语言模型

空 白II1 小时前
人工智能·语言模型·自然语言处理
9.26 大语言模型研究简报:把 Agent 开发做成“数据—训练—Harness”闭环公开时间(北京时间):2026 年 9 月 24 日 22:38 机构:Alibaba Token Hub / MAI Team 状态:论文预印本 + 技术报告
倔强的石头1069 小时前
语言模型·bert·transformer
【Transformer】BERT_双向预训练语言模型的开端摘要:BERT 是理解型预训练语言模型的里程碑。它不像 GPT 那样从左到右预测下一个 token,而是使用 Encoder-Only Transformer 双向阅读整段文本,并通过 Masked Language Modeling 学习上下文表示。BERT 让“先在海量文本上预训练,再在具体任务上微调”成为 NLP 的主流范式,也为今天的 embedding、rerank、分类、信息抽取等系统打下基础。本文从 BERT 出现前的 NLP 困境讲起,解释 Encoder-Only、MLM、NSP、[CL
Dawson Zhu12 小时前
人工智能·语言模型·架构·aigc·agi
一种多Agent权限管控与风险控制架构随着大语言模型(LLM)驱动的 Agent 系统在企业级场景中的快速落地,多 Agent 协作架构的安全治理问题日益凸显。当系统中存在多个自主决策的 Agent 时,权限失控、工具滥用、跨租户数据穿透等安全风险呈指数级增长。本文系统梳理了一种基于三级权限分类、多租户沙箱隔离与全局监督 Agent 的分层安全机制,并从工程实践角度分析其设计思路、实现要点与局限性。
Dawson Zhu14 小时前
人工智能·语言模型·架构·aigc·agi
Agent系统工程质量评估体系:原理解析与工程实践随着大语言模型(LLM)驱动的Agent系统在企业级应用中的快速部署,如何量化评估Agent系统的工程质量成为一个亟待解决的工程问题。与传统的确定性软件不同,Agent系统具有内在的非确定性特征——同一输入在不同运行中可能产生不同的输出路径和结果,这使得传统的软件测试和评估方法面临根本性挑战。
阡陌数智1 天前
人工智能·语言模型·性能优化·推荐算法
大模型推理抖动深度剖析:生产环境下时延波动根因定位与根治方案大模型服务从 POC 试点走向规模化生产,稳定性往往是最大拦路虎。不少团队完成压测后,GPU 利用率、平均 RT 都满足预期,接入真实业务流量后,间歇性出现时延陡增、流式输出卡顿、偶发请求超时熔断。抖动问题复现难度高,普通监控只能看到时延异常,很难直接定位根因。很多工程师第一反应怀疑 GPU 硬件或者推理内核,实际生产中纯粹内核缺陷占比很低,绝大多数抖动来自缓存、流量、调度、软硬件交互的组合问题。
Zzj_tju1 天前
人工智能·深度学习·语言模型
混合检索为什么有效:RRF 改变了哪些排名?——SciFact 开发集冻结排名实验冻结的 MiniLM 稠密检索平均低于 BM25,却在一些查询上获胜。这给出一个自然问题:能否把两路优势合起来?BM25 依赖词项匹配,稠密检索将文本编码为向量,再比较向量相似度。两者有不同的失误模式,但“不同”并不自动等于“互补有效”。
AI浩1 天前
人工智能·语言模型·自然语言处理
Migician:揭示多模态大语言模型中自由形式多图定位的魔力https://arxiv.org/pdf/2501.05767多模态大语言模型(MLLMs)的最新进展显著提升了其对单图像的细粒度感知能力以及对多图像的一般理解能力。然而,现有的 MLLMs 在复杂的多图场景中实现精确定位(Grounding)方面仍面临挑战。为此,我们首先探索了一种思维链(CoT)框架,将单图定位与多图理解相结合。虽然该方法部分有效,但由于其非端到端的特性,仍然不稳定且难以捕捉抽象的视觉信息。因此,我们推出了 Migician,这是首个能够在多张图像间执行自由形式且精确定位的模型。为支
硅谷秋水1 天前
人工智能·机器学习·语言模型·自然语言处理
从语言模型到作用于世界的系统:智能体AI在数字、社交、虚拟及物理环境中的进展与局限26年9月的综述论文“From Language Models to World-Acting Systems: Progress and Limits of Agentic AI across Digital, Social, Virtual, and Physical Environments”。
喜欢打篮球的普通人1 天前
语言模型
MiniMind 学习笔记(二):Pretrain 导言——从零理解 LLM,先想清楚这几个问题学习 LLM 最容易犯的错误,就是一头扎进训练代码的局部细节里。这一章的目标不是立刻进入大模型细节,而是先回答一个更基础的问题:当我们说"从零开始理解一个 LLM 的预训练流程"时,到底需要先想清楚哪些问题?
Carl_奕然1 天前
人工智能·设计模式·语言模型
【智能体】Loop 的四种设计模式之:Agent Loop(2026 最新版)小屌丝:鱼哥,我昨天上线了一个 Agent,让它"帮我把这周的周报整理出来发群里"。结果你猜怎么着?小鱼:它给你把周报写得天花乱坠?
艾莉丝努力练剑1 天前
网络·c++·人工智能·学习·语言模型
【AI大模型接入SDK】ChatSDK架构设计与实现🎬 艾莉丝的简介:通俗类比:做菜场景项目原有三大独立模块:会话管理内部持有数据管理对象,会话管理与数据管理可以视作一个逻辑单元。
user_admin_god2 天前
java·人工智能·spring boot·语言模型
第 10 篇:拼上下文与生成——预算、边界与防幻觉第 09 篇结尾留了一句:把挑出来的几条拼成提示词,还有它自己的问题—— 总共能放多少字、超了砍谁、资料不够时怎么让模型坦白说不知道。 这一篇就用实测把这三件事逐个定下来。
奇思妙想聪明勤奋的小羊7 天前
人工智能·python·学习·语言模型
DeepAgents第5章:子Agent 与上下文隔离—让 Agent学会委派第四章Agent的任务规划解决了“复杂任务如何拆分和记录进度”的问题,但如果所有子任务都由主 Agent 自己执行,搜索结果、文件读取、工具调用和中间分析仍然会不断进入主 Agent 的上下文。例如,一个研究任务可能需要多次网络搜索、文件写入和内容整理,这些中间过程本身可能产生大量 Token,而主 Agent 最终真正需要的往往只是研究结论。
IZero077 天前
python·语言模型
Jev 与 Laya整理日期:2026-09-21 来源:github传统大模型(GPT、Claude、DeepSeek)的目标一直是「跟人聊天」和「帮人干活」,本质是逐字生成文本。
喜欢打篮球的普通人8 天前
语言模型
MiniMind 快速上手(一):环境准备与项目结构对于一个项目,最好的学习办法就是最快地把它跑起来。先不纠结细节,把环境搭好、把代码跑起来,再慢慢理解它的细节和原理。本文是 MiniMind 学习笔记的开篇——环境准备与项目结构。
Dawson Zhu8 天前
人工智能·语言模型·架构·aigc·agi
从 Jev 说起:快慢模型如何协同调度,以及这背后需要解决什么问题近期 TypeSafe AI 的 Jev 模型引起了不少关注。它不做自回归文本生成,而是给定状态与一组预定义问题,一次前向输出 Choice / Score / Null 的概率分布与置信度,端到端 70–500 ms。这个变化看似只是「更快更便宜」,实际上改变的是输出的形状——概率可以直接参与计算,而文本必须经过解析才能变成数字。本文从这一处差异出发,记录一条由浅入深的推导路径。
大模型任我行8 天前
人工智能·语言模型·自然语言处理·论文笔记
谷歌:“课程学习”融入扩散模型强化学习📖标题:CanvasAnneal: Curriculum Reinforcement Learning for Diffusion Language Models 🌐来源:arXiv, 2609.13060v1
Dawson Zhu8 天前
人工智能·语言模型·架构·aigc·agi
大模型记忆系统设计:分层架构与关键技术解析大语言模型(LLM)虽然在自然语言理解和生成上表现出色,但其本质是一个无状态的函数——它不保存任何跨请求的上下文信息。实际业务场景中,无论是多轮对话、个性化推荐,还是复杂 Agent 任务,都要求模型能够"记住"之前发生的事。简单的做法是"把所有内容塞进 Prompt",但上下文窗口(Context Window)有容量上限,并且随着对话变长,成本、延迟和"迷失在中间"的问题会越来越严重。
Dawson Zhu8 天前
人工智能·语言模型·架构·aigc·agi
大模型预训练为何普遍单轮遍历?——从 Scaling Laws、数据重复到灾难性遗忘的技术解析在传统深度学习里,几百个 epoch 是家常便饭:ResNet 在 ImageNet 上训几十上百轮,MLP 在小数据集上甚至训到 loss 不再下降为止。数据量小、模型相对小,反复遍历是唯一合理的选择。
johnsong8 天前
人工智能·语言模型
AI 前沿日报 · 2026-09-20今日主题:信任危机——当AI工具变成安全隐患 覆盖:17条深度 · 5大板块今天,一位开发者偶然发现智谱的AI编码桌面应用ZCode在用户不知情的情况下,将整个工作区的 .git 历史打包上传到阿里云OSS。几乎同一时间,韩国个人信息保护委员会宣布将重大数据泄露的最高罚款提升至企业总收入的10%——以Coupang泄露3755万用户数据为例,旧规罚款6246亿韩元,新规下可能突破数万亿。从编码工具到监管法规,"信任"二字正在被重新定义。