论文标题 : DeepResearch Agent System
论文地址 : https://arxiv.org/abs/2607.27562
作者单位 : Software Copyright Research and Development Document
发表时间: 2026年7月30日
背景知识
在深入解读 DeepResearch Agent System 之前,有必要先厘清几个核心概念。
什么是 Deep Research Agent? Deep Research Agent 是一类能够自主执行多步信息检索、跨源信息综合、迭代推理反思并生成结构化研究报告的 LLM Agent 系统。与单轮问答不同,它需要维护长期研究计划、调用多种外部工具(搜索、计算、文件解析)、在长达数万 token 的上下文中保持信息一致性,并能够根据中间发现动态调整研究方向。
什么是稀疏激活架构(Sparse Activation / Mixture-of-Experts)? 稀疏激活架构(以 MoE 为代表)将模型参数划分为多个"专家"子网络,通过路由机制为每个输入 token 动态选择并激活少量专家(如 300 亿总参数中仅激活 30 亿)。这使得模型总容量与每 token 计算成本解耦:总参数量决定模型表达能力,激活参数量决定推理成本。相比同等总容量的密集模型,稀疏架构可显著降低推理延迟和内存占用,但引入了路由稳定性、负载均衡和训练复杂性等挑战。
什么是 GRPO(Group Relative Policy Optimization)? GRPO 是一种强化学习优化算法,改进自传统策略梯度方法。它通过在同批次共享 prompt 的轨迹组内计算相对优势(group-relative advantage)来归一化奖励信号,从而降低梯度方差、提升训练稳定性。Token-level policy gradients 进一步将信用分配粒度细化到单个 token,使模型能够精确学习多步轨迹中每个 token 对最终成功或失败的贡献。
什么是 ReAct 与 IterResearch? ReAct(Reasoning + Acting)是一种将推理与行动交错进行的 Agent 范式,LLM 在每一步先生成思考(reasoning)再决定工具调用(acting),适用于基础多步问题求解。IterResearch 是本文提出的迭代研究范式,支持最多 20 步的深层推理循环,允许 Agent 维护运行中的研究计划、细化子问题、从无效路径回溯并深化调查。
一、背景:从单轮问答到自主深度研究的鸿沟
1.1 为什么现有 LLM 系统难以胜任真正的深度研究任务?
现代大语言模型在单轮问答、文本生成和知识提取上已达到接近人类专家的水平,但真实世界的研究分析任务要求的能力远超单轮交互:
- 推理深度的要求:学术研究、商业分析和研发支持需要系统性地分解复杂问题、提出子问题、跨多源验证假设,并在数十步交互中保持逻辑一致性。单轮或浅层多轮交互无法覆盖这种深度。
- 上下文长度的瓶颈:研究任务常涉及数万甚至数十万 token 的文档集合(论文、财报、技术文档)。标准注意力机制随序列长度二次增长,导致长上下文中的注意力稀释(attention dilution)和信息丢失,检索与推理精度急剧下降。
- 计算成本的刚性:密集 Transformer 架构的总参数量与每 token 计算成本线性耦合。当模型规模扩大到足以支撑复杂推理时,推理延迟和内存消耗同步膨胀,大规模部署成本 prohibitive。
- 工具协调的脆弱性:深度研究需要无缝协调检索、计算、网页搜索、文件解析等多种工具。现有系统在工具选择、参数指定、错误恢复和结果整合上缺乏鲁棒性,单点故障即可导致整个研究链条断裂。
- 训练数据的稀缺:高质量的多步推理、工具使用和深度研究轨迹数据难以获取,人工标注成本极高,限制了监督微调的效果。
因此,构建一个实用的 Deep Research Agent 不是简单的"给 LLM 加上搜索工具",而是在算力效率、上下文长度、推理深度、工具鲁棒性和数据可扩展性五个维度上的系统工程问题。
1.2 现有方法的"天花板"
现有工作可分为几类,但都存在结构性局限:
- 传统信息检索:基于关键词的搜索引擎(TF-IDF、BM25)和布尔查询缺乏语义理解,无法处理复杂自然语言查询,更不具备跨源综合能力。
- 神经检索 + 单轮 QA:Dense Passage Retrieval(DPR)等神经检索方法改善了语义匹配,但仍局限于单轮检索-回答范式,无法执行多步调查或工具协调。
- ReAct 与基础 Agent 框架:ReAct 通过交错推理与行动实现了基础工具使用,但缺乏对长上下文的有效处理,推理步数受限,且没有系统性的训练优化框架来提升多步稳定性。
- 长上下文模型:通过位置编码扩展或稀疏注意力机制支持更长上下文,但标准注意力在长序列上的注意力稀释问题未得到根本解决,检索准确率和事实召回率显著下降。
- 密集大模型:GPT-4、Claude 等密集架构模型虽然推理能力强,但推理成本与模型规模线性相关,部署 300B 级别密集模型进行高并发 Agent 推理在成本上不可行。
这些方法的共同盲区是:它们要么解决了效率但牺牲了能力(稀疏模型训练不稳定),要么解决了能力但牺牲了效率(密集大模型),要么解决了单点问题但缺乏系统整合(检索、推理、工具、训练各自为战)。DeepResearch Agent System 的目标正是跨越这一鸿沟------通过稀疏激活架构、分层注意力、双模推理、多工具协调和 GRPO 训练的系统性整合,在保持 SOTA 能力的同时实现高效部署。
二、核心创新:稀疏激活杠杆 + 分层长上下文 + 双模推理 + GRPO 训练 + 自动数据飞轮
DeepResearch Agent System 的技术精髓可以概括为:以稀疏激活架构打破算力-能力的耦合枷锁,以分层注意力机制攻克超长上下文的信息稀释难题,以双模推理引擎覆盖从浅层到深层的全谱研究需求,以 GRPO 强化学习实现 token 级精细信用分配,以自动数据合成管道构建可持续的训练数据飞轮 。

2.1 稀疏激活架构:300 亿总参数 / 30 亿激活参数的算力杠杆
系统采用 Mixture-of-Experts(MoE)稀疏激活架构:
- 总容量与计算解耦:300 亿总参数提供强大的知识存储和推理能力,但每 token 仅激活 30 亿参数,实现与 30B 密集模型相当的推理成本。
- 动态专家路由:学习到的路由函数(learned gating function)为每个 token 动态选择最相关的 top-k 专家子网络,并引入负载均衡正则化防止专家坍缩。
- 效率收益 :相比同等总容量的密集模型,实现 3.2 倍推理加速 和 45% 内存减少,同时保持或超越密集模型在推理和检索任务上的准确率。
这一设计的核心洞察是:Agent 系统需要频繁调用 LLM 进行多步推理,推理成本是部署瓶颈。稀疏激活将"模型能知道多少"与"每次推理花多少"解耦,是 Agent 系统从实验室走向生产的关键架构选择。
2.2 分层注意力机制:128K 上下文窗口的信息保真
针对长上下文中的注意力稀释问题,系统引入分层注意力:
- 局部窗口注意力(Local Window Attention):将长序列划分为局部窗口,在窗口内进行细粒度自注意力,捕获局部语义依赖。
- 全局聚合层(Global Aggregation Layer):在更高层级对局部窗口的表示进行聚合,建模长距离依赖关系。
- 多尺度上下文建模:通过局部-全局的层次化结构,兼顾细粒度局部理解和粗粒度全局综合。
性能收益 :相比标准长上下文基线,准确率提升 18.7%,召回率提升 23.4%。这使得系统能够真正基于 128K token 的完整文档集合进行推理,而非仅将长上下文作为"存储桶"而实际依赖局部片段。
2.3 双模推理引擎:ReAct + IterResearch 的全谱覆盖
系统提供两种推理模式,根据任务复杂度自适应选择:
- ReAct 模式:标准的 Reasoning-Acting 交错范式,适用于基础多步问题求解。LLM 每步生成思考过程,决定工具调用,整合观察结果,循环直至任务完成。
- IterResearch 模式 :面向高复杂度迭代研究的深度模式,支持最多 20 步推理 。核心能力包括:
- 运行计划维护(Running Plan Maintenance):动态维护研究计划,根据中间发现调整后续步骤。
- 子问题细化(Sub-question Refinement):将高层研究问题分解为可执行的子问题,并根据反馈迭代优化。
- 自我反思与计划修正(Self-reflection and Plan Revision):识别无效路径并主动回溯,避免在错误方向上持续消耗步数。
联合收益 :相比单轮基线,双模引擎实现 31.2% 的准确率提升。ReAct 处理简单查询的低延迟路径,IterResearch 处理复杂深度研究的高性能路径,形成完整的推理光谱覆盖。
2.4 多工具协调:统一接口下的 92.1% 工具使用准确率
系统集成四类工具,通过统一接口协调:
| 工具 | 能力 | 典型场景 |
|---|---|---|
| Retrieval | 稠密向量索引搜索、文档检索、段落排序、上下文感知查询重构 | 从内部知识库检索相关文献 |
| Calculator | 数学表达式求值、代码执行、统计计算、符号数学 | 财务数据分析、公式验证 |
| Web Search | 外部搜索引擎查询、网页解析、实时信息检索、结果摘要 | 获取最新新闻、验证事实 |
| File Parsing | PDF 提取、电子表格解析、结构化文档处理、多格式支持 | 处理上传的研究报告、财报 |
协调框架负责工具选择、参数规范、错误恢复和结果整合,在 multi-tool benchmark 上达到 92.1% 的工具使用准确率。
2.5 GRPO 强化学习优化:Token 级信用分配的训练革命
训练框架基于 GRPO 算法,核心创新包括:
- 组相对优势估计(Group-Relative Advantage Estimation):在同批次共享 prompt 的轨迹组内计算相对优势,归一化奖励信号,显著降低梯度方差。
- Token-Level Policy Gradients:将信用分配粒度从轨迹级细化到 token 级,使模型能够精确学习多步轨迹中每个具体 token 对成功/失败的贡献。
- 训练收益 :相比标准策略梯度方法,训练稳定性提升 35%,收敛速度加速 42%。
这一设计解决了多步 Agent 训练中的核心难题------轨迹级奖励过于稀疏,无法指导中间步骤的优化;而 token 级梯度提供了细粒度的学习信号。
2.6 自动数据合成管道:92.5% 可用率的训练飞轮
系统构建了无需人工标注的自动数据合成流水线:
- 种子生成(Seed Generation):从精选的种子查询出发。
- 轨迹扩展(Trajectory Expansion):通过多步推理、工具使用和结果验证自主生成多样化的训练轨迹。
- 质量过滤与去重:自动质量评估、低质量过滤、格式验证和一致性检查。
- 可用率 :生成数据达到 92.5% 的可用率,支持规模化训练。
这一管道是系统可持续演进的关键------Agent 能力的提升依赖于高质量的多步轨迹数据,而人工标注此类数据的成本 prohibitive。
2.7 内存优化与分布式推理:生产级部署保障
- 动态梯度检查点(Dynamic Gradient Checkpointing) :自适应选择需要存储激活的层,其余层在反向传播时重新计算,实现 60% 内存减少。
- 激活卸载(Activation Offloading) :将中间激活转移到 CPU 内存或 NVMe 存储,使 128K token 上下文可在 18GB GPU 内存内处理。
- 分布式推理加速 :专家计算采用张量并行,顺序层采用流水线并行,实现 3.8 倍加速 ,维持 128 tokens/秒 的推理吞吐和 1.2 samples/秒/GPU 的训练吞吐。
三、实验验证:从基准测试到系统级效率的全面领先
3.1 主实验:三大 Agent 基准测试的 SOTA 表现
系统在三个具有代表性的 Agent 基准上进行了评估:
| 基准测试 | 得分 | 任务特征 |
|---|---|---|
| Humanity's Last Exam | 87.3% | 高难度多学科综合考试,考验深度知识和复杂推理 |
| BrowserComp Chinese | 85.3% | 中文网页浏览与信息提取,考验多语言工具使用 |
| WebWalkerQA | 91.2% | 网页导航与问答,考验长上下文信息追踪 |
这些结果表明系统在深度推理、多语言工具协调和长上下文信息追踪三个关键维度上均达到了领先水平。
3.2 架构效率:稀疏激活 vs 密集模型的系统性优势
| 指标 | 稀疏激活 (300B/30B) | 同等容量密集模型 | 收益 |
|---|---|---|---|
| 推理速度 | 基准 | 3.2x 慢 | 3.2x 加速 |
| 内存占用 | 基准 | +45% | 45% 减少 |
| 推理准确率 | 维持或超越 | 基准 | 能力不降级 |
关键洞察:稀疏激活不是"为了效率牺牲质量"的权衡,而是通过专家专业化(expert specialization)和知识分布(knowledge distribution)在降低计算成本的同时保持甚至提升性能。
3.3 长上下文能力:分层注意力的信息保真验证
| 指标 | 标准长上下文基线 | 分层注意力 | 提升 |
|---|---|---|---|
| 准确率 | 基准 | +18.7% | 18.7% |
| 召回率 | 基准 | +23.4% | 23.4% |
在 128K token 的极端长度下,分层注意力通过局部-全局的层次化建模,有效缓解了标准全注意力中的信息稀释问题。23.4% 的召回率提升意味着系统能够从长文档中遗漏更少的关键信息,这对深度研究至关重要。
3.4 推理深度:双模引擎的准确率跃升
| 模式 | 相对单轮基线提升 | 适用场景 |
|---|---|---|
| ReAct | 显著提升 | 基础多步问题求解 |
| IterResearch (≤20步) | 31.2% | 复杂深度研究 |
| 联合使用 | 31.2% | 全谱覆盖 |
IterResearch 的 20 步深度能力使系统能够执行真正的"研究"------不是一次性检索回答,而是迭代地提出假设、验证、修正、深化,这与人类专家的研究方法论一致。
3.5 训练效率:GRPO 的稳定性与收敛优势
| 指标 | 标准策略梯度 | GRPO | 提升 |
|---|---|---|---|
| 训练稳定性 | 基准 | +35% | 35% |
| 收敛速度 | 基准 | +42% | 42% |
GRPO 的组相对优势归一化和 token 级信用分配,从根本上解决了多步 Agent 轨迹训练中的奖励稀疏和梯度方差问题。35% 的稳定性提升意味着更少的训练崩溃和超参调优,42% 的收敛加速意味着更低的训练成本。
3.6 数据质量:自动合成的可用率
自动数据合成管道达到 92.5% 的可用率,意味着每生成 100 条轨迹约有 92-93 条可直接用于训练。这一高可用率依赖于:
- 种子查询的精心筛选确保初始方向正确。
- 多步推理和工具使用的自主扩展保证多样性。
- 自动质量评估过滤掉逻辑断裂、工具调用失败或结果不一致的轨迹。
3.7 部署效率:从实验室到生产的工程落地
| 指标 | 数值 | 意义 |
|---|---|---|
| 128K 上下文 GPU 内存 | 18 GB | 单卡可部署 |
| 分布式推理加速 | 3.8x | 多卡线性扩展 |
| 推理吞吐 | 128 tokens/s | 实时交互体验 |
| 训练吞吐 | 1.2 samples/s/GPU | 高效训练迭代 |
| 内存减少(检查点) | 60% | 更大 batch size |
这些工程指标证明系统不仅是研究原型,而是具备生产部署可行性的完整方案。
四、学术洞见:DeepResearch Agent System 揭示了哪些深层规律?
洞见一:稀疏激活是 Agent 系统的"算力杠杆"------解耦容量与成本
DeepResearch Agent System 证明,在 Agent 场景中,稀疏激活架构不是"大模型的廉价替代品",而是重新设计算力-能力关系的基础设施 。Agent 系统需要频繁调用 LLM(每步推理一次),推理成本是部署的决定性因素。通过将总参数量(知识容量)与激活参数量(计算成本)解耦,系统实现了"用 30B 的成本运行 300B 的能力"。这揭示了一个更广泛的规律:高频调用场景(如 Agent 多步推理)中,稀疏架构的性价比优势远超低频批处理场景。未来面向 Agent 的模型设计应优先考虑稀疏激活而非密集扩展。
洞见二:长上下文需要"层次化注意力"而非"简单长度扩展"
标准注意力机制扩展到 128K 时,注意力分数在长距离上趋于均匀分布(注意力稀释),导致模型无法有效聚焦关键信息。DeepResearch 的分层注意力通过局部窗口捕获细粒度语义 + 全局聚合建模长距离依赖 的层次结构,从根本上解决了这一问题。这揭示了一个关键设计原则:上下文长度的扩展必须与注意力机制的结构性改进同步进行,单纯的位置编码扩展或稀疏注意力模式不足以保证长距离信息保真。局部-全局的层次化建模是处理超长文档的必由之路。
洞见三:Token 级信用分配是多步 Agent 训练的"最后一公里"
传统轨迹级策略梯度将整个多步轨迹的奖励平均分配给所有 token,导致信用分配模糊------模型无法区分"哪一步的哪个 token 导致了成功/失败"。GRPO 的 token-level policy gradients 将学习信号精确到单个 token,使模型能够优化具体的推理措辞、工具参数和反思策略。这揭示了一个深层规律:Agent 能力的提升不仅取决于模型规模,更取决于训练信号的粒度。在需要精确控制多步行为的场景中,token 级信用分配比轨迹级方法具有本质优势。
洞见四:自动数据合成是 Agent 能力可持续扩展的"飞轮"
高质量的多步推理、工具使用和深度研究轨迹数据极难人工标注。DeepResearch 的自动数据合成管道通过种子扩展、自主生成和质量过滤,实现了 92.5% 的可用率。这揭示了一个关键洞察:Agent 系统的数据瓶颈不在于"量",而在于"结构"------需要包含思考过程、工具调用、观察整合和结果验证的完整轨迹。自动合成管道通过模拟 Agent 的执行过程来生成这种结构化数据,是突破数据瓶颈的可行路径。
五、局限性与未来方向
论文/技术文档坦诚讨论了以下局限(及隐含的挑战):
- 基准测试的覆盖范围:当前报告的三个基准(HLE、BrowserComp Chinese、WebWalkerQA)虽然具有代表性,但未涵盖所有 Agent 场景(如代码生成 Agent、科学实验 Agent、多模态感知 Agent)。跨领域泛化能力有待进一步验证。
- 稀疏激活的路由挑战:虽然系统实现了负载均衡正则化,但 MoE 架构中的专家路由在极端分布偏移下仍可能出现专家坍缩(expert collapse)或路由不稳定。动态路由的鲁棒性在长程部署中需要持续监控。
- 128K 上下文的边界:对于超长文档(如整本书、大型代码库、多年财报集合),128K 仍可能不足。虽然分层注意力改善了信息保真,但上下文长度的物理上限仍是约束。
- 工具生态的封闭性:当前工具集(检索、计算、搜索、文件解析)相对标准,对于需要调用专业领域工具(如分子模拟软件、CAD 工具、实验设备接口)的 Agent 场景,工具协调框架的扩展性未充分验证。
- 训练数据合成的质量天花板:92.5% 的可用率虽高,但剩余 7.5% 的低质量数据仍可能引入噪声。随着任务复杂度提升,自动合成管道生成高质量轨迹的难度将指数增长。
- 强化学习的奖励设计:GRPO 依赖于可量化的奖励信号,但对于开放式研究任务(如"评估某技术的商业前景"),奖励设计本身具有主观性,可能限制模型在模糊目标场景下的表现。
未来方向包括:
- 百万级上下文扩展:结合 RAG 与分层注意力,将有效上下文扩展到百万 token 级别,覆盖整本书或大型代码库。
- 多模态工具协调:扩展工具集至图像分析、视频理解、语音处理,构建真正的多模态研究 Agent。
- 自适应稀疏路由:引入动态专家数量选择(根据任务复杂度调整激活专家数),在简单任务上进一步降低计算成本。
- 跨 Agent 协作:多个 DeepResearch Agent 并行研究不同子问题,通过 Agent 间通信实现大规模协作研究。
- 领域特化版本:针对法律、医疗、金融等垂直领域,构建领域专家模板和专用工具链。
六、核心思想总结与可借鉴点
DeepResearch Agent System 的核心思想可以用一句话概括:不要把 Agent 系统当成"大模型 + 工具调用"的简单组合,而要把它当成稀疏架构、分层注意力、双模推理、GRPO 训练和自动数据合成的系统工程;通过算力-能力解耦、信息保真、推理深度、训练信号粒度和数据可持续性五个维度的协同创新,实现真正可部署的自主深度研究能力。这个原则背后,是五层可迁移的方法论:
- 稀疏激活杠杆:以 MoE 架构解耦总容量与计算成本,使高频 Agent 推理在经济上可行。
- 分层注意力保真:以局部-全局层次化建模攻克超长上下文的信息稀释,确保长文档推理的准确性。
- 双模推理覆盖:以 ReAct + IterResearch 覆盖从浅层到深层的全谱研究需求,避免"一刀切"的推理策略。
- Token 级信用分配:以 GRPO 的 token-level policy gradients 实现多步轨迹的精细优化,突破轨迹级训练的瓶颈。
- 自动数据飞轮:以种子扩展 + 质量过滤构建可持续的训练数据管道,摆脱对人工标注的依赖。
对研究者的借鉴:
- 稀疏激活是 Agent 系统的首选架构:如果你的应用场景需要高频调用 LLM(如多步 Agent、对话系统、实时推理),优先考虑稀疏激活架构而非密集模型扩展。算力-能力解耦是 Agent 经济性的核心。
- 长上下文必须配套注意力机制创新:单纯扩展位置编码支持的长度没有意义。分层注意力、局部-全局建模、记忆机制等结构性改进是长上下文有效性的前提。
- 训练信号的粒度决定 Agent 的行为精度:轨迹级奖励无法支撑精细的多步行为控制。token 级或至少步骤级的信用分配是高级 Agent 训练的必要条件。GRPO 的组相对优势 + token 级梯度是一个可复用的设计模式。
- 数据合成管道是 Agent 能力的天花板:Agent 的上限不仅由模型架构决定,更由训练数据的质量和多样性决定。投资于自动数据合成基础设施,比单纯扩大模型规模更具长期回报。
对工程师的借鉴:
- 双模推理是实用的系统设计模式:为不同复杂度的任务提供不同的推理路径(ReAct 快速路径 + IterResearch 深度路径),避免简单任务被过度复杂化、复杂任务被过度简化。可通过任务分类器或用户显式选择来路由。
- 分层注意力可迁移到任何长文档场景:无论是法律合同审查、医学文献综述还是代码库分析,局部窗口 + 全局聚合的层次化建模都是处理超长文本的有效工程方案。
- 动态梯度检查点 + 激活卸载是长上下文部署的标配:如果需要在消费级 GPU 上部署长上下文模型,这两项技术的组合(60% 内存减少 + CPU/NVMe 卸载)是必选项。
- 工具协调的统一接口设计:为所有工具定义标准化的输入输出 schema、错误码和重试策略,使 Agent 能够以统一方式调用异构工具。92.1% 的工具使用准确率背后是严格的接口规范和错误恢复机制。
- 生产部署需要全栈优化:从模型架构(稀疏激活)到注意力机制(分层)到训练框架(GRPO)到内存优化(检查点+卸载)到分布式推理(张量+流水线并行),每一层都需要为 Agent 场景专门优化。单点优化无法支撑生产级 Agent 系统。
DeepResearch Agent System 通过稀疏激活架构、分层长上下文注意力、双模推理引擎、GRPO 强化学习优化和自动数据合成管道的系统性整合,在自主深度研究 Agent 领域建立了从算法创新到工程落地的完整范式。它证明了 Agent 系统的核心竞争力不在于单一技术的突破,而在于算力效率、信息保真、推理深度、训练精度和数据可持续性五个维度的协同优化,为下一代自主研究 Agent 的设计提供了可复用的方法论框架和开源实现基础。