摘要
本文解读 COLM 2025 论文《Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning》。该论文提出 Search-R1 强化学习框架 ,通过融合搜索引擎环境建模 、检索 token 损失掩码 与纯结果奖励 ,让大语言模型在推理过程中自主发起多轮搜索、整合实时信息,其特别之处在于不需要任何人工标注轨迹或过程监督。实验表明 7B 与 3B 模型相对 RAG 基线平均提升 24% 与 20%,在七个问答数据集(含 5 个域外数据集)上一致领先,为检索增强推理(RAG 之后的下一代范式)提供了重要借鉴。
视频讲解 :点击观看 B 站视频
- 摘要
- 论文基本信息
- [Search-R1 要解决什么问题:为什么大模型需要学会搜索?](#Search-R1 要解决什么问题:为什么大模型需要学会搜索?)
- 研究主线:从问题到结论
- 基准/方法设计:把搜索引擎变成强化学习环境
- 分类全景:搜索增强推理的两条技术路线
- [方法细节:掩码、结构化 token 与纯结果奖励](#方法细节:掩码、结构化 token 与纯结果奖励)
- 实验设计与结果:七个数据集的一致领先
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- [Search-R1 和 RAG 有什么区别?](#Search-R1 和 RAG 有什么区别?)
- [Search-R1 需要人工标注的检索轨迹吗?](#Search-R1 需要人工标注的检索轨迹吗?)
- [检索 token 掩码是什么,为什么重要?](#检索 token 掩码是什么,为什么重要?)
- [Search-R1 支持哪些基座模型和 RL 算法?](#Search-R1 支持哪些基座模型和 RL 算法?)
- [GRPO 和 PPO 怎么选?](#GRPO 和 PPO 怎么选?)
- 训练成本高吗?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning |
| 标题(中文) | Search-R1:强化学习让大模型学会边推理边搜索 |
| 作者 | Bowen Jin, Hansi Zeng, Zhenrui Yue, Jinsung Yoon, Sercan Ö. Arık, Dong Wang, Hamed Zamani, Jiawei Han |
| 机构 | University of Illinois Urbana-Champaign / University of Massachusetts Amherst / Google Cloud AI Research |
| 会议 | COLM 2025 |
| arXiv | https://arxiv.org/abs/2503.09516 |
| 项目网站 | https://github.com/PeterGriffinJin/Search-R1 |
Search-R1 要解决什么问题:为什么大模型需要学会搜索?
大语言模型(LLM)虽然展现出强大的推理与生成能力,但缺乏实时与领域外的知识,容易产生幻觉;而复杂推理任务往往需要最新的外部信息。把搜索引擎接入 LLM 的已有方案主要有两条路线,各有明显局限:
- RAG(检索增强生成):按输入查询检索一次、拼接进上下文生成一次。代表工作 Lewis et al.(NeurIPS 2020)。局限:面对多跳问题检索不精准,无法根据推理过程动态调整查询。
- 搜索即工具:ReAct、IRCoT 用提示词引导迭代"推理---检索",泛化性差;Toolformer 用大规模监督微调学习调用工具,依赖高质量标注轨迹,且搜索操作不可微,无法端到端梯度优化。
- 推理强化学习路线(DeepSeek-R1 范式) :纯结果奖励即可涌现推理能力,但此前**没有工作把 RL 应用到"LLM 调用搜索引擎"**这个场景------这正是 Search-R1 的切入点。
一句话:已有方法靠"提示"或"标注"教模型搜索,Search-R1 让模型在强化学习中自己学会何时搜索、搜什么、怎么用结果。
研究主线:从问题到结论

图 9:研究主线 Mermaid 流程图------问题 → 动机 → 设计 → 方法 → 实验 → 结论,边标签带关键证据(+24%/+20%)。
基准/方法设计:把搜索引擎变成强化学习环境
Search-R1 的核心设计是把搜索引擎建模为 RL 环境的一部分 。经典 RL 目标假定响应轨迹 y 全部由策略模型生成;Search-R1 将其扩展为模型生成与检索结果交织的联合分布:y \\sim \\pi_\\theta(\\cdot \\mid x; \\mathcal{R}) = \\pi_\\theta(\\cdot \\mid x) \\otimes \\mathcal{R},其中 \\mathcal{R} 为搜索引擎,\\otimes 表示检索与推理的交替。轨迹中检索出的内容只是上下文,不是学习对象。

图 1:Search-R1 的 PPO / GRPO 训练流程------模型在 rollout 中生成思考与搜索请求,系统查询搜索引擎并把结果包回上下文,多轮迭代直至给出答案。
框架兼容 PPO 与 GRPO 两种策略梯度算法,两者的目标函数都用有效 token 数归一化。完整公式化见附录 A:PPO 采用广义优势估计(GAE),GRPO 用组内相对奖励计算优势且 KL 惩罚直接加入损失,均通过检索 token 掩码 I(y_t) 保证训练稳定------I(y_t)=1 表示该 token 由模型生成并参与优化,I(y_t)=0 表示检索 token 不参与梯度与 KL 计算。
分类全景:搜索增强推理的两条技术路线

图 10:搜索增强推理分类全景(Mermaid 流程图)------五条技术路线:RAG 单轮拼接、IRCoT/ReAct 提示驱动、Toolformer 监督微调、Search-o1 推理交织、Search-R1 RL 优化。
方法细节:掩码、结构化 token 与纯结果奖励
四个核心设计要素:
- 检索 token 损失掩码:PPO / GRPO 的 token 级损失只对 LLM 生成的 token 计算,检索文本排除在优化之外,避免"检索内容主导梯度"导致的训练不稳定(消融:掩码带来 Avg 0.431 vs 0.343 的提升)。
- 结构化特殊 token :
<think>推理、<search>查询、<information>检索结果、<answer>答案四类标记,让多轮交互可稳定解析与拼接。 - 极简系统提示词:只约束输出结构(先思考、需要时搜索、最后给答案),不注入"必须搜索 / 必须反思"等内容偏向,保留模型自然学习动态。
- 纯结果奖励 :r_\\phi(x,y) = \\text{EM}(a_{\\text{pred}}, a_{\\text{gold}}),即最终答案与标准答案的精确匹配(EM),没有格式奖励、没有过程奖励、没有神经奖励模型。
Rollout 流程:模型生成遇到 </search> 即触发检索,系统解析查询、调用搜索引擎、把结果以 <information> 包回序列;遇 </answer> 或动作预算 B=4 耗尽则终止。实验证明,仅凭这一机制模型就能涌现"验证式检索"(案例研究中模型在集齐答案后仍额外搜索一轮核验结论)。
实验设计与结果:七个数据集的一致领先
评测协议:通用 QA(NQ、TriviaQA、PopQA)与多跳 QA(HotpotQA、2WikiMultiHopQA、Musique、Bamboogle)共 7 个数据集;训练集 = NQ + HotpotQA 训练集合并;检索统一 E5 编码器 + 2018 Wikipedia 语料,top-3 段落;指标为 EM;基线含 RAG、IRCoT、Search-o1、SFT、无搜索的 R1、拒绝采样等,所有方法共享同一检索器、语料、训练数据与预训练模型。训练在单节点 8 张 H100 上完成 500 步,batch 512,策略学习率 10\^{-6}。
主表(Qwen2.5-7B,EM):
| 方法 | NQ | TriviaQA | HotpotQA | Avg |
|---|---|---|---|---|
| RAG | 0.349 | 0.585 | 0.299 | 0.304 |
| R1-base(无搜索 RL) | 0.297 | 0.539 | 0.242 | 0.276 |
| Rejection Sampling | 0.360 | 0.592 | 0.331 | 0.348 |
| Search-R1-base | 0.480 | 0.638 | 0.433 | 0.431 |
| Search-R1-instruct | 0.393 | 0.610 | 0.370 | 0.385 |
Search-R1-base 平均 0.431,相对 RAG(0.304)提升 24% ,相对无搜索 R1(0.276)提升 56% ;Search-R1-instruct 平均 0.385 同样高于全部基线。3B 模型相对 RAG 平均提升 20%(0.325 vs 0.270)。

图 2:响应长度训练动态------前 100 步骤降(模型去掉冗余填充),随后随搜索调用增加而上升,与训练奖励走势一致。

图 3:有效搜索次数随训练单调增加------RL 教会模型判断"何时需要外部信息"。
消融与扩展实验(并入附录结论):

图 4:损失掩码消融(7b-base)------带掩码训练持续优于无掩码(Avg 0.431 vs 0.343)。

图 5:PPO 与 GRPO 对比------GRPO 收敛快但长训练后奖励坍塌,PPO 更稳定,最终收益相当(默认选 PPO)。

图 6:Base 与 Instruct 对比------instruct 收敛快、起点高,RL 可拉平差距,最终奖励趋同。

图 7:top-k 研究------top-k=3 最优(Avg 0.431);top-k=1 召回不足,top-k=5 噪声拖累。

图 8:GRPO 组大小------size=1(等价 REINFORCE)训练最稳、域外泛化最好(Avg 0.410),收敛速度与稳定性存在权衡。
14B 扩展:Search-R1-base 在 Qwen2.5-14B 上 Avg 达 0.479(vs RAG 0.281,相对提升约 70%),超过 7B 的 0.431------规模红利在搜索推理场景同样成立。
结果对比总结

图 11:结果对比总结(Mermaid 流程图)------RAG 0.304 → Search-R1-base 0.431(+24%),3B +20% / 14B +70%。
关键发现
- 系统性超越强基线:7B 模型 7 数据集平均 EM 0.431,相对 RAG 提升 24%,相对无搜索 R1 提升 56%,域内(NQ、HotpotQA)与 5 个域外数据集全部领先。
- 纯结果奖励即可:EM 匹配奖励 + 检索 token 掩码,无格式奖励、无过程奖励、无神经奖励模型,验证了 R1-Zero 范式在检索场景的迁移性。
- 掩码是稳定关键:7b-base 上带掩码 Avg 0.431 vs 无掩码 0.343,提升 8.8 个百分点。
- 模型越大越会搜索:7B 与次优基线 RAG 的差距(0.127)远大于 3B(0.058);14B 上差距进一步扩大到 0.198。
- 行为涌现:模型自主学会"验证式检索"------集齐答案后仍额外搜索一轮核验结论;有效搜索次数随训练单调上升。
- 工程可用:代码与模型权重开源(GitHub PeterGriffinJin/Search-R1),训练仅需问题-答案对,8 张 H100、500 步即可复现。
局限性
- 奖励信号单一:EM 只刻画最终答案正确性,不反馈中间检索质量;作者明确未采用过程奖励。
- 结构约束 :
<search>/<information>/<answer>模板约定输出格式,复杂工具组合与多信息源尚未支持。 - 检索配置固定:top-3 段落、动作预算 B=4、单一 Wikipedia 语料,更广场景(多语种、实时事件)未验证。
- RL 稳定性:GRPO 在长训练后出现奖励坍塌,需要检查点回退策略兜底(PPO 更稳,故默认 PPO)。
常见问题(FAQ)
Search-R1 和 RAG 有什么区别?
RAG 是"检索一次、拼接生成"的单轮流水线,查询由输入决定;Search-R1 把搜索引擎放进 RL 环境,模型在推理过程中自主决定何时搜索、搜什么,且经过 RL 优化搜索策略,7 数据集上相对 RAG 平均提升 24%(7B)。
Search-R1 需要人工标注的检索轨迹吗?
不需要。训练只用问题-答案对,奖励是最终答案的精确匹配(EM),模型通过 RL 自己学会生成查询与利用检索结果,无需任何过程监督或标注轨迹。
检索 token 掩码是什么,为什么重要?
轨迹中检索到的文本也占 token 位置,若它们参与梯度更新,检索内容会主导优化方向。掩码 I(y_t) 把检索 token 从策略梯度与 KL 项中排除,只优化模型生成的 token------消融显示掩码带来 8.8 个百分点的平均提升。
Search-R1 支持哪些基座模型和 RL 算法?
支持 Qwen2.5-3B/7B/14B 的 Base 与 Instruct 版本,RL 算法兼容 PPO 与 GRPO(默认 PPO);检索后端与知识语料可替换(实验用 E5 + 2018 Wikipedia)。
GRPO 和 PPO 怎么选?
GRPO 收敛更快(无需 critic 预热),但长训练后可能奖励坍塌;PPO 更稳定、最终收益相当。论文默认选 PPO。
训练成本高吗?
单节点 8 张 H100、batch 512、500 步即可完成训练,配合 vLLM 加速 rollout;不需要大模型标注团队,数据效率是相对 SFT/拒绝采样路线的核心优势。
参考链接
- arXiv 论文页:https://arxiv.org/abs/2503.09516
- 项目主页(代码与模型):https://github.com/PeterGriffinJin/Search-R1
- DeepSeek-R1(推理 RL 范式):https://arxiv.org/abs/2501.12948
- DeepSeekMath(GRPO 算法):https://arxiv.org/abs/2402.03300
- RAG 原始论文:https://arxiv.org/abs/2005.11401
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群 :白拾的小屋 (750365700)
⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页 :YhbCode000(工程文件)