【COLM 2025】Search-R1:强化学习让大模型学会边推理边搜索|从LLM检索增强推理视角

摘要

本文解读 COLM 2025 论文《Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning》。该论文提出 Search-R1 强化学习框架 ,通过融合搜索引擎环境建模检索 token 损失掩码纯结果奖励 ,让大语言模型在推理过程中自主发起多轮搜索、整合实时信息,其特别之处在于不需要任何人工标注轨迹或过程监督。实验表明 7B 与 3B 模型相对 RAG 基线平均提升 24% 与 20%,在七个问答数据集(含 5 个域外数据集)上一致领先,为检索增强推理(RAG 之后的下一代范式)提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
标题(中文) Search-R1:强化学习让大模型学会边推理边搜索
作者 Bowen Jin, Hansi Zeng, Zhenrui Yue, Jinsung Yoon, Sercan Ö. Arık, Dong Wang, Hamed Zamani, Jiawei Han
机构 University of Illinois Urbana-Champaign / University of Massachusetts Amherst / Google Cloud AI Research
会议 COLM 2025
arXiv https://arxiv.org/abs/2503.09516
项目网站 https://github.com/PeterGriffinJin/Search-R1

Search-R1 要解决什么问题:为什么大模型需要学会搜索?

大语言模型(LLM)虽然展现出强大的推理与生成能力,但缺乏实时与领域外的知识,容易产生幻觉;而复杂推理任务往往需要最新的外部信息。把搜索引擎接入 LLM 的已有方案主要有两条路线,各有明显局限:

  • RAG(检索增强生成):按输入查询检索一次、拼接进上下文生成一次。代表工作 Lewis et al.(NeurIPS 2020)。局限:面对多跳问题检索不精准,无法根据推理过程动态调整查询。
  • 搜索即工具:ReAct、IRCoT 用提示词引导迭代"推理---检索",泛化性差;Toolformer 用大规模监督微调学习调用工具,依赖高质量标注轨迹,且搜索操作不可微,无法端到端梯度优化。
  • 推理强化学习路线(DeepSeek-R1 范式) :纯结果奖励即可涌现推理能力,但此前**没有工作把 RL 应用到"LLM 调用搜索引擎"**这个场景------这正是 Search-R1 的切入点。

一句话:已有方法靠"提示"或"标注"教模型搜索,Search-R1 让模型在强化学习中自己学会何时搜索、搜什么、怎么用结果。

研究主线:从问题到结论

图 9:研究主线 Mermaid 流程图------问题 → 动机 → 设计 → 方法 → 实验 → 结论,边标签带关键证据(+24%/+20%)。

基准/方法设计:把搜索引擎变成强化学习环境

Search-R1 的核心设计是把搜索引擎建模为 RL 环境的一部分 。经典 RL 目标假定响应轨迹 y 全部由策略模型生成;Search-R1 将其扩展为模型生成与检索结果交织的联合分布:y \\sim \\pi_\\theta(\\cdot \\mid x; \\mathcal{R}) = \\pi_\\theta(\\cdot \\mid x) \\otimes \\mathcal{R},其中 \\mathcal{R} 为搜索引擎,\\otimes 表示检索与推理的交替。轨迹中检索出的内容只是上下文,不是学习对象。

图 1:Search-R1 的 PPO / GRPO 训练流程------模型在 rollout 中生成思考与搜索请求,系统查询搜索引擎并把结果包回上下文,多轮迭代直至给出答案。

框架兼容 PPO 与 GRPO 两种策略梯度算法,两者的目标函数都用有效 token 数归一化。完整公式化见附录 A:PPO 采用广义优势估计(GAE),GRPO 用组内相对奖励计算优势且 KL 惩罚直接加入损失,均通过检索 token 掩码 I(y_t) 保证训练稳定------I(y_t)=1 表示该 token 由模型生成并参与优化,I(y_t)=0 表示检索 token 不参与梯度与 KL 计算。

分类全景:搜索增强推理的两条技术路线

图 10:搜索增强推理分类全景(Mermaid 流程图)------五条技术路线:RAG 单轮拼接、IRCoT/ReAct 提示驱动、Toolformer 监督微调、Search-o1 推理交织、Search-R1 RL 优化。

方法细节:掩码、结构化 token 与纯结果奖励

四个核心设计要素:

  1. 检索 token 损失掩码:PPO / GRPO 的 token 级损失只对 LLM 生成的 token 计算,检索文本排除在优化之外,避免"检索内容主导梯度"导致的训练不稳定(消融:掩码带来 Avg 0.431 vs 0.343 的提升)。
  2. 结构化特殊 token<think> 推理、<search> 查询、<information> 检索结果、<answer> 答案四类标记,让多轮交互可稳定解析与拼接。
  3. 极简系统提示词:只约束输出结构(先思考、需要时搜索、最后给答案),不注入"必须搜索 / 必须反思"等内容偏向,保留模型自然学习动态。
  4. 纯结果奖励r_\\phi(x,y) = \\text{EM}(a_{\\text{pred}}, a_{\\text{gold}}),即最终答案与标准答案的精确匹配(EM),没有格式奖励、没有过程奖励、没有神经奖励模型

Rollout 流程:模型生成遇到 </search> 即触发检索,系统解析查询、调用搜索引擎、把结果以 <information> 包回序列;遇 </answer> 或动作预算 B=4 耗尽则终止。实验证明,仅凭这一机制模型就能涌现"验证式检索"(案例研究中模型在集齐答案后仍额外搜索一轮核验结论)。

实验设计与结果:七个数据集的一致领先

评测协议:通用 QA(NQ、TriviaQA、PopQA)与多跳 QA(HotpotQA、2WikiMultiHopQA、Musique、Bamboogle)共 7 个数据集;训练集 = NQ + HotpotQA 训练集合并;检索统一 E5 编码器 + 2018 Wikipedia 语料,top-3 段落;指标为 EM;基线含 RAG、IRCoT、Search-o1、SFT、无搜索的 R1、拒绝采样等,所有方法共享同一检索器、语料、训练数据与预训练模型。训练在单节点 8 张 H100 上完成 500 步,batch 512,策略学习率 10\^{-6}

主表(Qwen2.5-7B,EM)

方法 NQ TriviaQA HotpotQA Avg
RAG 0.349 0.585 0.299 0.304
R1-base(无搜索 RL) 0.297 0.539 0.242 0.276
Rejection Sampling 0.360 0.592 0.331 0.348
Search-R1-base 0.480 0.638 0.433 0.431
Search-R1-instruct 0.393 0.610 0.370 0.385

Search-R1-base 平均 0.431,相对 RAG(0.304)提升 24% ,相对无搜索 R1(0.276)提升 56% ;Search-R1-instruct 平均 0.385 同样高于全部基线。3B 模型相对 RAG 平均提升 20%(0.325 vs 0.270)。

图 2:响应长度训练动态------前 100 步骤降(模型去掉冗余填充),随后随搜索调用增加而上升,与训练奖励走势一致。

图 3:有效搜索次数随训练单调增加------RL 教会模型判断"何时需要外部信息"。

消融与扩展实验(并入附录结论)

图 4:损失掩码消融(7b-base)------带掩码训练持续优于无掩码(Avg 0.431 vs 0.343)。

图 5:PPO 与 GRPO 对比------GRPO 收敛快但长训练后奖励坍塌,PPO 更稳定,最终收益相当(默认选 PPO)。

图 6:Base 与 Instruct 对比------instruct 收敛快、起点高,RL 可拉平差距,最终奖励趋同。

图 7:top-k 研究------top-k=3 最优(Avg 0.431);top-k=1 召回不足,top-k=5 噪声拖累。

图 8:GRPO 组大小------size=1(等价 REINFORCE)训练最稳、域外泛化最好(Avg 0.410),收敛速度与稳定性存在权衡。

14B 扩展:Search-R1-base 在 Qwen2.5-14B 上 Avg 达 0.479(vs RAG 0.281,相对提升约 70%),超过 7B 的 0.431------规模红利在搜索推理场景同样成立。

结果对比总结

图 11:结果对比总结(Mermaid 流程图)------RAG 0.304 → Search-R1-base 0.431(+24%),3B +20% / 14B +70%。

关键发现

  • 系统性超越强基线:7B 模型 7 数据集平均 EM 0.431,相对 RAG 提升 24%,相对无搜索 R1 提升 56%,域内(NQ、HotpotQA)与 5 个域外数据集全部领先。
  • 纯结果奖励即可:EM 匹配奖励 + 检索 token 掩码,无格式奖励、无过程奖励、无神经奖励模型,验证了 R1-Zero 范式在检索场景的迁移性。
  • 掩码是稳定关键:7b-base 上带掩码 Avg 0.431 vs 无掩码 0.343,提升 8.8 个百分点。
  • 模型越大越会搜索:7B 与次优基线 RAG 的差距(0.127)远大于 3B(0.058);14B 上差距进一步扩大到 0.198。
  • 行为涌现:模型自主学会"验证式检索"------集齐答案后仍额外搜索一轮核验结论;有效搜索次数随训练单调上升。
  • 工程可用:代码与模型权重开源(GitHub PeterGriffinJin/Search-R1),训练仅需问题-答案对,8 张 H100、500 步即可复现。

局限性

  • 奖励信号单一:EM 只刻画最终答案正确性,不反馈中间检索质量;作者明确未采用过程奖励。
  • 结构约束<search>/<information>/<answer> 模板约定输出格式,复杂工具组合与多信息源尚未支持。
  • 检索配置固定:top-3 段落、动作预算 B=4、单一 Wikipedia 语料,更广场景(多语种、实时事件)未验证。
  • RL 稳定性:GRPO 在长训练后出现奖励坍塌,需要检查点回退策略兜底(PPO 更稳,故默认 PPO)。

常见问题(FAQ)

Search-R1 和 RAG 有什么区别?

RAG 是"检索一次、拼接生成"的单轮流水线,查询由输入决定;Search-R1 把搜索引擎放进 RL 环境,模型在推理过程中自主决定何时搜索、搜什么,且经过 RL 优化搜索策略,7 数据集上相对 RAG 平均提升 24%(7B)。

Search-R1 需要人工标注的检索轨迹吗?

不需要。训练只用问题-答案对,奖励是最终答案的精确匹配(EM),模型通过 RL 自己学会生成查询与利用检索结果,无需任何过程监督或标注轨迹。

检索 token 掩码是什么,为什么重要?

轨迹中检索到的文本也占 token 位置,若它们参与梯度更新,检索内容会主导优化方向。掩码 I(y_t) 把检索 token 从策略梯度与 KL 项中排除,只优化模型生成的 token------消融显示掩码带来 8.8 个百分点的平均提升。

Search-R1 支持哪些基座模型和 RL 算法?

支持 Qwen2.5-3B/7B/14B 的 Base 与 Instruct 版本,RL 算法兼容 PPO 与 GRPO(默认 PPO);检索后端与知识语料可替换(实验用 E5 + 2018 Wikipedia)。

GRPO 和 PPO 怎么选?

GRPO 收敛更快(无需 critic 预热),但长训练后可能奖励坍塌;PPO 更稳定、最终收益相当。论文默认选 PPO。

训练成本高吗?

单节点 8 张 H100、batch 512、500 步即可完成训练,配合 vLLM 加速 rollout;不需要大模型标注团队,数据效率是相对 SFT/拒绝采样路线的核心优势。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
海天一色y4 小时前
深入解析 DeepSpeedPPOTrainer:基于 PPO 的大规模 RLHF 训练实现
人工智能·强化学习·deepspeed·后训练
皮卡丘不断更1 天前
从一段 RGB 视频到机器人开门:读懂 Video2DoorTraversal 的仿真闭环
机器人·强化学习·数字孪生·具身智能·机器人仿真
山顶夕景1 天前
【MLLM Agent】多模态理解Agent研究进展
agent·强化学习·多模态·rl·agentic
闲研随记2 天前
【文献阅读 ICLR 2026】RL算法:DECS
算法·llm·强化学习·iclr·rl
盼小辉丶4 天前
PyTorch强化学习实战——用预训练语言模型和ChatGPT玩转文本游戏
pytorch·深度学习·语言模型·chatgpt·强化学习
林间码客6 天前
Agentic-RL:从SFT到GRPO,让智能体学会“自主进化”
sft·强化学习·grpo·agentic-rl
XLYcmy7 天前
小红书 算法一面 四
深度学习·llm·sft·强化学习·多模态·grpo·奖励函数
盼小辉丶7 天前
PyTorch强化学习实战(22)——将强化学习应用于TextWorld互动小说游戏
pytorch·深度学习·强化学习
XLYcmy8 天前
小红书 算法一面 三
llm·sft·强化学习·多模态·损失函数·visual r1·奖励机制