【COLM 2025】Search-R1:强化学习让大模型学会边推理边搜索|从LLM检索增强推理视角本文解读 COLM 2025 论文《Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning》。该论文提出 Search-R1 强化学习框架,通过融合搜索引擎环境建模、检索 token 损失掩码与纯结果奖励,让大语言模型在推理过程中自主发起多轮搜索、整合实时信息,其特别之处在于不需要任何人工标注轨迹或过程监督。实验表明 7B 与 3B 模型相对 RAG 基线平均提升 24% 与 20