Reasoning Models 论文精读路线:CoT、Self-Consistency、Process Supervision 与 Search

系列 :AI 论文精读与复现训练营

日期 :2026-08-06

适合读者:已经读过 Transformer、Instruction Tuning、RLHF 或偏好优化,想系统理解"推理模型"论文如何从提示技巧走向训练范式、推理预算和可验证搜索的研究生、科研新人和工程背景读者。

目录

  1. 为什么这个主题重要
  2. 核心阅读方法:把推理拆成五个变量
  3. 代表论文路线图
  4. 关键论文精读
  5. 方法与实验对比表
  6. 复现建议
  7. 常见误区
  8. 适合研究生继续做的选题
  9. 总结
  10. 参考资料

为什么这个主题重要

"推理"是 LLM 论文里最容易被滥用的词。一个模型能在 GSM8K、MATH、AIME、GPQA、Codeforces 或程序合成任务上得高分,可能意味着它真的学会了更稳健的中间步骤,也可能只是更会模式匹配、采样更多答案、调用了强验证器,或者 benchmark 已经被训练数据间接覆盖。因此,读 Reasoning Models 的第一条原则是:不要先问"这个模型聪不聪明",先问"这篇论文把什么叫作推理"。

经典 CoT 论文的贡献是让中间步骤进入输入输出接口:模型不再只生成答案,而是生成可读的解题过程。Self-Consistency 的贡献是把"单一路径"换成"多条候选路径",用答案一致性降低偶然错误。GSM8K verifier 和 PRM800K 一类工作继续推进:如果可以给候选解或中间步骤打分,推理就可以被选择、训练和监督。Tree of Thoughts 则进一步把候选步骤组织成搜索树,而不是只在 token 层自回归地走一条路。

2025 年之后,Reasoning Models 的焦点发生变化。DeepSeek-R1 把可验证任务上的强化学习放到中心位置,展示了不用大量人工标注推理轨迹也能诱发自我反思、验证和策略切换。Kimi k1.5 强调 RL 扩展、长上下文和 long2short。s1 用一个很小的高质量推理数据集和 budget forcing 研究测试时扩展的最小路径。Qwen3 技术报告则把 thinking mode、non-thinking mode 和 thinking budget 写进开源模型族的接口。这些工作共同说明:推理模型已经从 prompt engineering 主题变成训练数据、奖励设计、推理控制、评测可验证性和系统成本共同决定的研究方向。

核心阅读方法:把推理拆成五个变量

读这一方向,建议把每篇论文拆成五个变量。

第一,任务是否可验证。 数学题、代码题、形式化证明、部分科学问答可以用答案、单元测试、证明检查器或规则验证;开放问答、规划、写作和安全判断则更依赖人评或模型评审。可验证任务天然适合采样、rerank、RL 和搜索;不可验证任务更容易出现 reward hacking 或"看起来合理但无法证明"的推理链。

第二,推理轨迹从哪里来。 CoT 使用少量人工示例诱导轨迹;STaR、least-to-most、Auto-CoT 等工作尝试自动构造或分解轨迹;Process Supervision 需要步骤级标注;DeepSeek-R1-Zero 一类路线希望通过可验证奖励让模型自己发展长推理模式。笔记里要记录轨迹是人工写的、模型生成的、筛选过的,还是 RL 过程中涌现的。

第三,选择发生在什么层级。 Self-Consistency 在答案层投票;verifier 在整条解答层评分;process reward model 在步骤层评分;Tree of Thoughts 在"thought"层扩展和剪枝;代码与证明任务可在执行器或 proof checker 层验证。层级越细,监督成本和错误定位能力通常越高。

第四,额外计算花在哪里。 推理模型常把性能提升建立在更多测试时计算上:多采样、长 CoT、反思、搜索、验证器打分、工具执行、rerank。复现实验必须记录 samples、temperature、max tokens、thinking budget、搜索宽度、搜索深度、verifier 成本和失败重试策略,否则结果不可比较。

第五,评测是否区分结果正确和过程可靠。 最终答案正确不代表中间过程可信;中间过程看起来漂亮也不保证答案正确。ProcessBench 的价值就在于把错误定位到最早出错步骤,提醒我们 PRM 是否能泛化到更难数学题,是独立问题而不是天然成立。

代表论文路线图

阶段 代表工作 精读抓手
显式中间步骤 Chain-of-Thought, Least-to-Most prompt 示例如何改变任务分解,是否只适用于大模型
多路径采样 Self-Consistency, Large Language Monkeys coverage、pass@k、consensus、verifier selection 的关系
结果验证器 GSM8K verifier, code unit tests 生成与验证哪个更难,验证器是否过拟合答案模式
步骤监督 Let's Verify Step by Step, PRM800K, ProcessBench outcome supervision 与 process supervision 的差异,步骤标注成本
搜索式推理 Tree of Thoughts, MCTS-style reasoning state、action、thought、value、剪枝策略如何定义
强化学习推理模型 OpenAI o1 report, DeepSeek-R1, Kimi k1.5 train-time compute、test-time compute、可验证奖励、长 CoT
开源推理接口 s1, Qwen3 thinking budget、budget forcing、distillation、可复现训练脚本

这张表不是"必读清单排名",而是读论文时的坐标系。一个新工作如果声称提升 reasoning,你可以先判断它主要改了哪一列:提示、采样、验证、步骤监督、搜索、RL 还是推理预算。

关键论文精读

Chain-of-Thought Prompting。 这篇论文要读的是"现象"和"边界"。它说明在足够大的语言模型上,少量带中间步骤的示例可以诱发更好的多步推理表现。精读时不要只记"think step by step",而要看实验任务类型、模型规模、示例构造方式,以及小模型为什么没有同样收益。复现时最重要的是固定 prompt、示例顺序、解码参数和答案抽取规则。

Self-Consistency。 它把 CoT 从贪心解码改成采样多条推理路径,再按答案一致性做边缘化选择。这里的研究方法论很关键:当问题存在多个合理解题路径但答案唯一时,多样化采样可以提升鲁棒性;当答案开放、答案抽取不稳定或模型系统性误解题意时,投票可能只是放大同一个错误。读这篇要画出 sampling、answer extraction、majority vote 三个环节。

Training Verifiers 与 Let's Verify Step by Step。 GSM8K verifier 工作展示了"生成多个候选,再由验证器选择"的基本范式。Let's Verify Step by Step 则把监督从最终答案推进到中间步骤,并发布 PRM800K 步骤级反馈数据。精读这类论文,核心是比较 outcome supervision 和 process supervision:前者便宜但信用分配粗,后者更可诊断但标注成本高、标注一致性难、可能只覆盖某类题目风格。

Tree of Thoughts。 ToT 的关键不是"树"这个视觉隐喻,而是把语言模型生成的中间 thought 变成可搜索对象。读这篇要明确:状态是什么,下一步候选如何产生,value 或 vote 如何评估,BFS/DFS 如何剪枝,任务是否真的需要全局搜索。它在 Game of 24、Mini Crosswords 这类任务上很直观,但迁移到开放研究问题时,搜索空间和评价函数会变得模糊。

OpenAI o1 报告。 官方报告提供的是高层技术信号而不是完整可复现论文:它把 train-time compute 和 test-time compute 明确列为推理能力提升轴,并展示了在数学、代码、GPQA 等任务上的评估。读这种模型报告时要特别谨慎:可以学习问题定义、评测选择和安全观察,但不能把未公开训练细节当成可复现实验方案。

DeepSeek-R1。 DeepSeek-R1 的重要性在于把"可验证任务 + 强化学习 + 推理模式涌现"讲清楚,并区分了 DeepSeek-R1-Zero 和带 cold-start、多阶段训练的 DeepSeek-R1。精读时要追问四件事:奖励来自哪里,哪些任务可自动验证,为什么不依赖人工长 CoT 仍能出现 self-reflection,蒸馏到小模型时到底蒸馏了能力、格式还是搜索策略。由于 arXiv 页面显示该工作在 2026-01-04 更新到 v2,并有关联 Nature 2025 版本,引用时应注明版本。

Kimi k1.5、s1 与 Qwen3。 Kimi k1.5 把 RL 扩展、长上下文和 long2short 放在一起,强调不依赖复杂 MCTS、价值函数和 PRM 的简洁 RL 框架。s1 则从相反方向问:用 1000 条高质量推理样本、SFT 和 budget forcing,能否获得简单的测试时扩展路径。Qwen3 技术报告把 thinking / non-thinking 与 thinking budget 作为模型族能力的一部分,并公开 Apache 2.0 模型。三者适合放在一起读:一个看大规模训练实践,一个看小规模复现实验,一个看开源模型接口如何暴露推理预算。

方法与实验对比表

方法 主要变量 适合任务 复现风险
CoT prompting 示例数量、示例质量、解码参数 数学、常识、多步问答 prompt 泄漏、答案抽取不一致
Self-consistency sample 数、temperature、投票规则 答案唯一但路径多样的问题 成本高,错误路径可能同质化
Outcome verifier 候选数量、验证器训练集、rerank 规则 数学、代码、选择题 验证器记答案或过拟合分布
Process reward model 步骤粒度、标注协议、错误定位 数学推导、证明、可分步任务 标注贵,跨难度泛化不稳
Tree/search 状态定义、宽度、深度、value 函数 规划、组合搜索、游戏题 评价函数模糊时搜索无意义
RL reasoner 奖励、policy optimizer、探索预算 可验证数学、代码、STEM reward hacking,训练成本高
Thinking budget max tokens、预算强制、停止策略 需要速度/准确率折中的任务 不同模型接口不可直接比较

读实验表时,不要只看 pass@1。Reasoning paper 常用 pass@k、consensus、rerank、coverage、step error localization、token budget、latency 和 cost。最基本的复现表至少要同时报告:单次答案、同预算多采样、同样 token 上限、是否使用 verifier、是否使用工具或测试用例、失败案例分类。

复现建议

不要一开始复现完整 DeepSeek-R1 或 Kimi k1.5。更好的训练营路径是做一个小而可诊断的 reasoning lab。

  1. 选择可验证任务。 用 GSM8K、MATH 子集、HumanEval/MBPP 小样本、或你自己构造的 100-300 道可自动判分题。优先选择能自动判 final answer 的任务。
  2. 建立四个基线。 Direct answer、CoT greedy、CoT self-consistency、CoT + verifier/reranker。每个基线固定模型、prompt、temperature、max tokens 和答案抽取脚本。
  3. 记录推理预算。 对每题记录生成样本数、输出 token、总推理时间、失败重试次数和验证器调用次数。没有预算记录,任何"推理能力提升"都不完整。
  4. 做步骤级错误标注小样本。 随机抽 50 个失败案例,人工标注最早错误步骤:读题错误、公式错误、算术错误、搜索方向错误、答案格式错误、验证器误判。
  5. 复现一个 search toy task。 用 Game of 24 或 Mini Crosswords 复现 ToT 思路,比较宽度、深度、value prompt 和 vote prompt。目标不是追 SOTA,而是理解搜索变量。
  6. 加入 budget ablation。 让 sample 数从 1、4、8、16 增加,或让 thinking token budget 分档,观察准确率、成本和失败类型是否同步变化。

建议输出一份 reproduction report:实验设置、数据版本、模型版本、prompt、seed、预算、指标、结果表、失败案例、你认为最可能的机制解释。注意:如果使用闭源模型或在线 API,模型版本可能发生变化,报告中必须写明调用日期和模型名称;若无法锁定版本,标注"待人工核验"。

常见误区

  1. 把长答案当成长推理。 长 CoT 可能包含反复、跑题和自我合理化;判断它有用,需要看 final answer、步骤错误和预算收益。
  2. 只比较准确率,不比较成本。 一个 64-sample consensus 方法如果只比 1-sample 高一点点,在研究上可能有价值,但工程和论文结论都必须写清预算。
  3. 用不可验证任务证明验证器有效。 如果没有独立标签、执行器、证明检查器或人类专家审查,验证器分数很容易变成另一个模型偏好。
  4. 忽略答案抽取。 数学和代码评测中,答案格式、单位、等价表达、浮点容差都会制造假失败或假成功。
  5. 把 benchmark 提升等同于通用推理。 GSM8K、MATH、AIME、GPQA、Codeforces 测的是不同能力,不应混成一个"reasoning score"。
  6. 把公开模型报告当完整论文。 o1、部分商业模型报告提供重要线索,但训练细节、数据和代码不完整时,不能写成可复现实验证据。

适合研究生继续做的选题

  1. 推理预算路由器。 给定问题难度、模型置信度和成本约束,动态选择 direct、CoT、self-consistency、verifier 或 search。
  2. PRM 跨难度泛化。 用 GSM8K/MATH 训练或筛选的过程奖励模型,是否能定位奥赛级题目的早期错误。
  3. 长 CoT 压缩。 研究 long2short:哪些中间步骤必须保留,哪些只是冗余自检。
  4. 代码任务中的验证器分层。 比较自然语言 critic、单元测试、fuzzing、静态分析和执行反馈对候选程序选择的贡献。
  5. 开放任务的过程可信度。 对无法自动判分的科研问答或文献综述任务,设计人类可审计的 evidence trail,而不是只让模型自评。
  6. 搜索空间设计。 对同一任务比较 token-level sampling、step-level search、tool-level planning 和 proof-level search,分析哪种粒度最省预算。

总结

Reasoning Models 的主线可以概括为:先让模型写出中间过程,再让模型生成多条路径,然后训练或调用验证器选择路径,最后把推理变成可分配预算、可搜索、可强化学习优化的系统。精读这条路线时,要避免被"会思考"的表述带偏。真正值得记录的是:推理轨迹如何产生,验证信号来自哪里,额外计算是否可控,评测是否可复现,失败能否定位到具体步骤。

如果你要从今天开始读,建议按五篇打底:CoT、Self-Consistency、Let's Verify Step by Step、Tree of Thoughts、DeepSeek-R1。再用 s1 和 Qwen3 观察 2025 年开源推理模型如何把 thinking budget 变成可实验变量。这样读完后,你不会只会复述"模型会深度思考",而能提出一个可检验的问题:在什么任务、什么预算、什么验证信号下,推理真的变可靠了?

参考资料

检索日期:2026-08-06。

  1. Jason Wei et al. "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models." arXiv, 2022; NeurIPS 2022. https://arxiv.org/abs/2201.11903
  2. Xuezhi Wang et al. "Self-Consistency Improves Chain of Thought Reasoning in Language Models." arXiv, 2022; ICLR 2023. https://arxiv.org/abs/2203.11171
  3. Denny Zhou et al. "Least-to-Most Prompting Enables Complex Reasoning in Large Language Models." arXiv, 2022; ICLR 2023. https://arxiv.org/abs/2205.10625
  4. Karl Cobbe et al. "Training Verifiers to Solve Math Word Problems." arXiv, 2021. https://arxiv.org/abs/2110.14168
  5. Dan Hendrycks et al. "Measuring Mathematical Problem Solving With the MATH Dataset." arXiv, 2021; NeurIPS 2021. https://arxiv.org/abs/2103.03874
  6. Hunter Lightman et al. "Let's Verify Step by Step." arXiv, 2023. https://arxiv.org/abs/2305.20050
  7. Shunyu Yao et al. "Tree of Thoughts: Deliberate Problem Solving with Large Language Models." arXiv, 2023; NeurIPS 2023. https://arxiv.org/abs/2305.10601
  8. Princeton NLP. "tree-of-thought-llm" official repository. https://github.com/princeton-nlp/tree-of-thought-llm
  9. Shunyu Yao et al. "ReAct: Synergizing Reasoning and Acting in Language Models." arXiv, 2022; ICLR 2023. https://arxiv.org/abs/2210.03629
  10. David Rein et al. "GPQA: A Graduate-Level Google-Proof Q&A Benchmark." arXiv, 2023. https://arxiv.org/abs/2311.12022
  11. OpenAI. "Learning to reason with LLMs." Official report, 2024. https://openai.com/index/learning-to-reason-with-llms/
  12. Bradley Brown et al. "Large Language Monkeys: Scaling Inference Compute with Repeated Sampling." arXiv, 2024, revised 2024. https://arxiv.org/abs/2407.21787
  13. Scaling Intelligence. "large_language_monkeys" official repository. https://github.com/ScalingIntelligence/large_language_monkeys
  14. Chujie Zheng et al. "ProcessBench: Identifying Process Errors in Mathematical Reasoning." arXiv, 2024, revised 2025; ACL 2025. https://arxiv.org/abs/2412.06559
  15. DeepSeek-AI et al. "DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning." arXiv, 2025, revised 2026; Nature 2025 version linked on arXiv. https://arxiv.org/abs/2501.12948
  16. Kimi Team et al. "Kimi k1.5: Scaling Reinforcement Learning with LLMs." arXiv, 2025. https://arxiv.org/abs/2501.12599
  17. Niklas Muennighoff et al. "s1: Simple test-time scaling." arXiv, 2025. https://arxiv.org/abs/2501.19393
  18. SimpleScaling. "s1" official repository. https://github.com/simplescaling/s1
  19. Zhong-Zhi Li et al. "From System 1 to System 2: A Survey of Reasoning Large Language Models." arXiv, 2025, revised 2025. https://arxiv.org/abs/2502.17419
  20. An Yang et al. "Qwen3 Technical Report." arXiv, 2025. https://arxiv.org/abs/2505.09388
相关推荐
惊鸿一博1 小时前
基于Diffusion的轨迹优化:扩散模型在自动驾驶中的原理、架构与落地挑战
人工智能·自动驾驶·diffusion·规控
合合技术团队1 小时前
合合信息携手中科软发布智能化方案,推动AI融入保险理赔、核保与风控多节点
大数据·人工智能·文档智能·数据智能
zyplayer-doc1 小时前
核心制度不该被随手修改:用zyplayer-doc锁定文档和全部子文档
大数据·数据库·人工智能·笔记·pdf·ocr
具身新纪元1 小时前
CVPR 2026|新缺陷不断上线,如何让工业视觉检测模型不忘旧账?
人工智能·深度学习·目标检测·机器学习·计算机视觉·目标跟踪·视觉检测
Raas1001 小时前
MAIGateway,魔芋企业级AI网关的FinAPI成本弹性设计
人工智能
constCpp1 小时前
AI 编程:追不完的工具,理得清的问题
人工智能·ai编程·ai-native
2401_865261631 小时前
亦唐科技(YIKTONG):驱动国产贴片机迈向智能化未来
大数据·人工智能
阿kun要赚马内1 小时前
工具在langchain agent中的调用
人工智能·后端·python
IT_陈寒1 小时前
Vite的HMR在我项目上突然失效,排查三天找到离谱原因
前端·人工智能·后端