Reasoning Models 论文精读路线:CoT、Self-Consistency、Process Supervision 与 Search

系列 :AI 论文精读与复现训练营
日期 :2026-08-06
适合读者:已经读过 Transformer、Instruction Tuning、RLHF 或偏好优化,想系统理解"推理模型"论文如何从提示技巧走向训练范式、推理预算和可验证搜索的研究生、科研新人和工程背景读者。
目录
- 为什么这个主题重要
- 核心阅读方法:把推理拆成五个变量
- 代表论文路线图
- 关键论文精读
- 方法与实验对比表
- 复现建议
- 常见误区
- 适合研究生继续做的选题
- 总结
- 参考资料
为什么这个主题重要
"推理"是 LLM 论文里最容易被滥用的词。一个模型能在 GSM8K、MATH、AIME、GPQA、Codeforces 或程序合成任务上得高分,可能意味着它真的学会了更稳健的中间步骤,也可能只是更会模式匹配、采样更多答案、调用了强验证器,或者 benchmark 已经被训练数据间接覆盖。因此,读 Reasoning Models 的第一条原则是:不要先问"这个模型聪不聪明",先问"这篇论文把什么叫作推理"。
经典 CoT 论文的贡献是让中间步骤进入输入输出接口:模型不再只生成答案,而是生成可读的解题过程。Self-Consistency 的贡献是把"单一路径"换成"多条候选路径",用答案一致性降低偶然错误。GSM8K verifier 和 PRM800K 一类工作继续推进:如果可以给候选解或中间步骤打分,推理就可以被选择、训练和监督。Tree of Thoughts 则进一步把候选步骤组织成搜索树,而不是只在 token 层自回归地走一条路。
2025 年之后,Reasoning Models 的焦点发生变化。DeepSeek-R1 把可验证任务上的强化学习放到中心位置,展示了不用大量人工标注推理轨迹也能诱发自我反思、验证和策略切换。Kimi k1.5 强调 RL 扩展、长上下文和 long2short。s1 用一个很小的高质量推理数据集和 budget forcing 研究测试时扩展的最小路径。Qwen3 技术报告则把 thinking mode、non-thinking mode 和 thinking budget 写进开源模型族的接口。这些工作共同说明:推理模型已经从 prompt engineering 主题变成训练数据、奖励设计、推理控制、评测可验证性和系统成本共同决定的研究方向。
核心阅读方法:把推理拆成五个变量

读这一方向,建议把每篇论文拆成五个变量。
第一,任务是否可验证。 数学题、代码题、形式化证明、部分科学问答可以用答案、单元测试、证明检查器或规则验证;开放问答、规划、写作和安全判断则更依赖人评或模型评审。可验证任务天然适合采样、rerank、RL 和搜索;不可验证任务更容易出现 reward hacking 或"看起来合理但无法证明"的推理链。
第二,推理轨迹从哪里来。 CoT 使用少量人工示例诱导轨迹;STaR、least-to-most、Auto-CoT 等工作尝试自动构造或分解轨迹;Process Supervision 需要步骤级标注;DeepSeek-R1-Zero 一类路线希望通过可验证奖励让模型自己发展长推理模式。笔记里要记录轨迹是人工写的、模型生成的、筛选过的,还是 RL 过程中涌现的。
第三,选择发生在什么层级。 Self-Consistency 在答案层投票;verifier 在整条解答层评分;process reward model 在步骤层评分;Tree of Thoughts 在"thought"层扩展和剪枝;代码与证明任务可在执行器或 proof checker 层验证。层级越细,监督成本和错误定位能力通常越高。
第四,额外计算花在哪里。 推理模型常把性能提升建立在更多测试时计算上:多采样、长 CoT、反思、搜索、验证器打分、工具执行、rerank。复现实验必须记录 samples、temperature、max tokens、thinking budget、搜索宽度、搜索深度、verifier 成本和失败重试策略,否则结果不可比较。
第五,评测是否区分结果正确和过程可靠。 最终答案正确不代表中间过程可信;中间过程看起来漂亮也不保证答案正确。ProcessBench 的价值就在于把错误定位到最早出错步骤,提醒我们 PRM 是否能泛化到更难数学题,是独立问题而不是天然成立。
代表论文路线图
| 阶段 | 代表工作 | 精读抓手 |
|---|---|---|
| 显式中间步骤 | Chain-of-Thought, Least-to-Most | prompt 示例如何改变任务分解,是否只适用于大模型 |
| 多路径采样 | Self-Consistency, Large Language Monkeys | coverage、pass@k、consensus、verifier selection 的关系 |
| 结果验证器 | GSM8K verifier, code unit tests | 生成与验证哪个更难,验证器是否过拟合答案模式 |
| 步骤监督 | Let's Verify Step by Step, PRM800K, ProcessBench | outcome supervision 与 process supervision 的差异,步骤标注成本 |
| 搜索式推理 | Tree of Thoughts, MCTS-style reasoning | state、action、thought、value、剪枝策略如何定义 |
| 强化学习推理模型 | OpenAI o1 report, DeepSeek-R1, Kimi k1.5 | train-time compute、test-time compute、可验证奖励、长 CoT |
| 开源推理接口 | s1, Qwen3 | thinking budget、budget forcing、distillation、可复现训练脚本 |
这张表不是"必读清单排名",而是读论文时的坐标系。一个新工作如果声称提升 reasoning,你可以先判断它主要改了哪一列:提示、采样、验证、步骤监督、搜索、RL 还是推理预算。
关键论文精读
Chain-of-Thought Prompting。 这篇论文要读的是"现象"和"边界"。它说明在足够大的语言模型上,少量带中间步骤的示例可以诱发更好的多步推理表现。精读时不要只记"think step by step",而要看实验任务类型、模型规模、示例构造方式,以及小模型为什么没有同样收益。复现时最重要的是固定 prompt、示例顺序、解码参数和答案抽取规则。
Self-Consistency。 它把 CoT 从贪心解码改成采样多条推理路径,再按答案一致性做边缘化选择。这里的研究方法论很关键:当问题存在多个合理解题路径但答案唯一时,多样化采样可以提升鲁棒性;当答案开放、答案抽取不稳定或模型系统性误解题意时,投票可能只是放大同一个错误。读这篇要画出 sampling、answer extraction、majority vote 三个环节。
Training Verifiers 与 Let's Verify Step by Step。 GSM8K verifier 工作展示了"生成多个候选,再由验证器选择"的基本范式。Let's Verify Step by Step 则把监督从最终答案推进到中间步骤,并发布 PRM800K 步骤级反馈数据。精读这类论文,核心是比较 outcome supervision 和 process supervision:前者便宜但信用分配粗,后者更可诊断但标注成本高、标注一致性难、可能只覆盖某类题目风格。
Tree of Thoughts。 ToT 的关键不是"树"这个视觉隐喻,而是把语言模型生成的中间 thought 变成可搜索对象。读这篇要明确:状态是什么,下一步候选如何产生,value 或 vote 如何评估,BFS/DFS 如何剪枝,任务是否真的需要全局搜索。它在 Game of 24、Mini Crosswords 这类任务上很直观,但迁移到开放研究问题时,搜索空间和评价函数会变得模糊。
OpenAI o1 报告。 官方报告提供的是高层技术信号而不是完整可复现论文:它把 train-time compute 和 test-time compute 明确列为推理能力提升轴,并展示了在数学、代码、GPQA 等任务上的评估。读这种模型报告时要特别谨慎:可以学习问题定义、评测选择和安全观察,但不能把未公开训练细节当成可复现实验方案。
DeepSeek-R1。 DeepSeek-R1 的重要性在于把"可验证任务 + 强化学习 + 推理模式涌现"讲清楚,并区分了 DeepSeek-R1-Zero 和带 cold-start、多阶段训练的 DeepSeek-R1。精读时要追问四件事:奖励来自哪里,哪些任务可自动验证,为什么不依赖人工长 CoT 仍能出现 self-reflection,蒸馏到小模型时到底蒸馏了能力、格式还是搜索策略。由于 arXiv 页面显示该工作在 2026-01-04 更新到 v2,并有关联 Nature 2025 版本,引用时应注明版本。
Kimi k1.5、s1 与 Qwen3。 Kimi k1.5 把 RL 扩展、长上下文和 long2short 放在一起,强调不依赖复杂 MCTS、价值函数和 PRM 的简洁 RL 框架。s1 则从相反方向问:用 1000 条高质量推理样本、SFT 和 budget forcing,能否获得简单的测试时扩展路径。Qwen3 技术报告把 thinking / non-thinking 与 thinking budget 作为模型族能力的一部分,并公开 Apache 2.0 模型。三者适合放在一起读:一个看大规模训练实践,一个看小规模复现实验,一个看开源模型接口如何暴露推理预算。
方法与实验对比表
| 方法 | 主要变量 | 适合任务 | 复现风险 |
|---|---|---|---|
| CoT prompting | 示例数量、示例质量、解码参数 | 数学、常识、多步问答 | prompt 泄漏、答案抽取不一致 |
| Self-consistency | sample 数、temperature、投票规则 | 答案唯一但路径多样的问题 | 成本高,错误路径可能同质化 |
| Outcome verifier | 候选数量、验证器训练集、rerank 规则 | 数学、代码、选择题 | 验证器记答案或过拟合分布 |
| Process reward model | 步骤粒度、标注协议、错误定位 | 数学推导、证明、可分步任务 | 标注贵,跨难度泛化不稳 |
| Tree/search | 状态定义、宽度、深度、value 函数 | 规划、组合搜索、游戏题 | 评价函数模糊时搜索无意义 |
| RL reasoner | 奖励、policy optimizer、探索预算 | 可验证数学、代码、STEM | reward hacking,训练成本高 |
| Thinking budget | max tokens、预算强制、停止策略 | 需要速度/准确率折中的任务 | 不同模型接口不可直接比较 |
读实验表时,不要只看 pass@1。Reasoning paper 常用 pass@k、consensus、rerank、coverage、step error localization、token budget、latency 和 cost。最基本的复现表至少要同时报告:单次答案、同预算多采样、同样 token 上限、是否使用 verifier、是否使用工具或测试用例、失败案例分类。
复现建议
不要一开始复现完整 DeepSeek-R1 或 Kimi k1.5。更好的训练营路径是做一个小而可诊断的 reasoning lab。
- 选择可验证任务。 用 GSM8K、MATH 子集、HumanEval/MBPP 小样本、或你自己构造的 100-300 道可自动判分题。优先选择能自动判 final answer 的任务。
- 建立四个基线。 Direct answer、CoT greedy、CoT self-consistency、CoT + verifier/reranker。每个基线固定模型、prompt、temperature、max tokens 和答案抽取脚本。
- 记录推理预算。 对每题记录生成样本数、输出 token、总推理时间、失败重试次数和验证器调用次数。没有预算记录,任何"推理能力提升"都不完整。
- 做步骤级错误标注小样本。 随机抽 50 个失败案例,人工标注最早错误步骤:读题错误、公式错误、算术错误、搜索方向错误、答案格式错误、验证器误判。
- 复现一个 search toy task。 用 Game of 24 或 Mini Crosswords 复现 ToT 思路,比较宽度、深度、value prompt 和 vote prompt。目标不是追 SOTA,而是理解搜索变量。
- 加入 budget ablation。 让 sample 数从 1、4、8、16 增加,或让 thinking token budget 分档,观察准确率、成本和失败类型是否同步变化。
建议输出一份 reproduction report:实验设置、数据版本、模型版本、prompt、seed、预算、指标、结果表、失败案例、你认为最可能的机制解释。注意:如果使用闭源模型或在线 API,模型版本可能发生变化,报告中必须写明调用日期和模型名称;若无法锁定版本,标注"待人工核验"。
常见误区
- 把长答案当成长推理。 长 CoT 可能包含反复、跑题和自我合理化;判断它有用,需要看 final answer、步骤错误和预算收益。
- 只比较准确率,不比较成本。 一个 64-sample consensus 方法如果只比 1-sample 高一点点,在研究上可能有价值,但工程和论文结论都必须写清预算。
- 用不可验证任务证明验证器有效。 如果没有独立标签、执行器、证明检查器或人类专家审查,验证器分数很容易变成另一个模型偏好。
- 忽略答案抽取。 数学和代码评测中,答案格式、单位、等价表达、浮点容差都会制造假失败或假成功。
- 把 benchmark 提升等同于通用推理。 GSM8K、MATH、AIME、GPQA、Codeforces 测的是不同能力,不应混成一个"reasoning score"。
- 把公开模型报告当完整论文。 o1、部分商业模型报告提供重要线索,但训练细节、数据和代码不完整时,不能写成可复现实验证据。
适合研究生继续做的选题
- 推理预算路由器。 给定问题难度、模型置信度和成本约束,动态选择 direct、CoT、self-consistency、verifier 或 search。
- PRM 跨难度泛化。 用 GSM8K/MATH 训练或筛选的过程奖励模型,是否能定位奥赛级题目的早期错误。
- 长 CoT 压缩。 研究 long2short:哪些中间步骤必须保留,哪些只是冗余自检。
- 代码任务中的验证器分层。 比较自然语言 critic、单元测试、fuzzing、静态分析和执行反馈对候选程序选择的贡献。
- 开放任务的过程可信度。 对无法自动判分的科研问答或文献综述任务,设计人类可审计的 evidence trail,而不是只让模型自评。
- 搜索空间设计。 对同一任务比较 token-level sampling、step-level search、tool-level planning 和 proof-level search,分析哪种粒度最省预算。
总结
Reasoning Models 的主线可以概括为:先让模型写出中间过程,再让模型生成多条路径,然后训练或调用验证器选择路径,最后把推理变成可分配预算、可搜索、可强化学习优化的系统。精读这条路线时,要避免被"会思考"的表述带偏。真正值得记录的是:推理轨迹如何产生,验证信号来自哪里,额外计算是否可控,评测是否可复现,失败能否定位到具体步骤。
如果你要从今天开始读,建议按五篇打底:CoT、Self-Consistency、Let's Verify Step by Step、Tree of Thoughts、DeepSeek-R1。再用 s1 和 Qwen3 观察 2025 年开源推理模型如何把 thinking budget 变成可实验变量。这样读完后,你不会只会复述"模型会深度思考",而能提出一个可检验的问题:在什么任务、什么预算、什么验证信号下,推理真的变可靠了?
参考资料
检索日期:2026-08-06。
- Jason Wei et al. "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models." arXiv, 2022; NeurIPS 2022. https://arxiv.org/abs/2201.11903
- Xuezhi Wang et al. "Self-Consistency Improves Chain of Thought Reasoning in Language Models." arXiv, 2022; ICLR 2023. https://arxiv.org/abs/2203.11171
- Denny Zhou et al. "Least-to-Most Prompting Enables Complex Reasoning in Large Language Models." arXiv, 2022; ICLR 2023. https://arxiv.org/abs/2205.10625
- Karl Cobbe et al. "Training Verifiers to Solve Math Word Problems." arXiv, 2021. https://arxiv.org/abs/2110.14168
- Dan Hendrycks et al. "Measuring Mathematical Problem Solving With the MATH Dataset." arXiv, 2021; NeurIPS 2021. https://arxiv.org/abs/2103.03874
- Hunter Lightman et al. "Let's Verify Step by Step." arXiv, 2023. https://arxiv.org/abs/2305.20050
- Shunyu Yao et al. "Tree of Thoughts: Deliberate Problem Solving with Large Language Models." arXiv, 2023; NeurIPS 2023. https://arxiv.org/abs/2305.10601
- Princeton NLP. "tree-of-thought-llm" official repository. https://github.com/princeton-nlp/tree-of-thought-llm
- Shunyu Yao et al. "ReAct: Synergizing Reasoning and Acting in Language Models." arXiv, 2022; ICLR 2023. https://arxiv.org/abs/2210.03629
- David Rein et al. "GPQA: A Graduate-Level Google-Proof Q&A Benchmark." arXiv, 2023. https://arxiv.org/abs/2311.12022
- OpenAI. "Learning to reason with LLMs." Official report, 2024. https://openai.com/index/learning-to-reason-with-llms/
- Bradley Brown et al. "Large Language Monkeys: Scaling Inference Compute with Repeated Sampling." arXiv, 2024, revised 2024. https://arxiv.org/abs/2407.21787
- Scaling Intelligence. "large_language_monkeys" official repository. https://github.com/ScalingIntelligence/large_language_monkeys
- Chujie Zheng et al. "ProcessBench: Identifying Process Errors in Mathematical Reasoning." arXiv, 2024, revised 2025; ACL 2025. https://arxiv.org/abs/2412.06559
- DeepSeek-AI et al. "DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning." arXiv, 2025, revised 2026; Nature 2025 version linked on arXiv. https://arxiv.org/abs/2501.12948
- Kimi Team et al. "Kimi k1.5: Scaling Reinforcement Learning with LLMs." arXiv, 2025. https://arxiv.org/abs/2501.12599
- Niklas Muennighoff et al. "s1: Simple test-time scaling." arXiv, 2025. https://arxiv.org/abs/2501.19393
- SimpleScaling. "s1" official repository. https://github.com/simplescaling/s1
- Zhong-Zhi Li et al. "From System 1 to System 2: A Survey of Reasoning Large Language Models." arXiv, 2025, revised 2025. https://arxiv.org/abs/2502.17419
- An Yang et al. "Qwen3 Technical Report." arXiv, 2025. https://arxiv.org/abs/2505.09388