技术栈

推理时计算扩展

thesky123456
30 分钟前
大模型·长思维链·推理时计算扩展·inference-time scaling·long-cot·best-of-n·process reward
27届大模型面试准备(六十八):长思维链与推理时计算扩展——从 long-CoT 到 inference-time scaling本篇是"工程实战深化"第 68 篇。前面我们写过 GRPO/PPO 对齐(A22:推理时扩展与 GRPO)、解码策略与生成质量(A33)。A22 讲的是"用强化学习在训练期把推理能力训出来",本文讲的是另一条同样重要、且当下最热的线:推理阶段(inference-time)怎么用更多计算把答案算得更对。这就是 inference-time scaling(测试时计算扩展)与 long-CoT(长思维链)。
我是有底线的