告别盲目重复采样:PTTS 用「规划-执行分离」把测试时算力省下一半

引子:为了让一个难题做对,我们最顺手的办法是「多抽几次、选最好的」------best-of-N、self-consistency 都这么干。但 UCLA 9 月 23 日放出的 PTTS(Planned Test-Time Scaling,arXiv 2609.27374)戳破了一个温水煮青蛙的事实:同一个策略独立抽 k 次,分支会塌缩到同一条主导推理路径上,多花的算力买来的是重复尝试,而不是新覆盖。PTTS 的改法很轻------给每个分支先发一张不同的「大纲」,让它们各走各路。它不训大模型,却把 pass@k 最高抬了 13.4 个点,还顺手把所需算力砍掉一半以上。

一、旧范式的原罪:重复采样在「碰运气」

测试时扩展(test-time scaling)的核心动作,是把一个问题并行跑 k 个分支,再从中挑一个最好的答案。这套打法有两个名字大家最熟:

  • best-of-N / 拒绝采样:对同一个 prompt 采样 N 次,用奖励模型或验证器挑分最高的。
  • self-consistency(自一致性):对多步推理题采样多条思维链,投票决定答案。

它们都共享一个隐含假设:k 个分支是从同一个策略 π 独立、同分布抽出来的。问题恰恰出在这里。

论文在「推理模式选择」的简化设定里证明了一个尖锐的结论:以 pass@1 为目标的边际策略会塌缩到单一主导模式(mode collapse)。换句话说,当模型「最擅长」某条路时,它抽出来的 k 个分支会高度相似,反复重放同一类失败。此时额外算力只是把你已经试过的错路再试一遍。

css 复制代码
重复采样:        π ──┬─> 分支1 ──> 主导模式 A
                      ├─> 分支2 ──> 主导模式 A   ← 高度重叠
                      └─> 分支3 ──> 主导模式 A
收益:k 倍算力,覆盖的模式数 ≈ 1

对一个只有单一正确解路径的简单题,这无所谓;但对那些「需要互补思路才能覆盖正确解」的难题(比如一道能用代数、几何、数论三种路径去碰的奥数题),重复采样的 pass@k 曲线会早早饱和。这不是模型不够强,是采样方式把多样性锁死了。

二、PTTS 的原理:规划-执行分离

PTTS 把「抽 k 个独立样本」换成一个协调的联合策略(coordinated joint policy):

  1. Planner(规划器) 一次性为 k 个分支各生成一份差异化的解题大纲(outline),把分支往不同的推理路径上推;
  2. Executor(执行器) 在各自大纲的条件下,产出完整解答。
css 复制代码
PTTS:           Planner ──┬─> 大纲1 ──> Executor ──> 分支1 ──> 互补模式 A
                          ├─> 大纲2 ──> Executor ──> 分支2 ──> 互补模式 B
                          └─> 大纲k ──> Executor ──> 分支k ──> 互补模式 C
收益:同算力下,pass@k 覆盖更多正确路径

「啊哈」时刻 :这本质上是个协调问题,不是采样问题。难点从来不是「多抽几次」,而是「让每次抽取去探索还没被覆盖的思路」。一旦显式地规划大纲,pass@k 就从「重复抽奖」变成「分工勘探」。

形式上,论文证明 PTTS 严格泛化(strictly generalizes)重复采样 :当 Planner 给所有分支输出相同大纲时,PTTS 就退化成重复采样------所以它保证不会比重复采样更差,只会更好。在同一简化设定里,直接以 pass@k 为目标的 Planner 会主动促进互补推理模式的覆盖,从而拿到比 pass@1 优化更好的 pass@k 扩展曲线。

论文给出两个落地形态:

  • PTTS-ZS(零样本) :用一个基础 LLM 当 Planner(利用其更广的生成多样性),冻结一个强推理模型当 Executor;所有 k 份大纲在一次自回归生成里联合产出。简单到可以纯 prompt 实现,且天然支持端到端优化。
  • PTTS-RL(强化学习) :冻结 Executor,直接用 k 个分支解的 pass@k 作为奖励去优化 Planner。关键技巧是训练时截断 Executor 的推理预算------不让 Executor 用「想得更久」来抢救一份烂大纲,从而把信用分配(credit assignment)精准地压到 Planner 头上,同时大幅降低 rollout 成本。

三、N 个优势(都用数据说话)

实验在 Qwen3-1.7B 和 4B 两个Executor、五个数理推理基准上完成:

方案 pass@64 相对重复采样 算力开销
重复采样(基线) --- k 次完整推理
PTTS-ZS(零样本) 最高 +6.7 点 约等于基线
PTTS-RL(强化学习) 最高 +13.4 点 半预算即超越基线(>2× 算力效率)

几个值得记住的点:

  1. 算力效率是真金白银:PTTS-RL 只用一半采样预算就超过了重复采样,等价于 2 倍以上 compute-efficient。
  2. Planner 可迁移 :用 PTTS-RL 训出的 Planner 能套到训练时没见过的 Executor 上------更大的推理模型 +4.4 pass@64,用多样性 RL 训过的 Executor 也 +4.4。说明它和「Executor 侧改进」是互补而非替代关系。
  3. 可叠加:既然 Planner 层和 Executor 层解耦,你完全可以先把底层模型训得更强,再在上面叠一层 PTTS,两层收益互不抵消。

四、理想丰满,现实骨感:N 个工程死结

专业度的来源就在这里------PTTS 不是银弹。

  1. 长输出会「跑题」:大纲只是软约束。Executor 在长链思维里仍可能偏离初始大纲,一旦跑偏,所谓「互补路径」就名存实亡。论文自己也点出这是未跨过的门槛。
  2. Planner 有天花板:PTTS-ZS 的收益依赖基础模型本身的多样性。若 Planner 太弱,生成的大纲并不真正互补,增益就缩水。零样本版的上限,本质上受限于你手头那个「会写大纲」的模型。
  3. 评测面太窄 :五个基准全是数学推理。它能否迁移到代码、开放问答、Agent 工具调用等「分支间依赖更强、验证更模糊」的场景,尚无可信证据。
  4. k 不能无限大:联合生成 k 份大纲本身有成本,且分支过多时协调收益递减。它不是「k 越大越好」的免费午餐。

五、解法与缓解

  • PTTS-RL 的截断预算本身就是对症药:通过禁止 Executor 用更长思考兜底,强迫 Planner 学会「写好大纲」而非「甩锅给执行」。
  • Executor 侧多样性 RL 与 PTTS 互补,两层一起上能逼近更高 ceiling。
  • Planner 保持轻量:它不需要是大模型,一个基础 LLM 足以,部署成本低。

六、生产现实:真正跑起来是什么样

PTTS 的最佳定位是「架在现有推理模型上的推理时包装层」------你不用重训那个贵的大模型,只需挂一个轻量 Planner(甚至零样本 prompt 基础模型)。

markdown 复制代码
你在用 best-of-N 吗?
├─ 否 → 先上 best-of-N 拿到基础收益
└─ 是 → 你的题是否需要「互补思路」才覆盖正确解?
         ├─ 否(单主导路径)→ 重复采样已够,PTTS 增益有限
         └─ 是 → 上 PTTS:
               ├─ 想要零改动 → PTTS-ZS(prompt 基础模型当 Planner)
               └─ 想要极致效率 → PTTS-RL(训一个小 Planner,半预算超基线)

什么场景赚 :问题有多种有效推理模式、你有固定算力预算、且已经在做 best-of-N。此时 PTTS 严格占优。 什么场景亏:任务只有单一解法路径(塌缩不伤)、或 Executor 本身太弱(规划救不了执行)------「给弱模型发好大纲,它也走不到答案」。

七、我的判断

测试时计算正在从「堆采样」变成一门工程学科 :规划(让分支互补)、预算(决定算多少)、选择(用验证器挑)三者分离。PTTS 贡献的是一个清晰的协调层,它和 Executor 改进、验证器选择是正交的三件事,可以叠加。

最值得盯的下一个信号:RL 训出来的 Planner 能否根据问题难度自适应调整大纲多样性------简单的题少分支、难的题多分支,把「该分配多少算力给规划」也变成可学出来的策略。


参考与数据来源:arXiv 2609.27374(Planned Test-Time Scaling with Coordinated Reasoning Paths,UCLA,2026-09-23 提交,未 peer-review);关键数字(pass@64 +6.7 / +13.4、半预算 2× 效率、迁移 +4.4)均来自论文摘要与正文报告。评测基于 Qwen3-1.7B/4B 与五个数理基准,迁移结论来自论文 transfer 实验。本文为技术解读,落地前请以原论文与你的实测为准。

相关推荐
有毒的教程1 小时前
AI文生视频转场提示词(直接复制,分类型|适配MiniMax H3 / 可灵 / Runway)
人工智能·音视频
泛联新安1 小时前
软件定义汽车时代,如何让AI研发“可信”?——泛联新安构建汽车企业级可信AI体系的落地路径
大数据·人工智能·安全·网络安全·汽车·漏洞挖掘·代码安全
吴建旭 智宅焕1 小时前
AI搜索时代的智能家居交付知识架构:官网作为可信一手信息源与全国交付基础设施
人工智能·架构·智能家居
yuanxi2001 小时前
001267拟扩产光模块:大客户销售如何用价值力读一条扩产公告
人工智能·职场和发展·创业创新·学习方法
梦帮科技2 小时前
领域认知知识库图谱注入:从双式记账图网络到高质量问答对自动化合成流水线
运维·网络·数据库·人工智能·矩阵·架构·自动化
浦信仿真大讲堂2 小时前
告别反复样机试制!重塑机械装备研发
人工智能·达索系统·力学仿真
飞哥数智坊2 小时前
我让 TRAE 也“看”到了微信小程序
人工智能·ai编程
一直在努力的小宁2 小时前
【阅读笔记】具身智能的真机数采,到了分水岭
人工智能·深度学习·机器学习·agent·具身智能·vlm·vln
向成科技2 小时前
XC3576H工控主板|深度适配Ubuntu 26.04 LTS,释放边缘AI与工业开发新潜能
linux·人工智能·ubuntu·机器人·硬件·主板·边缘ai