昨天(7 月 31 日)一天,AI 圈接连发生了三件事
早上,智谱 GLM Coding Plan 重新开放订阅

之前每天定点放名额,我一次没抢到过,现在不用抢了
以为是好消息呢,看到官网订阅价格,我傻眼了
Lite 118、Pro 538、Max 1078
最高比旧版贵了 3 倍多,用量似乎还少了

紧接着,上午刷到了 gpt 5.6 降价的消息
OpenAI 这是反着来啊:GPT-5.6 的 Luna 系列降幅甚至高达 80%

国外降价,国内涨价,剧情有点魔幻~
然后就刷到了 DeepSeek V4 Flash 0731 正式版发布

看 benchmark 分数全面大涨,好几项超过 GLM-5.2,价格一分没涨,依旧性价比拉满!
热闹归热闹。晚上我盯着官方那张 benchmark 对比图,看了很久。

DeepSWE,7.3 → 54.4。Terminal Bench 2.1,61.8 → 82.7。Cybergym,38.7 → 76.7。
要知道 0731 和 Preview 是架构相同、规模相同,只是重新做了一遍后训练。
不改架构、不加参数,凭什么强这么多?
我只知道强化学习和后训练可以提升模型做事的能力,但是一个后训练真的能提升那么大吗?
我顺着这个问题研究了下,发现答案比「后训练很牛」这四个字复杂得多,也有意思得多。
0731 做了什么:官方没说,但有线索
0731 具体改了什么------数据配方、训练配比------官方并没有披露具体内容。
但不是没线索。
V4 技术报告写了这一代完整的后训练方法论,0731 大概率出自这套体系。
看懂它,是讨论后面一切的前提。
V4 Flash 是 MoE(混合专家)模型:总参数 284B,每个 token 只激活 13B------内部一堆「专家」,每次只叫醒相关的一小撮干活,所以又强又便宜。
它的后训练分几步:
第一步,分头练专家。 代码、数学、工具调用各练各的:先 SFT(监督微调,给标准答案),再上 GRPO(强化学习,按结果好坏打分)。
第二步,蒸馏合并。 用 On-Policy Distillation(在线策略蒸馏,让学生模型在自己真实会走到的状态里逐 token 向老师对齐),把 10 多个专家合并回一个模型。
第三步,自己当裁判。 判不了对错的任务,用 GRM(生成式奖励模型)让模型自己打分。
另外还搭了 DSec 沙箱平台:单集群几十万个隔离环境,模型在里面真刀真枪跑代码、调工具。

信息量在于:后训练早不是「喂点对话数据调调口癖」了,它是一套有专家分工、有蒸馏、有裁判、有训练场的工业体系。
至于 0731 在里面拧了哪几个旋钮,目前还不知道。
后训练是「教新东西」,还是「兑现旧能力」?
这是整个研究里最关键的问题。
先交代我之前的朴素理解:预训练灌知识,后训练教做事------书呆子被调教成熟练工。
大方向没毛病,但太笼统。目前有两派研究:
第一派:主要是「兑现」。 NeurIPS 2025 一篇论文用 pass@k 做实验:同一道题让模型做 k 次,对一次就算过。
结果 RL 后模型能解的题,基座基本都能解,只是要试更多次。
也就是说,RL 没教新解法,它把「偶尔做对」变成了「一次做对」。能力一直在底座里,后训练提高的是正确策略被选中的概率。
第二派:RL 也能扩边界。 NVIDIA 的 ProRL 发现,训练拉得足够长,模型能解出基座怎么试都解不出的题;而且基座越弱的领域扩得越明显------那里还没被预训练「榨干」。
我的理解是:默认是兑现,但底座没被榨干、训练足够长时,也能扩边界。
蒸馏是例外,两派都承认它能搬运新行为------老师可能本来就是另一个更强的模型。让小模型直接学大模型的长思维链和解题能力,本来就是行业里的成熟做法。
那为什么分数能涨得这么夸张?
就算接受「主要是兑现」------DeepSWE 翻了 7 倍,杠杆哪来这么大?
其实,这可能是一种累积效果。
假设一个 Agent 任务要连续操作 100 步(读文件、改代码、跑测试、看报错......几百次工具调用很正常),单步正确率 90%,听着挺高了。
但 100 步全对的概率,是 0.9 的 100 次方:
- 单步 90%:全程全对概率 0.0027%,基本做不成
- 单步 99%:36.6%
- 单步 99.9%:90.5%

账面上「涨 47 分」,底层是单步稳定性的一点点改善,被长链路指数级放大了。
这就是后训练最狠的杠杆:不教新东西,只把已有能力兑现成稳定策略------而在长链路任务上,「稳定」的价值是指数级的。
代码和 Agent 任务特别适合这么练:
奖励可验证。 代码能跑测试,对就是对,错就是错。
在错误现场纠正。 On-Policy 训练覆盖的是模型自己真实会犯的错。
信用分配有解法。 Cursor 的 Composer 2.5 在出错那一步插入局部提示,让带提示的模型当老师,用蒸馏把正确行为写回去,只修出错那一段。
后训练本身也还在 scaling:有研究用 40 万 GPU 小时拟合出 sigmoid 增长曲线;Cursor 的 Composer 1.5 在同一个底座上把 RL 扩大 20 倍,后训练算力超过了预训练,能力还在涨。
泼盆冷水:涨的分,不全是模型的功劳
故事到这很顺,但就此收笔就不诚实了。
benchmark 涨分里,混着不少跟权重无关的东西。
最打击人的一个实验:用完全随机的奖励做 RL,都能让 Qwen2.5-Math 提升 21.4%------随机奖励教不会任何东西,是 GRPO 的机制天然放大基座先验。
单看「RL 后涨分」,你分不清涨的是能力还是算法偏见。
再看 harness(Agent 的脚手架,决定模型能看到什么、用什么工具、错了怎么重试)。Kimi K2.5 在三个 harness 下跑 Terminal Bench:43.2、47.3、50.8。
同一个模型,换层脚手架差 7.6 分。
带着这个视角看战报,味道就不一样了。
Composer 2 的 SWE-bench Multilingual 按 Moonshot 官方口径是 73.0 → 73.7,几乎打平;涨最狠的 CursorBench 是 Cursor 自家基准,外部复现不了。
DeepSeek 的官方 Agent 分数,用的是「尚未公开的 DeepSeek Harness」👀
第三方 Artificial Analysis 独立测下来进步是真的(Intelligence Index 比 Preview 高约 10 分),但也指出它输出冗长,整个评测生成 2.1 亿 token------分数里有一部分是拿推理 token 堆出来的。
还有 reward hacking(奖励投机):Cursor 自己披露,模型发现高风险修改容易被罚,就学会用「澄清问题」回避修改、白拿稳妥分。模型在讨好奖励函数,不一定在变强。
所以下次再刷到 benchmark 战报,先问三句:基准哪个版本?谁跑的 harness?推理档位开多少?------每个变量都值好几分。
我现在的理解:能力是一个五层系统
研究做完,我脑子里「模型能力强弱」的单一坐标,变成了一张分层图:

用这个框架回看昨天三件事:
价格战只是表象,真正的军备竞赛在后训练------预训练 scaling 放缓后,后训练是提升能力最便宜的路径。
同一副底牌,谁兑现率高、谁的训练场离真实世界近,谁就赢。
Cursor 把模型、harness、训练环境、真实用户反馈攥成闭环,最快每 5 小时出一个新 checkpoint------「后训练之神」背后不是神奇算法,是整套系统。
DeepSeek 是另一个打法:把技术红利让给开发者。
梁文锋说过,「我们的原则是不贴钱,也不赚取暴利,只赚合理的利润。」 🫡

现在全世界大部分模型都进入了 DeepSeek 斩杀区,能力差、价格贵的只能等着被斩杀了😀
回到开头的问题:同样规模,为什么突然变强?
我的答案:没有魔法。
284B 的强底座里本来就压着大量没被兑现的能力,后训练做的是把它们一层层放出来。
这也是我期待 V4 Pro 的原因------Flash 的底座是 284B,Pro 是 1.6T。
如果「兑现」的逻辑成立,Pro 底座里压着的,只会更多。
梁圣,搞快点。
