上一篇写了"on-policy 化的 DPO",这一篇把镜头切回 OPD(On-Policy Distillation,在线策略蒸馏) 本身------它是当前大模型后训练(post-training)里性价比最高的技巧之一,Qwen3、DeepSeek-V4、GLM-5 等一线大模型都在用。这篇挑十篇论文,从"是什么"讲到"为什么会失败"再到"怎么修"。
0. 一张图搞懂 OPD 是什么
先把"蒸馏(Distillation)"这件事按数据来源分个类:
┌───────────────────────────┐
│ 知识蒸馏总览 │
└───────────────────────────┘
│
┌───────────────────────┼───────────────────────┐
│ │
Off-Policy 蒸馏(传统 KD/SFT) On-Policy 蒸馏(OPD)
学生学习"教师生成的固定语料" 学生自己采样 → 教师打分/给分布 → 学生对照自己学
训练/推理分布不一致(exposure bias) 训练时看到的就是推理时会遇到的分布
一句话定义:
OPD = 让学生模型 πθ\pi_\thetaπθ 自己采样出一条轨迹 y∼πθ(⋅∣x)y \sim \pi_\theta(\cdot|x)y∼πθ(⋅∣x),再用一个更强的教师模型 πteacher\pi_{teacher}πteacher 对这条"学生亲手写出来的"轨迹逐 token 打分/纠偏,而不是死记硬背教师提前写好的范文。
这解决的是传统 KD 的老大难问题------exposure bias(暴露偏差):学生在训练时只见过教师的"标准答案",一到推理时自己现场生成,稍微走错一步就再也没见过这种"错误状态",只能一步错步步错,好比背课文却没做过考场上的应用题。
1. 论文一(奠基):GKD------给 OPD 一个正式的数学框架
《On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes》(Agarwal et al., Google DeepMind, ICLR 2024, arXiv:2306.13649)
这是把 OPD 在 LLM 上系统化、公式化的开山之作,提出 Generalized Knowledge Distillation(GKD) 框架。
1.1 核心公式
GKD 把"数据从哪采样"做成一个可调的混合参数 λ∈0,1\lambda \in 0,1λ∈0,1:
LGKD(θ)=(1−λ) Ey∼DD(πteacher ∥ πθ)(y∣x) + λ Ey∼πθ(⋅∣x)D(πteacher ∥ πθ)(y∣x) \mathcal{L}{GKD}(\theta) = (1-\lambda)\,\mathbb{E}{y\sim \mathcal{D}}\bigD(\\pi_{teacher} \\,\\Vert\\, \\pi_\\theta)(y\|x)\\big \;+\; \lambda\,\mathbb{E}{y\sim \pi\theta(\cdot|x)}\bigD(\\pi_{teacher} \\,\\Vert\\, \\pi_\\theta)(y\|x)\\big LGKD(θ)=(1−λ)Ey∼DD(πteacher∥πθ)(y∣x)+λEy∼πθ(⋅∣x)D(πteacher∥πθ)(y∣x)
| 符号 | 含义 |
|---|---|
| D\mathcal{D}D | 固定的离线语料(off-policy 部分) |
| πθ(⋅∣x)\pi_\theta(\cdot\vert x)πθ(⋅∣x) | 学生自己采样(on-policy 部分),λ=1\lambda=1λ=1 时就是纯 OPD |
| D(⋅∥⋅)D(\cdot\Vert\cdot)D(⋅∥⋅) | 任意可选的散度,例如前向 KL、反向 KL、JSD,不局限于交叉熵 |
λ=1\lambda=1λ=1 时,公式退化为纯粹的 on-policy 蒸馏:学生生成什么,教师就纠正什么,训练看到的分布 = 推理时会遇到的分布。
1.2 贡献总结
- 首次把"蒸馏损失函数"和"采样来源"解耦成两个独立可调的旋钮;
- 证明 OPD 可以和 RLHF 无缝结合(蒸馏本身可以看成一种更便宜的"以教师为奖励"的强化学习)。
一句话总结:GKD 是 OPD 的"标准公式",后面几乎所有 OPD 论文都能塞进这个框架里当成一个特例。
2. 论文二:MiniLLM------用反向 KL,让学生"学会取舍"而不是"雨露均沾"
《MiniLLM: Knowledge Distillation of Large Language Models》(Gu et al., ICLR 2024, arXiv:2306.08543)
2.1 为什么选反向 KL
传统蒸馏常用前向 KL:KL(πteacher∥πθ)KL(\pi_{teacher} \Vert \pi_\theta)KL(πteacher∥πθ),这个散度是"mean-seeking"(均值寻求)的------学生会试图覆盖教师所有可能的输出模式,结果是"什么都学一点,什么都不精"。MiniLLM 改用 反向 KL:
KL(πθ ∥ πteacher)=Ey∼πθlogπθ(y∣x)πteacher(y∣x) KL(\pi_\theta \,\Vert\, \pi_{teacher}) = \mathbb{E}{y\sim \pi\theta}\Big\\log\\frac{\\pi_\\theta(y\|x)}{\\pi_{teacher}(y\|x)}\\Big KL(πθ∥πteacher)=Ey∼πθlogπteacher(y∣x)πθ(y∣x)
反向 KL 是"mode-seeking"(模式寻求)的:学生会集中火力,专注学会教师分布里它自己有能力学好的那一小块高质量模式,放弃勉强自己去够那些学不会的长尾模式。这对参数量小、表达能力有限的学生模型更友好。
2.2 工程难点与解法
反向 KL 的期望是在 πθ\pi_\thetaπθ 上求的,意味着必须从学生自己采样------这正好是 on-policy 的要求,但也带来一个麻烦:反向 KL 的梯度不能像交叉熵那样直接求,MiniLLM 借助策略梯度(policy gradient)的技巧,把它变成一个可以用强化学习方式优化的目标,并加入单步分解、教师混合采样等工程手段稳定训练。
一句话总结:MiniLLM 告诉我们,OPD 不仅仅是"换个数据源",连损失函数本身(该用哪种散度)都要跟着采样方式一起重新设计。
3. 论文三(工程落地范本):Thinking Machines Lab------用 OPD 把 RL 的效果用蒸馏的价格买到
《On-Policy Distillation》(Thinking Machines Lab 技术博客,2025)
这不是一篇严格意义上的会议论文,而是一份非常有影响力的技术报告,把 OPD 从"学术概念"落地成了"工程配方"。
3.1 核心流程:先 off-policy 打底,再 on-policy 精调
预训练模型 →off-policy 蒸馏(SFT on 教师轨迹) 中期模型 →on-policy 蒸馏(OPD) 最终模型 \text{预训练模型} \;\xrightarrow{\text{off-policy 蒸馏(SFT on 教师轨迹)}}\; \text{中期模型} \;\xrightarrow{\text{on-policy 蒸馏(OPD)}}\; \text{最终模型} 预训练模型off-policy 蒸馏(SFT on 教师轨迹) 中期模型on-policy 蒸馏(OPD) 最终模型
他们发现:纯 off-policy 的 SFT 负责把"基本盘"搭起来,真正决定上限的是后面这一步 on-policy 精调 ------学生在自己生成的完整轨迹(包括中间的思考过程 chain-of-thought)上,让教师逐 token 打分再拿分数当训练信号,这跟"过程奖励模型(process reward model)"的思路(如 Let's Verify Step by Step)是同一种精神。
3.2 结果
- 用他们的 Tinker 训练 API 复现了 Qwen3 技术报告里"OPD 达到与 RL 相当的推理基准表现"的结果,而成本只是 RL 的一小部分;
- 说明 OPD 可以在很多场景下替代昂贵的 RLHF/RL 微调,尤其是持续学习、模型个性化、能力找回(performance recovery)这几个场景。
一句话总结:这篇报告把"OPD 能不能打"从论文数字变成了业界可复现的工程结论------能,而且便宜很多。
4. 论文四 & 五:打破"必须同一个分词器"的诅咒------跨 tokenizer 的 OPD
标准 OPD 有个隐藏假设:教师和学生必须共用同一个分词器(tokenizer),才能逐 token 对齐概率分布。一旦教师、学生来自不同模型家族(比如用 Qwen 教 Llama),这套方法直接失效,只能退化成粗糙的 SFT。下面两篇是这个方向的代表:
4.1 GOLD:通用跨模型家族的 on-policy logit 蒸馏
《Unlocking On-Policy Distillation for Any Model Family》(Patiño et al., Hugging Face 研究报告, 2025)
提出 General On-Policy Logit Distillation(GOLD),在 TRL 库里给出可直接跑的实现,核心是设计一套跨词表的 token 映射/对齐算法,让"教师在不同分词体系下打的分"依然能转换成学生词表上可用的监督信号。
4.2 Byte-Prefix Marginalization:更彻底的字节级对齐
《Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization》(2026, arXiv:2607.22334)
指出 GOLD 这类早期方法在跨词表映射时,容易丢弃教师的概率质量 或者把它错误地分配给内容不相关的学生 token。这篇提出 Byte-Prefix Marginalization(BPM) :把教师、学生的 token 都重新表示成字节(byte)空间里的序列,规则是------
教师 token 的概率 ⟶ 分配给"字节前缀匹配"的最长学生 token \text{教师 token 的概率} \;\longrightarrow\; \text{分配给"字节前缀匹配"的最长学生 token} 教师 token 的概率⟶分配给"字节前缀匹配"的最长学生 token
同一学生 token 收到的多份概率质量做累加,实在匹配不上的部分放进一个专门的"剩余类别(residual category)",保证整个概率分布不丢质量、不错配、覆盖全词表。
一句话总结(这两篇合起来看):教师学生不同源不再是 OPD 的天花板,"字节级"对齐正在把 OPD 的适用范围从"同门师徒"扩展到"任意模型家族"。
5. 论文六:D-OPSD------OPD 思想走出 LLM,走进扩散模型
《D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models》(2026)
这篇很有意思:把 OPD/OPSD(On-Policy Self-Distillation)的思路从"自回归语言模型"迁移到"少步扩散图像生成模型"上。
5.1 问题背景
文生图模型正从"多步采样器"转向"少步(step-distilled)采样器"以提升效率,但这类模型持续微调、学新概念时,现有方案都有短板:
- 离线 RL 方法(如 Diffusion-DPO、PSO):做成对偏好监督,但优化状态不是完全由学生当前分布决定的,存在跟 DPO 一样的 off-policy 问题;
- 在线 RL 方法(如 ReFL、Flow-GRPO):在模型 rollout 上训练,但依赖奖励模型,二次开发者往往只有"图像-文本对",拿不到高质量奖励信号。
5.2 D-OPSD 的位置
D-OPSD 选择了一个独特的位置:在线策略、不需要奖励模型、保持训练-推理一致,同时用自蒸馏引入目标图像-文本对。类比关系可以这样对应:
| LLM 中的 OPD | D-OPSD(扩散模型) |
|---|---|
| 学生自己采样的回答 | 学生自己的降噪轨迹(denoising trajectory) |
| 教师给出更强的下一 token 预测 | 教师(更强上下文条件下)给出更强的条件速度场(velocity field) |
| 用 KL 散度对齐离散分布 | 用速度预测的均方误差(MSE)对齐连续场 |
因为扩散模型参数化的是连续的"条件速度场"而非离散词表分布,没法直接套用 KL,所以改用 MSE 达到类似"把学生轨迹拉向教师"的效果。
一句话总结:OPD 不是 LLM 的专利,只要"训练分布 = 推理分布"这件事有价值,思想就能迁移到扩散模型甚至更多生成范式上。
6. 论文七:Rethinking On-Policy Distillation------OPD 到底什么时候会失败?
《Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe》(清华 THUNLP, 2026, arXiv:2604.13016)
前面几篇都在讲"OPD 怎么用、怎么扩展",这篇开始"泼冷水"------系统研究 OPD 什么时候不管用。
6.1 两个决定成败的条件
论文提炼出两条规律:
- 思维模式兼容性(thinking pattern compatibility):学生和教师的推理/思考风格必须相容。哪怕教师在榜单上分数更高,如果它的推理路径跟学生的"习惯"差异太大,蒸馏信号也会被削弱------论文用一个反直觉的实验证明了这点:一个 benchmark 分数更低、但推理风格与学生更接近的 GRPO 教师,反而比分数更高但风格迥异的教师带来更好的蒸馏效果;
- 知识新颖性(genuine novelty):哪怕思维模式一致、教师分数也更高,只要教师提供的"能力"是学生训练中早就见过的,蒸馏也不会有增益------用符号表示大致是:
OPD 收益 ∝ Compatible(πθ,πteacher)⏟思维模式相容 × Novelty(πteacher∖πθ)⏟教师独有、学生没见过的能力 \text{OPD 收益} \;\propto\; \underbrace{\text{Compatible}(\pi_\theta, \pi_{teacher})}{\text{思维模式相容}} \;\times\; \underbrace{\text{Novelty}(\pi{teacher} \setminus \pi_\theta)}_{\text{教师独有、学生没见过的能力}} OPD 收益∝思维模式相容 Compatible(πθ,πteacher)×教师独有、学生没见过的能力 Novelty(πteacher∖πθ)
两个因子任何一个接近 0,整体收益都会归零------这也是为什么"随便找个更强的模型当教师"经常不奏效的根本原因。
一句话总结:教师"更强"是必要条件,不是充分条件------风格要合拍,还得有真本事教给学生,两条缺一不可。
7. 论文八:Rethinking OPD for Thinking Models------"开卷"反而让强模型变差?
《Rethinking On-Policy Self-Distillation for Thinking Models》(2026, arXiv:2607.05184)
这篇发现了一个更反直觉的现象,聚焦在"会长链推理的 thinking models"(如 Qwen3-Thinking、OLMo-thinking 系列)身上。
7.1 "特权自蒸馏"为什么会反噬
特权自蒸馏(privileged self-distillation):让模型看到"标准答案/解题过程"当教师信息,自己给自己当学生做纠偏。直觉上,给学生开卷考试应该只会更好------但论文在 Qwen3、OLMo 等 5 个 thinking 模型上,于 AIME24/25、HMMT25 等长推理基准上发现:
avg@16 准确率相对下降幅度最高可达 17% \text{avg@16 准确率相对下降幅度最高可达 } 17\% avg@16 准确率相对下降幅度最高可达 17%
而且退化幅度随"隐藏给学生的特权信息量"增加而增加,在**长 rollout(模型本该发挥最大优势)**的场景下最严重。
7.2 机制解释
- 特权上下文会降低 thinking 模型 rollout 中的"分叉率(fork rate)"------也就是模型在推理途中"自我怀疑、回头重新想一想"的行为变少了;
- 这个现象在纯 instruction 模型上不明显,唯独在 thinking 模型上明显,形成一个有趣的二分法:特权上下文能帮 instruction 模型,却会伤害更强的 thinking 模型;
- 更细粒度看,当学生刚要开始一段"自我修正(self-correction)"分支时,带特权信息的 OPD 会惩罚掉这些"重新考虑"的 token,而普通(无特权)OPD 反而会支持这些 token------直接导致模型输出中验证、回溯、犹豫等标志性推理行为大幅减少。
一句话总结:给模型"作弊小抄"式的特权信息看似仁慈,实际上会悄悄砍掉 thinking 模型赖以强大的"自我怀疑"能力,OPD 用于自蒸馏时要格外小心这个副作用。
8. 论文九:Purified OPSD------怎么在不丢失"怎么想"的前提下做自蒸馏
《Purified OPSD: On-Policy Self-Distillation Without Losing How to Think》(2026, arXiv:2607.02234)
这篇可以看作是对论文八发现的问题给出的"修复方案"------标题里的 Without Losing How to Think 已经点出了目标。
8.1 思路
既然问题出在"特权信息会污染 token 级别的监督信号,尤其是打断自我修正行为",Purified OPSD 的核心思路是对自蒸馏信号做"提纯(purify)":在构造训练目标时,有选择性地区分哪些 token 是"实质性内容 token"、哪些是"体现思考过程本身的 token"(如验证、回溯、犹豫标记),对后者施加更谨慎、更少破坏性的监督,而不是像普通 OPSD 那样对所有 token 一视同仁地纠偏。
一句话总结:做自蒸馏时,不能只关心"答案对不对",还要保护好模型"怎么一步步想出答案"的过程本身------这是从论文八的教训里直接反推出来的工程对策。
9. 论文十(全局视角):A Survey of On-Policy Distillation------用一个公式统一所有 OPD 变体
《A Survey of On-Policy Distillation for Large Language Models》(Song & Zheng, 2026, arXiv:2604.00626)
作为目前第一篇专门的 OPD 综述,它做的最有价值的事情是给出一个统一的数学视角,把 GKD、MiniLLM 等各种变体都收纳进同一个框架。
9.1 统一采样分布 πmix\pi_{mix}πmix
综述引入一个"混合采样策略" πmix\pi_{mix}πmix,把训练数据到底来自哪里这件事参数化:
πmix=(1−λ)⋅Doffline + λ⋅πθ(⋅∣x),λ∈0,1 \pi_{mix} = (1-\lambda)\cdot \mathcal{D}{offline} \;+\; \lambda \cdot \pi\theta(\cdot|x), \qquad \lambda \in 0,1 πmix=(1−λ)⋅Doffline+λ⋅πθ(⋅∣x),λ∈0,1
再配合一个可自由选择的 f-散度 Df(πteacher∥πθ)D_f(\pi_{teacher} \Vert \pi_\theta)Df(πteacher∥πθ) 作为损失,GKD(λ=1\lambda=1λ=1,可选散度)、MiniLLM(反向 KL,on-policy)等都能表示成这个统一框架下的特例------只是 λ\lambdaλ 和 DfD_fDf 的具体取值不同。
9.2 综述给出的分类维度
综述还按照另外几个正交维度对现有工作做了归类,方便工程师"按图索骥":
- 反馈信号来源:是否需要教师完整的 logits(白盒),还是只有教师的采样输出(黑盒);
- 教师访问模式:能拿到 logits → 白盒方法(如 GKD、Entropy-Aware OPD);拿不到 → 黑盒方法(判别器式奖励,如 GAD、OVD)或干脆自己当自己的教师(OPSD、SDFT);
- 损失函数族:前向 KL / 反向 KL / JSD 等 f-散度的具体选择,直接决定了"雨露均沾"还是"抓大放小"的学习风格(呼应论文二 MiniLLM 的讨论)。
一句话总结:这篇综述把前面九篇论文全都"装进了同一个坐标系"里,告诉我们 OPD 领域看似五花八门的方法,本质上只是在 (λ,Df,教师访问模式)(\lambda, D_f, \text{教师访问模式})(λ,Df,教师访问模式) 这三个维度上做不同的排列组合。
10. 十篇论文横向对比表
| 论文 | 年份 | 定位 | 核心贡献一句话 |
|---|---|---|---|
| GKD | 2023/2024(ICLR) | 奠基理论 | 给出 (1−λ)off-policy+λon-policy(1-\lambda)\text{off-policy} + \lambda\text{on-policy}(1−λ)off-policy+λon-policy 的统一蒸馏公式 |
| MiniLLM | 2023/2024(ICLR) | 损失函数设计 | 用反向 KL(mode-seeking)让小模型"抓大放小"地学 |
| Thinking Machines Lab 报告 | 2025 | 工程落地 | 用 OPD 以 RL 一小部分的成本复现 RL 级别效果 |
| GOLD | 2025 | 能力扩展 | 打破"教师学生必须同分词器"的限制 |
| Byte-Prefix Marginalization | 2026 | 能力扩展(升级版) | 字节级对齐,解决跨词表映射丢概率质量的问题 |
| D-OPSD | 2026 | 跨模态迁移 | 把 OPD 思想搬到少步扩散图像生成模型上 |
| Rethinking OPD(THUNLP) | 2026 | 失败模式分析 | 提出"思维模式相容 + 知识新颖性"两条成败铁律 |
| Rethinking OPSD for Thinking Models | 2026 | 失败模式分析(细化) | 发现特权自蒸馏会砍掉 thinking 模型的自我修正能力 |
| Purified OPSD | 2026 | 修复方案 | 区分内容 token 与思考过程 token,针对性保护后者 |
| A Survey of OPD | 2026 | 统一理论/综述 | 用 πmix\pi_{mix}πmix + f-散度统一所有 OPD 变体 |
十篇论文按"故事线"排列:先立框架(1、2)→ 落地证明有效(3)→ 打破适用范围限制(4、5、6)→ 发现隐藏的失败模式(7、8)→ 给出修复方案(9)→ 最后用综述把一切收归统一理论(10)。
11. 总结:如果只带走三句话
- OPD 的本质是"训练分布 = 推理分布":让学生在自己实际会遇到的状态上被纠偏,而不是死记硬背教师提前写好的范文,这是它相对传统 SFT/KD 最根本的优势;
- 教师"更强"不等于"更好教":思维风格是否相容、教的东西是否真的新颖,比单纯看教师的 benchmark 分数更重要,给 thinking 模型喂"标准答案"式的特权信息甚至可能弄巧成拙;
- OPD 正在从"同门蒸馏"走向"万能蒸馏":跨分词器、跨模态(扩散模型)的探索说明,只要抓住"on-policy 采样 + 教师逐步纠偏"这个核心思想,它能被搬到远超当初 LLM 场景的地方去用。
参考文献
- Agarwal, R. et al. On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes (GKD). ICLR 2024, arXiv:2306.13649.
- Gu, Y. et al. MiniLLM: Knowledge Distillation of Large Language Models. ICLR 2024, arXiv:2306.08543.
- Lu, K. & Thinking Machines Lab. On-Policy Distillation. Technical blog, 2025.
- Patiño, C. M. et al. Unlocking On-Policy Distillation for Any Model Family (GOLD). Hugging Face research article, 2025.
- Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization. arXiv:2607.22334, 2026.
- D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models. 2026.
- Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe. THUNLP, arXiv:2604.13016, 2026.
- Rethinking On-Policy Self-Distillation for Thinking Models. arXiv:2607.05184, 2026.
- Purified OPSD: On-Policy Self-Distillation Without Losing How to Think. arXiv:2607.02234, 2026.
- Song, M. & Zheng, M. A Survey of On-Policy Distillation for Large Language Models. arXiv:2604.00626, 2026.