On-Policy Distillation 全景深潜

On-Policy Distillation 全景深潜

从第一性原理到 2026 前沿:同策略蒸馏的统一视角、数学骨架、工程配方与求职实战

更新日期 :2026-09-16(截至写作当日)

定位 :一篇由浅入深、面向"所有水平读者"的横切式长文。初学可读第一、二章建立直觉,进阶可读第三至五章掌握方法谱系,研究者与求职者请重点读第七至第九章。

一句话结论On-Policy Distillation(OPD,同策略蒸馏)是在"学生自己采样出来的状态分布"上做分布匹配的训练范式。它的数学本质是"以教师-学生对数比(log-ratio)为奖励的策略梯度";它的工程本质是"用一切手段驯服一个高方差、有偏、且受支撑集约束的估计量"。

关键词:同策略蒸馏、On-Policy Distillation、OPD、反向 KL、Reverse KL、暴露偏差、Exposure Bias、GKD、MiniLLM、DistiLLM、自蒸馏、策略梯度、大模型后训练、推理模型、RLHF、GRPO、特权信息。


0. 导读:这篇文档为什么值得你花时间

关于"知识蒸馏(Knowledge Distillation, KD)"的中文资料很多,但绝大多数停留在两种层次:要么复述 Hinton 2015 的软标签公式,要么罗列几篇论文的结论。它们共同的缺口是------没有回答"为什么蒸馏的采样分布如此重要",也没有把 2023 年以后 OPD 的爆发式进展装进一个统一的坐标系。

本文试图补上这个缺口,并做三件大多数中文博客没做的事:

  1. 给公式,而且给推导。 不是"OPD 用反向 KL",而是把"反向 KL 的梯度 = 以对数比为奖励的策略梯度"完整推给你看,让你在任何一篇 2026 的论文里都能一眼看穿作者在拧哪个旋钮。
  2. 给坐标系,而不是给清单。 2026 年上半年 arXiv 上以 "on-policy distillation" 为主题的工作数以百计(截至写作日 arXiv 全库命中 488 条)。清单会过时,坐标系不会。本文提出 "定位---重分配---稳定---数据---系统" 五轴框架,把最新工作各归其位。
  3. 给判断,包括失败。 大量新工作报告"我们比 baseline 好",却很少有人说清"什么时候 OPD 根本不该用"。本文专门用一章讲失败模式、有偏教师、多样性坍缩与理论边界。

诚实声明 :本文第四节之前的内容是相对稳定的经典;第五、七节大量引用 2025--2026 的预印本。它们代表了当下最前沿的共识与争论,但尚未沉淀为教科书结论,可能随后续实验修正。凡是这一步的判断,我都标注了"前沿判断"。


0.1 核心结论速览(TL;DR)

如果你只有 5 分钟,请把下面 10 条带走:

  1. 蒸馏的本质是分布匹配,不是"把答案抄给学生"。教师的价值一半在硬标签(答案),一半在软分布(哪些错误答案有多接近)。
  2. Forward KL 与 Reverse KL 不是技术细节,而是两种世界观:前者"质量覆盖"(mass-covering,学生会覆盖教师所有可能的输出),后者"众数寻找"(mode-seeking,学生只压在教师最可能的输出上)。
  3. 自回归生成任务偏爱 Reverse KL,因为学生容量有限,Forward KL 会强迫它把概率质量摊到教师的长尾上,而它根本生成不好这些长尾------这是 MiniLLM 的核心论证。
  4. On-policy 的精确含义是"数据来自当前待优化策略 π_θ",而不是"用了在线服务/实时数据"。Reverse KL 天然 on-policy,Forward KL 天然 off-policy。
  5. Reverse KL 的梯度可以写成策略梯度 :∇θKL(πθ∥πT)=− Ex∼πθ  log⁡πT(x)πθ(x) ∇θlog⁡πθ(x) \nabla_\theta \mathrm{KL}(\pi_\theta\|\pi_T) = -\,\mathbb{E}{x\sim\pi\theta}\,\\,\\log\\tfrac{\\pi_T(x)}{\\pi_\\theta(x)}\\,\\nabla_\\theta\\log\\pi_\\theta(x)\\,∇θKL(πθ∥πT)=−Ex∼πθlogπθ(x)πT(x)∇θlogπθ(x)。教师-学生对数比就是奖励
  6. 暴露偏差(exposure bias)随序列长度增长:学生在教师"完美前缀"上训练,却在推理时用自己的"脏前缀",错误会复利式累积。OPD 的作用是让学生在自己的状态分布上练习"纠错"。
  7. OPD 有四个可拧的旋钮:采样来源、散度方向、时间信用分配、辅助奖励。看懂这四个旋钮,就看得懂 2026 的绝大多数论文。
  8. OPD 最大的结构性弱点在支撑集:Reverse KL 只能"抑制学生已经采到的高概率错误 token",却无法主动把学生"引向"教师偏好、但学生几乎采不到的 token。2026 年的"概率重分配(routing)"类工作都在解决它。
  9. OPD 对数据量近乎不敏感 (2026 多项独立结果:8 条难题 ≈ 17k 数据集,甚至 1 条样本恢复大部分收益),但对状态覆盖率极其敏感。这说明 OPD 是"数据已被喂饱、瓶颈在算法"的领域。
  10. OPD 正在与 RL 合流:教师即奖励、验证器门控、OPD→RL 两阶段,学术界已很难划清"蒸馏"与"强化学习"的边界。这是 2026 年最重要的趋势。

0.2 阅读地图

复制代码
零基础读者 ──► 第 1 章(直觉)+ 第 2 章(定义)+ 第 5.0 节案例
进阶读者   ──► 第 3 章(数学)+ 第 4 章(谱系)+ 第 6 章(工程)
研究者     ──► 第 5 章(前沿坐标)+ 第 7 章(机理与争论)+ 第 10 章(开放问题)
求职者     ──► 第 8 章(选型)+ 第 9 章(面试真题)+ 第 11 章(速查表)

术语约定 :本文中 πT\pi_TπT 表示教师策略(teacher),πθ\pi_\thetaπθ 表示学生策略(student,即被优化的参数化策略),xxx 表示一条完整轨迹/回答,xtx_txt 表示第 ttt 个 token,x<tx_{<t}x<t 表示其前缀,V\mathcal VV 表示词表。KL(p∥q)\mathrm{KL}(p\|q)KL(p∥q) 一律用"从 ppp 到 qqq"的顺序书写。


1. 第一性原理:蒸馏到底在优化什么?

1.1 从"软标签"到"分布匹配"

2015 年 Hinton、Vinyals 与 Dean 的《Distilling the Knowledge in a Neural Network》开启了现代蒸馏。它的洞见朴素而深刻:一个训练好的大模型,其输出分布里编码的信息远多于一个 one-hot 标签。

对分类任务,教师对某张图的输出是一个概率向量,比如"猫 0.9,豹 0.07,老虎 0.02,狗 0.01"。硬标签只告诉你"这是猫";而软标签还告诉你"这张图长得有点像豹、又有点像老虎,但完全不像飞机"。这些"负类的相对概率"就是所谓的暗知识(dark knowledge)

于是损失函数变成教师软分布与学生软分布的 KL 散度,配上一个温度 TTT 把分布"软化":

LKD  =  α CE(y,  σ(zS))⏟硬标签  +  (1−α) T2 KL(σ ⁣(zT/T) ∥ σ ⁣(zS/T))⏟软标签:分布匹配 \mathcal{L}{\text{KD}} \;=\; \alpha\,\underbrace{\mathrm{CE}\big(y,\;\sigma(z_S)\big)}{\text{硬标签}} \;+\;(1-\alpha)\,T^2\,\underbrace{\mathrm{KL}\Big(\sigma\!\big(z_T/T\big)\,\Big\|\,\sigma\!\big(z_S/T\big)\Big)}_{\text{软标签:分布匹配}} LKD=α硬标签 CE(y,σ(zS))+(1−α)T2软标签:分布匹配 KL(σ(zT/T) σ(zS/T))

其中 zT,zSz_T,z_SzT,zS 是教师/学生的 logits,σ\sigmaσ 是 softmax,TTT 是温度。

但请立刻注意一件事 :上式里的 KL 是"从教师分布到学生分布",写成 KL(πT∥πθ)\mathrm{KL}(\pi_T\|\pi_\theta)KL(πT∥πθ)。这个方向,后来成了整个 OPD 故事的伏笔。

1.2 两个方向:Forward KL 与 Reverse KL

KL 散度不对称,这是它最容易被忽视、也最重要的一点。

KL(πT∥πθ)⏟Forward KL=∑yπT(y)log⁡πT(y)πθ(y),KL(πθ∥πT)⏟Reverse KL=∑yπθ(y)log⁡πθ(y)πT(y) \underbrace{\mathrm{KL}(\pi_T\|\pi_\theta)}{\text{Forward KL}}=\sum{y}\pi_T(y)\log\frac{\pi_T(y)}{\pi_\theta(y)},\qquad \underbrace{\mathrm{KL}(\pi_\theta\|\pi_T)}{\text{Reverse KL}}=\sum{y}\pi_\theta(y)\log\frac{\pi_\theta(y)}{\pi_T(y)} Forward KL KL(πT∥πθ)=y∑πT(y)logπθ(y)πT(y),Reverse KL KL(πθ∥πT)=y∑πθ(y)logπT(y)πθ(y)

它们的惩罚对象完全不同

  • Forward KL 惩罚"教师有质量、学生没有"的地方 (πT>0\pi_T>0πT>0 而 πθ→0\pi_\theta\to 0πθ→0 时,−πTlog⁡πθ→+∞-\pi_T\log\pi_\theta\to+\infty−πTlogπθ→+∞)。所以学生被迫在教师的每一个非零概率处都留一点质量 → 质量覆盖(mass-covering)
  • Reverse KL 惩罚"学生有质量、教师没有"的地方 (πθ>0\pi_\theta>0πθ>0 而 πT→0\pi_T\to 0πT→0 时,πθlog⁡πθ−πθlog⁡πT→+∞\pi_\theta\log\pi_\theta-\pi_\theta\log\pi_T\to+\inftyπθlogπθ−πθlogπT→+∞)。所以学生被迫收缩到教师分布的支撑集内 → 众数寻找(mode-seeking / zero-forcing)

这是本文第一个、也是最值得记住的结论:KL 的方向决定了"学生是去覆盖教师,还是去投靠教师"。

1.3 一个必须记住的几何直觉

用一个最简例子把它钉死在脑子里。设教师的真实分布是双峰 的:p(x)=0.5 N(−3,0.5)+0.5 N(+3,0.5)p(x)=0.5\,\mathcal N(-3,0.5)+0.5\,\mathcal N(+3,0.5)p(x)=0.5N(−3,0.5)+0.5N(+3,0.5)。学生的容量只够拟合单峰高斯。两种 KL 会得到截然不同的解:

目标 最优单峰学生 直觉名字 行为
Forward KL KL(p∣q)\mathrm{KL}(p|q)KL(p∣q) N(0, ≈4)\mathcal N(0,\ \approx 4)N(0, ≈4):把质量摊在两峰之间 均值寻找 / 质量覆盖 每个教师模式都沾一点,但每个都不像
Reverse KL KL(q∣p)\mathrm{KL}(q|p)KL(q∣p) N(−3,0.5)\mathcal N(-3,0.5)N(−3,0.5) 或 N(+3,0.5)\mathcal N(+3,0.5)N(+3,0.5):选一个峰钻进去 众数寻找 / 零回避 放弃覆盖,把一个模式学到位

这就是"蒸馏"和"能力差距"之间的张力的化身。 当学生比教师小很多(capacity gap),Forward KL 会逼学生去拟合它根本表示不了的复杂长尾,结果样样稀松;Reverse KL 让学生"打不过就加入"------专挑教师最有把握的模式,把它做扎实。

对自回归语言模型,这个直觉被 MiniLLM 进一步锐化:Forward KL 鼓励学生高估教师分布中那些低概率区域 (因为要覆盖),而这些低概率 token 往往是学生根本不会正确生成的,于是错误被放大。这是 OPD 选择 Reverse KL 的第一性原因。

1.4 为什么自回归生成"天生偏爱"Reverse KL

把三点叠在一起:

  1. 采样来源 :KL(πθ∥πT)\mathrm{KL}(\pi_\theta\|\pi_T)KL(πθ∥πT) 的期望在 πθ\pi_\thetaπθ 下求,恰好就是学生推理时自己会走的状态分布;而 KL(πT∥πθ)\mathrm{KL}(\pi_T\|\pi_\theta)KL(πT∥πθ) 的期望在 πT\pi_TπT 下求,需要采样教师。
  2. 容量匹配:Reverse KL 的"专精一个模式"更契合小模型的有限容量;Forward KL 的"覆盖全部"会把小模型撑爆。
  3. 推理时的错误恢复:语言模型是逐 token 生成的复合过程。Reverse KL 作用在学生自己的状态上,天然训练"在学生的错误前缀下如何继续",这正是推理时最需要的。

因此,当你在 2023 年之后的 LLM 蒸馏论文里看到"我们把 forward KL 换成 reverse KL",它背后不是一个工程 trick,而是上面这套世界观。

一个容易忽略的代价 :Reverse KL 是 mode-seeking,它会主动牺牲多样性 。如果一个任务需要学生保留多种合理回答(开放对话、创意写作、多解推理),纯 Reverse KL 会把分布"锐化"成单一模式,导致熵坍缩(entropy collapse)。第七章会专门讲这个失败模式。


2. 精确定义 On-Policy:别再把"在线数据"当成 on-policy

2.1 行为策略 vs 目标策略

强化学习给了我们最精确的定义工具:

  • 目标策略(target policy) :你正在优化的策略,这里就是 πθ\pi_\thetaπθ。
  • 行为策略(behavior policy) :实际产生训练数据 {x}\{x\}{x} 的那个策略,记作 πdata\pi_{\text{data}}πdata。

On-policy 当且仅当 πdata=πθ\pi_{\text{data}}=\pi_\thetaπdata=πθ(或与当前 πθ\pi_\thetaπθ 足够接近)。

这个定义和"数据新不新""是不是实时抓的"没有关系。你哪怕今天刚从线上抓了一批数据,只要这批数据是三个月前的旧模型 生成的,相对当前的 πθ\pi_\thetaπθ 它就是 off-policy 的。反过来,即使你在离线环境里训练,只要每步都用"当前学生"重新采样,它就是 on-policy。

映射到分布匹配:

目标 期望的下标分布 数据来源 分类
KL(πT∣πθ)\mathrm{KL}(\pi_T|\pi_\theta)KL(πT∣πθ) πT\pi_TπT 教师采样 Off-policy(supervised KD)
KL(πθ∣πT)\mathrm{KL}(\pi_\theta|\pi_T)KL(πθ∣πT) πθ\pi_\thetaπθ 学生采样 On-policy(OPD)

所以"用教师数据做 SFT"是 off-policy 蒸馏,"让学生自己生成、教师打分"才是 on-policy 蒸馏。 这是本文第二个必须记住的结论。

2.2 自回归里的分布漂移与暴露偏差

为什么这点对语言模型如此致命?因为自回归生成是一个误差复合系统。

设一条长度为 TTT 的轨迹。训练时(off-policy SFT)学生见到的前缀都来自教师(或人类标注),是"干净"的;推理时它见到的前缀是自己生成的,一旦某步出错,后续就进入了一个训练时从未见过的状态。经典理论结果(如 DAgger 一脉的模仿学习分析,以及 OPD 综述中引用的结论)表明:

  • 在"专家前缀"上训练、错误前缀上无训练的情况下,累积误差随 TTT 呈二次增长(∼T2\sim T^2∼T2)
  • 而让学习者在自己的状态分布 上接受纠正,累积误差可降到线性(∼T\sim T∼T)

这就是暴露偏差(exposure bias) 。它在短任务上几乎无害,所以早期 KD 论文没太在意;一旦任务变成几千 token 的思维链推理,T2T^2T2 会直接把 off-policy SFT 打崩。

一句话直觉 :只让孩子看冠军棋谱、从不让他下自己会下臭的棋,他永远学不会"下臭了怎么救回来"。OPD 就是让教练在孩子自己下出的局面上实时支招。

2.3 On-Policy / Off-Policy 方法分类表

方法族 状态从哪来(采样分布) 监督信号 On-policy? 代表
经典 KD(Hinton) 训练集(固定) 教师软标签 KD 2015
序列级 KD(SeqKD) 教师/NMT beam 解码 教师序列(硬) Kim & Rush 2016
白盒 logit KD 固定真实数据 教师分布(token级) 通用 KD
GKD(广义蒸馏) 学生自采样(可混教师) 教师反馈(任意散度) 可调 Agarwal 2024
MiniLLM 学生自采样 + 教师混合采样 Reverse KL Gu 2024
DistiLLM 学生自采样(自适应调度) Skew KL 是(渐强) Ko 2024
ToDi 学生自采样 token 级 FKL/RKL 混合 Jung 2025
SDPO / OPSD 学生自采样 自己(+特权信息)当教师 2025--2026
ReST / RFT / RAFT 学生自采样后再筛选 离线 SFT/偏好优化 (数据 on-policy,损失 off-policy) Gulcehre 2023 等

特别说明 ReST/RFT/RAFT 这一族 :它们让学生生成→用奖励/验证器筛选→在优质样本上做离线 SFT/DPO。数据是 on-policy 采的,但训练阶段的损失函数不含当前策略的对数比,所以严格说是"on-policy 数据 + off-policy 目标",介于两者之间。把它们和真正的 OPD 混为一谈,是面试里非常常见的失分点。

2.4 OPD 与 RL 中 on/off-policy 的关系

  • 在价值型 RL 里,on-policy 指"用当前策略采的数据更新当前策略"(如 REINFORCE、PPO)。
  • 在 OPD 里,你同样用当前策略采数据,但不需要环境奖励,而是用教师的对数概率当奖励

这个对应不是打比方,而是数学恒等(见 3.2):Reverse KL 的梯度就是一个以 log⁡πTπθ\log\frac{\pi_T}{\pi_\theta}logπθπT 为奖励的策略梯度。 因此 OPD 可以精确地看成"奖励由教师给定的 on-policy RL"。这一点在 2026 年的多篇工作(REOPOLD、OPPO、公式驱动综述)中被独立地反复指出,是理解整个领域的钥匙。

2.5 易混概念澄清(面试必考)

  • OPSD(On-Policy Self-Distillation,同策略自蒸馏) :教师不是外部大模型,而是学生自己,但被喂了"特权信息"(privileged information, PI)------参考答案、计划、环境反馈。学生看不到 PI,教师能看到。所以教师"不比学生强,只是信息更多"。
  • SDPO(Self-Distillation Policy Optimization,自蒸馏策略优化):2025--2026 出现的一类具体算法,用"模型自己在反馈条件下的预测"作自教师,与 GRPO 等 RL 目标结合。2026 年有大量围绕它的改进(I-SDPO、SRPO、SC-SDPO、OPPO 等)。
  • 特权信息泄漏(privileged information leakage):自蒸馏中,教师因为看到了答案,会把"依赖答案才能得出的捷径"教给学生,而学生测试时没有答案 → 学到虚假关联。这是 OPSD 的头号失败模式。
  • 黑盒蒸馏 vs 白盒蒸馏:白盒能拿到教师 logits(需要权重),可做 token 级分布匹配;黑盒只能拿教师文本(API),只能用序列级/偏好级信号。OPD 的经典形态是白盒,但黑盒 OPD 也在快速演化。

3. 数学骨架:OPD 的三种等价视角

本章给推导。怕公式的读者可以只读每节末尾的"一句话"。

3.1 视角一:在 π_θ 上最小化到 π_T 的散度

OPD 的目标函数最一般地写成一个 fff-散度(fff-divergence)最小化,期望在学生采样的轨迹上求:

min⁡θ Ex∼πθ ∑t=1Td(πT(⋅∣x\ \min_\theta\ \ \mathbb{E}{x\sim\pi\theta}\Big\\ \\sum_{t=1}\^{T} d\\big(\\pi_T(\\cdot\\mid x_{\ θmin Ex∼πθ t=1∑Td(πT(⋅∣x\

其中 d(⋅,⋅)d(\cdot,\cdot)d(⋅,⋅) 是逐 token 的散度(可以是 Reverse KL、Forward KL、skew KL,或它们的加权混合)。注意两件事 :期望下标是 πθ\pi_\thetaπθ(这就是 on-policy 的数学体现);ddd 是可以逐 token 分解的。

3.2 视角二:对数比即奖励------策略梯度视角(完整推导)

这是全文最重要的一段推导。考虑序列级 Reverse KL

L(θ)=KL(πθ∥πT)=Ex∼πθlog⁡πθ(x)−log⁡πT(x) \mathcal{L}(\theta)=\mathrm{KL}(\pi_\theta\|\pi_T)=\mathbb{E}{x\sim\pi\theta}\Big\\log\\pi_\\theta(x)-\\log\\pi_T(x)\\Big L(θ)=KL(πθ∥πT)=Ex∼πθlogπθ(x)−logπT(x)

先把它写成 Ex∼πθgθ(x)\mathbb{E}{x\sim\pi\theta}g_\\theta(x)Ex∼πθgθ(x),其中 gθ(x)=log⁡πθ(x)−log⁡πT(x)g_\theta(x)=\log\pi_\theta(x)-\log\pi_T(x)gθ(x)=logπθ(x)−logπT(x)。利用log-derivative trick(得分函数):

∇θ Ex∼πθgθ(x)=Ex∼πθgθ(x) ∇θlog⁡πθ(x)⏟① 得分项+Ex∼πθ∇θgθ(x)⏟② 直接项 \nabla_\theta\,\mathbb{E}{x\sim\pi\theta}\bigg_\\theta(x)\\big =\underbrace{\mathbb{E}{x\sim\pi\theta}\bigg_\\theta(x)\\,\\nabla_\\theta\\log\\pi_\\theta(x)\\big}{\text{① 得分项}} +\underbrace{\mathbb{E}{x\sim\pi_\theta}\big\\nabla_\\theta g_\\theta(x)\\big}_{\text{② 直接项}} ∇θEx∼πθgθ(x)=① 得分项 Ex∼πθgθ(x)∇θlogπθ(x)+② 直接项 Ex∼πθ∇θgθ(x)

其中 ① 来自"期望的下标也依赖 θ\thetaθ",② 来自"被积函数依赖 θ\thetaθ"。

对第 ② 项:∇θgθ(x)=∇θlog⁡πθ(x)\nabla_\theta g_\theta(x)=\nabla_\theta\log\pi_\theta(x)∇θgθ(x)=∇θlogπθ(x),而 Ex∼πθ∇θlog⁡πθ(x)=0\mathbb{E}{x\sim\pi\theta}\\nabla_\\theta\\log\\pi_\\theta(x)=0Ex∼πθ∇θlogπθ(x)=0(得分函数的期望为零)。

代回并整理符号:

∇θ KL(πθ∥πT)=− Ex∼πθ(log⁡πT(x)πθ(x))⏟奖励 R(x) ∇θlog⁡πθ(x) \boxed{\ \nabla_\theta\,\mathrm{KL}(\pi_\theta\|\pi_T) =-\,\mathbb{E}{x\sim\pi\theta}\Big\\underbrace{\\Big(\\log\\tfrac{\\pi_T(x)}{\\pi_\\theta(x)}\\Big)}_{\\text{奖励 }R(x)}\\,\\nabla_\\theta\\log\\pi_\\theta(x)\\Big\ } ∇θKL(πθ∥πT)=−Ex∼πθ奖励 R(x) (logπθ(x)πT(x))∇θlogπθ(x)

这就是 OPD 的"心脏"。 把它和标准策略梯度 ∇θER(x)=ER(x)∇θlog⁡πθ(x)\nabla_\theta \mathbb{E}R(x)=\mathbb{E}R(x)\\nabla_\\theta\\log\\pi_\\theta(x)∇θER(x)=ER(x)∇θlogπθ(x) 对照:

OPD 精确等价于:用 R(x)=log⁡πT(x)πθ(x)R(x)=\log\frac{\pi_T(x)}{\pi_\theta(x)}R(x)=logπθ(x)πT(x) 当奖励的 on-policy 策略梯度。

由此立刻得到几条工程直觉:

  1. 奖励是"对数概率比":学生认为越可能、教师认为越不可能的 token,惩罚越大(奖励越负)。这天然把学生推向教师偏好的方向。
  2. 奖励无界 :log⁡πTπθ\log\frac{\pi_T}{\pi_\theta}logπθπT 可以趋于 ±∞\pm\infty±∞(当某个 token 学生概率极小而教师概率不小,或反之)。这是 OPD 梯度方差大的数学根源,也是 2026 年"有界奖励"类工作(PowerOPD、TV-OPD、γOPD)的靶点。
  3. 奖励自带基线 :因为奖励含 log⁡πθ(x)\log\pi_\theta(x)logπθ(x),它某种程度自我居中;但在实践中仍需要方差缩减(见 3.3、6.4)。

逐 token 版本 :若把序列拆成 token,log⁡πT(x)=∑tlog⁡πT(xt∣x<t)\log\pi_T(x)=\sum_t\log\pi_T(x_t\mid x_{<t})logπT(x)=∑tlogπT(xt∣x<t),则每个 token 的"即时对数比"为

rt=log⁡πT(xt∣x<t)πθ(xt∣x<t). r_t=\log\frac{\pi_T(x_t\mid x_{<t})}{\pi_\theta(x_t\mid x_{<t})}. rt=logπθ(xt∣x<t)πT(xt∣x<t).

问题随之而来:每个 token 的梯度应该乘上哪个 rrr? 这就是下一节。

一句话:Reverse KL 的梯度 = 以教师/学生对数比为奖励的策略梯度;教师即奖励函数。

3.3 时间信用分配:immediate / prefix / return-to-go / discounted

同一句"用对数比当奖励",能衍生出四种截然不同的估计量,它们之间的取舍是 2026 年前沿的核心议题(公式驱动综述把它称为 temporal credit problem)。

对 token ttt,令 rt=log⁡πT(xt∣x<t)πθ(xt∣x<t)r_{t}=\log\frac{\pi_T(x_t\mid x_{<t})}{\pi_\theta(x_t\mid x_{<t})}rt=logπθ(xt∣x<t)πT(xt∣x<t)。梯度权重主要有四族:

估计量 权重 wtw_twt(乘在 ∇log⁡πθ(xt)\nabla\log\pi_\theta(x_t)∇logπθ(xt) 上) 方差 偏差/视野 直觉
Immediate(token-local) rtr_trt 局部、看不到未来 每个 token 独立纠错,稳定但近视
Prefix(前缀累积) ∑t′≤trt′\sum_{t'\le t} r_{t'}∑t′≤trt′ 惩罚早错 MiniLLM 一族思路
Return-to-go(整段累计) ∑t′≥trt′\sum_{t'\ge t} r_{t'}∑t′≥trt′(或总和对全部 token) 看未来、视野随 TTT 增长 序列级 RKL 的直接估计
Discounted(折扣) ∑k≥0γkrt+k\sum_{k\ge 0}\gamma^{k} r_{t+k}∑k≥0γkrt+k 可控 用 γ\gammaγ 调视野 γOPD:视野无关的方差界

关键 trade-off:token-local 稳定但"看不到未来",序列级能捕捉"未来信用"但方差随序列长度爆掉。2026 年的 γOPD 用折扣因子在两者之间连续插值,并给出"与视野无关的方差上界";公式驱动综述则把 immediate / return-to-go / discounted / baseline-corrected 的偏差边界逐一划出,并提出 GAE-OPD 作为"价值化对数比回报"的假设。

一句话:token 级 OPD 是"局部纠错",序列级 OPD 是"全局信用",折扣/基线是调和二者的旋钮。

3.4 视角三:FKL/RKL 插值与 token 级门控

既然 Forward KL 负责"覆盖"、Reverse KL 负责"收缩",自然可以把两者插值 。GKD(Agarwal et al., ICLR 2024)正是这么做的:它用广义 JSD 在"教师数据/学生数据"和"FKL/RKL"之间连续滑动,一个参数 α\alphaα 同时控制采样混合比散度方向。这是"On-Policy Distillation"作为术语被正式确立的标志性工作之一------它的标题就是《On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes》。

token 粒度 上插值,就是 2025--2026 很热门的 token 级门控(per-token gating)

L=∑tλt KL(πT∥πθ)∣t+(1−λt) KL(πθ∥πT)∣t,λt∈0,1. \mathcal{L}=\sum_t\Big\\lambda_t\\,\\mathrm{KL}\\big(\\pi_T\\\|\\pi_\\theta\\big)\\big\|_t+(1-\\lambda_t)\\,\\mathrm{KL}\\big(\\pi_\\theta\\\|\\pi_T\\big)\\big\|_t\\Big, \qquad \lambda_t\in0,1. L=t∑λtKL(πT∥πθ) t+(1−λt)KL(πθ∥πT) t,λt∈0,1.

  • ToDi(EMNLP 2025 Oral) :用教师-学生概率对数比的 sigmoid 决定 λt\lambda_tλt------当学生低估 某 token(教师概率高)时偏 Forward KL(把它拉上来),当学生高估某 token 时偏 Reverse KL(把它压下去)。梯度分析显示 FKL 抬低估、RKL 压高估,二者互补。
  • EOPD(2026):用熵信号门控。
  • 统一门控族(2026) :用一个四系数参数化 λt=σ(aht+bu(x)+c+d⋅gapt)\lambda_t=\sigma(a h_t+b u(x)+c+d\cdot\text{gap}_t)λt=σ(aht+bu(x)+c+d⋅gapt) 把 EOPD、ToDi 及其多维组合统一为特例,并做受控对比。

一句话:FKL 抬"被低估的正确 token",RKL 压"被高估的错误 token";token 级门控就是按每个 token 的处境动态选边。

3.5 统一控制面板:四个旋钮

把上面所有东西压缩成一台机器。任何 OPD 方法(包括 2026 的最新工作)都可以用这四个旋钮描述:

L(θ)=Ex∼πmix∑twt⏟③信用⋅dλt(πT,πθ)∣t⏟②散度  +  μ Lreward⏟④辅助奖励 \mathcal{L}(\theta)=\mathbb{E}{x\sim \pi{\text{mix}}}\Big\\underbrace{\\sum_t w_t}_{\\text{③信用}}\\cdot\\underbrace{d_{\\lambda_t}\\big(\\pi_T,\\pi_\\theta\\big)\\big\|_t}_{\\text{②散度}}\\Big\;+\;\underbrace{\mu\,\mathcal{L}{\text{reward}}}{\text{④辅助奖励}} L(θ)=Ex∼πmix③信用 t∑wt⋅②散度 dλt(πT,πθ) t+④辅助奖励 μLreward

旋钮 含义 典型取值 代表工作
采样来源 πmix\pi_{\text{mix}}πmix 学生 / 教师 / 混合 / 特权自教师 πθ\pi_\thetaπθ;(1−α)πT+απθ(1-\alpha)\pi_T+\alpha\pi_\theta(1−α)πT+απθ;πθ(⋅∣PI)\pi_\theta(\cdot\mid\text{PI})πθ(⋅∣PI) MiniLLM、GKD、OPSD
散度方向 dλd_{\lambda}dλ FKL / RKL / skew / token 门控 逐 token 动态 λt\lambda_tλt GKD、DistiLLM、ToDi
时间信用 wtw_twt immediate / prefix / return-to-go / discounted 折扣或基线校正 MiniLLM、γOPD、OPPO
辅助奖励 μ\muμ 验证器 / 结果奖励 / 过程奖励 0(纯蒸馏)或小权重 VG-OPD、CEPO、OPPO、REOPOLD

使用说明 :读到任何一篇新论文,先问四个问题------它从哪采样?它和教师比的是什么散度?它怎么分配 token 权重?它有没有加外部奖励?四问之下,论文的定位立刻清晰。这套控制面板是本文对领域的一种原创性整理,也是你面试时能碾压对手的框架。


4. 算法谱系:从 SeqKD 到 SDPO

本章沿时间线走一遍关键方法。每个方法都标注它在 3.5 节"控制面板"上的四个旋钮取值。

4.1 前史:Policy Distillation 与 SeqKD

Policy Distillation(Rusu et al., 2015, arXiv:1511.06295) 是最早在 RL 智能体上做策略蒸馏的工作。它把 DQN 的策略(在状态上对动作的分布)蒸馏进小网络,甚至能把多个任务专用策略融合成一个多任务策略。当时还没人叫它"on-policy distillation",但"用策略自己的状态分布做监督"的思想已经萌芽。

Sequence-Level Knowledge Distillation(SeqKD, Kim & Rush, 2016, arXiv:1606.07947) 把 KD 带到 NMT(神经机器翻译)。它的做法是:用教师 beam search 解码出高质量序列 作为学生的监督目标。这在当时很有效,但注意------数据来自教师,是 off-policy,本质是"在教师生成的整句上做 SFT"。它的两个序列级损失形式(近似 teacher distribution 与 N-best 重排)也第一次让人们意识到"序列级监督"与"词级监督"的差异。

小结:SeqKD 是 OPD 的"负空间"------正是它的 off-policy 本质,暴露了后面所有暴露偏差问题。

4.2 GKD:把"on-policy distillation"正式命名(ICLR 2024)

《On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes》(Agarwal et al., 2023/ICLR 2024, arXiv:2306.13649) 是领域的奠基性工作,也是 OPD 这个术语的正式来源之一。它的贡献有三点:

  1. 诊断:自回归 KD 的根本问题是"训练时见到的序列"与"推理时学生生成的序列"之间的分布不匹配。
  2. 方法 GKD :不再只用固定的教师序列,而是让学生在自己生成的序列 上,接受教师对这些序列的反馈。同时把损失从固定 KL 推广到一族广义散度,允许学生在容量不足时采用更合适的匹配方式。
  3. 可组合性:GKD 可无缝叠加 RLHF,首次明确"蒸馏"与"对齐"可以在同一个 on-policy 循环里统一。

控制面板:①采样来源=学生/混合;②散度=广义 JSD(可在 FKL↔RKL 滑动);③信用=序列/token;④无辅助奖励。

4.3 MiniLLM:Reverse KL + 策略梯度 + 教师混合采样(ICLR 2024)

《MiniLLM: On-Policy Distillation of Large Language Models》(Gu et al., 2023/ICLR 2024, arXiv:2306.08543) 是 OPD 在 LLM 上最经典的方法论论文。它的三块基石:

  1. 用 Reverse KL 替代 Forward KL 。前面 1.4 节已解释:防止学生高估教师分布的低概率区域,这对容量有限的学生尤其重要。
  2. 用策略梯度做 on-policy 优化 。把 RKL 的梯度写成策略梯度(即 3.2 节的恒等式),在学生自己采样的序列上估计。
  3. 教师混合采样 + 长度归一化 + 单步分解。纯学生采样方差大、且学生可能"跑飞"到教师从未覆盖的区域,于是从一个"学生/教师混合分布"里采样,用混合比控制方差与状态覆盖;用长度归一化抵消"长序列奖励被稀释"的偏置;用单步分解降低序列级估计的方差。

实验显示 MiniLLM 相比标准 KD 有更低的暴露偏差、更好的校准(calibration)与长文本生成能力,且在 120M--13B 的多个模型族上可扩展。

控制面板:①学生+教师混合;②Reverse KL;③单步分解/长度归一化;④无。

4.4 DistiLLM:Skew KL + 自适应 off-policy 调度(ICML 2024)

《DistiLLM: Towards Streamlined Distillation for Large Language Models》(Ko et al., 2024, arXiv:2402.03898) 针对两个痛点:

  • 缺少统一目标 :它提出 skew KL 散度,并揭示其理论性质,作为比 FKL/RKL 更"居中"的匹配目标。
  • on-policy 太贵 :学生自采样显著抬高算力。于是设计自适应 off-policy 调度 ------训练早期更多用(可复用的)off-policy 数据,后期逐步转向 on-policy,从而在效果与成本间取得平衡,报告最高 4.3× 加速

控制面板:①学生自采样 + 自适应调度;②skew KL;③token/序列;④无。

4.5 ToDi:token 级 FKL/RKL 动态混合(EMNLP 2025 Oral)

《ToDi: Token-wise Distillation via Fine-Grained Divergence Control》(Jung et al., 2025, arXiv:2505.16297) 用梯度分析证明:Forward KL 抬高被低估的 token,Reverse KL 压制被高估的 token,二者互补。于是用"教师-学生概率对数比的 sigmoid"作为每个 token 的混合权重,动态选择方向。这是 3.4 节 token 门控思想的先行者。

4.6 REOPOLD:把 OPD 显式看成策略优化(2026)

《Scaling Reasoning Efficiently via Relaxed On-Policy Distillation》(Ko et al., 2026, arXiv:2603.11137) 的关键论断是:OPD 可以被理论与实践同时解释为一种策略优化,教师-学生对数似然比就是 token 奖励。 它据此放松了标准 OPD 的严格模仿约束,采用"混合式奖励裁剪 + 基于熵的 token 级动态采样 + 探索到精修(exploration-to-refinement)的统一策略"。结果:比近期 RL 方法样本效率高 6.7--12× ,并让 7B 学生在视觉推理上追平 32B 教师,推理约 3.32× 加速

4.7 SDPO / OPSD:自蒸馏时代(2025--2026)

这是当前最热、也最"卷"的方向。核心思想:不再需要外部教师,把学生自己在"特权信息(答案/计划/环境反馈)"条件下的预测当作自教师。

  • SDPO(Self-Distillation Policy Optimization) :为每条轨迹提供密集 token 级监督;但 2026 年多项工作(SRPO, arXiv:2604.02288;I-SDPO, arXiv:2608.12957)发现它在长训练后期会崩 ------对已经正确的样本继续自蒸馏会引入优化歧义,且自教师的信号可靠性会衰减。SRPO 的对策是"分样本路由":正确样本走 GRPO 的奖励对齐,失败样本走 SDPO 的 logit 级纠错,配合熵感知动态加权。
  • OPSD(On-Policy Self-Distillation) :SDPO 的泛化,教师=带特权信息的学生。OPSD 的头号失败模式是"坍缩" ------推理路径集合逐渐收窄。2026 年 8 月的一篇批判性综述《One Symptom, Three Levers》(arXiv:2608.25936)把它归结为三个杠杆:信号施加在哪里(token 加权)、教师看到什么(特权信息性质)、信号何时变化(教师动态与引导衰减)
  • 有偏教师 :2026 年的《Privileged, but Biased》(arXiv:2608.04794)给出一个冷水结论------当特权信息是一份"具体的参考解"时,自教师的逐 token 目标会被这份解带偏,而不是"普适的正确" ;学生被训练去匹配这份解,其损失大部分落在停用词、标点等低信息 token 上,甚至在正确轨迹内部惩罚"推理所需的犹豫"。在困难任务上,作为单独目标的自蒸馏会出现"训练 loss 稳步下降、验证准确率不升反降"。
  • 有界/自适应目标 :DemoPSD(arXiv:2607.02502)不直接拟合教师全分布,而是让学生靠近一个"Reverse-KL 重心目标 "(教师与学生的加权几何组合),并按 token 处的分布差异自适应混合,理论上同时实现"泄漏衰减"与"探索保持"。VISTA(arXiv:2608.28306)反过来用通过验证的轨迹去微调教师,让师生互相靠近。

控制面板:①学生自采样 + 特权自教师;②Reverse KL 为主,或重心目标;③token 级;④可选结果验证。

4.8 一句话时间线

时间 里程碑 一句话贡献
2015 KD(Hinton) 软标签与暗知识
2015 Policy Distillation RL 策略的状态分布蒸馏
2016 SeqKD 序列级监督,但 off-policy
2023 DPO 免奖励模型的偏好优化,off-policy
2024 GKD 正式命名 OPD,学生自生成 + 教师反馈
2024 MiniLLM Reverse KL + 策略梯度,LLM 上最完整的方法论
2024 DistiLLM skew KL + off-policy 自适应,性价比
2025 ToDi token 级 FKL/RKL 动态门控
2025--2026 SDPO / OPSD 自蒸馏,去掉外部教师
2026 REOPOLD / γOPD / TrOPD / PowerOPD... 稳定化、时间信用、有界奖励、可信区域
2026 VG-OPD / CEPO / OPPO 验证器/结果奖励与蒸馏合流

5. 2026 前沿全景:把最新论文装进一个坐标系

到 2026 年 9 月,arXiv 全库以 "on-policy distillation" 命中的论文已达 488 条 ,其中 2026 年一项就贡献了几十篇。逐篇读既不可能也无必要。本节用 "定位---重分配---稳定---数据---系统"五轴框架把它们归位。每篇只需记住"它拧了哪个旋钮、解决了什么痛点"。

5.0 先看一个能落地的成果,建立体感

在展开之前,先看 2026 年已经"产品化"的证据:

  • SenseNova-U1.5(arXiv:2609.11929) :8B 原生统一多模态模型,把视觉美学、双语文字渲染、信息图生成、图像编辑等多个专家能力通过 multi-expert OPD 合并进一个模型。
  • Miles v0.1(arXiv:2609.08368):生产级后训练系统,原生支持 RL、LoRA、OPD 与 SFT,并在 64 张 GB300 上跑通 744B 模型的异步 agentic RL(中位 step 时间 263 秒)。
  • Video-MOPD-8B(arXiv:2609.09300)Instella-MoE(arXiv:2609.00791)KuaiRP(arXiv:2609.11127):多教师 OPD 已成为"把多个 RL 专家合成一个可部署模型"的标准做法。

结论先行 :OPD 在 2026 年已经从"论文技巧"变成后训练流水线的标准组件。大厂岗位问它,不是问概念,是问你怎么用、怎么稳、怎么省。

5.1 第一轴:定位(Localization)------"该学哪里?"**

问题:学生轨迹里,哪些 token 值得教师纠正? 大部分 token 是格式、模板、填充词,对它们做密集蒸馏不仅浪费算力,还会污染训练(惩罚"探索所需的犹豫")。

  • TrOPD / 信任域 OPD(arXiv:2606.01249) :只在教师能给出可靠监督的区域做 OPD,离群区域改用梯度裁剪、掩码或 Forward KL 估计;并用"教师前缀 + Forward KL"提供 off-policy 引导,把探索推向可靠区域。
  • 近未来引导(arXiv:2606.00305) :发现约 30% 的高损失 token 属于"低散度区"------只是表层表述不同,不是真正的推理分叉。用近未来轨迹信息识别真正的分歧状态,把监督分摊到未来多个 token;在 AIME24/25 上把平均准确率从 47.8% 提到 52.2%。
  • TV-OPD(arXiv:2609.08341) :惊人地发现只保留 token 优势的符号就足以达到标准 OPD 的效果;进一步用全变差(Total Variation)把优势整形为有界、平滑的信号,换来更稳的训练与更好的后期性能。
  • 极稀疏监督(arXiv:2609.04565) :监督少至 0.05% 的 token 就能匹配甚至超过全 token 训练(跨九组师生配置)。
  • 验证器门控多专家(VG-OPD, arXiv:2609.15404) :用"某专家在某个答案标准上的反事实增益"决定谁有资格教哪个 token ,再做 token 级定位与加权;在 7 个科学推理基准上 4B/8B 学生拿下 5 个第一。结论:收益来自监督的精准定位,而非增加教师或损失项。
  • 首错定位(Cliff, arXiv:2609.02817) :用教师定位第一个错误 ,给正确前缀正优势、之后负反馈。这与 STRIDE 的发现互相印证------多轮 agent 中,教师认可的损失在时间上锁定于学生的第一次错误动作,而不是随轮次逐渐累积。

前沿共识 :OPD 的正确姿势正从"全量密集模仿"转向"精准、稀疏、以第一次偏航为锚点的定位式监督"。

5.2 第二轴:重分配(Redistribution)------"概率质量该往哪挪?"**

问题:这是 Reverse KL 最深的结构性缺陷。采样式 RKL 只会说"这个被采到的 token 该涨还是该跌",却没说"腾出来的概率质量应该挪到哪个 token 上"。如果教师偏好的目标 token 学生几乎采不到,纯 on-policy 采样就永远够不着它。

  • RouteOPD / 概率传输(arXiv:2609.08337) :把 OPD 重新表述为受教师引导的概率传输 ------把教师-学生分歧拆成"学生过剩的源 "与"教师亏缺的汇",显式配对,再用有界教师势函数生成成对 log-odds 目标。实验显著优于采样式 RKL,路由保真度更高、背景泄漏更低。
  • 《OPD 真的在蒸馏吗?》(arXiv:2608.31046) :实证发现 OPD 的功劳主要来自压制低概率 token,并提出无监督的 OPSA(熵自适应负优势)来复现甚至超越这种效果。
  • PowerOPD / 有界幂变换(arXiv:2606.17199) :诊断出"对数比奖励无界"导致梯度集中在前几个位置且贯穿训练;用 Box-Cox 幂变换构造原生有界、符号一致 的奖励族(对数比是 α→0\alpha\to0α→0 的退化极限)。在六个数学推理基准上,相比 vanilla OPD 平均提升最高 +6.37,梯度范数小 3000 倍以上。
  • AED / 把 Reverse KL 看成自适应熵蒸馏(arXiv:2608.14685) :把 on-policy RKL 的目标精确分解为"教师拟合项 + 学生熵项" ,证明逐 token 最优学生是教师分布的"退火(tempered)变体",用教师熵动态校准模仿强度------无需显式 FKL 分支。
  • DemoPSD(arXiv:2607.02502):走向"Reverse-KL 重心",即教师与学生的加权几何组合,天然在"学教师"与"保留自身推理"之间平衡。

前沿共识 :单纯的采样式 Reverse KL 是"只会踩刹车、不会打方向"。2026 年的方法几乎都在补上"打方向"(概率重分配)这一半。

5.3 第三轴:稳定(Stabilization)------"怎么不崩?"**

OPD 训练不稳是公认痛点,原因可归为三角:奖励无界(方差)、教师有偏(偏差)、支撑集错配(不可达)

  • γOPD(arXiv:2609.16937) :用折扣时间信用分配统一 token 级与序列级 RKL,兼具长视野监督与稳定优化,并给出"与视野无关"的方差界;再加入"奖励兼容的有界混合(RBM)"把可验证结果反馈与折扣优势结合。
  • Trust Region(TrOPD):见 5.1。
  • TV-OPD / PowerOPD:用有界奖励整形(见 5.2)。
  • 异步与陈旧数据(AsyncOPD, arXiv:2606.24143) :首个系统研究"OPD 数据可以多陈旧"。结论极有工程价值:教师加权的 Forward KL 对陈旧 rollout 更稳,学生加权的 Reverse KL 很脆弱 ;对脆弱的 RKL,与其套用异步 RL 的稳定技巧,不如在学习器端用当前学生重算 RKL 信号 ;有限教师打分缓存会造成偏差-方差权衡,用多样本蒙特卡洛 可保正确性同时降方差。最终吞吐提升 1.6--3.8×
  • 多轮 agentic 加速(STRIDE, arXiv:2609.14636) :自适应早停(累计教师对数概率低于 OOD 阈值就截断)+ 前缀缓存重启,在 τ²-bench retail 上以 3.73× 加速追平全轨迹 OPD。其关键发现(监督集中在每轮前缀、断点锁定在首错)已在前文提到。
  • 离线锚点稳定 RL(ARMOR, arXiv:2607.10481):指出单纯 Reverse KL 正则不足以防止"覆盖不足导致的验证集坍缩",主张主动用参考策略的 off-policy 样本做锚定。
  • 顺序优于联合(arXiv:2609.04108)先 OPD 再 RLVR 的两阶段,胜过 OPD 与 RLVR 的联合训练------前者扩张支撑集,后者在支撑集内锐化。这是一个非常实用、可立即落地的结论。
  • 贝叶斯统一(arXiv:2609.05111):用两步贝叶斯模板把 ICL、SFT、KL 正则 RL 与 OPD 统一为"Gibbs 后验的不同 Forward-KL 投影",为"什么时候该用哪种"提供了原则性答案。
  • 演化上下文(Flux-OPD, arXiv:2607.28022):当监督来自"随学生演化的上下文"时目标会不稳;把上下文条件教师与无条件教师的差异作为"上下文修正信号",用冲突项控制修正强度。

5.4 第四轴:数据与课程(Data & Curriculum)------"到底需要多少数据?"**

这是 2026 年最反直觉、也最能体现"认知跃升"的一组结论:

  • 数据无关性(DF-OPD, arXiv:2609.14193) :OPD 对训练数据近乎无所谓 ------8 条 prompt 就能匹配 17k 题数据集 ;三个难度差几倍的数据集训练曲线几乎重合;把数学换成竞赛编程仍能恢复 90% 以上的域内增益。原因:OPD 的数据单元不是 prompt,而是 prompt 诱导出的"状态";一个 prompt 会随着采样不断暴露新的教师纠正,而新增 prompt 的边际价值在 8 条后崩塌。
  • 只需一条样本(arXiv:2609.04172) :单查询 OPD 通过高状态覆盖即可恢复大部分全数据收益,结论是"OPD 被数据喂撑了,却饿着算法"。
  • 8 条难题就够了(arXiv:2609.05198) :选择困难样本做 OPD,8 条即可匹配 17K 基线。
  • DF-OPD 的极限 :让教师自己出题(无外部数据、无过滤),效果匹配甚至超过真实数据;在多教师场景,1k 条自生成问题能弥补 98.5% 的可达空间。
  • 课程与路由 :DRIFT(arXiv:2606.30345)用难度路由 + 节奏门控,问题级分配"自蒸馏 vs RL"、token 级调控探索;I-SDPO(arXiv:2608.12957)按实例路由------"全错组"才用自蒸馏,"有成功组"交给 GRPO;SC-SDPO(arXiv:2605.27765)用通过率的 p^(1−p^)\sqrt{\hat p(1-\hat p)}p^(1−p^) 加权,形成隐式课程。
  • 轨迹完整性(arXiv:2609.07103):部分或"仅终点"的推理轨迹也够用,终点训练对 RL 与 OPD 都有益。

实践含义 :别再卷数据集规模。把预算花在"状态覆盖率"和"选样/课程"上。

5.5 第五轴:多教师、能力融合与系统(Multi-Teacher & Systems)

  • 多教师 OPD 成为标准:VG-OPD、Video-MOPD、Flow3D-OPD、SenseNova-U1.5、Instella-MoE、MT-SDPO(arXiv:2609.02548,"答案验证决定谁教,而非域标签")等,把"每个领域一个 RL 专家 → OPD 合成一个可部署学生"作为标准流水线。
  • 能力组合:Lightning Weave(arXiv:2609.14708)把"后训练带来的策略位移"抽取并组合进单一学生,改善精度-效率前沿。
  • 领域专精且不遗忘 :KuaiRP 用"领域模型当教师、原始基座当学生"的两阶段 OPD + 累积散度衰减(CDD),在注入领域知识的同时恢复通用能力;Uncertainty-Calibrated MOPD(arXiv:2608.26735)用温度采样与背书过滤保留通用能力。
  • 跨家族蒸馏 :CompassOPD(arXiv:2609.10154)发现跨模型族 OPD 会因 tokenizer/嵌入偏移而失效,于是去掉跨族偏移、只迁移族内似然位移,最高 +5.50 分。
  • 模态扩展:多模态(OPD-Aha 的"视觉反思"、MIRROR)、长视频(Video-OPSD、Clue-OPSD)、语音(JO-OPD 把 S2T 强策略蒸馏进 S2TS 联合生成)、扩散/流匹配(TOPD、AdaFlash、Self-OPD)、脉冲网络(SpikeOPD)、安全(SafeSteer、Constitutional OPD)。
  • 系统效率:Miles、AsyncOPD、STRIDE(见 5.3)。

5.6 前沿判断汇总(写给你的"要点卡")

  1. OPD 已工程化:2026 年的关键词是"生产、融合、稳定",不再是"证明能比 SFT 好"。
  2. 瓶颈从数据转到算法与信用分配:数据近乎免费,方向与定位才是胜负手。
  3. 纯自蒸馏作为单独目标不可靠:需要验证器、结果奖励或与 RL 分阶段配合(前沿判断)。
  4. 两阶段 OPD→RL 往往优于联合(前沿判断,已被多篇独立复现方向性一致)。
  5. 有界奖励 + 精准定位 + 概率重分配是当前公认的三大稳定手段。
  6. 异步化是必然:但要区分 FKL(耐陈旧)与 RKL(需重算)。
  7. OPD 与 RL 的边界正在消失:教师即奖励,验证器即教师,"蒸馏"越来越像"带稠密奖励的 on-policy RL"。

6. 工程实战:一个可复现的 OPD Recipe

本章是"能直接照着做"的部分。假定你有一个白盒教师 πT\pi_TπT(如 32B)和一个学生 πθ\pi_\thetaπθ(如 7B),要把教师的推理能力迁到学生,并部署。

6.1 训练循环:五步

  1. 采样(Rollout) :给一批 prompt,用当前学生生成一条或多条回答;记录 token id 与生成时的对数概率(用于诊断,不一定用于梯度)。
  2. 教师打分(Scoring) :把(prompt, 学生回答)一起喂给教师,取教师对回答部分每个 token 的对数概率。关键:prompt 部分不参与损失。
  3. 计算损失(Loss):按 3.5 节控制面板选择散度/信用/权重。可以只用被采样 token 的蒙特卡洛估计(省显存),也可以算全词表的精确 RKL(更准但更贵)。
  4. 可选验证(Verification):用规则/验证器/奖励模型给整条轨迹打结果分,作为辅助项(第四旋钮)。
  5. 更新(Update):反向传播、梯度裁剪、优化器 step。定期刷新 rollout 以维持 on-policy。

6.2 三种损失估计量(附代码)

① 精确全词表 Reverse KL(贵,但它是"真值")

对每个回答位置 ttt,令学生分布 p=softmax(zθ)p=\mathrm{softmax}(z_\theta)p=softmax(zθ)、教师分布 q=softmax(zT)q=\mathrm{softmax}(z_T)q=softmax(zT):

LRKLfull=∑t∑v∈Vpv(log⁡pv−log⁡qv)⏟KL(p∥q) \mathcal{L}{\text{RKL}}^{\text{full}}=\sum_t \underbrace{\sum{v\in\mathcal V} p_v\big(\log p_v-\log q_v\big)}_{\mathrm{KL}(p\|q)} LRKLfull=t∑KL(p∥q) v∈V∑pv(logpv−logqv)

python 复制代码
import torch, torch.nn.functional as F

def full_vocab_rkl(student_logits, teacher_logits, mask):
    # student_logits, teacher_logits: [B, T, V]
    log_p = F.log_softmax(student_logits, dim=-1)
    p     = log_p.exp()
    log_q = F.log_softmax(teacher_logits, dim=-1)
    rkl   = (p * (log_p - log_q)).sum(-1)          # [B, T]
    return (rkl * mask).sum() / mask.sum().clamp_min(1)

② 采样 token 的蒙特卡洛估计(省显存,是策略梯度)

只用被采样的 token,得到的是 3.2 节策略梯度的无偏单样本估计:

LRKLMC=∑t(log⁡pθ(xt)−log⁡pT(xt))⏟stop-grad 的对数比⋅log⁡pθ(xt) \mathcal{L}{\text{RKL}}^{\text{MC}}=\sum_t \underbrace{\big(\log p\theta(x_t)-\log p_T(x_t)\big)}{\text{stop-grad 的对数比}}\cdot\log p\theta(x_t) LRKLMC=t∑stop-grad 的对数比 (logpθ(xt)−logpT(xt))⋅logpθ(xt)

python 复制代码
def sampled_rkl_pg(student_logp, teacher_logp, mask):
    # student_logp, teacher_logp: [B, T](被采样 token 的对数概率)
    log_ratio = (student_logp - teacher_logp).detach()   # 优势/负奖励,务必 detach
    loss = (log_ratio * student_logp * mask).sum() / mask.sum().clamp_min(1)
    return loss

为什么 detach 对数比? 因为我们要的是 ∇θKL=E (log⁡pθ−log⁡pT)∇θlog⁡pθ \nabla_\theta \mathrm{KL}=\mathbb{E}\\,(\\log p_\\theta-\\log p_T)\\nabla_\\theta\\log p_\\theta\\,∇θKL=E(logpθ−logpT)∇θlogpθ。若不对对数比 detach,你算的会是另一个函数(含"直接项"的额外路径),梯度不再等于 RKL 的梯度。这是 OPD 实现中最常见、也最隐蔽的 bug。

③ token 级门控的 FKL/RKL 混合(ToDi 风格)

python 复制代码
def gated_mix(student_logits, teacher_logits, mask, T=2.0):
    log_p = F.log_softmax(student_logits/T, dim=-1)
    p     = log_p.exp()
    log_q = F.log_softmax(teacher_logits/T, dim=-1)
    q     = log_q.exp()
    # 逐 token 的对数比 -> sigmoid 门控
    ratio = (q / p.clamp_min(1e-8)).clamp(1e-6, 1e6)      # 近似教师/学生
    lam   = torch.sigmoid(ratio.log())                      # [B,T] 逐 token 权重
    fkl = (q * (log_q - log_p)).sum(-1)                     # 抬低估
    rkl = (p * (log_p - log_q)).sum(-1)                     # 压高估
    loss = lam * fkl + (1 - lam) * rkl
    return (loss * mask).sum() / mask.sum().clamp_min(1)

工程提醒 :真实实现里"逐 token 对数比"应取被采样 token 的 log⁡pT(xt)pθ(xt)\log\frac{p_T(x_t)}{p_\theta(x_t)}logpθ(xt)pT(xt)(与采样一致),上面的全词表近似仅用于展示门控形态。生产代码请参考 ToDi/统一门控族的定义。

6.3 显存与吞吐优化清单

  • 只存回答 token 的对数概率,不要缓存全词表 logits。
  • prompt 掩码:损失只在 completion 上计算。
  • 教师打分缓存 :教师前向昂贵,尤其是异步设定。但缓存有限会引入偏差-方差权衡------AsyncOPD 建议用多样本蒙特卡洛来兼顾正确性与方差。
  • 混合精度 + 梯度检查点:教师通常冻结,可低精度前向。
  • 采样引擎与训练引擎分离:用 vLLM/SGLang 做 rollout,训练用 FSDP/Megatron。Miles 就是这种分层架构(rollout=SGLang,trainer=FSDP/Megatron,三种权重同步传输)。
  • 批次长度均衡:长回答会主导显存与方差,配合长度归一化。

6.4 稳定化清单(按优先级)

优先级 手段 针对 代表
P0 对数比 detach(策略梯度估计时) 实现正确性 3.2
P0 长度归一化 长度偏差 MiniLLM
P0 监控"训练 loss↓ / 验证 acc↓"背离 有偏教师/PI 偏差 2608.04794
P1 有界奖励(幂变换/TV/裁剪) 方差爆炸 PowerOPD、TV-OPD
P1 token 门控/掩码(不可靠区域不算) 噪声监督 TrOPD、VG-OPD
P1 梯度裁剪 + 小学习率 训练不稳 通用
P2 教师混合采样 状态覆盖 + 方差 MiniLLM
P2 off-policy 锚点/正则 覆盖不足、验证坍缩 ARMOR
P2 分阶段:先 OPD 再 RL 支撑集扩张后锐化 2609.04108
P3 异步 + 学习者端重算 RKL 系统吞吐 AsyncOPD
P3 早停/前缀缓存 rollout 成本 STRIDE

6.5 超参数起点

参数 建议起点 说明
学习率 5×10−6∼2×10−55\times10^{-6}\sim2\times10^{-5}5×10−6∼2×10−5(全参) 比 SFT 更小;OPD 梯度尺度大
温度 TTT 1.0(生成)/ 2.0(软目标) 软目标可升温,采样别太热
散度方向 早期偏 FKL/门控,后期偏 RKL 或直接用 token 门控
教师混合比 α\alphaα 0.0→0.2 递增(学生占比) 纯学生方差大
折扣 γ\gammaγ(若用) 0.9--0.99 γOPD 建议配合方差界调
奖励裁剪 对数比截断到 −5,5-5,5−5,5 或用幂变换
全局批 token 随显存,尽量大 降方差
每 prompt 采样数 4--16 覆盖状态 + 估计基线
辅助奖励权重 μ\muμ 0.0--0.3 有验证器时再加

6.6 怎么评测"蒸馏是否成功"

不要只看一个 benchmark。OPD 的收益最常体现在分布层面,所以至少测六件事:

  1. 暴露偏差:teacher-forced 困惑度 vs 自由生成困惑度的差距(gap 越小越好)。
  2. 校准:ECE / Brier,看置信度是否可靠(MiniLLM 明确报告更好的校准)。
  3. 长文本 / 长链:长度拉长后性能衰减曲线。
  4. 推理指标:pass@k(多样性)、avg@k(平均正确率)、maj@k(多数投票)。
  5. 分布外泛化:跨域、跨难度、跨模态。
  6. 能力保留:域专精后通用基准是否掉点(对齐税 / 灾难性遗忘)。
  7. 成本:生成 token 数、教师前向次数、wall-clock、显存、加速比。

6.7 一页伪代码

复制代码
for step in range(total_steps):
    prompts = sample_prompts(dataset)                    # 小数据集也够(见 5.4)
    with no_grad():
        responses, _ = student.generate(prompts, n=K)    # 学生自采样,K 条/题
        teacher_logp = teacher.score(prompts, responses) # 教师对回答逐 token 打分
    student_logp = student.score(prompts, responses)     # 带梯度重算
    mask = completion_mask(responses)

    # 旋钮①采样来源:可对部分 batch 用教师前缀/混合
    # 旋钮②散度:RKL / FKL / 门控混合
    loss = sampled_rkl_pg(student_logp, teacher_logp, mask)

    # 旋钮③信用:可选折扣/前缀/基线
    # 旋钮④辅助奖励:有验证器时加结果奖励
    if verifier is not None:
        r = verifier(prompts, responses)
        loss = loss + mu * (-r).mean()

    loss.backward()
    clip_grad_norm_(student.parameters(), 1.0)
    optimizer.step(); optimizer.zero_grad()

    if step % eval_every == 0:
        check(loss_down_but_acc_down)   # 关键健康检查

7. 深入思考:为什么有效、何时失效、边界在哪

本章是全文的"含金量核"。面试拉开差距的,正是这里。

7.1 暴露偏差的机制,以及 OPD 到底修好了什么

经典解释(模仿学习理论) :设每条轨迹有 TTT 步。在"专家前缀"上训练的策略,其错误率会触发"走出专家状态分布";一旦离开,策略进入未见过的状态,错误继续累积。在强假设下(如 DAgger/Ross 2011 一脉的分析),这种复合误差随 TTT 呈二次增长 ;而在学习者自身状态分布上接受纠正,可把增长降为线性。2026 年的 OPD 综述也明确引用了"exposure bias 大致随序列长度的平方增长"这一结论。

更精确的机制(我建议你这样理解) :定义"可恢复集" R\mathcal RR------学生犯错后仍能自行回到正确答案的那些前缀。Off-policy SFT 只在 R\mathcal RR 的"干净侧"训练,学生从未见过 R\mathcal RR 的"脏侧";OPD 用学生自己的脏前缀做训练,直接把 R\mathcal RR 的脏侧纳入训练分布 。所以 OPD 修好的不是"知识",而是"从错误状态里恢复的能力"。

一个必须警惕的推论 :如果任务根本不需要"恢复"(比如短分类、格式转换、单步抽取),OPD 相对 SFT 的增益会很小,却要付出自采样的成本。这就是第 8 章决策树的依据。

7.2 支撑集问题:Reverse KL 最深的结构性缺陷

这是本文最想让资深读者记住的一点。

Reverse KL 的梯度权重是奖励 × 得分函数 ,而得分函数 ∇θlog⁡πθ(xt)\nabla_\theta\log\pi_\theta(x_t)∇θlogπθ(xt) 只对被采样的 token 非零。这意味着:

采样式 Reverse KL 只能"重新加权学生已经会采样的 token",无法主动把概率质量"指派"给学生几乎采不到、但教师偏好的 token。

用开车打比方:Reverse KL 是一个只会踩刹车、不会打方向的教练。它能告诉你"刚才那个弯不该踩油门"(压低高估 token),但如果你压根没往正确方向打过方向盘,它没法教你"该打多少度"。

形式化地,若教师的最优 token KaTeX parse error: Undefined control sequence: \* at position 3: v^\̲*̲ 落在学生支撑集之外(KaTeX parse error: Undefined control sequence: \* at position 14: \pi_\theta(v^\̲*̲)\approx0),单样本 MC 估计对该 token 的信用为零,学生需要极长时间/极多探索才可能采样到它并得到纠正。这导致三个后果:

  1. 收敛慢:需要大量 on-policy 探索才能覆盖教师偏好的区域。
  2. 可能负迁移:若学生在错误模式上"自信",RKL 会进一步锐化它(熵坍缩)。
  3. 对初始策略敏感:好初始化的学生(如已在正确支撑集附近)受益大,差初始化几乎学不动。

这正是 2026 年"概率重分配 / 路由 "类工作(RouteOPD、CR-OPD)的动机:把"抑制学生过剩的源"和"填充教师亏缺的汇"显式配对,相当于给教练补上"打方向"的能力。而 TrOPD 用"教师前缀 + FKL"把学生先引导到可靠区域,也是同一思路。

面试加分句式:"OPD 的收益来自在自身状态分布上的纠错,但它的结构性弱点是支撑集------Reverse KL 只能抑制学生已采到的错误,不能主动把质量搬到未采到的教师偏好上;这也是 2026 年概率路由与教师前缀引导类工作的核心动机。"

7.3 有偏教师与特权信息泄漏

OPD 成立的一个隐含前提是"教师是对的"。现实里这个前提经常不成立:

  • 教师本身会错:在困难任务上,教师的"高置信错误"会被密集地灌给学生。
  • 特权信息偏差(PI bias) :自蒸馏中,教师看到了一份具体的参考解 ,于是它的逐 token 目标被这份解"锚定",而非指向"普适正确"。2026 年《Privileged, but Biased》(arXiv:2608.04794)量化了这一点:损失大量落在停用词、标点、不确定性词上,而在正确轨迹内部,探索性 token 反而损失最高------相当于惩罚了"推理所需的犹豫"。
  • 特权信息泄漏:教师因看到答案而走"捷径",学生学到"依赖答案才能得出的关联",测试时没有答案 → 学到虚假信号。DemoPSD(arXiv:2607.02502)、AMVL 等用"泄漏衰减 / 反 KL 正则"来抑制。

判别信号训练 loss 稳步下降,验证准确率不升反降。一旦看到这个背离,立刻怀疑"教师在教不可迁移的东西",而不是继续调学习率。

7.4 多样性坍缩:mode-seeking 的代价

Reverse KL 是 mode-seeking,它会主动收窄 分布。对需要多解的任务(开放对话、创意、多路径推理),这会导致熵坍缩:模型越来越只会一种说法/一种解法。OPSD 领域的批判性综述《One Symptom, Three Levers》(arXiv:2608.25936)把"坍缩"当成整个领域的头号症状,沿三个杠杆组织全文献:

  1. 信号施加在哪里(token 加权)------全量密集监督会惩罚探索;
  2. 教师看到什么(特权信息性质)------越具体越容易带偏;
  3. 信号何时变化(教师动态与引导衰减)------固定教师会随时间失配,需要"累积散度衰减(CDD)"之类的调度(KuaiRP)。

连续后训练场景更危险:《Denser ≠ Better》(arXiv:2607.01763)发现,越密集的自蒸馏漂移越大,甚至会通过"师生自增强回路"放大高频格式伪影,导致灾难性遗忘;相比之下 GRPO 更保守、更能保住旧能力。

实践结论不要默认"越密集的 OPD 越好"。 稀疏、定位、加负优势、按能力路由的监督往往既高效又不易坍缩。

7.5 OPD 与 RL 的统一:边界正在消失

把 3.2 的恒等式放在心口:OPD = 以教师对数比为奖励的 on-policy 策略梯度。 由此可推出三条深刻的推论:

  1. 教师即奖励函数。RLHF 用人类偏好训练奖励模型;OPD 直接拿教师当奖励。OPD 是"免人类、免奖励模型的稠密 RL"。
  2. OPD 是 KL 约束 RL 的特例 。带 KL 正则的 RL 目标 Er−β KL(πθ∥πref)\mathbb{E}r-\beta\,\mathrm{KL}(\pi_\theta\|\pi_{\text{ref}})Er−βKL(πθ∥πref) 在"奖励 = 教师对数比、πref=πT\pi_{\text{ref}}=\pi_Tπref=πT"时退化到 OPD。2026 年综述(arXiv:2604.00626)与 OPPO(arXiv:2605.21851,把 oracle 信号解释为贝叶斯信念更新,OPD 奖励是其严格特例)都论证了这一点。
  3. 与 DPO 的关系 :DPO 用偏好对做off-policy 的隐式奖励优化;OPD 用教师对数比做on-policy 的显式稠密奖励。二者是"off-policy 偏好"与"on-policy 分布匹配"的对偶。

2026 的实际融合形态

  • RL 先,OPD 后(多教师融合):各领域用 RL 练出专家 → OPD 合成一个学生(VG-OPD、Video-MOPD、MT-SDPO)。
  • OPD 先,RL 后:OPD 扩张支撑集,RLVR 在支撑集内锐化(arXiv:2609.04108,两阶段优于联合)。
  • RL 与 OPD 同循环:验证器门控决定用哪条路(RA-OPD、I-SDPO、SRPO、CEPO)。
  • 教师被学生反向修正:VISTA、DualOPSD 让教师也朝学生移动,避免"师生失配"。

前沿判断 :未来 1--2 年,学术界很可能会放弃"蒸馏 vs RL"的二分法,转而讨论"在什么状态上、用什么样的稠密信号、以什么信用分配去更新策略"------这正是本文 3.5 节控制面板的语言。

7.6 数据无关性:一个需要重新理解的概念

2026 年最反直觉的结论是 OPD"几乎不挑数据":8 条 prompt ≈ 17k 数据集;一条样本恢复大部分收益;0.05% 的 token 监督就够。怎么理解?

因为 OPD 的数据单元不是 prompt,而是 prompt 诱导出的状态。 同一个 prompt,随学生策略演化,会不断暴露新的"教师纠正"------今天学生在这里犯错,明天在别处犯错。所以:

  • prompt 的边际价值很快饱和(DF-OPD 发现 8 条后崩塌);
  • 状态的覆盖才是关键(一条 prompt 反复采样即可产生大量状态);
  • 难度比数量重要(选难题、选"学生做错"的题,信号更强);
  • 教师可以自己出题(DF-OPD 让教师生成问题,效果匹配真实数据)。

实践含义 :把数据集当"状态发生器"而非"知识清单"。宁可用少量难题 + 大采样数 + 好课程,也不要海量简单题 + 单采样。

7.7 理论边界与开放问题

  • 蒸馏的 scaling law 尚未建立:学生多大、教师多强、任务多难时 OPD 的收益/成本最优?目前都是零散实证。
  • 样本复杂度:on-policy 采样的理论代价 vs off-policy 的偏差,界还很松。
  • "何时 OPD 可证优于 SFT":需要分布漂移与容量差距的形式化条件。
  • 不确定性感知反馈:教师该在"自己也不确定"的地方沉默,如何度量?
  • agent 级蒸馏:多轮工具调用、环境交互下的信用分配(STRIDE、SSPO 是早期探索)。
  • 评估危机 :大量新方法在少量基准上单种子对比,"比 baseline 好 0.5 分"的统计显著性常常不足(甚至 2026 年有论文自我声明"探索性、非独立假设检验")。读论文时务必看种子数和置信区间。

8. 选型决策树与反模式

8.1 什么时候该用 OPD

复制代码
需要把能力迁到更小的可部署模型?
├─ 任务是短任务/格式转换/单步抽取?
│   └─ 用 off-policy SFT/KD。OPD 收益小、成本高。
├─ 任务是长链推理/多轮 agent/需要"纠错恢复"?
│   ├─ 有白盒教师 logits?
│   │   ├─ 学生容量明显小于教师?
│   │   │   └─ 用 Reverse KL 为主的 OPD(MiniLLM 范式)+ 定位/门控。
│   │   └─ 学生容量接近教师?
│   │       └─ 用 FKL/RKL 门控或 skew KL(ToDi/DistiLLM)。
│   └─ 只有黑盒教师(API)?
│       └─ 用"学生自采样 + 教师评判/验证 + 偏好或 RL"(on-policy 数据 + off-policy/RL 目标)。
├─ 有验证器/规则奖励?
│   └─ 上"OPD + 验证器门控"或"先 OPD 再 RL"(VG-OPD / 两阶段范式)。
├─ 需要合并多个领域专家?
│   └─ 多教师 OPD(MOPD),并用答案验证决定"谁教哪个 token"。
└─ 需要在专精时保住通用能力?
    └─ 用"领域模型当教师、基座当学生"的自蒸馏 + 散度衰减(CDD 类)。

8.2 什么时候该用 OPD

  1. 只想注入知识/格式:SFT 更快、更稳、更便宜。OPD 解决的是"状态分布匹配",不是"知识写入"。
  2. 教师不可靠:密集蒸馏会把教师的错误高保真地刻进学生。宁可不蒸。
  3. 任务只需单解、且要求创造性多样性:纯 Reverse KL 会坍缩。此时应保留熵正则、混 FKL、或干脆用 RL。
  4. 算力/时延极度受限:on-policy 自采样 + 教师前向是显著开销。off-policy KD 的性价比更高。
  5. 黑盒且无 logits、又无验证器:OPD 的优势几乎无法施展,退化为普通 SFT/偏好优化。

8.3 七个反模式(面试与实战都会考)

  1. 把"用强模型输出做 SFT"叫成 OPD 。R1 蒸馏到 Qwen 的经典做法是 off-policy SeqKD/SFT,不是 OPD。混淆概念是硬伤。
  2. 对数比不 detach(或 detach 错对象)→ 梯度不再是 KL 梯度。
  3. 全 token 均匀蒸馏:把损失浪费在格式词上,甚至惩罚探索。
  4. 忽略长度归一化:长回答的奖励被稀释,训练偏向短/长某一侧。
  5. 只看训练 loss:有偏教师下 loss 下降但能力下降,必须看验证集与分布指标。
  6. 域专精不做能力保留:领域 OPD 后通用能力崩掉(对齐税),需要 CDD/不确定性校准/自蒸馏回补。
  7. 盲目追"最新方法":很多 2026 改进是"限定场景的小改进"。先建立强 baseline(MiniLLM/GKD 范式 + 门控 + 有界奖励),再谈花活。

9. 大厂面试真题与答题框架(求职向)

题目按难度分三级。每题给出"面试官想听什么"(考点)、"标准回答骨架"、"加分点"。建议自己先合上文档口述一遍。

9.1 入门级(必须秒答)

Q1. 什么是 On-Policy Distillation?它和普通知识蒸馏的区别是什么?

  • 考点:是否抓住"数据从哪来"。
  • 骨架 :普通 KD 在固定的教师/人类数据上做分布匹配(off-policy);OPD 让学生自己生成轨迹 ,教师在这些学生轨迹 上给出反馈,训练分布跟随学生当前策略 πθ\pi_\thetaπθ。
  • 加分点:指出 Reverse KL 天然 on-policy、Forward KL 天然 off-policy;点出"on-policy 指采样分布,不等于实时数据"。

Q2. 为什么 LLM 蒸馏更推荐 Reverse KL 而不是 Forward KL?

  • 骨架:Forward KL 是 mass-covering,会逼学生覆盖教师全部非零概率,包括学生容量根本表示不了的长尾,导致"样样稀松";Reverse KL 是 mode-seeking,让学生收缩到教师支撑集内、专精于教师最确定的模式。
  • 加分点:提到 MiniLLM 的"防止学生高估教师低概率区域";同时主动说出 Reverse KL 的代价------多样性/熵坍缩。

Q3. 什么是暴露偏差(exposure bias)?

  • 骨架:训练时学生见教师干净前缀,推理时用自己生成的前缀;一旦偏离,后续进入训练未覆盖状态,错误复合累积,累积误差随长度近似二次增长(经典模仿学习结论)。
  • 加分点 :给出"可恢复集 R\mathcal RR"的视角------OPD 把错误的脏前缀纳入训练分布,直接训练"纠错恢复"能力。

9.2 进阶级(区分度所在)

Q4. 写出 OPD(Reverse KL)的梯度,并说明它和策略梯度的关系。

  • 骨架
    ∇θKL(πθ∥πT)=− Ex∼πθlog⁡πT(x)πθ(x) ∇θlog⁡πθ(x)\nabla_\theta \mathrm{KL}(\pi_\theta\|\pi_T)=-\,\mathbb{E}{x\sim\pi\theta}\big\\log\\frac{\\pi_T(x)}{\\pi_\\theta(x)}\\,\\nabla_\\theta\\log\\pi_\\theta(x)\\big∇θKL(πθ∥πT)=−Ex∼πθlogπθ(x)πT(x)∇θlogπθ(x)
    即:把教师-学生对数比当奖励的策略梯度。教师就是奖励函数。
  • 加分点 :现场推导(log-derivative trick + 得分函数期望为零),或指出 token 级 rtr_trt 与序列级的关系。

Q5. 实现时为什么必须对"对数比"做 stop-gradient(detach)?

  • 骨架 :策略梯度估计量里,对数比是"优势/奖励",只作为标量权重;用 PyTorch 的 .detach()no_grad 得到。若让它参与反向传播,你算的就不是 KL 的梯度,会引入"直接项"的额外路径。
  • 加分点 :说明"得分函数期望为零"这一步在数学上抵消了直接项,但这只在"奖励被当成不依赖 θ\thetaθ 的常量"时成立。

Q6. OPD 的 loss 一直降,但验证集准确率不升反降,怎么排查?

  • 骨架 :优先怀疑有偏教师/特权信息泄漏------教师在教"不可迁移的捷径"(参考解偏差、答案依赖)。检查:损失是否集中在停用词/标点;教师在该任务上是否可靠;是否用了具体参考解当特权信息。
  • 加分点:提出对策------限制特权信息粒度(只给计划/证据而非完整答案,如 Evidence Anchors)、用验证过的轨迹修正教师(VISTA)、走向重心/有界目标(DemoPSD/PowerOPD)。

Q7. OPD 训练不稳定,梯度方差很大,有哪些手段?

  • 骨架 :①有界奖励 (对数比截断 / 幂变换 / TV 整形);②token 门控或掩码 ,只在教师可靠区域学习;③梯度裁剪 + 小学习率 ;④教师混合采样 ;⑤长度归一化 ;⑥折扣/基线做时间信用分配。
  • 加分点:说清"奖励无界"是方差根源;引入信任域(TrOPD)与自适应熵蒸馏(AED)的思想。

Q8. OPD 和 DPO / RLHF 有什么关系?

  • 骨架 :三者都在做"策略对齐",但信号与数据不同。DPO 用偏好对、off-policy 、隐式奖励;RLHF 用奖励模型 + PPO、on-policy;OPD 用教师对数比当稠密奖励、on-policy。
  • 加分点:指出 OPD 是"带 KL 约束 RL 的特例"(奖励=教师对数比,参考策略=教师),并提到 OPSD 用验证器/结果奖励后已与 RL 融合。

Q9. OPSD / SDPO 是什么?为什么说"教师不比学生强只是信息更多"?

  • 骨架 :自蒸馏------教师是学生自己在特权信息(答案/计划/环境反馈)条件下的副本;测试时学生看不到特权信息,所以教师"更准"而非"更大"。
  • 加分点:说出 OPSD 的头号问题(坍缩)与三个杠杆(信号施加位置 / 特权信息性质 / 引导何时衰减),以及 SDPO 后期崩溃、需要分样本路由(SRPO)。

9.3 高阶级(研究/系统设计)

Q10. OPD 的结构性局限是什么?("踩刹车不打方向")

  • 骨架 :采样式 Reverse KL 只对被采样 token 有梯度,只能重新加权学生已会采样的 token,无法主动把概率质量指派到教师偏好但学生几乎采不到的 token(支撑集问题)。后果:收敛慢、对初始化敏感、可能锐化错误模式。
  • 加分点:说出 2026 的解法方向------概率传输/路由(RouteOPD 显式配对"学生过剩源"与"教师亏缺汇")、教师前缀 + FKL 引导探索(TrOPD)、探索式采样。

Q11. OPD 到底需要多少数据?为什么?

  • 骨架 :出乎意料地少------8 条 prompt 可匹配 17k 数据集,一条样本恢复大部分收益,稀疏到 0.05% 的 token 监督就够。原因是数据单元是状态而非 prompt:一个 prompt 随采样不断产生新状态。
  • 加分点:因此应投资"状态覆盖 + 难度选样 + 课程",而非数据集规模;教师甚至能自己出题(DF-OPD)。

Q12. 为什么"先 OPD 再 RL"往往优于"OPD 与 RL 联合"?

  • 骨架 :OPD 扩张策略的支撑集 (让学生能采到更多正确模式),RLVR 在支撑集内锐化(提升正确模式的概率)。两阶段各司其职;联合训练会互相干扰。
  • 加分点:联系"OPD 只会刹车不会打方向",RL 补上了探索与锐化。

Q13. 多教师 OPD 怎么把多个领域专家合成一个模型?

  • 骨架 :各领域先 RL 出专家;再让学生自采样,按 token/样本把专家的反馈合成。关键在"谁教哪个 token"------按答案验证(MT-SDPO)、按反事实增益(VG-OPD)决定教师资格,而非简单按域标签路由。
  • 加分点:提醒域内专家"平均正确"不等于"某样本正确",必须逐样本验证可靠性("让对的教,而不是让对口的教")。

Q14. 系统设计:把 32B 推理模型蒸到 7B,要求可部署、质量接近、成本可控。请给出方案。

  • 骨架
    1. 目标与评测:定义 avg@k/pass@k、长链衰减、校准、通用能力保留。
    2. 教师与数据:白盒 32B;少量难题(8--1000 条)+ 每题大采样,最大化状态覆盖;教师可自出题。
    3. 训练:MiniLLM 范式(Reverse KL + 教师混合采样 + 长度归一化)为基线;加 token 门控(ToDi/EOPD)与有界奖励(PowerOPD/TV);只在可靠区域学习(TrOPD)。
    4. 两阶段:先 OPD 扩支撑,再用可验证奖励做 RL 锐化。
    5. 系统:rollout 用 vLLM/SGLang,训练用 FSDP/Megatron,异步并处理陈旧数据(FKL 耐陈旧;RKL 在学习器端重算 + 多样本 MC)。
    6. 监控:训练/验证背离、熵、长度、截断率;早期停止与回滚。
    7. 部署:合并/量化/投机解码;必要时用蒸馏出的草稿模型做投机(AdaFlash 类)。
  • 加分点:主动谈成本(教师前向、生成 token、wall-clock)与风险(坍缩、遗忘、统计显著性)。

Q15. 代码题:用 PyTorch 写 Reverse KL 的 on-policy 策略梯度损失,并解释每行。

  • 骨架 :见 6.2 节 sampled_rkl_pg。要点:对数比 detach;只在 completion 上计算;按有效 token 数归一化。
  • 加分点 :主动区分"采样式 MC(省显存、高方差)"与"全词表精确 RKL(准、贵)";指出 log(softmax)log_softmax 数值更稳。

Q16. 场景题:SFT 之后模型在长思维链上反而变差,怎么诊断与解决?

  • 骨架:诊断为暴露偏差------长链下错误复合。解决:转到 OPD,让学生在自己(含错误)的前缀上接受教师纠正;加 token 定位与稀疏监督、首错锚点(Cliff/STRIDE);必要时两阶段 OPD→RL。
  • 加分点:提示"如果任务不需要恢复能力,OPD 收益有限"------会先确认任务性质。

9.4 一句话"面试官潜台词"清单

面试官问 潜台词 你要点的关键词
为什么 reverse KL 你是否理解散度方向的物理意义 mode-seeking / 容量差距
数据要多少 你是否懂"状态 vs prompt" state coverage / 8 条够
怎么稳定 你是否做过真实训练 有界奖励 / 门控 / 首错锚
和 RL 区别 你是否跟得上 2026 教师即奖励 / 两阶段优于联合
怎么评测 你是否只会看 acc 暴露偏差 / 校准 / 长链 / 熵

10. 高频 FAQ(GEO 问答区)

问:On-Policy Distillation 和 Off-Policy Distillation 最本质的区别是什么?

答:区别在训练数据的采样分布 。On-policy 的数据来自当前待优化学生 πθ\pi_\thetaπθ,off-policy 的数据来自教师或历史策略。数学上,Reverse KL 的期望在 πθ\pi_\thetaπθ 下,天然 on-policy;Forward KL 的期望在 πT\pi_TπT 下,天然 off-policy。

问:为什么说 Reverse KL 的梯度就是策略梯度?

答:因为 ∇θKL(πθ∥πT)=− Ex∼πθlog⁡πTπθ∇θlog⁡πθ\nabla_\theta \mathrm{KL}(\pi_\theta\|\pi_T)=-\,\mathbb{E}{x\sim\pi\theta}\\log\\frac{\\pi_T}{\\pi_\\theta}\\nabla_\\theta\\log\\pi_\\theta∇θKL(πθ∥πT)=−Ex∼πθlogπθπT∇θlogπθ,与策略梯度 ∇θER=ER∇θlog⁡πθ\nabla_\theta\mathbb{E}R=\mathbb{E}R\\nabla_\\theta\\log\\pi_\\theta∇θER=ER∇θlogπθ 形式完全一致,奖励 R=log⁡πTπθR=\log\frac{\pi_T}{\pi_\theta}R=logπθπT。

问:OPD 能替代 RLHF 吗?

答:不能完全替代,但可互补。RLHF 优化的是人类偏好(可含风格、安全性等策略问题);OPD 优化的是"匹配教师分布"。二者目标不同。2026 年趋势是合流------用验证器/结果奖励与 OPD 同循环。

问:什么是 on-policy self-distillation(OPSD)?

答:教师是学生自己在特权信息条件下的副本,无需外部大模型。优点是省去外部教师成本;风险是坍缩与特权信息泄漏。

问:OPD 为什么在 2024 年后突然火了?

答:三个原因叠加:①长链推理任务普及,暴露偏差从"小问题"变成"致命问题";②开源白盒大模型(可做 token 级监督)增多;③后训练流水线需要"把 RL 专家合成可部署学生"的手段。

问:Reverse KL 会造成模型只会一种解法吗?

答:会(mode-seeking 导致熵坍缩),尤其在密集自蒸馏下。缓解手段:混入 Forward KL / 熵正则、稀疏定位、按能力路由、让教师带不确定性、用验证过的轨迹修正教师。

问:OPD 训练时教师需要多大?

答:与任务和容量差距有关。教师不是越大越好------跨模型族还会因 tokenizer/嵌入偏移而失效(CompassOPD 的发现)。实践中关键是"教师靠谱且与学生状态可比"。

问:黑盒模型(只有 API)能做 OPD 吗?

答:可以但受限。没有 logits 就只能用序列级信号(教师文本、评判、偏好),本质近似"on-policy 数据 + off-policy/偏好目标"。若还配了验证器/奖励,就接近"蒸馏 + RL"的混合形态。

问:OPD 和"提炼推理模型的思维链做 SFT"是一回事吗?

答:不是。后者(如 R1 蒸馏到 Qwen)是 teacher-generated 数据的 off-policy SFT/SeqKD;OPD 要求学生自采样并在学生状态上匹配教师分布。

问:2026 年 OPD 最值得关注的三条趋势?

答:①精准定位 + 稀疏监督取代全量密集;②概率重分配(路由)补上 Reverse KL 的短板;③OPD 与 RL/验证器深度合流,及异步系统化。


11. 速查表与术语表

11.1 一句话速查

概念 一句话
Knowledge Distillation 用教师软分布监督学生
Forward KL mass-covering,覆盖教师全部模式
Reverse KL mode-seeking,收缩到教师支撑集
Off-policy KD 数据来自教师/固定集
On-policy distillation 数据来自当前学生
GKD 学生自生成 + 教师反馈,散度可插值
MiniLLM Reverse KL + 策略梯度 + 教师混合
DistiLLM skew KL + off-policy 自适应调度
ToDi token 级 FKL/RKL 动态门控
REOPOLD OPD = 以对数比为奖励的策略优化
OPSD / SDPO 特权信息自蒸馏
暴露偏差 错误前缀导致的误差复合
支撑集问题 RKL 只会刹车不会打方向
PI bias 参考解把教师带偏
两阶段范式 先 OPD 扩支撑,再 RL 锐化

11.2 术语中英对照

中文 English
同策略蒸馏 On-Policy Distillation (OPD)
广义知识蒸馏 Generalized Knowledge Distillation (GKD)
反向 / 正向 KL Reverse / Forward KL (RKL / FKL)
暴露偏差 Exposure Bias
质量覆盖 / 众数寻找 Mass-covering / Mode-seeking
特权信息 Privileged Information (PI)
特权信息泄漏 Privileged Information Leakage
时间信用分配 Temporal Credit Assignment
概率重分配 / 路由 Probability Redistribution / Routing
熵坍缩 Entropy Collapse
信任域 Trust Region
蒸馏尺度律 Distillation Scaling Law

12. 参考文献(截至 2026-09-16)

阅读提示:2026 条目均为 arXiv 预印本(部分已备注会议),结论可能后续修正;引用时请核对最新版本。

12.1 奠基与经典

  1. Hinton, Vinyals, Dean. Distilling the Knowledge in a Neural Network. arXiv:1503.02531 (2015).
  2. Rusu et al. Policy Distillation. arXiv:1511.06295 (2015).
  3. Kim, Rush. Sequence-Level Knowledge Distillation. arXiv:1606.07947 (EMNLP 2016).
  4. Schulman et al. Proximal Policy Optimization Algorithms. arXiv:1707.06347 (2017).
  5. Rafailov et al. Direct Preference Optimization. arXiv:2305.18290 (2023).
  6. Gulcehre et al. Reinforced Self-Training (ReST) for Language Modeling. arXiv:2308.08998 (2023).
  7. Ross, Gordon, Bagnell. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning. AISTATS 2011.(暴露偏差 T2T^2T2 的经典来源)

12.2 OPD 核心方法

  1. Agarwal et al. On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes (GKD). arXiv:2306.13649 (ICLR 2024).
  2. Gu et al. MiniLLM: On-Policy Distillation of Large Language Models. arXiv:2306.08543 (ICLR 2024).
  3. Ko et al. DistiLLM: Towards Streamlined Distillation for Large Language Models. arXiv:2402.03898 (ICML 2024).
  4. Jung et al. ToDi: Token-wise Distillation via Fine-Grained Divergence Control. arXiv:2505.16297 (EMNLP 2025 Oral).
  5. Ko et al. Scaling Reasoning Efficiently via Relaxed On-Policy Distillation (REOPOLD). arXiv:2603.11137 (2026).

12.3 综述与批判性回顾

  1. Song, Zheng. A Survey of On-Policy Distillation for Large Language Models. arXiv:2604.00626 (2026).
  2. Zhang. A Formula-Driven Survey and Research Agenda for On-Policy Distillation. arXiv:2606.22793 (2026).
  3. Robert, Qader. One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation. arXiv:2608.25936 (2026).
  4. Xu et al. A Survey on Knowledge Distillation of Large Language Models. arXiv:2402.13116 (2024).
  5. Mansourian et al. A Comprehensive Survey on Knowledge Distillation. arXiv:2503.12067 (TMLR 2025).

12.4 前沿方法(2026 预印本,按主题)

时间信用 / 稳定化

  1. γOPD: Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for OPD. arXiv:2609.16937.
  2. Trust Region On-Policy Distillation (TrOPD). arXiv:2606.01249.
  3. TV-Regulated OPD: Direction Matters in OPD. arXiv:2609.08341.
  4. PowerOPD: Stabilizing OPD with Bounded Power Transformation. arXiv:2606.17199.
  5. Rethinking Reverse KL as Adaptive Entropy Distillation (AED). arXiv:2608.14685.

定位 / 稀疏监督

  1. Bridging Reasoning Trajectories in OPD via Near-Future Guidance. arXiv:2606.00305.
  2. Extremely Sparse Supervision Incentivizes Reasoning Ability. arXiv:2609.04565.
  3. What Matters in OPD? Data Efficiency and Data Selection. arXiv:2609.05198.
  4. Cliff: Learning Process Rewards from the First Mistake. arXiv:2609.02817.
  5. When Teacher Guidance Misleads: Reward-Aligned OPD (RA-OPD). arXiv:2608.27960.
  6. Influence-Directed Distillation (IDA-OPD). arXiv:2608.29846.

概率重分配 / 路由

  1. Distillation as Probability Transport: Routed OPD (RouteOPD). arXiv:2609.08337.
  2. Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement. arXiv:2608.31046.

自蒸馏 / 特权信息

  1. DemoPSD: Disagreement-Modulated Policy Self-Distillation. arXiv:2607.02502.
  2. Privileged, but Biased: How PI-Conditioned Teachers Break Self-Distillation. arXiv:2608.04794.
  3. Denser ≠ Better: Limits of OPSD for Continual Post-Training. arXiv:2607.01763.
  4. Latent On-Policy Self-Distillation (LOPD). arXiv:2608.13040.
  5. I-SDPO: Instance-Level Adaptive Self-Distillation Policy Optimization. arXiv:2608.12957.
  6. Sample-Routed Policy Optimization (SRPO). arXiv:2604.02288.
  7. VISTA: Verifier-Informed Student-to-Teacher Adaptation. arXiv:2608.28306.
  8. DualOPSD: Adaptive Privileged Teachers for OPSD. arXiv:2608.26019.

数据 / 课程

  1. Data-free On-policy Distillation (DF-OPD). arXiv:2609.14193.
  2. Rethinking OPD of LLMs II: One Training Example. arXiv:2609.04172.
  3. DRIFT: Difficulty Routing Self-Distillation. arXiv:2606.30345.
  4. SC-SDPO: Pass-Rate Weighted Self-Distillation. arXiv:2605.27765.
  5. Sequential Beats Joint: Interplay between OPD and RLVR. arXiv:2609.04108.
  6. Unifying ICL, SFT, KL-Regularized RL Through a Bayesian Lens. arXiv:2609.05111.

与 RL / 验证器合流

  1. OPPO: Bayesian Value Recursion for Token-Level Credit Assignment. arXiv:2605.21851.
  2. CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization. arXiv:2605.19436.
  3. VG-OPD: Verifier-Gated Multi-Expert OPD. arXiv:2609.15404.
  4. MT-SDPO: Answer-Verified Multi-Teacher Distillation. arXiv:2609.02548.

多教师 / 融合 / 模态 / 系统

  1. Video-MOPD: Multi-Teacher OPD for Video Understanding. arXiv:2609.09300.
  2. KuaiRP: Two-stage OPD with Cumulative-Divergence Decay. arXiv:2609.11127.
  3. Lightning Weave: Capability Composition via OPD. arXiv:2609.14708.
  4. CompassOPD: Cross-Family OPD via Within-Family Likelihood Shifts. arXiv:2609.10154.
  5. SenseNova-U1.5: Multi-Expert OPD for Unified Visual Intelligence. arXiv:2609.11929.
  6. OPD-Aha: Multimodal OPD with Visual Reflection. arXiv:2609.16459.
  7. JO-OPD: Joint-Output OPD for Speech LMs. arXiv:2609.15313.
  8. Miles v0.1: Production-Level Post-Training. arXiv:2609.08368.
  9. AsyncOPD: How Stale Can On-Policy Distillation Be? arXiv:2606.24143.
  10. STRIDE: Accelerating Multi-Turn Agentic OPD. arXiv:2609.14636.

13. 结语:给三类读者的话

给初学者:请把第 1 章的三件事记住------蒸馏比的是分布、KL 有方向、on-policy 看的是采样来源。这三句话,胜过背十篇论文标题。

给工程师:OPD 的收益不是免费的,它买的是"从错误中恢复"的能力。如果任务不需要恢复,别用。用的时候,盯住四个旋钮、三类健康指标(训练/验证背离、熵、长度),并在真实算力上先建立强 baseline。

给研究者与求职者 :这个领域在 2026 年已经从"证明有用"进入"如何稳定、如何省、如何融合"的阶段。真正的机会在三个尚未解决的地方------支撑集(概率重分配)、时间信用分配、以及蒸馏的尺度律。谁把这三件事讲清楚,谁就定义了下一阶段。

如果这篇文档让你在面试里被追问"然后呢?"时还能继续往下讲三层,那它就达到了目的。


附录 A:GEO 结构化数据(供搜索引擎 / 生成式引擎解析)

说明:以下 JSON-LD 采用 schema.org 词汇,便于生成式检索引擎(GEO)抽取本文的实体、作者、主题与问答对。可直接嵌入网页 <head>;在纯 Markdown 中保留为代码块。

json 复制代码
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@type": "TechArticle",
      "@id": "#on-policy-distillation-guide",
      "headline": "On-Policy Distillation 全景深潜:从第一性原理到 2026 前沿",
      "description": "一篇系统梳理 On-Policy Distillation(同策略蒸馏)的深度长文:从 Forward/Reverse KL 第一性原理、策略梯度等价推导,到 GKD/MiniLLM/DistiLLM/OPSD 方法谱系,再到 2026 年前沿的定位、重分配、稳定化与多教师融合,并附大厂面试真题与工程配方。",
      "datePublished": "2026-09-16",
      "dateModified": "2026-09-16",
      "inLanguage": "zh-CN",
      "keywords": [
        "On-Policy Distillation",
        "同策略蒸馏",
        "Reverse KL",
        "反向KL",
        "Exposure Bias",
        "暴露偏差",
        "GKD",
        "MiniLLM",
        "DistiLLM",
        "On-Policy Self-Distillation",
        "OPSD",
        "SDPO",
        "Knowledge Distillation",
        "大模型蒸馏",
        "LLM 后训练",
        "策略梯度",
        "RLHF",
        "GRPO"
      ],
      "about": [
        { "@type": "Thing", "name": "Knowledge Distillation" },
        { "@type": "Thing", "name": "Large Language Model Post-training" },
        { "@type": "Thing", "name": "Reinforcement Learning" }
      ],
      "mentions": [
        { "@type": "ScholarlyArticle", "name": "MiniLLM: On-Policy Distillation of Large Language Models", "identifier": "arXiv:2306.08543" },
        { "@type": "ScholarlyArticle", "name": "On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes", "identifier": "arXiv:2306.13649" },
        { "@type": "ScholarlyArticle", "name": "DistiLLM: Towards Streamlined Distillation for Large Language Models", "identifier": "arXiv:2402.03898" },
        { "@type": "ScholarlyArticle", "name": "A Survey of On-Policy Distillation for Large Language Models", "identifier": "arXiv:2604.00626" }
      ]
    },
    {
      "@type": "FAQPage",
      "mainEntity": [
        {
          "@type": "Question",
          "name": "On-Policy Distillation 和 Off-Policy Distillation 的本质区别是什么?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "区别在训练数据的采样分布:On-policy 的数据来自当前待优化学生策略 π_θ,Off-policy 的数据来自教师或历史策略。数学上 Reverse KL 的期望在 π_θ 下,天然 on-policy;Forward KL 的期望在 π_T 下,天然 off-policy。"
          }
        },
        {
          "@type": "Question",
          "name": "为什么 LLM 蒸馏推荐 Reverse KL 而不是 Forward KL?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Forward KL 是质量覆盖(mass-covering),会迫使学生覆盖教师全部非零概率,包括其容量无法表示的长尾,导致样样稀松;Reverse KL 是众数寻找(mode-seeking),让学生收缩到教师支撑集内、专精教师最确定的模式。代价是可能造成多样性/熵坍缩。"
          }
        },
        {
          "@type": "Question",
          "name": "On-Policy Distillation 的梯度与策略梯度有什么关系?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Reverse KL 的梯度等于以教师-学生对数比 log(π_T/π_θ) 为奖励的策略梯度,即 ∇KL(π_θ||π_T) = -E_{x~π_θ}[ log(π_T/π_θ) ∇log π_θ ]。因此 OPD 可视为奖励由教师给定的 on-policy 强化学习。"
          }
        },
        {
          "@type": "Question",
          "name": "On-Policy Distillation 需要多少训练数据?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "远少于直觉:2026 年多项结果显示 8 条 prompt 即可匹配 17k 题数据集,单条样本可恢复大部分收益,甚至 0.05% 的 token 监督就足够。原因是 OPD 的数据单元是 prompt 诱导出的状态而非 prompt 本身,关键在状态覆盖率。"
          }
        },
        {
          "@type": "Question",
          "name": "On-Policy Distillation 最大的结构性局限是什么?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "支撑集问题:采样式 Reverse KL 只对被采样 token 有梯度,只能抑制学生已经采到的错误,无法主动把概率质量指派到教师偏好但学生几乎采不到的 token。2026 年通过概率传输/路由、教师前缀引导等方式补齐。"
          }
        }
      ]
    }
  ]
}

本文由 AI 辅助撰写并基于截至 2026-09-16 的公开文献整理。2026 年条目为预印本,请以最新版本为准。欢迎转载,请保留出处。

相关推荐
计算机编程-吉哥1 小时前
深度学习:我用YOLO11-L做了一个水下垃圾检测系统 对比YOLOv8-L/Faster R-CNN【计算机毕业设计选题推荐】
人工智能·深度学习·yolo·课程设计·计算机毕业设计选题
小刘快学习1 小时前
批量推理的吞吐优化:聚合平台怎么做
人工智能
IvorySQL1 小时前
PostgreSQL 日报|8 字节 TOAST 值支持(9 月 16 日)
数据库·人工智能·postgresql
ai小陈1 小时前
LTX2.5音视频生成任务验收实战:批量记录与音画质量检查
人工智能·python·深度学习·ai·音视频·gpu算力
机器人猎头David1 小时前
如何看待机器人行业人才频繁流动?
人工智能·机器人猎头·猎头公司·猎头公司推荐·机器人猎头公司
精益数智工坊1 小时前
云计算环境元数据是什么意思?云计算元数据管理怎么做?
大数据·人工智能·数据挖掘·数据可视化
湘-枫叶情缘1 小时前
为什么你通过AI学了很多,却感觉自己没变强? ——从“知识输入”到“能力形成”的认知转化工程
人工智能·程序人生
东方-教育技术博主1 小时前
自进化自动编码软件用法02
人工智能
2601_962380761 小时前
考研专业课知识点科普视频怎么做:用MG动画把抽象概念讲透
人工智能