从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布
理解大模型后训练中的能力学习、泛化与遗忘
引言:后训练究竟在改变什么?
大语言模型在预训练阶段阅读海量文本,并通过"预测下一个 token"学习语言规律、世界知识、代码结构与一定程度的推理能力。然而,一个完成预训练的模型并不天然知道怎样遵循用户指令,也不一定会按照我们期待的格式回答,更不会自动把"对用户有帮助""数学答案正确"或"代码能够通过测试"当作自己的优化目标。
这正是后训练要解决的问题。
后训练并不是简单地向模型中添加几条知识,而是在已有能力的基础上,改变模型面对特定输入时生成各种回答的概率。对于同一个问题,模型原本可能生成简短答案、冗长解释、错误推理、正确推理或格式混乱的内容。经过后训练,这些候选回答之间的概率关系会发生变化:某些行为被强化,另一些行为被压低,还有一些原有行为可能在训练过程中受到意外影响。
因此,我们可以把后训练理解为对模型输出分布的重新塑造。
本文重点讨论三种后训练方法:
- 监督微调(Supervised Fine-Tuning,SFT):在预先准备好的标准答案上学习;
- 强化学习(Reinforcement Learning,RL):从当前模型的输出中采样,再根据奖励优化;
- 在线策略蒸馏(On-Policy Distillation,OPD):由学生生成轨迹,再由教师在学生实际访问的状态上提供逐 token 指导。
三种方法都能提升模型能力,但它们使用的数据来源、学习信号和优化目标并不相同。这些差异进一步影响了训练效率、泛化能力、灾难性遗忘和输出多样性。
全文将围绕三个问题展开:
- SFT、RL 和 OPD 分别如何改变模型的输出分布?
- 它们最明确的优势、局限和适用条件是什么?
- 为什么它们在泛化与遗忘方面会表现出不同的倾向?
全文按照"概念---机制---证据---实践"逐步展开:
- 第一至三章建立基础,并分别说明 SFT 与 RL;
- 第四章从知识蒸馏出发,解释 OPD、OPSD 与 MOPD;
- 第五、六章讨论遗忘、泛化、KL 方向,以及学生为何可能超过教师;
- 第七章回到实验,检验教师类型与在线策略数据分别发挥什么作用;
- 第八、九章给出完整后训练流水线、方法选择框架与最终结论。
