从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布

从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布

理解大模型后训练中的能力学习、泛化与遗忘


引言:后训练究竟在改变什么?

大语言模型在预训练阶段阅读海量文本,并通过"预测下一个 token"学习语言规律、世界知识、代码结构与一定程度的推理能力。然而,一个完成预训练的模型并不天然知道怎样遵循用户指令,也不一定会按照我们期待的格式回答,更不会自动把"对用户有帮助""数学答案正确"或"代码能够通过测试"当作自己的优化目标。

这正是后训练要解决的问题。

后训练并不是简单地向模型中添加几条知识,而是在已有能力的基础上,改变模型面对特定输入时生成各种回答的概率。对于同一个问题,模型原本可能生成简短答案、冗长解释、错误推理、正确推理或格式混乱的内容。经过后训练,这些候选回答之间的概率关系会发生变化:某些行为被强化,另一些行为被压低,还有一些原有行为可能在训练过程中受到意外影响。

因此,我们可以把后训练理解为对模型输出分布的重新塑造。

本文重点讨论三种后训练方法:

  • 监督微调(Supervised Fine-Tuning,SFT):在预先准备好的标准答案上学习;
  • 强化学习(Reinforcement Learning,RL):从当前模型的输出中采样,再根据奖励优化;
  • 在线策略蒸馏(On-Policy Distillation,OPD):由学生生成轨迹,再由教师在学生实际访问的状态上提供逐 token 指导。

三种方法都能提升模型能力,但它们使用的数据来源、学习信号和优化目标并不相同。这些差异进一步影响了训练效率、泛化能力、灾难性遗忘和输出多样性。

全文将围绕三个问题展开:

  1. SFT、RL 和 OPD 分别如何改变模型的输出分布?
  2. 它们最明确的优势、局限和适用条件是什么?
  3. 为什么它们在泛化与遗忘方面会表现出不同的倾向?

全文按照"概念---机制---证据---实践"逐步展开:

  • 第一至三章建立基础,并分别说明 SFT 与 RL;
  • 第四章从知识蒸馏出发,解释 OPD、OPSD 与 MOPD;
  • 第五、六章讨论遗忘、泛化、KL 方向,以及学生为何可能超过教师;
  • 第七章回到实验,检验教师类型与在线策略数据分别发挥什么作用;
  • 第八、九章给出完整后训练流水线、方法选择框架与最终结论。

具体链接地址为:https://mp.weixin.qq.com/s/-GwE8wNo0UVDYks1qvCn_g

相关推荐
chen_zn9516 小时前
《VLA 系列》RLT | RL Token | 轻量 Actor-Critic | 在线强化学习与源码解析
人工智能·强化学习·具身智能·vla
计科杨某人2 天前
机器学习基本常识
随机森林·机器学习·支持向量机·监督学习·强化学习·最小二乘法·无监督学习
云和数据.ChenGuang4 天前
fastapi项目拆分实战数据模型
java·服务器·数据库·人工智能·深度学习·fastapi·强化学习
林泽毅11 天前
PyTRIO快速入门实战篇(二):用 GRPO 提升 GSM8K 数学推理准确率
人工智能·深度学习·机器学习·llm·强化学习
幻影123!14 天前
从零训练一个会下五子棋的AI
python·深度学习·神经网络·强化学习·五子棋·alpha zero·mokugo
我是小邵20 天前
Zero RL:当 AI 学会“顿悟“——零强化学习的狂欢与阵痛
强化学习·大模型训练·grpo·zero rl
盼小辉丶20 天前
PyTorch强化学习实战(20)——优势演员-评论家(Advantage Actor-Critic, A2C)
pytorch·深度学习·强化学习·优势演员-评论家算法
阿木实验室24 天前
预设航线之外,无人机如何应对变化?
强化学习·自主无人机
一颗小树x1 个月前
《VLA 系列》AMP 代码复现 | 强化训练 | 行走 跌倒 恢复
机器人·强化学习·amp·vla·复现