从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布

从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布

理解大模型后训练中的能力学习、泛化与遗忘


引言:后训练究竟在改变什么?

大语言模型在预训练阶段阅读海量文本,并通过"预测下一个 token"学习语言规律、世界知识、代码结构与一定程度的推理能力。然而,一个完成预训练的模型并不天然知道怎样遵循用户指令,也不一定会按照我们期待的格式回答,更不会自动把"对用户有帮助""数学答案正确"或"代码能够通过测试"当作自己的优化目标。

这正是后训练要解决的问题。

后训练并不是简单地向模型中添加几条知识,而是在已有能力的基础上,改变模型面对特定输入时生成各种回答的概率。对于同一个问题,模型原本可能生成简短答案、冗长解释、错误推理、正确推理或格式混乱的内容。经过后训练,这些候选回答之间的概率关系会发生变化:某些行为被强化,另一些行为被压低,还有一些原有行为可能在训练过程中受到意外影响。

因此,我们可以把后训练理解为对模型输出分布的重新塑造。

本文重点讨论三种后训练方法:

  • 监督微调(Supervised Fine-Tuning,SFT):在预先准备好的标准答案上学习;
  • 强化学习(Reinforcement Learning,RL):从当前模型的输出中采样,再根据奖励优化;
  • 在线策略蒸馏(On-Policy Distillation,OPD):由学生生成轨迹,再由教师在学生实际访问的状态上提供逐 token 指导。

三种方法都能提升模型能力,但它们使用的数据来源、学习信号和优化目标并不相同。这些差异进一步影响了训练效率、泛化能力、灾难性遗忘和输出多样性。

全文将围绕三个问题展开:

  1. SFT、RL 和 OPD 分别如何改变模型的输出分布?
  2. 它们最明确的优势、局限和适用条件是什么?
  3. 为什么它们在泛化与遗忘方面会表现出不同的倾向?

全文按照"概念---机制---证据---实践"逐步展开:

  • 第一至三章建立基础,并分别说明 SFT 与 RL;
  • 第四章从知识蒸馏出发,解释 OPD、OPSD 与 MOPD;
  • 第五、六章讨论遗忘、泛化、KL 方向,以及学生为何可能超过教师;
  • 第七章回到实验,检验教师类型与在线策略数据分别发挥什么作用;
  • 第八、九章给出完整后训练流水线、方法选择框架与最终结论。

具体链接地址为:https://mp.weixin.qq.com/s/-GwE8wNo0UVDYks1qvCn_g

相关推荐
机器学习之心4 小时前
基于强化学习的股票价格预测与智能交易实战
强化学习·股票价格预测
XLYcmy4 小时前
Self-Adapting Language Models论文分享
自然语言处理·llm·微调·sft·论文笔记·强化学习·自进化
指掀涛澜天下惊20 小时前
强化学习进阶篇八 策略梯度算法
深度学习·学习·算法·强化学习
盼小辉丶1 天前
PyTorch强化学习实战——融合人类示范数据的高效强化学习
人工智能·pytorch·python·深度学习·强化学习
爱听歌的周童鞋1 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 5 | Part 2 | 蒙特卡洛方法(MC Basic 算法介绍)
强化学习·monte carlo·estimation·model-free·mc basic
爱听歌的周童鞋1 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 5 | Part 3 | 蒙特卡洛方法(MC Basic 算法例子)
强化学习·example·monte carlo·mc basic·episode length
盼小辉丶2 天前
PyTorch强化学习实战——基于图像-文本融合的自动化网页导航
人工智能·pytorch·深度学习·自动化·强化学习
Mid_search2 天前
Dueling Network
人工智能·深度学习·强化学习·dueling network
爱听歌的周童鞋3 天前
强化学习的数学原理 | 赵世钰 | 西湖大学 | 笔记 | Lecture 5 | Part 1 | 蒙特卡洛方法(通过例子介绍蒙特卡洛)
强化学习·大数定律·monte carlo·estimation·model-free·expectation
Mid_search3 天前
高估问题、Target Network、Double DQN
人工智能·深度学习·强化学习·double dqn·bootstrapping·target network