从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布

从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布

理解大模型后训练中的能力学习、泛化与遗忘


引言:后训练究竟在改变什么?

大语言模型在预训练阶段阅读海量文本,并通过"预测下一个 token"学习语言规律、世界知识、代码结构与一定程度的推理能力。然而,一个完成预训练的模型并不天然知道怎样遵循用户指令,也不一定会按照我们期待的格式回答,更不会自动把"对用户有帮助""数学答案正确"或"代码能够通过测试"当作自己的优化目标。

这正是后训练要解决的问题。

后训练并不是简单地向模型中添加几条知识,而是在已有能力的基础上,改变模型面对特定输入时生成各种回答的概率。对于同一个问题,模型原本可能生成简短答案、冗长解释、错误推理、正确推理或格式混乱的内容。经过后训练,这些候选回答之间的概率关系会发生变化:某些行为被强化,另一些行为被压低,还有一些原有行为可能在训练过程中受到意外影响。

因此,我们可以把后训练理解为对模型输出分布的重新塑造。

本文重点讨论三种后训练方法:

  • 监督微调(Supervised Fine-Tuning,SFT):在预先准备好的标准答案上学习;
  • 强化学习(Reinforcement Learning,RL):从当前模型的输出中采样,再根据奖励优化;
  • 在线策略蒸馏(On-Policy Distillation,OPD):由学生生成轨迹,再由教师在学生实际访问的状态上提供逐 token 指导。

三种方法都能提升模型能力,但它们使用的数据来源、学习信号和优化目标并不相同。这些差异进一步影响了训练效率、泛化能力、灾难性遗忘和输出多样性。

全文将围绕三个问题展开:

  1. SFT、RL 和 OPD 分别如何改变模型的输出分布?
  2. 它们最明确的优势、局限和适用条件是什么?
  3. 为什么它们在泛化与遗忘方面会表现出不同的倾向?

全文按照"概念---机制---证据---实践"逐步展开:

  • 第一至三章建立基础,并分别说明 SFT 与 RL;
  • 第四章从知识蒸馏出发,解释 OPD、OPSD 与 MOPD;
  • 第五、六章讨论遗忘、泛化、KL 方向,以及学生为何可能超过教师;
  • 第七章回到实验,检验教师类型与在线策略数据分别发挥什么作用;
  • 第八、九章给出完整后训练流水线、方法选择框架与最终结论。

具体链接地址为:https://mp.weixin.qq.com/s/-GwE8wNo0UVDYks1qvCn_g

相关推荐
阿木实验室3 天前
预设航线之外,无人机如何应对变化?
强化学习·自主无人机
一颗小树x8 天前
《VLA 系列》AMP 代码复现 | 强化训练 | 行走 跌倒 恢复
机器人·强化学习·amp·vla·复现
飞思实验室9 天前
跨越算力鸿沟与不可微壁垒:GPU张量化仿真如何重塑多智能体强化学习?
gpu算力·强化学习
紫金修道10 天前
深度强化学习内核:从马尔可夫链到PPO的哲学与数学之美
强化学习
闲研随记12 天前
【文献阅读 ICML 2026】RL算法:R2VPO
论文阅读·人工智能·算法·强化学习·icml·rl算法
EW Frontier15 天前
三级跳突破864维动作空间——QMIX-Hierarchical多无人机协同通信方法全解析【附python代码】
开发语言·python·无人机·强化学习·通信资源分配
盼小辉丶17 天前
PyTorch强化学习实战(18)——基于DQN处理股票交易问题
pytorch·深度学习·强化学习
闲研随记19 天前
【文献阅读 ICML 2026】RL算法:Critique-GRPO
论文阅读·算法·llm·强化学习·rl·icml·grpo
智能优化与强化学习23 天前
Gym(Gymnasium)仿真环境详解(二):环境简介、入门算法、调参要点、核心挑战
算法·强化学习·gym·零基础入门·算法评估