Post-train 入门(1):SFT / DPO / Online RL 概念理解和分类

Post-train 的分类

  1. SFT
  2. DPO
  3. online RL

以下是后训练(Post-train)中三种主流方法的对比表格,涵盖核心定义、优化目标、数据需求、优缺点及典型应用场景:

分类 核心定义 优化目标 数据需求 优点 缺点 典型应用场景
SFT(监督微调) 在预训练模型基础上,使用人工标注的高质量指令-响应对数据进行微调,让模型学习特定任务的输出格式和知识。 最小化模型输出与标注数据的交叉熵损失,使模型生成符合人类预期的"标准答案"。 依赖高质量的人工标注数据(如指令-响应对),数据规模通常较小(数万至数十万样本)。 1. 训练简单稳定,易实现; 2. 能快速对齐基础任务格式; 3. 对计算资源要求较低。 1. 难以捕捉复杂的人类偏好(如安全性、相关性); 2. 泛化能力有限,对未见过的指令可能生成错误结果。 基础对话系统、特定任务指令对齐(如翻译、摘要)、模型快速适配新领域。
DPO(直接偏好优化) 跳过显式奖励模型训练,直接通过人类偏好数据(如"更好/更差"的样本对)优化策略,将偏好建模嵌入模型损失函数。 最大化模型生成"偏好样本"的概率,同时通过KL约束保持与参考模型(如SFT模型)的分布接近。 需要人类标注的偏好对数据(如(x,y好,y差)(x, y_{\text{好}}, y_{\text{差}})(x,y好,y差)),数据规模中等。 1. 省去奖励模型训练,简化流程; 2. 训练稳定性优于传统RLHF; 3. 对域内任务拟合效果好。 1. 依赖高质量偏好标注,标注成本高; 2. 域外泛化能力较弱; 3. 难以处理复杂奖励信号。 对齐人类偏好的对话模型(如ChatGPT后期优化)、内容生成质量提升(如文本、图像)。
Online RL(在线强化学习) 模型在与环境交互中实时生成样本,基于实时反馈(奖励)动态更新策略,无需依赖预收集的静态数据集。 最大化累积奖励,通过探索不同生成路径找到最优策略,同时平衡"探索"与"利用"。 无需预收集数据,依赖实时奖励信号(可来自benchmark、人类反馈或其他评估器)。 1. 能适应动态环境和复杂奖励; 2. 域外泛化能力强; 3. 可持续优化策略。 1. 训练复杂,需设计高效探索机制; 2. 计算成本高(实时生成与反馈); 3. 可能存在奖励黑客风险。 动态任务优化(如文本到图像生成的细节控制)、需要推理能力的任务(如数学解题、代码生成)。

关键区别总结:

  • 数据依赖 :SFT和DPO依赖静态标注数据 ,Online RL依赖实时反馈
  • 优化粒度:SFT关注"正确输出",DPO关注"相对偏好",Online RL关注"全局最优策略";
  • 适用阶段 :SFT通常作为后训练的基础步骤,DPO和Online RL用于进一步优化偏好对齐和复杂任务能力

Alignment in Diffusion 的分类

相关推荐
AI_小站1 小时前
6个GitHub爆火的免费大模型教程,助你快速进阶AI编程
人工智能·langchain·github·知识图谱·agent·llama·rag
xindoo1 小时前
GitHub Trending霸榜!深度解析AI Coding辅助神器 Superpowers
人工智能·github
时间之里1 小时前
【深度学习】:RF-DETR与yolo对比
人工智能·深度学习·yolo
北京阿法龙科技有限公司1 小时前
数智化升级:AR 智能眼镜驱动工业运维效能革新
人工智能
风落无尘1 小时前
《智能重生:从垃圾堆到AI工程师》——第二章 概率与生存
大数据·人工智能
j_xxx404_2 小时前
Linux:静态链接与动态链接深度解析
linux·运维·服务器·c++·人工智能
收获不止数据库2 小时前
达梦9发布会归来:AI 时代,我们需要一款什么样的数据库?
数据库·人工智能·ai·语言模型·数据分析
hhb_6182 小时前
AI全栈编程生存指南
人工智能
AI-Frontiers2 小时前
transformer进阶之路:#2 工作原理详解
人工智能·深度学习·transformer
科研前沿2 小时前
2026 数字孪生前沿科技:全景迭代报告 —— 镜像视界生成式孪生(Generative DT)技术白皮书
大数据·人工智能·科技·算法·音视频·空间计算