区别
强化学习(RL)是大类技术;对齐算法是落地场景子集
强化学习:通用机器学习范式,不限大模型,解决任意智能体做序列决策优化,最大化长期累积奖励
LLM 对齐:目标是让模型贴合人类偏好、指令、安全规范;很多对齐依赖强化学习实现,但对齐≠强化学习,对齐还有非 RL 路线
二者是「工具」和「使用场景」的关系:
强化学习是工具箱,对齐是改造大模型的工程目标,可以用这个工具箱,也可以用别的工具箱
强化学习算法
智能体(Agent)不断和环境交互生成动作,依靠奖励信号更新策略,最大化长期累积奖励
经典清单:PPO、GRPO、DAPO、A2C、DQN、SAC
适用范围极广:游戏 AI、机器人控制、推荐系统、大模型微调、自动驾驶,不止局限于语言
核心三要素:智能体、环境、奖励
LLM 对齐算法
目标约束大模型输出符合人类要求:听话、回答优质、逻辑靠谱、安全无害、价值观合规
对齐分两大路线
路线 1:基于强化学习的对齐(RL 对齐)
RLHF、RL with GRPO、RL-DAPO。依靠强化学习 + 奖励模型优化,也就是用 RL 算法做对齐
路线 2:无强化学习的偏好对齐(纯离线,不需要 RL)
DPO、ORPO、KTO、IPO。全程没有强化学习迭代、没有环境交互,只用标注偏好对直接做监督式损失优化
除此之外,SFT 监督微调、红队安全训练也属于广义对齐
示例
GRPO 首先是强化学习算法,满足 RL 逻辑:模型(智能体)对同一个 prompt 生成多条回复(动作),用奖励打分,优化策略提升高奖励动作概率
当用 GRPO 优化数学解题、贴合人类答题偏好时,这套训练流程属于RL 对齐
可以把 GRPO 拿去做别的 RL 任务(比如机器人动作优化),此时它只是普通强化学习,和模型对齐没有任何关系
反向例子:DPO 是标准对齐算法,但不属于强化学习
DPO 只拿「好回答 / 坏回答」成对数据训练,没有在线采样探索、没有循环交互,不属于 RL,却是当下主流对齐方案
❌误区:对齐 = 强化学习
✅纠正:对齐有 RL 和非 RL 两条路。DPO 不需要任何强化学习,依旧能完成对齐
❌误区:PPO/GRPO 天生就是对齐算法
✅纠正:它们只是 RL 工具。用在人类偏好微调 = 对齐;用在游戏打怪训练 = 纯强化学习,和对齐无关
小节
强化学习是工具;对齐是大模型的改造目的
工具可以用于对齐,也可以不用于对齐;对齐可以用这个工具,也可以不用这个工具