【LLM开发实验】强化学习实现原理及实战

目录

一、RLHF流程简介

[1.1 LLM 训练三步走](#1.1 LLM 训练三步走)

[1.2 核心痛点](#1.2 核心痛点)

二、强化学习前置知识(热身)

[2.1 RL 五要素(贯穿式类比:训练运动员)](#2.1 RL 五要素(贯穿式类比:训练运动员))

[2.2 策略梯度核心思想](#2.2 策略梯度核心思想)

[2.3 原始策略梯度(REINFORCE)的两大病](#2.3 原始策略梯度(REINFORCE)的两大病)

三、PPO:近端策略优化

[3.0 PPO 的历史地位](#3.0 PPO 的历史地位)

[3.1 解决了什么问题](#3.1 解决了什么问题)

[3.2 核心思想](#3.2 核心思想)

[3.3 数学推导](#3.3 数学推导)

效果:模型能稳步小幅优化,但永远不会"一步改崩"。

[3.5 关键组件 1:GAE 优势估计](#3.5 关键组件 1:GAE 优势估计)

[3.6 关键组件 2:价值网络 critic](#3.6 关键组件 2:价值网络 critic)

[3.7 RLHF 中的 PPO 完整形态(InstructGPT 做法)](#3.7 RLHF 中的 PPO 完整形态(InstructGPT 做法))

​编辑

[3.8 优缺点](#3.8 优缺点)

四、DPO:直接偏好优化

[4.1 解决了什么问题](#4.1 解决了什么问题)

[4.2 核心思想](#4.2 核心思想)

[4.3 关键数学洞察(DPO 的精髓)](#4.3 关键数学洞察(DPO 的精髓))

[4.4 直观理解](#4.4 直观理解)

[4.7 潜在优缺点:](#4.7 潜在优缺点:)

1.优点:

2.缺点

五、GRPO:组相对策略优化

[5.1 背景与解决的问题](#5.1 背景与解决的问题)

[5.2 核心思想](#5.2 核心思想)

[5.3 数学:组内归一化优势](#5.3 数学:组内归一化优势)

[5.4 目标函数](#5.4 目标函数)

[5.5 为什么说 GRPO 是 PPO 的轻量版](#5.5 为什么说 GRPO 是 PPO 的轻量版)

[5.6 DeepSeek-R1 中的实际用法(GRPO 一战成名)](#5.6 DeepSeek-R1 中的实际用法(GRPO 一战成名))

[5.8 优缺点](#5.8 优缺点)

六、PPO与DPO算法对比表

差异总结

[七、当前主流 RL 算法格局](#七、当前主流 RL 算法格局)

基于AI反馈的强化学习 (RLAIF)

[7.1 LLM 对齐领域:三足鼎立](#7.1 LLM 对齐领域:三足鼎立)

[7.2 2025 年以来的新变体(GRPO 的迭代潮)](#7.2 2025 年以来的新变体(GRPO 的迭代潮))

[7.3 两个配套趋势](#7.3 两个配套趋势)

[GRPO 在 2024 年把它与强化学习结合起来,而 DeepSeek-R1-Zero 在 2025 年展示了一个非常有影响力的结果:通过基于结果的 RL,模型可以自己形成越来越复杂的 reasoning behavior,而不需要人工逐步规定"应该怎么思考"。](#GRPO 在 2024 年把它与强化学习结合起来,而 DeepSeek-R1-Zero 在 2025 年展示了一个非常有影响力的结果:通过基于结果的 RL,模型可以自己形成越来越复杂的 reasoning behavior,而不需要人工逐步规定“应该怎么思考”。)

SAPO


一、RLHF流程简介

强化学习 (reinforcement learning)人类反馈(RLHF)是一种旨在解决对齐 (alignment)难题并克服纯监督方法局限性的标准流程。这种多阶段方法旨在引导大型语言模型(LLMs)生成更符合人类偏好和指示的输出。它通常包含三个不同阶段:

  1. 监督微调 (fine-tuning)(SFT): 这一初始阶段使用精心整理的高质量提示和期望响应数据集,将预训练 (pre-training)的LLM适应到目标应用方向或风格。可以将其看作是教授模型预期的基本格式和风格。其成果是一个"SFT模型",作为后续强化学习阶段的起点。尽管有帮助,但单独的SFT往往难以涵盖人类偏好的全部范围,尤其是在处理复杂指示、安全性或像实用性这类细微特点时。

  2. 奖励模型构建(RM): 由于我们希望根据人类偏好优化模型,但又因为成本和延迟,在强化学习训练期间无法与人类进行交互查询,所以我们首先训练一个单独的模型来预测 人类偏好。这就是奖励模型(RM)。为了训练它,我们收集人类反馈数据。通常,针对一个给定的提示,会向人类展示由SFT模型(或其他模型)生成的多个响应,并要求他们进行排序或选择最佳响应。这种偏好数据(例如,其中一个响应优于另一个的响应对)用于训练RM。RM以提示和生成的响应作为输入,输出一个标量奖励分数,该分数理想情况下与人类偏好该响应的可能性相关。

  3. 强化学习微调(PPO): 在最后阶段,SFT模型(现在作为初始策略 )使用强化学习进行进一步微调。环境包括接收提示、生成响应,并从RM获得奖励。目标是调整策略模型的参数 (parameter),以最大化RM预测的预期奖励,有效地教导模型生成RM评分高的响应(从而人类也可能偏好)。近端策略优化(PPO)常在此处使用。此阶段一个重要方面是在更新后的策略和原始SFT策略之间施加约束,通常使用Kullback-Leibler(KL)散度。这种KL惩罚防止强化学习过程与SFT模型学到的知识和分布产生过大偏差,有助于保持语言连贯性,并避免策略以不切实际的方式为奖励模型"过度优化"(奖励作弊)。

这个序列构成了RLHF的核心流程。每个阶段都在前一阶段的基础上建立,从一个通用能力模型开始,训练一个偏好预测器,最后针对该预测器优化模型。

1.1 LLM 训练三步走

复制代码
预训练  →  SFT  →  RLHF
学说话      学对话     学听话

比喻:一个学生的成长

阶段 比喻 说明
预训练 博览群书 读遍互联网,学会"中文长什么样、词怎么搭配",但只会"接龙",不知道什么回答是好回答
SFT 模仿老师写作业 给一批"问题-标准答案"照着学,学会对话格式和语气;但老师只示范了一小部分题
RLHF 参加考试拿高分 不再看标准答案,由裁判(奖励模型)给每个回答打分,模型自己摸索"怎么答才能拿高分"

1.2 核心痛点

  • 预训练目标只是 P(下一个词)P(下一个词),模型不知道"用户问 A,答 B 才是好"。
  • SFT 只能模仿有限的人类示范,且示范质量参差、成本高。
  • 需要显式的奖励信号:这个回答好 / 这个回答差,让模型自己优化。

二、强化学习前置知识(热身)

2.1 RL 五要素(贯穿式类比:训练运动员)

RL 概念 运动员类比 LLM 对应
智能体 Agent 运动员 语言模型本身
环境 Environment 赛场 回答问题的场景
状态 State 当前局面 已生成的 token 序列
动作 Action 选动作 下一个要生成的 token
奖励 Reward 裁判打分 奖励模型给的分数

策略 π(a∣s)π(a∣s) :运动员的"肌肉记忆"------给定局面,选每个动作的概率分布。语言模型本身就是一个策略:给定上文,输出下一个词的概率分布。

2.2 策略梯度核心思想

不直接求解"最优动作是什么",而是直接调整策略参数 θθ,让"带来高回报的动作概率变大、低回报的动作概率变小"。

梯度方向:

∇J(θ)=E∇log⁡π(a∣s)×R∇J(θ)=E∇logπ(a∣s)×R

直觉:动作漂亮(RR 高)→ 回去多练这个动作(提高概率);动作失误(RR 低)→ 少练(降低概率)。

2.3 原始策略梯度(REINFORCE)的两大病

  1. 方差极大 :一场比赛只看一次结果,偶然性太大,梯度忽大忽小。
  2. 步子容易迈太大:教练看完比赛说"你全错了,全部推翻重来",把本来练得好的动作也改坏了。

于是需要"近端"(Proximal)思想:每次只小幅调整。这就是 PPO 的诞生理由。


三、PPO:近端策略优化

3.0 PPO 的历史地位

OpenAI 2017 年提出,连续五年是 RL 默认算法;2022 年 ChatGPT 用它完成 RLHF------直到今天仍是理解一切的基准。

3.1 解决了什么问题

原始策略梯度方差大、更新步长失控 → 训练动不动就崩。PPO 用"裁剪"机制把每次更新的幅度锁死在一个小范围里,稳定性大幅提升。采样一批数据只更新一次------on-policy 的样本效率极低,大模型生成又贵,烧不起-----PPO让旧数据能被复用几次

3.2 核心思想

更新可以,但新旧策略不能差太远------像教练一次只纠正一个动作,不推翻重来。

3.3 数学推导

① 新旧策略概率比(importance sampling 重写):

rt(θ)=πθ(at∣st)πθold(at∣st)rt​(θ)=πθold​​(at​∣st​)πθ​(at​∣st​)​

  • r>1r>1:新策略比旧策略更倾向这个动作
  • r<1r<1:新策略不如旧策略倾向它
  • r=1r=1:没变化

② 裁剪目标函数(PPO 核心公式):

LCLIP(θ)=Emin⁡(rt(θ)⋅At, clip⁡(rt(θ), 1−ε, 1+ε)⋅At)LCLIP(θ)=Emin(rt​(θ)⋅At​, clip(rt​(θ), 1−ε, 1+ε)⋅At​)

εε 通常取 0.2

③ 直觉拆解

  • 好动作(At>0At>0):如果 rr 涨到超过 1+ε1+ε,收益被裁剪封顶 → 防止"一个动作好,就把概率猛抬 50%"
  • 坏动作(At<0At<0):如果 rr 跌到低于 1−ε1−ε,惩罚也封顶 → 防止"一个动作差,就把概率猛砍 50%"

效果:模型能稳步小幅优化,但永远不会"一步改崩"。

3.5 关键组件 1:GAE 优势估计

At=δt+γλ δt+1+(γλ)2δt+2+⋯At​=δt​+γλδt+1​+(γλ)2δt+2​+⋯

δt=rt+γV(st+1)−V(st)(TD 误差)δt​=rt​+γV(st+1​)−V(st​)(TD 误差)

直观理解:优势 = 实际拿到的回报 − 本来预期的回报。超出预期越多 → 这个动作越"超出水平",越值得加强。

λλ 是偏差/方差旋钮:

  • λ→0λ→0:只看眼前一步,偏差大、方差小
  • λ→1λ→1:看完整未来,偏差小、方差大

3.6 关键组件 2:价值网络 critic

  • V(s)V(s) 负责预测"在这个局面下未来大概能得多少分"。
  • 与策略网络 actor 一起训练 → Actor-Critic 架构
  • critic 相当于"陪练的记分员",给运动员提供"预期分数"做参照。

奖励模型提前训练冻结参数

3.7 RLHF 中的 PPO 完整形态(InstructGPT 做法)

R=rθ(x,y)−β⋅KL⁡(πθ(y∣x)∥πref(y∣x))R=rθ​(x,y)−β⋅KL(πθ​(y∣x)∥πref​(y∣x))

为什么加 KL 惩罚 :奖励模型可能被"刷分"------模型发现说长句、堆砌华丽词藻分数就高。KL 惩罚把新策略钉在 SFT 模型附近,防止跑偏说胡话。参考模型冻结参数

共 4 个模型

模型 状态
策略模型 πθπθ​ 要训练
价值模型 VV 要训练
​奖励模型 RM 训练后冻结(SFT 后的模型)
参考模型 πrefπref 冻结

3.8 优缺点

  • ✅ 稳定、通用、大规模验证过(InstructGPT / ChatGPT 都靠它)
  • ❌ 工程复杂:4 个模型、超参多、调参痛苦
  • ❌ 显存算力开销大;奖励模型可能被 hack,
  • ❌ 策略模型与价值模型 同时训练,价值模型出错会影响策略模型

四、DPO:直接偏好优化

4.1 解决了什么问题

PPO 太复杂:要训奖励模型、要在线采样、要价值网络、KL 调参、训练不稳定......

DPO 的惊人洞察 :这一切可以合并成一步------"奖励模型 + RL"在数学上可以闭式消掉,最终变成一个普通的分类损失。不需要奖励模型,不需要采样,不需要 RL 循环。

4.2 核心思想

不显式训练奖励模型,而是把"策略偏离参考模型的程度"当作隐式奖励,直接拿成对偏好数据 (chosen, rejected) 做监督式训练。

4.3 关键数学洞察(DPO 的精髓)

第 1 步:RLHF 的优化目标

max⁡ ER(x,y)−β⋅KL⁡(πθ∥πref)max ER(x,y)−β⋅KL(πθ​∥πref​)

含义:分数要高,但又不能偏离 SFT 模型太远。

第 2 步:这个优化问题有闭式解!

最优策略 π∗π∗ 满足:

π∗(y∣x)∝πref(y∣x)⋅exp⁡(R(x,y)β)π∗(y∣x)∝πref​(y∣x)⋅exp(βR(x,y)​)

即:最优策略 = 参考策略 × 奖励的指数加权。

第 3 步:把公式反解,奖励函数可以用策略表达出来

R(x,y)=β⋅log⁡(π∗(y∣x)πref(y∣x))+β⋅log⁡Z(x)R(x,y)=β⋅log(πref​(y∣x)π∗(y∣x)​)+β⋅logZ(x)

含义:奖励不需要单独学!只要看"当前策略比参考策略更偏好这个回答多少",隐式奖励就藏在 log 概率比里。

第 4 步:代入 Bradley-Terry 偏好模型(成对比较模型)

P(yw>yl)=σ(R(x,yw)−R(x,yl))=sigmoid⁡(隐式奖励差)P(yw​>yl​)=σ(R(x,yw​)−R(x,yl​))=sigmoid(隐式奖励差)

第 5 步:得到 DPO 目标函数

LDPO(θ)=−Elog⁡σ(βlog⁡πθ(yw∣x)πref(yw∣x)−βlog⁡πθ(yl∣x)πref(yl∣x))LDPO​(θ)=−Elogσ(βlogπref​(yw​∣x)πθ​(yw​∣x)​−βlogπref​(yl​∣x)πθ​(yl​∣x)​)

4.4 直观理解

这就是一个二元分类问题

  • 让"chosen 相对参考模型的 log 概率比"高于"rejected 的"
  • 等价于:模型要更偏好 chosen、更不偏好 rejected
  • 损失就是 sigmoid + 交叉熵,和训练一个分类器一模一样

如果反了(模型更偏好 rejected):logit 为负,σσ 接近 0,损失巨大 → 梯度狠狠地把模型推回正确方向。

关键点:即使 πθπθ​ 的绝对概率很低,只要"相对参考模型的偏离"方向对,照样学得动。这就是 DPO 不需要奖励模型的秘密。

4.7 潜在优缺点:

1.优点:
  • 简洁性: 消除了训练、存储和加载独立奖励模型的必要。
  • 稳定性: 避免了显式奖励模型与强化学习 (reinforcement learning)算法(PPO)之间相互作用可能产生的不稳定。优化过程通常更稳定,也更易于调整。
  • 效率: 与PPO相比,计算量可能更小,因为它避免了PPO循环中的采样和奖励计算步骤。
2.缺点
  • 隐含奖励: 由于没有显式奖励模型可供检查,调试有时会更困难。性能直接取决于偏好数据集的质量和构成。
  • 优化动态: 优化行为与PPO不同。超参数 (hyperparameter)调整,特别是对于 ββ,仍然很重要。
  • 数据要求: 像所有基于偏好的方法一样,DPO非常依赖高质量和足够大的偏好数据集。
  • **过拟合:**离线数据是死的,模型把偏好对背下来------训练 acc 100%,实际输出却变差(chosen 概率也在掉,只是 rejected 掉得更快)。

五、GRPO:组相对策略优化

5.1 背景与解决的问题

DeepSeek 团队(DeepSeekMath → DeepSeek-R1)发现 PPO 有个大问题:critic 价值网络和策略网络一样大! 训 671B 的模型就要再养一个 671B 的 critic,显存爆炸,而且 critic 本身训练不稳定、容易带偏。

GRPO 的答案:把 critic 整个扔掉,用"组内相对比较"代替价值网络。

5.2 核心思想

对同一个问题,让模型自己采样一组(Group)回答,用这组回答的平均分作为基线,每个回答的优劣是"相对组内其他人"而言的。

类比:不请专业裁判精确打分,而是让一组运动员同时做同一套动作,大家互相比较------谁明显比平均好,就表扬谁;谁明显比平均差,就纠正谁。不需要"预期分数",平均分就是最自然的参照物。

5.3 数学:组内归一化优势

对问题 xx,从当前策略采样 GG 个回答:{y1,y2,...,yG}{y1​,y2​,...,yG​},用奖励函数打分:{r1,r2,...,rG}{r1​,r2​,...,rG​}。

优势估计(z-score 归一化)

Ai=ri−mean⁡(r)std⁡(r)Ai​=std(r)ri​−mean(r)​

  • 高于组平均 → 正优势(鼓励)
  • 低于组平均 → 负优势(抑制)
  • 关键:这里的 mean/std 是"这组采样自己"的统计量,不需要任何额外网络

5.4 目标函数

LGRPO(θ)=−E1G∑imin⁡(ri(θ)⋅Ai, clip⁡(ri(θ), 1−ε, 1+ε)⋅Ai)−β⋅KL⁡(πθ∥πref)LGRPO​(θ)=−EG1​i∑​min(ri​(θ)⋅Ai​, clip(ri​(θ), 1−ε, 1+ε)⋅Ai​)−β⋅KL(πθ​∥πref​)

与 PPO 对比一目了然

优势估计
PPO At=rt+γV(st+1)−V(st)At​=rt​+γV(st+1​)−V(st​) ← 需要 critic
GRPO Ai=(ri−mean)/stdAi​=(ri​−mean)/std ← 只需要组内统计量

裁剪机制保留(继承 PPO 的稳定性),KL 惩罚保留(防跑偏),只是 critic 没了

5.5 为什么说 GRPO 是 PPO 的轻量版

  • 模型数从 4 个降到 3 个(策略 + 参考,无 critic)
  • 显存和算力大幅下降 → DeepSeek 敢在 671B 的 R1 上做大规模 RL

5.6 DeepSeek-R1 中的实际用法(GRPO 一战成名)

  • 奖励是规则型的,不是神经网络打分
    • 答案正确性(数学题对错可验证 / 代码跑不跑得过测试)
    • 格式正确(思考过程包在 <think> 标签里)
  • 没有奖励模型!
  • 效果:模型在 RL 过程中自发涌现出"反思"、"自我纠正"、"长思维链"等推理行为
  • 局限:规则奖励只适合可验证任务(数学、代码、逻辑);开放式任务(写作、闲聊)很难写规则,需要结合人工偏好数据

5.8 优缺点

  • ✅ 无 critic → 显存省、训练稳、能跑超大模型
  • ✅ 组内比较天然抗"奖励尺度漂移"(归一化后与绝对分数无关)
  • ✅ 可验证任务上效果拔群(R1 证明了)
  • ❌ 组内比较是相对的:整组都差时可能"矮子里拔高个"
  • ❌ GG 要够大才有统计意义,采样成本高
  • ❌ 奖励函数设计敏感:规则奖励难写,开放式任务效果打折

六、PPO与DPO算法对比表

|-------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|---|
| #### 差异总结 | 特点 | 基于PPO的RLHF | 直接偏好优化 (DPO) | |--------------------------------------|-----------------------------------------|--------------------------------------| | 奖励模型 | 显式训练的独立模型 (rϕrϕ​) | 隐式,直接从偏好似然中得出 | | 训练阶段 | 三阶段:SFT -> RM训练 -> RL微调 (fine-tuning) | 两阶段:SFT -> DPO微调 | | 优化 | 强化学习 (reinforcement learning) (PPO) | 监督学习 (supervised learning)(类似二分类的损失) | | 复杂性 | 较高:需要RM基础设施、RL微调、稳定性管理 | 较低:SFT后单一优化阶段 | | 稳定性 | 可能不稳定(RL方差,奖励欺骗) | 通常更稳定(损失更简单) | | 超参数 (parameter) (hyperparameter) | 较多:PPO参数(裁剪、批次等)、KL系数 ββ、RM参数 | 较少:主要是DPO参数 ββ | | 灵活性 | 较高:可检查/塑造RM,可能多目标 | 较低:直接与偏好数据格式绑定 | | 实现 | 更复杂:独立的RM/RL循环 | 更简单:适合标准微调流程 | | |


七、当前主流 RL 算法格局

基于AI反馈的强化学习 (RLAIF)

尽管收集人类偏好数据是标准RLHF的根本,但这一过程可能消耗大量资源、耗时且难以扩展。生成数百万高质量的人类比较数据需要对标注平台、质量控制和人力时间投入大量资金。基于AI反馈的强化学习 (reinforcement learning)(RLAIF)提供了一种替代方法,它用另一个AI模型(通常是能力很强的大型语言模型LLM)来代替人类标注员,以生成偏好标签。

其核心思想是运用一个现有、可能非常强大的语言模型来评估正在训练的模型的输出。我们不再询问人类"哪个回应更好?",而是指派一个AI模型根据预定义的一套规则、准则或"宪法"来做出判断。

7.1 LLM 对齐领域:三足鼎立

① GRPO 家族 ------ 在线 RL 的绝对主流(推理时代主角)

DeepSeek-R1 带火后,开源社区几乎一统江湖:

模型 采用的算法
DeepSeek-R1 / DeepSeekMath GRPO
Qwen3 GRPO(加了自己的改进)
GLM-4.5 DAPO(GRPO 的改进变体)
Kimi k1.5 长链 RL(同思路)

原因:无 critic、省显存、配合规则奖励(数学/代码可验证)效果拔群,让小团队也能训超大模型。

② DPO 家族 ------ 离线便宜对齐的主流

不需要采样、不需要 RL 循环,一个分类损失搞定:

  • DPO 本体(Llama3、Zephyr 等大量开源模型)
  • 变体:KTO (只要单条好/坏标注)、SimPO (连参考模型都省了)、ORPO(把 SFT 和对齐合并成一步)

地位:预算有限、数据是成对偏好时的首选;也是 RL 之前的"热身"手段。

③ PPO ------ 经典正统,仍未被完全取代

  • OpenAI 系(InstructGPT / ChatGPT / o 系列)一直用 PPO 路线
  • 优势:有 critic 做基线,理论上限更高、更稳,适合"奖励很难定义"的任务
  • 劣势:工程复杂、显存贵,开源社区越来越少直接上 PPO

一句话定位

复制代码
钱多要上限 → PPO;开源要省 → GRPO;数据是偏好对 → DPO

7.2 2025 年以来的新变体(GRPO 的迭代潮)

GRPO 火了之后,大家发现它也有毛病(熵崩塌、组大小要调、训练不稳定),于是涌现一批"修 GRPO"的算法,现在基本成了新的主流选择:

算法 解决的问题 提出方 / 时间
Dr. GRPO G 固定导致训练不稳 → 动态调整组大小 UCLA, 2025.3
DAPO GRPO 熵崩塌、梯度消失 → 解耦裁剪 + 动态采样 + token 级损失 + 过采样 ByteDance/清华, 2025.4
REINFORCE++ 比 GRPO 更简洁,去掉 KL 项用 log 概率直接算,效果还更好 Michael Zhang 等, 2025.5
RLOO 每样本留一法,GRPO 的前身/简化版 Nvidia, 2024
GSPO,SAPO 用一个连续的温度可控门控函数替代离散截断------近策略的 token 梯度完整保留,离策略的平滑衰减而非清零。 QWEN, 2025.11

有意思的现象:REINFORCE++ 火起来后,很多人调侃"转了一圈又回到 REINFORCE"------说明 GRPO 的本质其实就是"带归一化的策略梯度"。

7.3 两个配套趋势

  1. 奖励模型不再流行,规则奖励(RLVR, RL with Verifiable Rewards)成为主流:数学对错、代码能否通过测试,直接可验证
  2. 从结果奖励 ORM 转向过程奖励 PRM:不光看最后答案对不对,还检查推理每一步(数学竞赛题上效果显著)

GRPO 在 2024 年把它与强化学习结合起来,而 DeepSeek-R1-Zero 在 2025 年展示了一个非常有影响力的结果:通过基于结果的 RL,模型可以自己形成越来越复杂的 reasoning behavior,而不需要人工逐步规定"应该怎么思考"。


LoRA + RL 是绝配

RL 比 SFT 更吃显存(rollout 要驻留生成模型 + 训练模型 + 参考模型)。LoRA 只训 1% 参数: ① 训练侧的梯度+优化器状态大减 ② rollout 和训练可共享基座权重 ③ 参考模型直接复用基座(冻结)

2025.12 Mind Lab 用 verl + Megatron-bridge 在 64×H800 上完成了万亿参数模型的 GRPO LoRA 训练------LoRA RL 已验证可上超大模型。

SAPO

SAPO(Stochastic Advantage Policy Optimization)是一种用于大模型强化学习的策略优化方法。训练时,首先让模型针对同一个问题采样多个回答,再通过奖励模型或规则计算每个回答的奖励,并计算相对优势。与GRPO不同,SAPO使用**平滑的门控函数(soft gate)**控制每个token对策略更新的贡献:当新旧策略概率差异较小时,允许较充分更新;差异过大时逐渐降低更新权重,从而避免PPO式硬裁剪带来的梯度突变。最终通过优势加权的策略梯度更新模型,使模型逐渐提高高奖励回答的概率,同时保持训练稳定。

相关推荐
北京GEO服务商余小铁2 小时前
北京美容美发店AIGEO获客落地指南:精准引流、高效锁客、提升到店率
人工智能·深度学习·神经网络
小陈phd2 小时前
大模型微调方式及场景应用介绍
人工智能·深度学习·机器学习
浪兎兎2 小时前
【深度学习】(五)参数调优策略
人工智能·深度学习
阳明山水3 小时前
销量预测2025—2026:技术演进、实证发现与系统架构的系统性综述
人工智能·深度学习·算法·机器学习·架构
就是一顿骚操作3 小时前
SSD:单阶段多尺度目标检测的经典解读
人工智能·深度学习·目标检测·计算机视觉·论文解读
不断学习加努力3 小时前
【一看就会】视觉传感器分类和整理
人工智能·深度学习
饼干哥哥4 小时前
保姆级教程|Codex接入 DeepSeek、Kimi K3后,天下无对手!
人工智能·深度学习·ai编程
richard_first4 小时前
第8章 Feed Forward Network(FFN 网络)
网络·人工智能·深度学习·机器学习·transformer
硅谷秋水5 小时前
ImageWAM:世界-动作模型真的需要视频生成,还是只需要图像编辑?
人工智能·深度学习·计算机视觉·语言模型·机器人·音视频