论文阅读-REINFORCE++与Lessons of Developing PRMs

1. 两篇论文的统一研究框架

1.1 论文定位与核心问题

论文 研究对象 核心问题 主要贡献
REINFORCE++(2025,arXiv:2501.03262) LLM强化学习策略优化 如何在无Critic条件下稳定获得策略梯度 Global Advantage Normalization、KL约束与稳定的REINFORCE优化
Lessons of Developing PRMs(正式版:2025,arXiv:2501.07301;早期讨论对应2024版本) Process Reward Model 如何构造可靠的过程奖励及避免PRM泛化失效 分析MC标注、LLM Judge、人工标注及Consensus Filtering
两者联系 Reward → Advantage → Policy 奖励是否可靠、奖励如何稳定转化为梯度 前者关注Gradient Quality,后者关注Reward Quality

两篇论文可以统一到LLM推理强化学习链路:推理轨迹 → Reward/PRM → Advantage → 归一化 → KL约束 → Policy Update。PRM主要解决"什么样的推理过程值得奖励",REINFORCE++主要解决"如何将奖励稳定地转化为策略更新"。

1.2 Reward Quality与Gradient Quality

层次 关键问题 对应论文
Reward层 当前推理步骤是否真正正确 Lessons of Developing PRMs
Advantage层 Reward如何转换为策略学习信号 REINFORCE++
Normalization层 不同样本的奖励尺度如何统一 REINFORCE++
KL层 策略更新能偏离Reference Model多少 REINFORCE++
Generalization层 PRM在分布外是否仍能识别真实错误 Lessons of Developing PRMs

核心认识:错误PRM会产生错误Reward,错误Reward会进一步导致错误Policy Update;即使Reward可靠,如果Advantage估计存在统计偏差,策略优化同样可能不稳定。

2. REINFORCE++的宏观框架

2.1 从PPO到Critic-Free RL

传统PPO通常包含Policy Model、Value/Critic Model、Reference Model和Reward Model。Critic负责估计V(s),进而计算Advantage:A_t = Q(s_t,a_t) − V(s_t)。

REINFORCE则直接利用Reward构造策略梯度:∇θJ(θ) = ER · ∇θ log πθ(o\|q)

REINFORCE++试图减少对Critic的依赖,使训练结构由"Policy + Critic + Reference + Reward"简化为"Policy + Reference + Reward",核心目标是在保持策略梯度有效性的同时降低Value Model带来的计算和训练成本。

2.2 REINFORCE++总体优化链

Prompt → Policy生成Response → Reward Model计算Reward → KL修正 → Advantage估计 → Global Advantage Normalization → Policy Gradient → 更新Policy

组件 作用
Policy πθ 生成当前推理轨迹
Reward R 衡量Response或Reasoning质量
Reference πref 提供原始策略参照
KL 限制Policy过度偏离Reference
Advantage 将Reward转换为策略优化方向
Global Normalization 稳定Advantage尺度并降低统计偏差

3. Advantage归一化:REINFORCE++核心

3.1 Local Advantage Normalization的问题

GRPO等方法常在同一个Prompt生成多个Response:q → o₁,o₂,...,o_k,然后在Group内部计算Reward均值和标准差。

公式:A_i^local = (R_i − μ_q) / (σ_q + ε)

其中μ_q和σ_q仅由当前Prompt对应的Group计算。

这种方法的直觉是"比较同一道题的不同答案",但存在统计问题:当Group规模较小时,μ_q和σ_q本身具有较强随机性,尤其σ_q会直接影响Advantage的尺度。

3.2 Local Normalization的统计偏差

Local Normalization的问题并不只是数值稳定性,而是统计估计问题。由于Reward差值R_i − μ_q与Group标准差σ_q来自同一批样本,二者并非独立,因此:

(R_i − μ_q) / σ_q

不能简单理解为"一个固定尺度下的无偏Reward差异"。

Group越小,σ_q越容易受到偶然Reward分布影响,最终导致不同Prompt之间的梯度贡献被重新加权。

情况 Local Normalization可能产生的效果
Group内部Reward差异很小 σ_q较小,微小差异可能被放大
Group内部Reward差异很大 σ_q较大,Reward差异可能被压缩
不同Prompt Reward分布差异大 每个Prompt使用不同尺度
Group规模较小 均值和标准差估计不稳定

因此Local Normalization实际上可能使优化目标从"全局Reward重要性"转变为"当前Prompt内部相对排名"。

3.3 Global Advantage Normalization

REINFORCE++将归一化统计范围从Prompt Group扩大到整个Batch。

公式:A_i^global = (A_i − μ_batch) / (σ_batch + ε)

其中μ_batch和σ_batch由整个Batch的Advantage计算。

其核心变化可以概括为:

Local:每个Prompt单独估计μ_q、σ_q → Global:整个Batch统一估计μ_batch、σ_batch。

当Batch规模增大时,Batch统计量更加接近真实数据分布的期望与方差,因此可以降低小Group统计量带来的随机性。

3.4 为什么Global Normalization更稳定

对比维度 Local Normalization Global Normalization
统计范围 单个Prompt Group 整个Batch
均值估计 小样本 大样本
方差稳定性 容易波动 相对稳定
Prompt间尺度 不同Prompt不同 Batch统一
梯度贡献 容易受Group方差影响 更接近全局Reward尺度
核心思想 相对比较 全局标准化

关键逻辑:Batch样本数增加 → μ_batch、σ_batch估计更加稳定 → Advantage尺度更加稳定 → 梯度估计方差降低、归一化偏差减弱。

因此,Global Advantage Normalization不是简单的"数值技巧",而是对Policy Gradient估计器统计性质的改进。

3.5 REINFORCE++ with Baseline

REINFORCE++还可以使用Group Baseline。

首先计算:

A'_i = R_i − mean_group(R)

随后不再使用Group标准差进行归一化,而是在Batch层面进行:

A_norm = (A'_i − μ_batch) / (σ_batch + ε)

因此其结构应理解为:

Group Baseline负责减去局部基准 → Global Normalization负责统一全局尺度。

这一点不能简单理解为重新使用GRPO的Local Normalization。

4. KL约束与策略稳定性

4.1 KL在LLM RL中的作用

如果只最大化Reward:

max ER

Policy可能不断远离原始SFT模型,导致语言能力退化、策略漂移甚至Reward Hacking。

因此通常加入KL约束:

J(θ) = ER − β KL(πθ || πref)

其中πθ是当前Policy,πref是Reference Policy,β控制KL惩罚强度。

项目 作用
Reward 推动Policy寻找高奖励行为
KL 限制Policy偏离原始模型
β 控制Reward提升与Policy漂移之间的权衡
Reference Model 提供策略更新的参照点

可以理解为:Reward负责"往哪里走",KL负责"不要走得太远"。

4.2 Token-Level KL估计

LLM生成Response时可以在每个Token位置比较当前Policy与Reference Policy。

公式:KL_t相关项 ≈ log πθ(o_t|q,o_<t) − log πref(o_t|q,o_<t)

通过Token-level的Log Probability差异,可以构造完整Response层面的KL惩罚。

因此:

Token概率差异 → 累积形成Response级KL → 加入Reward/Advantage → 约束Policy Update。

4.3 KL Estimator的重要性

理论KL需要对整个Vocabulary分布计算,但LLM Vocabulary规模巨大,因此实际训练通常采用采样估计器。

REINFORCE++讨论不同KL估计方式,并强调KL估计器不仅影响KL数值本身,也会影响梯度稳定性。

核心认识:KL estimator不是单纯的监控指标,而是Policy Gradient的一部分;估计器的偏差或高方差会进一步传递到最终Policy Update。

因此分析RL训练时不能只观察"KL是否变大",还应该同时观察:

Reward变化 → KL变化 → Policy性能变化。

5. PRM的数据构造与泛化风险

5.1 PRM与ORM的区别

模型 监督对象 判断内容
ORM 最终Outcome 最终答案是否正确
PRM Reasoning Process 每个推理步骤是否正确
ORM优势 标注简单 最终结果明确
PRM优势 能定位过程错误 更适合多步推理过程监督

PRM的目标不是简单预测"最终答案对不对",而是判断当前Reasoning Step本身是否正确。

5.2 Monte Carlo标注方法

传统MC方法可以从某个中间Step继续采样多个Completion,然后观察最终答案是否正确。

基本逻辑:

当前Step → 多次继续生成 → 判断最终答案 → 用最终成功率估计当前Step质量。

这种方法实际估计的是:

P(final answer correct | current step)

但PRM真正需要学习的是:

P(current step correct | reasoning context)

二者并不等价。

5.3 MC估计造成的标签噪声

情况 当前Step 最终答案 MC可能产生的标签
A 正确 正确 正确
B 正确 错误 可能错误标注
C 错误 正确 可能正确标注
D 错误 错误 错误

特别重要的是B和C。

正确Step可能因为后续推理失败而被标记为负样本;错误Step也可能因为后续修正而最终得到正确答案。

因此:

最终结果正确 ≠ 当前推理步骤正确。

这构成MC式PRM数据构造的根本风险。

6. PRM泛化与Reward Hacking

6.1 Process-to-Outcome Shift

PRM最危险的问题之一,是模型逐渐学习一个Shortcut:

最终答案正确 → 前面推理过程大概率正确。

这样训练出来的模型虽然可能在In-Domain测试中表现良好,但面对复杂或分布外推理时,可能无法真正定位过程错误。

其退化方向可以概括为:

Process Reward Model → 学习Outcome Shortcut → 更关注Final Answer → 向Outcome Reward Model退化。

论文观察到,在Best-of-N等优化环境下,PRM的低分判断容易集中在最终答案步骤附近,这说明模型可能逐渐从"过程判断"偏向"结果判断"。

6.2 为什么PRM泛化风险会被RL放大

普通分类模型出现错误标签时,主要表现为分类准确率下降。

但PRM作为RL Reward Model时:

PRM偏差 → Policy发现高PRM分数模式 → Policy主动强化该模式 → PRM Score继续升高 → 真实Reasoning质量可能下降。

因此PRM的错误并不会静态存在,而可能被RL优化过程主动放大。

这就是PRM与普通分类器最大的区别之一。

6.3 Best-of-N评价风险

Best-of-N的基本过程是:

一个Prompt → 生成N条Reasoning → PRM评分 → 选择最高分Response。

如果PRM存在Shortcut,Best-of-N可能不断选择:

"PRM认为正确"但"真实过程并不正确"的推理。

因此仅使用Best-of-N Accuracy评价PRM是不充分的。

评价层次 关注内容
Response-Level 最终答案是否正确
Step-Level PRM是否正确定位错误Step
In-Domain 熟悉数据分布上的性能
Out-of-Domain 新问题、新推理模式上的泛化
BoN性能 PRM用于搜索时的实际效果

真正可靠的PRM评价需要同时考虑Outcome能力与Process Verification能力。

7. Consensus Filtering与两篇论文的统一理解

7.1 Consensus Filtering

针对MC标注存在的噪声问题,Lessons of Developing PRMs提出Consensus Filtering。

基本过程:

MC标注 → LLM Judge独立判断 → 比较两者对错误Step的判断 → 达成一致 → 保留高可信样本 → 训练PRM。

核心思想不是单纯扩大数据量,而是提高标签可靠性。

论文实验中,经过Consensus Filtering后,约860K样本最终保留约40%,说明大量原始数据可能存在不确定性或标注冲突。

7.2 为什么少量高质量数据可能优于大量噪声数据

数据方案 特征 潜在影响
大规模MC数据 数据量大但标签噪声较多 容易学习Shortcut
高质量Consensus数据 数据量减少但标签更加一致 更有利于学习真正Process规律
核心原则 Data Quantity ≠ Data Quality 标签质量决定Reward可靠性

对于PRM而言,错误的Step Label会直接改变模型对Reasoning Pattern的判断,因此"增加数据"不能替代"提高标签质量"。

7.3 两篇论文的统一闭环

PRM可靠性链:Reasoning → Step Label → PRM → Reward。

REINFORCE++优化链:Reward → Advantage → Global Normalization → KL-constrained Policy Update。

完整关系:

高质量Reasoning数据 → 可靠PRM → 可靠Reward → 稳定Advantage → Global Normalization → KL约束 → Policy优化。

因此两篇论文分别控制RL系统中的两个关键误差源:

误差源 典型问题 对应解决思路
Reward误差 PRM标签噪声、Outcome Shortcut、OOD泛化失败 Consensus Filtering、Step-Level Evaluation
Gradient误差 Local Normalization统计偏差、Advantage尺度不稳定 Global Advantage Normalization
Policy Drift Reward最大化导致策略过度偏移 KL Regularization
Evaluation误差 BoN高分不代表Process正确 Response-Level + Step-Level联合评价

最终可以将两篇论文压缩为一条核心认知:

PRM决定"什么行为值得学习" → REINFORCE++决定"如何稳定地学习这些行为" → KL控制"学习过程中不要偏离Reference过远" → Global Normalization控制"Reward进入Gradient时的统计尺度" → Step-Level/OOD Evaluation检验"PRM是否真的学到了推理过程"。

相关推荐
小马过河R1 小时前
开篇|3天从0到1入门AI应用开发
人工智能·语言模型·llm·agent·ai编程·deepagent
Htr_1 小时前
Creem 2.0 使用指南:面向 AI 构建时代的资金平台
android·数据库·人工智能·ui·photoshop
古希腊掌管代码的神THU1 小时前
【清华代码熊】DeepSeek-V4.1-Flash 多模态架构解析
人工智能·深度学习·机器学习·自然语言处理·面试
咬代码的兽1 小时前
Qwen3.8-Omni-Flash 发布:1M 上下文 + 原生全模态,四步跑通音视频 API
人工智能·大模型·api·qwen
论文复现现场1 小时前
ComfyUI 怎么同时调用 4 张/8 张 RTX 4090?AI 视频批量生成的多实例队列与 Python 调度方案
人工智能·python·comfyui·rtx4090
泡海椒1 小时前
评分系统最佳实践:JQuick-Java实现权重、阈值动态配置评分
java·人工智能·python
云上工程笔记1 小时前
星图AstraFlow接入MiniMax-H3/H3-Max实战:文字/单图生成视频怎么用?附提示词与选型
人工智能
7177771 小时前
国内组件安全扫描工具选哪家:2026年主流方案对比与选型指南
人工智能·gitee
JeJe同学2 小时前
深度学习基础:什么是上采样和下采样?
深度学习