1. 两篇论文的统一研究框架
1.1 论文定位与核心问题
| 论文 | 研究对象 | 核心问题 | 主要贡献 |
|---|---|---|---|
| REINFORCE++(2025,arXiv:2501.03262) | LLM强化学习策略优化 | 如何在无Critic条件下稳定获得策略梯度 | Global Advantage Normalization、KL约束与稳定的REINFORCE优化 |
| Lessons of Developing PRMs(正式版:2025,arXiv:2501.07301;早期讨论对应2024版本) | Process Reward Model | 如何构造可靠的过程奖励及避免PRM泛化失效 | 分析MC标注、LLM Judge、人工标注及Consensus Filtering |
| 两者联系 | Reward → Advantage → Policy | 奖励是否可靠、奖励如何稳定转化为梯度 | 前者关注Gradient Quality,后者关注Reward Quality |
两篇论文可以统一到LLM推理强化学习链路:推理轨迹 → Reward/PRM → Advantage → 归一化 → KL约束 → Policy Update。PRM主要解决"什么样的推理过程值得奖励",REINFORCE++主要解决"如何将奖励稳定地转化为策略更新"。
1.2 Reward Quality与Gradient Quality
| 层次 | 关键问题 | 对应论文 |
|---|---|---|
| Reward层 | 当前推理步骤是否真正正确 | Lessons of Developing PRMs |
| Advantage层 | Reward如何转换为策略学习信号 | REINFORCE++ |
| Normalization层 | 不同样本的奖励尺度如何统一 | REINFORCE++ |
| KL层 | 策略更新能偏离Reference Model多少 | REINFORCE++ |
| Generalization层 | PRM在分布外是否仍能识别真实错误 | Lessons of Developing PRMs |
核心认识:错误PRM会产生错误Reward,错误Reward会进一步导致错误Policy Update;即使Reward可靠,如果Advantage估计存在统计偏差,策略优化同样可能不稳定。
2. REINFORCE++的宏观框架
2.1 从PPO到Critic-Free RL
传统PPO通常包含Policy Model、Value/Critic Model、Reference Model和Reward Model。Critic负责估计V(s),进而计算Advantage:A_t = Q(s_t,a_t) − V(s_t)。
REINFORCE则直接利用Reward构造策略梯度:∇θJ(θ) = ER · ∇θ log πθ(o\|q)。
REINFORCE++试图减少对Critic的依赖,使训练结构由"Policy + Critic + Reference + Reward"简化为"Policy + Reference + Reward",核心目标是在保持策略梯度有效性的同时降低Value Model带来的计算和训练成本。
2.2 REINFORCE++总体优化链
Prompt → Policy生成Response → Reward Model计算Reward → KL修正 → Advantage估计 → Global Advantage Normalization → Policy Gradient → 更新Policy
| 组件 | 作用 |
|---|---|
| Policy πθ | 生成当前推理轨迹 |
| Reward R | 衡量Response或Reasoning质量 |
| Reference πref | 提供原始策略参照 |
| KL | 限制Policy过度偏离Reference |
| Advantage | 将Reward转换为策略优化方向 |
| Global Normalization | 稳定Advantage尺度并降低统计偏差 |
3. Advantage归一化:REINFORCE++核心
3.1 Local Advantage Normalization的问题
GRPO等方法常在同一个Prompt生成多个Response:q → o₁,o₂,...,o_k,然后在Group内部计算Reward均值和标准差。
公式:A_i^local = (R_i − μ_q) / (σ_q + ε)
其中μ_q和σ_q仅由当前Prompt对应的Group计算。
这种方法的直觉是"比较同一道题的不同答案",但存在统计问题:当Group规模较小时,μ_q和σ_q本身具有较强随机性,尤其σ_q会直接影响Advantage的尺度。
3.2 Local Normalization的统计偏差
Local Normalization的问题并不只是数值稳定性,而是统计估计问题。由于Reward差值R_i − μ_q与Group标准差σ_q来自同一批样本,二者并非独立,因此:
(R_i − μ_q) / σ_q
不能简单理解为"一个固定尺度下的无偏Reward差异"。
Group越小,σ_q越容易受到偶然Reward分布影响,最终导致不同Prompt之间的梯度贡献被重新加权。
| 情况 | Local Normalization可能产生的效果 |
|---|---|
| Group内部Reward差异很小 | σ_q较小,微小差异可能被放大 |
| Group内部Reward差异很大 | σ_q较大,Reward差异可能被压缩 |
| 不同Prompt Reward分布差异大 | 每个Prompt使用不同尺度 |
| Group规模较小 | 均值和标准差估计不稳定 |
因此Local Normalization实际上可能使优化目标从"全局Reward重要性"转变为"当前Prompt内部相对排名"。
3.3 Global Advantage Normalization
REINFORCE++将归一化统计范围从Prompt Group扩大到整个Batch。
公式:A_i^global = (A_i − μ_batch) / (σ_batch + ε)
其中μ_batch和σ_batch由整个Batch的Advantage计算。
其核心变化可以概括为:
Local:每个Prompt单独估计μ_q、σ_q → Global:整个Batch统一估计μ_batch、σ_batch。
当Batch规模增大时,Batch统计量更加接近真实数据分布的期望与方差,因此可以降低小Group统计量带来的随机性。
3.4 为什么Global Normalization更稳定
| 对比维度 | Local Normalization | Global Normalization |
|---|---|---|
| 统计范围 | 单个Prompt Group | 整个Batch |
| 均值估计 | 小样本 | 大样本 |
| 方差稳定性 | 容易波动 | 相对稳定 |
| Prompt间尺度 | 不同Prompt不同 | Batch统一 |
| 梯度贡献 | 容易受Group方差影响 | 更接近全局Reward尺度 |
| 核心思想 | 相对比较 | 全局标准化 |
关键逻辑:Batch样本数增加 → μ_batch、σ_batch估计更加稳定 → Advantage尺度更加稳定 → 梯度估计方差降低、归一化偏差减弱。
因此,Global Advantage Normalization不是简单的"数值技巧",而是对Policy Gradient估计器统计性质的改进。
3.5 REINFORCE++ with Baseline
REINFORCE++还可以使用Group Baseline。
首先计算:
A'_i = R_i − mean_group(R)
随后不再使用Group标准差进行归一化,而是在Batch层面进行:
A_norm = (A'_i − μ_batch) / (σ_batch + ε)
因此其结构应理解为:
Group Baseline负责减去局部基准 → Global Normalization负责统一全局尺度。
这一点不能简单理解为重新使用GRPO的Local Normalization。
4. KL约束与策略稳定性
4.1 KL在LLM RL中的作用
如果只最大化Reward:
max ER
Policy可能不断远离原始SFT模型,导致语言能力退化、策略漂移甚至Reward Hacking。
因此通常加入KL约束:
J(θ) = ER − β KL(πθ || πref)
其中πθ是当前Policy,πref是Reference Policy,β控制KL惩罚强度。
| 项目 | 作用 |
|---|---|
| Reward | 推动Policy寻找高奖励行为 |
| KL | 限制Policy偏离原始模型 |
| β | 控制Reward提升与Policy漂移之间的权衡 |
| Reference Model | 提供策略更新的参照点 |
可以理解为:Reward负责"往哪里走",KL负责"不要走得太远"。
4.2 Token-Level KL估计
LLM生成Response时可以在每个Token位置比较当前Policy与Reference Policy。
公式:KL_t相关项 ≈ log πθ(o_t|q,o_<t) − log πref(o_t|q,o_<t)
通过Token-level的Log Probability差异,可以构造完整Response层面的KL惩罚。
因此:
Token概率差异 → 累积形成Response级KL → 加入Reward/Advantage → 约束Policy Update。
4.3 KL Estimator的重要性
理论KL需要对整个Vocabulary分布计算,但LLM Vocabulary规模巨大,因此实际训练通常采用采样估计器。
REINFORCE++讨论不同KL估计方式,并强调KL估计器不仅影响KL数值本身,也会影响梯度稳定性。
核心认识:KL estimator不是单纯的监控指标,而是Policy Gradient的一部分;估计器的偏差或高方差会进一步传递到最终Policy Update。
因此分析RL训练时不能只观察"KL是否变大",还应该同时观察:
Reward变化 → KL变化 → Policy性能变化。
5. PRM的数据构造与泛化风险
5.1 PRM与ORM的区别
| 模型 | 监督对象 | 判断内容 |
|---|---|---|
| ORM | 最终Outcome | 最终答案是否正确 |
| PRM | Reasoning Process | 每个推理步骤是否正确 |
| ORM优势 | 标注简单 | 最终结果明确 |
| PRM优势 | 能定位过程错误 | 更适合多步推理过程监督 |
PRM的目标不是简单预测"最终答案对不对",而是判断当前Reasoning Step本身是否正确。
5.2 Monte Carlo标注方法
传统MC方法可以从某个中间Step继续采样多个Completion,然后观察最终答案是否正确。
基本逻辑:
当前Step → 多次继续生成 → 判断最终答案 → 用最终成功率估计当前Step质量。
这种方法实际估计的是:
P(final answer correct | current step)
但PRM真正需要学习的是:
P(current step correct | reasoning context)
二者并不等价。
5.3 MC估计造成的标签噪声
| 情况 | 当前Step | 最终答案 | MC可能产生的标签 |
|---|---|---|---|
| A | 正确 | 正确 | 正确 |
| B | 正确 | 错误 | 可能错误标注 |
| C | 错误 | 正确 | 可能正确标注 |
| D | 错误 | 错误 | 错误 |
特别重要的是B和C。
正确Step可能因为后续推理失败而被标记为负样本;错误Step也可能因为后续修正而最终得到正确答案。
因此:
最终结果正确 ≠ 当前推理步骤正确。
这构成MC式PRM数据构造的根本风险。
6. PRM泛化与Reward Hacking
6.1 Process-to-Outcome Shift
PRM最危险的问题之一,是模型逐渐学习一个Shortcut:
最终答案正确 → 前面推理过程大概率正确。
这样训练出来的模型虽然可能在In-Domain测试中表现良好,但面对复杂或分布外推理时,可能无法真正定位过程错误。
其退化方向可以概括为:
Process Reward Model → 学习Outcome Shortcut → 更关注Final Answer → 向Outcome Reward Model退化。
论文观察到,在Best-of-N等优化环境下,PRM的低分判断容易集中在最终答案步骤附近,这说明模型可能逐渐从"过程判断"偏向"结果判断"。
6.2 为什么PRM泛化风险会被RL放大
普通分类模型出现错误标签时,主要表现为分类准确率下降。
但PRM作为RL Reward Model时:
PRM偏差 → Policy发现高PRM分数模式 → Policy主动强化该模式 → PRM Score继续升高 → 真实Reasoning质量可能下降。
因此PRM的错误并不会静态存在,而可能被RL优化过程主动放大。
这就是PRM与普通分类器最大的区别之一。
6.3 Best-of-N评价风险
Best-of-N的基本过程是:
一个Prompt → 生成N条Reasoning → PRM评分 → 选择最高分Response。
如果PRM存在Shortcut,Best-of-N可能不断选择:
"PRM认为正确"但"真实过程并不正确"的推理。
因此仅使用Best-of-N Accuracy评价PRM是不充分的。
| 评价层次 | 关注内容 |
|---|---|
| Response-Level | 最终答案是否正确 |
| Step-Level | PRM是否正确定位错误Step |
| In-Domain | 熟悉数据分布上的性能 |
| Out-of-Domain | 新问题、新推理模式上的泛化 |
| BoN性能 | PRM用于搜索时的实际效果 |
真正可靠的PRM评价需要同时考虑Outcome能力与Process Verification能力。
7. Consensus Filtering与两篇论文的统一理解
7.1 Consensus Filtering
针对MC标注存在的噪声问题,Lessons of Developing PRMs提出Consensus Filtering。
基本过程:
MC标注 → LLM Judge独立判断 → 比较两者对错误Step的判断 → 达成一致 → 保留高可信样本 → 训练PRM。
核心思想不是单纯扩大数据量,而是提高标签可靠性。
论文实验中,经过Consensus Filtering后,约860K样本最终保留约40%,说明大量原始数据可能存在不确定性或标注冲突。
7.2 为什么少量高质量数据可能优于大量噪声数据
| 数据方案 | 特征 | 潜在影响 |
|---|---|---|
| 大规模MC数据 | 数据量大但标签噪声较多 | 容易学习Shortcut |
| 高质量Consensus数据 | 数据量减少但标签更加一致 | 更有利于学习真正Process规律 |
| 核心原则 | Data Quantity ≠ Data Quality | 标签质量决定Reward可靠性 |
对于PRM而言,错误的Step Label会直接改变模型对Reasoning Pattern的判断,因此"增加数据"不能替代"提高标签质量"。
7.3 两篇论文的统一闭环
PRM可靠性链:Reasoning → Step Label → PRM → Reward。
REINFORCE++优化链:Reward → Advantage → Global Normalization → KL-constrained Policy Update。
完整关系:
高质量Reasoning数据 → 可靠PRM → 可靠Reward → 稳定Advantage → Global Normalization → KL约束 → Policy优化。
因此两篇论文分别控制RL系统中的两个关键误差源:
| 误差源 | 典型问题 | 对应解决思路 |
|---|---|---|
| Reward误差 | PRM标签噪声、Outcome Shortcut、OOD泛化失败 | Consensus Filtering、Step-Level Evaluation |
| Gradient误差 | Local Normalization统计偏差、Advantage尺度不稳定 | Global Advantage Normalization |
| Policy Drift | Reward最大化导致策略过度偏移 | KL Regularization |
| Evaluation误差 | BoN高分不代表Process正确 | Response-Level + Step-Level联合评价 |
最终可以将两篇论文压缩为一条核心认知:
PRM决定"什么行为值得学习" → REINFORCE++决定"如何稳定地学习这些行为" → KL控制"学习过程中不要偏离Reference过远" → Global Normalization控制"Reward进入Gradient时的统计尺度" → Step-Level/OOD Evaluation检验"PRM是否真的学到了推理过程"。