CO-REWARDING: STABLE SELF-SUPERVISED RL FOR ELICITING REASONING IN LARGE LANGUAGE MODELS
标题 *:Co-rewarding: 激发大语言模型推理能力的稳定自监督强化学习
链接 :https://github.com/tmlr-group/Co-rewarding
发表会议:ICLR 2026
摘要
本文提出的 Co-rewarding 是一种稳定自监督强化学习框架,旨在解决大语言模型自奖励训练中的崩溃问题。它通过两种并行方案打破单一视角监督:数据侧 (Co-rewarding-I)对同一问题生成语义等价改写,让原问题与改写问题互相监督,迫使模型掌握问题本质;模型侧(Co-rewarding-II)引入缓慢更新的教师模型,提供与当前策略解耦的稳定监督信号。两者结合的 Co-rewarding-III 进一步增强了抗投机能力。实验表明,该方法在 MATH、GSM8K 等基准上不仅显著优于其他自奖励基线、保持训练稳定,甚至在 GSM8K 上超越了使用真实标签的传统方法,同时展现出良好的跨领域泛化能力。
一、背景
-
为进一步激发模型在复杂场景下的推理能力,研究人员提出可验证奖励的强化学习(RLVR)用于后训练,该方法可利用程序执行结果、数学等价性等外部可验证信号。尽管取得了显著的提升,但RLVR对高质量真实标注(GT)标签的依赖成为了一大瓶颈,推动学界开始探索基于无标注数据的自奖励方法。
- 一种方法是利用内部信号(例如熵与自置信度self-certainty)来增强模型推理时的置信度。
- 另一种方法则寻求答案层面的一致性,以此构建伪标签作为奖励依据。
-
尽管这类自奖励方法初期效果尚可,但往往会出现不可忽视的训练崩溃 问题,崩溃源于自洽错觉下的奖励投机:奖励信号由策略模型单单基于数据视角在内部生成,在训练过程中容易陷入无意义的解。具体而言:
- 对于基于熵(通过最小化模型输出分布的熵来鼓励模型生成更加确定、自信的预测 )或置信度(最大化模型输出分布与均匀分布之间的KL散度,散度越大,表示模型输出分布离均匀分布越远,即模型对某个输出更加"确信")的奖励机制,策略模型可能会将概率集中在一小部分token上,生成能够最小化熵或最大化自身置信度的重复文本。
- 对于基于一致性的奖励机制,策略模型可能会收敛得到一个在多轮采样输出中一致性很高但本身错误的答案。
-
总体而言,该策略模型持续降低不确定性,却无法让正确率获得稳定提升,抬高了奖励值的同时削弱了探索能力与多样性。当出现一种持续性的投机策略时,最终就会彻底失效。

-
因此,论文提出 Co-rewarding 方法------一种自监督RL框架,受自监督学习启发,旨在从其他视角获取互补监督信息:
(1) 协同奖励‑I (Co-rewarding-I) :数据方面的实现,通过语义相似问题之间的对比一致性构建奖励,两类问题互相为对方提供伪标签。
(2) 协同奖励‑II (Co-rewarding-II) :模型方面的实现,引入策略可动态更新的额外教师模型,提供不受当前在线策略影响的稳定伪标签。
(3) 协同奖励‑III (Co-rewarding-III):组合实现方案,该方案融合数据侧交叉监督与模型侧自蒸馏,以进一步提升模型性能。
-
在多个数据集上开展的大量实验表明,相较于Qwen3/2.5与Llama等LLM,Co-rewarding有效地减轻了训练崩溃,形成了稳定的自监督RL训练。值得注意的是,协同奖励‑I 与协同奖励‑II 在多种实验条件下的表现均可达到甚至超过基于真实标签开展训练的效果,例如在 GSM8K 数据集上最高取得 94.01% 的 Pass@1 指标。
二、方法
(一)原理:Invariance Beyond the Single-View (超越单一视角的不变性)
- 自奖励方法存在一个根本性矛盾:模型从自身输出中获取监督信号,不可避免地会让监督信号与模型策略交织在一起,导致崩溃的风险。真正的推理能力并不能简单等同于答案的正确性,而应当使训练信号在不同数据视角下保持有效,或者在模型随时间演变的过程中保持一致,为自监督强化学习提供更为可靠的依托基础。在这一方面,稳定性源于不变性。这种不变性避免模型针对数据的表层变化进行推理,并在训练过程中引导模型走向越来越可靠的推理路径。
- 上述想法引出了论文的 Co-rewarding 框架,核心思想是将self-supervised RL建立在不变性之上,而非可靠性存疑的单视角反馈。论文通过两种方式以及一种组合版本实现:在数据侧强制实现类比不变性(Co‑rewarding‑I),在模型侧借助时间不变性实现监督解耦(Co‑rewarding‑II),并将上述两种机制整合为统一实例(Co‑rewarding‑III)。
(二)Co-rewarding框架的两种实现

1. Co-rewarding-I (数据侧)
- 核心思想 :假设LLM在激发推理能力时具备类比不变归纳特性 (an analogy-invariance inductive property),即具有相同数学本质、仅表层形式存在差异的问题(例如通过释义、替换背景信息或调整表述格式),应当生成有效性相当且相似的推理结果。
- 实现方式 :
- 对每个原始问题,利用一个强大的LLM(如Qwen3-32B)生成一个语义等价的改写版本,构建数据集 ( D' )。
- 对于原始问题 ( x ) 和改写问题 ( x' ),分别由策略模型进行多轮采样,生成一组输出 {yi}i=1G\{y_i\}_{i=1}^G{yi}i=1G 和{yi′}i=1G\{y'i\}{i=1}^G{yi′}i=1G。
- 对两组输出分别进行多数投票 ,获得伪标签 yvy_vyv 和 yv′y'vyv′:
yv←argmaxy∗∑i=1GIans(yi)=ans(y∗)y_v \leftarrow \arg\max{y^*} \sum_{i=1}^G \mathbb{I}\\text{ans}(y_i) = \\text{ans}(y\^\*)yv←argmaxy∗∑i=1GIans(yi)=ans(y∗)
yv′←argmaxy∗∑i=1GIans(yi′)=ans(y∗)y'v \leftarrow \arg\max{y^*} \sum_{i=1}^G \mathbb{I}\\text{ans}(y'_i) = \\text{ans}(y\^\*)yv′←argmaxy∗∑i=1GIans(yi′)=ans(y∗) - 通过交叉引用 的方式计算奖励:使用 ( y'_v ) 作为标签来计算原始问题输出的奖励,反之亦然。具体地,相对优势通过以下方式估计:
A^i=r(yv′,yi)−mean({r(yv′,yi)}i=1G)std({r(yv′,yi)}i=1G)\hat{A}_i = \frac{r(y'_v, y_i) - \text{mean}(\{r(y'v, y_i)\}{i=1}^G)}{\text{std}(\{r(y'v, y_i)\}{i=1}^G)}A^i=std({r(yv′,yi)}i=1G)r(yv′,yi)−mean({r(yv′,yi)}i=1G)
A^i′=r(yv,yi′)−mean({r(yv,yi′)}i=1G)std({r(yv,yi′)}i=1G)\hat{A}'_i = \frac{r(y_v, y'_i) - \text{mean}(\{r(y_v, y'i)\}{i=1}^G)}{\text{std}(\{r(y_v, y'i)\}{i=1}^G)}A^i′=std({r(yv,yi′)}i=1G)r(yv,yi′)−mean({r(yv,yi′)}i=1G) - 总目标是两个视角目标的和:
JCo-rewarding-I(θ)=Ex∈D, {yi}i=1G∼πθold(⋅∣x)Rθ(A^)⏟Joriginal(θ)+Ex′∈D′, {yi′}i=1G∼πθold(⋅∣x′)Rθ(A^′)⏟Jrephrased(θ)J_{\text{Co-rewarding-I}}(\theta)=\underbrace{\mathbb{E}{x\in\mathcal{D},\, \{y_i\}{i=1}^{G} \sim \pi_{\theta_{\text{old}}}(\cdot\mid x)}\mathcal{R}\theta(\hat{A})}{\mathcal{J}{\text{original}}(\theta)}+\underbrace{\mathbb{E}{x'\in\mathcal{D}',\, \{y_i'\}{i=1}^{G} \sim \pi{\theta_{\text{old}}}(\cdot\mid x')}\mathcal{R}\theta(\hat{A}')}{\mathcal{J}_{\text{rephrased}}(\theta)}JCo-rewarding-I(θ)=Joriginal(θ) Ex∈D,{yi}i=1G∼πθold(⋅∣x)Rθ(A^)+Jrephrased(θ) Ex′∈D′,{yi′}i=1G∼πθold(⋅∣x′)Rθ(A^′)
- 作用:通过类比一致性(contrastive agreement),引入数据侧的"集体有效性验证",迫使模型在不同形式的同一问题上达成一致,缓解单一视角下的奖励投机。
2. Co-rewarding-II (模型侧:时间不变性)
-
核心思想 :从模型侧引入辅助的教师模型,该模型与当前在线策略解耦,并提供稳定的伪标签。
-
实现方式 :
-
标准RL中的参考模型πref\pi_{\text{ref}}πref通常是一个固定的初始模型,用于计算KL散度,防止新策略模型偏离太远,此处,将其作为教师模型。该教师模型通过指数移动平均(EMA)更新:
π~ref(k)←α(k)⋅π~ref(k−1)+(1−α(k))⋅πθold(k)\tilde{\pi}{\text{ref}}^{(k)} \leftarrow \alpha^{(k)} \cdot \tilde{\pi}{\text{ref}}^{(k-1)} + (1 - \alpha^{(k)}) \cdot \pi_{\theta_{\text{old}}}^{(k)}π~ref(k)←α(k)⋅π~ref(k−1)+(1−α(k))⋅πθold(k)
α(k)=1−(αend−αstart)2(1+cos(πkK))\alpha(k) = 1 − \frac{(\alpha_{\text{end}} − \alpha_{\text{start}})}{2}\left(1 + \cos\left( \frac{\pi k}{K} \right)\right)α(k)=1−2(αend−αstart)(1+cos(Kπk))
式中:k为当前训练步数,K为总的训练步数,αstart\alpha_{start}αstart:初始EMA系数(如0.99),αend\alpha_{end}αend:最终EMA系数(如0.9999),α(k)∈(0,1)\alpha(k) \in (0, 1)α(k)∈(0,1) 为指数移动平均EMA权重,按照余弦退火策略从 αstart\alpha_{\text{start}}αstart 更新至 αend\alpha_{\text{end}}αend;该设置使得教师模型在训练初期更新速度较快,之后更新逐步放缓,实现平滑演变,同时与当前在线策略保持时间解耦。
通过EMA更新的目的是,若Teacher模型不变,随着student模型更新,Teacher会过时;若更新太快(直接同步Student),又退化成自奖励模式。EMA让Teacher模型=大部分的自己+小部分的学生模型。
-
对于问题 ( x ),策略模型采样输出{yi}i=1G\{y_i\}_{i=1}^G{yi}i=1G,教师模型独立采样输出 {y~j}j=1G~\{\tilde{y}j\}{j=1}^{\tilde{G}}{y~j}j=1G~。
-
从教师模型的输出中通过多数投票获得伪标签 y~v\tilde{y}_vy~v。
-
使用该伪标签计算策略模型输出的相对优势:
A^i(k)=r(y~v(k),yi)−mean({r(y~v(k),yi)}i=1G)std({r(y~v(k),yi)}i=1G)\hat{A}^{(k)}_i = \frac{r(\tilde{y}^{(k)}_v, y_i) - \text{mean}(\{r(\tilde{y}^{(k)}v, y_i)\}{i=1}^G)}{\text{std}(\{r(\tilde{y}^{(k)}v, y_i)\}{i=1}^G)}A^i(k)=std({r(y~v(k),yi)}i=1G)r(y~v(k),yi)−mean({r(y~v(k),yi)}i=1G)
-
目标函数为:
JCo-rewarding-II(k)(θ)=Ex∈D, {yi}i=1G∼πθold(k)(⋅∣x)⏟policy student rollout, {y~j}j=1G~∼π~ref(k)(⋅∣x)⏟reference teacher rolloutRθ(A\^(k)),J^{(k)}{\text{Co-rewarding-II}}(\theta)=\mathbb{E}{\underbrace{x\in\mathcal{D},\, \{y_i\}{i=1}^{G} \sim \pi^{(k)}{\theta_{\text{old}}}(\cdot\mid x)}{\text{policy student rollout}},\;\underbrace{\{\tilde{y}j\}{j=1}^{\tilde{G}} \sim \tilde{\pi}^{(k)}{\text{ref}}(\cdot\mid x)}_{\text{reference teacher rollout}}}\Big\\mathcal{R}_\\theta\\big(\\hat{A}\^{(k)}\\big)\\big,JCo-rewarding-II(k)(θ)=Epolicy student rollout x∈D,{yi}i=1G∼πθold(k)(⋅∣x),reference teacher rollout {y~j}j=1G~∼π~ref(k)(⋅∣x)Rθ(A\^(k)),
-
-
作用:通过一个缓慢更新的教师模型来提供监督信号,打破了现有自奖励方法中单步在线反馈的循环。教师模型与当前策略的解耦,使得模型难以投机那些低熵的捷径或虚假的一致性,从而稳定了训练过程。
3. Co-rewarding-III (组合实现)
- 核心思想:将数据侧的类比不变性与模型侧的时间不变性结合,形成更强的抗投机能力。
- 实现方式 :
- 对于原始问题 ( x ) 和改写问题 ( x' ),策略模型分别采样输出 ( {y_i} ) 和 ( {y'_i} )。
- 教师模型(EMA更新)也分别为两个问题采样输出 ( {\tilde{y}_j} ) 和 ( {\tilde{y}'_j} )。
- 使用教师模型在改写问题 上的输出生成伪标签 ( \tilde{y}'_v ),来监督策略模型在原始问题上的输出;对称地,使用教师模型在原始问题上的输出 ( \tilde{y}_v ),来监督策略模型在改写问题上的输出。
- 目标函数是两个方向的结合:
JCo-rewarding-III(k)(θ)=ERθ(A\^(k))+ERθ(A\^′(k))J_{\text{Co-rewarding-III}}^{(k)}(\theta) = \mathbb{E}\\mathcal{R}_\\theta(\\hat{A}\^{(k)}) + \mathbb{E}\\mathcal{R}_\\theta(\\hat{A}'\^{(k)})JCo-rewarding-III(k)(θ)=ERθ(A\^(k))+ERθ(A\^′(k))
- 作用:同时利用了数据多样性和模型解耦带来的稳定性,进一步提升了性能和抗崩溃能力。
三、实验
(一)实验设置
- 骨干模型与基线 :
- 模型:Qwen2.5-3B/7B, Qwen3-1.7B/4B/8B-Base, Llama-3.2-3B-Instruct。
- 基线:GT-Reward(使用真实标签), Self-Certainty, Entropy, Majority-Voting。
- 数据集 :
- 训练集:MATH (7,500条), DAPO-14k (约14,100条), OpenRS (7,000条)。
- 验证/测试集:MATH500, GSM8K, AMC, AIME24, LiveCodeBench, CRUX, IFEval, MMLU-Pro。
- 实现细节 :
- 基于VeRL框架,在4×H100 GPU上训练。
- 批大小128,学习率3e-6,每个问题采样G=8个输出。
- Co-rewarding-I中,改写任务由Qwen3-32B完成。
- Co-rewarding-II中,EMA的α从0.99衰减至0.9999。
(二)主要结果
-
性能优于自奖励基线:在MATH和DAPO-14k训练集上,Co-rewarding的三种实现均显著优于Self-Certainty、Entropy和Majority-Voting等自奖励基线。例如,在MATH训练集上,Co-rewarding-I平均相对提升+4.42%,Co-rewarding-II在DAPO-14k上平均提升+12.90%。
-
-
在某些基准上超越GT-Reward:Co-rewarding在GSM8K等相对简单的基准上甚至超过了使用真实标签的GT-Reward。例如,Co-rewarding-II在Qwen3-8B-Base上于GSM8K达到了**94.01%**的Pass@1,高于GT-Reward的87.26%。
-
跨领域泛化与保持通用能力:尽管仅在数学数据上训练,模型在代码生成基准(如CRUX)上也有提升,显示出跨领域泛化能力。同时,Co-rewarding在MMLU-Pro和IFEval上的表现表明,其推理能力的提升并未损害模型的通用指令遵循和多任务能力。
(三)进一步分析
-
训练稳定性:通过验证集曲线观察到,所有自奖励基线都会在训练后期出现崩溃(准确率急剧下降)。而Co-rewarding-I在MATH数据上能保持稳定,Co-rewarding-II在所有设置下都能维持稳定的上升趋势,证明了其有效性。
-

-

(协同奖励 I(Co-rewarding-I)在 MATH 数据集上保持稳定,但在 DAPO-14k 数据集上依旧发生崩塌,这说明该方法的稳定性依赖训练数据自身特性。一种合理的解释是:MATH 中的试题能够营造有利条件,生成多样化的改写表述,有助于协同奖励 I(Co-rewarding-I)中对比一致性机制发挥作用。)
-
-
奖励与响应长度分析:Entropy和Majority-Voting基线很快达到最高奖励,对应于奖励投机。而GT-Reward和Co-rewarding的奖励曲线平滑上升。同时,GT-Reward 通过拉长输出来探索正确推理路径;多数投票(Majority-Voting) 收敛为简短输出,限制了探索空间;熵正则(Entropy) 则将概率质量集中在少量 token 上,反复生成这类 token 直至触发截断。与之不同,Co-rewarding 在整个训练过程中始终维持适中的响应长度,体现出探索与利用之间均衡的折中效果。
-
伪标签质量:消融实验表明,移除Co-rewarding-II中教师模型的EMA更新会导致性能下降。伪标签准确率曲线显示,有EMA更新的教师模型能持续提升伪标签质量,而无更新则保持低水平,Majority-Voting的伪标签准确率则会崩溃至接近零。
-
案例研究:
- 在一个数学题上,Majority-Voting为了追求输出一致性,给出了错误的答案;Entropy则陷入了重复生成"Simplify the next fraction"的循环。相比之下,Co-rewarding和GT-Reward都能生成正确的逐步推理和最终答案,展现出其克服奖励投机并激发真正推理的能力。





