【文献阅读 ICLR 2026】RL算法:DECS

Overthinking reduction with decoupled rewards and curriculum data scheduling

标题 :通过解耦奖励和课程数据调度来缓解过度思考

方法名称 :DECS

论文链接 :arxiv:2509.25827v2

项目链接https://github.com/pixas/DECS

发表会议:ICLR 2026

摘要

虽然用免评价的强化学习算法和可验证奖励来训练大型推理模型是目前最好的技术(例如:GRPO、DAPO等 ),但其实际应用受到"过度思考"的阻碍(模型生成过长的推理路径,却没有性能提升)。现有的对长度进行惩罚的方法经常失败导致性能下降,因为轨迹级奖励trajectory-level rewards和token级优化的不匹配。这篇文章提出了一个新的框架DECS,其理论是发现的两个现行方式的缺陷:(1)错误地惩罚了必要的探索性token,(2)无意中奖励了部分冗余token。框架创新包括:(1)一种首创的token级奖励解耦机制,能精准区分和惩罚冗余token,(2)一种新的课程批量调度策略,用于平衡效率和效果。实验结果表明DECS在七个基准测试中可将推理token数量显著减少超过50%,同时保持甚至提升模型性能。这充分证明,在不牺牲模型推理能力的前提下,可以实现显著的推理效率提升。

一、预备知识

(一)RLVR
  • RL的目标是最大化累积奖励r,具体而言,策略梯度方法的目标函数如下:
    ∇J(θ)=Eq∼D,o∼πθ(q)∑j=0T∇θlog⁡πθ(oj∣o<j)A(o<j,j),(1) \nabla \mathcal{J}(\theta) = \mathbb{E}{q\sim \mathcal{D},\boldsymbol{o}\sim \pi\theta(q)} \sum_{j=0}^{T} \nabla_\theta \log \pi_\theta(o_j \mid \boldsymbol{o}{<j}) A(\boldsymbol{o}{<j},j), \tag{1} ∇J(θ)=Eq∼D,o∼πθ(q)j=0∑T∇θlogπθ(oj∣o<j)A(o<j,j),(1)
    其中D\mathcal{D}D是训练分布,q是输入提示词,o\boldsymbol{o}o是T个tokens组成的输出序列{o1,o2,...,oT}\{o_1,o_2,...,o_T\}{o1,o2,...,oT},A(o<j,j)A(\boldsymbol{o}_{ < j},j)A(o<j,j)是第j个token的优势。
  • DeepSeek-R1提出的GRPO算法,每条采样轨迹都会标注可验证奖励r(·),而优势值A则基于同一提示词q生成的G条轨迹构成的轨迹组\\mathcal{O} = {o_i}_{i=1}\^G 所对应的奖励均值与标准差进行估算:
    Ai=r(oi)−mean⁡(r(o1),...,r(oG))std⁡(r(o1),...,r(oG)).(2) A_i = \frac{r(\boldsymbol{o}_i) - \operatorname{mean}\big(r(\boldsymbol{o}_1),\dots,r(\boldsymbol{o}_G)\big)}{\operatorname{std}\big(r(\boldsymbol{o}1),\dots,r(\boldsymbol{o}G)\big)}. \tag{2} Ai=std(r(o1),...,r(oG))r(oi)−mean(r(o1),...,r(oG)).(2)
    目标函数如下:
    Eq∼D,{oi}i=1G∼πθ(⋅∣q)1∑iG∣oi∣∑i=1G∑j=1∣oi∣min⁡(ρi,jAi,clip⁡(ρi,jAi,1−ϵ,1+ϵ)Ai),(3) \mathbb{E}
    {q\sim\mathcal{D},\{\boldsymbol{o}i\}{i=1}^G \sim \pi
    \theta(\cdot|q)} \left \\frac{1}{\\sum_{i}\^{G} \|\\boldsymbol{o}_i\|} \\sum_{i=1}\^{G}\\sum_{j=1}\^{\|\\boldsymbol{o}_i\|} \\min \\big(\\rho_{i,j} A_i,\\operatorname{clip}(\\rho_{i,j} A_i,1-\\epsilon,1+\\epsilon)A_i\\big) \\right, \tag{3}Eq∼D,{oi}i=1G∼πθ(⋅∣q) ∑iG∣oi∣1i=1∑Gj=1∑∣oi∣min(ρi,jAi,clip(ρi,jAi,1−ϵ,1+ϵ)Ai) ,(3)
(二)基于长度惩罚的高效推理
  • 基于高熵决策性token(例如: "wait", "however", "alternatively"),模型会受到激励开展新尝试,通过多种方法对临时结果进行交叉验证,并修正已有结果。不过,尽管频繁生成高熵触发信号确实能够提升模型处理难题的能力,这类提升效果并不稳定,同时还会让普通问题的推理过程变得冗长,并产生"过度思考"现象。
  • 一种最直接的方法是对基础正确性奖励增加基于长度的奖励,以此鼓励更短并且正确的响应。具体而言,采用一个对长度单调递减的函数f(l)=−γlf(l)=-\gamma lf(l)=−γl,组合后的奖励定义为:
    r′(oi)={r(oi)−γ∣oi∣oi is correctr(oi)otherwise(4) r'(\boldsymbol{o}_i)= \begin{cases} r(\boldsymbol{o}_i)-\gamma|\boldsymbol{o}_i| & \boldsymbol{o}_i \text{ is correct} \\ r(\boldsymbol{o}_i) & \text{otherwise} \end{cases} \tag{4} r′(oi)={r(oi)−γ∣oi∣r(oi)oi is correctotherwise(4)
    其中γ为一个较小系数,用于避免长度奖励主导整体奖励,该系数可自适应计算,也可预先设置为超参数。

高熵token:指那些反映模型进行主动推理机制 的词汇,它们通常用于连接推理步骤、触发探索和反思 。比如:(论文引用 Wang et al. (2025b) 的工作,列举了典型的高熵Token),"wait""however""alternatively""okay""given""therefore""so" ,起到的作用包括:

  • 探索性:这些词表明模型正在考虑不同的路径或检查当前路径的有效性。
  • 反思性:如 "wait" 或 "but",表明模型对之前的步骤产生了怀疑或准备进行纠正。
  • 过渡性:用于在不同逻辑步骤之间建立连接。

统计定义(在证明中):在 Appendix A.1 的证明过程中,作者采用了 Wang et al. (2025b) 的假设:高熵Token在序列中是均匀分布的。

  • 对于任意长度为 LiL_iLi 的序列,平均会有 h⋅Lih \cdot L_ih⋅Li 个高熵Token。
  • 其中 hhh 被定义为 20%。这意味着在模型生成的推理链中,大约有 20% 的词汇属于这类探索性词汇。

二、长度引导式推理优化的局限性

尽管现有方法有所进展,但论文通过理论分析,揭示了当前长度惩罚驱动方法在提升推理效率时存在的两个关键缺陷,这些缺陷源于轨迹级优势分数与token级优化目标之间的不匹配。

(一) 策略梯度下的Logit动力学
  • 大语言模型在第m步的策略为Softmax策略,定义如下:

    πθm(ot∣o<t)=exp⁡(zo<t,ot)∑o′∈∣V∣exp⁡zo<t,o′,(5) \pi_\theta^m(o_t \mid \boldsymbol{o}{<t}) = \frac{\exp(z{\boldsymbol{o}{<t},o_t})}{\sum{o'\in|V|} \exp z_{\boldsymbol{o}_{<t},o'}}, \tag{5} πθm(ot∣o<t)=∑o′∈∣V∣expzo<t,o′exp(zo<t,ot),(5)

    其中 zo<t,otz_{\boldsymbol{o}{<t},o_t}zo<t,ot 是给定前缀序列 o<t\boldsymbol{o}{<t}o<t 时,token oto_tot 对应的输出Logit,且 ot∼πθm(⋅∣o<t)o_t \sim \pi_\theta^m(\cdot \mid \boldsymbol{o}_{<t})ot∼πθm(⋅∣o<t)。

    在策略梯度优化目标下,有如下引理:

    • 引理1(原始策略梯度下策略Logit的变化量)
      假设演员策略 πθ\pi_\thetaπθ 是表格softmax策略,并使用公式(1)中定义的策略梯度目标以学习率 η\etaη 进行更新,则两个连续步骤 mmm 和 m+1m+1m+1 之间的 zo<t,otz_{o_{<t}, o_t}zo<t,ot 差值满足:zo<t,otm+1−zo<t,otm=η⋅πθ(ot∣o<t)⋅A(o<t,ot)z^{m+1}{o{<t}, o_t} - z^m_{o_{<t}, o_t} = \eta \cdot \pi_\theta(o_t | o_{<t}) \cdot A(o_{<t}, o_t)zo<t,otm+1−zo<t,otm=η⋅πθ(ot∣o<t)⋅A(o<t,ot)
      该引理表明,logit的变化与当前token的概率及其优势值成正比。
      • Logit:对数概率

(二)Optimization with Ill-posed Efficiency (定位不当的效率优化)
  • 在GRPO算法中,当策略 πθ\pi_\thetaπθ 在简单提示 qθ,Gq_{\theta,G}qθ,G 上生成的 GGG 次采样结果全部正确 时,正确性奖励在轨迹间变为常数,长度成为唯一的区分信号。
    • 由此,正确但过长的轨迹会收到负的估计优势值。
    • 根据公式(3)目标函数,这些负优势值会回传到轨迹中的所有token,包括必要的高熵探索性token(如 "wait", "however"),将其形式化为下面的引理。
  • 引理 2 (正确高熵Token的Logit下降)
    对于公式4中定义的长度奖励函数 f(l)=−γlf(l) = -\gamma lf(l)=−γl,由简单提示 qθ,Gq_{\theta,G}qθ,G 采样的G个正确rollouts {oi}i=1G\{o_i\}^G_{i=1}{oi}i=1G,在两个连续优化步骤 mmm 和 m+1m+1m+1 之间,高熵token集合 {ohigh}\{o_{high}\}{ohigh}的logit变化严格为负:
    Eo∈{ohigh}zom+1−zom<0E_{o \in \{o_{high}\}} z\^{m+1}_{o} - z\^m_{o} < 0Eo∈{ohigh}zom+1−zom<0
  • 在上述引理中,由qθ,Gq_{\theta,G}qθ,G正确生成的高熵token其生成概率被降低,这可能会干扰甚至扭曲整个批次对高熵token的学习方向,且需满足下述定理所规定的约束条件。

推导过程(附录A.1)

  • 假设高熵token均匀分布,对于含LiL_iLi个tokens的序列,有h⋅Lih \cdot L_ih⋅Li个高熵token。
  • 因为在"简单提示"场景下,所有响应都正确,则r(oi)=1r(o_i)=1r(oi)=1,r′(oi)=1+f(Li)r'(o_i)=1+f(L_i)r′(oi)=1+f(Li),原始奖励均值=1,标准差=0,新奖励均值=1+μf(L),标准差=σf(L),因此A′(oi)=r′(oi)−μr′σr′=f(Li)−μf(L)σf(L)A'(o_i)=\frac{r'(o_i)-\mu_{r'}}{\sigma_{r'}}=\frac{f(L_i)-\mu_{f(L)}}{\sigma_{f(L)}}A′(oi)=σr′r′(oi)−μr′=σf(L)f(Li)−μf(L)
  • μL=EL=1G∑i=1GLi\mu_L=EL=\frac{1}{G}\sum_{i=1}^G L_iμL=EL=G1∑i=1GLi ; ∑i=1GLi=GμL\sum_{i=1}^G L_i = G\mu_L∑i=1GLi=GμL ; ∑i=1GLi2=GEL2\sum_{i=1}^G L_i^2 = GEL\^2∑i=1GLi2=GEL2
  • σL2=EL2−μL2\sigma^2_L=EL\^2-\mu_L^2σL2=EL2−μL2
    Ezohighm+1−zohighm∝∑i=1G∑j=1Liπθ(oi,j)⋅A(oi,j)⋅1oi,j∈{ohigh}=∑i=1GA(oi)∑j=1Liπθ(oi,j)⋅1oi,j∈{ohigh}⏟GRPO Broadcast<∑i=1GA(oi)⋅hLi=h∑i=1Gf(Li)−μf(L)σf(L)Li=h∑i=1G−γLi−(−γμL)γσLLi=h∑i=1Gγ(−Li+μL)γσLLi=hσL∑i=1G(−Li2+LiμL)=hσL⋅G(−EL2+μL2)=−hGσL<0 \begin{aligned} \mathbb{E}\left z_{o_{\\text{high}}}\^{m+1} - z_{o_{\\text{high}}}\^{m} \\right &\propto \sum_{i=1}^{G}\sum_{j=1}^{L_i} \pi_\theta(o_{i,j}) \cdot A(o_{i,j}) \cdot \mathbf{1}{o{i,j}\in\{o_{\text{high}}\}} \\ &= \sum_{i=1}^{G} A(o_i) \underbrace{\sum_{j=1}^{L_i}\pi_\theta(o_{i,j})\cdot \mathbf{1}{o{i,j}\in\{o_{\text{high}}\}}}{\text{GRPO Broadcast}} \\ &< \sum{i=1}^{G} A(o_i) \cdot h L_i \\ &= h\sum_{i=1}^{G} \frac{f(L_i)-\mu_{f(L)}}{\sigma_{f(L)}} L_i \\ &= h\sum_{i=1}^{G} \frac{-\gamma L_i-(-\gamma \mu_L)}{\gamma \sigma_L} L_i \\ &= h\sum_{i=1}^{G} \frac{\gamma(-L_i+\mu_L)}{\gamma \sigma_L} L_i \\ &= \frac{h}{\sigma_L} \sum_{i=1}^{G}(-L_i^2+L_i \mu_L) \\ &= \frac{h}{\sigma_L} \cdot G (-EL\^2+\mu_L^2)\\ &= -hG\sigma_L < 0 \end{aligned} Ezohighm+1−zohighm∝i=1∑Gj=1∑Liπθ(oi,j)⋅A(oi,j)⋅1oi,j∈{ohigh}=i=1∑GA(oi)GRPO Broadcast j=1∑Liπθ(oi,j)⋅1oi,j∈{ohigh}<i=1∑GA(oi)⋅hLi=hi=1∑Gσf(L)f(Li)−μf(L)Li=hi=1∑GγσL−γLi−(−γμL)Li=hi=1∑GγσLγ(−Li+μL)Li=σLhi=1∑G(−Li2+LiμL)=σLh⋅G(−EL2+μL2)=−hGσL<0
  • Theorem 1 (批处理学习下高熵Token的维持)
    设简单提示 qθ,Gq_{\theta,G}qθ,G 在一个批次中的比例为 κ\kappaκ。假设长度奖励定义为公式(4),σL\sigma_LσL 为 qθ,Gq_{\theta,G}qθ,G 响应长度的平均标准差。若要使批处理中正确高熵token的期望logit变化大于0,必须满足以下条件:κσL<C\kappa \sigma_L < CκσL<C其中,CCC 是关于批次中生成采样token的一个常数。
  • 当 κσL\kappa \sigma_LκσL 变得过大时,策略将不再遵循性能-效率权衡,而是进入一个以牺牲高熵token主动性为代价来换取效率提升的领域,从而导致性能退化。

推导过程(附录A.2)

证明 :参照引理2的证明过程,可以通过计算 ∑n=1B∑i=1G∑j=1∣oi,n∣A(oi,n)⋅1correct⋅1high\sum_{n=1}^{B}\sum_{i=1}^{G}\sum_{j=1}^{|o_{i,n}|}A(o_{i,n})\cdot\mathbb{1}\text{correct}\cdot\mathbb{1}\text{high}∑n=1B∑i=1G∑j=1∣oi,n∣A(oi,n)⋅1correct⋅1high 的上界,得到 Ezmhigh−zm−1high\mathbb{E}\biglz\^\\text{high}_m-z\^\\text{high}_{m-1}\\bigrEzmhigh−zm−1high 的上界,该式为全部正确高熵tokens的优势值之和:

Ezmhigh−zm−1high∝∑n=1B∑i=1G∑j=1∣oi,n∣πθ(oni,j)A(oni,j)⋅1correct⋅1high<∑n=1B∑i=1GhLiA(oni,j)⋅1correct(12) \mathbb{E}\biglz\^\\text{high}_m-z\^\\text{high}_{m-1}\\bigr\propto \sum_{n=1}^{B}\sum_{i=1}^{G}\sum_{j=1}^{|o_{i,n}|} \pi_\theta(o^{i,j}n)A(o^{i,j}n)\cdot\mathbb{1}\text{correct}\cdot\mathbb{1}\text{high} \tag{12} \\ <\sum_{n=1}^{B}\sum_{i=1}^{G}\biglhL_iA(o\^{i,j}_n)\\cdot\\mathbb{1}_\\text{correct}\\bigr Ezmhigh−zm−1high∝n=1∑Bi=1∑Gj=1∑∣oi,n∣πθ(oni,j)A(oni,j)⋅1correct⋅1high<n=1∑Bi=1∑GhLiA(oni,j)⋅1correct(12)

式中 oi,j,no_{i,j,n}oi,j,n 代表基于第 nnn 条提示词生成的一组回复内,第 iii 个输出的第 jjj 个token。假设任意 qθ,Gq_{\theta,G}qθ,G 的输出分布满足独立同分布,将该项展开如下:

∑n=1B∑i=1GhLiA(oni,j)⋅1correct=κBh∑i=1GLi⋅f(Li)−μf(L)σf(L)+∑n=1(1−κ)B∑i=1GLin⋅1−μncσnc⋅1correct=−κBhGσL+∑n=1(1−κ)B∑i=1GLni⋅1−μncσnc⋅1correct(13) \sum_{n=1}^{B}\sum_{i=1}^{G}\biglhL_iA(o\^{i,j}_n)\\cdot\\mathbb{1}_\\text{correct}\\bigr =\kappa Bh\biggl\\sum_{i=1}\^{G}L_i\\cdot\\frac{f(L_i)-\\mu_{f(L)}}{\\sigma_{f(L)}}\\biggr +\sum_{n=1}^{(1-\kappa) B}\sum_{i=1}^{G}L_i^n \cdot \frac{1-\mu_n^c}{\sigma_n^c}\cdot\mathbb{1}\text{correct} \tag{13}\\ =-\kappa Bh G\sigma_L+ \sum{n=1}^{(1-\kappa) B}\sum_{i=1}^{G}L_n^i\cdot\frac{1-\mu^c_n}{\sigma_n^c}\cdot\mathbb{1}_\text{correct} n=1∑Bi=1∑GhLiA(oni,j)⋅1correct=κBhi=1∑GLi⋅σf(L)f(Li)−μf(L)+n=1∑(1−κ)Bi=1∑GLin⋅σnc1−μnc⋅1correct=−κBhGσL+n=1∑(1−κ)Bi=1∑GLni⋅σnc1−μnc⋅1correct(13)

其中 μnc\mu^c_nμnc、σnc\sigma_n^cσnc 分别为第 nnn 条提示词对应的正确性奖励的均值与标准差。设提示词b对应的正确回复数量为 ana_nan,则 μnc=an\mu^c_n=a_nμnc=an,σnc=an(1−an)\sqrt{\sigma_n^c}=\sqrt{a_n(1-a_n)}σnc =an(1−an) ,对第二项做展开:

∑n=1κB∑i=1GLin⋅1−μncσnc⋅1correct=∑n=1κB∑i=1GLin⋅1−anan(1−an)⋅1correct=CB(14) \sum_{n=1}^{\kappa B}\sum_{i=1}^{G} L_{i}^{n}\cdot \frac{1-\mu_{n}^{c}}{\sigma_{n}^{c}}\cdot \mathbf{1}{\text{correct}} =\sum{n=1}^{\kappa B}\sum_{i=1}^{G} L_{i}^{n}\cdot \frac{1-a_{n}}{\sqrt{a_{n}(1-a_{n})}}\cdot \mathbf{1}{\text{correct}} =C{B} \tag{14} n=1∑κBi=1∑GLin⋅σnc1−μnc⋅1correct=n=1∑κBi=1∑GLin⋅an(1−an) 1−an⋅1correct=CB(14)

因此,当 an<1a_n<1an<1 时第二项恒为正,且在批次 BBB 内为常数。由此可得:当且仅当公式(13)的第一项足够负时,目标函数小于0。求解使公式(13)取正值的不等式,得到如下条件:在该条件下,跨批次学习信号不会对正确高熵令牌施加惩罚:

κ⋅σL<CBBhG=C(15) \kappa\cdot\sigma_L<\frac{C_B}{B h G}=C \tag{15} κ⋅σL<BhGCB=C(15)

存在两种方式打破该条件:(1) 在单条提示词下生成更多 qθ,Gq_{\theta,G}qθ,G,对应取更大的 κ\kappaκ 参数;(2) 扩大输出长度的取值范围,对应取更大的 σL\sigma_LσL。

easy prompt 过多且长度差异大时,长度惩罚的负面信号会占主导。


(三)INSUFFICIENT EFFICIENCY(效率不足)

除性能下降外,当前基于长度的奖励方法也无法充分减少过度思考问题。下面将通过形式化定义必要推理前缀(NRP),区分出待删减的冗余token(必要推理前缀是指足以推导出正确答案的最短推理轨迹片段)。

  • 定义1:必要推理前缀 (NRP)

    设q为输入提示,y∗y^*y∗ 为真实答案,o=(o1,o2,...,oL)o = (o_1, o_2, ..., o_L)o=(o1,o2,...,oL) 为生成的响应序列,L=∣o∣L = |o|L=∣o∣,o相对于q的必要推理前缀(NRP):最短前缀o1:K∗o_{1:K^*}o1:K∗,使得ANSWER(o1:K∗)=y∗\text{ANSWER}(o_{1:K^*}) = y^*ANSWER(o1:K∗)=y∗,对于任何∀k<K∗,ANSWER(o1:k)=nullorANSWER(o1:k)≠y∗\forall k < K^*, \quad ANSWER(o_{1:k}) = \text{null} \quad \text{or} \quad ANSWER(o_{1:k}) \neq y^*∀k<K∗,ANSWER(o1:k)=nullorANSWER(o1:k)=y∗

    由于在位置 K∗K^*K∗ 处正确答案已经在逻辑上得到验证,token集合 {oj∣j>Ko∗}\{o_j | j > K^*_o\}{oj∣j>Ko∗} 被认为是冗余的。

  • 为了禁止策略在生成完NRP后继续生成token,优化的目标转变为最小化生成NRP后第一个推理token的概率,从而降低整体的冗余:

    min⁡Eo∼πθ(⋅∣qθ,G)zo≤K∗,ojm−zo≤K∗,ojm−1s.t.j=K∗+1(6) \min \mathbb{E}{\boldsymbol{o}\sim \pi\theta(\cdot \mid q_\theta,G)} \left z_{\\boldsymbol{o}_{\\leq K\^\*},o_j}\^{m} - z_{\\boldsymbol{o}_{\\leq K\^\*},o_j}\^{m-1} \\right \quad \text{s.t.} \quad j = K^* + 1 \tag{6} minEo∼πθ(⋅∣qθ,G)zo≤K∗,ojm−zo≤K∗,ojm−1s.t.j=K∗+1(6)

  • 根据Lemma 1,该目标可以转化为策略加权的优势期望:

    • Theorem 2 (Suboptimal Reduction of Redundant Tokens)
      设长度奖励函数f按公式(4)定义,在正确的rollout ooo 中,令 j=Ko∗+1j = K^*o + 1j=Ko∗+1 表示NRP之外的第一个冗余token的位置。设 A(o)A(o)A(o) 为通过公式(2)计算的组相对优势。那么,第一个冗余token的期望策略梯度信号表示为:J(A;j=Ko∗+1)=Eo∼πθ(⋅∣qθ,G)πθ(oj∣o\J(A; j=K^*o+1) = E{o \sim \pi\theta(\cdot | q_{\theta,G})} \\pi_\\theta(o_j \| o_{\J(A;j=Ko∗+1)=Eo∼πθ(⋅∣qθ,G)πθ(oj∣o\满足:J(A;j=Ko∗+1)>0J(A; j=K^*_o+1) > 0J(A;j=Ko∗+1)>0
  • 这个定理说明,虽然策略可以通过惩罚远离NRP末端的token来减少总体长度,但由于对NRP后的第一个冗余token没有施加惩罚,策略无法学习到在NRP末端停止生成。这种不良特性会保留部分过度思考的token,导致冗余信息无法得到最优精简。

推导过程(附录A.3)

  • 对于任意一个简单提示词q,假设模型πθ\pi_\thetaπθ生成一组共G个正确输出序列{oi}i=1G\{o_i\}_{i=1}^G{oi}i=1G,其序列长度分别为L1,L2,...,LGL_1,L_2,\dots,L_GL1,L2,...,LG。每个输出序列的优势值通过分组标准化(公式2)计算:
    A(oi)=f(Li)−μGσG=−γLi−LˉσLA(o_i)=\frac{f(L_i)-\mu_G}{\sigma_G}=-\gamma\frac{L_i-\bar{L}}{\sigma_L}A(oi)=σGf(Li)−μG=−γσLLi−Lˉ式中Lˉ\bar{L}Lˉ与σL\sigma_LσL分别为该组内LLL的均值与标准差。
  • 在输出序列oio_ioi中,在必要推理前缀(NRP)之后生成的第一个冗余token为 oi,j=Ki∗+1o_{i,j=K_i^*+1}oi,j=Ki∗+1,其期望梯度信号为:
    J(A)=Eo∼πθ(⋅∣q)πθ(oj∣o\J(A)=\mathbb{E}{o\sim\pi\theta(\cdot|q)} \big\\pi_\\theta(o_j \\mid o_{\J(A)=Eo∼πθ(⋅∣q)πθ(oj∣o\
    为更加简洁,令 wi:=πθ(oi,≤j∣q)w_i := \pi_\theta(o_{i,\le j} \mid q)wi:=πθ(oi,≤j∣q) 为策略θ生成第i个roll-out的前缀到第一个冗余token的概率,J(A)=∑i=1Gwi⋅A(oi)∑i=1GwiJ(A)=\frac{\sum_{i=1}^G w_i \cdot A(o_i)}{\sum_{i=1}^G w_i}J(A)=∑i=1Gwi∑i=1Gwi⋅A(oi)
  • 假设较短的前缀更容易被模型生成,概率更高,即Li<LkL_i < L_kLi<Lk,则 wi≥wkw_i \ge w_kwi≥wk。
  • 假设对任意推演序列 oio_ioi,其思考长度大于其NRP长度 Li>Ki∗L_i > K_i^*Li>Ki∗。根据条件期望的定义:
    J(A)=∑i=1Gwi⋅A(oi)∑i=1Gwi=∑i=1Gwi∑i=1Gwi⋅(−γLi−LˉσL)=−γσL∑i=1Gwi∑i=1Gwi⋅(Li−Lˉ)=−γ⋅Lˉw−LˉσL \begin{aligned} J(A)&=\frac{\sum_{i=1}^G w_i \cdot A(o_i)}{\sum_{i=1}^G w_i} \\ &=\frac{\sum_{i=1}^G w_i }{\sum_{i=1}^G w_i} \cdot (-\gamma\frac{L_i-\bar{L}}{\sigma_L})\\ &=\frac{-\gamma}{\sigma_L} \frac{\sum_{i=1}^G w_i }{\sum_{i=1}^G w_i} \cdot (L_i-\bar{L})\\ &=-\gamma\cdot\frac{\bar L_w-\bar L}{\sigma_L}\\ \end{aligned} J(A)=∑i=1Gwi∑i=1Gwi⋅A(oi)=∑i=1Gwi∑i=1Gwi⋅(−γσLLi−Lˉ)=σL−γ∑i=1Gwi∑i=1Gwi⋅(Li−Lˉ)=−γ⋅σLLˉw−Lˉ
    其中 Lˉw=∑i=1GwiLi∑i=1Gwi\bar L_w=\frac{\sum_{i=1}^G w_iL_i}{\sum_{i=1}^G w_i}Lˉw=∑i=1Gwi∑i=1GwiLi 为策略加权平均长度。将 Lˉw\bar L_wLˉw 减去 Lˉ\bar LLˉ,可得:
    Lˉw−Lˉ=∑i=1GwiLi∑i=1Gwi−1G∑i=1GLi=1G∑i=1GwiLi−(1G∑i=1Gwi)(1G∑i=1GLi)1G∑i=1Gwi=Cov(w,L)Ew<0 \begin{aligned} \bar L_w-\bar L&=\frac{\sum_{i=1}^G w_iL_i}{\sum_{i=1}^G w_i}-\frac{1}{G}\sum_{i=1}^G L_i\\ &=\frac{\frac{1}{G}\sum_{i=1}^G w_iL_i-\big(\frac{1}{G}\sum_{i=1}^G w_i\big)\big(\frac{1}{G}\sum_{i=1}^G L_i\big)}{\frac{1}{G}\sum_{i=1}^G w_i}\\ &=\frac{Cov(w,L)}{Ew}<0 \end{aligned} Lˉw−Lˉ=∑i=1Gwi∑i=1GwiLi−G1i=1∑GLi=G1∑i=1GwiG1∑i=1GwiLi−(G1∑i=1Gwi)(G1∑i=1GLi)=EwCov(w,L)<0
    Cov(w,L)=EwL−EwEL<0Cov(w,L)=EwL-EwEL<0Cov(w,L)=EwL−EwEL<0,因为w,L负相关。
    因此,Lˉw−Lˉ<0\bar L_w-\bar L<0Lˉw−Lˉ<0,故 J(A)>0J(A)>0J(A)>0。

三、DECS

针对上述缺陷,DECS提出了一个包含三个主要设计的新框架,旨在实现最高的效率-效果平衡。

(一)必要推理前缀(NRP)检测
  • 方法 :微调一个轻量级的判别模型 MjudgeM_{judge}Mjudge 来判断一段推理片段是否包含给定问题的正确答案。给定一条正确推演序列ooo,首先提取推理tokens得到othink=(o1,...,o</think>)o_{\text{think}} = (o_1, \dots, o_{</think>})othink=(o1,...,o</think>),借助预先定义的分隔token,把推理过程被切分为多个片段:S={s1,s2,⋯ ,s∣S∣}S = \{s_1, s_2, \cdots, s_{|S|}\}S={s1,s2,⋯,s∣S∣},其中scs_csc代表othinko_{\text{think}}othink中的第ccc个片段。基于问题qqq与对应的标准答案y∗y^*y∗,通过向评判模型MjudgeM_{\text{judge}}Mjudge输入提示,生成子步骤scs_csc的判定结果jsc∈{yes,no}j_{s_c} \in \{yes,no\}jsc∈{yes,no}:

    jsc∼Mjudge(⋅∣q,sc,y∗)j_{s_c} \sim M_{\text{judge}}(\cdot \mid q, s_c, y^*)jsc∼Mjudge(⋅∣q,sc,y∗)

  • NRP包含从开始到第一个被判断为包含正确答案的片段scs_csc的所有片段:

    NRP=⨁i=1c∗si,where c∗=min⁡{c∈1,∣S∣:jsc=yes}(8) \text{NRP} = \bigoplus_{i=1}^{c^*} s_i, \quad \text{where } c^* = \min\left\{ c \in 1, \|S\| : j_{s_c} = \text{yes} \right\} \tag{8} NRP=i=1⨁c∗si,where c∗=min{c∈1,∣S∣:jsc=yes}(8) ⨁\bigoplus⨁表示推理片段的拼接,c*是第一个判断为"yes"的片段索引。

(二)DECOUPLED REWARD ASSIGNMENT(解耦奖励分配)
  • 设计了一个token级奖励函数,确保NRP内的token获得最大奖励,并且偏好简短正确的响应:

    ri,j={r+⋅1oi is correctj≤Koi∗∨oj∉othink∨oi,j=∅(r0−(r+−r0)LiLmax)⋅1oi is correctj>Koi∗∧oj∈othink(9) r_{i,j}= \begin{cases} r_{+} \cdot \mathbf{1}{o_i \text{ is correct}} & j \leq K{o_i}^{*} \lor o_j \notin o_{\text{think}} \lor o_{i,j} = \emptyset \\6pt \left(r_{0} - \frac{(r_{+}-r_{0})L_i}{L_{\text{max}}}\right) \cdot \mathbf{1}{o_i \text{ is correct}} & j > K{o_i}^{*} \land o_j \in o_{\text{think}} \end{cases} \tag{9} ri,j=⎩ ⎨ ⎧r+⋅1oi is correct(r0−Lmax(r+−r0)Li)⋅1oi is correctj≤Koi∗∨oj∈/othink∨oi,j=∅j>Koi∗∧oj∈othink(9)

    其中r+r_+r+和r0r_0r0分别为最大正奖励与最小正奖励,Koi∗K_{o_i}^{*}Koi∗是oio_ioi的NRP的的最后一个token的索引,∅\emptyset∅代表填充token,LiL_iLi是序列长度,LmaxL_{max}Lmax 是最大长度。

  • 由于相较于r+r_+r+,该反比例函数会对冗余token施加低得多的奖励,因此任意NRP后的token都会持续得到负优势,从而减少文本冗余。此外,只有冗余思考token有可能获得负优势,避免对关键推理token和答案结论token产生惩罚。

  • 最终的token级优势计算与GRPO类似:

    Ai,jDECS=ri,j−mean(r1,j,...,rG,j)std(r1,j,...,rG,j).(10) A_{i,j}^{\text{DECS}} = \frac{r_{i,j} - \text{mean}(r_{1,j},\dots,r_{G,j})}{\text{std}(r_{1,j},\dots,r_{G,j})}. \tag{10} Ai,jDECS=std(r1,j,...,rG,j)ri,j−mean(r1,j,...,rG,j).(10)

公式9如何惩罚冗余token(附录C)

通过reward structure和相对优势的计算,确保了冗余tokens都受到负优势的惩罚,训练中设r+=1.1,r0=1.0r_+=1.1,r_0=1.0r+=1.1,r0=1.0

  • reward structure:对于任意正确的rollout oio_ioi,
    • NRP内的token都得到了一个固定的高奖励r+=1.1r_+=1.1r+=1.1,
    • NRP之后的token的奖励基于长度缩放:ri,j=r0−(r+−r0)LiLmax=1−0.1LiLmax,Li=∣oi∣r_{i,j}=r_0 - \frac{(r_+-r_0)L_i}{L_{max}}=1-0.1\frac{L_i}{L_{max}},L_i=|o_i|ri,j=r0−Lmax(r+−r0)Li=1−0.1LmaxLi,Li=∣oi∣,所以0.9≤ri,j≤1.00.9 \leq r_{i,j} \leq 1.00.9≤ri,j≤1.0
  • 组相对优势机制:一个token只有当他的奖励超过G个rollout在该位置的平均奖励时才为正奖励
    对于一个序列中的开头的冗余token
    情况1:rollout序列有该组内最长的NRP ,奖励必然低于平均奖励,token得到负优势。
    情况2:组内至少有一个序列有等长或更长的NRP
    • 假设G=16,对于某个长度为LkL_kLk的序列,其第一个冗余token reward=rk=1.0−0.1LkLmaxr_k=1.0-0.1\frac{L_k}{L_{max}}rk=1.0−0.1LmaxLk,在该token的位置,存在k个序列仍处于NRP内,奖励为1.1。
    • 则该位置的平均reward为μ=1161.1k+∑i=116−k(1.0−0.1LiLmax⁡)\mu=\frac{1}{16}1.1k+\\sum_{i=1}\^{16-k}\\left(1.0-0.1\\frac{L_i}{L_{\\max}}\\right)μ=1611.1k+∑i=116−k(1.0−0.1LmaxLi),当前冗余token相对平均值的差为rk−μr_k-\murk−μ
    • 因为μ\muμ中Li≤LkL_i \leq L_kLi≤Lk,可推得rk−μ≤−0.1k16(1+LkLmax⁡)<0r_k-\mu \leq -0.1\frac{k}{16}\left(1+\frac{L_k}{L_{\max}}\right)<0rk−μ≤−0.116k(1+LmaxLk)<0,所以Ai,jDECS<0A_{i,j}^{\text{DECS}}<0Ai,jDECS<0
      所以情况2得到的优势也为负数。

结合在上述两种情况下,首个冗余token的奖励严格低于分组平均值,进而产生负优势值。保证其会受到惩罚。因此会对所有冗余内容实现惩罚。

(三)CURRICULUM PROMPT SCHEDULE(课程提示词调度)
  • 根据Theorem 1:κσL<C\kappa \sigma_L < CκσL<C:批次中简单问题(全答对问题)比例κ\kappaκ太大,或者响应长度差别σL\sigma_LσL太大,模型就会错误地抑制必要的高熵探索 Token。
  • 但为了利用长度惩罚迫使模型生成的思考过程变短,需要引入简单问题,简单问题比例太大又容易导致误杀探索性token,所以这里设计了一个课程调度,动态调整简单问题的比例,确保提升效率的同时,不破换theorem 1的条件。
  • 课程调度公式
    κm=clip(κm−1+β(Rm−Rm−1),0,κm0)(11) \kappa_m = \text{clip}\big(\kappa_{m-1} + \beta(\mathcal{R}m - \mathcal{R}{m-1}), 0, \kappa_m^0\big) \tag{11} κm=clip(κm−1+β(Rm−Rm−1),0,κm0)(11) κm\kappa_mκm(调度比例),第m步训练时,批次中简单问题的占比

    RmR_mRm(NRP比例),第m步训练时,当前批次中所有正确轨迹的NRP占比的平均值,RmR_mRm低,即冗余多,效率低;RmR_mRm高,则冗余少,效率高。

    ΔR=Rm−Rm−1\Delta R=R_m-R_{m-1}ΔR=Rm−Rm−1,>0说明冗余减少,模型在变好,<0冗余增加,在变坏

    β(控制系数,通过网格搜索得到),超参数,控制对效率提升的奖励程度

    • 当ΔR>0\Delta R>0ΔR>0,模型变高效,已能高效处理简化推理过程,κm\kappa_mκm增加,增加简单问题的比例,提供更多的效率优化信号,进一步提升效率。
    • 当ΔR<0\Delta R<0ΔR<0,模型变低效,此时再放入大量简单题,会加剧对高熵token的错误惩罚,所以减小κm\kappa_mκm,减小简单问题的比例。

四、实验

4.1 实验设置

  • 评估基准 :包含七个数据集,涵盖数学、编程和科学任务:
    • 领域内:MATH500, AMC23, Olympiad Bench, AIME2024, AIME2025
    • 领域外:GPQA-Diamond, LiveCodeBench-v6
  • 基线模型:ThinkPrune, TLMRE, AdaptThink, LC-R1,以及GRPO(作为性能参考)。
  • 训练设置:使用DeepScaleR作为训练集,以DeepSeek-R1-Distill-1.5B(DS-1.5B)和7B(DS-7B)为基础策略。在DS-1.5B上训练2个epoch,在DS-7B上训练3个epoch。
  • 主要指标 :Pass@1(准确性)和使用的平均Token数(#Tok.)。同时使用平均效率评分(AES)综合评估效率与效果。

4.2 主要结果

  • 在DS-1.5B模型上
    • DECS将平均推理长度减少了57.17%,同时将Pass@1准确率提升了+2.48个百分点。
    • 在所有七个基准测试上,DECS的AES得分均显著高于所有基线方法,实现了更优的效率-效果权衡。
  • 在DS-7B模型上
    • DECS将推理长度减少了49.50%,Pass@1准确率提升了+0.8个百分点。
    • 即使在NRP检测器仅针对数学任务训练的情况下,其在领域外任务(GPQA-Diamond和LiveCodeBench)上也能分别减少56.33%和33.52%的token,证明了DECS的强泛化性和实用价值。
  • 在其他骨干模型上
    • 在Qwen3-4B模型上,DECS实现了54.80%的token减少和1.32的Pass@1提升,证明了其骨干模型无关的鲁棒性。

4.3 消融研究

在DS-1.5B模型上进行的消融研究表明,课程调度(CS)和解耦奖励(DR)对于DECS的性能至关重要:

  • 移除课程调度:性能出现显著下降(Pass@1降低约-2.5),验证了Theorem 1中过度惩罚探索性token的问题。
  • 移除解耦奖励:冗余token仅减少约25%,验证了Theorem 2中序列级长度奖励无法充分减少冗余的结论。
相关推荐
量化小c1 小时前
一行代码查 BTCUSDT 和 AAPL 最新价?QuantDash 统一多市场实时行情接口实战
后端·算法·github
机器人梦想家1 小时前
具身机器人视觉服务的异步回调与并发控制
数据库·算法·机器人
我命由我123453 小时前
人脸识别 - 人脸识别选帧
java·人工智能·python·算法·安全·java-ee·人脸识别
时针滴滴答啊3 小时前
最大子数组和
算法·leetcode·职场和发展
知几蜗牛3 小时前
0 后端 · 0 数据库 · 0 备案:用 AI 两天搓出的股票管理系统,开源了
前端·后端·llm
五月底_3 小时前
LIS算法
python·算法·最长子序列
学学酱快乐4 小时前
2026年PMP考试生命周期选择决策树精讲:从需求判断到混合型统一框架的应试全攻略
算法·决策树·机器学习·pmp新版考试大纲·pmp新题型·pmp培训哪家好·pmp培训机构推荐
傅科摆 _ py4 小时前
动态规划复习
算法·动态规划
Wang's Blog4 小时前
PostgreSQL笔记49:向量检索核心算法、索引调优与过滤策略深度解析
笔记·算法·postgresql