
📖标题:Predictive Divergence Masks for LLM RL
🌐来源:arXiv, 2607.10848v1
🛎️文章简介
🔸研究问题:在大语言模型强化学习中,当使用分布散度作为信任区域邻近性判据时,如何设计与之对齐的方向性判据以解决传统采样比率判据的不一致问题?
🔸主要贡献:提出预测散度掩码,通过解析推导散度的方向导数并设计轻量级估计器,实现了与散度变化严格对齐的更新方向控制,显著提升了训练稳定性与效果。
📝重点思路
🔸指出DPPO等现有方法仅升级了基于散度的邻近性判据,却保留了基于单样本重要性比率的方向性判据,导致两者在判断更新是否偏离行为策略时存在符号不一致的理论缺陷。
🔸定义预测散度掩码,核心思想是直接询问下一步梯度更新会增加还是减少当前定义的散度,从而决定是否屏蔽该token的梯度,确保方向判据与邻近性判据基于同一度量标准。
🔸针对Softmax策略推导散度方向导数的闭式解,将其分解为反映采样token概率差的局部项和反映整个词汇表归一化耦合的全局项,揭示传统比率判据仅捕捉局部项而忽略全局影响的本质。
🔸鉴于生产环境推理引擎仅提供Top-K概率,开发两种轻量级尾部估计器(聚合尾部估计和均匀尾部估计)来近似计算全局项,无需额外前向或反向传播,计算开销极低。
🔎分析总结
🔸理论分析表明,预测散度掩码中的方向判据比传统的采样比率判据能更准确地对齐散度的实际变化,特别是在采样token差距与分布整体修正方向相反时,能有效纠正错误判断。
🔸在Qwen3不同规模模型及FP8精度设置下的实验显示,引入预测散度掩码的方法在AIME基准测试中均优于DPPO基线,且在更严格的信任区域阈值下表现出更强的鲁棒性。
🔸Token级别的详细分析证实,在两个判据做出不同决策的少数样本中,基于散度的方向判据具有更低的不安全保留率,即更少地保留那些实际上会增加散度的有害更新。
💡个人观点
论文发现了现有改进方法中邻近性与方向性判据的度量错位问题,并通过数学推导将方向判断从单样本代理回归到分布散度本身。
