腾讯:预测散度掩码提升LLM强化学习

📖标题:Predictive Divergence Masks for LLM RL

🌐来源:arXiv, 2607.10848v1

🛎️文章简介

🔸研究问题:在大语言模型强化学习中,当使用分布散度作为信任区域邻近性判据时,如何设计与之对齐的方向性判据以解决传统采样比率判据的不一致问题?

🔸主要贡献:提出预测散度掩码,通过解析推导散度的方向导数并设计轻量级估计器,实现了与散度变化严格对齐的更新方向控制,显著提升了训练稳定性与效果。

📝重点思路

🔸指出DPPO等现有方法仅升级了基于散度的邻近性判据,却保留了基于单样本重要性比率的方向性判据,导致两者在判断更新是否偏离行为策略时存在符号不一致的理论缺陷。

🔸定义预测散度掩码,核心思想是直接询问下一步梯度更新会增加还是减少当前定义的散度,从而决定是否屏蔽该token的梯度,确保方向判据与邻近性判据基于同一度量标准。

🔸针对Softmax策略推导散度方向导数的闭式解,将其分解为反映采样token概率差的局部项和反映整个词汇表归一化耦合的全局项,揭示传统比率判据仅捕捉局部项而忽略全局影响的本质。

🔸鉴于生产环境推理引擎仅提供Top-K概率,开发两种轻量级尾部估计器(聚合尾部估计和均匀尾部估计)来近似计算全局项,无需额外前向或反向传播,计算开销极低。

🔎分析总结

🔸理论分析表明,预测散度掩码中的方向判据比传统的采样比率判据能更准确地对齐散度的实际变化,特别是在采样token差距与分布整体修正方向相反时,能有效纠正错误判断。

🔸在Qwen3不同规模模型及FP8精度设置下的实验显示,引入预测散度掩码的方法在AIME基准测试中均优于DPPO基线,且在更严格的信任区域阈值下表现出更强的鲁棒性。

🔸Token级别的详细分析证实,在两个判据做出不同决策的少数样本中,基于散度的方向判据具有更低的不安全保留率,即更少地保留那些实际上会增加散度的有害更新。

💡个人观点

论文发现了现有改进方法中邻近性与方向性判据的度量错位问题,并通过数学推导将方向判断从单样本代理回归到分布散度本身。

相关推荐
ivywriter22 分钟前
【具身智能】物理AI具体指什么,和具身智能是什么关系?
人工智能
new_zhou26 分钟前
C++ 项目 AI 协作指南(Windows / MSVC 环境)
c++·人工智能·windows
洛阳泰山31 分钟前
AI 应用层被 Python 卷成红海,为什么我偏要用 Java 造一个 RAG + 工作流引擎?
java·人工智能·后端
wangray1997droid39 分钟前
让 AI 拥有“真实记忆“:一次从碎片到叙事的记忆系统质变
人工智能
一次旅行41 分钟前
AI 前沿日报 | 2026年08月08日 星期六
人工智能
hyuk的AI工坊1 小时前
Agent/Tool Calling 深度实战:LangChain4j 生产级工具设计
人工智能
manyingAi1 小时前
AIGC 落地影视内容行业:漫映 AI 漫剧全链路工作流技术架构解析
人工智能·架构·aigc
架构师汤师爷1 小时前
我用WorkBuddy和ima搭了一套AI写作工作流,真滴香晕了!
人工智能
观远数据1 小时前
当ChatBI遇上数据合规:AI+BI规模化落地的安全边界如何划定
大数据·人工智能·安全
Qyr992 小时前
吞咽困难介护食:老龄化社会中的营养安全守护者
人工智能