腾讯:预测散度掩码提升LLM强化学习

📖标题:Predictive Divergence Masks for LLM RL

🌐来源:arXiv, 2607.10848v1

🛎️文章简介

🔸研究问题:在大语言模型强化学习中,当使用分布散度作为信任区域邻近性判据时,如何设计与之对齐的方向性判据以解决传统采样比率判据的不一致问题?

🔸主要贡献:提出预测散度掩码,通过解析推导散度的方向导数并设计轻量级估计器,实现了与散度变化严格对齐的更新方向控制,显著提升了训练稳定性与效果。

📝重点思路

🔸指出DPPO等现有方法仅升级了基于散度的邻近性判据,却保留了基于单样本重要性比率的方向性判据,导致两者在判断更新是否偏离行为策略时存在符号不一致的理论缺陷。

🔸定义预测散度掩码,核心思想是直接询问下一步梯度更新会增加还是减少当前定义的散度,从而决定是否屏蔽该token的梯度,确保方向判据与邻近性判据基于同一度量标准。

🔸针对Softmax策略推导散度方向导数的闭式解,将其分解为反映采样token概率差的局部项和反映整个词汇表归一化耦合的全局项,揭示传统比率判据仅捕捉局部项而忽略全局影响的本质。

🔸鉴于生产环境推理引擎仅提供Top-K概率,开发两种轻量级尾部估计器(聚合尾部估计和均匀尾部估计)来近似计算全局项,无需额外前向或反向传播,计算开销极低。

🔎分析总结

🔸理论分析表明,预测散度掩码中的方向判据比传统的采样比率判据能更准确地对齐散度的实际变化,特别是在采样token差距与分布整体修正方向相反时,能有效纠正错误判断。

🔸在Qwen3不同规模模型及FP8精度设置下的实验显示,引入预测散度掩码的方法在AIME基准测试中均优于DPPO基线,且在更严格的信任区域阈值下表现出更强的鲁棒性。

🔸Token级别的详细分析证实,在两个判据做出不同决策的少数样本中,基于散度的方向判据具有更低的不安全保留率,即更少地保留那些实际上会增加散度的有害更新。

💡个人观点

论文发现了现有改进方法中邻近性与方向性判据的度量错位问题,并通过数学推导将方向判断从单样本代理回归到分布散度本身。

相关推荐
程序员-李俞19 小时前
向量引擎接入自研 API 中转网关:鉴权、限流、熔断和审计日志复盘
服务器·人工智能·大模型·api·ai编程·ai api
雪碧聊技术19 小时前
软件定义三维近存AI芯片发布——国产算力走出“不依赖先进制程”的独特路线
人工智能
夜瞬19 小时前
内生可解释性:从黑盒深度模型到可理解、可干预的智能系统
人工智能·python
额恩6619 小时前
阶段一:Vue 2 单页应用基础
人工智能·深度学习·机器学习
大模型丫丫19 小时前
Skill-Agent 如何实践:从概念到落地的完整指南
java·大数据·人工智能
工业HMI实战笔记19 小时前
【拯救HMI】:边缘计算在工业自动化中的落地:低延迟控制的实现路径
人工智能·自动化·边缘计算
Ivanqhz19 小时前
预训练 Embedding + 轻量级线上模型
人工智能·机器学习·embedding
问商十三载19 小时前
2026大模型GEO优化体系:3层链路提收录,零成本提34%引用率附工具包
大数据·前端·人工智能
小码哥哥19 小时前
企业AI知识库本地部署的安全真相
人工智能·安全