腾讯:预测散度掩码提升LLM强化学习

📖标题:Predictive Divergence Masks for LLM RL

🌐来源:arXiv, 2607.10848v1

🛎️文章简介

🔸研究问题:在大语言模型强化学习中,当使用分布散度作为信任区域邻近性判据时,如何设计与之对齐的方向性判据以解决传统采样比率判据的不一致问题?

🔸主要贡献:提出预测散度掩码,通过解析推导散度的方向导数并设计轻量级估计器,实现了与散度变化严格对齐的更新方向控制,显著提升了训练稳定性与效果。

📝重点思路

🔸指出DPPO等现有方法仅升级了基于散度的邻近性判据,却保留了基于单样本重要性比率的方向性判据,导致两者在判断更新是否偏离行为策略时存在符号不一致的理论缺陷。

🔸定义预测散度掩码,核心思想是直接询问下一步梯度更新会增加还是减少当前定义的散度,从而决定是否屏蔽该token的梯度,确保方向判据与邻近性判据基于同一度量标准。

🔸针对Softmax策略推导散度方向导数的闭式解,将其分解为反映采样token概率差的局部项和反映整个词汇表归一化耦合的全局项,揭示传统比率判据仅捕捉局部项而忽略全局影响的本质。

🔸鉴于生产环境推理引擎仅提供Top-K概率,开发两种轻量级尾部估计器(聚合尾部估计和均匀尾部估计)来近似计算全局项,无需额外前向或反向传播,计算开销极低。

🔎分析总结

🔸理论分析表明,预测散度掩码中的方向判据比传统的采样比率判据能更准确地对齐散度的实际变化,特别是在采样token差距与分布整体修正方向相反时,能有效纠正错误判断。

🔸在Qwen3不同规模模型及FP8精度设置下的实验显示,引入预测散度掩码的方法在AIME基准测试中均优于DPPO基线,且在更严格的信任区域阈值下表现出更强的鲁棒性。

🔸Token级别的详细分析证实,在两个判据做出不同决策的少数样本中,基于散度的方向判据具有更低的不安全保留率,即更少地保留那些实际上会增加散度的有害更新。

💡个人观点

论文发现了现有改进方法中邻近性与方向性判据的度量错位问题,并通过数学推导将方向判断从单样本代理回归到分布散度本身。

相关推荐
大模型任我行17 分钟前
谷歌:“课程学习”融入扩散模型强化学习
人工智能·语言模型·自然语言处理·论文笔记
AIGCmagic社区28 分钟前
具身智能专题:机器人也有Scaling Law?智元GE-Act 2.0用3万小时真机数据给出答案
人工智能·aigc·具身智能
Rosanci1 小时前
谷歌浏览器插件开发实战指南:从 Hello World 到上架发布
大数据·人工智能·chrome·程序人生
明月_清风2 小时前
AI 越来越强,程序员真正的价值到底是什么?
人工智能·后端
m0_466525292 小时前
云从科技上线云起ModelHub:AI团队时代的模型算力基础设施
大数据·人工智能·科技
火山引擎开发者社区2 小时前
OpenViking:给 Codex 加上长期记忆
人工智能
荆棘鸟智能2 小时前
城市感知设备怎么统一接入?从多协议网关到设备模型的中间件架构设计
人工智能·算法·边缘计算
火山引擎开发者社区2 小时前
当 AI 内容真假难辨,谁来为真实签名 —— 证书中心 C2PA 内容可信溯源服务正式发布
人工智能
百万蹄蹄向前冲2 小时前
风扇转了一晚上MVP专家团翻车事故
前端·人工智能
米小虾3 小时前
你的 harness 技巧有保质期:176 组对照实验显示,上下文管理的收益从 35.7 分跌到 2.7 分
人工智能·agent