笔记:Visually-Guided Policy Optimization for Multimodal Reasoning

文章链接:Visually-Guided Policy Optimization for Multimodal Reasoning - ACL Anthology

文章名称:Visually-Guided Policy Optimization for Multimodal Reasoning

文章来源:ACL26-Long (CCF-A)

问题来源:大模型在生成内容时会发生信息遗忘现象,其后续生成内容会逐渐更多依赖已经生成的文本,而弱化对原始输入资源的利用。这种现象在多模态视觉推理中尤其明显,表现为模型在推理早期能够关注图像,但随着推理链延长,视觉注意逐渐衰减,形成 Temporal Visual Forgetting(时序视觉遗忘) 。因此,文章提出一种视觉引导的强化学习训练方法 VGPO,在策略优化过程中识别与视觉信息关联程度较高的生成 token,并对推理后期的视觉关注进行补偿,使模型在长链推理过程中持续利用原始视觉证据,而不是过度依赖自身已经生成的文本信息。

1.问题描述

文章中图1具体描述了问题细节:

向文章提出的模型和基线模型(Qwen2.5-VL-7B-Instruct)中输入一个表格,里面是每个物品及其价格,要求模型进行总价计算。观察在处理相同问题时两个模型的思考过程:

1.基线模型前期很好的提取出了图片中的价格内容,但是从计算总价开始,并没有继续获取图片的相关信息。

2.文章提出模型前期和基线大体一致,但是后期再计算时在思考中再次提及了视觉内容。

这说明, 基线模型虽然能够在推理早期正确读取视觉信息,但随着推理过程推进,会逐渐转而**依赖自身已经生成的文本信息,而减少对原始视觉证据的再次调用。**VGPO则使模型在后续推理过程中仍能重新关注并利用视觉信息,从而缓解视觉遗忘。

2.问题切入

2.1.Group Relative Policy Optimization

Group Relative Policy Optimization (GRPO),是一种专门为大语言模型(LLM)的强化学习训练 设计的策略优化算法。其核心思想是:针对同一个问题生成一组不同回答,通过组内比较判断哪些回答更好,再利用这种相对优劣更新模型。

其主要原理流程为:

1.生成多个候选回答。

如图所示,对于同一个问题 q,当前策略模型会采样生成 G个不同的回答:

2.对每个回答进行评分。

根据答案正确性或其他评价标准,为每个回答得到奖励:

3.进行组内相对比较。

GRPO不只看奖励的绝对大小,而是比较一个回答在当前组中的表现。可以简单理解为:

4.根据优势更新模型。

对于正向优势的回答,提高模型产生相应生成行为的概率,对于负向优势的回答,则降低其概率:


经过大量问题和候选回答的反复训练,经常出现在高奖励推理轨迹中的有效生成模式会逐渐得到强化,而经常导致错误结果的生成模式则逐渐受到抑制。因此,可以将 GRPO 简单理解为:

同一道题多生成几个答案 → 比较谁答得更好 → 奖励好的生成行为、抑制差的生成行为 → 逐渐优化模型的推理策略。

这也正好为后面的 VGPO 埋下问题:GRPO知道"哪条回答更好",但并不知道一条回答内部哪些 token 真正利用了视觉信息。

2.2.Key Findings in Multimodal Reasoning

Key Findings in Multimodal Reasoning 主要通过分析多模态模型在推理过程中的注意力分配,揭示模型在长链推理中存在的视觉利用问题。其主要发现包括:

1.Text-dominated Inference and Sparse Visual Activation

在每一步生成过程中,模型的注意力主要集中在输入问题和已经生成的文本上,而分配给图像 token 的注意力整体较低。视觉信息通常只在少数推理步骤中出现明显激活,表现为"短暂看图、随后主要依赖文本继续推理"。

2.emporal Visual Forgetting

随着推理步骤增加,模型对视觉信息的关注通常会逐渐下降。文章进一步比较正确样本和错误样本的后期/前期视觉关注比例:

实验中,正确样本的平均比例约为:

而错误样本约为:

3.Inherent Visual Similarity can serve as Visual Focus Score

虽然整体视觉激活较弱,但当模型真正关注视觉信息时,其注意区域通常能够较准确地定位到与当前推理相关的图像内容。这说明模型的主要问题并非"完全看不懂图像",而是无法在后续推理中持续保持对视觉信息的关注。


因此,该部分实验最终得到的核心结论是:

多模态模型通常具备基本的视觉定位和信息提取能力,但在长链推理过程中容易逐渐转向依赖自身已经生成的文本,导致原始视觉证据被弱化甚至遗忘。

这一发现也直接构成了后续 VGPO 方法的设计依据:不是单纯增强视觉编码能力,而是让模型在后期推理中继续保持必要的视觉依赖。

3.方法思想

VGPO 的核心目标是:在强化学习训练过程中,让模型不仅关注最终答案是否正确,还关注推理过程中是否持续、合理地利用了视觉信息。

结合图中的数据流,其主要过程可以概括为:

  1. 生成多条推理结果
    输入图片和文本问题后,模型针对同一问题生成多条不同的推理轨迹,并像传统 GRPO 一样根据最终答案的正确性获得奖励。

  2. 判断生成内容对视觉信息的依赖程度
    VGPO利用模型内部表示,比较每个生成 token 与图像视觉表示之间的相似程度。相似程度越高,说明当前生成内容与视觉信息的联系越强。

  3. 补偿后期逐渐减弱的视觉关注
    针对前文发现的"视觉遗忘"现象,VGPO会更加关注推理后期仍与视觉信息相关的内容,避免模型随着推理链增长完全转向依赖自身已经生成的文本。

  4. 重新调整强化学习奖励。
    在原有"答案是否正确"的基础上,同时考虑:

    最终利用重新调整后的奖励更新模型,使其逐渐学习到:不仅要得到正确答案,还应该在需要视觉证据时持续利用原始图像信息。

4.关键算法

4.1.Visual Prototype 与相似度计算

首先提取图片中所有视觉 Token 的隐藏状态,并通过平均池化 得到一个整体视觉表示,即 Visual Prototype:

随后,将模型每个生成 Token 的隐藏状态与 Visual Prototype 计算余弦相似度 ,得到 Visual Focus Score:

相似度越高,表示当前生成 Token 与视觉信息的关联越强。该方法不需要额外使用 CLIP,而是直接利用 VLM 自身的内部表示。

4.2 Visual Attention Compensation(视觉注意补偿)

Visual Focus Score 得到每个生成 Token 与视觉信息的相关程度以后,作者发现不能直接拿它训练,因为推理越到后期,视觉关注天然越容易下降。

因此作者加入补偿机制:

推理越靠后,对于那些本身就具有较高视觉相关性的 Token,给予更强的视觉补偿。

它不是简单粗暴地提高所有后期 Token 的视觉权重,而是有一个门控条件:

  • 推理已经进入后半程;
  • 当前 Token 的视觉相关程度本身较高;

满足条件才增强。

4.3 Dual-grained Advantage Re-weighting(双粒度优势重加权)

这是把前面的视觉分析真正接入 GRPO 的关键。

作者从两个尺度调整原来的奖励:

Intra-trajectory:单条推理内部比较

哪些 Token 比这条推理中的其他 Token 更依赖视觉?

视觉相关程度更高的 Token,在策略更新时获得更大的权重。

Inter-trajectory:多条推理之间比较

同一道题生成的多条回答中,哪条推理整体保持了更好的视觉利用?

视觉利用更充分的 trajectory 得到更强的优化信号。

所以 Reshaped Advantage 本身不用单独列成一个算法章节 ,它就是 4.3 最后的结果:重新决定不同生成行为应该被奖励/抑制多大程度。

5.启发

这篇论文对后续研究最重要的启发并非 VGPO 本身,而是其对多模态模型内部信息利用过程的分析。

  1. 自回归生成可能造成原始信息逐渐丢失。
    模型生成的内容会继续成为后续生成的上下文,因此随着推理链增长,模型可能越来越依赖自身此前生成的信息,而逐渐降低对原始输入证据的利用。VGPO观察到的视觉遗忘就是这一现象在视觉模态上的具体表现。

  2. "输入了某种模态"不代表模型始终在利用该模态。
    即使图像和文本同时输入模型,不同推理阶段对两种模态的依赖程度也可能发生明显变化。因此,未来研究图文相关性或一致性时,不应只分析最终输出,还可以研究推理过程中图像与文本的动态依赖变化。

  3. 模型内部表示可以用于衡量模态相关性。

    VGPO没有额外使用 CLIP,而是将视觉 Token 聚合为 Visual Prototype,再与生成 Token 的 Hidden State 计算相似度,以此估计当前生成内容对视觉信息的依赖程度。

    这一思想可以迁移到未来的图文一致性研究中,例如分别构造视觉和文本表示,判断两种模态之间的相关程度,而不一定完全依赖外部相似度模型。

  4. "相关"与"冲突"需要区分。

    Visual Focus Score解决的主要是"当前内容与视觉信息是否相关",但低相关并不代表图文冲突。例如图片无法验证文本中的某项信息时,也可能表现为低相关。因此未来若研究图文一致性,可以进一步拆分为:

    复制代码
    图文输入
       ↓
    相关性 / 可验证性判断
       ↓
    是否存在共同语义证据?
       ↓
    一致性 / 冲突判断
       ↓
    图像支持文本 / 图像反驳文本 / 无法判断
  5. 研究问题的发现方式值得借鉴。

    论文不是先提出 VGPO 再寻找应用场景,而是从错误案例出发,通过 Attention 分析发现文本主导现象,再通过跨数据集统计和正确/错误样本对比确认 Temporal Visual Forgetting,最后才针对该现象设计优化方法。

    因此以后面对"图文是否表达一致"这类问题,可以优先采用:

    复制代码
    观察失败案例
        ↓
    分析模型内部行为
        ↓
    提出潜在异常现象
        ↓
    设计指标量化
        ↓
    在不同数据/模型上验证是否普遍存在
        ↓
    最后设计针对性方法

核心启发: 与其直接设计一个"图文一致性门控",更值得首先研究:当图像和文本共同输入时,模型究竟如何在两种模态之间分配依赖;这种依赖是否会随着自回归推理发生漂移;当图文存在冲突时,模型又会逐渐相信哪一种模态。 如果这些现象能够被稳定测量和验证,本身就可能形成后续研究的问题基础。

相关推荐
jidaowansui几秒前
B3643 图的存储———>数组模拟邻接矩阵
算法
EchoMind-Henry3 分钟前
DeepSeek换个位置,检索准确率差40.2个百分点?
人工智能·机器学习
y1su11 分钟前
Leetcode 二分模板
java·数据结构·算法·leetcode·排序算法
ifenxi爱分析15 分钟前
爱分析发布《2026 爱分析·Data+AI应用实践报告》
大数据·人工智能
youshi666818 分钟前
平衡车——PID算法优化
stm32·单片机·嵌入式硬件·算法·pid·平衡车
Thuni_soft22 分钟前
华宇亮相2026药品数智发展大会:AI助推医疗器械审评审批提质增效
大数据·人工智能
通信大模型26 分钟前
Aerial Agentic AI:面向低空无线网络的 LLM 与 SLM 协同框架
人工智能
lingyubb31 分钟前
支持多语种配音的短视频配音工具横向评测|出海内容技术拆解
自然语言处理·音视频·语音识别·ai配音·多语种
元岳数字人小元36 分钟前
数字人私有化部署:企业级AI数字场景长效落地优选方案
运维·人工智能·开源·人机交互·交互