笔记:Visually-Guided Policy Optimization for Multimodal Reasoning

文章链接:Visually-Guided Policy Optimization for Multimodal Reasoning - ACL Anthology

文章名称:Visually-Guided Policy Optimization for Multimodal Reasoning

文章来源:ACL26-Long (CCF-A)

问题来源:大模型在生成内容时会发生信息遗忘现象,其后续生成内容会逐渐更多依赖已经生成的文本,而弱化对原始输入资源的利用。这种现象在多模态视觉推理中尤其明显,表现为模型在推理早期能够关注图像,但随着推理链延长,视觉注意逐渐衰减,形成 Temporal Visual Forgetting(时序视觉遗忘) 。因此,文章提出一种视觉引导的强化学习训练方法 VGPO,在策略优化过程中识别与视觉信息关联程度较高的生成 token,并对推理后期的视觉关注进行补偿,使模型在长链推理过程中持续利用原始视觉证据,而不是过度依赖自身已经生成的文本信息。

1.问题描述

文章中图1具体描述了问题细节:

向文章提出的模型和基线模型(Qwen2.5-VL-7B-Instruct)中输入一个表格,里面是每个物品及其价格,要求模型进行总价计算。观察在处理相同问题时两个模型的思考过程:

1.基线模型前期很好的提取出了图片中的价格内容,但是从计算总价开始,并没有继续获取图片的相关信息。

2.文章提出模型前期和基线大体一致,但是后期再计算时在思考中再次提及了视觉内容。

这说明, 基线模型虽然能够在推理早期正确读取视觉信息,但随着推理过程推进,会逐渐转而**依赖自身已经生成的文本信息,而减少对原始视觉证据的再次调用。**VGPO则使模型在后续推理过程中仍能重新关注并利用视觉信息,从而缓解视觉遗忘。

2.问题切入

2.1.Group Relative Policy Optimization

Group Relative Policy Optimization (GRPO),是一种专门为大语言模型(LLM)的强化学习训练 设计的策略优化算法。其核心思想是:针对同一个问题生成一组不同回答,通过组内比较判断哪些回答更好,再利用这种相对优劣更新模型。

其主要原理流程为:

1.生成多个候选回答。

如图所示,对于同一个问题 q,当前策略模型会采样生成 G个不同的回答:

2.对每个回答进行评分。

根据答案正确性或其他评价标准,为每个回答得到奖励:

3.进行组内相对比较。

GRPO不只看奖励的绝对大小,而是比较一个回答在当前组中的表现。可以简单理解为:

4.根据优势更新模型。

对于正向优势的回答,提高模型产生相应生成行为的概率,对于负向优势的回答,则降低其概率:


经过大量问题和候选回答的反复训练,经常出现在高奖励推理轨迹中的有效生成模式会逐渐得到强化,而经常导致错误结果的生成模式则逐渐受到抑制。因此,可以将 GRPO 简单理解为:

同一道题多生成几个答案 → 比较谁答得更好 → 奖励好的生成行为、抑制差的生成行为 → 逐渐优化模型的推理策略。

这也正好为后面的 VGPO 埋下问题:GRPO知道"哪条回答更好",但并不知道一条回答内部哪些 token 真正利用了视觉信息。

2.2.Key Findings in Multimodal Reasoning

Key Findings in Multimodal Reasoning 主要通过分析多模态模型在推理过程中的注意力分配,揭示模型在长链推理中存在的视觉利用问题。其主要发现包括:

1.Text-dominated Inference and Sparse Visual Activation

在每一步生成过程中,模型的注意力主要集中在输入问题和已经生成的文本上,而分配给图像 token 的注意力整体较低。视觉信息通常只在少数推理步骤中出现明显激活,表现为"短暂看图、随后主要依赖文本继续推理"。

2.emporal Visual Forgetting

随着推理步骤增加,模型对视觉信息的关注通常会逐渐下降。文章进一步比较正确样本和错误样本的后期/前期视觉关注比例:

实验中,正确样本的平均比例约为:

而错误样本约为:

3.Inherent Visual Similarity can serve as Visual Focus Score

虽然整体视觉激活较弱,但当模型真正关注视觉信息时,其注意区域通常能够较准确地定位到与当前推理相关的图像内容。这说明模型的主要问题并非"完全看不懂图像",而是无法在后续推理中持续保持对视觉信息的关注


因此,该部分实验最终得到的核心结论是:

多模态模型通常具备基本的视觉定位和信息提取能力,但在长链推理过程中容易逐渐转向依赖自身已经生成的文本,导致原始视觉证据被弱化甚至遗忘。

这一发现也直接构成了后续 VGPO 方法的设计依据:不是单纯增强视觉编码能力,而是让模型在后期推理中继续保持必要的视觉依赖。

3.方法思想

VGPO 的核心目标是:在强化学习训练过程中,让模型不仅关注最终答案是否正确,还关注推理过程中是否持续、合理地利用了视觉信息。

结合图中的数据流,其主要过程可以概括为:

  1. 生成多条推理结果
    输入图片和文本问题后,模型针对同一问题生成多条不同的推理轨迹,并像传统 GRPO 一样根据最终答案的正确性获得奖励。

  2. 判断生成内容对视觉信息的依赖程度
    VGPO利用模型内部表示,比较每个生成 token 与图像视觉表示之间的相似程度。相似程度越高,说明当前生成内容与视觉信息的联系越强。

  3. 补偿后期逐渐减弱的视觉关注
    针对前文发现的"视觉遗忘"现象,VGPO会更加关注推理后期仍与视觉信息相关的内容,避免模型随着推理链增长完全转向依赖自身已经生成的文本。

  4. 重新调整强化学习奖励。
    在原有"答案是否正确"的基础上,同时考虑:

    最终利用重新调整后的奖励更新模型,使其逐渐学习到:不仅要得到正确答案,还应该在需要视觉证据时持续利用原始图像信息。

4.关键算法

4.1.Visual Prototype 与相似度计算

首先提取图片中所有视觉 Token 的隐藏状态,并通过平均池化 得到一个整体视觉表示,即 Visual Prototype

随后,将模型每个生成 Token 的隐藏状态与 Visual Prototype 计算余弦相似度 ,得到 Visual Focus Score

相似度越高,表示当前生成 Token 与视觉信息的关联越强。该方法不需要额外使用 CLIP,而是直接利用 VLM 自身的内部表示。

4.2 Visual Attention Compensation(视觉注意补偿)

Visual Focus Score 得到每个生成 Token 与视觉信息的相关程度以后,作者发现不能直接拿它训练,因为推理越到后期,视觉关注天然越容易下降

因此作者加入补偿机制:

推理越靠后,对于那些本身就具有较高视觉相关性的 Token,给予更强的视觉补偿。

它不是简单粗暴地提高所有后期 Token 的视觉权重,而是有一个门控条件:

  • 推理已经进入后半程;
  • 当前 Token 的视觉相关程度本身较高;

满足条件才增强。

4.3 Dual-grained Advantage Re-weighting(双粒度优势重加权)

这是把前面的视觉分析真正接入 GRPO 的关键。

作者从两个尺度调整原来的奖励:

Intra-trajectory:单条推理内部比较

哪些 Token 比这条推理中的其他 Token 更依赖视觉?

视觉相关程度更高的 Token,在策略更新时获得更大的权重。

Inter-trajectory:多条推理之间比较

同一道题生成的多条回答中,哪条推理整体保持了更好的视觉利用?

视觉利用更充分的 trajectory 得到更强的优化信号。

所以 Reshaped Advantage 本身不用单独列成一个算法章节 ,它就是 4.3 最后的结果:重新决定不同生成行为应该被奖励/抑制多大程度

5.启发

这篇论文对后续研究最重要的启发并非 VGPO 本身,而是其对多模态模型内部信息利用过程的分析。

  1. 自回归生成可能造成原始信息逐渐丢失。
    模型生成的内容会继续成为后续生成的上下文,因此随着推理链增长,模型可能越来越依赖自身此前生成的信息,而逐渐降低对原始输入证据的利用。VGPO观察到的视觉遗忘就是这一现象在视觉模态上的具体表现。

  2. "输入了某种模态"不代表模型始终在利用该模态。
    即使图像和文本同时输入模型,不同推理阶段对两种模态的依赖程度也可能发生明显变化。因此,未来研究图文相关性或一致性时,不应只分析最终输出,还可以研究推理过程中图像与文本的动态依赖变化

  3. 模型内部表示可以用于衡量模态相关性。

    VGPO没有额外使用 CLIP,而是将视觉 Token 聚合为 Visual Prototype,再与生成 Token 的 Hidden State 计算相似度,以此估计当前生成内容对视觉信息的依赖程度。

    这一思想可以迁移到未来的图文一致性研究中,例如分别构造视觉和文本表示,判断两种模态之间的相关程度,而不一定完全依赖外部相似度模型。

  4. "相关"与"冲突"需要区分。

    Visual Focus Score解决的主要是"当前内容与视觉信息是否相关",但低相关并不代表图文冲突。例如图片无法验证文本中的某项信息时,也可能表现为低相关。因此未来若研究图文一致性,可以进一步拆分为:

    复制代码
    图文输入
       ↓
    相关性 / 可验证性判断
       ↓
    是否存在共同语义证据?
       ↓
    一致性 / 冲突判断
       ↓
    图像支持文本 / 图像反驳文本 / 无法判断
  5. 研究问题的发现方式值得借鉴。

    论文不是先提出 VGPO 再寻找应用场景,而是从错误案例出发,通过 Attention 分析发现文本主导现象,再通过跨数据集统计和正确/错误样本对比确认 Temporal Visual Forgetting,最后才针对该现象设计优化方法。

    因此以后面对"图文是否表达一致"这类问题,可以优先采用:

    复制代码
    观察失败案例
        ↓
    分析模型内部行为
        ↓
    提出潜在异常现象
        ↓
    设计指标量化
        ↓
    在不同数据/模型上验证是否普遍存在
        ↓
    最后设计针对性方法

核心启发: 与其直接设计一个"图文一致性门控",更值得首先研究:当图像和文本共同输入时,模型究竟如何在两种模态之间分配依赖;这种依赖是否会随着自回归推理发生漂移;当图文存在冲突时,模型又会逐渐相信哪一种模态。 如果这些现象能够被稳定测量和验证,本身就可能形成后续研究的问题基础。

相关推荐
智嵌研习社12 分钟前
从 Prompt 到工程化技能包:AI Skills 标准与 Continue 落地
人工智能·prompt·skill
一只QAQ15 分钟前
c++项目
java·c++·算法
STLearner18 分钟前
KDD 2026 | (2月轮)时空数据(Spatial-Temporal)论文总结时空(交通)预测,轨迹数据挖掘(表示,生成)
论文阅读·人工智能·python·深度学习·学习·机器学习·数据挖掘
学习星球19 分钟前
空天地一体化网络(NTN)深度解析:从Starlink D2C到3GPP NTN,卫星直连手机是如何实现的?
网络·人工智能·算法·智能手机·php
Liudef0626 分钟前
腾讯混元Hunyuan3D-Part:重新定义3D部件生成的革命性架构
人工智能·3d·架构·腾讯混元hunyuan3d
zhangjin112027 分钟前
NLP英文分词
人工智能·自然语言处理
爱分享的康康27 分钟前
端到端自动驾驶仿真平台选型:确定性、传感器保真与车规合规实践
人工智能·机器学习·自动驾驶
一条破秋裤28 分钟前
STM32 学习笔记:中断系统与 EXTI 外部中断
笔记·stm32·学习