SIGIR 2026|南京大学:Video-GAR:“通过生成 Query 来验证视频语义理解”的生成增强范式

前言:

Video-GAR 干的事:

把传统 VCMR 中"视频-文本相似度匹配"的判别式范式,改造成"通过生成 Query 来验证视频语义理解"的生成增强范式。

论文将传统问题概括为两个:

浅层匹配(Superficial Matching):模型容易抓住"狗、红色管道"等静态显著特征,而忽略"快速跑过"这样的动作语义;

细粒度语义对齐不足(Fine-grained Semantic Alignment):判别式匹配只需要"区分正负样本",并不要求模型真正理解视频,因此容易出现 Attention Drift,导致时间边界不准确。

💡创新1:Bi-Mamba Video Retrieval

要解决的问题:

长视频太长,Transformer的Self-Attention计算复杂度是 O(N2),视频帧数一多,计算和显存成本都会快速增加。

所以作者不用Transformer直接处理整段视频,而是:

把Transformer的二次复杂度长视频建模改成SSM的线性复杂度。

从结构上看,这一创新点可以拆成两个层次来理解:一是把建模主体从 Transformer 换成 SSM,二是把复杂度从二次降到线性。先点明这两层,再分别展开,会更容易跟上。

在逻辑上,建议补充一个"为什么需要换"的动机:Transformer 在长视频场景下,自注意力机制的计算量会随序列长度平方增长,导致显存和耗时都难以承受;而 SSM 通过状态空间递推,把计算开销压到线性,才让"整段长视频直接建模"成为可能。

在案例上,可以补一个直观对比:例如一段 10 分钟、按秒抽帧得到 600 帧的视频,Transformer 需要处理 600×600 量级的注意力关系,而 Bi-Mamba 只需线性扫描一遍,训练和推理的差距会非常明显。

📌好处:

① 把长视频建模从Transformer的二次复杂度路线转向SSM的线性复杂度路线;

② 能够建模长距离时间依赖;

③ 双向建模同时利用过去和未来信息。

🏃‍♀️做法:

复制代码
Video
 ↓
Forward Mamba
 +
Backward Mamba
 ↓
Concat + Linear
 ↓
Hv

💡创新2:Generation-Augmented Fusion

这是整篇论文真正核心的创新。作者的核心想法:

不要直接要求Attention"看对地方",而是让Attention承载的信息必须足够支持Query生成。

把"Query重构"作为Semantic Regularizer,用生成任务反向校准Cross-Attention。

📌好处:

让模型从"匹配表面特征"转向"理解视频语义";减少Attention Drift;不需要额外Frame-Level语义标注(作者利用已有的Query Ground Truth作为生成监督,因此没有引入密集的Frame1、2、3这种额外人工标注);推理阶段没有额外生成成本(Decode训练完直接扔掉)。

最关键:Decoder只在训练阶段存在,Inference(推理)阶段直接删除,因此生成模块不会增加部署推理成本。

🏃‍♀️做法:

复制代码
Video + Query
      ↓
Fusion Encoder
      ↓
Cross Attention
      ↓
Hfuse
      ↓
Autoregressive Decoder
      ↓
Reconstruct Query
      ↓
LGEN
      ↓
反向传播
      ↓
校准Attention

🔥 最关键的地方:为什么它能够"校准Attention"?

Generation Loss → Fusion Feature → Cross-Attention → Attention权重

也就是:

复制代码
Attention关注错误区域
        ↓
Fusion Feature语义信息不足
        ↓
Query生成错误
        ↓
LGEN变大
        ↓
梯度反向传播
        ↓
修改Attention
        ↓
逐渐关注真正与Query相关的Frame

因此:Query生成任务成为了对Video-Text Attention的间接监督。

💡创新3:Boundary-Aware Localization

前面的Generation模块解决的是:

"模型到底关注哪个时间区域?"

但还没有彻底解决:

"到底从哪一帧开始,到哪一帧结束?"

因此作者又提出Boundary-Aware Localization。

把Moment Localization从"边界回归/阈值判断"改成"Start/End序列分类"。

📌好处:

显式建模Start / End,提高细粒度时间边界定位能力,并通过联合概率保证起止位置的一致性。

🏃‍♀️做法:

作者把:Moment Localization重新定义成:Sequence Classification

复制代码
Sattn(输入)
 ↓
Conv1D(start)
 ↓
Softmax
 ↓
Pstart / Pend
 ↓
所有合法(i,j)
 ↓
Pstart(i) × Pend(j)
 ↓
Joint Likelihood Search
 ↓
最佳Moment

💡创新4:训练-推理解耦(Video-GAR很重要的工程思想)

训练时使用Generation,推理时删除Generation。

即训练时可以使用昂贵的生成模型提供强监督;部署时把它拿掉。

📌核心思想:

训练阶段用昂贵的生成任务换取更强的语义表示,推理阶段保留已经被校准过的Attention,从而获得"生成式训练 + 轻量级推理"。

❀总结:

模块 解决的问题 核心方法
Bi-Mamba 长视频计算成本高 SSM线性复杂度 + 双向建模
Generation-Augmented Fusion 浅层匹配、Attention Drift Query重构作为Semantic Regularizer
Boundary-Aware Localization 时间边界不精确 Start/End序列分类 + Joint Likelihood

🧠思考:

论文讲的一句话可以概括:不是直接告诉模型"你应该关注这个Frame",而是让模型为了完成Query生成任务,自己学会必须关注哪些Frame。也就是:生成任务→语义监督→Attention校准→更好的定位。

这篇论文对于学习推荐系统来说,最重要不是Video+Mamba,而是:把"生成"从最终输出形式,变成一种训练信号,用生成能力反过来约束底层表示学习。

相关推荐
speop1 小时前
Hello-Agents | Task00 环境配置
人工智能
7177771 小时前
基于 Gitee 的软件成分分析(SCA)工具选型与集成参考
人工智能·gitee
子非鱼eva1 小时前
Ascend950PR版本速配表
人工智能·ai
Henry-SAP1 小时前
SAP PP模块核心机制解析
人工智能·云原生·sap·erp
imbackneverdie1 小时前
论文中的机制图、原理图用什么软件画?AI生成可编辑矢量图的方法分享
人工智能·深度学习·计算机视觉·aigc·科研·ai绘图·科研绘图
suaizai_1 小时前
GraphEngineering:重塑AI Agent的工作形状
人工智能
知行产研1 小时前
地下矿的绿色革命,中车广州的‘双造‘跨界样本。
人工智能
Elsa️7461 小时前
算法一周刷题总结
c++·算法
Sophnet云平台1 小时前
2026:AI Agent应用元年,企业从试点到核心业务的跨越逻辑
网络·人工智能·llm·openai·agent