【CVPR 2026】CoF:Chain-of-Frames,让视频大模型按帧推理|从多模态视频推理范式视角

摘要

本文解读 CVPR 2026 论文《Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning》。该论文提出 Chain-of-Frames(CoF,帧感知推理链) ,通过融合单阶段链式推理显式帧引用真实+合成双通道数据生成 ,让视频多模态大模型在回答前先输出一段明确引用关键帧的推理过程,其特别之处在于把"关键帧检索"内化为纯文本推理轨迹中的帧编号引用,无需任何辅助模型。实验表明 CoF-InternVL3 在五个视频理解基准上平均达到 72.1(较基座 +5.1),其中 VSI 51.3 与 MVBench 77.1 登顶、超越 GPT-4o 与 Gemini-1.5-Pro,为视频链式推理的轻量化与数据可扩展提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning
标题(中文) Chain-of-Frames:让视频大模型按帧推理
作者 Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg
机构 New York University (NYU) \\cdot EPFL
会议 CVPR 2026
arXiv arXiv:2506.00318
项目网站 github.com/SaraGhazanfari/CoF

背景与动机:为什么视频链式推理又贵又不可靠?

视频理解中的 Chain-of-Thought(CoT)推理长期面临一个两难:要么推理过程没有时间锚点,要么依赖复杂的多阶段流水线

  • 单阶段路线的代表 VideoCoT:用 LLM 与人工专家迭代标注生成推理轨迹,但标注过程昂贵、数据集仅 1.1 万条,且推理步骤没有帧级对齐,容易产生时序不一致与幻觉。
  • 多阶段路线的代表 VideoEspresso、M-LLM、Video-of-Thought:先用辅助模型挑选关键帧、构建时空场景图,再把结果交给主模型。推理开销大、只能处理帧子集,丢失全局时序上下文。

从历史脉络看(附录 H),视频 CoT 在 2024 年由 VideoCoT 开启单阶段路线、Video-of-Thought 与 VideoEspresso 走多阶段流水线,两者都难以兼顾成本时序锚定。CoF 在 2026 年给出第三种答案:单阶段推理 + 显式帧引用 + 低成本合成数据规模化。

研究主线:从问题到结论

图 1(Mermaid 流程图):CoF 研究主线------从视频 CoT 的时序锚定问题出发,经数据生成与微调,到五基准全面验证。

基准/方法设计:CoF 是什么?

CoF 的核心是把帧位置编号(Frame 1、Frame 2...)作为推理轨迹中的显式引用标识。与时间戳不同,帧编号与视频时长、采样频率无关,跨数据更一致、更容易学习。

图 2:CoF-4B 生成的链式帧推理------模型在回答前显式引用关键帧(VideoMME 样例),推理过程可核查。

相比现有方案,CoF 有四个优势:数据质量 (帧级对齐的标注生成时间上准确的推理)、简洁性 (纯自然语言,无边界框/场景图等复杂格式)、显式时序锚定 (帧引用写进推理链而非多阶段检索)、可解释性(推理时可见模型引用了哪些帧)。

分类全景:视频 CoT 的两大流派

图 3(Mermaid 流程图):视频 CoT 两大流派------单阶段(无帧级对齐)与多阶段(辅助模型选帧/场景图),CoF 以单阶段+显式帧引用立足。

方法细节:两步数据生成流水线

COF-DATA 由两步流水线生成(图 4):Step 1 帧 ID 对齐 ------把原始帧编号映射到时间戳、裁剪到模型最大支持时长(30 秒)、按新位置重校准编号;Step 2 生成三元组------真实视频用 Llama-3.1-8B-Instruct 基于帧级字幕生成(问题、帧感知推理、答案),合成视频用 CLEVRER 富标注配合手工模板生成。

图 4:COF-DATA 两步生成流水线------Step 1 重校准帧 ID 保持对齐;Step 2 用 Llama-3.1-8B(真实视频)与手工模板(合成视频)生成 CoF 三元组。

最终数据集 COF-DATA 共 164,186 条 :真实视频(VideoEspresso)103,683 条、合成视频(CLEVRER)60,503 条。合成数据覆盖三类定量问题:物体计数、出现顺序、相对距离,全部由模板自动生成、零 LLM 成本。数据过滤阶段剔除问题本身引用帧的样本,并保留少量无引用样本,避免强迫模型在不需要推理的任务上输出帧引用。

InternVL 系列的编码格式与 CoF 天然互补(图 5):每帧前插入 Frame-1Frame-2 文本标识符,模型在预训练时就熟悉帧编号语义,微调后能自然把帧引用写进推理轨迹。

图 5:InternVL 视频编码格式------每帧前插入文本标识符,与 CoF 的帧引用天然互补。

训练配置:InternVL2.5 全参数微调(冻结视觉编码器)、InternVL3 用 LoRA 降低显存、Phi-3.5-Vision 验证跨架构泛化;单节点 4×H100,学习率 2\\times10\^{-6},batch size 2,单 epoch;推理时均匀采样 30 帧。

实验设计与结果:五基准两冠两亚

评测覆盖五个互补基准:VideoMME (6 大视觉域、2--60 分钟长短视频)、MVBench (20 项跨帧任务)、VSI (空间定量推理,用平均相对准确率 \\mathcal{MRA}=\\frac{1}{10}\\sum_{\\theta\\in\\mathcal{C}}\\mathds{1}(\|\\hat{y}-y\|/y\<1-\\theta) 衡量)、VidHalEventHallusion(视频/事件幻觉)。

模型 VSI VideoMME MVBench 平均
GPT-4o 34.0 71.9 -- --
Gemini-1.5-Pro 48.8 75.0 -- --
Qwen2-VL-72B 37.6 71.2 73.6 62.7
InternVL3(基座) 41.0 66.5 74.4 67.0
CoF-InternVL2.5 36.9 59.7 76.1 64.6
CoF-InternVL3(本文) 51.3 73.7 77.1 72.1

图 6:CoF 模型 vs 基座(含 CoT 提示)------几乎全基准稳定提升。

CoF-InternVL3 在 VSI 上 51.3(超 Gemini-1.5-Pro 的 48.8)、MVBench 77.1 全场第一、EventHallusion 78.7 开源最佳,平均 72.1 比基座 InternVL3 高 5.1。

附录 A 的五种推理变体消融(基于 InternVL2.5)进一步证明帧引用是收益核心

InternVL2.5 变体 VSI VideoMME MVBench VidHal EventHall.
原始模型 31.8 54.9 70.8 74.0 62.5
+ CoT 提示 33.5 54.7 71.5 77.0 67.4
+ SFT QA only 31.8 54.5 73.4 64.1 57.7
+ SFT CoT 34.3 58.6 73.7 77.9 53.1
+ SFT CoF(本文) 36.9 59.7 76.1 79.2 71.2

去掉帧引用的 CoT 微调在 EventHallusion 上反而退化到 53.1,纯 QA 微调全面受损------说明收益来自帧级时序锚定,而非简单的微调或提示。

合成数据的分布外迁移同样反直觉(图 7):纯 CLEVRER 合成数据训练在多数基准上反超纯真实数据,两者组合后进一步超过单一来源。

图 7:合成数据影响------多数基准上纯合成训练优于纯真实数据,两者组合最佳(InternVL2.5,均 164k 样本)。

推理时帧引用行为(附录 B,图 8)显示:CoF-InternVL3 的 76.9% 回答包含至少一个帧引用,且幻觉类基准上无引用回答的比例明显更低------模型把帧引用当作可选的证据机制,按任务动态调整。

图 8:推理时帧引用分布------CoF-InternVL3 生成的回答中帧引用数量(76.9% 含至少一个引用)。

结果对比总结

图 9(Mermaid 流程图):CoF-InternVL3 五基准平均 72.1(+5.1),VSI 与 MVBench 登顶、EventHallusion 开源最佳。

关键发现

  • 单阶段帧感知推理可行:CoF-InternVL3 平均 72.1(较基座 +5.1),CoF-InternVL2.5 平均 64.6(+3.8),更大模型获益更多。
  • 超越闭源模型:VSI 51.3 超过 Gemini-1.5-Pro 的 48.8,MVBench 77.1 超过 Qwen2-VL-72B 的 73.6,EventHallusion 78.7 为开源最佳。
  • 合成数据分布外迁移显著:纯 CLEVRER 合成数据训练在多数基准反超纯真实数据,计数、排序能力成功迁移到真实视频。
  • 帧引用是收益来源:五种变体消融中 SFT with CoF 全部基准最优(36.9/59.7/76.1/79.2/71.2),去帧引用的 CoT 微调在 EventHallusion 退步。
  • 帧引用按任务自适应:76.9% 回答含帧引用,幻觉基准上引用更密集,模型学会了何时需要视觉证据锚定。
  • 跨架构泛化:CoF 在 InternVL2.5、InternVL3、Phi-3.5-Vision 三个模型家族上均稳定提升(附录)。

局限性

  • 固定 FPS 前提:帧编号必须与模型实际看到的帧一一对应,动态帧率模型(如 Qwen2.5-VL)无法直接套用。
  • 数据规模有限:164k 样本仍小于通用视频预训练数据,规模效应未充分探索。
  • 基座依赖:主要验证 InternVL 家族,其帧间标识符格式是 CoF 收益的重要条件。
  • 引用质量缺乏校验:模型会选择性引用,但何时该引用、引用是否准确仍缺细粒度自动评估。

常见问题(FAQ)

CoF 与普通 CoT 提示有什么区别?

CoT 提示只是引导模型"逐步思考",推理没有时间锚点;CoF 微调让模型在推理轨迹中显式引用 Frame N 等帧编号,把时序锚定写进推理本身。消融显示仅提示(+CoT Prompting)提升有限,而 SFT with CoF 全部基准最优。

CoF 需要辅助模型来挑选关键帧吗?

不需要。关键帧检索被内化为推理轨迹中的显式帧引用,单阶段推理一次前向完成,无需 VideoEspresso、M-LLM 那样的辅助选帧模型或多阶段流水线。

为什么合成数据也能提升真实视频理解?

CLEVRER 的富标注让计数、出现顺序、相对距离这类空间定量任务的推理轨迹可以零成本精确生成;模型从合成数据学到任务本身,并成功迁移到分布外的真实评测视频。

COF-DATA 数据集有多大、怎么生成?

共 164,186 条:真实视频(VideoEspresso)103,683 条由 Llama-3.1-8B 基于帧级字幕生成,合成视频(CLEVRER)60,503 条由手工模板自动生成。

CoF 在哪些基准上超越了闭源模型?

VSI 51.3(超 Gemini-1.5-Pro 48.8)、MVBench 77.1(全场第一)、EventHallusion 78.7(开源最佳);VideoMME 73.7 位列第二。

CoF 能用于动态帧率的视频大模型吗?

当前不能直接套用------帧编号必须与模型实际输入帧对齐。作者将动态帧率编码适配列为未来方向。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
星核0penstarry1 小时前
超越 VLA:NVIDIA 解读|世界动作模型,会是具身智能的未来吗?
人工智能·机器人
科里 Coralyx1 小时前
评测凭什么成为模型护城河:Agent评测的跨厂机制分析
大数据·人工智能·ai
武子康1 小时前
VLA 落地先签动作合同:从视觉语言输入到可执行控制指令
人工智能·llm·agent
知识燃料2 小时前
企业级生成式 AI 云平台推荐,哪些平台更适合从 Agent 原型走向生产?
大数据·人工智能
oioihoii2 小时前
我用 Seed Evolving 做了个 AI 小说写作工具
人工智能
龙虾PRO2 小时前
破解变异 OLLVM 混淆新思路:基于 Angr 动态执行自动化还原控制流完整实操方案
人工智能
@Mr_LiuYang2 小时前
《深入理解 AI Agent:设计原理与工程实践 》实验1-1上下文的关键作用
人工智能
大模型丫丫2 小时前
MCP协议开发实战:从零搭建AI Agent工具链
人工智能
wangxin2082 小时前
大模型稀疏注意力和MoE的宽度丢失与多智能体的维度补充
人工智能·ai·多智能体·管理学·组织管理·coordclaw·稀释注意力