【VQA】VideoChat3长视频理解模型

note

  • VideoChat3 通过 I3D-ViT 早期时空压缩 + 自适应分辨率 + 大规模重标注/合成视频指令数据 + 四阶段训练 ,在完全开源 的前提下,用 4B 参数实现了在通用、长视频、流式视频理解上优于同/更大规模开源模型的性能,并显著提升长视频推理效率和主动流式交互能力。
  • 通用长视频多模态大模型,针对现有视频MLLM痛点:普遍将视频拆分为独立图片序列编码,丢失帧间时序运动信息;长视频输入易出现Token爆炸、推理成本高昂;多数模型仅半开源,难以完整复现。该模型原生仅支持视频+文本输入,无内置音频编码通路。
  • 架构要点
    • I3D-ViT时空编码器:对连续帧块执行时空联合建模,捕获画面动态信息,配套空间与时序池化实现高倍率特征压缩。
    • 自适应分辨率流式感知机制:依据画面内容动态调整分辨率,平淡场景降低算力消耗,关键事件保留图像细节,适配直播、长视频流式持续输入场景。
    • 分层训练数据体系:搭建三层开源视频指令数据集Academic2M、LV116K、OL617K,覆盖短视频、长视频、直播流媒体场景。
  • 模型效果:模型评测覆盖长视频问答、时序定位、动态动作理解、流式视频四大类主流基准(Video-MME、TimeLens、MotionBench、TempCompass、ODVBench、StreamingBench):
    • 4B参数量下,相比Qwen3-VL-4B,19项评测指标中18项实现提升;
    • 时序定位任务优势显著:TimeLens、VUE-TR、MomentSeeker基准大幅超越VideoChat-Flash-7B;在MotionBench达到61.7、TempCompass达到75.6,为开源模型最优水平;部分时序定位子集指标超越GPT-5、Gemini 2.5 Flash闭源模型;
    • 长视频基准Video-MME得分70.1;流式视频基准ODVBench 72.3、StreamingBench 83.0;
    • 处理最长2048帧超长视频场景,相比Qwen3-VL推理延迟下降54%;消融实验证实:编码器内置时空建模方案效果优于稀疏单帧独立采样方案。

文章目录

  • note
    • 概览
    • 一、研究动机
    • 二、VideoChat3
      • [1. 高效模型架构](#1. 高效模型架构)
        • [(1)I3D-ViT(Inflated 3D Vision Transformer)](#(1)I3D-ViT(Inflated 3D Vision Transformer))
        • [(2)Adaptive Frame Resolution(自适应帧分辨率,面向流式视频)](#(2)Adaptive Frame Resolution(自适应帧分辨率,面向流式视频))
      • [2. 大规模高质量视频指令数据](#2. 大规模高质量视频指令数据)
      • [3. 四阶段训练策略](#3. 四阶段训练策略)
    • 三、实验结果和分析
      • [1. 通用视频理解(短时 / 长时 / 推理 / 时间定位)](#1. 通用视频理解(短时 / 长时 / 推理 / 时间定位))
      • [2. 流式视频理解](#2. 流式视频理解)
      • [3. 效率分析](#3. 效率分析)
      • [4. 消融实验要点](#4. 消融实验要点)
  • Reference

概览

一、研究动机

arXiv链接:https://arxiv.org/abs/2607.14935

这篇论文是 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding(2026年7月arXiv),由南京大学、上海人工智能实验室、南洋理工大学等机构联合提出。

主页:https://mcg-nju.github.io/VideoChat3

模型与数据:https://huggingface.co/collections/MCG-NJU/videochat3

代码:https://github.com/MCG-NJU/VideoChat3

现有开源视频多模态大语言模型(Video MLLM)存在三个明显短板:

  1. 泛化能力不足
    • 很多模型只在特定视频场景(短视频 / 长视频 / 流式视频)表现好,换一类视频就掉性能,难以落地到真实多样的场景(社媒、监控、自动驾驶、具身感知等)。
  2. 计算开销高
    • 视频天然比图像多一个时间维度,直接把图像 MLLM 扩展到视频会导致视觉 token 爆炸,长视频和实时流理解在显存、时延上都很难承受。
  3. 开放性不够
    • 不少高性能模型是闭源,或部分开源(只放权重,不放训练代码 / 策略 / 数据集),社区难以复现、改进和理解性能来源,阻碍开源生态发展。

二、VideoChat3

VideoChat3 从模型架构、数据构建、训练流程、全栈开源 四个层面系统设计,只用 4B 参数就达到优于更大参数开源模型的性能。

1. 高效模型架构

(1)I3D-ViT(Inflated 3D Vision Transformer)
  • 在预训练图像 ViT(MoonViT)基础上膨胀为时空 ViT
    • 把 2D 空间自注意力扩展成分块时空自注意力
    • 将连续 T=4 帧作为一个 chunk,在 chunk 内做联合时空建模;
    • 再对时间维做 temporal pooling ,整体实现 16× 时空压缩(4 帧时间压缩 + 2×2 空间下采样)。
  • 效果:
    • 在视觉编码器阶段就压缩冗余,送入 LLM 的视觉 token 只有同类模型(如 Qwen3-VL)的 约一半
    • LLM 计算复杂度是序列长度的二次方,因此显著节省显存和时延,尤其利好长视频。
(2)Adaptive Frame Resolution(自适应帧分辨率,面向流式视频)
  • 受人类观看直播启发:平时低分辨率监控,关键时刻切高分辨率细看
  • 引入三种状态 token,由模型自己预测:
    • Silence:无相关证据 → 低分辨率(224²);
    • Standby:可能有证据但不足 → 下一窗口切高分辨率(448²);
    • Response:证据足够 → 生成回答,之后回到低分辨率监控。
  • 优点:
    • 大部分背景帧用低分辨率,只在必要时消耗更多视觉预算;
    • I3D-ViT 本身支持变分辨率输入,不需要额外的高分辨率编码器。

2. 大规模高质量视频指令数据

论文构建了 3 个百万级数据集 ,覆盖通用、长视频、流式场景,合计约 300 万 条高质量多模态指令样本:

  1. VideoChat3-Academic2M
    • 对公开学术数据集(caption、QA、运动感知等)重新标注:
      • 把原始"选项 / 短语级"答案,重写为带视觉证据和推理的自然语言回答
      • 用大模型做一致性校验,过滤幻觉和不一致样本。
  2. VideoChat3-LV116K
    • 针对长视频(平均时长 156s~1300s):
      • 先边界感知时序分割;
      • 分段用 VLM 描述 + 质量过滤;
      • 再由 LLM 合成长视频任务:时间定位、时间线总结、跨段 QA 等。
  3. VideoChat3-OL617K
    • 把离线视频 QA 转为在线流式监督
      • 定位关键视觉线索区间;
      • 验证区间是否足以回答问题;
      • 构造带 </Silence>、</Standby>、</Response> 的流式序列,训练模型学会"何时沉默、何时准备、何时回答"。

3. 四阶段训练策略

阶段 目的 可训练模块 关键数据
Stage 0 视觉 tokenizer 预训练(语言接地) 投影 → 全参数 图文 + 视频文本对(7.59M)
Stage 1 视频--语言对齐 投影 → ViT+LLM caption 为主(3.47M)
Stage 2 通用视频指令微调 全参数 图像+视频指令(10.33M)
Stage 3 长视频 & 流式指令微调 投影+LLM 长视频+流式数据(3.41M)

具体的训练参数:

  • Stage 3 还设计了 state transition masking
    • 保留所有状态切换位置的损失;
    • 在"维持原状态"的位置均匀采样等量样本;
    • 避免模型只学"一直 Silence"或只看前一状态而不看画面。

三、实验结果和分析

1. 通用视频理解(短时 / 长时 / 推理 / 时间定位)

19 项基准上对比专有模型、仅开放权重的模型和完全开源模型:

  • 参数量仅 4B 的 VideoChat3-4B
    • MotionBench(61.7)、TempCompass(75.6) 上取得完全开源模型最优
    • 相比同规模完全开源 Molmo2-4B、VideoChat-Flash-7B 在多数指标更优;
    • 在时间定位(TimeLens、VUE-TR、MomentSeeker)提升尤其明显,例如 TimeLens 三个子集分别 +9.7 / +6.4 / +8.3;
    • 相比 Qwen3-VL-4B,在 18/19 个指标上提升,仅在一个开集指标略降。

说明:I3D-ViT 的时空压缩 + 学术数据重写,显著增强了细粒度运动感知和时间定位能力


2. 流式视频理解

在 ODVBench、OVBench、StreamingBench、River(感知与记忆)以及 OVO-Timing、ProactiveVQA(主动响应)上评估:

  • 感知与记忆
    • ODVBench 72.3(超 StreamForest 12.4),OVOBench 任务均值得益 +0.9,StreamingBench +2.8,River +2.9;
  • 主动响应(OVO-Timing F1)
    • VideoChat3 35.5,超过专用模型 Em-Garde(31.0),且不依赖额外 2B 辅助模块;
    • 相比 Qwen3-VL-4B 提升 +27.4。

说明:自适应分辨率和流式状态监督,让模型既能持续记忆 ,又能在正确时机主动回答


3. 效率分析

在 NVIDIA H200 上对比 Qwen3-VL 与 VideoChat3(同每帧 patch 数设定):

输入帧数 Visual Tokens(VC3 / Qwen3) 总时延(VC3 / Qwen3) 显存(VC3 / Qwen3)
256 12.5K / 25K 1.65s / 1.36s(短视频略高) 17.7G / 20.6G
512 25K / 50K 3.60s / 3.84s 26.7G / 32.9G
1024 50K / 100K 8.10s / 12.25s 44.7G / 57.6G
2048 100K / 200K 20.41s / 44.45s 80.8G / 106.9G
  • 短视频(256 帧)时,VC3 因 I3D-ViT 计算略重,总时延稍高;
  • 随着帧数增加,LLM 二次方成本主导 ,VC3 的 token 减半优势迅速放大:
    • 2048 帧时,时延降低 ~54% ,FLOPs 减少 ~62% ,显存省 ~26GB

结论:把压缩做在视觉端(线性成本)而非 LLM 端(二次方成本),对长视频扩展性非常关键。


4. 消融实验要点

  1. I3D-ViT vs MoonViT
    • I3D-ViT 在视频任务全面显著优于图像 ViT,得益于 4× 时间压缩支持采更多帧。
  2. 动态分辨率 + 状态掩码
    • 固定低分辨率:F1 33.5;固定高分辨率:30.5;动态(224²&448²)35.5,且视觉预算仅 30.2%。
    • 状态损失:全量→5.8,仅过渡→20.1,状态过渡掩码→35.5
  3. Academic2M 重写
    • 多数时间感知 / 时间定位指标明显提升(如 TempCompass 67.8→74.6,TL mIoU 38.1→45.0)。
  4. LV116K / OL617K
    • LV116K 提升长视频和长时间定位;
    • OL617K 把 OVO-Timing F1 从 4.0 拉到 35.5,同时不损害离线视频性能。

Reference

1 VideoChat3:一个全栈开源的视频理解大模型,4b跑分还把GPT-5比下去了

2 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

相关推荐
MindUp5 小时前
面试录音视频的AI复盘方案:从语音转录到RAG问答的技术实践
人工智能·面试·音视频
EasyDSS7 小时前
企业培训视频散落各处?EasyDSS视频直播点播平台模块如何让知识资产“活“起来
音视频·媒体·直播·点播·easydss
白拾7 小时前
【CVPR 2026】CoF:Chain-of-Frames,让视频大模型按帧推理|从多模态视频推理范式视角
人工智能·多模态大模型·视频理解·cvpr 2026·cof 论文分享·链式推理·帧感知推理
海带紫菜菠萝汤9 小时前
VP9 vs AV1 vs H.265 编码格式对比:压缩效率与解码性能实测
音视频·h.265·av1·vp9
tedcloud12311 小时前
Kimi-K3 部署指南:大模型应用开发环境搭建实践
linux·运维·服务器·开源·音视频
星花月11 小时前
视频压缩为什么会变糊?从码率、分辨率到 H.264/H.265 的参数选择指南
ffmpeg·音视频·h.265·视频编解码·视频
苏醒的人生11 小时前
2026年支持最多全模态素材的AI视频生成工具推荐:即梦AI Seedance 2.5一次投喂50个素材,精准还原每一步
人工智能·音视频
却道天凉_好个秋12 小时前
音视频学习(一百零二):全彩夜视
学习·音视频·全彩夜视
却道天凉_好个秋12 小时前
音视频学习(一百零一):IR-Cut
学习·音视频·ir-cut