note
- VideoChat3 通过 I3D-ViT 早期时空压缩 + 自适应分辨率 + 大规模重标注/合成视频指令数据 + 四阶段训练 ,在完全开源 的前提下,用 4B 参数实现了在通用、长视频、流式视频理解上优于同/更大规模开源模型的性能,并显著提升长视频推理效率和主动流式交互能力。
- 通用长视频多模态大模型,针对现有视频MLLM痛点:普遍将视频拆分为独立图片序列编码,丢失帧间时序运动信息;长视频输入易出现Token爆炸、推理成本高昂;多数模型仅半开源,难以完整复现。该模型原生仅支持视频+文本输入,无内置音频编码通路。
- 架构要点
- I3D-ViT时空编码器:对连续帧块执行时空联合建模,捕获画面动态信息,配套空间与时序池化实现高倍率特征压缩。
- 自适应分辨率流式感知机制:依据画面内容动态调整分辨率,平淡场景降低算力消耗,关键事件保留图像细节,适配直播、长视频流式持续输入场景。
- 分层训练数据体系:搭建三层开源视频指令数据集Academic2M、LV116K、OL617K,覆盖短视频、长视频、直播流媒体场景。
- 模型效果:模型评测覆盖长视频问答、时序定位、动态动作理解、流式视频四大类主流基准(Video-MME、TimeLens、MotionBench、TempCompass、ODVBench、StreamingBench):
- 4B参数量下,相比Qwen3-VL-4B,19项评测指标中18项实现提升;
- 时序定位任务优势显著:TimeLens、VUE-TR、MomentSeeker基准大幅超越VideoChat-Flash-7B;在MotionBench达到61.7、TempCompass达到75.6,为开源模型最优水平;部分时序定位子集指标超越GPT-5、Gemini 2.5 Flash闭源模型;
- 长视频基准Video-MME得分70.1;流式视频基准ODVBench 72.3、StreamingBench 83.0;
- 处理最长2048帧超长视频场景,相比Qwen3-VL推理延迟下降54%;消融实验证实:编码器内置时空建模方案效果优于稀疏单帧独立采样方案。
文章目录
- note
-
- 概览
- 一、研究动机
- 二、VideoChat3
-
- [1. 高效模型架构](#1. 高效模型架构)
-
- [(1)I3D-ViT(Inflated 3D Vision Transformer)](#(1)I3D-ViT(Inflated 3D Vision Transformer))
- [(2)Adaptive Frame Resolution(自适应帧分辨率,面向流式视频)](#(2)Adaptive Frame Resolution(自适应帧分辨率,面向流式视频))
- [2. 大规模高质量视频指令数据](#2. 大规模高质量视频指令数据)
- [3. 四阶段训练策略](#3. 四阶段训练策略)
- 三、实验结果和分析
-
- [1. 通用视频理解(短时 / 长时 / 推理 / 时间定位)](#1. 通用视频理解(短时 / 长时 / 推理 / 时间定位))
- [2. 流式视频理解](#2. 流式视频理解)
- [3. 效率分析](#3. 效率分析)
- [4. 消融实验要点](#4. 消融实验要点)
- Reference
概览
一、研究动机
arXiv链接:https://arxiv.org/abs/2607.14935
这篇论文是 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding(2026年7月arXiv),由南京大学、上海人工智能实验室、南洋理工大学等机构联合提出。
主页:https://mcg-nju.github.io/VideoChat3
模型与数据:https://huggingface.co/collections/MCG-NJU/videochat3
代码:https://github.com/MCG-NJU/VideoChat3
现有开源视频多模态大语言模型(Video MLLM)存在三个明显短板:
- 泛化能力不足
- 很多模型只在特定视频场景(短视频 / 长视频 / 流式视频)表现好,换一类视频就掉性能,难以落地到真实多样的场景(社媒、监控、自动驾驶、具身感知等)。
- 计算开销高
- 视频天然比图像多一个时间维度,直接把图像 MLLM 扩展到视频会导致视觉 token 爆炸,长视频和实时流理解在显存、时延上都很难承受。
- 开放性不够
- 不少高性能模型是闭源,或部分开源(只放权重,不放训练代码 / 策略 / 数据集),社区难以复现、改进和理解性能来源,阻碍开源生态发展。

二、VideoChat3
VideoChat3 从模型架构、数据构建、训练流程、全栈开源 四个层面系统设计,只用 4B 参数就达到优于更大参数开源模型的性能。
1. 高效模型架构

(1)I3D-ViT(Inflated 3D Vision Transformer)
- 在预训练图像 ViT(MoonViT)基础上膨胀为时空 ViT :
- 把 2D 空间自注意力扩展成分块时空自注意力;
- 将连续 T=4 帧作为一个 chunk,在 chunk 内做联合时空建模;
- 再对时间维做 temporal pooling ,整体实现 16× 时空压缩(4 帧时间压缩 + 2×2 空间下采样)。
- 效果:
- 在视觉编码器阶段就压缩冗余,送入 LLM 的视觉 token 只有同类模型(如 Qwen3-VL)的 约一半;
- LLM 计算复杂度是序列长度的二次方,因此显著节省显存和时延,尤其利好长视频。
(2)Adaptive Frame Resolution(自适应帧分辨率,面向流式视频)

- 受人类观看直播启发:平时低分辨率监控,关键时刻切高分辨率细看。
- 引入三种状态 token,由模型自己预测:
Silence:无相关证据 → 低分辨率(224²);Standby:可能有证据但不足 → 下一窗口切高分辨率(448²);Response:证据足够 → 生成回答,之后回到低分辨率监控。
- 优点:
- 大部分背景帧用低分辨率,只在必要时消耗更多视觉预算;
- I3D-ViT 本身支持变分辨率输入,不需要额外的高分辨率编码器。
2. 大规模高质量视频指令数据
论文构建了 3 个百万级数据集 ,覆盖通用、长视频、流式场景,合计约 300 万 条高质量多模态指令样本:
- VideoChat3-Academic2M
- 对公开学术数据集(caption、QA、运动感知等)重新标注:
- 把原始"选项 / 短语级"答案,重写为带视觉证据和推理的自然语言回答;
- 用大模型做一致性校验,过滤幻觉和不一致样本。
- 对公开学术数据集(caption、QA、运动感知等)重新标注:
- VideoChat3-LV116K
- 针对长视频(平均时长 156s~1300s):
- 先边界感知时序分割;
- 分段用 VLM 描述 + 质量过滤;
- 再由 LLM 合成长视频任务:时间定位、时间线总结、跨段 QA 等。
- 针对长视频(平均时长 156s~1300s):
- VideoChat3-OL617K
- 把离线视频 QA 转为在线流式监督 :
- 定位关键视觉线索区间;
- 验证区间是否足以回答问题;
- 构造带
</Silence>、</Standby>、</Response>的流式序列,训练模型学会"何时沉默、何时准备、何时回答"。
- 把离线视频 QA 转为在线流式监督 :
3. 四阶段训练策略
| 阶段 | 目的 | 可训练模块 | 关键数据 |
|---|---|---|---|
| Stage 0 | 视觉 tokenizer 预训练(语言接地) | 投影 → 全参数 | 图文 + 视频文本对(7.59M) |
| Stage 1 | 视频--语言对齐 | 投影 → ViT+LLM | caption 为主(3.47M) |
| Stage 2 | 通用视频指令微调 | 全参数 | 图像+视频指令(10.33M) |
| Stage 3 | 长视频 & 流式指令微调 | 投影+LLM | 长视频+流式数据(3.41M) |
具体的训练参数:

- Stage 3 还设计了 state transition masking :
- 保留所有状态切换位置的损失;
- 在"维持原状态"的位置均匀采样等量样本;
- 避免模型只学"一直 Silence"或只看前一状态而不看画面。

三、实验结果和分析
1. 通用视频理解(短时 / 长时 / 推理 / 时间定位)

在 19 项基准上对比专有模型、仅开放权重的模型和完全开源模型:
- 参数量仅 4B 的 VideoChat3-4B :
- 在 MotionBench(61.7)、TempCompass(75.6) 上取得完全开源模型最优;
- 相比同规模完全开源 Molmo2-4B、VideoChat-Flash-7B 在多数指标更优;
- 在时间定位(TimeLens、VUE-TR、MomentSeeker)提升尤其明显,例如 TimeLens 三个子集分别 +9.7 / +6.4 / +8.3;
- 相比 Qwen3-VL-4B,在 18/19 个指标上提升,仅在一个开集指标略降。
说明:I3D-ViT 的时空压缩 + 学术数据重写,显著增强了细粒度运动感知和时间定位能力。
2. 流式视频理解

在 ODVBench、OVBench、StreamingBench、River(感知与记忆)以及 OVO-Timing、ProactiveVQA(主动响应)上评估:
- 感知与记忆 :
- ODVBench 72.3(超 StreamForest 12.4),OVOBench 任务均值得益 +0.9,StreamingBench +2.8,River +2.9;
- 主动响应(OVO-Timing F1) :
- VideoChat3 35.5,超过专用模型 Em-Garde(31.0),且不依赖额外 2B 辅助模块;
- 相比 Qwen3-VL-4B 提升 +27.4。
说明:自适应分辨率和流式状态监督,让模型既能持续记忆 ,又能在正确时机主动回答。
3. 效率分析
在 NVIDIA H200 上对比 Qwen3-VL 与 VideoChat3(同每帧 patch 数设定):
| 输入帧数 | Visual Tokens(VC3 / Qwen3) | 总时延(VC3 / Qwen3) | 显存(VC3 / Qwen3) |
|---|---|---|---|
| 256 | 12.5K / 25K | 1.65s / 1.36s(短视频略高) | 17.7G / 20.6G |
| 512 | 25K / 50K | 3.60s / 3.84s | 26.7G / 32.9G |
| 1024 | 50K / 100K | 8.10s / 12.25s | 44.7G / 57.6G |
| 2048 | 100K / 200K | 20.41s / 44.45s | 80.8G / 106.9G |
- 短视频(256 帧)时,VC3 因 I3D-ViT 计算略重,总时延稍高;
- 随着帧数增加,LLM 二次方成本主导 ,VC3 的 token 减半优势迅速放大:
- 2048 帧时,时延降低 ~54% ,FLOPs 减少 ~62% ,显存省 ~26GB。
结论:把压缩做在视觉端(线性成本)而非 LLM 端(二次方成本),对长视频扩展性非常关键。
4. 消融实验要点
- I3D-ViT vs MoonViT
- I3D-ViT 在视频任务全面显著优于图像 ViT,得益于 4× 时间压缩支持采更多帧。
- 动态分辨率 + 状态掩码
- 固定低分辨率:F1 33.5;固定高分辨率:30.5;动态(224²&448²) :35.5,且视觉预算仅 30.2%。
- 状态损失:全量→5.8,仅过渡→20.1,状态过渡掩码→35.5。
- Academic2M 重写
- 多数时间感知 / 时间定位指标明显提升(如 TempCompass 67.8→74.6,TL mIoU 38.1→45.0)。
- LV116K / OL617K
- LV116K 提升长视频和长时间定位;
- OL617K 把 OVO-Timing F1 从 4.0 拉到 35.5,同时不损害离线视频性能。
Reference
1 VideoChat3:一个全栈开源的视频理解大模型,4b跑分还把GPT-5比下去了
2 VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding