note
- 给出了一套比较完整的 长视频 Omni 模型训练 recipe:AV-Skills 数据 → Short → Long → Timestamp CoT → GRPO
- AV-Flamingo 是一个面向长视频 Audio-Visual 理解的开源 7B 模型,核心贡献不是新 Backbone,而是 AV-Skills 大规模音视频数据、Short→Long 课程训练,以及带时间戳的 TAVIT CoT + GRPO,让模型能够在长视频中进行跨时间、跨音视频模态推理。
- Audio-Visual 联合训练:不是简单"视频抽帧 + ASR 文本拼接",而是将声音和视觉按照时间轴显式对齐后共同输入 LLM。
- Timestamp CoT:长视频推理中,模型不仅输出 reasoning,还显式指出证据发生在哪个时间点,这比普通 CoT 更适合长视频场景。
文章目录
- note
-
- [Audio-Visual Flamingo:面向长视频的开源音视频理解模型](#Audio-Visual Flamingo:面向长视频的开源音视频理解模型)
- [1. 研究动机](#1. 研究动机)
- [2. 论文核心](#2. 论文核心)
-
- [2.1 模型架构](#2.1 模型架构)
- [2.2 AV-Skills 数据](#2.2 AV-Skills 数据)
- [3. 三阶段训练](#3. 三阶段训练)
- [4. GRPO Reward](#4. GRPO Reward)
- [5. 实验结果](#5. 实验结果)
- [6. 最关键的消融](#6. 最关键的消融)
Audio-Visual Flamingo:面向长视频的开源音视频理解模型
Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
arXiv:https://arxiv.org/abs/2607.16107
机构:NVIDIA + 马里兰大学 | 参数规模:7B,开源
1. 研究动机
现有 Video-LLM / Omni 模型主要有两个问题:
- 很多模型实际上偏 视觉理解,音频、语音、环境声和画面之间的联合建模不足;
- 大多数模型更擅长短视频,面对电影、访谈、播客等长视频时,跨时间事件关联和音视频对齐能力明显下降。
AV-Flamingo 的目标就是:
让模型同时理解画面、语音、声音,并能够在长视频中进行跨时间、跨模态推理。
论文同时指出,现有训练数据大量是 audio-only、video-only 或短视频数据,缺少真正面向长视频 Audio-Visual Reasoning 的大规模训练集。
2. 论文核心
这篇论文的核心并不是提出一个全新的 Backbone,而是:
大规模 Audio-Visual 数据 + 三阶段课程训练 + 带时间戳的 CoT 推理。
2.1 模型架构
- 时序交错音画对齐
SigLIP编码视觉帧、AF-Whisper滑动窗口编码音频;特征严格按时间戳交错排布进token序列,依靠LLM自注意力自然完成视听跨模态融合,无需额外跨注意力模块。 - Dynamic S2动态Token压缩
动态调整帧率与分辨率,控制token总量,是实现超长视频输入、防止上下文爆炸的核心手段。 - CRTE时序扰动正则化
训练时对时序施加随机扰动,提升模型对剪辑、音画不同步、丢帧等真实视频噪声的鲁棒性。 - 模态均衡损失设计
平衡视觉与音频权重,缓解大模型先天视觉偏好问题,让模型平等利用图像、音频信息。

整体结构为:
text
Video → SigLIP Vision Encoder ┐
├→ Audio-Visual Temporal Alignment
Audio → AF-Whisper Encoder ┘
↓
Qwen2.5-7B LLM
↓
Text / Speech
视觉和音频首先独立编码,再按照时间轴进行 interleave,并加入时间位置编码,使 LLM 能直接建模:
"某个声音出现时,画面发生了什么"。
2.2 AV-Skills 数据
作者构建了大规模 Audio-Visual-Skills 数据:
- AV-Skills-Short:≤ 60 秒;
- AV-Skills-Long:60 秒~15 分钟;
- 总计约 7M caption / QA 样本。
数据重点训练的不是简单识别,而是:
- Temporal Reasoning
- Audio-Visual Alignment
- Counting
- Relation / Causal Reasoning
- Needle-in-the-Haystack
- Long-video QA
- Detailed Captioning
核心思想是:
针对当前 Omni 模型的能力短板,主动构造对应训练数据。
3. 三阶段训练
AV-Flamingo 的训练流程是这篇论文最值得关注的部分。
Stage 1:Short-context SFT
使用短视频、图片、音频、ASR 等混合数据进行训练,最大上下文 16K,主要学习基础视觉、音频以及初步 Audio-Visual Alignment。
Stage 2:Long-context SFT
加入 AV-Skills-Long,最大视频长度扩展到 15 分钟、Context 扩展到 32K,重点提升长视频理解和时间推理能力。
训练完成得到:
AVF-Instruct
Stage 3:CoT + GRPO
作者进一步构造 AV-Think 数据,让模型输出带时间戳的推理链,例如:
text
<t=00:20> 听到某句话
<t=01:15> 画面出现某人物
<t=03:10> 出现某事件
→ 综合判断答案
这种方法称为 TAVIT:Temporal Audio-Visual Interleaved Chain-of-Thought。
随后:
AVF-Instruct → CoT SFT → GRPO → AVF-Think
4. GRPO Reward
GRPO 部分本身比较标准。
同一个输入采样多个回答,然后使用三类 Reward:
- Format Reward :是否正确输出
<think>/<answer>格式; - Accuracy Reward:QA 最终答案是否正确;
- Structured Reward:长 Caption / 开放回答转成结构化字段后,与 GT 进行匹配。
例如将回答解析成:
json
{
"scene": "...",
"participants": "...",
"events": "...",
"topic": "...",
"conclusion": "..."
}
再计算字段匹配得分。
5. 实验结果
整体结果不错,但不是所有榜单都第一。
比较值得关注的是:
| Benchmark | Baseline | AVF-Instruct | AVF-Think |
|---|---|---|---|
| WorldSense | OmniVinci 48.2 | 50.3 | 51.6 |
| DailyOmni | OmniVinci 66.5 | 72.4 | 73.9 |
| MMOU | Gemini-2.5 Pro 64.2 | 56.9 | 60.2 |
| Video-MME | OmniVinci 67.3 | 70.7 | - |
其中 MMOU 上,7B 级 AVF-Think 达到 60.2 ,距离 Gemini-2.5 Pro 的 64.2 已经比较接近。
不过 LongVideoBench:
OmniVinci:62.0
AVF-Instruct:60.1
所以它并不是所有长视频 Benchmark 都 SOTA。
6. 最关键的消融
论文最有价值的一个结果是:
| 模型 | DailyOmni | WorldSense | VideoMME |
|---|---|---|---|
| OmniVinci | 66.5 | 48.2 | 67.3 |
| + AV-Skills-Short | 69.5 | 48.5 | 68.5 |
| + AV-Skills-Long | 72.4 | 50.3 | 70.7 |
这个结果说明:
长视频能力并不会单纯随着模型参数变大自然出现,专门构造长视频 Audio-Visual 数据进行训练非常重要。