【全模态】音视频理解模型Audio-Visual Flamingo

note

  • 给出了一套比较完整的 长视频 Omni 模型训练 recipe:AV-Skills 数据 → Short → Long → Timestamp CoT → GRPO
  • AV-Flamingo 是一个面向长视频 Audio-Visual 理解的开源 7B 模型,核心贡献不是新 Backbone,而是 AV-Skills 大规模音视频数据、Short→Long 课程训练,以及带时间戳的 TAVIT CoT + GRPO,让模型能够在长视频中进行跨时间、跨音视频模态推理。
  • Audio-Visual 联合训练:不是简单"视频抽帧 + ASR 文本拼接",而是将声音和视觉按照时间轴显式对齐后共同输入 LLM。
  • Timestamp CoT:长视频推理中,模型不仅输出 reasoning,还显式指出证据发生在哪个时间点,这比普通 CoT 更适合长视频场景。

文章目录

  • note
    • [Audio-Visual Flamingo:面向长视频的开源音视频理解模型](#Audio-Visual Flamingo:面向长视频的开源音视频理解模型)
    • [1. 研究动机](#1. 研究动机)
    • [2. 论文核心](#2. 论文核心)
      • [2.1 模型架构](#2.1 模型架构)
      • [2.2 AV-Skills 数据](#2.2 AV-Skills 数据)
    • [3. 三阶段训练](#3. 三阶段训练)
    • [4. GRPO Reward](#4. GRPO Reward)
    • [5. 实验结果](#5. 实验结果)
    • [6. 最关键的消融](#6. 最关键的消融)

Audio-Visual Flamingo:面向长视频的开源音视频理解模型

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

arXiv:https://arxiv.org/abs/2607.16107

机构:NVIDIA + 马里兰大学 | 参数规模:7B,开源

1. 研究动机

现有 Video-LLM / Omni 模型主要有两个问题:

  • 很多模型实际上偏 视觉理解,音频、语音、环境声和画面之间的联合建模不足;
  • 大多数模型更擅长短视频,面对电影、访谈、播客等长视频时,跨时间事件关联和音视频对齐能力明显下降。

AV-Flamingo 的目标就是:

让模型同时理解画面、语音、声音,并能够在长视频中进行跨时间、跨模态推理。

论文同时指出,现有训练数据大量是 audio-only、video-only 或短视频数据,缺少真正面向长视频 Audio-Visual Reasoning 的大规模训练集。


2. 论文核心

这篇论文的核心并不是提出一个全新的 Backbone,而是:

大规模 Audio-Visual 数据 + 三阶段课程训练 + 带时间戳的 CoT 推理。

2.1 模型架构

  1. 时序交错音画对齐
    SigLIP编码视觉帧、AF-Whisper滑动窗口编码音频;特征严格按时间戳交错排布进token序列,依靠LLM自注意力自然完成视听跨模态融合,无需额外跨注意力模块。
  2. Dynamic S2动态Token压缩
    动态调整帧率与分辨率,控制token总量,是实现超长视频输入、防止上下文爆炸的核心手段。
  3. CRTE时序扰动正则化
    训练时对时序施加随机扰动,提升模型对剪辑、音画不同步、丢帧等真实视频噪声的鲁棒性。
  4. 模态均衡损失设计
    平衡视觉与音频权重,缓解大模型先天视觉偏好问题,让模型平等利用图像、音频信息。

整体结构为:

text 复制代码
Video → SigLIP Vision Encoder ┐
                              ├→ Audio-Visual Temporal Alignment
Audio → AF-Whisper Encoder   ┘
            ↓
    Qwen2.5-7B LLM
            ↓
      Text / Speech

视觉和音频首先独立编码,再按照时间轴进行 interleave,并加入时间位置编码,使 LLM 能直接建模:

"某个声音出现时,画面发生了什么"。

2.2 AV-Skills 数据

作者构建了大规模 Audio-Visual-Skills 数据:

  • AV-Skills-Short:≤ 60 秒;
  • AV-Skills-Long:60 秒~15 分钟;
  • 总计约 7M caption / QA 样本

数据重点训练的不是简单识别,而是:

  • Temporal Reasoning
  • Audio-Visual Alignment
  • Counting
  • Relation / Causal Reasoning
  • Needle-in-the-Haystack
  • Long-video QA
  • Detailed Captioning

核心思想是:

针对当前 Omni 模型的能力短板,主动构造对应训练数据。


3. 三阶段训练

AV-Flamingo 的训练流程是这篇论文最值得关注的部分。

Stage 1:Short-context SFT

使用短视频、图片、音频、ASR 等混合数据进行训练,最大上下文 16K,主要学习基础视觉、音频以及初步 Audio-Visual Alignment。

Stage 2:Long-context SFT

加入 AV-Skills-Long,最大视频长度扩展到 15 分钟、Context 扩展到 32K,重点提升长视频理解和时间推理能力。

训练完成得到:

AVF-Instruct

Stage 3:CoT + GRPO

作者进一步构造 AV-Think 数据,让模型输出带时间戳的推理链,例如:

text 复制代码
<t=00:20> 听到某句话
<t=01:15> 画面出现某人物
<t=03:10> 出现某事件
→ 综合判断答案

这种方法称为 TAVIT:Temporal Audio-Visual Interleaved Chain-of-Thought

随后:

AVF-Instruct → CoT SFT → GRPO → AVF-Think


4. GRPO Reward

GRPO 部分本身比较标准。

同一个输入采样多个回答,然后使用三类 Reward:

  • Format Reward :是否正确输出 <think> / <answer> 格式;
  • Accuracy Reward:QA 最终答案是否正确;
  • Structured Reward:长 Caption / 开放回答转成结构化字段后,与 GT 进行匹配。

例如将回答解析成:

json 复制代码
{
  "scene": "...",
  "participants": "...",
  "events": "...",
  "topic": "...",
  "conclusion": "..."
}

再计算字段匹配得分。


5. 实验结果

整体结果不错,但不是所有榜单都第一。

比较值得关注的是:

Benchmark Baseline AVF-Instruct AVF-Think
WorldSense OmniVinci 48.2 50.3 51.6
DailyOmni OmniVinci 66.5 72.4 73.9
MMOU Gemini-2.5 Pro 64.2 56.9 60.2
Video-MME OmniVinci 67.3 70.7 -

其中 MMOU 上,7B 级 AVF-Think 达到 60.2 ,距离 Gemini-2.5 Pro 的 64.2 已经比较接近。

不过 LongVideoBench:

OmniVinci:62.0

AVF-Instruct:60.1

所以它并不是所有长视频 Benchmark 都 SOTA。


6. 最关键的消融

论文最有价值的一个结果是:

模型 DailyOmni WorldSense VideoMME
OmniVinci 66.5 48.2 67.3
+ AV-Skills-Short 69.5 48.5 68.5
+ AV-Skills-Long 72.4 50.3 70.7

这个结果说明:

长视频能力并不会单纯随着模型参数变大自然出现,专门构造长视频 Audio-Visual 数据进行训练非常重要。

相关推荐
QH139292318802 小时前
R&S FSPN50 FSPN26 FSWP26 相位噪声分析仪典型应用案例
人工智能·百度·微信·集成测试·音视频·facebook·oneapi
HyperAI超神经3 小时前
MiniMax H3 突破视频生成边界,音画内容一体生成;Ornith-1.5-35B-A3B 探索推理模型自进化训练新模式
人工智能·深度学习·学习·音视频·多模态·视频生成·推理模型
chunmiao30323 小时前
Gemini Omni 1.1 Flash 发布:场景扩展上限 40 秒,AI 视频生成转向可控
人工智能·音视频
音视频牛哥3 小时前
世界人形机器人运动会9项新赛技术解读:全自主、灵巧手与机器人实时音视频系统演进
音视频·世界人形机器人运动会·世界人形机器人运动会9项新赛·人形机器人技术发展·机器人实时音视频·机器人低延迟视频·机器人远程接管
zhonyu鱼3 小时前
Shotcut:免费开源的专业级视频剪辑软件
音视频·开源软件
码云骑士3 小时前
120-视频理解-大模型视频分析-抽帧-自动字幕摘要-高光片段
python·音视频
镭封4 小时前
2026免费AI配音5款实测:哪些真正无水印可导出音频
人工智能·音视频·媒体
H0311169854 小时前
会议视频转文字工具实测:六款主流方案功能与适用场景解析
音视频
非凡ghost4 小时前
用 Kotlin 和 Jetpack Compose 重写的安卓视频播放器,原生体验有多流畅?
android·java·kotlin·音视频·软件需求
阿童木写作17 小时前
跨境电商翻译利器,批量图片视频翻译+智能抠图工具
python·音视频