【全模态】音视频理解模型Audio-Visual Flamingo

note

  • 给出了一套比较完整的 长视频 Omni 模型训练 recipe:AV-Skills 数据 → Short → Long → Timestamp CoT → GRPO
  • AV-Flamingo 是一个面向长视频 Audio-Visual 理解的开源 7B 模型,核心贡献不是新 Backbone,而是 AV-Skills 大规模音视频数据、Short→Long 课程训练,以及带时间戳的 TAVIT CoT + GRPO,让模型能够在长视频中进行跨时间、跨音视频模态推理。
  • Audio-Visual 联合训练:不是简单"视频抽帧 + ASR 文本拼接",而是将声音和视觉按照时间轴显式对齐后共同输入 LLM。
  • Timestamp CoT:长视频推理中,模型不仅输出 reasoning,还显式指出证据发生在哪个时间点,这比普通 CoT 更适合长视频场景。

文章目录

  • note
    • [Audio-Visual Flamingo:面向长视频的开源音视频理解模型](#Audio-Visual Flamingo:面向长视频的开源音视频理解模型)
    • [1. 研究动机](#1. 研究动机)
    • [2. 论文核心](#2. 论文核心)
      • [2.1 模型架构](#2.1 模型架构)
      • [2.2 AV-Skills 数据](#2.2 AV-Skills 数据)
    • [3. 三阶段训练](#3. 三阶段训练)
    • [4. GRPO Reward](#4. GRPO Reward)
    • [5. 实验结果](#5. 实验结果)
    • [6. 最关键的消融](#6. 最关键的消融)

Audio-Visual Flamingo:面向长视频的开源音视频理解模型

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

arXiv:https://arxiv.org/abs/2607.16107

机构:NVIDIA + 马里兰大学 | 参数规模:7B,开源

1. 研究动机

现有 Video-LLM / Omni 模型主要有两个问题:

  • 很多模型实际上偏 视觉理解,音频、语音、环境声和画面之间的联合建模不足;
  • 大多数模型更擅长短视频,面对电影、访谈、播客等长视频时,跨时间事件关联和音视频对齐能力明显下降。

AV-Flamingo 的目标就是:

让模型同时理解画面、语音、声音,并能够在长视频中进行跨时间、跨模态推理。

论文同时指出,现有训练数据大量是 audio-only、video-only 或短视频数据,缺少真正面向长视频 Audio-Visual Reasoning 的大规模训练集。


2. 论文核心

这篇论文的核心并不是提出一个全新的 Backbone,而是:

大规模 Audio-Visual 数据 + 三阶段课程训练 + 带时间戳的 CoT 推理。

2.1 模型架构

  1. 时序交错音画对齐
    SigLIP编码视觉帧、AF-Whisper滑动窗口编码音频;特征严格按时间戳交错排布进token序列,依靠LLM自注意力自然完成视听跨模态融合,无需额外跨注意力模块。
  2. Dynamic S2动态Token压缩
    动态调整帧率与分辨率,控制token总量,是实现超长视频输入、防止上下文爆炸的核心手段。
  3. CRTE时序扰动正则化
    训练时对时序施加随机扰动,提升模型对剪辑、音画不同步、丢帧等真实视频噪声的鲁棒性。
  4. 模态均衡损失设计
    平衡视觉与音频权重,缓解大模型先天视觉偏好问题,让模型平等利用图像、音频信息。

整体结构为:

text 复制代码
Video → SigLIP Vision Encoder ┐
                              ├→ Audio-Visual Temporal Alignment
Audio → AF-Whisper Encoder   ┘
            ↓
    Qwen2.5-7B LLM
            ↓
      Text / Speech

视觉和音频首先独立编码,再按照时间轴进行 interleave,并加入时间位置编码,使 LLM 能直接建模:

"某个声音出现时,画面发生了什么"。

2.2 AV-Skills 数据

作者构建了大规模 Audio-Visual-Skills 数据:

  • AV-Skills-Short:≤ 60 秒;
  • AV-Skills-Long:60 秒~15 分钟;
  • 总计约 7M caption / QA 样本

数据重点训练的不是简单识别,而是:

  • Temporal Reasoning
  • Audio-Visual Alignment
  • Counting
  • Relation / Causal Reasoning
  • Needle-in-the-Haystack
  • Long-video QA
  • Detailed Captioning

核心思想是:

针对当前 Omni 模型的能力短板,主动构造对应训练数据。


3. 三阶段训练

AV-Flamingo 的训练流程是这篇论文最值得关注的部分。

Stage 1:Short-context SFT

使用短视频、图片、音频、ASR 等混合数据进行训练,最大上下文 16K,主要学习基础视觉、音频以及初步 Audio-Visual Alignment。

Stage 2:Long-context SFT

加入 AV-Skills-Long,最大视频长度扩展到 15 分钟、Context 扩展到 32K,重点提升长视频理解和时间推理能力。

训练完成得到:

AVF-Instruct

Stage 3:CoT + GRPO

作者进一步构造 AV-Think 数据,让模型输出带时间戳的推理链,例如:

text 复制代码
<t=00:20> 听到某句话
<t=01:15> 画面出现某人物
<t=03:10> 出现某事件
→ 综合判断答案

这种方法称为 TAVIT:Temporal Audio-Visual Interleaved Chain-of-Thought

随后:

AVF-Instruct → CoT SFT → GRPO → AVF-Think


4. GRPO Reward

GRPO 部分本身比较标准。

同一个输入采样多个回答,然后使用三类 Reward:

  • Format Reward :是否正确输出 <think> / <answer> 格式;
  • Accuracy Reward:QA 最终答案是否正确;
  • Structured Reward:长 Caption / 开放回答转成结构化字段后,与 GT 进行匹配。

例如将回答解析成:

json 复制代码
{
  "scene": "...",
  "participants": "...",
  "events": "...",
  "topic": "...",
  "conclusion": "..."
}

再计算字段匹配得分。


5. 实验结果

整体结果不错,但不是所有榜单都第一。

比较值得关注的是:

Benchmark Baseline AVF-Instruct AVF-Think
WorldSense OmniVinci 48.2 50.3 51.6
DailyOmni OmniVinci 66.5 72.4 73.9
MMOU Gemini-2.5 Pro 64.2 56.9 60.2
Video-MME OmniVinci 67.3 70.7 -

其中 MMOU 上,7B 级 AVF-Think 达到 60.2 ,距离 Gemini-2.5 Pro 的 64.2 已经比较接近。

不过 LongVideoBench:

OmniVinci:62.0

AVF-Instruct:60.1

所以它并不是所有长视频 Benchmark 都 SOTA。


6. 最关键的消融

论文最有价值的一个结果是:

模型 DailyOmni WorldSense VideoMME
OmniVinci 66.5 48.2 67.3
+ AV-Skills-Short 69.5 48.5 68.5
+ AV-Skills-Long 72.4 50.3 70.7

这个结果说明:

长视频能力并不会单纯随着模型参数变大自然出现,专门构造长视频 Audio-Visual 数据进行训练非常重要。

相关推荐
m0_614523552 小时前
翻译配音比原视频长,如何重新检查镜头与字幕
音视频·视频编辑
程序猿编码3 小时前
不用 GPU!RK3588 跑视觉大模型,Qwen3.5-2B VLM 端侧落地
大模型·llm·rk3588·qwen·推理·vlm
纽格立科技3 小时前
声音广播:要么数字化,要么边缘化
车载系统·音视频·信息与通信·传媒
刘广睿4 小时前
视频导出为什么发灰?色彩空间与色彩范围(BT.601/709/2020)的 ffmpeg 转换实战
ffmpeg·音视频·视频处理·色彩空间·素材管理
m0_614523557 小时前
多条课程视频识别字幕,怎样统一专名又保留不同语境
音视频·视频编辑
微咣科技9 小时前
平台化工业AI再突破|大捷智能携手岚图汽车,打造车身焊装智能设计行业标杆
pdf·音视频
马剑威(威哥爱编程)10 小时前
【共创稿事节】HarmonyOS 7 空间音频实战:降噪、美化、变声、空间渲染的节点编排
华为·音视频·harmonyos
TK泰妞11 小时前
2026TikTok带货视频怎么做?
人工智能·prompt·音视频
晨航11 小时前
首尾帧、参考图、参考视频:想控制 AI 视频,到底该给它什么素材?
人工智能·aigc·音视频
A133455512 小时前
2026支持云盘在线播放的电视应用推荐
音视频