【全模态】音视频理解模型Audio-Visual Flamingo

note

  • 给出了一套比较完整的 长视频 Omni 模型训练 recipe:AV-Skills 数据 → Short → Long → Timestamp CoT → GRPO
  • AV-Flamingo 是一个面向长视频 Audio-Visual 理解的开源 7B 模型,核心贡献不是新 Backbone,而是 AV-Skills 大规模音视频数据、Short→Long 课程训练,以及带时间戳的 TAVIT CoT + GRPO,让模型能够在长视频中进行跨时间、跨音视频模态推理。
  • Audio-Visual 联合训练:不是简单"视频抽帧 + ASR 文本拼接",而是将声音和视觉按照时间轴显式对齐后共同输入 LLM。
  • Timestamp CoT:长视频推理中,模型不仅输出 reasoning,还显式指出证据发生在哪个时间点,这比普通 CoT 更适合长视频场景。

文章目录

  • note
    • [Audio-Visual Flamingo:面向长视频的开源音视频理解模型](#Audio-Visual Flamingo:面向长视频的开源音视频理解模型)
    • [1. 研究动机](#1. 研究动机)
    • [2. 论文核心](#2. 论文核心)
      • [2.1 模型架构](#2.1 模型架构)
      • [2.2 AV-Skills 数据](#2.2 AV-Skills 数据)
    • [3. 三阶段训练](#3. 三阶段训练)
    • [4. GRPO Reward](#4. GRPO Reward)
    • [5. 实验结果](#5. 实验结果)
    • [6. 最关键的消融](#6. 最关键的消融)

Audio-Visual Flamingo:面向长视频的开源音视频理解模型

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

arXiv:https://arxiv.org/abs/2607.16107

机构:NVIDIA + 马里兰大学 | 参数规模:7B,开源

1. 研究动机

现有 Video-LLM / Omni 模型主要有两个问题:

  • 很多模型实际上偏 视觉理解,音频、语音、环境声和画面之间的联合建模不足;
  • 大多数模型更擅长短视频,面对电影、访谈、播客等长视频时,跨时间事件关联和音视频对齐能力明显下降。

AV-Flamingo 的目标就是:

让模型同时理解画面、语音、声音,并能够在长视频中进行跨时间、跨模态推理。

论文同时指出,现有训练数据大量是 audio-only、video-only 或短视频数据,缺少真正面向长视频 Audio-Visual Reasoning 的大规模训练集。


2. 论文核心

这篇论文的核心并不是提出一个全新的 Backbone,而是:

大规模 Audio-Visual 数据 + 三阶段课程训练 + 带时间戳的 CoT 推理。

2.1 模型架构

  1. 时序交错音画对齐
    SigLIP编码视觉帧、AF-Whisper滑动窗口编码音频;特征严格按时间戳交错排布进token序列,依靠LLM自注意力自然完成视听跨模态融合,无需额外跨注意力模块。
  2. Dynamic S2动态Token压缩
    动态调整帧率与分辨率,控制token总量,是实现超长视频输入、防止上下文爆炸的核心手段。
  3. CRTE时序扰动正则化
    训练时对时序施加随机扰动,提升模型对剪辑、音画不同步、丢帧等真实视频噪声的鲁棒性。
  4. 模态均衡损失设计
    平衡视觉与音频权重,缓解大模型先天视觉偏好问题,让模型平等利用图像、音频信息。

整体结构为:

text 复制代码
Video → SigLIP Vision Encoder ┐
                              ├→ Audio-Visual Temporal Alignment
Audio → AF-Whisper Encoder   ┘
            ↓
    Qwen2.5-7B LLM
            ↓
      Text / Speech

视觉和音频首先独立编码,再按照时间轴进行 interleave,并加入时间位置编码,使 LLM 能直接建模:

"某个声音出现时,画面发生了什么"。

2.2 AV-Skills 数据

作者构建了大规模 Audio-Visual-Skills 数据:

  • AV-Skills-Short:≤ 60 秒;
  • AV-Skills-Long:60 秒~15 分钟;
  • 总计约 7M caption / QA 样本

数据重点训练的不是简单识别,而是:

  • Temporal Reasoning
  • Audio-Visual Alignment
  • Counting
  • Relation / Causal Reasoning
  • Needle-in-the-Haystack
  • Long-video QA
  • Detailed Captioning

核心思想是:

针对当前 Omni 模型的能力短板,主动构造对应训练数据。


3. 三阶段训练

AV-Flamingo 的训练流程是这篇论文最值得关注的部分。

Stage 1:Short-context SFT

使用短视频、图片、音频、ASR 等混合数据进行训练,最大上下文 16K,主要学习基础视觉、音频以及初步 Audio-Visual Alignment。

Stage 2:Long-context SFT

加入 AV-Skills-Long,最大视频长度扩展到 15 分钟、Context 扩展到 32K,重点提升长视频理解和时间推理能力。

训练完成得到:

AVF-Instruct

Stage 3:CoT + GRPO

作者进一步构造 AV-Think 数据,让模型输出带时间戳的推理链,例如:

text 复制代码
<t=00:20> 听到某句话
<t=01:15> 画面出现某人物
<t=03:10> 出现某事件
→ 综合判断答案

这种方法称为 TAVIT:Temporal Audio-Visual Interleaved Chain-of-Thought

随后:

AVF-Instruct → CoT SFT → GRPO → AVF-Think


4. GRPO Reward

GRPO 部分本身比较标准。

同一个输入采样多个回答,然后使用三类 Reward:

  • Format Reward :是否正确输出 <think> / <answer> 格式;
  • Accuracy Reward:QA 最终答案是否正确;
  • Structured Reward:长 Caption / 开放回答转成结构化字段后,与 GT 进行匹配。

例如将回答解析成:

json 复制代码
{
  "scene": "...",
  "participants": "...",
  "events": "...",
  "topic": "...",
  "conclusion": "..."
}

再计算字段匹配得分。


5. 实验结果

整体结果不错,但不是所有榜单都第一。

比较值得关注的是:

Benchmark Baseline AVF-Instruct AVF-Think
WorldSense OmniVinci 48.2 50.3 51.6
DailyOmni OmniVinci 66.5 72.4 73.9
MMOU Gemini-2.5 Pro 64.2 56.9 60.2
Video-MME OmniVinci 67.3 70.7 -

其中 MMOU 上,7B 级 AVF-Think 达到 60.2 ,距离 Gemini-2.5 Pro 的 64.2 已经比较接近。

不过 LongVideoBench:

OmniVinci:62.0

AVF-Instruct:60.1

所以它并不是所有长视频 Benchmark 都 SOTA。


6. 最关键的消融

论文最有价值的一个结果是:

模型 DailyOmni WorldSense VideoMME
OmniVinci 66.5 48.2 67.3
+ AV-Skills-Short 69.5 48.5 68.5
+ AV-Skills-Long 72.4 50.3 70.7

这个结果说明:

长视频能力并不会单纯随着模型参数变大自然出现,专门构造长视频 Audio-Visual 数据进行训练非常重要。

相关推荐
郑午时光12 小时前
全球首发!2026年适合IP短剧长视频的AI视频生成工具,即梦seedance2.5轻松做短剧
人工智能·tcp/ip·音视频
Fluxart.ai16 小时前
AI 视频生成接入电商流水线的工程实践:从单条测试到日均 50 条的踩坑全记录
音视频
IT小白杨17 小时前
2026年短视频平台风控技术解析:设备指纹体系、行为建模与环境隔离的边界在哪里
chrome·经验分享·架构·音视频·安全架构·指纹浏览器
桐桐桐18 小时前
视频画面裁剪与尺寸压缩实战:ffmpeg crop/scale 用法与在线替代
ffmpeg·音视频·视频
阿童木写作19 小时前
跨境电商图片翻译工具推荐:批量AI翻译+视频字幕+智能抠图
大数据·人工智能·python·音视频
勤劳X码农20 小时前
2026年四款免费配音轻量工具参数记录与实测数据
音视频
乐橙开放平台21 小时前
老旧小区监控事件驱动派单:基于 setMessageCallback 的 msgType 分级与工单闭环实现
后端·物联网·音视频
lailai041021 小时前
视频离线观看工具的多维度比较分析
音视频
程序员老陆1 天前
音频为什么不编码成“声卡格式”(例如S16)?因为声卡只负责响,编码器只负责省
ffmpeg·音视频