【Omni】OmniGAIA: Towards Native Omni-Modal AI Agents

note

  • OmniGAIA 填补了原生全模态 Agent 评测 的空白,其事件图构造法可扩展至更多场景;OmniAtlas 证明了通过高质量轨迹合成 + Masked SFT + OmniDPO 能显著提升开源模型的工具集成推理能力 ,但感知底座与 Hard 任务推理仍是开放挑战
  • 造数据时的探索 agent loop → DeepSeek-V3.2:Hindsight-Guided Tree Exploration 里那个走 TIR 轨迹、采样 k=3 分支、调 web_search / read_video / code_executor 的循环体,是 DeepSeek-V3.2 当探索器:
    • 感知前置:Gemini-3-Flash 先把原始视频/音频转成文本描述
    • 然后 DeepSeek-V3.2 在这个文本化环境里跑 agent loop 合成轨迹
    • 剪枝验证器:Gemini-3-Flash(拿 ground-truth 判哪条分支对)
  • OmniAtlas 真正被训练的 agent loop → Qwen2.5-Omni / Qwen3-Omni
    • 训练pipeline:轨迹级监督微调(Masked SFT)-> OmniDPO:细粒度错误纠正
  • OmniDPO 里的"找第一个错步"→ Gemini-3-Flash。失败轨迹归因用的 verifier 是 Gemini-3-Flash

文章目录

一、研究动机:为什么需要 OmniGAIA?

项目链接:https://github.com/RUC-NLPIR/OmniGAIA

当前多模态大模型(MLLM)存在三个明显的断层:

维度 现状 缺口
模型能力 主流仍是视觉‑语言或音频‑语言双模态;即便出现 Qwen3‑Omni 等全模态模型,也偏重感知 ,缺乏长程推理 + 多轮工具调用 没有"原生全模态 Agent"
评测基准 OmniBench、WorldSense、Daily‑Omni、UNO‑Bench 等大多基于短音视频 + 选择题 + 感知导向 缺少多跳、多轮工具、开放可验证答案的 Agent 评测
Agent 研究 文本 Agent 已较成熟,但融合视‑听‑语言的全模态 Agentic 推理几乎空白 无法衡量真实场景下的通用助手能力

核心诉求:补上"全模态感知 × 复杂推理 × 工具使用"三位一体的评测与训练范式,推动下一代通用 AI 助手。


二、OmniGAIA 基准 + OmniAtlas 智能体

2.1 OmniGAIA:如何构造"难而可解"的全模态任务?

数据底座
  • 视频+音频:FineVideo(43K 视频,平均 4 分钟)、LongVideoBench / LongVideo‑Reason(约 10 分钟长视频)
  • 图像+音频:COCO 2017(12.2 万图像) + FineVideo 的音频轨道
四阶段流水线(重点)

① 细粒度信号挖掘

用 Gemini‑3‑Flash 对每种模态提取时间对齐的确定信息:

  • 视频:按 ≤60s 切片,生成场景、事件、非语音环境音描述
  • 音频:时间戳 ASR、说话人日志、音频事件检测、环境标签
  • 图像:OCR、物体/人脸检测、全局描述

② 全模态事件图构建

用 DeepSeek‑V3.2 将提取的信息自动构建为图结构 :节点=实体/事件,边=跨模态关系。图能自然表达分支(一对多)、级联(顺序)、混合拓扑,避免线性链的逻辑漏洞。

③ Agent 驱动的事件图扩展(关键创新)

赋予探索 Agent(DeepSeek‑V3.2)一套工具,主动寻找缺失证据并链接回图:

  • search_related_{video/audio/image}_info:跨模态检索
  • web_search / page_browser:引入外部时效知识
  • web_image_search / visual_question_answering:扩展视觉证据
  • code_executor:支持多步数值推理
    Agent 自主决定调用时机,将图的边界推到"需要多跳关联+工具验证"的复杂度。

④ 事件模糊化(Fuzzification)生成 QA

直接问图节点是"事实查找",因此选择长推理路径上的关键节点/边,用类型替换实体或遮蔽属性(例如把"Ruby Street Bridge"模糊为"一座可移动桥梁")。这强制模型遍历完整逻辑链、融合多源多模态证据才能推出唯一答案。

⑤ 质量管控

LLM 委员会(DeepSeek‑V3.2 + Gemini‑3‑Pro)筛选 → 可选难度膨胀 → 3 名研究生人工核验可解性、答案唯一性。

最终产出 :360 个任务,覆盖 9 个真实领域,包含 Easy / Medium / Hard 三档,答案类型均为开放可验证 ,且必须调用外部工具(主要是网页搜索,偶尔代码)。


2.2 OmniAtlas:原生全模态基础智能体

不是从头预训练,而是在开源全模态模型(Qwen2.5‑Omni / Qwen3‑Omni)上注入 Agent 能力的训练配方。

1) 自主工具集成推理(TIR)
  • 轨迹定义: τ = ( s t , a t , o t ) \tau = (s_t, a_t, o_t) τ=(st,at,ot),其中 s t s_t st 为思考, a t a_t at 为工具调用或最终回答, o t o_t ot 为工具返回。
  • 模型基于历史自回归生成: p θ ( τ ∣ x ) = ∏ t p θ ( s t , a t ∣ x , s < t , a < t , o < t ) p_\theta(\tau|x) = \prod_t p_\theta(s_t, a_t | x, s_{<t}, a_{<t}, o_{<t}) pθ(τ∣x)=∏tpθ(st,at∣x,s<t,a<t,o<t)
  • 检测到工具调用 token 时暂停执行,把观察追加进上下文继续生成。
2) 主动全模态感知(Active Perception)

针对长视频/高分辨率图像,避免无差别下采样导致细节丢失。模型可主动调用:

  • read_video(video_id, t_start, t_end)
  • read_audio(audio_id, t_start, t_end)
  • read_image(image_ids, crop_box)
    实现"按需看/听",只加载需要的片段或区域。
3) 基于引导树探索的轨迹合成(重点)

由于闭源模型(Gemini)不暴露原生推理轨迹,作者用 DeepSeek‑V3.2 作为探索器:

  • 先用 Gemini‑3‑Flash 把原始多模态输入转为详细文本描述
  • 从根状态开始,每步采样 k=3 个候选延续(思考+工具动作)
  • Gemini‑3‑Flash 验证器(已知标准答案)剪枝错误/冗余分支,只保留成功轨迹用于训练
4) 轨迹级监督微调(Masked SFT)

标准 teacher forcing,但只对 Agent 自身生成的 token(思考、工具调用)计算损失,屏蔽工具返回的 observation 。公式:

L SFT ( θ ) = − 1 ∑ m i ∑ i = 1 L m i log ⁡ p θ ( y i ∣ y < i , x ) \mathcal{L}{\text{SFT}}(\theta) = -\frac{1}{\sum m_i} \sum{i=1}^L m_i \log p_\theta(y_i | y_{<i}, x) LSFT(θ)=−∑mi1i=1∑Lmilogpθ(yi∣y<i,x)

这防止模型记忆环境反馈噪声,专注学习"如何思考与行动"。

5) OmniDPO:细粒度错误纠正(重点)

全轨迹 SFT 不足以修正细微错误。OmniDPO 流程:

  • 让 SFT 模型在训练集上探索,对每个失败轨迹 ,用 Gemini‑3‑Flash(已知标注答案)定位第一个错误步骤
  • 生成纠正后的前缀 ,得到 ( τ win , τ lose ) (\tau_{\text{win}}, \tau_{\text{lose}}) (τwin,τlose) 对
  • 优化 masked DPO 目标 ,同样只在 Agent 生成 token 上计算 log‑prob:
    L D P O = − E log ⁡ σ ( β log ⁡ π θ ( τ w i n ) π r e f ( τ w i n ) − β log ⁡ π θ ( τ l o s e ) π r e f ( τ l o s e ) ) \mathcal{L}_{DPO} = -\mathbb{E} \left \\log \\sigma \\left( \\beta \\log \\frac{\\pi_\\theta(\\tau_{win})}{\\pi_{ref}(\\tau_{win})} - \\beta \\log \\frac{\\pi_\\theta(\\tau_{lose})}{\\pi_{ref}(\\tau_{lose})} \\right) \\right LDPO=−Elogσ(βlogπref(τwin)πθ(τwin)−βlogπref(τlose)πθ(τlose))
    这样每次优化只聚焦修正单一错误模块(感知、推理或工具使用),实现精准提升。

三、实验结果

评测采用 LLM‑as‑a‑Judge (DeepSeek‑V3.2)判断答案等价性,统一提供 web / browser / code 工具。

四大核心发现

  1. 闭源‑开源差距高达 4.7 倍(62.5 vs 13.3),开源社区在全模态感知与工具推理上急需突破。
  2. 单纯扩大参数无效 :560B 的 LongCat 甚至不如 30B 的 Qwen3‑Omni,说明工具使用策略才是瓶颈,而非参数量。
  3. OmniAtlas 带来显著提升:Qwen3‑Omni 从 13.3 → 20.8(+7.5),小模型增益更夸张(7B 3.6→13.3,近 3.7 倍),证明训练配方能有效解锁各尺寸模型的 Agent 潜力。
  4. Hard 任务仍是共同噩梦 :Gemini‑3‑Pro 在 Easy 达 78.7,Hard 暴跌至 38.5;OmniAtlas 在易/中档提升明显,但 Hard 上仍挣扎,揭示深度多跳推理是未来重点。

四、深度分析

4.1 细粒度错误剖析(Figure 5 & Table 4)

错误类型占比(Qwen3‑Omni‑30B):

  • 无效工具调用:81.1%
  • 推理错误:79.7%
  • 视觉感知错误:31.7%
  • 音频感知错误:33.9%

关键规律

  • 在 Hard 任务上,开源模型工具误用率饱和至 90‑96% ,推理错误率 80‑90% ,说明上游取证失败会级联导致下游推理崩溃
  • Gemini‑3‑Pro 各项错误率远低于开源(工具 35.3%,推理 15.8%),体现更成熟的规划与验证能力。
  • OmniAtlas 的改进 :Qwen3‑30B 经 SFT+DPO 后,无效工具调用降至 59.4% ,推理错误降至 64.4% ,但感知错误仍徘徊 30% 左右 → 感知底座是下一个必须攻克的瓶颈

4.2 工具调用分布(Figure 6)

  • 0 次调用的模型几乎全挂 → 原生感知不足以解决 OmniGAIA 的大多数任务,必须借助外部工具。
  • 高调用次数(>10‑20)≠ 高成功率 → 大量失败轨迹伴随长尾调用,表明模型存在低效探索或"抖动"(thrashing):反复调用工具却未消除不确定性。
  • OmniAtlas 改变了调用模式 :从 Qwen3‑30B 的"不敢调/少调"变为"积极调用",分布更广,与工具错误下降、总分上升一致,但调用效率仍有优化空间

4.3 原生感知 vs. 外挂感知工具(Table 3,重点)

实验设计 :将听觉/视觉模型封装为工具(audio_qa / vision_qa),让 Agent 通过工具获取缺失模态信息,对比"原生全模态输入"与"工具辅助"的性能。

配置 Gemini‑3‑Flash (Easy/Med/Hard/Avg) Qwen3‑Omni‑30B (Easy/Med/Hard/Avg)
原生感知(全媒体输入) 67.2 / 46.9 / 37.2 / 51.7 19.7 / 10.6 / 9.0 / 13.3
仅视觉+外挂音频工具 60.7 / 48.8 / 35.9 / 50.0 24.6 / 15.0 / 3.9 / 15.8
仅音频+外挂视觉工具 50.0 / 43.1 / 33.3 / 43.3 18.0 / 11.3 / 5.1 / 12.2
无媒体+双外挂工具 52.5 / 46.9 / 35.9 / 46.4 23.8 / 11.9 / 7.7 / 15.0

结论

  1. 对强模型(Gemini) :原生感知就是最优解,外挂工具不仅掉点,还增加工具调用次数(4.4 → 6.8‑9.4),没有准确性‑成本优势
  2. 对弱模型(Qwen3‑Omni) :外挂工具有助于 Easy/Medium (13.3→15.8/18.1),但 Hard 档反而下降 (9.0→3.9/5.1/7.7)。说明工具输出能修补低层信号缺失,但无法替代原生跨模态融合进行长程推理。
  3. 外挂感知一致增加交互成本(Qwen 工具调用从 0.2 升至 0.5‑2.0),意味着更高延迟与部署开销。

启示 :原生全模态感知应作为默认配置 ,外挂感知仅作为弱模型或缺失模态场景的兜底方案

4.4 训练有效性拆解(Table 4)

模型 视觉感知错误↓ 音频感知错误↓ 无效工具调用↓ 推理错误↓ 性能↑
Qwen2.5‑Omni‑7B 41.4 48.3 91.9 78.6 3.6
+ OmniAtlas‑SFT 38.9 49.7 69.2 75.0 11.4
+ OmniDPO 37.2 46.1 67.2 72.8 13.3
Qwen3‑Omni‑30B 31.7 33.9 81.1 79.7 13.3
+ OmniAtlas‑SFT 32.2 35.8 65.3 68.1 18.9
+ OmniDPO 30.3 31.9 59.4 64.4 20.8
  • SFT 贡献了大部分增益(Qwen3‑30B:13.3→18.9),主要压低了无效工具调用(81.1→65.3)。
  • OmniDPO 进一步全面优化 ,在 SFT 基础上再提 1.9 个点,并继续降低各类错误,验证了细粒度错误纠正的有效性。

4.5 典型案例启示(附录 Table 5‑7)

同一道关于"Joliet Iron Works 历史遗址中出现的桥梁与电影《The Blues Brothers》"的问题:

  • 失败案例 I(无工具):模型依赖先验(芝加哥大桥),不调用工具验证,得出错误桥名与建成年限。
  • 失败案例 II(工具漂移):虽然调用工具,但查询被错误假设锁定("LaSalle Street Bridge"),确认偏误导致计算正确但事实错误。
  • 成功案例(OmniAtlas) :先按地点锚定(Joliet Iron Works → 附近可移动桥),再针对性检索验证桥名(Ruby Street Bridge,1935 年建)与电影开拍时间(1979 年 7 月),最后用代码计算 1979‑1935=44。

核心教训 :工具访问是必要非充分条件 。成功的 Agent 需要 "地点优先锚定 → 假设检验 → 验证后再计算" 的鲁棒模式,而非盲目检索或过早闭合。


总结与展望

OmniGAIA 填补了原生全模态 Agent 评测 的空白,其事件图构造法可扩展至更多场景;OmniAtlas 证明了通过高质量轨迹合成 + Masked SFT + OmniDPO 能显著提升开源模型的工具集成推理能力 ,但感知底座与 Hard 任务推理仍是开放挑战

论文最后指出三个方向:

  1. 全模态 Agentic RL:直接优化长程 Agent 策略
  2. 全模态 MCP 服务:扩展工具生态
  3. 具身全模态智能体:迈向物理世界交互
相关推荐
HIT_Weston1 小时前
205、【Agent】【OpenCode】TUI 内部:.tsx 与 .ts 的分界线
人工智能·agent·opencode
武子康1 小时前
中文 Prosody-Aware Eval:从四象限样本到可诊断的实时语音评测
人工智能·llm·agent
夏文强2 小时前
DeepSeek Harness 可观测性:用 OpenTelemetry 把会话遥测出去
人工智能·开源·大模型·agent·deepseek
Csvn2 小时前
第 17 章 评估与自检 Evaluation
人工智能·aigc·agent
ShallWeL2 小时前
RAG 向量索引重建与回归
人工智能·agent·知识库·工作流·rag
HIT_Weston2 小时前
206、【Agent】【OpenCode】TUI 内部:装配层与 context 工厂
人工智能·agent·opencode
一颗小树x3 小时前
NVFP4 量化 × 具身智能:ModelScope 模型生态调研
具身智能·vlm·端侧·nvfp4
夏文强3 小时前
DeepSeek Harness SDK 集成:把 Agent 嵌进你的应用
人工智能·开源·大模型·agent·deepseek
AIGC大时代3 小时前
LangGraph 生产级笔记:Checkpointer + interrupt(),把人审做成可恢复状态机
python·agent·状态机·langgraph·hitl