【MLLM Agent】多模态理解Agent研究进展

note

  • 方案选型:
    • 做图片输入 + function call 通用多模态 Agent → 优先看DeepSeek‑Harness + MTA‑Agent;
    • 做图片多轮检索求证 → DR‑MMSearchAgent;
    • 做长文档图文问答 → MDocAgent;
    • 做成本优化、工具调用节流 → ToolGate;
    • 做GUI 屏幕自动化 Agent → UI‑TARS / Agent‑TARS。
  • 新一代视觉 Agent 不会始终把整张图片或整段视频放进上下文,而是让模型主动如下,这样可以降低视觉 token 数量,并提升模型处理高分辨率图像和长视频的能力:
    • 裁剪局部区域。
    • 放大关键区域。
    • 选择视频关键帧。
    • 通过工具生成 OCR 或 grounding 结果。
    • 按需构建后续视觉上下文。

文章目录

一、2026多模态Agent研究热点

  • 原生视觉工具调用(最核心热点):
    • VLM 不再仅做图文问答,输入图片 → Agent 推理 → 调用检索 / 截图放大 / OCR / 搜索 / 计算器等工具;
    • 像 DeepSeek V4‑Flash‑Vision‑Exp 这条线:保留原有 function call 能力,新增图片输入,原生把视觉嵌入 Agent 循环,而不是外挂 OCR 预处理。
    • 痛点:VLM 容易幻觉、分不清什么时候需要调用工具、多轮识图求证不稳定。
  • 长时序多轮深度搜索 Agent:多模态检索智能体,针对图片做多轮搜索、反复核验;解决 Agent 提前停止搜索、信息收集不全(DR‑MMSearchAgent、MTA‑Agent 就是这类)。
    Agent 成本与调用效率优化
  • ToolGate(CVPR26)代表方向:增加前置路由模块,过滤不必要工具调用、减少冗余 step;工具缓存、动态路由、轻量化调度,降低多步 Agent 的 token 开销。
  • 专用场景多模态 Agent:
    • 文档 Agent(MDocAgent):长图文 PDF、图表、表格问答、切片解析;
    • GUI 视觉 Agent(UI‑TARS / Agent‑TARS):截图识别界面、点击操作;
  • 多模态 Agent 训练范式升级:
    • RL 微调、反射自省、工具轨迹蒸馏;用 Agent 轨迹数据微调 VLM,提升工具决策准确率;同时配套多模态 Agent 评测 benchmark 建设。

二、相关项目

1、框架类

(1)框架类(可直接搭建多模态 Agent 基座)

DeepSeek‑Harness(DeepSeek 2026)

定位:Agent 运行时框架,近期新增 Vision 支持,对接 V4‑Flash‑Vision‑Exp,实现图片输入 + 原生 function call 闭环,可插拔 Agent 循环、工具、记忆、上下文管理

仓库:https://github.com/deepseek‑ai/harness

Agent‑TARS / UI‑TARS(字节 2026,GUI 视觉 Agent)

定位:屏幕截图理解 + GUI 操作 Agent(视觉动作智能体)

仓库:https://github.com/bytedance/ui‑tars

核心:截图输入 → 识别界面元素 → 输出点击动作,典型视觉工具 Agent 范式。

2、多模态深搜

(2)论文向多模态 Agent(顶会 /arxiv,有开源代码)

MTA‑Agent(Salesforce 2026)

论文:MTA‑Agent: An Open Recipe for Multimodal Deep Search Agents

方向:多模态深度检索 Agent,自带数据生成流水线、工具缓存训练

arxiv:https://arxiv.org/html/2604.06376v1

✅ 开源:https://github.com/salesforce/mta‑agent

DR‑MMSearchAgent(2026)

论文:DR‑MMSearchAgent: Deepening Reasoning in Multimodal Search Agents

解决:多模态搜索 Agent 容易提前终止、搜不全;适合图片多轮识图 + 联网求证

arxiv:https://arxiv.org/html/2604.19264v1

✅ 开源:https://github.com/DR‑MMSearch/DR‑MMSearchAgent

MDocAgent(2025,文档多模态 Agent)

论文:MDocAgent: A Multi‑Modal Multi‑Agent Framework for Document Understanding

方向:图文混合文档 DocQA,文档切片、图表解析、检索工具链

arxiv:https://arxiv.org/pdf/2503.13964v1

✅ 开源:https://github.com/mdocagent/MDocAgent

ToolGate(CVPR2026,工具调用成本优化)

论文:ToolGate

定位:前置门控模块(不改动主模型),预判是否调用工具,减少无效工具请求,降低 Agent 成本

arxiv:https://arxiv.org/pdf/2606.03054v1

✅ 开源:https://github.com/ToolGate2026/ToolGate

三、方向确定

做图片输入 + function call 通用多模态 Agent → 优先看 DeepSeek‑Harness + MTA‑Agent;

做图片多轮检索求证 → DR‑MMSearchAgent;

做长文档图文问答 → MDocAgent;

做成本优化、工具调用节流 → ToolGate;

做GUI 屏幕自动化 Agent → UI‑TARS / Agent‑TARS。

四、多模态 Agentic RL 框架

1. PyVision-RL

项目:https://github.com/agents-x-project/PyVision-RL

定位:面向图像和视频理解的多模态 Agentic RL 框架。

主要能力:

(1)使用 Python 作为视觉工具。

(2)支持图像裁剪、旋转、局部分析等操作。

(3)支持视频关键帧选择和按需构建视觉上下文。

(4)支持多轮工具交互。

(5)使用 rollout 过采样、过滤和排序策略。

(6)加入累积工具 reward,减少训练后模型不再调用工具的问题。

适合任务:

  • 图像搜索。
  • 图像细节分析。
  • 图片处理和视觉推理。
  • 视频关键帧选择。
  • 多轮视觉问答。

2. VAGEN

项目:https://github.com/mll-lab-nu/VAGEN

定位:面向多轮 VLM Agent 和视觉环境交互的 RL 框架。

主要环境:

  • FrozenLake。
  • Navigation。
  • Sokoban。
  • ManiSkill。
  • SVG。

主要能力:

(1)将任务表示为视觉状态、Agent 动作和环境反馈组成的 POMDP。

(2)支持多轮环境交互。

(3)对状态估计和状态转移建模进行奖励。

(4)支持长轨迹压缩和 compaction RL。

(5)主线基于 verl agent-loop,便于自定义环境。

适合任务:

  • GUI 操作。
  • 视觉导航。
  • 游戏环境。
  • 具身交互。
  • 需要连续观察环境变化的 Agent 任务。

3. OpenRLHF

项目:https://github.com/OpenRLHF/OpenRLHF

定位:通用 Agentic RL 底座,近期增强了 VLM 和多轮 VLM Agent RL。

主要能力:

(1)VLM 单轮 RL。

(2)Multi-Turn VLM RL。

(3)环境返回图片或截图。

(4)自定义 Agent Executor。

(5)PPO、GRPO、DAPO、REINFORCE++ 等算法。

(6)LoRA/QLoRA 和异步 rollout。

适合任务:

text 复制代码
初始图片 -> Agent 行动 -> 环境返回截图 -> Agent 继续行动

如果已有自定义 tool_impl.py、reward 和 rollout 逻辑,OpenRLHF 可以作为通用迁移目标。

4. VerlTool

项目:https://github.com/TIGER-AI-Lab/verl-tool

定位:基于 verl 的工具 Agent RL 框架。

主要能力:

  • 统一工具 API。
  • 异步 rollout。
  • 多轮 trajectory。
  • 代码执行、搜索和 SQL 工具。
  • 图像处理。
  • 视频帧选择。
  • 图像/视频 observation。
  • DAPO recipe。

适合已有工具和 reward 代码的团队。当前 agent_my 目录中的工具、reward 和 rollout 逻辑,后续可以重点评估向该框架迁移。

5. VISTA-Gym

论文:https://arxiv.org/html/2511.19773v1

定位:视觉工具集成的 Agent 训练环境。

主要工具和任务包括:

(1)GroundingDINO、SAM、EasyOCR 等视觉工具。

(2)图表理解。

(3)文档解析。

(4)几何和数学推理。

(5)区域定位和结构化视觉反馈。

该方向适合:

  • OCR。
  • 图表理解。
  • 文档问答。
  • 视觉定位。
  • 工具选择。
  • 多步视觉推理。

6. Visual-ARFT

项目:https://github.com/Liuziyu77/Visual-RFT

需要区分:

(1)Visual-RFT:主要是单轮视觉 RLVR,例如分类、检测、grounding 和视觉问答。

(2)Visual-ARFT:重点是视觉 Agent,支持网页搜索、图片裁剪、图片旋转和代码分析图片。

主要基座包括:Qwen2-VL、Qwen2.5-VL

适合研究视觉搜索和图像处理工具增强的多模态推理。

7. Agent-R1

项目:https://github.com/AgentR1/Agent-R1

主要抽象包括:

text 复制代码
AgentFlowBase
AgentEnvLoop
AgentEnv
ToolEnv

支持:

  • 多轮工具调用。
  • 环境 reset/step
  • trajectory 训练。
  • tool reward。
  • process reward。
  • VLM Agent 扩展。

它更偏通用 Agent RL 基础设施,视觉能力不是最专用,但适合研究环境、工具和 credit assignment。

8. Verl

Verl支持VLM训练DAPO:https://github.com/verl-project/verl/blob/main/docs/ascend_tutorial/model_support/examples/dapo_multi_model_optimization_practice.md

相关推荐
dong_junshuai1 小时前
# 每天一个开源项目#76 Skills:23万星的 Agent 工程技能库
开源·github·agent
李燚2 小时前
MultiAgent Host 源码 + ADK prebuilt 三种预制模式(第92篇-E78)
agent·multiagent·tool·eino·subagent·deepflux·loopagent
梦想很大很大2 小时前
Workrun 进度更新:从理念到解决具体问题
agent·workflow·工作流引擎
番茄不是西红柿kk2 小时前
deepseek-harness跨平台桌面端二开项目(四)安装完点“启动应用“却没反应?背后是 sidecar 的冷启动预算与杀软博弈
人工智能·agent·deepseek
武子康2 小时前
DeepSeek Harness 为什么不用 messages 数组保存一切
人工智能·llm·agent
海市公约2 小时前
独立开发项目ColdChain Guard冷盾:冷链温控合规智能分析系统项目复盘
mongodb·agent·rag·全栈开发项目
pqpo3 小时前
Agent Team 的上下文工程设计:如何组织和共享上下文
agent·ai编程
leeyi3 小时前
Agent 间 Transfer 交接:用户在不同 Agent 间无缝切换(第93篇-E79)
人工智能·aigc·agent
很楠爱上3 小时前
从“AI 看合同”到可举证的合同决策链:CounterClause(对薄) 的架构设计与工程实践
人工智能·经验分享·python·学习·agent