note
- 方案选型:
- 做图片输入 + function call 通用多模态 Agent → 优先看DeepSeek‑Harness + MTA‑Agent;
- 做图片多轮检索求证 → DR‑MMSearchAgent;
- 做长文档图文问答 → MDocAgent;
- 做成本优化、工具调用节流 → ToolGate;
- 做GUI 屏幕自动化 Agent → UI‑TARS / Agent‑TARS。
- 新一代视觉 Agent 不会始终把整张图片或整段视频放进上下文,而是让模型主动如下,这样可以降低视觉 token 数量,并提升模型处理高分辨率图像和长视频的能力:
- 裁剪局部区域。
- 放大关键区域。
- 选择视频关键帧。
- 通过工具生成 OCR 或 grounding 结果。
- 按需构建后续视觉上下文。
文章目录
- note
- 一、2026多模态Agent研究热点
- 二、相关项目
- 三、方向确定
- [四、多模态 Agentic RL 框架](#四、多模态 Agentic RL 框架)
-
-
- [1. PyVision-RL](#1. PyVision-RL)
- [2. VAGEN](#2. VAGEN)
- [3. OpenRLHF](#3. OpenRLHF)
- [4. VerlTool](#4. VerlTool)
- [5. VISTA-Gym](#5. VISTA-Gym)
- [6. Visual-ARFT](#6. Visual-ARFT)
- [7. Agent-R1](#7. Agent-R1)
- [8. Verl](#8. Verl)
-
一、2026多模态Agent研究热点
- 原生视觉工具调用(最核心热点):
- VLM 不再仅做图文问答,输入图片 → Agent 推理 → 调用检索 / 截图放大 / OCR / 搜索 / 计算器等工具;
- 像 DeepSeek V4‑Flash‑Vision‑Exp 这条线:保留原有 function call 能力,新增图片输入,原生把视觉嵌入 Agent 循环,而不是外挂 OCR 预处理。
- 痛点:VLM 容易幻觉、分不清什么时候需要调用工具、多轮识图求证不稳定。
- 长时序多轮深度搜索 Agent:多模态检索智能体,针对图片做多轮搜索、反复核验;解决 Agent 提前停止搜索、信息收集不全(DR‑MMSearchAgent、MTA‑Agent 就是这类)。
Agent 成本与调用效率优化 - ToolGate(CVPR26)代表方向:增加前置路由模块,过滤不必要工具调用、减少冗余 step;工具缓存、动态路由、轻量化调度,降低多步 Agent 的 token 开销。
- 专用场景多模态 Agent:
- 文档 Agent(MDocAgent):长图文 PDF、图表、表格问答、切片解析;
- GUI 视觉 Agent(UI‑TARS / Agent‑TARS):截图识别界面、点击操作;
- 多模态 Agent 训练范式升级:
- RL 微调、反射自省、工具轨迹蒸馏;用 Agent 轨迹数据微调 VLM,提升工具决策准确率;同时配套多模态 Agent 评测 benchmark 建设。
二、相关项目
1、框架类
(1)框架类(可直接搭建多模态 Agent 基座)
DeepSeek‑Harness(DeepSeek 2026)
定位:Agent 运行时框架,近期新增 Vision 支持,对接 V4‑Flash‑Vision‑Exp,实现图片输入 + 原生 function call 闭环,可插拔 Agent 循环、工具、记忆、上下文管理
仓库:https://github.com/deepseek‑ai/harness
Agent‑TARS / UI‑TARS(字节 2026,GUI 视觉 Agent)
定位:屏幕截图理解 + GUI 操作 Agent(视觉动作智能体)
仓库:https://github.com/bytedance/ui‑tars
核心:截图输入 → 识别界面元素 → 输出点击动作,典型视觉工具 Agent 范式。
2、多模态深搜
(2)论文向多模态 Agent(顶会 /arxiv,有开源代码)
MTA‑Agent(Salesforce 2026)
论文:MTA‑Agent: An Open Recipe for Multimodal Deep Search Agents
方向:多模态深度检索 Agent,自带数据生成流水线、工具缓存训练
arxiv:https://arxiv.org/html/2604.06376v1
✅ 开源:https://github.com/salesforce/mta‑agent
DR‑MMSearchAgent(2026)
论文:DR‑MMSearchAgent: Deepening Reasoning in Multimodal Search Agents
解决:多模态搜索 Agent 容易提前终止、搜不全;适合图片多轮识图 + 联网求证
arxiv:https://arxiv.org/html/2604.19264v1
✅ 开源:https://github.com/DR‑MMSearch/DR‑MMSearchAgent
MDocAgent(2025,文档多模态 Agent)
论文:MDocAgent: A Multi‑Modal Multi‑Agent Framework for Document Understanding
方向:图文混合文档 DocQA,文档切片、图表解析、检索工具链
arxiv:https://arxiv.org/pdf/2503.13964v1
✅ 开源:https://github.com/mdocagent/MDocAgent
ToolGate(CVPR2026,工具调用成本优化)
论文:ToolGate
定位:前置门控模块(不改动主模型),预判是否调用工具,减少无效工具请求,降低 Agent 成本
arxiv:https://arxiv.org/pdf/2606.03054v1
✅ 开源:https://github.com/ToolGate2026/ToolGate
三、方向确定
做图片输入 + function call 通用多模态 Agent → 优先看 DeepSeek‑Harness + MTA‑Agent;
做图片多轮检索求证 → DR‑MMSearchAgent;
做长文档图文问答 → MDocAgent;
做成本优化、工具调用节流 → ToolGate;
做GUI 屏幕自动化 Agent → UI‑TARS / Agent‑TARS。
四、多模态 Agentic RL 框架
1. PyVision-RL
项目:https://github.com/agents-x-project/PyVision-RL
定位:面向图像和视频理解的多模态 Agentic RL 框架。
主要能力:
(1)使用 Python 作为视觉工具。
(2)支持图像裁剪、旋转、局部分析等操作。
(3)支持视频关键帧选择和按需构建视觉上下文。
(4)支持多轮工具交互。
(5)使用 rollout 过采样、过滤和排序策略。
(6)加入累积工具 reward,减少训练后模型不再调用工具的问题。
适合任务:
- 图像搜索。
- 图像细节分析。
- 图片处理和视觉推理。
- 视频关键帧选择。
- 多轮视觉问答。
2. VAGEN
项目:https://github.com/mll-lab-nu/VAGEN
定位:面向多轮 VLM Agent 和视觉环境交互的 RL 框架。
主要环境:
- FrozenLake。
- Navigation。
- Sokoban。
- ManiSkill。
- SVG。
主要能力:
(1)将任务表示为视觉状态、Agent 动作和环境反馈组成的 POMDP。
(2)支持多轮环境交互。
(3)对状态估计和状态转移建模进行奖励。
(4)支持长轨迹压缩和 compaction RL。
(5)主线基于 verl agent-loop,便于自定义环境。
适合任务:
- GUI 操作。
- 视觉导航。
- 游戏环境。
- 具身交互。
- 需要连续观察环境变化的 Agent 任务。
3. OpenRLHF
项目:https://github.com/OpenRLHF/OpenRLHF
定位:通用 Agentic RL 底座,近期增强了 VLM 和多轮 VLM Agent RL。
主要能力:
(1)VLM 单轮 RL。
(2)Multi-Turn VLM RL。
(3)环境返回图片或截图。
(4)自定义 Agent Executor。
(5)PPO、GRPO、DAPO、REINFORCE++ 等算法。
(6)LoRA/QLoRA 和异步 rollout。
适合任务:
text
初始图片 -> Agent 行动 -> 环境返回截图 -> Agent 继续行动
如果已有自定义 tool_impl.py、reward 和 rollout 逻辑,OpenRLHF 可以作为通用迁移目标。
4. VerlTool
项目:https://github.com/TIGER-AI-Lab/verl-tool
定位:基于 verl 的工具 Agent RL 框架。
主要能力:
- 统一工具 API。
- 异步 rollout。
- 多轮 trajectory。
- 代码执行、搜索和 SQL 工具。
- 图像处理。
- 视频帧选择。
- 图像/视频 observation。
- DAPO recipe。
适合已有工具和 reward 代码的团队。当前 agent_my 目录中的工具、reward 和 rollout 逻辑,后续可以重点评估向该框架迁移。
5. VISTA-Gym
论文:https://arxiv.org/html/2511.19773v1
定位:视觉工具集成的 Agent 训练环境。
主要工具和任务包括:
(1)GroundingDINO、SAM、EasyOCR 等视觉工具。
(2)图表理解。
(3)文档解析。
(4)几何和数学推理。
(5)区域定位和结构化视觉反馈。
该方向适合:
- OCR。
- 图表理解。
- 文档问答。
- 视觉定位。
- 工具选择。
- 多步视觉推理。
6. Visual-ARFT
项目:https://github.com/Liuziyu77/Visual-RFT
需要区分:
(1)Visual-RFT:主要是单轮视觉 RLVR,例如分类、检测、grounding 和视觉问答。
(2)Visual-ARFT:重点是视觉 Agent,支持网页搜索、图片裁剪、图片旋转和代码分析图片。
主要基座包括:Qwen2-VL、Qwen2.5-VL
适合研究视觉搜索和图像处理工具增强的多模态推理。
7. Agent-R1
项目:https://github.com/AgentR1/Agent-R1
主要抽象包括:
text
AgentFlowBase
AgentEnvLoop
AgentEnv
ToolEnv
支持:
- 多轮工具调用。
- 环境
reset/step。 - trajectory 训练。
- tool reward。
- process reward。
- VLM Agent 扩展。
它更偏通用 Agent RL 基础设施,视觉能力不是最专用,但适合研究环境、工具和 credit assignment。
8. Verl
Verl支持VLM训练DAPO:https://github.com/verl-project/verl/blob/main/docs/ascend_tutorial/model_support/examples/dapo_multi_model_optimization_practice.md