Agent 能力评测------2026 年基准测试全景与模型真实能力画像
WebArena 成功率两年翻五倍,OSWorld 超越人类基线,MLE-bench 从 17% 飙升至 64%------但这些数字到底意味着什么?本文系统梳理 2026 年 Agent 评测生态。
一、2026 年 Agent 评测的三个关键趋势
2026 年的 Agent 评测领域正在经历三个结构性变化:
第一,基准测试从单一能力走向综合评估。 早期基准如 HumanEval 仅测试代码生成,ToolBench 仅测试工具调用。2026 年的新基准------如 AgencyBench 和 TUA-Bench------则要求 Agent 在长周期任务中综合运用规划、工具调用、错误恢复等多种能力。
第二,评测从"能否完成"走向"完成得多好"。 成功率不再是唯一指标。成本效率、安全合规性、可维护性和工作流集成正成为新的评测维度。
第三,评测正在追赶 Agent 的能力前沿。 现有基准的复杂度已落后于前沿 Agent 的实际能力。AgencyBench 的设计动机之一就是现有基准仅需数十次工具调用,而真实任务平均需要 90 次。
二、核心基准测试全景
2.1 WebArena:浏览器端到端任务
WebArena 是一个真实 Web 环境中的自主代理评测基准,包含 812 个长周期任务,以自然语言意图表述,涵盖信息查找、站点导航和多页面内容配置。
关键在于,WebArena 不比较操作轨迹,而是通过验证站点的最终状态(数据库、页面内容、URL)来判断 Agent 是否真正实现了目标。
核心数据:
- 成功率从 2023 年的约 15% 飙升至 2026 年初的 74.3%
- 最佳模型距人类基线 78.2% 仅差 4 个百分点
- 2026 年 1 月,蚂蚁集团 OpAgent 以 71.6% 的成功率登顶 WebArena 榜单
- NEC 的代理技术记录了 80.4% 的成功率,首次超越人类 78.2% 的基线
WebArena 是所有 Agent 基准中模型与人类表现差距最小的。
2.2 OSWorld:桌面级计算机操作
OSWorld 是一个可扩展的真实计算机环境,用于评估多模态 AI 代理在 Ubuntu、Windows 和 macOS 上的开放式任务,包含 369 个涉及桌面应用、Web 应用、文件操作和多应用工作流的任务。
计算机科学学生能解决其中约 72% 的任务,中位耗时约两分钟。
核心数据:
- Claude Opus 4.5 以 66.3% 的准确率领先 OSWorld-Verified 榜单,距人类表现仅 6 个百分点
- GPT-5.4 在 OSWorld-Verified 上达到 75.0%,超越人类基线 72.4%
- 早期最佳模型成功率仅为 1%--12%,OSWorld 是人类与模型差距缩小最快的基准之一
OSWorld 已被认为是"较可信"的基准------BenchJack 类漏洞已修补,Agent 首次追平人类基线。
2.3 MLE-bench:机器学习工程能力
MLE-bench 评估 AI Agent 的机器学习工程能力,包含 75 项 Kaggle 竞赛,涵盖 NLP、计算机视觉、信号处理等领域。竞赛经过手动筛选,重建了训练/测试分割并重新实现了评分代码,使 Agent 的得分可以直接与人类 Kaggle 排行榜和奖牌阈值对比。
核心数据:
- Agent 成功率从 2024 年的约 17% 跃升至 2026 年初的 64.4%
- Famou-Agent 2.0 搭配 Gemini-3-Pro-Preview 在 MLE-bench 上达到 64.44% 的全量基准成绩
- 百度"伐谋"企业级算法自主优化智能体在该基准上也有突出表现
这一提升速度在如此短的时间内指向了 Agent 在端到端机器学习任务上日益增长的能力,但竞赛类问题比真实世界数据科学工作更具结构化。
2.4 TUA-Bench:终端使用代理
TUA-Bench 是 Meta 发布的通用终端使用代理基准,包含 120 个真实世界任务。与 OSWorld 侧重 GUI 操作不同,TUA-Bench 的任务完全通过命令行执行,不需要视觉感知或图形界面------即 CLI 路由。
核心数据:
- 最强前沿 Agent(Claude Code + Claude Opus 4.8,max reasoning effort)仅达到 65.8% 的整体表现
- 推理努力程度与性能呈正相关但边际收益递减------从中等提升至极高推理等级仅增加 2.3% 成功率却使 Token 消耗翻倍
- 在长程规划、工具使用、执行监控和错误恢复方面仍存在显著差距
即使在最强配置下,通用终端 Agent 距真正可靠完成现实工作仍有相当距离。
2.5 Cybench:网络安全
Cybench 是评估 AI Agent 网络安全能力的基准框架,包含 40 个专业级 CTF 任务,涵盖密码学、Web 安全、逆向工程、取证和漏洞利用六大类别。任务基于真实人类难度------"首次解决时间"从两分钟到近 25 小时不等。
核心数据:
2.6 新兴基准:AgencyBench 与 VIBench
AgencyBench 由 ACL 2026 收录,是一个包含 138 个真实世界任务的综合基准,评估 6 种核心智能体能力(游戏开发、前端、后端、代码生成、研究、MCP 工具),分布在 32 个真实场景中。每个场景平均需要 90 次工具调用和 100 万 Token。其核心创新包括:通过用户模拟 Agent 替代人类反馈、Docker 沙箱执行可视化评估,实现长程复杂任务的全自动化评估。
VIBench 专注于非 API 可交互应用的视觉交互评测,覆盖 3D 游戏、娱乐和办公场景。与 GAIA 不同,VIBench 强调 Agent 需要通过图形用户界面(GUI)与应用程序交互,而非标准 API。在 VIBench 上,MMAC-Copilot 获得 70.32% 的平均分,远超对比系统 FRIDAY 的 35.07%。
三、评测生态的方法论挑战
3.1 基准数字到底意味着什么
一篇系统综述提出了一个关键观点:"基准数字的含义取决于它测量的是哪种能力、如何评分、以及在何处测试"。该综述提出了一个三元坐标系------能力(什么)、评分范式(如何)、环境拓扑(哪里)------来定位每一个基准。
这意味着,直接比较 WebArena 的 74.3% 和 OSWorld 的 66.3% 是没有意义的------它们测量的是完全不同的能力维度和环境拓扑。
3.2 从基准到部署的鸿沟
一篇 2026 年的综述批判性地分析了 15 个主要 Agent 基准,指出当前评测体系在成本效率、安全合规性、可维护性和工作流集成等部署关键维度上覆盖不足。
生产环境应该额外关注的五个指标:
- 真实输入分布上的任务完成率,而非测试集分布
- 步骤级成功率,而非仅看端到端结果
- 每完成任务的成本
- 工具调用频率与重试率
- N 次运行一致率与目标漂移指标
这些指标直接关系到 Agent 能否在实际业务中创造价值。
3.3 "评测即打勾"的危险
当前 Agent 评测的一个结构性问题是:测一次、批准、之后只靠客户投诉监控。这种模式无法捕捉模型更新、数据分布偏移或环境变化带来的性能退化。持续评测和回归测试应该成为 Agent 部署的标准实践。
四、从评测数据看 Agent 的真实能力边界
综合以上数据,2026 年 Agent 的能力画像是:
已跨越的能力门槛:浏览器端到端任务(WebArena)、桌面级计算机操作(OSWorld)已在部分配置下达到或接近人类水平。网络安全 CTF 任务表现突出(93%),说明结构化、有明确目标的任务非常适合当前 Agent。
仍有显著差距的领域:终端使用代理(TUA-Bench 65.8%)表明长程规划、错误恢复和执行监控仍是短板。MLE-bench 的 64.4% 虽较 2024 年大幅提升,但竞赛类问题相比真实数据科学工作仍偏结构化。
快速进步的领域:所有基准的成功率在过去 18--24 个月内都呈现陡峭上升曲线。WebArena 从 15% 到 74.3%,MLE-bench 从 17% 到 64.4%,Cybench 从 15% 到 93%------进步速率本身是最值得关注的信号。
五、给开发者的建议
- 不要只看总分。理解基准测量的具体能力维度,选择与你实际场景最匹配的基准。
- 关注成本维度。TUA-Bench 的研究表明,推理努力程度的提升存在边际收益递减------极高推理等级仅增加 2.3% 成功率却使 Token 消耗翻倍。
- 建立自己的评测集。公开基准提供的是基线参考,但你的业务场景需要定制化的评测------真实输入分布、你的工具链、你的失败模式。
- 持续评测而非一次性评测。模型更新、API 变更和环境变化都会影响 Agent 表现,回归测试应该是持续性的。