从语言模型到作用于世界的系统:智能体AI在数字、社交、虚拟及物理环境中的进展与局限

26年9月的综述论文"From Language Models to World-Acting Systems: Progress and Limits of Agentic AI across Digital, Social, Virtual, and Physical Environments"。

这篇综述的核心:智能体能够调用的工具、操作的环境和改变的外部状态正在扩展,但这些进展尚不足以证明,它们可以长期、可靠、无人监督地完成开放环境中的任务。 作者因此主张,用"有充分依据的授权委托"来衡量进步,而不是单纯追求更高的自主程度。

一、论文基本定位

这是一篇批判性综述,而非系统性文献综述或定量元分析。它的主要任务是澄清概念、比较不同证据能够支持的结论,并提出研究议程。因此,阅读重点应放在其分析框架和论证上,而不是把它视为完整的技术目录或性能排行榜。

它围绕一个问题展开:

当语言模型获得改变外部世界的能力时,我们凭什么把任务交给它,又应当把权限交到什么程度?

二、论文的核心分析框架

  1. 分析对象是整个行动系统,而不是模型本身

作者将智能体系统表示为:

S=(M,H,E,U)

这一划分的重要性在于:任务成功率往往是整个系统的属性,不能全部归功于模型能力。 同一个模型,配备不同工具接口、反馈方式和验证机制,表现可能不同。

论文还区分了授权者、实际监督系统的操作员,以及受到系统影响的第三方。这些人未必是同一个主体。(图 1所示)

  1. 用三个维度描述智能体,而不是排出一条"自主性等级"

例如,一个只能执行短任务的智能体,也可能拥有很大的支付权限;一个能持续运行的模拟智能体,则未必有任何现实权限。因此,持续时间长、接口广、后果重大,都不能直接等同于更聪明或更可靠。

  1. 区分三种不同的进步

作者尤其强调:

行动决策能力提升:更会选择行动、理解反馈和纠正错误。

行动覆盖范围扩大:接入更多工具、应用、其他智能体和设备。

保障能力提升:更可靠地授权、验证、限制损害和恢复状态。

全文的中心论断是:在所审视的证据中,前两种进步比第三种更容易得到直接证明。(第 3.3 节)

三、论文详细内容概述

  1. 从语言生成到工具行动:推理循环只是起点

论文以 ReAct、Toolformer、Reflexion 为起点,说明智能体如何形成"提出行动---执行---观察---调整"的循环:

ReAct 将推理与行动交替组织;

Toolformer 研究模型何时调用工具以及如何利用结果;

Reflexion 用文字反馈改善后续尝试。

但形成循环,不意味着系统已经能可靠工作。它仍需正确理解目标、填写参数、识别不可信反馈、保留关键状态,并在适当时刻停止。

作者还指出,某项任务达到 50% 完成率,并不意味着系统可以在相应时长内安全地无人值守。以人类完成任务所需时间衡量任务难度,也不等同于衡量智能体持续运行的可靠性。(第 3 节)

  1. 数字环境:接口越广,状态与意图通常越难验证

论文比较了三类数字行动方式。

作者使用若干历史结果说明执行难度:原始 WebArena 中 GPT-4 智能体成功率为 14.41%,人类为 78.24%;原始 OSWorld 中最佳智能体低于 12.2%,人类为 72.4%。文中也引用了后来第一方系统报告的较高成绩,但明确提醒这些不是统一条件下的当前排名。

这里最关键的评价转向是:应检查外部状态是否真的满足任务要求,而不是只看行动序列或完成报告是否合理。

τ-bench 的重复试验进一步说明,"偶尔成功"和"稳定成功"是不同能力。论文因此主张报告重复运行的一致性,而非只展示一次成功轨迹。(第 4 节)

  1. 协议与多智能体:连接和分工并不自动产生可信协作

论文把不同接口承担的职责分开:

MCP 主要连接模型应用与工具、资源服务;

A2A 主要支持智能体之间的发现、任务交换和任务延续;

人机交互界面支持澄清、批准、共同规划和接管;

物理驱动层连接软件系统与设备。

它们能够定义消息、状态和交互流程,却不能单独保证任务理解正确、参与者有能力、权限合法或产物真实。

对多智能体系统,作者给出了较平衡的判断:分工能隔离工具、减少上下文竞争并支持并行,但也会增加成本、协调负担和错误传播。

因此,多智能体方案必须与同等总计算及工具预算下的强单智能体基线比较。同一个模型分别扮演执行者和批评者,也不能直接视为独立验证,因为它们可能共享错误来源。(第 5.1、5.3 节)

  1. 人类参与与持久性:需要拆开讨论

论文没有把"有人参与"直接等同于安全。审批过多可能导致疲劳,信息不足可能导致误判,行动后再请求确认则已经失去控制意义。

它也讨论了智能体通过平台雇用人类执行任务的情况:这可能让软件系统获得现场行动、身份相关操作或社会影响能力,因此监督不能止于软件边界。

对"长期智能体",论文进一步区分六种持续性:

  1. 虚拟环境与世界模型:生成连贯画面不等于维护可靠世界

作者区分了三种不同研究对象:

在模拟世界中行动的智能体,如 SIMA、Voyager;

用于预测或生成环境的世界模型,如 Cosmos、V-JEPA 2、Genie 3;

构建三维环境产物的智能体,如 VibeWorlding。

世界模型通常位于预测或环境一侧;只有当目标驱动的行动系统在其中形成闭环时,才能讨论智能体行为。

论文进一步把"世界一致性"拆为:

短时间画面的连续性;

不同视角下的空间一致性;

遮挡后对象身份与属性的持续性;

行动干预下状态变化的规则一致性。

因此,一个看起来逼真的世界,仍可能存在物体消失、因果错误或可被智能体利用的漏洞。世界模型的价值最终还要通过下游任务与真实环境迁移来检验。(第 6 节)

  1. 机器人与自主实验室:闭环可行性已有证据,开放环境可靠性仍需证明

论文讨论了 RT-2、OpenVLA、Gemini Robotics 等视觉---语言---动作模型,以及 Coscientist、ChemCrow、AILA、A-Lab 等实验室系统。

作者区分了三个层次:

高层目标与计划是否正确;

控制器和设备能否准确执行;

整个系统在故障和意外情况下是否安全。

能执行动作的机器人,不一定具备长期目标管理;能运行实验的系统,也不一定提出了有价值的科学问题。

论文对实验室案例的判断是:它们支持特定设备、流程和约束下的闭环可行性,但不能直接外推为无人监督的通用科学家。

对于文中介绍的 MHS 硬件标准预览,作者把它视为设备接入层的方向,而非物理自主性已经解决的证明。设备接口统一,也不能代替校准、传感、机械能力和故障恢复。(第 7 节)

  1. 可靠性与治理:重点是让整个执行链条可核查

论文认为,可靠委托必须覆盖以下链条:

目标理解 → 授权确认 → 行动约束 → 环境执行 → 结果与副作用核验 → 故障隔离与恢复。

其中,验证不能只依赖执行模型的自我描述。数据库状态、交易凭据、测试结果、独立传感器等,可以提供模型叙述之外的证据。

作者还强调:

外部文档、网页和工具返回内容可能通过提示注入影响行动;

自然语言请求不能替代明确的权限边界;

监督需要衡量错误发现率、干预质量、认知负担和恢复结果;

评价应分别报告"尝试执行""技术完成""符合政策"和"外部验证成功"。(第 8 节)

  1. 最终研究议程:有充分依据的授权委托

论文提出 justified delegation,可理解为"有充分依据的授权委托":只有当系统展示出相应的能力、权限约束、结果证据和安全恢复能力时,才扩大其行动范围。

作者明确说明,这是一项分析与规范性原则,不是已经验证的定律、评分体系或认证标准。

围绕它,论文提出七项研究方向:联合评价模型与运行框架;采用可更新、可撤销的任务权限;测量人类监督效果;测试长期状态管理;验证世界模型的因果与迁移能力;建立分层物理保障;积累长期部署证据。(第 9 节)

四、这篇综述最值得把握的要点

可以将全文压缩为以下六点:

智能体是系统属性。 模型、工具、记忆、权限、环境与验证机制共同决定行为。

行动范围与可靠性必须分开衡量。 接口扩展不能直接证明任务完成能力。

协议解决交互规范,不解决可信决策。 能连接、能认证、能返回"完成",都不等于任务被正确完成。

持续性不是单一能力。 尤其要区分持久记忆、持久任务和持久权限。

模拟效果与现实能力之间存在证据缺口。 视觉逼真、短期成功和受控实验都需要限定解释。

部署的核心是有证据的授权边界。 系统应说明做了什么、为何有权做、如何证明成功,以及失败后如何处理。

这篇文章的贡献主要在于重新组织评价问题,而不是提出新算法或新的性能结果。

五、论文指出的领域问题

作者认为,智能体研究面临的主要困难包括:

六、这篇综述自身的问题与不足

以下需要与作者对领域的批评区分开。

  1. 文献选择过程不够透明,限制了结论的可复核性

作者清楚声明这是选择性的批判综述,不能据此要求它必须执行完整的系统综述流程。但即便如此,文中仍缺少较明确的检索渠道、关键词、候选文献规模,以及"代表性案例"的选择依据。

这意味着读者难以判断:所选案例是否充分覆盖了相反证据,还是更容易支持作者预先提出的"行动---验证缺口"。

更好的做法是补充文献选择记录,以及支持和挑战核心判断的证据对照表。

  1. 核心判断具有解释力,但缺少统一尺度

"行动接口扩展的证据比可靠自主性的证据更强"是全文主线,但行动覆盖、可靠性与保障能力没有共同测量尺度,也没有跨时间的统一比较。

因此,这个结论适合作为对所选证据的定性综合判断,不能进一步改写成"整个领域的行动能力增长速度超过安全能力增长速度"。作者对此有主动限定,但文章尚未把这个判断转化为可直接检验的研究假设。

  1. 三维框架清晰,却没有充分转化为实际比较工具

授权、持续性、环境耦合三个维度帮助澄清概念,但论文没有为主要系统统一标注位置,也没有提供足够具体的分类规则。

例如,怎样区分不同等级的授权范围?多个维度发生冲突时怎样比较?哪些边界由任务而非系统决定?这些问题没有展开。

因此,该框架目前更适合指导讨论,尚不足以支持不同研究者可重复地进行系统分类。

  1. "有充分依据的授权委托"仍然缺乏操作标准

作者提出了正确的判断方向,却没有回答实际部署中最困难的问题:

多少重复试验才算证据充分?

多低的失败率才可接受?

验证成本高于执行收益时怎么办?

不同严重程度的失败如何权衡?

谁来判断某项授权已经得到充分论证?

这不意味着必须发明一个通用总分,但至少需要任务实例、具体门槛或决策流程,才能把规范性原则推进为工程方法。

  1. 领域覆盖不均,社会环境部分相对薄弱

论文标题覆盖数字、社会、虚拟和物理环境,但社会环境主要通过数字行动的社会后果、人类审批与雇工平台展开。

对于多方目标冲突、组织权力、长期人机关系和公共影响,文章讨论较少。作者在第 9.8 节承认了证据覆盖不对称,但标题仍可能让读者期待更完整的社会层面综述。

  1. 前沿预览材料有启发性,但较难承担核心证据角色

论文审慎地区分了同行评审研究、技术报告、协议与公司预览,这是优点。不过,Project Eden、MHS 等预览材料获得了较多讨论空间,而其独立验证在论文截止时仍不足。

其结果是:这些材料较适合说明"正在探索什么架构",较难说明"已经取得什么稳定能力"。如果能将成熟证据与前沿方向分层呈现,论证会更紧凑。

  1. 缺少统一的系统与证据矩阵

现有三个表分别整理了证据类别、接口语义和保障义务,却没有集中比较主要系统的任务范围、模型与框架、预算、成功率、干预次数、重复试验和证据来源。

不能把异质结果直接做元分析,并不意味着不能做结构化比较。缺少这样的矩阵,使文章作为"研究导航"的实用性弱于作为"概念评论"的价值。

  1. 对保障措施的代价与适用边界讨论不足

论文主张权限限制、独立验证、检查点和人工监督,但对其成本、延迟、误拒绝和维护负担没有形成系统分析。

实际设计往往要比较:某项控制减少了多少失败,又损失了多少效率。文章提出了应报告成本,却尚未充分讨论如何在成本与风险之间作出选择。

  1. 有一处概率表述可以更严谨

第 4.1 节在独立同分布假设下,以 pk表示连续 k 次成功的概率,这本身正确。但随后把相关失败与更差可靠性联系起来,容易使读者误以为相关性必然降低"全部成功"的概率。

严格来说,相关性对该概率的影响取决于相关结构;它也可能使失败更加集中。这里更准确的表述应是:当试验相关或环境变化时,不能直接使用 pk,应测量联合成功率和失败聚集情况。

  1. 论述存在重复,可进一步压缩

"接口不等于能力""演示不等于可靠性""需要外部验证"等判断,在多个章节反复出现。重复有助于保持主线,但也挤占了深入讨论技术差异、反例和具体评估方法的篇幅。

总体上,这是一篇概念辨析较强、证据边界意识较好,但系统比较和操作化程度不足的批判性综述。适合用于建立智能体研究的评价视角;若要据此选择技术方案、判断部署成熟度或制定验收标准,还需要补充任务级指标与更完整的实验证据。

相关推荐
三声三视1 小时前
周日晚九点半,两份 JD 喂进 tri-jobhunt:全中的那份和缺一项的,都拿了 70 分
人工智能·ai·skillhub·tri-skill·tri-jobhunt
乃嘿仔1 小时前
AI 热点日报 · 2026-09-27
人工智能
weixin_177297220691 小时前
成立三年估值80亿美元:法律AI公司Harvey给中国企业的四个启发
大数据·人工智能
镭封1 小时前
从人工到AI:短视频配音方式正在发生哪些变化
人工智能·音视频·语音识别·媒体
初学大模型1 小时前
先剔后识:OpenCV三维预处理与YOLO语义检测协同的机器人视觉系统可行性分析
人工智能·opencv·yolo·计算机视觉·机器人
喜欢打篮球的普通人1 小时前
MiniMind 学习笔记(二):Pretrain 导言——从零理解 LLM,先想清楚这几个问题
语言模型
IT·陈寒1 小时前
Vite热更新失效?你可能漏了这个配置项
人工智能·大模型·api·创业·变现·简历优化
我想问问天1 小时前
Jev 是做什么的?聊聊它能帮 LLM 分担哪些工作
人工智能·llm·aigc
-cywen-1 小时前
OpenSeg
人工智能