AI 的“手和眼”:一场关于感知与行动的静默革命

当我们在讨论 AI Agent 时,我们到底在讨论什么?


一个被忽视的关键问题

过去两年,大模型的叙事几乎被"参数规模""推理能力""上下文长度"这些词垄断。我们惊叹于 GPT-4 能写诗、Claude 能编程、Gemini 能解数学题。

但一个尴尬的事实是:这些模型再聪明,它们也无法自己打开一个网页。

你可能会说,不是有插件吗?不是有 Function Calling 吗?没错,但这些机制本质上只是让模型"输出一段结构化文本",真正去执行这段文本的,仍然是外部的工程系统。

于是,一个关键问题浮现出来:谁来做 AI 的手和眼?

这个问题看似工程化、技术化,但它背后隐藏着一个更深的哲学命题:当一个智能体被剥夺了感知和行动能力时,它还算不算真正的智能?


第一层思考:Playwright 为什么成了默认答案

在上一轮对话中,我们聊到 AI 工具在分析图像时经常用到 Playwright。这个现象本身就值得深思。

Playwright 最初是为测试工程师设计的------它的使命是自动化浏览器操作,验证网页功能是否正常。但如今,它正在成为 AI Agent 的"标配外设"。

为什么?

因为 Playwright 恰好满足了 AI 作为智能体的两个核心需求:

第一,它是"手"。 AI 可以生成一个点击指令,Playwright 在真实浏览器中执行这个点击。AI 可以决定"填写这个表单",Playwright 负责把文字敲进去。

第二,它是"眼"。 执行完动作后,AI 需要知道"发生了什么"。Playwright 可以截图,可以提取 DOM 树,可以返回无障碍树------这些都是 AI 感知页面状态的通道。

这构成了一个闭环:分析 → 行动 → 感知 → 再分析。

这个闭环,恰恰是"智能体"(Agent)这个词的本义。一个 Agent 不是静态的模型,而是一个能与环境持续交互的动态系统。

但这里有一个微妙的问题:Playwright 的"眼睛"看到的,和人类看到的,是同一个世界吗?


第二层思考:AI 的"视觉"与人类的"视觉"并不相同

当我们说 AI 用 Playwright 截图来"看"页面时,我们其实在用一个隐喻。

人类看网页,看到的是布局、颜色、文字、按钮的视觉层次。但 AI 通过截图"看"到的,是一堆像素矩阵。它需要经过额外的视觉模型(如 GPT-4V)才能理解"这是一个登录按钮"。

而 Playwright 提供的另一种感知方式------无障碍树(Accessibility Tree)------则完全是另一条路径。无障碍树原本是为屏幕阅读器设计的,它把页面抽象成结构化的语义节点:"按钮:登录""输入框:用户名"。

有趣的是,对于 AI 来说,无障碍树往往比截图更高效、更精确。

截图是冗余的:一个 1920×1080 的页面,截图可能包含数百万像素,但真正有意义的元素可能只有十几个。而无障碍树直接给出了语义结构,token 消耗更少,判断更准确。

这引出了一个深刻的洞察:AI 的感知通道,不必与人类对齐,而应该与任务对齐。

我们人类用眼睛看世界,是因为进化给了我们视觉皮层。但 AI 不需要模仿人类的感知方式,它可以选择最适合自己的"感官"。

这就解释了为什么会出现像 Unbrowser 这样的工具------它干脆放弃了像素渲染,直接返回一个约 500 token 的 BlockMap(结构化页面摘要)。AI 不需要"看"页面,它只需要"理解"页面。

这是一种感知的极简主义。


第三层思考:工具的分化,折射出 AI Agent 的三种哲学

当我们盘点 Playwright、Puppeteer、Unbrowser、SERA、MIME、chrome-use 这些工具时,会发现它们并不是简单的替代关系,而是代表了三种不同的哲学。

哲学一:模拟人类。

Playwright 和 Puppeteer 走的是这条路。它们驱动真实浏览器,渲染真实像素,模拟真实点击。AI 像一个人一样"使用"浏览器。这种方式的优势是通用性强------任何人类能操作的网页,AI 都能操作。但代价是笨重、慢、token 消耗大。

哲学二:超越人类。

Unbrowser 和 SERA 代表这条路。它们认为 AI 不应该模仿人类,而应该用更高效的方式感知。Unbrowser 返回结构化摘要,SERA 优先使用无障碍树。它们的信条是:AI 的感官应该为 AI 的认知方式而设计。

哲学三:融入人类。

chrome-use 和 Windows 365 for Agents 走的是这条路。它们直接连接你现有的浏览器、你的登录状态、你的桌面环境。AI 不是在一个隔离的沙盒里操作,而是在你的真实数字生活中行动。

这三种哲学没有绝对的对错,它们对应着不同的场景:

  • 需要通用性时,选模拟人类。
  • 需要效率和成本控制时,选超越人类。
  • 需要真实上下文时,选融入人类。

但更深层的问题是:当 AI 的感知方式越来越远离人类时,我们还能理解它在做什么吗?


第四层思考:可解释性的隐忧

这是一个被低估的风险。

当 AI 通过截图操作网页时,我们可以回放截图,看到它"看到"了什么。但当 AI 通过 BlockMap 或无障碍树操作时,我们看到的只是一堆结构化文本。如果 AI 做出了一个错误的决策,我们很难直观地理解"它为什么这么想"。

更麻烦的是,不同的感知通道会带来不同的偏差。

截图会让 AI 过度关注视觉显著的元素(比如大按钮、鲜艳的颜色),而忽略语义上重要的元素(比如一个不起眼的"条款同意"复选框)。无障碍树则可能让 AI 忽略视觉布局带来的隐含信息(比如两个按钮的位置关系暗示了主次)。

每一种感知方式,都是一种对世界的简化。而每一种简化,都是一种偏见。

这让我们不得不思考:我们是否应该让 AI 同时使用多种感知通道? 就像人类既有视觉又有听觉、触觉一样,AI 是否也应该融合截图、DOM、无障碍树、甚至网络请求日志,来形成一个更完整的"世界模型"?

这或许是下一代 AI Agent 基础设施的核心命题。


第五层思考:从工具到生态,谁在定义标准?

如果我们把视野再拉高一点,会发现这场"手和眼"的竞争,本质上是一场标准之争。

微软推出了 Playwright Workspaces 和 Windows 365 for Agents,把浏览器自动化和 Windows UI 自动化打包成 MCP 服务器。这意味着任何支持 MCP 的 AI 助手(Claude、Cursor 等)都可以直接调用这些能力。

MIME 原生支持 MCP,用 Go 写了一个单二进制文件,追求极致的部署简单性。

chrome-use 则走 CLI 路线,任何能执行 shell 命令的 Agent 都能用。

这不再是一个"哪个工具更好用"的问题,而是一个"哪个工具能成为 AI Agent 默认外设"的问题。

历史告诉我们,在基础设施领域,标准往往比性能更重要。 就像 USB-C 不一定是最优秀的技术,但它成为了通用标准。MCP 正在成为 AI 工具集成的"USB-C"------它定义了 AI 如何发现、调用、组合外部工具。

如果 MCP 真的成为标准,那么未来的 AI Agent 将不再关心"我用的是 Playwright 还是 Puppeteer",而是关心"我需要什么能力,哪个 MCP 服务器提供这个能力"。

工具会隐入幕后,能力会成为商品。


结语:手和眼的革命,才刚刚开始

回到最初的问题:AI 工具在分析图像时为什么用 Playwright?

表面答案是:因为它能执行动作、能截图、能提取 DOM。

但深层答案是:因为 AI 需要一个身体。

一个只有大脑没有身体的智能,无法与世界交互。它只能输出文本,不能改变现实。而 Playwright 及其同类工具,正在为 AI 构建一个数字身体------有手可以点击,有眼可以观察,有循环可以试错。

这个身体目前还很笨拙。它需要截图、需要解析、需要等待页面加载。它会被验证码挡住,会在复杂的 JavaScript 页面中迷失。

但正如生物进化从简单到复杂,AI 的"数字身体"也在快速进化。从模拟人类,到超越人类,再到融入人类------这场关于感知与行动的静默革命,正在重新定义什么是"智能体"。

而我们,正站在这场革命的起点。


思考题:

如果 AI 的感知方式可以完全不同于人类,那么"可解释性"的标准是否也应该重新定义?我们需要的,是让 AI 像人一样思考,还是让 AI 的思考过程对人类透明?

欢迎在评论区分享你的看法。

相关推荐
柯南46681 小时前
【AI工程师精讲】05:FlashAttention:它不是算得更快,是搬得更少
人工智能·ai编程
C++ 老炮儿的技术栈1 小时前
char (*csConnectName)[256]; 和 char csConnectName [256] 有什么区别
java·c语言·开发语言·c++·人工智能·算法·c
Rocky Ding*1 小时前
VideoChat3 深度解析:视频理解的效率,来自时空压缩与主动感知的共同设计
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·视频理解
禹凕1 小时前
深度学习之激活函数(Deep Learning about Activation function)
人工智能·深度学习
loulanyue_1 小时前
脑机接口:意动·芯动·行动——读同济医院副院长廖家智2026云栖演讲
人工智能·深度学习·云栖大会
Dcr_stephen1 小时前
电商 Agent 实践:为什么运营分析与产品调研,需要两套相反的工作流?
人工智能
Omics Pro1 小时前
全新可重分析!代谢组质谱专用
数据库·人工智能·算法·机器学习·自然语言处理
一只废狗狗狗狗狗狗狗狗狗1 小时前
Network架构1——卷积神经网络CNN
人工智能·算法·cnn
鲲穹AI种草1 小时前
桌面与手机美化怎么做,多款 AI 壁纸生成工具使用记录
人工智能·壁纸工具