当我们在讨论 AI Agent 时,我们到底在讨论什么?
一个被忽视的关键问题
过去两年,大模型的叙事几乎被"参数规模""推理能力""上下文长度"这些词垄断。我们惊叹于 GPT-4 能写诗、Claude 能编程、Gemini 能解数学题。
但一个尴尬的事实是:这些模型再聪明,它们也无法自己打开一个网页。
你可能会说,不是有插件吗?不是有 Function Calling 吗?没错,但这些机制本质上只是让模型"输出一段结构化文本",真正去执行这段文本的,仍然是外部的工程系统。
于是,一个关键问题浮现出来:谁来做 AI 的手和眼?
这个问题看似工程化、技术化,但它背后隐藏着一个更深的哲学命题:当一个智能体被剥夺了感知和行动能力时,它还算不算真正的智能?
第一层思考:Playwright 为什么成了默认答案
在上一轮对话中,我们聊到 AI 工具在分析图像时经常用到 Playwright。这个现象本身就值得深思。
Playwright 最初是为测试工程师设计的------它的使命是自动化浏览器操作,验证网页功能是否正常。但如今,它正在成为 AI Agent 的"标配外设"。
为什么?
因为 Playwright 恰好满足了 AI 作为智能体的两个核心需求:
第一,它是"手"。 AI 可以生成一个点击指令,Playwright 在真实浏览器中执行这个点击。AI 可以决定"填写这个表单",Playwright 负责把文字敲进去。
第二,它是"眼"。 执行完动作后,AI 需要知道"发生了什么"。Playwright 可以截图,可以提取 DOM 树,可以返回无障碍树------这些都是 AI 感知页面状态的通道。
这构成了一个闭环:分析 → 行动 → 感知 → 再分析。
这个闭环,恰恰是"智能体"(Agent)这个词的本义。一个 Agent 不是静态的模型,而是一个能与环境持续交互的动态系统。
但这里有一个微妙的问题:Playwright 的"眼睛"看到的,和人类看到的,是同一个世界吗?
第二层思考:AI 的"视觉"与人类的"视觉"并不相同
当我们说 AI 用 Playwright 截图来"看"页面时,我们其实在用一个隐喻。
人类看网页,看到的是布局、颜色、文字、按钮的视觉层次。但 AI 通过截图"看"到的,是一堆像素矩阵。它需要经过额外的视觉模型(如 GPT-4V)才能理解"这是一个登录按钮"。
而 Playwright 提供的另一种感知方式------无障碍树(Accessibility Tree)------则完全是另一条路径。无障碍树原本是为屏幕阅读器设计的,它把页面抽象成结构化的语义节点:"按钮:登录""输入框:用户名"。
有趣的是,对于 AI 来说,无障碍树往往比截图更高效、更精确。
截图是冗余的:一个 1920×1080 的页面,截图可能包含数百万像素,但真正有意义的元素可能只有十几个。而无障碍树直接给出了语义结构,token 消耗更少,判断更准确。
这引出了一个深刻的洞察:AI 的感知通道,不必与人类对齐,而应该与任务对齐。
我们人类用眼睛看世界,是因为进化给了我们视觉皮层。但 AI 不需要模仿人类的感知方式,它可以选择最适合自己的"感官"。
这就解释了为什么会出现像 Unbrowser 这样的工具------它干脆放弃了像素渲染,直接返回一个约 500 token 的 BlockMap(结构化页面摘要)。AI 不需要"看"页面,它只需要"理解"页面。
这是一种感知的极简主义。
第三层思考:工具的分化,折射出 AI Agent 的三种哲学
当我们盘点 Playwright、Puppeteer、Unbrowser、SERA、MIME、chrome-use 这些工具时,会发现它们并不是简单的替代关系,而是代表了三种不同的哲学。
哲学一:模拟人类。
Playwright 和 Puppeteer 走的是这条路。它们驱动真实浏览器,渲染真实像素,模拟真实点击。AI 像一个人一样"使用"浏览器。这种方式的优势是通用性强------任何人类能操作的网页,AI 都能操作。但代价是笨重、慢、token 消耗大。
哲学二:超越人类。
Unbrowser 和 SERA 代表这条路。它们认为 AI 不应该模仿人类,而应该用更高效的方式感知。Unbrowser 返回结构化摘要,SERA 优先使用无障碍树。它们的信条是:AI 的感官应该为 AI 的认知方式而设计。
哲学三:融入人类。
chrome-use 和 Windows 365 for Agents 走的是这条路。它们直接连接你现有的浏览器、你的登录状态、你的桌面环境。AI 不是在一个隔离的沙盒里操作,而是在你的真实数字生活中行动。
这三种哲学没有绝对的对错,它们对应着不同的场景:
- 需要通用性时,选模拟人类。
- 需要效率和成本控制时,选超越人类。
- 需要真实上下文时,选融入人类。
但更深层的问题是:当 AI 的感知方式越来越远离人类时,我们还能理解它在做什么吗?
第四层思考:可解释性的隐忧
这是一个被低估的风险。
当 AI 通过截图操作网页时,我们可以回放截图,看到它"看到"了什么。但当 AI 通过 BlockMap 或无障碍树操作时,我们看到的只是一堆结构化文本。如果 AI 做出了一个错误的决策,我们很难直观地理解"它为什么这么想"。
更麻烦的是,不同的感知通道会带来不同的偏差。
截图会让 AI 过度关注视觉显著的元素(比如大按钮、鲜艳的颜色),而忽略语义上重要的元素(比如一个不起眼的"条款同意"复选框)。无障碍树则可能让 AI 忽略视觉布局带来的隐含信息(比如两个按钮的位置关系暗示了主次)。
每一种感知方式,都是一种对世界的简化。而每一种简化,都是一种偏见。
这让我们不得不思考:我们是否应该让 AI 同时使用多种感知通道? 就像人类既有视觉又有听觉、触觉一样,AI 是否也应该融合截图、DOM、无障碍树、甚至网络请求日志,来形成一个更完整的"世界模型"?
这或许是下一代 AI Agent 基础设施的核心命题。
第五层思考:从工具到生态,谁在定义标准?
如果我们把视野再拉高一点,会发现这场"手和眼"的竞争,本质上是一场标准之争。
微软推出了 Playwright Workspaces 和 Windows 365 for Agents,把浏览器自动化和 Windows UI 自动化打包成 MCP 服务器。这意味着任何支持 MCP 的 AI 助手(Claude、Cursor 等)都可以直接调用这些能力。
MIME 原生支持 MCP,用 Go 写了一个单二进制文件,追求极致的部署简单性。
chrome-use 则走 CLI 路线,任何能执行 shell 命令的 Agent 都能用。
这不再是一个"哪个工具更好用"的问题,而是一个"哪个工具能成为 AI Agent 默认外设"的问题。
历史告诉我们,在基础设施领域,标准往往比性能更重要。 就像 USB-C 不一定是最优秀的技术,但它成为了通用标准。MCP 正在成为 AI 工具集成的"USB-C"------它定义了 AI 如何发现、调用、组合外部工具。
如果 MCP 真的成为标准,那么未来的 AI Agent 将不再关心"我用的是 Playwright 还是 Puppeteer",而是关心"我需要什么能力,哪个 MCP 服务器提供这个能力"。
工具会隐入幕后,能力会成为商品。
结语:手和眼的革命,才刚刚开始
回到最初的问题:AI 工具在分析图像时为什么用 Playwright?
表面答案是:因为它能执行动作、能截图、能提取 DOM。
但深层答案是:因为 AI 需要一个身体。
一个只有大脑没有身体的智能,无法与世界交互。它只能输出文本,不能改变现实。而 Playwright 及其同类工具,正在为 AI 构建一个数字身体------有手可以点击,有眼可以观察,有循环可以试错。
这个身体目前还很笨拙。它需要截图、需要解析、需要等待页面加载。它会被验证码挡住,会在复杂的 JavaScript 页面中迷失。
但正如生物进化从简单到复杂,AI 的"数字身体"也在快速进化。从模拟人类,到超越人类,再到融入人类------这场关于感知与行动的静默革命,正在重新定义什么是"智能体"。
而我们,正站在这场革命的起点。
思考题:
如果 AI 的感知方式可以完全不同于人类,那么"可解释性"的标准是否也应该重新定义?我们需要的,是让 AI 像人一样思考,还是让 AI 的思考过程对人类透明?
欢迎在评论区分享你的看法。