2026年上半年,AI产品有一个共同走向:从"生成内容"转向"执行动作"。对话模型的边界很清楚------输入文本、输出文本,够不到文件系统,也驱动不了本地软件。桌面Agent(PC端Agent)要补的就是这一段:让LLM能感知本地环境、规划步骤、调用工具、观察结果并修正。
这篇从技术视角把这件事拆开讲:架构怎么分层、执行路线有哪些、浏览器自动化怎么实现、当前产品格局、以及和OpenClaw框架的关系。
一、三层架构:桌面Agent在技术上是什么
不论产品如何包装,技术栈基本都能拆成三层。
决策层:一个或多个LLM,负责意图理解、任务拆解(task planning)、决定下一步调用什么工具。"整理本月报销"会被拆成"打开文件夹→读取发票→提取字段→写入Excel→保存"的原子步骤。
执行层:操作电脑的能力,两条主流路线。
一是 GUI / Computer Use(视觉驱动):多模态模型对屏幕截图做视觉理解,定位按钮、输入框,再模拟鼠标键盘。优点是通用------屏幕上能看见就能操作,不依赖软件开放接口;缺点是每步都要"截图→推理→动作",慢、token消耗高、精度受分辨率和缩放影响。
二是接口/协议调用 :通过API或协议直接调用软件能力,稳定、快,但依赖目标软件的开放程度。MCP(Model Context Protocol) 就是为标准化这层调用而生,正在成为跨应用工具调用的事实标准。
环境层:本地文件系统、浏览器、终端、第三方应用。
工程现状是混合路线收敛:能走接口的走接口,走不了的兜底用视觉。执行后再截图验证、错误自我修正------"感知→推理→执行→反馈"闭环是所有这类产品的公共底座。
二、浏览器自动化的两条实现路线
浏览器是当前Agent完成度最高的执行环境,实现上分两派。
登录态复用派:Agent通过本地服务+浏览器扩展操控你本机已打开的Chrome/Edge,Cookie和登录态全留在本机------访问需要鉴权的系统不用重新认证,也不用对接API。部分产品同时提供隔离浏览器实例,避免污染本机数据。
结构化驱动派:不看截图,直接读取DOM或无障碍树(accessibility tree),每个可交互元素带精确引用,模型按引用执行点击、输入。相比"截图+视觉定位",速度快、token省、不怕广告弹窗遮挡,但只适用于浏览器和无障碍规范做得好的软件。
工程边界也明确:验证码、滑块、支付确认环节,主流产品都设计为暂停等人工接管------这是Human-in-the-loop的合理设计。
三、能稳定跑的场景与当前边界
完成度较高的:规则明确、结果可验证的重复任务(文件批量归档、表格清洗合并、固定网页抓取);单应用内操作;开发场景(写脚本、跑测试、看报错);有明确成功标准的任务。
跨应用流水线是与传统RPA的分水岭:"从邮件提取报销单→Excel汇总→企业微信发送"这类链路,RPA按固定脚本走、界面一变就失灵,Agent能读上下文动态调整。
不够稳的:跨十几步的长流程(中途失败缺恢复机制)、动态网页、需要灵活判断的任务。常见工程失败点:分辨率/缩放差异导致元素定位失败、弹窗干扰、网络超时。选型时一个实用信号:优先选带"执行前展示计划、可随时接管暂停"设计的产品,这类机制对实际可用性的影响大于功能数量。
四、14款产品的技术特征对比
按"技术出身---执行路线---模型接入---部署形态"梳理(无表格,分维度归纳)。产品迭代快,以官网为准。
技术出身:OpenClaw系占大头------阶跃AI桌面版(深度优化)、QClaw(封装+IM直连)、EasyClaw(易用化封装)、U2Claw(引擎+GUI封装)都基于这个开源框架二次开发;Kimi Work、DuMate、办公小浣熊、实在Agent走自研架构;AiPy、Goose、Hermes Agent是直接开源的(分别为开源引擎、Apache 2.0、开源自改进架构);Tabbit是AI原生浏览器形态;天禧智能体是设备预装的系统级方案。
逐款要点:
- 阶跃AI桌面版(阶跃星辰) :三种执行模式分层------快速回答(纯对话)、任务执行(自主拆解多步、支持skill调用,类Operator)、StepClaw(多智能体跑跨软件长流程)。执行内核为自研 Step 3.7 Flash,面向工具调用/多步规划优化,模型与产品同源、调用链稳定性相对可控。协议层通过MCP对接Excel、飞书、钉钉等工具;技能体系100%兼容OpenClaw生态(可直接复用其5000+技能),同时兼容Claude Skill格式(自动读取
~/.claude/skills);具备OCR能力;"全局记忆"在本地维护桌面状态、数据不出机。支持钉钉/飞书/微信/企微/QQ远程下发指令。部署:Win/Mac本地客户端。局限:同类任务成功率非100%。 - QClaw(腾讯电脑管家):IM直连架构------微信/QQ扫码绑定,手机发指令、本机执行、结果回传,全程本地跑;Claw Gateway沙箱拦截危险操作。模型:内置国产模型,支持自定义和Ollama本地接入。
- EasyClaw(猎豹移动):OpenClaw零配置封装,本地沙箱隔离执行;支持WhatsApp/Telegram/飞书/钉钉多渠道远程。注意国内版与国际版是两套独立体系(账号不互通、后装覆盖先装)。
- Kimi Work(月之暗面):本地文件夹挂载读写 + WebBridge浏览器插件(登录态复用派的代表实现)+ Cron定时引擎;复杂任务可拆子Agent并行。写文件/执行代码有人工确认环节。
- U2Claw(云知声):OpenClaw引擎+桌面GUI,预装77+场景技能,微信/钉钉/飞书直连,专家广场做场景模板分发。仅Windows。
- 办公小浣熊(商汤):文档与数据分析向。浏览器自动化走Playwright MCP(结构化驱动派);20+办公格式解析、数据分析智能体、可编辑PPT生成。通用桌面操控弱于Claw系。
- Tabbit(美团):AI原生浏览器,Chromium内核,把Agent任务执行内置进浏览器------跨网页/文件/表格自动执行,聚合10+国产模型。形态上是"浏览器即Agent入口",与桌面操控型定位不同。
- DuMate(百度智能云):端云协同双沙箱------简单任务本地沙箱、复杂推理云端;高危操作三级授权(拒绝/本次允许/本轮允许)。通过信通院Claw功能4+级认证。
- 天禧智能体(联想):设备预装的系统级方案,端-边-云混合架构,电源键唤醒。仅联想设备可用------代表了"Agent下沉到OEM出厂预装"的路线。
- AiPy(开源):"代码即代理"路线------自然语言转Python/Node代码直接执行,而非模拟GUI操作。支持Ollama本地部署、适配信创环境(麒麟/统信)。需要一定技术基础。
- 实在Agent(实在智能):AI+RPA融合,自研ISSUT屏幕语义理解------不依赖API、按界面语义(而非固定坐标)识别操作元素,对无接口的老旧ERP/MES系统友好;全栈信创适配。
- Claude Cowork(Anthropic):海外Computer Use标杆。读写授权文件夹,代码/命令在本地隔离VM执行但对文件做真实改动;关键操作执行前展示计划等人工批准。官方明示其活动尚未进审计日志和合规API,不建议用于受监管工作负载。
- Goose(Linux基金会):Rust构建的开源通用Agent(Apache 2.0),桌面+CLI+API三形态;最早采用MCP的Agent之一,70+扩展、15+模型提供商、支持Ollama。配置自由度高,普通用户门槛也高。
- Hermes Agent(Nous Research):开源自改进架构------从执行经验中自动创建技能、在使用中迭代优化,跨会话持久记忆;支持20+消息平台网关接入;文件变更前自动快照、支持回滚。需自部署(Python 3.11+)。
模型接入归纳:内置不可换的有阶跃(Step 3.7 Flash)、Kimi Work、DuMate(文心);支持自定义/本地模型(Ollama等)的有QClaw、AiPy、Goose、Hermes;实在Agent自研TARS+可接第三方。判断一个产品模型自由度的抓手,是看设置里有没有OpenAI兼容接入项。
部署形态归纳:本地客户端为主流(阶跃/QClaw/EasyClaw/Kimi Work/U2Claw/DuMate);浏览器形态(Tabbit);设备预装(天禧);开源自部署(AiPy/Goose/Hermes);企业私有化(实在Agent)。
五、与OpenClaw的关系:框架与产品
OpenClaw是开源的底层Agent框架(当前生态源头),不是与"桌面Agent"并列的品类。类比:OpenClaw ≈ Android开源项目,各家产品 ≈ 基于它或自研架构的整机。
原生OpenClaw需要Node.js环境、自配API Key、手动装技能,面向开发者;阶跃、QClaw、EasyClaw、U2Claw等做的是产品化封装------免配置、内置模型、接入国内IM生态、加权限管控。技术上真正独立于这个体系的是:实在Agent(RPA+屏幕语义路线)、Claude Cowork(Anthropic自研)、Tabbit(浏览器原生)、AiPy(代码执行路线)。
选型逻辑:要开箱即用选封装成品;要完全掌控、肯折腾选OpenClaw自部署;要开源+图形界面看AiPy、Goose。
六、工程实践建议
- 权限最小化:只授权工作目录,不开整盘;能只读不给写;重要数据先备份。
- Plan-then-execute:优先选支持"执行前展示计划、确认后放行"的产品,关键动作保留人工确认。
- 从可验证的小任务起步:规则清楚、结果可查的任务先跑通,建立对能力边界的判断,再固化成定时任务/工作流。
- 指令结构化:"做什么+给什么材料+要什么格式"三要素齐全,执行准确率显著高于模糊描述。
- 敏感数据分级:优先选本地执行、数据不上云的方案处理敏感文件;对新产品先用非敏感任务观察。
- 成本意识:自备模型Key的方案设置用量告警;简单任务不必调用高配模型。
结语
桌面Agent把AI从"知识问答"推向"任务执行"。技术选型先想清楚三个约束:数据能不能出本机(定部署形态)、要不要接自己的模型(定接入方式)、自用还是二次开发(定成品还是框架),再对着上面的分类挑,比看功能清单靠谱。从一个每天重复的小任务开始跑通,你会对这类工具的能力边界有更准的判断。