2026 年的 AI 已经从"你问一句、它答一段"迈进了 Agent 阶段:能操作软件和浏览器、读写你电脑里的文件、把一个多步任务从头干到尾、直接交出成品。市面上叫"办公 Agent"的产品一抓一大把,但选型文章大多在堆榜单、比分数。作为技术读者,我更关心一件事------这些产品在技术上到底差在哪,我的场景该落到哪一类。
这篇不排座次,而是从技术边界出发,把"会做"型 Agent 的构成、五类产品的架构差异、以及一套可复用的选型决策逻辑讲清楚。
一、先分清"会说"和"会做":差的是一个执行循环
普通对话式 AI 的生命周期很短:接收 prompt → 生成 token → 返回。它的输出终点是"文本"。
"会做"型 Agent 多了一个执行循环。抽象成伪代码大致是这样:
python
ini
# 一个"会做"型 Agent 的最小执行循环
state = perceive(task) # 感知:理解任务、读取环境(文件/屏幕/页面)
while not state.is_done():
plan = model.plan(state) # 规划:下一步做什么
action = plan.next_action() # 决策:调用哪个工具
result = tools.invoke(action) # 执行:真去操作(读写文件/点按钮/发消息)
state = observe(result) # 观察:看结果,决定继续还是纠错
deliver(state.artifact) # 交付:产出可验收的成品
关键在中间三行:它能调用工具真去操作 ,并且能根据结果自我纠错、多步推进 。选型时,你要区分的正是------它到底跑不跑这个循环,还是只停在 model.generate() 那一步给你一段文字建议。"发条消息通知你"和"真读写你的文档、把活干完"是两回事。
这个循环能转起来,技术上依赖两块拼图:
- MCP(Model Context Protocol):给 Agent 接工具的统一协议。 过去每接一个软件都要单独写适配,有了 MCP 这类标准,本地文件、邮箱、飞书、钉钉、浏览器、地图等都能按同一种方式"挂"上来。它决定
tools.invoke()能调到哪些东西。 - 技能(Skill):做某类活的标准做法。 MCP 管"能连上什么",技能管"拿到工具后按什么章法把这件事做完"。工具是手,技能是手艺。
二、五个选型维度,其实对应五个技术能力点
我把常见的五个维度翻译成技术语言,你就知道每一维在考察什么:
- 任务执行稳定性 → 上面那个
while循环能连着跑多少步不断链。步数越多、跨应用越多,对规划和纠错能力要求越高。这是最难的一维,也最能拉开差距。 - 执行边界(会说还是会做) →
tools.invoke()到底接没接真实操作能力,是能读写本地文件、操作 GUI,还是只有只读检索/纯生成。 - 上手门槛 → 你要不要自己配 API Key、写代码、搭运行环境。对应"能力封装在哪一层"(见第三节)。
- 生态集成 → MCP / 技能生态有多广,能不能接你现有的飞书、钉钉、企微和本地文件。
- 成本与安全 → 数据在本地跑还是上云、能否私有化、免费额度多少。涉及财务和客户资料时,这一维权重要往上提。
一句话:稳定性和执行边界是"能不能真干活",门槛和生态是"顺不顺手",成本安全是"敢不敢交给它"。
说明:各家宣传的评测分数测试口径不一、时效性差,本文一律不引用宣传分数;涉及价格与免费额度请以官网当日为准。
三、为什么分五类:本质是"能力封装在哪一层"
产品分类看着乱,底层其实就一条线索------模型、执行循环、工具、技能这几块,厂商替你打包了多少,又留给你多少要自己拼。 按封装程度从高到低:
① 成品客户端(封装最彻底,下载即用) 模型、执行循环、常用工具、技能全给你打包进一个客户端。你下载、登录,直接派活,它在你本机跑循环、读写本地文件、交成品。技术自由度最低,但上手成本也最低。适合不想碰配置、只想干活的个人。
这一层判断一款产品"够不够硬",技术上要看它驱动任务的模型是不是为 Agent 场景专门优化过、执行能力是不是自研可控。
举个这一类里较有代表性的国产例子------阶跃 AI 桌面版:阶跃星辰推出,驱动自研的 Step 3.7 Flash 模型(为 Agent 任务专门优化),下载扫码即用、不配 API Key,文件默认存本地不上云,通过 MCP 可调 Excel、飞书、钉钉等十余款工具。它的技术底气在于模型自研、执行能力可控,而不是直接调第三方模型接口;局限是复杂长流程仍要盯着、结果自己复核。
同一层还有两款:百度搭子 DuMate 本地沙箱运行,对删除、发送等高危操作分级授权、要你点确认,以文心大模型为主并接百度网盘、文库等自家生态,还支持手机端远程给电脑派活,短板是跨厂商工具链仍在扩展、较依赖百度生态;QClaw 由腾讯电脑管家推出,主打微信、QQ 扫码远程操控自己的电脑,数据本地运行不上传,接腾讯文档、会议、邮箱,可同时挂多个 Agent,短板是复杂长链路偶尔卡壳、Mac 端弱于 Windows。
② Agent 搭建平台(封装到"编排层") 模型和运行时给你,但流程要你自己用可视化拖拽编排。你不写代码,也能拼出专属 Bot 和工作流,代价是要理解节点、变量、插件怎么串。扣子 Coze(零代码可视化、已开源 Apache 2.0)、腾讯元器(绑微信生态)属这一层。适合现成产品满足不了、想按自己业务逻辑搭一套的人。
③ 企业级平台(封装到"组织层") 在执行能力之上,叠加了权限体系、私有化部署、合规适配。实在 Agent 靠屏幕语义理解操作界面,不依赖 API 就能接管没有接口的老系统,支持信创适配、等保三级;千问办公打通钉钉/飞书/企微、桌面云端协同;飞书 Aily 原生长在飞书里、权限跟用户体系走。适合要把老系统和跨部门流程自动化的团队。
④ 开源框架(几乎不封装,给你全部零件) 模型无关、工具可插、运行时自建,自由度最高,但要有工程能力自己搭环境、自己加固安全。这一层的代表是 OpenClaw(开源、本地优先、自托管、有社区维护的技能生态可复用)和 Dify(可视化编排 + 可私有化,较新版本带原生 Agent 沙箱、支持 MCP)。适合要完全自主可控、数据不出自己服务器的开发者。
⑤ 长文档/知识处理型是按场景切出来的一支:强在超长上下文与文档读写,如 Kimi Work(一次啃几十份 PDF、挂载本地文件夹读写、子任务并行)、天工 SkyClaw(百万级 token、偏平台层)。
封装越彻底越省心、自由度越低;越接近框架越自由、门槛越高。你的技术能力和控制欲落在哪,大致就决定了该看哪一层。
四、一套可复用的选型决策逻辑
把上面的判断串成一段决策伪代码,照着走基本不跑偏:
text
kotlin
def choose_office_agent(user):
if user.需要私有化 and user.有工程能力:
return "开源框架(Dify / OpenClaw):自建可控,代价是配环境"
if user.是企业 and user.要自动化老系统或跨部门流程:
return "企业级平台(实在 Agent / 千问办公 / 飞书 Aily)"
if user.想自己编排流程 and not user.会写代码:
return "搭建平台(扣子 Coze):零代码拖拽"
if user.主要啃长文档研报:
return "长文档型(Kimi Work):超长上下文"
# 最大众的一支:个人在自己电脑上直接干活
return "成品客户端(下载扫码即用):门槛最低,本地读写交成品"
注意几个反直觉的点:
- 不是越强越贵越适合你。 一个只想在自己电脑上合并表格、出周报的个人,上企业级平台纯属负担。
- 执行边界要亲测。 别信"支持自动化"这类词,拿一个你每天在重复的真实小任务(比如"把这几个 Excel 合并、算好总额、生成一页报告")去跑一遍,一测就知道它是"会说"还是"会做"。
- 数据敏感就把"本地/私有化"这一维的权重拉满。 财务、客户、合同类数据,优先选文件默认存本地或支持私有化的方案。
五、落地:怎么给自己接一个"会做"的 Agent
以门槛最低的成品客户端起步,技术步骤其实是"挑 + 接 + 授权 + 跑通":
1. 选一个底座。 个人从成品客户端起步最省事;要深度定制再往搭建平台、开源框架走。
2. 接上工具(MCP)。 把它要碰的东西挂上来。以"本地文件 + 飞书"为例,一份 MCP 配置大致长这样(通用示意):
json
perl
{
"mcpServers": {
"filesystem": {
"command": "npx",
"args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/you/work"]
},
"feishu": {
"command": "npx",
"args": ["-y", "some-feishu-mcp-server"],
"env": { "FEISHU_APP_ID": "***", "FEISHU_APP_SECRET": "***" }
}
}
}
接上后,它就多了"读写你指定文件夹"和"往飞书发消息/读文档"两只手。成品客户端通常把这一步做成了界面点选,不用你手写 JSON;但理解背后是这么回事,排查问题时心里有数。
3. 装上技能(Skill)。 按你的活挑现成技能装上(做 PPT、处理表格、写周报),绝大多数时候是"挑现成的",不用自己写。
4. 划好权限。 这一步最容易被忽略,却最重要。给个最小授权清单参考:
- 只授权它该碰的文件夹,别开整盘、别给系统盘;
- 删除、发送、转账、覆盖写这类不可逆动作,一律保留人工点确认;
- API Key、密钥走环境变量,别硬编码进配置;
- 涉密数据优先用文件本地不上云的方案。
5. 拿真实小任务跑通,再上定时。 先用"整理下载文件夹""按模板改个格式"这种每天在重复的小事验证稳定性,跑顺了再让它定时出周报、自动抓数据。
结语
办公 Agent 的选型,与其纠结谁家榜单第一,不如回到技术本身:先看它跑不跑那个执行循环(会说还是会做),再看它的能力封装在哪一层(匹配你的技术能力和控制欲),最后拿真实任务测稳定性、按最小权限授权。想清楚这几步,再对着自己的场景挑,比任何一份排行榜都靠谱。