
译注:作者 David Ondrej 是 AI 效率工具领域的独立创作者,YouTube 频道 @DavidOndrej 的主理人,AI 生产力产品 Vectal 背后的 Vectal Labs 创始人。这是他 2026 年 8 月底发布的「装备清单」:过去 3 年用 AI 写代码超过 2000 小时、访谈过圈内一批最高产的 Agentic Engineer 之后,把当时正在用的整套东西一次交底。文中提到的模型、价格、产品都是 2026 年第三季度的时点信息,两个月后可能就换天,但「怎么选、怎么组合、哪些钱不该花」的判断框架,比任何单一工具都活得久。以下为全文精译,保留原文小节结构。
过去 3 年,我用 AI 写代码的时间远超 2000 小时,还亲自访谈了 Agentic Engineering 领域一批产出最高的从业者。
下面是我截至 2026 年第三季度的全套装备。
如果你只想先抓主线,可以先看下面这张总览图。

图中从人出发,把交互界面、模型订阅、云端环境、Agent harness、可复用 skills 和隔离 worktree 串成了一套工作系统;后文会逐一拆开说明它们各自解决的问题。
一、交互界面
先说界面,也就是你跟 Agent 打交道的 UI / CLI。我的主界面是 bb。
它开源、完全免费,而且让你在同一个 GUI 里用任何订阅、任何 Agent、任何模型。Codex、Claude Code、Pi、Cursor CLI、OpenCode、Grok Build、Hermes,全在同一个界面里。
Codex 或 Cursor 这类 App 的问题在于:只让你用它们自家的模型、自家的订阅。而我们的目标是:花最少的钱,拿到最多的 token。
你喜欢 Codex / Cursor App 里的那些功能,bb 里都有,而且它每周都在迭代(另外,它完全开源、100% 免费)。
另一个我高频使用的是 cmux。
启动一个新的 cmux 工作区后,你可以像用 tmux 那样切分屏幕(名字就是这么来的),每个窗格里跑不同的终端,还内置一个浏览器。
cmux 的短板出现在 Agent 和工作区多起来之后:左侧边栏这个交互原语撑不住。同时开两三件事没问题,但真要规模化地做 Agentic Engineering,它就不是最优解了。
终端我用 Ghostty,因为它非常快,而且是原生应用。
在 Ghostty 里可以跑 Herdr,基本可以理解为「Agent 版的 tmux」,一个 Agent 的后端运行时。极简、极轻量,就活在终端里;Agent 跑完之后,状态会显示在左侧:done(完成)、idle(空闲)、blocked(阻塞)、running(运行中)。
追踪 Agent 的状态至关重要。 我的预测是,3 到 6 个月内,「Agent 状态追踪」会变得越来越重要,因为你面对的将不再是单个 Agent,而是一个管理着一堆 Worker Agent 的 Manager Agent。
最后要提的界面是 Corral,我自己开发的东西。
在 Herdr 里,Agent 谁跑完就切谁,其实没有真正的顺序;Corral 的做法是:每个 Agent 都有优先级,就像任务有不同的重要性等级。P1 的 Agent 跑完了,它就顶到最上面。P1 刚跑完的时候,你绝不该去响应一个 P4。(对......我确实该把 Corral 开源了,一直没腾出手。)
二、模型与订阅
花最少的钱,拿最多的 token。这应该是每个 Agentic Engineer 的主要目标之一,仅次于「把事儿干成」。
目前主流订阅就 4 家。而且没错......两个月之后,这份名单可能就完全变样了。
现在性价比最香的是 OpenCode Go。只要 10 美元,就能用上 Kimi K3、Grok 4.6、GLM 5.3、DeepSeek V4 Pro 等一大堆模型......但它没有最强的那批模型,比如 Fable 5 和 GPT-5.6 Sol(而且用量额度偏小)。
所以,如果预算稍微宽一点,按这个路线走:
- 30 美元:OpenCode Go + ChatGPT Plus(20 美元);
- 50 美元:再叠加 20 美元的 Claude Code 订阅;
- 70 美元:再加 Cursor 的 20 美元月付,四家订阅的入门档就配齐了;
- 110 美元:OpenCode 加一档 100 美元级的大计划。ChatGPT 的 100 美元档会比 Claude 划算,事实就是这样,没什么好说的:OpenAI 家算力更多,也更舍得补贴;
- 210 美元:两家 100 美元档,直接都拿下;
- 真要玩票大的(比如我),把三家 200 美元档全开(Codex、Claude、Cursor),这些档位是 20 倍用量,单位 token 价格全场最优。
顺带一提......Cursor 的订阅被严重低估了。被 SpaceX 收购之后,Cursor(或者说 Grok)会变成一个超值的订阅。SpaceXAI 手里算力管够,玩得起补贴游戏。而且(如果我记的没错)Cursor/Grok 套餐给 Cursor 和 Grok Bot 分开算额度,这一点简直离谱(好的那种离谱)。
Grok Bot 正在快速成为人们与 Agent 交互的新入口,所以现在比以往任何时候都更值得持有 Cursor 订阅(不是恰饭哈,纯粹实话)。另外,新模型 Grok 4.7 已经在路上了。
无论怎样,千万不要按 API 价格付费。那是全场最差的 deal。直接买订阅。
三、云端 Agent
云端 Agent 是未来,这一点相当明显。Cursor、Amp、Devin、Codex......这些公司全都在云端 Agent 上押了重注。
证明「云端 Agent 是未来」的,是下面这张图。
译注:原文此处有一张图,Cursor 云端 Agent 产生的已合并 PR 占比走势,从年初的 10%-15% 升至接近 60%。原文图片未随文存档。
这是 Cursor 的内部数据:云端 Agent 产生的已合并 PR 占比,今年年初大约 10%-15%,如今已逼近 60%。注意,这还只是「已合并」的 PR,也就是真正被用上的那部分。要不了多久,这个数字会变成 70%,然后 80%,然后 90%。
把所有 Agent 都跑在本地机器上的问题是:不可扩展。你没法同时跑几百个 Agent。只要有两个 Agent 同时决定跑你的完整测试套件,你的电脑就开始发出怪声(连我那台 7000 美元的 MacBook Pro 都扛不住)。
云端 Agent 给你的是:隔离的环境、持久的会话、不断电不断网。本地方案呢?合上笔记本,会话就没了;断网几分钟,harness 就没法自恢复。
但现有云端 Agent 方案的问题,是疯狂级别的生态锁定。环境配置、密钥录入要花掉大量时间,然后你就被锁死了:会话在它那儿,价格它说了算,数据也全交给它。就算他们不用你的数据训练模型,利用数据的方式还有千百种。
解法:拥有你自己的服务器。而托 AI 的福,这套东西现在 10 分钟就能搭好(认真的)。买一台 VPS,在上面跑 Herdr,然后 SSH 连上去。
Herdr 给你持久的 Agent 会话,SSH 让你从手机、笔记本、任何设备连上去。花几美元,就拿到云端 Agent 的 80/20(用 20% 的成本换 80% 的核心价值),而且没有锁定。
如果你只想先抓住这段的主线,可以先看下面这张图。

图里的意思其实很简单:本地机器很适合开始,但并行 Agent 一多就会争抢资源;把会话和隔离环境放到自己掌控的 VPS,再通过 SSH 从不同设备接入,才有了可扩展、可恢复的工作底座。
四、搭一套自己的云端环境
我的 VPS 用的 Hostinger,KVM2 套餐就够了。我最想强调的一点是:你完全不需要是 VPS、DevOps 或 Linux 方面的专家。
用大白话跟你的 Agent 说就完了!!!
在即将发布的视频里,我全程直播了整个搭建过程:一个 cmux 工作区,左窗格是编码 Agent(跑 Grok 4.6 的 Cursor CLI),右窗格是一个空终端。
我的 cmux skill 能让 Agent 找到另一个窗格,并在里面执行命令。我自己 SSH 连上新买的 VPS,然后对 Agent 说:「把这台服务器里里外外摸清楚,然后把开发环境搭好:Herdr、Node.js、Python 3、Git。」
它几秒钟就完成了对 VPS 的分析,装好了所有东西,启动了 Herdr,接着装了 Pi Agent,在我 MacBook 上找到了一个 OpenRouter key,然后自己跑完了整套配置。几条简短的 prompt 之后,我有一个跑着 GPT-5.6 Sol 的 Pi 会话,和另一个跑着 Fable 的会话,都在云端、都在我自己的 VPS 上、都拿着完整 root 权限。
我的电脑或 Wi-Fi 就算出事......就算我的 MacBook 当场炸了,这些 Agent 照跑不误。完整走读在视频里(YouTube 频道 @DavidOndrej)。
再说一个提速的事......我平时用 SuperWhisper 做语音输入。正在读这篇文章的你,打字速度多半在每分钟 40-50 词。这很慢。
但是!你说话的速度能到 250+ WPM。一款语音 AI 工具(SuperWhisper、Glaido、Whispr Flow 之类)能让你发 prompt 的速度直接快 3-4 倍。用一个。别犯傻。
五、Harness
第一个必须提的 harness 是 Pi Agent,我心目中的 GOAT。
市面上最极简的 harness:只有 4 个工具、永远跑在 YOLO 模式、支持任何模型、任何提供商。非常优雅、可配置性极强,这就是为什么这么多人在 Pi 之上做二次开发。开源、完全免费,去 pi.dev 就能拿到。没得商量。它是我装到 VPS 上的第一个 harness。
Cursor CLI。 被严重低估,因为它什么模型都能用:Grok、GPT 系列、Anthropic 系列、Kimi。你可以给 skill 打标签,还可以预发送消息。整体非常优秀的 harness。
下一类 harness,我称之为「自我改进型」(self-improving)harness。
最有名的两个是 Hermes Agent 和 Prime Agent。适合你「还不知道自己在干什么」的场景。如果任务不确定性很高、需要大量摸索,就用自我改进型 harness:它会自己创建 skill,并随着你的使用不断变强。
最后是经典款:Claude Code 和 Codex。我给它们做了别名(alias)。很多人每天都要手敲 claude --dangerously-skip-permissions,极慢、极没效率。我敲 cc,直接以跳过权限模式启动 Claude Code;敲 cx,以 YOLO 模式启动 Codex。
你必须为高频长命令创建全局别名。 这是 Agentic Engineering 的定律之一:如何在同样的时间里,干成更多的事?
六、Skills
我的 skills 仓库上个月火了(github.com/davidondrej/skills)。同样完全免费、开源,等等等等。
跟 Agentic Engineering 最相关的几个 skill:
(1)/total-review
它会调用另外两个 skill:/gpt-review 和 /fable-review,分别用 GPT-5.6 Sol 和 Fable 5 审查你刚做完的代码改动,然后把两份清单去重,合并成一张「真正重要的问题」清单。就像把你最聪明的朋友全请来帮你改简历,而且他们只挑最致命的问题说。在中大型改动上跑它,尤其是当改动出自另一个模型之手:Grok 4.6 干的活,你就该换一个完全不同的模型来审。
重点:任何你重复得足够多的操作,都应该沉淀成预设(preset)。
如果是单步操作,用文本替换。我把它们做成 Raycast snippets:「用平实的英文简短回答」「把上一条回答改得更简单、更短」「暂存所有文件、写一条清晰的 commit、推送到 GitHub」。
如果是多步工作流,做成 skill。
(2)/ask-then-build
这个 skill 我每天都在用,任何「开建」之前先用它。与其说「让这个支持 Windows」,然后任由模型悄悄做出让你日后后悔的架构决策,它会把关键决策一个个摆到你面前,附上选项,逐条让你拍板。AI 模型擅长写代码、擅长实现,但它们没有品味,也没有过硬的判断力。这两样,得由你,人类,来把关。
(3)/deepapi
任何深度研究、任何抓取、任何跟 Web 沾边的活,我都用这个 skill。Codex 和 Claude Code 自带的只是基础款搜索:不能抓取、不能深研,还动不动被拦。「跑 8 个快速搜索,给我前 3 个选项」「抓 Twitter」「抓 GitHub」「找出联系某个人的 3 条路径」。我团队里人人都在用。必备。
(4)护栏与推送锁
这一条更无聊,但绝对关键,而且只需配置一次。全局 Agent 护栏(guardrails)是一个 pre-tool-call 钩子,确保你的 Agent 永远不会抹盘、永远不改写 Git 历史、永远不碰你的密码管理器。而推送锁(push lock),是给同时跑 15+ 个 Agent 的场景准备的:一把操作系统级的内核锁,罩住整条流水线,合并、验证、推送、CI、部署、健康检查,串行进行。
别把我的 skills 全装上。按需取用就好。
如果你更关心整套装备如何实际协作,可以先看下面这张工作闭环图。

先记住这个结构,再看细节:人负责关键判断,Agent 在隔离工作区中执行;review 和护栏把关后再交付,结果再反馈给下一轮决策。Skills 的价值,就是让这个闭环中反复出现的动作变得稳定、可复用。
七、Worktree
worktree(工作树)基本就是:把你的主 checkout 复制到一个单独的文件夹,并在那里创建一条新的 Git 分支,让多个 Agent 完全隔离地并行干活。
小项目?纯属杀鸡用牛刀。待在单分支上,干活更快。
中大型项目、随时挂着 20-30 个以上 Agent?躲不掉,必须上 worktree。不然 Agent 会互相冲突、互相回滚对方的改动、互相打架。bb 的另一个好处:内置 worktree,而且它记得在我那些大仓库上,我总是要基于 origin/main 开一个新的 worktree。
如果你更习惯按项目规模做判断,这张图会更直观。

不要一上来就搭一套复杂的多 Agent 系统:小项目保持轻量;出现并行、持久会话或复用需求时,再增加云端环境、Skills 与 worktree;只有复杂度真的上来,才需要 Manager Agent、Worker 和更严格的交付闸门。
八、其他实战心得
知道每个模型什么时候用。
- 做规划、起新项目?Fable,它的「天才灵光」最多。修一个深不见底的严重 bug?GPT-5.6 Sol,推理力度开到最大。日常对话?Grok 4.6 开 high 就够了:智能水平几乎一样,但便宜一半、快一倍。前端?Kimi K3。
- 另外,每当一个重量级新模型发布,专门留出一天,只用那一个模型。别听 Twitter 上吵什么,自己上手试。
知道什么时候该 review。
- 我不会对每次改动都跑 total review。一个小的前端微调,直接上线。
- 还有,永远不要做「递归式 review」。你让模型「找出 5 个最大的问题」,哪怕代码库完美无缺,它也会给你找出 5 个问题来。这些模型会凭空发明 bug。
预发送(Pre-sending)。
- 通常我已经知道 Agent 下一步会干什么,所以提前把消息排进队列:「实现这个计划」「对这个跑一次 Fable review」「现在把这些问题修掉」。
- 有时是 2 条,有时是 6 条。
- 永远不要用不支持预发送的 harness。
子 Agent 被滥用了。
- 很多人只是拿子 Agent 烧额度。我只在自己掌控全局时用:我要亲手指定跑在子 Agent 里的是哪个模型,因为我清楚自己手上有哪些订阅、哪些额度。
- 未来是 Manager Agent 派发 Worker,但你仍然要亲手设计这套系统:规则、权限、什么条件下启动子 Agent。我不想让 Anthropic 或 OpenAI 的某个工程师替我拍这个板。
ADR(架构决策记录)。
- 这是把「决策」写进代码库的方法。/docs/adr 是我在任何项目里最先创建的文件夹之一。
- 每个核心架构决策都有一个小文件:定了什么、为什么、当时项目处于什么状态。有些东西能从代码里读出来,但不是全部。
- 读不出来的那些,就该写下来,让未来的 Agent 和人类立刻明白「为什么当时这么建」。
测试。
- 现在的模型会疯狂给你的仓库灌测试:单元测试、集成测试、数据库测试,哪怕是最小的、毫无必要的小仓库也不放过。
- 你让它加测试,它加到失控;你说「别加测试」,它还是会加一点,而最终落到的数量刚刚好。
生产数据库访问。
- 任何有真实使用量的产品都该这么做:建一个只读的 Postgres role,把这个给你的 Agent。
- 别给写权限。只要出现一次不可逆的改动,你就有的悔了。
- 但完全不给访问也是错的。有只读权限,你就能给每个功能做「现实校验」:这功能在生产环境里真的会发生吗?真有人用吗?真希望我早点这么干。
追踪你的 Agentic 生产力。
- 我们刚在 Vectal Labs 下开源了一个新仓库:agentic-productivity。它追踪你的 commit、你的 Agent 会话、你的 prompt。
- 单独看,每一项都是坏指标。但把三者结合起来、看长期趋势,你就能看出:你是不是真的在成为一个更好的 Agentic Engineer。
以上就是我当前的整套装备。一个月后,它多半又是另一副样子,这套东西一直在变。
文 / David Ondrej(先为 YouTube 口述,后整理成文章)