如果你最近在 Reddit 的 AI coding 社区里逛过,大概率见过 oh-my-pi 这个名字反复被提起。它不是凭空出现的新物种,而是站在另一个爆款项目 Pi 的肩膀上长出来的分支。要讲清楚 oh-my-pi,得先从 Pi 说起,再看 oh-my-pi 在这个基础上加了什么料,最后拉出来和 Claude Code、Codex、OpenCode 这些主流编程智能体比一比,看看它到底强在哪、又牺牲了什么。
极简主义的起点,Pi 的设计哲学
Pi 是由 libGDX 作者 Mario Zechner 打造的开源终端编程智能体,核心理念简单到近乎倔强,如果我不需要,就不会被造出来。默认状态下,Pi 只给模型四个工具,读文件、写文件、编辑、执行命令,系统提示词压缩到不足一千个 token,没有内置的子智能体、没有计划模式、没有 MCP、也没有权限弹窗。
这种克制不是偷懒,而是刻意留白。Pi 把所有可能臃肿的功能都做成了可插拔的扩展、技能包和提示词模板,你可以让 Pi 自己写代码来扩展自己,改完直接 /reload 热加载,不用重启会话。它支持 15 个以上的模型供应商,覆盖 Anthropic、OpenAI、DeepSeek、Google、xAI 等几乎所有主流选择,会话历史是树状结构,可以随时回溯到任意分支继续对话,还能一键导出成 HTML 或分享成 GitHub Gist。
这套哲学吸引了大量希望自己掌控工具的资深工程师。有博主形容是 Claude Code 帮你把该学的规则都学一遍,而 Pi 让你自己去定义规则。这条评论虽然带着明显的个人立场,但确实点出了两类产品的分野,一个追求开箱即用的普适性,一个追求可深度定制的专业性。
oh-my-pi 加了什么料,把编辑器功能焊进了终端
oh-my-pi(官网简称 omp )是 can1357 在 Pi 基础上做的一个功能全开版本,README 里的自我定位是把 IDE 焊进了编程智能体。它不再满足于四个基础工具,而是把一整套开发环境的能力塞进了终端会话里。
硬核的底层架构
整个项目用 Rust 重写了核心,官方数据显示核心代码量达到约八万行,配合 TypeScript 和 Bun 搭建外围生态,官网还特别强调原生支持 Windows,不需要 WSL,这对很多 Windows 阵营的开发者算是个小惊喜。截至目前项目在 GitHub 上已经积累了三万多颗星标、三千多个 Fork,社区活跃度相当可观。
工具箱变成了真正的开发环境
具体拆开来看,oh-my-pi 内置了 31 个工具、支持 60 多个模型供应商、14 种 LSP(语言服务器协议)操作和 28 种 DAP(调试适配器协议)操作。这意味着它不只是能读写代码,还能像 VS Code 一样理解代码的语义结构,做跳转定义、查找引用,甚至直接挂上调试器单步执行------这些原本只有图形化 IDE 才具备的能力,现在被塞进了一个终端命令里。
Model Roles,让不同模型各司其职
oh-my-pi 一个非常实用的设计是模型角色机制。你不用给整个会话绑死一个模型,而是给不同类型的任务分配不同角色,配置文件里写明白就行:
| 角色 | 作用 |
|---|---|
default |
日常主力模型,处理大部分实际工作 |
plan |
任务需要先规划时启用 |
slow |
遇到最难问题时调用的重型模型 |
task |
子智能体,用于并行委派任务 |
smol / tiny |
轻量任务,比如生成标题、提交信息 |
vision |
图像分析 |
designer |
UI 与设计相关工作 |
advisor |
第二个模型在旁监督每一轮输出,发现问题可以打断 |
有位使用者分享了自己的真实配置,日常用 DeepSeek v4 Flash 处理大部分工作,Grok 4.5 专门负责需要看图和做规划的任务,还配了个 Nemotron 3 Ultra 当备胎,一旦触发限流就自动切换,整条链路几乎不需要人工介入。每个角色还能单独设置思考强度,从 minimal 到 max 六个档位,相当于给每种任务量身定做算力预算。
Advisor 看门狗,给主模型配个监工
Advisor 角色值得单独说一句,它本质上是让第二个模型全程旁听主模型的每一轮操作,一旦发现苗头不对可以直接插话打断。这个功能默认是可以关闭的,很多人在熟悉了主力模型的脾气之后会选择关掉,需要时再打开当作双人复核机制。
长期记忆与其他细节能力
除此之外,oh-my-pi 还带有后见记忆 系统,用 retain 在运行过程中随手记下事实,用 learn 沉淀可复用的经验教训,再用 recall 把这些记忆调回来用,让智能体在跨会话之间也能记住你的代码库习惯。加上哈希行编辑 和时间旅行规则 这些设计,官网把它形容为每一个工具都经过真实会话反复打磨。

社区怎么看,评价两极却真实
用户反馈这块得实话实说,oh-my-pi 目前处于技术圈内小圈子热议、大众认知度还没跟上 的阶段。Reddit 上有用户直接发帖问有没有人用过 oh-my-pi,理由是主页上列的功能看起来很诱人,但翻遍网络几乎找不到讨论帖,连一个 YouTube 视频都没有。这条帖子本身就说明了问题,产品力可能到位了,但社区教育和内容生态还没跟上节奏。
真正深度使用过的博主给出了更细致的反馈。deepakness.com 的作者原本是 Pi 的老用户,转投 oh-my-pi 之后最满意的一点是多模型协作而不是相互竞争 ,他把 DeepSeek 用作日常主力、Grok 4.5 专门处理视觉和规划任务,靠角色配置实现了自动分工,不用再手动切换模型。他还提到自己把 Advisor 功能用在了刚上手的阶段,让强模型监督弱模型,等熟悉之后才关掉,转而全程用 yolo 模式------所有命令和编辑自动批准,不弹权限确认框。这种先谨慎后放权的使用路径,其实很能代表一批资深开发者对这类工具的信任建立过程。
至于母项目 Pi 本身,社区评价则更加两极。支持者的声音相当激烈,有人直接把它称为唯一真正配得上叫 Claude Code 竞品的开源工具,理由是它已经积累了 11.5 万以上的星标,月度 npm 下载量超过三百万次,还是 OpenClaw 项目底层依赖的智能体框架。批评的声音则更冷静务实,有开发者做了一场相当硬核的对照实验,同一个模型(DeepSeek V4 Flash)分别跑在 Pi、Claude Code、Codex、OpenCode 四套外壳上,30 个真实任务,900 秒超时限制,结果 Pi 用最少的工具和最短的系统提示词拿到了最高的成功率和最低的成本。这份数据后面还会详细展开。
拉出来横向比一比,oh-my-pi 到底强在哪
要客观评价 oh-my-pi,绕不开跟主流选手放在同一张桌子上比较。下面这份对比综合了实测数据和产品设计定位。
硬核数据说话,同模型不同外壳的成本差异
有工程师专门做了一次控制变量实验,固定模型不变,只换外壳,跑了 14 天真实工作加 30 个标准化任务,结果如下:
| 外壳 | 通过率 | 中位耗时 | 平均 token/任务 | 单次成功成本 |
|---|---|---|---|---|
| Pi | 20/30 | 132.2 秒 | 558,885 | $0.028 |
| Claude Code | 16/30 | 122.7 秒 | 741,659 | $0.195 |
| Codex | 16/30 | 245.0 秒 | 664,772 | $0.081 |
| OpenCode | 14/30 | 129.7 秒 | 692,195 | $0.073 |
这个结果颠覆了不少人的直觉------Pi 系工具只给模型四个基础工具、系统提示词不到一千 token,结果反而赢了 Claude Code 那套约三万三千 token 的复杂提示词加工具模式。作者还引用了 Databricks 在自己数百万行代码库上跑 Opus 4.8 的内部数据作为佐证,同样的模型,Claude Code 每个任务耗费 74.2 万 token,Pi 只用了 23.7 万 token,成功率却持平。这背后的道理其实不复杂,工具和提示词越精简,模型每一步决策要处理的上下文噪音就越少,反而更容易命中正确路径。
不过这份实验也如实指出了代价,Codex 是唯一自带内核级沙箱隔离的工具(macOS 上用 Seatbelt,Linux 上用 bubblewrap 加 seccomp,默认断网),所以作者只敢让它接触来源不明的克隆仓库,但相应地也慢了将近一倍。Pi 系工具默认零护栏,从第一条消息开始就有完整系统权限,用作者的原话是不用 Docker 隔离就是在祈祷。oh-my-pi 继承了这套设计取向,性能和成本优势的背后,是安全边界主动让位给了灵活性。
定位差异,四个维度的取舍
如果把编程智能体的能力拆成上下文、模型、提示词、工具这四个维度来看,各家的取舍方向其实很清晰:
Claude Code 的强项在于默认值就很聪明,权限护栏合理,适合团队协作和对安全边界有要求的场景,代价是定制自由度低,一切都是 Anthropic 帮你设计好的。Codex 的强项是真正的沙箱隔离,适合处理来源不可信的代码,代价是速度慢。OpenCode 走的是开源折中路线,兼顾了一部分可定制性和易用性。Pi 和 oh-my-pi 站在对立的一端,把控制权彻底交还给使用者,用极简核心加插件生态实现深度定制,而 oh-my-pi 在这条路径上又往前走了一步,直接把 LSP、DAP、多模型角色分工、长期记忆这些原本要靠社区插件拼凑的能力,做成了内置功能。
一句话总结各自的适用场景
综合以上信息,可以给出一个相对务实的选型建议。如果你是团队协作、需要开箱即用、不想折腾配置,Claude Code 依然是最稳的起点。如果你要处理来源存疑的代码、极度看重安全边界,Codex 的沙箱是不可替代的。如果你是愿意花时间打磨自己工具链的资深工程师,想要多模型协同、IDE 级语义理解、又不想为臃肿的默认功能买单,oh-my-pi 目前看是这条路径上功能最全的选择,只是社区文档和讨论氛围还处在早期,遇到问题可能得靠自己啃源码或者去官方 Discord 蹲答案。