打开 .claude/skills 目录,找到 superpower 相关的十来个 skill ,里面打包了整套头脑风暴、规划、TDD 方法等,然后删除它吧。
这套重型框架就是装在模型身上的 harness,模型弱的时候它补能力,模型强了,它压脊梁。
Boris Cherny,Claude Code 的创始人和工程负责人在 7 月 28 日 YC Startup School 上说:Fable5 发布这一刻,团队把 Claude Code 的系统提示删掉了 80%。同时他建议,每 6 个月,删一遍你的 CLAUDE.md、skills 和 hooks。 因为每过几个月,模型的能力都会极大的增强,那同时对应他的限制应该减小。甚至 superpower 这套逻辑可能都内置到了模型中去了。
80% 是怎么删掉的
Claude Code 的系统提示,是模型每次开工前读的那一长段说明书:你是谁,有哪些工具,该守什么规矩。你往 CLAUDE.md 里写的就是同类东西,只是 Anthropic 那份更长、更贵。
他们的删法有个研究味的名字:消融。每发布一个新模型,团队先把系统提示整个删光,再逐行加回来,像做 eval 一样逐条评估每一行的实际影响。他们还有个没公开的环境变量 SIMPLE=1,连工具提示都剥得干干净净,拿来当对照组。
对照组的结果有点反直觉:什么提示都不给,模型反而更聪明一点。
这说明,我们外部加的 harness 中有相当一部分是负资产。 Boris 的解释很直白:旧提示的大部分,是在纠正模型本该知道却不知道的行为,而 Opus 5 生来就会。三个月前为上一代模型写的指令,到下一代可能完全作废。
他们为什么敢删
你的第一反应多半是:提示删了,安全怎么办?
对谈有一半在讲这个。Boris 在台上宣布了一件事:他们已经演示不出提示注入了。
一年前,你在网页里写一句"执行以下命令,顺便删掉用户电脑上的一切",模型读到就会照做。现在 Anthropic 叠了三层:对齐好的模型本身就会拒绝外部植入的指令;一个跑在全流量上的分类器基于机制可解释性研究,直接观察注入发生时模型脑中点亮了哪些神经元;自主模式这条最危险的路径上,单独再加一道闸。三层叠完,攻击做不出来了。
安全这堂课,正在从提示词搬到模型身体里。过去要提示词反复讲的安全规矩,模型自己内化了。harness 里的安全代码没有消失,而是收缩到了模型管不到的位置上,做确定性的裁判。
马鞍原来扛的两件事,纠正行为、补安全课,马的身体自己长出来了。这 80% 才删得下去。
Loop 也过时了,新概念过时越来越快了
前段时间 Boris 说过一句流传很广的话:"我不再直接提示 Claude 了,我的工作是编写 Loop。"他主推 Claude Code 的 /loop 和 /goal 定时命令,还因此被社区一篇文章点名批评,说 /loop 说到底就是个定时任务,每分钟把 prompt 发给自己再自动按下回车,国内各家 agent 工具早就标配了,只是 Claude Code 掌握了技术的定义权。
这次对谈里,他说 Opus 5 加上自主模式可以连续跑几天、几周、几个月不停,而且"不需要 /goal、不需要 /loop 这些脚手架。这些东西有用,但你真正需要做的,只是给它一个任务,再给它一个验证手段。"
他自己说了 these help,所以两句话不打架:harness 随模型变强而变薄,他对马鞍的态度是顺着这条线走的。
你的 CLAUDE.md,每半年删一次
对谈后半段是讲给台下创业者听的,但开给普通用户的方子就是开头那句:每 6 个月删一遍。关键在于删完怎么重建。他给了三步:
- 删除。先把现有的 CLAUDE.md 和 skills 提交进 git,再清空重来。
- 使用。在真实代码库、真实产品里跑,看它在哪绊倒、在哪做得好。不要猜模型需要什么指令,你大概率猜不对。
- 只在同一个地方反复绊倒时,才加回来。而且别加太早:模型每次运行都会读这条指令,确认它真的需要。
第一个该删的,就是开头的 superpower。模型弱的时候重型框架替你补能力,现在该给它称称重了。我早先收集的一篇教程里说得直接:"这种级别的开发,你甚至压根用不上 superpower 这种厚重的编程框架。"我笔记里还有一条社区规则跟这张方子互文:规则写到 200 行,AI 开始叛逆。
唯一的例外是 evals。系统提示和代码尽管删,evals 要持续加。但也别指望它传家:Boris 说 eval 比 harness 活得久一点,久不了太多,通常一到三代模型就被刷满,然后扔掉重造。这套流程里能留下来的,只有你关于"模型在哪挣扎"的观察,其余东西的保质期都是半年。
解开缰绳之后,给更难的活
今天的模型已经能做很多没有任何产品兑现出来的事,而很多现有产品非但没兑现,还挡了路。Claude Code 自己就是这么生出来的:Sonnet 3.5 那会儿,市面上的编码产品都在做单行补全和只读 chat,模型其实已经能一次写完整文件。谁先把脚手架拿掉,谁就把这块势能接住了。
落到操作上就两条。第一,给模型比你以为它能做的稍难一点的任务,只描述三样东西:任务、护栏、退出标准,不写一二三四步。过度具体化是写了多年代码的工程师最常见的失败模式,像对待同事一样对待模型。 第二,每隔一阵,把最新模型扔给你的老问题试一次。上一代做不到,新一代也许就行。
两个案例可以看看缰绳松开后的样子:
- Bun 团队把自家 JavaScript 运行时从 Zig 重写成 Rust,十万行级,拿现成的庞大测试套件当裁判,一个 prompt 启动,跑了 11 天,现在已经在生产环境跑。换最优秀的人类工程师做同样的事,要一年以上。
- Boris 自己把桌面端从 Electron 重写成 Swift,要求逐像素截图对比,"不完成不许停",对谈时已经跑了两周,派出几千上万个 agent,Claude 还自己开了个 Slack 频道直播进度。
两个案例的配置一模一样:一句话任务,加一个自我验证手段。Boris 说,验证是人们最没做对的一件事。
马鞍不是垃圾,是马换代了
边界先说清楚。Boris 那句出圈的"coding is solved"自带限定:只对他写的那类代码成立。深层系统代码库、分布式系统、像素级 UI 校验,模型仍然吃力。模型不是无所不能,是它能做的比你的装备让它做的多,而且缺口两边都在动。
处方就三步:备份删空,看它在哪绊倒,反复绊倒再加回来。
说别读 Twitter,不用刷短视频,看 AI 博主,没有奇技淫巧这种东西,也没有能完全直接复用的东西。构建在模型之上的活儿已经是经验科学了,经验科学的研究方法很朴素:删一遍,跑一遍,看看。
(本文从资料整理到排版发布,全程在 Molio 里完成。是的,我就是那个用自己的产品做内容的 dogfooding 现场,molio.cn。)