刚开始使用 Superpowers 时,我觉得自己找到了 AI 编程的正确答案。
它要求模型先澄清需求,再设计方案;设计通过后编写实施计划,然后用 TDD 开发、调用子代理、执行代码审查,最后验证结果。
这套流程非常专业,而且确实有效。
尤其当你使用的是规划能力、工具调用能力或长任务稳定性不够强的模型时,Superpowers 能够显著改善结果。它就像一套工程护栏,约束模型不要凭感觉写代码,也不要在没有验证的情况下宣布任务完成。
但换到 GPT-5.6,尤其是 gpt-5.6-sol 后,我逐渐发现了一个奇怪的现象:
安装了 Superpowers 的 GPT-5.6,有时反而没有"裸奔"的 GPT-5.6 聪明。
它不是不会写代码,而是越来越不愿意直接解决问题。
你让它改一行配置,它想先写设计文档;让它修一个原因明确的 bug,它要先讨论成功标准;让它执行一个已经非常清楚的任务,它仍然不断向你确认。
于是,我关闭了全局启用的 Superpowers,转向一个简单得近乎寒酸的技能:Grill Me。
结果反而更好。
Superpowers 解决的是什么问题?
Superpowers 本质上不是一个单独的技能,而是一整套面向 AI 编程的软件开发方法论。
它主要解决模型常见的几个问题:
- 没理解需求就开始写代码
- 遇到复杂任务时缺乏规划
- 写到一半忘记最初目标
- 不写测试,也不验证结果
- 修改范围不断失控
- 自信地宣布一个并未完成的任务已经完成
因此,Superpowers 给模型规定了一套严格流程:
先头脑风暴,再输出设计;
设计确认后,编写实施计划;
按计划开发,执行测试驱动;
每个阶段都进行检查、审查和验证。
对于能力还不够强的模型,这套方法非常有价值。
它们可能不能稳定判断什么时候应该澄清、什么时候应该探索代码库,也不一定能自己维持一个持续数十步的开发计划。Superpowers 把这些原本依赖模型判断的事情,转化成了一套明确的操作程序。
换句话说:
当模型缺乏工程判断时,Superpowers 用工程流程替它做判断。
这不是缺点,恰恰是它最重要的价值。
为什么到了 GPT-5.6,情况发生了变化?
GPT-5.6 Sol 本身已经具备很强的代理能力。
它能够主动检查代码库、理解项目结构、拆解复杂任务、调用工具、验证结果,并根据任务风险决定下一步行动。
这时再叠加一套全局强制流程,新增价值就开始下降,副作用却会逐渐增加。
Superpowers 中包含不少严格规则,例如:
- 只要技能有一点可能适用,就必须调用
- 所有创意工作都必须先完成设计
- 即使任务非常简单,也不能跳过设计阶段
- 用户没有批准设计之前,禁止开始实施
- 设计完成后还要写文档、提交并再次等待确认
能力较弱的模型需要这些规则来避免失控。
但 GPT-5.6 的问题恰恰相反:它的指令遵循能力很强,所以会认真执行每一道流程。结果就是,它把大量注意力放在"是否遵守了工作流"上,而不是"怎样最有效地完成任务"。
这就像带领两名不同经验的工程师。
对于新人,你可能需要提供详细的开发规范、检查清单和审批流程;对于经验丰富的工程师,你只需要说明目标、约束和验收标准。如果还要求他修改一个按钮颜色也必须提交完整设计方案,流程就会开始拖累效率。
不同能力的模型,需要不同程度的约束
Superpowers 和 Grill Me 不是简单的替代关系。
它们更适合不同能力水平的模型。
对于能力一般的模型,Superpowers 可以提供:
- 稳定的任务分解方法
- 明确的阶段目标
- 强制的用户确认节点
- 测试驱动开发约束
- 防止范围失控的检查机制
- 完成前必须验证的质量底线
这些流程能够降低模型遗漏需求、跳过测试或盲目实现的概率。
而对于 GPT-5.6 Sol 这样的强模型,更合适的方式通常是:
- 给出清晰目标
- 提供必要上下文
- 说明关键约束
- 定义授权和审批边界
- 设置明确的完成标准
- 只在需要时调用专项技能
弱一些的模型需要别人告诉它"每一步怎么走"。
强模型更需要知道"要去哪里、什么不能做、怎样才算完成"。
为什么提示词越多,模型可能越笨?
很多人认为,给 AI 更多规则,它就会表现得更专业。
实际情况并非如此。
每增加一条指令,模型就多了一个需要同时满足的目标。规则之间可能重复、竞争,甚至互相冲突。
模型原本只需要考虑:
怎样正确完成这个任务?
加入复杂工作流后,它还要考虑:
是否应该先调用另一个技能?
是否已经完成需求澄清?
是否可以进入实施阶段?
是否需要创建设计文档?
是否必须等待用户确认?
是否违反了某项工作流规则?
对于能力较弱的模型,这些问题提供了必要的行为框架。
对于已经能够自主做出这些判断的模型,它们却可能成为额外负担。
OpenAI 当前的 GPT-5.6 提示指南也建议:
- 使用更精简的提示词
- 每条规则只陈述一次
- 只提供当前任务需要的工具
- 删除重复的说明和示例
在一组内部编码代理评测中,精简系统提示词曾让模型得分提高约 10%--15%,同时减少 41%--66% 的 token 消耗。具体结果会因任务而异,但它说明了一个重要趋势:
模型能力越强,提示词越应该关注目标和边界,而不是重复规定过程。
Grill Me 为什么更适合 GPT-5.6?
Grill Me 没有试图接管完整的软件开发过程。
它只做一件事:
在你需要时,狠狠拷问你的方案。
它会围绕一个计划逐项追问:
- 你真正要解决的问题是什么?
- 为什么选择这个方案?
- 有哪些没有验证的假设?
- 最坏情况下会发生什么?
- 哪些边界条件还没有考虑?
- 有没有更简单的替代方案?
- 怎样判断最终结果是否成功?
它一次只问一个问题,并为每个问题提供推荐答案。能够从代码库或环境中查到的事实,它会主动查找;真正涉及取舍的决策,才交给用户。
更重要的是,Grill Me 通常由用户主动触发。
你可以在真正需要它时说:
我要重构权限系统。先不要写代码,grill me。
讨论清楚后,Grill Me 的任务就结束了。接下来,GPT-5.6 可以恢复自己的原生工作方式,完成设计、实施和验证。
Grill Me 没有试图替代模型的判断能力。
它只是临时把模型的审查能力放大。
我的选择不是"Superpowers 没用了"
关闭 Superpowers,不代表它已经过时,更不代表设计、测试和代码审查不重要。
真正需要改变的是使用方式。
如果模型经常出现以下问题,Superpowers 仍然非常适合:
- 接到需求便立刻写代码
- 不能稳定完成多阶段任务
- 容易偏离原始目标
- 经常忘记运行测试
- 修改范围不断扩大
- 缺少设计和验证意识
- 工具调用不稳定
- 需要明确流程才能保持一致性
但如果使用 GPT-5.6 Sol,并且它已经能够稳定地规划、执行和验证任务,那么更适合采用轻量、按需的技能组合:
- 简单明确的修改,直接实施并验证
- 需求模糊时,使用 Grill Me
- 复杂功能开始前,调用 brainstorming
- 疑难故障出现时,调用 systematic debugging
- 高风险改动才要求完整设计和审批
- 是否采用 TDD,根据项目和任务决定
这不是抛弃工程纪律,而是让流程与任务风险、模型能力相匹配。
最后的结论
Superpowers 最适合解决的是:
模型能力不够稳定,怎样用流程约束它?
Grill Me 更适合解决的是:
模型已经很强,怎样让它在关键决策上挑战我?
对于能力一般的模型,Superpowers 是一套非常有价值的工程护栏。它能够弥补模型在规划、测试、验证和长期任务执行上的不足。
对于 GPT-5.6 Sol,继续全局强制执行同样的流程,却可能限制它根据实际情况调整策略的能力。此时,像 Grill Me 这样轻量、单一、按需触发的技能,往往更加合适。
能力不足的模型,需要 Superpowers 告诉它每一步怎么走。
能力足够强的模型,只需要 Grill Me 在关键路口问一句:你真的想清楚了吗?