GPT-5.6时代-从Superpowers转向Grill-Me

刚开始使用 Superpowers 时,我觉得自己找到了 AI 编程的正确答案。

它要求模型先澄清需求,再设计方案;设计通过后编写实施计划,然后用 TDD 开发、调用子代理、执行代码审查,最后验证结果。

这套流程非常专业,而且确实有效。

尤其当你使用的是规划能力、工具调用能力或长任务稳定性不够强的模型时,Superpowers 能够显著改善结果。它就像一套工程护栏,约束模型不要凭感觉写代码,也不要在没有验证的情况下宣布任务完成。

但换到 GPT-5.6,尤其是 gpt-5.6-sol 后,我逐渐发现了一个奇怪的现象:

安装了 Superpowers 的 GPT-5.6,有时反而没有"裸奔"的 GPT-5.6 聪明。

它不是不会写代码,而是越来越不愿意直接解决问题。

你让它改一行配置,它想先写设计文档;让它修一个原因明确的 bug,它要先讨论成功标准;让它执行一个已经非常清楚的任务,它仍然不断向你确认。

于是,我关闭了全局启用的 Superpowers,转向一个简单得近乎寒酸的技能:Grill Me

结果反而更好。

Superpowers 解决的是什么问题?

Superpowers 本质上不是一个单独的技能,而是一整套面向 AI 编程的软件开发方法论。

它主要解决模型常见的几个问题:

  • 没理解需求就开始写代码
  • 遇到复杂任务时缺乏规划
  • 写到一半忘记最初目标
  • 不写测试,也不验证结果
  • 修改范围不断失控
  • 自信地宣布一个并未完成的任务已经完成

因此,Superpowers 给模型规定了一套严格流程:

先头脑风暴,再输出设计;

设计确认后,编写实施计划;

按计划开发,执行测试驱动;

每个阶段都进行检查、审查和验证。

对于能力还不够强的模型,这套方法非常有价值。

它们可能不能稳定判断什么时候应该澄清、什么时候应该探索代码库,也不一定能自己维持一个持续数十步的开发计划。Superpowers 把这些原本依赖模型判断的事情,转化成了一套明确的操作程序。

换句话说:

当模型缺乏工程判断时,Superpowers 用工程流程替它做判断。

这不是缺点,恰恰是它最重要的价值。

为什么到了 GPT-5.6,情况发生了变化?

GPT-5.6 Sol 本身已经具备很强的代理能力。

它能够主动检查代码库、理解项目结构、拆解复杂任务、调用工具、验证结果,并根据任务风险决定下一步行动。

这时再叠加一套全局强制流程,新增价值就开始下降,副作用却会逐渐增加。

Superpowers 中包含不少严格规则,例如:

  • 只要技能有一点可能适用,就必须调用
  • 所有创意工作都必须先完成设计
  • 即使任务非常简单,也不能跳过设计阶段
  • 用户没有批准设计之前,禁止开始实施
  • 设计完成后还要写文档、提交并再次等待确认

能力较弱的模型需要这些规则来避免失控。

但 GPT-5.6 的问题恰恰相反:它的指令遵循能力很强,所以会认真执行每一道流程。结果就是,它把大量注意力放在"是否遵守了工作流"上,而不是"怎样最有效地完成任务"。

这就像带领两名不同经验的工程师。

对于新人,你可能需要提供详细的开发规范、检查清单和审批流程;对于经验丰富的工程师,你只需要说明目标、约束和验收标准。如果还要求他修改一个按钮颜色也必须提交完整设计方案,流程就会开始拖累效率。

不同能力的模型,需要不同程度的约束

Superpowers 和 Grill Me 不是简单的替代关系。

它们更适合不同能力水平的模型。

对于能力一般的模型,Superpowers 可以提供:

  • 稳定的任务分解方法
  • 明确的阶段目标
  • 强制的用户确认节点
  • 测试驱动开发约束
  • 防止范围失控的检查机制
  • 完成前必须验证的质量底线

这些流程能够降低模型遗漏需求、跳过测试或盲目实现的概率。

而对于 GPT-5.6 Sol 这样的强模型,更合适的方式通常是:

  • 给出清晰目标
  • 提供必要上下文
  • 说明关键约束
  • 定义授权和审批边界
  • 设置明确的完成标准
  • 只在需要时调用专项技能

弱一些的模型需要别人告诉它"每一步怎么走"。

强模型更需要知道"要去哪里、什么不能做、怎样才算完成"。

为什么提示词越多,模型可能越笨?

很多人认为,给 AI 更多规则,它就会表现得更专业。

实际情况并非如此。

每增加一条指令,模型就多了一个需要同时满足的目标。规则之间可能重复、竞争,甚至互相冲突。

模型原本只需要考虑:

怎样正确完成这个任务?

加入复杂工作流后,它还要考虑:

是否应该先调用另一个技能?

是否已经完成需求澄清?

是否可以进入实施阶段?

是否需要创建设计文档?

是否必须等待用户确认?

是否违反了某项工作流规则?

对于能力较弱的模型,这些问题提供了必要的行为框架。

对于已经能够自主做出这些判断的模型,它们却可能成为额外负担。

OpenAI 当前的 GPT-5.6 提示指南也建议:

  • 使用更精简的提示词
  • 每条规则只陈述一次
  • 只提供当前任务需要的工具
  • 删除重复的说明和示例

在一组内部编码代理评测中,精简系统提示词曾让模型得分提高约 10%--15%,同时减少 41%--66% 的 token 消耗。具体结果会因任务而异,但它说明了一个重要趋势:

模型能力越强,提示词越应该关注目标和边界,而不是重复规定过程。

Grill Me 为什么更适合 GPT-5.6?

Grill Me 没有试图接管完整的软件开发过程。

它只做一件事:

在你需要时,狠狠拷问你的方案。

它会围绕一个计划逐项追问:

  • 你真正要解决的问题是什么?
  • 为什么选择这个方案?
  • 有哪些没有验证的假设?
  • 最坏情况下会发生什么?
  • 哪些边界条件还没有考虑?
  • 有没有更简单的替代方案?
  • 怎样判断最终结果是否成功?

它一次只问一个问题,并为每个问题提供推荐答案。能够从代码库或环境中查到的事实,它会主动查找;真正涉及取舍的决策,才交给用户。

更重要的是,Grill Me 通常由用户主动触发。

你可以在真正需要它时说:

我要重构权限系统。先不要写代码,grill me。

讨论清楚后,Grill Me 的任务就结束了。接下来,GPT-5.6 可以恢复自己的原生工作方式,完成设计、实施和验证。

Grill Me 没有试图替代模型的判断能力。

它只是临时把模型的审查能力放大。

我的选择不是"Superpowers 没用了"

关闭 Superpowers,不代表它已经过时,更不代表设计、测试和代码审查不重要。

真正需要改变的是使用方式。

如果模型经常出现以下问题,Superpowers 仍然非常适合:

  • 接到需求便立刻写代码
  • 不能稳定完成多阶段任务
  • 容易偏离原始目标
  • 经常忘记运行测试
  • 修改范围不断扩大
  • 缺少设计和验证意识
  • 工具调用不稳定
  • 需要明确流程才能保持一致性

但如果使用 GPT-5.6 Sol,并且它已经能够稳定地规划、执行和验证任务,那么更适合采用轻量、按需的技能组合:

  • 简单明确的修改,直接实施并验证
  • 需求模糊时,使用 Grill Me
  • 复杂功能开始前,调用 brainstorming
  • 疑难故障出现时,调用 systematic debugging
  • 高风险改动才要求完整设计和审批
  • 是否采用 TDD,根据项目和任务决定

这不是抛弃工程纪律,而是让流程与任务风险、模型能力相匹配。

最后的结论

Superpowers 最适合解决的是:

模型能力不够稳定,怎样用流程约束它?

Grill Me 更适合解决的是:

模型已经很强,怎样让它在关键决策上挑战我?

对于能力一般的模型,Superpowers 是一套非常有价值的工程护栏。它能够弥补模型在规划、测试、验证和长期任务执行上的不足。

对于 GPT-5.6 Sol,继续全局强制执行同样的流程,却可能限制它根据实际情况调整策略的能力。此时,像 Grill Me 这样轻量、单一、按需触发的技能,往往更加合适。

能力不足的模型,需要 Superpowers 告诉它每一步怎么走。

能力足够强的模型,只需要 Grill Me 在关键路口问一句:你真的想清楚了吗?

相关推荐
DogDaoDao3 分钟前
深度学习增强的视频压缩框架:Neutron Star 如何超越 VVC
人工智能·深度学习·音视频·视频编解码·h266·vvc·视频压缩
nuo5342026 分钟前
2026-07-31 AI 新闻汇总
人工智能
AI创界者11 分钟前
【8G显存福音】最新LTX-2.3-22B-DISTILLED-1.1-VBVR 整合包文生视频、图生视频,支持首尾帧/单图无限时长,50系显卡全适配!
人工智能·音视频
科技新芯12 分钟前
ChinaJoy 首日直击!Bidnex 两大 AI 新品正式亮相
人工智能
limingade14 分钟前
如何在手机本地不依靠网络-实现真正的端到端语音交互的智能AI应答
人工智能·智能手机·ai机器人·ai外呼·手机本地ai大模型·离线ai机器人·离线ai
m0_敲代码的彭于晏16815 分钟前
如何查看自己的电脑是 x64 还是 ARM64 ?
人工智能·电脑
南方程序猴15 分钟前
2026年7月最新国内 Codex 安装教程和使用教程:GPT-5.6 完整指南
人工智能·gpt·ai·ai编程
iiiiii1118 分钟前
【论文阅读笔记】Reparameterization Proximal Policy Optimization (RPO):将PPO的稳定性引入可微分强化学习
论文阅读·人工智能·笔记·深度学习·机器学习·机器人·具身智能
GitCode官方28 分钟前
openPangu-2.0-Pro 模型及技术报告正式开源上线 AtomGit AI
人工智能·华为·开源·harmonyos·atomgit
少年最是31 分钟前
体协作系统,用于分析聊天记录中特定人物的荣格八维人格类型。 本文使用 CC-BY-NC-SA . 协议。转载或者 AI 模型/智能体 ...
人工智能