文章目录
-
- 前言
- [第一步,先让 Codex 自己审自己](#第一步,先让 Codex 自己审自己)
- 第二步,拿着审查结果做手术
- [01、给 Skill 描述做减法](#01、给 Skill 描述做减法)
-
- [1.1 触发描述写太宽,就像家门没锁](#1.1 触发描述写太宽,就像家门没锁)
- [1.2 自检清单,顺手收藏](#1.2 自检清单,顺手收藏)
- [02、CLAUDE.md 减脂计划](#02、CLAUDE.md 减脂计划)
-
- [2.1 无条件规则是毒药](#2.1 无条件规则是毒药)
- [2.2 给安全操作发通行证](#2.2 给安全操作发通行证)
- [2.3 自检清单](#2.3 自检清单)
- 03、决策边界松一松
-
- [3.1 底线不能动](#3.1 底线不能动)
- [3.2 日常琐事别烦我](#3.2 日常琐事别烦我)
- 04、开工前,先把"完成"两个字焊死
-
- [4.1 写完代码 ≠ 完成](#4.1 写完代码 ≠ 完成)
- [4.2 停止条件要写明白](#4.2 停止条件要写明白)
- ending
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/H1727548
前言
大家好,我是那个天天被 Agent 抢饭碗、还乐呵呵给 Agent 打工的人。
前几天手痒,把 Codex 的配置文件翻出来做了一次大扫除。起因是 OpenAI 发了一篇指南,标题叫《Rethinking skills and prompts for GPT-6 Astra》。
翻译成人话:模型都换新脑子了,你们那些破配置,该减肥了。
我一看,这简直是对着我的 AGENTS.md 点名的。里面堆的规则,比我妈衣柜里的旧衣服还多,每一件都"可能有用",每一件都没穿过。
于是我第一时间抄作业,实践了一波。效果怎么说呢?像给跑了十年的笔记本清了灰,风扇不转了,跑得反而快了。
第一步,先让 Codex 自己审自己
在 Codex 里扔这么一句:
按照这篇指南:https://developers.openai.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra 审查当前项目的 AGENTS.md 和 Skills,找出过宽的 Skill 触发、无关文档强制读取、重复检查、冲突规则,以及频繁要求确认的指令。逐条告诉我问题和最小修改建议,先不要改文件。
这一步的精髓是:让嫌疑人自己交代自己的问题。
模型把 AGENTS.md 和 Skills 翻了个底朝天,审出来的问题比我年终总结里的待办还长:哪个 Skill 一碰就触发、哪份文档没人看还被强制读、哪两条规则互相打架。
第二步,拿着审查结果做手术
根据刚才的审查结果优化 AGENTS.md 和 Skills。缩小 Skill 触发范围,删除无关文档读取,合并重复检查,解决冲突规则,并减少低风险任务中的无意义确认。保留安全边界、敏感操作确认和必要测试。修改完成后列出具体改动。
改完就一个感受:以前的我,像给自行车装了导弹发射器------能发射,但没必要。
这里有个小建议:一次只改一条,改完拿你天天干的那件破事跑一遍,确认没变傻再动下一条。别一口气全删光,回头模型不认识你了,你还得哭着重新写。
官方指南主要讲了四个方向,我挨个给你们划重点。
01、给 Skill 描述做减法
1.1 触发描述写太宽,就像家门没锁
Skill 的触发描述写太宽,就像家门口贴了个"欢迎光临"。收快递的进来了,查水表的进来了,发传单的也进来了。
OpenAI 举了个例子:一个处理 Postgres 数据库迁移的 Skill,触发描述写的是:
「涉及数据库、查询或数据模型时使用」
看起来没毛病,对吧?
但用户只是想写一条 SQL 查询,模型也会触发这个 Skill,把一整套迁移流程的指令全加载进来。你只是想去楼下买包烟,司机已经把整个旅行团的行程都规划好了。
改法是收窄成:
「新增或修改迁移、审查迁移发布时使用」
触发条件跟实际干的活对上了,误触自然就少了。
我翻了一下自己项目里的 Skill,类似的问题一抓一大把。有个 browser-act 的 Skill,描述写了整整四行,从 fetch URL 到截图到填表单全覆盖。只要任务里沾一个"网页",模型就跟狗见了骨头一样冲过去,拦都拦不住。
另外还有个扎心的事实:很多 Skill 是老模型时代写的,操作步骤恨不得精确到"先迈左脚、再迈右脚"。新模型已经能处理模糊和复杂了,你把它捆得越细,它发挥得越差。
这就像你请了个博士生,非给他发一份幼儿园作息表。
官方还提醒了一句:你写的指令不只是给自家模型看的,别的 Agent 也可能用到。你为自家熊孩子定的一堆规矩,套到别人家孩子身上,可能就是过度管教。
1.2 自检清单,顺手收藏
- 每个 Skill 的描述,能不能一两句话说明白"做什么"和"什么时候用"?
- 有没有触发条件宽到离谱、八竿子打不着的任务也加载它的?
- 多个 Skill 的描述有没有重叠?模型能不能分清该翻谁的牌子?
- 操作步骤是塞在描述里,还是老老实实放在子文档里?
02、CLAUDE.md 减脂计划
2.1 无条件规则是毒药
CLAUDE.md(Codex 对应 AGENTS.md)是全局规则文件,模型每次干活都要读一遍。
你想想,一个文件你顿顿都得吃,那里面装的必须是精华,不能是泔水。
官方给了一个非常典型的反面教材:
每次编辑前,都读 architecture.md、database.md 和 deployment.md。
这是啥?这是"不管你干啥,先把三本手册通读一遍"。改个注释也要先读三份文档,不知道的还以为在考科目一。
改法是给每份文档加上读取条件:
涉及服务边界时读 architecture.md
修改表结构时读 database.md
准备部署时读 deployment.md
前者是"全都读",后者是"需要才读"。一个像自助餐吃到扶墙,一个像精准点菜。
2.2 给安全操作发通行证
再低头看看大部分人的 CLAUDE.md:全是"不要 XX""修改前必须 XX""禁止自动 XX"。很少有人写"这件事你可以放心干"。
官方建议是:给安全的工作流显式授权。比如本地测试,用的是临时数据,碰不到生产环境,跑完自动清理,那就可以写一句:
本地测试使用一次性数据,没有生产环境访问权限。直接跑测试、修复失败、重跑受影响的测试,不需要每一步都等确认。
翻译一下:这种低风险的活,别当妈宝,自己拿主意。
2.3 自检清单
- 有没有"每次都要 XX"这种无条件规则?是不是像强迫症?
- 这些规则分别适合什么场景?能不能加上触发条件,或者挪到具体的 Skill 里?
- 有没有安全的工作流可以放权,减少干等确认的时间?
- 规则里引用的文档,和实际代码还对得上吗?文档都改版八次了,规则还在引用第一版,这就尴尬了。
03、决策边界松一松
3.1 底线不能动
老模型时代,我们给模型加了一堆限制:"改文件前必须先问我""禁止自动执行 shell 命令""涉及数据库的操作都要等确认"。
当时合理吗?合理。老模型判断力不够,不拦着容易闯祸。
但现在呢?Astra 这代模型对指令更敏感,对安全边界的判断也更准。你还在那"禁止""必须先问",模型就变成了一个过度谨慎的实习生:该干的活不敢干,该往前走的时候停下来等你点头。
打个比方:你请了个很靠谱的司机,结果每过一个路口,你都要喊一声"慢点慢点"。司机还没疯,你先累了。
官方的建议是:把以前加的限制分成两类。
一类是安全底线。「不要自动 push 代码到远程仓库」「不要删除生产数据」「涉及密钥的操作必须确认」。这类不管模型多聪明都得留着。就像家里的灭火器,一年用不上也得摆着,真着火了你就知道它多值钱了。
3.2 日常琐事别烦我
另一类是日常琐事。读个文件要确认,写个测试要确认,跑个格式化也要确认。这些低风险操作,交给模型自己判断就行。
它现在有这个能力了,你还攥着不放,图啥?图个仪式感吗?
04、开工前,先把"完成"两个字焊死
4.1 写完代码 ≠ 完成
有个现象:模型做视频的时候,会一口气把整个任务执行完;但 GPT-6 Astra 会中途停下来问你"要不要继续"。
对做视频来说,这是好事,省得出片了再返工。
但如果你只是让它"跑测试、修 bug、验证通过",又希望它一口气干完,那你得在提示里把"完成"的定义写明白。
Bad 写法:
帮我实现用户登录功能。
模型写完代码就收工了,留你一个人对着终端发呆:然后呢?测试呢?验收呢?
Good 写法:
实现用户登录功能。完成后跑通本地测试套件,修复因为这次改动导致的测试失败,确认所有测试通过、没有报错后再汇报结果。
发现区别没有?"写完代码"只是做完了一半,"测试全过"才是真的完。
就像煮饭,米下锅不算完,端上桌才算完。
4.2 停止条件要写明白
官方有句话说得特别到位:在开始之前就定义完成(define completion before starting)。
翻译过来就是:别等模型跑完了你才想起来验收标准,那会儿黄花菜都凉了。
测试的停止条件也得写清楚。"相关检查通过、没有新改动和新问题,就可以交付",这比反复强调"多测几遍"有用多了。
"多测几遍"这四个字,听起来像玄学;一条明确的验收标准,才是硬通货。
ending
新版本模型发布,尤其是 GPT-6 Astra 这种强力选手,确实值得花点时间清理一波 AGENTS.md、Skills、Memory。
花不了太久,但之后每次开任务都会顺滑不少。就像搬家,旧东西扔干净了,走路都带风。
行了,本次大扫除报告到此结束。我得回去看看我的 Agent 今天有没有背着我偷懒。下期见。
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/H1727548