Codex配置瘦身实践:给Agent提示词做一次深度大扫除

文章目录

    • 前言
    • [第一步,先让 Codex 自己审自己](#第一步,先让 Codex 自己审自己)
    • 第二步,拿着审查结果做手术
    • [01、给 Skill 描述做减法](#01、给 Skill 描述做减法)
      • [1.1 触发描述写太宽,就像家门没锁](#1.1 触发描述写太宽,就像家门没锁)
      • [1.2 自检清单,顺手收藏](#1.2 自检清单,顺手收藏)
    • [02、CLAUDE.md 减脂计划](#02、CLAUDE.md 减脂计划)
      • [2.1 无条件规则是毒药](#2.1 无条件规则是毒药)
      • [2.2 给安全操作发通行证](#2.2 给安全操作发通行证)
      • [2.3 自检清单](#2.3 自检清单)
    • 03、决策边界松一松
      • [3.1 底线不能动](#3.1 底线不能动)
      • [3.2 日常琐事别烦我](#3.2 日常琐事别烦我)
    • 04、开工前,先把"完成"两个字焊死
      • [4.1 写完代码 ≠ 完成](#4.1 写完代码 ≠ 完成)
      • [4.2 停止条件要写明白](#4.2 停止条件要写明白)
    • ending

P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/H1727548

前言

大家好,我是那个天天被 Agent 抢饭碗、还乐呵呵给 Agent 打工的人。

前几天手痒,把 Codex 的配置文件翻出来做了一次大扫除。起因是 OpenAI 发了一篇指南,标题叫《Rethinking skills and prompts for GPT-6 Astra》。

翻译成人话:模型都换新脑子了,你们那些破配置,该减肥了。

我一看,这简直是对着我的 AGENTS.md 点名的。里面堆的规则,比我妈衣柜里的旧衣服还多,每一件都"可能有用",每一件都没穿过。

于是我第一时间抄作业,实践了一波。效果怎么说呢?像给跑了十年的笔记本清了灰,风扇不转了,跑得反而快了。

第一步,先让 Codex 自己审自己

在 Codex 里扔这么一句:

复制代码
按照这篇指南:https://developers.openai.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra 审查当前项目的 AGENTS.md 和 Skills,找出过宽的 Skill 触发、无关文档强制读取、重复检查、冲突规则,以及频繁要求确认的指令。逐条告诉我问题和最小修改建议,先不要改文件。

这一步的精髓是:让嫌疑人自己交代自己的问题。

模型把 AGENTS.md 和 Skills 翻了个底朝天,审出来的问题比我年终总结里的待办还长:哪个 Skill 一碰就触发、哪份文档没人看还被强制读、哪两条规则互相打架。

第二步,拿着审查结果做手术

复制代码
根据刚才的审查结果优化 AGENTS.md 和 Skills。缩小 Skill 触发范围,删除无关文档读取,合并重复检查,解决冲突规则,并减少低风险任务中的无意义确认。保留安全边界、敏感操作确认和必要测试。修改完成后列出具体改动。

改完就一个感受:以前的我,像给自行车装了导弹发射器------能发射,但没必要。

这里有个小建议:一次只改一条,改完拿你天天干的那件破事跑一遍,确认没变傻再动下一条。别一口气全删光,回头模型不认识你了,你还得哭着重新写。

官方指南主要讲了四个方向,我挨个给你们划重点。

01、给 Skill 描述做减法

1.1 触发描述写太宽,就像家门没锁

Skill 的触发描述写太宽,就像家门口贴了个"欢迎光临"。收快递的进来了,查水表的进来了,发传单的也进来了。

OpenAI 举了个例子:一个处理 Postgres 数据库迁移的 Skill,触发描述写的是:

复制代码
「涉及数据库、查询或数据模型时使用」

看起来没毛病,对吧?

但用户只是想写一条 SQL 查询,模型也会触发这个 Skill,把一整套迁移流程的指令全加载进来。你只是想去楼下买包烟,司机已经把整个旅行团的行程都规划好了。

改法是收窄成:

复制代码
「新增或修改迁移、审查迁移发布时使用」

触发条件跟实际干的活对上了,误触自然就少了。

我翻了一下自己项目里的 Skill,类似的问题一抓一大把。有个 browser-act 的 Skill,描述写了整整四行,从 fetch URL 到截图到填表单全覆盖。只要任务里沾一个"网页",模型就跟狗见了骨头一样冲过去,拦都拦不住。

另外还有个扎心的事实:很多 Skill 是老模型时代写的,操作步骤恨不得精确到"先迈左脚、再迈右脚"。新模型已经能处理模糊和复杂了,你把它捆得越细,它发挥得越差。

这就像你请了个博士生,非给他发一份幼儿园作息表。

官方还提醒了一句:你写的指令不只是给自家模型看的,别的 Agent 也可能用到。你为自家熊孩子定的一堆规矩,套到别人家孩子身上,可能就是过度管教。

1.2 自检清单,顺手收藏

  • 每个 Skill 的描述,能不能一两句话说明白"做什么"和"什么时候用"?
  • 有没有触发条件宽到离谱、八竿子打不着的任务也加载它的?
  • 多个 Skill 的描述有没有重叠?模型能不能分清该翻谁的牌子?
  • 操作步骤是塞在描述里,还是老老实实放在子文档里?

02、CLAUDE.md 减脂计划

2.1 无条件规则是毒药

CLAUDE.md(Codex 对应 AGENTS.md)是全局规则文件,模型每次干活都要读一遍。

你想想,一个文件你顿顿都得吃,那里面装的必须是精华,不能是泔水。

官方给了一个非常典型的反面教材:

复制代码
每次编辑前,都读 architecture.md、database.md 和 deployment.md。

这是啥?这是"不管你干啥,先把三本手册通读一遍"。改个注释也要先读三份文档,不知道的还以为在考科目一。

改法是给每份文档加上读取条件:

复制代码
涉及服务边界时读 architecture.md
修改表结构时读 database.md
准备部署时读 deployment.md

前者是"全都读",后者是"需要才读"。一个像自助餐吃到扶墙,一个像精准点菜。

2.2 给安全操作发通行证

再低头看看大部分人的 CLAUDE.md:全是"不要 XX""修改前必须 XX""禁止自动 XX"。很少有人写"这件事你可以放心干"。

官方建议是:给安全的工作流显式授权。比如本地测试,用的是临时数据,碰不到生产环境,跑完自动清理,那就可以写一句:

复制代码
本地测试使用一次性数据,没有生产环境访问权限。直接跑测试、修复失败、重跑受影响的测试,不需要每一步都等确认。

翻译一下:这种低风险的活,别当妈宝,自己拿主意。

2.3 自检清单

  • 有没有"每次都要 XX"这种无条件规则?是不是像强迫症?
  • 这些规则分别适合什么场景?能不能加上触发条件,或者挪到具体的 Skill 里?
  • 有没有安全的工作流可以放权,减少干等确认的时间?
  • 规则里引用的文档,和实际代码还对得上吗?文档都改版八次了,规则还在引用第一版,这就尴尬了。

03、决策边界松一松

3.1 底线不能动

老模型时代,我们给模型加了一堆限制:"改文件前必须先问我""禁止自动执行 shell 命令""涉及数据库的操作都要等确认"。

当时合理吗?合理。老模型判断力不够,不拦着容易闯祸。

但现在呢?Astra 这代模型对指令更敏感,对安全边界的判断也更准。你还在那"禁止""必须先问",模型就变成了一个过度谨慎的实习生:该干的活不敢干,该往前走的时候停下来等你点头。

打个比方:你请了个很靠谱的司机,结果每过一个路口,你都要喊一声"慢点慢点"。司机还没疯,你先累了。

官方的建议是:把以前加的限制分成两类。

一类是安全底线。「不要自动 push 代码到远程仓库」「不要删除生产数据」「涉及密钥的操作必须确认」。这类不管模型多聪明都得留着。就像家里的灭火器,一年用不上也得摆着,真着火了你就知道它多值钱了。

3.2 日常琐事别烦我

另一类是日常琐事。读个文件要确认,写个测试要确认,跑个格式化也要确认。这些低风险操作,交给模型自己判断就行。

它现在有这个能力了,你还攥着不放,图啥?图个仪式感吗?

04、开工前,先把"完成"两个字焊死

4.1 写完代码 ≠ 完成

有个现象:模型做视频的时候,会一口气把整个任务执行完;但 GPT-6 Astra 会中途停下来问你"要不要继续"。

对做视频来说,这是好事,省得出片了再返工。

但如果你只是让它"跑测试、修 bug、验证通过",又希望它一口气干完,那你得在提示里把"完成"的定义写明白。

Bad 写法:

复制代码
帮我实现用户登录功能。

模型写完代码就收工了,留你一个人对着终端发呆:然后呢?测试呢?验收呢?

Good 写法:

复制代码
实现用户登录功能。完成后跑通本地测试套件,修复因为这次改动导致的测试失败,确认所有测试通过、没有报错后再汇报结果。

发现区别没有?"写完代码"只是做完了一半,"测试全过"才是真的完。

就像煮饭,米下锅不算完,端上桌才算完。

4.2 停止条件要写明白

官方有句话说得特别到位:在开始之前就定义完成(define completion before starting)。

翻译过来就是:别等模型跑完了你才想起来验收标准,那会儿黄花菜都凉了。

测试的停止条件也得写清楚。"相关检查通过、没有新改动和新问题,就可以交付",这比反复强调"多测几遍"有用多了。

"多测几遍"这四个字,听起来像玄学;一条明确的验收标准,才是硬通货。

ending

新版本模型发布,尤其是 GPT-6 Astra 这种强力选手,确实值得花点时间清理一波 AGENTS.md、Skills、Memory。

花不了太久,但之后每次开任务都会顺滑不少。就像搬家,旧东西扔干净了,走路都带风。

行了,本次大扫除报告到此结束。我得回去看看我的 Agent 今天有没有背着我偷懒。下期见。

P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/H1727548

相关推荐
shark-chili1 小时前
关于AI辅助编程的认知
数据库·人工智能·redis·macos·缓存
机核研创社1 小时前
一次性内裤无人生产线详解:从裁片到成品 12–35 秒一件的整线自动化架构
人工智能·自动化
有Li1 小时前
【AI答疑】MR数据预处理步骤
人工智能·笔记·算法·语言模型·医学生
衡石科技1 小时前
让 BI 能力可编排:CLI、Headless API 与可治理执行
人工智能·chatbi
蓝速科技1 小时前
国产化信创终端等保合规核心防护与落地方案丨蓝速科技
大数据·运维·数据库·人工智能·科技
GEO实战经验分享2 小时前
王涛:GEO 服务商能力评估清单——基础、结构、战略、风控四层怎么核验
大数据·人工智能·chatgpt
干就完事了2 小时前
机器学习-音乐艺人流行趋势预测
人工智能·机器学习·阿里云
财经科技社2 小时前
从卧室到卫生间,流感季家庭环境消毒怎么做?
人工智能·科技
量化吞吐机2 小时前
会写代码之后,量化学习还要补上交易判断
人工智能·python