最近忙着做新的产品和工具,公号几天没更新,今天爬上来说几点。
AI 发展得很快,但是我发现很多人对 AI 的用法还停留在之前,我们应该跟随时代而更新。
索性今天说下最近用 AI 的几个技巧,应该对一些人有价值。
1. Anthropic 自己砍了 80%,规则式约束过时了
先把这件事说清楚,因为它是个分水岭。
7 月 24 日 Anthropic 的官方博客,为 Opus 5 和 Fable 5 删掉了 Claude Code 系统提示词 80% 以上的内容,评测结果零损失。团队成员的原话是:我们给 Claude 施加了过多约束。
什么意思呢?以前大家写提示词,喜欢堆规则:不许这样,不许那样,再塞几个示例。对新模型,这套做法不但没用,反而有害。官方现在的说法是,负面清单和示例堆砌会限制模型的判断空间,拉低输出质量。
CLAUDE.md 也一样。官方文档的建议就一句话:每一行都问自己,删掉这条,Claude 会犯错么?不会就删。原话更狠,臃肿的 CLAUDE.md 会让 Claude 直接无视你真正的指令。
Claude Code 创始人 Boris 自己的 CLAUDE.md 只有两行。
新版还内置了 /doctor 命令,可以自动审计你的 CLAUDE.md 和 skills,帮你瘦身。官方下场帮你删配置,这事以前想都不敢想。
一句话:靠堆规则管 AI 的时代,结束了。
2. 各种「补能力」的 Skill 都会死掉
随着 AI 的能力越来越强,其实一堆 Skill 根本不需要了。
模型能力强了之后,那些「补能力」的东西确实在快速贬值。以前模型不会规划,你装个规划 skill,不会拆任务,你装个拆任务的。现在这些模型自己就会,你装得越多越添乱。
Databricks 有篇论文实测过,skill 库扩到 202 个的时候,任务通过率最多掉了 21%,主要原因不是塞不下,是 AI 在一堆 skill 里挑花了眼,选错了。还有人把自己 7 个 MCP server 全删了,省出来 6 万多 token,这些是每次会话开场就白烧的。
但是,注意这个但是。Anthropic 砍规则的同时,却建议你把项目的坑,业务的口径,干活的流程,沉淀成 skills 按需加载。因为这些是你的私有知识,模型再强也不知道你公司的测试命令是什么,不知道你们「活跃用户」怎么定义。
所以判断标准很简单:这个 skill 是教 AI 干活,还是告诉 AI 你的情况?前者大概率该删,后者留着,越用越值钱。
这和我三周前那篇《为什么你的 AI 像智障》说的约束和语料,其实是一回事。规则式约束死了,私有知识型沉淀的分量更重了。
3. Kimi K3 开放权重了,抢不到套餐的直接上云
昨天,7 月 27 日,Kimi K3 的完整权重挂上了 Hugging Face。
2.8T 参数,目前全球最大的开放权重模型。Artificial Analysis 智能指数排全球第三,前俩是 Claude Fable 5 和 GPT-5.6,这是开放权重模型第一次挤进第一梯队。
对于大部分人来说,你用第一和第三,其实基本都够用了,都足够强,尤其前端能力,Kimi K3 评测甚至直接第一,但是也有一些不足之处,比如会慢,会啰嗦些。
但最主要的是算力限制,Kimi 官方订阅套餐,很多人根本抢不到。
那么这里有个建议,因为权重开源了,所以可以考虑直接上云:阿里云百炼,火山引擎方舟,腾讯云等全都上架了 K3。百炼的价格和官方一致,输入 20 元输出 100 元每百万 token,火山那边还进了 Coding Plan 套餐,写代码的可以直接包月。
开源权重最大的意义,就是你不用吊死在官方一棵树上。
4. 新手别头铁冲 CC 了,Codex 是更稳的选择
A 社的封号又升级了。最近很多人应该都被封号了,尤其前几天德国一个支付漏洞,顺手直接又干了一大批号。
官方透明度数据,半年封了 145 万个账号,申诉成功率 3.3%。
所以经常有新手问我怎么入坑,我现在的答案很统一:有条件的直接用 Codex,种种原因要用国产的,那就无脑选择 Kimi。
能力上,Codex 默认模型已经是 GPT-5.6,各方面能力都是顶尖的,关键封号规则很宽松。
而且是多模态,截图直接甩给它,还可以直接用 Image-2.0 生图。报 bug 别费劲打字描述了,截个图发过去,它连样式带报错一起看。这个习惯养成了,你描述问题的成本能省一大半。
另一个是省心。7 月 13 日 Codex 刚取消了付费档的 5 小时使用限制,而且为了和 CC 抢用户,额度经常重置。
如果你是深度开发者,如果算单价的话,最近 Codex 成本可能比全球最具性价比的 DeepSeek 还便宜。
5. effort 别拉满,并不是越高越好。
现在每家模型都有推理档位。Claude 是 low, medium, high, xhigh, max 五档,OpenAI 和 Kimi 也都有对应的档位。
他们的区别类比做事情,你想一步,还是想十步,一百步的区别。
很多人以为档位越高越聪明,默认拉满。其实不然。
你想下,如果你一个很简单的任务,他不用想太多,直接去做,又快又好。
很多时候,你用上了高档位的推理模式,一个小活,反而又慢,干起来活来不够简洁优雅,经常过度实现。
Anthropic 自己跑的基准测试,Opus 5 在 medium 档得分最高,拉到 high 和 max,分数反而下降,钱还花得更多。官方数据层面的「想太多」,很有意思。
OpenAI 的文档说得更直白,xhigh 这个档位,唯一点名的场景就是安全和代码审查,而且要你自己的评测证明有收益才建议用。
我的建议:日常任务 medium 或者 high 足够了,速度快还省额度。只有终审,代码 review,安全审查这种场合,再上 xhigh 或者 max。
对了,用 Kimi K3 的注意,它的 API 默认就是 max 档,官方自己都说简单任务调低档位能降延迟省 token,记得手动调。
把最高档留给真正重要的 5%,剩下的 95% 别浪费。
最后
再提点很小但是特别管用的技巧。
现在 1M 上下文已经是标配了,但是很多人不知道的是,支持 1M 上下文是一回事,AI 在 1M 上下文内能不能记清楚细节,更好地处理任务,是另一回事。
如果你用的是 1M 上下文,用到 50% 左右,我建议你手动压缩,基本都支持 /compact 命令,这样你的 AI 之后「脑子会更清晰」。
GPT-5.6 现在默认是 258k 上下文,因为官方实测这个范围内 AI 的表现更好,所以你用 GPT 可以无脑去用了,不用考虑压缩场景,你上下文用满都没多大关系。
以上,就是给大家分享的一些小技巧。
AI 的使用,到了一个做减法的时刻。