AI 的玩法,该做减法了

最近忙着做新的产品和工具,公号几天没更新,今天爬上来说几点。

AI 发展得很快,但是我发现很多人对 AI 的用法还停留在之前,我们应该跟随时代而更新。

索性今天说下最近用 AI 的几个技巧,应该对一些人有价值。

1. Anthropic 自己砍了 80%,规则式约束过时了

先把这件事说清楚,因为它是个分水岭。

7 月 24 日 Anthropic 的官方博客,为 Opus 5 和 Fable 5 删掉了 Claude Code 系统提示词 80% 以上的内容,评测结果零损失。团队成员的原话是:我们给 Claude 施加了过多约束。

什么意思呢?以前大家写提示词,喜欢堆规则:不许这样,不许那样,再塞几个示例。对新模型,这套做法不但没用,反而有害。官方现在的说法是,负面清单和示例堆砌会限制模型的判断空间,拉低输出质量。

CLAUDE.md 也一样。官方文档的建议就一句话:每一行都问自己,删掉这条,Claude 会犯错么?不会就删。原话更狠,臃肿的 CLAUDE.md 会让 Claude 直接无视你真正的指令。

Claude Code 创始人 Boris 自己的 CLAUDE.md 只有两行。

新版还内置了 /doctor 命令,可以自动审计你的 CLAUDE.md 和 skills,帮你瘦身。官方下场帮你删配置,这事以前想都不敢想。

一句话:靠堆规则管 AI 的时代,结束了。

2. 各种「补能力」的 Skill 都会死掉

随着 AI 的能力越来越强,其实一堆 Skill 根本不需要了。

模型能力强了之后,那些「补能力」的东西确实在快速贬值。以前模型不会规划,你装个规划 skill,不会拆任务,你装个拆任务的。现在这些模型自己就会,你装得越多越添乱。

Databricks 有篇论文实测过,skill 库扩到 202 个的时候,任务通过率最多掉了 21%,主要原因不是塞不下,是 AI 在一堆 skill 里挑花了眼,选错了。还有人把自己 7 个 MCP server 全删了,省出来 6 万多 token,这些是每次会话开场就白烧的。

但是,注意这个但是。Anthropic 砍规则的同时,却建议你把项目的坑,业务的口径,干活的流程,沉淀成 skills 按需加载。因为这些是你的私有知识,模型再强也不知道你公司的测试命令是什么,不知道你们「活跃用户」怎么定义。

所以判断标准很简单:这个 skill 是教 AI 干活,还是告诉 AI 你的情况?前者大概率该删,后者留着,越用越值钱。

这和我三周前那篇《为什么你的 AI 像智障》说的约束和语料,其实是一回事。规则式约束死了,私有知识型沉淀的分量更重了。

3. Kimi K3 开放权重了,抢不到套餐的直接上云

昨天,7 月 27 日,Kimi K3 的完整权重挂上了 Hugging Face。

2.8T 参数,目前全球最大的开放权重模型。Artificial Analysis 智能指数排全球第三,前俩是 Claude Fable 5 和 GPT-5.6,这是开放权重模型第一次挤进第一梯队。

对于大部分人来说,你用第一和第三,其实基本都够用了,都足够强,尤其前端能力,Kimi K3 评测甚至直接第一,但是也有一些不足之处,比如会慢,会啰嗦些。

但最主要的是算力限制,Kimi 官方订阅套餐,很多人根本抢不到。

那么这里有个建议,因为权重开源了,所以可以考虑直接上云:阿里云百炼,火山引擎方舟,腾讯云等全都上架了 K3。百炼的价格和官方一致,输入 20 元输出 100 元每百万 token,火山那边还进了 Coding Plan 套餐,写代码的可以直接包月。

开源权重最大的意义,就是你不用吊死在官方一棵树上。

4. 新手别头铁冲 CC 了,Codex 是更稳的选择

A 社的封号又升级了。最近很多人应该都被封号了,尤其前几天德国一个支付漏洞,顺手直接又干了一大批号。

官方透明度数据,半年封了 145 万个账号,申诉成功率 3.3%。

所以经常有新手问我怎么入坑,我现在的答案很统一:有条件的直接用 Codex,种种原因要用国产的,那就无脑选择 Kimi。

能力上,Codex 默认模型已经是 GPT-5.6,各方面能力都是顶尖的,关键封号规则很宽松。

而且是多模态,截图直接甩给它,还可以直接用 Image-2.0 生图。报 bug 别费劲打字描述了,截个图发过去,它连样式带报错一起看。这个习惯养成了,你描述问题的成本能省一大半。

另一个是省心。7 月 13 日 Codex 刚取消了付费档的 5 小时使用限制,而且为了和 CC 抢用户,额度经常重置。

如果你是深度开发者,如果算单价的话,最近 Codex 成本可能比全球最具性价比的 DeepSeek 还便宜。

5. effort 别拉满,并不是越高越好。

现在每家模型都有推理档位。Claude 是 low, medium, high, xhigh, max 五档,OpenAI 和 Kimi 也都有对应的档位。

他们的区别类比做事情,你想一步,还是想十步,一百步的区别。

很多人以为档位越高越聪明,默认拉满。其实不然。

你想下,如果你一个很简单的任务,他不用想太多,直接去做,又快又好。

很多时候,你用上了高档位的推理模式,一个小活,反而又慢,干起来活来不够简洁优雅,经常过度实现。

Anthropic 自己跑的基准测试,Opus 5 在 medium 档得分最高,拉到 high 和 max,分数反而下降,钱还花得更多。官方数据层面的「想太多」,很有意思。

OpenAI 的文档说得更直白,xhigh 这个档位,唯一点名的场景就是安全和代码审查,而且要你自己的评测证明有收益才建议用。

我的建议:日常任务 medium 或者 high 足够了,速度快还省额度。只有终审,代码 review,安全审查这种场合,再上 xhigh 或者 max。

对了,用 Kimi K3 的注意,它的 API 默认就是 max 档,官方自己都说简单任务调低档位能降延迟省 token,记得手动调。

把最高档留给真正重要的 5%,剩下的 95% 别浪费。

最后

再提点很小但是特别管用的技巧。

现在 1M 上下文已经是标配了,但是很多人不知道的是,支持 1M 上下文是一回事,AI 在 1M 上下文内能不能记清楚细节,更好地处理任务,是另一回事。

如果你用的是 1M 上下文,用到 50% 左右,我建议你手动压缩,基本都支持 /compact 命令,这样你的 AI 之后「脑子会更清晰」。

GPT-5.6 现在默认是 258k 上下文,因为官方实测这个范围内 AI 的表现更好,所以你用 GPT 可以无脑去用了,不用考虑压缩场景,你上下文用满都没多大关系。

以上,就是给大家分享的一些小技巧。

AI 的使用,到了一个做减法的时刻。

相关推荐
IT_陈寒1 小时前
SpringBoot自动配置坑了我一周,原来问题这么蠢!
前端·人工智能·后端
糯米导航1 小时前
实践教程|搭建电商 AI 无限画布,实现百款商品主图自动化批量生成
运维·人工智能·自动化
kyriewen1 小时前
我review了一份Vibe Coding写的前端代码——能跑,但5个地方迟早要命
前端·javascript·ai编程
东小西2 小时前
第12篇:《AI的幻觉差点让我背锅:于是我给它开了一场"开卷考试"》
openai·ai编程
朴马丁2 小时前
从制造到智造:PLM如何赋能企业研发创新
大数据·运维·人工智能·食品行业·流程行业plm·化工新材料行业·新能源材料行业
武子康2 小时前
GAIA、Cosmos、Genie 等视频模型纷纷自称"世界模型",为什么说视觉逼真度不构成决策证据?
人工智能·llm·agent
上海锝秉工控2 小时前
普通编码器:基础信号处理与数据转换核心岗
人工智能·信号处理
chenyuhao20242 小时前
第一章_自动驾驶中的社会交互
人工智能·机器学习·自动驾驶
腻害兔2 小时前
【若依项目-产品经理视角】RuoYi-Vue-Pro 源码拆解:IM 即时通讯模块,一个被低估的「全功能聊天系统」
java·前端·vue.js·产品经理·ai编程