让 AI 少说废话:95K Star 的 Caveman,把输出 token 砍掉 65% 还更准了

一个把 "说人话" 做成商业模式的 95K Star 开源项目:它让哪怕最矜持的 AI 模型,也学会先把结论甩出来再说。

先问你一个问题:你上一次让 AI 代写一段代码时,它开口第一句是不是 "好的,我来帮你分析一下"?

注意。你为这句话付费了。

这句开场白大约 12 个 token,占单次回复的 3% 到 5%。如果你一天用 50 次 AI,光这种礼貌用语,就白烧了杯咖啡的钱。

这不是拍脑袋。过去两周,GitHub 冒出个叫 Caveman 的 Claude Code 技能,梗是"石器时代说话",干的却是最现代的省钱生意:教 AI 去掉填充词、含糊话、客气话,把输出 token 平均砍掉 65%。

今晚把这个项目扒到底,看它怎么省、能省多少、这个 65% 是不是营销话术。

先说结论,给时间紧的人

只带走一句话:Caveman 不是改模型,只是给 Claude Code 加一个"闭嘴"的癖好,压低回复里废话的占比,输出 token 平均降 65%(官方基准,区间 22% 到 87%)。

它不碰输入 token,不改模型本身,也几乎不动你的代码质量。省的是"客套税",不是"技术税"。

四个典型判断:

  • 问答型工作流:收益最大,直接省五六成输出 token。
  • Agent 自主编码:省得少,因为大部分输出是代码而非散文。
  • 要交付带温度的解释:别用,它会把礼貌全删。
  • 既心疼 token 又想要结构化:它改一键读完,收益反而更高。

65% 是怎么测出来的

先说清楚这个数的来源,因为它决定了你该信几分。

作者在仓库里放了 benchmarks/ 和 evals/ 两个目录,用真实 Claude API 跑了 10 组对话式 prompt,一组问、一组答,对比默认回复和 Caveman 回复的 token 数:

指标 默认回复 Caveman 回复 节省幅度
平均输出 token 100% 35% 65%
最好的一组 100% 13% 87%
最差的一组 100% 78% 22%

关键在口径:这是一问一答的对话式 prompt,不是一次完整的 agent 自主编码。

后者作者也测了:在整段 agent 编码任务里,大部分输出本来就是代码和工具调用,散文废话占比低,节省只剩 8.5%。

所以 65% 不是骗人,但它特指"散文回复"场景。你拿它去套代码生成的完整流程,会得到一个温和得多的数字。

机制:它到底改了 AI 的什么

Caveman 的安装本体是一组 skill 文件,装进 Claude Code、Codex、Gemini、Cursor、Copilot 等 30 多个 agent 后,等于给系统提示词注入了一组"说话规矩":

  • 删掉客套:不说"当然可以""很好的问题""希望这有帮助"。
  • 删掉转场:不说"首先让我......""总结一下:"这类铺垫。
  • 删掉重复:不把用户问题复述一遍再回答。
  • 用短句和列表:能用箭头链写清依赖关系,就不用长句子。
  • 代码、命令、报错原样保留:压缩只碰散文,不碰技术内容。

安装:一条命令的事

Caveman 的安装脚本会自动扫描你机器上装了哪些 agent,全部装一遍,30 秒内完成,要求 Node 18 以上:

bash 复制代码
# macOS / Linux / WSL / Git Bash
curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash

装完会多出几个斜杠命令,都是"少说多做"的味道:

命令 作用
/caveman-commit 生成 50 字符内的常规提交信息
/caveman-review 每个改动只回一行评审意见
/caveman-stats 显示累计省了多少 token,比如 "143k saved"
/caveman-compress CLAUDE.md 等记忆文件也压成猿语

状态栏还会挂一个 CAVEMAN 计数器,实时显示这一轮帮你省了多少 token,看着它跳比看基金还解压。

必须知道的三个反直觉真相

真相一:它省的是输出 token,不是总成本。

Caveman 只压输出。输入 token(你贴的上下文、代码库、历史对话)一分钱不少,而且它自己的技能文件每轮还要占 1 到 1.5K 输入 token。对本来就很啰嗦的模型,这是净赚;对已经极简的工作流,可能倒贴。

真相二:65% 是散文口径,全流程只有 8.5%。

这是仓库自己标粗的"诚实数字警告"。问答场景平均 65%,agent 编码全流程只省 8.5%,因为代码和工具调用占了大头,没废话可删。

真相三:省钱之外,它还有精度红利。

2026 年 3 月一项研究显示,约束回答长度的提示反而让准确率提高 26 个点。道理很朴素:模型每说一句话都要赌一次,话越少,赌错的窗口越小。

谁该装,谁该躲

  • 重度问答用户(答疑、写文案、查文档):装,这是白捡的。
  • Agent 自主编码主力:省不了多少,但回复更短更聚焦,读起来舒服。
  • 写博客、写书、面向客户的解释:别装,或者只对技术对话开。
  • 团队共享同一套提示词规范:装之前先开会,别让队友以为 AI 突然学会了阴阳怪气。

算一笔账:一年能省多少

拿真实的 API 价格来算。以 Claude 的中档模型为例,输出 token 按每百万个几美元计费。

假设一个重度用户每天产出 50 万输出 token(10 小时高强度使用很常见),一年按 250 个工作日算:

场景 年输出 token 单价 年花费
默认回复 1.25 亿 $12/百万 约 $1500
Caveman 问答口径省 65% 4375 万 $12/百万 约 $525

一年省接近一千美元。如果按 5 人小团队算,这就是一台新 MacBook 的钱。

当然,这是把 65% 套用到全年总输出的乐观口径。把 agent 编码流程的真实 8.5% 折进去,现实数字大概是省两到三成。不管怎么折,它都是正的。

我自己的使用体验

装之前我预期它会把回答变得干巴巴,实际用下来有两个意外:

第一个意外是,删掉客套之后,回答反而更好读了。以前 AI 习惯先复述一遍问题再开始干活,现在直接给结论,信息密度翻倍,扫一眼就知道该干嘛。

第二个意外是,代码质量没有下降。压缩只作用于散文层,代码块、报错信息、命令都是原样保留。该跑不动的测试照样跑不动,该报的错一个不少。

唯一的槽点是它偶尔把"请参考文档"压成"看 doc",遇到不熟的同事会愣一下。但这属于风格问题,不属于质量问题。

什么时候它反而亏钱

诚实数字永远是双向的。Caveman 的文档里特意留了一节 HONEST-NUMBERS,专门讲它什么时候不该用:

场景一:你的输出本来就极简。 如果你已经把提示词调教得很好,模型回复已经很短,那它每轮自带的 1 到 1.5K 输入 token 就成了纯负担,整体可能净负。

场景二:单次小请求不追问。 只发一条小 prompt、不追问、没有上下文缓存命中,它的技能文件成本会吃掉省下的输出。官方自己也承认这种场景不划算。

场景三:你依赖模型的语气写文案。 面向用户的文案、道歉邮件、客服话术,删掉客套等于删掉业务。

判断标准就一句话:你的输出里废话占比高不高。高,就是净赚;低,就是倒贴。

和同类方案的对比

市面上省 token 的办法不止 Caveman 一个,但它选了最省事的一条路:

方案 原理 改动成本 对质量影响
Caveman 改说话风格 一条命令 几乎为零
缓存长会话 减少重复输入 本地代理
精简系统提示词 减少输入 token 人工 需反复调
换更小模型 单价更低 换 API 可能掉精度

对比下来,Caveman 的独特优势是改动成本最低:不换模型、不动业务代码、不引入基础设施,随时装随时卸。

一个值得记住的结论

这轮看完 Caveman,最值得记住的不是 65% 这个数字,而是它揭示的行业趋势:当模型能力竞争进入平台期,开发者开始把注意力转向 token 经济学------同样一件事,怎么用更少的 token 达成。

从压缩提示词、到缓存上下文、再到今天的说话风格压缩,省 token 正在变成一门正经工程。下一个十年,"会省 token"可能和"会写代码"一样,成为工程师的基础素养。

如果你也想省,从今天起记住一句话:让 AI 说人话,就是让 AI 省钱。

写在最后

Caveman 走红的本质,是开发者对 AI 成本的一次集体觉醒:原来我们一直在为 AI 的礼貌买单。

它没有发明任何新技术,只是把"别废话"写进了系统提示词,就撬动了上万个开发者的账单。这提醒我们,在模型能力很难再快速翻倍的阶段,省钱的杠杆往往不在模型,而在你怎么用它

如果你也想试试,装之前先想清楚自己的场景是问答还是 agent 编码,再决定要不要让 AI 学会说人话。

毕竟,省下来的每一个 token,都是你白捡的。

相关推荐
王莹月2 小时前
生图API 从 OpenAI 迁到甜甜圈API 要改多少代码?实测只动一行,还多了 nano banana pro / Veo 3.1
gpt·ai·chatgpt·ai作画·aigc·agi
AI产品库3 小时前
2026年8月双响:ChatGPT免费版文本不限量,Qwen3.8-Max开启开源旗舰时代
chatgpt·开源
顿哥GPT21 小时前
2026年8月更新:ChatGPT与Codex深度实践——从Token消耗到AI编程效率优化,开发者如何管理自己的AI用量(GPT-5.6 最新分享)
人工智能·chatgpt·ai编程
po123op1231 天前
ChatGPT 桌面应用安装| 中文|使用
chatgpt
YH55269841 天前
ChatGPT里的GPT-5.6怎么选?
人工智能·gpt·chatgpt
声网1 天前
Agent-VUI 设计:写在语音智能体的「ChatGPT 时刻」前夜|Voice Agent 学习笔记
笔记·学习·chatgpt
王莹月1 天前
文生图接口的提示词写多长合适?nano banana pro / gpt-image-2 实测长度与负面词
gpt·ai·chatgpt·ai作画·aigc·agi
KH.1 天前
AI翻译PDF保留排版原理:Gemini vs ChatGPT引擎实测对比
人工智能·gpt·ai·chatgpt·pdf·dall·e mini
RAOY的AI笔记2 天前
# ChatGPT Plus 辅助分析 Python 异常堆栈:从日志脱敏到回归测试
gpt·chatgpt