一个把 "说人话" 做成商业模式的 95K Star 开源项目:它让哪怕最矜持的 AI 模型,也学会先把结论甩出来再说。
先问你一个问题:你上一次让 AI 代写一段代码时,它开口第一句是不是 "好的,我来帮你分析一下"?
注意。你为这句话付费了。
这句开场白大约 12 个 token,占单次回复的 3% 到 5%。如果你一天用 50 次 AI,光这种礼貌用语,就白烧了杯咖啡的钱。
这不是拍脑袋。过去两周,GitHub 冒出个叫 Caveman 的 Claude Code 技能,梗是"石器时代说话",干的却是最现代的省钱生意:教 AI 去掉填充词、含糊话、客气话,把输出 token 平均砍掉 65%。
今晚把这个项目扒到底,看它怎么省、能省多少、这个 65% 是不是营销话术。
先说结论,给时间紧的人
只带走一句话:Caveman 不是改模型,只是给 Claude Code 加一个"闭嘴"的癖好,压低回复里废话的占比,输出 token 平均降 65%(官方基准,区间 22% 到 87%)。
它不碰输入 token,不改模型本身,也几乎不动你的代码质量。省的是"客套税",不是"技术税"。
四个典型判断:
- 问答型工作流:收益最大,直接省五六成输出 token。
- Agent 自主编码:省得少,因为大部分输出是代码而非散文。
- 要交付带温度的解释:别用,它会把礼貌全删。
- 既心疼 token 又想要结构化:它改一键读完,收益反而更高。
65% 是怎么测出来的
先说清楚这个数的来源,因为它决定了你该信几分。
作者在仓库里放了 benchmarks/ 和 evals/ 两个目录,用真实 Claude API 跑了 10 组对话式 prompt,一组问、一组答,对比默认回复和 Caveman 回复的 token 数:
| 指标 | 默认回复 | Caveman 回复 | 节省幅度 |
|---|---|---|---|
| 平均输出 token | 100% | 35% | 65% |
| 最好的一组 | 100% | 13% | 87% |
| 最差的一组 | 100% | 78% | 22% |
关键在口径:这是一问一答的对话式 prompt,不是一次完整的 agent 自主编码。
后者作者也测了:在整段 agent 编码任务里,大部分输出本来就是代码和工具调用,散文废话占比低,节省只剩 8.5%。
所以 65% 不是骗人,但它特指"散文回复"场景。你拿它去套代码生成的完整流程,会得到一个温和得多的数字。
机制:它到底改了 AI 的什么
Caveman 的安装本体是一组 skill 文件,装进 Claude Code、Codex、Gemini、Cursor、Copilot 等 30 多个 agent 后,等于给系统提示词注入了一组"说话规矩":
- 删掉客套:不说"当然可以""很好的问题""希望这有帮助"。
- 删掉转场:不说"首先让我......""总结一下:"这类铺垫。
- 删掉重复:不把用户问题复述一遍再回答。
- 用短句和列表:能用箭头链写清依赖关系,就不用长句子。
- 代码、命令、报错原样保留:压缩只碰散文,不碰技术内容。
安装:一条命令的事
Caveman 的安装脚本会自动扫描你机器上装了哪些 agent,全部装一遍,30 秒内完成,要求 Node 18 以上:
bash
# macOS / Linux / WSL / Git Bash
curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
装完会多出几个斜杠命令,都是"少说多做"的味道:
| 命令 | 作用 |
|---|---|
| /caveman-commit | 生成 50 字符内的常规提交信息 |
| /caveman-review | 每个改动只回一行评审意见 |
| /caveman-stats | 显示累计省了多少 token,比如 "143k saved" |
| /caveman-compress | 把 CLAUDE.md 等记忆文件也压成猿语 |
状态栏还会挂一个 CAVEMAN 计数器,实时显示这一轮帮你省了多少 token,看着它跳比看基金还解压。
必须知道的三个反直觉真相
真相一:它省的是输出 token,不是总成本。
Caveman 只压输出。输入 token(你贴的上下文、代码库、历史对话)一分钱不少,而且它自己的技能文件每轮还要占 1 到 1.5K 输入 token。对本来就很啰嗦的模型,这是净赚;对已经极简的工作流,可能倒贴。
真相二:65% 是散文口径,全流程只有 8.5%。
这是仓库自己标粗的"诚实数字警告"。问答场景平均 65%,agent 编码全流程只省 8.5%,因为代码和工具调用占了大头,没废话可删。
真相三:省钱之外,它还有精度红利。
2026 年 3 月一项研究显示,约束回答长度的提示反而让准确率提高 26 个点。道理很朴素:模型每说一句话都要赌一次,话越少,赌错的窗口越小。
谁该装,谁该躲
- 重度问答用户(答疑、写文案、查文档):装,这是白捡的。
- Agent 自主编码主力:省不了多少,但回复更短更聚焦,读起来舒服。
- 写博客、写书、面向客户的解释:别装,或者只对技术对话开。
- 团队共享同一套提示词规范:装之前先开会,别让队友以为 AI 突然学会了阴阳怪气。
算一笔账:一年能省多少
拿真实的 API 价格来算。以 Claude 的中档模型为例,输出 token 按每百万个几美元计费。
假设一个重度用户每天产出 50 万输出 token(10 小时高强度使用很常见),一年按 250 个工作日算:
| 场景 | 年输出 token | 单价 | 年花费 |
|---|---|---|---|
| 默认回复 | 1.25 亿 | $12/百万 | 约 $1500 |
| Caveman 问答口径省 65% | 4375 万 | $12/百万 | 约 $525 |
一年省接近一千美元。如果按 5 人小团队算,这就是一台新 MacBook 的钱。
当然,这是把 65% 套用到全年总输出的乐观口径。把 agent 编码流程的真实 8.5% 折进去,现实数字大概是省两到三成。不管怎么折,它都是正的。
我自己的使用体验
装之前我预期它会把回答变得干巴巴,实际用下来有两个意外:
第一个意外是,删掉客套之后,回答反而更好读了。以前 AI 习惯先复述一遍问题再开始干活,现在直接给结论,信息密度翻倍,扫一眼就知道该干嘛。
第二个意外是,代码质量没有下降。压缩只作用于散文层,代码块、报错信息、命令都是原样保留。该跑不动的测试照样跑不动,该报的错一个不少。
唯一的槽点是它偶尔把"请参考文档"压成"看 doc",遇到不熟的同事会愣一下。但这属于风格问题,不属于质量问题。
什么时候它反而亏钱
诚实数字永远是双向的。Caveman 的文档里特意留了一节 HONEST-NUMBERS,专门讲它什么时候不该用:
场景一:你的输出本来就极简。 如果你已经把提示词调教得很好,模型回复已经很短,那它每轮自带的 1 到 1.5K 输入 token 就成了纯负担,整体可能净负。
场景二:单次小请求不追问。 只发一条小 prompt、不追问、没有上下文缓存命中,它的技能文件成本会吃掉省下的输出。官方自己也承认这种场景不划算。
场景三:你依赖模型的语气写文案。 面向用户的文案、道歉邮件、客服话术,删掉客套等于删掉业务。
判断标准就一句话:你的输出里废话占比高不高。高,就是净赚;低,就是倒贴。
和同类方案的对比
市面上省 token 的办法不止 Caveman 一个,但它选了最省事的一条路:
| 方案 | 原理 | 改动成本 | 对质量影响 |
|---|---|---|---|
| Caveman | 改说话风格 | 一条命令 | 几乎为零 |
| 缓存长会话 | 减少重复输入 | 本地代理 | 无 |
| 精简系统提示词 | 减少输入 token | 人工 | 需反复调 |
| 换更小模型 | 单价更低 | 换 API | 可能掉精度 |
对比下来,Caveman 的独特优势是改动成本最低:不换模型、不动业务代码、不引入基础设施,随时装随时卸。
一个值得记住的结论
这轮看完 Caveman,最值得记住的不是 65% 这个数字,而是它揭示的行业趋势:当模型能力竞争进入平台期,开发者开始把注意力转向 token 经济学------同样一件事,怎么用更少的 token 达成。
从压缩提示词、到缓存上下文、再到今天的说话风格压缩,省 token 正在变成一门正经工程。下一个十年,"会省 token"可能和"会写代码"一样,成为工程师的基础素养。
如果你也想省,从今天起记住一句话:让 AI 说人话,就是让 AI 省钱。
写在最后
Caveman 走红的本质,是开发者对 AI 成本的一次集体觉醒:原来我们一直在为 AI 的礼貌买单。
它没有发明任何新技术,只是把"别废话"写进了系统提示词,就撬动了上万个开发者的账单。这提醒我们,在模型能力很难再快速翻倍的阶段,省钱的杠杆往往不在模型,而在你怎么用它。
如果你也想试试,装之前先想清楚自己的场景是问答还是 agent 编码,再决定要不要让 AI 学会说人话。
毕竟,省下来的每一个 token,都是你白捡的。