用 Claude Code 写代码、干活,爽是真爽,但额度也是真不经用。
同样一个任务,有人半天就把额度耗光,有人一整天都够用。差别往往不在"用得多不多",而在"会不会用"。
这篇分两部分:先用 6 招让每一个 token 都花在刀刃上(额度更耐用),再用 1 个作息技巧让满额度正好落在你最忙的时候。不堆术语,小白也能看懂。
先从最根上的东西说起------
一、先搞懂:钱是按 token 算的
你发给 AI 的每句话、AI 回你的每段话,都会先被切成一小块一小块,每块叫一个 token。用掉的 token 越多,花的越多。
这里有个几乎人人会犯的误会:以为 AI 会"把你话里的关键词挑出来、把废话扔掉"。并不会。 你说的每个字,哪怕是口水话,都会被原样切成 token,一个不少。
那"切"是怎么切的?看图就懂:
它不是理解你的意思再切,而是拿你的话去查一本提前做好的"常用词打包表":表里有的词,一整块算 1 个 token;表里没有的,只能一个字一个字硬拆,一个字顶好几个。
记住这个"查表"机制,下面很多招都从这儿来。
二、一个关键认知:AI"回话"比"听话"贵得多
同样是 token,还分两种:
你发进去的叫输入 token,便宜;
AI 吐出来的叫输出 token,贵------在 Claude 上大约是输入的 5 倍价。
而且注意:AI 给你最终答案前,会先在"心里"想一大段,这段思考即使不显示给你,也算输出 token、照样收费。
所以省钱的核心思路就一句话:让 AI 少想、少说、少返工。
下面 6 招,都围绕这个。
三、省 token 的 6 招
招 1 · 说中文,就优先用国产大模型
回到那本"常用词打包表"。
用大量中文训练的模型,表里塞满"社区""我们"这类常见词,切中文又快又省;几乎只学过英文的模型,遇到中文只能一个字一个字硬拆,同一句话切出的 token 多一大截,钱也多花一截。再加上国产模型单价普遍更低。
注意:不是国产模型"更懂中文语法",而是它"见过的中文多、打包得好"。原理还是查表。
招 2 · 把话说清楚,反而更省钱(反常识)
这条最反直觉:发得越多,不是切出的 token 越多吗?恰恰相反。
说得含糊("帮我优化下这个")→ AI 得先猜你想干嘛、反复试、错了还重来,这一通猜和返工烧的全是贵的输出 token。
说得清楚("把这个函数里的循环改成 map,变量名不动,不要动注释")→ AI 一看就懂,一步到位。
你多打的那几十个字是便宜的输入,省下的却是贵的思考和返工。
一句话:宁可多写两句,也别让 AI 靠猜。
招 3 · 把不变的放前面,用好"缓存"
AI 有个省钱机制叫缓存:如果这次请求的开头一大段和上次一模一样,这部分能直接复用,只按原价的 10% 收费。
它靠"前缀匹配"------从头一个字一个字往下比,位置和内容完全相同的整段才算命中。
所以用法就一条:固定不变的放最前面,经常变的放最后面。 每次都要带的长文档、固定规则放最前,它们每次都能命中缓存、只花 1 折;你真正变化的那句提问放最后。
好消息:正常聊天时只要不改前面说过的话,前面的对话历史每轮都会自动命中,这部分不用操心。
招 4 · 对话太长,及时 /compact
聊得越久,每轮都要把前面所有内容重新带一遍,越来越沉、越来越贵,AI 还会开始"记不清"早前细节。这时敲一个命令:/compact
它会把前面一大段对话压成一段摘要:AI 还记得"做过什么",但啰嗦细节被折叠了。
体积一下小下来,后面接着聊就省很多。代价是丢掉部分细节,所以在"一个阶段告一段落"时压最合适。
招 5 · 定几条规矩,不让 AI 说废话
AI 天生爱铺垫:"这是个很好的问题""当然可以!下面我来为您详细讲解......"------全是白花的输出 token。
在项目的 CLAUDE.md 文件里立几条规矩,一劳永逸:
默认中文回复;代码、命令、变量名、文件路径保持英文
结论先行,简洁直接,不先铺垫背景
不客套,不夸"这是个好问题",不以"当然可以"开头
有问题直接指出,有更好的做法主动说
补一句:让 AI 输出 JSON 主要是为了"能被程序读、格式统一",不一定更省 token;真正砍钱的是上面这几条风格规矩。
招 6 · 工具按需加载,别一股脑全开
Claude Code 能调用很多工具(联网、读文件、跑命令......),每个工具的"说明书"都要塞进请求、按输入 token 收费。
一上来全加载几十个、大半用不上,是白花钱。用到哪个才加载哪个------新版本很多工具已经是"用到时才去取说明书",能省下不少。
四、进阶:跟 5 小时窗口"打时间差",把额度榨干
前面 6 招是让每个 token 更值钱;这一招是让额度在对的时间到位。
Claude Code 的额度是按 5 小时的滚动窗口来的:从你发第一句话开始计时,这个窗口管 5 小时;5 小时一过,下次发消息就开一个新的满额窗口。
不同套餐(Pro / Max)的具体额度和规则会有差异,Max 还有每周上限,这里只讲"5 小时窗口"这个通用机制。
多数人的问题是:上午额度用不完(浪费),下午一忙就不够用。我的做法是用作息去卡窗口的边界:
,把第一个窗口"点着"(可以设个闹钟,一句话就行)→ 窗口 1 覆盖 7--12 点,上午本来用得少,没关系。
,开第二个窗口 → 窗口 2 覆盖 12--17 点。而 12--14 点正好午休、基本不用,等你 14 点回来,这个窗口还是满的,全力干到 17 点。
17 点窗口 2 到期,窗口 3 自然覆盖 17--22 点的晚上。
这样一算:你把"上午用不满"的额度让给了午休时段去"垫底",下午(14--17)和晚上(17--22)各拿到一个满额窗口------相当于最忙的下半天有两倍的额度可用。
关键就一句:别等到你真正忙起来才开第一个窗口,早上先把它点着,中午再借午休重开一次。
最后,一句话心法
用便宜的输入把话说足,让 AI 少想少返工;再让满额窗口正好落在你最忙的时候。
省 token 不是"少说话",而是"把话说到点子上、把额度用在刀刃上"。