省 Token 的文章很多,教你砍 Rules、用 @、换模式。但若没有观测,你不知道哪一刀真有效------很容易陷入「这周换了模型,下周又觉得贵」的轮回。本文不重复四步省 Token 操作清单,而做一件更基础的事:把会话成本结构拆开,建成个人能坚持的降本仪表盘。
说明:不同产品对用量的展示字段不同;下列拆分为工程定性模型,不是某厂商官方账单公式。有官方用量时,把它当作校准源;没有时,用结构化笔记也能做对照实验。

摘要
- 先拆结构:前缀、工具、历史、生成,四块分开看。
- 再贴标签:任务类型与模式(Ask/Agent/Manual)。
- 对照实验:改配置前后用同一类任务采样。
- 只留有效杠杆:仪表盘驱动每周一个改进。
- 不编造单价:涉及钱只引用官方,个人表可用「低/中/高」档。
结论:降本是测量问题,其次才是技巧问题。不会观测,就只会迷信。
结论卡
| 块 | 常见来源 | 观测抓手 | 优先动作 |
|---|---|---|---|
| 前缀 | Rules/系统/摘要 | Always 行数 | 砍到一屏 |
| 工具 | MCP schema/结果 | 启用数、调用次数 | 按需加载 |
| 历史 | 长线程回灌 | 是否新会话 | 阶段切换 |
| 生成 | 回答与补丁 | 是否废话过长 | 约束输出格式 |
背景与边界
与「隐形税」观点文、省 Token 操作文分工:观点讲为什么;操作讲怎么改;本文讲怎么知道改没改对。不承诺第三方插件的精确度;不提供绕过计费或盗用额度的方法。

原理:为什么「最后几行生成」常常不是大头
一次请求里,模型看到的往往包括:系统与 Rules、工具定义、历史消息、工具结果、然后才是你的新问题与它的新生成。个人体感上「它回得好长所以好贵」,但工程上更常见的是:每轮都带的前缀与工具税,乘上多轮探索。 观测的第一目的,就是防止你砍错对象------例如拼命让它「回短一点」,却留下百科 Always。

仪表盘五步

步骤 1:定义任务标签
最少三类:ask-设计、agent-修测、agent-重构。可加 mcp-重、docs-长。标签稳定比细腻重要。
步骤 2:采样频率
每周固定采样 6--10 次真实任务,不要只采样「今天心情好写的 Demo」。记录时间(Asia/Shanghai)。
步骤 3:填写结构字段
见下表。没有官方 token 数时,用主观档:低/中/高,但必须同时填结构字段,否则主观档不可比。
步骤 4:对照
只改一个变量(例如 Always 砍半,或禁用两个 MCP),用同类标签任务各采 3 次对比。
步骤 5:每周一个动作
仪表盘的输出不是漂亮图表,而是「本周唯一改进」。例:把发版清单移出 Always。
个人记录表示意

| 字段 | 示例 |
|---|---|
| 日期 | 2026-10-05 |
| 标签 | agent-修测 |
| 模式 | Agent |
| Always 行数 | 40→18 |
| MCP 启用数 | 5→2 |
| 是否 @ 精确 | 是 |
| 是否新会话 | 是 |
| 主观用量档 | 中 |
| 官方用量备注 | (可选粘贴区间) |
| 本周动作 | 禁用以备不用的浏览器 MCP |
可用表格:Notion / 飞书 / 本地 CSV 均可。不要一上来上复杂 BI。
CSV 头示例:
text
date,tag,mode,always_lines,mcp_count,precise_at,new_session,usage_band,note,weekly_action
如何「拆」一轮会话(实操)
- 发请求前:看将注入的 Rules / 工具是否多到吓人。
- 结束后:数工具调用次数;是否反复全文搜索。
- 看历史:是否在同一脏线程里修了三类无关 bug。
- 看生成:是否要求了结构化短输出仍长篇说教------若是,先改提示与 Rules,再怪模型。
若产品 UI 提供用量细项,把细项映射到四块;映射不了就诚实写「未知」,不要假装精确。
对照实验设计(最小)
假设:砍 Always 能降低 ask-设计 的主观档。
方法:砍前采 3 次,砍后采 3 次,其它习惯不变。
成功:后测「高」档次数下降,且答案质量不降(用同一检查清单评分)。
失败:档位不变 → 可能贵在工具或历史,换下一刀。
与操作技巧文的衔接
观测指出「前缀型浪费」→ 去执行 Rules 工程化。
观测指出「工具型浪费」→ 去管 MCP 启用与 resources 化。
观测指出「历史型浪费」→ 阶段切换与交接模板。
观测指出「生成型浪费」→ 约束输出格式、Ask 分流。
没有观测,技巧文容易变成教条。
踩坑
| 坑 | 结果 | 处理 |
|---|---|---|
| 只看账单总额 | 不知砍哪 | 拆结构 |
| 同时改五个习惯 | 无法归因 | 单变量 |
| 只采样 Demo | 偏差 | 真实任务 |
| 追求绝对 token 数 | 工具不足就放弃 | 先用档+结构 |
| 仪表盘不驱动动作 | 变成日记 | 强制每周一刀 |
验收
- 能回答:「上周最贵的习惯是什么?」
- 连续两周有「唯一改进」记录。
- 至少一次对照实验有结论(有效/无效)。
- 未在文中或表中编造官方单价。
练习
导出或手建一张 CSV,完成本周 6 次采样,并写一句:下刀砍前缀、工具还是历史。
团队版仪表盘怎么缩小范围
团队不必共享每个人的主观「心情档」。共享三样即可:Always 行数分布、各仓库默认 MCP 列表、每周一次「最贵任务」复盘纪要。个人表仍保留在本地。谁要推动规范变更,用对照实验说话,不用音量。
当官方提供用量 API 或导出时
把导出字段映射到你的四块;保留原始文件;在 CSV 增加 official_input/official_output 列。仍然同时记录结构字段------否则换型号后你仍不知道习惯有没有变。API 字段以官方文档为准,本文不臆造端点。
采样时的隐私
不要把客户代码、密钥、内网 URL 粘进共享表。标签与结构字段足够。若必须存提示词片段,脱敏后再存,并限制访问。仪表盘是为了降本,不是为了再建一个泄密渠道。
两周迭代日历
第 1 周:只建立表与采样,不大改配置。第 2 周:根据众数浪费类型砍一刀并对照。第 3 周:把有效动作写进公约或 Rules。若第 1 周就同时重构 Rules+MCP+模型,你得到的是故事,不是数据。
样本任务库(避免每次临场找题)
预先列 8 个真实小任务标签化:两个 Ask 设计、三个修测、两个重构、一个文档整理。每周从中抽,保证对照实验的任务可比。任务描述不含客户敏感数据。
何时升级「团队仪表盘」
当两名以上成员都完成个人表,且都指向同一浪费类型(例如 MCP 过多),再在周会上做一次联合动作。过早上团队大表容易变成填表表演。
四类浪费的识别口诀
前缀型:无关任务也在说教。工具型:工具定义长、调用碎、结果巨。历史型:同一线程修了三类无关问题。生成型:短问题长作文且无结构。先对号入座,再选刀法。口诀可以贴在显示器下沿,采样时快速标注。
个人 CSV 一周示例行(示意)
不必真实填数量,只示范字段如何写:日期、标签 agent-修测、模式 Agent、Always 行数 18、MCP 数 2、精确 @ 是、新会话 是、用量档 中、备注「禁用浏览器 MCP 后」、本周动作「禁用」。三行这样的记录,已经比空喊降本强。
团队共享什么、不共享什么
共享:Always 行数分布、默认 MCP 列表、每周最贵任务类型。不共享:完整提示词、客户代码、密钥。谁提案改规范,谁出示对照实验。音量不能代替数据。
常见自欺语句拆穿
「我感觉已经很省了」------打开表。
「都是模型太贵」------先看 Always 行数。
「采样太烦」------每周六次,每次一分半。
「没有精确 token 就没法做」------结构字段 + 档位仍可对照。
「改了好多处应该有效」------单变量,否则无法归因。
小结
Token 降本的第一步不是更狠的技巧,而是看得见的结构。前缀、工具、历史、生成------拆开、贴标签、做对照、每周一刀。仪表盘足够简陋,只要能阻止你砍错对象。