先看一个反常现象
新一代旗舰模型 GPT-6 Astra 上线后,关于能力的讨论已经很多。但真正把它接入日常工作的人,普遍先撞上另一件事:它聪明很多,消耗也快得多------同样的任务量,消耗速度超过上一代 5.6 Sol 的两倍。
变强与变贵同时发生,问题的重心随之转移:当能力不再稀缺,用量管理反而成了用好它的第一道门槛。

对企业来说,这不是程序员圈子的技术话题,而是实实在在的成本话题。当 AI 从"尝鲜工具"变成"生产工具",每一轮对话、每一次调用、每一份喂进去的资料,都在产生账单。
这篇不做配置清单,只讲 3 个判断。它们决定企业的 AI 投入,是花在刀刃上,还是花在看不见的地方。
判断一:模型不是越强越好,成本要按任务分层
先看一组开发者实测的数据:同一款强模型,用低档位跑简单任务,比高档位省下约一半的 token,准确率只损失 1%--3%;而低档位跑出来的效果,仍然好过旧款模型的最高档位。
这背后的逻辑值得企业认真看:大模型的能力存在明显溢出,大多数日常任务根本用不到最高档位 。成熟的行业做法是任务分级:客服问答、资料抽取这类轻量任务走轻档位,方案初稿、文档处理走中档位,只有复杂规划与架构级分析才动用重档位。
判断二:喂给模型的上下文,决定 AI 的账单
开发者圈最新的共识是:不要再把"所有资料都塞进上下文" 。强模型对冗余信息更敏感------塞得越杂,token 浪费越多,回答还容易跑偏。新的做法是开启上下文管理,用"笔记 + 窗口"的方式跨会话保留关键信息,细节丢得更少,token 消耗还能再省三分之一。
这个经验搬到企业,就是知识治理:AI 之前,先治理。很多企业把文档一股脑导入系统,旧版本、重复内容、口径不一的信息互相打架,模型不知道该信谁。
给 AI 喂资料前,建议先过 3 道工序:
-
去重去旧:只保留最新版本,删掉过时口径
-
结构化:把散落文档整理成问答、条目等机器易读的形态
-
口径统一:同一件事,全网只保留一套说法
知识库质量越高,AI 越愿意采信,产出越稳定------这正是 AI 时代企业"信源资产"的价值起点。
判断三:企业要把"使用规则"变成 AI 能读的资产
开发者圈还有一个正在发生的变化:大家开始重写 AGENTS.md、精简 Skills。原因是过去为了"管住弱模型"写下的长篇指令,强模型读来反而变成束缚 ;新原则是渐进披露、按需加载------只让模型在需要时读取相关部分,而不是一上来通读全部。
对企业而言,这套思路对应的是把使用规范沉淀成资产:规则越简洁、越贴近真实业务,AI 的执行质量越高。这和企业信息资产的建设逻辑完全一致------少而精,优于多而杂。
写在最后
模型能力越强,对企业信息质量和使用方式的要求就越高。省 token 的本质不是抠成本,而是让每一分钱都花在"被正确理解、被准确引用"的信息上 。AI 成本治理,正在成为企业数字化的下一道门槛。