从“有多少卡“到“卖多少 Token“:算力的标尺正在换

一个做企业客服的朋友最近卡在一个很实际的问题上:想给客服系统接个大模型,需求不复杂,可预算就是做不出来。他一连问了三个平台,一家按"卡时"报价,一家按"Token"报价,还有一家说"看你调什么模型"。同样一份需求,三家给出的月度成本差了将近三倍。他说,问题不是贵,是不知道该信谁的数字。

这个困惑不是他一个人的。它的背后,是整个算力行业正在悄悄换一把尺子。

一、算力不缺,缺的是"连接"

先看供给端的一组反差。

国内在用智算中心已经超过 500 个,另有近 400 个在建或规划中。头部 AI 公司仍在抢卡,几家大厂几乎"没有一张 GPU 是闲置的"。但另一边,西部某城一座千卡级智算中心,上架率不足 50%,已上架服务器的实际利用率不到 30%,一年光运营成本就超过 3000 万元。行业里比较常见的一个估算口径是,全国智算中心平均利用率只有 20%---30%。

而一座智算中心通常要跑到四成左右的上架水平才能跨过盈亏平衡线。按这条线粗算,500 多座中心里,可能有 250 到 350 座还没走出亏损区。

"搬卡"这门生意的利润也远没有想象中厚。并行科技上半年算力服务收入 8.95 亿元,占总收入九成以上,毛利率却只有 16.97%。另一家做算力网络的润建股份,相关业务收入同比增长五成、自称"Token 工厂"模式已基本闭环,毛利率却只有 6.97%------原因之一,是固定资产投产初期折旧太重。

这几个数字其实说了一件事:GPU 买回来只是开始。卡只要闲着,折旧照样发生。算力中心缺的,往往不是下一批 GPU,而是下一批订单。

二、Token 正在变成标尺,但标尺还没统一

于是行业开始把"算力"重新包装成一种更好卖的东西------Token。

今年 7 月,工信部在普惠算力专项行动中明确提出探索"算力超市""算力银行",支持按"卡时""核时"以及 Token 计费。到 9 月的服贸会,三大运营商干脆把 Token 套餐、词元商店和统一 API 网关摆上了展台:中国电信用单一 Token 账户加统一 API 接口提供模型调用,中国联通把分散算力统一纳管做 Token 调度。地方也没闲着------南京江宁的"算力超市"试运营阶段只有 20 家企业接入,却累计调用模型 130.8 万次、消耗 510 亿 Token;四川雅安的 Token 工厂对外强调了一条很关键的供给原则:"不降档、无路由",意思是实际输出质量要和标称能力对得上。

为什么这句"不降档、无路由"值得单独拎出来?因为它恰好点破了 Token 这把新尺子还没解决的麻烦:同样是"100 万 Token",在不同平台上根本不是一回事。它可能是缓存命中的输入,也可能是未命中的;可能是闲时价,也可能是高峰价;可能来自满血版本,也可能在你不注意的时候被静默路由到了更便宜的小模型上。计量单位统一了,计量口径却仍然各说各话。

三、比单价更该盯的,是"单位任务成本"

有一份来自 AICC 的企业 API 报告提到,过去一年企业 Token 成本同比下降了 67%,其中仅"智能路由"这一项就贡献了 34 个百分点;企业平均同时使用的模型数量,从年初的 2.1 个升到了 4.7 个。这说明降本的主力已经不是"找到最便宜的模型",而是"把对的活派给对的模型"。

但有一个趋势在悄悄抵消这部分收益:模型能力不足带来的重复调用、返工和错误修复,同样会迅速推高 Token 消耗。有开发者拿自己 7 月和 8 月相同调用次数的账单做对比,实际支出涨了接近三倍。所以单位 Token 便宜,不等于单位任务便宜。

对独立开发者和中小团队来说,比较务实的做法有两条。

第一,先把计费口径搞清楚再比价 。缓存命中率、峰谷时段、是否降级路由,这些才决定真实成本曲线,别只盯着标价。这也是不少人开始用 EasyAPI 这类统一入口的原因:不同平台的模型接到同一个接口下,账单也归到一处,口径对齐了,才有可能横向比出真正的单位任务成本。

第二,尽量让调用入口"变薄",别把业务代码绑死在某一家的 SDK 和计费逻辑上。

EasyAPI这类聚合层,换模型时改的是配置而不是业务代码,实测一个新模型也更像换个插槽试手,试错成本低得多。

写在最后

回到开头那位朋友。他最后没有去找一个更"准"的报价,而是把需求拆成"必须用大模型的"和"可以用小模型的"两部分,再分别去比单位任务成本。数字一下就清楚多了。

算力行业下一场竞争,恐怕不是"谁还有更多卡",而是"谁能让闲置的卡多产出一个可收费的 Token"。而对天天用 API 的人来说,功课其实很像:把标称额度拆成可复现的单位任务成本,把调用入口始终留在随时能换的位置。省下的可能不只是几个百分点,而是被锁定之后没有退路的那一部分。

相关推荐
零依赖极客1 小时前
Day 6·1 ARMv8.2 dotprod——vdotq_s32 一条指令做 4 个点积
c语言·开发语言·人工智能·矩阵·arm·vllm
xsd202411181 小时前
Seedance 2导演Skill开源:让AI Agent变身视频创意总监
人工智能
冬奇Lab2 小时前
DeepSeek Harness 系列(05):Session 与记忆——对话历史是怎么活下来的
人工智能
DogDaoDao2 小时前
SimToolReal 解读:用“物体中心“视角重新定义灵巧工具操作
人工智能·机器人·github·关键点·人形机器人·gpt-4o·simtoolreal
冬奇Lab2 小时前
一天一个开源项目(第216篇):OpenViking - 给 AI Agent 装上可自进化的上下文数据库
人工智能·开源·资讯
移动云开发者联盟2 小时前
中国移动发布全链条算力服务成果
大数据
一切皆是因缘际会2 小时前
从存量释放
人工智能
Xuantong_902 小时前
从 0 到 1 搭建本地 AI 工作环境:我的完整方案与经验总结
人工智能
晓窗科技2 小时前
口碑好的AI基座服务商
大数据·人工智能·python