凌晨两点,我被一串告警吵醒。1688 API 批量报错,订单同步服务停了两小时。查日志才发现,夜间抓取任务太密集,把接口限流给打爆了。最后塞了个消息队列进去,削峰填谷,服务才算稳下来。
这种事在系统里很常见,但放在大模型API调用上,代价就变成了实打实的账单。算力调用正在从粗放按量计费,走向精细化的峰谷调度。
DeepSeek 的峰谷定价,8月17号生效。高峰时段放在北京时间9点到12点、14点到18点,闲时价格是高峰的一半。V4-Flash 输出闲时4.5元、高峰9.0元每百万token,V4-Pro 高峰缓存命中输入价格涨了12倍。谷歌那边也把 Gemini 3.7 Flash 半价挂到了年底。高盛研报的说法是,涨价说明需求旺、算力紧。
算力正在变成水电煤。过去厂商为了拉开发者,亏本赚吆喝。现在需求爆发,GPU不够用,就得靠价格杠杆把算力往闲时赶。闲时空着也是空着,便宜卖。高峰挤不动,涨价劝退低价值请求。
对技术团队来说,任务调度器得重新设计。非实时的推理任务,扔到闲时跑。后端系统得有能力感知时间、感知路由。高优的实时交互走高优通道,低优的批量清洗任务丢进闲时缓冲池。这套机制对状态追踪的要求不低。
模型路由和切换,成了新话题。支付巨头 Stripe 传出要拿70多亿美元收购 OpenRouter,后者每月处理200万亿以上token,抽成约5%。这笔交易买的,是AI推理支付的结算权。价格战打到底,收租才是正经生意。
OpenRouter 聚合了500多个模型、80多家供应商,路由层的负载均衡和容灾是它的核心壁垒。开发支持峰谷策略的网关,眼下是刚需。业务优先级不同,成本与延迟的取舍就不同。主模型在高峰期限流报错时,网关得能把请求转发给备用模型。
下面是一段模型路由分发的逻辑,按当前时间与任务优先级来决定调度策略:
python
import datetime
def get_pricing_strategy():
now = datetime.datetime.now()
hour = now.hour
if (9 <= hour < 12) or (14 <= hour < 18):
return "peak"
return "off_peak"
def route_llm_request(prompt, priority):
strategy = get_pricing_strategy()
if strategy == "peak" and priority == "low":
return {"model": "deepseek_v4_flash", "queue": True, "retry": 3}
elif strategy == "peak" and priority == "high":
return {"model": "deepseek_v4_pro", "queue": False, "fallback": "gemini_flash"}
else:
return {"model": "deepseek_v4_pro", "queue": False, "retry": 1}
逻辑很简单:高峰期用便宜快的模型,低优请求排队,高优请求保留高精度并降级兜底。这套设计就是冲着峰谷定价去的。
中国开源模型在 OpenRouter 上的份额,从2024年底不足2%涨到了63.5%。DeepSeek V4 Flash 的价格,只有部分闭源竞品的一百多分之一。成本塌方是真实发生的事。
跨境业务里,系统对接讲究务实。像代购这种,商品详情抓取、多语言翻译、客服自动回复,每个场景对延迟和成本的敏感度都不一样。商品详情是离线活,闲时扔给开源模型跑就行。实时客服不行,高峰期也得用高精度模型,延迟不能垮。像 Taocarts 这类做跨境代购和集运的独立站系统,从下单采购到仓储合包再到国际物流,链路拉得很长,系统必须看清楚每个节点的属性,再把算力分配合适。
开源模型给这种精细化分配铺了路。Airbnb 混用中国开源模型,Lindy AI 换模型后成本降了约90%。技术选型已经不看跑分了,看的是实际投产比。中小玩家专注应用层,吃开源模型和峰谷定价的红利,是眼下务实的活法。
算力的价格战升级成了价格制度战。基础设施的定价逻辑,正在重塑整个行业怎么选技术。想了解这类海外好物怎么买,可以关注我们。