45%的AI流量已转向中国开源模型:K3登顶那天,账要重新算了
2026年7月7日,CNBC发布了一项调查,数据来自全球最大的AI模型路由平台OpenRouter。结论只有一句话:自2月8日以来,中国开源模型每周至少吃掉该平台30%的企业Token调用量,峰值触及46.4%。
这是什么概念。一年前的2025年上半年,这个数字是4.5%。再往前,2024年10月,中国模型在OpenRouter的流量占比只有1.2%。18个月,市场份额翻了40倍。
同一时间,美国三大实验室OpenAI、Anthropic、Google的合计份额,从约70%跌到约30%。deepseek一家16到17个百分点的周Token量约5.13万亿,Qwen约2.77万亿。两家中国开源模型加起来,已经超过了任何一个美国闭源厂商。
这是《AI下半场:Agent淘金热》系列第四篇,进入全新Phase:开源逆袭篇。前三篇讲的是Agent的成本黑洞,Token账单怎么爆炸、怎么失控、怎么让CFO失眠。这篇开始回答那个所有人都在问的问题:账单这么贵,有没有别的路。
答案是,全球开发者已经用真金白银投了票。而且这次投票的方向,指向中国开源模型。
一、18个月的流量逆转:从1.2%到46%
1.1 OpenRouter是什么,为什么它的数据可信
先解释一下为什么OpenRouter的数据值得当风向标。
OpenRouter是一个统一API网关,开发者接一次它的接口,就能调用全球400多个模型,从OpenAI、Anthropic、Google到DeepSeek、Qwen、Kimi。它目前服务超过800万开发者,2026年5月的周Token处理量从5万亿暴涨到25万亿,五个月翻了5倍。
因为它聚合的是开发者真实的付费调用请求,没有问卷调研的水分,没有发布会PPT的滤镜。每一枚Token都是花钱买出来的。所以它的流量分布,就是全球开发者真实选择的实时晴雨表。
顺带一提,这个晴雨表本身刚刚被资本盖章。2026年8月16日,彭博社独家披露,支付巨头Stripe以超过70亿美元收购OpenRouter,比它5月B轮的13亿美元估值翻了5.4倍。一家支付公司花70亿买一个模型路由平台,买的当然是AI调用流量的入口。这个细节后面还会展开。
1.2 流量迁移的完整曲线
把CNBC调查、Mozilla报告和多家英文科技媒体的数据拼起来,能看到一条陡得惊人的曲线。
| 时间点 | 中国模型流量占比 | 事件背景 |
|---|---|---|
| 2024.10 | 1.2% | 边缘玩家 |
| 2025.H1 | 4.5% | DeepSeek R1刚出圈 |
| 2025全年均值 | 11% | 企业开始试探 |
| 2026.02.08起 | 每周不低于30% | 跨过临界点 |
| 2026.04 | 峰值46.4% | 六个中国模型排名超过Claude |
| 2026.07 | 45%到51%区间 | 周调用量连续14周超过美国闭源总和 |
来源:CNBC调查2026.07.07,santageai.com,technologypulse.app,metirai.com
几个更细的切片。
Financial Times的分析显示,OpenRouter上流量最高的9个模型里,中国开源模型每周处理约18万亿Token,美国模型约5.5万亿,比例超过3比1。
按厂商拆,截至2026年7月,OpenRouter周Token量的格局是:DeepSeek约16.5%排第一,Qwen约13.9%排第二,Google约12.5%,Claude约13.3%,OpenAI约8.4%。更扎眼的是,有六个中国模型(DeepSeek、GLM-5.2、Qwen、Kimi K2.6、MiniMax-M3等)的调用量都排在了Anthropic的Claude前面。
注意一个关键限定:这是Token量口径。按请求次数算,美国闭源厂商仍然领先。中国开源模型吃掉的流量集中在编程和Agent工作负载,恰好是Token消耗最大、成本敏感度最高的场景。也就是说,在开发者最在乎成本的那部分市场里,迁移已经发生了。
1.3 份额的另一面:美国模型从70%跌到30%
份额的转移从来都是零和的。
2025年6月,Google、OpenAI、Anthropic三家合计占OpenRouter约70%的Token量。到2026年7月,这个数字跌到约30%。
一年时间,主导权易手。没有发布会,没有口水战,就是无数开发者在路由配置里默默改了一行模型名称。Santage的分析说得准确:这种侵蚀是静默的,因为它是财务团队驱动的,竞争对手连还手的抓手都找不到。
二、K3登顶:开源权重第一次踩下闭源旗舰
流量数据讲的是钱。2026年7月16日,另一件事讲的是能力。
2.1 1679分对1631分
当天,月之暗面发布Kimi K3,总参数2.8万亿,号称迄今最大的开源权重模型,权重定于7月27日公开下载。
在Arena的Frontend Code Arena前端编程盲测榜上,K3以1679分空降第一。第二名是长期霸榜的Anthropic Claude Fable 5,1631分。第三名OpenAI GPT-5.6 Sol,1618分。
这个榜单测的是真实网页开发任务。两个匿名模型各交一份代码,用户在不知道模型身份的情况下投票选更好的那个。盲测机制削掉了品牌光环,剩下纯手活。K3在7个细分场景里赢了6个,包括品牌营销页、参考设计还原、数据可视化、消费产品、模拟、内容工具,只在游戏场景输给了Fable 5。
48分的差距,是明确反超,不是侥幸擦线。
2.2 从第18名到第1名
更有信息量的是上一代的位置。Kimi K2.6在这张榜上排第18名。一代产品,从第18跳到第1。
Vercel CEO Guillermo Rauch的评价是:这是第一个在高端评测中击败所有专有模型的开源模型。Mozilla CTO Raffi Krikorian对Axios说得更直白:美国实验室显然在担心。
当然要泼冷水。Moonshot自己承认,K3的综合能力仍落后于Fable 5和GPT-5.6 Sol Max,K3的盲测样本量也比Fable 5少约750份,排名存在回落可能。开源的领先目前集中在编程这类高价值垂直场景,通用推理、长上下文检索、复杂Agent任务上闭源仍有优势。Mozilla报告把这个现象叫锯齿状前沿:平均差距3.3%,但前沿是参差的。
2.3 每美元能买多少能力
单看分数还不够,编程场景真正在乎的是性价比。
DeepSWE软件工程基准上有个指标叫每100美元解决的任务数:K3解决14.7个,GPT-5.6 Sol解决8.2个,Claude Fable 5解决5.3个。K3的金钱效率是Fable 5的2.8倍。
K3的API定价是每百万Token输入3美元、输出15美元,缓存命中输入只要0.30美元,等于打了九折的缓存策略。而它的对手里,GPT-5.5输入价格是每百万5美元,Claude Fable 5更贵。能力接近,价格腰斩,这就是采购决策的全部理由。
写到这里,趋势已经清楚了:开源模型在最能烧钱的编程场景里,能力和价格同时到位了。
但故事只讲了一半。还有三个关键问题没有展开。
第一,价格差到底有多大,为什么60%到90%的成本优势能让CoinBase把AI支出砍半、让Lindy把100%流量从Claude迁去DeepSeek、让Stripe把5000万日请求切到开源模型省下73%成本。这背后的采购逻辑值得每个团队抄作业。
第二,开源模型现在到底哪些场景够用了,哪些场景还不够。Mozilla那份950人调查给出的三个够用了和三个还不够,是2026年做技术选型最值钱的参考。
第三,也是最容易踩坑的:具体到你自己,个人开发者、小团队、企业、极致性能追求者,四类角色的选型决策树完全不同。选错了,省钱变烧钱。
以下内容为粉丝专属。包括2026年开源模型天梯图、四大企业迁移案例的完整拆解、三够用三不够清单、以及一张可以直接照抄的选型决策树。
以上为免费试读部分。以下内容仅对粉丝可见,关注后即可阅读全文。
三、钱在说话:60%到90%的价差如何改写采购逻辑
3.1 一个数量级的价格差
先看最直接的价差。
2026年6月的价格:DeepSeek V4 Flash每百万Token输入0.14美元。OpenAI GPT-5.5每百万Token输入5美元。35倍。
CNBC调查给出的整体判断是:中国开源模型的运行成本比OpenAI和Anthropic的旗舰产品便宜60%到90%。Mozilla报告补充了宏观曲线:GPT-4级别能力的推理价格三年降了50倍,从每百万Token约20美元跌到约0.40美元。
结合本系列第三篇讲过的成本黑洞:Agent工作负载的Token消耗是聊天机器人的5到30倍。两件事叠加就是,越是Agent用得重的团队,价差的绝对金额越大,迁移的动力越强。这解释了为什么迁移集中在编程和Agent场景。
3.2 四个可以抄作业的案例
Coinbase:1200个AI Agent跑在中国模型上,AI支出砍半。 这家美国金融科技公司的技术团队属于全球最挑剔的一批买家,他们先用小流量验证质量,确认够用之后批量迁移,最终AI总支出降低约50%。
Lindy:100%流量从Claude迁移到DeepSeek。 这家做AI Agent自动化平台的公司没有留后手,全部推理流量切换。对一家Agent创业公司来说,模型就是它的核心成本项,敢全量迁移说明质量验证做到了位。
Stripe:5000万日请求切到开源路径,成本降73%。 支付巨头把每日5000万次请求迁到开源权重模型,省下73%成本。更妙的是它随后花70亿美元收购OpenRouter,把模型路由入口也握在了手里。从省钱到买下省钱的管道,这是一条完整的战略路径。
Ramp供应商指数:DeepSeek登顶。 Ramp追踪企业信用卡和报销支出,DeepSeek近期成为其指数上排名第一的热门软件供应商。从沙盒试验到出现在正式报销单上,这一步意味着采用变成了采购。
四个案例的共同点值得记住:没有一家是闭着眼睛迁移的。都是小流量验证、质量确认、批量切换的三段式。开源迁移省的是Token钱,花的是验证功夫。
3.3 Microsoft和Uber的转向
Mozilla报告还点了一个趋势:Microsoft和Uber正在重新评估对付费闭源AI工具的依赖,账单越垒越高是直接原因。Uber四个月烧光全年AI预算的故事本系列第一篇讲过。而Microsoft在测试用DeepSeek跑Copilot的部分工作负载。
对国内读者还有一层:这场流量逆转里的最大赢家模型,DeepSeek、Qwen、Kimi、GLM,全都可以直接调用官方API,也可以下载权重自己部署。全球开发者在抢的红利,中国开发者的获取门槛最低。
四、开源的三个"够用了"
Mozilla 2026年7月14日发布的首份《State of Open Source AI》报告,基于全球950多名开发者的调查和公开基准数据,是目前关于开源AI现状最权威的一份摸底。结论先行:开源与闭源的能力差距,从2024年初的8.04%缩小到2026年3月的3.3%。
三个已经够用的场景。
第一,代码生成。 K3在Frontend Code Arena登顶,DeepSeek V4 Pro编程基准54/60分逼近闭源旗舰,Mozilla确认开源在编程任务上已达到或接近持平。而编程恰好是AI使用量最大的场景。
第二,指令遵循与通用知识问答。 Mozilla数据显示开源在这两项与闭源基本持平。RAG文档处理、结构化输出、客服问答,这些占企业AI调用量大头的任务,开源模型的差距已经小于用户能感知的阈值。
第三,垂直场景微调。 用行业数据微调后的开源模型,在客服、数据分析、领域文本任务上效果不输闭源。而且微调权重归自己,不用担心供应商改接口、改价格、改服务条款。
一个简单的判断标准:如果你的任务失败一次重试一次没什么大不了,开源几乎总是对的。如果任务失败一次代价惨重,往下看第五节。
五、开源的三个"还不够"
第一,深度推理与复杂Agent任务。 Mozilla的锯齿状前沿描述里,3.3%的平均差距掩盖了结构性的短板分布。差距集中在推理、长上下文检索、多步Agent任务,恰好是闭源实验室砸预算的前沿方向。超长链条的自主Agent、复杂多步推理,闭源旗舰仍然更稳。
第二,生产部署的基础设施。 79%的开发者在用开源模型,但只有51%真正上了生产环境,闭源模型的这个数字是63%。这28个百分点的差距,Mozilla归因于部署基础设施不成熟、安全合规成本、维护复杂度,而非模型质量。翻译一下:模型够好了,伺候它的工具链还不够好。这是下一篇(第06篇,79%用开源但51%上生产)要专门拆的问题。
第三,服务与责任的兜底。 闭源API出了问题有厂商工单、有SLA赔付。开源权重自己部署,凌晨三点推理服务崩了,值班电话打给谁,打给你自己。开源换来的是控制权,付出的是运维责任。
还有一条要警惕:开源不等于免费。权重免费,GPU不免费,运维人力不免费,微调数据更不免费。Mozilla报告里那个最刺眼的数据是,开源模型承载了约三分之一的真实AI使用量,却只拿到约4%的收入。价值在流动,钱没有跟着流回开源生态。这个错配长期怎么演化,值得持续观察。
六、2026年开源模型天梯图
按2026年7月的公开数据整理,供参考。
| 模型 | 厂商 | 关键参数 | 亮点 | 短板 |
|---|---|---|---|---|
| Kimi K3 | 月之暗面 | 2.8T参数,开源权重 | 前端编程盲测第一,长程Agent优化,每美元效率2.8倍于Fable 5 | 综合能力仍落后Fable 5与Sol Max |
| DeepSeek V4 Pro/Flash | DeepSeek | 权重公开 | OpenRouter第一大供应商,编程与数学强,Flash仅$0.14/M | 峰谷定价后高峰成本上升 |
| Qwen 3.6 Plus | 阿里 | 开源权重 | 多语言最强,周Token量13.9%全球第二 | 前沿推理略逊旗舰闭源 |
| MiMo-V2-Pro | 小米 | 1M上下文 | OpenRouter用量第一,编程流量占25.5% | 智能指数榜排第10,量能倒挂 |
| GLM-5.2 | 智谱 | MIT许可 | 编程场景热门,国内生态成熟 | 国际流量份额有限 |
对照组:Claude Fable 5(综合最强,最贵)、GPT-5.6 Sol(均衡,$5/M起)、Gemini 3.5(便宜大杯)。有意思的是,用量榜和智能榜是脱钩的:用量第一的MiMo在智能指数上只排第10。开发者在用脚投票,投的是混合性价比,从来不是单纯的榜单第一。
七、实战选型决策树
按角色对号入座。
个人开发者。 Ollama加Qwen或DeepSeek蒸馏版本地跑,成本为零,隐私无忧。API兜底用DeepSeek,10块钱人民币能跑很久的Agent实验。预算敏感的编码助手场景,K3的缓存命中价格($0.30/M)几乎等于白送。
小团队。 DeepSeek或Qwen官方API做主力,月成本能压在闭源方案的十分之一以内。关键路径保留一个闭源API做复杂任务兜底。用LiteLLM之类的网关统一管理,为以后切换留好接口。
企业。 混合架构是2026年的主流答案:80%常规任务走开源(API或私有化部署),20%高价值复杂任务走闭源旗舰。数据敏感的业务单元直接私有化部署开源权重,数据不出域。参照Coinbase的三段式:小流量验证、质量确认、批量切换。
极致性能追求者。 深度推理、多模态前沿、超长链条自主Agent,目前仍然选Claude Fable 5或GPT-5.6 Sol Max,同时做好成本预算(回看本系列第一篇的Uber案例)。但每个季度重新评估一次,开源的追赶速度以月为单位计。
一句话版本:常规任务用开源省钱,关键任务用闭源保命,路由层两手准备。
八、辩证看待:逆转之后的三个冷静判断
第一,流量份额不等于终局。 OpenRouter只是推理市场的一个切片,按请求次数算美国闭源仍占大头。45%的Token份额集中在成本敏感的编程和Agent负载,企业核心系统、合规重区的迁移才刚起步。逆转发生在一层,格局重排还早。
第二,闭源的反击不会等太久。 硅谷实验室不会坐视份额流失。推理成本下降、价格战、订阅打包、独家能力迭代,都是牌。2026年内的闭源降价几乎是确定性事件,届时开源的成本优势会被压缩,竞争焦点会进一步上移到Mozilla说的那层:模型之上的Agent工程层。选型决策树里的每一支,都需要按季度重新走一遍。
第三,对中国开发者,这是主场红利也是能力考题。 全球开发者挤破头抢的性价比模型,你可以原生调用、无缝微调、自由部署,这是主场红利。但红利不自动变现。能在K3和Fable 5之间做对的选型、能把开源模型真正送上生产环境、能驾驭混合架构的人,才是这场逆转里真正的受益者。模型在开源,能力不开源。
45%这个数字还会涨。涨到多少不重要,重要的是当迁移成本趋近于零的时候,你的技术判断力就是唯一的护城河。
下一篇(第05篇)讲模型选型的完整实操:从Ollama一行命令到vLLM生产部署,从成本精细算账到混合路由架构,手把手拆完整个链路。
本系列导航
本文是《AI下半场:Agent淘金热》系列第04篇,开源逆袭篇第一篇。
| 篇号 | 标题 | Phase | 状态 |
|---|---|---|---|
| 01 | AI不能拖欠工资:Uber四个月烧光全年AI预算 | 成本黑洞 | 已发 |
| 02 | 从1200到5亿:2026年最贵AI编程翻车账单全曝光 | 成本黑洞 | 已发 |
| 03 | Token降了99%,账单涨了100倍:2028年AI编程成本将超过你的年薪 | 成本黑洞 | 已发 |
| 04 | 45%的AI流量已转向中国开源模型:K3登顶那天,账要重新算了 | 开源逆袭 | 本文 |
| 05 | 从OpenAI到DeepSeek到本地Llama:模型选型完全指南 | 开源逆袭 | 待发 |
| 06 | 79%用开源但51%上生产:开源AI最后一公里 | 开源逆袭 | 待发 |
| 07 | 90%Agent试点活不到生产:活下来的10%做对了什么 | 工程落地 | 待发 |
| 08 | 多Agent一上线就打架:20个Agent协同的工程噩梦 | 工程落地 | 待发 |
| 09 | 从Prompt到Shell:AI Agent安全攻防2026实战手册 | 工程落地 | 待发 |
| 10 | AI Engineer年入35万:增长最快职业在做什么 | 黄金时代 | 待发 |
| 11 | 只会写代码被淘汰,只会写Prompt也快被淘汰 | 黄金时代 | 待发 |
| 12 | 2027年AI行业预测:5个确定性布局机会 | 黄金时代 | 待发 |
前作推荐:
- 《AI下半场》第03篇"Token经济学":开源便宜60%到90%的成本逻辑前置阅读
- 《AI下半场》第01篇"AI不能拖欠工资":为什么成本压力逼出了这场流量迁移
- 《本地AI配置系列》全20篇:开源模型本地部署的完整技术底座
数据来源
本文数据来源于以下英文信源(2026年8月18日检索验证):
- CNBC 2026.07.07调查:中国模型占OpenRouter企业Token量自2月8日起每周不低于30%,峰值46.4%,此前一年均值11%,2025上半年4.5%,美国份额从70%跌至30%
- santageai.com / metirai.com:OpenRouter流量结构拆解,DeepSeek 16.5%周5.13万亿Token,Qwen 13.9%,六个中国模型排名超过Claude,60%到90%价差,Coinbase、Lindy、Ramp案例
- technologypulse.app:中国模型18个月从1.2%到45%到51%的流量曲线
- Mozilla《State of Open Source AI》2026.07.14:开源闭源差距8.04%缩至3.3%,推理成本三年降50倍,79%开发者使用开源但仅51%上生产,开源占三分之一使用量仅获4%收入,锯齿状前沿,Microsoft与Uber重新评估闭源依赖
- theagenttimes.com / aiexpert.news / wps.hkprog.org:Kimi K3发布详情,2.8万亿参数,Frontend Code Arena 1679分对Fable 5的1631分,DeepSWE每百美元任务数14.7对5.3,定价3/15/$0.30
- digitalapplied.com Q2报告:小米MiMo-V2-Pro占OpenRouter流量21.1%为OpenAI三倍,用量与智能指数脱钩
- Financial Times(经Mozilla报告引用):中国开源模型周Token约18万亿对美国约5.5万亿
- Bloomberg 2026.08.16:Stripe以超70亿美元收购OpenRouter,周Token量五个月从5万亿涨至25万亿,800万开发者
- singularity.kiwi / dev.to / creativeainews.com:Mozilla报告细节交叉验证
标签 :AI 人工智能 AIGC 开源模型 DeepSeek Kimi K3 AI Agent 程序员