同一个星期里,发生了两件方向完全相反的事。
一周:Anthropic、Meta、Google、OpenAI 四家顶级实验室在同一个星期里各发一款旗舰。CNBC 在 9 月 6 日给这个现象起了个名字------"模型疲劳"(model fatigue)。企业买家的原话是:每类任务有 10 个候选模型,我们只评得起 5 个。
另一件:三家名字你可能没听过的算力公司,五天里拿走了 48 亿美元 。Crusoe 300 亿估值、Fluidstack 180 亿估值,两家加起来占了当周全球前十大已披露轮次的 74%。领投 Fluidstack 的不是风投,是量化交易公司 Jane Street。
一边是模型层卷到没人评得过来,一边是钱成捆地往机房里搬。这不是两件无关的事,这是同一件事的两面。
引子:把这一周的数字摆在一起
| 时间 | 事件 | 关键数字 |
|---|---|---|
| 9.1 | Anthropic 发布 Claude Fable 5.1 / Mythos 5.1 | 缓存读取价格 −75% |
| 9.2 | Meta 发布 Muse Spark 1.3 | 内部评测工具调用 −20% 、token −25% |
| 9.2 | Google 发布 Gemini 3.8 Flash | 六周内第三个 Flash 版本 |
| 9.3--9.4 | OpenAI 发布 GPT-6 Astra | 上下文 105 万 token |
| 9.3 | 英伟达宣布收购 Hugging Face | 129.3 亿美元,公司史上最大收购 |
| 9.3 | MBZUAI 发布 K2 Horizon 系列 | 6 个尺寸,Apache 2.0,训练日志全开 |
| 9.3--9.5 | Crusoe / Fluidstack / Gimlet 融资 | 合计 48 亿美元 |
| 9.6 | CNBC 报道"模型疲劳" | 企业"10 个候选只评 5 个" |
把它们摆成一行,主线就出来了:模型层的供给速度第一次超过了需求侧的消化能力,而资本早已悄悄绕过了模型层。

一、天花板:模型能力不再稀缺,稀缺的是"评估能力"
1.1 一周四发,但大部分是"点更新"
这一周的发布看起来声势浩大,但拆开看,节奏比实质更抢眼:
- Anthropic(9.1) :Claude Fable 5.1 与 Mythos 5.1,官方定位是"最先进的编程与知识工作模型"。真正有商业含义的不是 benchmark,是缓存读取价格下调 75%------这一刀直接砍在长时运行智能体的单位成本上。据 CNBC 相关报道转述,典型工作负载成本下降约四分之一,智能体工作负载最多可省 45%。
- Meta(9.2) :Muse Spark 1.3,官方称内部评测中工具调用减少约 20%、token 消耗减少约 25%,上下文 100 万 token。新增行为很有意思:遇到模糊指令会主动追问 ,执行有后果的动作前会停下来确认。
- Google(9.2):Gemini 3.8 Flash------这是六周内的第三个 Flash 版本。
- OpenAI(9.3--9.4):GPT-6 Astra,主打电脑操作与网络安全。
AI 金融初创公司 Farsight 的 CTO Noah Faro 说了一句很实在的话:这一周的多数更新是"point releases"(点更新),是已有模型的升级,不是全新架构。
1.2 "模型疲劳"不是矫情,是资源约束
这个词能被 CNBC 正式命名,是因为它标记了一个结构性临界点:供给侧的发布节奏,第一次被主流媒体认定为超过了需求侧的消化能力。
具体表现是两个可测量的退化:
其一,评估预算被打穿。 企业 AI 公司 Clockwork Systems 的 CEO Suresh Vasudevan 对 CNBC 说,跟踪每一个增量更新都要消耗大量算力,他的团队现在每类任务只评估约 10 个候选模型中的 5 个。
其二,定价逻辑分化,让"性价比"不再是算术题。 同样是这一周:Anthropic 维持名义价格但砍了缓存价;OpenAI 名义价格不变但给了 105 万 token 窗口,并对超过 27.2 万 token 的输入单独计价。第三方对比还显示,GPT-6 Astra 的单 token 价格约为 Gemini 3.8 Flash 的 13 倍(该对比来自第三方评测机构,非厂商官方口径)。
两条完全不同的定价逻辑摆在一起,跨厂商比较就从一道算术题变成了一份需要持续重算的研究工作。
1.3 决策质量在退化
最值得警惕的不是"累",而是决策方式从最优化退回满意化。
markdown
理想状态:评估全部候选 → 选出最优解 (optimizing)
现实状态:算力/人力不够 → 选熟悉的、选头部的、选最近发布的 (satisficing)
↑
不是选最合适的
当买家开始按"谁最近发过版"来做选型,发布节奏本身就变成了一种可以变现的资产------哪怕新版本的边际改进有限。Runpod CEO Zhen Lu 说得直白:"环境里泡沫太多,企业不得不持续制造声量。"
而这一切的背景是:Gartner 预计 2026 年全球 AI 支出达 2.59 万亿美元 ,同比增长 47%,其中软件、服务、网络安全与模型相关支出合计超过 1 万亿美元。Anthropic 与 OpenAI 都在冲 IPO,私募估值各自逼近 1 万亿美元。在上市窗口期,每一份发布日历都是写给资本市场看的成绩单。
二、地板:钱没有流向模型,流向了机房
2.1 48 亿美元,五天内搬完
| 公司 | 轮次 | 金额 / 估值 | 领投方 | 上一次估值 |
|---|---|---|---|---|
| Crusoe | Series F | 30 亿 / 300 亿 | Atreides、Valor(Mubadala 参投) | 约 100 亿(2025.10) |
| Fluidstack | 私募轮 | 15 亿 / 180 亿 | Jane Street Capital | 75 亿(2025.12) |
| Gimlet Labs | Series B | 3 亿 / 30 亿 | a16z(Arm、M12 等跟投) | --- |
据 Catenaa 统计,当周全球前十大已披露轮次合计约 60.6 亿美元 ,Crusoe 与 Fluidstack 两家就占了 74%。其余八家里有六家是软件或服务公司,它们的总和还不及 Fluidstack 一家。
这三家公司有一个共同点:没有一家向终端客户卖软件。它们的生意是租算力、调度算力、给算力供电。
2.2 定价的速度,快到不像一级市场
Crusoe:2025 年 10 月 13.8 亿美元融资时估值约 100 亿美元 → 2026 年 9 月估值 300 亿美元。10 个月三倍。
Fluidstack:2025 年 12 月 75 亿 → 2026 年 9 月 180 亿。九个月两倍多。
这不是"增长带来的估值提升",这是稀缺性定价。Crusoe 原本是 2018 年成立的比特币矿场公司,靠烧油田伴生气发电起家,现在客户名单是 OpenAI、Microsoft、Meta、Oracle。Fluidstack 2017 年从牛津 spun out,最早是给研究者拼闲置 GPU,现在是谷歌之外第一个公开运营 TPU 容量的厂商。
从"拼闲置显卡"到"180 亿美元估值",中间只隔了九年------而估值翻倍的间隔,只有九个月。
2.3 为什么是现在:资本开支的量级变了
支撑这个价格的是需求侧的刚性:
- Dell'Oro Group 预计 2026 年全球数据中心资本开支将突破 1 万亿美元,同比增长超过 50%(2025 年已经增长 57%)。
- 亚马逊、谷歌、Meta、微软四家 2026 年的计划支出合计接近 6000 亿美元,约占全球六成。
- a16z 关闭了 11 亿美元的 "Machine Age Fund" 专投 AI 硬件,增长基金扩至 85 亿美元。
一个更直观的对照:三家算力公司一周融的钱,比美国种子市场通常一个月的投放量还多。
arduino
模型层(本周):4 款旗舰发布 → 买家的反应是"评不过来"
算力层(本周):3 笔融资 48 亿 → 买家的反应是"抢不到"
↑
同一周,两种稀缺性
三、暗线:三个正在悄悄改变格局的变量
3.1 买方变了:交易台开始给算力资产定价
Jane Street 是这周最值得琢磨的角色。它做了三件事:
- 领投 Fluidstack 的 15 亿美元轮;
- 与 Crusoe 签下五年、约 130 亿美元的云合同;
- 8 月还领投了推理芯片公司 Etched 的 7 亿美元轮(估值 210 亿美元)。
量化交易公司很少去给电厂和电网融资。它们之所以进来,是因为 AI 算力在 2026 年已经是一种类大宗商品:买方要的是锁定的长期供给,而不是随买随有的现货。
这带来一个此前不存在的定价模型。风投给软件公司定价看的是收入倍数;交易台给算力资产定价看的是合约现金流。一位 VC 的说法很形象:Jane Street 领投 180 亿美元的轮次,是"交易台在给合同化的现金流定价,不是成长基金在给软件倍数定价"。
这意味着尽调的核心变了 ------不是 ARR,而是 Anthropic、Google 那些合同里的 take-or-pay(照付不议)条款:如果客户错过里程碑或要求重谈,义务怎么算?如果一家公司不肯给你"过去两个季度的在手订单转化率",那 300 亿估值就只是个叙事,不是个估值。
风险也很清楚:这些算力的买方是一个极短的名单------Anthropic、OpenAI、Google、Meta。集中度这么高,每一轮融资本质上都是对四个对手方的杠杆化下注。
3.2 "完全开源"的标准被抬高了,但开源也是最容易开空头支票的地方
9 月 3 日,阿布扎比 MBZUAI 下属基础模型研究所(IFM)发布 K2 Horizon:6 个尺寸(0.9B / 3.7B / 7B / 32B / 36B-A4B / 375B-A23B),全部 Apache 2.0。
真正让它区别于以往"开源"的是:不只给权重,还给了训练代码、数据配方(data recipes)、中间检查点、训练日志。约 20 万亿 token 的预训练语料里,约 17% 是显式推理轨迹------推理能力是从预训练阶段就编进去的,不是后训练阶段贴上去的。
几个关键数字:
| 指标 | K2 Horizon | 对比 |
|---|---|---|
| AA Intelligence Index(375B) | 47 | 上一代 70B 的 K2 Think V2 提升 30 点 |
| 幻觉率(375B) | 26% | 上一代 71%(策略是对 60% 的问题选择拒答) |
| SWE-bench Verified(7B,自报) | 70.6 | Qwen3.5-9B 50.8、Gemma 4-12B 30.6 |
| AIME 2026(0.9B,自报) | 48.5 | Qwen3.5-0.8B 0.2 |
(后两项为厂商自报,且 sub-4B 的 SWE-bench 结果受评测框架影响极大,不可直接横向比较。)
但这里必须同时讲另一半:模型卡指向的两个数据集仓库返回 HTTP 401,预训练代码尚未上线,32B 版本是 stage-1 检查点,在 Terminal-Bench 上落后 Qwen3.8-27B 43 分。
所以"史上最完整的开源发布",同时也是一张部分兑现的欠条。这不丢人------开放训练生命周期本来就是件工程量巨大的事------但它提醒我们:"开源"这个词的含义在 2026 年被抬高了,而抬高标准的最好方式,是看它到底能不能被复现。
3.3 卖铲子的开始买集市
9 月 3 日,英伟达宣布以 129.303 亿美元收购 Hugging Face(约 119 亿对价 + 最高 10 亿美元的股权留任计划),预计 2027 年上半年完成,尚待监管批准。这是英伟达史上最大一笔收购,超过 2020 年 69 亿美元收购 Mellanox。
黄仁勋给出的数字是:1800 万开发者、300 万个模型、50 万个数据集、100 万个应用、20 万家企业。
这笔交易买的不是模型能力,是开源模型的分发入口和开发者的默认起点。它对中国大模型厂商的意义尤其直接------从 2023 年的 ChatGLM、Qwen,到 2025 年 DeepSeek-R1 引发的开源推理模型潮,Hugging Face 早已是中国模型面向全球社区的主要入口。
黄仁勋承诺"平台保持中立、不强制绑定英伟达算力",Hugging Face CEO 也表态保持开放。这个承诺值多少钱,可以参照两个先例:微软 2018 年 75 亿美元收购 GitHub 时承诺独立运营,2025 年 GitHub 被并入微软 CoreAI 团队。
国内这一周同步发生的还有:长电科技 9 月 3 日晚公告拟定增不超 65 亿元,投向 AI 芯片封装、玻璃基板等四大项目,总投入超 95 亿元;液冷与光模块在绿色算力政策与 1.6T 需求预期下走强。(国内部分来自行业媒体汇总,具体项目进度以公司公告为准。)
四、四个判断
判断一:模型层的竞争维度,已经从"能力"迁移到"节奏",而节奏正在摧毁买方的决策质量。
当买家从"选最优"退回"选熟悉",发布频率就成了可兑现的资产。这对整个生态是负外部性------实验室获得了节奏的收益,买家承担了评估的成本。对企业来说,可执行的动作只有一个:把模型评估从"项目"变成"常设职能",并且只在你自己的任务集上评,不要看通用排行榜。
判断二:算力资产的估值锚,正在从"收入倍数"切换到"合约现金流"。
这是 2026 年最重要的金融创新,也是最脆弱的一环。Jane Street 们进来的前提是合同是硬的;一旦四大买方里的任何一个开始重谈条款,或者推理需求的增长曲线不及预期,300 亿和 180 亿的标记会在一两个季度内连锁重定价。看这类公司,先看在手订单,再看收入。
判断三:评估能力,而不是模型能力,正在成为新的瓶颈资源。
Gartner 预计 2026 年全球 AI 支出 2.59 万亿美元,其中超过 1 万亿流向软件、服务和模型。但这个市场的交易摩擦不在供给侧,在需求侧的评估能力上。谁能把"在我自己的任务上低成本、可重复地评模型"这件事做成产品,谁就拿走这层价值。
判断四:开源的下一条分界线是"可复现",不是"可下载"。
K2 Horizon 把标准从权重推到了训练生命周期。接下来一年,值得关注的不是谁家权重最大,而是谁家的训练过程能被第三方真的跑通。同理,谁开的是空头支票,也会在复现这一步露馅。
结语:三个可以立刻自问的问题
- 你的模型选型流程,是"每次发版重评一遍"还是"常设评估 + 自有任务集"? 如果是前者,你已经在这个星期的疲劳名单里了。
- 如果你的供应商是一家 neocloud,你有没有看过它的 take-or-pay 条款? 你的算力成本,可能正挂在一个你看不见的对手方信用上。
- 你用的开源模型,你能说出它的训练数据来源吗? 如果说不出,那它在合规意义上的自由度,可能比你以为的要低。
数据来源:CNBC(9 月 6 日"模型疲劳"报道)、Crunchbase News、Catenaa、Value Add VC、The CODEW、Silicon Report、Gartner、Dell'Oro Group、英伟达官方博客与 SEC 文件、MBZUAI IFM 官方发布与 Hugging Face 模型卡、Artificial Analysis、腾讯新闻等公开报道。
免责声明:本文为基于公开信息的行业观察,不构成任何投资建议。文中涉及融资、估值与收购的数字以各家公开披露为准,未披露细节的部分已标注来源性质;厂商自报的 benchmark 成绩均已注明,不等同于独立复现结果。