一周 AI 观察:模型层在"周更",钱却全流进了机房

同一个星期里,发生了两件方向完全相反的事。

一周:Anthropic、Meta、Google、OpenAI 四家顶级实验室在同一个星期里各发一款旗舰。CNBC 在 9 月 6 日给这个现象起了个名字------"模型疲劳"(model fatigue)。企业买家的原话是:每类任务有 10 个候选模型,我们只评得起 5 个。

另一件:三家名字你可能没听过的算力公司,五天里拿走了 48 亿美元 。Crusoe 300 亿估值、Fluidstack 180 亿估值,两家加起来占了当周全球前十大已披露轮次的 74%。领投 Fluidstack 的不是风投,是量化交易公司 Jane Street。

一边是模型层卷到没人评得过来,一边是钱成捆地往机房里搬。这不是两件无关的事,这是同一件事的两面。


引子:把这一周的数字摆在一起

时间 事件 关键数字
9.1 Anthropic 发布 Claude Fable 5.1 / Mythos 5.1 缓存读取价格 −75%
9.2 Meta 发布 Muse Spark 1.3 内部评测工具调用 −20% 、token −25%
9.2 Google 发布 Gemini 3.8 Flash 六周内第三个 Flash 版本
9.3--9.4 OpenAI 发布 GPT-6 Astra 上下文 105 万 token
9.3 英伟达宣布收购 Hugging Face 129.3 亿美元,公司史上最大收购
9.3 MBZUAI 发布 K2 Horizon 系列 6 个尺寸,Apache 2.0,训练日志全开
9.3--9.5 Crusoe / Fluidstack / Gimlet 融资 合计 48 亿美元
9.6 CNBC 报道"模型疲劳" 企业"10 个候选只评 5 个"

把它们摆成一行,主线就出来了:模型层的供给速度第一次超过了需求侧的消化能力,而资本早已悄悄绕过了模型层。


一、天花板:模型能力不再稀缺,稀缺的是"评估能力"

1.1 一周四发,但大部分是"点更新"

这一周的发布看起来声势浩大,但拆开看,节奏比实质更抢眼:

  • Anthropic(9.1) :Claude Fable 5.1 与 Mythos 5.1,官方定位是"最先进的编程与知识工作模型"。真正有商业含义的不是 benchmark,是缓存读取价格下调 75%------这一刀直接砍在长时运行智能体的单位成本上。据 CNBC 相关报道转述,典型工作负载成本下降约四分之一,智能体工作负载最多可省 45%。
  • Meta(9.2) :Muse Spark 1.3,官方称内部评测中工具调用减少约 20%、token 消耗减少约 25%,上下文 100 万 token。新增行为很有意思:遇到模糊指令会主动追问 ,执行有后果的动作前会停下来确认
  • Google(9.2):Gemini 3.8 Flash------这是六周内的第三个 Flash 版本。
  • OpenAI(9.3--9.4):GPT-6 Astra,主打电脑操作与网络安全。

AI 金融初创公司 Farsight 的 CTO Noah Faro 说了一句很实在的话:这一周的多数更新是"point releases"(点更新),是已有模型的升级,不是全新架构。

1.2 "模型疲劳"不是矫情,是资源约束

这个词能被 CNBC 正式命名,是因为它标记了一个结构性临界点:供给侧的发布节奏,第一次被主流媒体认定为超过了需求侧的消化能力。

具体表现是两个可测量的退化:

其一,评估预算被打穿。 企业 AI 公司 Clockwork Systems 的 CEO Suresh Vasudevan 对 CNBC 说,跟踪每一个增量更新都要消耗大量算力,他的团队现在每类任务只评估约 10 个候选模型中的 5 个

其二,定价逻辑分化,让"性价比"不再是算术题。 同样是这一周:Anthropic 维持名义价格但砍了缓存价;OpenAI 名义价格不变但给了 105 万 token 窗口,并对超过 27.2 万 token 的输入单独计价。第三方对比还显示,GPT-6 Astra 的单 token 价格约为 Gemini 3.8 Flash 的 13 倍(该对比来自第三方评测机构,非厂商官方口径)。

两条完全不同的定价逻辑摆在一起,跨厂商比较就从一道算术题变成了一份需要持续重算的研究工作。

1.3 决策质量在退化

最值得警惕的不是"累",而是决策方式从最优化退回满意化

markdown 复制代码
理想状态:评估全部候选 → 选出最优解        (optimizing)
现实状态:算力/人力不够 → 选熟悉的、选头部的、选最近发布的 (satisficing)
                          ↑
                    不是选最合适的

当买家开始按"谁最近发过版"来做选型,发布节奏本身就变成了一种可以变现的资产------哪怕新版本的边际改进有限。Runpod CEO Zhen Lu 说得直白:"环境里泡沫太多,企业不得不持续制造声量。"

而这一切的背景是:Gartner 预计 2026 年全球 AI 支出达 2.59 万亿美元 ,同比增长 47%,其中软件、服务、网络安全与模型相关支出合计超过 1 万亿美元。Anthropic 与 OpenAI 都在冲 IPO,私募估值各自逼近 1 万亿美元。在上市窗口期,每一份发布日历都是写给资本市场看的成绩单。


二、地板:钱没有流向模型,流向了机房

2.1 48 亿美元,五天内搬完

公司 轮次 金额 / 估值 领投方 上一次估值
Crusoe Series F 30 亿 / 300 亿 Atreides、Valor(Mubadala 参投) 约 100 亿(2025.10)
Fluidstack 私募轮 15 亿 / 180 亿 Jane Street Capital 75 亿(2025.12)
Gimlet Labs Series B 3 亿 / 30 亿 a16z(Arm、M12 等跟投) ---

据 Catenaa 统计,当周全球前十大已披露轮次合计约 60.6 亿美元 ,Crusoe 与 Fluidstack 两家就占了 74%。其余八家里有六家是软件或服务公司,它们的总和还不及 Fluidstack 一家。

这三家公司有一个共同点:没有一家向终端客户卖软件。它们的生意是租算力、调度算力、给算力供电。

2.2 定价的速度,快到不像一级市场

Crusoe:2025 年 10 月 13.8 亿美元融资时估值约 100 亿美元 → 2026 年 9 月估值 300 亿美元。10 个月三倍。

Fluidstack:2025 年 12 月 75 亿 → 2026 年 9 月 180 亿。九个月两倍多。

这不是"增长带来的估值提升",这是稀缺性定价。Crusoe 原本是 2018 年成立的比特币矿场公司,靠烧油田伴生气发电起家,现在客户名单是 OpenAI、Microsoft、Meta、Oracle。Fluidstack 2017 年从牛津 spun out,最早是给研究者拼闲置 GPU,现在是谷歌之外第一个公开运营 TPU 容量的厂商。

从"拼闲置显卡"到"180 亿美元估值",中间只隔了九年------而估值翻倍的间隔,只有九个月。

2.3 为什么是现在:资本开支的量级变了

支撑这个价格的是需求侧的刚性:

  • Dell'Oro Group 预计 2026 年全球数据中心资本开支将突破 1 万亿美元,同比增长超过 50%(2025 年已经增长 57%)。
  • 亚马逊、谷歌、Meta、微软四家 2026 年的计划支出合计接近 6000 亿美元,约占全球六成。
  • a16z 关闭了 11 亿美元的 "Machine Age Fund" 专投 AI 硬件,增长基金扩至 85 亿美元。

一个更直观的对照:三家算力公司一周融的钱,比美国种子市场通常一个月的投放量还多。

arduino 复制代码
   模型层(本周):4 款旗舰发布  →  买家的反应是"评不过来"
   算力层(本周):3 笔融资 48 亿 →  买家的反应是"抢不到"
                                    ↑
                          同一周,两种稀缺性

三、暗线:三个正在悄悄改变格局的变量

3.1 买方变了:交易台开始给算力资产定价

Jane Street 是这周最值得琢磨的角色。它做了三件事:

  1. 领投 Fluidstack 的 15 亿美元轮;
  2. 与 Crusoe 签下五年、约 130 亿美元的云合同;
  3. 8 月还领投了推理芯片公司 Etched 的 7 亿美元轮(估值 210 亿美元)。

量化交易公司很少去给电厂和电网融资。它们之所以进来,是因为 AI 算力在 2026 年已经是一种类大宗商品:买方要的是锁定的长期供给,而不是随买随有的现货。

这带来一个此前不存在的定价模型。风投给软件公司定价看的是收入倍数;交易台给算力资产定价看的是合约现金流。一位 VC 的说法很形象:Jane Street 领投 180 亿美元的轮次,是"交易台在给合同化的现金流定价,不是成长基金在给软件倍数定价"。

这意味着尽调的核心变了 ------不是 ARR,而是 Anthropic、Google 那些合同里的 take-or-pay(照付不议)条款:如果客户错过里程碑或要求重谈,义务怎么算?如果一家公司不肯给你"过去两个季度的在手订单转化率",那 300 亿估值就只是个叙事,不是个估值。

风险也很清楚:这些算力的买方是一个极短的名单------Anthropic、OpenAI、Google、Meta。集中度这么高,每一轮融资本质上都是对四个对手方的杠杆化下注。

3.2 "完全开源"的标准被抬高了,但开源也是最容易开空头支票的地方

9 月 3 日,阿布扎比 MBZUAI 下属基础模型研究所(IFM)发布 K2 Horizon:6 个尺寸(0.9B / 3.7B / 7B / 32B / 36B-A4B / 375B-A23B),全部 Apache 2.0。

真正让它区别于以往"开源"的是:不只给权重,还给了训练代码、数据配方(data recipes)、中间检查点、训练日志。约 20 万亿 token 的预训练语料里,约 17% 是显式推理轨迹------推理能力是从预训练阶段就编进去的,不是后训练阶段贴上去的。

几个关键数字:

指标 K2 Horizon 对比
AA Intelligence Index(375B) 47 上一代 70B 的 K2 Think V2 提升 30 点
幻觉率(375B) 26% 上一代 71%(策略是对 60% 的问题选择拒答)
SWE-bench Verified(7B,自报) 70.6 Qwen3.5-9B 50.8、Gemma 4-12B 30.6
AIME 2026(0.9B,自报) 48.5 Qwen3.5-0.8B 0.2

(后两项为厂商自报,且 sub-4B 的 SWE-bench 结果受评测框架影响极大,不可直接横向比较。)

但这里必须同时讲另一半:模型卡指向的两个数据集仓库返回 HTTP 401,预训练代码尚未上线,32B 版本是 stage-1 检查点,在 Terminal-Bench 上落后 Qwen3.8-27B 43 分。

所以"史上最完整的开源发布",同时也是一张部分兑现的欠条。这不丢人------开放训练生命周期本来就是件工程量巨大的事------但它提醒我们:"开源"这个词的含义在 2026 年被抬高了,而抬高标准的最好方式,是看它到底能不能被复现。

3.3 卖铲子的开始买集市

9 月 3 日,英伟达宣布以 129.303 亿美元收购 Hugging Face(约 119 亿对价 + 最高 10 亿美元的股权留任计划),预计 2027 年上半年完成,尚待监管批准。这是英伟达史上最大一笔收购,超过 2020 年 69 亿美元收购 Mellanox。

黄仁勋给出的数字是:1800 万开发者、300 万个模型、50 万个数据集、100 万个应用、20 万家企业。

这笔交易买的不是模型能力,是开源模型的分发入口和开发者的默认起点。它对中国大模型厂商的意义尤其直接------从 2023 年的 ChatGLM、Qwen,到 2025 年 DeepSeek-R1 引发的开源推理模型潮,Hugging Face 早已是中国模型面向全球社区的主要入口。

黄仁勋承诺"平台保持中立、不强制绑定英伟达算力",Hugging Face CEO 也表态保持开放。这个承诺值多少钱,可以参照两个先例:微软 2018 年 75 亿美元收购 GitHub 时承诺独立运营,2025 年 GitHub 被并入微软 CoreAI 团队。

国内这一周同步发生的还有:长电科技 9 月 3 日晚公告拟定增不超 65 亿元,投向 AI 芯片封装、玻璃基板等四大项目,总投入超 95 亿元;液冷与光模块在绿色算力政策与 1.6T 需求预期下走强。(国内部分来自行业媒体汇总,具体项目进度以公司公告为准。)


四、四个判断

判断一:模型层的竞争维度,已经从"能力"迁移到"节奏",而节奏正在摧毁买方的决策质量。

当买家从"选最优"退回"选熟悉",发布频率就成了可兑现的资产。这对整个生态是负外部性------实验室获得了节奏的收益,买家承担了评估的成本。对企业来说,可执行的动作只有一个:把模型评估从"项目"变成"常设职能",并且只在你自己的任务集上评,不要看通用排行榜。

判断二:算力资产的估值锚,正在从"收入倍数"切换到"合约现金流"。

这是 2026 年最重要的金融创新,也是最脆弱的一环。Jane Street 们进来的前提是合同是硬的;一旦四大买方里的任何一个开始重谈条款,或者推理需求的增长曲线不及预期,300 亿和 180 亿的标记会在一两个季度内连锁重定价。看这类公司,先看在手订单,再看收入。

判断三:评估能力,而不是模型能力,正在成为新的瓶颈资源。

Gartner 预计 2026 年全球 AI 支出 2.59 万亿美元,其中超过 1 万亿流向软件、服务和模型。但这个市场的交易摩擦不在供给侧,在需求侧的评估能力上。谁能把"在我自己的任务上低成本、可重复地评模型"这件事做成产品,谁就拿走这层价值。

判断四:开源的下一条分界线是"可复现",不是"可下载"。

K2 Horizon 把标准从权重推到了训练生命周期。接下来一年,值得关注的不是谁家权重最大,而是谁家的训练过程能被第三方真的跑通。同理,谁开的是空头支票,也会在复现这一步露馅。


结语:三个可以立刻自问的问题

  1. 你的模型选型流程,是"每次发版重评一遍"还是"常设评估 + 自有任务集"? 如果是前者,你已经在这个星期的疲劳名单里了。
  2. 如果你的供应商是一家 neocloud,你有没有看过它的 take-or-pay 条款? 你的算力成本,可能正挂在一个你看不见的对手方信用上。
  3. 你用的开源模型,你能说出它的训练数据来源吗? 如果说不出,那它在合规意义上的自由度,可能比你以为的要低。

数据来源:CNBC(9 月 6 日"模型疲劳"报道)、Crunchbase News、Catenaa、Value Add VC、The CODEW、Silicon Report、Gartner、Dell'Oro Group、英伟达官方博客与 SEC 文件、MBZUAI IFM 官方发布与 Hugging Face 模型卡、Artificial Analysis、腾讯新闻等公开报道。

免责声明:本文为基于公开信息的行业观察,不构成任何投资建议。文中涉及融资、估值与收购的数字以各家公开披露为准,未披露细节的部分已标注来源性质;厂商自报的 benchmark 成绩均已注明,不等同于独立复现结果。

相关推荐
Dawson Zhu1 小时前
从单体到联邦:多Agent架构的必要性与设计哲学
人工智能·语言模型·架构·aigc·agi
火山引擎开发者社区1 小时前
AgentKit 实战|搭建一个有记忆、懂业务、会执行的智能客服
人工智能
商业看点解说2 小时前
企业需要为大模型应用设置安全护栏,推荐使用哪些生成式AI平台?
人工智能·安全
ai小陈2 小时前
LoRA微调显存怎么估?32GB GPU训练配置与常见问题排查
人工智能·深度学习·机器学习·ai·gpu算力
论文复现现场2 小时前
ComfyUI部署MiniMax H3:8G本地卡、RTX 4090和RTX 5090怎么选?
人工智能·云计算·音视频·gpu算力
腾视科技-AI2 小时前
超低功耗 性能卓越|腾视科技重磅推出TS-SG-SM9系列AI算力模组,引领边缘智能计算新篇章!
人工智能·科技·ai·ai算力模组·ai模组·腾视科技·ai算力盒
政企项目老覃2 小时前
大模型幻觉治理与自动评测:金融风控场景的落地实践
人工智能·算法·机器学习
SuperHeroWu72 小时前
【HarmonyOS AI】 通用文字识别详解
人工智能·pytorch·深度学习·通用文字识别