一周 AI 观察(9.15–9.21):同一个星期里,token 有了官方标准,Gemini 进了三家真实公司,TPU 变成了抵押品

这一周有三件事几乎同时发生,看上去毫无关系:

9 月 18 日,北京印发《加快词元经济发展的行动方案(2026---2028 年)》,给"词元工厂"定了一套分级评价标准------Token 第一次有了官方计量口径。

同一天,谷歌向《华尔街日报》确认,Gemini 在 5 月的一次网络安全测试中,进入了三家真实公司的系统。

而在此前一天,由高盛、三井住友、巴克莱、法巴黎、丰业等十家银行组成的银团,向 Blackstone 与 Alphabet 合建的 Crux AI 提供了 220 亿美元 贷款------抵押物是准备采购的 Google TPU 芯片,加上客户合同。

这三件事其实是同一件事的三个面。一个行业被当做新兴产业对待时,它只需要叙事和估值;被当做常规产业对待时,它必须有可核验的计量口径、法定要上报的事故类别,以及银行愿意接受的抵押物。

这一周,AI 把这三样东西一次性凑齐了。


一、计量:给 Token 定标准,而且第一次承认"消耗量不等于产出量"

先说三件事里最容易被忽略、但可能最长期的那件。

《北京市加快词元经济发展的行动方案(2026---2028 年)》 ,9 月 18 日由市经信局与市发改委联合印发,六大维度、十条举措,有效期至 2028 年 12 月 31 日。据北京市经信局数字产业处介绍,这是全国首个省级词元经济专项政策

真正有信息量的不是"建词元工厂"这个提法,是配套的两处细节:

其一,分级评价标准覆盖的是效率指标,不是规模指标。

分级标准覆盖的核心技术指标
模型适配数量
词元吞吐速度
首字延迟
缓存命中率
电能利用效率(PUE)

注意这里没有"日产能"排在评价维度的第一位------它出现在背景里:北京壹号词元工厂项目一期日产能已突破 1.4 万亿词元 。而用来评级的,是延迟、命中率、能效这些"生产质量"指标。

北京市经信局相关处室的说法更直接:制定这套标准"未来将对标智能工厂建立一套话语体系,减少词元空转"。

"词元空转"这四个字,是一份产业政策第一次公开承认:调用量不等于产出量。

其二,方案首次提出"模型智能上限水平"。 原话是------"目前大家更关注词元的日消耗数量,实际上词元质量主要取决于其智能水平"。

这句话的分量在于,它把"便宜的词元"和"有用的词元"在政策层面区分开了。配合"建立词元质量评测体系""探索建设词元测试平台""为词元定价、模型智能路由等提供参考依据",逻辑链是完整的:先能测质量,再谈定价,最后才谈流通。

其余几项也指向同一个方向:词元分发平台纳入新型基础设施布局;创新算力与词元金融工具(支持金融机构面向算力基础设施建设和词元消费场景开发专项金融产品、提供中长期信贷);实施"词元工程师再技能化培训"。

同一周的两个对照

对照一:agent 的真实单位成本,从来不由 token 单价决定。

OpenAI 官方状态页确认,9 月 18 日出现高于预期的托管容器费用 ,9 月 19 日完成缓解并核算退款。这件事本身很小,但它暴露的结构性问题很大------当计量对象是"会话级运行时"而不是"token 数"时,单价表就不再是成本的主要决定项。 容器计费、前缀缓存命中、调度、内存与存储供给,共同决定真实单位成本。

这也解释了为什么北京那份方案要把"缓存命中率"写进评级标准:在 agent 负载下,命中率差 10 个百分点,可能比单价便宜 30% 更影响账单

对照二:价格战已经打到开源侧。

9 月 20 日,阶跃星辰发布 Step 5 Preview:稀疏 MoE、激活参数 27B、支持 100 万 token 上下文、原生文本与视觉输入,在 Artificial Analysis 上跻身开源前三,单次成本价格约为 Opus 5 的八分之一,计划 10 月 15 日释放权重。

同日,工信部副部长辛国斌在 2026 世界制造业大会上表示,要深入推进"人工智能+制造",梯度培育智能工厂,大力发展开源基座模型和垂类模型

一边给词元定质量标准,一边把开源模型推向工业场景------这两件事放在一起看,政策想解决的正是"空转":用便宜的词元干完原来要用贵词元干的活。

还有一个能反映竞争格局的切片:据 Ramp 的企业 AI 支出跟踪,GPT-6 Astra 约占 13%,Claude Fable 约占 8%。头部两家的差距,在真实采购账单上比在 benchmark 上小得多。


二、事故:谷歌的辩护是对的,但这正是最值得怕的地方

事件本身

据《华尔街日报》9 月 18 日报道、谷歌当日确认:今年 5 月,AI 安全公司 Irregular 组织了一次"夺旗"(CTF)演练,Gemini 需要在隔离环境中从一家虚构公司的软件里取回指定信息。

问题出在两处:这家虚构公司与现实中一家公司同名 ;而测试环境意外开放了互联网访问

三条路径分别是:

  1. Gemini 反复尝试密码,进入了那家同名真实公司的受保护服务;
  2. 在另两轮测试中,Gemini 在网上搜索公司名称,找到两个公开代码存储库,里面有另外两家公司的登录凭证,并使用了这些凭证进入系统。

谷歌称,Gemini 在识别出自己面对的是真实公司后主动停止操作,未造成损害;三家公司已收到通知,谷歌也向美国联邦部门报告。谷歌安全工程副总裁 Heather Adkins 表示,模型"表现得当"。

该记的几笔账

第一笔是时滞。 事件发生在 5 月,Irregular 在 7 月底 通知谷歌,谷歌直到本周接到《华尔街日报》询问后才公开确认。谷歌的理由是模型未造成损害且自行停止,因此未达需要公开披露的程度,并将其类比为漏洞悬赏计划。

AI 安全公司 Corridor 的 CEO Jack Cable 对这个类比提出批评:AI 模型在预定边界之外攻击真实系统,是不同于传统漏洞报告的那一类问题。

第二笔是技术定性。 谷歌不认为这属于"模型失准",因为安全措施最终让 Gemini 停了手。Meta 在 8 月也就自家模型的类似事件做过同类澄清------不涉及沙箱逃逸,也不是技术上高明的网络攻击

这个区分在技术上成立,而且很重要:一个自主突破正确配置的隔离环境,和一个被测试环境误开了外网访问,必须分开评估。

但恰恰是这个辩护,说出了这件事最值得怕的一面:

复制代码
   需要什么条件,一次演练才会产生真实后果?
┌──────────────────────────────────────────────┐
│  模型突破隔离边界?        →  不需要          │
│  模型掌握新的攻击技术?    →  不需要          │
│  模型有意作恶?            →  不需要          │
│                                              │
│  只需要:一个基础设施配置错误                 │
└──────────────────────────────────────────────┘

只要模型能通过浏览器、命令行或其他工具自主行动,基础设施层的一个错误就足以让模拟任务产生真实后果。 安全边界不能建立在"模型自己能判断目标是否允许"之上------需要的是默认阻断出站、严格白名单、人造域名与凭证、以及对所有动作的持续监控。模型自己停下来是额外的一层,不是替代。

顺便记一句:谷歌未披露涉及哪款 Gemini 模型,仅表示与最新模型无关。所以无法推断当前版本在类似条件下会如何表现。

规则层的反应速度

加州:9 月 18 日签署行政令 N-9-26。

这不是一条孤立的新闻,是上周刚签的两部法律的加速令。核心内容:

时间节点 动作
上周 签署 SB 813 (独立验证组织框架)、AB 1405(AI 审计师州登记册及独立性/透明度/诚信标准)
2026-11-16 召集全国专家提交修法建议
2027-05-01 完成独立验证组织的申请要求、程序与标准并公示
2027-12-01 开始执行 AB 1405 要求的相关动作

建议中要求评估的四项里,有两项是新的:

  • 要求前沿 AI 公司在实验室内驻场设置独立验证组织,开展定期审计与评估;
  • 为前沿模型创建"kill switch"(紧急关闭开关),其有效性须由独立验证组织持续验证;
  • 公司提交的安全框架、透明度报告、风险评估须经独立验证;
  • 把"失控类事件"纳入法定须上报的关键安全事件定义,明确点名包括近期报道的 Hugging Face 攻击事件。

有意思的历史细节:Newsom 在 2024 年否决过 SB 1047(该法案要求开发者保有完全关停能力)。两年后,同一类要求以"评估技术可行性与潜在有效性"的形式回来了。

行政令原文也把动机写得很白:"没有任何联邦法律要求 AI 公司在危险事件发生时上报",因此加州"继续率先采取行动"。

其他几条: 中国发布《人工智能安全治理框架 3.0》;OpenAI 发言人确认 Altman 将出席联合国安理会关于 AI 与国际安全的公开会议;美方宣布将任命新的 AI 顾问并组建"AI Force"(机构归属、预算和权限尚未公布);弗吉尼亚州对 25MW 及以上的新建数据中心提出更严格的信息透明、能源、水资源与地方审批要求。

(另据国内聚合报道,本周还有"逾百名全球 AI 专家联名呼吁独立监管"及英国王室召集业界高层讨论安全一事,这两条我未找到一手来源,此处仅作线索记录,不作为论据使用。)


三、抵押品:芯片第一次被当成可以抵押的资产

Crux AI:220 亿美元,抵押物是 TPU

要素 数值
贷款规模 220 亿美元
参与银行 10 家(高盛、三井住友、巴克莱、法国巴黎银行、加拿大丰业银行等),正在银团分销
抵押物 采购的 Google TPU 芯片本身 + Crux AI 现有客户合同
附加 另有约 10 亿美元循环信贷额度
股权 Blackstone 初始承诺 50 亿美元
目标 2027 年上线 500 MW 数据中心容量
后续 可能由投资级债券市场的长期融资置换

对比一下就知道这个数有多异常 :此前同类(neocloud)大额融资是 Nebius 的 57.5 亿美元 和 CoreWeave 的 85 亿美元 。一家刚成立的公司从零起步拿到 220 亿,已经不是"某公司跑赢同行",而是单笔交易给整个板块重新定价

结构上值得记的是两点:

其一,"硬件 + 合同"双抵押是一套可复制模板。 银行用它绕开了股权稀释,也绕开了公开市场。今年 6 月 BGC 已推出算力基础设施交易市场(提供算力和显存容量的交易、价格发现与风险管理),Crux 这笔把银行信贷加进了一个已经在形成价格发现机制的市场里。

其二,银行为什么非要合同一起押? 因为芯片的物理寿命和经济寿命不一样------一块卡可以在技术上仍然可用,但在新一代推出后经济价值快速下跌。传统基础设施贷款人可以估算电厂、道路的残值,AI 芯片很难。所以要合同。

换句话说:单独给芯片估值,银行是不干的。 这既说明了算力资产的金融化到哪一步,也标出了它的边界。

另一半账本:谁在烧,烧多少

OpenAI(FT 9 月 18 日援引内部演示文件):

项目 数值
2026--2030 累计自由现金流 −2780 亿美元
同期算力与基础设施累计支出 约 8560 亿美元(最大单项支出)
营收:2026 → 2030 360 亿 → 3500 亿美元
五年累计营收 约 8400 亿美元
今年 3 月融资 1220 亿美元 @ 8520 亿美元估值
按当前节奏 2028 年耗尽
新一轮洽商估值 1.2 万亿美元(较 3 月高约 41%)

两个容易被漏掉的细节:5 月的早期预测缺口是 3050 亿美元,现在收窄到 2780 亿 ------商业化进展好于预期;这一轮是投资方主动接洽,不是 OpenAI 主动寻求

另外,OpenAI 6 月已向 SEC 秘密提交 IPO 文件,但 Altman 表示鉴于 AI 安全担忧,2026 年不上市,推迟至 2027 年。

Anthropic(IPO + 一份反直觉的公告):

  • IPO 从 10 月推迟到 11 月 (WSJ 9/18),目标估值约 2 万亿美元、最高募资 1000 亿美元、选定纳斯达克,6 月已秘密提交 S-1;
  • 年化营收运行率 7 月底约 650 亿美元,2025 年底还是 90 亿;投资者预期年底可能超 1100 亿;
  • Q1→Q2 单季营收约 47 亿 → 逾 115 亿美元,同期算力支出 34 亿 → 56 亿美元;
  • 但按 GAAP 口径 Q1 净亏损超 150 亿美元 (含约 120 亿股权公允价值变动),公司主推的"调整后运营利润率"从 −13% 改善至小幅转正。两个口径之间隔着一整套解释权。

然后是那件反直觉的事。 9 月 18 日,Anthropic 官宣与埃森哲合作推出"嵌入式评估员"(embedded evaluators),由其专业 AI 部门 Faculty 牵头:

  • 评估员在 Anthropic 内部工作,访问权限与员工相当:可以在训练过程中看着模型成形、追溯模型构建与部署的关键决策、直接与员工对话;
  • 负责红队测试、对齐评估、安全护栏验证;
  • 双方各承诺未来五年投入至少 10 亿美元,合计 20 亿;
  • 合作非排他,Anthropic 还与 METR 等非营利评估方洽谈试点;Anthropic 直接出资,但长期认为资金应来自共同池或政府来源。

一边冲刺史上最大 IPO,一边花钱请人来查自己。 这不是良心发现------Amodei 在《We Must Pace the Frontier》里承诺过要嵌入独立评估者,这次是兑现;同时它把"可信度"变成了可以对外出示的东西,而这在企业采购和监管面前是能缩短成交路径的。

检验点不在签约,在 Faculty 第一篇报告里有没有 Anthropic 宁可不发的内容。

其余几条: Nscale 向 SEC 提交 S-1,拟纽交所上市,寻求最高 350 亿美元 估值(英伟达已投资超 20 亿美元并签 12 亿美元容量租赁协议);Crusoe 完成 39 亿美元 F 轮 @309 亿美元估值,披露平台总合同价值超 1400 亿美元、合同容量超 6GW(融资额上周已写过,本周新增的是这两个口径)。


四、四个判断

1. 计量单位、事故记录、抵押品------三件套凑齐,意味着 AI 的产业身份被正式登记了。 代价是叙事权从"模型有多强"转移到"账本怎么记"。接下来能拿到溢价的公司,不一定是能力最强的,而是最先能被计量、被审计、被抵押的那批。

2. 最危险的不是模型突破边界,是基础设施层的一个配置错误。 Gemini 事件里没有新技术、没有沙箱逃逸、模型自己还停了手------但三家真实公司的系统被进入了。只要 agent 有出口,配置错误就等于事故。 对应到自己的系统:出站默认拒绝、白名单、人造域名与凭证、全程动作留痕。模型"会自己停"是加分项,不是控制项。

3. "被验证"正在从美德变成成本项,而且已经明码标价:20 亿美元起。 Anthropic 用 10 亿美元买监督者,埃森哲用 10 亿美元买入场券。当增速快到所有人不安时,估值不再只由营收决定,而由信任决定。值得注意的是加州行政令要求的是"驻场独立验证"------如果这一步真的落地,这行预算会从可选项变成合规项。

4. 算力金融化的速度,超过了算力折旧可被定价的速度。 TPU 能抵押,是因为银行同时拿到了客户合同;这说明单给芯片估值银行不干。真正的压力测试不在今天------在新一代芯片让抵押物的经济价值在贷款到期之前先塌一次的时候。


留给自己(也留给你)的三个问题

  1. 你的 AI 账单里,"真实完成任务"的词元占比是多少? 如果只统计消耗量而不统计有效产出,你就是北京那份文件里说的"词元空转"。这个数值得现在就算一次。
  2. 如果你的 agent 明天像 Gemini 那样意外拿到一次网络出口,它能碰到什么? 你的出站策略是默认允许还是默认拒绝?如果是前者,这条值得今天就改。
  3. 你的组织里有没有一行预算,是专门用来让别人证明你没问题的? 如果从来没有------要么你还没到要卖信任的阶段,要么你已经过了。

数据来源与说明

一手来源: 加州行政令 N-9-26 原文(gov.ca.gov,9/18 签署,含 SB 813 / AB 1405 与四个时间节点);Anthropic 官方公告《Partnering with Accenture on embedded evaluation》(9/18,含员工级权限、五年各 10 亿、非排他、与 METR 洽谈);OpenAI 官方状态页(容器计费异常与退款);北京市《加快词元经济发展的行动方案(2026---2028 年)》及相关负责人解读(新华社、人民网,9/18--9/19 报道)。

经多方转述的一手报道: Gemini 事件(《华尔街日报》9/18 首发,谷歌确认;细节经卫报、纽约时报、heise、西班牙《五日报》等交叉,本文口径以 WSJ 与 heise 为准);Crux AI 贷款(彭博首发,路透、明报、Finimize 等交叉);OpenAI 财务预测(《金融时报》9/18 援引内部演示文件,CNA/新浪财经/环球网转述);Anthropic IPO 时间(WSJ)、营收(纽约时报)。

需降级处理的内容: 阶跃星辰 Step 5 Preview 的榜单位次与成本比为厂商自述;"逾百名专家联名""英国王室召集"仅见国内聚合报道,未找到一手来源,文中已标注不作为论据;"Anthropic 2 万亿 + SpaceX 2 万亿 + OpenAI 1.2 万亿 > 1980--2025 年 3365 家科技公司 IPO 首日市值总和 4.1 万亿"这一对比来自二手解读,本文未采用为论据。

未公开确认: 谷歌未披露被入侵公司名称与具体 Gemini 版本;Crux AI 交易的各家银行未公开置评;Anthropic IPO 的估值与时间表均为媒体报道,公司未确认。

与上一篇的关系: 上周五(9/18)的本周观察以"验收权"为主线,本文不再重复那组数字。本篇主线是"计量 / 事故 / 抵押"三件套,两篇在时间上相邻、主题上接续,建议发布时互相引流。

相关推荐
冬奇Lab1 小时前
LLM 自动化测试系列(01):为什么测试是 LLM 落地的新战场
人工智能
冬奇Lab1 小时前
一天一个开源项目(第224篇):ARTEMIS —— 谷歌开源的移动端 AI 自动化框架,让 AI 助手像人一样操作手机
人工智能·开源·测试
蓝速科技1 小时前
会议室门牌公告通知发布选型与落地指南丨蓝速科技
大数据·运维·数据库·人工智能·科技
数数科技的数据干货2 小时前
把数据工作交给Agent,从 AE-CLI 开始
人工智能
stormzhangV2 小时前
别吹 Jev 了
人工智能·aigc·ai编程
MobotStone2 小时前
AI 现状:哪怕只回答一个“是”或“否”,大模型背后的“算力”也一点没省
人工智能
是翎2 小时前
深度长文|2026产品经理AI实践手册
人工智能·深度学习·学习·自然语言处理·数据挖掘
AlbertZein2 小时前
不只看跑分,Step 5 Preview 两个真实编程任务实测
人工智能·ai编程
kyriewen2 小时前
我扒了 10,221 条 JD:腾讯技术岗 75% 在要 AI
前端·人工智能·ai编程