【实测数据本身】
8月24日,英伟达在官方博客放出了下一代旗舰机柜Vera Rubin NVL72的首批片上实测数据:在真实智能体编码负载下,每兆瓦吞吐量最高达到GB300 NVL72的30倍 ,每百万Token生产成本最高降低35倍。测试模型是DeepSeek V4 Pro,负载来自SemiAnalysis的AgentX。数字公布当天,中文科技社区的反应出奇一致:连骗投资人的PPT都不敢这么写。负载与模型的具体口径,下文逐条交代,先把这张成绩单摊开看。
先把结论放在前面。这批数据的意义不在30倍这个数字本身,而在于它第一次用真实智能体会话而不是固定长度的合成序列,测出了下一代硬件在Agent负载下的效率边界。对电力受限的AI工厂,同样一兆瓦电力预算能干的智能体活多了30倍,对调用API的开发者,长链路Agent任务的成本被压进一个新量级。本篇拆解只引用英伟达官方博客与可核对的公开来源,媒体推导的部分会明确标注口径。每个数字都能溯源,复核成本就低。
英伟达这次用的AgentX,是SemiAnalysis设计的一套智能体工作负载,素材是录制的真实编程智能体会话,上下文逐轮增长、工具被反复调用、子智能体被动态生成这些特征全部保留。这跟以往固定输入输出长度、跑合成序列的静态基准完全是两种东西。官方文中有两处留白值得注意:这些结果正在等待SemiAnalysis的独立复核,而且尚未计入Vera CPU在工具调用上的性能贡献。两个还没算进去的部分,意味着这份答卷只可能朝更好的方向修正。
30倍的口径要说清楚。它比的是每兆瓦吞吐量:在电力预算固定、服务质量不降级的前提下,一套系统能撑起多少真实的智能体工作。英伟达的说法是,对电力受限的AI工厂,这直接等于同样的能源足迹多出30倍的智能体产出。换句话说,不扩建机房、不新增供电容量,账面上的算力资产凭空多了一个数量级还多。
往上再叠一代,基数更夸张。同一份文档给出,GB300 NVL72在DeepSeek V4 Pro上的每兆瓦吞吐量,已经是Hopper架构的15倍。两代连乘,从Hopper到Vera Rubin,同样一度电所能完成的智能体任务翻了数百倍。半导体行业过去用几十年走完的能效曲线,被压缩到了两代机柜之间,这个压缩速度本身就是最大的新闻。节拍变了,规划节奏也得跟着变。
35倍的成本降幅比30倍的吞吐提升更值得单独看。吞吐量是技术指标,Token成本是直接写在云账单上的商业模式输入。英伟达在文中把关系挑明:对AI工厂,每兆瓦吞吐量决定收入,每百万Token成本决定这笔收入上的利润率。一个管开源,一个管节流,两个数字一起动,商业模型才有重写的资格。
这轮测试里Blackwell平台的领先面覆盖多个主流模型。官方点名了Kimi K3、MiniMax M3、GLM5.3、Qwen3.5和DeepSeek V4 Pro,在AgentX负载下Blackwell全部处于性能领先位置。模型名单横跨多家实验室,说明优化是系统层面的,不依赖某一家模型的架构特性,换模型不需要重讲一遍硬件故事。这一点对多模型混部的团队尤其省心。同一批硬件吃下整个模型清单,采购故事就此简化。
第三方云厂商的交叉数据可以拿来对口径。CoreWeave在自家博客公布,用DeepSeek R1做推理,在相同交互性目标下,Vera Rubin NVL72每兆瓦Token产出是GB200 NVL72的10倍。注意对比对象换成GB200而不是GB300,结论就从30倍变成10倍。这提醒我们读这类数字先看基线是谁,口径比倍数重要,跨来源引用时基线不一致是最常见的翻车点。基线、负载、模型三个口径都对上,数字之间才有相互印证的价值。
【Agent负载为什么特殊】
智能体负载和聊天负载的差别,官方给了两个硬数字。聊天或文档摘要这类场景,输入输出序列通常在1K到8K Token之间。而智能体会话的上下文跨步骤累积,输入可以到几十万Token,而且请求之间长度波动极大。一个是短跑,一个是带着行李的越野,硬件面对的是两种完全不同的压力分布。
OpenRouter的数据解释了消耗从哪来。一个智能体要为投资决策研究一家公司,它会查财务数据库、搜新闻和公告,再派子智能体跑同业对比和估值模型,最后把所有东西综合成建议。智能体和子智能体会一直推理到任务完成,每一步累积的Token又成为下一步的输入。这种工作模式的Token消耗,比一次普通聊天请求高出15倍。
15倍消耗放大之后,压力全落在长上下文处理上。上下文每一步都变成下一步的输入,KV Cache的占用随之滚雪球,显存和访存带宽先后成为瓶颈。官方那句话说得直白:长上下文处理是智能体AI性能的核心。这也是为什么同样的GPU,跑聊天服务游刃有余,跑智能体服务就开始喘。会话越长,缓存越重,单请求的边际成本越高,这个结构靠涨价解决不了,只能靠系统设计硬扛。
硬件侧的应对是一整套组合拳。分离式服务把上下文处理和响应生成拆开,各自独立扩展。速率匹配让两侧的产Token速度同步,避免一端空等另一端。大规模专家并行把混合专家模型的子网络铺满整个scale-up域,分布式KV缓存把显存摊到多卡,不活跃的上下文再分层卸载到主机和存储。每一个技术点都对着智能体负载的一个痛点。
KV感知路由是最能体现负载特征的一项。它把新来的请求调到已经持有相关缓存上下文的GPU上,长会话里省掉的是整段重复计算,这是对智能体负载动态特征最直接的回应。配合MegaMoE这类融合内核,把多步计算和跨GPU通信合并成一次执行,GPU排队等数据的时间被压掉。软件栈懂负载,硬件才有机会全力输出,这套协同正是后文协同设计一节的伏笔。
还有一块余量没释放。Vera CPU是为智能体工具调用专门设计的处理器,而这次公布的30倍里没有计入它的贡献。工具调用在智能体会话里占比可观,等这部分性能真正落地,同一个平台还能再往上走。买硬件买到的是平台的天花板,软件和配套芯片决定你现在站在天花板下面的哪个位置。
【每兆瓦吞吐的账怎么算】
电力正在取代算力成为AI工厂最稀缺的入场券。机柜可以下单,电力容量要排队,电网改造和审批以年计,两者之间的时间差就是产能的缺口。在这个约束下,每兆瓦吞吐量从技术手册里的参考项,变成了决定一座AI工厂收入上限的经营指标。同样的供电额度,谁能榨出更多有效Token,谁的生意盘子就更大。
把30倍放进财务模型里看。假设你的机房供电额度是10兆瓦,原来用GB300机柜能稳定服务的智能体会话数,换成Vera Rubin之后理论上是原来的30倍。固定成本摊到每个会话上的份额被压到几十分之一,单位算力的服务能力直接改写。这就是每兆瓦口径比单卡FLOPS更接近生意本质的原因:财务报表买的是电表后面的产出,芯片规格表只是这个产出的一个技术注脚。
DSX MaxLPS是在30倍之外再叠的一层。这套电源管理技术在GPU、机柜、工作负载三个层面调配功耗,官方口径是同样的兆瓦预算内可以多配最多**40%**的GPU。注意这是叠加关系:30倍的吞吐优势之上,再乘一个1.4倍的部署密度,两个字段在算式里是相乘而不是相加。对供电额度已经见底的机房,这40%往往就是能不能继续接单的区别。电源管理从机房后勤变成了产能杠杆,这个身份变化本身就值得单独记账。
把官方口径的关键数字整理成一张表,三代平台的台阶看得更清楚。每一个倍数的对比对象都列在表里,负载和模型口径也一并标注,引用时先对基线再谈倍数。看表的正确姿势是横向对比同代、纵向对比跨代,避免拿每卡峰值冒充系统性能,也避免把不同负载下的读数直接相除。三个口径都对齐,倍数之间才有可比性。
| 平台 | 每兆瓦吞吐 | Token成本 | 口径来源 |
|---|---|---|---|
| Hopper | 基线 1x | 基线 | 官方博客参照系 |
| GB300 NVL72 | Hopper的15倍 | 上一代水位 | DeepSeek V4 Pro |
| Vera Rubin NVL72 | GB300的30倍 | 每百万Token降35倍 | AgentX负载,待复核 |
| + DSX MaxLPS | 同兆瓦多40% GPU | 继续摊薄 | 电源管理叠加 |
机柜采购成本的质疑也值得正面回应。按中文媒体的整理口径,从GB300到Vera Rubin整机架价格大致再翻一倍,两年间机柜成本约涨4倍换来数百倍的吞吐提升。这笔账要按总拥有成本算:电费、机房、散热这些运营开支在生命周期里占比极高,吞吐每多一倍,同样的运营支出就多摊薄一分。只看采购价会得出相反结论。
【35倍Token成本降幅的含金量】
成本降35倍的传导链条,第一站落在产品预算表上。智能体产品的成本大头是推理Token,每次工具调用、每轮自我修正都是真金白银,账单跟着会话长度线性往上走。单价降一个量级,原本因为贵而被砍掉的产品形态就有了立项资格:更长的探索链路、更频繁的重试、更激进的工具编排,都不再需要逐条审批。预算表的审批标准从每次调用花多少钱,变成每个结果值多少钱,这是产品经理视角的一次换轨。
官方博客里那句愿景值得原样理解:更低的Token成本让智能体可以连续地、大规模地运行,覆盖客户工作负载的全谱。24小时不关机的数字员工、面向大众的超级应用,这两类形态此前都卡在单位经济性上,跑得越多亏得越快。成本地基被抽走一块,卡点就松一处,规模不经济翻转成规模经济。当然这只是必要条件,产品能不能立住还要看留存和场景,便宜救不了没人要的东西。
价格弹性也会改写行业价目表。就在这批数据公布的同一周,硅谷大模型价格战的消息已经见报,OpenAI和谷歌先后下调调用费用。推理工程优化、缓存技术、硬件适配带来的成本下降,给降价留出了技术空间。Vera Rubin这批数字等于预告了下一轮降价还有多深的物理余量,也预告了这场价格战远没到见底的时候。
调度和缓存决定你能不能兑现理论降幅。KV感知路由把请求送到已持有上下文的GPU上,长会话场景下缓存命中意味着整段Prefill免掉,这部分节省直接落进Token成本。同样的硬件,调度策略不同,实际成本能差出几倍,官方数字测的是优化到位的系统而不是裸机。买新机柜只是拿到入场券,软件栈的功力决定你离官方数字有多近,也决定同一批采购在不同团队手里跑出完全不同的账单。

对自建算力的团队,成本模型要重算折旧。成本曲线加速下跌意味着存量机柜的经济性提前归零:今天按三年折旧的设备,可能在第十八个月就被新平台的单位成本甩开一个量级。采购节奏、租约结构、扩容窗口都要按新的曲线斜率重新排期,按旧曲线做财务模型的会先吃亏。折旧年限每压短一年,报表利润就要先承压一轮,这也是为什么新平台越强,财务团队越要提前上桌参与采购决策。
最后泼一盆冷水:成本下降不自动等于利润。单位成本降35倍,如果利用率上不去、调度粗糙、场景没选对,省下来的钱只是换个地方亏。硬件给的是下限,赚钱靠的是把下限用满的工程能力,从内核调优到路由策略每一层都有文章可做。这也是为什么同样的机柜,不同团队跑出的账单能差出一个量级,差距从来不在采购单上。
【七芯片平台与协同设计】
Vera Rubin不是一块GPU,是一套七芯片系统。官方点名的七颗芯片:Rubin GPU、Vera CPU、NVLink 6交换芯片、BlueField-4 DPU、Spectrum-6以太网交换芯片、ConnectX-9 SuperNIC,以及Groq 3 LPU。每一颗都有明确岗位:推理、工具调用、机柜内互联、安全卸载、以太网骨干、数据直连、特定加速,各管一段。拼在一起才是一个完整的智能体算力平台,缺任何一颗,工作流里就有一段要靠通用部件硬顶。
英伟达把这叫极致协同设计,含义是七颗芯片从规格定义阶段就在同一张蓝图下推进,接口协议、功耗预算、散热路径一起敲定,而不是各自做完再拼装。这种做法消灭了系统集成时最常见的关键部件互相等待,也把跨团队返工的浪费压到最低。系统级效率的天花板,从一开始就由整张蓝图而不是最强单芯片决定。短板部件的交付节奏,往往比旗舰芯片更决定平台落地时间。
分离式服务是软件侧的对应设计。Prefill负责吃进上下文,Decode负责逐Token生成,两边资源特征完全不同:一个吃算力,一个吃带宽,混部必然互相拖累,拆开各自扩展才合理。速率匹配再保证两边的产Token速度同步,管线里不留互相等待的空转,系统吞吐取决于最慢一环。这两项是智能体长上下文负载能跑出高吞吐的地基,也是后面所有优化技巧的承重墙。
scale-up域是这一切的前提。NVL72把72颗GPU连成一个高带宽低延迟的域,大规模专家并行才能把混合专家模型的子网络铺满整个域,分布式KV缓存才能把显存摊开,两者都以这个域的存在为前提。跨出这个域,专家路由和缓存共享的代价就会陡增,优化空间立刻收窄。机柜级互联不是拓扑美学,是算法设计的边界条件,选模型架构之前得先看清自己硬件的域边界在哪里。
第六代NVLink和NVLink交换芯片的官方数据:包速率是现成以太网方案的10倍 ,延迟低3倍。跨卡通信每省一纳秒,专家并行的等待窗口就小一分,KV缓存的搬运就便宜一分,这些节省会在长会话里被反复复利。智能体负载恰恰是通信最密集的那类,工具调用和子任务派生都在制造跨卡流量,互联规格的提升直接换算成吞吐,而不是只体现在拓扑图上。省下的每个等待周期,都是账单上实打实的折扣。
芯片本体的升级同样围着负载转。第五代Tensor Core和第三代Transformer Engine同时加速Prefill和Decode两个阶段,两个阶段的瓶颈特征不同,双线加速才不会出现一端快一端堵的局面。NVFP4量化把权重压到4比特精度,显存占用更小、吞吐更高,官方口径是不牺牲输出质量。对追求单位成本的大规模推理,这是一条经过验证的压缩路线,也是把每兆瓦吞吐推到新高度的直接推手之一。
MegaMoE这类融合内核是软件侧的另一件武器。它把多步计算和跨GPU通信合并成一次执行,GPU不再排队等数据,等待窗口的节省在专家密集的负载里被成倍放大。配合TensorRT-LLM推理运行时和Dynamo服务框架这套与硬件共同设计的软件栈,官方口径是全平台已进入全面量产,生态内伙伴正在同步铺开部署。软硬一起到位,纸面倍数才有兑现的通道,缺一边都只是发布会数字。
整条产品线的分工到此完整:GPU管推理,Vera CPU管工具调用,DPU管安全与存储卸载,网卡和交换芯片管网,LPU管特定推理加速。你在应用层调一次工具,七颗芯片各出一段力,任何一段掉链子都会拖慢整条链路。理解这个分工,就理解了为什么智能体时代的算力竞争从单芯片战争变成了平台战争。采购决策单位也从买卡变成了买系统,评估维度随之多出一整层系统级的指标。
【对推理成本曲线的实际影响】
把三代数字摆在一起,曲线的形状变了。从Hopper到GB300是15倍,从GB300到Vera Rubin是30倍吞吐加35倍成本。每代平台的降幅在放大,而不是收敛,这不是等比数列而是加速过程。对做长期规划的人,这条加速下跌的曲线比任何一个单点数字都重要,它决定了今天签的算力合约两年后是资产还是包袱。长租约的价格条款怎么锚定成本指数,会成为接下来采购谈判里最考验专业度的一页。
部署策略需要按新曲线重估。为压显存做的激进缓存淘汰、为省Token用小模型做路由,这些工程妥协的合理性都建立在旧成本结构上。单位成本降一个量级后,直接上大模型、留长上下文、跑完整推理链,可能既更便宜又更可靠。为省钱而复杂的设计,值得逐个拉出来重新审一遍。
这套账可以落成一个可运行的核算脚本。下面的Python程序只用标准库,把官方公布的倍数关系和你可以替换的基线假设分开:改几个场景里的功耗、并发、单价,就能算出固定电力预算下的年Token产量、生命周期摊销后的每百万Token成本,以及两个平台的吞吐倍数和成本降幅。假设区全部集中在文件开头的常量里,替换成自己的账单口径即可复算,不需要改动任何计算逻辑。运行它只需要标准库,任何Python 3.8以上的环境都能直接跑。
python
"""
fleet_token_cost.py - 固定电力预算下的 Token 产能与成本核算
只依赖标准库;所有假设集中在常量区,替换成你自己的账单口径再跑。
官方 30x/35x 是 AgentX 负载下 Pareto 曲线上不同工作点的读数,
本脚本不复述官方数字,只把相对关系翻译成你自己的绝对成本。
"""
import json
from dataclasses import dataclass, asdict
POWER_BUDGET_MW = 10.0 # 固定电力预算(兆瓦)
YEARS = 5 # 摊销周期(年)
OPEX_RATIO = 0.30 # 年度运营成本占购置成本比例
TPS_PER_USER = 60 # 每会话每秒生成 Token 数
PRICE_PER_MWH = 8.0 # 电价(美元每兆瓦时)
@dataclass
class Platform:
name: str
rack_power_mw: float # 单机柜功耗(兆瓦)
sessions_per_mw: int # 每兆瓦可稳定承载的智能体会话数
rack_price_usd: float # 单机柜购置成本(美元)
SCENARIOS = [
Platform("GB300 NVL72", 0.14, 140, 3_500_000),
Platform("Vera Rubin NVL72", 0.25, 4_200, 5_000_000),
]
def annual_tokens(p: Platform) -> float:
sessions = p.sessions_per_mw * POWER_BUDGET_MW
return sessions * TPS_PER_USER * 86400 * 365
def lifetime_cost_usd(p: Platform) -> float:
racks = POWER_BUDGET_MW / p.rack_power_mw
capex = racks * p.rack_price_usd
energy = POWER_BUDGET_MW * PRICE_PER_MWH * 24 * 365 * YEARS
return capex * (1 + OPEX_RATIO * YEARS) + energy
def cost_per_million(p: Platform) -> float:
total = annual_tokens(p) * YEARS / 1_000_000
return lifetime_cost_usd(p) / total
def main() -> None:
rows = []
for p in SCENARIOS:
rows.append({
"platform": p.name,
"annual_tokens_billion": round(annual_tokens(p) / 1e9, 1),
"cost_per_million_usd": round(cost_per_million(p), 4),
"spec": asdict(p),
})
base, new = SCENARIOS[0], SCENARIOS[1]
print(json.dumps({
"power_budget_mw": POWER_BUDGET_MW,
"years": YEARS,
"rows": rows,
"throughput_gain_x": round(annual_tokens(new) / annual_tokens(base), 1),
"cost_reduction_x": round(cost_per_million(base) / cost_per_million(new), 1),
}, ensure_ascii=False, indent=2))
if __name__ == "__main__":
main()
脚本输出的两个倍数对不对得上官方口径,取决于你喂进去的基线假设。官方的30倍和35倍是AgentX负载下的实测,参数换成你自己的真实账单后倍数会漂移,这正是脚本的用法:不是复述官方数字,而是把官方的相对关系翻译成你的绝对成本。数字过时的责任在假设,不在模型,这也是所有成本模型应有的诚实。拿到输出后先对历史账单做一次回测,脚本能复现过去的账,再让它预测未来。
对推理框架和工具链的工程师,这一代平台意味着新一轮适配。TensorRT-LLM、vLLM、SGLang都要为新硬件更新内核和调度,异构编程从往GPU发射内核,扩展到把工作流拆给CPU、DPU和LPU。工具链成熟的节奏,决定平台红利落到早鸟手里还是等下一个代际,而工具链的每次升级都会重新洗牌一次性能排名。跟进得早的团队,等于用工程投入换了一张不断升值的船票。
算力成本下降不等于所有问题都解决。推理延迟、工具生态、智能体的可靠性和安全性,每一项都还是硬骨头,没有任何一项会因为Token变便宜而自动消失。但Agent大规模落地的最大一块成本地基正在被抽走,这个判断在这批实测数据面前站得住。剩下的账,交给在它上面盖房子的人。