NVIDIA Vera CPU 深度解读:Olympus 自研核心为什么是 Agentic AI 的关键拼图

NVIDIA Vera CPU 深度解读:Olympus 自研核心为什么是 Agentic AI 的关键拼图

NVIDIA 昨天(7 月 21 日)发布了 Vera CPU 的技术博客和架构白皮书。这可能是 NVIDIA 迄今为止最详细的一次 CPU 技术披露------从 Olympus 核心的微架构到双路 NUMA 拓扑,全摊开了。

我读完之后最强烈的感受:NVIDIA 在为 GPU 空转等 CPU 这个问题建护城河。而且这堵墙 x86 短期翻不过去。


Vera vs Grace:不只是迭代

参数 Grace (2024) Vera (2026 H2) 变化
核心 72× Neoverse V2 授权 88× Olympus 自研 全自研
线程 72 176 (空间多线程) +144%
解码宽度 6 10 指令/周期 +67%
L2 1 MB/核 2 MB/核 翻倍
L3 114 MB 164 MB 统一 +43%
SCF 对分带宽 --- 3.4 TB/s 全新
内存带宽 512 GB/s 1.2 TB/s (14 GB/s/核) +134%
NVLink-C2C 900 GB/s 1.8 TB/s 翻倍
PCIe Gen 5 Gen 6.4 新标准
双路 单 NUMA 双路 新能力
FP8 ✅ 首个原生 FP8 CPU 关键新能力
机密计算 --- Arm CCA/RME + 机架级可信 新能力

Olympus 核心微架构

NVIDIA 将 Olympus 核心拆为四个子系统:前端、中核、执行引擎、缓存子系统

前端:10-wide Decode + 神经分支预测器。 当前 x86 最高(Zen 5/6)是 8-wide,ARM 公版 Neoverse V2 是 6-wide,Olympus 直接拉到 10-wide------对标 Apple M 系列的设计规模。背后的支撑是神经分支预测器(Neural Branch Predictor),每周期处理两个 taken branch。Agent 代码全是 if-else 和动态调用,分支预测命中率直接决定有效 IPC。

中核:价值预测 + 内存重命名 + 关键路径加速。 价值预测(Value Prediction)------猜 load 指令会返回什么值,不等 DRAM 直接继续执行后面的指令。这在学术圈研究了二十年,商业 CPU 中大规模部署的极少。内存重命名(Memory Renaming)解决指针链的 alias 问题。关键路径加速标记最长依赖链上的指令给予优先调度。再加上大 ROB + 大物理寄存器堆,in-flight 指令数远超 Grace。

执行引擎:SVE2 + FP8。 6×128-bit SVE2 向量单元(单线程),双线程时各 3×128-bit。FP8 原生支持是 CPU 史上首次------之前的 Intel AMX 和 ARM SME 把 FP8 放在矩阵加速器里,不在核心流水线中。LLM 推理前的 token 量化------过去在 GPU 上浪费 GPU 算力,Vera 在 CPU 上以 FP8 精度完成,直接通过 NVLink-C2C 喂给 GPU。

缓存子系统:图预取器(Graph Prefetcher)。 标准 prefetcher 对规律访问有效。Agent 的数据结构完全不同------每一步地址取决于上一步取值,传统 prefetcher 完全失效。图预取器通过学习内存访问中的指针模式来预测下一个 load 地址。Intel 和 AMD 的 CPU 里没见过------NVIDIA 专门为 Agent 负载做的差异化投资。


空间多线程:名字就叫 SMT,但和你知道的那个完全不一样

NVIDIA 的 Spatial Multithreading 缩写也叫 SMT。两个 SMT 的区别:

传统 SMT(Intel Hyper-Threading): 两个线程共享分支预测器、解码带宽、执行单元、Load/Store 队列、L1/L2 Cache。一条线程的 cache miss 驱逐另一条的数据。结果:0-30% 吞吐提升,延迟完全不可预测。

Vera 空间多线程: Olympus 核心足够宽,物理分两个线程槽。单线程模式时全部资源给一条线程,兄弟线程只跑后台管理。双线程模式时资源物理平分,互不干扰。结果:接近 100% 吞吐提升,延迟完全可预测。

为什么确定性延迟对 Agentic AI 是刚需?

一个 Rubin GPU 集群每秒烧几千美元。如果 CPU 线程竞争导致 Kernel Launch 抖动 30ms------1 个 GPU 空转 → 72 个 GPU 一起等(NVL72 紧耦合)→ 1 次抖动 = 2.16 GPU-秒浪费。每天几千次 = 几万 GPU-秒。空间多线程把这种不确定性归零。x86 SMT 可以提供接近的平均延迟,但无法消除尾延迟。


SCF 互联与 SOCAMM2 内存子系统

SCF(Scalable Coherency Fabric)是 Vera 的片上骨干:3.4 TB/s 对分带宽,164 MB 统一 L3,所有 88 核在单片 Die 上,无跨 Die NUMA。

SOCAMM2 LPDDR5X 是 Vera 在内存形态上的关键创新:LPDDR 的低功耗和高带宽(1.2 TB/s)+ DIMM 的可维护性 + 企业级 RAS(ECC/内存镜像/rank sparing)。之前这三个需求互斥(LPDDR 必须焊死才能维持短电气路径),NVIDIA 通过模块化设计突破了这个限制。


双路单 NUMA:和 Chiplet 路线说再见

x86 双路服务器的 NUMA 地狱:Socket 0 内 2-4 NUMA + Socket 1 内 2-4 NUMA = 总共 4-8 个 NUMA 域。线程放哪、内存在哪、I/O 走哪------需要专门的性能工程师。

Vera 的方案:每个 Socket 单 NUMA 域(单片 Die 的自然结果),双路 = 两个 NUMA 域。NVLink-C2C Gen 2 做 Socket 间互联。NVIDIA 博客原话:"avoids the die-hop latency and variability common in fragmented chiplet designs"。软件优先。


性能:1.8× Agent 负载提升

博客 Figure 6:"Vera CPU delivers up to 1.8x higher performance on agentic workloads"。

注意限定词:"up to"------最好情况。"agentic workloads"------Python 执行、代码编译、工具驱动路径,不是 SPEC 整数。"loaded single-thread performance"------全 socket 跑满 176 线程时的单线程性能,不是单核空跑峰值。

这个指标比单核峰值难得多:88 个核心同时争抢 L3、内存带宽、SCF 对分带宽。单核的邻居越多,单核越难维持高性能。Vera 在这个场景下比 Grace 好 1.8 倍。


我的几个判断

第一,Olympus 自研核心是 NVIDIA CPU 战略的梭哈时刻。 Grace 是试水(ARM 公版 + NVLink 包装),Vera 是全栈自研------核心、互联、内存、NUMA 全部自己定义。这个跨越相当于 AMD 从 Bulldozer 到 Zen。

第二,神经预测器 + 价值预测 + 图预取器一起出现,说明 NVIDIA 对 Agent 负载做了深度 profiling。 不是"比 x86 快 10%",而是"x86 架构在 Agent 负载上有 30-50% 的无用功"。这三个技术没有一个是传统服务器 CPU 的标配。

第三,单片 Die 短期很对,长期有天花板。 88 核是物理极限。SCF 正在为未来多 Die 扩展做准备。Vera-next(2028?)必须面对 Chiplet 问题------那时 Rubin GPU 的计算密度又翻了一倍。

第四,NVLink-C2C 1.8TB/s 是 x86 翻不过去的结构性壁垒。 不是技术问题,是商业模式------Intel 和 AMD 不可能为 NVIDIA 定制 CPU-GPU 一致性互联协议。

第五,白皮书里的 SPEC 分数才是硬验证。 博客是架构叙事,1.8× 是定性结论。等拿到白皮书原文我会补上 SPEC 分析。


发布时间:2026年7月22日 来源:NVIDIA Developer Blog "Inside NVIDIA Vera CPU: Olympus Cores Built for Maximum Single-Threaded Performance in Agentic AI" (2026.7.21)、NVIDIA Vera CPU Architecture Whitepaper

相关推荐
yiyesushu1 小时前
GitHub Copilot 在 vscode 中使用之 Prompt
人工智能·visual studio code
小K漫剧创作笔记1 小时前
AI短剧出海从「选修课」变「必修课」:合规分发正在成为内容全球化的真正门槛
大数据·人工智能·ai·aigc·漫剧
蜜桃味女焊匠人1 小时前
气保焊怎样改造,稳定达成40%-60%节气降耗效果?
人工智能·经验分享·其他·机器人
探索云原生1 小时前
Kubernetes 官方出品:一个 Controller 搞定 Job 排队和资源配额
ai·云原生·kubernetes·scheduler
matlab代码1 小时前
基于Hough变换的道路提示牌检测标记系统【源码50期】
人工智能·计算机视觉·图像标记
Ai_easygo2 小时前
多Agent协作与A2A协议——CrewAI + LangGraph搭建AI协作团队
人工智能
HIT_Weston2 小时前
151、【Agent】【OpenCode】启动分析(CLI 命令注册)
人工智能·agent·opencode
笑小枫2 小时前
用 Claude Code 推翻重写笑小枫网站
java·人工智能·spring boot·ai编程
audyxiao0012 小时前
人工智能顶会AAAI 2026论文分享|SlideBot:用于生成信息丰富、可靠、多模态幻灯片的多智能体框架
人工智能·大模型·aaai·智能体·幻灯片