NVIDIA DGX/HGX 服务器全景深度解析:从 H100 到 GB300,专业算力选型必读
⚠️ 声明:本文由 AI 辅助调研整理,价格信息为 2026 年 9 月市场公开数据(波动大、仅供量级参考),规格以 NVIDIA 官方 Datasheet 及厂商页面为准。
一、先厘清概念:DGX、HGX、MGX、EGX 到底是什么关系?
很多做了多年算力的人仍然分不清这四个词。它们不是性能高低的区别,而是四种完全不同的产品形态:
| 平台 | 本质 | 谁来组装 | 目标用户 |
|---|---|---|---|
| DGX | NVIDIA 原厂设计、原厂出厂的整机(含全套软件栈) | NVIDIA | 科研机构、头部企业、不差钱要开箱即用 |
| HGX | GPU 核心模组 + 参考设计(SXM 基板 + NVSwitch + 供电散热方案) | Dell/SMCI/联想/浪潮等 OEM | 云厂商、IDC、大规模自建集群 |
| MGX | 模块化服务器架构(计算/存储/网络分离,可独立升级) | OEM 按模块组合 | 现代化数据中心、混合负载 |
| EGX | 边缘加速平台(L4/L40S 等低功耗 GPU) | OEM | 边缘推理、工业视觉、智慧城市 |
一句话记住核心区别:HGX 是发动机底盘(一块 8 卡 SXM GPU 主板模组,无法独立工作,必须配机头服务器平台),DGX 是在这个模组之上由 NVIDIA 亲自装好的整车(含 DGX OS、Base Command、NVIDIA AI Enterprise、三年企业级软硬件支持)。
同一代芯片下,HGX 模组的算力与 DGX 同级,但整机由 OEM 自由搭配 CPU/内存/存储/网络,成本更低、可定制性更强------这就是全球云厂商和 IDC 几乎全用 HGX 方案,而 DGX 主要卖给科研和企业要确定性客户的原因。
二、GPU 模组演进:HGX H100 → B200 → B300
2.1 HGX H100 / H200(Hopper,SXM5)
- H100 SXM5:80GB HBM3,带宽 3.35TB/s,FP8 稠密算力约 989 TFLOPS(稀疏 1979 TFLOPS),TDP 700W
- H200 SXM5:141GB HBM3e,带宽 4.8TB/s(+43%),算力与 H100 持平------H200 的升级全在显存,长上下文推理和大 Batch 推理收益显著
- NVLink 4.0:单 GPU 双向 900GB/s,4 颗 NVSwitch 芯片把 8 卡连成全互联域
2.2 HGX B200 / B300(Blackwell,SXM6)
- B200:180/192GB HBM3e(按 SKU),带宽约 8TB/s,TDP 1000W,NVLink 5.0 单卡双向 1.8TB/s
- B300(Blackwell Ultra):288GB HBM3e 单卡,互联升级至 800Gb/s,FP4 稠密算力约 1.1 PFLOPS/卡
- Blackwell B200 实为双 Die(chiplet)设计,NV-HBI 片间 10TB/s,2080 亿晶体管------严格说 NVL72 应叫 NV144 die,这也是下一代 Rubin 采用 NVL144 命名的原因
三、DGX 整机全系机型详解(重点)
3.1 DGX H100 --- AI 基础设施的金标准
| 项目 | 规格 |
|---|---|
| GPU | 8× H100 SXM5 80GB,总计 640GB HBM3 |
| GPU 互联 | NVLink 4.0 + 4× NVSwitch,900GB/s/GPU |
| CPU | 2× Intel Xeon Platinum 8480C(56 核×2,共 112 核) |
| 系统内存 | 2TB DDR5 |
| 存储 | 2× 1.9TB NVMe M.2(OS)+ 8× 3.84TB NVMe U.2(约 30TB) |
| 网络 | 8× 单口 ConnectX-7 400Gb/s(IB/以太)+ 2× 双口 BlueField-3 DPU(400G+200G) |
| 性能 | 32 PFLOPS FP8(稀疏),64 PFLOPS FP16 稀疏 |
| 功耗 | 最高 10.2 kW,8U 风冷 |
| 软件 | DGX OS(Ubuntu 底座)、Base Command、NVIDIA AI Enterprise |
| 市场 | 2022 年底上市;国内渠道整机从数月前不足 200 万涨至约 310-345 万元/台(2026-08 现货报价,94G 修复版溢价更高) |
3.2 DGX H200 --- 显存加倍的推理特化版
| 项目 | 规格 |
|---|---|
| GPU | 8× H200 SXM5 141GB,总计 1128GB HBM3e |
| GPU 互联 | 4× NVSwitch,GPU 双向 7.2TB/s(单卡 900GB/s 不变) |
| CPU / 内存 | 2× Xeon Platinum 8480C(112 核)/ 2TB |
| 存储 | 30TB NVMe SSD |
| 网络 | 10× ConnectX-7 400Gb/s(峰值双向 1TB/s) |
| 市场 | 2024 年 Q2 上市;国内 HGX 版整机报价约 535-566 万元/台(2026-09),PCIe NVL 版约 410-420 万元 |
3.3 DGX B200 --- Blackwell 风冷旗舰
| 项目 | 规格 |
|---|---|
| GPU | 8× B200 SXM6 180GB,总计 1.4TB HBM3e,聚合带宽 64TB/s |
| GPU 互联 | NVLink 5.0,1.8TB/s/GPU(双向) |
| 性能 | 72 PFLOPS 训练 / 144 PFLOPS 推理(FP8,稀疏)------训练 3 倍、推理 15 倍于 DGX H100 |
| CPU | 双路 Intel Xeon(第五代/第六代) |
| 网络 | 8× ConnectX-8 800Gb/s + 2× BlueField-3 |
| 功耗 | 约 14 kW 风冷 |
| 零售价 | 首发渠道价 51.5 万美元(约 364 万元人民币,Broadberry 2024-10 报价) |
3.4 DGX B300 --- Blackwell Ultra 十卡级(当前风冷顶配)
| 项目 | 规格 |
|---|---|
| GPU | 8× Blackwell Ultra SXM,总计 2.1-2.3TB HBM3e |
| 性能 | FP4:144 PFLOPS(稀疏)/108 PFLOPS(稠密);FP8:72 PFLOPS |
| CPU | Intel Xeon 6776P |
| GPU 互联 | NVLink 交换系统,聚合 14.4 TB/s(2 倍于 B200) |
| 网络 | 8× ConnectX-8(800Gb/s IB/以太)+ 2× 双口 BlueField-3(400G) |
| 存储 | 2× 1.9TB M.2 + 8× 3.84TB E1.S |
| 功耗 | 约 14 kW,10U |
| 软件 | Mission Control(集成 Run:ai)+ AI Enterprise + DGX OS(RHEL/Rocky/Ubuntu) |
3.5 DGX GB200 / GB300 NVL72 --- 机架级超级计算机
这是 DGX 产品线的形态跃迁:从一台服务器变成一个机柜就是一台超算。
| 项目 | DGX GB200 NVL72 | DGX GB300 NVL72 |
|---|---|---|
| 构成 | 18× 计算托盘(1U)= 36 GB200 超级芯片 = 72 B200 + 36 Grace | 18× 1U 托盘 = 72 Blackwell Ultra + 36 Grace(2592 个 Arm 核) |
| GPU 显存 | 13.5TB HBM3e(192GB/卡) | 20-21TB HBM3e(288GB/卡) |
| CPU 内存 | 17TB LPDDR5X | 最高 17TB LPDDR5X,GPU+CPU 总内存约 37TB |
| 互联 | NVLink 5.0 全交换,1.8TB/s/GPU,9+ 托盘 NVSwitch,对分带宽约 130TB/s | 同代 NVLink,一跳直达 |
| 性能 | 720 PFLOPS FP8 / 1440 PFLOPS FP4 | 1080 PFLOPS FP8 / 1440 PFLOPS FP4(1.1 EFLOPS 稠密 FP4) |
| 网络 | 18× BlueField-3 + 72× ConnectX-7 400G | 72× ConnectX-8 800G + 18× BlueField-3 |
| 散热/功耗 | 全液冷,满载约 120-130kW,整机约 1.3-1.36 吨 | 全液冷,132kW 供电(8× 33kW),250kW CDU |
| 价格 | 约 300 万美元/机柜(HSBC 估算,约 2172 万元) | 机柜级价格更高,DGX Station GB300 桌面版起售 9.49 万美元 |
| 实测 | 1.8T MoE 实时推理吞吐约为 H100 的 30 倍 | LLM 推理 11 倍于 Hopper 代 |
关键细节:GB200 超级芯片内部用 NVLink-C2C(约 900GB/s)把 1 颗 Grace CPU 与 2 颗 B200 绑成缓存一致的统一内存域;72 卡通过 2 英里长的 NVLink 线缆在全机柜内组成单一 NVLink 域------这是把 72 张卡当一张卡用的物理基础。
3.6 DGX Station / DGX Spark --- 桌面级
- DGX Spark(GB10 超级芯片,MediaTek 联合设计):20 核 Grace + Blackwell 桌面 GPU,128GB 统一内存,1 PFLOP(FP4),体积仅 115mm×50.5mm,ConnectX-7 可双机互联跑 405B 模型。官方价 3999→4699 美元(2026-02 因内存涨价上调 700 美元),美国现货一度炒到 4999 美元,约 3.2-3.4 万元人民币
- DGX Station(GB300 桌面超级芯片):252GB HBM3e + 496GB LPDDR5X = 748GB 统一内存,液冷,1800W 钛金电源,QSFP 400G 双机互联,起售 94930 美元(约 64 万元人民币),可跑万亿参数模型;小红书上 100 万预算 DGX Station VS Pro 6000 多卡工作站是 2026 年算力圈的热门选型话题,求购帖预算约 9 万美元
四、HGX 阵营:主流 OEM 机型一览(采购视角)
| 厂商 / 机型 | 支持 GPU | 形态 | 关键规格 |
|---|---|---|---|
| Supermicro SYS-A21GE-NBRT | HGX B200 8-GPU(180GB) | 10U 风冷 | 双路 Xeon 5/4,最高 4TB DDR5-5600,6× 5250W 钛金电源 |
| Supermicro SYS-822GS-NB3RT | HGX B300 SXM6(288GB×8) | 8U 风冷 | 双路 Xeon 6 6767P(64 核),3TB DDR5-6400,国内期货约 600 万、现货约 800 万元 |
| Supermicro 液冷 4U | HGX H100/H200 8-GPU | 4U D2C 液冷 | 最高 8TB DDR5,16× NVMe,CPU 可选 Xeon 或 EPYC 9004 |
| Dell PowerEdge XE9685L | HGX H200 141GB(700W)或 HGX B200 180GB(1000W SXM6) | 4U 液冷 | 8 GPU 全 NVLink 互联 |
| ASUS ESC NB8-E11 | HGX B200 8-GPU | 风冷 | 双路 Xeon 5(350W TDP),单 GPU 对单 NIC 拓扑(8 NIC),5+1 钛金电源 |
| ASUS ESC N8-E11 | HGX H100 80G SXM5 | 7U 风冷 | 12× PCIe 5.0、32 DIMM、10× NVMe、4+2 冗余 3000W;华硕现货 H100 整机曾有 274 万元/台报价 |
| 浪潮 NF5688G7 | 8× H100/H200 | 5U/8U | NVLink + IB 200G/RoCE,液冷或强化风冷,国内大模型训练主力机型之一 |
选购提示:HGX 模组本身(8 卡 SXM 基板)与机头平台分开报价,国内渠道常混报。2026 年市场参考价:H100 八卡模组约 150 万元(不含平台),HGX H200 模组约 150 万元/套;B300 八卡整机期货约 600 万元、现货约 800 万元。整机报价务必写清 GPU 形态(SXM/PCIe)、显存版本(80G/94G/141G/180G/288G)、NVSwitch 配置、IB/RoCE 网卡、保修与税票。
五、机架级与集群:DGX SuperPOD / BasePOD
- SuperPOD(Hopper 代):以 32 台 DGX H100/H200 为一个扩展单元(SU),FP8 算力 640 PFLOPS/SU,配 Quantum-2 IB 400G 计算网络 + Spectrum-3 存储网络 + BeeGFS/WEKA 并行存储。NetApp 参考架构建议单 SuperPOD 至少 2 个存储构建块
- SuperPOD(Blackwell GB200 代):8 套 DGX GB200 系统起步 = 576 颗 B200,FP4 共 11.5 EFLOPS,240TB 高速显存
- SuperPOD(Blackwell Ultra):8× NVL72 机架 = 288 Grace + 576 Blackwell Ultra,300TB HBM3e,11.5 EFLOPS FP4,即 AI 工厂最小单元
- BasePOD:面向中小规模的认证参考架构(16-32 卡起步,无需完整的 SuperPOD 认证流程)
- 网络选型惯例:训练用 Quantum-X800 InfiniBand(800G),推理/以太生态用 Spectrum-X 以太网;BlueField-3 做 NVMe-oF 存储卸载与安全隔离
六、软件栈:DGX 溢价的另一半
买 DGX 买的不只是硬件:
- DGX OS:Ubuntu 底座 + NVIDIA 认证驱动栈,RHEL/Rocky 可选(B300 起)
- Base Command / Mission Control:集群调度与运维(Mission Control 集成了收购的 Run:ai 能力,支持 GPU 分区、配额、多租户)
- NVIDIA AI Enterprise:含 NGC 容器目录(数百个预优化模型/框架镜像)、TensorRT-LLM、RAG/微调工作流,企业级 License 支持
- DGXperts / 企业支持:NVIDIA 工程师直接支持,三年软硬件商务级服务(GB300 标配)
HGX 方案则需要 OEM 或集成商自己堆这些能力(云厂商通常自研调度,如各家 K8s + Volcano/自研平台)。
七、专业选型建议(面向算力决策者)
按预算与场景:
| 场景 | 推荐形态 | 理由 |
|---|---|---|
| 千亿以下模型微调/推理 POC | DGX Spark / RTX Pro 6000 工作站 | 3-64 万元,128GB 统一内存够跑 70B 量化 |
| 百亿-千亿常驻推理、长上下文 | HGX/DGX H200 8 卡 | 141GB×8 显存 + 4.8TB/s 带宽是 KV Cache 利器 |
| 千亿-万亿训练(一次建成) | DGX B300 / HGX B300 8 卡 | FP4 时代单机顶过去半个机柜 |
| 万卡级 AI 工厂 | GB300 NVL72 × N + SuperPOD | 机柜级 NVLink 域 + 800G IB 扩展 |
| 云厂商/IDC 大规模自建 | HGX 模组 + OEM 机头 | 同算力成本最优,调度自研 |
三条避坑经验:
- 显存带宽比算力先成为瓶颈(MLPerf 与实测一致):推理场景优先看 HBM 容量/带宽(H200 141GB vs H100 80GB 推理吞吐近 2 倍),训练看 FP8/FP4 稠密算力与 NVLink 域大小
- 功耗与散热决定落地成本:8× B200/B300 风冷单机 14kW 已接近普通机房上限;NVL72 必须液冷(120-132kW/柜),改造机房时 CDU、承重(1.3 吨/柜)、供电冗余要提前设计
- H100 现货价格倒挂风险:2026 年 H100 整机从不足 200 万涨至 300 万+,主要受 94G 修复版溢价与现货稀缺驱动;若无出口合规限制,B200/H200 的单位算力成本更优,H100 高位追高需谨慎
八、总结
NVIDIA 的服务器产品线本质是同代 GPU 的四种交付深度:HGX(模组)→ DGX(原厂整机)→ SuperPOD(认证集群)→ NVL72/GB 系列(机架级超级芯片)。代际上从 Hopper(H100/H200)到 Blackwell(B200/B300),再到的 Grace 统一内存机架(GB200/GB300),演进主线始终是:更大的 HBM、更宽的 NVLink、更高的机柜算力密度。
对专业算力从业者,2026 年的关键判断是:单机 8 卡风冷仍是主流采购单元(14kW 上限),但真正的性能代差发生在机架级 NVLink 域(NVL72 的 130TB/s 对分带宽)------未来两年,按机柜报价会逐步取代按台报价成为大单主流。
参考:NVIDIA 官方 Datasheet(DGX H100/H200/B200/B300/GB300)、NetApp SuperPOD 设计指南、Supermicro/戴尔/华硕/浪潮产品页、SMM 上海有色网与 Mysteel 算力价格快讯(2026-08/09)、知乎 GB200 NVL72 拆解、IT之家/快科技报道,以及小红书社区实机讨论帖。