国产算力双雄对决:曙光8000十万卡集群 vs 华为昇腾950超节点深度解析

国产算力双雄对决:曙光8000十万卡集群 vs 华为昇腾950超节点深度解析

前言

在刚刚落幕的2026世界人工智能大会(WAIC)上,国产算力基础设施成为当之无愧的焦点。中科曙光的"曙光8000(登峰)"入选大会十大"镇馆之宝",华为昇腾950超节点(Atlas 950 SuperPoD)则斩获大会最高荣誉SAIL奖。如果说昇腾950代表了单系统超节点的极致,那么曙光8000则展示了超大规模集群的雄心。本文将深度解析这两大国产算力重器。

一、曙光8000(登峰):首个全国产十万卡AI超集群

1.1 系统概述

曙光8000(登峰)由中科曙光打造,是中国首个全国产十万卡AI超集群。该集群占地仅2000平方米,于2026年7月10日正式落成,部署历程经历了多个阶段:2024年完成系统研制,2025年完成工程建设,2026年2月3万卡上线试运行,4月6万卡投入使用,6月完成10万卡部署。上线一周即满载运行。

1.2 核心技术路线

曙光8000采用 "超智融合" 技术路线,摒弃传统分区方式,实现了科学计算与智能计算的原生一体化融合。系统支持FP64到INT8全精度计算,可无缝覆盖科学计算、大模型训练、AI推理、工业仿真等多类场景。

1.3 硬件规格

· 算力底座:由海光CPU+DCU等国产芯片提供底层支撑

· 高速网络:自研scaleFabric类IB原生RDMA高速互连技术,实现十万卡规模超高速稳定互连

· 分布式存储:ParaStor分布式存储,支撑大模型训练和科学计算中的海量数据读写

· 液冷散热:浸没式相变液冷技术,可支撑单机柜MW级高功率密度部署

· 算力密度:全球首创高密度机柜结构,单个计算单元算力密度较其他超节点提升20倍

· 管理平台:Gridview7.0一站式智能化算力管理平台

1.4 全链路国产化

曙光8000实现了 "芯片、计算、存储、网络、散热、应用、服务"全链路全自研。

1.5 应用与生态

目前,曙光8000已完成300余项超智融合应用优化,覆盖大模型、机器人、创新药、新材料、量子计算、天文气象等20余个科研和产业领域。超过70项应用实现万卡规模扩展,已支撑蛋白质折叠模拟(8万卡)、万亿原子级水分子动力学模拟(9万卡)、超大规模湍流模拟等科学智能应用。集群已同步接入国家超算互联网。

二、华为昇腾950超节点(Atlas 950 SuperPoD)

2.1 系统概述

昇腾950超节点(Atlas 950 SuperPoD)是华为基于昇腾950DT芯片打造的旗舰级智算超节点。在WAIC 2026上首次以真机形式展出。该产品基于自研灵衢(UnifiedBus)互联协议和超节点架构,实现业界最大1024卡规模。

2.2 核心芯片:昇腾950DT

昇腾950DT是华为AI芯片路线图中的关键型号:

· 微架构:升级为SIMD/SIMT

· 算力:1 PFLOPS(FP8)/ 2 PFLOPS(FP4)

· 自研HBM内存:搭载HiZQ 2.0(代号"朱雀"),容量144GB,带宽4TB/s

· 互联带宽:2TB/s

· 数据格式:支持FP32、HF32、FP16、BF16、FP8、MXFP8、HiF8、MXFP4、HiF4等

· 上市时间:计划2026年第四季度上市

950DT专为对带宽极度敏感的推理Decode阶段及模型训练场景打造。

2.3 超节点规格

· 配置规模:标准1024卡,由16台计算柜组成,每柜64张芯片

· 总算力:1 EFLOPS(FP8)/ 2 EFLOPS(FP4)

· 全局内存:256TB全局统一内存编址空间

· 互联带宽:TB级NPU互联带宽

· 通信时延:3微秒(μs) 超低RTT时延

· 散热方案:主打液冷方案;另有Atlas 850E风冷版本

· 设计上限:最大可扩展至8192张昇腾卡

· 集群扩展:基于该超节点打造的Atlas 950 SuperCluster集群可扩展至50万卡

2.4 互联技术:灵衢(UnifiedBus)

灵衢是华为自研的高速互联协议,已于2025年向业界全面开放。灵衢2.0相比传统互联协议,通信带宽提升15倍,单跳通信时延从2微秒降至200纳秒,降低10倍。基于UB-Mesh递归直连拓扑网络架构,支持单板内、单板间和机架间的NPU全互联。

2.5 商用生态

昇腾384超节点(前代产品)已商用落地750多套,广泛应用于互联网、运营商、金融、教育、医疗、交通、制造等20多个行业。CANN开源社区已上线67个社区项目,累计开源代码超1244万行,月活跃开发者突破3500人。

三、对比总结

对比维度 曙光8000(登峰) 华为昇腾950超节点

系统定位 大规模AI超集群 超节点服务器

卡规模 十万卡级 标准1024卡(上限8192卡)

总算力 未披露具体数值 1 EFLOPS FP8 / 2 EFLOPS FP4

核心芯片 海光CPU + DCU 昇腾950DT(自研HBM)

精度支持 FP64 ~ INT8 全精度 FP8 / FP4 为主

互联技术 scaleFabric(类IB RDMA) 灵衢(UnifiedBus)

通信时延 未披露 3μs超低时延

全局内存 未披露 256TB统一编址

散热方案 浸没式相变液冷 液冷(标配)/ 风冷(850E)

落地状态 已落成运营 计划2026 Q4上市

生态规模 300+项应用优化 前代750+套商用

核心差异

曙光8000是一个已投入运营的"算力超级工厂" ,强调大规模工程化落地和全精度覆盖,兼顾科学计算与AI计算。

华为昇腾950则是一个即将交付的"超强算力引擎" ,追求极致的单节点性能和互联效率,专为万亿级大模型训练与高并发推理设计。

两者代表了国产算力在 "规模应用"与"技术突破" 上的不同侧重,共同构筑起支撑中国AI产业发展的坚实算力底座。

参考文献

  1. 我国首个全国产10万卡AI超集群曙光8000登峰亮相WAIC 2026,凤凰网,2026-07-17

  2. WAIC 2026探展:国产算力进入"效能为王"新阶段,新浪财经,2026-07-18

  3. 世界人工智能大会2026镇馆之宝!曙光8000真机全球首秀,新京报,2026-07-18

  4. 华为将于今年四季度上市两款智算超节点,东方财富,2026-05-22

  5. 华为昇腾AI芯片路线图公布,快科技,2025-09-19

  6. 昇腾950超节点真机亮相2026世界人工智能大会,华为官网,2026-07-17

  7. 华为首次展示昇腾950超节点:1024卡集群,凤凰网,2026-07-17

相关推荐
xcLeigh1 小时前
AI 编程的未来趋势:2025-2026 年你必须关注的六大技术方向
人工智能·ai·ai编程
xcLeigh1 小时前
88%在用,不到10%完成规模化部署——AI Agent落地差在哪里
人工智能
一见已难忘1 小时前
产业AI落地技术解析:边缘部署、工业视觉检测与多传感器融合预警的工程实践(燎原:我看见的智能中国)
人工智能·计算机视觉·视觉检测
小燕子~~1 小时前
Photoshop2026新版 AI 功能实测,看这一篇就够了
图像处理·人工智能·ai·aigc·photoshop
星河耀银海1 小时前
数据解析:AI返回JSON数据在HTML5中的渲染方法
人工智能·json·html5
秦先生在广东1 小时前
构筑 AI Agent 的实时安全防线:Harness 与 AWS AgentCore Gateway 的深度集成解析
人工智能
秦先生在广东1 小时前
可审计决策原语:重塑 Agent 循环中的治理与信任
人工智能
米小虾1 小时前
一周 AI 观察(9.23–9.30):越狱的 Agent、腰斩的价格,与一场关于 GPU 的金融赌局
人工智能
秦先生在广东2 小时前
AI 时代的交付新瓶颈:从代码生成速度到生产环境持续信任
人工智能