华为昇腾 960 超节点发布:4096 卡、5500 个光引擎替 4.8 万光模块——国产算力拐点到了吗?

华为昇腾 960 超节点发布:4096 卡、5500 个光引擎替 4.8 万光模块------国产算力拐点到了吗?

核心结论 :9 月 17 日华为全联接大会发布昇腾 960 超节点------全球首个采用 NPO 光引擎的超节点,单节点 4096 卡、5500 个自研光互联产品替代原本需要的 4.8 万颗 800G 光模块,功耗直降 550 多千瓦,系统可用度 99.8%。配合灵衢互联协议和多轨道拓扑,最大可扩到 100 万卡集群。对企业架构师的含义是:国产算力正在从"能用"跨到"好用"------智谱刚把 2026 年 ARR 指引从 24 亿美元上调到 30 亿美元,验证了这条路线的商业化闭环。 这篇文章从工程视角拆解 NPO 光互联到底解决了什么问题,以及企业现在该不该把国产算力写进架构选型。

一、为什么是超节点:传统架构的 40% 通信代价

先看一个被多数人忽略的数字。华为轮值董事长汪涛在大会上给出:传统服务器架构下,集群内通信代价超过训练时间的 40%,严重制约 MFU(模型浮点算力利用率)。

翻译成人话:你花 100 块钱买 GPU,有 40 块花在了"卡和卡之间互相喊话"上,真正算矩阵乘法的时间只占一半多一点。

背景是模型参数规模的爆炸:Kimi K3 7 月发布时参数 2.8 万亿,Qwen3.8 八月总参数 2.4 万亿,大模型参数正快速迈向 10 万亿。中国每日推理 Token 已增长到 500 万亿左右。十万亿级模型训练,10 万卡集群已经是标配。

但传统服务器架构是为"每个节点独立干活"设计的------服务器之间走标准以太网/IB 网络,延迟高、带宽瓶颈明显。当你把 10 万张卡堆在一起训一个模型,数据要在卡之间来回同步,通信时间就吃掉了 40% 的训练窗口。

超节点(SuperPoD)的思路是:把几十、几百、几千张卡通过专用互联协议紧密封装成"一台计算机",跨物理节点统一内存编址。逻辑上看,这就是一台超大机器,而不是几千台小机器的网络。

二、昇腾 960 的三个工程突破

1. NPO 光引擎:5500 个光引擎替 4.8 万颗光模块

这是本次发布最硬的技术点。昇腾 960 超节点搭载了 5500 个华为自研的新一代 NPO(Near-Packaged Optics,近封装光学)光互联产品 Hi-ONE。

对比一下:按传统方案,4096 卡规模的互联需要大约 4.8 万颗 800G 光模块。华为用 5500 个 NPO 光引擎把这部分替代掉了。

工程收益:

  • 功耗直降 550 多千瓦------一个 4096 卡机房省出的电力,相当于一个中型数据中心的冷却负荷;
  • 系统无故障运行时间提升 1 倍------光引擎数量少了一个数量级,故障点自然少;
  • 系统可用度达到 99.8%

为什么 NPO 这么省电?传统光模块是"把电信号转成光信号再转回来",每一跳都有光电转换损耗;NPO 把光引擎直接贴在交换芯片旁边,缩短电信号路径,从物理上把功耗和延迟都压下来。这和英伟达 NVL72 的"机柜内光互联"是同一代思路,但华为是全球第一个把它做成商用超节点的。

2. 正交架构 + 全液冷

昇腾 960 采用正交架构和全液冷设计。正交架构的含义是:计算平面和互联平面在空间上垂直布置,避免线缆交叉堵塞风道和维护通道;全液冷则把单柜功率密度推到风冷方案无法支撑的水平。

这两点放在一起,解决的是数据中心的现实瓶颈------不是芯片不够快,是电送不进去、热带不出来。昨天我们刚写过 AEMA 联盟要解决的电网瓶颈,今天华为的方案是从机房内部把单位功耗压下来。

3. 灵衢互联协议:从 4096 卡到 100 万卡的扩展路径

昇腾 960 单节点 4096 卡,多个超节点通过灵衢网络二层 CLOS 四平面组网,最大集群规模 51.2 万卡;再结合多轨道拓扑技术,最大可构建 100 万卡昇腾超节点集群。

超节点代际 单节点规模 状态 定位
昇腾 384 384 卡 2025 年上市,已部署超 1000 套 行业商用起点
昇腾 950 1024 卡 已规模商用 万亿级模型训练推理
昇腾 960 4096 卡 9/17 发布,960DT 2027Q1 就绪 十万亿级模型
昇腾 970/980 规划中 2028/2029 陆续推出 按 τ 定律规格继续翻倍

数据来源:华为全联接大会 2026 汪涛主题演讲(9/17)、上海证券报《超节点+光互联 华为亮出算力新蓝图》(9/21)、36氪(9/17)。

三、国产算力拐点的三个商业信号

技术参数听着热闹,企业真正关心的是:"这东西到底好用不好用?"三个商业信号值得拆开看。

信号 1:智谱把 ARR 指引从 24 亿上调到 30 亿美元。

9 月 18 日智谱上线 GLM-5.3-FlashX,在国产算力集群支撑下进一步优化推理效率,并将 2026 年末年度经常性收入(ARR)指引从 24 亿美元上调至 30 亿美元(中信建投研报 9/21)。这是国产大模型第一次把"国产算力+国产模型"的商业化闭环跑出来------不是 PPT,是收入指引上调。

信号 2:Nebius 把 GPU 云租赁价格上调 17%-21%。

海外 GPU 云厂商在涨价,说明算力供需仍然偏紧。国内智谱能在国产算力上跑全量生产推理,等于给企业提供了一个不依赖海外 GPU 的备选池。

信号 3:CANN 开源社区外部开发者首次超过内部。

抖音发布会现场数据:CANN(昇腾异构计算架构)已进入常态化开源社区运作,外部开发者占比 61%,月活超 5200 名,是中国最活跃的 AI 开源社区。这是国产算力生态从"华为自己用"跨到"外面人愿意来"的关键拐点------过去几年最大的质疑就是生态封闭。

四、企业怎么判断国产算力是否 ready

我在过去几个企业级 AI 项目里踩过国产算力的坑,给一个三层判断框架:

第一层:能不能跑通? 看你要训/推的模型有没有人在昇腾上跑过。智谱、DeepSeek、Qwen 都已经在昇腾集群上有生产部署,主流模型框架的移植成本已经降到可接受范围。但如果你用的是极其小众的算子或自定义 CUDA kernel,迁移成本仍然很高。

第二层:跑得好不好? 看 MFU。华为说 960 把通信代价压下来后 MFU 会显著提升,但企业要自己 benchmark------拿你的真实模型、真实 batch size、真实序列长度跑一遍,和英伟达 H 系列对比吞吐和延迟。不要拿厂商 PPT 上的峰值数做决策。

第三层:算得过账吗? 把三块成本加起来:硬件采购、电力冷却、运维人力。NPO 光互联把功耗降了 550 千瓦,这在三年 TCO 里是实打实的节省。但如果你的团队没有熟悉 CANN 生态的工程师,学习成本会吃掉这部分节省。

五、Q&A

Q1:昇腾 960 和英伟达 NVL72/GB200 谁更强?

这两家现在不在同一个时间点上比。英伟达 NVL72 已经规模商用,GB200 也在出货;昇腾 960 的 960DT 要到 2027Q1 才就绪,960PR 到 2027Q3。短期看,英伟达在软件生态和开发者心智上仍然领先一代;中期看,NPO 光互联路线华为是商用首发,路线选择上没有落后。企业选型不要比单点峰值,比你自己业务的 TCO。

Q2:我们公司现在要不要把业务迁到昇腾?

分场景看。如果你的业务是训练十万亿级大模型、需要万卡以上集群,昇腾 960 的 NPO 互联和百万卡扩展能力值得评估;如果你的业务是日常推理、百卡以内,继续用现有方案即可,没必要为了"国产化"而国产化。正确姿势是:新业务按昇腾做兼容设计,存量业务按合规节奏迁移。

Q3:NPO 光互联是华为独有技术吗?

NPO(近封装光学)是行业方向,谷歌、英伟达都在布局。华为的不同点在于把 NPO 做成了商用超节点的标配------5500 个光引擎替 4.8 万颗光模块,这个工程化规模目前是公开信息里最大的。具体的良率、可维护性、长期成本,还要看 2027 年量产后的实际数据。

Q4:国产算力"卡脖子"问题解决了吗?

没有完全解决,但在改善。昇腾 960 的芯片本身是国产设计,光引擎也是自研,互联协议灵衢也是自研。但制造端的先进制程产能、HBM 供应、EDA 工具链仍然有外部依赖。企业决策时不要假设"已经完全自主可控",而要做"最坏情况下能跑通什么"的压力测试。

六、给技术决策者的 3 条判断

  1. 把"超节点"写进下一代算力规划。2027 年之后,万卡以上集群的标准形态会从"服务器组网"变成"超节点堆叠"。现在做架构规划时,不要按传统 IDC 机房的思路设计,要按液冷机房、高密柜、光互联的新范式预留空间。

  2. 国产算力从"试点"转"规模化"的窗口在 2027 年。昇腾 960DT 2027Q1 就绪、960PR 2027Q3 就绪、970/980 一年一代。如果你今年在做 2027-2028 年的算力采购预算,现在就应该把昇腾方案纳入对比清单,而不是等到 2027 年才开始调研。

  3. 生态比参数更重要。CANN 社区外部开发者 61%、月活 5200、3000+ 行业合作伙伴、7000+ 行业方案------这些数字比"8 EFLOPS"更能决定你未来三年的工程效率。选型时优先看你所在行业有没有成熟方案,而不是看单卡性能。


关于作者:AI 架构的深耕者,智能价值的转化者。11 年全栈 AI 架构与技术掌舵经验,立足架构设计与战略决策双视角,精通大模型全链路工程化部署,独握端侧 AI 软硬一体化核心技术。主导 15+ 企业级 AI 项目从蓝图到落地,累计创造超 2000 万合同价值,服务千万级用户与 500+ 企业。关注我,一起把前沿 AI 变成可落地的商业价值。

数据来源:华为全联接大会 2026 汪涛主题演讲(2026-09-17,上海);上海证券报《超节点+光互联 华为亮出算力新蓝图》(2026-09-21);36氪《华为发布业界首个使用 NPO 的昇腾 960 超节点》(2026-09-17);中信建投/中信证券相关研报(2026-09-21);智谱 GLM-5.3-FlashX 上线公告(2026-09-18)。产品规格以华为官方发布为准,本文工程解读为作者个人判断。

本文基于 2026-09-21 可查证的公开信息撰写,不构成投资建议。

相关推荐
O。O蛋黄酥啊1 小时前
Claude Code 记忆机制全拆解:Auto Memory 与 CLAUDE.md 双轨解析
大模型·agent·memory·claude·codex·记忆
BlackStar_L2 小时前
第二章 上下文工程
大模型·llm·agent
进阶的猪2 小时前
RKNN C API模型部署完整流程
rknn·模型部署·c api
User_芊芊君子3 小时前
让 Claude Code 换上国产大脑:蓝耘元生代上 GLM-5.2 / DeepSeek / Qwen 模型横评实测
人工智能·ai·大模型
寻道码路3 小时前
大模型工程化实战(十二):RAG 数据工程底座——采集到入库流水线(离线+在线双链路)
大模型·知识库·rag·ai工程化·llmops`·数据工程底座·文档采集
Web3&Basketball12 小时前
CRM Agent 后训练实战:3 倍更少错误
python·架构·大模型·agent·推理
蚁小二官方12 小时前
AI 安全治理框架更新|大模型训练数据合规,企业实操落地思路
大模型·数据合规·ai安全
AI模力圈20 小时前
On-Policy Distillation:原理、变体与工程实现解析
大模型·强化学习·知识蒸馏
长谷深风11121 小时前
根因定位:三步隔离法破解AIBadcase
人工智能·ai·大模型·retrieval·ai智能体·aiagent·aibadcase