
算力方案和昇腾计算产品介绍











网络方案和产品介绍










总结
-
智算方案背景与核心架构
- 全球算力发展现状
- 算力梯队划分:全球各国人均算力分为低、中、中高三个梯队,中国2021年统计值为5.2,属中算力梯队偏下水平。
- 算力增长趋势:未来算力增长核心动力为AI算力,其增长速度远超通用计算,华为针对该趋势已加大相关技术投入。
- 主流AI训练技术架构
- 全球算力发展现状
-
单机多卡训练模式:当前主流AI训练采用单机多卡并行模式,以华为 SS 800 为例,单台搭载8张计算卡,由主机统筹加速训练。
-
PS参数服务器架构:分布式训练的PS架构由Server端负责参数更新广播、Worker端负责梯度计算,分同步、异步两类模式。
- 架构细节说明:PS架构的同步、异步训练等细分细节无需记忆,仅需掌握架构核心逻辑即可,不属于认证考核范围。
- AI集群核心要求:AI集群依赖网络连接多节点实现分布式训练,大模型训练场景下传统PCI协议无法满足通信需求,需定制专属硬件连接方案。
- 相关考题提示:大模型训练需定制专属硬件连接方案的表述为正确判断项,考试遇到该类场景直接选对即可。
-
华为核心硬件产品及考点
- Atlas系列产品相关说明
- 全液冷方案对应产品:Atlas 900 A2 RD 服务器是华为唯一采用全液冷方案的AI服务器,单台价值超千万,相关选型考点需直接识记。
- 各产品场景定位:Atlas 200 IDK 开发者套件多用于高校场景仅支持推理,Atlas 500 智能小站用于本地实时推理,单套云台配套方案价值一二十万。
- 演示与参考资源:Atlas 产品3D演示页面当前处于维护状态暂无法演示,官方产品手册已发至交流群,可直接查阅获取参数。
- SS 800系列服务器特性
- 硬件连接设计:SS 800 系列服务器采用华为自研NPU载板连接NPU,未使用常规PCIe接口,可突破传统接口的速率瓶颈。
- 分布式训练支持:该系列服务器支持 RoCE 协议,无需额外插卡即可通过网络直接调用其他服务器算力,适配分布式训练需求。
- 硬件类考题应对方法:针对SS 800 未找到PCIe接口的考题,需排除"NPU集成在CPU内"等错误表述,按要求选择对应错误选项即可。
- Atlas系列产品相关说明
-
智算中心与无损网络技术
- 智算中心核心特征:智算中心与传统数据中心的核心区别为要求网络零丢包,"少丢包"等相关表述均为错误,为认证核心考点。
- 关键网络技术特性
- RDMA技术特征:远程直接内存访问(RDMA)无需经过内核态拷贝、减少封解包开销,可有效降低CPU负载、提升数据传输效率。
- 智能无损网络架构:华为智能无损网络实现全栈优化,通过PFC协议保障不丢包、ECN协议防范堵塞,自研算法实现零丢包目标。
- 智算中心组网设计规则
- 组网平面划分:华为智算中心组网分为参数面、样本面、业务面、带外管理面四大平面,各平面各司其职实现网络资源的专项优化。
- 资源分区规则:组网按通用计算区、AI计算区、存储区、带外管理区等分区部署,实现不同类型资源的物理隔离,保障运行稳定性。