技术栈
ai集群
gwf216
12 天前
芯片设计
·
rdma
·
nccl
·
拥塞控制
·
ai集群
·
rnic
·
gpudirect
AI训练RDMA性能Profiling:瓶颈定位与调优方法论
摘要:本文聚焦AI集群RDMA性能Profiling,从芯片RTL与寄存器级深度剖析RNIC数据流、拥塞控制与GPUDirect通路。结合NCCL硬件加速与多平面拓扑,提供万卡集群尾延迟瓶颈定位、硬件级调优及故障排查的实战方法论,为资深网络芯片与架构工程师提供硅片级的性能优化指南。
gwf216
16 天前
rdma
·
拥塞控制
·
dpu
·
ai集群
·
gpudirect
·
rail-optimized
·
自适应路由
AI RDMA流量工程:自适应路由与动态负载均衡 —— 架构篇:从芯片RTL到集群拓扑的算网协同设计
📑 目录摘要:本文从芯片RTL与协议栈底层视角,深度剖析AI集群RDMA流量工程。涵盖Rail-Optimized拓扑、自适应路由硬件实现、RNIC流水线时序及拥塞控制状态机,为资深工程师提供算网协同的芯片级实战指南。
gwf216
21 天前
芯片设计
·
rdma
·
nccl
·
ai集群
·
gpudirect
·
多租户隔离
·
sr-iov
AI多租户集群的RDMA隔离:PD/MR/ACL硬件实现 —— 面向大模型训练/推理的硅级安全架构
一、前言/AI场景背景 二、核心原理与协议深度 三、硬件架构深度剖析 四、AI通信的硬件加速实现 五、实战部署与深度配置 六、性能深度分析与基准测试 七、典型故障深度排查 八、总结与设计trade-off 参考资料
gwf216
1 个月前
rdma
·
infiniband
·
nccl
·
ai集群
·
rnic
·
gpudirect
·
railoptimized
Rail-Optimized拓扑:AI训练集群的RDMA拥塞消除与硬件实现深度解析
摘要:本文从芯片RTL与协议栈底层视角,深度剖析Rail-Optimized拓扑在AI集群中消除RDMA拥塞的机制。涵盖RNIC硬件架构、流水线时序、NCCL硬件加速及实战调优。
gwf216
1 个月前
rdma
·
硬件加速
·
dpu
·
kvcache
·
ai集群
·
gpudirect
·
bluefield4
NVIDIA BlueField-3/4 DPU在AI集群的RDMA卸载与增强:芯片设计验证级深度剖析
摘要:本文深度剖析NVIDIA BlueField-3/4 DPU在AI集群中的RDMA卸载与硬件加速机制。从RTL级数据通路、寄存器定义到KV Cache卸载与NCCL集合通信的硬件映射,全面拆解DPU如何突破内存墙与通信墙,为资深芯片与网络架构工程师提供芯片设计验证级的实战指南。
gwf216
1 个月前
rdma
·
nccl
·
scaleout
·
rocev2
·
ai集群
·
rnic
·
gpudirect
AI集群RDMA网络架构总览:从Scale-Out到多平面
摘要:本文深度剖析AI集群RDMA网络架构,从Scale-Out拓扑演进至多平面组网。结合芯片级硬件实现,探讨RNIC寄存器、RTL数据流及GPUDirect RDMA通路,为万卡集群的高吞吐、低尾延迟网络建设提供实战指南。
杰克逊的日记
1 年前
人工智能
·
ai
·
gpu
·
ai集群
·
pytorach
AI集群设计
以下是一个简单的 Kubernetes 配置文件示例,用于在集群中运行一个基于 TensorFlow 的训练任务:
我是有底线的