技术栈

aiinfra

gwf216
17 天前
rdma·nvlink·nccl·dpu·rocev2·aiinfra·gpudirect
NVLink与RDMA融合:Scale-Up/Scale-Out统一互联架构深度解析摘要:本文深度解构NVLink与RDMA在AI集群中的融合架构。从芯片RTL级剖析Scale-Up/Out统一互联的数据通路、寄存器定义与流水线时序,探讨MoE/LLM场景下的集合通信硬件加速、拥塞控制状态机及GPUDirect零拷贝路径,为资深网络芯片工程师提供设计验证与部署调优的硬核指南。
索木木
5 个月前
人工智能·机器学习·大模型·attention·训练·显存优化·aiinfra
Flash Attention反向梯度优化显存前面我有文章介绍子Flash Attention 针对长序列的正向优化,而其反向算子(Backward Pass)的优化由于涉及到复杂的梯度重计算和显存权衡,往往比正向过程更具挑战性。
我是有底线的