技术栈
nccl
gwf216
7 天前
rdma
·
nccl
·
scaleout
·
rocev2
·
ai集群
·
rnic
·
gpudirect
AI集群RDMA网络架构总览:从Scale-Out到多平面
摘要:本文深度剖析AI集群RDMA网络架构,从Scale-Out拓扑演进至多平面组网。结合芯片级硬件实现,探讨RNIC寄存器、RTL数据流及GPUDirect RDMA通路,为万卡集群的高吞吐、低尾延迟网络建设提供实战指南。
Albart575
12 天前
cuda
·
nccl
·
vllm
·
大模型部署
·
多卡推理
·
大模型踩坑
vLLM多卡部署终极踩坑:CUDA error worker进程异常退出 完整定位&生产根治方案
本文为生产级 vLLM 多卡分布式部署踩坑复盘,聚焦全网高频疑难问题:CUDA error: worker 进程异常退出。
Aethir
20 天前
架构
·
分布式训练
·
infiniband
·
nccl
·
gpu集群
·
液冷散热
去中心化GPU云底层是怎么搭的——去中心化云算力全景·第二章:技术架构
本文是《去中心化云算力全景》系列的第二章。系列共十章,每章独立成文。上一章(市场总览)覆盖了Neocloud的市场规模、定价结构和商业模式,本章深入技术底层,拆解GPU集群的三个核心技术层:互联网络、散热架构、GPU调度系统。
haimin0371
3 个月前
nccl
nccl-tests测试报告的性能指标
NCCL 测试报告以毫秒(ms)为单位的平均操作时间,以及以GB/s为单位的两种带宽:算法带宽和总线带宽。本文档解释了这些数字的含义以及在不同硬件上的预期表现。
Soonyang Zhang
3 个月前
gin
·
nccl
nccl分析(三)——GPU-Initiated Networking(gin)数据发送过程分析
NCCL Device API architecture showing three operation modes and their underlying interconnect technologies:
Soonyang Zhang
3 个月前
网络
·
nccl
·
集合通信
nccl分析(二)——RDMA带外建链过程
关于RDMA带外建联过程,博客[1]已经分析的很好了。本篇结合nccl的源码,分析RDMA的建链过程。
数据与后端架构提升之路
4 个月前
nccl
·
训练通信
你的 GPU 为什么只能跑 20%?大模型训练通信瓶颈的四层排查 SOP
半夜三点,Grafana 大盘上 GPU 利用率持续在 15% 上下浮动。你盯着屏幕:算力没问题,显存没爆,loss 曲线也正常——训练就是慢得离谱。
d1z888
5 个月前
gpu
·
nvidia
·
nccl
NCCL 测试完全指南:从概念到性能调优
📅 版本:2026-03-30 🎯 目标:全面掌握 NCCL 测试方法,从入门到精通 📚 NCCL 版本:基于 NCCL 2.29.7 ⏱️ 预计阅读时间:3-5 小时 💻 适用对象:AI 工程师、HPC 开发者、系统管理员
int WINGsssss
5 个月前
nccl
·
ai infra
·
集合通信库
·
我爱吃烤肉
NCCL工作流程分析&&NCCL源码解读
本文章是笔者在学习NCCL源码时候的感悟和理解,由于源码实在抽象,所以笔者尽量用更直白通俗的语言表达自己的理解。若有错误,望各位大神多多批评指教!该文章会不断更新修改,一些细枝末节也将会不断补充,新的文章未来也会采用链接形式纳入本文章中。
KIDGINBROOK
5 个月前
cuda
·
rdma
·
nccl
NVIDIA NCCL 源码学习(十七)- LL和LL128协议
之前提到nccl有多种协议,并且主要以simple协议为例介绍nccl的流程,本节我们具体看下simple之外的LL和LL128协议,LL是low latency的缩写,表示低延迟。 协议在这里是指当前rank发送数据给peer的时候,peer如何知道数据已经可见,simple的做法是当前rank先发data,再执行fence_sys,最后发flag,peer轮询flag,当轮询到flag的时候就可以知道data已经可见,但是fence_sys是个耗时的操作,nccl通过拆分出单独的warp执行fence
bandaoyu
6 个月前
nccl
·
rccl
·
nvshmem
【NVSHMEM】PCIe 距离类型(PIX,PXB,PHB,NOD,SYS)和判断
PCIe 距离类型(从优到差):PATH_PIX (0): 相同设备,最优PATH_PXB (1): 通过 PCIe 交换机连接
三点水-here
7 个月前
分布式
·
rdma
·
nccl
·
moe
·
流水线并行
·
张量并行
·
专家并行
04 - 分布式大模型推理实战:TP/PP/EP并行策略深度解析
本文是《大模型推理框架深度解析》系列的第四篇,详解张量并行、流水线并行与专家并行的原理与配置。当你的模型从7B扩展到70B、405B,单卡显存已经无法满足需求时,分布式推理成为必然选择。但面对TP、PP、EP等各种并行策略,很多开发者感到困惑:
容沁风
8 个月前
nccl
·
v100
·
lk_llama.cpp
lk_llama.cpp启用nccl
要下载对应cuda toolkit版本的nccl,到nvidia官方下载 我用的GPU是v100显卡,只能下载legacy的。
predawnlove
8 个月前
nccl
·
通信库
【NCCL】8 PAT AllGather 设备端实现详解3
PatAGAlgorithm::getNextOp() 函数的算法规划是 PAT (Pipelined Allgather Tree) 算法的核心调度器。
predawnlove
8 个月前
算法
·
gpu
·
nccl
【NCCL】4 AllGather-PAT算法
根据前三篇,可以得知:如果仅想要查看一个算法和其余算法的不同点,着重入手的地方为如下三处未完,不一定有续
predawnlove
8 个月前
gpu
·
nccl
【NCCL】5 GPU 间链路 Preconnect 机制
详细分析 NCCL 中 GPU 间链路的 preconnect(预连接)机制。这是一个关键的优化,用于在实际通信前建立好所有必要的连接。
predawnlove
8 个月前
gpu
·
nccl
·
通信库
【NCCL】3. ncclPrepareTasks 到 scheduleCollTasksToPlan 的衔接机制
Commit: 59242d7cncclPrepareTasks 之后如何衔接到 scheduleCollTasksToPlan 的完整流程。关键在于 ncclLaunchPrepare 函数。
Luchang-Li
1 年前
pytorch
·
python
·
nccl
sglang pytorch NCCL hang分析
sglang部署出现卡死现象,通过cuda-gdb分析发现是NCCL卡死但是默认没有打印调用栈,通过设置如下环境变量,打印NCCL错误信息和算子调用栈:
小马敲马
1 年前
开发语言
·
c++
·
人工智能
·
算法
·
性能优化
·
nccl
[4.2-2] NCCL新版本的register如何实现的?
在enqueue.cc内的调用是:会走到sendrecv_reg.cc,这里的 ncclRegisterP2pIpcBuffer 实现: