nccl

gwf2167 天前
rdma·nccl·scaleout·rocev2·ai集群·rnic·gpudirect
AI集群RDMA网络架构总览:从Scale-Out到多平面摘要:本文深度剖析AI集群RDMA网络架构,从Scale-Out拓扑演进至多平面组网。结合芯片级硬件实现,探讨RNIC寄存器、RTL数据流及GPUDirect RDMA通路,为万卡集群的高吞吐、低尾延迟网络建设提供实战指南。
Albart57512 天前
cuda·nccl·vllm·大模型部署·多卡推理·大模型踩坑
vLLM多卡部署终极踩坑:CUDA error worker进程异常退出 完整定位&生产根治方案本文为生产级 vLLM 多卡分布式部署踩坑复盘,聚焦全网高频疑难问题:CUDA error: worker 进程异常退出。
Aethir20 天前
架构·分布式训练·infiniband·nccl·gpu集群·液冷散热
去中心化GPU云底层是怎么搭的——去中心化云算力全景·第二章:技术架构本文是《去中心化云算力全景》系列的第二章。系列共十章,每章独立成文。上一章(市场总览)覆盖了Neocloud的市场规模、定价结构和商业模式,本章深入技术底层,拆解GPU集群的三个核心技术层:互联网络、散热架构、GPU调度系统。
haimin03713 个月前
nccl
nccl-tests测试报告的性能指标NCCL 测试报告以毫秒(ms)为单位的平均操作时间,以及以GB/s为单位的两种带宽:算法带宽和总线带宽。本文档解释了这些数字的含义以及在不同硬件上的预期表现。
Soonyang Zhang3 个月前
gin·nccl
nccl分析(三)——GPU-Initiated Networking(gin)数据发送过程分析NCCL Device API architecture showing three operation modes and their underlying interconnect technologies:
Soonyang Zhang3 个月前
网络·nccl·集合通信
nccl分析(二)——RDMA带外建链过程关于RDMA带外建联过程,博客[1]已经分析的很好了。本篇结合nccl的源码,分析RDMA的建链过程。
数据与后端架构提升之路4 个月前
nccl·训练通信
你的 GPU 为什么只能跑 20%?大模型训练通信瓶颈的四层排查 SOP半夜三点,Grafana 大盘上 GPU 利用率持续在 15% 上下浮动。你盯着屏幕:算力没问题,显存没爆,loss 曲线也正常——训练就是慢得离谱。
d1z8885 个月前
gpu·nvidia·nccl
NCCL 测试完全指南:从概念到性能调优📅 版本:2026-03-30 🎯 目标:全面掌握 NCCL 测试方法,从入门到精通 📚 NCCL 版本:基于 NCCL 2.29.7 ⏱️ 预计阅读时间:3-5 小时 💻 适用对象:AI 工程师、HPC 开发者、系统管理员
int WINGsssss5 个月前
nccl·ai infra·集合通信库·我爱吃烤肉
NCCL工作流程分析&&NCCL源码解读本文章是笔者在学习NCCL源码时候的感悟和理解,由于源码实在抽象,所以笔者尽量用更直白通俗的语言表达自己的理解。若有错误,望各位大神多多批评指教!该文章会不断更新修改,一些细枝末节也将会不断补充,新的文章未来也会采用链接形式纳入本文章中。
KIDGINBROOK5 个月前
cuda·rdma·nccl
NVIDIA NCCL 源码学习(十七)- LL和LL128协议之前提到nccl有多种协议,并且主要以simple协议为例介绍nccl的流程,本节我们具体看下simple之外的LL和LL128协议,LL是low latency的缩写,表示低延迟。 协议在这里是指当前rank发送数据给peer的时候,peer如何知道数据已经可见,simple的做法是当前rank先发data,再执行fence_sys,最后发flag,peer轮询flag,当轮询到flag的时候就可以知道data已经可见,但是fence_sys是个耗时的操作,nccl通过拆分出单独的warp执行fence
bandaoyu6 个月前
nccl·rccl·nvshmem
【NVSHMEM】PCIe 距离类型(PIX,PXB,PHB,NOD,SYS)和判断PCIe 距离类型(从优到差):PATH_PIX (0): 相同设备,最优PATH_PXB (1): 通过 PCIe 交换机连接
三点水-here7 个月前
分布式·rdma·nccl·moe·流水线并行·张量并行·专家并行
04 - 分布式大模型推理实战:TP/PP/EP并行策略深度解析本文是《大模型推理框架深度解析》系列的第四篇,详解张量并行、流水线并行与专家并行的原理与配置。当你的模型从7B扩展到70B、405B,单卡显存已经无法满足需求时,分布式推理成为必然选择。但面对TP、PP、EP等各种并行策略,很多开发者感到困惑:
容沁风8 个月前
nccl·v100·lk_llama.cpp
lk_llama.cpp启用nccl要下载对应cuda toolkit版本的nccl,到nvidia官方下载 我用的GPU是v100显卡,只能下载legacy的。
predawnlove8 个月前
nccl·通信库
【NCCL】8 PAT AllGather 设备端实现详解3PatAGAlgorithm::getNextOp() 函数的算法规划是 PAT (Pipelined Allgather Tree) 算法的核心调度器。
predawnlove8 个月前
算法·gpu·nccl
【NCCL】4 AllGather-PAT算法根据前三篇,可以得知:如果仅想要查看一个算法和其余算法的不同点,着重入手的地方为如下三处未完,不一定有续
predawnlove8 个月前
gpu·nccl
【NCCL】5 GPU 间链路 Preconnect 机制详细分析 NCCL 中 GPU 间链路的 preconnect(预连接)机制。这是一个关键的优化,用于在实际通信前建立好所有必要的连接。
predawnlove8 个月前
gpu·nccl·通信库
【NCCL】3. ncclPrepareTasks 到 scheduleCollTasksToPlan 的衔接机制Commit: 59242d7cncclPrepareTasks 之后如何衔接到 scheduleCollTasksToPlan 的完整流程。关键在于 ncclLaunchPrepare 函数。
Luchang-Li1 年前
pytorch·python·nccl
sglang pytorch NCCL hang分析sglang部署出现卡死现象,通过cuda-gdb分析发现是NCCL卡死但是默认没有打印调用栈,通过设置如下环境变量,打印NCCL错误信息和算子调用栈:
小马敲马1 年前
开发语言·c++·人工智能·算法·性能优化·nccl
[4.2-2] NCCL新版本的register如何实现的?在enqueue.cc内的调用是:会走到sendrecv_reg.cc,这里的 ncclRegisterP2pIpcBuffer 实现: