NCCL 中的一些辅助debug 知识点

1,调试nccl 启动kernel的方法

ncclLaunchKernel

cuLaunchKernelEx

ncclStrongStreamLaunchKernel

cudaLaunchKernel

ncclLaunchOneRank

cudaLaunchKernel

在 nccl lib 中,不存在使用<<<grid, block,,>>> 这种类似方式启动kernel的情景。

gdb ./example_test

(gdb) b ncclLaunchKernel

(gdb) c

(gdb) backtrace

2,

未完待续。。。

相关推荐
gwf2163 天前
RDMA在联邦学习与跨DC训练中的应用:从协议栈到芯片微架构的深度解析
rdma·nccl·硬件加速·rocev2·dcqcn·gpudirect·ai集群网络
gwf2169 天前
AI多租户集群的RDMA隔离:PD/MR/ACL硬件实现 —— 面向大模型训练/推理的硅级安全架构
芯片设计·rdma·nccl·ai集群·gpudirect·多租户隔离·sr-iov
gwf21610 天前
NVLink与RDMA融合:Scale-Up/Scale-Out统一互联架构深度解析
rdma·nvlink·nccl·dpu·rocev2·aiinfra·gpudirect
gwf21613 天前
PFC风暴与RDMA死锁:AI训练典型故障深度分析——从芯片RTL到集群架构的全栈解构
ai训练·rdma·nccl·rocev2·pfc·dcqcn·gpudrirect
gwf21614 天前
Rail-Optimized拓扑:AI训练集群的RDMA拥塞消除与硬件实现深度解析
rdma·infiniband·nccl·ai集群·rnic·gpudirect·railoptimized
gwf2161 个月前
AI集群RDMA网络架构总览:从Scale-Out到多平面
rdma·nccl·scaleout·rocev2·ai集群·rnic·gpudirect
Albart5751 个月前
vLLM多卡部署终极踩坑:CUDA error worker进程异常退出 完整定位&生产根治方案
cuda·nccl·vllm·大模型部署·多卡推理·大模型踩坑
Aethir1 个月前
去中心化GPU云底层是怎么搭的——去中心化云算力全景·第二章:技术架构
架构·分布式训练·infiniband·nccl·gpu集群·液冷散热
haimin03713 个月前
nccl-tests测试报告的性能指标
nccl