lk_llama.cpp启用nccl

要下载对应cuda toolkit版本 的nccl,到nvidia官方下载

我用的GPU是v100显卡,只能下载legacy的。

查看cuda版本

bash 复制代码
yu@llm:~/ik_llama.cpp$ nvcc --version
nvcc: NVIDIA (R) Cuda compiler driver
Copyright (c) 2005-2024 NVIDIA Corporation
Built on Thu_Mar_28_02:18:24_PDT_2024
Cuda compilation tools, release 12.4, V12.4.131
Build cuda_12.4.r12.4/compiler.34097967_0

安装错误的版本,编译可以成功,但是推理时会报错allreduce错误。

安装命令

bash 复制代码
# 1. 安装仓库包
sudo dpkg -i nccl-local-repo-ubuntu2204-2.27.7-cuda12.4_1.0-1_amd64.deb

# 2. 添加GPG密钥(请根据实际路径调整,或者在1执行完成后,会有个提示,按照那个)
sudo apt-key add /var/nccl-local-repo-ubuntu2204-2.27.7-cuda12.4/7fa2af80.pub

# 3. 更新软件源
sudo apt update

# 4. 安装指定版本的NCCL库
sudo apt install libnccl2=2.27.7-1+cuda12.4 libnccl-dev=2.27.7-1+cuda12.4

配置

bash 复制代码
cmake -B build -DGGML_BLAS=ON -DGGML_CUDA=ON -DGGML_NCCL=ON -DGGML_AVX=ON -DGGML_AVX2=ON -DGGML_CUDA_FA=ON -DGGML_CUDA_FORCE_CUBLAS=ON -DGGML_GRAPHS=ON -DGGML_CUDA_FA_ALL_QUANTS=ON

编译

bash 复制代码
cmake --build build --config Release -j20

e5 2673V4是20核的,利用它的40个pcie通道跑在x16模式。v100如果运行在pcie3.0 x8模式,装载模型时明显慢。

运行

bash 复制代码
./llama-server --host 0.0.0.0 --port 8086 --no-warmup -m ~/llama/cognitivecomputations_Dolphin-Mistral-24B-Venice-Edition-Q8_0.gguf -c 8192 -ngl 99 -sm graph

不能使用 --device cuda0,cuda1,会不分层,推理速度靠cpu基本是1tps

open webui运行在docker,它自己会自动运行。

使用graph参数启用NCCL,Prompt处理慢,文本生成生成快,生成时俩个GPU利用率接近100%,功耗也大,但是2张卡合计也就400W。不使用NCCL,文本生成慢,GPU利用率分别在50%左右。

相关推荐
gwf2165 天前
AI训练RDMA性能Profiling:瓶颈定位与调优方法论
芯片设计·rdma·nccl·拥塞控制·ai集群·rnic·gpudirect
gwf2168 天前
RDMA在联邦学习与跨DC训练中的应用:从协议栈到芯片微架构的深度解析
rdma·nccl·硬件加速·rocev2·dcqcn·gpudirect·ai集群网络
gwf21615 天前
AI多租户集群的RDMA隔离:PD/MR/ACL硬件实现 —— 面向大模型训练/推理的硅级安全架构
芯片设计·rdma·nccl·ai集群·gpudirect·多租户隔离·sr-iov
gwf21615 天前
NVLink与RDMA融合:Scale-Up/Scale-Out统一互联架构深度解析
rdma·nvlink·nccl·dpu·rocev2·aiinfra·gpudirect
gwf21618 天前
PFC风暴与RDMA死锁:AI训练典型故障深度分析——从芯片RTL到集群架构的全栈解构
ai训练·rdma·nccl·rocev2·pfc·dcqcn·gpudrirect
gwf21619 天前
Rail-Optimized拓扑:AI训练集群的RDMA拥塞消除与硬件实现深度解析
rdma·infiniband·nccl·ai集群·rnic·gpudirect·railoptimized
扉伟庆20 天前
GPU 算力租赁选型指南:V100 / T4 / L40S 怎么选不踩坑
算力·v100·t4·gpu租赁·l40s
gwf2161 个月前
AI集群RDMA网络架构总览:从Scale-Out到多平面
rdma·nccl·scaleout·rocev2·ai集群·rnic·gpudirect
Albart5751 个月前
vLLM多卡部署终极踩坑:CUDA error worker进程异常退出 完整定位&生产根治方案
cuda·nccl·vllm·大模型部署·多卡推理·大模型踩坑
Aethir1 个月前
去中心化GPU云底层是怎么搭的——去中心化云算力全景·第二章:技术架构
架构·分布式训练·infiniband·nccl·gpu集群·液冷散热