第七十九篇-E5-2680V4+V100-32G+llama-cpp编译运行+Qwen3-Next-80B

环境

bash 复制代码
系统:CentOS-7
CPU : E5-2680V4 14核28线程
内存:DDR4 2133 32G * 2
显卡:Tesla V100-32G【PG503】 (水冷)
驱动: 535
CUDA: 12.2

需要环境

nvcc --version

bash 复制代码
nvcc: NVIDIA (R) Cuda compiler driver
Copyright (c) 2005-2023 NVIDIA Corporation
Built on Tue_Jun_13_19:16:58_PDT_2023
Cuda compilation tools, release 12.2, V12.2.91
Build cuda_12.2.r12.2/compiler.32965470_0

cmake -version

bash 复制代码
cmake version 3.24.3

CMake suite maintained and supported by Kitware (kitware.com/cmake).

如果版本不合理需要重新安装

克隆仓库

bash 复制代码
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp

清理并创建构建目录

bash 复制代码
rm -rf build && mkdir build && cd build

配置 CMake(关键参数)

bash 复制代码
cmake .. -DGGML_CUDA=ON -DGGML_CUDA_ARCH=70 -DCMAKE_BUILD_TYPE=Release

可以问问AI调整参数

编译(根据 CPU 核心数调整 -j 参数)

bash 复制代码
  make -j$(nproc) GGML_CUDA_FORCE_DMMV_X=1 GGML_CUDA_FORCE_MMQ=1 llama-server

运行

bash 复制代码
./bin/llama-server   -m /models/GGUF_LIST/Qwen3-Next-80B/Qwen3-Coder-Next-Q4_K_M-00001-of-00004.gguf   --host 0.0.0.0   --port 28000   --gpu-layers 30   --ctx-size 102000   --threads 26

访问

bash 复制代码
http://192.168.31.222:28000/

效果

速度

7-8 tokens/s (CPU性能太弱)

GPU 消耗 30G+

GPU利用率 10+%

CPU 2400+ 已经满载在跑了

内存5G+

速度还是很慢的。CPU存在瓶颈

相关推荐
雾时之林1 小时前
Linux--软件管理、源码包安装
linux·服务器·数据库
苏打水com2 小时前
《llama.cpp Server实战:把本地模型变成OpenAI兼容接口》
llama
sxstj4 小时前
Ubuntu 完整安装并启用 Flatpak 教程
linux·运维·ubuntu
RisunJan5 小时前
Linux命令-sshd(SSH 服务器守护进程)
linux·服务器·ssh
天疆说5 小时前
Ubuntu 26.04 下 Intel Meteor Lake 核显 + NPU 驱动配置与 PyTorch NPU 推理实测
linux·pytorch·ubuntu
2401_868534785 小时前
存储与虚拟化
linux·网络协议
mounter6255 小时前
突破单点限制:BPF 多跟踪点高效附加机制与新 ftrace 架构解析
linux·ebpf·linux kernel·kernel·ftrace
刘某的Cloud5 小时前
Galera Cluster部署 mariadb 节点down机,log sequence number恢复
linux·运维·数据库·负载均衡·mariadb·集群·高可用
小此方6 小时前
Re:Linux系统篇(五十四)线程篇 · 七:互斥锁的底层实现原理:从硬件上下文、原子交换指令(Swap)到并发封装实战
linux·运维·驱动开发
郭涤生6 小时前
rootfs 详解与裁剪优化记录
linux·c++·bsp