使用llama.cpp的Qwen3.6-27B-Q8本地部署详解【Linux GPU】

0. 检查cmake,cuda的安装情况及版本

cmake更新,参考:https://askubuntu.com/questions/829310/how-to-upgrade-cmake-in-ubuntu

cmake --version无结果,ln一下(注意cmake版本):

bash 复制代码
sudo ln -s /usr/local/bin/cmake /usr/bin/cmake

cuda安装,参考:https://blog.csdn.net/qxqsunshine/article/details/161664593

1. 创建文件夹,安装llama.cpp

bash 复制代码
mkdir LLM

cd LLM

git clone https://github.com/ggml-org/llama.cpp

cd llama.cpp

mkdir -p build && cd build

2.编译llama.cpp

bash 复制代码
cd .. # 回到有CMakeLists.txt文件的llama.cpp目录下

cmake ..     -DGGML_CUDA=ON     -DCMAKE_BUILD_TYPE=Release     -DCMAKE_CUDA_ARCHITECTURES="89"     -DGGML_NATIVE=ON
# 此处nvcc --version无结果,就要看看cuda了

cmake --build . --config Release -j $(nproc) 

./bin/llama-cli --help

3. 安装huggingface library并下载模型

bash 复制代码
pip install huggingface_hub 

cd build # 到LLM/llama.cpp/build目录下
# 选择好适合自己的模型
hf download unsloth/Qwen3.6-27B-GGUF Qwen3.6-27B-Q8_0.gguf --local-dir ./models

4.选择适合自己的参数配置,运行模型

bash 复制代码
cd ../../ # 回到LLM目录下

# 这里我选择了深度思考模式,参数配置如下,执行代码运行模型:
./llama.cpp/build/bin/llama-server -m ./llama.cpp/build/models/Qwen3.6-27B-Q8_0.gguf -ngl 999 -c 32768 --temp 1.0 --top-p 0.95 --top-k 20 --min_p 0.0 --host 0.0.0.0 --port 8080
# 保持该界面不要退出,让模型在后端运行
# 检查一下GPU CPU使用情况,确保模型在指定设备运行

5.进入对话界面

在本地网页打开

或者输入主机ip,用其他设备浏览器输入 http:xxx.xxx.xxx.xxx:8080 打开

本文步骤主要参考来源:

https://blog.csdn.net/qxqsunshine/article/details/161664593

https://www.youtube.com/watch?v=EONM2W1gUFY

次要来源:

https://github.com/ZengboJamesWang/Qwen3.5-35B-A3B-openclaw-dgx-spark

https://huggingface.co/unsloth/Qwen3.6-27B-MTP-GGUF

https://unsloth.ai/docs/models/qwen3.6#mtp-qwen3.6-27b

相关推荐
东城居士3 小时前
验证第一个Linux字符驱动程序
linux·嵌入式系统
网硕互联的小客服5 小时前
各个版本的Linux系统如何修改远程端口ssh端口?
linux·运维·服务器·网络
T1mzhou5 小时前
ARM64 Linux 6.10 内核驱动(12):dd.c:probe/ remove、延迟 probe
linux·服务器·c语言·arm开发·arm
Mr小林7 小时前
Docker 安装教程(在线 + 离线)
运维·docker·容器
JudithHuang8 小时前
把本地服务暴露到公网
运维
yt004yt8 小时前
### 越华环保集团|绿岛 VOCs 集中治理,管网系统安全设计工程实战分享
大数据·运维
yt004yt8 小时前
越华环保集团|绿岛 VOCs 集中治理,管网系统安全设计工程实战分享
大数据·运维
晚安日记wanna9 小时前
压测 TPS 卡在 800CPU 只跑四成六步定位法
运维·面试·测试
yunwei379 小时前
eBPF 示例教程:实现 `scx_nest` 调度器
linux·后端·性能优化
朽棘不雕9 小时前
关于重定向的小补充
linux