使用llama.cpp的Qwen3.6-27B-Q8本地部署详解【Linux GPU】

0. 检查cmake,cuda的安装情况及版本

cmake更新,参考:https://askubuntu.com/questions/829310/how-to-upgrade-cmake-in-ubuntu

cmake --version无结果,ln一下(注意cmake版本):

bash 复制代码
sudo ln -s /usr/local/bin/cmake /usr/bin/cmake

cuda安装,参考:https://blog.csdn.net/qxqsunshine/article/details/161664593

1. 创建文件夹,安装llama.cpp

bash 复制代码
mkdir LLM

cd LLM

git clone https://github.com/ggml-org/llama.cpp

cd llama.cpp

mkdir -p build && cd build

2.编译llama.cpp

bash 复制代码
cd .. # 回到有CMakeLists.txt文件的llama.cpp目录下

cmake ..     -DGGML_CUDA=ON     -DCMAKE_BUILD_TYPE=Release     -DCMAKE_CUDA_ARCHITECTURES="89"     -DGGML_NATIVE=ON
# 此处nvcc --version无结果,就要看看cuda了

cmake --build . --config Release -j $(nproc) 

./bin/llama-cli --help

3. 安装huggingface library并下载模型

bash 复制代码
pip install huggingface_hub 

cd build # 到LLM/llama.cpp/build目录下
# 选择好适合自己的模型
hf download unsloth/Qwen3.6-27B-GGUF Qwen3.6-27B-Q8_0.gguf --local-dir ./models

4.选择适合自己的参数配置,运行模型

bash 复制代码
cd ../../ # 回到LLM目录下

# 这里我选择了深度思考模式,参数配置如下,执行代码运行模型:
./llama.cpp/build/bin/llama-server -m ./llama.cpp/build/models/Qwen3.6-27B-Q8_0.gguf -ngl 999 -c 32768 --temp 1.0 --top-p 0.95 --top-k 20 --min_p 0.0 --host 0.0.0.0 --port 8080
# 保持该界面不要退出,让模型在后端运行
# 检查一下GPU CPU使用情况,确保模型在指定设备运行

5.进入对话界面

在本地网页打开

或者输入主机ip,用其他设备浏览器输入 http:xxx.xxx.xxx.xxx:8080 打开

本文步骤主要参考来源:

https://blog.csdn.net/qxqsunshine/article/details/161664593

https://www.youtube.com/watch?v=EONM2W1gUFY

次要来源:

https://github.com/ZengboJamesWang/Qwen3.5-35B-A3B-openclaw-dgx-spark

https://huggingface.co/unsloth/Qwen3.6-27B-MTP-GGUF

https://unsloth.ai/docs/models/qwen3.6#mtp-qwen3.6-27b

相关推荐
ComputerInBook43 分钟前
Linux内核之概观
linux·linux内核代码结构·linux内核结构
裕晟资质规划1 小时前
首次办理军工保密资质:咨询服务选择要点与全流程交付清单(评估框架)
大数据·运维·服务器·网络·数据库·经验分享
超龄超能程序猿1 小时前
实战优化:.NET 8 容器 Debian 源+时间同步企业级 Dockerfile
运维·debian·.net
运维全栈笔记4 小时前
Vue + Spring Boot 前后端分离项目部署笔记(若依 RuoYi-Vue 3.9.2)
运维·服务器·vue.js·spring boot·笔记·开源·开源软件
专注API从业者9 小时前
告别人工盯品!借助 Open Claw 搭建电商商品自动化监控与数据分析系统(完整可运行源码)
大数据·运维·数据库·数据分析·自动化
爱喝水的鱼丶11 小时前
SAP-ABAP:ABAP 用户出口参数传递与上下文获取:SAP 标准数据读取与交互逻辑实现
运维·性能优化·交互·sap·abap·经验交流·出口
IT大白鼠11 小时前
PentestGPT作为AI运维编排工作流自动化底座的技术架构与应用价值评估
运维·人工智能·自动化·pentestgpt
M78佐菲11 小时前
c语言学习笔记:排序与查找方法整理
linux·c语言·笔记·学习·算法
ltl12 小时前
QUIC 协议拆解(上):为什么 TCP 改不动了
linux