0. 检查cmake,cuda的安装情况及版本
cmake更新,参考:https://askubuntu.com/questions/829310/how-to-upgrade-cmake-in-ubuntu
cmake --version无结果,ln一下(注意cmake版本):
bash
sudo ln -s /usr/local/bin/cmake /usr/bin/cmake
cuda安装,参考:https://blog.csdn.net/qxqsunshine/article/details/161664593
1. 创建文件夹,安装llama.cpp
bash
mkdir LLM
cd LLM
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
mkdir -p build && cd build
2.编译llama.cpp
bash
cd .. # 回到有CMakeLists.txt文件的llama.cpp目录下
cmake .. -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release -DCMAKE_CUDA_ARCHITECTURES="89" -DGGML_NATIVE=ON
# 此处nvcc --version无结果,就要看看cuda了
cmake --build . --config Release -j $(nproc)
./bin/llama-cli --help
3. 安装huggingface library并下载模型
bash
pip install huggingface_hub
cd build # 到LLM/llama.cpp/build目录下
# 选择好适合自己的模型
hf download unsloth/Qwen3.6-27B-GGUF Qwen3.6-27B-Q8_0.gguf --local-dir ./models
4.选择适合自己的参数配置,运行模型
bash
cd ../../ # 回到LLM目录下
# 这里我选择了深度思考模式,参数配置如下,执行代码运行模型:
./llama.cpp/build/bin/llama-server -m ./llama.cpp/build/models/Qwen3.6-27B-Q8_0.gguf -ngl 999 -c 32768 --temp 1.0 --top-p 0.95 --top-k 20 --min_p 0.0 --host 0.0.0.0 --port 8080
# 保持该界面不要退出,让模型在后端运行
# 检查一下GPU CPU使用情况,确保模型在指定设备运行
5.进入对话界面
在本地网页打开
或者输入主机ip,用其他设备浏览器输入 http:xxx.xxx.xxx.xxx:8080 打开
本文步骤主要参考来源:
https://blog.csdn.net/qxqsunshine/article/details/161664593
https://www.youtube.com/watch?v=EONM2W1gUFY
次要来源:
https://github.com/ZengboJamesWang/Qwen3.5-35B-A3B-openclaw-dgx-spark