【无标题】

ubuntu llama.cpp部署Qwen2.5-7B-Instruct-Q4_K_M

1。安装基础依赖:更新软件源并安装必要的编译工具链。

sudo apt update

sudo apt install -y build-essential cmake git wget curl libomp-dev

2。克隆源码并编译:由于没有 N 卡,无需开启 CUDA 选项。

git clone https://github.com/ggerganov/llama.cpp

cd llama.cpp

make clean && make -j$(nproc)

3 获取 Qwen2 GGUF 模型

cd llama.cpp/models目录

下载Qwen2.5-7B-Instruct-Q4_K_M

wget https://hf-mirror.com/bartowski/Qwen2.5-7B-Instruct-GGUF/resolve/main/Qwen2.5-7B-Instruct-Q4_K_M.gguf

4。进入构建目录

cd llama.cpp/build

cmake ...

cmake --build . --config Release -j$(nproc)

5。启动命令行交互运行

进入llama.cpp目录

./build/bin/llama-cli -m ./models/Qwen2.5-7B-Instruct-Q4_K_M.gguf -ngl 0 --color auto -t $(nproc) -c 4096

./build/bin/llama-cli -m ./models/Qwen2.5-7B-Instruct-Q4_K_M.gguf -t $(nproc) -c 4096 -p "你好,请介绍通义千问Qwen2大模型"

6 启动 OpenAI 兼容 API+WebUI 服务(llama-server,生产部署首选)

./build/bin/llama-server \

-m ./models/Qwen2.5-7B-Instruct-Q4_K_M.gguf

-ngl 38

-c 4096

--host 0.0.0.0

--port 8080

curl -N http://192.168.1.3:8080/v1/chat/completions

-H "Content-Type: application/json"

-d '{

"model": "qwen2.5",

"messages": {"role":"user","content":"你好,介绍一下自己"},

"stream": true,

"temperature": 0.7

}'

相关推荐
随便做点啥11 小时前
32卡-64G-910B4-16后端-(Qwen3.8-27B-W8A8)集群部署报告
运维·服务器·经验分享·docker·vllm
xueyongfu2 天前
vLLM 模型编译:从 torch.compile 到分段 CUDA Graph
vllm
sel_92 天前
【vLLM】vLLM 推理框架详解:从 PagedAttention 到生产级部署实战
人工智能·深度学习·算法·语言模型·框架·vllm
缘友一世2 天前
GLM-5.3-Flash 在 8×A800 (sm_80) 上跑通(一):项目介绍与方案选型
vllm·模型推理部署·a800·glm5.3 flash
auto_go2 天前
大模型实战指南(11)——推理框架选型实战:vLLM × SGLang × TensorRT-LLM 深度对比与部署指南
vllm·sglang
wen_zhufeng3 天前
用 vLLM 加速 TTS 推理:通用改造指南
android·vllm
一休哥※3 天前
# 接入 vLLM 的 qwen3.8 模型:WorkBuddy 自定义模型配置教程、踩坑记录与心路历程
vllm
thesky1234563 天前
27届大模型面试准备(五十九):大模型推理引擎内核深度剖析——PagedAttention、调度器与显存管理
大模型·vllm·flashattention·推理引擎·pagedattention·连续批处理·显存管理
谢白羽3 天前
SGLang模型加载过程笔记
笔记·llm·论文·agent·vllm·大模型部署·sglang
zhangfeng11334 天前
AMD Instinct MI50(gfx906)上为 Qwen 系列模型优化并可用的 vLLM 相关仓库、Docker 镜像与实践指南。
人工智能·docker·ai编程·qwen·算子开发·vllm·mi50