【无标题】

ubuntu llama.cpp部署Qwen2.5-7B-Instruct-Q4_K_M

1。安装基础依赖:更新软件源并安装必要的编译工具链。

sudo apt update

sudo apt install -y build-essential cmake git wget curl libomp-dev

2。克隆源码并编译:由于没有 N 卡,无需开启 CUDA 选项。

git clone https://github.com/ggerganov/llama.cpp

cd llama.cpp

make clean && make -j$(nproc)

3 获取 Qwen2 GGUF 模型

cd llama.cpp/models目录

下载Qwen2.5-7B-Instruct-Q4_K_M

wget https://hf-mirror.com/bartowski/Qwen2.5-7B-Instruct-GGUF/resolve/main/Qwen2.5-7B-Instruct-Q4_K_M.gguf

4。进入构建目录

cd llama.cpp/build

cmake ...

cmake --build . --config Release -j$(nproc)

5。启动命令行交互运行

进入llama.cpp目录

./build/bin/llama-cli -m ./models/Qwen2.5-7B-Instruct-Q4_K_M.gguf -ngl 0 --color auto -t $(nproc) -c 4096

./build/bin/llama-cli -m ./models/Qwen2.5-7B-Instruct-Q4_K_M.gguf -t $(nproc) -c 4096 -p "你好,请介绍通义千问Qwen2大模型"

6 启动 OpenAI 兼容 API+WebUI 服务(llama-server,生产部署首选)

./build/bin/llama-server \

-m ./models/Qwen2.5-7B-Instruct-Q4_K_M.gguf

-ngl 38

-c 4096

--host 0.0.0.0

--port 8080

curl -N http://192.168.1.3:8080/v1/chat/completions

-H "Content-Type: application/json"

-d '{

"model": "qwen2.5",

"messages": {"role":"user","content":"你好,介绍一下自己"},

"stream": true,

"temperature": 0.7

}'

相关推荐
缘友一世12 小时前
GLM5.3 flash cybersec本地部署[5]:生产运维与故障恢复
ubuntu·vllm·glm5.3 flash
缘友一世1 天前
GLM5.3 flash cybersec本地部署[4]:基准测试与复现
vllm·glm5.3 flash
rjc_lihui2 天前
NCCL,Tokio ,vLLM ,Vue 3在线书籍
vllm
GPUStack2 天前
一张 A800 80GB,跑通 Qwen-Image-2.1:GPUStack 部署、生成与图像编辑实战
人工智能·开源·github·vllm·大模型部署·gpustack
缘友一世3 天前
GLM5.3 flash cybersec本地部署[0]:环境准备与首次启动
vllm·glm5.3 flash
DongQiShanRen4 天前
裁决台账双向互校(中):五向一致性链——②向解读与③向实现
人工智能·深度学习·自然语言处理·集成学习·vllm
智码看视界4 天前
开源大模型每日追踪:小米 MiMo-V2.6-Pro,登顶开放权重第一(超过 GLM-5.3 、Kimi K3)
agent·vllm·moe·全模态·小米大模型·mimo-v2.6
零基础1236 天前
DeepSeek V4.1 Flash (Batch) 的性能测试与应用
经验分享·python·语言模型·vllm
梦帮科技7 天前
vLLM / TensorRT-LLM 极限推理:PagedAttention 细粒度物理页表管理与连续批处理(Continuous Batching)实战
数据结构·人工智能·分布式·python·深度学习·算法·vllm
可乐ea8 天前
vLLM 分离式推理实战指南:把 prefill 和 decode 拆开跑
ai智能体·vllm·kv缓存·大模型推理优化·分离式推理