windows 直接安装llama.cpp的方法

windows 直接安装llama.cpp的方法:

winget install llama.cpp

如果下载那步卡住,可以复制显示出来的链接用讯雷下载后,解压即可使用,需要手动配置Path环境变量指向该目录。

讯雷下载时没有资源下载的话,先转到云盘再从云盘里下载下来。

如:https://github.com/ggml-org/llama.cpp/releases/download/b9310/llama-b9310-bin-win-vulkan-x64.zip

另附llama.cpp 各平台安装包下载

https://github.com/ggml-org/llama.cpp/releases

winget 安装的是vulkan版本,如果想安装cuda版本,可到此下载。

两个版本的区别

vulkan:支持英伟达gpu、intel igpu(核显)、CPU

cuda:支持英伟达gpu、CPU

资料显示,都使用英伟达gpu时,cuda比vulkan速度上快约 30-40%,实测快10-15%。

使用cuda版本还有个好处,当ngl 设置为99时,当显存不足时优先使用显存再用共享内存补齐,也能跑模型。用vulkan版本时,当显存不足会直接加载失败。

模型下载地址

因为hdf.sh无法正常链接https://huggingface.co/settings/tokens 注册用户和获取token,

使用由阿里巴巴通义实验室,联合CCF开源发展技术委员会的社区下载。

https://modelscope.cn/models

注意:llama.cpp需使用的是gguf版本的模型,下载.gguf结尾的即可。

服务启动命令

单模型模式

llama-server -m D:\llama.cpp\models\Qwen3.5-4B-Q4_0.gguf -a Qwen3.5-4B-Q4_0 -b 512 -ngl 99 -rea auto --mlock --port 11444 -c 65535

模型路由模式

llama-server --models-dir D:\llama.cpp\models -b 512 -ngl 99 -rea auto --mlock --port 11444 -c 65535

llama-server --models-dir D:\llama.cpp\models -b 512 -ngl 99 -rea auto --mlock --port 11444 --models-max 1

参数:

中文对照 https://zhuanlan.zhihu.com/p/2038693936693302037

--mlock:锁死内存,防止使用虚拟内存导致的全机卡顿(最重要!)。

-a:设置模型别名。

-b 512:增大批处理,显著减少"首字等待时间"(从 7 秒降到 2 秒左右的关键),这个值是每次模型前向推理时最多可以同时处理的 token 数量,越大每次处理的越多。在Openclaw中使用时建议设置大一点,如8192。

-ngl 99:0全使用cpu,99全使用gpu。当显存够时用99。

-rea, --reasoning on\|off\|auto ,在对聊天中使用 reasoning/thinking ('on', 'off', or 'auto', 默认: 'auto' (detect from template))。

--models-max: 路由模式下内存驻留的最大模型数。

-ctk q4_0, KV 缓存中 K 的数据类型(allowed: f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, q5_1, default: f16),显存小选q4_0。

-ctv q4_0, KV 缓存中 V 的数据类型(allowed: f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, q5_1, default: f16),显存小选q4_0。

-ctkd q4_0, 草稿模型 KV 缓存中 K 的数据类型(allowed: f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, q5_1, default: f16),显存小选q4_0。

-ctvd q4_0, 草稿模型 KV 缓存中 V 的数据类型(allowed: f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, q5_1, default: f16),显存小选q4_0。

相关推荐
GPU实战笔记2 小时前
本地跑不动 llama.cpp,临时租云 GPU 怎么搭?从启动服务到环境复用
java·服务器·网络·人工智能·深度学习·llama
牛马工作号2 天前
RK3588 使用 rk-llama.cpp + RKNPU2 部署 Qwen3.5:从零开始的 NPU 本地大模型实战
人工智能·语言模型·llama
书源丶2 天前
Qwen3-Embedding-0.6B 纯 CPU
网络·语言模型·embedding·llama
论文复现现场3 天前
Llama/Qwen 70B 部署需要几张 RTX 4090?2卡、4卡、8卡显存、量化与 vLLM 选型
llama·qwen·vllm·大模型推理·大模型部署·rtx4090
谢白羽4 天前
在4×B300用SGLang部署DeepSeek-V4.1 Flash优化实录
笔记·python·llm·llama·sglang
renzao_ai7 天前
本地 35B 大模型部署实战:Ollama 跑 Ornith-35B 全流程
python·llama·免费ai大模型
Είναι η κοπέλα7 天前
本地大模型部署完全指南:Ollama / vLLM / llama.cpp / MLX 四大引擎横评与选型实战
macos·llama·vllm
小饕7 天前
RK3588 NPU 跑大模型实测:rknn-llm 解码 25.9 tok/s,是 llama.cpp 的 4 倍!附三天完整踩坑记录
人工智能·机器人·llama
一航jason8 天前
Android平台推理框架及试用场景模型对比
android·人工智能·ai·架构·ai编程·llama
一航jason8 天前
Android 端侧大模型推理框架对比
android·人工智能·ai·ai编程·llama·ai-native