模型下载与使用

模型选择

根据个人电脑配置及使用场景,我选择模型为Qwen-4B-Chat-Q4_K_M

模型下载

模型需要从Huggingface模型库下载,需要使用平台工具来下载

注:使用wget无法下载

安装工具

pip install -U huggingface_hub

网络问题,需要使用镜像

export HF_ENDPOINT="https://hf-mirror.com"

原始模型下载

huggingface-cli download Qwen/Qwen1.5-4B-Chat --local-dir ./models/Qwen1.5-4B-Chat

原始模型需要进行量化转换

转换需要安装依赖,进入llama.cpp-b8642目录,执行如下命令进行安装

pip install -r requirements.txt

注:安装依赖要求Python 3.10以上版本,因此笔者并没有成功转换,使用第二在方法:

直接下载现成的 GGUF 模型

huggingface-cli download itlwas/Qwen1.5-4B-Chat-Q4_K_M-GGUF qwen1.5-4b-chat-q4_k_m.gguf --local-dir ./ --local-dir-use-symlinks False

webui启动

./build/bin/llama-server -m models/qwen-4b-chat.Q4_K_M.gguf -c 4096 -ngl 35 --host 0.0.0.0 --port 8080

使用

http://127.0.0.1:8080/

有如下界面

相关推荐
空 白II7 小时前
9.20 大语言模型研究简报:Qwen Code v0.24.1从 Coding Agent 走向统一 Agent Runtime
大语言模型·qwen
咬代码的兽2 天前
Qwen3.8-Omni-Flash 发布:1M 上下文 + 原生全模态,四步跑通音视频 API
人工智能·大模型·api·qwen
程序猿编码3 天前
不用 GPU!RK3588 跑视觉大模型,Qwen3.5-2B VLM 端侧落地
大模型·llm·rk3588·qwen·推理·vlm
赋创小助手3 天前
Qwen3.8-27B 本地推理 Benchmark 解析:llama.cpp、vLLM、SGLang 与长 Context 的性能差异
服务器·人工智能·大模型·qwen·vllm·sglang·context长度
论文复现现场3 天前
Llama/Qwen 70B 部署需要几张 RTX 4090?2卡、4卡、8卡显存、量化与 vLLM 选型
llama·qwen·vllm·大模型推理·大模型部署·rtx4090
程序猿编码4 天前
扔掉 vLLM!从零构建 Qwen3-8B 推理引擎,C++/CUDA 实现性能追平 98%
大模型·qwen·推理
程序猿编码6 天前
两张 3090 扛 27B:Qwen3.8-27B 大模型 DFlash2 加速版生产级落地
开发语言·gpt·深度学习·神经网络·大模型·qwen
java_logo8 天前
Claude 遭大规模「蒸馏」?过去 8 个月,AI 行业另一场战争被摊开了
人工智能·claude·qwen·ai 安全·kimi·模型蒸馏·anthropic
星核0penstarry19 天前
三款Flash模型横向对比:GLM-5.3、DeepSeek-V4、Qwen3.8怎么选?
人工智能·qwen·flash·glm-5.3·deepseek-·横向测评
晨欣19 天前
LLM Architecture Gallery 是什么:新开源模型出来后,先对照架构再决定要不要部署
qwen·moe·gqa·kv cache·deepseek·mla·llm架构