千问Qwen7B chat:本地部署及网页端使用

基于前面的安装经验,千问大模型的本地部署并不算难,主要时间用在大模型文件的下载上。同时系统运行对硬件也有较高的要求,本机的硬件配置为N卡3060,显存12G。

  1. 使用conda创建虚拟环境,主要版本如下:

Python 3.9.18

CUDA 12.1

pytorch 2.2.2

  1. 克隆代码到本地

git clone https://github.com/QwenLM/Qwen.git

  1. 进入Qwen目录,执行安装命令

安装依赖

pip install -r requirements.txt

安装 web_demo 依赖

pip install -r requirements_web_demo.txt

  1. 运行命令

python web_demo.py --server-port 8087 --server-name "0.0.0.0"

会下载很多模型文件,需要一点时间。下载完成后启动界面如下

在输入框里输入沟通内容"你是谁"。我们看一下后台输出:

相关推荐
费曼学习法21 分钟前
无人值守AI内容矩阵实战(2):我给 Agent 装了个「声称检测器」,专治它谎报已发布
llm·agent·ai编程
程工造Agent22 分钟前
temperature 设为 0,就不会产生幻觉了吗?从解码机制到生产选值
llm
Clain26 分钟前
全球首款 RTX Spark 电脑开卖:128GB 统一内存 + 1 Petaflop,价格你猜对了吗?
llm·aigc
AI小白Lin29 分钟前
我的 Agent 迁移"成功"了:每道门都在册,没有一道能跑
架构·llm·agent
lucas_AI36 分钟前
给 Coding Agent 塞文档前先看这篇:什么时候是救命稻草,什么时候帮倒忙
llm·agent
小林ixn1 小时前
DeepAgent 实战:从零搭建一个会自己分工的深度调研助手
llm·agent
范中勤3 小时前
Agent IDE 双层异步调用机制:前端流式与后端多分支调度,到底各自解决什么问题
llm·agent·claude code·subagent·异步架构
AINative软件工程4 小时前
LLM 应用的预取工程实践:用预测性调用把首 Token 延迟砍掉 60%
性能优化·llm·ai编程
孟健15 小时前
Qwen3.8-27B 本地推理实测:从 14 tok/s 到 159 tok/s 的投机解码调优
人工智能·llm·ai编程
Flynt15 小时前
HN 614 分的 16.9MB 语音模型,我在 1 核 2G 上实测了一遍
llm