千问Qwen7B chat:本地部署及网页端使用

基于前面的安装经验,千问大模型的本地部署并不算难,主要时间用在大模型文件的下载上。同时系统运行对硬件也有较高的要求,本机的硬件配置为N卡3060,显存12G。

  1. 使用conda创建虚拟环境,主要版本如下:

Python 3.9.18

CUDA 12.1

pytorch 2.2.2

  1. 克隆代码到本地

git clone https://github.com/QwenLM/Qwen.git

  1. 进入Qwen目录,执行安装命令

安装依赖

pip install -r requirements.txt

安装 web_demo 依赖

pip install -r requirements_web_demo.txt

  1. 运行命令

python web_demo.py --server-port 8087 --server-name "0.0.0.0"

会下载很多模型文件,需要一点时间。下载完成后启动界面如下

在输入框里输入沟通内容"你是谁"。我们看一下后台输出:

相关推荐
桃西西呀11 小时前
Spring AI Alibaba 之七:我没写一行 tracing 埋点,Agent 每一步却被 Micrometer 看得清清楚楚
人工智能·spring·llm
桃西西呀11 小时前
Spring AI Alibaba 之八:我让 Agent 直接执行 shell 命令,它却读到了目录里的密钥,沙箱到底防住了什么
人工智能·spring·llm
MoonOut13 小时前
LLM | OpenAI 兼容模式 与 Anthropic 协议的区别
llm
架构师那点事儿14 小时前
Agent Skill: 视频/PPT 内容提取 Skill —— 从 0 到 1 诞生记 + 使用指南
llm·agent·ai编程
lucas_AI14 小时前
CPSE:只给 3 篇范文,让 LLM 学会你的 478 字段抽取 schema,还不许动接口
llm
AINative软件工程15 小时前
LLM 应用的 Adaptive Batching 工程实践:动态合批把吞吐提升 3 倍,但延迟的坑你踩过吗
后端·llm·ai编程
范中勤16 小时前
LLM 动态加载与多用户缓存架构技术文档
redis·langchain·llm·缓存架构·多用户隔离
流浪00116 小时前
大模型技术全景(二十):RAG 文本分块策略与语义完整性
llm·rag·文本分块·语义完整性
10年前端老司机1 天前
你的RAG检索正在“高效地重复废话”:一文彻底搞懂MMR算法
langchain·llm·agent
stereohomology1 天前
大模型的观点谨:StoryTold 「Crafting Apps」四件套 · 深度总览
人工智能·llm