[书生·浦语大模型实战营]——LMDeploy 量化部署 LLM 实践

1.基础作业

1.1配置 LMDeploy 运行环境

创建开发机

创建新的开发机,选择镜像Cuda12.2-conda;选择10% A100*1GPU;点击"立即创建"。注意请不要选择Cuda11.7-conda的镜像,新版本的lmdeploy会出现兼容性问题。其他和之前一样,不赘述。

创建conda环境

c 复制代码
studio-conda -t lmdeploy -o pytorch-2.1.2

安装LMDeploy

c 复制代码
#激活虚拟环境
conda activate lmdeploy
#安装0.3.0的imdeploy
pip install lmdeploy[all]==0.3.0

1.2以命令行方式与 InternLM2-Chat-1.8B 模型对话


2.进阶作业

2.1 设置KV Cache最大占用比例为0.4,开启W4A16量化,以命令行方式与模型对话。


2.2 以API Server方式启动 lmdeploy,开启 W4A16量化,调整KV Cache的占用比例为0.4,分别使用命令行客户端与Gradio网页客户端与模型对话。

命令行:

网页客户端:

2.3 使用W4A16量化,调整KV Cache的占用比例为0.4,使用Python代码集成的方式运行internlm2-chat-1.8b模型。

2.4 使用 LMDeploy 运行视觉多模态大模型 llava gradio demo。


相关推荐
知几蜗牛1 分钟前
多Agent最怕的不是答错,而是崩溃后不知道做到哪一步
人工智能
知几蜗牛4 分钟前
4 bit模型为何不等于显存缩小四倍?量化账单这样算
人工智能
deepseek234 分钟前
OpenAI 一万 Agent 解纳维-斯托克斯拆解:scaling 从参数换成并发,AGI 标尺从准确率变成连续工作时长
人工智能·多智能体·ai agent
知几蜗牛12 分钟前
Claude放宽生命科学限制:代价是验证、分级和30天留存
人工智能
知几蜗牛12 分钟前
Anthropic公开内部AI研发速度:真正该盯的是三个分母
人工智能
回眸&啤酒鸭13 分钟前
【回眸】GLM 5.3 Flash 高效落地实战指南
人工智能
吴佳浩13 分钟前
为什么 Agent 需要 Memory?Memory 和 RAG 到底有什么区别?
人工智能·agent·ai编程
skywalk816314 分钟前
在FreeBSD15.1系统安装bun,最后使用官方安装成功!
人工智能·bun
带鱼吃猫15 分钟前
LangGraph入门:支持搜索的智能代理系统
人工智能·langchain
吴佳浩15 分钟前
Agent Memory 架构设计:短时记忆、长期记忆与 Memory 生命周期
人工智能·agent·ai编程