DeepSeek容器化部署(vLLM+Open WebUI)魔搭模型版

一、环境准备

前提:服务器已安装NVIDIA GPU驱动,系统为Ubuntu 20.04。

1. 安装Docker

bash 复制代码
curl -fsSL https://download.docker.com/linux/ubuntu/gpg | sudo gpg --dearmor -o /usr/share/keyrings/docker-archive-keyring.gpg
echo "deb [arch=$(dpkg --print-architecture) signed-by=/usr/share/keyrings/docker-archive-keyring.gpg] https://download.docker.com/linux/ubuntu focal stable" | sudo tee /etc/apt/sources.list.d/docker.list > /dev/null
apt update
apt install -y docker-ce docker-ce-cli containerd.io
systemctl start docker
systemctl enable docker

2. 安装NVIDIA-Docker

bash 复制代码
distribution=$(. /etc/os-release;echo $ID$VERSION_ID)
curl -s -L https://nvidia.github.io/nvidia-docker/gpgkey | sudo apt-key add -
curl -s -L https://nvidia.github.io/nvidia-docker/$distribution/nvidia-docker.list | sudo tee /etc/apt/sources.list.d/nvidia-docker.list
apt-get update
apt-get install -y nvidia-docker2
systemctl restart docker

二、魔搭社区下载模型(ModelScope)

1. 安装ModelScope工具

bash 复制代码
pip install modelscope

2. 下载Qwen3-8B模型(自定义路径)

bash 复制代码
modelscope download --model Qwen/Qwen3-8B --local_dir /hy-tmp/models/deepseek/

模型将保存到:/hy-tmp/models/deepseek/,后续容器直接挂载此路径。


三、拉取Docker镜像

bash 复制代码
# 拉取Open WebUI(CUDA版)
docker pull ghcr.io/open-webui/open-webui:cuda
# 拉取vLLM推理镜像
docker pull vllm/vllm-openai

四、启动vLLM容器(挂载魔搭模型)

bash 复制代码
docker run -d \
 --gpus all \
 --restart unless-stopped \
 --name deepseek-container \
 --network host \
 -v /hy-tmp/models/deepseek:/model \
 vllm/vllm-openai:latest \
 --model /model \
 --served-model-name qwen3-8b \
 --dtype half \
 --api-key OPENWEBUI123

关键说明:

  • -v /hy-tmp/models/deepseek:/model:挂载魔搭下载的模型路径
  • --served-model-name qwen3-8b:自定义服务模型名
  • --api-key OPENWEBUI123:接口密钥(WebUI需保持一致)

五、启动Open WebUI容器

bash 复制代码
docker run -d \
 --name openwebui-container \
 --network host \
 --gpus all \
 -e OPENAI_API_BASE_URL=http://localhost:8000/v1 \
 -e OPENAI_API_KEYS=OPENWEBUI123 \
 -e USE_CUDA_DOCKER=true \
 ghcr.io/open-webui/open-webui:cuda

六、验证与访问

  1. 检查容器状态:
bash 复制代码
docker ps
  1. 浏览器访问Open WebUI:

    http://服务器IP:8080

  2. 首次访问创建管理员账号,即可选择qwen3-8b模型对话。


七、常见参数说明

参数 作用
--gpus all 容器调用全部GPU
--network host 复用主机网络,端口直通
-v 本地路径:容器路径 模型目录挂载
--dtype half FP16精度,降低显存占用
--api-key 接口鉴权密钥
相关推荐
梦帮科技18 小时前
vLLM / TensorRT-LLM 极限推理:PagedAttention 细粒度物理页表管理与连续批处理(Continuous Batching)实战
数据结构·人工智能·分布式·python·深度学习·算法·vllm
可乐ea2 天前
vLLM 分离式推理实战指南:把 prefill 和 decode 拆开跑
ai智能体·vllm·kv缓存·大模型推理优化·分离式推理
小马9262 天前
【无标题】
vllm
智码看视界5 天前
开源大模型追踪:腾讯混元Hy4preview,FP8 770GB 落地企业私有化,Apache 2.0 无字段限制
开源·vllm·开源大模型·apache2.0·fp8量化·腾讯混元hy4·agent推理
仙人掌_lz6 天前
3090 上的部署两种基于Qwen3.5-4B 判别模型open jev:llama.cpp和 vLLM ,谁更快、谁更准
人工智能·llm·llama·vllm·判别模型·jev
Είναι η κοπέλα6 天前
开源推理引擎怎么选:vLLM、SGLang、Ollama、llama.cpp 的机制与部署
开源·vllm·sglang
程序员清风7 天前
vLLM 实战:用 OpenAI 兼容接口部署本地大模型推理服务
开源·github·vllm
程序猿编码7 天前
C++/CUDA 手写 LLM 推理引擎:拆解 vLLM 核心 PagedAttention 与连续批处理
开发语言·c++·深度学习·神经网络·推理·vllm
谢白羽7 天前
对比DP8+EP与TP8在DS MoE部署性能
llm·vllm·大模型部署·sglang
可乐ea7 天前
vLLM 支持无失真文本水印了:Gumbel-max 是怎么混进采样管线的
vllm·llm应用开发·采样策略·llm水印·gumbelmax