第一步:源服务器打包镜像
bash
docker save zj/vllm-zj-v100:v20260530 | gzip > vllm-zj-v100-20260530.tar.gz
第二步:同步三样东西
bash
# 1. 镜像包
scp vllm-zj-v100-20260530.tar.gz root@新服务器IP:/tmp/
# 2. compose 文件(放到新服务器对应目录)
scp docker-compose.yml root@新服务器IP:/data/metahuman_work/ZengKingMorphe/zj-aha-vllm-v100/
# 3. 模型目录(大文件,用 rsync)
rsync -avP /data/metahuman_work/models/ root@新服务器IP:/data/metahuman_work/models/
第三步:新服务器导入并启动
bash
gunzip -c /tmp/vllm-zj-v100-20260530.tar.gz | docker load
docker images | grep vllm-zj-v100
cd /data/metahuman_work/ZengKingMorphe/zj-aha-vllm-v100
docker compose up -d
docker logs -f zj-vllm-Qwen3-14B-AWQ
🔍 启动前还要确认两件事
① 模型目录路径要一致
compose 里挂载的是 /data/metahuman_work/models:/models,命令里引用的是 /models/Qwen3-14B-AWQ。所以新服务器上模型必须放在 /data/metahuman_work/models/Qwen3-14B-AWQ,路径一个字都不能差,否则容器内找不到模型。
② 模型目录内容要完整
确认 Qwen3-14B-AWQ 里有:
-
模型权重(
.safetensors等) -
qwen3_nonthinking.jinja(命令里用到了,缺了会启动失败)
bash
ls /data/metahuman_work/models/Qwen3-14B-AWQ/
💡 如果新服务器没有 NVIDIA Container Toolkit
gpus: 这个字段依赖 NVIDIA Container Toolkit。如果新服务器上 docker compose up 报 GPU 相关错误,先装:
bash
# 确认 nvidia 驱动正常
nvidia-smi
# 确认容器运行时
docker run --rm --gpus all nvidia/cuda:12.0-base nvidia-smi