HongKongの1024

复制代码
version: '3.8'

services:
  lbot-14b:
    image: quay.io/ascend/vllm-ascend:v0.11.0rc0-openeuler
    container_name: lbot-14b
    privileged: true
    ipc: host
    shm_size: 96g
    devices:
      - /dev/davinci0
      - /dev/davinci1
      - /dev/davinci_manager
      - /dev/devmm_svm
      - /dev/hisi_hdc
    volumes:
      - /usr/local/dcmi:/usr/local/dcmi
      - /usr/local/bin/npu-smi:/usr/local/bin/npu-smi
      - /usr/local/sbin/:/usr/local/sbin
      - /usr/local/Ascend/driver:/usr/local/Ascend/driver
      - /etc/ascend_install.info:/etc/ascend_install.info
      - /etc/vnpu.cfg:/etc/vnpu.cfg
         - /data/disk2/alphainf/models/Qwen/Qwen3-14B:/mnt/data/models/Qwen3-14B
         - /data/disk2/alphainf/lora:/mnt/data/auto-train/volumes/save
    environment:
      - VLLM_ALLOW_RUNTIME_LORA_UPDATING=True
      - VLLM_LORA_RESOLVER_CACHE_DIR=/mnt/data/auto-train/volumes/save
      - OMP_NUM_THREADS=48
      - NPU_MEMORY_FRACTION=0.8
      - MINDIE_LOG_TO_STDOUT=1
      - MINDIE_LOG_TO_FILE=1
      - MINDIE_LOG_VERBOSE=1
      - VLLM_USE_V1=1
      - VLLM_PLUGINS=lora_filesystem_resolver
      - OMP_NUM_THREADS=4
    ports:
      - 6214:6214
    entrypoint: []
    command:
      - "bash"
      - "-c"
      - "python3 -m vllm.entrypoints.openai.api_server \
        --model=/mnt/data/models/Qwen3-14B --served-model-name lbot-14b --host 0.0.0.0 --port 6214 --gpu-memory-utilization 0.8  --max-num-seqs 200 --max-seq-len-to-capture 32768 --max-model-len 32768 --enable-prefix-caching --quantization=fp8   --reasoning-parser qwen3 --enable-lora  --max-lora-rank 64 --tensor-parallel-size 2"  也能写成一句docker run吧

可以将这个 docker-compose.yml 配置转换为等效的 docker run 命令。以下是转换后的命令(为了可读性拆分为多行,实际使用时可合并为一行):

复制代码
docker run -d \
  --name lbot-14b \
  --privileged \
  --ipc=host \
  --shm-size=96g \
  --device=/dev/davinci0 \
  --device=/dev/davinci1 \
  --device=/dev/davinci_manager \
  --device=/dev/devmm_svm \
  --device=/dev/hisi_hdc \
  -v /usr/local/dcmi:/usr/local/dcmi \
  -v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
  -v /usr/local/sbin/:/usr/local/sbin \
  -v /usr/local/Ascend/driver:/usr/local/Ascend/driver \
  -v /etc/ascend_install.info:/etc/ascend_install.info \
  -v /etc/vnpu.cfg:/etc/vnpu.cfg \
  -v /data/disk2/alphainf/models/Qwen/Qwen3-14B:/mnt/data/models/Qwen3-14B \
  -v /data/disk2/alphainf/lora:/mnt/data/auto-train/volumes/save \
  -e VLLM_ALLOW_RUNTIME_LORA_UPDATING=True \
  -e VLLM_LORA_RESOLVER_CACHE_DIR=/mnt/data/auto-train/volumes/save \
  -e OMP_NUM_THREADS=4 \
  -e NPU_MEMORY_FRACTION=0.8 \
  -e MINDIE_LOG_TO_STDOUT=1 \
  -e MINDIE_LOG_TO_FILE=1 \
  -e MINDIE_LOG_VERBOSE=1 \
  -e VLLM_USE_V1=1 \
  -e VLLM_PLUGINS=lora_filesystem_resolver \
  -p 6214:6214 \
  quay.io/ascend/vllm-ascend:v0.11.0rc0-openeuler \
  bash -c "python3 -m vllm.entrypoints.openai.api_server \
    --model=/mnt/data/models/Qwen3-14B \
    --served-model-name lbot-14b \
    --host 0.0.0.0 \
    --port 6214 \
    --gpu-memory-utilization 0.8 \
    --max-num-seqs 200 \
    --max-seq-len-to-capture 32768 \
    --max-model-len 32768 \
    --enable-prefix-caching \
    --quantization=fp8 \
    --reasoning-parser qwen3 \
    --enable-lora \
    --max-lora-rank 64 \
    --tensor-parallel-size 2"
相关推荐
胜天半月子13 小时前
嵌入式开发 | C语言 | 单精度浮点数4字节可以表示的范围计算过程
c语言·嵌入式c·1024程序员节·单精度浮点数计算
x_lrong13 小时前
配置Centos7.6 yum镜像源
1024程序员节
B站_计算机毕业设计之家13 小时前
python舆情分析可视化系统 情感分析 微博 爬虫 scrapy爬虫技术 朴素贝叶斯分类算法大数据 计算机✅
大数据·爬虫·python·scrapy·数据分析·1024程序员节·舆情分析
一条星星鱼13 小时前
PSG技术文章大纲
1024程序员节
weixin_4209476413 小时前
golang使用泛型
golang·1024程序员节
B站_计算机毕业设计之家13 小时前
基于python人脸识别系统 人脸检测 实时检测 深度学习 Dlib库 ResNet深度卷积神经网络 pyqt设计 大数据(源码)✅
python·深度学习·目标检测·计算机视觉·信息可视化·人脸识别·1024程序员节
极客范儿13 小时前
新华三H3CNE网络工程师认证—STP状态机与收敛过程
服务器·网络·stp·1024程序员节
汤姆yu13 小时前
2026版基于python大数据的电影分析可视化系统
大数据·python·1024程序员节·电影分析可视化
阿登林13 小时前
C# .NET Core中Chart图表绘制与PDF导出
c#·1024程序员节