vllm安装到dgx spark上

docker pull nvcr.io/nvidia/vllm:26.01-py3

docker run -it --gpus all -p 8000:8000 \ nvcr.io/nvidia/vllm:${LATEST_VLLM_VERSION} \ vllm serve "Qwen/Qwen2.5-Math-1.5B-Instruct"

docker run -it --rm \ --gpus all \ -p 8000:8000 \ -e HF_ENDPOINT=https://hf-mirror.com \ nvcr.io/nvidia/vllm:26.01-py3 \ vllm serve Qwen/Qwen3.5-9B-Instruct \ --trust-remote-code \ --host 0.0.0.0

docker run -it --rm \ --gpus all \ -p 8000:8000 \ --ipc=host \ -e HF_ENDPOINT=https://hf-mirror.com \ nvcr.io/nvidia/vllm:26.01-py3 \ vllm serve Qwen/Qwen2-7B-Instruct \ --host 0.0.0.0

http://服务器IP:8000/v1/chat/completions

curl http://localhost:8000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Qwen/Qwen2-7B-Instruct", "messages": {"role": "user", "content": "你好!你是谁"} }'

其他电脑访问 vLLM 模型的地址

1. 基础访问地址(前端 / 面板用)

plaintext

复制代码
http://192.168.1.77:8000

2. OpenAI 兼容 API 地址(所有软件通用)

plaintext

复制代码
http://192.168.1.77:8000/v1

3. 对话接口(可直接测试)

plaintext

复制代码
http://192.168.1.77:8000/v1/chat/completions

其他电脑测试命令(直接复制可用)

bash

运行

复制代码
curl http://192.168.1.77:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen2-7B-Instruct",
    "messages": [
      {"role": "user", "content": "你好"}
    ]
  }'

Ubuntu 开放端口(必须执行一次)

bash

运行

复制代码
sudo ufw allow 8000/tcp
sudo ufw reload

相关推荐
Web3&Basketball15 小时前
vLLM部署开源大模型实战:显存、命令与成本核算
人工智能·深度学习·大模型·ai技术·vllm
ん贤2 天前
从一个 Token 到 vLLM:推理、量化、适配的理解
vllm
随便做点啥2 天前
32卡×4090 24GB,Qwen3.8-27B-FP8 集群部署报告
服务器·经验分享·docker·vllm
进军的码农4 天前
DeepSeek-V4-Pro 正式版本地部署:联想 ThinkStation P4 硬件架构拆解与推理链路全验证
vllm·deepseek·ai推理·大模型本地部署·联想工作站·thinkstation p4
johnny2334 天前
vLLM理论及实战入门
vllm
我有2只猫5 天前
vLLM Docker 本地部署小模型
docker·容器·vllm
ZJU_统一阿萨姆5 天前
【推理优化进阶】调度器的数学内核:排队论、SLO 与在线决策
开发语言·人工智能·语言模型·系统架构·vllm
Albart5755 天前
vLLM多卡部署终极踩坑:CUDA error worker进程异常退出 完整定位&生产根治方案
cuda·nccl·vllm·大模型部署·多卡推理·大模型踩坑
ZJU_统一阿萨姆6 天前
【推理优化进阶】性能实验科学:工作负载、统计显著性与尾延迟归因
开发语言·人工智能·语言模型·系统架构·vllm
JAI科研7 天前
Deepseek Agent Harness教程(二) | DeepSeek Harness 设计思路
人工智能·深度学习·算法·机器学习·自然语言处理·transformer·vllm