📋 目录
🖥️ 基础环境
| 组件 | 规格/版本 |
|---|---|
| 操作系统 | UOS V25 服务器操作系统 |
| 服务器型号 | 浪潮 AI 服务器 (NF5468m6) |
| AI 加速卡 | 天数智芯 B150 |
| 驱动版本 | corex-driver-linux64-4.4.0_x86_64_10.2.run |
| Docker 版本 | v24.0.9 |
📦 驱动安装
🐳 容器化部署
1. 拉取官方镜像
bash
docker pull registry.uniontech.com/uos-ai/uos-server-25-iluvatar:4.4.0
2. 创建并启动容器
bash
docker run -dit \
-v /usr/src:/usr/src \
-v /lib/modules:/lib/modules \
-v /dev:/dev \
-v /data:/data \
--network=host \
--name=sglang \
--ipc=host \
--privileged \
registry.uniontech.com/uos-ai/uos-server-25-iluvatar:4.4.0 \
tail -f /dev/null
3. 进入容器环境
bash
docker exec -it sglang /bin/bash
4. 启动 SGLang 推理服务
bash
export SGLANG_KV_CACHE_FORMAT=NHD
python3 -m sglang.launch_server \
--model-path /data/models/DeepSeek-R1-Distill-Qwen-1.5B \
--host 0.0.0.0 \
--port 30000 \
--tp 2 \
--chunked-prefill-size 2048 \
--attention-backend triton \
--page-size 16 \
--served-model-name deepseek \
--mem-fraction-static 0.85 \
--trust-remote-code \
--disable-custom-all-reduce \
--disable-cuda-graph \
--disable-radix-cache \
--enable-metrics
📷 服务启动成功截图:

✅ 服务验证
发送测试请求
bash
curl -X POST http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek",
"messages": [{"role": "user", "content": "你好,请介绍一下自己"}],
"temperature": 0.7,
"max_tokens": 200,
"stream": false
}'
📷 预期返回: JSON 格式的模型回复,示例如下:

⚠️ 注意事项
- 模型路径 :确保
/data/models/DeepSeek-R1-Distill-Qwen-1.5B目录已下载完整模型权重,若未下载可使用huggingface-cli download或modelscope下载。 - 显存预留 :
--mem-fraction-static建议设为0.85~0.90,过高易触发 OOM。