vllm运行在DGX Spark的启动参数及小问题

视频链接: https://www.bilibili.com/video/BV1feum6oEzh/?vd_source=5ba34935b7845cd15c65ef62c64ba82f

ollama的并发和tps太慢,最近在尝试vllm或sglang的框架进行加载,如下为vllm部署及使用过程的记录和一些可能大家会碰到的问题,选择https://huggingface.co/Sehyo/Qwen3.5-122B-A10B-NVFP4,参考https://docs.vllm.com.cn/en/latest/getting_started/quickstart/#installation

使用python本地部署方式

复制代码
mkdir vllm && cd vllm
uv venv --python 3.12 --seed
source .venv/bin/activate
uv pip install vllm --torch-backend=cu130

vllm serve Sehyo/Qwen3.5-35B-A3B-NVFP4 --gpu-memory-utilization 0.5

一直尝试联网失败,所以还是网络的问题,加上如下的启动指令,禁止进行hub链接,使用本地缓存的模型

复制代码
HF_HUB_OFFLINE=1 vllm serve Sehyo/Qwen3.5-35B-A3B-NVFP4 --gpu-memory-utilization 0.5

运行122b会出现加载显存爆炸,是因为模型虽然限制了使用,但是比如首次编译如下图,基本上会耗尽显存,所以需要增加swap,过了编译和其他的阶段就会释放

复制代码
sudo fallocate -l 64G /swapfile2
sudo chmod 600 /swapfile2
sudo mkswap /swapfile2
sudo swapon /swapfile2
echo '/swapfile2 none swap sw 0 0' | sudo tee -a /etc/fstab     

加载权重就花了8分钟左右,由于选择了cuda graph,所以这部分也会有耗时,总耗时接近10分钟左右

测试下,两个claude code并发同时写5000字小说

其他的测试过程中也出现如下,上下文的问题

API Error: 500 This model's maximum context length is 131072 tokens. However, you requested 32000 output tokens and your prompt contains at least 99073 input tokens, for a total of at least 131073 tokens. Please reduce the length of the input prompt or the number of requested output tokens. (parameter=input_tokens, value=99073). This is a server-side issue, usually temporary --- try again in a moment. If it persists, check your inference gateway (localhost:8000).

最后使用了hf上sjug的参数,其中提到推荐Spark使用Marlin,约比CUTLASS快2%。

https://huggingface.co/sjug/Qwen3.5-122B-A10B-NVFP4-resharded/blob/4f805105ca6ae306b5e3f0efb7c50b77adff6893/README.md?utm_source=chatgpt.com

复制代码
CUTE_DSL_ARCH=sm_121a HF_HUB_OFFLINE=1 vllm serve Sehyo/Qwen3.5-122B-A10B-NVFP4 \
    --trust-remote-code \
    --quantization compressed-tensors \
    --kv-cache-dtype fp8 \
    --load-format safetensors \
    --moe-backend marlin \
    --gpu-memory-utilization 0.70 \
    --max-model-len 262144 \
    --max-num-seqs 2 \
    --max-num-batched-tokens 8192 \
    --enable-prefix-caching \
    --enable-chunked-prefill \
    --reasoning-parser qwen3 \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder

大约可以到30tps

相关推荐
DeepVisionary4 小时前
谷歌 Gemini Omni 1.1 Flash 正式发布:4K 视频、40 秒场景延伸,视频生成进入按 token 计费时代
python·自动化
ZGIAI4 小时前
ZGI Workflow:条件分支走错时先查哪一层
人工智能·架构
X54先生(人文科技)5 小时前
《元创力》纪实录 · 桥段 《窑变纪元:一份来自星历2227年的深空考古笔记》
人工智能·开源·ai写作·零知识证明
ZGIAI5 小时前
ZGI 文件产物:生成报告后怎样交付
人工智能·架构
东方-教育技术博主5 小时前
自动编码在教育场景中的重要性:一项基于多源证据的深度综述
大数据·人工智能
骥龙5 小时前
模块二:Ollama本地模型部署与OpenCode代理配置
人工智能
阡之尘埃5 小时前
Python数据分析案例85——大模型微调全流程(SFT的LoRA微调)
人工智能·python·深度学习·语言模型·llm·微调·千问
Regentsoft丽晶软件5 小时前
品牌方新品上市促销政策无法实时同步经销商,有没有支持总部-经销商-终端一站式的分销解决方案?
人工智能·经验分享·数据库架构
liuqs3325 小时前
机器人产业加速发展,制造业正在迎来新的自动化探索
大数据·人工智能
腾讯云大数据5 小时前
DataBuddy数据语义驱动的企业Agent Runtime实践
大数据·人工智能·腾讯云·agent