vllm运行在DGX Spark的启动参数及小问题

视频链接: https://www.bilibili.com/video/BV1feum6oEzh/?vd_source=5ba34935b7845cd15c65ef62c64ba82f

ollama的并发和tps太慢,最近在尝试vllm或sglang的框架进行加载,如下为vllm部署及使用过程的记录和一些可能大家会碰到的问题,选择https://huggingface.co/Sehyo/Qwen3.5-122B-A10B-NVFP4,参考https://docs.vllm.com.cn/en/latest/getting_started/quickstart/#installation

使用python本地部署方式

复制代码
mkdir vllm && cd vllm
uv venv --python 3.12 --seed
source .venv/bin/activate
uv pip install vllm --torch-backend=cu130

vllm serve Sehyo/Qwen3.5-35B-A3B-NVFP4 --gpu-memory-utilization 0.5

一直尝试联网失败,所以还是网络的问题,加上如下的启动指令,禁止进行hub链接,使用本地缓存的模型

复制代码
HF_HUB_OFFLINE=1 vllm serve Sehyo/Qwen3.5-35B-A3B-NVFP4 --gpu-memory-utilization 0.5

运行122b会出现加载显存爆炸,是因为模型虽然限制了使用,但是比如首次编译如下图,基本上会耗尽显存,所以需要增加swap,过了编译和其他的阶段就会释放

复制代码
sudo fallocate -l 64G /swapfile2
sudo chmod 600 /swapfile2
sudo mkswap /swapfile2
sudo swapon /swapfile2
echo '/swapfile2 none swap sw 0 0' | sudo tee -a /etc/fstab     

加载权重就花了8分钟左右,由于选择了cuda graph,所以这部分也会有耗时,总耗时接近10分钟左右

测试下,两个claude code并发同时写5000字小说

其他的测试过程中也出现如下,上下文的问题

API Error: 500 This model's maximum context length is 131072 tokens. However, you requested 32000 output tokens and your prompt contains at least 99073 input tokens, for a total of at least 131073 tokens. Please reduce the length of the input prompt or the number of requested output tokens. (parameter=input_tokens, value=99073). This is a server-side issue, usually temporary --- try again in a moment. If it persists, check your inference gateway (localhost:8000).

最后使用了hf上sjug的参数,其中提到推荐Spark使用Marlin,约比CUTLASS快2%。

https://huggingface.co/sjug/Qwen3.5-122B-A10B-NVFP4-resharded/blob/4f805105ca6ae306b5e3f0efb7c50b77adff6893/README.md?utm_source=chatgpt.com

复制代码
CUTE_DSL_ARCH=sm_121a HF_HUB_OFFLINE=1 vllm serve Sehyo/Qwen3.5-122B-A10B-NVFP4 \
    --trust-remote-code \
    --quantization compressed-tensors \
    --kv-cache-dtype fp8 \
    --load-format safetensors \
    --moe-backend marlin \
    --gpu-memory-utilization 0.70 \
    --max-model-len 262144 \
    --max-num-seqs 2 \
    --max-num-batched-tokens 8192 \
    --enable-prefix-caching \
    --enable-chunked-prefill \
    --reasoning-parser qwen3 \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder

大约可以到30tps

相关推荐
东莞市云毅网络有限公司2 分钟前
PDF 表格抽取的三条技术路线对比:规则、库解析与版面识别
python·sqlite·自动化运维·geo·数据监测
jimmyleeee7 分钟前
大模型安全之二十五:Agent AI 威胁全景
人工智能·安全
samforce12 分钟前
叶公好龙:人类对AI的认知困境
人工智能
tiger86513 分钟前
大语言模型面试和题解,Context Engineering 怎么做?长 Prompt、动态上下文与 Memory 管理
人工智能·深度学习·算法·语言模型·自然语言处理·面试·nlp
仙魁XAN14 分钟前
【WorkBuddy·基础入门】第 7 篇 :不会公式也能做分析:WorkBuddy Excel 入门实战
人工智能·excel 数据处理·workbuddy·workbuddy 基础入门
AI袋鼠帝15 分钟前
WorkBuddy+仓颉.Skill 2.5,免费蒸馏飞书的任何内容!
人工智能·经验分享
刘广睿15 分钟前
影栈实战:AI 生图放大不再糊,Hires.fix 与 ESRGAN 超分从 512 到 4K 封面
图像处理·人工智能·深度学习·aigc·效率工具
Figo_Cheung15 分钟前
Figo权重动力学:递归本体论与跨尺度演化的形式化基础——揭示:宇宙的演化,本质上就是一场由无数观测者共同参与的、永不停歇的、跨尺度的权重重构盛宴。
网络·人工智能·量子计算
甲维斯16 分钟前
Codex立大功!成功狙击网站“小偷”
人工智能
海盗123420 分钟前
微软技术日报 2026-09-19:Azure AI Foundry 曝 CVSS 10 满分漏洞,Copilot Cowork 全球转正
人工智能·机器人·aigc