vllm运行在DGX Spark的启动参数及小问题

视频链接: https://www.bilibili.com/video/BV1feum6oEzh/?vd_source=5ba34935b7845cd15c65ef62c64ba82f

ollama的并发和tps太慢,最近在尝试vllm或sglang的框架进行加载,如下为vllm部署及使用过程的记录和一些可能大家会碰到的问题,选择https://huggingface.co/Sehyo/Qwen3.5-122B-A10B-NVFP4,参考https://docs.vllm.com.cn/en/latest/getting_started/quickstart/#installation

使用python本地部署方式

复制代码
mkdir vllm && cd vllm
uv venv --python 3.12 --seed
source .venv/bin/activate
uv pip install vllm --torch-backend=cu130

vllm serve Sehyo/Qwen3.5-35B-A3B-NVFP4 --gpu-memory-utilization 0.5

一直尝试联网失败,所以还是网络的问题,加上如下的启动指令,禁止进行hub链接,使用本地缓存的模型

复制代码
HF_HUB_OFFLINE=1 vllm serve Sehyo/Qwen3.5-35B-A3B-NVFP4 --gpu-memory-utilization 0.5

运行122b会出现加载显存爆炸,是因为模型虽然限制了使用,但是比如首次编译如下图,基本上会耗尽显存,所以需要增加swap,过了编译和其他的阶段就会释放

复制代码
sudo fallocate -l 64G /swapfile2
sudo chmod 600 /swapfile2
sudo mkswap /swapfile2
sudo swapon /swapfile2
echo '/swapfile2 none swap sw 0 0' | sudo tee -a /etc/fstab     

加载权重就花了8分钟左右,由于选择了cuda graph,所以这部分也会有耗时,总耗时接近10分钟左右

测试下,两个claude code并发同时写5000字小说

其他的测试过程中也出现如下,上下文的问题

API Error: 500 This model's maximum context length is 131072 tokens. However, you requested 32000 output tokens and your prompt contains at least 99073 input tokens, for a total of at least 131073 tokens. Please reduce the length of the input prompt or the number of requested output tokens. (parameter=input_tokens, value=99073). This is a server-side issue, usually temporary --- try again in a moment. If it persists, check your inference gateway (localhost:8000).

最后使用了hf上sjug的参数,其中提到推荐Spark使用Marlin,约比CUTLASS快2%。

https://huggingface.co/sjug/Qwen3.5-122B-A10B-NVFP4-resharded/blob/4f805105ca6ae306b5e3f0efb7c50b77adff6893/README.md?utm_source=chatgpt.com

复制代码
CUTE_DSL_ARCH=sm_121a HF_HUB_OFFLINE=1 vllm serve Sehyo/Qwen3.5-122B-A10B-NVFP4 \
    --trust-remote-code \
    --quantization compressed-tensors \
    --kv-cache-dtype fp8 \
    --load-format safetensors \
    --moe-backend marlin \
    --gpu-memory-utilization 0.70 \
    --max-model-len 262144 \
    --max-num-seqs 2 \
    --max-num-batched-tokens 8192 \
    --enable-prefix-caching \
    --enable-chunked-prefill \
    --reasoning-parser qwen3 \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder

大约可以到30tps

相关推荐
Data_Journal10 小时前
如何使用 Java 和 Jsoup 解析 HTML
大数据·开发语言·数据库·python·scrapy
zhangfeng113310 小时前
免费 GPU 资源清单(按用途选)包括国产显卡 和 amd显卡 英伟达v100等
人工智能·ai编程·显卡
今天的砖头有点烫手啊10 小时前
AI Agent 开发实战(十):Agent 设计模式(ReAct / Plan-Execute / Reflection)
人工智能·react.js·设计模式
用户81818706274610 小时前
第1章 大模型的本质:为什么"预测下一个词"能做出这么多事
人工智能
敲代码的玉米C10 小时前
让两个模型一写一审
前端·人工智能·架构
如何原谅奋力过但无声11 小时前
现代化Python工具:uv、Ruff、Pyright、Rich(只讲重点版)
vscode·python·uv
Logintern0911 小时前
DeepAgents 主-子 Agent 的底层实现逻辑完全基于 LangGraph 的图机制
python
程序员cxuan11 小时前
Claude Opus 5 的系统提示词被扒出来了
人工智能·后端·程序员
董员外11 小时前
RAG 系统进化论(十):可运营 RAG,从原型到长期运行的知识系统
人工智能·后端·设计模式
二川bro11 小时前
从零跑通大模型全流程:基于Qwen3‑0.6B微调中医模型并Docker部署
人工智能