关于vllm【常见问题解决方案】

1、启动时报错

【1】

执行命令

powershell 复制代码
vllm serve /path/to/Qwen-2.5-7B-Instruct --served-model-name vllm --enable-prefix-caching --served-model-name Qwen-2.5-7B-Instruct

报错信息

powershell 复制代码
error: Failures have been detected while processing an MLIR pass pipeline
...
RuntimeError: PassManager::run failed

可能原因

这是 Triton 编译器 在生成 GPU 内核时失败,常见于:

1 Tesla T4(Compute Capability 7.5) 不支持某些 Triton 特性。

2 vLLM 版本 + Triton 版本不兼容。
解决方案

1 禁用 --enable-prefix-caching

powershell 复制代码
vllm serve /path/to/Qwen-2.5-7B-Instruct --served-model-name Qwen-2.5-7B-Instruct

【2】

执行命令

powershell 复制代码
vllm serve /path/to/Qwen2-7B-Instruct --served-model-name vllm --enable-prefix-caching --served-model-name Qwen2-7B-Instruct

报错信息

powershell 复制代码
CUDA out of memory. Tried to allocate 224.00 MiB.
GPU 0 has a total capacity of 14.58 GiB of which 161.38 MiB is free.

可能原因

因为你的 GPU无法加载 Qwen2-7B-Instruct 模型所需的全部显存。
解决方案

1 使用量化模型

使用 4-bit 量化模型(如 Qwen2-7B-Instruct-GPTQ 或 AWQ)。

相关推荐
迅易科技14 小时前
从场景验证到Agent上线:迅易 × WorkBuddy如何帮助企业建设AI能力?
人工智能·ai·腾讯云
Yana.nice14 小时前
Linux 只保留 30 天内日志(find命令删除日志文件)
linux·运维·chrome
克里斯蒂亚诺更新15 小时前
ruoyi角色权限的对应关系
笔记
神奇霸王龙15 小时前
GB/T 46886 闭环屠夫:5 旗舰多模态 LLM 工业质检实测
人工智能·计算机视觉·ai·开源·ai编程·本地部署
smartfish_liu15 小时前
LLM.deepseek: 2026-7-24工作总结
llm·agent
小林ixn16 小时前
大模型的“高考成绩单”:读懂Benchmark,选对真·生产力模型
人工智能·llm·测试
冬奇Lab16 小时前
AI 评测系列(04):RAG 评测——RAGAS 四指标实战与一个反直觉发现
人工智能·llm·agent
三声三视16 小时前
uni-app 鸿蒙端传参变成 [object Object]?顺着源码追到 ArkTS router 底层才搞明白
人工智能·ai·uni-app·aigc·ai编程·harmonyos
fthux16 小时前
“装闭”,让装修套路“装”不下去
人工智能·ai·开源·github·open source
Darling噜啦啦17 小时前
GPT-5.6 意味着什么?从 Benchmark 跑分到模型分层,读懂 AI 行业的三个真相
llm