关于vllm【常见问题解决方案】

1、启动时报错

【1】

执行命令

powershell 复制代码
vllm serve /path/to/Qwen-2.5-7B-Instruct --served-model-name vllm --enable-prefix-caching --served-model-name Qwen-2.5-7B-Instruct

报错信息

powershell 复制代码
error: Failures have been detected while processing an MLIR pass pipeline
...
RuntimeError: PassManager::run failed

可能原因

这是 Triton 编译器 在生成 GPU 内核时失败,常见于:

1 Tesla T4(Compute Capability 7.5) 不支持某些 Triton 特性。

2 vLLM 版本 + Triton 版本不兼容。
解决方案

1 禁用 --enable-prefix-caching

powershell 复制代码
vllm serve /path/to/Qwen-2.5-7B-Instruct --served-model-name Qwen-2.5-7B-Instruct

【2】

执行命令

powershell 复制代码
vllm serve /path/to/Qwen2-7B-Instruct --served-model-name vllm --enable-prefix-caching --served-model-name Qwen2-7B-Instruct

报错信息

powershell 复制代码
CUDA out of memory. Tried to allocate 224.00 MiB.
GPU 0 has a total capacity of 14.58 GiB of which 161.38 MiB is free.

可能原因

因为你的 GPU无法加载 Qwen2-7B-Instruct 模型所需的全部显存。
解决方案

1 使用量化模型

使用 4-bit 量化模型(如 Qwen2-7B-Instruct-GPTQ 或 AWQ)。

相关推荐
虹科数字化与AR5 分钟前
工业AR设备采购指南:从参数到场景的全面评估框架
经验分享
桃西西呀16 分钟前
AI 为什么一本正经地胡说八道?3 个底层原因 + 2 个防坑法
人工智能·llm·ai编程
长沙京卓20 分钟前
MagenticLite 设备需求:能不能本地跑,先分清 App 端和模型端
人工智能·ai
Tisfy24 分钟前
LeetCode 2058.找出临界点之间的最小和最大距离:遍历+遇到极值则更新(这种题谁空间复杂度不是O(1)啊)
linux·数据库·leetcode·链表·题解·模拟·遍历
liulilittle29 分钟前
REALITY 代理隧道的有效检测方法: 被动、主动与确定性三层实证研究
linux·服务器·网络·网络协议·安全·网络安全·通信
苏灵凯31 分钟前
IT疑难杂症诊疗室:从故障定位到根治的技术实战指南
笔记·ai·域名·agent·deepseek
冰暮流星33 分钟前
marketdown之表格
笔记
阿黎梨梨33 分钟前
AI也有记忆?LangChain Memory 管理指南
langchain·node.js·llm
衡石科技40 分钟前
构建软件公司的JARVIS:AI Native研发中枢的方法论
人工智能·ai·数据分析
武子康1 小时前
删掉邮箱后,Agent Trace 仍可能泄露什么:一条可重放脱敏流水线
人工智能·llm·agent