记一次在双 RTX 3090 工作站上部署 vLLM 与 Qwen3.6-35B-AWQ 的实战记录最近需要本地部署大模型推理服务,目标是运行 Qwen3.6-35B 的 INT4 量化版本(AWQ 格式),并使用高性能推理引擎 vLLM 提供服务。由于模型采用 AWQ 量化,且需要较新的 CUDA 环境,现有的 CUDA 11.5 和旧版驱动已经不满足要求。因此,决定将 NVIDIA 驱动和 CUDA Toolkit 升级到 CUDA 12.9 兼容版本,并在 Docker 容器中运行 vLLM,以实现环境隔离与快速部署。