Qwen-Drive-1.0-4B

!Note
本仓库包含以 Hugging Face 格式发布的 Qwen-Drive-1.0 权重与配置。配套的代码、演示数据与文档已发布于 QwenLM/Qwen-Drive-1.0。
Qwen-Drive-1.0 保留了预训练 Qwen3.5 视觉语言模型的架构,并在统一框架内集成了 3D 感知 、视觉问答 与 运动规划 。原生多模态的 Qwen3.5-4B 作为共享的视觉语言模型(VLM)底座,外接两个模块:BEV 感知头 联合执行 3D 目标检测、语义占用预测与 BEV 地图分割;规划专家 基于共享的 VLM 表征,通过流匹配(flow matching)生成未来自车轨迹。保持不变的 VLM 负责回答关于驾驶场景的自由形式问题。分阶段的训练方案将驾驶监督与通用视觉语言数据相结合,使模型在获得驾驶专项能力的同时,保留广泛的视觉理解与指令跟随能力。
更多细节请参见技术报告:Qwen-Drive-1.0。
亮点
- Qwen-Drive-1.0 是首个在预训练阶段即统一 3D 感知与视觉问答、并进一步扩展到运动规划的自动驾驶视觉语言基础模型,同时完全保持预训练 VLM 架构不变。
- 外置的 BEV 感知头作为显式、可检查的 3D 探针,联合学习 3D 检测、语义占用预测与 BEV 地图分割,为同一预训练 VLM 提供清晰的感知输出,同时保持极具竞争力的视觉语言性能。
- 分阶段的训练与数据方案统一了跨数据集的标签,重写响应并对样本进行一致性过滤,将驾驶数据与通用视觉语言监督相结合,在支持领域适配的同时缓解灾难性遗忘。
- 针对预训练 VLM 表征定制的规划专家,通过流匹配生成未来自车轨迹。统一的轨迹标注支持在多个公开驾驶数据集上联合训练,并在开环(open-loop)、伪闭环(pseudo-closed-loop)与闭环(closed-loop)评测中均取得极具竞争力的结果。
- 发布两个规划专家版本:
planner-sft同时支持直接规划与推理规划;planner-rl进一步在 NAVSIM PDMS、WOD-E2E RFS 及位移项上进行了奖励优化,在推理规划模式下表现最佳。

运动规划
| AutoVLA | SpanVLA | MindVLA-U1 | Alpamayo-1.5 | SimWAMIL | Qwen-Drive-1.0-SFT | Qwen-Drive-1.0-RL | |
|---|---|---|---|---|---|---|---|
| 开环(Open-loop) | |||||||
| WOD-E2E (RFS val/test ↑) | --/7.56 | -- | ++8.20/7.87++ | -- | -- | 7.95/7.78 | 8.45/7.91 |
| WOD-E2E (ADE 5s val/test ↓) | --/2.96 | -- | ++2.28/2.66++ | -- | -- | 2.31/++2.65++ | 1.27/2.67 |
| PAI-AV (Avg. ADE 3s ↓) | -- | -- | -- | 0.35 | 0.41 | ++0.37++ | 0.42 |
| PAI-AV (Avg. ADE 5s ↓) | -- | -- | -- | 1.05 | -- | ++1.07++ | 1.11 |
| 伪闭环(Pseudo-closed-loop) | |||||||
| NAVSIM (PDMS ↑) | 89.6 | ++90.3++ | -- | -- | ++90.3++ | 88.2 | 90.7 |
| NAVSIM best-of-6 (PDMS ↑) | -- | -- | -- | -- | -- | ++89.3++ | 91.4 |
| 闭环(Closed-loop) | |||||||
| AlpaSim (at-fault score ↑) | -- | -- | -- | 0.45 | 0.30 | 0.27 | ++0.37++ |
* AutoVLA 与 SimWAM 在每个数据集上分别训练独立模型。
* SFT 列报告的是以规划推理为条件的 Qwen-Drive-1.0-SFT。
* IL 指模仿学习。
* -- 表示该方法未在对应基准上报告结果。
凭借完全来自公开来源的规划样本,Qwen-Drive-1.0 统一了各数据集的轨迹格式,评测覆盖从开环预测到闭环驾驶的全过程。SFT 模型在所有基准上已具备竞争力。经过强化学习后,模型仅以轻微的开环位移代价,换取人类偏好对齐与闭环安全性的全面提升。

视觉语言理解
| InternVL3.5-8B-Instruct | LLaVA-OV2-8B | Qwen3.5-4B | Cosmos-Reason1-7B | Cosmos-Reason2-8B | Cosmos3-nano | MiMo-Embodied-7B | Alpamayo-1.5-10B | Qwen-Drive-1.0-SFT | |
|---|---|---|---|---|---|---|---|---|---|
| 驾驶 VQA | |||||||||
| LingoQA | 46.4 | 41.2 | 70.4 | 45.2 | 59.6 | 65.0 | ++72.0++ | 64.0 | 77.8 |
| Ego3D RMSE ↓ | 23.01 | 24.97 | 13.17 | 26.71 | 12.62 | 22.41 | ++9.85++ | 25.31 | 7.78 |
| VLAD | 54.5 | 58.7 | ++65.4++ | 33.6 | 56.4 | 57.7 | 50.3 | 9.1 | 66.5 |
| SURDS | 32.8 | 38.6 | ++53.0++ | 8.5 | 19.5 | 39.7 | 43.1 | 3.1 | 66.1 |
| WaymoQA safety | 54.5 | 49.7 | 62.5 | 39.5 | 57.7 | 56.9 | ++66.5++ | 42.6 | 70.7 |
| WaymoQA all | 58.1 | 55.2 | 67.1 | 43.9 | 57.9 | 58.4 | ++69.6++ | 44.4 | 74.5 |
| CoC all | -- | 0.6 | 2.6 | 3.2 | 1.7 | ++4.0++ | -- | 3.4 | 41.3 |
| IH | 47.5 | 54.0 | 59.0 | 30.5 | 56.0 | 2.0 | ++61.0++ | 3.0 | 71.0 |
| 知识、推理与识别 | |||||||||
| MMBench | 80.0 | 82.7 | 87.1 | 80.0 | 82.8 | 79.6 | -- | 7.5 | ++85.5++ |
| MMStar | 64.1 | 64.9 | ++75.3++ | 63.5 | 65.3 | 66.7 | 22.4 | 26.1 | 75.9 |
| MMMU | 62.0 | 54.7 | 73.4 | 54.2 | 59.1 | 60.9 | -- | 27.4 | ++72.7++ |
| MMMU-Pro std | 46.4 | 36.3 | 64.9 | 38.4 | 36.1 | 46.4 | 27.4 | 15.6 | ++62.7++ |
| MMMU-Pro vis | 42.3 | 26.0 | 61.3 | 35.8 | 43.5 | 40.8 | 28.1 | 13.5 | ++59.7++ |
| CharXiv | 41.7 | 40.1 | 65.1 | 39.7 | 42.5 | 42.1 | 57.5 | 1.5 | ++64.4++ |
| OCRBench | 83.2 | 79.3 | ++86.9++ | 85.2 | 87.0 | 85.2 | 78.8 | 3.2 | 86.4 |
| RealWorldQA | 66.9 | 71.8 | ++76.3++ | 67.5 | 67.5 | 69.7 | 28.5 | 46.9 | 79.0 |
| SimpleVQA | 40.8 | 36.7 | 47.8 | 45.0 | 45.3 | 45.0 | -- | -- | ++46.1++ |
| CountQA | 20.9 | 22.6 | 35.9 | 18.5 | 22.3 | 23.6 | 22.6 | 4.7 | ++31.7++ |
| 空间理解与定位 | |||||||||
| EmbSpatial | 74.2 | ++78.4++ | 76.0 | 68.8 | 77.6 | 77.9 | 45.1 | 20.6 | 78.9 |
| ERQA | 42.0 | 42.3 | ++46.3++ | 38.5 | 43.3 | 41.3 | 39.8 | 27.5 | 48.5 |
| RefSpatial | -- | -- | 54.5 | 0.4 | ++51.8++ | -- | 2.2 | -- | 50.8 |
| Omni3D | -- | -- | 47.4 | -- | 32.9 | 32.3 | -- | -- | ++45.8++ |
| ODinW13 | -- | -- | ++40.8++ | 4.8 | 40.2 | 35.9 | -- | -- | 45.9 |
* 所有基准均使用相同的高置信度解码设置(greedy=false, top-p=0.001, top-k=1, temperature=0.01, repetition_penalty=1.0, presence_penalty=0.0),以更直接地反映模型能力。
* LingoQA 使用 Qwen-Plus 作为评审,而非官方 LingoJudge------我们发现官方评审在不同场景下打分偏宽松且不一致。在官方 LingoJudge 协议下,Qwen-Drive-1.0-SFT 的 LingoScore 为 79.4。
* 每个基准上的所有方法均由同一评审打分。
* -- 表示无效或无法解析的响应。
驾驶 VQA。 Qwen-Drive-1.0-SFT 在驾驶问答上领先于通用视觉语言模型以及驾驶/具身智能专项模型,空间理解最为锐利,物理尺度感知更为准确。其中因果推理能力的提升最为显著,其驾驶决策能力源于对广泛驾驶数据的泛化,而非记忆特定场景。
通用视觉语言理解。 大规模驾驶训练未造成明显的灾难性遗忘。Qwen-Drive-1.0-SFT 在很大程度上保留了通用视觉语言能力,在知识、推理、识别与空间理解基准上与基础模型 Qwen3.5-4B 表现相当,同时完好保留了指令跟随能力。
3D 感知

单个 Qwen-Drive-1.0-SFT 模型即可生成连贯的 3D 检测、语义占用与 BEV 地图分割结果,这些结果反映真实的 3D 结构,而非继承标签噪声。BEV 感知头被刻意保持简单,使其作为共享 VLM 表征的显式、可检查的 3D 探针,而非面向先进感知基准的专项模型。
仓库内容
所有内容均在一个目录中发布。VLM 位于根目录,被所有任务共享,各任务头则位于其旁边的子目录中。
Qwen-Drive-1.0-4B/ 9.1 GB 视觉语言模型,单独即可提供 VQA 模式
├── planner-sft/ 2.1 GB 规划专家,模仿学习训练
├── planner-rl/ 2.1 GB 奖励优化后的规划专家
└── perception/ 0.5 GB BEV 感知头
快速开始
从 GitHub 仓库安装推理代码:
bash
git clone https://github.com/QwenLM/Qwen-Drive-1.0 qwen-drive && cd qwen-drive
pip install -e . --no-build-isolation
下载权重(根目录的 VLM 及其子目录中的每个任务头):
bash
hf download Qwen/Qwen-Drive-1.0-4B --local-dir Qwen-Drive-1.0-4B
加载 VLM 并挂载规划专家来预测轨迹:
python
import torch
from qwen_drive import InferenceMode, QwenDriveForPlanning
from qwen_drive.benchmarks import read_scene_file
from qwen_drive.images import ImageArchive
model = QwenDriveForPlanning.from_pretrained(
"Qwen-Drive-1.0-4B",
planner="Qwen-Drive-1.0-4B/planner-rl",
dtype=torch.bfloat16,
attn_implementation="flash_attention_2",
).to("cuda").eval()
scene = next(
read_scene_file(
"data/demo/planning_scenes.jsonl",
image_archive=ImageArchive.open("data/demo/frames.parquet"),
)
).scene
result = model.run(InferenceMode.REASONING_PLANNING, scene=scene, num_samples=6)
print(result.reasoning)
print(result.trajectories.shape) # (6, 50, 3) -> (x, y, heading), 5 s at 10 Hz
- VQA。 不加载规划器、仅加载根目录时,VLM 可独立回答关于驾驶场景的自由形式问题。
- 感知。 使用
QwenDrivePerception.from_pretrained("Qwen-Drive-1.0-4B/perception")挂载 BEV 头;它绑定同一 VLM,输出 3D 检测、占用与 BEV 地图分割结果。 planner-rl仅在推理条件下的 rollout 上进行了奖励优化,因此请在推理规划模式下运行。planner-sft则同时支持直接规划与推理规划。
GitHub 仓库中的 scripts/demo.py 无需任何额外数据即可端到端运行四个内置规划场景与六个感知帧。
引用
如果你觉得我们的工作有帮助,欢迎引用我们。
bibtex
@misc{zhou2026qwendrive10initialstepvisionlanguage,
title={Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving},
author={Xin Zhou and Zongchuang Zhao and Zhibo Yang and Mingsheng Li and Humen Zhong and Shuai Bai and Du Chu and Ruizhe Chen and Zhaohai Li and Jun Tang and Qiuyue Wang and Mingkun Yang and Jiazhao Zhang and Dayiheng Liu and Dingkang Liang and Xiang Bai},
year={2026},
eprint={2609.00111},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2609.00111},
}