26年8月来自阿里千问团队和华中科技的论文"Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving"。
这是一篇关于自动驾驶视觉语言-基础模型的论文,提出Qwen-Drive-1.0,一个统一的视觉-语言模型,集成3D感知、VQA和运动规划。现有VLM通过VQA适应驾驶任务时,无法显式约束3D布局,且容易灾难性遗忘通用知识。其介绍模型架构(共享VLM+外部BEV感知头+规划专家)、四阶段训练策略和数据配方法。实验部分展示了在多个基准上的性能结果。
如图1所示Qwen-Drive-1.0 在驾驶 VQA、通用 VQA、3D 感知和运动规划方面的性能概述。

真正的驾驶基础模型应满足三个要求:保持VLM架构不变、显式感知探测、保留通用能力。其核心是外部BEV头和分阶段训练。存在的问题:规划推理不够稳定、轨迹与文本理据未完全对齐、跨任务迁移受限等。
一、核心观点
1. 统一的驾驶基础模型愿景
论文提出建立一个视觉-语言基础模型,将3D感知、视觉问答(VQA)和运动规划统一在单一框架中。其核心主张是:真正的自动驾驶基础模型应同时满足三个设计需求:
保持预训练VLM架构不变(便于使用和部署)
引入显式3D感知探测(而非仅依赖文本空间推理)
保留通用视觉语言能力(支持OOD泛化和舱驾一体部署)
2. 现有方法的两个关键局限
文本监督不直接约束3D:VQA目标只通过语言监督引入驾驶知识,不要求模型进行显式的3D预测(深度、占据、布局等),导致模型在3D空间上不精确。
灾难性遗忘问题:在驾驶数据上过度微调会导致遗忘预训练获得的通用知识,而真实世界的稀有和分布外场景恰恰依赖这些知识。
3. 舱驾一体的工程价值
论文强调保留通用能力不仅是学术需求,更是工程部署要求------智能座舱和驾驶系统共享单一计算平台,一个模型需同时服务两个领域。
二、主要方法
1. 模型架构(图2所示)

Qwen-Drive-1.0基于Qwen3.5-4B,在保持原架构不变的基础上外挂两个模块:
(1) BEV感知头(图3a所示)

输入:多视角图像(6或8个相机)+ 相机标定参数
特征融合:同时利用视觉编码器特征(Fv,低层外观)和VLM输出特征(Fm,语义上下文)
视图变换:基于深度分布的Lift-Splat方法,将图像特征提升到3D体素空间
三个任务分支:
3D目标检测(DETR风格解码器)
语义占据预测(3D UNet)
BEV地图分割(UNet风格)
作用:作为显式3D信息探测接口,使模型的3D预测可检查、可评估
(2) 规划专家(上图3b所示)
架构:32层扩散Transformer(约11亿参数)
输入条件:VLM缓存的K/V、历史轨迹、导航指令、当前状态、规划推理文本
生成方式:流匹配(Flow Matching),预测50个未来路径点(5秒,10Hz)
轨迹表示:纵向位置(x)、横向位置(y)、航向角(θ),归一化后分别除以165m、25m、π/2
2. 四阶段训练流程(图4所示)


3. 数据策略
感知数据统一化(图5所示)

标签对齐:将nuScenes(17类)和OpenScene的标签映射到统一的7类空间(vehicle, bicycle, generic_object, pedestrian, traffic_cone, barrier, cone_sign)
空间对齐:保持各自原生占据网格(nuScenes: ±40m, 0.4m体素;OpenScene: ±50m, 0.5m体素),通过可微三线性采样进行空间映射
离线补全:使用辅助标注补全缺失类别(如从nuPlan矢量图生成可行驶区域标签)
VQA数据处理(图6所示)

整合24个公开驾驶VQA数据集(5.53M原始样本)
使用Qwen3.5-Plus重写格式,Qwen3.5-Flash做一致性过滤(保留率55.9%,最终3.09M)
自构建数据:规划推理(CoC轨迹,含因果链)、相机排序任务、室内感知QA
Stage 2混合:1.54M样本(9.7%感知 + 26.0%通用VQA + 64.3%驾驶VQA)
规划数据
4个来源:NAVSIM、OpenScene、WOD-E2E、PAI-AV(共约283万样本)
其中24.2%(68.5万)包含规划推理文本作为条件
4. 强化学习细节(Stage 4)
随机化策略:仅在流匹配最后3个Euler步骤(t=0.7,0.8,0.9)引入随机扰动
低频子空间:使用前6个余弦模态限制扰动为平滑轨迹变形(而非逐点抖动)
组相对优势:每组8个rollout,计算组内标准化优势
多源奖励:NAVSIM用PDMS,WOD-E2E用RFS,PAI-AV用位移误差,并加入共享的ADE项
三、实验结果与关键发现
1. 3D感知
nuScenes:mAP 43.95,NDS 42.83,地图mIoU 60.99
OpenScene:mAP 43.45,地图mIoU 71.27
关键观察:
头-仅训练(Head-only)性能有限(nuScenes mAP仅35.60),说明预训练特征不直接暴露3D结构
Stage 2联合微调后性能显著提升(mAP +10.46),说明需要让感知目标反向传播更新VLM
跨数据集迁移存在负迁移(nuScenes占据mIoU下降26.6%),源于标注管道差异
2. 驾驶VQA
在5个公开基准上平均69.43(相比Qwen3.5-4B的63.52提升5.91)
因果推理上优势显著:PAI-AV-CoC整体准确率41.26(第二佳仅5.73)
Ego3D距离估计:RMSE 7.78m(相对Qwen3.5-4B下降40.9%),得益于保留的物理尺度先验
3. 通用VQA保持
知识/推理/识别基准平均66.41(相比Qwen3.5-4B的67.40,损失<1点)
空间理解/接地基准平均53.96(甚至超过Qwen3.5-4B的52.99)
证明驾驶适应未导致灾难性遗忘,反而增强了空间相关能力
4. 运动规划

四、主要问题与局限
1. 规划推理质量不稳定(Limitations)
多时间尺度因果混淆:20m外的红灯需要早期渐减,而5m外的儿童需要立即响应,当两类原因共存时,模型难以识别主导原因及其时间范围
文本理据与轨迹不一致:生成的推理文本和实际执行轨迹之间缺乏显式一致性监督
2. 跨任务转移受限
三个任务(感知、VQA、规划)使用不同的输入格式、时间上下文和图像分辨率,可能限制表示学习的迁移
建议:更好对齐配置 + 更紧密的联合优化
3. 跨数据集感知负迁移
混合数据训练在nuScenes上占据mIoU下降26.6%
根因:OpenScene的机器生成标签含有特定语义和构造伪影,联合适应无法完全解决源歧义
4. 闭环评估的局限性
NAVSIM的PDMS接近上限时,改进可能更多反映对评分函数的过适应,而非真正的交互驾驶质量
AlpaSim上进度与安全的权衡:RL降低off-road率但进度从54%降至48%
5. 数据依赖与扩展性
视觉语言数据过滤率仅55.9%,大量数据因不一致被丢弃
感知数据统一化依赖繁琐的标签映射和离线补全,难以扩展至更多数据集
6. 未解决:跨相机配置的定量评估
论文仅展示了在WOD-E2E和PAI-AV未知相机配置上的定性结果(图13)
缺乏真实标注,无法建立可靠的跨配置3D精度评估
五、贡献总结
首个在保持预训练VLM架构不变的前提下,集成3D感知、VQA和运动规划的驾驶视觉-语言基础模型
提出BEV感知头作为3D探测接口,使隐式表征中的3D信息变得显式可检查
设计了四阶段训练配方 + 跨数据集标签统一策略,在获取驾驶能力的同时有效缓解灾难性遗忘
在开环、伪闭环、闭环三个递进层次的规划评估中均取得有竞争力的结果