Qwen-Drive-1.0:迈向自动驾驶视觉-语言基础模型的第一步

26年8月来自阿里千问团队和华中科技的论文"Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving"。

这是一篇关于自动驾驶视觉语言-基础模型的论文,提出Qwen-Drive-1.0,一个统一的视觉-语言模型,集成3D感知、VQA和运动规划。现有VLM通过VQA适应驾驶任务时,无法显式约束3D布局,且容易灾难性遗忘通用知识。其介绍模型架构(共享VLM+外部BEV感知头+规划专家)、四阶段训练策略和数据配方法。实验部分展示了在多个基准上的性能结果。

如图1所示Qwen-Drive-1.0 在驾驶 VQA、通用 VQA、3D 感知和运动规划方面的性能概述。

真正的驾驶基础模型应满足三个要求:保持VLM架构不变、显式感知探测、保留通用能力。其核心是外部BEV头和分阶段训练。存在的问题:规划推理不够稳定、轨迹与文本理据未完全对齐、跨任务迁移受限等。


一、核心观点

1. 统一的驾驶基础模型愿景

论文提出建立一个视觉-语言基础模型,将3D感知、视觉问答(VQA)和运动规划统一在单一框架中。其核心主张是:真正的自动驾驶基础模型应同时满足三个设计需求:

保持预训练VLM架构不变(便于使用和部署)

引入显式3D感知探测(而非仅依赖文本空间推理)

保留通用视觉语言能力(支持OOD泛化和舱驾一体部署)

2. 现有方法的两个关键局限

文本监督不直接约束3D:VQA目标只通过语言监督引入驾驶知识,不要求模型进行显式的3D预测(深度、占据、布局等),导致模型在3D空间上不精确。

灾难性遗忘问题:在驾驶数据上过度微调会导致遗忘预训练获得的通用知识,而真实世界的稀有和分布外场景恰恰依赖这些知识。

3. 舱驾一体的工程价值

论文强调保留通用能力不仅是学术需求,更是工程部署要求------智能座舱和驾驶系统共享单一计算平台,一个模型需同时服务两个领域。


二、主要方法

1. 模型架构(图2所示)

Qwen-Drive-1.0基于Qwen3.5-4B,在保持原架构不变的基础上外挂两个模块:

(1) BEV感知头(图3a所示)

输入:多视角图像(6或8个相机)+ 相机标定参数

特征融合:同时利用视觉编码器特征(Fv,低层外观)和VLM输出特征(Fm,语义上下文)

视图变换:基于深度分布的Lift-Splat方法,将图像特征提升到3D体素空间

三个任务分支:

3D目标检测(DETR风格解码器)

语义占据预测(3D UNet)

BEV地图分割(UNet风格)

作用:作为显式3D信息探测接口,使模型的3D预测可检查、可评估

(2) 规划专家(上图3b所示)

架构:32层扩散Transformer(约11亿参数)

输入条件:VLM缓存的K/V、历史轨迹、导航指令、当前状态、规划推理文本

生成方式:流匹配(Flow Matching),预测50个未来路径点(5秒,10Hz)

轨迹表示:纵向位置(x)、横向位置(y)、航向角(θ),归一化后分别除以165m、25m、π/2

2. 四阶段训练流程(图4所示)

3. 数据策略

感知数据统一化(图5所示)

标签对齐:将nuScenes(17类)和OpenScene的标签映射到统一的7类空间(vehicle, bicycle, generic_object, pedestrian, traffic_cone, barrier, cone_sign)

空间对齐:保持各自原生占据网格(nuScenes: ±40m, 0.4m体素;OpenScene: ±50m, 0.5m体素),通过可微三线性采样进行空间映射

离线补全:使用辅助标注补全缺失类别(如从nuPlan矢量图生成可行驶区域标签)

VQA数据处理(图6所示)

整合24个公开驾驶VQA数据集(5.53M原始样本)

使用Qwen3.5-Plus重写格式,Qwen3.5-Flash做一致性过滤(保留率55.9%,最终3.09M)

自构建数据:规划推理(CoC轨迹,含因果链)、相机排序任务、室内感知QA

Stage 2混合:1.54M样本(9.7%感知 + 26.0%通用VQA + 64.3%驾驶VQA)

规划数据

4个来源:NAVSIM、OpenScene、WOD-E2E、PAI-AV(共约283万样本)

其中24.2%(68.5万)包含规划推理文本作为条件

4. 强化学习细节(Stage 4)

随机化策略:仅在流匹配最后3个Euler步骤(t=0.7,0.8,0.9)引入随机扰动

低频子空间:使用前6个余弦模态限制扰动为平滑轨迹变形(而非逐点抖动)

组相对优势:每组8个rollout,计算组内标准化优势

多源奖励:NAVSIM用PDMS,WOD-E2E用RFS,PAI-AV用位移误差,并加入共享的ADE项


三、实验结果与关键发现

1. 3D感知

nuScenes:mAP 43.95,NDS 42.83,地图mIoU 60.99

OpenScene:mAP 43.45,地图mIoU 71.27

关键观察:

头-仅训练(Head-only)性能有限(nuScenes mAP仅35.60),说明预训练特征不直接暴露3D结构

Stage 2联合微调后性能显著提升(mAP +10.46),说明需要让感知目标反向传播更新VLM

跨数据集迁移存在负迁移(nuScenes占据mIoU下降26.6%),源于标注管道差异

2. 驾驶VQA

在5个公开基准上平均69.43(相比Qwen3.5-4B的63.52提升5.91)

因果推理上优势显著:PAI-AV-CoC整体准确率41.26(第二佳仅5.73)

Ego3D距离估计:RMSE 7.78m(相对Qwen3.5-4B下降40.9%),得益于保留的物理尺度先验

3. 通用VQA保持

知识/推理/识别基准平均66.41(相比Qwen3.5-4B的67.40,损失<1点)

空间理解/接地基准平均53.96(甚至超过Qwen3.5-4B的52.99)

证明驾驶适应未导致灾难性遗忘,反而增强了空间相关能力

4. 运动规划


四、主要问题与局限

1. 规划推理质量不稳定(Limitations)

多时间尺度因果混淆:20m外的红灯需要早期渐减,而5m外的儿童需要立即响应,当两类原因共存时,模型难以识别主导原因及其时间范围

文本理据与轨迹不一致:生成的推理文本和实际执行轨迹之间缺乏显式一致性监督

2. 跨任务转移受限

三个任务(感知、VQA、规划)使用不同的输入格式、时间上下文和图像分辨率,可能限制表示学习的迁移

建议:更好对齐配置 + 更紧密的联合优化

3. 跨数据集感知负迁移

混合数据训练在nuScenes上占据mIoU下降26.6%

根因:OpenScene的机器生成标签含有特定语义和构造伪影,联合适应无法完全解决源歧义

4. 闭环评估的局限性

NAVSIM的PDMS接近上限时,改进可能更多反映对评分函数的过适应,而非真正的交互驾驶质量

AlpaSim上进度与安全的权衡:RL降低off-road率但进度从54%降至48%

5. 数据依赖与扩展性

视觉语言数据过滤率仅55.9%,大量数据因不一致被丢弃

感知数据统一化依赖繁琐的标签映射和离线补全,难以扩展至更多数据集

6. 未解决:跨相机配置的定量评估

论文仅展示了在WOD-E2E和PAI-AV未知相机配置上的定性结果(图13)

缺乏真实标注,无法建立可靠的跨配置3D精度评估


五、贡献总结

首个在保持预训练VLM架构不变的前提下,集成3D感知、VQA和运动规划的驾驶视觉-语言基础模型

提出BEV感知头作为3D探测接口,使隐式表征中的3D信息变得显式可检查

设计了四阶段训练配方 + 跨数据集标签统一策略,在获取驾驶能力的同时有效缓解灾难性遗忘

在开环、伪闭环、闭环三个递进层次的规划评估中均取得有竞争力的结果

相关推荐
Omics Pro1 小时前
澳科大:自进化AI虚拟细胞
数据库·人工智能·算法·机器学习·自然语言处理
2601_967659881 小时前
GEO 优化哪家好推荐即搜 ai:2026 企业 AI 搜索获客服务商深度测评
大数据·人工智能
Ares-Wang1 小时前
WPF StaticResource x:static
人工智能
Z_W_H_1 小时前
GLEAM
人工智能
筝筝ba1 小时前
1987 NDX收盘价格复盘
人工智能·科技·ai·gpu算力
hhzz1 小时前
【OpenCV 入门到精通 05】核心操作与像素处理:ROI、运算与性能优化
人工智能·python·opencv·性能优化
这张生成的图像能检测吗1 小时前
(论文速读)基于两阶段多模式深度学习的轮胎表面缺陷自动检测及严重程度分类系统
人工智能·深度学习·计算机视觉·数据采集·检测系统·缺陷检测分类·轮胎缺陷
IT_陈寒1 小时前
为什么我的Java Stream操作总是默默吃掉异常?
前端·人工智能·后端
一木 之林1 小时前
李沐《动手学深度学习》知识卡合集:从 Softmax 回归到房价实战(第24-50集)
开发语言·c++·人工智能