1 背景
Waymo表示,他们开发了一个名为 Waymo 基础模型的大规模 AI 模型,该模型支持车辆感知周围环境、预测道路上其他车辆的行为、模拟场景并做出驾驶决策。
这个庞大模型的功能类似于 ChatGPT 等大型语言模型 (LLM),这些模型基于海量数据集进行训练,以学习模式并进行预测。
2 模型架构
Waymo 感知算法负责人吴晨(Wu Chen)女士在 2025 年 CVPR(计算机视觉与模式识别会议)上的演讲围绕自动驾驶感知技术的核心突破、现存挑战及未来方向展开,核心内容可总结为以下三大板块:
2.1 Waymo 基础模型与世界模型
吴晨女士重点介绍了 Waymo 研发的基础模型(Waymo Foundation Model) ,该模型是支撑自动驾驶全链路任务的核心框架,其设计思路与多模态大语言模型(如 ChatGPT)一脉相承,但针对自动驾驶场景做了深度优化:
- 多模态数据融合能力:模型可整合摄像头、雷达、激光雷达等多传感器数据,编码环境信息并内置世界知识,实现 "感知 - 预测 - 决策" 全流程任务统一处理。
- 模型蒸馏部署策略:采用 "教师 - 学生" 模型架构,云端训练的超大模型作为 "教师",将知识蒸馏到车端紧凑的 "学生" 模型中。车端模型优化了速度与效率,可实时运行感知、行为预测及路径规划任务;云端大模型则用于虚拟场景仿真,在实际部署前完成测试验证。
- 泛化与适配能力:通过统一的世界模型,Waymo 实现了对不同硬件平台的快速适配,同时凭借海量数据训练获得了强大的场景泛化能力,可应对多数日常驾驶场景。
- 模型架构:"教师 - 学生" 蒸馏机制
- 云端 "教师模型":基于海量数据集训练,整合摄像头、雷达、激光雷达等多模态传感器数据,具备环境感知、行为预测、场景模拟、决策规划等全链路能力,可在云端进行虚拟驾驶环境仿真,对决策算法进行预先测试与验证。
- 车端 "学生模型":通过模型蒸馏技术从 "教师模型" 中提炼而来,体积更小、速度更快,针对车端硬件优化,保留核心决策能力,可实时处理感知、行为预测与路径规划任务。
- 核心功能:"世界模型" 的编码与解码
- 编码层:融合所有传感器数据(摄像头图像、雷达点云、激光雷达数据),并内置真实世界的物理规则与交通常识(如道路标识含义、车辆运动规律)。
- 解码层:输出端支持两类任务,一是车端实时任务,包括物体感知、其他交通参与者的行为预测、车辆控制指令生成;二是云端仿真任务,通过模拟复杂驾驶场景(如极端天气、突发路况),提前验证算法安全性。
2.2长尾场景突破
吴晨女士指出,当前自动驾驶已解决多数常规场景问题,下一步核心挑战是长尾场景(如极端天气、低能见度、遮挡、复杂施工场景等),并分享了 Waymo 的技术探索方向:

- 极端天气应对:针对雨天水坑、洪水、雪地等场景,采用视觉语言模型(VLM)结合海量语料库提升环境判断精度;硬件层面通过传感器加热、清洁功能解决雪地遮挡问题,同时探索车辙识别、路面摩擦力估计等关键技术。
- 低能见度与遮挡推理:在沙尘暴、夜间等低能见度场景中,依赖多模态传感器协同(如激光雷达在尘暴中仍可清晰检测行人);针对 "鬼探头""加塞" 等遮挡场景,通过学习驾驶数据统计信息、挖掘微弱传感器线索估计遮挡区域物体状态,并优化自车速度控制策略以提升安全性。
- 复杂场景理解:对于施工区域、交通警官手势、事故现场等动态场景,需结合大语言模型进行场景语义理解,而非单纯识别单个物体。例如,施工场景中需推理锥筒排布的几何逻辑以调整路线,事故现场则需整体判断路况并规划最优绕行方案。
2.3 数据、决策效率与工程落地
吴晨女士结合 Waymo 的实践经验,提出了自动驾驶研发的三大核心优先级:
- 数据质量优于数量:强调 "高效高质数据" 是模型迭代的基础,Waymo 通过语言搜索、嵌入搜索、少样本学习等技术筛选关键数据,尤其注重挖掘碰撞、漂移等特殊事件的视频数据,确保模型聚焦核心问题。
- 决策链路效率决定安全性:自动驾驶的响应速度取决于 "传感器输入 - 算法运算 - 执行机构响应" 全链路帧率。当前摄像头(>24Hz)、底盘执行机构(如 ESP 刹车,百 Hz 级)已达标,算法处理帧率(如 10Hz/20Hz)成为瓶颈,Waymo 正通过模型优化进一步压缩算法延迟。
- 工程落地与运营支撑:提及 Waymo 的 Depots 运营停车场和改装工厂的重要性 ------ 车辆可自主完成充电、调度、生产线驶出等流程,为 L4 级自动驾驶的规模化运营提供硬件与流程支撑。同时她也坦言,工程落地是行业重要壁垒,需跨领域协同传统汽车工程师(如博世等企业背景人才)解决测试、生产、运营中的实操问题。
3 总结
Waymo 基础模型代表了自动驾驶技术路径的一次重要演进。其核心在于通过类似 LLM 的规模化训练方式,构建一个统一的世界模型,并借助"教师---学生"蒸馏架构解决车端算力与云端智能的矛盾。针对生存挑战,该方案以视觉语言模型补充稀疏语义,以多模态协同推理应对视觉退化,以数据质量筛选保障迭代效率。这种架构将感知与决策统一于一个模型语境之下,使车辆能够超越"看见并识别"的阶段,进入"理解并预判"的层面。
同时,吴晨的阐述也揭示了这一技术的局限性:长尾场景的复杂性意味着对安全性与泛化能力的提升依然是一个依赖数据与仿真双循环的渐进过程,其真正的壁垒不仅在于模型设计,更在于将庞大系统工程在真实世界中高效、安全地串联起来。


