
BEV感知:将多视角2D图像统一到3D鸟瞰空间,是高阶智驾的感知基石
最近有个车企客户有个做仅根据激光和毫米波雷达识别不同距离的动物并且分类,应用场景为露营场景的需求,刚好梳理下在3D检测这方面的内容。本文主要从智驾的角度来看待这个问题。
当我们坐在搭载高阶智驾系统的车辆中,车辆不仅能识别前方车辆、路边行人,还能感知左后方超车的车辆、右后方盲区的骑行者,甚至能预判周围车辆的行驶轨迹------这种360度全方位的环境感知能力,背后最核心的感知框架之一,就是BEV ( Bird's-Eye View ,鸟瞰图)感知。
在传统的2D图像感知范式中,每个摄像头各自检测各自视野内的目标,输出的是分散在不同图像坐标系下的2D检测框,需要后续通过后处理融合、坐标转换才能统一到车辆坐标系。而BEV感知直接在统一的鸟瞰图空间中完成目标检测、语义分割、车道线识别等所有感知任务,输出的就是车辆坐标系下的3D感知结果,天然适配后续的规划控制模块。
本文从BEV感知的核心意义与行业挑战出发,全面拆解BEV感知的三大主流技术路线------纯视觉BEV、激光雷达BEV、多模态BEV融合,帮你建立完整的技术认知体系。
**一、**BEV 感知的核心意义与行业挑战
1.1****什么是 BEV 感知
BEV(Bird's-Eye View)即鸟瞰图视角,是一种从正上方俯视地面的二维坐标系。在自动驾驶场景中,BEV空间通常以车辆后轴中心为原点,X轴指向车辆正前方,Y轴指向车辆左侧,覆盖车辆周围一定范围(通常前后各50-100米、左右各50米)的3D空间。
BEV感知的核心思想是:将所有传感器(多相机、激光雷达、毫米波雷达)的数据,统一变换到同一个 BEV 空间中,在这个统一的 2D **特征平面上完成目标检测、语义分割、车道线识别、可行驶区域分割等所有感知任务。**输出的感知结果直接在车辆坐标系下,无需额外的坐标转换和后处理融合。
1.2****为什么 BEV 感知成为行业主流
BEV感知之所以在短短几年内成为高阶智驾的标配感知框架,核心原因有三点:
- 统一多传感器的空间基准:传统感知范式中,每个摄像头输出各自的2D检测结果,不同相机的视野重叠区域会出现重复检测,需要复杂的NMS后处理和跨相机融合。BEV感知将所有相机的特征统一到同一个BEV平面,天然解决了多相机目标的统一检测问题,避免了重复检测和后处理融合的精度损失。
- 天然适配规划控制模块:自动驾驶的规划控制模块工作在车辆坐标系下,需要的是车辆周围3D空间中的障碍物位置、尺寸、朝向和速度。传统2D感知输出的2D检测框需要通过深度估计、坐标转换才能得到3D信息,转换过程中的误差会直接影响规划决策。BEV感知直接输出车辆坐标系下的3D检测结果,感知和规划之间的接口更简洁、更精准。
- 实现感知 - 决策 - 规划的端到端优化:BEV空间是连接感知和规划的桥梁。在BEV空间中,感知特征可以直接输入到预测和规划模块,实现从传感器输入到规划输出的端到端优化。特斯拉FSD的端到端方案、国内车企的BEV+Occupancy+规划端到端方案,都是以BEV空间为基础框架。
1.3 BEV****感知的核心挑战
BEV感知的优势很明显,但实现起来也面临三个核心挑战:
- 视图变换( View Transform )是核心难点:对于纯视觉BEV路线,最大的挑战是如何将2D图像特征准确地变换到3D BEV空间。2D图像丢失了深度信息,从2D到3D的变换本质上是一个深度估计问题,深度估计的精度直接决定BEV特征的质量。这也是纯视觉BEV路线中各种视图变换方法(LSS、Transformer交叉注意力、3D位置编码查询)竞争的核心。
- 多帧时序融合提升感知性能:单帧BEV特征只包含当前时刻的空间信息,缺乏时序维度的运动信息。而自动驾驶感知需要判断目标的运动状态(速度、加速度、行驶方向),需要多帧时序融合来提升检测精度、减少漏检误检。如何高效地融合历史BEV特征,是BEV感知的第二个核心挑战。
- 计算量与实时性的平衡:BEV特征图的分辨率通常为200×200或更大,覆盖车辆周围100米×100米的范围。高分辨率BEV特征图的计算量很大,尤其是纯视觉路线中,多相机特征到BEV的变换计算量更大。如何在车载有限算力下实现实时推理(通常要求10-20fps),是BEV感知落地的第三个核心挑战。
二、获取****BEV 特征的三条核心技术路线
针对BEV感知的核心挑战,行业内形成了三条成熟、边界清晰的技术路线,分别是纯视觉 BEV 路线 、激光雷达 BEV 路线 、多模态 BEV 融合路线。三条路线各有优劣,分别适配不同成本、不同等级的智驾方案,也是目前行业内所有落地方案的技术底座。

BEV感知三大技术路线:纯视觉、激光雷达、多模态融合,各有适配场景
2.1****纯视觉 BEV 路线:仅用相机实现 3D 鸟瞰感知
核心原理
这条路线完全不依赖激光雷达等3D传感器,仅用车载多相机(通常6-12个,覆盖360度视野)采集的2D图像,通过视图变换(View Transform)算法将2D图像特征转换到统一的3D BEV空间,在BEV特征上完成3D目标检测、语义分割等感知任务。其核心要解决的问题,就是如何从丢失了深度维度的2D图像中,恢复出准确的3D BEV特征。
根据视图变换方法的不同,纯视觉BEV路线主要分为三大技术分支:
**分支一:基于深度估计的方法(**LSS 范式)
核心思路是显式估计每个像素的深度分布,将2D像素"提升"(Lift)到3D空间,再"投射"(Splat)到BEV平面。代表算法是BEVDet (2021),纯视觉BEV检测的开山之作,采用LSS(Lift-Splat-Shoot)视图变换,首次实现了端到端的纯视觉BEV 3D检测。后续的BEVDet4D (2022)引入多帧时序融合,通过4D信息提升检测精度;BEVDepth(2022)引入深度监督,进一步提升视图变换的精度。
分支二:基于****Transformer 交叉注意力的方法
核心思路是不做显式深度估计,而是用BEV查询(Query)通过空间交叉注意力(Spatial Cross-Attention)在多相机2D特征图中自适应采样,将2D特征"聚合"到BEV空间。代表算法是BEVFormer(2022),纯视觉BEV的里程碑算法,引入可变形注意力实现高效的空间交叉注意力,同时引入时序自注意力(Temporal Self-Attention)融合历史BEV特征,在nuScenes数据集上取得了SOTA级精度,成为后续大量算法的基础框架。
分支三:基于****3D 位置编码查询的方法
核心思路是将3D空间位置编码注入检测查询(Query),让查询直接在3D空间中定位目标,不需要显式的BEV特征图,避免了视图变换的精度损失。代表算法是PETR (2022),首次提出3D位置编码查询,实现了无显式BEV特征的3D检测;StreamPETR (2023)引入流式时序建模,进一步提升了检测精度和推理效率;SparseBEV(2023)采用稀疏BEV查询,大幅降低了计算量,实现了高效的纯视觉BEV检测。

纯视觉BEV的核心:2D图像特征到3D BEV特征的视图变换,三条技术路径各有优劣
核心优缺点与落地应用
✅ 核心优势:
- 硬件成本极低,摄像头是车载标配传感器,无需额外增加硬件成本,是成本敏感车型的唯一选择;
- 图像包含丰富的纹理与语义信息,类别区分能力强,能精准识别交通标志、信号灯、不同类型物体;
- BEV空间统一了多相机特征,避免了跨相机后处理融合的精度损失;
- 数据获取成本低,海量车载图像数据可用于模型训练,迭代速度快。
❌ 核心劣势:
- 视图变换的精度依赖深度估计,纯视觉方案无物理深度约束,远距离深度估计精度差,导致远距离BEV特征质量下降;
- 对光照、天气极其敏感,夜晚、逆光、雨天等场景下,图像质量大幅下降,BEV特征质量严重受损;
- 计算量大,多相机特征到BEV的变换计算复杂度高,对车载芯片算力要求高;
- 对无纹理、低纹理障碍物检测能力弱,易漏检地面小障碍物、水泥墩等物体。
落地场景 :纯视觉BEV路线的代表是特斯拉 FSD,通过多相机BEV+Transformer+大模型+占用网络,实现了不依赖激光雷达的高阶智驾。国内10万级家用车搭载的入门级L2+智驾方案,也广泛采用纯视觉BEV感知,通过单目/多相机BEV实现ACC、AEB、车道保持等基础功能,成本优势显著。
2.2****激光雷达 BEV 路线:点云天然 3D ,直接体素化到 BEV
核心原理
这条路线直接通过激光雷达获取真实物理世界的3D点云数据,每个点都包含精准的3D坐标(x,y,z)、反射强度等信息。与纯视觉路线需要做复杂的2D→3D视图变换不同,激光雷达点云天然就是3D数据,只需要将无序点云通过体素化(Voxelization)或柱化(Pillarization)转换为规则的BEV特征图,再用2D卷积神经网络完成特征提取与3D框回归。视图变换的难度大大降低,核心挑战在于点云的稀疏性处理和计算效率优化。
根据点云表示方式的不同,激光雷达BEV路线主要分为两大技术分支:
分支一:基于柱化的方法(车载落地最广)
核心思路是将3D点云在垂直方向上压缩,将每个垂直柱(Pillar)内的点云提取特征,转换为2D BEV特征图,用2D卷积替代3D卷积,大幅提升推理速度。代表算法是PointPillars (2019),车载落地最广泛的点云检测算法,将点云柱化后用2D卷积检测,速度极快,是目前量产车激光雷达感知的标配算法。后续的PillarNet(2023)进一步优化了柱化特征提取,提升了检测精度。
分支二:基于体素化的方法(学术精度更高)
核心思路是将3D点云划分为规则的3D体素(Voxel),对每个体素内的点云提取特征,用3D稀疏卷积完成特征提取,再将3D特征压缩到2D BEV空间完成检测。相比柱化方法,体素化保留了更多垂直方向的几何信息,检测精度更高,但计算量更大。代表算法包括引入稀疏卷积实现实时推理的SECOND (2018);摒弃anchor设计、采用中心热图方案的CenterPoint (2020),目前激光雷达BEV检测的主流算法;引入Transformer检测头的CenterFormer(2022),进一步提升了检测精度。
核心优缺点与落地应用
✅ 核心优势:
- 点云天然3D,无需复杂的视图变换,深度信息精准,无尺度歧义,测距精度远高于视觉方案;
- 对光照不敏感,夜晚、逆光场景下性能无明显衰减,全天候工作能力强;
- BEV特征质量高,点云几何信息丰富,对车辆、行人等目标的尺寸、朝向估计精准;
- 计算量相对可控,柱化方法用2D卷积,推理速度快,适合车载实时部署。
❌ 核心劣势:
- 硬件成本高,激光雷达是高阶智驾方案成本居高不下的核心原因之一;
- 缺乏纹理与语义信息,类别区分能力弱,难以区分外观相似但类别不同的物体(如轿车与SUV、行人与骑行者);
- 点云稀疏性问题,远距离物体点云数量极少,检测精度大幅下降;
- 大雨、大雾等恶劣天气下,点云会出现散射,有效点云数量锐减。
落地场景:激光雷达BEV路线是所有搭载激光雷达的智驾方案的核心感知技术。目前国内蔚来NAD、小鹏XNGP、理想AD Max、华为ADS等主流高阶智驾系统,均以激光雷达BEV检测为核心感知方案,搭配视觉BEV做语义补充与冗余。PointPillars和CenterPoint是量产车中落地最广泛的激光雷达BEV检测算法。
2.3****多模态 BEV 融合路线:图像与点云在 BEV 空间深度融合
核心原理
这条路线结合了前两条路线的核心优势,将摄像头采集的图像数据与激光雷达采集的点云数据分别转换到统一的BEV空间,在BEV空间中进行深度融合。利用图像丰富的语义纹理信息,弥补点云语义不足的缺陷;利用点云精准的3D几何信息,弥补图像深度不准的缺陷,实现"1+1>2"的效果,是目前精度和鲁棒性最高的BEV感知路线。
根据融合的阶段不同,行业内将多模态BEV融合分为三大范式,其中中期特征级融合是目前的主流,精度最高。
范式一:早期融合(数据级融合)
核心思路是在数据输入模型之前,就完成图像与点云的融合。常见做法是将激光雷达3D点云通过相机内外参投影到2D图像上,给每个点云赋予对应像素的RGB、语义分割等图像特征,生成带语义信息的增强点云,再送入点云BEV检测网络。代表算法有早期融合经典方案MV3D 、AVOD。
✅ 融合逻辑简单,计算量小,易于实现和部署;❌ 对传感器空间标定和时间同步要求极高,微小的标定误差就会导致点云与图像错位,融合效果大幅下降;异构数据在数据层面难以实现深度互补,精度提升有限。
范式二:中期融合(特征级融合,当前主流)
核心思路是图像分支和点云分支分别提取BEV特征,在BEV空间的中间层完成跨模态的特征融合,将图像的语义特征与点云的几何特征进行深度互补,再基于融合后的BEV特征完成3D检测。这是目前行业内的主流方案,也是精度最高的融合范式。
主流代表算法:
- TransFusion(2022):引入Transformer实现跨模态融合,采用软关联方式,用激光雷达的query在图像特征中自适应采样,解决了标定误差导致的融合错位问题,对标定误差的容忍度极高,同时实现了SOTA级检测精度;
- BEVFusion(2022,MIT版与商汤版):目前车载落地最火的多模态融合算法,将图像分支生成的BEV特征与激光雷达分支生成的BEV特征,在统一的BEV空间中进行深度融合,彻底解决了不同模态的空间对齐问题,实现了端到端优化,同时兼顾速度与精度,是国内主流车企高阶智驾方案的首选融合框架;
- DeepInteraction(2022):通过深度交互模块实现图像与点云特征的双向交互融合,进一步提升了融合精度;
- UniTR(2023):统一Transformer框架,将图像和点云在同一个Transformer中进行统一编码和融合,实现了更高效的多模态融合。
✅ 能充分挖掘两种模态的互补信息,融合效果最好,检测精度最高;对传感器标定误差的容忍度远高于早期融合,鲁棒性更强;能同时利用图像语义与点云几何信息,解决单模态固有缺陷,恶劣环境下的表现远优于单模态方案;❌ 模型结构更复杂,计算量更大,对车载芯片算力要求更高;开发与优化难度大,需要同时优化两个模态的特征提取与融合分支,部署门槛高。
范式三:晚期融合(决策级融合)
核心思路是图像分支和点云分支分别独立完成BEV空间下的3D目标检测,输出各自的3D检测框,在最终决策层面对两个分支的检测结果进行融合,通过非极大值抑制(NMS)、加权融合等方式,合并重复检测框,优化最终结果。
✅ 模块化程度极高,两个分支可独立开发、优化、升级,开发门槛低;对传感器标定与同步要求最低,单传感器失效时,另一模态仍能正常工作,功能安全冗余性最好;❌ 仅在结果层面融合,无法利用两种模态的互补特征,精度提升非常有限;无法解决单模态的固有缺陷。
多模态融合路线整体优缺点与落地应用
✅ 核心优势:精度与鲁棒性是三条路线中最高的,同时兼顾图像的语义优势与点云的几何优势,能互补单模态的固有缺陷;全天候、全场景工作能力最强,夜晚、逆光场景靠激光雷达保证性能,低纹理、长尾场景靠图像补充语义,恶劣天气下两种模态互相冗余,大幅降低漏检、误检率;功能安全冗余性好,满足高阶自动驾驶的功能安全要求。
❌ 核心劣势:硬件成本最高,需要同时配备激光雷达与多摄像头;传感器标定与时间同步难度大,需要精准的空间标定与硬件级时间同步;模型计算量大,对车载芯片算力要求极高,开发、优化与部署门槛远高于单模态方案。
落地场景:多模态BEV融合路线是目前L2+及以上高阶智驾方案的首选。国内小鹏XNGP、蔚来NAD、理想AD Max、华为ADS 2.0等主流高阶智驾系统,均采用了BEV空间下的多模态融合感知方案,平衡了检测精度、鲁棒性与功能安全,是行业内公认的最优落地路线。
三、路线对比与行业发展趋势
3.1****三大技术路线核心对比
|------------|------------|------------------------------|-----------------------------|-------------------------------|
| 技术路线 | 核心硬件 | 核心优势 | 核心劣势 | 适配场景 |
| 纯视觉BEV路线 | 多相机(6-12个) | 成本极低、语义信息丰富、数据迭代快、BEV空间统一多相机 | 深度估计精度差、光照天气敏感、计算量大、无纹理目标漏检 | 入门级L2+智驾、成本敏感车型、特斯拉FSD方案 |
| 激光雷达BEV路线 | 激光雷达+相机 | 深度精度高、光照不敏感、几何信息丰富、柱化方法速度快 | 硬件成本高、语义信息弱、远距离点云稀疏、恶劣天气散射 | 高阶智驾、高速场景、全天候场景、所有搭载激光雷达的方案 |
| 多模态BEV融合路线 | 激光雷达+多相机 | 精度最高、鲁棒性最强、冗余性好、全场景全天候能力最强 | 成本最高、算力要求高、开发难度大、标定同步要求高 | L2+及以上高阶智驾、全场景自动驾驶、国内主流车企高阶方案 |
3.2****行业未来发展趋势
- BEV 空间下的端到端感知 - 预测 - 规划成为绝对主流:BEV空间不仅是感知的统一空间,更是连接感知、预测、规划的桥梁。目前行业已全面转向BEV空间下的端到端方案,将感知特征直接输入到预测和规划模块,实现从传感器输入到规划输出的端到端优化。特斯拉FSD V12、华为ADS 3.0、小鹏XNGP等方案均已采用端到端架构,BEV空间是其基础框架。
- 占用网络( Occupancy Network )替代传统 3D 框检测:传统BEV感知只能识别预定义类别的物体(车辆、行人、骑行者等),无法处理长尾场景的异形障碍物(散落货物、施工路障、异形车辆等)。占用网络能预测BEV空间中每个体素的占用概率和语义类别,识别任意形状的障碍物,彻底解决长尾漏检问题。目前特斯拉、华为、小鹏、理想等企业已开始大规模落地占用网络,BEV+Occupancy成为高阶智驾的标配感知方案。
- 多模态融合的轻量化与端到端优化:随着车载芯片算力的提升(英伟达Orin/Thor、华为MDC、地平线征程6等),多模态BEV融合方案正朝着端到端方向发展,同时通过模型压缩、量化、稀疏卷积、动态BEV分辨率等技术实现轻量化,降低算力要求,让多模态融合方案能下放到更多车型。
- 4D 毫米波雷达成为 BEV 感知的重要补充:4D毫米波雷达能输出带高度信息的点云,成本远低于激光雷达,恶劣天气下的性能优于激光雷达,正在成为纯雷达路线和多模态融合路线的重要补充。未来将形成"激光雷达+4D毫米波+摄像头"的多传感器BEV融合方案,进一步提升感知的鲁棒性和冗余性。
- 大模型与 BEV 感知深度结合:视觉大模型、3D大模型正在被引入BEV感知中,通过海量数据预训练,提升模型的泛化能力和长尾场景检测能力。同时,基于大模型的端到端感知-决策方案正在成为研究热点,BEV空间作为大模型的3D世界表示,将发挥越来越重要的作用。
入门学习建议
如果你是刚入门智驾BEV感知的新手,这里有几条实用的学习建议:
- 打好基础:先掌握2D目标检测的核心原理(FCOS、Faster R-CNN等),再学习相机几何、透视投影、多视图几何、3D点云处理等基础知识,这是理解BEV感知中视图变换的核心;
- 从经典算法入手:先学习BEVDet、BEVFormer、PointPillars、BEVFusion等经典、易复现的算法,理解每条技术路线的核心逻辑和视图变换方法,不要一开始就啃复杂的SOTA算法;
- 动手实践:基于MMDetection3D、BEVDet、OpenPCDet等开源框架,跑通nuScenes、Waymo等开源数据集,动手修改视图变换模块、调参、可视化BEV特征,实践是最好的学习方式;
- 关注行业落地:BEV感知是强落地的技术,不要只关注学术SOTA,多关注车企、Tier1的落地方案(特斯拉FSD、华为ADS、小鹏XNGP等),理解车规级场景对实时性、鲁棒性、功能安全的要求,以及BEV+Occupancy+端到端的行业趋势。
BEV感知是自动驾驶环境感知的核心框架,也是智驾行业从2D感知向3D感知、从单传感器向多传感器融合、从模块化向端到端演进的关键技术。三条技术路线没有绝对的优劣,只有适配不同的场景和成本需求。随着技术的不断发展,BEV感知会朝着更高精度、更强鲁棒性、更低成本、更端到端的方向持续演进,为高阶自动驾驶的大规模落地奠定坚实的感知基础。