从“识别已知”到“发现未知”:3D通用目标检测如何打开智驾感知新边界

在智能驾驶感知中,车辆、行人、交通标志等高频目标已有相对成熟的检测方案。但真正影响安全上限的,往往是那些低频、罕见、甚至从未出现在训练集中的"长尾障碍物":遗落在路面的纸箱、散落物、施工材料、路面坑洼,或远距离的小型异物。

这类目标给3D通用检测带来了多重挑战:首先,传统监督学习依赖预定义类别与大量标注,新类别的引入通常意味着重新采集数据、标注和训练;其次,小目标、远距离目标以及弱反射目标本就难以稳定感知;更关键的是,未知目标无法被穷举为一个固定类别清单。语义分割模型也可能将其视为背景,从而造成漏检。

一种新思路:不问"它是什么",而问"它是否偏离道路"

《Zero-shot 3D General Obstacle Detection via Multimodal Foundation Models and Geometry》提出了一条无需任务专用训练的路径:将通用障碍物理解为道路表面的异常或不连续区域,再结合多模态基础模型与时序LiDAR几何推理,输出可靠的3D包围框。

其价值在于改变了问题定义:不要求系统先认识"纸箱""碎石"或"异物"分别属于什么类别,而是先判断道路区域是否出现了不符合道路表面结构的部分。这样,感知系统便有机会覆盖训练数据之外的未知障碍物。

从二维候选到三维定位:论文方法如何落地

方法首先在图像侧建立道路区域先验:利用 Grounding DINO 以"road"为提示定位道路,再将结果输入SAM 获取更精细的道路掩码。道路掩码中出现的边界、中断或异常区域,会被视为潜在障碍候选;对于地平线附近仅局部可见的目标,方法还通过凸包后处理提升候选完整性。

随后,系统进入几何定位环节。它从每帧LiDAR点云中识别并去除地面点,对剩余点云聚类;再将候选跨帧匹配、跟踪和聚合,让同一目标在不同视角下的点云共同参与三维重建。聚合后的几何信息能显著降低单帧投影和稀疏回波带来的深度不确定性。

此外,论文还通过多帧道路点构建道路世界模型,以局部平面拟合和偏差分析寻找路面的凸起、坑洞等静态异常;最终融合已知类别检测、视觉障碍候选与道路几何异常,并在聚合点云上拟合3D包围框。

效果:更远、更全,也更适合自动标注

论文基于包含151段序列、约3.4万帧相机与LiDAR数据的自建数据集进行验证,人工标注距离覆盖至100米。结果显示,该方法可检测最远约100米的通用障碍物;引入基础模型生成的障碍掩码后,召回率在各评测设置下提升约10%至25%,同时保持相近精度。

对比仅依赖单帧投影点云的朴素方案,后者平均纵向定位误差达到1.57米;结合时序聚合与几何推理后,方法的纵向、横向误差分别低于0.65米和0.57米。

当然,该路线也提示了行业现实:可靠3D定位仍高度依赖LiDAR可见性。对于被遮挡或缺少有效LiDAR回波的障碍物,三维重建能力会受限,相关场景被纳入统计后召回率约下降5%至10%。

从论文启示到仿真:让长尾验证可构建、可复现

真实道路上的长尾场景难采、难复现、难穷尽,而感知算法又必须在多传感器、多环境和多扰动条件下持续验证。

康谋 aiSim 作为全球首个通过 ISO 26262 ASIL-D认证的仿真工具,可灵活组建智能驾驶测试所需的传感器组合,并对相机、激光雷达、毫米波雷达、GPS-WGS84、IMU等进行高保真仿真。用户可配置晴、雨、雪、雾、昼夜等环境条件,结合地图、场景、车辆模型,构造面向通用障碍物检测的可控测试闭环。

对于论文所体现的"视觉先验+LiDAR几何"融合路线,aiSim能够帮助开发者系统化测试:当目标尺寸缩小、距离拉远、遮挡增强、光照变化或LiDAR回波减弱时,算法的候选生成、点云聚合和三维定位究竟会如何退化;又该如何优化传感器配置与感知策略。

同时,aiSim可由确定性引擎原生输出 2D/3D Bounding Box、Segmentation 与 Lane真值,为目标检测、分割等算法训练和测试提供准确、可追溯的验证依据。相较于仅依靠现实数据回归问题,仿真能够让关键变量被独立控制,让长尾风险被重复构造,让算法迭代更高效。

结语

通用3D障碍物检测的未来,不只是提升对已知类别的识别精度,更在于建立面对未知风险时的感知能力。该论文通过基础模型、道路异常先验和时序几何推理,为"无需专门训练也能发现未知障碍物"提供了可行方向。

而以aiSim为代表的高保真仿真平台,则可将这类前沿方法放入可控、可复现、可量化的测试体系中。让未知不再只能等待真实道路偶然出现,而是成为可以主动构建、充分验证和持续优化的智能驾驶能力。

相关推荐
俊哥V20 分钟前
每日 AI 研究简报 · 2026-08-28
人工智能·ai
点PY22 分钟前
《一种超分辨率重建方法和相关装置》专利解析
人工智能·计算机视觉·超分辨率重建
Luke Ewin23 分钟前
Qwen3-ASR藏语语音识别 | 少数民族(藏语|维吾尔语)语音识别 | 本地化部署藏语语音识别模型
人工智能·语音识别·asr·藏语asr
byte轻骑兵24 分钟前
【BlueZ 】蓝牙配对/绑定基础:BlueZ 中安全机制的入门级源码解析
linux·人工智能·bluez·电脑蓝牙·嵌入式蓝牙
飞哥数智坊24 分钟前
当下 Agent 缺少的,也许是读懂产物的能力
人工智能
新知图书25 分钟前
14.1 多模态试驾预约Agent系统概述
人工智能·agent·ai agent·智能体
哦哦~92128 分钟前
AI赋能CFD:从Fluent仿真到物理信息机器学习的智能流体工程实战
人工智能·机器学习·cfd·fluent
QH1392923188029 分钟前
R&S FSPN50 FSPN26 FSWP26 相位噪声分析仪典型应用案例
人工智能·百度·微信·集成测试·音视频·facebook·oneapi
用户52746756142131 分钟前
给 Agent 一份 package-lock:别让 Skill、MCP 和权限各自漂移
人工智能