ECCV 2026 · KAIST · 3D OBJECT DETECTION
在下雨或者下雪的情况下再加一台相机会更好一些吗?
相机应该在点云变稀的时候进行补充,但是也有可能把雨水、雪花遮挡看作新的噪音。RAF 的解决办法是:不要对整个图片同等对待,而是要为每一个像素估计出可信度。
01导读
在下雨下雪的时候,LiDAR 和 4D RADAR 的回波就会变得很稀少,相机本来应该来填补这些空缺的地方。但是镜头也会因为雨水、雪花或者雾气而变得模糊不清,在有的地方还出现了噪音。这时如果直接把相机的信息加到融合网络中去的话,并不会使情况变得更稳定,还会把错误的信息放大的问题出现。
KAIST 队伍所提出的方法叫做可靠性-aware融合(RAF),它给人们提供了一条简单明了的道路:首先对每个像素点进行可靠性的评估,然后根据这个结果来确定相机特征在三维检测中要起多大的作用。
在接入RAF之后,在3D-LRF上总体的AP_BEV由原来的64.5提升到了现在的71.0,而AP_3D也从之前的35.8提高到了现在的43.2,分别增加了6.5和7.4个百分点。
02核心信息
标题:RAF: Reliability-Aware Fusion of Camera, LiDAR, and 4D RADAR for Robust 3D Object Detection in Adverse Weather | 面向恶劣天气下鲁棒三维目标检测的相机、激光雷达与 4D 雷达可靠性感知融合
发表:ECCV 2026
作者:Heejun Park、Jaeseok Jeong、Kuk-Jin Yoon
单位:韩国科学技术院(KAIST)视觉智能实验室
论文:https://arxiv.org/abs/2607.04587
代码:https://github.com/parkie0517/RAF
简而言之就是:RAF 通过弱监督逐像素可靠性图来消除由于相机噪声明显降低而产生的雨雪遮挡问题,在此基础上再用CALM 来缓解跨模态投影时出现的标定误差。
03研究背景:"加相机"的地方为什么会变坏呢?
LiDAR擅长处理几何和距离的问题,但是距离越大,点云就越稀;4D雷达在恶劣天气下更加稳定,并且可以给出速度信息,但是也会由于反光不充分而导致没有目标回波。相机可以弥补稠密语义上的不足,但是一个不同的问题是:雾霾并不是均匀分布的。
一块雪花可以挡住画面的一半,一滴雨水可以把前面的车全部遮住,但是其他地方还是可以看到的。如果网络只学习一个完整的模态权重或者让置信图仅仅依靠检测损失去自我探索的话,那么它就很难得到明确的监督信号来判断哪些部分已经不再可信了。论文把这样的问题归结为相机可靠性的空间变化问题。


图1 RAF要解决的两个入口问题就是点云稀少和相机可靠性的不足。
04 RAF 做了以下三点事情
给可信赖度图直接的学习信号
由于论文中没有给出每一像素的真实可靠性值,所以先根据可视性把图像分成Clean、Mixed和Noisy三类,然后用Clean和Noisy进行跨模态对齐,并且得到的相似度作为稀疏伪标签来指导可靠性估测器的学习过程。
2、给标定误差留下一定的余地可以用CALM来表示
当体素被投射到图像平面上的时候,如果外参存在微小偏差的话,就会落在错误的位置上。CALM 会在附近的窗口中找到最接近的匹配,并且不会引入新的可学习参数,但是可以使得跨模态对应对于稍微投影偏移更加宽容。
3、保留预训练的LiDAR-Radar骨干
RAF 已经有了用 LiDAR-RADAR 作为基础的部分,并且只对新加入的相机部分进行训练,还包括了可靠性评估器、BEV 融合编码器和检测头等组件。虽然可以看作是一个可替换的模块,但是仍然存在一定的计算开销。
05方法深入研究:由相似度控制变为可靠性的门控

图2 RAF总体结构:可靠性估算、CALM以及门控整合。
第一部分就是求出跨模态相似度
RAF 将 LiDAR-RADAR 体素特征和相机特征投影到一个公共隐空间中,并利用归一化的余弦相似度计算出一个介于 0 和 1 之间的分数值。对于干净图像而言,期望该分数越接近于 1;而对于噪声图像,则期望该分数越接近于 0。
该步骤使可靠性的判断不再仅仅依靠对损失进行反向传播来推测,而会从不同模态的一致性中获得训练信息。

图3 可靠性估计算法弱监督学习过程。
第二步:在局部窗口中找到最好的匹配
对于第i个投影体素,在窗口集里取最大的相似度值,当窗口尺寸为1的时候就变成了普通的单像素匹配,本文默认采用的是5。
窗口不能太大也不能太小:如果增大到7的话就会把远处的像素当作对应的点了。最好的窗口大小是5,表示局部容错有效但是过大范围地搜寻会导致错误的相关性产生。
第三步就是用可靠性图来控制相机特征保留的比例
可靠性估计器用的是一个轻量级的CNN来产生每个像素点上的可靠度图R,在α=0的情况下所有的不可信像素都可以被抑制掉,在α=1的时候就相当于没有做门控了。论文中默认值为α=0.2。
默认情况下会保存一部分底层相机的信息来防止突然切换导致的数据丢失过多,在可靠的区域全部保留下来就是所谓的**"有选择性地信任相机"**。
第四步就是进行联合训练检测以及可靠性的分析
在训练的时候要进行跨模态投影、CALM以及稀疏监督,在推理的时候只需要相机分支来产生一个置信图,并不需要再执行CALM或者类似的相似性计算了。
06源码解析:仓库都已经对外公布了,那么我们先来看看哪些地方呢?
目前公开仓库中包含了models、pipelines、configs、datasets和tools等文件夹,同时也提供了main_train.py和main_eval.py这样的入口文件。对于安装的部分,则是按照K-Radar官方环境来进行的。
按照三条线路来读取:首先通过configs去验证L4DR或者3D-LRF的基础数据和数据通道;然后沿着main_train.py以及pipelines寻找出检测、相似度以及可靠性的损失三者结合的地方;最后到models中找到相机部分、可靠性估测器以及BEV融合的位置。
在复现的时候要重点检查训练和推理这两个分支:论文中提到,在推理阶段不需要CALM了,它的作用只是在训练期间产生更加准确的跨模态对应。
07实验验证:提高的原因是什么?
K-Radar 包括58 个序列、17458 个训练样本以及 17536 个测试样本,在论文中根据相机可视性被分成 21 个清晰、9 个噪声和 28 个混合序列,在 Sedan 类别下并且 IoU=0.5 的情况下给出 BEV 和 3D 的 AP 值。
论文也对VoD进行了评价,但是具体的数值被放到附加资料里去了,并没有提及。
证据二:LiDAR-RADAR 的主要负责人也从中获益

表1 K-Radar 测试集的主要结果。
3D-LRF接入RAF之后,AP_BEV由原来的64.5/35.8提升到了现在的71.0/43.2,增加了6.5分;AP_3D也从之前的77.5/53.5提高到了现在的82.0/57.4,并且获得了整个表格中最好的总分。结果表明RAF可以适用于两种不同的主要技术路线,但是得分最高的还是L4DR(RAF)。
第二条证据就是混合才是可靠性的主要阵地

表2 清晰、混合和噪声可见度条件下所得到的结果。
混合场景中既有可视又有不可视的部分,简单的关节或者冻结融合都会失分,但是 RAF 在两条主干上都比各自的 LiDAR-RADAR 基线要好很多。在全部都被遮住的嘈杂场景下,RAF 并不是凭空恢复了视觉效果,而是尽可能地回到没有用到摄像头的时候的状态。
第三种情况就是门控不进行监管的话,就会对性能造成损害

表3 门控、弱监督和CALM各部分的作用。
只用门控而让其仅仅依靠于对损失的判断来学习的时候,3D-LRF 的 AP_3D 由原来的 39.1 下降到现在的 33.1,降低了 6.0;加上了弱监督之后又回升到了 41.9,再加上 CALM 后达到了 43.2。监督信号和可靠的跨模态对应是缺一不可的。
08定性分析:红区是否处于被遮蔽的位置上?


图4 不同可见度条件下定量检测的结果。
Clean 类型的照片里,可靠性的图像几乎为纯白;Mixed 类型的照片里,雨雪污染的地方用红色表示出来,可以看到的部分仍然保持着较高的可靠性;Noisy 类型的照片全部变成红色。这可以形象地表明RAF学到的是一个局部开关而非全局开关,在不同位置上的可靠程度也各不相同。
CALM 的弱监督版本给 L4DR 带来了 1.8 AP_BEV、2.0 AP_3D 的提升效果,给 3D-LRF 带来了 0.5 和 1.3 的提升效果,这些改进来自于训练期间更加稳定的跨模态匹配,并且CALM 不会带来任何可学习的参数。
边界要说明的是,在噪声条件下,RAF 只是更加靠近了 LiDAR-RADAR 基线,并没有在完全看不见的情况下把信息给找回来。
09总结与展望
RAF 最可取之处在于它并没有把所有的信息都一股脑地塞进去,而是在确定了要相信的信息之后再进行分析。逐像素可靠性的地图可以用来判断某个地方是否有用的信息,而CALM 则防止小角度调整造成的偏差。
它也有明确的边界,在目前可靠性估算只考虑了相机、LiDAR 和 4D RADAR 本身的老化的情况下,加入相机分支会带来更多的参数和计算量。比如L4DR的基础是55.83M个参数、140.07GFLOPS、5.36FPS,而引入相机分支之后则变成了126.42M个参数、286.81GFLOPS、4.19FPS。虽然可靠性更好,并不代表没有工程成本。
接下来可以将相同的可靠性建模应用到LiDAR和RADAR上,并且使这三种传感器都能够根据天气、距离以及遮挡等因素来自动地判断出各自的可信程度,那么多模态才会由目前固定的拼接方式转变为针对场景的协同工作模式。
往期推荐



