UECP:不确定性增强的协同感知 | 基于物理先验的BEV融合新范式
论文信息
标题:UECP: Uncertainty-Enhanced Collaborative Perception
会议:arXiv 2026 预印本
单位:中国人民大学、国防科技大学、中国水运科学研究院
代码:即将公开
论文:https://arxiv.org/pdf/2606.23046
一、背景与核心痛点:置信度图的「自卖自夸」困境
如果你开过车就知道,路口被大货车挡着、转弯有盲区的时候,最容易出事故。自动驾驶也一样,单车感知就算摄像头、激光雷达再强,也绕不开「视线被挡」的物理极限。于是协同感知就成了破局关键:车和车、车和路侧设备共享感知信息,你看不到的地方我帮你看。
当前协同感知的主流范式是中间层BEV特征融合------既不像早期融合那样传原始点云、带宽爆炸,也不像晚期融合那样只传检测框、信息损失严重,在性能和效率之间取得了最优平衡。但理想很丰满,现实很骨感:多车信息融合的时候,很容易把对方的「检测幻觉」也融进来,假阳性越融越多,反而越帮越忙。
之前的主流解决方案,是给每个智能体的特征加一张置信度图,按置信度高低加权融合。但这个置信度是和检测头一起联合训练的,本质就是「模型自己给自己打分」,很容易形成自增强循环:检测觉得这里有物体→置信度给高分→融合时权重变大→反过来强化检测结果。假阳性就是这么被越放越大的。

图1 传统置信度图与本文不确定性图的本质区别(出自原文Figure 1)
如图1所示,两者的底层逻辑完全不同:
- 置信度图:和分类头共同学习,属于「模型信念」,和检测结果强耦合,只关注前景物体,容易自嗨式放大假阳性;
- 不确定性图:由独立的不确定性头预测,用激光雷达点云密度做监督,属于「物理证据」,和检测任务完全解耦,只评判「这个区域的传感器观测靠不靠谱」,客观中立。
通俗备注:这就像小组作业互评。置信度图模式是每个人给自己的作业打分,肯定都往满分打,最后汇总出来全是「优秀作业」,水货也被吹成精品;而不确定性图模式是根据每个人手里的参考资料数量来打可信度分,资料全的说话分量重,资料少的分量轻,完全客观,不会出现自吹自擂的情况。
为什么点云密度可以当不确定性的黄金标准?因为激光雷达的几乎所有观测误差来源------遮挡、远距离、镜面反射、物体截断------最终都会表现为该区域返回的激光点变少、密度降低。点越密,观测越可靠,不确定性越低;点越疏,观测越模糊,不确定性越高。
更关键的是,高密度的背景区域同样有价值:它能提供可靠的「负证据」------这里点很密但没有物体,说明真的没东西,能有效抑制假阳性。这是置信度图做不到的,因为置信度只关注前景有没有物体,背景区域完全没约束。
二、UECP整体框架
本文提出的UECP框架,核心就是把物理监督的不确定性图,深度嵌入到BEV特征融合的全流程中,整体流水线如下:

图2UECP整体流水线(出自原文Figure 3)
整个流程分为四步:
- 每个智能体独立处理原始传感器数据,通过共享的BEV编码器提取初始BEV特征;
- 并行地,每个智能体通过独立的不确定性头,输出对应分辨率的不确定性图;
- 自车和所有邻居的BEV特征+不确定性图,统一转换到自车坐标系下,送入核心的**不确定性感知金字塔融合(UAPF\mathcal{U}\text{AP}\mathcal{F}UAPF)**模块;
- 深度融合后的特征送入检测头,输出最终的协同感知结果。
整个框架是插件式的,不确定性图可以无缝接入现有的BEV协同感知算法,几乎不增加通信开销。
三、核心模块详解
3.1 不确定性图生成
首先是BEV特征提取:第iii个智能体输入原始数据xix_ixi,通过BEV编码器Φenc\Phi_{enc}Φenc得到BEV特征Fi\mathcal{F}_iFi,维度为H×W×CH \times W \times CH×W×C。
不确定性头Φunc\Phi_{unc}Φunc接收BEV特征,输出单通道的不确定性图:
Ui=Φunc(Fi)∈0,1H×W(2) \mathcal{U}{i}=\Phi{unc}\left(\mathcal{F}_{i}\right) \in0,1^{H \times W} \tag{2} Ui=Φunc(Fi)∈0,1H×W(2)
符号全解释:
- Ui\mathcal{U}_iUi:第iii个智能体的不确定性图,每个像素取值0~1,值越高表示该区域观测可靠性越低;
- Φunc\Phi_{unc}Φunc:不确定性头网络,由若干卷积层组成;
- Fi\mathcal{F}_iFi:输入的BEV特征图;
- H,WH, WH,W:BEV特征图的高度和宽度。
真值定义
不确定性图的监督信号完全来自原始传感器数据,不需要人工标注。先把激光雷达点云投影到BEV网格,统计每个网格的点数得到密度图Di\mathcal{D}_iDi,归一化到0,1区间后,不确定性真值定义为:
Uigt=1−norm(Di)(3) \mathcal{U}{i}^{gt}=1-\text{norm}\left(\mathcal{D}{i}\right) \tag{3} Uigt=1−norm(Di)(3)
符号全解释:
- Uigt\mathcal{U}_i^{gt}Uigt:不确定性图的真值;
- norm(⋅)\text{norm}(\cdot)norm(⋅):归一化函数,将密度图映射到0~1区间;
- Di\mathcal{D}_iDi:原始点云密度图,每个网格的值是该区域的激光点数量。
简单说就是:点越密,密度越高,不确定性越低。
不确定性损失
为了同时兼顾难样本关注和边缘结构保留,损失由两部分组成:
Lun=Lfocal+wgLgrad(4)\mathcal{L}{un }=\mathcal{L}{focal }+w_{g} \mathcal{L}_{grad } \tag{4}Lun=Lfocal+wgLgrad(4)
符号全解释:
- Lun\mathcal{L}_{un}Lun:不确定性头的总损失;
- Lfocal\mathcal{L}_{focal}Lfocal:连续版(\mathcal{F})ocal回归损失,给误差大的难样本更高权重,避免大量简单区域主导损失;
- Lgrad\mathcal{L}_{grad}Lgrad:梯度一致性损失,用固定Sobel算子计算预测和真值的梯度差,保留物体边界等精细结构;
- wgw_gwg:梯度损失的权重系数,论文中取1.0。
通俗备注:Focal损失让模型重点关注「拿不准的区域」,别在简单的地方反复刷分;梯度损失让不确定性图的边缘和真实物体边缘对齐,不会糊成一团。
3.2 不确定性感知金字塔融合(UAPF\mathcal{UAPF}UAPF)
有了不确定性图,怎么把它深度融入融合过程?作者设计了多尺度金字塔融合架构UAPF\mathcal{UAPF}UAPF,采用从粗到细的策略,每个尺度都用不确定性做引导。

图3 UAPF\mathcal{UAPF}UAPF整体架构(出自原文Figure 4\text{Figure 4}Figure 4)
UAPF\mathcal{UAPF}UAPF包含两个核心组件:
- 不确定性加权下采样(UWD\mathcal{UWD}UWD):构建高质量的特征金字塔,下采样时保留高可靠区域的信息;
- 不确定性引导残差融合(UGRF\mathcal{UGRF}UGRF):每个尺度下稳健融合多智能体特征,残差结构保证训练稳定。
3.2.1 不确定性加权下采样(UWD\mathcal{UWD}UWD)
构建多尺度金字塔的第一步就是下采样。传统的平均池化会把噪声区域的信息平均进来,稀释有效信息;最大池化又容易放大局部噪声。UWD\mathcal{UWD}UWD的思路很直接:下采样的时候,可信度高的区域权重高,可信度低的区域权重低,把优质信息保留下来。

图4 UWD\mathcal{UWD}UWD模块结构(出自原文Figure 5\text{Figure 5}Figure 5)
计算公式如下:
Fs=AvgPools(F⊙(1−U))AvgPools(1−U)(5) \mathcal{F}{s} =\frac{\text{AvgPool}{s}\big(\mathcal{F} \odot(1-\mathcal{U})\big)}{\text{AvgPool}_{s}(1-\mathcal{U})} \tag{5} Fs=AvgPools(1−U)AvgPools(F⊙(1−U))(5)
符号全解释:
- Fs\mathcal{F}_sFs:下采样到第sss尺度的特征图;
- AvgPools(⋅)\text{AvgPool}_s(\cdot)AvgPools(⋅):对应尺度sss的平均池化操作;
- F\mathcal{F}F:输入特征图;
- U\mathcal{U}U:对应输入的不确定性图;
- ⊙\odot⊙:逐元素相乘(哈达玛积);
- 分母是权重的归一化因子,保证输出数值范围稳定。
本质上就是一个可靠性加权的平均池化 :每个像素的贡献和它的可靠性(1−U)(1-\mathcal{U})(1−U)成正比。这样下采样之后,低质量、高不确定性的区域被自然压低,高质量区域的信息被完整保留,金字塔的每一层都有很高的信噪比。
3.2.2 不确定性引导残差融合(UGRF\mathcal{UGRF}UGRF)
每个金字塔尺度下,怎么把多个智能体的特征稳健地融合起来?作者设计了残差式融合结构:自车特征始终是主体,协同信息作为残差补充,就算协同信息质量差,也不会把自车带崩。
第一步:计算每个智能体的融合权重
λn=(ϵ+γ⋅(1−Un))⊙vn∑n=1N(ϵ+γ⋅(1−Un))⊙vn(6) \lambda_{n}=\frac{\left(\epsilon+\gamma \cdot\left(1-\mathcal{U}{n}\right)\right) \odot v{n}}{\sum_{n=1}^{N}\left(\epsilon+\gamma \cdot\left(1-\mathcal{U}{n}\right)\right) \odot v{n}} \tag{6} λn=∑n=1N(ϵ+γ⋅(1−Un))⊙vn(ϵ+γ⋅(1−Un))⊙vn(6)
符号全解释:
- λn\lambda_nλn:第nnn个智能体的空间融合权重图,每个位置的权重值0~1,所有智能体对应位置权重和为1;
- ϵ\epsilonϵ:极小常量(10−810^{-8}10−8),防止分母为0,保证数值稳定;
- γ\gammaγ:可学习的标量系数,通过Softplus激活保证为正数,控制不确定性对权重的影响强度;
- Un\mathcal{U}_nUn:第nnn个智能体的不确定性图;
- vnv_nvn:可见性掩码,坐标对齐后的视野范围二值图,不在视野内的区域权重直接置0;
- NNN:参与融合的智能体总数。
得到权重后,还会用3×3高斯模糊做一次平滑,让权重空间更连续,避免出现突兀的跳变。
第二步:残差式融合更新
F^i=Fi+β⋅ϕpost((∑n=1Nλn⊙Fn)−Fi⏟Residual)(7) \hat{\mathcal{F}}{i}=\mathcal{F}{i}+\beta \cdot \phi_{post }\left(\underbrace{\left(\sum_{n=1}^{N} \lambda_{n} \odot \mathcal{F}{n}\right)-\mathcal{F}{i}}_{\text{Residual}}\right) \tag{7} F^i=Fi+β⋅ϕpost Residual (n=1∑Nλn⊙Fn)−Fi (7)
符号全解释:
- F^i\hat{\mathcal{F}}_iF^i:融合后的自车特征;
- Fi\mathcal{F}_iFi:自车原始BEV特征,作为融合的基底;
- β\betaβ:可学习的门控系数,取值0~1,控制协同信息的更新强度;
- ϕpost\phi_{post}ϕpost:浅层卷积后处理网络,对融合残差做特征精炼;
- Residual\text{Residual}Residual:协同加权和与自车特征的差值,也就是协同信息带来的「增量」。
通俗备注:这个残差设计就像你自己先写好一份报告(自车特征),然后参考别人的资料做修改。你不会把自己的报告全删掉重写,而是在自己的基础上,根据别人资料的靠谱程度,补充修正内容。别人资料越靠谱(不确定性低),改得越多;越不靠谱,改得越少。这样就算别人的资料有错,也不会把你原本正确的内容搞坏,稳定性极强。
多尺度融合的最后一步:将深层粗尺度的融合结果上采样,和浅层细尺度的融合结果逐元素相加,逐层细化,最终得到和输入分辨率一致的融合特征。
3.3 总损失函数
整个模型的训练损失由四部分组成:
Ltotal=λregLreg+λclsLcls+λdirLdir+λunLun(8)L_{total}=\lambda {reg}L{reg}+\lambda {cls}L{cls}+\lambda {dir}L{dir}+\lambda {un}L{un} \tag{8}Ltotal=λregLreg+λclsLcls+λdirLdir+λunLun(8)
符号全解释:
- LregL_{reg}Lreg:检测框回归损失,采用L1损失,权重λreg=2\lambda_{reg}=2λreg=2;
- LclsL_{cls}Lcls:分类损失,采用(\mathcal{F})ocal Loss解决正负样本不平衡,权重λcls=1\lambda_{cls}=1λcls=1;
- LdirL_{dir}Ldir:方向分类损失,采用交叉熵损失,权重λdir=0.2\lambda_{dir}=0.2λdir=0.2;
- LunL_{un}Lun:不确定性图损失,权重λun=1\lambda_{un}=1λun=1。
四、实验结果与深度分析
实验在两个真实世界的协同感知基准上完成:
- DAIR-V2X:车路协同数据集,71k+激光雷达-图像帧对;
- V2V4REAL:车车协同数据集,覆盖410km城市道路,240k+3D标注框。
感知范围为前后102.4m、左右51.2m,通信距离100m。
4.1 不确定性图的通用性验证
首先验证核心问题:不确定性图是不是只对特定算法有效?作者把HEAL和Where2comm两个基线中的置信度图,直接替换成本文的不确定性图,结果如下:
表1 替换置信度为不确定性图的性能提升(出自原文Table 1)
| 方法 | AP@30 | AP@50 | AP@70 | 平均提升 | |||
|---|---|---|---|---|---|---|---|
| 置信度 | 不确定性 | 提升 | 置信度 | 不确定性 | 提升 | ||
| HEAL | 79.11 | 80.60 | +1.49 | 73.95 | 75.20 | +1.25 | +3.37 |
| Where2comm | 74.92 | 76.63 | +1.71 | 67.90 | 71.48 | +3.58 | +5.86 |
结果分析:
- 两个基线替换不确定性图后,所有指标全面上涨,说明不确定性图是通用有效的插件;
- 越高的IoU阈值,提升越明显。AP@70的涨幅远大于AP@30,说明不确定性图最大的贡献是抑制假阳性------高Io(\mathcal{U})下对检测框精度要求高,假阳性很容易被筛掉,而置信度图带来的假阳性在高IoU下会严重拉分;
- 这也验证了核心判断:置信度图的自增强循环会放大假阳性,而物理监督的不确定性图解耦了检测,打破了这个恶性循环。
4.2 主实验:SOTA性能对比
表2 与SOTA方法的性能对比(出自原文Table 2)
| 方法 | V2V4REAL | DAIR-V2X | ||||
|---|---|---|---|---|---|---|
| AP@30 | AP@50 | AP@70 | AP@30 | AP@50 | AP@70 | |
| 无协同 | 46.12 | 44.03 | 27.71 | 59.97 | 54.23 | 41.27 |
| (\mathcal{F})cooper | 47.97 | 40.83 | 30.64 | 76.94 | 70.57 | 54.65 |
| V2X-ViT | 40.11 | 37.18 | 24.53 | 77.28 | 72.47 | 57.97 |
| HEAL | 51.57 | 48.70 | 35.24 | 79.11 | 73.95 | 55.56 |
| Code(\mathcal{F})illing | 60.15 | 59.78 | 35.07 | 79.85 | 75.18 | 57.26 |
| (\mathcal{U})ECP(本文) | 65.69 | 63.38 | 38.90 | 81.78 | 77.59 | 61.12 |
| 相对第二名提升 | +2.56 | +3.28 | +3.66 | +1.93 | +2.41 | +3.15 |
结果分析:
- UECP在两个数据集的所有指标上全部拿下SOTA,优势非常明显;
- 依然是高IoU下提升最大,V2V4REAL的AP@70涨了3.66个点,DAIR-V2X涨了3.15个点,再次印证了对假阳性的强抑制能力;
- 对比「无协同」的基线,协同感知带来了巨大的性能提升,而UECP把协同的收益挖到了新高度。
4.3 鲁棒性测试:真实场景的试金石
实际部署中,位姿误差、通信延迟是躲不开的问题。作者在两种干扰下测试了算法鲁棒性:

图5 姿态误差与通信延迟下的鲁棒性对比(出自原文Figure 7)
结果分析:
- 随着姿态噪声增大(定位不准,空间对齐偏差变大),所有方法性能都下降,但UECP下降最慢,始终保持最高精度;
- 随着通信延迟增大,依赖密集交互的方法掉点严重,而UECP因为有不确定性加权,对齐不准的区域会被自动压低权重,性能下降非常平缓;
- 这说明不确定性引导的融合,天生就对各种对齐误差有鲁棒性------不准的地方自动降权,不用额外设计抗噪模块。
4.4 消融实验:每个组件都有用吗?
表3 组件渐进式消融实验(出自原文Table 3)
| 不确定性图 | 多尺度 | (\mathcal{U})WD | (\mathcal{U})GR(\mathcal{F}) | AP@0.3 | AP@0.5 | AP@0.7 |
|---|---|---|---|---|---|---|
| 76.94 | 70.57 | 54.65 | ||||
| ✓ | 78.52 | 72.39 | 56.92 | |||
| ✓ | ✓ | 79.98 | 75.73 | 59.74 | ||
| ✓ | ✓ | ✓ | 80.08 | 76.05 | 60.63 | |
| ✓ | ✓ | ✓ | ✓ | 81.78 | 77.59 | 61.12 |
结果分析:
- 只加不确定性图,AP@0.7就涨了2.27,说明不确定性引导本身就是最大的收益来源;
- 加多尺度金字塔,AP@0.7再涨2.82,多尺度融合对高精度检测增益巨大;
- UWD和UGRF各自都带来了进一步提升,尤其是高IoU下,每一步都在强化对高质量检测的支持。
4.5 细粒度设计验证
表4 融合模块设计细节消融(出自原文Table 4)
(a)金字塔尺度数量
| 尺度 | AP@30 | AP@50 | AP@70 |
|---|---|---|---|
| 单尺度 | 80.03 | 75.43 | 59.03 |
| 两尺度(2,1) | 81.00 | 76.12 | 59.79 |
| 三尺度(4,2,1) | 81.78 | 77.59 | 61.12 |
三尺度金字塔效果最好,粗尺度捕捉全局语义,细尺度保留精细边缘。
(b)引导图类型
| 引导图 | AP@30 | AP@50 | AP@70 |
|---|---|---|---|
| 无引导 | 77.89 | 72.63 | 55.91 |
| 置信度图 | 78.68 | 73.60 | 56.47 |
| 不确定性图 | 81.78 | 77.59 | 61.12 |
不确定性图的提升远大于置信度图,置信度图只比无引导好一点点,再次证明了物理监督的不确定性图远优于自监督的置信度图。
(c)融合操作
| 融合操作 | AP@30 | AP@50 | AP@70 |
|---|---|---|---|
| 最大池化 | 80.93 | 76.01 | 59.86 |
| 平均池化 | 80.33 | 75.13 | 57.66 |
| 加权求和 | 81.78 | 77.59 | 61.12 |
加法融合效果最好,结合残差结构,既保留了自车的基础信息,又充分吸收了协同的增量信息。
4.6 额外验证:学习的图比直接用密度还好
作者还对比了直接用点密度真值当引导,和端到端学习的不确定性图的差异:
表5 不同引导图的性能对比(出自原文附录Table 5)
| 引导图 | AP@0.3 | AP@0.5 | AP@0.7 |
|---|---|---|---|
| 无引导 | 77.89 | 72.63 | 55.91 |
| 置信度图 | 78.68 | 73.60 | 56.47 |
| 直接密度真值 | 81.73 | 77.28 | 60.77 |
| 学习的不确定性图 | 81.78 | 77.59 | 61.12 |
学习的不确定性图比直接用密度真值还要好一点,说明端到端训练不仅学到了点密度的物理先验,还捕捉到了特征层面的其他模糊性,比如特征提取带来的误差,比纯物理信号更全面。
4.7 效率与通信开销

图6 算法效率对比(出自原文Figure 9\text{Figure 9}Figure 9)
- 参数量:仅8.34M,远低于V2X‑ViT、CoBEVT等Transformer类方法;
- 计算量 :约100G FLOPs\text{FLOPs}FLOPs,处于中等水平;
- 推理速度 :9 FPS\text{FPS}FPS,满足实时性要求;
- 通信开销:只比普通BEV特征多传1个通道的不确定性图,256通道特征下仅增加0.39%的带宽,几乎可以忽略。而且可以和Where2comm等稀疏通信方法无缝兼容,不需要修改通信策略。
4.8 定性可视化

图7 协同过程可视化(出自原文Figure 8\text{Figure 8}Figure 8)
从左到右可以看到:自车有盲区,邻居补充了盲区的特征;不确定性图准确反映了每个智能体的观测质量;融合权重图自动给可靠区域更高的权重,最终融合后的特征更完整,检测结果更准。

图8 检测结果定性对比(出自原文Figure 10\text{Figure 10}Figure 10)
可以直观看到,对比其他SOTA方法,UECP\mathcal{UECP}UECP的检测框更准,假阳性更少,漏检也更少,尤其是远处和遮挡区域的提升非常明显。
五、核心代码实现
下面给出两个核心模块的PyTorch简化实现,对应论文中的UWD和UGRF。
5.1 不确定性加权下采样(UWD)
python
import torch
import torch.nn as nn
import torch.nn.functional as \(\mathcal{F}\)
class \(\mathcal{U}\)ncertaintyWeightedDownsample(nn.Module):
def __init__(self, scale_factor=2):
super().__init__()
self.scale_factor = scale_factor
self.avg_pool = nn.AvgPool2d(kernel_size=scale_factor, stride=scale_factor)
def forward(self, feat, uncertainty):
"""
不确定性加权下采样,对应论文公式(5)
Args:
feat: [B, C, H, W] 输入BEV特征
uncertainty: [B, 1, H, W] 不确定性图,取值0~1
Returns:
down_feat: [B, C, H/scale, W/scale] 下采样后的特征
down_unc: [B, 1, H/scale, W/scale] 下采样后的不确定性图
"""
# 可靠性权重 = 1 - 不确定性
reliability = 1.0 - uncertainty
# 加权特征
weighted_feat = feat * reliability
# 分子:加权特征的平均池化
numerator = self.avg_pool(weighted_feat)
# 分母:权重的平均池化
denominator = self.avg_pool(reliability)
# 归一化,加极小值防止除零
down_feat = numerator / (denominator + 1e-8)
# 不确定性图也同步下采样
down_unc = self.avg_pool(uncertainty)
return down_feat, down_unc
5.2 不确定性引导残差融合((\mathcal{U})GR(\mathcal{F}))
python
class \(\mathcal{U}\)ncertaintyGuidedResidual\(\mathcal{F}\)usion(nn.Module):
def __init__(self, feat_dim=256):
super().__init__()
self.gamma = nn.Parameter(torch.tensor(1.0)) # 可学习gamma,用softplus保证正
self.beta = nn.Parameter(torch.tensor(0.5)) # 残差门控
# 后处理卷积网络
self.post_conv = nn.Sequential(
nn.Conv2d(feat_dim, feat_dim, kernel_size=3, padding=1),
nn.BatchNorm2d(feat_dim),
nn.ReL\(\mathcal{U}\)(),
nn.Conv2d(feat_dim, feat_dim, kernel_size=3, padding=1),
nn.BatchNorm2d(feat_dim),
)
# 高斯模糊平滑权重
self.gaussian_blur = nn.Conv2d(1, 1, kernel_size=3, padding=1, bias=\(\mathcal{F}\)alse)
self._init_gaussian_kernel()
def _init_gaussian_kernel(self):
# 初始化3x3高斯核
kernel = torch.tensor([[1, 2, 1],
[2, 4, 2],
[1, 2, 1]], dtype=torch.float32) / 16.0
self.gaussian_blur.weight.data = kernel.view(1, 1, 3, 3)
self.gaussian_blur.weight.requires_grad = \(\mathcal{F}\)alse
def forward(self, ego_feat, feats, uncertainties, vis_masks=None):
"""
不确定性引导残差融合,对应论文公式(6)(7)
Args:
ego_feat: [B, C, H, W] 自车特征
feats: list of [B, C, H, W] 所有智能体的特征(含自车)
uncertainties: list of [B, 1, H, W] 所有智能体的不确定性图
vis_masks: list of [B, 1, H, W] 可见性掩码,默认全1
Returns:
fused_feat: [B, C, H, W] 融合后的特征
"""
N = len(feats)
B, C, H, W = ego_feat.shape
# 计算每个智能体的原始权重
weights = []
gamma = \(\mathcal{F}\).softplus(self.gamma) # 保证为正
for i in range(N):
w = (1e-8 + gamma * (1 - uncertainties[i]))
if vis_masks is not None:
w = w * vis_masks[i]
weights.append(w)
# 归一化权重
weight_sum = torch.stack(weights, dim=0).sum(dim=0)
norm_weights = [w / (weight_sum + 1e-8) for w in weights]
# 高斯平滑权重
norm_weights = [self.gaussian_blur(w) for w in norm_weights]
# 加权求和得到融合特征
weighted_sum = torch.zeros_like(ego_feat)
for i in range(N):
weighted_sum = weighted_sum + norm_weights[i] * feats[i]
# 计算残差
residual = weighted_sum - ego_feat
# 后处理残差
residual_refined = self.post_conv(residual)
# 残差更新
beta = torch.sigmoid(self.beta) # 门控限制在0~1
fused_feat = ego_feat + beta * residual_refined
return fused_feat
六、总结与展望
核心贡献
- 物理可解释的不确定性图:首次提出用激光雷达点云密度监督的不确定性图,和检测任务完全解耦,提供客观的物理证据,打破了置信度图的自增强循环;
- UECP\mathcal{UECP}UECP完整融合框架 :设计了不确定性感知金字塔融合UAPF\mathcal{UAPF}UAPF,包含UWD\mathcal{UWD}UWD加权下采样和UGRF\mathcal{UGRF}UGRF残差融合两个核心组件,从金字塔构建到特征融合全流程嵌入不确定性引导;
- SOTA性能与强鲁棒性:在DAIR‑V2X和V2V4REAL两个真实数据集上全面超越SOTA,尤其在高精度检测上提升显著,同时对位姿误差、通信延迟有天然的鲁棒性,且通信开销极低。
未来方向
- 扩展到多模态异质智能体场景,比如有的车只有摄像头,有的有激光雷达,不确定性图可以适配不同传感器的质量评估;
- 结合动态通信带宽,根据不确定性动态调整通信区域,高不确定性的区域多传数据,低不确定性的少传,进一步节省带宽;
- 把不确定性引入感知下游任务,比如规划、控制,让下游模块也能感知到哪些区域的检测结果不可靠,做出更安全的决策。
通俗总结:这篇工作最巧妙的地方,就是没有在「怎么让模型更相信自己」这条路上卷,而是退回到物理本质,用传感器本身的特性做客观的质量评估。就像评判一份作业好不好,不要看作者自己吹得有多凶,要看他手里的参考资料够不够多、够不够准。这种回归物理先验的思路,往往比堆模型结构更有生命力。