现有主流双模态融合方案设计较为单一,特征利用效率不足,主要存在两类缺陷:浅层早期融合在网络浅层直接拼接双模态特征,模态特征未充分解耦,易发生跨模态噪声相互干扰、有效特征被掩盖的问题,无法发挥双模态互补优势;纯晚期隔离融合采用双分支独立编码,仅在骨干末端进行特征拼接,虽避免了浅层噪声干扰,但编码全程无模态交互,存在特征割裂问题,无法在特征提取阶段互相增益,导致可见光纹理与红外位置信息难以深度融合,模型表征能力存在明显瓶颈。
针对上述两种融合范式的固有弊端,本文提出多级渐进交互 + 后端聚合的双模态特征融合架构。摒弃浅层强制融合与全程隔离末端拼接的单一方式,在骨干多尺度编码阶段实现分层渐进式跨模态交互,最后在骨干末端完成同尺度特征聚合,结合 Transformer 增强 FPN-PAN 与 DEIM 检测头,构建了一套兼顾模态独立性、跨模态关联性与多尺度表征能力的新型双模态融合范式。
1. 整体架构设计
整体网络核心围绕自研融合架构搭建,分为四大核心模块:双流HGNetv2多级渐进交互编码模块 、多尺度后端特征聚合模块 、Transformer增强FPN-PAN特征精炼模块 、DEIM Decoder精准解码模块 。整套架构的核心亮点聚焦于全新的双模态融合逻辑,实现了传统简单融合方式的全面升级。

1.1. 双流HGNetv2骨干:多级渐进跨模态交互编码
架构采用对称式双流独立分支设计,可见光RGB图像与红外单通道图像分别输入两条参数独立的HGNetv2骨干分支,各自专注学习对应模态的专属特征表征,保留双模态原生特征优势,从根源避免模态特征相互干扰。HGNetv2通过HGStem与多级HGStage逐级下采样,输出P2~P5多尺度层级特征,满足不同尺寸目标的特征建模需求。
区别于所有传统简单融合方案,本文核心创新在于多尺度渐进式跨模态交互设计:在P3、P4、P5多个关键特征尺度的编码阶段,搭建轻量化跨模态交互通路,让两个独立模态分支在网络前向推理过程中,逐层完成信息双向交互增益。交互过程采用残差增量注入机制,仅将另一模态的互补特征作为增量信息补充至原分支,不覆盖、不破坏原有模态的主体特征表征。
该设计完美解决传统方案痛点:相较于浅层早期融合,全程规避了浅层原始噪声叠加污染问题,保证模态特征先独立精炼、再交互增强;相较于纯晚期隔离融合,彻底打破了双分支信息壁垒,在编码阶段就能完成可见光纹理细节补充、红外目标定位信息增益,提前建立跨模态特征关联,让双模态互补优势贯穿整个特征提取过程。
1.2. 多尺度后端特征聚合模块
在完成骨干网络多级、分层渐进交互增强后,对双分支输出的同尺度P3、P4、P5特征进行拼接聚合。此时的双模态特征已经完成多轮互补增益与特征对齐,相较于传统末端简单拼接的原始特征,聚合后的融合特征兼具红外精准定位信息 与可见光精细化纹理信息,特征冗余度更低、有效信息密度更高,为后续多尺度精炼与检测解码提供高质量特征基底。
1.3. Transformer增强FPN-PAN多尺度精炼模块
针对聚合后的多尺度双模态融合特征,采用Transformer增强的FPN-PAN结构完成跨尺度特征优化。自上而下的FPN通路传递高层强语义信息,自下而上的PAN通路补充底层精准定位信息,同时引入Transformer Encoder建模全局长距离依赖,解决小目标、密集目标特征弱化问题,进一步挖掘多级交互融合特征的深层关联,适配复杂场景检测需求。
1.4. DEIM Decoder检测解码模块
依托DEIM可变形查询机制,自适应聚焦目标有效区域、动态调整采样位置,能够充分适配本文融合架构输出的高质量、高维度双模态特征。精准完成复杂场景下的目标分类与边界框回归,最大化发挥新型融合架构的性能优势,有效提升暗光、遮挡、小目标密集场景的检测鲁棒性。
2.核心创新点总结
2.1. 创新"分层交互+后端聚合"融合范式,打破传统二元局限
传统融合方式仅有"浅层早融合"和"末端晚融合"两种极端,各有缺陷。本文架构创新性融合二者优势,规避全部短板:既不提前混合未精炼的原始模态特征,杜绝噪声干扰;又不全程隔离模态信息,避免特征割裂。通过多级渐进交互实现编码过程的动态增益,通过后端聚合实现全局特征统一整合,形成更科学、更高效的双模态融合逻辑。
2.2. 残差增量交互,平衡模态独立性与互补性
不同于传统融合的粗暴特征叠加,本文采用残差式增量交互策略。双模态各自保留专属特征主体,仅吸收对方的优势互补信息,既守住了可见光纹理、红外热成像的模态原生优势,又实现了跨模态信息双向增强,彻底解决传统融合"要么互相干扰、要么互不增益"的难题。
2.3. 多尺度渐进融合,全方位挖掘双模态互补信息
传统融合仅在单一层级完成特征融合,无法适配多尺度目标检测需求。本文在P3/P4/P5多个尺度逐层交互增强,针对不同尺寸目标实现精细化跨模态特征对齐与增益,让小目标获得更丰富的细节信息,让大目标获得更精准的全局语义信息,大幅提升多尺度目标检测能力。
2.4. 融合质量更高,适配性更强
经过多级交互+后端聚合的融合特征,相较于传统简单融合特征,有效信息更集中、特征对齐更精准、冗余噪声更少,能够充分适配后续Transformer全局建模与DEIM自适应解码机制,全方位提升复杂场景双模态检测的精度与稳定性。
3.代码和视频讲解
视频讲解:
DEIM:超越 YOLO,快准双绝!DEIM:让 DETR 告别慢收敛,开启实时检测新纪元_哔哩哔哩_bilibili
DEIM:超越 YOLO,快准双绝!一个视频告诉你DEIM如何搭建backbone_哔哩哔哩_bilibili
代码获取:
https://github.com/tgf123/YOLOv8_improve/blob/master/DEIM.md
4. 项目实战
第一: 将下面的核心代码复制到DEIMv2-main\MM_DEIM路径下,如下图所示。

第二:将模型配置文件复制到DEIM.YAMY文件中

第三:跑的结果

5. 实验预期与适用场景
本文所提融合架构通用性强,可广泛适配夜间安防监控、车载多光谱感知、航拍遥感检测等各类红外-可见光双模态检测场景。依托分层渐进交互的融合优势,模型在暗光无纹理、强光过曝、目标遮挡、小目标密集等复杂工况下,均能保持稳定的特征提取与融合能力。
后续可围绕该融合架构进一步优化:增加自适应模态权重调控机制,动态调整不同场景下双模态交互增益强度;引入跨模态特征对齐损失,进一步提升双模态特征空间一致性,持续挖掘该融合范式的性能上限。
6. 小结
针对现有双模态检测任务中,传统浅层早期融合、纯晚期隔离融合方式特征利用率低、模态适配性差、互补性不足的问题,本文提出了多级渐进交互 + 后端聚合的新型双模态特征融合架构。通过骨干多尺度分层渐进交互、末端同尺度特征聚合的组合设计,完美平衡了模态独立学习与跨模态信息融合,彻底解决了传统融合方案的噪声干扰、信息割裂、增益不足等核心痛点。整套融合架构轻量化、高效性、通用性强,能够充分挖掘红外与可见光双模态的信息互补潜力,为高精度双模态目标检测提供了一种更优的融合范式与基线方案。