红外-可见光DEIM双模态目标检测:多级渐进交互+后端聚合融合架构设计

现有主流双模态融合方案设计较为单一,特征利用效率不足,主要存在两类缺陷:浅层早期融合在网络浅层直接拼接双模态特征,模态特征未充分解耦,易发生跨模态噪声相互干扰、有效特征被掩盖的问题,无法发挥双模态互补优势;纯晚期隔离融合采用双分支独立编码,仅在骨干末端进行特征拼接,虽避免了浅层噪声干扰,但编码全程无模态交互,存在特征割裂问题,无法在特征提取阶段互相增益,导致可见光纹理与红外位置信息难以深度融合,模型表征能力存在明显瓶颈。

针对上述两种融合范式的固有弊端,本文提出多级渐进交互 + 后端聚合的双模态特征融合架构。摒弃浅层强制融合与全程隔离末端拼接的单一方式,在骨干多尺度编码阶段实现分层渐进式跨模态交互,最后在骨干末端完成同尺度特征聚合,结合 Transformer 增强 FPN-PAN 与 DEIM 检测头,构建了一套兼顾模态独立性、跨模态关联性与多尺度表征能力的新型双模态融合范式。

1. 整体架构设计

整体网络核心围绕自研融合架构搭建,分为四大核心模块:双流HGNetv2多级渐进交互编码模块 、多尺度后端特征聚合模块 、Transformer增强FPN-PAN特征精炼模块 、DEIM Decoder精准解码模块 。整套架构的核心亮点聚焦于全新的双模态融合逻辑,实现了传统简单融合方式的全面升级。

1.1. 双流HGNetv2骨干:多级渐进跨模态交互编码

架构采用对称式双流独立分支设计,可见光RGB图像与红外单通道图像分别输入两条参数独立的HGNetv2骨干分支,各自专注学习对应模态的专属特征表征,保留双模态原生特征优势,从根源避免模态特征相互干扰。HGNetv2通过HGStem与多级HGStage逐级下采样,输出P2~P5多尺度层级特征,满足不同尺寸目标的特征建模需求。

区别于所有传统简单融合方案,本文核心创新在于多尺度渐进式跨模态交互设计:在P3、P4、P5多个关键特征尺度的编码阶段,搭建轻量化跨模态交互通路,让两个独立模态分支在网络前向推理过程中,逐层完成信息双向交互增益。交互过程采用残差增量注入机制,仅将另一模态的互补特征作为增量信息补充至原分支,不覆盖、不破坏原有模态的主体特征表征。

该设计完美解决传统方案痛点:相较于浅层早期融合,全程规避了浅层原始噪声叠加污染问题,保证模态特征先独立精炼、再交互增强;相较于纯晚期隔离融合,彻底打破了双分支信息壁垒,在编码阶段就能完成可见光纹理细节补充、红外目标定位信息增益,提前建立跨模态特征关联,让双模态互补优势贯穿整个特征提取过程。

1.2. 多尺度后端特征聚合模块

在完成骨干网络多级、分层渐进交互增强后,对双分支输出的同尺度P3、P4、P5特征进行拼接聚合。此时的双模态特征已经完成多轮互补增益与特征对齐,相较于传统末端简单拼接的原始特征,聚合后的融合特征兼具红外精准定位信息 与可见光精细化纹理信息,特征冗余度更低、有效信息密度更高,为后续多尺度精炼与检测解码提供高质量特征基底。

1.3. Transformer增强FPN-PAN多尺度精炼模块

针对聚合后的多尺度双模态融合特征,采用Transformer增强的FPN-PAN结构完成跨尺度特征优化。自上而下的FPN通路传递高层强语义信息,自下而上的PAN通路补充底层精准定位信息,同时引入Transformer Encoder建模全局长距离依赖,解决小目标、密集目标特征弱化问题,进一步挖掘多级交互融合特征的深层关联,适配复杂场景检测需求。

1.4. DEIM Decoder检测解码模块

依托DEIM可变形查询机制,自适应聚焦目标有效区域、动态调整采样位置,能够充分适配本文融合架构输出的高质量、高维度双模态特征。精准完成复杂场景下的目标分类与边界框回归,最大化发挥新型融合架构的性能优势,有效提升暗光、遮挡、小目标密集场景的检测鲁棒性。

2.核心创新点总结

2.1. 创新"分层交互+后端聚合"融合范式,打破传统二元局限

传统融合方式仅有"浅层早融合"和"末端晚融合"两种极端,各有缺陷。本文架构创新性融合二者优势,规避全部短板:既不提前混合未精炼的原始模态特征,杜绝噪声干扰;又不全程隔离模态信息,避免特征割裂。通过多级渐进交互实现编码过程的动态增益,通过后端聚合实现全局特征统一整合,形成更科学、更高效的双模态融合逻辑。

2.2. 残差增量交互,平衡模态独立性与互补性

不同于传统融合的粗暴特征叠加,本文采用残差式增量交互策略。双模态各自保留专属特征主体,仅吸收对方的优势互补信息,既守住了可见光纹理、红外热成像的模态原生优势,又实现了跨模态信息双向增强,彻底解决传统融合"要么互相干扰、要么互不增益"的难题。

2.3. 多尺度渐进融合,全方位挖掘双模态互补信息

传统融合仅在单一层级完成特征融合,无法适配多尺度目标检测需求。本文在P3/P4/P5多个尺度逐层交互增强,针对不同尺寸目标实现精细化跨模态特征对齐与增益,让小目标获得更丰富的细节信息,让大目标获得更精准的全局语义信息,大幅提升多尺度目标检测能力。

2.4. 融合质量更高,适配性更强

经过多级交互+后端聚合的融合特征,相较于传统简单融合特征,有效信息更集中、特征对齐更精准、冗余噪声更少,能够充分适配后续Transformer全局建模与DEIM自适应解码机制,全方位提升复杂场景双模态检测的精度与稳定性。

3.代码和视频讲解

视频讲解:

DEIM:超越 YOLO,快准双绝!DEIM:让 DETR 告别慢收敛,开启实时检测新纪元_哔哩哔哩_bilibili

DEIM:超越 YOLO,快准双绝!一个视频告诉你DEIM如何搭建backbone_哔哩哔哩_bilibili

代码获取:

https://github.com/tgf123/YOLOv8_improve/blob/master/DEIM.md

4. 项目实战

第一: 将下面的核心代码复制到DEIMv2-main\MM_DEIM路径下,如下图所示。

第二:将模型配置文件复制到DEIM.YAMY文件中

第三:跑的结果

5. 实验预期与适用场景

本文所提融合架构通用性强,可广泛适配夜间安防监控、车载多光谱感知、航拍遥感检测等各类红外-可见光双模态检测场景。依托分层渐进交互的融合优势,模型在暗光无纹理、强光过曝、目标遮挡、小目标密集等复杂工况下,均能保持稳定的特征提取与融合能力。

后续可围绕该融合架构进一步优化:增加自适应模态权重调控机制,动态调整不同场景下双模态交互增益强度;引入跨模态特征对齐损失,进一步提升双模态特征空间一致性,持续挖掘该融合范式的性能上限。

6. 小结

针对现有双模态检测任务中,传统浅层早期融合、纯晚期隔离融合方式特征利用率低、模态适配性差、互补性不足的问题,本文提出了多级渐进交互 + 后端聚合的新型双模态特征融合架构。通过骨干多尺度分层渐进交互、末端同尺度特征聚合的组合设计,完美平衡了模态独立学习与跨模态信息融合,彻底解决了传统融合方案的噪声干扰、信息割裂、增益不足等核心痛点。整套融合架构轻量化、高效性、通用性强,能够充分挖掘红外与可见光双模态的信息互补潜力,为高精度双模态目标检测提供了一种更优的融合范式与基线方案。

相关推荐
一勺汤13 天前
DEIM 改进系列(四):concat 融合节点改进——把“简单拼接“升级为“学习式融合“
detr·自研·魔改·rtdetr·deim·即插即用·deim改进
一勺汤5 个月前
自研双 Backbone 协同检测架构:从根源重构特征提取,解锁单 / 多模态检测精度新上限
多模态·yolo11改进·双backbone·yolo12改进·yolo26·yolo26改进·yolo26双backbone
一勺汤6 个月前
双骨干并行,极简融合:一款高效双 Backbone 目标检测网络详解(单模态增强创新点,双模态检测)
yolo·多模态·双backbone·yolo双backbone·单模态·yolo26双backbone·yolo11双backbone
一勺汤10 个月前
YOLO 双 Backbone 双模态融合:以 LLVIP 数据集为例的红外 - 可见光目标检测实践
yolo·双backbone·yolo 双backbone·双模态·yolo双模态·llvip
停走的风1 年前
(CVPR2025)DEIM模型训练自己的数据集教程(基于Pycharm)
python·深度学习·pycharm·模型训练·deim
一勺汤1 年前
YOLOv11改进-双Backbone架构:利用双backbone提高yolo11目标检测的精度
人工智能·yolo·双backbone·double backbone·yolo11 backbone·yolo 双backbone
凌康ACG3 年前
springmvc内嵌tomcat、tomcat整合springmvc、自研国产web中间件
中间件·tomcat·信创·自研
globalcoding3 年前
开源和自研——机器人
机器人·开源·自研