ICML 2026 | 福州大学 LaRA-Fusion:用双环约束优化红外与可见光融合潜空间的拓扑结构

ICML 2026 双环约束,稳住融合潜空间

LaRA-Fusion:面向红外与可见光融合的潜空间鲁棒适应

图 1 自重建、循环翻译和双环流形约束的对比示意图


导读

无监督图像融合一般依靠重建或者循环一致性来实现,但是模型可能会用到隐藏高频噪声减少损失但是没有学到东西跨模态共享结构。LaRA-Fusion 以潜空间拓扑为出发点,利用双环流形来限制这些数值捷径,并且使红外显著目标与可见光纹理在更加稳定的表示空间中完成融合。


论文信息

题目: LaRA-Fusion: Latent-Robust Adaptation via Dual-Loop Constraints for Infrared and Visible Image Fusion

中文: LaRA-Fusion:基于双环约束的红外与可见光图像融合潜空间鲁棒适应

作者: Yaru Su、Chaowei Huang、Huangbiao Xu、Xiao Ke

单位: 福州大学计算机与大数据学院;福建省网络计算与智能信息处理重点实验室;教育部大数据智能工程研究中心

下载: https://icml.cc/virtual/2026/poster/61058

代码: 论文里没有给出公开链接

为什么要去研究潜空间呢?

传统的无监督融合的方法主要是像素级限制下重建成的结果。严格地进行重建或者循环损失可以减小误差,但是也会使编码器把源图像中的细节隐藏起来不能被人体所听到的高频率声音,造成潜空间和实际的数据流形态不同。LaRA-Fusion 的主要目的并不是只为了"重建得更加相似",而是在潜空间里使各种模态之间存在差异可以反向进行、分布均匀并且拓扑上是连通的。


核心方法

01 双环流型限制 内环利用自我重构以及循环映射来保持几何可逆性;外环用对抗学习来限制中间翻译的结果,并使对齐目标模态分布,减少潜空间坍塌和高频率噪音捷径。02 内容和属性分离 共享的内容编码器抽取跨模态几何结构,模态特异性属性编码器描述热辐射、照度以及纹理的不同,给融合提供稳定的、可以控制的潜在表示。03 MRB、HAA 和 MSBMRB 用残差聚合来修正跨模态的内容特征拓扑偏差;HAA动态平衡红外和可见光特性;MSB把融合属性加入到卷积权重中去,并且在不改变结构的情况下完成高保真解码。

图2 LaRA-Fusion 整体结构、MRB、HAA 和双环训练方法

图3 调制合成块(MSB)结构图


实验设置

模型用到了MSRS中的一些东西1083 图像训练,并且在MSRS、TNO、Kaist和M3FD上进行测试。对后三个数据集,模型不需要做进一步的微调来验证跨数据集泛化能力。使用EN、SD、AG、MI、VIF和Qabf这六个标准来评价结果,并且把DeFusion、BDLFusion、LRRNet、CAF、MMDRFuse、ITFuse、FusionBooster、LUTFuse和T2EA等方法的结果也一并纳入其中进行对比分析。

实验结果

在四个测试集中对LA-RFusion进行评估,在六个维度上的表现总体上仍然处于领先地位或者有很强的竞争性,尤其是在信息保存、对比度、视觉保真度以及边沿细节上都比较稳定。消融实验表明,在去掉内环、外环、MRB、HAA或者随机属性之后,性能都会有所降低。完整的模型在MSRS上获得EN 6.77、SD 45.73、AG 3.76、VIF 1.03和Qabf 0.66。在下游的任务里用到M3FD目标检测的时候,融合了图像之后mAP@50 为 66.74%;MSRS 语义分割的时候用到65.53%mIoU,所以它不但视觉效果好,而且可以进行高阶认知的任务。

图4、图5中M3FD和MSRS数据集上定性比较的结果

表 1、表 2 四个数据集上量化的结果以及MSRS消融实验

图7 内容-属性解耦和潜空间拓扑对齐分析


一句话总结

LaRA-Fusion 不再只是在像素层面上做到"可以重建"的程度上,而是在于双环约束、流形修正和随机属性遍历使融合潜空间一直处在可逆、对齐和鲁棒。

END


往期推荐

相关推荐
枫叶林FYL23 分钟前
【群体智能集群控制工程实践】第8章 无人机蜂群测试与部署
人工智能·无人机
2601_949950634 小时前
练题簿,把培训从“走过场”变成“真落地”
人工智能·学习·小程序·刷题·小程序推荐
诸神缄默不语5 小时前
备战 AI 出海 DAY 0:海外数据采集
大数据·人工智能
Ysn07196 小时前
YOLO-Master工程:experts.py 专家结构详解与目标检测专家设计启发
人工智能·yolo·目标检测
BingoGo6 小时前
使用 GPT-6 Astra 模型 请立刻更新你的 Skill 与提示词
人工智能
香菜+6 小时前
端侧视频分析 · 架构笔记
人工智能
s1ckrain6 小时前
【论文阅读】A Survey on Vision–Language–Action Models for Embodied AI
论文阅读·人工智能·多模态·具身智能
深圳雨林凯AI7 小时前
图案裂变的“风格归一化“设计思路:主体保得住,画风才拉得齐|雨林凯AI技术笔记
人工智能·笔记
DevNo7 小时前
英文会议转中文纪要,三款AI工具实测体验
人工智能
深小乐7 小时前
AI 说话越来越难懂?Anthropic 员工都在用 ELI5 这个图解 Skill
人工智能