(cvpr26) AIMDepth: Asymmetric Image-Event Mamba for Monocular Depth Estimation

1、研究动机

该论文研究事件相机+图像结合用于深度估计。如下图所示,当前方法包括隐式融合(多模态数据直接拼接输入编码器),显示融合(多模态分别提取特征,由融合模块融合特征),作者提出一种全新方案,输入数据先进行特征对齐(SCPG),同时构建非对称模态编码器(AME),然后中间进行模态交互局部细化(ModiLocal)。

2、模型框架

AIMDepth 采用类 U-Net结构,全程基于 SSM 搭建,整体分为四大核心模块,流程:输入预处理 → 输入层对齐 (SCPG) → 非对称模态编码器 (AME) → 模态交互局部细化 (ModiLocal) → Mamba 解码器 → 深度图输出。

(1)Spectral Cross-Modal Prior Guidance (SCPG)。 对图像、事件做二维离散傅里叶变换 (DFT),分解为振幅谱 + 相位谱。 **事件表征增强:**用掩码选取低频区域,将图像低频振幅替换事件低频振幅,保留事件原有高频时域动态,逆傅里叶变换得到结构增强后的事件表征。 图像表征增强: 事件相位谱保留精细边缘与运动边界,弥补静态图像时域缺失问题。选取全局响应最强的两个事件通道,提取其相位图;将原图与相位图通道拼接,为图像注入动态运动线索。

(2)Asymmetric Modal-Aware Encoder (AME)。 图像是稠密纹理,浅层网络可提取空间细节。事件是稀疏动态,深层网络才能挖掘时空语义。非对称特征选择即对图像特征,保留前 3 层浅层特征。对于事件特征,保留后3层深层特征。共享权重控制参数量,分层特征选择完成特征级模态对齐,适配两种模态的表达规律。

(3)ModiLocal Block。 先进行 ISS 全局交互式扫描,然后进行LSS局部空间扫描。模块收尾加入SE注意力,自适应加权通道特征。

相关推荐
宸津-代码粉碎机1 小时前
OpenAI 连夜迎战 Grok Bot 和 Muse:AI 智能体从 “会聊天” 到 “能办事”,现在入场还来得及吗
java·大数据·人工智能·分布式·python
做萤石二次开发的哈哈2 小时前
视频解码器怎么对接?解码上墙、电视墙开窗与场景切换的ISAPI接入实战
人工智能·物联网·监控·视频编解码·大屏端·萤石开放平台·蓝海aiot一站式工作台
Leo.yuan2 小时前
2026年本地化Data Agent优质厂商盘点:哪些产品更适合企业生产环境
大数据·数据库·人工智能
长谷深风1113 小时前
Tool与Skill:AI能力设计的分水岭
java·人工智能·ai·大模型·aiagent
科技观察哨3 小时前
六足平台选型与纳米定位系统集成:HEB-640六自由度位移台在半导体光刻对准中的参数边界与国产替代评估
前端·人工智能
云上先途3 小时前
任务智能体可以自动完成哪些类型工作,是不是只能做简单重复操作?
大数据·人工智能
明志数科3 小时前
具身智能数据供给的分层:分布式采集与入厂采集的工程边界分析
人工智能·机器学习·机器人
像风一样自由20203 小时前
41.用FastAPI搭建一个RAG后端需要哪些接口
人工智能·大模型·fastapi·rag·智能体
小蒋观天下3 小时前
两轮车检测AI摄像头——2026行业竞争格局、商业模式与核心痛点
大数据·人工智能·安全·计算机视觉·ai大模型
RisunJan3 小时前
【这就是AI】AI每日资讯简报 - 2026-09-28(周一)
大数据·人工智能