CVPR Efficient ViM:视觉 Mamba 的轻量化

2025 CVPR 的新 Paper《Efficient ViM》,专门解决轻量级视觉模型中 Attention 计算太慢 和 标准 Mamba 参数冗余 的痛点!提出了一种在"隐状态"空间做混合的高效算法。

论文原文 :https://arxiv.org/pdf/2411.15241

代码:https://github.com/mlvlab/EfficientViM

即插即用代码仓库:https://github.com/AITricks/AITricks

1️⃣ 核心痛点:Attention 太慢,Mamba 还不够快

CNN:提取局部特征快,但看完全局很吃力。

ViT:能看全局,但计算量是,Token 一多直接卡死。

标准 Mamba:虽然是线性复杂度 ,但投影层的计算量依然很大,且内存访问是瓶颈。

2️⃣ 核心架构:Efficient ViM

宏观:采用 4 阶段的金字塔结构,逐步降低分辨率。

微观:引入了 HSM-SSD 模块 替代传统的 Attention 或卷积模块。

单头设计:作者发现"多头"机制在轻量级模型上会增加显存读写负担,所以改成了更高效的"单头"模式。

3️⃣ 核心创新:HSM-SSD

传统 SSD:是在庞大的 Token 序列上做通道混合,计算量大。

HSM-SSD:"曲线救国"。它先不急着混合,而是把特征压缩到极小的隐状态里,然后在隐状态空间里做混合。

效果:因为隐状态维度远小于序列长度,计算量直接暴跌,实现了"在压缩空间做昂贵运算"。

4️⃣ 增强魔法:MSF (多阶段隐状态融合)

原理:把浅层的隐状态直接传给深层。

作用:就像给模型装了"记忆体",让深层网络能回忆起图像的纹理细节,弥补了轻量级模型表征能力弱的短板。

5️⃣ 实验结果:吊打 MobileNet 和 SHVIT

速度/精度权衡:Efficient ViM-S 在精度达到 75.3% 的同时,推理延迟仅 0.6ms。

对比竞品:相比于最新的轻量级 SOTA 模型 SHVIT-S1,Efficient ViM 在相同精度下,推理速度快了 1.3 倍;相比于经典的 MobileNetV3,精度大幅提升。

总结:Efficient ViM 证明了 "隐状态操作" 是轻量级 Mamba 的正确打开方式。

#深度学习 #计算机视觉 #科研 #科研日常 #论文 #论文分享 #mamba #算法 #科研学习

相关推荐
一隅论数智4 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
上海广测检测科技有限公司4 天前
智能平板出口巴西合规详解:Anatel射频、Inmetro电源/电池与LGPD数据合规叠加
经验分享
FLJwu4 天前
存储与固件量产实战01:运动相机TF卡量产翻车实录!V30≠4K可用,90%OEM踩中的隐形售后坑
经验分享·数码相机·相机
深圳老胡4 天前
STM32F407 控制 L6470 步进电机驱动 —— 控制过程简介
笔记·stm32·单片机·嵌入式硬件·代码规范
xiaomu001234 天前
床垫选型的技术评估模型:结构、材料、卫生与检测四层口径
经验分享
Because_of_Her14 天前
并查集-听课笔记
笔记·算法·并查集
汉风设计装饰4 天前
智慧办公弱电系统设计:门禁、监控与 IoT 传感器的集成方案
经验分享
彧azz4 天前
Linux 环境下 Redis 学习总结:数据类型、持久化、锁、事务、主从与缓存问题
linux·redis·笔记·学习·面试
m0_719640874 天前
支持开源二次开发的VR遥操机器人2026年选型推荐
经验分享
陈卫军老师4 天前
陈卫军:把口味写在一张纸上,店才稳得住
经验分享·笔记·流量运营