Swin版VMamba来了！精度再度提升，VMamba-S达成83.5%，超越Swin-S，已开源！

本文首发：AIWalker

就在昨日，华科王兴刚团队公开了Mamba在ViT的入局Vim，取得了更高精度、更快速度、更低显存占用。相关信息可参考：

入局CV，Mamba再显神威！华科王兴刚团队首次将Mamba引入ViT，更高精度、更快速度、更低显存！

就在纳闷Swin版的VMamba啥时候出来之时，UCAS、华为以及鹏城实验室联合提出了Swin版本的VMamba，不出之外的取得了更高的精度，VMamba-S比Vim-S指标还高出3.2% ，不过这在意料之中，Swin-S也比DeiT-S高3%左右，不得不为Vim早一天公开感到庆幸，_哈哈

https://arxiv.org/abs/2401.10166

https://github.com/MzeroMiko/VMamba

本文受到最近提出的状态空间模型的启发，提出了一种视觉状态空间模型（VMamba），在不牺牲全局感受野的情况下实现了线性复杂度 。为了解决方向敏感的问题，我们引入了交叉扫描模块（CSM）遍历空间域和转换任何非因果的视觉图像顺序补丁序列。大量的实验结果证明，VMamba在各种视觉感知任务中表现出有前途的能力，而且随着图像分辨率的增加，表现出更明显的优势。

本文方案

上图为所提VMamba架构示意图，很明显与Swin Transformer具有相似的宏观架构，区别在于核心模块：VSS Block。很明显，VSS Block是一种大核卷积注意力 模块，这里的关键就变成了如何基于SSM构建大感受野卷积注意力核了。在这里，参考S6(Selective Scan Mechanism)，作者引入了2D选择性扫描机制。在S6中，矩阵 $B \\in R\^{B \\times L \\times N}, C \\in R\^{B \\times L \\times N}, \\Delta in \\in R\^{B \\times L \\times D} 由输入数据由输入数据由输入数据x\\in R\^{B \\times L \\times N}$ 推导而来。这就意味着：S6具有输入感知的上下文信息，确保了该机制内权值的动态性。