【IJCAI2024】LeMeViT: Efficient Vision Transformer with Learnable Meta Tokens

【IJCAI2024】LeMeViT: Efficient Vision Transformer with Learnable Meta Tokens for Remote Sensing Image Interpretation

论文:https://arxiv.org/abs/2405.09789

代码:https://github.com/ViTAE-Transformer/LeMeViT

由于相邻像素和图像块之间的高度相关性,以及遥感图像中纹理和模式的重复性质,存在大量的空间冗余。如下图所示,ViT 中的自注意力机制计算每两个图像块之间的相似性,相似的token对特征表示的贡献很小,但消耗了大量的计算负载,影响了模型性能。

为此,作者提出了下图所示的框架。本质上引入了一个可学习的 meta token(类似于原型或者记忆),不断的进行 image token 和 meta token 的信息交换。值得注意的是,网络的浅层使用的是cross-attention,深层使用的是自注意力(作者解释是自注意力的性能更高)。

作者在语义分割、目标检测等多个应用上做了大量实验,结果表明该方法具有较好的性能。有个有趣的消融实验是meta token 长度对性能的影响。长度为 64、32、16 和 8时,准确率几乎相同。这进一步证实了注意力计算的冗余,表明使用较少数量的 meta token 来表示密集图像 token 的动机。最后,考虑到效率和准确性,作者选择 16 作为 meta token 长度的默认设置。

作者还可视化了 dual cross attention最后一个块中,交叉注意映射结果。自然图像上的实验结果表明,学习到的 meta token 可以很好地关注图像中的目标,有助于提高分类精度。遥感图像上的实验结果则表明不同的 meta token 负责图像的不同语义部分。

相关推荐
Zzj_tju2 分钟前
Embodied Agent 小环境:用状态日志解释成功、绕路与超时
人工智能·深度学习·机器学习·自然语言处理
微财经观圈20 分钟前
AI 3D生成角色怎样套用预设动作?自动绑骨与动作测试步骤
人工智能·3d
是翎31 分钟前
图解大语言模型部署
人工智能·驱动开发·深度学习·开源协议·imagen
joinwell5233 分钟前
写了“始终审批”,AI 为什么还是执行了?
人工智能
腾渊信息科技公司33 分钟前
腾渊科技重磅出品——智能体交易信任架构实战:从KYA到可追溯审计的完整方案
人工智能·科技·aiagent·腾渊科技·腾渊信息科技
知几蜗牛1 小时前
AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层
人工智能
CIO_Alliance1 小时前
AI微调系列(2)| QLoRA:一张卡微调700亿参数,显存是怎么省下来的
大数据·人工智能·深度学习·ai·企业ai转型·企业cio联盟
段一凡-华北理工大学1 小时前
高炉智能布料技术与炉料分布优化~系列文章14:布料制度与送风制度的协同匹配
人工智能·高炉布料·高炉料面·布料制度·送风制度
thesky1234561 小时前
评测驱动开发(EDD):让 AI 应用“说得清好坏“的方法论
人工智能·ai·大模型
AI备案指南-满满1 小时前
iPhone 18 的 Siri 跟以前到底有什么不一样?
人工智能·ai·生成式ai·大模型备案