【IJCAI2024】LeMeViT: Efficient Vision Transformer with Learnable Meta Tokens

【IJCAI2024】LeMeViT: Efficient Vision Transformer with Learnable Meta Tokens for Remote Sensing Image Interpretation

论文:https://arxiv.org/abs/2405.09789

代码:https://github.com/ViTAE-Transformer/LeMeViT

由于相邻像素和图像块之间的高度相关性,以及遥感图像中纹理和模式的重复性质,存在大量的空间冗余。如下图所示,ViT 中的自注意力机制计算每两个图像块之间的相似性,相似的token对特征表示的贡献很小,但消耗了大量的计算负载,影响了模型性能。

为此,作者提出了下图所示的框架。本质上引入了一个可学习的 meta token(类似于原型或者记忆),不断的进行 image token 和 meta token 的信息交换。值得注意的是,网络的浅层使用的是cross-attention,深层使用的是自注意力(作者解释是自注意力的性能更高)。

作者在语义分割、目标检测等多个应用上做了大量实验,结果表明该方法具有较好的性能。有个有趣的消融实验是meta token 长度对性能的影响。长度为 64、32、16 和 8时,准确率几乎相同。这进一步证实了注意力计算的冗余,表明使用较少数量的 meta token 来表示密集图像 token 的动机。最后,考虑到效率和准确性,作者选择 16 作为 meta token 长度的默认设置。

作者还可视化了 dual cross attention最后一个块中,交叉注意映射结果。自然图像上的实验结果表明,学习到的 meta token 可以很好地关注图像中的目标,有助于提高分类精度。遥感图像上的实验结果则表明不同的 meta token 负责图像的不同语义部分。

相关推荐
树獭哥5 分钟前
量化金融入门:从数据规则到随机游走与凯利公式
人工智能·算法·金融·量化金融
联盟分享专家6 分钟前
2026独立站引流推广:低成本获取网站精准流量的7个渠道
人工智能
G智爱AI12 分钟前
2026工作汇报PPT AI工具实测|主流省时办公工具横向对比
人工智能·powerpoint
迪康coolmu12 分钟前
当大模型遇上终端安全—AI驱动的智能运维实践
运维·人工智能·安全
财迅通Ai13 分钟前
科源制药携手腾讯云推进AI办公迭代升级
人工智能·云计算·腾讯云·科源制药
DS随心转APP19 分钟前
实测 AI 导出鸭实操效果,依托 AI 直接生成 word 功能横向比对五类导出办法,梳理办公文档转换最优路径
人工智能·ai·word·deepseek·ai导出鸭
前沿在线27 分钟前
2026 WRC世界机器人大会| 黑芝麻智能展台亮点
人工智能·ai·大模型
QYRdata34 分钟前
28.7%年复合增速锚定AI模型安全赛道,2026-2032年行业步入高速扩容新阶段
人工智能·安全
皮卡丘不断更35 分钟前
Vibe Coding 做完原型后:给网页项目加上任务、验证和人工确认
人工智能·软件工程
Leo.yuan41 分钟前
FineDataLink 5.0 vs Great Expectations:数据质量治理工具深度横评,国产低代码方案能否替代开源标杆?
大数据·人工智能