【IJCAI2024】LeMeViT: Efficient Vision Transformer with Learnable Meta Tokens

【IJCAI2024】LeMeViT: Efficient Vision Transformer with Learnable Meta Tokens for Remote Sensing Image Interpretation

论文:https://arxiv.org/abs/2405.09789

代码:https://github.com/ViTAE-Transformer/LeMeViT

由于相邻像素和图像块之间的高度相关性,以及遥感图像中纹理和模式的重复性质,存在大量的空间冗余。如下图所示,ViT 中的自注意力机制计算每两个图像块之间的相似性,相似的token对特征表示的贡献很小,但消耗了大量的计算负载,影响了模型性能。

为此,作者提出了下图所示的框架。本质上引入了一个可学习的 meta token(类似于原型或者记忆),不断的进行 image token 和 meta token 的信息交换。值得注意的是,网络的浅层使用的是cross-attention,深层使用的是自注意力(作者解释是自注意力的性能更高)。

作者在语义分割、目标检测等多个应用上做了大量实验,结果表明该方法具有较好的性能。有个有趣的消融实验是meta token 长度对性能的影响。长度为 64、32、16 和 8时,准确率几乎相同。这进一步证实了注意力计算的冗余,表明使用较少数量的 meta token 来表示密集图像 token 的动机。最后,考虑到效率和准确性,作者选择 16 作为 meta token 长度的默认设置。

作者还可视化了 dual cross attention最后一个块中,交叉注意映射结果。自然图像上的实验结果表明,学习到的 meta token 可以很好地关注图像中的目标,有助于提高分类精度。遥感图像上的实验结果则表明不同的 meta token 负责图像的不同语义部分。

相关推荐
147API13 分钟前
评测分数不理想,什么时候值得补蒸馏数据
人工智能·深度学习·机器学习
不会写代码的女程序猿15 分钟前
养生馆采购 AI 四诊仪,5000 元预算怎么选?
大数据·人工智能·科技·ai·健康医疗
天天代码码天天27 分钟前
一个 HTML 就能跑完整 OCR:lw.PPOCR.C 发布 v0.1.0-preview.4,新增浏览器 JavaScript SDK
人工智能
AI情绪识别开源27 分钟前
检信 AI 智能推广平台(代号:JX-Promote)
人工智能·算法·erlang
俊哥V35 分钟前
每日 AI 研究简报 · 2026-08-30
人工智能·ai
Java后端的Ai之路36 分钟前
14、Python - 责任链模式
服务器·开发语言·人工智能·python·责任链模式
番茄不是西红柿kk38 分钟前
GLM-5.3-Flash 20分钟复刻《我的世界》实录
人工智能·ai·aigc·agent·我的世界
霸道流氓气质42 分钟前
Tabbit AI 原生浏览器 — 完全技术参考手册
人工智能
Python大数据分析@43 分钟前
推荐一个生成“结构化”html网页的SKILL
人工智能
阿里云大数据AI技术44 分钟前
DataWorks Data Agent 实战课堂(六):数据集成定时任务巡检
人工智能·agent