论文笔记:Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See

2024 10月的arxiv

1 主要idea

  • 针对多模态大模型(如LLaVA),提出了一系列高效的剪枝策略
    • 在显著降低计算开销(多达 88%)的同时,保持了模型在多模态任务中的性能表现

2 目前的问题

  • 与文本 token 相比,视觉 token 的数量往往更为庞大
    • 在 LLaVA 模型中,处理一张图像涉及超过 500 个视觉 token,而对应的文本 token 只有数十个
      • ------>计算效率低下
      • ------>视觉数据固有的空间稀疏性导致许多计算是冗余的
        • 大部分视觉 token 之间的交互权重很低,仅有邻近 token 之间的交互是关键
        • 在深层模型中,视觉 token 对文本生成的影响逐渐减弱
  • 目前的优化策略通常以牺牲模型性能为代价
    • ------>如何在保持性能的同时显著降低计算复杂度,仍是一个急需解决的

3 论文方法

4 实验

效果没怎么降,FLOP降多了

相关推荐
TG_yunshuguoji几秒前
阿里云代理商:阿里云部署OpenClaw 一键更新升级指南
服务器·人工智能·阿里云·云计算
郝学胜-神的一滴几秒前
深度学习框架新纪元:PyTorch核心原理与工程实践全解析
人工智能·pytorch·python·深度学习·机器学习
禹笑笑-AI食用指南1 分钟前
分享一个 OpenClaw 协同平台+CLI+工具调用思路+实战!
人工智能·ai·openclaw·龙虾
ETFOption2 分钟前
50ETF期权分仓技术讲解(三):分仓系统技术实现与平台选择指南
人工智能·区块链
EasyDSS4 分钟前
视频会议EasyDSS语音转写STT/AI会议摘要/AI大模型智能技术重构会议全流程
人工智能·重构·音视频·ai大模型·语音转写·stt·点播技术
大写-凌祁4 分钟前
VHM:多功能且诚实的遥感视觉语言模型
人工智能·深度学习·计算机视觉·语言模型·aigc
老陈测评4 分钟前
从“工具“到“社群场域“:健康管理APP社交化转型的价值重构与隐私博弈
人工智能·健康医疗
涛涛北京4 分钟前
107-agent调研
人工智能
Godspeed Zhao5 分钟前
科技信息最前沿202603——AI机遇
人工智能·科技
乾元5 分钟前
API 安全: 保护 AI 应用的交互接口
网络·人工智能·安全·web安全·机器学习·架构·安全架构