论文笔记:Treat Visual Tokens as Text? But Your MLLM Only Needs Fewer Efforts to See

2024 10月的arxiv

1 主要idea

  • 针对多模态大模型(如LLaVA),提出了一系列高效的剪枝策略
    • 在显著降低计算开销(多达 88%)的同时,保持了模型在多模态任务中的性能表现

2 目前的问题

  • 与文本 token 相比,视觉 token 的数量往往更为庞大
    • 在 LLaVA 模型中,处理一张图像涉及超过 500 个视觉 token,而对应的文本 token 只有数十个
      • ------>计算效率低下
      • ------>视觉数据固有的空间稀疏性导致许多计算是冗余的
        • 大部分视觉 token 之间的交互权重很低,仅有邻近 token 之间的交互是关键
        • 在深层模型中,视觉 token 对文本生成的影响逐渐减弱
  • 目前的优化策略通常以牺牲模型性能为代价
    • ------>如何在保持性能的同时显著降低计算复杂度,仍是一个急需解决的

3 论文方法

4 实验

效果没怎么降,FLOP降多了

相关推荐
浩风祭月1 小时前
ChatGPT o3将在8月26日退出:Plus、Pro用户现在该迁移什么
人工智能·chatgpt·openai o3·模型迁移
布列瑟农的星空1 小时前
Milvus内部机制浅入浅出
人工智能·agent
东离与糖宝1 小时前
WorkBuddy记忆机制拆解:别再反复交代需求
人工智能
ZHOU_WUYI1 小时前
7. fastwam 模型 _predict_action_noise_with_cache部分
人工智能·pytorch·深度学习
测试者家园2 小时前
AI如何发现测试人员看不到的问题?
人工智能·职场和发展·agent·智能化测试·幻觉检测·行为漂移
WoooChi2 小时前
DailyTech-20260807
人工智能·科技·业界资讯
新知图书2 小时前
12.1 技术文档与表达优化
人工智能·ai助手·千问
华清远见成都中心3 小时前
卷积神经网络(CNN)为什么能够识别图像?
人工智能·深度学习·cnn
派拉软件3 小时前
派拉AIGS应用场景解析:在客户实际环境中,AI Agent如何做到“可控、可管、可审“
大数据·人工智能
创世宇图3 小时前
DeepSeek API涨价的技术归因与开发者成本优化实操
人工智能·deepseek