论文阅读·多模态工作

ALBEF:ALign BEfore Fusion

  • 动机:预训练的视觉特征和文本特征一开始间隔很远,不利于在最后多模态的编码器进行学习(对齐)
  • 模型本质上:就是CLIP的模型,但是为了保留一个多模态的编码器,因此将BERT的模型拆分成文本和多模态编码器(使用交叉注意力对齐)
  • 三种损失:图文对比损失,图文匹配损失,语言模型损失
  • 图文匹配损失:给定图像和文本,输出一个二分类值,表示是否匹配。这一步通过利用对比损失构造最难样本进行加速。
  • 语言模型损失:给定图像和掩码后的文本,输出掩码处的文本

VLMO

  • 动机:同一双塔模型(CLIP,视觉和文本编码器完全独立且分开);单塔模型(有一个多模态编码器,推理速度)
  • 模型:MOE的架构,只不过MOE换成模态的专家FFN,有一个负责模态融合FFN(VL-FFN)
  • 采用共享注意力权重,分阶段训练单一模态,多模态的训练方式


BLIP

  • 动机:之前工作不能直接实现 的多模态的文本生成(只有解码器),且数据大多数存在图文不匹配问题
  • 模型:借鉴了VLMO的思路,多一个文本模态的解码器,不同模态的编码器架构有一点不同,但是关键是共享大多数参数
  • 自举的方式筛选和增强数据。

BEIT-3

  • 动机:利用掩码语言损失来直接进行损失计算 。同一个多个模态间的计算。
相关推荐
chnyi6_ya7 小时前
论文阅读笔记 | One Sentence, One Drama: 基于多智能体系统的个性化短剧生成
论文阅读·笔记
小马哥crazymxm9 小时前
Arxiv论文周选 (2026-W28)
论文阅读·人工智能·科技
m4Rk_16 小时前
【论文阅读】Agent 记忆机制(20):RecMem——只在信息反复出现时进行长期记忆巩固
论文阅读·人工智能·学习·开源·github
m4Rk_1 天前
【论文阅读】Agent 记忆机制(22):FluxMem——根据对话结构动态选择记忆组织方式
论文阅读·人工智能·学习
万里鹏程转瞬至3 天前
论文简读:Boogu-Image 图像生成与编辑模型
论文阅读·深度学习·aigc
Rocky Ding*4 天前
一文读懂Kimi k1.5大模型核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·kimi k1.5
SimpleLearingAI6 天前
论文解读:RECCE — 端到端重建-分类学习的人脸伪造检测
论文阅读
柳叶方舟12 天前
npj Digital Medicine IF=15.1 | 多模态数字活检:术前无创预测胃癌隐匿性腹膜转移
论文阅读·人工智能·健康医疗
chnyi6_ya16 天前
论文阅读笔记 | VIDEOPHY: Evaluating Physical Commonsense for Video Generation
论文阅读·笔记
闲研随记16 天前
【文献阅读 ICML 2026】RL算法:R2VPO
论文阅读·人工智能·算法·强化学习·icml·rl算法