论文阅读——Align before Fuse

Align before Fuse: Vision and Language Representation Learning with Momentum Distillation

image-text contrastive learning(ITC)用在单模态，masked language modeling (MLM) and image-text matching (ITM) 用在多模态。

单模态编码器的表示上引入了中间图像文本对比（ITC）损失，目的是在融合前更好地学习单模态表征：

（1）它对齐图像特征和文本特征，使多模态编码器更容易执行跨模态学习;

（2）改进了单模态编码器，以更好地理解图像和文本的语义；

（3）它学习一个共同的低维空间来嵌入图像和文本，这使得图像文本匹配目标能够通过我们的对比硬负挖掘找到更多信息样本。

就是对图片和文本的[CLS]token经过encoder后得到，，经过线性映射得到，，（gv 和 gw 是将 [CLS] 嵌入映射到归一化低维（256-d）表示的线性变换）计算相似度（点乘），然后使匹配的相似度接近1 ，不匹配的接近0。维护两个队列来存储来自动量单模态编码器的最新 M 个图像文本表示，归一化后为。然后每张图片和其他M个文本，每个文本和其他M个图片都计算相似度。

Masked Language Modeling利用图像和上下文文本来预测掩码单词。我们以 15% 的概率随机屏蔽输入标记，并将其替换为特殊标记 [MASK]。MLM最小化屏蔽文本token预测和真实token之间的交叉熵。

Image-Text Matching预测一对图像和文本是正（匹配）还是负（不匹配）。我们使用多模态编码器的 [CLS] 标记的输出embedding作为图像-文本对的联合表示，并附加一个全连接（FC）层，然后是 softmax 来预测二类概率。

如果负图像-文本对具有相似的语义但在细粒度细节上有所不同，它们是困难样本。、

我们提出了一种策略，以零计算开销对 ITM 任务进行硬负例采样。如果负图像-文本对具有相似的语义但在细粒度细节上有所不同，那么它们就很困难。我们使用等式 1 中的对比相似性来查找批量中的硬负例。对于小批量中的每张图像，我们按照对比相似度分布从同一批次中采样一个负文本，其中与图像更相似的文本有更高的机会被采样。同样，我们还为每个文本采样一张硬负片图像。

总损失：

Momentum Distillation

用于预训练的图像文本对主要是从网络上收集的，并且它们往往是有噪声的。正对通常是弱相关的：文本可能包含与图像无关的单词，或者图像可能包含文本中未描述的实体。对于 ITC 学习，图像的否定文本也可能与图像的内容匹配。对于 MLM，可能存在与同样好（或更好）描述图像的注释不同的其他词。然而，ITC 和 MLM 的独热标签会惩罚所有负面预测，无论其正确性如何。