1、研究动机:
MOSI 和 MOSEI 的标签不是简单的正面、负面分类,而是从 −3 到 +3 的连续情感强度。
但是,很多对比学习方法会根据类别、标签区间或文本相似度选择正负样本。例如,两个样本的标签分别是 −0.2 和 −0.4,虽然情感非常接近,却可能因为样本选择机制而被作为负样本推远。
与此同时,标签差异为 −0.4 与 +0.6、−0.4 与 +1.0 的两组样本,通常又会受到同样强度的排斥。实际上,后者的情感差异更大,理应在表示空间中被推得更远。
所以作者认为,MSA 中的对比学习不应该只回答:它们是不是正负样本?
还应该进一步回答:它们有多相似或多不同?应该拉近或推远多少?
2、研究思路:
CLGSI 先分别编码文本、音频和视觉,再用 Subnet 保留每种模态的独有信息,同时利用情感强度对比学习对齐三种模态的公共表示,并通过 GLFK 提取跨模态共同信息,最后联合公共特征和特有特征完成情感预测。
从方法主线来看,该模型是:模态特有信息+情感强度约束下的公共信息→最终情感预测

特色设计:
损失函数
图里出现了两个损失:
Lcl:对比学习损失;
Ltask:最终情感预测损失。
Loverall=Ltask+γLcl
Ltask 要求最终预测结果正确,例如真实标签是 +0.6,模型预测就应该尽量接近 +0.6。
Lcl:则要求中间表示空间合理,让情感相近的样本靠近、情感差异大的样本远离。
情感强度引导的对比学习
对比学习不是用来"融合不同样本"的,而是利用不同样本之间的关系,约束每个样本融合后的表示空间。
对比学习则在训练阶段比较不同样本的表示,决定哪些样本应该靠近、哪些应该远离。 它可以放在三个位置。
1)放在融合之前(这就是 CLGSI 当前的做法)
模型先得到:Tc,Ac,Vc然后在这些单模态公共表示上计算对比损失,使三种模态进入一个相对统一的情感空间。
2)放在融合之后
假设模型融合后得到样本表示:zi=Fusion(Ti,Ai,Vi) 就可以根据情感标签距离,在 zi 和 z j 之间计算加权对比损失: L fusion-cl =Contrast(zi,zj,D(i,j))
3)用在完整样本与缺失样本之间
对于你之前考虑的缺失模态方向,这个思想也可以自然改造。
对于同一个样本,可以生成:zifull和zimissing
前者是完整三模态的融合表示,后者是缺失或损坏条件下的融合表示。因为它们来自同一个样本,应当作为强正样本:模型被要求在模态缺失后,仍然保持核心情感语义不变。
不同样本之间则继续根据情感强度差异确定关系:
yi−yj∣较小⇒软正样本 ∣yi−yj∣较大⇒负样本
这样,对比学习就不只是一般的标签监督,而是同时约束:
- 完整与缺失条件的一致性;
- 连续情感标签的空间结构;
- 不同模态状态下的融合稳定性。
这比直接照搬 CLGSI 更适合缺失鲁棒性研究。
2、思路:
1)先决定正负样本关系 对于样本 i 和 j,
先计算情感标签距离: D(i,j)=∣yi−yj|论文将标签归一化到 −1,1,并设置阈值: κ=0.4于是: D(i,j)≤0.4表示两者情感强度接近,被划为正样本对;而 D(i,j)>0.4表示情感差异较大,被划为负样本对。 这里解决的是"应该拉近还是推远"。
2)再决定拉近或推远的力度
对于正样本对,权重为: w(i,j)=1.5∣tanh(D(i,j)−2κ)∣ 在正样本范围内,情感标签越接近,权重越大。也就是说,两个几乎具有相同情感强度的样本,应当被更强地拉近;两个刚好处在阈值边缘的正样本,拉近力度较弱。
对于负样本对,权重为:w(i,j) =1.5∣tanh(D(i,j))∣ 负样本的情感差异越大,权重越大。也就是说,轻微正面和轻微负面的样本虽然要分开,但不必推得特别远;强烈正面和强烈负面的样本则应受到更强的分离约束。

效果
数据集表现:
1、CLGSI 在 MOSI 上报告:
CLGSI 的 Acc-7 和排除零值的 Acc-2 很突出,Acc-7 相比表中较强基线提升较明显。但 Corr 并不是表中最优,Self-MM 报告了 0.796;因此不能概括为所有指标全面超过已有方法。
2、MOSEI
CLGSI 在 MOSEI 的二分类指标上具有优势,但并未在全部回归和多分类指标上超过 ConFEDE。
3、SIMS
它的整体表现不错,但弱于作者复现的 ConFEDE 在 F1、Acc-5、MAE 和 Corr 上的结果。论文将这一差异归因于 ConFEDE 可以利用 SIMS 提供的单模态标签进行预训练,而 CLGSI 不依赖额外的单模态标签。

消融实验

其他
论文题目是 《CLGSI: A Multimodal Sentiment Analysis Framework based on Contrastive Learning Guided by Sentiment Intensity》,中文可以译为"基于情感强度引导对比学习的多模态情感分析框架"。
作者为 Yang Yang、Xunde Dong 和 Yupeng Qiang,来自华南理工大学自动化科学与工程学院。论文发表于 2024 年 NAACL Findings,页码为 2099---2110。作者在论文中给出了官方代码仓库地址。
感悟:
这篇论文属于完整模态论文,它get到了要把每个模态的特征分成共有和特有,(有使用一个subnet结构得到论文的单模态特征;也有使用一个FC模态对齐特征维度之后,再用GLFK来融合公共特征);比较创新的点还在于他用对比学习来约束三种模态的公共表示;
所以我们看一篇论文,损失函数很重要,它是模型训练的"指挥棒",它直接决定了我们模块训练的方向

