CLGSI

1、研究动机:

MOSI 和 MOSEI 的标签不是简单的正面、负面分类,而是从 −3 到 +3 的连续情感强度。

但是,很多对比学习方法会根据类别、标签区间或文本相似度选择正负样本。例如,两个样本的标签分别是 −0.2 和 −0.4,虽然情感非常接近,却可能因为样本选择机制而被作为负样本推远。

与此同时,标签差异为 −0.4 与 +0.6、−0.4 与 +1.0 的两组样本,通常又会受到同样强度的排斥。实际上,后者的情感差异更大,理应在表示空间中被推得更远。

所以作者认为,MSA 中的对比学习不应该只回答:它们是不是正负样本?
还应该进一步回答:它们有多相似或多不同?应该拉近或推远多少?

2、研究思路:

CLGSI 先分别编码文本、音频和视觉,再用 Subnet 保留每种模态的独有信息,同时利用情感强度对比学习对齐三种模态的公共表示,并通过 GLFK 提取跨模态共同信息,最后联合公共特征和特有特征完成情感预测。

从方法主线来看,该模型是:模态特有信息+情感强度约束下的公共信息→最终情感预测

特色设计:

损失函数

图里出现了两个损失:

Lcl:对比学习损失;

Ltask:最终情感预测损失。

Loverall​=Ltask​+γLcl​

Ltask 要求最终预测结果正确,例如真实标签是 +0.6,模型预测就应该尽量接近 +0.6。

Lcl:则要求中间表示空间合理,让情感相近的样本靠近、情感差异大的样本远离。

情感强度引导的对比学习

对比学习不是用来"融合不同样本"的,而是利用不同样本之间的关系,约束每个样本融合后的表示空间。

对比学习则在训练阶段比较不同样本的表示,决定哪些样本应该靠近、哪些应该远离。 它可以放在三个位置。

1)放在融合之前(这就是 CLGSI 当前的做法)

模型先得到:Tc,Ac,Vc然后在这些单模态公共表示上计算对比损失,使三种模态进入一个相对统一的情感空间。

2)放在融合之后

假设模型融合后得到样本表示:zi=Fusion(Ti,Ai,Vi) 就可以根据情感标签距离,在 zi 和 z j 之间计算加权对比损失: L fusion-cl =Contrast(zi,zj,D(i,j))

3)用在完整样本与缺失样本之间

对于你之前考虑的缺失模态方向,这个思想也可以自然改造。

对于同一个样本,可以生成:zifull​和zimissing​

前者是完整三模态的融合表示,后者是缺失或损坏条件下的融合表示。因为它们来自同一个样本,应当作为强正样本:模型被要求在模态缺失后,仍然保持核心情感语义不变。

不同样本之间则继续根据情感强度差异确定关系:

yi​−yj​∣较小⇒软正样本 ∣yi−yj∣较大⇒负样本

这样,对比学习就不只是一般的标签监督,而是同时约束:

  1. 完整与缺失条件的一致性;
  2. 连续情感标签的空间结构;
  3. 不同模态状态下的融合稳定性。

这比直接照搬 CLGSI 更适合缺失鲁棒性研究。

2、思路:

1)先决定正负样本关系 对于样本 i 和 j,

先计算情感标签距离: D(i,j)=∣yi−yj|论文将标签归一化到 −1,1,并设置阈值: κ=0.4于是: D(i,j)≤0.4表示两者情感强度接近,被划为正样本对;而 D(i,j)>0.4表示情感差异较大,被划为负样本对。 这里解决的是"应该拉近还是推远"。

2)再决定拉近或推远的力度

对于正样本对,权重为: w(i,j)=1.5∣tanh(D(i,j)−2κ)∣ 在正样本范围内,情感标签越接近,权重越大。也就是说,两个几乎具有相同情感强度的样本,应当被更强地拉近;两个刚好处在阈值边缘的正样本,拉近力度较弱。

对于负样本对,权重为:w(i,j) =1.5∣tanh(D(i,j))∣ 负样本的情感差异越大,权重越大。也就是说,轻微正面和轻微负面的样本虽然要分开,但不必推得特别远;强烈正面和强烈负面的样本则应受到更强的分离约束。

效果

数据集表现:

1、CLGSI 在 MOSI 上报告:

CLGSI 的 Acc-7 和排除零值的 Acc-2 很突出,Acc-7 相比表中较强基线提升较明显。但 Corr 并不是表中最优,Self-MM 报告了 0.796;因此不能概括为所有指标全面超过已有方法。

2、MOSEI

CLGSI 在 MOSEI 的二分类指标上具有优势,但并未在全部回归和多分类指标上超过 ConFEDE。

3、SIMS

它的整体表现不错,但弱于作者复现的 ConFEDE 在 F1、Acc-5、MAE 和 Corr 上的结果。论文将这一差异归因于 ConFEDE 可以利用 SIMS 提供的单模态标签进行预训练,而 CLGSI 不依赖额外的单模态标签。

消融实验

其他

论文题目是 《CLGSI: A Multimodal Sentiment Analysis Framework based on Contrastive Learning Guided by Sentiment Intensity》,中文可以译为"基于情感强度引导对比学习的多模态情感分析框架"。

作者为 Yang Yang、Xunde Dong 和 Yupeng Qiang,来自华南理工大学自动化科学与工程学院。论文发表于 2024 年 NAACL Findings,页码为 2099---2110。作者在论文中给出了官方代码仓库地址。

感悟:

这篇论文属于完整模态论文,它get到了要把每个模态的特征分成共有和特有,(有使用一个subnet结构得到论文的单模态特征;也有使用一个FC模态对齐特征维度之后,再用GLFK来融合公共特征);比较创新的点还在于他用对比学习来约束三种模态的公共表示;

所以我们看一篇论文,损失函数很重要,它是模型训练的"指挥棒",它直接决定了我们模块训练的方向

相关推荐
回眸&啤酒鸭5 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
一隅论数智5 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
倒头就睡的小比特5 天前
算法竞赛C++常用的STL
c++·算法
AI的探索之旅5 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein5 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
小羊没烦恼!5 天前
初探性能优化——2个月到4小时的性能提升
java·开发语言·windows·算法·c#
LaughingZhu5 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
美狐美颜SDK开放平台5 天前
开发直播APP时如何接入视频美颜SDK?开发流程与注意事项
android·人工智能·计算机视觉·音视频·直播美颜sdk
wukangjupingbb5 天前
智能网联汽车安全能力框架
人工智能