CLGSI

1、研究动机:

MOSI 和 MOSEI 的标签不是简单的正面、负面分类,而是从 −3 到 +3 的连续情感强度。

但是,很多对比学习方法会根据类别、标签区间或文本相似度选择正负样本。例如,两个样本的标签分别是 −0.2 和 −0.4,虽然情感非常接近,却可能因为样本选择机制而被作为负样本推远。

与此同时,标签差异为 −0.4 与 +0.6、−0.4 与 +1.0 的两组样本,通常又会受到同样强度的排斥。实际上,后者的情感差异更大,理应在表示空间中被推得更远。

所以作者认为,MSA 中的对比学习不应该只回答:它们是不是正负样本?
还应该进一步回答:它们有多相似或多不同?应该拉近或推远多少?

2、研究思路:

CLGSI 先分别编码文本、音频和视觉,再用 Subnet 保留每种模态的独有信息,同时利用情感强度对比学习对齐三种模态的公共表示,并通过 GLFK 提取跨模态共同信息,最后联合公共特征和特有特征完成情感预测。

从方法主线来看,该模型是:模态特有信息+情感强度约束下的公共信息→最终情感预测

特色设计:

损失函数

图里出现了两个损失:

Lcl:对比学习损失;

Ltask:最终情感预测损失。

Loverall​=Ltask​+γLcl​

Ltask 要求最终预测结果正确,例如真实标签是 +0.6,模型预测就应该尽量接近 +0.6。

Lcl:则要求中间表示空间合理,让情感相近的样本靠近、情感差异大的样本远离。

情感强度引导的对比学习

对比学习不是用来"融合不同样本"的,而是利用不同样本之间的关系,约束每个样本融合后的表示空间。

对比学习则在训练阶段比较不同样本的表示,决定哪些样本应该靠近、哪些应该远离。 它可以放在三个位置。

1)放在融合之前(这就是 CLGSI 当前的做法)

模型先得到:Tc,Ac,Vc然后在这些单模态公共表示上计算对比损失,使三种模态进入一个相对统一的情感空间。

2)放在融合之后

假设模型融合后得到样本表示:zi=Fusion(Ti,Ai,Vi) 就可以根据情感标签距离,在 zi 和 z j 之间计算加权对比损失: L fusion-cl =Contrast(zi,zj,D(i,j))

3)用在完整样本与缺失样本之间

对于你之前考虑的缺失模态方向,这个思想也可以自然改造。

对于同一个样本,可以生成:zifull​和zimissing​

前者是完整三模态的融合表示,后者是缺失或损坏条件下的融合表示。因为它们来自同一个样本,应当作为强正样本:模型被要求在模态缺失后,仍然保持核心情感语义不变。

不同样本之间则继续根据情感强度差异确定关系:

yi​−yj​∣较小⇒软正样本 ∣yi−yj∣较大⇒负样本

这样,对比学习就不只是一般的标签监督,而是同时约束:

  1. 完整与缺失条件的一致性;
  2. 连续情感标签的空间结构;
  3. 不同模态状态下的融合稳定性。

这比直接照搬 CLGSI 更适合缺失鲁棒性研究。

2、思路:

1)先决定正负样本关系 对于样本 i 和 j,

先计算情感标签距离: D(i,j)=∣yi−yj|论文将标签归一化到 −1,1,并设置阈值: κ=0.4于是: D(i,j)≤0.4表示两者情感强度接近,被划为正样本对;而 D(i,j)>0.4表示情感差异较大,被划为负样本对。 这里解决的是"应该拉近还是推远"。

2)再决定拉近或推远的力度

对于正样本对,权重为: w(i,j)=1.5∣tanh(D(i,j)−2κ)∣ 在正样本范围内,情感标签越接近,权重越大。也就是说,两个几乎具有相同情感强度的样本,应当被更强地拉近;两个刚好处在阈值边缘的正样本,拉近力度较弱。

对于负样本对,权重为:w(i,j) =1.5∣tanh(D(i,j))∣ 负样本的情感差异越大,权重越大。也就是说,轻微正面和轻微负面的样本虽然要分开,但不必推得特别远;强烈正面和强烈负面的样本则应受到更强的分离约束。

效果

数据集表现:

1、CLGSI 在 MOSI 上报告:

CLGSI 的 Acc-7 和排除零值的 Acc-2 很突出,Acc-7 相比表中较强基线提升较明显。但 Corr 并不是表中最优,Self-MM 报告了 0.796;因此不能概括为所有指标全面超过已有方法。

2、MOSEI

CLGSI 在 MOSEI 的二分类指标上具有优势,但并未在全部回归和多分类指标上超过 ConFEDE。

3、SIMS

它的整体表现不错,但弱于作者复现的 ConFEDE 在 F1、Acc-5、MAE 和 Corr 上的结果。论文将这一差异归因于 ConFEDE 可以利用 SIMS 提供的单模态标签进行预训练,而 CLGSI 不依赖额外的单模态标签。

消融实验

其他

论文题目是 《CLGSI: A Multimodal Sentiment Analysis Framework based on Contrastive Learning Guided by Sentiment Intensity》,中文可以译为"基于情感强度引导对比学习的多模态情感分析框架"。

作者为 Yang Yang、Xunde Dong 和 Yupeng Qiang,来自华南理工大学自动化科学与工程学院。论文发表于 2024 年 NAACL Findings,页码为 2099---2110。作者在论文中给出了官方代码仓库地址。

感悟:

这篇论文属于完整模态论文,它get到了要把每个模态的特征分成共有和特有,(有使用一个subnet结构得到论文的单模态特征;也有使用一个FC模态对齐特征维度之后,再用GLFK来融合公共特征);比较创新的点还在于他用对比学习来约束三种模态的公共表示;

所以我们看一篇论文,损失函数很重要,它是模型训练的"指挥棒",它直接决定了我们模块训练的方向

相关推荐
冬奇Lab1 小时前
开源项目第167期:Buzz — Block 开源的人机协作工作空间,Agent 是成员不是 Bot
人工智能·开源·agent
生命涌现1 小时前
生命涌现的小龙虾技能之【Human Pose Recognition Skill | 人体姿态识别技能】简介
人工智能·目标检测·计算机视觉·多模态大模型·openclaw小龙虾技能
funkygroove1 小时前
ChatGPT Business 包含 Pro 吗?两者区别一次说清
人工智能·chatgpt
神奇霸王龙1 小时前
Gemini CLI 中转站配置使用教程
人工智能·ai·ai作画·aigc·ai编程·gemini·goolge
stereohomology2 小时前
Kimi K3编程实力远超GLM5.2:一个Trae复赛证据
人工智能·大模型·对比·why不coding
阳光是sunny2 小时前
LangGraph实战教程:状态管理与`graph.invoke`入参深度解析
前端·人工智能·后端
老猿AI洞察2 小时前
7月25日热点:马斯克说中国AI有望成为全球领导者,这次不是客套话
大数据·人工智能
AI_小站2 小时前
Loop Engineering又是啥?一文讲清企业Agent落地的四层工程进化论
java·人工智能·架构·prompt·大模型开发·智能体·大模型应用