船舶发动机的故障样本极其稀少,且不可避免地存在类间差异较小的难样本,给少样本条件下的故障诊断带来了很大挑战。针对这一问题,论文DCSN: Focusing on hard samples mining in small-sample fault diagnosis of marine engine提出了一种深度度量学习方法,名为深度同心孪生网络(Deep Concentric Siamese Network,简称 DCSN)。其核心想法是用一对同心边界把容易和难的样本对区分开来,让网络把主要的学习压力施加在难样本上,从而在少样本条件下也能学到可区分的故障特征。下面分四个部分展开介绍:其一,研究背景与动因;其二,DCSN 的整体框架与同心损失;其三,少样本诊断流程与算法;其四,实验设置与主要结果。
一、研究背景与动因
1.1 少样本与难样本的双重难题
船舶主机长期在海上运转,受到外界环境、振动和噪声影响,采集到的故障样本数量非常有限;同时由于不同故障模式在某些工况下的特征表现可能非常接近,使得收集到的样本中不可避免地混入一批难样本,即与本类样本相似度低、与其他类样本相似度高的样本。这两类问题叠加之后,传统的深度分类模型在小样本场景下的判别能力会受到较大影响。
论文将这一困难拆成两个维度看:一是样本量不足,导致深度模型难以充分训练;二是样本中存在难样本,导致模型即使训练充分也容易在最关键的样本上犯错。少样本与难样本同时出现,构成了船舶发动机智能诊断的代表性挑战。
1.2 现有思路的局限
论文对常见的三类思路做了分析。其一,基于迁移学习的方法,例如利用堆叠自编码器或 TrAdaBoost 把相似设备的源域数据迁移到目标设备。这类方法在源域与目标域分布差异较小时有效,但当差异较大时容易出现负迁移。其二,基于孪生网络(Siamese network)的二分类思路,通过样本配对把多分类问题转化为正负样本对的判别问题,可以有效缓解过拟合,但传统孪生网络对正负样本对的处理一视同仁,难样本与易样本得到的关照相同。其三,基于数据增强或过采样的方法,可以在一定程度上扩充样本量,但所生成的合成样本与真实样本之间的差异难以控制,存在引入额外噪声的风险。
上述方法虽各有成效,但都较少考虑难样本对诊断性能的影响。论文把目光放在这一点上:能不能让网络主动看见难样本并对它们施加更大的学习压力?这就是 DCSN 的核心出发点。
二、DCSN 的整体框架与同心损失
2.1 论文想要什么样的特征分布
论文先把目标特征空间画了出来:来自同一类别的样本应当尽量靠近彼此,类与类之间应当被明显隔开。传统的特征空间容易出现各类样本聚成一团且彼此紧挨的情况,难样本就藏在不同类别交界附近的区域里;如果所有样本对都按相同的判别准则被拉近或推开,网络在易样本上几乎不再产生梯度,对难样本的修正也就无从谈起。
论文的解决方案是引入一对同心边界:内边界半径为 r,外边界半径为 R,所有样本的特征差异度都落在这对边界形成的环形区域里。当一对正样本(同类)的差异度超过 r,或者一对负样本(异类)的差异度小于 R 时,就会触发明显的损失;反之,对易样本几乎不施加力。这样一来,难样本对就会主导梯度方向,让网络集中精力把难样本推向正确的区域。下图给出了一个直观对照:

图 1 传统特征分布与 DCSN 同心损失作用下的特征分布对比(来自论文 Fig. 1)
2.2 DCSN 整体框架
下图给出了 DCSN 的整体框架。简单地说,它由三个模块串成:其一,样本配对模块,按无放回两两配对的方式把训练集里的样本配成对,得到远多于原始样本数的训练对;其二,特征学习模块,由两路权重共享的孪生分支分别提取一对样本的深度特征,再通过差值与欧氏距离得到样本对的差异度;其三,优化目标模块,用同心损失把特征学习引向类内紧凑、类间分离的目标。整个框架如下:

图 2 DCSN 整体框架(来自论文 Fig. 3)
2.3 同心损失:让难样本承担主要的学习压力
同心损失的形式如下:
其中,W 是网络参数,是一个样本对及其标签:当两个样本来自同一类别时 Y = 0(正样本对),来自不同类别时 Y = 1(负样本对);
是样本对的差异度,由两个深度特征的欧氏距离给出;r 与 R 分别是内边界半径与外边界半径,O 是它们的共同圆心(在论文中设为坐标原点)。
这一损失有一个很直观的几何意义:当 Y = 0(正样本对)时,只要两个样本的距离不大于 r,就不产生损失;一旦
超过 r(说明这对正样本的类内距离太大),损失就会增长并把样本拉向内边界之内。当 Y = 1(负样本对)时,只要
不小于 R,就不产生损失;一旦
小于 R(说明这对负样本距离太近、几乎挤到了一起),损失就会增长并把它们推向外边界之外。换句话说,已经做得对的样本对几乎不产生梯度,难样本对则会持续贡献梯度并被网络重点修正。
论文还讨论了损失对网络参数的梯度性质。以 Y = 0 为例:当时梯度为零,对参数没有任何更新;只有
时才会产生
的非零梯度。这进一步说明,常规易样本对在训练后期几乎不再打扰网络,难样本对才会让权重真正动起来。
2.4 训练中的边界收缩策略
还有一个细节值得一提:DCSN 在训练过程中会让内边界 r 随训练逐步收缩,让同类样本更加紧凑,同时让内外边界之间的间隔不断扩大。这一收缩策略让类内聚合更紧、类间分离更明显,对少样本场景下的判别能力有直接帮助。
三、少样本诊断流程与算法
3.1 样本配对与类别平衡
样本配对是孪生网络训练的关键步骤。给定 m 个训练样本,按无放回两两组合的方式可以得到 m(m-1)/2 个有序对(i ≠ j),再加上 m 个
自配对,可以形成一个规模远大于原始样本集的样本对训练集,从而有效缓解过拟合风险。
这里有一个常被忽略的小问题:随机配对往往会让负样本对数量远多于正样本对,导致类别不平衡,少数类别的判别信息也可能被淹没。论文因此在配对时引入类别平衡约束,确保正负样本对数大致相当,使每个类别都能对训练做出均衡贡献。
3.2 特征学习:两路权重共享的孪生分支
两路样本对分别进入两条权重共享的孪生分支,每条分支由卷积层、若干残差块(RBU)、全局平均池化层(GAP)和全连接层(FC)依次组成。两个分支的权重完全相同,因此一对样本无论先后进入都会被映射到同一特征空间,差异度可直接比较。这一设计带来两个好处:其一,权重共享让模型参数大幅减少,训练更稳定;其二,特征差异度只与样本本身有关,与配对顺序无关,物理意义更清晰。
3.3 少样本诊断的整体流程
把上面的环节拼起来,就得到下图所示的少样本诊断流程,分为三步:其一,采集监测信号(例如压力信号、振动信号),预处理后划分为训练集与测试集,并对两边都做样本配对;其二,用训练样本对优化 DCSN 网络参数;其三,用测试样本与训练样本两两配对、找出最小差异度对应类别的策略完成诊断。

图 3 基于 DCSN 的少样本故障诊断流程(来自论文 Fig. 7)
四、实验设置与主要结果
4.1 数据集与实验安排
实验使用一个公开的船舶发动机故障数据集,包含 8 类健康状态:正常、气缸 1 故障、气缸 2 故障、气缸 3 故障、气缸 4 故障、气缸 5 故障、气缸 6 故障以及多缸同时故障;共 3500 个样本,每个样本含 84 维特征(最大压力、平均压力、频率相关、幅值相关、相位相关特征各若干)。数据集在原始信号基础上叠加了 60 dB 的高斯白噪声以模拟真实的低信噪比环境。
论文模拟多种少样本场景:每个类别在训练集中分别取 3、6、9、12、15 个样本(记作 NF),其余样本用作测试。每个实验重复 5 次,取均值与标准差作为最终结果。评估指标包括精确率 P、召回率 R、F1 分数和准确率 Acc,覆盖了正负样本均衡性与整体正确率两个层面。
4.2 主要对比结果
论文把 DCSN 与 CNN、DRN、DSN-CNN、DSN-DRN、DCSN-CNN 五种模型在五种 NF 下做了对比,结论可总结为两点。其一,在所有 NF 设定下,DCSN-DRN 的 P/R/F1/Acc 四项指标都优于其他对比方法,特别是在 NF = 3 这种极端少样本条件下提升最明显,说明同心损失与孪生结构的结合确实能让网络在极少样本下也学到判别性信息。其二,把同心损失加孪生结构嫁接到不同的骨干网络上(CNN 或 DRN)都能带来稳定的提升,说明这一损失设计是相对独立的插件,对底层网络结构不敏感。
为了让对比结果更直观,论文在每类训练样本数为 15 的设定下,把各模型测试样本的特征画成了二维散点图(网络全连接层的输出维数设为 2,便于直接观察特征分布)。从图中可以看到,CNN 与 DRN 学到的特征中多个类别存在明显的类间重叠;换成四组带孪生结构的模型后,正常类样本聚在一个小区域内,各故障类分布在正常区域之外,并且故障程度越严重、离正常样本越远,这与故障逐渐恶化的物理过程相对应。值得注意的是,部分单缸故障类别大体呈两条长条状分布,对应单缸故障的两种成因,即缸内压缩比下降与喷油量减少;F7(进气歧管压力下降)则近似呈一条细长带状。综合来看,DCSN-DRN 的类间分离最清晰、类间重叠最少,说明它学到的特征在类间是最可区分的:

图 4 NF = 15 时各模型测试样本的二维特征分布(来自论文 Fig. 10)
4.3 一些细节
论文还做了若干消融实验,得到三点关键观察。其一,内边界半径 r 较小时类内聚合更紧、整体准确率更高,但过小会让优化困难,因此存在一个最优区间;外边界半径 R 在 4 附近表现最好,增大或减小都会降低性能。其二,输出特征维度增大到一定程度后再继续增大,收益会趋于饱和,说明在少样本条件下无需追求过高的特征维度。其三,DCSN 在时间成本上比纯 CNN 模型有所增加(模型参数因孪生结构翻倍,加上样本配对带来的训练集扩大),但相对 Siamese 类模型只多了差异度计算与边界设置的开销,整体仍在可接受范围。综合来看,DCSN 在多个少样本设定下都取得了较好的诊断效果。
五、小结
综合来看,DCSN 把少样本故障诊断中的两个关键难题,样本量不足和样本中存在难样本,同时纳入考虑:一方面通过两两配对与孪生结构把样本量放大并把多分类问题转化为二分类问题;另一方面通过同心损失让网络把梯度注向最难啃的硬骨头,并通过内边界收缩持续把同类样本压得更紧。其工程友好之处在于损失设计相对独立,既可以嫁接到 CNN 也可以嫁接到 DRN 等更深的骨干网络上,对于船舶主机这类少样本但故障类型多、类间差异不均的场景具有一定参考价值。
当然,DCSN 也并非没有改进空间:其一,孪生结构带来参数翻倍与训练时长上升,需要在算力受限的现场设备上进一步做轻量化;其二,同心损失中的 r 与 R 是关键超参数,目前依赖经验设定,能否根据数据自适应地选取,是值得继续研究的问题。
原文链接:https://www.sciencedirect.com/science/article/abs/pii/S0263224124008145
欢迎阅读。
参考资料