(论文速读)LINN:液体神经网络与脉冲神经元融合的可解释旋转机械故障诊断

论文题目: A liquid-impulse neural network model based on heterogeneous fusion of multimodal information for interpretable rotating machinery fault diagnosis

中文翻译: 基于多模态信息异构融合的液体-脉冲神经网络可解释旋转机械故障诊断模型

期刊: Mechanical Systems and Signal Processing,2026

摘要: 针对旋转机械故障诊断中动态特征衰减、多模态融合效率较低以及诊断可解释性不足的问题,论文提出可解释的多模态异构融合液体-脉冲神经网络(LINN)。首先构建基于微分方程的液体状态编码层,通过分块反馈机制建模非平稳信号中的时序动态演化;随后引入多通道泄漏积分发放(MC-LIF)脉冲神经元,结合替代梯度和膜电位衰减策略增强瞬态冲击特征提取;最后设计注意力引导的多模态融合机制,实现时频特征自适应整合并量化模态贡献。在高噪声和变负载测试中,LINN 以 4.1 M 参数取得超过 98.7% 的诊断精度,并在跨工况测试中取得 88.64% 的泛化准确率。消融实验验证了液体层和脉冲机制对动态建模与抗噪能力的重要作用,基于时频域注意力(TFDA)的分析进一步揭示模型对关键时频模态的响应。


一、研究背景与核心问题

旋转机械故障信号通常具有明显的非平稳性:早期弱故障可能只表现为短促冲击,随着设备状态和负载变化,同一故障的幅值、频率结构与时间演化规律也会变化。因此难点并不只是"分类",而是同时处理连续动态、瞬态冲击、多模态差异和诊断可信度。

传统 CNN 依赖固定卷积核,不擅长描述随时间连续变化的状态;一般时序网络虽然能建模依赖关系,却未必适合稀疏、高能量的冲击事件。只使用 FFT 会压缩时间信息,只使用时频图又可能损失部分紧凑频域特征,而直接拼接两种模态还可能产生尺度冲突。

论文因此把问题拆成三部分:如何跟踪机械状态的动态演化;如何增强瞬态冲击和弱故障响应;如何让 FFT 与时频图(SP)互补融合并解释最终决策。LINN 的思路可以概括为:液体神经网络负责连续动态,MC-LIF 负责瞬态冲击,注意力融合负责异构协同,TFDA 负责解释。


二、LINN 整体框架:连续动态 + 离散冲击 + 自适应融合

论文 Figure 1:LINN 整体框架

Figure 1 展示了三条核心信息流:输入端构造 FFT 与 SP 两种模态并分别编码;中间引入液体状态机制与 LIF 脉冲神经元;末端通过注意力融合完成分类,并输出定性、定量解释。

整体流程可写成:

原始振动信号 → FFT / SP → 模态编码 → 液体动态建模 + MC-LIF 冲击编码 → 注意力融合 → 故障分类 + TFDA

这里不是简单堆叠 LNN、SNN 和 Attention。三部分分别回答"状态如何连续变化""冲击何时出现""不同模态此时应该相信谁更多"。预处理部分则负责归一化和维度对齐:SP 图像映射到 0,1 并重排为 B × 3 × H × W,FFT 信号完成频谱归一化,为后续统一融合提供数值基础。


三、液体动态编码:把"状态如何变化"本身变成特征

论文 Figure 2:LNN 动态特征编码流程

液体神经网络针对非平稳和动态衰减问题。作者显式维护随输入演化的内部状态:

其中是神经元状态,控制变化速度,表示自然衰减,与 分别描述外部输入和递归状态影响。直观上,当前状态由"旧状态衰减 + 新输入驱动 + 内部反馈"共同决定。

实际计算中,作者用 Euler 方法离散化微分方程,并把长序列切成多个连续时间块。不同块之间通过

保持动态连续性。这样既利用分块降低长序列计算压力,又不会让时间块彼此割裂。

随后,注意力为关键时刻赋予更高权重,通过 () 聚合整个序列,再与原始输入的残差投影结合并做 LayerNorm。Figure 2 的"Temporal Blocks → Liquid State Encoding → Block Fusion and Dynamic Retention → Key Moment Enhancement"就是这条逻辑。其核心作用是:不只提取某个时间点的特征,而是建模设备状态如何演化、衰减以及何时发生明显变化。


四、MC-LIF 与多模态融合:捕捉冲击,再决定不同模态贡献

4.1 MC-LIF:把瞬态冲击变成"发放事件"

论文 Figure 3:MC-LIF 多通道脉冲神经网络

LNN 擅长连续动态,但轴承故障还常表现为短促冲击。MC-LIF 先对各通道卷积,再更新膜电位:

当膜电位超过阈值 () 时发放脉冲,随后重置;否则继续积累。这种机制天然适合"平时低响应、冲击出现时迅速触发"的故障模式。由于脉冲函数不可导,训练时使用替代梯度:

模型还对不同时刻、不同通道的脉冲响应进行注意力加权,因此学习的不只是"是否出现冲击",还包括"哪个通道、哪个时刻更关键"。

4.2 注意力引导的异构融合

论文 Figure 4:Attention-guided multimodal fusion

FFT 与 SP 不直接拼接,而是先分别编码,再通过 tanh 门控和 softmax 得到模态权重 :

随后加入跨模态动态残差:

加权负责融合共性,残差负责保留不同模态相对全局表示的差异,避免简单平均把特有信息抹平。

训练目标为。其中 () 是交叉熵与 Focal Loss 组合的分类损失,() 用 JS 散度约束图像和信号模态在高层语义空间的一致性,() 用于限制脉冲数量。三个损失的权重还会依据梯度方向差异动态调整,减少分类、模态对齐和脉冲稀疏之间的优化冲突。


五、实验结果、消融与可解释性分析

5.1 参数配置与主实验

论文 Table 1:LINN 核心参数配置

关键配置包括:液体编码 T = 50、β = 0.8、θ = 0.6;MC-LIF 初始阈值 θ₀ = 0.5、最大阈值 θmax = 1.2、替代梯度系数 α = 2.0;多模态注意力使用 4 个注意力头,每头维度 64。

论文 Table 2:不同负载与噪声条件下的 SOTA 对比

Table 2 的指标是 F1-score。CWRU-0HP 下,LINN 在 −6 dB 时达到 98.20%,0 dB 时达到 100%,平均 99.12%;CWRU-3HP 下分别为 98.43%、100% 和 98.94%。这说明模型的主要优势是强噪声下仍保持较小性能波动,而不是只在干净信号上获得高分。

需要注意,CWRU-2HP 上 MAIDCNN 的平均 F1 为 99.07%,略高于 LINN 的 99.01%。因此更准确的结论是:LINN 在不同负载和噪声条件下整体保持领先或接近最优,而不是每个单项都第一。

论文 Figure 5:−6 dB 与 0 dB 下的决策边界、t-SNE 和 3D 混淆矩阵

Figure 5 从特征空间补充了证据:−6 dB 强噪声下类别仍保持较清晰的决策区域,t-SNE 中类内聚集、类间分离明显,混淆矩阵以对角元素为主;噪声降低后,决策边界进一步变得平滑紧凑。

5.2 消融:三个模块分别贡献什么

论文 Table 3:LINN 消融实验

完整模型使用 FFT + SP + LC + ILIF + MF,参数量为 4.1 M,平均准确率达到 98.43 ± 0.31%。单独使用 FFT 的 LC+ILIF 为 92.65%,单独使用 SP 为 94.36%,融合后达到 98.43%,说明两种模态存在明显互补。

去掉液体编码后,模型对非平稳动态和衰减特征的描述能力下降;去掉 ILIF 后,瞬态冲击捕捉和强噪声稳定性变差;用简单特征拼接替代注意力融合时,又会产生异构尺度冲突。论文还指出,完整融合只增加约 0.3 M 参数,却带来超过 4 个百分点的准确率提升。

5.3 TFDA:从"预测正确"走向"知道模型在看什么"

论文 Figure 6:四类 TFDA 可解释性指标

作者使用 ACI、ICDR、DUI、CA 四个指标,分别衡量注意力聚焦、类内/类间结构、决策稳定性和置信度校准。在 CWRU-0HP 对比中,LINN 的 ACI = 0.85、DUI = 0.77、CA = 0.92;Transformer 的 ICDR 更低,因此其特征空间分离在该指标上更占优势。这里的意义是从不同角度检查模型,而不是把解释性压缩成一个总分。

论文 Figure 7:FFT 时间注意力与 SP 的 Grad-CAM++(此处插入原图截图)

FFT 分支的注意力呈现周期性高响应,用于定位故障冲击时刻;SP 分支的 Grad-CAM++ 激活集中在故障相关时频区域。测试集平均模态权重为 SP 0.58 ± 0.05、FFT 0.42 ± 0.05,与单模态实验中 SP 94.36%、FFT 92.65% 的性能关系一致,同时说明 FFT 仍贡献了约 42% 的决策信息。

5.4 跨工况泛化

论文 Figure 8:变工况轴承故障注入实验平台(此处插入原图截图)

Figure 8 展示由电机、调速装置、齿轮箱、负载装置、轴承试验装置和传感器组成的平台,并设置正常状态以及滚动体、内圈、外圈等多类故障,用于模拟更接近工业现场的动态负载和噪声环境。

论文 Figure 9:真实跨域工况下不同 SNR 的诊断与 TFDA 可视化

Figure 9 将准确率表现、FFT 注意力和 SP 的 Grad-CAM++ 放在一起,对比 −6 dB、0 dB 和 6 dB 条件。论文报告跨数据集/跨工况测试中的性能下降小于 10%,并强调可视化区域与故障特征频带保持较高一致性。

论文 Table 4:跨工况平均诊断性能与 TFDA 指标

Table 4 中,LINN 的 ACI = 0.82、ICDR = 0.46、DUI = 0.77、CA = 0.91、F1 = 0.89,Accuracy = 88.64%。相比单独的 LNN(80.34%)和 SNN(75.24%),完整 LINN 的准确率明显更高,说明连续动态建模和离散脉冲编码组合后形成了互补。需要注意,ICDR 越小通常越好,因此 LINN 的主要优势集中在注意聚焦、决策稳定、置信度以及最终诊断性能,而不是所有解释指标都单项最优。


六、总结与思考

如果把这篇论文压缩成一句话,LINN 的核心就是:用液体神经网络追踪机械状态的连续变化,用脉冲神经元放大瞬态冲击,再用注意力在 FFT 与时频图之间动态分配信息,最后把注意结果用于解释。

论文最值得记住的是模块分工非常明确:LNN 对应非平稳动态,MC-LIF 对应冲击事件,异构注意力对应多模态互补,TFDA 则把模型关注的时间、频率、空间区域和置信度显式呈现。实验上,LINN 以 4.1 M 参数在 CWRU 多负载、强噪声条件下保持较高 F1,并在跨工况测试中取得 88.64% 准确率;Table 3 的消融也说明性能提升来自多种机制协同,而不是简单扩容。

从方法设定上看,这篇论文提供了一个值得借鉴的故障诊断思路:当信号同时具有连续状态演化 和离散冲击事件时,可以让不同神经动力学分别处理最擅长的信息,再通过可学习融合机制完成统一决策。后续更值得验证的是这种液体-脉冲组合在更多设备、更强域偏移以及长期在线监测中的稳定性和计算收益。

相关推荐
东方佑1 小时前
v24 (Hybrid2Fast) 架构与实验报告
人工智能·深度学习·语言模型·自然语言处理·架构
阿部多瑞 ABU1 小时前
重复的辩证法:从哲学僵尸到历史唯物主义——论意识、重复与人类解放
人工智能·ai写作
枫叶丹41 小时前
从一次推理请求出发:模型、显存、网络与服务系统如何共同决定性能
网络·人工智能·chatgpt·开源·agent·codex
YangYang9YangYan1 小时前
2027 秋招|应用统计学专业投递快消市场部,岗位 JD 拆解与统计能力落地
人工智能·数据分析
lie..1 小时前
30天从零开始学AI应用开发(Day 17):ChromaDB 上手:给本地文档建一个“外挂大脑”
数据库·人工智能·oracle
deepdata_cn1 小时前
Seedance 2.5如何敲开工厂车间的门
人工智能
一水鉴天1 小时前
差-余-残三词体系:术语定稿与设计方案 20261004(豆包)
人工智能
杭州领祺科技2 小时前
27 号令横向隔离落地清单:储能边缘计算网关 ≠ 电力专用网闸,算电协同中心安全分区/纵向加密/SPDnet 怎么配
人工智能·安全·网络安全·边缘计算·储能·电力·电力监控
狂奔蜗牛(bradley)2 小时前
把 EtherCAT 初始化从 FPGA 搬到 ARM:命令通道的接口设计与11个坑
arm开发·人工智能·fpga开发·架构