航空发动机故障诊断专用智能体(四):深度强化学习与自适应奖励机制

在前序模块完成时序特征的低维压缩与空间拉伸后,诊断系统仍面临着分类决策层面的严苛挑战:由于不同故障类型与正常状态在样本总量上存在巨大的数量级差距,常规监督学习分类器在训练过程中往往会自发偏向占绝对多数的正常样本,从而忽视少数关键故障模式。

在论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》中,将多分类诊断任务重构为序贯决策与环境交互过程,构建了基于深度强化学习的类型识别模块,通过解耦状态价值评估与设计非对称奖励规则,使智能体能够在极端不平衡样本下维持对稀有故障的敏感度。

该模块首先将诊断流程规范化为标准的强化学习交互回路。由前端特征区分模块处理后的时序表征被作为环境状态输入智能体;智能体根据当前状态选择输出一个动作,该动作直接对应发动机的某种健康状态或特定故障类别;模拟的运维环境接收动作并将其与真实标签进行比对,依据预设的反馈规则向智能体反馈即时奖惩数值;同时,当前状态、采取动作、获得奖励以及后续状态被打包存入经验回放池中。通过不断从回放池中采样历史交互经验,智能体得以通过持续的梯度反向传播来校准自身的决策策略。

为了确保复杂状态下价值评估的准确性,智能体的网络主干采用了结合决斗结构与双重估计机制的深度强化学习架构。来自冻结编码器的特征首先进入一层长短期记忆网络以整合最终时序信息,然后分流至两个并行的全连接支路:一条支路输出标量形式的状态价值,用于评估当前发动机整体状态的内在基准值;另一条支路输出向量形式的动作优势,用于衡量在该状态下选择特定故障判断相对于平均水平的额外收益。这两条支路的解耦合并有效避免了特定状态下动作价值的虚高;同时,实时更新的策略网络与周期性同步的目标网络协同计算目标期望,从机制上抑制了传统强化学习在离散动作空间中常见的价值高估现象。

针对航空发动机故障数据极度不平衡的核心痛点,该研究在奖励函数的设计上摒弃了对称固定的奖惩设定。如果对所有类别的正确分类给予同等正向奖励,智能体只需将大部分样本预测为多数类即可获得高额累积分数。为此,环境中的奖励计算规则与各类样本在训练集中的实际数量建立反比映射关系。对于出现频次极低的罕见故障类型,智能体在做出正确判断时将获得显著放大的正向激励,而在发生误判时也会承受等额的惩罚;对于样本充裕的正常状态,其单次奖惩绝对值则被相应压缩。这种非对称的动态奖励机制使得智能体在优化总期望回报时,必须高度重视罕见故障的识别准确率,尽量在根本上消除由数据分布不均引起的分类偏置。

通过将解耦价值评估的强化学习主干与面向样本分布的自适应奖励策略相结合,类型识别模块构建了一个在小样本与高不平衡场景下具备稳健判定能力的决策中枢。智能体不仅能够较为准确地辨别常规运行状态,更能在罕见异常发生时给出具有明确物理指向的故障分类。在此基础上,智能体如何进一步嵌入航空公司的日常业务流程中,利用实际排故信息实现长周期的动态演化与闭环自适应更新,将在下一篇技术博客中进行全面解析。

来源文献:

参考文献:

Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenariosJ. Advanced Engineering Informatics, 2025, 65©: 103297.

https://www.sciencedirect.com/science/article/pii/S1474034625001909

航空发动机故障诊断专用智能体(一):小样本与高不平衡下的工程挑战

航空发动机故障诊断专用智能体(二):气路监测参数与时序样本构建

航空发动机故障诊断专用智能体(三):基于对比学习的时序特征区分方法

相关推荐
星云低代码开发平台1 分钟前
AI 工作台点了取消,ERP 订单还会创建吗?从三层状态设计验收
人工智能
Axis tech4 分钟前
通过MANUS手套推进由触觉驱动的机器人学习进程
人工智能·深度学习
数聚天成DeepSData4 分钟前
教育年限数据库跨版本对齐:年龄组、性别与五年间隔怎么处理
人工智能·深度学习·机器学习·数据集·deepsdata
欣欣之王来了6 分钟前
2024主流国产大模型深度对比:文心一言/通义千问/智谱AI/Qwen等选型指南
人工智能·ai·大模型
具身AGI16 分钟前
谁当具身主干,物理AI 世界模型 与 VLA 之争
人工智能
threerocks18 分钟前
速来!认领你的「口播Bot」,妈妈再也不用担心我做口播视频了!
人工智能·aigc·ai编程
YOLO数据集集合24 分钟前
Deepseek融合yolo的行人车辆多目标检测系统 |行人检测 车辆检测 多目标检测 YOLO DeepSeek9165期
人工智能·yolo·目标检测·计算机视觉·车辆检测·行人检测
进击的横打31 分钟前
【人工智能】缓存命中率:从原理到业务场景的全面解读
人工智能·缓存
lisw0532 分钟前
基于人工智能的安全分析技术: 用于实时识别威胁
人工智能·安全
武子康34 分钟前
LingBot-VA 2.0 深度解析:为什么要同时预测未来世界与机器人动作
人工智能·后端·agent