航空发动机故障诊断专用智能体(四):深度强化学习与自适应奖励机制

在前序模块完成时序特征的低维压缩与空间拉伸后,诊断系统仍面临着分类决策层面的严苛挑战:由于不同故障类型与正常状态在样本总量上存在巨大的数量级差距,常规监督学习分类器在训练过程中往往会自发偏向占绝对多数的正常样本,从而忽视少数关键故障模式。

在论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》中,将多分类诊断任务重构为序贯决策与环境交互过程,构建了基于深度强化学习的类型识别模块,通过解耦状态价值评估与设计非对称奖励规则,使智能体能够在极端不平衡样本下维持对稀有故障的敏感度。

该模块首先将诊断流程规范化为标准的强化学习交互回路。由前端特征区分模块处理后的时序表征被作为环境状态输入智能体;智能体根据当前状态选择输出一个动作,该动作直接对应发动机的某种健康状态或特定故障类别;模拟的运维环境接收动作并将其与真实标签进行比对,依据预设的反馈规则向智能体反馈即时奖惩数值;同时,当前状态、采取动作、获得奖励以及后续状态被打包存入经验回放池中。通过不断从回放池中采样历史交互经验,智能体得以通过持续的梯度反向传播来校准自身的决策策略。

为了确保复杂状态下价值评估的准确性,智能体的网络主干采用了结合决斗结构与双重估计机制的深度强化学习架构。来自冻结编码器的特征首先进入一层长短期记忆网络以整合最终时序信息,然后分流至两个并行的全连接支路:一条支路输出标量形式的状态价值,用于评估当前发动机整体状态的内在基准值;另一条支路输出向量形式的动作优势,用于衡量在该状态下选择特定故障判断相对于平均水平的额外收益。这两条支路的解耦合并有效避免了特定状态下动作价值的虚高;同时,实时更新的策略网络与周期性同步的目标网络协同计算目标期望,从机制上抑制了传统强化学习在离散动作空间中常见的价值高估现象。

针对航空发动机故障数据极度不平衡的核心痛点,该研究在奖励函数的设计上摒弃了对称固定的奖惩设定。如果对所有类别的正确分类给予同等正向奖励,智能体只需将大部分样本预测为多数类即可获得高额累积分数。为此,环境中的奖励计算规则与各类样本在训练集中的实际数量建立反比映射关系。对于出现频次极低的罕见故障类型,智能体在做出正确判断时将获得显著放大的正向激励,而在发生误判时也会承受等额的惩罚;对于样本充裕的正常状态,其单次奖惩绝对值则被相应压缩。这种非对称的动态奖励机制使得智能体在优化总期望回报时,必须高度重视罕见故障的识别准确率,尽量在根本上消除由数据分布不均引起的分类偏置。

通过将解耦价值评估的强化学习主干与面向样本分布的自适应奖励策略相结合,类型识别模块构建了一个在小样本与高不平衡场景下具备稳健判定能力的决策中枢。智能体不仅能够较为准确地辨别常规运行状态,更能在罕见异常发生时给出具有明确物理指向的故障分类。在此基础上,智能体如何进一步嵌入航空公司的日常业务流程中,利用实际排故信息实现长周期的动态演化与闭环自适应更新,将在下一篇技术博客中进行全面解析。

来源文献:

参考文献:

Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenariosJ. Advanced Engineering Informatics, 2025, 65©: 103297.

https://www.sciencedirect.com/science/article/pii/S1474034625001909

航空发动机故障诊断专用智能体(一):小样本与高不平衡下的工程挑战

航空发动机故障诊断专用智能体(二):气路监测参数与时序样本构建

航空发动机故障诊断专用智能体(三):基于对比学习的时序特征区分方法

相关推荐
jimmyleeee1 小时前
大模型安全之二十一:构建 AI 安全控制栈:从威胁映射到持续合规的完整指南
人工智能·安全
2601_962218611 小时前
万象生鲜系统多终端统一数据协议PC手机PDA数据实时同步
大数据·数据库·人工智能·python·算法
AgentMaster1 小时前
企业元数据管理技术实战:从采集架构到血缘解析的完整方案
大数据·人工智能·算法
牛马工作号1 小时前
RK3588 使用 rk-llama.cpp + RKNPU2 部署 Qwen3.5:从零开始的 NPU 本地大模型实战
人工智能·语言模型·llama
AI编码进化论1 小时前
云IDE介绍:环境模板化、Agent上云,云IDE该怎么选
开发语言·ide·人工智能·团队开发·ai编程
我滴老baby1 小时前
部署 Excalidraw:Docker 搭建手绘白板,再配置固定公网访问
数据库·人工智能·架构
科技苑1 小时前
Python AI自动剪辑视频简易程序
人工智能·python
晴天的雨.9921 小时前
[C++算法]盛最多水的容器(双指针算法)
开发语言·c++·算法
TAN-90°-1 小时前
Deep Learning for Computer Vision——Generative Models 1
人工智能·深度学习·神经网络·目标检测·机器学习·计算机视觉