一、持续对比强化学习的总体框架与环境交互机制
在处理复杂时序监测数据与动态演化环境时,传统机器学习模型往往面临训练与部署相互割裂、无法适应数据流持续增长以及类别分布极度不平衡等挑战。论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》提出了一种持续对比强化学习 (CCRL)方法,致力于构建具备环境感知与长期动态优化能力的通用决策智能体。该方法将持续学习演化、对比表征提取与深度强化学习相结合,使智能体能够在不断变化的环境中持续接收多维状态序列并完成模式识别与类别决策。
持续对比强化学习的总体架构将外部运行系统视为智能体的学习环境,形成了数据驱动与持续优化的交互闭环。如图所示,环境定期向智能体提供监测到的多维时序状态信息,智能体根据当前策略网络输出对应的类别动作;环境根据真实标签与预设的奖励规则反馈评判信号,并将状态转移、动作及奖励信息存入经验回放池中;智能体定期从经验池中采样以更新策略参数,从而实现伴随数据积累而动态演进的终身学习能力。

为了解决在极度不平衡与有限样本条件下难以直接学习判别性特征的问题,CCRL引入了分阶段的特征表征构建机制。如图所示,该机制首先利用体量庞大的基类正常样本训练一个基于长短期记忆网络(LSTM)的自编码器,通过端到端的序列重构过程捕捉时序数据的基础动态规律并实现数据压缩,这种基于无监督重构的预训练方式在一定程度上避免了编码器在初期直接拟合少数类样本而产生表征过拟合,为后续的判别式特征映射提供了较好的网络初始参数。

二、对比特征判别与不平衡自适应决策
在特征判别模块中,CCRL设计了适用于多分类时序特征空间的加权对比学习损失。该模块放弃了依赖人工时序数据增强生成样本的常规做法,直接利用真实同类样本构建正样本对、异类样本构建负样本对,并引入了正负样本权重超参数对标准对比损失进行重构;通过提升正样本对的聚集权重并平衡负样本对的排斥力度,网络在对预训练编码器进行微调时能够有效拉近同类样本的投影距离、推开异类样本的表征分布,从而提升特征空间的类间可分性。
完成特征提取后,智能体采用决斗双深度Q网络(D3QN)进行最终的类别识别与决策输出。如图所示,决策网络将状态表征输入至主干网络,通过两个独立的线性层分别估计状态本身的整体价值以及各个可选动作的优势函数,再将其聚合成最终的Q值输出;同时,系统通过策略网络负责动作选择、目标网络负责目标价值评估的双网协同机制,有效抑制了Q值的过估计倾向,并结合动态衰减的贪婪探索策略,在训练初期保证对状态空间的充分探索,在后期实现平稳收敛。

针对类别高度不平衡导致的模型决策偏置问题,CCRL在强化学习环境中建立了自适应权重奖励函数。环境根据训练集内各类样本数量的倒数计算归一化权重系数,使得出现频率较低的少数类样本在被正确或错误分类时能够获得绝对值更高的正负奖励反馈,从而在策略梯度更新中动态平衡不同类别的贡献权重;在整个框架的协同流程中,算法依次执行自编码器预训练、加权对比学习微调以及冻结编码层并训练强化学习分类网络,在一定程度上实现了从底层时序特征表征到顶层不平衡自适应决策的完整解耦与联合优化。
来源文献:
Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenariosJ. Advanced Engineering Informatics, 2025, 65©: 103297.
https://www.sciencedirect.com/science/article/pii/S1474034625001909