发动机故障诊断智能体(六):经验回放驱动的智能体在线动态更新与长效自适应演化
在民用航空发动机的实际服役周期中,机队日常飞行任务的持续执行导致监控数据呈现不间断的动态增长,同时伴随季节气候交替、气路部件自然老化以及维护改装等工况演变。若采用一次性离线训练的静态诊断模型,随着运行环境与物理分布的漂移,其判定精度往往会出现退化。论文《Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios》通过引入经验回放机制与闭环策略更新流程,构建了能够伴随实际业务数据流持续迭代的强化学习演化体系,致力于实现智能体在长期运行中的自适应能力与抗遗忘特性。

持续学习机制的数据中枢是专门设计的经验重放存储结构。在机队日常运营中,发动机航后下传的多航段时序特征被送入智能体进行即时诊断,然后地面维护工程团队结合现场检测与拆换件结果对诊断结论进行权威标定;系统将当前输入状态、智能体输出动作、专家核验后的奖励信号以及后继状态整合成标准的转移单元并存入经验重放池中。该存储结构实现了物理数据生成过程与算法计算优化过程的时间解耦,为后续策略网络的异步更新提供了结构化的历史数据沉淀。
为了保证网络训练的数值稳定性并消除相邻航段数据的时序自相关性,算法设定了严格的更新触发阈值与随机采样机制。当经验重放池内累积的有效交互记录达到预设的最低容量门限时,系统在每次完成新的状态判定后自动触发参数学习流程。在更新阶段,算法从经验池中随机抽取固定大小的批次数据进行计算,这种跨航段、跨时间维度的均匀随机采样打破了连续飞行状态之间的强相关性,满足了随机梯度下降优化对样本独立同分布的统计学假设,从而有效抑制了训练过程中的梯度方差。

在长效优化过程中,策略网络与目标网络的周期性参数同步构成了维持学习稳定性的核心控制手段。策略网络在每次获取随机经验批次后,依据时序差分损失函数实时执行反向传播并微调权重参数;而用于评估目标价值的目标网络则保持参数完全冻结,仅在策略网络累计迭代达到固定的步数周期后,才一次性复制策略网络的最新权重完成参数覆盖。这种快慢双周期的异步协调更新模式,有效切断了目标Q值与当前Q值之间的即时自相关反馈环路,保障了模型在长周期连续训练中的平稳收敛。
在应对持续数据流注入时,如何兼顾新工况适应与历史故障模式记忆是持续学习的关键挑战。该方法通过模块化分工缓解了灾难性遗忘风险:底层特征提取网络在冻结状态下维持着基于对比学习构建的高区分度拓扑结构,确保了基础物理表征的长期稳定;上层决策网络则依托经验重放池的混合回放机制,在吸收最新飞行数据的同时持续复习历史存储的典型故障模式与正常样本,使决策超平面在动态演化过程中始终兼顾全局分类边界的几何完整性。
经验回放驱动的在线更新体系将“数据接收-智能诊断-人工核验-经验存储-批次优化”整合成较为严密的闭环工程系统。该机制将传统的静态单向推理拓展为具备环境感知能力的动态自适应演化回路,使诊断智能体不仅能够在已有先验数据上实现高不平衡分类决策,更能够在机队长期运行的数据沉淀中持续优化其动作价值估计,为民航发动机复杂装备的长效智能运维与视情维护提供了一种严密、可参考的工程实现路径。
参考文献:
Continual contrastive reinforcement learning: Towards stronger agent for environment-aware fault diagnosis of aero-engines through long-term optimization under highly imbalance scenarios[J]. Advanced Engineering Informatics, 2025, 65(C): 103297.
- 点赞
- 收藏
- 关注作者
评论(0)