(IEEE Transactions 2025)自适应元强化学习动态柔性作业车间调度框架

文章目录

导读

论文标题:An Adaptive Meta-Reinforcement Learning Framework for Dynamic Flexible Job Shop Scheduling(IEEE Transactions on Automation Science and Engineering 2025)

聚焦 动态柔性作业车间调度问题 (DFJSP),针对传统调度方法在动态生产场景下适应性差、泛化能力弱、重调度响应慢的核心痛点,提出了一套 "模块化通用框架 + 自适应 MDP 建模 + 元强化学习算法 " 的完整解决方案。核心目标是实现对车间动态扰动的秒级响应,同时平衡完工时间与能耗两大生产目标,为现代离散制造的智能调度提供了新的技术路径。

背景动机

随着制造业向多品种、小批量、定制化转型,生产环境的动态性与不确定性急剧提升:紧急插单、设备故障、订单变更、物料延迟等事件频发。车间调度作为生产运营的核心环节,其灵活性、响应速度和优化质量直接决定了生产效率、交付能力与运营成本。

方法类别 优势 核心缺陷
分派规则(如 FIFO) 计算速度极快 依赖人工经验,复杂场景下解的质量差,适应性弱
元启发式算法(如 GA、PSO) 能求近优解 迭代计算耗时长,动态场景下重调度响应慢,规模增大时性能骤降
深度强化学习(DRL) 能自主学习策略,适合序列决策 样本效率低,对新场景 / 新任务泛化能力差,面对扰动需重新训练

元强化学习(MRL)结合了元学习 "快速适配新任务" 与强化学习 "序列决策" 的优势,在机器人控制、交通调度等领域已验证有效,但在车间调度领域仍处于起步阶段。核心瓶颈在于:缺乏适配 DFJSP 的通用建模框架,难以将工序、机器、扰动等要素转化为 MRL 可高效处理的形式,模型泛化性与鲁棒性不足。

现有研究已扩展了动态事件、运输约束、序列依赖换型时间等更贴近现实的要素,但存在两大问题:

  • 模型定制化强,缺乏标准化通用框架,难以跨场景复用;
  • 多数 MDP 建模是静态的,无法自适应地表达车间动态变化(如机器故障、新工件插入)。

MRL 在工业过程控制、云资源调度、能源管理等领域已展现出快速适配的优势,但在 FJSP 中应用极少。已有的少量研究未能解决:调度要素的有效状态表示问题;多样化车间场景的泛化问题;真实生产扰动的鲁棒性问题

方法框架

三层模块化 DFJSP 通用框架

论文提出了分层可插拔的通用架构,将车间要素系统拆解为独立模块,既能适配不同规模、不同约束的生产场景,又支持动态扰动的灵活接入。框架自顶向下分为三层:

调度环境层(顶层:问题定义)

负责调度问题的基础配置,是整个框架的输入层,包含 3 个模块:

  • 工厂模块:管理车间基础资源,包括机器、工序工艺、人员配置、物流能力等,可对接 MES/ERP 系统获取实时数据;
  • 目标模块:管理多目标优化,本文核心优化完工时间(makespan) 和加工能耗,支持根据企业战略调整目标权重;
  • 约束模块:定义工艺顺序约束、工序分配约束、机器产能约束等,也可扩展物流、库存等跨系统耦合约束。

调度规划层(中层:决策生成)

核心决策层,负责生成与管理调度方案,包含 2 个模块:

  • 调度生成模块:集成工厂、目标、约束、扰动模块的输入,调用调度算法生成最优方案;支持接入元启发式、规则、强化学习等多种算法;
  • 调度计划模块:部署当前调度方案,管理历史调度数据,为持续优化提供支撑。

物理执行层(底层:执行与反馈)

负责生产落地与动态响应,形成 "执行 - 反馈 - 调整" 闭环,包含 2 个模块:

  • 执行模块:按调度方案协调机器、人员、物料,同时采集生产反馈数据,评估方案执行效果;
  • 扰动模块:处理各类动态事件,内部扰动包括机器故障、加工时间波动、人员缺勤,外部扰动包括紧急插单、订单变更、物料延迟;触发后实时启动重调度。

模块化设计的核心价值:组件可按需增删,易于扩展物流、能源管理等功能,解决了传统调度模型定制化强、复用性差的问题,是实现通用化调度的基础。

自适应马尔可夫决策过程(AMDP)

为了将 DFJSP 转化为强化学习可求解的序列决策问题,论文提出自适应马尔可夫决策过程(AMDP),相比传统 MDP,核心突破是状态空间可随动态事件自适应调整。

首先用析取图 对 FJSP 进行数学表示,AMDP 由五元组 { S , A , R , T , D } \{S, A, R, T, D\} {S,A,R,T,D} 定义,相比传统 MDP 新增了扰动事件集 D,专门建模动态车间的不确定性。状态空间分成三类特征(工序特征,机器特征,工序-机器配对特征)

扰动事件集 D建模了三类典型车间扰动,采用统一的状态自适应机制处理:

紧急插单 :调度执行中新增工件及其工序,自动扩展状态空间与动作空间;

机器故障 :通过 mask 机制屏蔽故障机器,使其无法被分配工序,恢复后解除屏蔽;

定期维护:与故障机制类似,但维护的开始时间和时长已知,调度器可提前主动调整策略。

自适应机制:机器故障时自动屏蔽对应机器的特征,紧急插单时自动新增对应工序的特征,无需重新设计状态空间。

采用加权多目标奖励,同时优化完工时间和能耗:

r t = λ 1 × r e c + λ 2 × r m k r_{t}=\lambda {1}× r{ec}+\lambda {2}× r{mk} rt=λ1×rec+λ2×rmk

  • r e c r_{ec} rec:相邻时间步的总能耗减少量,最大化累计奖励等价于最小化最终总能耗;
  • r m k r_{mk} rmk:相邻时间步的完工时间减少量,最大化累计奖励等价于最小化最终完工时间;

权重设置:本文取 λ 1 = 0.2 \lambda_1=0.2 λ1=0.2(能耗)、 λ 2 = 0.8 \lambda_2=0.8 λ2=0.8(完工时间),贴合工业界优先保障交付的实际需求。

元强化学习算法:MAML-PPO

为了实现对新任务、新场景的快速适配,论文提出基于 MAML (模型无关元学习)+ PPO(近端策略优化) 的元强化学习算法,核心思想是 "学会快速适应调度任务",而非仅训练单个调度策略。

训练阶段(元训练)

输入大量差异化的调度任务(不同工件数、机器数、扰动类型),通过双循环优化得到元参数 Φ \Phi Φ。元参数代表了 "调度的通用知识",可以快速迁移到各类新任务。

  • 内循环:针对单个任务,用元参数初始化任务策略,在支撑集(90% 数据)上用 PPO 更新任务参数;
  • 外循环:用所有任务在查询集(10% 数据)上的损失更新元参数,让元参数能适配尽可能多的任务。

适应阶段(少样本微调)

面对新的调度任务(如新的车间配置、新的扰动场景),用元参数初始化策略,仅需少量样本(通常 < 5 条轨迹)和少数梯度步(<10 步)微调,就能得到适配新任务的调度策略,实现秒级响应。

实验分析

论文通过多组对照实验,从收敛性、泛化性、适应性、动态扰动响应四个维度验证了方法的有效性,实验硬件为海光 7185 处理器 + RTX 3080 GPU。

数据集 :生成不同规模的调度任务(10×5、20×5、15×10、20×10,以及大规模 40×5/10/15/20),融入三类动态扰动;

对比基线 :独立任务训练 PPO、预训练 PPO、随机初始化 PPO、DANRL(双注意力网络强化学习)、FIFO 规则、遗传算法(GA);

评价指标:完工时间(makespan)、总能耗、适应 / 求解时间。

泛化与适应能力对比

在不同规模的新任务上,MAML-PPO 仅需 5 步微调,性能就显著优于预训练 PPO 和随机初始化 PPO;

在小规模任务上,MAML-PPO 甚至超过了从零独立训练的模型;在大规模任务上,性能接近独立训练模型,但适配速度快几个数量级。

训练过程分析

单目标(完工时间 / 能耗)训练收敛稳定;多目标训练后期出现波动,反映了两个目标的权衡关系;

每 50 轮迭代引入新任务时出现短暂性能波动,是元学习适应新任务的正常现象,随后快速恢复并持续优化。

动态扰动响应测试

针对 17×11 的基准场景,测试三类典型扰动下的重调度性能:

  • 定期维护:3 台机器在 150-270 时间单位维护,重调度耗时 1.45 秒,完工时间 672,优于 DANRL(714)和 GA(984);
  • 机器故障:M4 在 120 时间单位突发故障,重调度耗时 1.02 秒,完工时间 639,优于所有对比算法;
  • 紧急插单:120 时间单位插入 3 个紧急工件,重调度耗时 1.15 秒,完工时间 645,显著优于对比算法。

结果充分验证:框架能在秒级完成动态扰动下的重调度,同时保证调度质量,满足工业实时性需求。

总结思考

提出自适应马尔可夫决策过程(AMDP),状态空间可随动态事件自动调整,为强化学习处理动态调度提供了标准化建模范式;首次将 MAML 与 PPO 结合应用于 DFJSP,实现了少样本快速适配,大幅提升了动态场景下的调度响应速度与泛化能力。

元学习追求跨任务泛化,在单一特定任务上的极致优化效果略逊于专门训练的模型;后续可探索分层元强化学习等更先进的元学习算法,平衡泛化性与单任务优化性能;

相关推荐
老余说AI3 小时前
告别机械音与音画脱节:2026 AI视频翻译与配音工具深度测评与工程选型指南
人工智能·音视频·视频翻译·视频配音
YonyouHRSaaS3 小时前
AI面试工具怎么选型?2026年企业AI面试系统选型标准是什么?
人工智能·面试·职场和发展·ai面试·ai招聘
码场老菜鸟3 小时前
C++ 指针的深度理解与应用
java·c++·算法
阿童木写作3 小时前
自动智能抠图工具推荐:跨马翻译批量处理图片与视频字幕,跨境电商高效翻译
大数据·人工智能·python·音视频
gs801403 小时前
Spring AI × Nacos 3.2:打造可动态治理 Prompt 的电商售后智能 Agent
人工智能·spring·prompt
Tenifs3 小时前
AI 智能体与大模型应用开发面试题库
人工智能·面试
光锥智能3 小时前
当Agent开始“动手”,企业AI竞争已从模型跑到“体系”
大数据·人工智能
悟天特斯3 小时前
智慧楼宇AI节能系统:基于机器学习的建筑能耗优化实践
人工智能·物联网·机器学习
克里斯蒂亚诺更新3 小时前
从XGBoost角度理解为什么要使用机器学习
人工智能·机器学习