多资源规划把"生产调度、库存、产能"放在同一决策框架里,核心难点是批量---排序---产能占用---库存持有互相耦合:大批量降换型但占库存/占产能,小批量反之下。下面按"精确建模→分解/混合启发→元启发/多目标→强化学习→不确定优化"整理近年较有代表性的创新算法,并标清各自适用边界。
一、精确建模与改进:MILP / 容量批量排程
适合中短期、约束可量化、规模不太爆炸的场景,追求可证明最优或高质量下界。
- 容量批量---排程一体化 MILP(CLSP+Scheduling)
把多阶段、多产品、顺序相关换型、设备时段能力写成混合整数模型;网络流/设施选址重构可收紧线性松弛、提高下界。
大型算例再用 MIP‑启发式:Relax‑and‑Fix(先放松部分变量定关键决策)→ Fix‑and‑Optimize(固定其他滚动优化),配合重叠时间窗分解,工业大规模可用。 - Benders / 嵌套Benders 分解
多层结构(选址+路由+运输、或主计划+随机场景)用Benders切平面降维;生物质物流、批量计划等大规模随机变体可用多切Benders。 - 列生成 + 分支定价
变量极多但约束相对稀疏时(人员排班、路径、批量模式生成)主流;多资源规划里常用于"候选生产/补货模式"主问题+子问题生成新列。 - 约束规划 CP
工序先后、设备互斥、时间窗、资源不可抢占等逻辑约束强时,CP比纯MILP更快出可行排程;可与MILP目标层配合(CP出可行、MIP调成本)。
落地建议:月度/周度主计划、有限产能MRP、批量+换型优化,优先MILP+分解;工序级强逻辑用CP或MILP+CP混合。
二、集成批量---排程的混合启发式(Matheuristic)
比纯元启发式更稳,比纯求解器更可扩展。
- Relax‑and‑Fix / Fix‑and‑Optimize / Rolling Horizon:有限周期大桶模型先松后固,滚动重优化;对含学习效应、超时、拖期的多产品容量批量问题有效。
- ML‑MIP 混合框架:用机器学习先判"机器---产品可行分配/候选解簇",再交给MIP精修,降低整数变量空间;Virginia Tech 大尺度生产排程案例用此思路平衡设备利用率与换型。
- 无监督学习驱动 Matheuristic(生产---配送):LP松弛/易得解做聚类,再嵌遗传算法;产能---设施---配送联合问题相较商业求解器在中大算例降本约15%,基准算例刷新较多best‑known。
三、多资源调度专用:元启发式与多目标
生产调度侧多机器/多人/AGV/能耗同时优化时用。
- 改进NSGA/MOEA/D 系列:makespan、换型、能耗、拖期多目标;分布式混合流水+动态订单可用改进MOEA/D,配合紧急时间窗、2‑opt局部搜索、滚动视界,相较NSGA‑II/MOALNS/RL超启发式在拖期与成本上更稳。
- 模因/变邻域/禁忌+局部搜索:柔性作业车间、混合流水、顺序相关换型;AGV与机器耦合可用"DQN选局部搜索算子+质量‑多样性存档"避免只收敛一类解。
- RL增强元启发式:如节能分布式流水车间用双重Q‑learning调正弦/群体算法,关键路径加速、非关键降速省电,多目标覆盖率和IGD优于常规KCA/INSGA类。
- 超启发式(Hyper‑heuristic):混装作业车间批量流用RL选底层启发式,统筹加工批量、子批排序、装配排序,目标含制造周期/库存时间/换型次数。
四、动态调度与学习决策:DRL / 多智能体
订单动态到达、故障插单、实时重排时,传统求解器慢,可用RL近似策略。
- MDP化车间调度:状态=工单/设备/队列/交期,动作=派工或重排序,奖励=拖期/能耗/利用率;可重构车间调度+重构联合决策,单工件决策毫秒级,优于GA/IG类元启发。
- 多智能体RL:染色车间组批+排缸双agent,LSTM提动态特征,MA‑RPPO降总拖期; 分布式柔性车间+AGV用DQN‑QD联合优化机器与运输。
- 优先级经验回放DQN:汽车涂装混流重排序,目标降颜色换型与总装序列偏差,掩码屏蔽非法动作。
- 协同Q‑学习+邻域搜索:锡化工分布式异质多线,订单拆分/排程/整合三agent,Q‑learning自适应选邻域,兼顾全局探索与局部开发。
注意:DRL在"未见过大扰动/新工艺路线"时泛化要谨慎,工业落地常做"RL初排+CP/MIP校验+规则兜底"。
五、库存---产能---生产联合的不确定优化
需求、加工时间、良率不确定时,不用固定概率分布硬算。
- 两阶段/多阶段随机规划:战略产能/设施位置为一阶段,补货量/生产量为二阶段,场景树+SAA(样本均值近似)求期望成本;适合需求可历史采样。
- 鲁棒优化 RO:需求落在盒式/预算不确定集,优化最坏情形;联合生产---库存可用RSOME类建模,避免分布假设过强,但会偏保守。
- 分布鲁棒优化 DRO:用矩信息/经验分布构造模糊集,最坏期望优化;供应链库存、排队动态定价、多阶段运营综述证明其比RO不保守、比SP不多要分布。
- 仿真优化/数字孪生:随机故障+随机订单用DES评估策略,外层接元启发或RL;APS实时重排常用"仿真校验+数学规划/规则"。
六、方法选型速表(多资源一体)
| 问题特征 | 推荐算法组合 | 典型目标 |
|---|---|---|
| 周/月主计划,设备+批量+换型,≤千百变量 | MILP(CLSP/CFLP)+ Relax‑and‑Fix | 总成本、换型、产能利用 |
| 多阶段混合流水、顺序换型、大算例 | 网络流MIP+FL重构+Fix‑and‑Optimize | 成本/下界/可行性 |
| 柔性车间+AGV+能耗,多目标 | DQN‑QD / NSGA‑II+局部搜索 / 模因GA | makespan、能耗、拖期 |
| 动态订单、插单、故障 | 滚动视界+MOEA/D 或 DRL派工+CP校验 | 拖期、响应时间 |
| 需求/加工时间不确定 | 两阶段SP / RO / DRO,配仿真 | 期望成本、最差动差 |
| 生产---仓库---运输一体 | MILP+Benders/列生成,或ML‑matheuristic | 生产+库存+运费 |
| 实时工序派工 | 派工规则+SPT/EDD基线,RL提升 | 吞吐、拖期 |