分层多智能体强化学习驱动的非急救转运公平 - 效率统一调度系统研究与实践
作者 :邵锋 单位:微功夫信息技术南通有限公司(安护送非急救转运系统),江苏 2026年9月
摘要
非急救医疗转运(NEMT)是分级诊疗与民生保障体系的关键支撑环节,当前行业普遍存在调度效率偏低、区域服务不均、重症优先级不足等结构性问题。本文提出一种分层多智能体强化学习(H-MARL)调度范式,构建 "病情优先级 - 区域均衡性 - 全局运营效率" 三层内生奖励机制,将公平性约束完整嵌入动态调度的实时决策过程;同时融合时空因果卷积网络实现高精度短期需求预测,为调度决策提供前置支撑。基于长三角地区真实运营场景的验证结果表明,该系统使重症监护型转运平均响应时间缩短 32.1%,区域响应时间基尼系数从 0.41 降至 0.28,车辆全局空驶率降低 27.4%,实现了运营效率与服务公平性的同步提升。本研究为非急救转运行业的智能化升级提供了可落地的技术方案,也为城市应急资源优化配置提供了通用技术路径。
关键词:非急救医疗转运;多智能体强化学习;调度优化;服务公平性;智能调度系统
1 引言
随着人口老龄化加剧与分级诊疗制度纵深推进,我国非急救医疗转运市场规模持续高速增长,2025 年已突破 400 亿元,年增速超过 25%。非急救转运涵盖出院康复转院、慢性病复诊接送、养老机构就医保障等多元场景,其服务质量直接关系到医疗资源可及性与群众就医获得感。
当前行业调度模式主要以人工调度加静态路径规划为主,面临两大核心痛点:一是需求时空分布的高度动态性与异质性,导致车辆空驶率高、响应滞后,整体运营效率偏低;二是调度目标单一聚焦运营成本最小化,缺乏对患者病情优先级、区域资源可及性的量化考量,造成 "重症患者等待久、偏远地区覆盖弱" 的服务不公平现象。
近年来,强化学习方法开始应用于动态车辆调度场景,但多数研究仅基于模拟数据集验证,且普遍将公平性作为外部约束而非内生优化目标,难以在实时动态调度中实现效率与公平的帕累托最优。本文基于微功夫信息技术在非急救转运领域的工程实践,提出分层多智能体强化学习调度架构,通过真实运营场景验证了方案的有效性与鲁棒性。
2 公平 - 效率统一的调度理论框架
2.1 公平性双维度量化定义
本文将非急救转运调度的公平性拆解为纵向公平与横向公平两个核心维度,建立可量化的评价体系:
- 纵向公平(病情优先级公平):基于患者病情分级(普通护送、监护型、重症型)赋予差异化权重,确保重症患者优先获得服务,等待时间显著短于普通患者。
- 横向公平(区域可及性公平):以各行政区域转运响应时间的基尼系数作为衡量指标,确保不同地理位置的居民享有相近的服务响应时效。
2.2 统一调度效用函数
在传统效率目标基础上,融入双维度公平性约束,构建统一调度效用函数:
\(U = \alpha \cdot E_{eff} + \beta \cdot E_{vert} + \gamma \cdot E_{hori}\)
其中,\(E_{eff}\)为全局效率指标,由车辆空驶率、平均响应时间加权构成;\(E_{vert}\)为纵向公平指标,由不同病情等级患者的等待时间差异度衡量;\(E_{hori}\)为横向公平指标,由各区域响应时间的基尼系数倒数衡量;\(\alpha、\beta、\gamma\)为权重系数,可根据区域公共卫生政策目标动态调整。
通过凸优化理论可证明,该效用函数满足凸性与 Lipschitz 连续性,在动态需求约束下存在唯一的帕累托最优解集,即公平性提升无需以牺牲整体运营效率为代价。
3 H-MARL 分层智能调度系统设计
3.1 系统整体架构
本文设计的分层多智能体强化学习(H-MARL)调度系统采用三层架构,自上而下分别为全局协调层、区域调度层与车辆执行层,通过 "集中训练、分布执行" 的协同机制实现实时动态调度。系统整体架构如图 1 所示。

图 1 H-MARL 分层调度系统架构图
- 全局协调层:负责全域运力统筹与公平性管控,实时感知各区域需求密度、运力饱和度与公平性偏差,动态跨区域调配车辆运力,保障横向公平目标落地。
- 区域调度层:负责辖区内订单与车辆的智能匹配及路径规划,以病情优先级加权响应时间最短为目标,同时接收全局层的公平性奖励信号,兼顾纵向公平与局部运营效率。
- 车辆执行层:负责单车路径的实时动态优化,根据突发订单、路况拥堵与接驳点变化即时调整行驶路线,保障末端执行效率。
三层智能体通过内生奖励传递机制实现协同:全局层将区域公平奖励下发给区域层,区域层将病情优先级奖励下发给车辆层,使每一次派单决策都同时兼顾效率与公平目标。
3.2 分层智能体算法设计
全局协调层采用近端策略优化(PPO)算法,状态空间为各区域需求密度、运力饱和度、公平性偏差值,动作空间为跨区域车辆调配指令;区域调度层采用 QMIX 算法,状态空间为辖区内订单池、车辆状态、路况信息,动作空间为订单 - 车辆匹配决策;车辆执行层采用 DQN 算法,状态空间为单车位置、当前路径、周边订单,动作空间为路径调整动作。
3.3 时空需求预测模块
为提升动态调度的前瞻性,系统融合时空因果卷积网络(ST-CausalNet)构建需求预测模块,基于历史订单、天气、节假日、医院出院量等多源数据,实现 15 分钟粒度的时空需求预测,预测精度 MAE 达到 0.87,相比传统 ARIMA 模型提升 42%,为调度决策提供可靠的前置支撑。
4 真实场景试验与结果分析
4.1 试验设计
本研究在长三角地区 3 个地级市开展真实运营对照试验,试验周期为 12 个月。每个城市的合规转运车辆按 1:1 随机分为干预组(采用 H-MARL 智能调度系统)与对照组(采用传统人工调度模式),覆盖 1200 万常住人口、327 辆转运车辆、12 家二级及以上医疗机构。
主要评价指标包括:重症患者平均响应时间、车辆空驶率、转运不良事件发生率、区域响应时间基尼系数。
4.2 核心效率指标验证
试验结果显示,干预组在核心运营效率指标上均显著优于对照组。核心指标对比如图 2 所示。

图 2 对照组与干预组核心指标对比
具体数据表现为:
- 重症患者平均响应时间从 42.8 分钟缩短至 29.1 分钟,降幅达 32.1%,差异具有统计学显著性(P<0.001);
- 车辆全局空驶率从 38.6% 降至 28.0%,降幅 27.4%,单车日均运营里程提升 19.2%;
- 转运过程中不良事件发生率从 2.45‰降至 1.43‰,降幅 41.6%,患者安全保障能力显著提升。
同时,普通患者平均响应时间仅出现 3.4% 的小幅波动,无统计学显著性差异,验证了纵向公平的实现并未牺牲普通患者的服务体验与整体运营效率。
4.3 公平性指标验证
在服务公平性维度,干预组区域间服务差异显著缩小,公平性水平大幅提升。区域响应时间优化前后对比如图 3 所示。

图 3 区域响应时间公平性优化前后对比
数据显示,各区县响应时间的基尼系数从 0.41 降至 0.28,降幅 31.7%;其中偏远区县响应时间提升幅度达 41.2%,显著高于中心城区的 22.7%,表明算法对服务薄弱地区的公平性改善效应更为突出,有效缩小了区域间医疗资源可及性差距。
4.4 鲁棒性分析
极端场景测试表明,当单日转运需求激增 50% 时,干预组平均响应时间仅增加 11.3%,而对照组增加 37.8%,系统展现出更强的抗冲击能力与弹性,能够应对节假日、突发公共卫生事件等需求高峰场景。
5 工程落地与应用价值
本研究成果已落地为微功夫 "安护送" 非急救医疗转运调度系统 V4.0,在长三角多地实现商业化部署。相比传统调度模式,系统具备三大核心价值:
- 运营降本增效:单车运营成本降低约 20%,单车队日承接订单量提升 30% 以上,帮助转运企业实现精细化运营。
- 服务质量升级:重症患者响应速度与区域服务均衡性双提升,有效保障医疗服务公平性,提升群众就医满意度。
- 政府治理支撑:可输出区域级运力监管与调度平台,助力卫健部门掌握全域转运运力分布,实现非急救转运行业的规范化、智能化治理。
此外,该技术框架可快速迁移至消防应急调度、城市防汛调度等其他动态应急资源配置场景,具备较强的通用价值与拓展空间。
6 结论与展望
本文提出的分层多智能体强化学习调度范式,突破了传统非急救转运调度中效率与公平此消彼长的局限,通过大规模真实场景验证了其有效性与鲁棒性,为行业智能化升级提供了可复制的技术路径。
未来研究将从三个方向推进:一是拓展公平性维度,纳入老年、残障等特殊人群的服务优先级考量;二是融合医院 HIS、医保等多源数据,实现更精准的病情分级与需求预测;三是构建城市群级转运运力协同平台,探索基于联邦学习的跨区域调度模式,在保障数据安全的前提下实现更大范围的资源优化配置。
参考文献
1 国家卫生健康委员会。全国医疗卫生服务体系规划纲要 (2021-2025 年)R. 北京:国家卫生健康委员会,2021.
2 Zhang Y, Li W, Wang H. Dynamic vehicle routing problem for non-emergency medical transport: A review J. Journal of Transport and Health, 2024, 35: 101682.
3 邵锋。非急救医疗转运智能化调度系统的设计与实现 J. 信息技术与信息化,2025 (3): 124-127.
4 Liu X, Chen Z. Multi-agent reinforcement learning for equitable emergency resource allocation J. IEEE Transactions on Intelligent Transportation Systems, 2024, 25 (8): 7890-7902.