1.摘要
多无人机自主协同导航需要在飞行中实时规划高效路径,同时避免无人机之间以及无人机与障碍物之间的碰撞。论文提出基于强化学习高效协同导航算法(RL-CN),将多无人机导航建模为马尔可夫决策过程,并使用适合连续控制的深度确定性策略梯度(DDPG)。针对稀疏奖励,设计覆盖接近目标、规避内外部碰撞、维持邻机连接和缩短时间步的奖励塑形;针对训练效率,提出带两个子演员网络的分阶段调优策略;针对经验回放,提出同时考虑时序差分(TD)误差与连接趋势的增强优先经验回放(EPER)。仿真结果表明,RL-CN在密集障碍、大范围和动态障碍环境中均能提高导航成功率、降低碰撞率,并保持较短路径。
2.研究背景与问题定义
见个人简介