IEEE TCCN | 面向低空经济网络的Agentic AI驱动多无人机轨迹优化

题目**:**Agentic AI-Empowered Multi-UAV Trajectory Optimization in Low-Altitude Economy Networks
作者:江沸菠,Xitao Pan,Li Dong,Kezhi Wang,Xiaolong Li,Ruidong Li

, Changhong Wang,Cunhua Pan

来源: IEEE Transactions on Cognitive Communications and Networking

论文地址:https://ieeexplore.ieee.org/document/11474960(查看全文请点击原文链接)

摘要:本研究提出了一种基于Agentic RAG与Mamba-Attention集成Transformer(ARMAIT)的多无人机(UAV)轨迹优化框架。该框架构建于大语言模型(LLMs)之上,融合了由Agentic AI赋能的检索增强生成(Retrieval-Augmented Generation, RAG)机制,并集成了无人机领域专用知识库。借助Agentic RAG机制,LLM能够自主理解高层任务需求,并识别轨迹优化所需的关键组成部分,包括模型输入与输出、网络架构、奖励函数以及任务约束条件等。为支持不同系统规模下的高效建模,本文进一步提出了Mamba-Attention Integrated Transformer(MAIT)模型。这是一种融合式神经网络架构,将注意力机制的长程依赖建模能力与Mamba对时序动态高效表征能力相结合,从而兼顾全局建模性能与计算效率。此外,本文提出了一种轨迹组相对策略优化(Trajectory-Group Relative Policy Optimization, T-GRPO)方法,用于在离散与连续轨迹空间中实现统一的策略梯度优化,以支持MAIT模型训练。多个实验结果验证了所提出ARMAIT框架的可行性与有效性。

1. 引言

随着信息与通信技术(Information and Communication Technologies, ICT)与无人机(UAV)技术的快速融合,低空经济网络(Low-Altitude Economy Networks, LAENets)已成为未来社会服务的重要基础设施之一。LAENets运行于3000米以下空域,依托多种低空飞行器(Low-Altitude Vehicles, LAVs),包括空中出租车、空中基站以及空中充电平台等,为物流配送、通信覆盖与空中监测等应用提供支撑。实现上述功能需要通信、计算、存储与感知能力的深度融合。然而,与传统地面网络相比,LAENets在控制模式与资源管理方面存在本质差异。其高度动态且不确定的运行环境不仅显著增加了系统复杂性,也使网络面临更高的安全风险,因此亟需构建更加鲁棒且智能化的系统设计方案。

在LAENets中,UAV凭借其高机动性与灵活部署能力,被视为核心空中节点。UAV既可作为空中基站或中继节点扩展偏远地区及弱覆盖区域的通信范围,也已在医疗物资配送、日常物流以及"最后一公里"运输等场景中展现出重要应用价值。由于UAV任务执行性能与轨迹规划能力直接影响整个网络的运行效率,因此,研究高效的UAV调度与轨迹优化机制,对于保障LAENets稳定可靠运行具有重要意义。

然而,现有基于深度学习(DL)的UAV轨迹规划方法普遍缺乏跨场景迁移能力与泛化能力,难以适应LAENets中任务多样化、环境异构化以及系统规模动态变化等复杂特征。为突破上述瓶颈,近年来研究重点逐渐转向通用人工智能(AGI)方向。AGI强调跨任务理解、通用推理以及自主规划能力,使智能体能够理解自然语言意图、融合异构知识源,并适应未知环境。在UAV轨迹规划领域,AGI能够根据高层任务目标自动提取约束条件与关键变量,并进一步生成可执行的跨场景轨迹策略,从而推动任务理解、策略泛化与轨迹生成的一体化协同,实现更加智能化的轨迹优化流程。

在上述背景下,基于Transformer的架构凭借其对变长序列的处理能力、全局依赖关系建模能力以及并行计算优势,已成为通用UAV轨迹规划的重要技术基础。自注意力机制能够在复杂空间环境中实现稳定的全局决策,并可自然适应LAENets中设备密度、任务规模以及状态维度的动态变化。然而,全自注意力机制的时间复杂度与存储复杂度均随序列长度呈二次增长,这促使研究者逐渐关注基于状态空间模型的Mamba架构。该类架构能够以线性复杂度建模长序列,同时保留关键时序动态特征。

此外,检索增强生成(RAG)通过在推理阶段从外部知识库中检索相关知识,为模型提供了显式知识支撑与上下文自适应能力。RAG能够将飞行法规、空气动力学模型、能耗公式以及经典调度启发式规则等领域先验知识注入模型推理过程,从而缓解纯端到端学习中先验知识不足的问题,并提升模型的可解释性与场景鲁棒性。然而,传统RAG本质上仍属于被动式、查询驱动的机制,其任务感知选择能力有限,且缺乏在推理过程中动态调整检索策略的能力。为解决上述问题,Agentic RAG被提出,其能够支持模型主动进行规划、检索与证据验证,从而实现更加可靠、符合领域知识且具备实际部署能力的轨迹推理过程。

为进一步提升LAENets中多UAV系统的自主决策与轨迹优化能力,本文探索了Agentic Artificial Intelligence(AI)范式在该领域中的应用。通过融合LLMs、轨迹规划模型以及强化学习(RL)算法,本文构建了一种基于Agentic RAG与Mamba-Attention Integrated Transformer的ARMAIT框架,实现了任务理解、知识检索、模型构建与训练以及轨迹生成的一体化协同。本文的主要贡献总结如下:

**1)面向任务建模的Agentic RAG机制:**本文设计了一种融合LLMs与UAV领域专用知识库的Agentic AI框架。借助Agentic RAG机制,LLMs能够根据自然语言任务指令自主理解用户意图,检索相关UAV领域知识,并自动生成任务所需的模型组成部分,包括输入表示(如状态空间)、输出目标(如动作空间)、模型结构(如Attention层与Mamba层的比例)、奖励函数定义以及任务约束条件等。该机制构建了从语言理解到任务建模的闭环流程,显著增强了多UAV轨迹规划任务的适应性与通用性。

**2)用于轨迹优化的MAIT模型:**本文提出了一种Mamba-Attention Integrated Transformer(MAIT)模型,将多头注意力机制的空间全局依赖建模能力与Mamba架构高效长序列建模能力相结合。MAIT不仅能够支持多UAV之间的并行交互,还能够有效捕获轨迹规划所需的关键时序动态特征。本文首先将UAV系统状态编码为结构化输入序列,随后模型根据系统规模自动调整Attention层与Mamba层的比例:对于小规模UAV集群,更倾向于采用Attention层;对于大规模UAV集群,则更多采用Mamba层。该设计兼顾了模型泛化能力与决策效率。

**3)用于模型训练的T-GRPO算法:**本文提出了一种面向多UAV轨迹生成的策略梯度强化学习算法------Trajectory-Group Relative Policy Optimization(T-GRPO)。在原始GRPO方法基础上,T-GRPO进一步扩展至离散动作空间(如停靠点序列)与连续动作空间(如飞行角度与飞行距离)两类轨迹生成任务。该算法定义了UAV集群的状态空间、动作空间以及全局奖励函数,并引入基于群体的相对优势函数与策略散度约束机制,实现策略优化。该方法能够稳定训练MAIT模型,从而在多种任务场景下生成具有全局协同能力的多UAV轨迹。

本文其余部分组织如下:第二部分综述相关研究工作;第三部分详细介绍ARMAIT框架原理;第四至第六部分展示实验结果;最后,第七部分对全文进行总结,并讨论未来研究方向。

2. 相关工作

2.1 基于强化学习增强的UAV系统

Wang等人提出了一种基于深度强化学习(Deep Reinforcement Learning, DRL)的UAV辅助移动边缘计算轨迹控制算法,旨在通过动态路径自适应最小化系统能耗。Dong等人采用基于Actor--Critic(AC)的方法训练了一种基于注意力机制的UAV轨迹优化器。Xue等人提出了一种基于逆强化学习的数据驱动轨迹模仿方法,并结合静态输出反馈控制以提升系统稳定性与控制精度。此外,Liu与Huang构建了一种面向空中机械臂系统的自适应鲁棒DDPG框架,重点研究四旋翼轨迹跟踪控制,并降低机械臂运动对飞行动力学的影响。

2.2 基于Transformer增强的UAV系统

在多UAV区域覆盖任务中,Chen等人在其T-MARL算法中引入Transformer编码器,以适应不同数量的UAV与用户节点。Zhu等人采用Transformer编码器--解码器架构,将整个UAV-IoT系统状态映射为优化后的访问顺序,从而实现了良好的泛化能力与计算效率。Feng等人在其EDT-MARL框架中,将轻量级Transformer嵌入每个UAV基站的评论家网络(critic network)中。此外,Wang等人采用基于Vision Transformer(ViT)的模型实现主跟踪器中的鲁棒视觉特征学习,并结合独立的Transformer模块对序列数据中的目标运动轨迹进行预测。

2.3 基于Mamba增强的UAV系统

Xiao等人提出了一种时间音频驱动的Mamba框架,通过融合频谱信息与时间信息,实现复杂声学环境下无人机轨迹的精确估计与分类。Tao等人提出了FDMamba-Net,该模型结合特征解耦机制与多层Mamba模块,在显著降低计算复杂度的同时,实现了高效且高精度的飞行轨迹预测。此外,相关研究还提出了一种时空对齐视觉Mamba网络,利用自监督学习实现无需人工标注的长时域三维UAV轨迹预测。

2.4 基于Agentic AI增强的UAV系统

Sapkota等人提出了一种Agentic UAV基础框架,该框架融合感知、推理与学习能力,从而提升无人机在多种应用场景中的自主空中作业能力。Zhao等人设计了一种高能效Agentic语义无线网络,其中UAV利用Agentic智能优化通信、任务卸载以及资源分配过程。此外,Koubaa与Gabr提出了一种由LLMs驱动并集成工具调用能力的UAV框架,在认知推理、目标检测可靠性以及自主动作规划方面取得了显著性能提升。

然而,现有UAV轨迹规划方法通常针对特定系统模型进行设计,缺乏适应多样化场景与复杂任务需求的灵活性。为解决上述问题,本文提出ARMAIT框架,通过融合LLMs与Agentic RAG机制,实现对不同任务需求的理解,并进一步将其转换为具体的系统设计与轨迹优化方案。

3.ARMAIT框架

ARMAIT框架由三个关键组成部分构成:基于Agentic RAG的任务分析模块、MAIT轨迹生成器以及T-GRPO优化器。Agentic RAG模块通过耦合LLMs与UAV领域知识库,实现对自然语言任务描述的解析、问题建模形式的推断,并自动完成MAIT与T-GRPO所需模型架构及数据接口的实例化配置。MAIT融合基于注意力机制的全局表示能力与Mamba高效序列建模能力,用于生成多UAV协同轨迹。T-GRPO则在离散与连续动作空间上联合优化策略,并训练MAIT生成满足多种约束条件的轨迹。上述模块共同构建了一个从自然语言理解到多UAV轨迹规划的闭环端到端处理流程,其整体架构如图1所示。

图1:ARMAIT框架工作流程图

3.1 Agentic RAG任务分析模块

为有效分析多样化UAV路径规划任务,LLMs因其强大的自然语言理解与推理能力而被广泛应用。然而,现有基于LLMs的任务分析方法通常缺乏充分的UAV领域知识,这可能导致问题建模错误以及幻觉(hallucination)的产生,进而影响实际部署环境下任务导向规划方案的生成质量。

RAG通过在生成阶段之前引入语义检索机制,有效缓解了上述问题。该机制能够利用上下文证据增强用户查询,从而降低幻觉问题与知识陈旧问题。然而,在UAV任务分析场景中,传统RAG仍存在以下两个关键局限性:1)用户查询无法根据UAV任务上下文的动态变化进行自适应调整,导致检索内容与生成目标之间存在不一致性;2)由于缺乏过程控制能力,系统无法根据中间输出动态调整检索策略或优化查询表达,从而限制了模型自主反思与自我纠错能力的实现。

为克服传统RAG系统在静态建模与单轮推理方面的局限性,本文提出了一种面向UAV任务建模与推理的新型Agentic RAG架构。该系统融合了Agentic AI的核心思想,使LLMs具备自主感知、推理以及主动规划能力。通过支持复杂UAV任务中的动态决策与自主检索,Agentic RAG构建了一个具有自主推理链的闭环任务求解流程,从而实现更加智能化的轨迹规划。以下给出了Agentic RAG在UAV轨迹规划任务分析中的具体工作流程:

**1)初始查询接收:**系统首先接收用户以自然语言形式描述的UAV任务。例如:"请调度10架UAV在指定区域内对100个IoT设备进行数据采集,并以能耗最小化为优化目标。"

**2)查询重构:**在理解任务目标与关键变量后,LLM Agent会对原始输入进行语义重构。例如,可将上述输入改写为:"基于能耗最小化准则,构建一个基于强化学习的多UAV轨迹规划模型,以协调10架UAV对目标区域内100个IoT设备进行高效数据采集。"

**3)任务澄清:**Agent进一步判断当前任务是否缺少必要背景信息,例如场景模型、飞行高度或电池约束等,并主动向用户请求补充相关参数,以完善先验知识。例如,Agent可能自动追问如下问题:"请提供IoT设备的地理分布、飞行距离限制以及每架UAV的最大载荷容量,以提升模型构建精度。"

**4)上下文检索:**在完成任务澄清后,系统将优化后的查询提交至检索引擎。该检索系统包括:基于UAV轨迹规划文献构建的向量数据库;由多种UAV相关模型组成的工具库,例如UAV动力学模型与无线信道模型;包含多类UAV相关算法的算法库,例如凸优化算法与遗传算法;以及能够直接访问互联网的API接口。

**5)上下文融合与生成:**Agent将检索得到的上下文信息与用户原始任务意图进行融合,以支持后续建模。例如,系统可能生成如下提示词:"请基于检索到的相关知识,生成一个多UAV轨迹优化系统的初步设计方案,包括状态空间、动作空间、约束条件、奖励函数定义,并推荐合适的MAIT架构与T-GRPO方法。"随后,LLM执行生成与推理过程,得到初步输出结果,例如:

  • 状态空间:位置、电池电量、任务负载等;
  • 动作空间:离散运动基元(motion primitives);

  • 奖励函数:UAV总能耗,包括飞行能耗、悬停能耗以及无线充电能耗;

  • 模型架构:包含10层编码器的Transformer结构,其中50%为Mamba层,50%为Attention层;

  • 训练方法:采用8组独立rollout的离散轨迹训练;

  • 任务约束:总能耗不得超过UAV最大能量容量。

**6)自验证与评估:**Agent对生成结果进行语义级验证,检查是否包含所有关键参数,并评估当前设计是否满足任务约束。例如,Agent可能检测到系统缺少资源约束条件,从而触发后续补充与修正过程。

**7)多轮检索与生成:**若当前生成结果未能满足任务目标,或缺乏充分的上下文支撑信息,Agent将重新启动查询重构与检索流程,进入下一轮交互推理;否则,系统将最终生成的解决方案传递至MAIT模型与T-GRPO算法模块。

总体而言,Agentic RAG通过引入具备自主推理与反馈控制能力的基于LLMs的智能体,有效突破了传统RAG系统静态化与被动式推理的局限性。该机制显著提升了LLMs在复杂UAV场景中的适应能力、任务建模准确性以及系统鲁棒性,使其能够更好地支持复杂任务建模、智能决策辅助以及交互式智能生成等应用。

3.2 Mamba-Attention Integrated Transformer

为进一步提升多UAV轨迹优化的建模能力与计算效率,本文构建了一种融合Mamba与Transformer自注意力机制的混合框架。在该设计中,注意力模块主要负责捕获全局依赖关系与交互模式,而Mamba模块则用于建模移动连续性以及资源约束的时间演化过程,从而将长序列处理的时间复杂度与存储复杂度由关于序列长度的二次复杂度降低至线性复杂度。该互补式融合机制能够实现更快速且更精确的轨迹规划决策,并提升系统在高度动态环境中的泛化能力与鲁棒性。

图2:MAIT模型架构

MAIT模型由嵌入层、Attention层、Mamba层以及轨迹输出层组成。在Attention层与Mamba层内部,还包含多层感知机(MLP)子层与均方根归一化(RMSNorm)子层。其中,MLP子层通过线性变换增强模型表示能力,而RMSNorm子层则用于规范化数据分布并稳定训练过程。MAIT模型整体结构如图2所示。其工作流程可描述如下:

1)嵌入层: 在MAIT模型中,输入状态的高效表示对于捕获时空依赖关系以及建模多UAV协同行为至关重要。与传统Transformer中的嵌入层不同,后者主要依赖离散词汇表对应的token embedding以及面向自然语言输入的固定位置编码,而MAIT模型处理的是UAV轨迹规划中固有的连续型、异构化且受物理约束的数值状态信息。由于这类高维物理特征无法通过标准查找表式嵌入方式进行有效表示,其连续时间动态特性也难以通过传统正弦位置编码进行准确建模,因此MAIT需要采用更适用于连续物理状态建模的特征表示机制。

为解决上述问题,本文设计了一种结构化嵌入层,用于将每个时间步下UAV系统的原始观测状态映射为统一的高维表示,并作为MAIT模型的输入。该输入嵌入层由三个部分组成:(1)状态嵌入(State Embedding);(2)时间编码(Temporal Encoding);(3)身份嵌入(Identity Embedding)。

该嵌入层具有以下几个方面的优势:首先,状态嵌入实现了不同属性空间输入特征的统一对齐,从而有利于MAIT进行高效序列建模;其次,时间编码赋予模型捕获轨迹演化时序动态特征的能力;最后,身份嵌入显式建模了地面设备与UAV之间的异构性与并行性,为后续基于交互的注意力机制提供了结构化基础。因此,该嵌入层不仅增强了输入表示的表达能力,同时也为多UAV轨迹规划任务提供了更加鲁棒的结构先验信息。

**2)Attention层:**MAIT 的第 l 个注意力层将第 i 个输入的上一层特征分别映射为查询、键和值。该过程通过相应的可学习权重完成,用于为后续注意力计算提供不同类型的特征表征。其中,查询、键和值分别对应第 i 个输入在注意力机制中的不同表征形式。

通过注意力机制,一个输入节点可以接收来自其他输入节点的信息。因此,第 i 个输入节点与第 j 个输入节点之间的兼容性通过查询与键之间的匹配关系进行度量。为避免自注意力机制性能下降,该兼容性在计算过程中会根据键的维度进行缩放处理。

随后,第 i 个输入节点的自注意力特征通过对所有输入节点的信息进行加权聚合得到。具体而言,模型首先利用 Softmax 函数对兼容性结果进行归一化,以获得不同输入节点对应的注意力权重;然后根据这些权重对各输入节点的值进行加权求和,从而得到第 i 个输入节点的自注意力输出特征。Softmax 函数能够对输出进行归一化处理,并保留数据特征。

多头自注意力机制使注意力层能够在不同输入节点处,从不同表示子空间中联合关注信息 。在多头自注意力机制中,模型为 H 个注意力头分别构造多组查询、键和值,并分别计算第 i 个输入节点在不同注意力头下的自注意力特征。最后,模型将 H 个注意力头得到的自注意力特征进行合并,并通过可学习权重进行融合,从而获得第 i 个输入节点在第 l 个自注意力层中的多头自注意力特征。

**3)Mamba层:**Mamba-2 是一种基于状态空间模型改进而来的神经网络架构,旨在高效建模序列数据中的长程依赖关系。与依赖成对 token 交互的注意力机制不同,Mamba-2 将序列建模过程表述为连续时间状态空间动态系统,使其在序列长度维度上具有线性时间复杂度,并能够实现高效的硬件部署。因此,Mamba-2 尤其适用于长序列处理、低时延推理以及存储资源受限的应用场景。

Mamba-2 的基本思想是通过隐藏状态刻画输入信号随时间变化对输出结果的影响。具体而言,模型利用线性动态系统描述隐藏状态的演化过程,并进一步通过隐藏状态生成对应的输出。该建模方式使模型能够在连续时间框架下捕获序列中的动态变化关系。在实际计算中,Mamba-2 可被视为连续状态空间模型的离散化形式。通过引入离散化时间步参数,连续系统中的状态传播过程和输入映射过程被转换为离散形式,从而适用于神经网络中的序列计算。离散化后,当前时刻的隐藏状态由上一时刻的隐藏状态和当前输入共同决定,当前输出则由当前隐藏状态生成。由此,模型能够沿时间维度递推地更新状态,并持续提取序列上下文信息。

此外,对于长度为 T 的输入序列,Mamba 层还可以通过全局卷积形式计算输出。该过程将状态空间模型中的时序传播关系转化为卷积核,并利用输入序列与该卷积核之间的卷积运算得到输出结果。通过这种方式,Mamba 层能够以结构化形式实现序列信息的高效传播与聚合。总体而言,Mamba-2 层通过选择性状态传播机制捕获多样化的上下文信息,无需采用 Transformer 中常见的显式多头结构。这一特性使其能够在保持长程依赖建模能力的同时,提升长序列场景下的计算效率和实现适配性。

**4)轨迹输出层:**在无人机轨迹优化任务中,轨迹输出层是 Transformer 架构的终端模块,负责将 MAIT 模型生成的高维时序表征解码为可执行动作或轨迹控制信号。输出层的设计直接决定了模型与实际控制任务之间的映射关系,是连接模型表征空间与真实飞行控制空间的关键桥梁。因此,构建结构清晰、功能完整且具备任务泛化能力的输出机制,对于提升系统在不同无人机场景中的适应性和泛化能力具有重要意义。该输出机制需要同时支持离散轨迹规划和连续轨迹控制两类模式。

轨迹输出层面向多无人机系统设计,支持多个无人机的同步建模与并行输出,旨在同时适应离散轨迹规划任务和连续轨迹控制任务。其基本功能是将经过 L 层 Transformer 处理后得到的完整特征序列表征,解码为多个无人机在当前时间步对应的动作输出。换言之,该层根据模型提取到的全局时序特征,为每架无人机生成与具体任务相关的轨迹决策或控制量。

离散轨迹头主要用于目标节点集合由有限数量停靠点组成的轨迹规划任务。例如,在固定物联网设备数据采集场景中,每架无人机需要从预定义的停靠点集合中选择最合适的目标节点。为此,离散轨迹头会为每架无人机在当前时间步生成一个关于候选停靠点的概率分布。该概率分布由模型特征经过可学习投影和 Softmax 归一化后得到,并结合掩码机制对可选停靠点进行约束。在轨迹规划开始时,所有候选停靠点默认均可访问;在后续决策过程中,掩码用于表示某些停靠点当前是否可达或是否受到限制。每个时间步中,无人机会选择概率最大的候选停靠点作为下一目标停靠点。

连续轨迹头则适用于需要输出连续动作变量的场景,例如位置坐标、方向向量及类似控制表征。典型应用包括平滑轨迹跟踪和动态导航。根据具体控制任务的不同,预测动作可以表示为位置增量、距离与航向角,或绝对目标位置。连续轨迹头通过可学习投影生成连续控制输出,并利用 Tanh 激活函数对输出范围进行约束。随后,模型结合任务相关的物理尺度因子,将预测结果调整到具有实际物理意义的取值范围内。

本文提出的轨迹输出层具有多个关键优势。首先,该结构基于统一状态表示实现多UAV并行建模与同步输出,从而增强系统对协同行为的建模能力。其次,通过分别设计离散轨迹输出头与连续轨迹输出头,模型能够适应不同类型任务格式,并支持异构任务场景之间的统一集成。最后,针对不同动作空间采用差异化激活函数:Softmax用于离散目标选择,可将输出映射为概率分布;Tanh则用于连续控制变量约束,使输出保持在物理可行范围内。该设计在输出精度与控制稳定性之间实现了有效平衡,并有助于强化学习优化过程中更加鲁棒的策略学习。MAIT模型整体工作流程如算法1所示(具体算法可查看原文)。

3.3 T-RGPO强化学习

传统UAV轨迹规划中的强化学习方法主要依赖于Actor--Critic(AC)类算法,例如A3C与DDPG。然而,这类方法在训练过程中面临显著挑战。一方面,AC类算法需要同时维护策略网络与价值网络。其中,价值网络通常与策略网络具有相近的模型规模,因此会带来较高的计算开销与存储开销。另一方面,在高度动态环境中,中间状态价值往往难以被准确估计,从而导致训练过程容易出现不稳定问题。

图3. T-GRPO的训练流程

为解决上述问题,本文提出一种新的Trajectory-Group Relative Policy Optimization(T-GRPO)方法。该方法完全移除了价值网络,从而显著降低了强化学习过程中的计算与存储成本。此外,T-GRPO并非依赖价值网络预测奖励来估计优势函数,而是基于同一状态下多个生成结果之间的相对优劣关系进行优势估计,从而有效减轻了价值估计偏差问题。同时,T-GRPO还引入了一种针对Kullback--Leibler(KL)散度的优化正则化策略,进一步提升了训练稳定性与收敛效率。下面将结合图3,对T-GRPO训练流程进行详细描述,并首先给出状态、动作以及奖励的定义。

**1)状态、动作与奖励:**为系统化描述多UAV协同轨迹规划任务,本文对状态空间、动作空间以及奖励函数进行如下定义。

  • 状态空间**:**系统状态由所有输入节点在当前时间步的联合状态构成。每个输入节点均具有对应的状态向量,用于描述该节点在当前时刻的状态信息。通过将所有输入节点的状态进行组合,可以得到整个多无人机系统在当前时间步的全局状态表征。
  • 动作空间**:** 动作空间的定义取决于具体任务形式。在离散轨迹规划任务中,每架无人机从预定义的候选停靠点集合中选择下一目标节点;而在连续控制任务中,每架无人机则生成连续控制向量,用于调整其运动参数。因此,在整个规划周期内,系统的强化学习轨迹可由一系列连续时间步上的状态和动作共同表示,从而描述多无人机系统在规划过程中的动态演化。
  • 奖励函数**:** 奖励函数用于衡量系统在给定状态和动作下所获得的即时收益。该收益可根据具体任务目标进行设计,例如能耗、覆盖增益、路径平滑性或碰撞规避惩罚等。在完整的强化学习轨迹中,系统的累计回报由各时间步的即时奖励按照折扣因子加权累积得到,其中折扣因子用于平衡当前收益与未来收益之间的影响。通过最大化累计回报,模型能够学习适用于多无人机协同轨迹规划任务的优化策略。

**2)组采样:**为了充分探索策略空间,并降低单条轨迹可能引入的估计偏差,本文采用多轨迹采样策略。在每一轮策略更新中,算法从给定初始状态出发,在当前策略下执行 G 次相互独立的轨迹采样,从而生成 G 条完整的状态---动作序列。每条轨迹均完整记录从初始状态到终止时间步之间的状态转移过程和动作选择结果。该多轨迹并行采样机制能够增强策略行为表征的多样性,并为后续优势估计提供更加稳健和充分的数据基础。

**3)奖励计算:**每条轨迹的累计回报通过对各时间步的即时奖励进行折扣累加得到。具体而言,算法利用折扣因子对不同时间步的奖励进行加权,使当前奖励与未来奖励能够共同反映轨迹的整体质量。由此得到的累计回报用于衡量无人机在整个规划周期内的综合表现。

**4)相对优势估计:**为避免绝对价值估计带来的偏差,T-GRPO 采用基于归一化的组内相对优势估计方法。具体而言,算法首先根据同一组内所有采样轨迹的累计回报计算组平均回报和回报标准差,以刻画该组轨迹整体收益水平及其离散程度。

**5)策略优化:**在 T-GRPO 的训练过程中,对于每条采样轨迹及其每个决策时间步,算法首先计算当前策略与旧策略之间的概率比,用于度量动作分布在策略更新前后的相对变化。为保证策略更新的稳定性,T-GRPO 借鉴 PPO 中的裁剪目标函数设计 ,对相对优势可能带来的过度放大效应进行约束。具体而言,算法通过裁剪机制将策略概率比限制在可控范围内,从而避免过于激进的策略更新导致训练不稳定。裁剪范围由相应的超参数控制。

在此基础上,整体策略目标通过对所有采样轨迹及其各决策时间步上的裁剪目标进行平均来构建,并以最大化该目标作为策略优化方向。进一步地,为约束策略更新幅度并防止更新过程中出现过度偏离,T-GRPO 在目标函数中引入 KL 惩罚项,用于度量旧策略与当前策略之间的分布差异。最终形成的复合目标函数能够在策略改进、更新稳定性和组内相对优势利用之间实现平衡,从而提升多无人机轨迹规划任务中的收敛速度和鲁棒性。T-GRPO 算法的整体工作流程见算法 3。(具体算法可查看原文)。

****4.案例研究1:连续轨迹规划

4.1 仿真参数设置

在本案例研究中,本文研究UAV辅助移动边缘计算(MEC)系统中的轨迹规划问题,并采用与文献10类似的系统框架。仿真区域大小为400×400 米,系统中包含100个用户设备(UE)以及4架UAV。每个UE在每个时间时隙中生成一个计算任务,其中:每个任务的通信数据量在10 KB至50 KB之间随机选取;每个任务所需的计算资源需求在 2×10^9 至 2×10^10 CPU周期范围内随机生成。本案例研究中的其余参数设置详见表1。

表1:案例研究1的参数设置

4.2 Agentic RAG分析

本文基于DeepSeek R1设计了一套Agentic RAG系统,利用其强大的推理能力,更好地支持面向Agent驱动的RAG框架优化。在系统实现中,本文采用Qanything作为底层RAG系统,并向其知识库中注入了大量与UAV轨迹规划相关的文献,以增强LLM对UAV任务需求的理解能力。

为系统性评估不同RAG系统生成任务建模结果的质量,本文设计了一套由四项关键指标组成的评估方案:(1)状态正确性(State Correctness):用于评估生成的状态空间是否包含所有必要变量,以及各变量类型定义是否正确。(2)动作正确性(Action Correctness):用于评估构建的动作空间是否包含全部必要元素,以及动作类型是否被正确指定。(3)约束覆盖率(Constraint Coverage):用于评估系统是否正确识别并纳入主要任务约束条件。(4)奖励一致性(Reward Consistency):用于衡量所设计奖励函数与底层任务目标之间的一致程度。此外,本文进一步采用模型幻觉(Hallucination)现象来评估生成内容是否引入了与知识库或系统模型不一致的虚构变量、错误约束或无效奖励定义。基于此,本文定义了"抗幻觉率(Anti-Hallucination Rate)"指标,用于评估幻觉现象对最终任务建模结果的影响。该指标用于衡量任务建模结果中保持事实正确、满足约束条件以及语义有效的任务元素比例。其中,上述四个评估维度分别占最终评分的25%。抗幻觉率越高,说明生成任务建模结果的可靠性与正确性越高。图4对比了传统RAG与Agentic RAG在三个典型任务案例中的抗幻觉率表现。从图中可以看出,在所有案例中,Agentic RAG均明显优于传统RAG基线模型。

在案例研究1(第IV节)中,Agentic RAG将抗幻觉率由约65%提升至95%以上。在案例研究2(第V节)与案例研究3(第VI节)中,也观察到了类似提升。其中,Agentic RAG的抗幻觉率达到约93%--94%,显著高于传统RAG约54%--58%的水平。这些结果充分表明,Agentic RAG框架能够显著降低模型幻觉问题,增强事实一致性与约束一致性,并在不同UAV轨迹规划场景下提供更加可靠的任务建模能力。

经过多轮检索与推理后,LLM最终给出了如下结论:

**1)状态空间:**状态空间由UE的位置、各任务的通信数据量以及计算资源需求共同构成。

**2)动作空间:**动作空间定义为每架UAV的飞行距离与飞行角度。本文假设任务卸载矩阵与资源分配矩阵可通过现有凸优化算法或匹配算法求解,而这些算法已集成于Agentic RAG框架的工具库中。

**3)奖励函数:**奖励函数旨在最小化所有UE的总能量消耗,其中包括任务卸载能耗与本地执行能耗。

**4)模型架构:**推荐模型架构由10层编码器组成,其中70%为Attention层,30%为Mamba层。

**5)训练方法:**训练方法采用连续轨迹优化策略,并使用4条独立采样轨迹(rollouts)对模型进行训练。

**6)任务约束:**任务约束包括每个UE任务的二元卸载决策、单架UAV可执行的最大卸载任务数量、UAV飞行距离限制、UAV覆盖范围约束以及任务执行的服务质量(QoS)要求等。

图4:RAG与Agentic RAG在三个案例研究中的抗幻觉率对比。

4.3 不同Transformer模型的比较

本实验旨在比较不同网络架构在性能与计算效率方面的表现。本文将MAIT模型与以下几种注意力机制模型进行对比:Classic Transformer ;Linear Transformer(Linformer);Performer 。此外,实验还测试了两种不同结构配置的MAIT模型:MAIT 1:由Agentic RAG系统推荐,其网络结构中包含70%的Attention层;MAIT 2:其网络结构中包含30%的Attention层,即采用更多Mamba层。不同Transformer模型的能量消耗与推理时间如表2所示。

表 2:不同Transformer模型的比较

从表2可以看出,由Agentic RAG系统推荐的MAIT 1模型实现了最低的能量消耗。相比之下,采用更多Mamba层的MAIT 2模型虽然获得了最短的推理时间,但其能量消耗略有增加。Performer模型虽然在能量消耗方面优于MAIT 2,但其推理时间更长。而其他基于Transformer的模型在性能与推理时间两个方面均未表现出相对于MAIT模型的明显优势。

MAIT模型能够实现较低能量消耗,主要原因包括以下两个方面:(1)Agentic RAG框架能够根据用户规模自适应地确定MAIT网络结构,包括Attention层与Mamba层的比例,从而实现高效且准确的特征提取;(2)Attention--Mamba混合结构能够同时捕获全局依赖关系与局部模式特征。其中,Attention层负责建模上下文关系,而Mamba层则用于保持序列一致性并减少冗余计算。

4.4 不同训练方法的比较

本实验通过将所提出的T-GRPO算法与AC 、DDPG以及SAC进行对比,以验证T-GRPO算法的可行性。不同强化学习方法的能量消耗与训练时间结果如表3所示。从表中可以看出,T-GRPO在所有方法中实现了最低的能量消耗。这一优势主要来源于其归一化优势函数设计,该设计能够有效降低策略梯度方差,从而实现对能量优化目标更加稳定的策略学习过程。此外,T-GRPO还能够在探索(exploration)与利用(exploitation)之间实现自适应平衡,使模型能够在不同状态空间条件下收敛到更加有效的能量控制策略。因此,相比其他强化学习方法,T-GRPO表现出更加鲁棒且更优的训练性能。

表 3:不同训练方法的比较

5. 案例研究2:离散轨迹规划

5.1 仿真参数设置

在本案例研究中,本文研究无线能量传输(WPT)辅助物联网(IoT)系统中的UAV轨迹规划问题,并采用与文献11类似的系统框架。研究区域大小为1000×1000 米,其中随机部署了500个物联网设备(IoTD)。每个IoTD需要采集的数据量在0.2 MB至1.5 MB区间内随机生成。本案例研究的详细参数设置列于表4。

表 4:案例研究2的参数设置

5.2 Agentic RAG分析

本文将参考文献11纳入知识库,并围绕相似系统构建LLM查询任务。

经过多轮检索与推理后,LLM给出了如下结论:

**1)状态空间:**状态空间由所有IoTD的位置以及各设备剩余待采集数据量共同组成。

**2)动作空间:**动作空间定义为选择下一待访问IoTD的位置,同时满足以下约束条件:每个IoTD仅能被访问一次,并且只能由单架UAV独占访问。

**3)奖励函数:**奖励函数综合考虑UAV总能量消耗,其中包括飞行能耗、悬停能耗以及无线充电能耗。

**4)模型架构:**推荐模型结构由15层编码器组成,其中30%为Attention层,70%为Mamba层,并建议采用带有掩码矩阵的离散输出头结构。

**5)训练方法:**训练方法采用离散轨迹优化策略,并利用8条独立采样轨迹(rollouts)对模型进行训练。

**6)任务约束:**任务约束规定,由于UAV的数据存储能力与能量资源有限,因此总能量消耗不得超过UAV最大能量容量,同时总数据采集量不得超过其最大存储容量。

5.3 不同轨迹规划器的比较

在实验中,本文评估了两种MAIT模型变体:MAIT 1:基线配置模型,其中包含70%的Attention层;MAIT 2:由Agentic RAG系统推荐的模型,其中包含30%的Attention层。随后,本文将其与多种离散轨迹规划算法进行性能对比,包括:Graph Neural Network(GNN);Graph Pointer Network(GPN);ATOM网络。实验采用能量消耗与推理时间作为评估指标,结果如表5所示。

从表5可以看出,MAIT 1实现了最低的能量消耗,而MAIT 2则在所有对比算法中获得了最短的推理时间。其原因在于,MAIT框架采用了Attention--Mamba混合机制,使编码器能够同时捕获IoTD的局部特征与全局特征,从而获得更加有效的特征表示;与此同时,Mamba结构显著降低了模型推理时间。

表 5:不同轨迹规划器的比较

为进一步评估所提出MAIT模型的鲁棒性与统计可靠性,本文进一步开展了包含200个IoTD的附加实验。在该实验设置下,MAIT 1、MAIT 2、GNN、GPN以及ATOM等算法均采用不同随机种子独立运行10次,以消除基于学习的轨迹规划方法中固有的随机性影响。实验结果在图5中给出,其中报告了各算法的平均能量消耗以及95%置信区间(Confidence Interval,CI)。结果表明,两种MAIT模型均持续优于基线算法,在多次重复实验中均表现出更低的能量消耗以及更小的性能波动方差。

图5:不同轨迹规划器的平均能量消耗

5.4 不同约束条件下的比较

本实验旨在评估MAIT模型的泛化能力,并将所有轨迹规划方法应用于具有不同UAV数据存储容量约束的场景中。实验中,UAV数据存储容量范围设置为340 MB至512 MB。不同方法对应的能量消耗仿真结果如图6所示。

图6:不同UAV数据存储容量条件下的能量消耗

从图6可以看出,GNN具有最高的能量消耗,其后依次为GPN、ATOM以及MAIT。在所有基于神经网络的方法中,MAIT实现了最低的能量消耗。这一优势主要来源于以下两个方面:(1)其Attention与Mamba混合机制相比其他方法具有更强的特征提取能力;(2)本文提出的T-GRPO算法能够更有效地捕获并适应UAV辅助数据采集过程中的动态因素,例如剩余存储容量与剩余电池能量等。

6. 结论

本文提出了ARMAIT框架,该框架融合了用于自主任务理解的Agentic RAG、用于高效轨迹特征建模的MAIT模型,以及用于混合动作空间稳定强化学习优化的T-GRPO算法。ARMAIT能够实现面向多UAV系统的端到端推理与轨迹生成。实验结果表明,相较于现有方法,ARMAIT在决策准确性与收敛速度方面均表现出更优性能,并在多个案例研究中展现出较强的泛化能力。然而,当前框架仍然依赖全局系统信息,并且仅关注UAV轨迹优化问题,尚未联合考虑资源调度问题。

未来,本文将进一步扩展ARMAIT框架,使其适用于去中心化与部分可观测场景,并探索轨迹规划与资源分配的联合优化,以进一步提升整体系统性能。

相关推荐
爱编程的小白L2 小时前
2027 计算机毕业设计选题汇总|深度学习专项(2027最新)
人工智能·深度学习·课程设计
wdfk_prog2 小时前
LWIP教程 09:从 `tcp_slowtmr()` 到 Fast Retransmit——TCP 超时重传与重复 ACK
服务器·网络·数据库·网络协议·tcp/ip
逸模2 小时前
BIM在连锁餐饮装修中的应用:不只是画三维图
大数据·数据库·人工智能·物联网·建模
Zooproxy全球IP代理2 小时前
住宅IP在AI行业中的技术应用:数据采集基础设施的工程实践
人工智能·网络协议·tcp/ip
夏白分享社2 小时前
没有 GPS,也没预建地图:双目+IMU 如何让无人机自主导航?
无人机·定位·导航
Rocky Ding*2 小时前
MOSS-VL技术原理深度解析:让视觉流持续进入生成过程,实时 Agent 才有架构基础
论文阅读·人工智能·深度学习·机器学习·aigc·多模态·ai-native
15Moonlight2 小时前
Linux网络(02):Socket 编程 UDP
linux·网络·udp