2025 IEEE TII,大型风电场无人机巡检的混合深度强化学习:部署与路径优化

目录


1.摘要

海上风电装机规模持续扩大,人工巡检耗时且难以扩展。论文提出一种启发式部署算法+深度强化学习(DRL)路径规划的混合方法,将大型风场巡检拆成巢站部署与分区内路径优化两个连续阶段。部署阶段根据风场拓扑、UAV航程、电池和风况划分巡检区域并减少巢站数量;路径阶段将风扰动下的巡检建模为非对称旅行商问题(ATSP),用图指针网络生成能耗友好巡检路线。Walney风场及其500、1000和2000台风机的扩展仿真表明,该方法在覆盖效率、能耗、环境适应性和计算时间之间取得较好平衡。

2.系统模型与问题描述

风场由 Q Q Q台风机的坐标和拓扑构成,风机 m m m与 n n n之间的距离记为 d m , n d_{m,n} dm,n。UAV的飞行能耗和悬停能耗分别为

E f = P f T f , E_f=P_fT_f, Ef=PfTf,

E h = P h T h , E_h=P_hT_h, Eh=PhTh,

其中, P f 、 P h P_f、P_h Pf、Ph分别是飞行功率和悬停功率, T f 、 T h T_f、T_h Tf、Th是相应时间,风会改变空速 V a V_a Va与地速 V g V_g Vg的关系。

UAV的有效巡检范围由通信距离 R c R_c Rc和风况下的最大返航半径共同决定:

R i w = min ⁡ ( R c , R f w ) , R_i^w=\min(R_c,R_f^w), Riw=min(Rc,Rfw),

R f w = V max ⁡ w T max ⁡ 2 . R_f^w=\frac{V_{\max}^wT_{\max}}{2}. Rfw=2VmaxwTmax.

部署问题以最少巢站为目标:

min ⁡ B , Z , x i , y i ∑ i = 1 N b i . \min_{B,Z,x_i,y_i}\sum_{i=1}^{N}b_i. B,Z,xi,yimini=1∑Nbi.

其中, b i b_i bi表示巢站是否部署, z i , m z_{i,m} zi,m表示风机 m m m是否分配给UAV i i i。

分区确定后,UAV从巢站出发,访问分区内全部风机并返回巢站。目标是最小化总巡检时间:

min ⁡ ∑ m = 1 M ∑ m , n ∈ Z t i , m , n , \min\sum_{m=1}^{M}\sum_{m,n\in Z}t_{i,m,n}, minm=1∑Mm,n∈Z∑ti,m,n,

t i , m , n = d m , n V g , m , n w , t i , n , m = d m , n V g , n , m w . t_{i,m,n}=\frac{d_{m,n}}{V_{g,m,n}^w},\qquad t_{i,n,m}=\frac{d_{m,n}}{V_{g,n,m}^w}. ti,m,n=Vg,m,nwdm,n,ti,n,m=Vg,n,mwdm,n.

3.混合算法流程

系统流程分为数据预处理、UAV部署和巡检路径优化三阶段。预处理阶段用Mercator投影把经纬度转为笛卡尔坐标,建立风场拓扑,并依据UAV最大抗风能力确定可执行风速范围。部署阶段依据航程、电池和风机分布划分分区,每个分区配置巢站。路径阶段在局部区域内训练图指针网络,输入风机拓扑、分区结果和天气信息,输出访问所有风机并返航的路线。

启发式部署算法先在每台风机位置初始化一个UAV巢站,再计算风况下的航程和电池约束。

DRL路径规划将每个分区建模为马尔可夫决策过程 ( S , A , R , P ) (S,A,R,P) (S,A,R,P)。状态为

s t = V t , L t , E t , U t , W t , s_t=V_t,L_t,E_t,U_t,W_t, st=Vt,Lt,Et,Ut,Wt,

其中 V t V_t Vt是已巡检风机集合, L t = ( x t , y t ) L_t=(x_t,y_t) Lt=(xt,yt)是当前位置, E t E_t Et是剩余能量, U t U_t Ut包含未巡检风机的位置与距离, W t = ( w a v g , w g u s t , w d i r ) W_t=(w_{\mathrm{avg}},w_{\mathrm{gust}},w_{\mathrm{dir}}) Wt=(wavg,wgust,wdir)是平均风速、阵风强度和风向。动作是选择下一台未巡检风机或返回巢站:

a t ∈ U t ( s t ) ∪ { v d e p o t } . a_t\in U_t(s_t)\cup\{v_{\mathrm{depot}}\}. at∈Ut(st)∪{vdepot}.

执行动作后更新已访问集合、坐标、剩余能量和未访问风机距离;若风况以概率方式建模,转移也具有随机性。即时奖励由距离、能耗、任务完成和安全项组成:

R t = w d R d i s t + w e R e n e r g y + w c R c o m p l e t i o n + w s R s a f e t y . R_t=w_dR_{\mathrm{dist}}+w_eR_{\mathrm{energy}}+w_cR_{\mathrm{completion}}+w_sR_{\mathrm{safety}}. Rt=wdRdist+weRenergy+wcRcompletion+wsRsafety.

其中

R d i s t = − d ( L t , L t + 1 ) , R e n e r g y = − E c o n s u m e d ( L t , L t + 1 , W t ) . R_{\mathrm{dist}}=-d(L_t,L_{t+1}),\qquad R_{\mathrm{energy}}=-E_{\mathrm{consumed}}(L_t,L_{t+1},W_t). Rdist=−d(Lt,Lt+1),Renergy=−Econsumed(Lt,Lt+1,Wt).

访问新风机获得 C v i s i t C_{\mathrm{visit}} Cvisit,完成全部巡检并安全返航获得较大的 C f i n a l C_{\mathrm{final}} Cfinal;低电量、重复访问、超过风速或阵风阈值会受到惩罚。折扣回报为

G t = ∑ k = 0 T − t − 1 γ k R t + k + 1 . G_t=\sum_{k=0}^{T-t-1}\gamma^kR_{t+k+1}. Gt=k=0∑T−t−1γkRt+k+1.

网络采用编码器---解码器和指针机制。风机坐标 X i = x i , y i X_i=x_i,y_i Xi=xi,yi先嵌入 d x d_x dx维表示,编码器用多头注意力(MHA)和前馈网络提取全局拓扑关系,并使用跳跃连接与批归一化;对不相邻节点的注意力相关性设为 − ∞ -\infty −∞。解码器以注意力和指针向量生成下一节点概率,已访问节点通过mask屏蔽:

π θ ( a i ∣ s i ) = p i = softmax ⁡ ( u i ) . \pi_\theta(a_i\mid s_i)=p_i=\operatorname{softmax}(u_i). πθ(ai∣si)=pi=softmax(ui).

下一节点可通过采样或贪心搜索选择。训练采用带baseline的策略梯度,梯度更新形式为

∇ θ k J ( θ k ) = 1 B ∑ i = 1 B ∑ t = 1 N r i ( k ) ( s i , t ( k ) , a i , t ( k ) ) − b i , k ∑ t = 1 N ∇ θ k log ⁡ π θ k ( a i , t ( k ) ∣ s i , t ( k ) , h i , t ( k ) ) , \nabla_{\theta_k}J(\theta_k)=\frac{1}{B}\sum_{i=1}^{B}\left\\sum_{t=1}\^{N}r_i\^{(k)}(s_{i,t}\^{(k)},a_{i,t}\^{(k)})-b_{i,k}\\right\left\\sum_{t=1}\^{N}\\nabla_{\\theta_k}\\log\\pi_{\\theta_k}(a_{i,t}\^{(k)}\\mid s_{i,t}\^{(k)},h_{i,t}\^{(k)})\\right, ∇θkJ(θk)=B1i=1∑Bt=1∑Nri(k)(si,t(k),ai,t(k))−bi,kt=1∑N∇θklogπθk(ai,t(k)∣si,t(k),hi,t(k)),

θ k ← θ k + α ∇ θ k J ( θ k ) . \theta_k\leftarrow\theta_k+\alpha\nabla_{\theta_k}J(\theta_k). θk←θk+α∇θkJ(θk).

4.实验结果

实验数据来自包含三个子风场的Walney offshore wind farm。作者用高斯核密度估计拟合真实风机分布,并按风场尺寸比例生成Walney 500、Walney 1000和Walney 2000三个虚拟数据集。

比较方法包括暴力搜索、ACO、GA及其他基线。暴力搜索得到的路径质量最优但运行时间最长;运行速度快于本文方法的算法并未同时获得最优路线。DRL模型在显著缩短求解时间的同时得到最优或接近最优的巡检结果,说明局部分区训练能够把风向造成的非对称时间纳入快速决策。

论文把大型海上风场巡检拆成巢站部署和分区路径规划两个连续问题,分别用启发式算法和DRL求解,并在模型中统一考虑UAV航程、电池、通信距离、悬停能耗以及风速、风向和阵风。实验表明,启发式部署可随风机规模和风况减少巢站数量,DRL路径规划则能在非对称风扰动下快速生成覆盖全部风机的路线。

5.参考文献

Zhang X Y, Yu H, Zheng X, et al. Hybrid Deep Reinforcement Learning for UAV Inspection in Large-Scale Wind Farms: Deployment and Routing OptimizationJ. IEEE Transactions on Industrial Informatics, 2025.

6.算法辅导·应用定制·读者交流

xx

相关推荐
zh路西法17 小时前
【10天速通ROS2-PX4无人机】(四) 关掉GPS和气压计,纯激光定位还能飞吗
c++·无人机·px4·ros2·卡尔曼滤波·fastlio2
沈阳昊天环宇无人机小编辑3 天前
沈阳无人机从业者注意!官方明确新黑飞整治常态化,合规飞行流程一文读懂
无人机
徐凤年_3 天前
SUPER功能包理解
无人机
zh路西法3 天前
【10天速通ROS2-PX4无人机】(一) 从零搭建仿真环境,妈妈再也不用担心我炸机了!
无人机·仿真·px4·ros2·gazebo
沈阳昊天环宇无人机小编辑4 天前
沈阳学无人机怎么选?沈阳昊天环宇:从合规取证到行业应用,构建低空经济时代的核心竞争力
无人机
JulyLi20195 天前
基于光电球机低空无人机智能追踪系统
无人机
小许同学记录成长5 天前
QGIS二次开发技术文档
图像处理·qt·信息可视化·无人机
GrepowTattu6 天前
新品发布|Tattu TA-BC无人机电池检测器上线,多通道充电状态尽在掌握
无人机
xuanshang_yutou7 天前
无人机调试起飞遇到的问题及注意事项
无人机