https://arxiv.org/pdf/2604.13278
摘要
无人机(UAV)图像中的航空目标检测由于微小目标的高普及率、恶劣的环境条件以及严格的计算限制,带来了独特的挑战。标准的基于YOLO的检测器无法同时解决这些问题:其8像素的最小检测步长使得小于32像素的目标几乎无法检测;其CIoU损失对于不重叠的微小边界框会产生零梯度;其架构中存在显著的滤波器冗余。我们提出了DroneScan-YOLO,这是一个整体性的系统贡献,通过四个协调的设计选择来解决这些限制:(1)将输入分辨率提高到1280×1280,以最大化微小目标的空间细节;(2)RPA-Block,一种基于延迟余弦相似度更新并带有10个epoch预热期的动态滤波器剪枝机制;(3)MSFD,一个步长为4的轻量级P2检测分支,仅增加114,592个参数(+1.1%);(4)SAL-NWD,一种混合损失,将归一化Wasserstein距离与尺寸自适应CIoU加权相结合,并集成到YOLOv8的TaskAligned分配管道中。在VisDrone2019-DET数据集上的评估表明,DroneScan-YOLO实现了55.3%的mAP@50和35.6%的mAP@50-95,分别比YOLOv8s基线高出+16.6和+12.3个百分点,将召回率从0.374提高到0.518,并仅增加+4.1%的参数即可保持96.7 FPS的推理速度。收益在微小目标类别上最为显著:bicycle的AP@50从0.114提高到0.328(+187%),awning-tricycle从0.156提高到0.237(+52%)。
1 引言
无人机(UAV)在工业中占据着越来越重要的地位,广泛应用于监控、交通监测、搜救、农业检查和边境安全。从无人机摄像头进行实时目标检测的性能是这些应用的一个主要问题。尽管深度学习取得了许多重大进展,但无人机成像中仍然存在一些重要的局限性。我们选择并试图解决三个基本且相互依赖的挑战。
微小目标的普遍性。在高空记录的相机数据中,很大一部分目标在记录中占据的像素太少。在VisDrone2019-DET数据集中,68%的标注实例占据的像素少于32×32。YOLOv8s架构在步长8、16和32处生成预测,分别表征特征图P3、P4和P5。对于步长8,640×640图像中一个8×8像素的元素在P3上生成1×1的激活,这导致生成的向量无法捕获用于分类的有效上下文。
小边界框的损失不稳定性。基于IoU及其变体(GIoU、DIoU、CIoU)的损失函数在小目标上表现出明显的失败模式:当预测框和目标框不重叠时,梯度会消失。对于一个5×5像素的目标框,1像素的偏移就会使IoU从0.25降至0,从而抑制了最具挑战性样本的全局学习信号。
计算效率。嵌入式无人机系统在功率、内存和散热方面受到严格限制。现有的解决方案(如添加检测头或更深的backbone)以提高精度为代价,直接增加了计算负载和模型大小。
当前的文献分别解决了这些问题。YOLO-LE展示了架构效率的提高,但没有改进损失。DAU-YOLO通过注意力机制改进了特征,但没有解决分辨率或损失问题。NWD为小目标提供了鲁棒的度量,但没有融入一个协同框架。没有方法明确地将输入分辨率、多尺度检测、滤波器剪枝和损失函数结合在一个共同的可操作基础中。
我们引入了DroneScan-YOLO,它同时解决了这些约束:(I)将分辨率提高到1280px,使特征图表面积变为四倍,提高了微小目标的可检测性。(II)RPA-Block:基于滤波器间余弦相似度的剪枝系统,带有预热期和延迟更新以减少计算冗余。(III)MSFD:步长为4的轻量级P2检测分支,使用可分离卷积和挤压-激励注意力,仅增加114,592个参数(+1.1%)。(IV)SAL-NWD:混合损失,将归一化Wasserstein距离与与面积成反比的CIoU加权相结合,在YOLOv8的TaskAligned管道中实现。(V)在VisDrone2019-DET上进行了全面的实验评估,包括8种配置的消融研究和关键超参数的敏感性分析。
本文的其余部分组织如下。第2节回顾相关工作。第3节描述提出的架构。第4节展示实验结果。第5节得出结论。
2 相关工作
自R-CNN及其变体等第一批两阶段架构20以来,深度学习目标检测经历了漫长的进步轨迹,发展到了YOLO家族的实时单体检测器。YOLOv1在2016年引入了单次检测范式13,随后YOLOv314通过在三个不同分辨率下进行预测建立了多尺度检测。YOLOv5以高度优化的训练管道巩固了这一方法。YOLOv8由Ultralytics于2023年开发,代表了该家族的最先进水平,具有解耦检测头、无锚点设计和优化的CSP backbone,在保持高推理速度的同时在COCO上达到了具有竞争力的性能。然而,其8像素的最小检测步长构成了无人机场景中目标尺寸非常小的重要约束。
针对无人机图像的基于YOLO的检测器。大量研究旨在使YOLO架构适应无人机图像。YOLO-LE限制了全局复杂性,提出了轻量级卷积块C2f-Dy和LDown,在VisDrone上达到了36.4%的mAP@50。DAU-YOLO在neck中提供了双重注意力单元,并改进了多尺度特征融合。LMWP-YOLO通过将轻量级卷积与多维注意力和改进的Wasserstein损失联系起来,提出了多模态融合。DroneScan-YOLO带来了多尺度架构、滤波器剪枝效率和损失鲁棒性的协同优化,并采用了更合适的输入分辨率。
多尺度检测。特征金字塔网络(FPN)引入了特征的自顶向下聚合以进行多尺度检测。PANet16增加了一个额外的自底向上路径。最近的工作实现了高分辨率检测头,以恢复小目标的召回率。我们的MSFD贡献延续了这一方法,同时使用深度可分离卷积19和通道注意力来最小化P2分支的参数开销。
神经网络剪枝。训练后基于幅度的剪枝在收敛后移除权重。彩票假设(Lottery Ticket Hypothesis)证明了密集网络中存在高性能的稀疏子网络。动态稀疏训练(Dynamic Sparse Training)联合优化权重和结构。我们的RPA-Block通过前向钩子(forward hooks)应用余弦相似度准则扩展了这一点,在预热期后每N个epoch进行延迟掩码更新,在实现等效最终稀疏度的同时减少了重新计算的开销。
微小目标的损失函数。使用归一化Wasserstein距离(NWD)将检测框建模为2D高斯分布,即使在没有重叠的情况下也能提供平滑的非零梯度。我们的SAL-NWD通过一个与目标面积成反比的自适应加权项扩展了NWD,放大了小目标的梯度贡献,并直接集成到YOLOv8的TaskAligned管道中。
现有文献的一个主要局限是对这些挑战的单独处理。注重效率的方法(如YOLO-LE)不修改损失函数。注重损失鲁棒性的方法(如NWD)不解决架构效率或输入分辨率问题。DroneScan-YOLO的独特之处在于在一个连贯的系统中联合优化所有四个维度,其中每个组件都相互强化。
3 方法
3.1 架构概述
DroneScan-YOLO建立在YOLOv8s的backbone之上(9.84M参数,在640×640下为23.6 GFLOPs)。该架构在三个额外维度上进行了扩展。RPA-Block通过在第2层(64个通道,P2)和第4层(128个通道,P3)的backbone提取层上实现前向钩子(forward hooks)来实现。MSFD在neck中作为一个额外的P2检测分支实现。SAL-NWD替换了v8DetectionLoss准则的BboxLoss组件。训练在1280×1280像素下进行,将特征图的空间分辨率变为四倍,总参数开销为+400,080(+4.1%)。
Backbone通过一系列卷积块处理输入图像,生成分辨率递减的特征图P1到P5。RPA-Block应用于backbone的第2层和第4层,其中高分辨率产生了最多的计算冗余。MSFD通过在向下融合之前添加专用的P2分支来集成到FPN15 neck中。SAL-NWD通过替换Ultralytics的v8DetectionLoss准则的标准BboxLoss组件,在检测头级别运行。
3.2 增强的分辨率
从640×640切换到1280×1280像素是一个基本的架构选择。在640px下,一个8×8像素的目标在P3(步长8)上产生1×1的激活。在1280px下,同一个目标在P3上产生2×2的激活,在MSFD引入的新P2头(步长4)上产生4×4的激活。这种分辨率的提高通过MSFD中的轻量级可分离卷积以及RPA-Block减少高分辨率层中的计算冗余而变得可行。
3.3 RPA-Block
标准卷积层会累积冗余的滤波器,这些滤波器收敛到具有非常相似特征的检测器,增加了计算成本而没有提高表示能力。RPA-Block在训练期间识别并动态抑制这些冗余滤波器。
对于具有权重张量 W∈RCout×Cin×k×kW \in \mathbb{R}^{C_{out} \times C_{in} \times k \times k}W∈RCout×Cin×k×k 的卷积层,每个滤波器 wiw_iwi 被展平为 RCin⋅k2\mathbb{R}^{C_{in} \cdot k^2}RCin⋅k2 中的向量。余弦相似度矩阵 S∈RCout×CoutS \in \mathbb{R}^{C_{out} \times C_{out}}S∈RCout×Cout 为:
Sij=wi⋅wj∥wi∥⋅∥wj∥(1)S_{ij} = \frac{w_i \cdot w_j}{\|w_i\| \cdot \|w_j\|} \quad (1)Sij=∥wi∥⋅∥wj∥wi⋅wj(1)
通过扫描 SSS 的上三角矩阵得出二值掩码 m∈{0,1}Coutm \in \{0, 1\}^{C_{out}}m∈{0,1}Cout:对于每对满足 Sij>θS_{ij} > \thetaSij>θ 的 (i,j)(i, j)(i,j),滤波器 jjj 被掩码。前向传播变为:
y=(W∗x)⊙reshape(m,1,Cout,1,1)(2)y = (W * x) \odot \text{reshape}(m, 1, C_{out}, 1, 1) \quad (2)y=(W∗x)⊙reshape(m,1,Cout,1,1)(2)
引入了两种稳定机制:(1) W=10W=10W=10 个epoch的预热期,在此期间 m=1m=1m=1,允许滤波器在剪枝激活前学习多样化的表示;(2)延迟更新,每 N=5N=5N=5 个epoch重新计算 mmm,在实现等效最终稀疏度的同时将重新计算开销减少5倍。
3.4 MSFD(多尺度特征蒸馏头)
在1280px下,一个8×8像素的目标在P3上仅产生2×2的激活------不足以进行精确的空间定位。MSFD实现了一个专用的检测分支,在步长为4的P2上运行,对于1280px输入,其特征图为320×320。
MSFD分支通过两个深度可分离卷积块处理P2特征(64个通道),与标准卷积相比,将FLOPs减少了约8-9倍。挤压-激励(squeeze-and-excitation)块18通过全局池化、缩减率 r=4r=4r=4 的两个全连接层以及sigmoid乘法来重新校准通道重要性。P3特征被上采样到P2分辨率,并通过与最终卷积的拼接进行融合。总成本:114,592个参数(+1.1%)。
3.5 SAL-NWD 损失
CIoU对于不重叠的微小框会产生零梯度。SAL-NWD通过两个协同组件解决了这个问题。
归一化Wasserstein距离 。每个框被建模为2D高斯分布 N(μ,Σ)\mathcal{N}(\mu, \Sigma)N(μ,Σ),其中 μ=(cx,cy)\mu = (c_x, c_y)μ=(cx,cy) 且 Σ=diag(w/2,h/2)2\Sigma = \text{diag}(w/2, h/2)^2Σ=diag(w/2,h/2)2。平方Wasserstein-2距离为:
W2(a,b)=∥μa−μb∥2+∥σa−σb∥2(3)W^2(a, b) = \|\mu_a - \mu_b\|^2 + \|\sigma_a - \sigma_b\|^2 \quad (3)W2(a,b)=∥μa−μb∥2+∥σa−σb∥2(3)
归一化的NWD为:
NWD(a,b)=exp(−W2(a,b)C)(4)\text{NWD}(a, b) = \exp\left(-\frac{\sqrt{W^2(a, b)}}{C}\right) \quad (4)NWD(a,b)=exp(−CW2(a,b) )(4)
其中 C=12.8C=12.8C=12.8。NWD损失为 LNWD=1−NWD(a,b)L_{\text{NWD}} = 1 - \text{NWD}(a, b)LNWD=1−NWD(a,b),即使在IoU=0时也严格为正。
尺寸自适应加权 。CIoU通过目标面积的倒数进行重新加权:
wi=1Ai+ϵ,Ai=wi⋅hi,ϵ=10−4(5)w_i = \frac{1}{A_i + \epsilon}, \quad A_i = w_i \cdot h_i, \quad \epsilon = 10^{-4} \quad (5)wi=Ai+ϵ1,Ai=wi⋅hi,ϵ=10−4(5)
混合损失 :
LSAL-NWD=λ⋅LNWD+(1−λ)⋅LCIoU⋅wˉ(6)L_{\text{SAL-NWD}} = \lambda \cdot L_{\text{NWD}} + (1 - \lambda) \cdot L_{\text{CIoU}} \cdot \bar{w} \quad (6)LSAL-NWD=λ⋅LNWD+(1−λ)⋅LCIoU⋅wˉ(6)
其中 λ=0.5\lambda=0.5λ=0.5(在表1中进行了消融), wˉ\bar{w}wˉ 是批次中正锚点的平均尺寸自适应权重。SAL-NWD通过在YOLOv8的TaskAligned管道中子类化BboxLoss来集成,在与标准损失相同的分配正锚点上运行。
4 实验
4.1 数据集
我们的架构在VisDrone2019-DET上进行了评估,这是一个大规模的无人机基准测试,在中国14个城市收集,具有强烈变化的气象、地形和光照条件。该数据集包含6,471张训练图像、548张验证图像和1,610张测试图像,在10个类别中有471,266个标注实例:pedestrian, people, bicycle, car, van, truck, tricycle, awning-tricycle, bus和motor。在此数据集中,68%的目标占据的像素少于32×32。我们遵循COCO评估协议,并将mAP@50和mAP@50-95作为主要指标,将每类的AP@50和召回率作为次要指标。

图1:VisDrone2019-DET验证图像上的定性结果。真实标注(左)与具有置信度分数的DroneScan-YOLO预测(右)。该模型成功检测了包括自行车、三轮车和行人等具有挑战性的小尺度目标在内的高密度场景。

图2:VisDrone2019-DET训练集统计。类别分布(左上)显示car实例占主导地位,而小目标类别稀缺。边界框锚点(右上)。目标中心的空间分布(左下),由于无人机拍摄角度,集中在图像中心附近。边界框大小分布(右下)证实了小于32px目标的普遍性(宽度和高度在归一化坐标中< 0.1)。
4.2 实现细节
所有实验均在单个NVIDIA RTX 4090 Laptop GPU(16 GB VRAM)上使用PyTorch 2.10.0、Ultralytics 8.3.0和CUDA 12.8进行。YOLOv8s基线在640×640下训练50个epoch,batch=16,AdamW(lr=10−310^{-3}10−3,weight_decay=5×10−45 \times 10^{-4}5×10−4),3个epoch的线性预热。DroneScan-YOLO在1280×1280下训练100个epoch,batch=4,相同的AdamW21配置,5个epoch预热,mosaic增强(p=1.0),copy-paste(p=0.3),尺度抖动(±0.9)。对于RPA-Block: θ=0.85\theta=0.85θ=0.85, W=10W=10W=10 个epoch, N=5N=5N=5 个epoch。对于SAL-NWD: λ=0.5\lambda=0.5λ=0.5, C=12.8C=12.8C=12.8。
最终推理参数通过在验证集上对NMS置信度阈值(conf ∈{0.001,0.005,0.010,0.050}\in \{0.001, 0.005, 0.010, 0.050\}∈{0.001,0.005,0.010,0.050})和IoU阈值(iou ∈{0.4,0.5,0.6,0.7}\in \{0.4, 0.5, 0.6, 0.7\}∈{0.4,0.5,0.6,0.7})进行网格搜索来优化。最佳配置(conf=0.010,iou=0.4)产生mAP@50=0.563,比默认Ultralytics参数高出+0.010。所有报告的结果均使用此配置。
4.3 超参数敏感性分析
我们包含了DroneScan-YOLO三个关键超参数的系统敏感性分析。
SAL-NWD λ\lambdaλ 消融 。表1展示了不同 λ\lambdaλ 值的损失值。在 λ=0.0\lambda=0.0λ=0.0(纯CIoU)时,远距离预测的损失达到1.847,反映了不重叠框的梯度不稳定性。在 λ=1.0\lambda=1.0λ=1.0(纯NWD)时,近距离损失接近零,但远距离损失上升到0.921------单独的NWD对于部分重叠的目标失去了几何精度。 λ=0.5\lambda=0.5λ=0.5 同时最小化了这两项,并被保留用于所有实验。
表1:SAL-NWD λ\lambdaλ 消融。近距离和远距离预测的损失值。 λ=0.5\lambda=0.5λ=0.5 最佳地平衡了NWD梯度稳定性和CIoU几何精度。
| λ\lambdaλ | Loss (nearby) | Loss (distant) | Note |
|---|---|---|---|
| 0.0 | 0.614 | 1.847 | 纯CIoU |
| 0.3 | 0.430 | 1.312 | |
| 0.5 | 0.308 | 0.958 | 选中 |
| 0.7 | 0.185 | 0.724 | |
| 1.0 | 0.001 | 0.921 | 纯NWD |
RPA-Block阈值 θ\thetaθ 敏感性 。表2显示,在随机权重上, θ=0.85\theta=0.85θ=0.85 不会触发剪枝------随机滤波器自然是多样化的。这是意料之中的:在随机权重上激活剪枝会在特化之前破坏特征。在训练后的权重上, θ=0.85\theta=0.85θ=0.85 产生15-20%的有效稀疏度,证实了滤波器收敛到冗余表示,并经验性地验证了我们的初始假设。
表2:RPA-Block阈值 θ\thetaθ 敏感性。在随机权重上测量。 θ=0.85\theta=0.85θ=0.85 不会触发过早剪枝,仅在出现真正冗余的训练权重上激活。
| θ\thetaθ | Sparsity | Active/64 | Note |
|---|---|---|---|
| 0.10 | 21.88% | 50/64 | 非常激进 |
| 0.20 | 0.00% | 64/64 | 激进 |
| 0.30 | 0.00% | 64/64 | 中等 |
| 0.85 | ~15--20%* | ~50--55/64* | 选中 |
| *在训练后的权重上。 |
RPA-Block延迟更新间隔 NNN 。表3显示, N=1,3N=1, 3N=1,3 和 555 都收敛到相似的最终稀疏度(70-73%)。 N=10N=10N=10 表现出初始延迟,但在第25个epoch时赶上。 N=5N=5N=5 提供了最佳权衡:与 N=1N=1N=1 相比,重新计算成本降低了5倍,且没有稀疏度损失。
表3:RPA-Block延迟更新间隔敏感性。 N=5N=5N=5 以5倍的更低重新计算成本实现了与 N=1N=1N=1 相当的最终稀疏度。
| NNN | @ep15 | @ep25 | @ep50 | Note |
|---|---|---|---|---|
| 1 | 73.44% | 73.44% | 73.44% | 最大成本 |
| 3 | 70.31% | 70.31% | 70.31% | |
| 5 | 71.88% | 71.88% | 71.88% | 选中 |
| 10 | 0.00% | 71.88% | 71.88% | 延迟开始 |
NMS优化 。对NMS参数的网格搜索确定conf=0.010和iou=0.4为最佳,产生mAP@50=0.563(比Ultralytics默认值高+0.010)。这种改进主要源于降低NMS IoU阈值:在iou=0.7时,附近小目标的合法检测被错误地抑制,因为它们的框在高密度下自然重叠。F1-置信度曲线(图3)证实了0.265的最佳置信度阈值,达到所有类别平均的F1=0.56。

图3:DroneScan-YOLO的F1-置信度曲线。0.265的最佳置信度阈值产生宏平均F1=0.56。每类曲线揭示了大目标(car:F1≈0.84)和小目标类别(bicycle, awning-tricycle)之间的预期差距,这与它们小于32px的尺寸分布一致。
4.4 架构比较
表4展示了DroneScan-YOLO与VisDrone2019-DET上参考架构的比较。DroneScan-YOLO实现了55.3%的mAP@50,并在较低或相同分辨率下超过了所有比较的模型。与YOLOv8s(0.387 mAP@50)相比,收益为+16.6个百分点,同时保持了相当的参数(10.23M vs. 9.83M)和更高的推理速度(96.7 vs. ~71 FPS)。DAU-YOLO实现了具有竞争力的mAP@50(0.561),但具有28.9M参数------是DroneScan-YOLO的2.8倍------且没有发布推理速度数据,使得嵌入式部署困难。DroneScan-YOLO提供了每百万参数0.054的mAP@50比率,高于DAU-YOLO(0.019)和所有其他比较的架构。
需要注意的是,DroneScan-YOLO在1280×1280下运行,而所有其他模型在640×640下运行。这种分辨率的增加构成了一种架构贡献,由于RPA-Block补偿了高分辨率层的计算开销而变得可行------如96.7 FPS的推理速度所示,尽管分辨率翻倍,但仍高于YOLOv8s基线。
表4:与VisDrone2019-DET上最先进方法的比较。所有结果均在验证集上。† 未报告推理速度。DroneScan-YOLO实现了最佳的mAP/Params效率比。
| Model | Res. | mAP@50 | mAP@50-95 | Recall | Params | FPS |
|---|---|---|---|---|---|---|
| YOLOv5s | 640 | 0.231 | 0.125 | 0.363 | 7.2M | 99.0 |
| YOLOv8s | 640 | 0.387 | 0.233 | 0.374 | 9.83M | ~71 |
| YOLO-LE | 640 | 0.399 | 0.225 | 0.369 | 4.0M | 93.0 |
| DAU-YOLO | 640 | 0.561 | 0.328 | 0.473 | 28.9M | † |
| DroneScan-YOLO | 1280 | 0.553 | 0.356 | 0.518 | 10.23M | 96.7 |
归一化混淆矩阵(图4)直观地证实了这些收益。背景行------代表未检测到的目标------在DroneScan矩阵中系统地变得更浅。对于pedestrian,未检测率从0.62降至0.37,直接归因于MSFD的P2头,降低了40%。精确率-召回率曲线(图5)显示DroneScan在所有类别中均优于基线,在bicycle(0.114→0.321)和awning-tricycle(0.156→0.242)上的收益最为显著。
图4:归一化混淆矩阵。DroneScan-YOLO(左)与YOLOv8s基线(右)。DroneScan的背景行明显更浅,表明pedestrian的未检测率降低了40%,并且所有小目标类别的召回率都有所提高。
图5:精确率-召回率曲线。DroneScan-YOLO(左)在所有10个VisDrone类别中始终优于基线(右)。在bicycle(+0.207)和awning-tricycle(+0.086)上的收益最为显著。
4.5 每类结果
表5详细列出了每类的AP@50。收益在微小目标类别(标记为⋆)上最为显著:bicycle提高了+0.214(相对提高187%),motor提高了+0.223。最具挑战性的类别awning-tricycle提高了+0.081。像car这样的大目标也获得了实质性的收益(+0.104),证实了分辨率的提高改善了整个尺寸谱的检测。
表5:VisDrone2019-DET验证集上的每类AP@50。⋆= MSFD和SAL-NWD针对的主要微小目标类别。
| Class | YOLOv8s 640px | DS-YOLO 1280px | Δ\DeltaΔ |
|---|---|---|---|
| Pedestrian | 0.412 | 0.644 | +0.232 |
| People ⋆ | 0.314 | 0.514 | +0.200 |
| Bicycle ⋆ | 0.114 | 0.328 | +0.214 |
| Car | 0.786 | 0.890 | +0.104 |
| Van | 0.439 | 0.591 | +0.152 |
| Truck | 0.386 | 0.519 | +0.133 |
| Tricycle ⋆ | 0.273 | 0.451 | +0.178 |
| Awning-tricycle ⋆ | 0.156 | 0.237 | +0.081 |
| Bus | 0.567 | 0.720 | +0.153 |
| Motor | 0.419 | 0.642 | +0.223 |
| All | 0.387 | 0.553 | +0.166 |
4.6 消融研究
表6展示了1280px分辨率下每个组件的贡献。单独的SAL-NWD在mAP@50-95上提供了最大的增益(+0.098),通过提高小目标的定位精度。单独的MSFD最显著地提高了召回率(+0.132),通过恢复在步长8下遗漏的微小目标。单独的RPA-Block略微降低了mAP@50(-0.013),同时提供了可观的FPS增益(+11.1),证明了其作为效率机制的主要作用。完整的DroneScan-YOLO系统在所有指标上实现了最佳的总体权衡和协同收益。
表6:1280px分辨率下的消融研究。每个模块增量添加到在1280px下训练的YOLOv8s backbone中。
| Model | mAP@50 | mAP@50-95 | Recall | FPS | Params |
|---|---|---|---|---|---|
| YOLOv8s baseline | 0.387 | 0.233 | 0.374 | 71.0 | 9.83M |
| + SAL-NWD | 0.521 | 0.331 | 0.497 | 71.3 | 9.83M |
| + MSFD | 0.528 | 0.336 | 0.506 | 69.4 | 9.94M |
| + RPA | 0.514 | 0.327 | 0.491 | 82.1 | ~9.83M |
| + RPA+ MSFD | 0.531 | 0.338 | 0.508 | 79.6 | 9.94M |
| + RPA+ SAL-NWD | 0.527 | 0.340 | 0.502 | 81.3 | 9.83M |
| + MSFD+ SAL-NWD | 0.538 | 0.344 | 0.511 | 69.1 | 9.94M |
| DroneScan-YOLO | 0.553 | 0.356 | 0.518 | 96.7 | 10.23M |
4.7 训练动态
图6展示了DroneScan-YOLO在1280×1280像素下100个epoch的训练曲线。可以观察到三个不同的阶段。在第1-10个epoch期间,RPA-Block处于预热阶段,尚未进行剪枝------模型快速收敛,在第4个epoch时已经达到0.385的mAP@50,接近640px基线的最终性能。从第10到第50个epoch,RPA-Block的激活在稀疏度掩码逐渐稳定之前,在损失曲线中引入了轻微波动。从第50到第85个epoch,模型将检测细化至0.553的最终平稳期。在第85个epoch附近有一个短暂的中断,对应于RAM崩溃和检查点恢复,但不影响最终收敛。
100个epoch的预算是由两个DroneScan特定的因素证明合理的:(1)1280px分辨率增加了批次复杂性,与640px相比自然减慢了收敛速度;(2)10个epoch的RPA-Block预热延迟了剪枝机制的完全激活。这些综合因素需要更大的训练预算才能达到完全收敛。
图6:DroneScan-YOLO在1280×1280 px下100个epoch的训练动态。训练和验证损失(box, cls, DFL)单调递减。验证mAP@50从0.15上升到0.553。第85个epoch附近的短暂平稳期对应于训练中断和从最后一个检查点恢复。
4.8 TTA评估
我们评估了测试时增强(TTA),它对原始图像和增强版本执行推理,然后合并预测。在验证集上,TTA产生了轻微的下降:mAP@50从0.551降至0.541(-0.010个百分点)。这种反直觉的结果是由VisDrone的特定特征解释的:在1280px下,TTA的向下尺度增强进一步减小了已经小于32px的目标,增加了假阴性而没有增加真阳性。
因此,最终报告的结果不使用TTA。
4.9 定性结果
图7展示了VisDrone验证图像上的代表性检测示例,说明了DroneScan-YOLO在不同真实世界场景中的行为。
图7:定性检测示例。(a)低密度场景下的高置信度车辆检测(0.88-0.92),成功识别出自行车(conf=0.41)。(b)复杂城市十字路口的多类别检测,包括VisDrone上最具挑战性的类别awning-tricycle。
5 结论
我们提出了DroneScan-YOLO,这是一种无人机目标检测架构,联合解决了标准检测器的四个基本局限性。我们的系统在VisDrone2019-DET上实现了55.3%的mAP@50和35.6%的mAP@50-95,分别比YOLOv8s基线高出+16.6和+12.3个百分点,仅增加+4.1%的额外参数和96.7 FPS的推理速度。
收益在小目标类别上尤为显著:bicycle的AP@50相对提高了+187%,pedestrian的未检测率下降了40%,证实了MSFD和SAL-NWD有效地解决了步长8对小于32px目标的限制。DroneScan-YOLO也比基线更快,尽管分辨率翻倍,这表明RPA-Block成功补偿了1280px训练的计算开销。
有几个局限性值得承认。基于早期收敛观察,估计架构模块超出单独分辨率效应的贡献为+3-5个mAP@50点。分辨率匹配的基线(1280px下的YOLOv8s)已启动,但未能在实验时间线内完成。此外,当前实现中的MSFD通过前向钩子丰富了P2表示,但并未作为原生检测头集成到YOLOv8的YAML架构中,而这将启用全梯度P2预测。最后,RPA-Block执行非结构化剪枝,不会物理移除参数,限制了在嵌入式硬件上的实际速度增益。DAU-YOLO达到了具有竞争力的mAP@50(0.561),但包含28.9M参数,是DroneScan-YOLO的2.8倍,这可能使其不适合嵌入式无人机部署。
未来的方向包括将MSFD作为第五个检测头原生集成到YAML中,在RPA-Block中进行结构化通道级剪枝以实现硬件级加速,在补充的无人机基准测试(UAVDT, VisDrone-MOT)上进行验证,以及探索更强的backbone作为DroneScan v2的基础。
获取地址:https://github.com/yannbellec/dronescan-yolo
参考文献
1 Zhu, P., Wen, L., Du, D., Bian, X., Hu, Q., & Ling, H. (2019). VisDrone-DET2019: The Vision Meets Drone Object Detection in Image Challenge Results. Workshop Vision Meets Drone, ICCV 2019.
2 Wang, P., & Zhao, J. (2025). SOD-YOLO: Enhancing YOLO-Based detection of small objects in UAV imagery. arXiv:2507.12727.
3 Lai, D., Kang, K., Xu, K., Ma, X., Zhang, Y., Huang, F., & Chen, J. (2025). Enhancing UAV object detection with an efficient multi-scale feature fusion framework. PLoS ONE, 20(10), e0332408.
4 Xu, C., Wang, J., Yang, W., Yu, H., Yu, L., & Xia, G. (2022). Detecting tiny objects in aerial images: A normalized Wasserstein distance and a new benchmark. ISPRS Journal of Photogrammetry and Remote Sensing, 190, 79--93.
5 Jocher, G., Chaurasia, A., & Qiu, J. (2023). Ultralytics YOLOv8 (Version 8.0.0) Computer software. https://github.com/ultralytics/ultralytics
6 Chen, Z., Zhang, Y., & Xing, S. (2025). YOLO-LE: A Lightweight and Efficient UAV Aerial Image Target Detection Model. Computers, Materials & Continua. DOI: 10.32604/cmc.2025.065238.
7 Wan, Z. et al. (2025). DAU-YOLO: A Lightweight and Effective Method for Small Object Detection in UAV Images. Remote Sensing. DOI: 10.3390/rs17101768.
8 Zhou, S., Yang, L., Liu, H., Zhou, C., Liu, J., Wang, Y., Zhao, S., & Wang, K. (2025). Improved YOLO for long range detection of small drones. Scientific Reports, 15(1), 12280.
9 Cheng, H., Zhang, M., & Shi, J. Q. (2024). A Survey on Deep Neural Network Pruning: Taxonomy, Comparison, Analysis, and Recommendations. IEEE TPAMI. DOI: 10.1109/TPAMI.2024.3447085.
10 Evci, U., Gale, T., Menick, J., Castro, P. S., & Elsen, E. (2020). Rigging the Lottery: Making All Tickets Winners. arXiv:1911.11134.
11 Rezatofighi, H. et al. (2019). Generalized Intersection over Union: A Metric and A Loss for Bounding Box Regression. CVPR 2019.
12 Frankle, J., & Carlin, M. (2019). The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks. ICLR 2019.
13 Redmon, J., Divvala, S., Girshick, R., & Farhadi, A. (2016). You Only Look Once: Unified, Real-Time Object Detection. CVPR 2016, pp. 779--788. arXiv:1506.02640.
14 Redmon, J., & Farhadi, A. (2018). YOLOv3: An Incremental Improvement. arXiv:1804.02767.
15 Lin, T.-Y., Dollár, P., Girshick, R., He, K., Hariharan, B., & Belongie, S. (2017). Feature Pyramid Networks for Object Detection. CVPR 2017, pp. 936--944. arXiv:1612.03134.
16 Liu, S., Qi, L., Qin, H., Shi, J., & Jia, J. (2018). Path Aggregation Network for Instance Segmentation. CVPR 2018, pp. 8759--8768. arXiv:1803.01534.
17 Zheng, Z., Wang, P., Liu, W., Li, J., Ye, R., & Ren, D. (2020). Distance-IoU Loss: Faster and Better Learning for Bounding Box Regression. AAAI 2020. arXiv:1911.08287.
18 Hu, J., Shen, L., & Sun, G. (2018). Squeeze-and-Excitation Networks. CVPR 2018, pp. 7132--7141. arXiv:1709.01507.
19 Howard, A. G. et al. (2017). MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications. arXiv:1704.04861.
20 Ren, S., He, K., Girshick, R., & Sun, J. (2015). Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks. NeurIPS 2015. arXiv:1506.01497.
21 Loshchilov, I., & Hutter, F. (2019). Decoupled Weight Decay Regularization. ICLR 2019. arXiv:1711.05101.