论文分析17:YOLOv11_UAVNet:无人机航拍图像专用目标检测算法

引用:1侯颖,黄嘉超,申家轩,等.YOLOv11_UAVNet:无人机航拍图像专用目标检测算法J/OL.计算机工程与应用,1-162026-09-18.https://link.cnki.net/urlid/11.2127.TP.20260917.1311.009.

1.结构改进

  1. 轻量化 DSConvSPDPW 卷积模块

    用深度可分离卷积(DSConv)+ 空间到深度(SPD)+ 逐点卷积(PWConv)组合,替换 YOLOv11 中所有 stride=2 的 CBS 卷积,实现无损下采样,保留小目标细节,同时大幅降低参数量。骨干网络用 DSConvSPDPW-2,Neck 用 DSConvSPDPW-1。

  2. 通道深度金字塔递减策略

    改变传统"通道递增"设置,增加浅层通道数、减少深层通道数,强化小目标特征捕获能力。

  3. 增加超浅层小目标检测分支 C1-C2-P2

    在骨干网络增加 160×160 的高分辨率浅层特征提取,Neck 中增加P2小目标检测头,构建五层特征金字塔,显著提升小目标检测率。

  4. 构建 PAFPN_CCFM_SOD 跨尺度特征融合网络

    在 FPN + PAN 基础上引入跨尺度特征融合模块(CCFM),并嵌入1×1 PWConv 进行通道调整,实现浅层细粒度信息与深层语义信息的互补增强,同时保持轻量化。

2.介绍

2.1 DSConv

公式:DSConv(X)=PWConv1×1​{DWConv3×3​(X)}

深度卷积DWConv不进行下采样和不改变通道数,对每个特征图的每个通道独立进行空间卷积,提取局部空间特征。

DWConv特点:每个输入通道独立进行空间卷积,通道之间没有任何信息交流

逐点卷积PWConv负责调整通道数,对 DWConv 输出的各通道进行通道维度的线性组合,实现通道信息融合。

PWConv作用:把同一个位置上的所有通道值放在一起,通过加权求和,生成新的通道

2.2 通道深度金字塔递减策略

具体作用:

**1.提升小目标检测精度。**增加浅层通道数,相当于给高分辨率特征图更多"表达能力",能保留更多小目标细节,减少漏检和错检。

**2.减少深层冗余。**深层特征图分辨率低,感受野大,语义信息强,主要利于大目标分类。但在无人机小目标检测任务中,深层特征对小目标贡献较低。所以,把深层通道压缩,可以减少对当前任务贡献不大的冗余参数,避免过参数化。

**3.实现参数再分配。浅层加宽,深层变窄。**让有限的参数可以更好地服务小目标检测。

2.3 增加超浅层小目标检测分支 C1-C2-P2

核心思想: 在骨干网络和 Neck 中引入下采样倍数仅为 4 的超浅层特征(C1、C2),并新增 P2 小目标检测头,形成 160×160 高分辨率检测分支,从而最大程度保留小目标的细粒度空间信息。

**具体做法:**Neck网络对160×160×512、160×160×256、 80×80×128、40×40×128、20×20×128五组{C1, C2,C3,C4,C5'}多尺度金字塔特征信息进行融合,实现浅层细粒度信息与深层语义信息的互补增强,同时Neck网络中添加P2小目标检测头,增强后生成160×160×256、80×80×128、40×40×128、20×20×128四组{P2,P3,P4,P5}多尺度特征信息用于后续检测头网络预测。

**创新点:1.**传统 YOLOv11 最小检测头是 P3(80×80),对极小目标不敏感。新增 P2 检测头后,网络可以直接在高分辨率特征图上预测小目标,减少漏检。

**2.**将 C1 引入 Neck,相当于在 C2 基础上再增加一路超浅层细节,显著提升小目标召回率。

**3.**传统 YOLOv11 最小检测头是 P3(80×80),对极小目标不敏感。新增 P2 检测头后,网络可以直接在高分辨率特征图上预测小目标,减少漏检。

4.**跨尺度融合互补。**C1、C2 细节丰富但语义弱;C4、C5* 语义强但分辨率低。PAFPN_CCFM_SOD 将两者双向融合,使 P2 既保留细节,又获得足够语义,降低误检。

2.4 构建 PAFPN_CCFM_SOD 跨尺度特征融合网络

理解为:FPN_CCFM + PAN_CCFM + 超浅层小目标分支 C1-C2-P2 + 轻量化设计

FPN 核心思想: 深层语义上采样,与浅层特征融合;PAN核心思想: 在 FPN 基础上增加自底向上路径;**BiFPN核心思想:**重复双向跨尺度连接,并给不同输入加可学习权重。

**CCFM(跨尺度特征融合模块):**在每条融合路径中引入 1×1 PWConv 调整通道数,实现轻量化,同时增强不同尺度特征的交互。论文指出,CCFM 比普通 PAN/BiFPN 融合更高效,且参数量更低。

采用PAFPN_CCFM_SOD 跨尺度特征融合网络能更好地融合超浅层 C1、C2 特征,而 BiFPN 对超浅层特征的利用不如本文设计充分。

3. 细节

通过ai对各个模式进行阐述:

相关推荐
m4Rk_1 小时前
【论文阅读】Agent 记忆机制(74):CompassMem——从相似度检索走向事件图上的记忆导航
论文阅读·人工智能·学习·开源·github
镭封1 小时前
短剧多人对白怎么配?一人完成多角色配音的办法
人工智能·音视频·语音识别·媒体
昇腾知识体系1 小时前
昇腾 torchrec_npu Docker 镜像选择:CANN/PyTorch/torchrec 版本矩阵与启动参数
人工智能·华为·知识图谱
VIP_CQCRE1 小时前
用 Ace Data Cloud 一次接入 AI 视频生成:HappyHorse Videos API 实战指南
人工智能·api·ai视频·acedatacloud
沧海一笑-dj2 小时前
【Python】Python学习笔记-初识 Python
python·python安装·python解释器
去伪存真2 小时前
大模型的参数量为什么那么大?
前端·人工智能
qq_199886872 小时前
第7板块·第3节:CUTLASS 的 GEMM 实现与优化策略
c++·人工智能·gpu算力·cuda
打工仔折腾 AI2 小时前
FastAPI 从本机到生产服务器:Nginx+Gunicorn+Uvicorn 完整部署实录
人工智能·后端·python·nginx·fastapi·gunicorn