论文分析16:多尺度特征增强与动态采样的轻量化目标检测

1郭亚楠,黄德启,倪自聪,等.多尺度特征增强与动态采样的轻量化目标检测J/OL.哈尔滨工业大学学报,1-202026-08-17.https://link.cnki.net/urlid/23.1235.T.20260618.1013.004.

1.研究目的

**目前存在问题和矛盾:1.**由于小目标在图像中像素占比小、特征信息微弱且易受背景或遮挡干扰,因此容易出现漏检或误检,进而引发追尾、变道冲突等严重安全事故,进而造成交通拥堵、事故频发,对道路交通秩序与行车安全构成严重威胁。为了解决自动驾驶场景中因目标尺度多变、遮挡严重导致的小目标检测精度低、漏检率高等核心挑战,为车载边缘设备提供一种轻量化、实时且高精度的目标检测算法,在保持200FPS实时推理速度的同时显著提升检测精度与召回率。论文提出一种多尺度特征增强与动态采样的轻量化目标检测算法(Scale-FeatureenhancedandDynamicsampling,SFD‑YOLO)。

**2.**现有轻量化检测方法在多尺度特征融合与细节保留之间存在固有矛盾------过度追求参数效率往往导致语义与细节信息的融合失衡,尤其在遮挡严重、尺度跨度大的场景下特征判别力依然受限;传统卷积下采样导致小目标细粒度信息在逐层传递中严重丢失;常规上采样方法(如最近邻插值)易产生锯齿状边缘且细节恢复能力不足;原YOLOv11模型在遮挡与多尺度场景中仍面临特征丢失与误检风险高等问题。

故论文提出出SFD-YOLO 检测算法,从下采样、特征增强、融合机制和检测层4个方面进行系统优化:1)引入PixelUnshuffle 下采样模块,替代传统卷积下采样,增强细节保留能力;2)设计C3k2_Faster_EMA 模块,融合轻量局部特征提取与多尺度注意力机制;3)构建CAFMFusion 融合模块与DySample 动态上采样机制,优化颈部特征融合;4)新增P2检测层,强化对小尺度目标的感知能力。

2.创新点

整体改进思路:

首先,在骨干网络中引入PixelUnshuffle 下采样模块,通过空间像素重组实现无信息损失的下采样,增强对小目标细粒度特征的保留能力,为后续模块提供高质量输入;其次,设计C3k2_Faster_EMA 模块,融合轻量局部特征提取与多尺度注意力机制,在遮挡与多尺度场景 下提升特征表达的判别力与鲁棒性;再次,在颈部结构中构建CAFMFusion 特征融合模块,结合动态上采 样机制DySample 模块,通过自适应权重平衡语义与细节信息,优化多尺度特征的融合质量;最后,新增P2 检测层,利用高分辨率特征图,强化对小尺度目标的感知与定位能力。上述各项改进从输入端到输出 端构成完整优化链路,旨在实现多尺度特征的自适应融合与增强,以提升模型在复杂道路场景下的检测精 度与泛化性能。

2.1 PixelUnshuffle无信息损失下采样模块

针对传统跨步卷积下采样导致的小目标细粒度信息丢失问题,该模块通过空间像素至通道维度的重组操作,将特征图按步长2划分为4个子特征图后沿通道拼接,实现无信息损失的下采样。在此过程中,空间信息被转化为通道信息,保留了在处理小目标时易丢失的细粒度特征,为后续模块提供了更丰富的小目标特征输入。

2.2 C3k2_Faster_EMA特征增强模块

为缓解遮挡与多尺度特征丢失问题,该结构融合FasterNet的轻量局部特征提取与EMA注意力的多尺 度建模能力。

针对遮挡与多尺度特征丢失问题,该模块融合了FasterNet的轻量局部特征提取能力与EMA(Efficient Multi-Scale Attention)的多尺度注意力建模能力。EMA机制将输入特征沿通道维度划分为多个子组,通过1×1卷积分支(捕捉局部细节)与3×3卷积分支(捕获多尺度空间信息)并行提取注意力权重,再通过跨空间学习方式融合两条分支特征,实现更丰富的特征聚合。

2.3 CAFMfusion通道自适应频率调制融合模块

与现有基于自注意力的特征融合方法相比,CAFMFusion模块的核心创新体现在以下3个方面:

1) 局部分支采用分组深度可分离卷积,且分组数为输入通道数的一半,在保持特征表达能力的同时有效降低计算复杂度,避免了现有方法中分组数依赖经验设定的问题;

2)全局分支通过重组查询-键-值矩阵的空间维度,降低自注意力的计算复杂度,在保持全局建模能力的同时显著提升计算效率;

3)引入可学习缩放系数动态调节全局分支的分配,使网络能够根据输入内容自适应平衡局部细节与全局语义,克服了传统 融合方法中固定权重或简单相加的局限性。

2.4 DySample动态上采样模块

本文引入DySample动态上采样模块,通过内容感知的动态点采样替代传统插值,在低计算开销下实现高分辨率特征的精准恢复。针对YOLOv11中最近邻插值上采样易产生锯齿状边缘且细节恢复能力不足的问题,该模块采用内容感知的动态点采样替代传统插值。其核心步骤包括:

①根据上采样尺度生成固定基准采样网格;

②通过线性卷积生成采样偏移,并分别通过静态范围因子(固定系数0.25)和动态范围因子(双并行卷积分支)对偏移量进行调制,避免采样点重叠导致的特征伪影;

③将偏移集合与基准网格逐元素相加得到内容感知的动态采样点集;

④基于动态采样点集进行双线性插值采样完成上采样。该模块使采样点能够根据特征内容自适应调整位置,在边缘区域扩大采样以捕获结构信息,在平坦区域缩小采样以避免噪声,在保持与基准模型相近参数量的同时实现了更高的细节恢复质量。

2.5 P2小目标检测层

针对YOLOv11原有P3、P4、P5检测层对远距离小目标(常小于32×32像素)感知能力不足的问题,本文在原有检测层基础上新增P2检测头,利用160×160高分辨率特征图处理小尺度目标,显著增强对小目标的细节感知与定位能力,在mAP50上较P4、P5分别提升7.3%与30.9%。

3. 后续优化

**(1)边缘设备部署验证与深化轻量化问题:**当前模型虽然在参数量和计算效率上取得了良好平衡,但在算力受限的嵌入式平台等边缘设备上的实际部署性能尚需进一步验证与优化。后续可探索模型剪枝、量化等压缩技术,进一步提升嵌入式平台的推理效率。

**(2)极端遮挡与极小目标检测性能提升问题:**算法对部分极端遮挡场景及极小目标(如远距离行人)的检测性能仍有待提升。后续可研究更精细的遮挡感知策略与极小目标专用的特征增强机制。

**(3)时序信息与多帧关联特征未充分利用的问题:**当前模型主要基于静态图像进行检测,未能充分利用自动驾驶场景中的时序信息与多帧关联特征,限制了其在动态环境下的潜在性能。后续可探索时序建模与多帧融合策略,增强动态场景下的检测鲁棒性。

**(4)动态环境下的泛化能力增强问题:**模型在不同天气、光照、地域等多变环境下的泛化能力仍需进一步提升。后续可研究增量学习与领域自适应策略,以提升算法在多变环境中的泛化能力,使其更广泛地适用于各类实际自动驾驶场景。

相关推荐
bittersuite2 小时前
BERT,fine-tuning
人工智能·深度学习·bert
武汉星际互动3 小时前
政务大厅引入AI数字人,需要关注哪些核心能力?
人工智能·政务
ZJU_统一阿萨姆3 小时前
【推理优化进阶】调度器的数学内核:排队论、SLO 与在线决策
开发语言·人工智能·语言模型·系统架构·vllm
今天AI了吗3 小时前
深度学习基础-Harness:从评估框架到工程落地
数据库·人工智能·sql·深度学习·机器学习
谁在黄金彼岸3 小时前
python webview打包版卡死、开发版正常
人工智能
大山佬3 小时前
抛弃 115200bps 的串口调试:J-Link RTT 实时日志系统配置、性能评测与多通道架构全面指南
人工智能·j-link
LaughingZhu3 小时前
Product Hunt 每日热榜 | 2026-08-18
人工智能·经验分享·深度学习·神经网络·产品运营
碧海银沙音频科技研究院3 小时前
基于杰理AC7016C的GTCRN门控卷积神经网络语音增强方法
人工智能·嵌入式硬件·语音识别
科技快报3 小时前
CANN全面开源开放 共赢AI技术生态
人工智能
阿里云大数据AI技术3 小时前
阿里云PAI发布通用蒸馏框架EasyDistill2.0,提供主流大模型蒸馏场景最佳实践
人工智能·agent