YOLO-IOD: Towards Real Time Incremental Object Detection——迈向实时增量目标检测

论文针对增量目标检测任务,提出了一个基于YOLO框架的实时解决方案。以下是其核心研究内容的全面总结:

一、研究背景与问题

  • 任务定义:增量目标检测要求模型在持续学习新类别时,不遗忘旧类别知识。

  • 现有局限:主流IOD方法多基于Faster R-CNN或DETR,不适用于实时YOLO系列;且直接套用会导致严重性能下降。

  • 核心挑战识别 :作者首次系统指出YOLO在增量学习中的三类知识冲突

    1. 前景-背景混淆:未标注的旧/新类别目标被误判为背景,尤其被YOLO的强数据增强放大。

    2. 参数干扰:不同任务共享参数,更新新任务会破坏旧任务表征。

    3. 错配知识蒸馏:教师与学生模型类别分布不一致,导致蒸馏失效。

二、提出方法:YOLO-IOD

基于预训练YOLO-World (开放词汇检测器),通过分阶段参数高效微调实现增量学习,包含三个核心模块:

模块 全称 功能
CPR 冲突感知伪标签精炼 缓解前景-背景混淆: ① 增强伪标签损失(置信度加权+熵正则化); ② 聚类未知伪标签(用开放词汇检测发现未来目标,聚为未知超类)。
IKS 基于重要性的内核选择 缓解参数干扰: 基于Fisher信息估计卷积核重要性,仅更新当前任务相关的Top-K核(基础阶段20%,增量阶段12%),其余冻结。
CAKD 跨阶段非对称知识蒸馏 解决错配蒸馏冲突: 采用双教师(旧检测器+当前检测器),将学生特征分别传入两个教师的检测头,实现不对称蒸馏,同时保留旧知识并适应新类别。

三、新基准:LoCo COCO

  • 现有基准缺陷 :类别划分任意,且同一图像可在多个阶段重复出现,造成数据泄漏,虚高伪标签方法性能。

  • LoCo COCO设计

    • 基于类别共现矩阵进行图聚类,将常共现类别分到同一任务,减少跨阶段图像重叠;

    • 对仍重叠的图像,随机分配给其中一个任务,确保每张图像仅出现一次。

  • 意义:更贴近真实应用场景,提供更公平的IOD评估。

四、实验与结果

  • 数据集:MS COCO 2017(传统划分)+ LoCo COCO(新划分)。

  • 对比方法:涵盖两阶段(BPF, RGR)、DETR系列(CL-DETR, SDDGR, DCA)、开放词汇方法(TLR, GCD),并在YOLO-World上复现ERD、RGR。

  • 主要结果

    • 单步设置(40+40, 70+10) :YOLO-IOD显著优于所有对比方法,RelGap(相对性能差距)低至2.7%和3.9%,接近联合训练上界。

    • 多步设置(40-10, 40-20, 20-20, 10-10):在长序列(8阶段)下仍保持低遗忘(RelGap仅8.8%),远超RGR(20.3%)和CL-DETR(48.1%)。

    • LoCo COCO上 :所有方法AP均有下降(0.6%~2.0%),但YOLO-IOD仍领先第二名5.9~8.5 AP,验证其鲁棒性。

  • 消融实验

    • 三个模块(CPR, IKS, CAKD)各自均有显著增益,组合后效果最佳;

    • CAKD双教师优于单教师;

    • IKS核选择比例12% 为最优平衡点。

五、贡献总结

  1. 首次系统识别并定义YOLO在IOD中的三类知识冲突。

  2. 提出YOLO-IOD------首个面向YOLO的实时增量检测框架,集成CPR、IKS、CAKD三大模块,有效平衡可塑性与稳定性。

  3. 设计LoCo COCO基准,消除数据泄漏,更贴近现实应用。

  4. 在传统和新型基准上均达到最先进性能,且保持实时推理速度。

YOLO-IOD成功将实时检测与增量学习结合,通过针对性解决知识冲突,在多个设置下实现了最低的遗忘率和最高的检测精度 ,为现实场景中的持续目标检测提供了有效方案。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

摘要

当前的增量目标检测(IOD)方法主要依赖于Faster R-CNN或DETR系列检测器;然而,这些方法不适用于实时的YOLO检测框架。在本文中,我们首先确定了导致基于YOLO的增量检测器发生灾难性遗忘的三类主要知识冲突:前景-背景混淆、参数干扰和错配的知识蒸馏。随后,我们介绍了YOLO-IOD,一个实时的增量目标检测(IOD)框架,该框架构建于预训练的YOLO-World模型之上,通过分阶段参数高效微调过程来促进增量学习。具体而言,YOLO-IOD包含三个主要组成部分:1)冲突感知伪标签精炼(CPR),它通过利用伪标签的置信度水平并识别与未来任务相关的潜在目标,来减轻前景-背景混淆。2)基于重要性的内核选择(IKS),它在当前学习阶段识别并更新与当前任务相关的关键卷积核。3)跨阶段非对称知识蒸馏(CAKD),它通过将学生目标检测器的特征分别传递给前一个和当前教师检测器的检测头,来解决错配的知识蒸馏冲突,从而在现有类别和新引入类别之间实现非对称蒸馏。我们进一步引入了LoCo COCO,一个更现实的基准测试,它消除了阶段间的数据泄露。在传统基准测试和LoCo COCO基准测试上的实验表明,YOLO-IOD以最小的遗忘实现了优越的性能。

引言

增量目标检测(IOD)的目标是在连续学习新任务的过程中,持续获取新的目标类别,同时保留过去学到的知识。尽管近期的工作(Mo等人,2024;Liu等人,2023)在IOD方面取得了显著进展,但大多数现有方法都建立在诸如Faster R-CNN(Ren等人,2015)或DETR(Carion等人,2020)等检测器之上。当这些开发的方法应用于实时的YOLO系列检测器(Redmon等人,2016)时,它们通常会在泛化性能上遭受显著下降,并且难以保持先前类别的先验知识,这主要是由于任务间的知识冲突所致。

图1:三种主要知识冲突的图示:(a)前景-背景混淆,(b)参数干扰,以及(c)错配的知识蒸馏冲突。

在这项工作中,我们首先将基于YOLO的增量检测器中遗忘的根本原因确定为三种主要类型的知识冲突,如图1所示:1)前景-背景混淆,其中未标注的先前和未来任务的目标在训练期间被错误地分类为背景。这个问题对于YOLO检测器尤为关键,因为它们依赖于诸如Mosaic和MixUp等激进的数据增强技术,这些技术假设标注是准确的。在IOD设置中,伪标签中的噪声会被这些增强方法放大,从而损害模型性能。2)参数干扰。这个问题源于不同任务经常依赖于模型内相交的参数子集。针对新任务的更新可能会改变这些共享参数,从而可能破坏先前学到的表示,并导致对早期任务的灾难性遗忘。3)错配的知识蒸馏冲突,即教师模型和学生模型针对不匹配的类别分布进行优化,违反了标准知识蒸馏中两个模型共享一致学习目标的核心假设。YOLO系列检测器以在空间网格上进行密集预测而闻名,受到这个问题的显著影响。

为了克服上述挑战,我们提出了YOLO-IOD,一个实时的IOD框架,它构建于预训练的YOLO-World(Cheng等人,2024)模型之上,并在每个增量学习阶段进行参数高效的微调。YOLO-IOD包含三个旨在解决已识别知识冲突的主要模块:1)冲突感知伪标签精炼(CPR),它通过结合两种策略来缓解前景-背景混淆:增强伪标签损失,通过基于预测的置信度和不确定性进行加权,提高来自伪标签的监督的可靠性;以及聚类未知伪标签,通过执行开放词汇目标检测和特征空间聚类来识别来自未来任务的潜在目标。2)基于重要性的内核选择(IKS),它通过基于费舍尔信息的微分重要性估计,选择并仅微调与任务相关的重要卷积核,从而减轻参数干扰。以及3)跨阶段非对称知识蒸馏(CAKD),它通过将跨阶段的学生特征分别传递给旧的和当前的教师检测器的检测头,来解决错配的知识蒸馏冲突,从而在旧类别和新类别之间实现非对称蒸馏。

此外,当前的IOD基准测试并不适合实际应用,因为它们随意划分类别,忽略了类别的自然共现,并且允许图像在增量阶段重复出现。在实际情况下,某些类别(如汽车和行人)经常一起出现,而其他类别(如汽车和船只)则不然。必须严格防止阶段间图像重叠,以避免数据泄露。这引发了一个问题:在当前基准测试上观察到的性能是否能有效地转化为实际应用,特别是对于最近依赖于伪标签的IOD方法。因此,我们引入了LoCo COCO,一个新的基准测试,旨在消除阶段间图像重叠并遵循类别共现统计,为IOD提供一个更公平、更现实的评估基准。

我们的贡献可以总结如下:

我们介绍了YOLO-IOD,一个集成的、实时的IOD框架,并指出了遗忘的三个原因:前景-背景混淆、参数干扰和错配的知识蒸馏冲突。YOLO-IOD包含了三个旨在减轻遗忘的创新模块,特别强调了双教师CAKD模块。该模块通过将目标学生检测器的特征分别传递给前一个和当前教师检测器的检测头,解决了错配知识蒸馏的挑战。我们引入了LoCo COCO,一个实用的基准测试,旨在消除阶段间的图像重叠并考虑类别共现,从而能够对增量目标检测进行更公平的评估。在多种设置下,对传统COCO和LoCo COCO基准测试的大量实验表明,我们的方法在保持实时推理速度的同时,持续达到了最先进的性能。

相关工作

增量学习

增量学习使模型能够在不遗忘先前知识的情况下获取新信息(Schlimmer和Granger Jr,1986;Li和Hoiem,2017)。方法包括基于重演的方法,即重播或生成来自先前任务的样本(Rebuffi等人,2017;Lopez-Paz和Ranzato,2017;Shin等人,2017);基于正则化的方法,即约束重要参数以维持稳定性(Kirkpatrick等人,2017;Luo等人,2025;Yang等人,2023;Wu等人,2025);基于架构的方法,即为任务分配特定的子网络(Von Oswald等人,2019;Rypeśé等人,2024);以及知识蒸馏,即通过教师-学生学习传递来自过去任务的信息(Tao等人,2020;Chen和Chang,2023;Asadi等人,2023)。最近,使用基础模型的持续学习也引起了许多兴趣,包括诸如L2P(Wang等人,2022)、CODA-Prompt(Smith等人,2023)和VPT-NSP2(Lu等人,2024)等方法。

增量目标检测

与分类相比,IOD涉及更复杂的场景和更大的挑战,因为它需要同时定位和分类目标。在IOD中,由于检测框架中丰富的特征表示和多级监督信号,蒸馏尤其有效。ERD(Feng,Wang和Yuan,2022)引入了弹性响应蒸馏,自适应地传递知识。BPF(Mo等人,2024)通过双教师模型桥接过去-未来知识,CL-DETR(Liu等人,2023)将蒸馏应用于DETR架构,强调来自旧模型的可靠预测。然而,这些方法通过仅选择那些与新标签不重合的旧任务输出来作为蒸馏目标,从而解决知识蒸馏问题。这种策略不适用于YOLO风格的密集预测。此外,这种方法只能从教师模型中蒸馏部分知识,无法完全解决潜在的冲突。我们提出了CAKD,它通过使用检测头抑制无关特征的响应,提供跨阶段非对称知识蒸馏。

预备知识和基准测试

问题定义

图2:YOLO-IOD的整体架构。我们的方法集成了三个组件来解决IOD中的知识冲突:1)冲突感知伪标签精炼(CPR);2)基于重要性的内核选择(IKS);以及3)跨阶段非对称知识蒸馏(CAKD)。

方法

总体框架

所提出的YOLO-IOD利用预训练的YOLO-World作为其基础模型。如图2所示,YOLO-IOD通过分阶段的部分微调来执行增量学习,其中参数更新由基于重要性的内核选择指导。整体架构由三个组件组成。在左上部分,冲突感知伪标签精炼(CPR)通过增强的伪标签损失生成高质量的旧任务监督,以减轻来自先前任务的前景-背景混淆,同时通过聚类未知伪标签解决未来任务上潜在的前景-背景混淆。在图2的左下部分,基于重要性的内核选择(IKS)确定在每个增量阶段要更新哪些卷积核,从而在允许对新类别进行部分微调的同时,保留来自先前任务的关键知识。最后,跨阶段非对称知识蒸馏(CAKD)实现了两种不同的知识蒸馏损失。第一种是比较旧检测器Mt−1​与目标检测器Mt​,方法是将它们各自的密集特征输入到旧检测器Mt−1的检测头中。第二种是比较当前检测器Mst(在阶段数据集Dt​上训练的、标注了类别Ct​的检测器)与目标检测器Mt​,方法是利用当前检测器检测头内的密集特征。

冲突感知伪标签精炼

CPR包含两个组成部分。增强伪标签损失利用置信度感知监督和熵正则化来更好地利用伪标签。同时,聚类未知伪标签结合了开放词汇目标检测和特征聚类,为未来任务中未标注的目标提供一致的监督。

增强伪标签损失。 IOD中传统的伪标签方法依赖于置信度阈值来选择可靠的伪标签,这引入了基于置信度的选择偏差。这种偏差导致低置信度类别在训练过程中逐渐被忽略。此外,高于阈值的伪标签被统一对待,而不考虑其实际可靠性,导致监督信号不一致。

为了解决这个问题,我们提出了一种增强伪标签损失,将每个伪标签的置信度分数ss视为软监督目标,结合了置信度感知加权和熵正则化:

实验

实验设置

数据集和指标。 为了评估我们的方法,我们使用MS COCO 2017(Lin等人,2014)数据集,并遵循先前研究(Mo等人,2024;Kim等人,2024)中建立的协议。我们还在提出的LoCo COCO基准测试上进行了评估,以提供更现实的评估。我们使用标准COCO指标:在IoU阈值0.5-0.95上的mAP、mAP@0.5和mAP@0.75。我们还报告了与联合训练相比的AbsGap(绝对mAP差距)和RelGap(相对mAP差距),以量化灾难性遗忘。

实现细节。 我们的方法在YOLO-World (X)上实现。我们在4块RTX 3090 GPU上使用批量大小16,学习率为2×10−5(主干网络)和2×10−4(颈部网络和检测头)。训练使用AdamW(Loshchilov和Hutter,2017)优化器进行20个epoch,在第10个epoch后禁用mosaic增强。在IKS模块中,基础阶段选择的核比例KK设置为20%20%,增量阶段设置为12%。

与最先进方法的比较

我们在COCO上的单步和多步IOD设置下评估了我们的方法。我们将YOLO-IOD与最近的最先进方法进行了比较,包括两阶段检测器(BPE, RGR)、基于DETR的方法(CL-DETR, SDDGR(Kim等人,2024), DCA(Zhang等人,2025)),以及基于开放词汇模型的方法(TLR(Zhang等人,2024), GCD(Wang, Wang和Lin,2025))。此外,我们在YOLO-World架构上复现了经典的基于响应蒸馏的方法ERD和最近的生成重演方法RGR,以进行进一步比较。

单步增量设置。 我们首先评估了在40+40和70+10设置下的性能,分别增加了40类和10类。如表1所示,YOLO-IOD相对于先前方法取得了持续的性能提升。具体来说,在40+40配置下,我们的方法比先前的最佳方法RGR在AP上提高了1.5,AbsGap仅为1.5,并将与联合训练的相对性能差距从5.5%显著降低到2.7%。在70+10设置下,YOLO-IOD在AP上比RGR高出3.3%,并且相对于上界实现了极低的RelGap(3.9%),同时在所有指标上保持了强劲的性能。请注意,RGR是一种基于生成重演的方法,而我们的方法完全不需要重演。

多步增量设置。 为了更好反映现实世界中新类别不断被引入的场景,我们在多阶段评估(40-10, 40-20)的基础上,增加了更长的20-20和10-10设置,每个阶段分别增加20或10个类别,直到所有80个类别被学完。这些更长的配置对于评估增量检测器在现实部署场景中的表现尤为重要。如表2所示,我们的方法在这些长期设置中持续取得最佳性能,相比RGR的AP提升从3.3%到6.3%不等。值得注意的是,在具有8个增量阶段、极具挑战性的10-10设置下,YOLO-IOD表现出了卓越的性能,在最终阶段仅达到8.8%的RelGap,显著优于RGR(20.3% RelGap)和CL-DETR(48.1% RelGap)。结果表明,YOLO-IOD通过充分解决知识冲突,可以成功地适用于需要持续适应新兴目标类别的现实场景。

在LoCo COCO上的评估

我们在更现实的LoCo COCO基准测试上评估了近期方法和我们的YOLO-IOD,如表3所示。与原始的COCO基准相比,所有方法在LoCo COCO上的AP下降了0.6%到2.0%,这表明了先前增量设置中数据泄露的影响。尽管如此,YOLO-IOD在所有增量场景中持续实现了强劲的性能,即使消除了阶段间图像重叠,也展现出了鲁棒性。具体来说,在40+40、70+10和40+20设置中,YOLO-IOD分别比先前的最佳方法GCD在AP上高出7.5、5.9和8.5。这些结果突显了YOLO-IOD对于现实持续检测的实用价值,以及LoCo COCO作为IOD实用评估基准的必要性。

消融研究

主要组件的有效性。 如表4所示,我们逐步添加模块以展示它们在70-10和40-10设置中的各自贡献。从达到48.4% AP(70-10)和44.3% AP(40-10)的标准伪标签基线开始,添加CPR显著将性能提高到50.3%和47.3%,证明了其在减轻前景-背景混淆方面的有效性。整合IKS进一步将结果提升到70-10的51.5% AP和40-10的49.1% AP,突显了选择性参数更新的价值。值得注意的是,当单独应用CAKD时,AP从70-10的48.4%上升到50.8%,从40-10的44.3%上升到49.2%,展示了其强大的蒸馏能力。当CAKD与先前模块结合时,可以获得进一步的增益,将AP从70-10的51.5%提高到52.4%,从40-10的49.1%提高到50.6%。这些结果证实了所有三个组件CPR、IKS和CAKD协同工作,每个组件都贡献了显著的性能提升,并共同解决了根本的知识冲突。因此,完整的YOLO-IOD框架取得了优越的结果。

CAKD消融研究。 如图3所示,我们比较了三种CAKD变体:仅使用旧教师检测器、仅使用当前教师检测器,以及完整的双教师。在早期阶段,仅当前变体通过促进对新类别的快速适应而表现更好。随着任务的积累,仅旧变体在保留先前知识方面变得更加有效,反映了从可塑性到稳定性的转变。完整的CAKD始终取得最佳结果,验证了结合两种知识来源的非对称蒸馏的优势。

IKS核选择比例KK的影响。 如图4所示,较小的比例(例如,5%)限制了模型的适应能力,而较大的比例(例如,20%)由于过度更新参数而引发遗忘。我们观察到,当设置K=12%时,达到了最佳的权衡,强调了在IOD中调节待更新参数数量的重要性。

结论

本研究介绍了YOLO-IOD,一个新颖的实时IOD框架,它利用了预训练的YOLO-World模型。通过部署三个精心设计的模块:冲突感知伪标签精炼、基于重要性的内核选择和跨阶段非对称知识蒸馏,有效地解决了前景-背景混淆、参数干扰和错配知识蒸馏的挑战,YOLO-IOD在保留先前知识和获取检测新类别目标的能力之间实现了最佳平衡。此外,我们提出了LoCo COCO基准测试,成功地减轻了数据泄露,并使类别划分与现实世界的共现情况相一致。YOLO-IOD在各种单步和多步设置下的传统COCO基准测试和LoCo COCO基准测试上都表现出了卓越的性能。

相关推荐
YOLO数据集集合1 小时前
固定翼无人机目标检测数据集 | 固定翼无人机 低空安防 目标检测 YOLO格式9062期
yolo·目标检测·无人机·固定翼无人机·固定翼·无人机识别·反无人机
深度学习lover3 小时前
<数据集>番茄叶片病害识别<目标检测>
人工智能·yolo·目标检测·计算机视觉·数据集·番茄叶片病害识别
YOLO数据集集合1 天前
福寿螺目标检测数据集 | 福寿螺检测 入侵物种 农业植保 目标检测9062期
人工智能·yolo·目标检测·计算机视觉·福寿螺·福寿螺检测·入侵物种
深度学习lover1 天前
<数据集>电力劳保穿戴识别<目标检测>
人工智能·yolo·目标检测·计算机视觉·数据集·电力劳保穿戴识别
YOLO数据集集合1 天前
反无人机禁飞识别无人机检测数据集 | 反无人机 禁飞识别 低空安防 目标检测 无人机检测10756期
人工智能·目标检测·无人机
深度学习lover1 天前
<数据集>安全带穿戴识别<目标检测>
人工智能·yolo·目标检测·计算机视觉·安全带穿戴识别
这张生成的图像能检测吗2 天前
(论文速读)GMA-Net:面向嵌入式物联网设备的航空发动机损伤检测轻量级实时网络
物联网·目标检测·缺陷检测·轻量化·设备部署
孤狼warrior2 天前
SCTR 五次失败的安全 BN 路由器
人工智能·python·深度学习·算法·安全·yolo
kyle~2 天前
标注平台---CVAT
人工智能·目标检测·计算机视觉·机器视觉