TIP 2025 | DIL-SSOD:密集信息增强与关系一致性正则化的半监督目标检测

文章目录

  • [1 论文信息](#1 论文信息)
  • [2 论文主要贡献](#2 论文主要贡献)
  • [3 论文创新点](#3 论文创新点)
  • [4 方法](#4 方法)
    • [4.1 整体框架](#4.1 整体框架)
    • [4.2 Dense Information Augmentation (密集信息增强)](#4.2 Dense Information Augmentation (密集信息增强))
    • [4.2.1 前景库](#4.2.1 前景库)
    • [4.2.2 尺度调整](#4.2.2 尺度调整)
    • [4.2.1 粘贴区域选择](#4.2.1 粘贴区域选择)
    • [4.3 Relation Consistency Regularization (关系一致性正则化)](#4.3 Relation Consistency Regularization (关系一致性正则化))
  • 实验

1 论文信息

论文题目: Dense Information Learning Based Semi-Supervised Object Detection

论文作者: Xi Yang, Penghui Li, Qiubai Zhou, Nannan Wang, Xinbo Gao

发表单位:

  • Xidian University
  • Hangzhou Institute of Technology, Xidian University
  • Chongqing University of Posts and Telecommunications

发表会议期刊: 2025 TIP

代码链接: 未公开

2 论文主要贡献

本文针对半监督目标检测中无标签图像可利用前景信息稀疏的问题,提出 Dense Information Learning(DIL)框架。传统方法通常通过调整伪标签阈值提高信息利用率,但仍然只能被动利用原始无标签图像中已有的前景,而 DIL 则主动生成包含更多有效前景实例的训练图像。

论文主要提出两个模块:

  1. Dense Information Augmentation(DIA) :利用 Teacher 模型预测得到的先验信息筛选可靠前景实例,并建立 Foreground Bank,将这些前景实例密集粘贴到无标签图像中,从而提高单张训练图像中的可利用前景密度。

  2. Relation Consistency Regularization(RCR) :通过图像尺度变化和特征 Mask 扰动构造多个视图,并利用 Pearson 相关系数约束不同扰动下类别之间的关系保持一致,从而增强模型的泛化能力。

整体而言,DIL 的核心并不是单纯降低伪标签筛选阈值,而是主动增加无标签训练图像中的可学习目标数量,并进一步通过关系一致性正则化充分利用这些密集前景信息。

图1. 半监督目标检测中可利用信息不足的问题。上图:部分图像的前景信息占比极低。下图:高置信度预测实例的占比较低。因此,现有半监督目标检测方法依赖包含稀疏可利用信息的未标记数据。

哪怕是训练成熟的模型,也会有约 40% 的真实前景被判定为背景,无法生成伪标签、无法参与半监督训练

  1. 原始未标注数据本身前景密度低,大量区域是背景;
  2. 模型能识别、可作为伪标签利用的前景,只占真实前景的一小部分。

3 论文创新点

传统方法本质上仍然是"被动利用"图像中已有的信息。DIL 将研究重点从"如何从原图中筛出更多伪标签"转变为:

如何主动构造包含更多可利用前景信息的无标签训练图像。

  • 引入密集信息增强模块,以直接获取高密度可利用信息。
  • 提出了关系一致性正则化模块,通过掩码和恢复来扰动特征,以更全面地利用密集信息。此外,我们主张对不同扰动下的输出施加强一致性约束,不利于进一步提升网络性能。
  • 通过结合这两个模块,提出了一种用于生成密集信息的新框架------密集信息学习,该框架在PASCAL VOC和MS-COCO数据集上取得了当前最优性能。

4 方法

4.1 整体框架

本文以 Soft Teacher 为基础框架,默认检测器为 Faster R-CNN。

整个网络的损失为:

L = L s + λ u L u L=L_s+\lambda_u L_u L=Ls+λuLu

其中有标注数据的监督损失为:

L s = ∑ i L c l s ( x i s , y i s ) + L r e g ( x i s , y i s ) L_s=\sum_i \left L_{cls}(x_i\^s,y_i\^s) + L_{reg}(x_i\^s,y_i\^s) \\right Ls=i∑Lcls(xis,yis)+Lreg(xis,yis)

无标签数据上的损失为:

L u = ∑ i L c l s ( x i u , y \^ i c l s ) + L r e g ( x i u , y \^ i r e g ) + L r c r ( x i u , x i m ) L_u=\sum_i \left L_{cls}(x_i\^u,\\hat{y}_{i}\^{cls}) + L_{reg}(x_i\^u,\\hat{y}_{i}\^{reg}) + L_{rcr}(x_i\^u,x_i\^m) \\right Lu=i∑Lcls(xiu,y\^icls)+Lreg(xiu,y\^ireg)+Lrcr(xiu,xim)

其中 L c l s L_{cls} Lcls 为分类损失, L r e g L_{reg} Lreg 为边界框回归损失, L r c r L_{rcr} Lrcr 为 Relation Consistency Regularization 损失。

4.2 Dense Information Augmentation (密集信息增强)

Dense Information Augmentation(DIA)的目标是主动增加无标签图像中的可利用前景数量。

论文将能够通过伪标签筛选并可靠用于训练的目标定义为 exploitable information:

E I t = { ( I i p s e , L i p s e ) } i = 1 N t EI_t= \left\{ (I_i^{pse},L_i^{pse}) \right\}_{i=1}^{N_t} EIt={(Iipse,Lipse)}i=1Nt

其中 I i p s e I_i^{pse} Iipse 表示 pseudo instance, L i p s e L_i^{pse} Lipse 表示其对应的 pseudo label, N t N_t Nt 为当前时刻可利用伪实例的数量。

4.2.1 前景库

DIA 首先建立一个 Foreground Bank 。Foreground Bank 本质上是按照类别划分的字典结构,每个类别分别保存若干前景 patch。

训练早期 主要将有标注数据中的真实前景实例放入 Foreground Bank,以保证 Bank 中前景的准确性。随着模型逐渐稳定,中后期主要加入无标签数据中 Teacher 预测得到的高质量 pseudo foreground,从而减少对少量人工标注数据的过拟合。

无标签前景实例必须同时经过分类和定位可靠性筛选。首先使用分类 Score Filter:

s c o r e > 0.9 score>0.9 score>0.9

只有高置信度实例才可能进入 Foreground Bank。

同时使用继承自 Soft Teacher 的 Box Jittering 判断 Bounding Box 的定位稳定性。对于一个伪框,生成多个轻微扰动后的候选框,再将这些框送入 Teacher 重新进行定位。若不同扰动框最终被回归到相近位置,则说明该目标定位稳定。 通过 Score Filter 和 Variance Filter 后,可靠 pseudo foreground 被存入 Foreground Bank。

4.2.2 尺度调整

粘贴之前,Foreground Patch 只进行随机水平翻转和尺度调整。首先分别对宽和高进行轻微缩放:

s w , s h ∈ 0.8 , 1.25 s_w,s_h\in0.8,1.25 sw,sh∈0.8,1.25

随后根据 foreground patch 相对于整张图像的尺寸进一步调整尺度。令:

r = max ⁡ ( w p a t c h w i m a g e , h p a t c h h i m a g e ) r= \max \left( \frac{w_{patch}}{w_{image}}, \frac{h_{patch}}{h_{image}} \right) r=max(wimagewpatch,himagehpatch)

如果:

r < 0.05 r<0.05 r<0.05

则将目标放大:

s c a l e ∈ 2.25 , 4 scale\in2.25,4 scale∈2.25,4

如果:

r > 0.3 r>0.3 r>0.3

则将目标缩小:

s c a l e ∈ 0.3 , 0.5 scale\in0.3,0.5 scale∈0.3,0.5

其他情况使用:

s c a l e ∈ 1.5 , 2 scale\in1.5,2 scale∈1.5,2

这样可以避免小目标过小难以学习,同时避免大目标占据过多图像面积。

DIA 的顺序是:

text 复制代码
Original Unlabeled Image
        ↓
Strong Augmentation
        ↓
从 Foreground Bank 选择实例
        ↓
Resize / Flip Foreground Patch
        ↓
Dense Pasting
        ↓
最终 Strong Augmented Dense Image

也就是说,论文采用的是 先对原图进行 Strong Augmentation,再执行 DIA 中的实例粘贴,而不是先粘贴目标后再对整张图做统一强增强。

4.2.1 粘贴区域选择

在选择粘贴位置时,作者利用 Teacher 在弱增强图像上的低阈值预测保护潜在前景区域。所有:

s c o r e > 0.05 score>0.05 score>0.05

的预测区域都会被视为 potential foreground。

新粘贴实例与这些潜在前景区域计算 IoF:

I o F ( A , B ) . = ∣ A ∩ B ∣ ∣ A ∣ IoF(A,B) .= \frac{|A\cap B|}{|A|} IoF(A,B).=∣A∣∣A∩B∣

只有当最大 IoF 足够小时才进行粘贴,从而尽量避免新目标覆盖原图中尚未被高置信识别的真实目标。

成功粘贴后,需要同步更新该图像对应的 pseudo label,并将新目标的位置加入当前 foreground 列表,使之后继续粘贴的实例也不会与已经粘贴的目标产生严重重叠。

4.3 Relation Consistency Regularization (关系一致性正则化)

图3. 以不同尺度图像的输出作为监督信号,迫使网络学习到泛化能力更强的特征。PCL代表皮尔逊相关系数损失。

RCR 同时在图像尺度和特征层面引入扰动,并要求模型在不同扰动下保持类别之间的关系一致。

RCR 使用三个主要视图:

text 复制代码
Strong Aug.
Resized Inter-Aug.
Resized Strong Aug.
  • Strong Aug. 是经过强增强并执行 DIA 后的无标签图像。

  • Inter-Aug. 是基于 weak augmented data 经过额外变换并通过 DIA 得到的中等扰动视图。一个扰动强度介于普通 weak view 和 strong view 之间的辅助视图。

  • Mask Perturbation(MP)会在空间维度随机擦除约 50 % 50\% 50% 的 Feature Map 信息。被 Mask 后的 Feature 再送入 Generator 进行恢复。其目的并不是恢复原始图像,而是在 Feature Space 中利用剩余信息补充被 Mask 的特征,从而迫使网络关注目标的多个判别性区域,而不是只依赖少数显著特征。

三个分支最终经过 RoI Head 得到分类输出:

z s a z_{sa} zsa

表示 Strong Aug. 分支输出,

z r i z_{ri} zri

表示 Resized Inter-Aug. 分支输出,

z r s z_{rs} zrs

表示 Resized Strong Aug. 分支输出。

RCR 不要求不同分支的类别概率数值完全一致,而是要求类别之间的相对关系保持一致。

最终 RCR Loss 为:

L r c r = .0.5 d p ( z r i , z s a ) + d p ( z r i , z r s ) L_{rcr} =. 0.5 \left d_p(z_{ri},z_{sa}) + d_p(z_{ri},z_{rs}) \\right Lrcr=.0.5dp(zri,zsa)+dp(zri,zrs)

也就是说,以 Resized Inter-Aug. 分支作为中间参考,分别约束其与 Strong Aug. 和 Resized Strong Aug. 的类别关系保持一致。

例如两个视图输出:

text 复制代码
View A:
car   = 0.80
truck = 0.15
dog   = 0.05

View B:
car   = 0.60
truck = 0.30
dog   = 0.10

虽然具体概率不同,但二者都满足:

text 复制代码
car > truck > dog

RCR 认为这种类别关系仍然是一致的,因此不需要像 KL Divergence 那样强制两个输出分布完全相同。

实验

表1 与其他最先进方法在PASCAL VOC上的对比实验。*表示我们的实验。-表示源论文中缺少相关结果。†表示两阶段方法

表2 与其他当前最优方法在COCO数据集上的对比实验。以交并比阈值范围为0.5至0.95的平均精度均值(%)作为评估指标。*表示本团队的实验结果。我们使用固定随机种子以消除随机性。-表示源论文中缺失相关结果。†表示两阶段方法

相关推荐
Nomarsgo1 小时前
柔性生产平台工业显示解决方案——基于联控 Lionconit IFD-1901 工业显示器打造高可靠人机交互终端
人工智能·科技·计算机外设·视觉检测·电脑·人机交互·制造
天天代码码天天1 小时前
不装 Android Studio,也能把 Vue / React 一键打成 APK:开源工具 lw.Web2Android
人工智能
武子康1 小时前
DeepSeek Harness:Subagent、Job、Goal 都叫任务,为什么不能混成一个对象
人工智能·llm·agent
这张生成的图像能检测吗2 小时前
图像处理 / 底层视觉论文解析汇总目录
图像处理·人工智能
探路者继续奋斗2 小时前
AI资产科普
人工智能
云边云科技_云网融合2 小时前
连锁门店如何用AI降本增效?云边云科技 “AI +零售”沙龙探门店智能运营新范式
人工智能·科技·零售
倔强的石头1062 小时前
【机器学习】损失函数全解_从MSE到交叉熵
人工智能·机器学习
研华科技Advantech2 小时前
Windows Server IoT 2025深度技术解析:功能、安全与AI性能突破
人工智能·物联网·安全