文章目录
- [1 论文信息](#1 论文信息)
- [2 论文主要贡献](#2 论文主要贡献)
- [3 论文创新点](#3 论文创新点)
- [4 方法](#4 方法)
-
- [4.1 整体框架](#4.1 整体框架)
- [4.2 Dense Information Augmentation (密集信息增强)](#4.2 Dense Information Augmentation (密集信息增强))
- [4.2.1 前景库](#4.2.1 前景库)
- [4.2.2 尺度调整](#4.2.2 尺度调整)
- [4.2.1 粘贴区域选择](#4.2.1 粘贴区域选择)
- [4.3 Relation Consistency Regularization (关系一致性正则化)](#4.3 Relation Consistency Regularization (关系一致性正则化))
- 实验
1 论文信息
论文题目: Dense Information Learning Based Semi-Supervised Object Detection
论文作者: Xi Yang, Penghui Li, Qiubai Zhou, Nannan Wang, Xinbo Gao
发表单位:
- Xidian University
- Hangzhou Institute of Technology, Xidian University
- Chongqing University of Posts and Telecommunications
发表会议期刊: 2025 TIP
代码链接: 未公开
2 论文主要贡献
本文针对半监督目标检测中无标签图像可利用前景信息稀疏的问题,提出 Dense Information Learning(DIL)框架。传统方法通常通过调整伪标签阈值提高信息利用率,但仍然只能被动利用原始无标签图像中已有的前景,而 DIL 则主动生成包含更多有效前景实例的训练图像。
论文主要提出两个模块:
-
Dense Information Augmentation(DIA) :利用 Teacher 模型预测得到的先验信息筛选可靠前景实例,并建立 Foreground Bank,将这些前景实例密集粘贴到无标签图像中,从而提高单张训练图像中的可利用前景密度。
-
Relation Consistency Regularization(RCR) :通过图像尺度变化和特征 Mask 扰动构造多个视图,并利用 Pearson 相关系数约束不同扰动下类别之间的关系保持一致,从而增强模型的泛化能力。
整体而言,DIL 的核心并不是单纯降低伪标签筛选阈值,而是主动增加无标签训练图像中的可学习目标数量,并进一步通过关系一致性正则化充分利用这些密集前景信息。

图1. 半监督目标检测中可利用信息不足的问题。上图:部分图像的前景信息占比极低。下图:高置信度预测实例的占比较低。因此,现有半监督目标检测方法依赖包含稀疏可利用信息的未标记数据。
哪怕是训练成熟的模型,也会有约 40% 的真实前景被判定为背景,无法生成伪标签、无法参与半监督训练
- 原始未标注数据本身前景密度低,大量区域是背景;
- 模型能识别、可作为伪标签利用的前景,只占真实前景的一小部分。
3 论文创新点
传统方法本质上仍然是"被动利用"图像中已有的信息。DIL 将研究重点从"如何从原图中筛出更多伪标签"转变为:
如何主动构造包含更多可利用前景信息的无标签训练图像。
- 引入密集信息增强模块,以直接获取高密度可利用信息。
- 提出了关系一致性正则化模块,通过掩码和恢复来扰动特征,以更全面地利用密集信息。此外,我们主张对不同扰动下的输出施加强一致性约束,不利于进一步提升网络性能。
- 通过结合这两个模块,提出了一种用于生成密集信息的新框架------密集信息学习,该框架在PASCAL VOC和MS-COCO数据集上取得了当前最优性能。
4 方法
4.1 整体框架
本文以 Soft Teacher 为基础框架,默认检测器为 Faster R-CNN。

整个网络的损失为:
L = L s + λ u L u L=L_s+\lambda_u L_u L=Ls+λuLu
其中有标注数据的监督损失为:
L s = ∑ i L c l s ( x i s , y i s ) + L r e g ( x i s , y i s ) L_s=\sum_i \left L_{cls}(x_i\^s,y_i\^s) + L_{reg}(x_i\^s,y_i\^s) \\right Ls=i∑Lcls(xis,yis)+Lreg(xis,yis)
无标签数据上的损失为:
L u = ∑ i L c l s ( x i u , y \^ i c l s ) + L r e g ( x i u , y \^ i r e g ) + L r c r ( x i u , x i m ) L_u=\sum_i \left L_{cls}(x_i\^u,\\hat{y}_{i}\^{cls}) + L_{reg}(x_i\^u,\\hat{y}_{i}\^{reg}) + L_{rcr}(x_i\^u,x_i\^m) \\right Lu=i∑Lcls(xiu,y\^icls)+Lreg(xiu,y\^ireg)+Lrcr(xiu,xim)
其中 L c l s L_{cls} Lcls 为分类损失, L r e g L_{reg} Lreg 为边界框回归损失, L r c r L_{rcr} Lrcr 为 Relation Consistency Regularization 损失。
4.2 Dense Information Augmentation (密集信息增强)
Dense Information Augmentation(DIA)的目标是主动增加无标签图像中的可利用前景数量。
论文将能够通过伪标签筛选并可靠用于训练的目标定义为 exploitable information:
E I t = { ( I i p s e , L i p s e ) } i = 1 N t EI_t= \left\{ (I_i^{pse},L_i^{pse}) \right\}_{i=1}^{N_t} EIt={(Iipse,Lipse)}i=1Nt
其中 I i p s e I_i^{pse} Iipse 表示 pseudo instance, L i p s e L_i^{pse} Lipse 表示其对应的 pseudo label, N t N_t Nt 为当前时刻可利用伪实例的数量。
4.2.1 前景库
DIA 首先建立一个 Foreground Bank 。Foreground Bank 本质上是按照类别划分的字典结构,每个类别分别保存若干前景 patch。
训练早期 主要将有标注数据中的真实前景实例放入 Foreground Bank,以保证 Bank 中前景的准确性。随着模型逐渐稳定,中后期主要加入无标签数据中 Teacher 预测得到的高质量 pseudo foreground,从而减少对少量人工标注数据的过拟合。
无标签前景实例必须同时经过分类和定位可靠性筛选。首先使用分类 Score Filter:
s c o r e > 0.9 score>0.9 score>0.9
只有高置信度实例才可能进入 Foreground Bank。
同时使用继承自 Soft Teacher 的 Box Jittering 判断 Bounding Box 的定位稳定性。对于一个伪框,生成多个轻微扰动后的候选框,再将这些框送入 Teacher 重新进行定位。若不同扰动框最终被回归到相近位置,则说明该目标定位稳定。 通过 Score Filter 和 Variance Filter 后,可靠 pseudo foreground 被存入 Foreground Bank。
4.2.2 尺度调整
粘贴之前,Foreground Patch 只进行随机水平翻转和尺度调整。首先分别对宽和高进行轻微缩放:
s w , s h ∈ 0.8 , 1.25 s_w,s_h\in0.8,1.25 sw,sh∈0.8,1.25
随后根据 foreground patch 相对于整张图像的尺寸进一步调整尺度。令:
r = max ( w p a t c h w i m a g e , h p a t c h h i m a g e ) r= \max \left( \frac{w_{patch}}{w_{image}}, \frac{h_{patch}}{h_{image}} \right) r=max(wimagewpatch,himagehpatch)
如果:
r < 0.05 r<0.05 r<0.05
则将目标放大:
s c a l e ∈ 2.25 , 4 scale\in2.25,4 scale∈2.25,4
如果:
r > 0.3 r>0.3 r>0.3
则将目标缩小:
s c a l e ∈ 0.3 , 0.5 scale\in0.3,0.5 scale∈0.3,0.5
其他情况使用:
s c a l e ∈ 1.5 , 2 scale\in1.5,2 scale∈1.5,2
这样可以避免小目标过小难以学习,同时避免大目标占据过多图像面积。
DIA 的顺序是:
text
Original Unlabeled Image
↓
Strong Augmentation
↓
从 Foreground Bank 选择实例
↓
Resize / Flip Foreground Patch
↓
Dense Pasting
↓
最终 Strong Augmented Dense Image
也就是说,论文采用的是 先对原图进行 Strong Augmentation,再执行 DIA 中的实例粘贴,而不是先粘贴目标后再对整张图做统一强增强。
4.2.1 粘贴区域选择
在选择粘贴位置时,作者利用 Teacher 在弱增强图像上的低阈值预测保护潜在前景区域。所有:
s c o r e > 0.05 score>0.05 score>0.05
的预测区域都会被视为 potential foreground。
新粘贴实例与这些潜在前景区域计算 IoF:
I o F ( A , B ) . = ∣ A ∩ B ∣ ∣ A ∣ IoF(A,B) .= \frac{|A\cap B|}{|A|} IoF(A,B).=∣A∣∣A∩B∣
只有当最大 IoF 足够小时才进行粘贴,从而尽量避免新目标覆盖原图中尚未被高置信识别的真实目标。
成功粘贴后,需要同步更新该图像对应的 pseudo label,并将新目标的位置加入当前 foreground 列表,使之后继续粘贴的实例也不会与已经粘贴的目标产生严重重叠。
4.3 Relation Consistency Regularization (关系一致性正则化)

图3. 以不同尺度图像的输出作为监督信号,迫使网络学习到泛化能力更强的特征。PCL代表皮尔逊相关系数损失。
RCR 同时在图像尺度和特征层面引入扰动,并要求模型在不同扰动下保持类别之间的关系一致。
RCR 使用三个主要视图:
text
Strong Aug.
Resized Inter-Aug.
Resized Strong Aug.
-
Strong Aug. 是经过强增强并执行 DIA 后的无标签图像。
-
Inter-Aug. 是基于 weak augmented data 经过额外变换并通过 DIA 得到的中等扰动视图。一个扰动强度介于普通 weak view 和 strong view 之间的辅助视图。
-
Mask Perturbation(MP)会在空间维度随机擦除约 50 % 50\% 50% 的 Feature Map 信息。被 Mask 后的 Feature 再送入 Generator 进行恢复。其目的并不是恢复原始图像,而是在 Feature Space 中利用剩余信息补充被 Mask 的特征,从而迫使网络关注目标的多个判别性区域,而不是只依赖少数显著特征。
三个分支最终经过 RoI Head 得到分类输出:
z s a z_{sa} zsa
表示 Strong Aug. 分支输出,
z r i z_{ri} zri
表示 Resized Inter-Aug. 分支输出,
z r s z_{rs} zrs
表示 Resized Strong Aug. 分支输出。
RCR 不要求不同分支的类别概率数值完全一致,而是要求类别之间的相对关系保持一致。
最终 RCR Loss 为:
L r c r = .0.5 d p ( z r i , z s a ) + d p ( z r i , z r s ) L_{rcr} =. 0.5 \left d_p(z_{ri},z_{sa}) + d_p(z_{ri},z_{rs}) \\right Lrcr=.0.5dp(zri,zsa)+dp(zri,zrs)
也就是说,以 Resized Inter-Aug. 分支作为中间参考,分别约束其与 Strong Aug. 和 Resized Strong Aug. 的类别关系保持一致。
例如两个视图输出:
text
View A:
car = 0.80
truck = 0.15
dog = 0.05
View B:
car = 0.60
truck = 0.30
dog = 0.10
虽然具体概率不同,但二者都满足:
text
car > truck > dog
RCR 认为这种类别关系仍然是一致的,因此不需要像 KL Divergence 那样强制两个输出分布完全相同。
实验
表1 与其他最先进方法在PASCAL VOC上的对比实验。*表示我们的实验。-表示源论文中缺少相关结果。†表示两阶段方法

表2 与其他当前最优方法在COCO数据集上的对比实验。以交并比阈值范围为0.5至0.95的平均精度均值(%)作为评估指标。*表示本团队的实验结果。我们使用固定随机种子以消除随机性。-表示源论文中缺失相关结果。†表示两阶段方法
