1 论文信息
论文题目: STEP-DETR: Advancing DETR-based Semi-Supervised Object Detection with Super Teacher and Pseudo-Label Guided Text Queries
论文作者: Tahira Shehzadi, Khurram Azeem Hashmi, Shalini Sarode, Didier Stricker, Muhammad Zeshan Afzal
发表单位:
- DFKI
- RPTU Kaiserslautern-Landau
- MindGarage-RPTU
发表会议期刊: ICCV 2025(2025 IEEE/CVF International Conference on Computer Vision)
代码链接: 未公开
文章目录
- [1 论文信息](#1 论文信息)
- [2 论文主要贡献](#2 论文主要贡献)
- [3 论文创新点](#3 论文创新点)
- [4 方法](#4 方法)
-
- [4.1 整体框架](#4.1 整体框架)
-
- [4.1.1 Stage 1:训练 Static Teacher](#4.1.1 Stage 1:训练 Static Teacher)
- [4.1.2 Stage 2:半监督 Teacher-Student 训练](#4.1.2 Stage 2:半监督 Teacher-Student 训练)
- [4.2 Super Teacher](#4.2 Super Teacher)
-
- [4.2.1 Static Teacher](#4.2.1 Static Teacher)
- [4.2.2 Dynamic Teacher](#4.2.2 Dynamic Teacher)
- [4.2.3 双 Teacher 伪标签融合](#4.2.3 双 Teacher 伪标签融合)
- [4.3 Pseudo-Label Text Queries(伪标签文本查询)](#4.3 Pseudo-Label Text Queries(伪标签文本查询))
-
- [4.3.1 为什么需要 Pseudo-Label Text Query](#4.3.1 为什么需要 Pseudo-Label Text Query)
- [4.3.2 Text Embedding](#4.3.2 Text Embedding)
- [4.3.3 构造 Pseudo-Label Text Query](#4.3.3 构造 Pseudo-Label Text Query)
- [4.4 Consistency Queries](#4.4 Consistency Queries)
- [4.5 Denoising Text Guided Object Queries(去噪文本引导目标查询)](#4.5 Denoising Text Guided Object Queries(去噪文本引导目标查询))
-
- [4.5.1 构造噪声 Bounding Box](#4.5.1 构造噪声 Bounding Box)
- [4.5.2 Positive Queries](#4.5.2 Positive Queries)
- [4.5.3 Negative Queries](#4.5.3 Negative Queries)
- [4.6 Query Refinement Module(查询精炼模块)](#4.6 Query Refinement Module(查询精炼模块))
-
- [4.6.1 Query 相似度计算](#4.6.1 Query 相似度计算)
- [5 实验分析](#5 实验分析)
- [6 个人声明](#6 个人声明)
2 论文主要贡献
STEP-DETR 是一种基于 DETR 的半监督目标检测方法,主要针对现有 DETR-based SSOD 中的 伪标签质量不足、类别置信度偏置 等问题进行改进。
论文的主要贡献包括:
-
提出 Super Teacher,由 Static Teacher 和 Dynamic Teacher 共同生成伪标签。Static Teacher 保留人工标注数据中学习到的稳定知识,Dynamic Teacher 则通过 Student 的 EMA 更新不断适应训练过程。
-
提出 Pseudo-Label Text Queries(伪标签文本查询),将 Super Teacher 产生的伪标签类别和边界框进一步转换为 Decoder Query,缓解少数类别由于低置信度导致监督不足的问题。
-
提出 Denoising Text Guided Object Queries(去噪文本引导目标查询),在 DINO 原有 Denoising Query 的基础上加入类别信息。对于前景正样本 Query 使用正确类别 embedding,而对于背景负样本 Query 随机加入错误类别 embedding,增强模型区分前景目标与背景的能力。
-
提出 Query Refinement Module(查询精炼模块),通过计算 Denoising Query 与伪标签类别 embedding 之间的相关性,过滤掉无关或冗余 Query,在提高检测性能的同时降低训练开销。
在 COCO 10% 标注数据设置下,STEP-DETR 达到 45.4 mAP ,相比 Semi-DETR 提升 1.9 mAP。

图 1 (a) 全监督网络依托可靠标注可取得优异性能;但在半监督场景下,为无标注数据生成的伪标签存在噪声,会导致 CNN 与 Transformer 两类网络的检测性能均出现下滑。(b) 目标检测器对常见目标(如行人)会输出更高的置信度,同时易将稀有目标(如消防栓)与背景混淆。在标注数据有限的半监督目标检测(SSOD)中,稀有目标的低置信度伪标签会被过滤(灰色箱线图),无法生成对应稀有目标的查询,最终造成稀有类别检测性能不佳。本文提出的 "超级教师" 模块通过为稀有目标生成目标查询(绿色箱线图)解决了这一问题,有效提升了检测性能。
3 论文创新点
其四个主要创新模块分别为:
- Super Teacher: 提高伪标签质量;
- Pseudo-Label Text Queries: 利用伪标签类别和位置构造额外 Query;
- Denoising Text Guided Object Queries: 构造前景与背景的正负 Query;
- Query Refinement: 删除无效和冗余的 Denoising Query。
论文中的 text 实际上就是目标类别名称,其类别标签首先经过 one-hot 表示,再转换成 256 256 256 维 embedding。
4 方法
4.1 整体框架
Teacher 与 Student 使用相同的 DETR-based 检测器结构,主要区别在于参数更新方式:
- Student 通过损失函数反向传播更新;
- Dynamic Teacher 通过 Student 参数的 EMA 更新;
- Static Teacher 在第一阶段训练完成后被冻结。

整个训练过程分为两个阶段。
4.1.1 Stage 1:训练 Static Teacher
首先仅使用人工标注数据 D l D_l Dl 训练一个 DINO 检测器。训练完成后,将该模型作为 Static Teacher ,并冻结其参数。Static Teacher 的主要作用是长期保存从真实标注数据中学习到的稳定知识。如果完全依赖 EMA Teacher,那么训练初期 Student 本身性能较差,Dynamic Teacher 也容易生成错误伪标签。
4.1.2 Stage 2:半监督 Teacher-Student 训练
第二阶段同时使用有标注数据和无标注数据。
对于无标注图像:
- Super Teacher 输入弱增强图像;
- Student 输入强增强图像;
- Super Teacher 生成伪标签;
- Student 使用伪标签进行学习。
STEP-DETR 最终训练损失由三部分组成:
L = L s + L u + L c L=L_s+L_u+L_c L=Ls+Lu+Lc
其中:
- L s L_s Ls:有标注数据上的监督损失;
- L u L_u Lu:无标注数据上的伪标签监督损失;
- L c L_c Lc:Teacher 和 Student 之间的一致性损失。
4.2 Super Teacher
Super Teacher 是 STEP-DETR 用于提高伪标签质量的模块,由:
text
Super Teacher
│
┌───┴────┐
↓ ↓
Static Dynamic
Teacher Teacher
共同组成。
4.2.1 Static Teacher
Static Teacher 在第一阶段使用人工标注数据训练。对于一个无标签图像 x x x,Static Teacher 生成预测:
y ^ s t a t i c = f s t a t i c ( x ) \hat{y}{static}=f{static}(x) y^static=fstatic(x)
第二阶段训练开始之后,Static Teacher 参数被冻结,不再随着 Student 更新。
4.2.2 Dynamic Teacher
Dynamic Teacher 与常见 Mean Teacher 方法类似,通过 Student 参数的 EMA 进行更新:
θ d y n a m i c ← α θ d y n a m i c + ( 1 − α ) θ s t u d e n t \theta_{dynamic} \leftarrow \alpha\theta_{dynamic} + (1-\alpha)\theta_{student} θdynamic←αθdynamic+(1−α)θstudent
其中:
- θ d y n a m i c \theta_{dynamic} θdynamic 表示 Dynamic Teacher 参数;
- θ s t u d e n t \theta_{student} θstudent 表示 Student 参数;
- α \alpha α 为 EMA 衰减系数。
随着 Student 不断训练,Dynamic Teacher 也会不断更新。
对于无标签图像 x x x,其预测为:
y ^ d y n a m i c = f d y n a m i c ( x ) \hat{y}{dynamic}=f{dynamic}(x) y^dynamic=fdynamic(x)
STEP-DETR 将两种 Teacher 结合
4.2.3 双 Teacher 伪标签融合
Static Teacher 和 Dynamic Teacher 分别产生:
y ^ s t a t i c \hat{y}_{static} y^static
和:
y ^ d y n a m i c \hat{y}_{dynamic} y^dynamic
首先将两者生成的预测进行合并:
y ^ s t a t i c ∪ y ^ d y n a m i c \hat{y}{static}\cup\hat{y}{dynamic} y^static∪y^dynamic
然后根据置信度阈值 τ \tau τ 进行筛选:
y ^ = . { y ^ i ∣ c o n f i d e n c e ( y ^ i ) ≥ τ , y ^ i ∈ y ^ s t a t i c ∪ y ^ d y n a m i c } \hat{y} =. \left\{ \hat{y}_i \mid confidence(\hat{y}i)\ge\tau, \hat{y}i\in \hat{y}{static}\cup\hat{y}{dynamic} \right\} y^=.{y^i∣confidence(y^i)≥τ,y^i∈y^static∪y^dynamic}
最终留下的高置信预测作为 Student 的普通伪标签。

4.3 Pseudo-Label Text Queries(伪标签文本查询)
Pseudo-Label Text Queries 是 STEP-DETR 中最重要的 Query 改进模块之一
4.3.1 为什么需要 Pseudo-Label Text Query
半监督目标检测中存在一个明显的问题:
常见类别通常具有更高的预测置信度,而少数类别的预测置信度通常较低。
4.3.2 Text Embedding
论文中的 Text 是目标类别名称。
类别标签首先采用 one-hot 表示,然后转换成 256 256 256 维 embedding:
e t i ∈ R 256 e_{t_i}\in R^{256} eti∈R256

4.3.3 构造 Pseudo-Label Text Query
Super Teacher 产生一个伪标签:
类别:car
Bounding Box:b
首先获得对应类别 embedding:
e c a r e_{car} ecar
然后将类别 embedding 与 Bounding Box b b b 结合,构造 Text Query:
l t = c o n c a t ( e t , b ) l_t=concat(e_t,b) lt=concat(et,b)
l s = c o n c a t ( e s , b ) l_s=concat(e_s,b) ls=concat(es,b)

4.4 Consistency Queries
STEP-DETR 中的 Consistency Query 主要继承自 Semi-DETR,用于约束 Teacher 和 Student 在弱增强和强增强视图下对同一目标保持一致。
Teacher 处理弱增强图像;Student 处理强增强图像:
对于相同的目标区域,可以分别得到 Teacher 和 Student 的目标视觉特征
同一个目标经过不同的数据增强后,Teacher 和 Student 仍然产生一致的目标表示和检测结果。
4.5 Denoising Text Guided Object Queries(去噪文本引导目标查询)
基本思想是:从已有 GT 或 Pseudo GT 出发,人为向 Bounding Box 加入一定扰动,然后让模型学习恢复正确目标。
STEP-DETR 在此基础上进一步加入类别信息,提出 Denoising Text Guided Object Queries。

4.5.1 构造噪声 Bounding Box
对于一个伪标签 Bounding Box c i c_i ci,生成一组 2 N 2N 2N 个噪声框:
c ~ i = { c i + λ 1 ϵ ( c i ) , 0 ≤ i < N c i + λ 2 ϵ ( c i ) , o t h e r w i s e \tilde{c}_i= \begin{cases} c_i+\lambda_1\epsilon(c_i), & 0\le i<N\\ c_i+\lambda_2\epsilon(c_i), & otherwise \end{cases} c~i={ci+λ1ϵ(ci),ci+λ2ϵ(ci),0≤i<Notherwise
其中:
λ 1 ∼ ( 0 , 1 ) \lambda_1\sim(0,1) λ1∼(0,1)
λ 2 ∼ ( 1 , 2 ) \lambda_2\sim(1,2) λ2∼(1,2)
ϵ ( c i ) \epsilon(c_i) ϵ(ci) 表示基于原 Bounding Box 宽和高计算得到的基本偏移量。
两种噪声尺度分别承担不同作用。
4.5.2 Positive Queries
前一部分使用较小的噪声尺度:
λ 1 ∼ ( 0 , 1 ) \lambda_1\sim(0,1) λ1∼(0,1)
因此生成的 Bounding Box 与原始伪标签通常具有较高 IoU。
对于正样本 Query,加入 Super Teacher 给出的正确类别。
使 Query 同时具有:
- 相对准确的位置;
- 正确的类别信息。
4.5.3 Negative Queries
后一部分使用更大的噪声:
λ 2 ∼ ( 1 , 2 ) \lambda_2\sim(1,2) λ2∼(1,2)
其 Bounding Box 与原始目标的 IoU 相对较低
对于部分 Negative Query,论文随机从所有类别 C t o t a l C_{total} Ctotal 中选择错误类别 embedding t c t_c tc。
Denoising Query 的构造方式为:
q ~ t , s ∗ = . { q t , s + t c , N ≤ i < 2 N and λ 1 < ρ q t , s + t s t , o t h e r w i s e \tilde{q}{t,s}^{*} =. \begin{cases} q{t,s}+t_c, & N\le i<2N \text{ and } \lambda_1<\rho\\ q_{t,s}+t_{st}, & otherwise \end{cases} q~t,s∗=.{qt,s+tc,qt,s+tst,N≤i<2N and λ1<ρotherwise
其中:
- q t , s q_{t,s} qt,s:原始 Denoising Object Query;
- t s t t_{st} tst:Super Teacher 给出的正确类别 embedding;
- t c t_c tc:随机选择的类别 embedding;
- ρ \rho ρ:类别随机替换概率。
因此最终构造出两类 Query:
c
Positive Query:
接近目标的位置
+
正确类别 embedding
c
Negative Query:
明显偏离目标的位置
+
随机错误类别 embedding
4.6 Query Refinement Module(查询精炼模块)
上面的模块会产生大量 Denoising Queries。其中尤其是 Negative Query 中可能包含大量:
- 无效 Query;
- 重复 Query;
- 与当前图像目标无关的 Query。
这些 Query 不仅可能影响训练,还会增加 Transformer Decoder 的计算量。
因此 STEP-DETR 提出 Query Refinement Module 对其进行进一步筛选。

4.6.1 Query 相似度计算
假设经过 Denoising Text Guided Object Queries 后得到多个 Query:
q ~ t , s ∗ \tilde{q}_{t,s}^{*} q~t,s∗
同时,当前图像中存在多个伪标签,其类别 embedding 表示为:
e t , s ∈ R 256 e_{t,s}\in R^{256} et,s∈R256
对于每一个 Denoising Query,分别计算其与所有伪标签类别 embedding 的相似度:
s i m ( q ~ t , s ∗ , e t , s ) sim(\tilde{q}{t,s}^{*},e{t,s}) sim(q~t,s∗,et,s)
它实际判断的是:
当前 Denoising Query 在模型 embedding 空间中,是否与当前图像中的某个伪标签类别表示具有足够高的相关性。
5 实验分析

表 1 STEP-DETR 与现有方法在 COCO-Partial 设置下的性能对比。所有结果经五折交叉验证取平均值。其中,FCOS 为单阶段检测器的基线,Faster R-CNN 为两阶段检测器的基线,DINO 为基于 Transformer 的检测器的基线。
6 个人声明
本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本文立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。