ICCV 2025 | STEP-DETR:基于超级教师与伪标签引导文本查询的半监督目标检测

1 论文信息

论文题目: STEP-DETR: Advancing DETR-based Semi-Supervised Object Detection with Super Teacher and Pseudo-Label Guided Text Queries

论文作者: Tahira Shehzadi, Khurram Azeem Hashmi, Shalini Sarode, Didier Stricker, Muhammad Zeshan Afzal

发表单位:

  • DFKI
  • RPTU Kaiserslautern-Landau
  • MindGarage-RPTU

发表会议期刊: ICCV 2025(2025 IEEE/CVF International Conference on Computer Vision)

代码链接: 未公开

文章目录

  • [1 论文信息](#1 论文信息)
  • [2 论文主要贡献](#2 论文主要贡献)
  • [3 论文创新点](#3 论文创新点)
  • [4 方法](#4 方法)
    • [4.1 整体框架](#4.1 整体框架)
      • [4.1.1 Stage 1:训练 Static Teacher](#4.1.1 Stage 1:训练 Static Teacher)
      • [4.1.2 Stage 2:半监督 Teacher-Student 训练](#4.1.2 Stage 2:半监督 Teacher-Student 训练)
    • [4.2 Super Teacher](#4.2 Super Teacher)
      • [4.2.1 Static Teacher](#4.2.1 Static Teacher)
      • [4.2.2 Dynamic Teacher](#4.2.2 Dynamic Teacher)
      • [4.2.3 双 Teacher 伪标签融合](#4.2.3 双 Teacher 伪标签融合)
    • [4.3 Pseudo-Label Text Queries(伪标签文本查询)](#4.3 Pseudo-Label Text Queries(伪标签文本查询))
      • [4.3.1 为什么需要 Pseudo-Label Text Query](#4.3.1 为什么需要 Pseudo-Label Text Query)
      • [4.3.2 Text Embedding](#4.3.2 Text Embedding)
      • [4.3.3 构造 Pseudo-Label Text Query](#4.3.3 构造 Pseudo-Label Text Query)
    • [4.4 Consistency Queries](#4.4 Consistency Queries)
    • [4.5 Denoising Text Guided Object Queries(去噪文本引导目标查询)](#4.5 Denoising Text Guided Object Queries(去噪文本引导目标查询))
      • [4.5.1 构造噪声 Bounding Box](#4.5.1 构造噪声 Bounding Box)
      • [4.5.2 Positive Queries](#4.5.2 Positive Queries)
      • [4.5.3 Negative Queries](#4.5.3 Negative Queries)
    • [4.6 Query Refinement Module(查询精炼模块)](#4.6 Query Refinement Module(查询精炼模块))
      • [4.6.1 Query 相似度计算](#4.6.1 Query 相似度计算)
  • [5 实验分析](#5 实验分析)
  • [6 个人声明](#6 个人声明)

2 论文主要贡献

STEP-DETR 是一种基于 DETR 的半监督目标检测方法,主要针对现有 DETR-based SSOD 中的 伪标签质量不足、类别置信度偏置 等问题进行改进。

论文的主要贡献包括:

  1. 提出 Super Teacher,由 Static Teacher 和 Dynamic Teacher 共同生成伪标签。Static Teacher 保留人工标注数据中学习到的稳定知识,Dynamic Teacher 则通过 Student 的 EMA 更新不断适应训练过程。

  2. 提出 Pseudo-Label Text Queries(伪标签文本查询),将 Super Teacher 产生的伪标签类别和边界框进一步转换为 Decoder Query,缓解少数类别由于低置信度导致监督不足的问题。

  3. 提出 Denoising Text Guided Object Queries(去噪文本引导目标查询),在 DINO 原有 Denoising Query 的基础上加入类别信息。对于前景正样本 Query 使用正确类别 embedding,而对于背景负样本 Query 随机加入错误类别 embedding,增强模型区分前景目标与背景的能力。

  4. 提出 Query Refinement Module(查询精炼模块),通过计算 Denoising Query 与伪标签类别 embedding 之间的相关性,过滤掉无关或冗余 Query,在提高检测性能的同时降低训练开销。

在 COCO 10% 标注数据设置下,STEP-DETR 达到 45.4 mAP ,相比 Semi-DETR 提升 1.9 mAP

图 1 (a) 全监督网络依托可靠标注可取得优异性能;但在半监督场景下,为无标注数据生成的伪标签存在噪声,会导致 CNN 与 Transformer 两类网络的检测性能均出现下滑。(b) 目标检测器对常见目标(如行人)会输出更高的置信度,同时易将稀有目标(如消防栓)与背景混淆。在标注数据有限的半监督目标检测(SSOD)中,稀有目标的低置信度伪标签会被过滤(灰色箱线图),无法生成对应稀有目标的查询,最终造成稀有类别检测性能不佳。本文提出的 "超级教师" 模块通过为稀有目标生成目标查询(绿色箱线图)解决了这一问题,有效提升了检测性能。

3 论文创新点

其四个主要创新模块分别为:

  1. Super Teacher: 提高伪标签质量;
  2. Pseudo-Label Text Queries: 利用伪标签类别和位置构造额外 Query;
  3. Denoising Text Guided Object Queries: 构造前景与背景的正负 Query;
  4. Query Refinement: 删除无效和冗余的 Denoising Query。

论文中的 text 实际上就是目标类别名称,其类别标签首先经过 one-hot 表示,再转换成 256 256 256 维 embedding。

4 方法

4.1 整体框架

Teacher 与 Student 使用相同的 DETR-based 检测器结构,主要区别在于参数更新方式:

  • Student 通过损失函数反向传播更新;
  • Dynamic Teacher 通过 Student 参数的 EMA 更新;
  • Static Teacher 在第一阶段训练完成后被冻结。

整个训练过程分为两个阶段。

4.1.1 Stage 1:训练 Static Teacher

首先仅使用人工标注数据 D l D_l Dl 训练一个 DINO 检测器。训练完成后,将该模型作为 Static Teacher ,并冻结其参数。Static Teacher 的主要作用是长期保存从真实标注数据中学习到的稳定知识。如果完全依赖 EMA Teacher,那么训练初期 Student 本身性能较差,Dynamic Teacher 也容易生成错误伪标签。

4.1.2 Stage 2:半监督 Teacher-Student 训练

第二阶段同时使用有标注数据和无标注数据。

对于无标注图像:

  • Super Teacher 输入弱增强图像;
  • Student 输入强增强图像;
  • Super Teacher 生成伪标签;
  • Student 使用伪标签进行学习。

STEP-DETR 最终训练损失由三部分组成:

L = L s + L u + L c L=L_s+L_u+L_c L=Ls+Lu+Lc

其中:

  • L s L_s Ls:有标注数据上的监督损失;
  • L u L_u Lu:无标注数据上的伪标签监督损失;
  • L c L_c Lc:Teacher 和 Student 之间的一致性损失。

4.2 Super Teacher

Super Teacher 是 STEP-DETR 用于提高伪标签质量的模块,由:

text 复制代码
Super Teacher
     │
 ┌───┴────┐
 ↓        ↓
Static   Dynamic
Teacher  Teacher

共同组成。

4.2.1 Static Teacher

Static Teacher 在第一阶段使用人工标注数据训练。对于一个无标签图像 x x x,Static Teacher 生成预测:

y ^ s t a t i c = f s t a t i c ( x ) \hat{y}{static}=f{static}(x) y^static=fstatic(x)

第二阶段训练开始之后,Static Teacher 参数被冻结,不再随着 Student 更新。

4.2.2 Dynamic Teacher

Dynamic Teacher 与常见 Mean Teacher 方法类似,通过 Student 参数的 EMA 进行更新:

θ d y n a m i c ← α θ d y n a m i c + ( 1 − α ) θ s t u d e n t \theta_{dynamic} \leftarrow \alpha\theta_{dynamic} + (1-\alpha)\theta_{student} θdynamic←αθdynamic+(1−α)θstudent

其中:

  • θ d y n a m i c \theta_{dynamic} θdynamic 表示 Dynamic Teacher 参数;
  • θ s t u d e n t \theta_{student} θstudent 表示 Student 参数;
  • α \alpha α 为 EMA 衰减系数。

随着 Student 不断训练,Dynamic Teacher 也会不断更新。

对于无标签图像 x x x,其预测为:

y ^ d y n a m i c = f d y n a m i c ( x ) \hat{y}{dynamic}=f{dynamic}(x) y^dynamic=fdynamic(x)

STEP-DETR 将两种 Teacher 结合

4.2.3 双 Teacher 伪标签融合

Static Teacher 和 Dynamic Teacher 分别产生:

y ^ s t a t i c \hat{y}_{static} y^static

和:

y ^ d y n a m i c \hat{y}_{dynamic} y^dynamic

首先将两者生成的预测进行合并:

y ^ s t a t i c ∪ y ^ d y n a m i c \hat{y}{static}\cup\hat{y}{dynamic} y^static∪y^dynamic

然后根据置信度阈值 τ \tau τ 进行筛选:

y ^ = . { y ^ i ∣ c o n f i d e n c e ( y ^ i ) ≥ τ , y ^ i ∈ y ^ s t a t i c ∪ y ^ d y n a m i c } \hat{y} =. \left\{ \hat{y}_i \mid confidence(\hat{y}i)\ge\tau, \hat{y}i\in \hat{y}{static}\cup\hat{y}{dynamic} \right\} y^=.{y^i∣confidence(y^i)≥τ,y^i∈y^static∪y^dynamic}

最终留下的高置信预测作为 Student 的普通伪标签。

4.3 Pseudo-Label Text Queries(伪标签文本查询)

Pseudo-Label Text Queries 是 STEP-DETR 中最重要的 Query 改进模块之一

4.3.1 为什么需要 Pseudo-Label Text Query

半监督目标检测中存在一个明显的问题:

常见类别通常具有更高的预测置信度,而少数类别的预测置信度通常较低。

4.3.2 Text Embedding

论文中的 Text 是目标类别名称。

类别标签首先采用 one-hot 表示,然后转换成 256 256 256 维 embedding:

e t i ∈ R 256 e_{t_i}\in R^{256} eti∈R256

4.3.3 构造 Pseudo-Label Text Query

Super Teacher 产生一个伪标签:

类别:car

Bounding Box:b

首先获得对应类别 embedding:

e c a r e_{car} ecar

然后将类别 embedding 与 Bounding Box b b b 结合,构造 Text Query:

l t = c o n c a t ( e t , b ) l_t=concat(e_t,b) lt=concat(et,b)

l s = c o n c a t ( e s , b ) l_s=concat(e_s,b) ls=concat(es,b)

4.4 Consistency Queries

STEP-DETR 中的 Consistency Query 主要继承自 Semi-DETR,用于约束 Teacher 和 Student 在弱增强和强增强视图下对同一目标保持一致。

Teacher 处理弱增强图像;Student 处理强增强图像:

对于相同的目标区域,可以分别得到 Teacher 和 Student 的目标视觉特征

同一个目标经过不同的数据增强后,Teacher 和 Student 仍然产生一致的目标表示和检测结果。

4.5 Denoising Text Guided Object Queries(去噪文本引导目标查询)

基本思想是:从已有 GT 或 Pseudo GT 出发,人为向 Bounding Box 加入一定扰动,然后让模型学习恢复正确目标。

STEP-DETR 在此基础上进一步加入类别信息,提出 Denoising Text Guided Object Queries

4.5.1 构造噪声 Bounding Box

对于一个伪标签 Bounding Box c i c_i ci,生成一组 2 N 2N 2N 个噪声框:

c ~ i = { c i + λ 1 ϵ ( c i ) , 0 ≤ i < N c i + λ 2 ϵ ( c i ) , o t h e r w i s e \tilde{c}_i= \begin{cases} c_i+\lambda_1\epsilon(c_i), & 0\le i<N\\ c_i+\lambda_2\epsilon(c_i), & otherwise \end{cases} c~i={ci+λ1ϵ(ci),ci+λ2ϵ(ci),0≤i<Notherwise

其中:

λ 1 ∼ ( 0 , 1 ) \lambda_1\sim(0,1) λ1∼(0,1)

λ 2 ∼ ( 1 , 2 ) \lambda_2\sim(1,2) λ2∼(1,2)

ϵ ( c i ) \epsilon(c_i) ϵ(ci) 表示基于原 Bounding Box 宽和高计算得到的基本偏移量。

两种噪声尺度分别承担不同作用。

4.5.2 Positive Queries

前一部分使用较小的噪声尺度:

λ 1 ∼ ( 0 , 1 ) \lambda_1\sim(0,1) λ1∼(0,1)

因此生成的 Bounding Box 与原始伪标签通常具有较高 IoU。

对于正样本 Query,加入 Super Teacher 给出的正确类别。

使 Query 同时具有:

  • 相对准确的位置;
  • 正确的类别信息。

4.5.3 Negative Queries

后一部分使用更大的噪声:

λ 2 ∼ ( 1 , 2 ) \lambda_2\sim(1,2) λ2∼(1,2)

其 Bounding Box 与原始目标的 IoU 相对较低

对于部分 Negative Query,论文随机从所有类别 C t o t a l C_{total} Ctotal 中选择错误类别 embedding t c t_c tc。

Denoising Query 的构造方式为:

q ~ t , s ∗ = . { q t , s + t c , N ≤ i < 2 N and λ 1 < ρ q t , s + t s t , o t h e r w i s e \tilde{q}{t,s}^{*} =. \begin{cases} q{t,s}+t_c, & N\le i<2N \text{ and } \lambda_1<\rho\\ q_{t,s}+t_{st}, & otherwise \end{cases} q~t,s∗=.{qt,s+tc,qt,s+tst,N≤i<2N and λ1<ρotherwise

其中:

  • q t , s q_{t,s} qt,s:原始 Denoising Object Query;
  • t s t t_{st} tst:Super Teacher 给出的正确类别 embedding;
  • t c t_c tc:随机选择的类别 embedding;
  • ρ \rho ρ:类别随机替换概率。

因此最终构造出两类 Query:

c 复制代码
Positive Query:
接近目标的位置
+
正确类别 embedding
c 复制代码
Negative Query:
明显偏离目标的位置
+
随机错误类别 embedding

4.6 Query Refinement Module(查询精炼模块)

上面的模块会产生大量 Denoising Queries。其中尤其是 Negative Query 中可能包含大量:

  • 无效 Query;
  • 重复 Query;
  • 与当前图像目标无关的 Query。

这些 Query 不仅可能影响训练,还会增加 Transformer Decoder 的计算量。

因此 STEP-DETR 提出 Query Refinement Module 对其进行进一步筛选。

4.6.1 Query 相似度计算

假设经过 Denoising Text Guided Object Queries 后得到多个 Query:

q ~ t , s ∗ \tilde{q}_{t,s}^{*} q~t,s∗

同时,当前图像中存在多个伪标签,其类别 embedding 表示为:

e t , s ∈ R 256 e_{t,s}\in R^{256} et,s∈R256

对于每一个 Denoising Query,分别计算其与所有伪标签类别 embedding 的相似度:

s i m ( q ~ t , s ∗ , e t , s ) sim(\tilde{q}{t,s}^{*},e{t,s}) sim(q~t,s∗,et,s)

它实际判断的是:

当前 Denoising Query 在模型 embedding 空间中,是否与当前图像中的某个伪标签类别表示具有足够高的相关性。

5 实验分析

表 1 STEP-DETR 与现有方法在 COCO-Partial 设置下的性能对比。所有结果经五折交叉验证取平均值。其中,FCOS 为单阶段检测器的基线,Faster R-CNN 为两阶段检测器的基线,DINO 为基于 Transformer 的检测器的基线。

6 个人声明

本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本文立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。

相关推荐
必须会一定会1 小时前
用纯 HTML/JS 做一个 AI 需求澄清器:把模糊想法转换成可执行任务书
开发语言·前端·javascript·人工智能·html·ai编程
HyperAI超神经1 小时前
基于 Strassen 与 LCMA 低复杂度矩阵乘,腾讯 FalconGEMM 探索超越硬件峰值的矩阵乘优化
人工智能·线性代数·矩阵·智能体·推理·ai编译器
DeepIntelli1 小时前
品牌百科词条建设:从词条命名到提交的完整技术指南
人工智能
TAN-90°-1 小时前
Deep Learning for Computer Vision——Image Classification with Linear Classifiers
python·深度学习·算法·计算机视觉·线性回归
MindUp1 小时前
企业网盘选型的技术评估维度与主流产品架构简析
人工智能·安全·架构
狂师1 小时前
用AI做自动化测试,哪些是真不行,哪些是你不会用?
人工智能·面试·测试
小鹿软件办公1 小时前
微软 MAI-Image-2.6 正式发布,文字渲染与 3D 能力显著增强
人工智能·microsoft
zhangfeng11331 小时前
Windows AMD显卡跑PyTorch
人工智能·pytorch·windows
小弥儿1 小时前
Firecrawl:把整个网页变成 AI 可查询的数据库
数据库·人工智能·学习