PASLE:Selective Label Enhancement Learning for Test-Time Adaptation
1. 论文定位与研究背景
1.1 基本信息
| 项目 | 内容 |
|---|---|
| 论文 | Selective Label Enhancement Learning for Test-Time Adaptation |
| 简称 | PASLE |
| 会议 | ICLR 2025 |
| 研究方向 | Test-Time Adaptation(TTA) |
| 核心问题 | 测试阶段无真实标签时,如何为目标域样本构造可靠监督信号 |
| 核心思想 | 对高置信样本使用确定标签,对不确定样本保留候选标签集合,并逐渐细化 |
1.2 TTA基本设定复习一下
TTA假设模型已经在有标注源域数据上完成训练,测试阶段面对无标签目标域数据,并利用目标域测试样本进行在线适应:
源域训练模型 → 无标签目标域测试数据 → 测试时模型更新 → 目标域预测
由于源域与目标域存在分布差异:
pS(x,y) ≠ pT(x,y)
因此源域训练得到的模型直接用于目标域时通常会出现性能下降。PASLE进一步关注的问题是:目标域没有真实标签时,模型自己的预测究竟应该以多大程度作为监督信号。
2. 从TENT到PASLE的问题演进
2.1 TENT:熵最小化
TENT的核心思想是利用目标域数据进行Entropy Minimization:
Lent(x) = -Σc pc(x) log pc(x)
目标是让模型输出更加尖锐、更加自信。
例如:
0.40, 0.30, 0.20, 0.10\] → \[0.90, 0.05, 0.03, 0.02
但关键问题是:
低Entropy ≠ 正确预测
如果真实类别是class 2,而模型预测:
0.95, 0.02, 0.02, 0.01
虽然Entropy很低,但模型实际上是错误且高度自信的。
因此可能形成:
错误预测 → 高置信度错误 → Entropy下降 → 参数更新 → 错误进一步强化
2.2 EATA:可靠样本选择
EATA进一步认识到,并非所有测试样本都适合用于模型更新。
| 问题 | EATA对应思路 |
|---|---|
| 高熵样本不可靠 | 选择可靠样本 |
| 大量相似样本产生重复梯度 | 减少样本冗余 |
| 持续更新造成模型漂移 | 控制有效更新 |
核心变化是:
所有样本参与更新 → 选择更可靠的样本参与更新
2.3 SAR:稳定参数更新
SAR进一步关注可靠样本产生的参数更新是否稳定,引入Reliable Sample和Sharpness-Aware Update,试图降低不稳定更新对模型造成的影响。
因此三者的问题重点不同:
| 方法 | 主要解决问题 |
|---|---|
| TENT | 如何利用无标签目标域数据 |
| EATA | 哪些样本值得用于更新 |
| SAR | 如何让参数更新更加稳定 |
| PASLE | 不确定样本应该采用什么形式的监督标签 |
3. PASLE核心创新:不确定样本不强制变成确定伪标签
3.1 传统伪标签的问题
假设模型预测:
p(x) = 0.45, 0.40, 0.10, 0.05
传统伪标签方法直接取最大概率类别:
ŷ = argmax p(x) = 1
然后将其转化为:
1,0,0,0
问题在于,模型实际上只有45%的概率倾向于class 1,同时还有40%的概率倾向于class 2。两者差距仅为0.05,却被强制转换成100%确定的class 1。
因此:
模型预测分布 → 强制One-hot伪标签
会造成明显的信息损失。
3.2 PASLE的Selective Label Enhancement
PASLE根据样本的预测可靠程度采用不同标签表示。
| 样本类型 | 模型状态 | 标签形式 | 训练方式 |
|---|---|---|---|
| Confident Sample | 某一类别明显领先 | One-hot Label | 确定性监督 |
| Uncertain Sample | 多个类别概率接近 | Candidate Label Set | 集合监督 |
| 适应后期 | 候选类别逐渐明确 | 更小Candidate Set或One-hot | 渐进式细化 |
核心思想可以概括为:
Confident Sample → One-hot Label
Uncertain Sample → Candidate Label Set → Progressive Refinement
因此PASLE真正的创新不是简单地"使用不确定标签",而是:
不确定样本 → 不强制选择唯一伪标签 → 保留候选类别空间 → 随适应过程逐步确定
4. Candidate Label Set与微观算法
4.1 候选标签集合的产生
假设模型输出:
p = 0.45,0.40,0.10,0.05
最高概率类别为:
p = argmaxj dj
第二高概率类别为:
q = argmaxj≠p dj
通过最高类别与第二高类别之间的概率差判断样本是否足够确定:
dp - dq > τ
满足条件时:
x → One-hot Label
不满足条件时:
x → Candidate Label Set
例如:
0.45 - 0.40 = 0.05
如果0.05没有超过当前阈值,则保留:
{1,2}
而不是直接选择class 1。
4.2 Candidate Label Loss
对于确定标签:
l = 1,0,0,0
普通交叉熵为:
L = -log f1(x;Θ)
对于候选标签:
l' = 1,1,0,0
PASLE使用集合监督:
L = -log(f1(x;Θ) + f2(x;Θ))
如果:
f(x) = 0.45,0.40,0.10,0.05
则:
L = -log(0.45 + 0.40) = -log(0.85) ≈ 0.163
此时模型需要提高:
f1 + f2
而不是强制:
f1 → 1
因此模型可以在候选类别内部继续调整。
4.3 与传统伪标签的数值对比
| 方法 | 标签 | Loss | 优化目标 |
|---|---|---|---|
| 传统伪标签 | 1,0,0,0 | -log0.45 | f1 → 1 |
| PASLE | 1,1,0,0 | -log(0.45+0.40) | f1+f2 → 1 |
假设真实类别实际为class 2:
传统伪标签可能形成:
错误伪标签 → 错误梯度 → class 1置信度继续升高
PASLE则允许:
候选集合{1,2} → 模型继续适应 → class 2概率逐渐超过class 1
因此其核心逻辑是:
先约束正确类别的范围 → 再逐渐确定具体类别
5. Progressive Refinement与Buffer
5.1 渐进式标签细化
PASLE并不是让候选标签集合永久存在,而是随着测试时适应不断推进,使标签逐渐从"不确定"走向"确定"。
典型变化为:
Candidate Set → Smaller Candidate Set → One-hot Label
早期模型刚进入目标域时,对样本的判断可能并不可靠,因此允许:
{1,2}
随着模型逐渐适应目标域:
{1,2} → {2} → One-hot(class 2)
这种机制避免了测试初期由于模型尚未适应目标域而产生错误伪标签。
5.2 动态阈值
PASLE并非简单采用一个固定阈值,而是根据适应过程逐渐调整标签确定程度。
| 适应阶段 | 模型状态 | 标签策略 |
|---|---|---|
| 早期 | 模型对目标域不熟悉 | 更谨慎,保留Candidate Set |
| 中期 | 模型逐渐适应 | 候选集合逐渐缩小 |
| 后期 | 预测更加稳定 | 更多样本转为确定标签 |
因此:
早期 → 保留不确定性
中期 → 缩小候选空间
后期 → 确定标签
5.3 Buffer
PASLE还利用Buffer保存当前阶段暂时不适合直接进行确定性更新的样本。
其基本作用是:
测试样本 → 可靠性判断 → 直接利用 / 暂时保留 → 后续逐渐处理
因此测试样本不必在第一次出现时就被迫产生确定监督。
6. PASLE与其他标签形式的区别
6.1 One-hot、Soft Label与Candidate Label
| 标签形式 | 示例 | 表达含义 |
|---|---|---|
| One-hot | 1,0,0,0 | 确定类别为class 1 |
| Soft Label | 0.45,0.40,0.10,0.05 | 各类别具有不同预测概率 |
| Candidate Label | 1,1,0,0 | 正确类别位于class 1或class 2 |
| PASLE | One-hot + Candidate Label动态切换 | 根据可靠程度决定监督强度 |
PASLE并不是简单的Soft Label。
Soft Label保留的是模型当前的概率分布:
0.45,0.40,0.10,0.05
Candidate Label表达的是:
正确类别 ∈ {1,2}
因此PASLE更接近Partial Label Learning,其重点是保留"不确定情况下的候选类别空间"。
6.2 PASLE真正改变的是什么
传统TTA重点关注:
预测分布 → Entropy → 参数更新
PASLE进一步关注:
预测分布 → 判断可靠性 → 选择标签表示 → 构造监督 → 参数更新
因此其核心变化可以概括为:
预测分布优化 → 伪标签质量与监督形式优化
7. 实验与最终理解
7.1 实验验证重点
PASLE在多个TTA实验场景中验证其方法,并通过消融实验分析Candidate Label机制的贡献。
| 实验关注点 | 目的 |
|---|---|
| PASLE与现有TTA方法比较 | 验证整体适应性能 |
| PASLE与去除Candidate Label机制的版本比较 | 验证候选标签机制本身的贡献 |
| 不同阈值设置 | 分析标签确定程度 |
| Buffer相关设置 | 分析样本暂存机制 |
| 不同目标域 | 验证方法对域偏移的适应能力 |
最重要的不是单纯记住某个Accuracy,而是理解消融实验回答的问题:
Candidate Label机制是否真正带来了收益?
实验结果支持其有效性。
7.2 熵最小化问题的完整总结
| 问题 | 表现 | PASLE关系 |
|---|---|---|
| 高置信错误 | 错误预测被进一步强化 | 主要针对 |
| 噪声梯度 | 错误伪标签产生错误更新方向 | 主要缓解 |
| 样本冗余 | 相似样本产生重复梯度 | EATA更直接针对 |
| 灾难性遗忘 | 持续适应导致已有知识退化 | PASLE并非主要解决 |
| 参数更新成本 | 持续测试时更新需要计算资源 | PASLE并非主要解决 |
| 不确定性监督不足 | 不确定样本被强制赋予确定标签 | PASLE核心解决 |
7.3 PASLE在TTA研究路线中的位置
可以将目前阅读的几篇论文理解为:
TENT:利用Entropy进行无监督测试时适应
→ EATA:筛选可靠样本并减少冗余更新
→ SAR:提高参数更新稳定性
→ PASLE:改变不确定样本的监督方式
因此PASLE最核心的一句话是:
不确定样本不能简单地变成一个确定伪标签,而应该保留候选标签集合,并随着测试时适应过程逐渐细化。
最终可压缩为:
PASLE = Confident Samples → One-hot Label;Uncertain Samples → Candidate Label Set → Progressive Refinement。