论文阅读-PASLE

PASLE:Selective Label Enhancement Learning for Test-Time Adaptation

1. 论文定位与研究背景

1.1 基本信息

项目 内容
论文 Selective Label Enhancement Learning for Test-Time Adaptation
简称 PASLE
会议 ICLR 2025
研究方向 Test-Time Adaptation(TTA)
核心问题 测试阶段无真实标签时,如何为目标域样本构造可靠监督信号
核心思想 对高置信样本使用确定标签,对不确定样本保留候选标签集合,并逐渐细化

1.2 TTA基本设定复习一下

TTA假设模型已经在有标注源域数据上完成训练,测试阶段面对无标签目标域数据,并利用目标域测试样本进行在线适应:

源域训练模型 → 无标签目标域测试数据 → 测试时模型更新 → 目标域预测

由于源域与目标域存在分布差异:

pS(x,y) ≠ pT(x,y)

因此源域训练得到的模型直接用于目标域时通常会出现性能下降。PASLE进一步关注的问题是:目标域没有真实标签时,模型自己的预测究竟应该以多大程度作为监督信号。

2. 从TENT到PASLE的问题演进

2.1 TENT:熵最小化

TENT的核心思想是利用目标域数据进行Entropy Minimization:

Lent(x) = -Σc pc(x) log pc(x)

目标是让模型输出更加尖锐、更加自信。

例如:

0.40, 0.30, 0.20, 0.10\] → \[0.90, 0.05, 0.03, 0.02

但关键问题是:

低Entropy ≠ 正确预测

如果真实类别是class 2,而模型预测:

0.95, 0.02, 0.02, 0.01

虽然Entropy很低,但模型实际上是错误且高度自信的。

因此可能形成:

错误预测 → 高置信度错误 → Entropy下降 → 参数更新 → 错误进一步强化

2.2 EATA:可靠样本选择

EATA进一步认识到,并非所有测试样本都适合用于模型更新。

问题 EATA对应思路
高熵样本不可靠 选择可靠样本
大量相似样本产生重复梯度 减少样本冗余
持续更新造成模型漂移 控制有效更新

核心变化是:

所有样本参与更新 → 选择更可靠的样本参与更新

2.3 SAR:稳定参数更新

SAR进一步关注可靠样本产生的参数更新是否稳定,引入Reliable Sample和Sharpness-Aware Update,试图降低不稳定更新对模型造成的影响。

因此三者的问题重点不同:

方法 主要解决问题
TENT 如何利用无标签目标域数据
EATA 哪些样本值得用于更新
SAR 如何让参数更新更加稳定
PASLE 不确定样本应该采用什么形式的监督标签

3. PASLE核心创新:不确定样本不强制变成确定伪标签

3.1 传统伪标签的问题

假设模型预测:

p(x) = 0.45, 0.40, 0.10, 0.05

传统伪标签方法直接取最大概率类别:

ŷ = argmax p(x) = 1

然后将其转化为:

1,0,0,0

问题在于,模型实际上只有45%的概率倾向于class 1,同时还有40%的概率倾向于class 2。两者差距仅为0.05,却被强制转换成100%确定的class 1。

因此:

模型预测分布 → 强制One-hot伪标签

会造成明显的信息损失。

3.2 PASLE的Selective Label Enhancement

PASLE根据样本的预测可靠程度采用不同标签表示。

样本类型 模型状态 标签形式 训练方式
Confident Sample 某一类别明显领先 One-hot Label 确定性监督
Uncertain Sample 多个类别概率接近 Candidate Label Set 集合监督
适应后期 候选类别逐渐明确 更小Candidate Set或One-hot 渐进式细化

核心思想可以概括为:

Confident Sample → One-hot Label

Uncertain Sample → Candidate Label Set → Progressive Refinement

因此PASLE真正的创新不是简单地"使用不确定标签",而是:

不确定样本 → 不强制选择唯一伪标签 → 保留候选类别空间 → 随适应过程逐步确定

4. Candidate Label Set与微观算法

4.1 候选标签集合的产生

假设模型输出:

p = 0.45,0.40,0.10,0.05

最高概率类别为:

p = argmaxj dj

第二高概率类别为:

q = argmaxj≠p dj

通过最高类别与第二高类别之间的概率差判断样本是否足够确定:

dp - dq > τ

满足条件时:

x → One-hot Label

不满足条件时:

x → Candidate Label Set

例如:

0.45 - 0.40 = 0.05

如果0.05没有超过当前阈值,则保留:

{1,2}

而不是直接选择class 1。

4.2 Candidate Label Loss

对于确定标签:

l = 1,0,0,0

普通交叉熵为:

L = -log f1(x;Θ)

对于候选标签:

l' = 1,1,0,0

PASLE使用集合监督:

L = -log(f1(x;Θ) + f2(x;Θ))

如果:

f(x) = 0.45,0.40,0.10,0.05

则:

L = -log(0.45 + 0.40) = -log(0.85) ≈ 0.163

此时模型需要提高:

f1 + f2

而不是强制:

f1 → 1

因此模型可以在候选类别内部继续调整。

4.3 与传统伪标签的数值对比

方法 标签 Loss 优化目标
传统伪标签 1,0,0,0 -log0.45 f1 → 1
PASLE 1,1,0,0 -log(0.45+0.40) f1+f2 → 1

假设真实类别实际为class 2:

传统伪标签可能形成:

错误伪标签 → 错误梯度 → class 1置信度继续升高

PASLE则允许:

候选集合{1,2} → 模型继续适应 → class 2概率逐渐超过class 1

因此其核心逻辑是:

先约束正确类别的范围 → 再逐渐确定具体类别

5. Progressive Refinement与Buffer

5.1 渐进式标签细化

PASLE并不是让候选标签集合永久存在,而是随着测试时适应不断推进,使标签逐渐从"不确定"走向"确定"。

典型变化为:

Candidate Set → Smaller Candidate Set → One-hot Label

早期模型刚进入目标域时,对样本的判断可能并不可靠,因此允许:

{1,2}

随着模型逐渐适应目标域:

{1,2} → {2} → One-hot(class 2)

这种机制避免了测试初期由于模型尚未适应目标域而产生错误伪标签。

5.2 动态阈值

PASLE并非简单采用一个固定阈值,而是根据适应过程逐渐调整标签确定程度。

适应阶段 模型状态 标签策略
早期 模型对目标域不熟悉 更谨慎,保留Candidate Set
中期 模型逐渐适应 候选集合逐渐缩小
后期 预测更加稳定 更多样本转为确定标签

因此:

早期 → 保留不确定性

中期 → 缩小候选空间

后期 → 确定标签

5.3 Buffer

PASLE还利用Buffer保存当前阶段暂时不适合直接进行确定性更新的样本。

其基本作用是:

测试样本 → 可靠性判断 → 直接利用 / 暂时保留 → 后续逐渐处理

因此测试样本不必在第一次出现时就被迫产生确定监督。

6. PASLE与其他标签形式的区别

6.1 One-hot、Soft Label与Candidate Label

标签形式 示例 表达含义
One-hot 1,0,0,0 确定类别为class 1
Soft Label 0.45,0.40,0.10,0.05 各类别具有不同预测概率
Candidate Label 1,1,0,0 正确类别位于class 1或class 2
PASLE One-hot + Candidate Label动态切换 根据可靠程度决定监督强度

PASLE并不是简单的Soft Label。

Soft Label保留的是模型当前的概率分布:

0.45,0.40,0.10,0.05

Candidate Label表达的是:

正确类别 ∈ {1,2}

因此PASLE更接近Partial Label Learning,其重点是保留"不确定情况下的候选类别空间"。

6.2 PASLE真正改变的是什么

传统TTA重点关注:

预测分布 → Entropy → 参数更新

PASLE进一步关注:

预测分布 → 判断可靠性 → 选择标签表示 → 构造监督 → 参数更新

因此其核心变化可以概括为:

预测分布优化 → 伪标签质量与监督形式优化

7. 实验与最终理解

7.1 实验验证重点

PASLE在多个TTA实验场景中验证其方法,并通过消融实验分析Candidate Label机制的贡献。

实验关注点 目的
PASLE与现有TTA方法比较 验证整体适应性能
PASLE与去除Candidate Label机制的版本比较 验证候选标签机制本身的贡献
不同阈值设置 分析标签确定程度
Buffer相关设置 分析样本暂存机制
不同目标域 验证方法对域偏移的适应能力

最重要的不是单纯记住某个Accuracy,而是理解消融实验回答的问题:

Candidate Label机制是否真正带来了收益?

实验结果支持其有效性。

7.2 熵最小化问题的完整总结

问题 表现 PASLE关系
高置信错误 错误预测被进一步强化 主要针对
噪声梯度 错误伪标签产生错误更新方向 主要缓解
样本冗余 相似样本产生重复梯度 EATA更直接针对
灾难性遗忘 持续适应导致已有知识退化 PASLE并非主要解决
参数更新成本 持续测试时更新需要计算资源 PASLE并非主要解决
不确定性监督不足 不确定样本被强制赋予确定标签 PASLE核心解决

7.3 PASLE在TTA研究路线中的位置

可以将目前阅读的几篇论文理解为:

TENT:利用Entropy进行无监督测试时适应

→ EATA:筛选可靠样本并减少冗余更新

→ SAR:提高参数更新稳定性

→ PASLE:改变不确定样本的监督方式

因此PASLE最核心的一句话是:

不确定样本不能简单地变成一个确定伪标签,而应该保留候选标签集合,并随着测试时适应过程逐渐细化。

最终可压缩为:

PASLE = Confident Samples → One-hot Label;Uncertain Samples → Candidate Label Set → Progressive Refinement。

相关推荐
释厄6231 小时前
01AB 基本元理——任何智能体的三元法理·0=1→0≠1法理跃迁为天理
人工智能·windows·算法·microsoft·机器学习
szxinmai主板定制专家1 小时前
工业视觉新思路:FPGA图像预处理+RK NPU推理,实现高速缺陷检测
人工智能·嵌入式硬件·fpga开发·rk3576+codesys
能源革命1 小时前
AI 日报 · 2026-10-02
人工智能
枯木◊靠推文躺平版1 小时前
2026 企业 AI 办公工具选型指南:如何匹配团队业务场景
人工智能
Web3&Basketball1 小时前
LlamaIndex+BGE 重排:RAG 从噪声到可信
人工智能·大模型·rag
MiYi124061 小时前
Vlog人像美颜工具怎么选
大数据·人工智能
Omics Pro1 小时前
经典多组学整合算法→商用云平台
数据库·人工智能·算法·机器学习·自然语言处理
Figo_Cheung1 小时前
Figo生成式AI高维潜空间认知模式解构研究
人工智能·神经网络
JAI科研1 小时前
CT重建(一) | NeRF 原理详解
人工智能·深度学习·计算机视觉·transformer·nerf