【CVPR 2025】UNEM:展开广义EM,让少样本推理超参数自动学习|从少样本学习算法设计视角

摘要

本文解读 CVPR 2025 论文《UNEM: UNrolled Generalized EM for Transductive Few-Shot Learning》。该论文提出 UNEM(Unrolled Generalized EM) ,通过把广义期望最大化算法 的每次迭代展开成网络层、并将类别平衡与温度超参数 变成可学习参数,让转导少样本推理彻底告别网格搜索。其特别之处在于仅用 21 个参数、数秒训练 就同时覆盖高斯与 Dirichlet 两种分布、纯视觉与 CLIP 两类范式。实验表明纯视觉最高提升 10 个百分点,CLIP 11 个数据集平均提升 4.2 个百分点,为少样本学习提供了"超参数也可以被学习"的全新设计范式。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) UNEM: UNrolled Generalized EM for Transductive Few-Shot Learning
标题(中文) UNEM:展开广义EM,让少样本推理超参数自动学习
作者 Long Zhou, Fereshteh Shakeri, Aymen Sadraoui, Mounir Kaaniche, Jean-Christophe Pesquet, Ismail Ben Ayed
机构 Politecnico di Milano · ÉTS Montréal · Université Paris-Saclay / Inria / CentraleSupélec · Sorbonne Paris Nord
会议 CVPR 2025
arXiv https://arxiv.org/abs/2412.16739
项目网站 https://github.com/ZhouLong0/UNEM-Transductive

背景与动机

转导(transductive)少样本推理是当前少样本分类的最强范式:它不逐样本独立预测,而是把整个查询批(query set)放在一起联合推理,利用无标注样本的统计信息。从 TIM (NeurIPS 2020)的信息最大化、LaplacianShot (ICML 2020)的图正则化,到 PADDLE (NeurIPS 2022)的 MDL 聚类、EM-Dirichlet(CVPR 2024)首次把转导带入 CLIP,这条主线持续刷新精度纪录。

但这类方法普遍依赖一个"隐藏的魔鬼":类别平衡超参数 \\lambda\\lambda 控制目标函数对类分布的先验强度,它的最优取值可能随数据集相差数量级------论文用 EM-Dirichlet 在 10 个 CLIP 数据集上实测,最优 \\lambda 从几十到上万不等。现有做法是在验证集上网格搜索,既次优又不可扩展;加上温度 T 等额外超参数后,搜索空间进一步爆炸。更糟的是,多数方法假设查询集类别均衡,而真实场景(如细粒度分类)并不满足。

UNEM 的回答是:把超参数选择从"搜索"重构为"学习"。借助信号处理领域成熟的 unrolling(learning to optimize)范式------LISTA、ISTA-Net、Monga 等人的综述(IEEE SPM 2021)------把迭代优化器映射成神经网络,让验证任务上的交叉熵直接反传优化这些超参数。

研究主线:从问题到结论

图 5:UNEM 研究主线(Mermaid 流程图)------从"调参难"问题出发,经 GEM 统一框架与迭代展开设计,到纯视觉 + CLIP 双范式实验验证,最终以 21 参数 + 4.2pt 平均增益收束。

基准/方法设计

UNEM 的出发点是**广义 EM(GEM)**目标函数:

\\min_{u,\\theta}\\; \\mathcal{L}(u,\\theta) + \\lambda\\Psi(u) + T\\Phi(u)

三项分别对应:负对数似然(数据拟合)、类别分布香农熵(\\lambda 控制类别平衡强度)、分配熵势垒(T 控制分配软度)。每次迭代三步更新:分布参数 \\theta_k \\leftarrow \\mathrm{DP_est}、类别占比 \\pi_k \\leftarrow \\frac{1}{\|Q\|}\\sum u_{n,k}、分配向量 u_n \\leftarrow \\mathrm{softmax}(\\frac{1}{T}(\\ln p(z_n\|\\theta_k) + \\frac{\\lambda}{\|Q\|}\\ln\\pi_k))。这个框架的优雅之处在于特例统一:T{=}1\\lambda{=}\|Q\| 时退化为经典 EMT{=}1 且用 Dirichlet 分布时恢复为 EM-Dirichlet------GEM 是它们的公共泛化。

图 1:类别平衡超参数 λ 对精度的关键影响。同一 EM-Dirichlet 算法在 10 个 CLIP 数据集上,最优 λ(星标)相差数量级,验证了手工调参不可行的动机。

分类全景

转导少样本方法按技术路线可分为四大流派,UNEM 用统一优化视角把它们收进同一框架:

图 6:转导少样本方法分类全景(Mermaid 流程图)------聚类派(PADDLE、α-AM)、信息最大化派(TIM、α-TIM)、标签传播派(TPN、ProtoLP)、最优传输派(ILPC),以及统一它们的 GEM→UNEM 框架。

方法细节

展开为网络L 次迭代 = L 层网络,每层学习独立的超参数 (\\lambda\^{(\\ell)}, T\^{(\\ell)}),实现逐层自适应------这是 unrolling 相对传统迭代算法的核心红利。

约束建模\\lambda = \\mathrm{Softplus}(a) \\ge 0 保证非负;T = 1 + \\mathrm{Softplus}(b) \\ge 1,下界 1 防止训练时温度趋近零导致梯度消失。

训练方式 :在验证任务上最小化交叉熵 \\mathcal{L}*c = \\sum y* {n,k}\\log u_{n,k}\^{(L)},全网络仅 2L 个参数(L{=}10 时共 21 个)。纯视觉用 1000 个验证任务、CLIP 用 100 个,80 epoch、Adam。

两种实例:UNEM-Gaussian(高斯分布 + 特征缩放 T_z,面向纯视觉骨干)与 UNEM-Dirichlet(Dirichlet 分布,面向 CLIP 的类别概率型特征)。

图 2:GEM 单次迭代展开为网络层。每个迭代 ℓ 对应一层,层内执行 θ、π、u 三个更新块,并携带该层专属超参数 (λ, T)。

图 3:UNEM 总体架构。特征 z 馈入所有层,L 个级联层各自携带可学习 (λ, T),输出第 L 层类别分配,以交叉熵在验证任务上训练。

实验设计与结果

评测协议 :转导设置下支撑集含 K 类、查询集仅含 K_{\\mathrm{eff}} 个真实类别(类不平衡、不披露);纯视觉 5/10/20-shot,CLIP 4-shot;精度在 1000 个任务上取平均。骨干:纯视觉 ResNet-18 / WRN28-10(微调),CLIP 直接用预训练模型。

主表:mini-ImageNet / tiered-ImageNet(ResNet-18,K=20/160)

方法 mini 5-shot mini 20-shot tiered 5-shot tiered 20-shot
Baseline 55.4 67.9 29.7 42.2
LaplacianShot 57.9 68.3 29.6 39.1
TIM 66.8 70.8 29.3 27.8
α-TIM 66.7 73.9 43.8 51.9
PADDLE 62.9 79.8 45.4 70.6
UNEM-Gaussian 66.4 80.4 52.3 73.2

UNEM-Gaussian 全面超越 PADDLE 与 SOTA:tiered 5-shot 提升 6.9pt(52.3 vs 45.4)。换 WRN28-10 骨干后优势更大(mini 20-shot 83.7、tiered 20-shot 74.7,5-shot 最高 +10pt);CUB 上 5-shot 78.5 vs PADDLE 71.2(+7.3pt)。关键佐证:PADDLE 换骨干几乎不涨------固定 \\lambda{=}\|Q\| 远离最优,印证超参数必须"学"而非"猜"。

CLIP 11 数据集(4-shot,平均精度)

方法 Food101 OxfordPets Flowers102 SUN397 ImageNet 平均
Tip-Adapter 76.7 86.4 83.2 66.7 62.7 68.3
CoOp 76.3 86.2 81.0 63.4 59.9 65.5
LaplacianShot 76.6 88.4 85.5 63.8 56.3 64.8
PADDLE 71.8 84.7 82.3 60.6 52.1 60.9
EM-Dirichlet 88.7 92.5 91.3 80.9 78.4 73.6
UNEM-Dirichlet 91.4 96.0 95.6 88.5 83.1 77.8

UNEM-Dirichlet 平均 77.8 vs EM-Dirichlet 73.6(+4.2pt),大类数数据集收益最大:FGVC Aircraft +5.5pt、Stanford Cars +6.5pt、SUN397 +7.6pt。

图 4:UNEM-Dirichlet 学到的超参数 (λ, T)。不同数据集收敛到截然不同的 λ 区域(从百量级到近万),直接说明单一经验值不可行。

附录消融:温度缩放带来 1--3pt 提升(tiered 5-shot +2.6pt、EuroSAT +2.9pt);逐层自适应超参比固定超参高 2--4pt(mini 5-shot +3.9pt);层数消融显示 L=7--10 即饱和(10 层 21 参数、训练 3.61s、推理 0.034s/任务);分布偏移场景(tiered 预训练 → CUB/mini 推理)UNEM 仍提升 6.9pt 与 4.1pt;换 CLIP ViT-B/32 骨干增益一致(SUN397 +6.7pt)。

结果对比总结

图 7:结果对比总结(Mermaid 流程图)------UNEM-Gaussian 在 tiered 5-shot 相对 PADDLE +6.9pt,UNEM-Dirichlet 在 CLIP 11 数据集平均相对 EM-Dirichlet +4.2pt。

关键发现

  1. 超参数敏感度惊人:同一算法的最优 \\lambda 在 10 个 CLIP 数据集间相差数量级(几十到上万),网格搜索本质上不可行。
  2. 极简参数预算 :L=10 的 UNEM 全部可学习参数仅 21 个 ,训练 3.61 秒 ,推理 0.034 秒/任务,却替代了昂贵搜索。
  3. 纯视觉最高 +10pt:WRN28-10 骨干 5-shot 场景相对 PADDLE 提升 10 个百分点,tiered-ImageNet 全面刷新 SOTA(52.3/65.7/73.2)。
  4. CLIP 平均 +4.2pt:UNEM-Dirichlet 在 11 个数据集平均 77.8,类别数越多收益越大(SUN397 +7.6pt、Stanford Cars +6.5pt)。
  5. 逐层自适应是核心红利:自适应超参比固定超参高 2--4pt;温度缩放再贡献 1--3pt。
  6. 跨骨干、跨域稳健:ViT-B/32 骨干增益一致;分布偏移场景(tiered→CUB)仍提升 6.9pt。

局限性

  • 仍需验证任务训练:每个数据集/骨干要重新学习超参数(好在只需数秒与 21 个参数)。
  • 分布模型有限:仅验证高斯与 Dirichlet 两种指数族分布,类别数最大到 K{=}160
  • 转导假设:依赖查询批共享类别结构,极端分布偏移下收益取决于 \\lambda 的泛化。
  • 机制分析初步:学到的 (\\lambda\^{(\\ell)}, T\^{(\\ell)}) 逐层演化规律尚未深入解释。

常见问题(FAQ)

UNEM 与传统 EM 算法是什么关系?

UNEM 是 EM 的广义化展开版本。当 T{=}1\\lambda{=}\|Q\| 时 GEM 退化为经典 EM;当 T{=}1 且采用 Dirichlet 分布时恢复为 EM-Dirichlet(CVPR 2024)。UNEM 把这些迭代展开成 10 层网络,让超参数可学习。

为什么超参数不能用网格搜索解决?

论文实测最优 \\lambda 跨数据集相差数量级,且随骨干变化。网格搜索在验证集上枚举候选值,既无法覆盖连续空间,又为每个数据集重复计算,成本随超参数数量指数增长。

21 个参数的网络如何训练?

把 10 次 GEM 迭代映射为 10 层,每层只有 (\\lambda\^{(\\ell)}, T\^{(\\ell)}) 两个可学习标量(Softplus 约束),在验证任务的交叉熵损失下用 Adam 端到端反传,80 epoch 即可收敛。

UNEM-Gaussian 和 UNEM-Dirichlet 有什么区别?

前者假设特征服从高斯分布(均值原型、闭式更新),面向纯视觉骨干(ResNet/WRN);后者假设 CLIP 的类别概率型特征服从 Dirichlet 分布(MM 更新),面向视觉语言模型。架构与训练流程完全一致。

代码开源了吗?

是的,官方实现与学习到的超参数已开源在 https://github.com/ZhouLong0/UNEM-Transductive。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
白拾2 小时前
【CVPR 2025】2SFS:重新思考视觉语言模型的少样本适配,两阶段方案|从少样本泛化视角
少样本学习·视觉语言模型·参数高效微调·cvpr 2025·2sfs 论文分享
_Meilinger_2 个月前
碎片笔记|样本少不等于欠拟合:从 Few-shot 任务理解过拟合与欠拟合
机器学习基础·少样本学习·过拟合·欠拟合·模型泛化·高方差·bias-variance
这张生成的图像能检测吗3 个月前
(论文速读)基于大语言模型的类人单次故障诊断
人工智能·目标检测·机器学习·故障诊断·少样本学习·自然语言模型
青云交9 个月前
Java 大视界 -- Java 大数据机器学习模型在自然语言处理中的少样本学习与迁移学习融合
自然语言处理·迁移学习·跨境电商·元学习·少样本学习·java 大数据·医疗语义分析
Code_流苏1 年前
AI知识补全(十四):零样本学习与少样本学习是什么?
人工智能·元学习·少样本学习·零样本学习·语义嵌入
Polaris_T1 年前
CVPR 2025 | 文本和图像引导的高保真3D数字人高效生成GaussianIP
数字人·cvpr 2025·3d生成
人在旅途我渐行渐远2 年前
FewShotChatMessagePromptTemplate 和 FewShotPromptTemplate区别
langchain·少样本学习
MocapLeader2 年前
IROS 2024不容错过的4大理由
机器人顶会·iros 2024·阿布扎比·icra 2025·rss 2025·cvpr 2025·iros 2025
仙魁XAN2 年前
AGI 之 【Hugging Face】 的【零样本和少样本学习】之一 [构建标记任务] / [ 基线模型 ] 的简单整理
agi·hugging face·少样本学习·零样本学习·构建标记任务·基线模型