摘要
本文解读 CVPR 2025 论文《UNEM: UNrolled Generalized EM for Transductive Few-Shot Learning》。该论文提出 UNEM(Unrolled Generalized EM) ,通过把广义期望最大化算法 的每次迭代展开成网络层、并将类别平衡与温度超参数 变成可学习参数,让转导少样本推理彻底告别网格搜索。其特别之处在于仅用 21 个参数、数秒训练 就同时覆盖高斯与 Dirichlet 两种分布、纯视觉与 CLIP 两类范式。实验表明纯视觉最高提升 10 个百分点,CLIP 11 个数据集平均提升 4.2 个百分点,为少样本学习提供了"超参数也可以被学习"的全新设计范式。
视频讲解 :点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- [UNEM 与传统 EM 算法是什么关系?](#UNEM 与传统 EM 算法是什么关系?)
- 为什么超参数不能用网格搜索解决?
- [21 个参数的网络如何训练?](#21 个参数的网络如何训练?)
- [UNEM-Gaussian 和 UNEM-Dirichlet 有什么区别?](#UNEM-Gaussian 和 UNEM-Dirichlet 有什么区别?)
- 代码开源了吗?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | UNEM: UNrolled Generalized EM for Transductive Few-Shot Learning |
| 标题(中文) | UNEM:展开广义EM,让少样本推理超参数自动学习 |
| 作者 | Long Zhou, Fereshteh Shakeri, Aymen Sadraoui, Mounir Kaaniche, Jean-Christophe Pesquet, Ismail Ben Ayed |
| 机构 | Politecnico di Milano · ÉTS Montréal · Université Paris-Saclay / Inria / CentraleSupélec · Sorbonne Paris Nord |
| 会议 | CVPR 2025 |
| arXiv | https://arxiv.org/abs/2412.16739 |
| 项目网站 | https://github.com/ZhouLong0/UNEM-Transductive |
背景与动机
转导(transductive)少样本推理是当前少样本分类的最强范式:它不逐样本独立预测,而是把整个查询批(query set)放在一起联合推理,利用无标注样本的统计信息。从 TIM (NeurIPS 2020)的信息最大化、LaplacianShot (ICML 2020)的图正则化,到 PADDLE (NeurIPS 2022)的 MDL 聚类、EM-Dirichlet(CVPR 2024)首次把转导带入 CLIP,这条主线持续刷新精度纪录。
但这类方法普遍依赖一个"隐藏的魔鬼":类别平衡超参数 \\lambda 。\\lambda 控制目标函数对类分布的先验强度,它的最优取值可能随数据集相差数量级------论文用 EM-Dirichlet 在 10 个 CLIP 数据集上实测,最优 \\lambda 从几十到上万不等。现有做法是在验证集上网格搜索,既次优又不可扩展;加上温度 T 等额外超参数后,搜索空间进一步爆炸。更糟的是,多数方法假设查询集类别均衡,而真实场景(如细粒度分类)并不满足。
UNEM 的回答是:把超参数选择从"搜索"重构为"学习"。借助信号处理领域成熟的 unrolling(learning to optimize)范式------LISTA、ISTA-Net、Monga 等人的综述(IEEE SPM 2021)------把迭代优化器映射成神经网络,让验证任务上的交叉熵直接反传优化这些超参数。
研究主线:从问题到结论

图 5:UNEM 研究主线(Mermaid 流程图)------从"调参难"问题出发,经 GEM 统一框架与迭代展开设计,到纯视觉 + CLIP 双范式实验验证,最终以 21 参数 + 4.2pt 平均增益收束。
基准/方法设计
UNEM 的出发点是**广义 EM(GEM)**目标函数:
\\min_{u,\\theta}\\; \\mathcal{L}(u,\\theta) + \\lambda\\Psi(u) + T\\Phi(u)
三项分别对应:负对数似然(数据拟合)、类别分布香农熵(\\lambda 控制类别平衡强度)、分配熵势垒(T 控制分配软度)。每次迭代三步更新:分布参数 \\theta_k \\leftarrow \\mathrm{DP_est}、类别占比 \\pi_k \\leftarrow \\frac{1}{\|Q\|}\\sum u_{n,k}、分配向量 u_n \\leftarrow \\mathrm{softmax}(\\frac{1}{T}(\\ln p(z_n\|\\theta_k) + \\frac{\\lambda}{\|Q\|}\\ln\\pi_k))。这个框架的优雅之处在于特例统一:T{=}1、\\lambda{=}\|Q\| 时退化为经典 EM ,T{=}1 且用 Dirichlet 分布时恢复为 EM-Dirichlet------GEM 是它们的公共泛化。

图 1:类别平衡超参数 λ 对精度的关键影响。同一 EM-Dirichlet 算法在 10 个 CLIP 数据集上,最优 λ(星标)相差数量级,验证了手工调参不可行的动机。
分类全景
转导少样本方法按技术路线可分为四大流派,UNEM 用统一优化视角把它们收进同一框架:

图 6:转导少样本方法分类全景(Mermaid 流程图)------聚类派(PADDLE、α-AM)、信息最大化派(TIM、α-TIM)、标签传播派(TPN、ProtoLP)、最优传输派(ILPC),以及统一它们的 GEM→UNEM 框架。
方法细节
展开为网络:L 次迭代 = L 层网络,每层学习独立的超参数 (\\lambda\^{(\\ell)}, T\^{(\\ell)}),实现逐层自适应------这是 unrolling 相对传统迭代算法的核心红利。
约束建模:\\lambda = \\mathrm{Softplus}(a) \\ge 0 保证非负;T = 1 + \\mathrm{Softplus}(b) \\ge 1,下界 1 防止训练时温度趋近零导致梯度消失。
训练方式 :在验证任务上最小化交叉熵 \\mathcal{L}*c = \\sum y* {n,k}\\log u_{n,k}\^{(L)},全网络仅 2L 个参数(L{=}10 时共 21 个)。纯视觉用 1000 个验证任务、CLIP 用 100 个,80 epoch、Adam。
两种实例:UNEM-Gaussian(高斯分布 + 特征缩放 T_z,面向纯视觉骨干)与 UNEM-Dirichlet(Dirichlet 分布,面向 CLIP 的类别概率型特征)。

图 2:GEM 单次迭代展开为网络层。每个迭代 ℓ 对应一层,层内执行 θ、π、u 三个更新块,并携带该层专属超参数 (λ, T)。

图 3:UNEM 总体架构。特征 z 馈入所有层,L 个级联层各自携带可学习 (λ, T),输出第 L 层类别分配,以交叉熵在验证任务上训练。
实验设计与结果
评测协议 :转导设置下支撑集含 K 类、查询集仅含 K_{\\mathrm{eff}} 个真实类别(类不平衡、不披露);纯视觉 5/10/20-shot,CLIP 4-shot;精度在 1000 个任务上取平均。骨干:纯视觉 ResNet-18 / WRN28-10(微调),CLIP 直接用预训练模型。
主表:mini-ImageNet / tiered-ImageNet(ResNet-18,K=20/160)
| 方法 | mini 5-shot | mini 20-shot | tiered 5-shot | tiered 20-shot |
|---|---|---|---|---|
| Baseline | 55.4 | 67.9 | 29.7 | 42.2 |
| LaplacianShot | 57.9 | 68.3 | 29.6 | 39.1 |
| TIM | 66.8 | 70.8 | 29.3 | 27.8 |
| α-TIM | 66.7 | 73.9 | 43.8 | 51.9 |
| PADDLE | 62.9 | 79.8 | 45.4 | 70.6 |
| UNEM-Gaussian | 66.4 | 80.4 | 52.3 | 73.2 |
UNEM-Gaussian 全面超越 PADDLE 与 SOTA:tiered 5-shot 提升 6.9pt(52.3 vs 45.4)。换 WRN28-10 骨干后优势更大(mini 20-shot 83.7、tiered 20-shot 74.7,5-shot 最高 +10pt);CUB 上 5-shot 78.5 vs PADDLE 71.2(+7.3pt)。关键佐证:PADDLE 换骨干几乎不涨------固定 \\lambda{=}\|Q\| 远离最优,印证超参数必须"学"而非"猜"。
CLIP 11 数据集(4-shot,平均精度)
| 方法 | Food101 | OxfordPets | Flowers102 | SUN397 | ImageNet | 平均 |
|---|---|---|---|---|---|---|
| Tip-Adapter | 76.7 | 86.4 | 83.2 | 66.7 | 62.7 | 68.3 |
| CoOp | 76.3 | 86.2 | 81.0 | 63.4 | 59.9 | 65.5 |
| LaplacianShot | 76.6 | 88.4 | 85.5 | 63.8 | 56.3 | 64.8 |
| PADDLE | 71.8 | 84.7 | 82.3 | 60.6 | 52.1 | 60.9 |
| EM-Dirichlet | 88.7 | 92.5 | 91.3 | 80.9 | 78.4 | 73.6 |
| UNEM-Dirichlet | 91.4 | 96.0 | 95.6 | 88.5 | 83.1 | 77.8 |
UNEM-Dirichlet 平均 77.8 vs EM-Dirichlet 73.6(+4.2pt),大类数数据集收益最大:FGVC Aircraft +5.5pt、Stanford Cars +6.5pt、SUN397 +7.6pt。

图 4:UNEM-Dirichlet 学到的超参数 (λ, T)。不同数据集收敛到截然不同的 λ 区域(从百量级到近万),直接说明单一经验值不可行。
附录消融:温度缩放带来 1--3pt 提升(tiered 5-shot +2.6pt、EuroSAT +2.9pt);逐层自适应超参比固定超参高 2--4pt(mini 5-shot +3.9pt);层数消融显示 L=7--10 即饱和(10 层 21 参数、训练 3.61s、推理 0.034s/任务);分布偏移场景(tiered 预训练 → CUB/mini 推理)UNEM 仍提升 6.9pt 与 4.1pt;换 CLIP ViT-B/32 骨干增益一致(SUN397 +6.7pt)。
结果对比总结

图 7:结果对比总结(Mermaid 流程图)------UNEM-Gaussian 在 tiered 5-shot 相对 PADDLE +6.9pt,UNEM-Dirichlet 在 CLIP 11 数据集平均相对 EM-Dirichlet +4.2pt。
关键发现
- 超参数敏感度惊人:同一算法的最优 \\lambda 在 10 个 CLIP 数据集间相差数量级(几十到上万),网格搜索本质上不可行。
- 极简参数预算 :L=10 的 UNEM 全部可学习参数仅 21 个 ,训练 3.61 秒 ,推理 0.034 秒/任务,却替代了昂贵搜索。
- 纯视觉最高 +10pt:WRN28-10 骨干 5-shot 场景相对 PADDLE 提升 10 个百分点,tiered-ImageNet 全面刷新 SOTA(52.3/65.7/73.2)。
- CLIP 平均 +4.2pt:UNEM-Dirichlet 在 11 个数据集平均 77.8,类别数越多收益越大(SUN397 +7.6pt、Stanford Cars +6.5pt)。
- 逐层自适应是核心红利:自适应超参比固定超参高 2--4pt;温度缩放再贡献 1--3pt。
- 跨骨干、跨域稳健:ViT-B/32 骨干增益一致;分布偏移场景(tiered→CUB)仍提升 6.9pt。
局限性
- 仍需验证任务训练:每个数据集/骨干要重新学习超参数(好在只需数秒与 21 个参数)。
- 分布模型有限:仅验证高斯与 Dirichlet 两种指数族分布,类别数最大到 K{=}160。
- 转导假设:依赖查询批共享类别结构,极端分布偏移下收益取决于 \\lambda 的泛化。
- 机制分析初步:学到的 (\\lambda\^{(\\ell)}, T\^{(\\ell)}) 逐层演化规律尚未深入解释。
常见问题(FAQ)
UNEM 与传统 EM 算法是什么关系?
UNEM 是 EM 的广义化展开版本。当 T{=}1、\\lambda{=}\|Q\| 时 GEM 退化为经典 EM;当 T{=}1 且采用 Dirichlet 分布时恢复为 EM-Dirichlet(CVPR 2024)。UNEM 把这些迭代展开成 10 层网络,让超参数可学习。
为什么超参数不能用网格搜索解决?
论文实测最优 \\lambda 跨数据集相差数量级,且随骨干变化。网格搜索在验证集上枚举候选值,既无法覆盖连续空间,又为每个数据集重复计算,成本随超参数数量指数增长。
21 个参数的网络如何训练?
把 10 次 GEM 迭代映射为 10 层,每层只有 (\\lambda\^{(\\ell)}, T\^{(\\ell)}) 两个可学习标量(Softplus 约束),在验证任务的交叉熵损失下用 Adam 端到端反传,80 epoch 即可收敛。
UNEM-Gaussian 和 UNEM-Dirichlet 有什么区别?
前者假设特征服从高斯分布(均值原型、闭式更新),面向纯视觉骨干(ResNet/WRN);后者假设 CLIP 的类别概率型特征服从 Dirichlet 分布(MM 更新),面向视觉语言模型。架构与训练流程完全一致。
代码开源了吗?
是的,官方实现与学习到的超参数已开源在 https://github.com/ZhouLong0/UNEM-Transductive。
参考链接
- arXiv 论文页:https://arxiv.org/abs/2412.16739
- 官方代码(UNEM-Transductive):https://github.com/ZhouLong0/UNEM-Transductive
- PADDLE(NeurIPS 2022):https://arxiv.org/abs/2207.14214
- EM-Dirichlet / Transductive Zero-Shot and Few-Shot CLIP(CVPR 2024):https://arxiv.org/abs/2406.10064
- Algorithm Unrolling 综述(IEEE SPM 2021):https://arxiv.org/abs/1912.10557
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群 :白拾的小屋 (750365700)
⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页 :YhbCode000(工程文件)