【CVPR 2025】2SFS:重新思考视觉语言模型的少样本适配,两阶段方案|从少样本泛化视角

摘要

本文解读 CVPR 2025 论文《Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages(2SFS:两阶段少样本适配) 》。该论文提出先测量后设计 的少样本适配新思路:实证发现 PEFT 训练动态天然分裂为"任务级特征学习"与"基类特化"两个阶段,据此把预算拆成LayerNorm 微调线性分类器 两段,其特别之处在于仅凭约 61k 可训练参数与固定超参数,就在 11 个数据集、2 种设定、3 个骨干上全面超越 CoOp、MaPLe、CLIP-LoRA、MMA 等全部 prompt/adapter 方法。实验表明base-to-novel 平均调和均值 80.20(8/11 数据集最佳),all-to-all 三个骨干平均 82.9/79.2/87.1 全部第一,为视觉语言模型的少样本迁移提供了"回归经典分类器范式"的重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Rethinking Few-Shot Adaptation of Vision-Language Models in Two Stages
标题(中文) 重新思考视觉语言模型的少样本适配:两阶段方案
作者 Matteo Farina, Massimiliano Mancini, Giovanni Iacca, Elisa Ricci
机构 University of Trento & Fondazione Bruno Kessler (FBK)
会议 CVPR 2025
arXiv https://arxiv.org/abs/2503.11609
项目网站 https://github.com/FarinaMatteo/rethinking_fewshot_vlms

背景与动机

少样本适配(FSA)面对的根本矛盾是数据-参数比失衡 :CLIP 这类视觉语言模型有上亿参数,每类却只有几张标注图(如 k{=}16 shots),全量微调几乎必然过拟合。因此参数高效微调(PEFT)成为主流:提示调优 (CoOp、CoCoOp、ProGrad、KgCoOp、MaPLe)与适配器方法(CLIP-Adapter、TaskRes、CLIP-LoRA、MMA)都能稳定超过全量微调与线性探测。

但作者指出,这些结论大多是"事后观察"(a-posteriori)------没有人真正测量过少样本训练过程中发生了什么 。一个被广泛默认的负载假设是:想让模型泛化到未见过的 novel 类别,必须设计跨模态机制(如 MaPLe 的跨模态提示、MMA 的权重共享)来主动灌输任务知识。本文用 3 种 PEFT × 多数据集的训练动态测量扭转了这个假设 :即使没有任何 ad-hoc 机制,PEFT 前期也会在 base 与 novel 上联合上升------模型天然会先学好任务级特征;越过断点后,继续调同一组参数才开始"特化"到可见类别,novel 性能不可恢复地退化。

历史地看(附录 H),2014--2019 年"预训练特征 + 线性分类器"本是主流配方(Razavian et al.、Kornblith et al.);2022--2024 年 prompt/adapter 全面取代了线性探测;2025 年 2SFS 让经典配方以 PEFT 形态回归,并成为跨设定统一的底座------完成了一次从"被替代范式"到"统一配方底座"的回归。

研究主线:从问题到结论

图 1(Mermaid 流程图):2SFS 的研究主线------从测量学习动态出发,到两阶段设计,再到固定超参数下的全面验证。

基准/方法设计

2SFS(Two-Stage Few-Shot Adaptation)把固定的迭代预算 m 拆成两段,两个阶段优化不同的参数集

  • 第一阶段(\\alpha \\times m 次迭代):只微调视觉与文本双编码器中全部 LayerNorm 的 scale/shift 参数(约 61k 参数),学习可泛化的任务级特征。选择 LayerNorm 的依据来自断点测量:它的断点来得最晚、第二阶段最稳健,数据-参数比(61k vs LoRA 184k / BitFit 125k)最平衡。
  • 第二阶段((1-\\alpha) \\times m 次迭代)冻结第一阶段参数,训练一个顶层线性分类器。分类器权重直接用第一阶段文本编码器对 base 类的嵌入堆叠初始化。
  • 类别级选择性推理:推理时 base 类嵌入就是分类器矩阵的行(\\mathcal{O}(1) 查表,跳过文本编码器),只有 novel 类才经过适配后的文本编码器------这是既有 prompt/adapter 方法都不具备的新能力。

超参数只在 ImageNet + ViT-B/16 + k{=}16 上选取一次:M{=}300\\alpha{=}0.6,之后全部固定。

图 2:2SFS 在 all-to-all 与 base-to-novel 两种设定下均表现优异,而设定特化的 SOTA 方法(CLIP-LoRA、MMA)跨设定显著退化。

图 3:FGVC-Aircraft 上三种 PEFT 的学习动态------粉色竖线为断点,左侧 base/novel 联合上升(任务级特征),之后 base 特化、novel 不可恢复地退化。

图 4:2SFS 总览------给定迭代预算 m,Stage 1 调 LayerNorm 学任务级特征,Stage 2 用 base 类文本嵌入初始化并训练线性分类器;推理时仅 novel 类经过文本编码器。

分类全景

图 5(Mermaid 流程图):PEFT 三大流派分类全景------2SFS 的 Stage 1 属于选择性微调(LayerNorm),Stage 2 是对 adapter 与 prompt 的替代。

方法细节

断点现象(核心实证):以 CLIP ViT-B/16 在 DTD 与 FGVC-Aircraft 上做 k{=}16 shots 训练,用 8000 步预算测量 LayerNorm、LoRA、BitFit 三种 PEFT 的 held-out 动态,发现一致的"两阶段"结构:

  1. 第一阶段 :base 与 novel 精度联合上升------模型在学任务级特征(这是最反直觉的发现,没有任何显式机制推动);
  2. 断点之后:base 继续提升,novel 开始退化------模型在"特化"可见类别。这不是过拟合(评测都在 held-out 数据上),而是对下游任务整体有害的知识覆盖。

两阶段损失 :第一阶段沿用标准 softmax 交叉熵(\\mathcal{L}*{\\omega* {LN}},只在 base 类上计算);第二阶段冻结 \\phi_{LN}\^* 后优化分类器 \\mathcal{L}*{\\Phi* {\\mathcal{C}*{base}}}。预测函数为 \\arg\\max* {c \\in \\mathcal{C}*{all}} \\langle f_V\^{\\phi*{LN}\^* }(x),\\ \\phi_c\^*\\rangle,其中 base 类的 \\phi_c\^* 直接取分类器行、novel 类由第一阶段文本编码器即时嵌入(见附录 A 的公式推导与实现细节)。

断点现象的普遍性(附录 A):UCF-101、EuroSAT 上三种 PEFT 的断点结构完全复现(EuroSAT 尤其尖锐);SUN397、ImageNet 上由于类别空间大、样本多,LayerNorm 达到"饱和"而非断裂;Food-101、Oxford Pets 则是失败案例------base 与 novel 同时断裂,单一 \\alpha 救不回来(对应图 8、图 9)。

实验设计与结果

评测协议:11 个数据集(ImageNet、Caltech101、SUN397、DTD、FGVC-Aircraft、Oxford Pets/Flowers、Stanford Cars、Food-101、EuroSAT、UCF-101,CoCoOp 划分);两种设定------base-to-novel(对比 8 个方法)与 all-to-all(对比 12 个方法);统一 k{=}16 shots、AdamW(lr 2{\\times}10\^{-4})、batch 32、单一模板 "a photo of a {}"、3 次运行平均。

base-to-novel 平均结果(ViT-B/16,k{=}16

方法 Base Novel HM
CLIP (zero-shot) 69.34 74.22 71.70
CoOp 82.69 63.22 71.66
CoCoOp 80.47 71.69 75.83
MaPLe 82.28 75.14 78.55
ProGrad 82.48 70.75 76.16
KgCoOp 80.73 73.60 77.00
CLIP-LoRA 85.32 70.63 77.28
MMA 83.20 76.80 79.87
2SFS (Ours) 85.55 75.48 80.20

2SFS 在 11 个数据集中 8 个 HM 第一(Stanford Cars +2.76、FGVC-Aircraft +2.30 优势最大),平均 HM 80.20 全面超过 MMA(79.87)与 CLIP-LoRA(77.28)。注意 CLIP-LoRA 的 Novel 只有 70.63------单阶段适配确实牺牲了未见类别泛化。

图 6:\\alpha 扫描(ImageNet 验证集,步长 0.1)------最优值 \\alpha{=}0.6 前后性能均下降,与断点分析预测一致。

all-to-all 平均精度(附录 B 全表)

Backbone 2SFS CLIP-LoRA MMA 最佳其他
ViT-B/16 82.9 83.0 81.0 PLOT++ 82.1
ViT-B/32 79.2 78.9 76.7 TIP-Adapter-F 77.1
ViT-L/14 87.1 86.9 84.4 LP++ 85.2

两阶段消融 :相对"只调 LayerNorm"(无 Stage 2),Stanford Cars / FGVC-Aircraft 提升 \>+10\\% ,SUN397 / UCF-101 / DTD / Flowers 再 +4\\%跨设定稳定性是最大差异化:CLIP-LoRA 在 base-to-novel 落后 2.9 个点,MMA 在 all-to-all 三个骨干上分别落后 +1.9\\%/+2.5\\%/+2.7\\%

图 7:11 个数据集上的两阶段消融------绝对精度提升普遍显著,仅 Pets / Food-101 轻微退化。

图 8:UCF-101 学习动态------断点结构完全复现,证明两阶段现象不限于 DTD / FGVC-Aircraft。

图 9:Food-101 失败案例------base 与 novel 在断点处同时断裂,说明单一 \\alpha 在此类数据集上不理想。

鲁棒性(附录 D)M 从 100 扫到 500 最优仍是 300(HM 73.86 / 74.20 / 74.12);k{=}{4,8} shots 下 2SFS 全面胜过 MMA,4-shot 时差距最大(ViT-B/16 +3.98、ViT-B/32 +4.45 HM)------LayerNorm 仅 61k 参数 vs MMA 674k,越极端的低数据越占优;2SFS-LoRA 变体(\\alpha{=}0.3)novel 平均 +3.02\\%、33 项组合 32 项胜 CLIP-LoRA,CoOp 包装进两阶段后 HM +3.56

结果对比总结

图 10(Mermaid 流程图):结果对比总结------2SFS 在两种设定、三个骨干上以固定超参数全面胜出。

关键发现

  1. PEFT 学习动态天然两阶段:3 种 PEFT(LayerNorm / LoRA / BitFit)在多个数据集上呈现一致的断点结构,前期 base+novel 联合上升、后期 base 特化------且无需任何 ad-hoc 跨模态机制。
  2. 平均 HM 80.20:base-to-novel 平均调和均值超过全部 8 个基线(MMA 79.87、MaPLe 78.55、CLIP-LoRA 77.28),8/11 数据集第一。
  3. 两阶段消融 \>+10\\%:Stanford Cars 与 FGVC-Aircraft 上相对单阶段提升超过 10 个百分点,SUN397/UCF-101/DTD/Flowers 再 +4\\%
  4. 跨设定稳定:all-to-all 三骨干平均 82.9 / 79.2 / 87.1 全部第一或并列第一,而 CLIP-LoRA 与 MMA 跨设定显著退化(+2.9\\% / +1.9\\%--+2.7\\% 差距)。
  5. 低数据更优:4-shot 时对 MMA 的领先扩大到 +3.98\\%(B/16)与 +4.45\\%(B/32)HM------61k 参数比 MMA 的 674k 更耐数据稀缺。
  6. 类别级选择性推理:base 类嵌入 \\mathcal{O}(1) 查表、跳过文本编码器,这是 prompt/adapter 方法没有的推理期红利。

局限性

  • 固定 \\alpha 非最优:Oxford Pets / Food-101 上 base 与 novel 同时断裂,需要逐数据集定制 \\alphaM,但作者为贴近真实 FSA 场景刻意不做逐数据集调参(EuroSAT 用 batch 1 后 HM 可从 79.29 回升到 84.32,验证了假设)。
  • 任务类型受限:仅覆盖下游分类;语义分割(空间)、动作识别(时序)可能需要不同的适配策略。
  • 切换时机依赖人工:何时从特征提取切换到分类器由 \\alpha 决定,缺少免验证集的动态停止准则(作者建议引入 Mahsereci et al. 的 early-stopping 思路)。
  • 评估范围有限:3 个 CLIP 骨干、11 个数据集、分类任务------对其他(或未来)PEFT 策略与模型的扩展性尚未验证。

常见问题(FAQ)

2SFS 相比 prompt 调优和 adapter 方法本质区别是什么?

既有方法在"怎么调参数"上做文章;2SFS 先测量"训练过程中发生了什么",发现断点结构后把预算拆成特征提取(LayerNorm)与分类(线性分类器)两段,在断点处切换参数集而非继续调同一组参数。

为什么只微调 LayerNorm 而不是 LoRA 或 BitFit?

断点测量显示 LayerNorm 断点来得最晚、第二阶段最稳健,且约 61k 参数(vs LoRA 184k / BitFit 125k)的数据-参数比最平衡,更适合少样本场景;附录还验证了两阶段设计对 LoRA(\\alpha{=}0.3)与 prompt 方法同样有效。

断点后继续训练就是过拟合吗?

不是。评测都在 held-out 数据上进行:断点后 base 继续上升、novel 开始退化,属于对可见类别的"特化"而非记忆训练样本------这正是两阶段设计的动机。

2SFS 在推理时如何做到更省算力?

类别级选择性推理:base 类嵌入就是分类器矩阵的行,直接 \\mathcal{O}(1) 查表、跳过文本编码器;只有 novel 类才需要经过适配后的文本编码器即时嵌入。

固定超参数是否公平?

超参数只在 ImageNet + ViT-B/16 + k{=}16 上选取一次(M{=}300\\alpha{=}0.6),之后跨 11 数据集、2 设定、3 骨干全部固定;对比方法则使用各自论文中逐数据集调优后的结果。

论文代码在哪里?

官方代码开源在 https://github.com/FarinaMatteo/rethinking_fewshot_vlms ,复现了全部实验(含 4/8/16 shots 与 LoRA 变体)。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
带娃的IT创业者2 个月前
深度解析:当 MLX 遇上视觉语言模型,Mac 本地推理的新范式
人工智能·macos·语言模型·视觉语言模型·apple silicon·mlx·mac本地推理
_Meilinger_2 个月前
碎片笔记|样本少不等于欠拟合:从 Few-shot 任务理解过拟合与欠拟合
机器学习基础·少样本学习·过拟合·欠拟合·模型泛化·高方差·bias-variance
这是谁的博客?3 个月前
多模态大模型技术深度解析:从 CLIP 到 LLaVA 的视觉语言融合原理
ai·transformer·多模态·clip·视觉语言模型·vit·llava
带娃的IT创业者3 个月前
MLX-VLM:在Mac上解锁视觉语言模型的本地推理与微调能力
人工智能·macos·语言模型·mac·视觉语言模型·mlx·本地推理
这张生成的图像能检测吗3 个月前
(论文速读)基于大语言模型的类人单次故障诊断
人工智能·目标检测·机器学习·故障诊断·少样本学习·自然语言模型
dax eursir4 个月前
Qwen3-VL-2B vs BLIP-2:轻量视觉模型部署效率对比分析
qwen·视觉语言模型·多模态ai·ocr识别
这张生成的图像能检测吗5 个月前
(论文速读)Mono3DVLT:基于单眼视频的3D视觉语言跟踪
深度学习·计算机视觉·视觉语言模型·3d目标追踪·单目视频
风巽·剑染春水5 个月前
【技术追踪】具有多图像视觉能力的医学大视觉语言模型(MICCAI-2025)
人工智能·语言模型·自然语言处理·视觉语言模型·医学影像
这张生成的图像能检测吗7 个月前
(论文速读)Unified Modality Separation: 无监督领域自适应的视觉语言框架
人工智能·机器学习·无监督学习·视觉语言模型·域自适应·跨模态融合·模态差异