摘要:
通用视觉基础模型(DINOv3 等)直接用于生物显微、遥感、野生动物监测、医学影像等专业领域时,因域偏移性能大幅下滑;传统适配方案存在致命缺陷:监督微调仅用源域标签,全量微调主干,域偏移下泛化差; 无监督域自适应额外引入目标域无标注数据,仍任务导向,泛化提升有限; 纯自监督表征适配无标签、无元数据,易捕获采集噪声等虚假特征;
文章提出FINO(FIne-tuning with NO labels) 统一元数据驱动无标签表征适配框架,主干网络全程不使用任何任务标签,仅靠数据集自带免费元数据做弱监督自监督适配,最后冻结主干,仅训练轻量化线性 / 注意力探针完成下游评估。
这里的元数据(metadata)指的是数据集自带的、无需额外标注的采集信息(抗体、拍摄国家、时间、患者年龄等),属于免费弱监督信号;
背景:
视觉基础模型提供了很强的通用表示能力,然而对一些特殊的领域,它的能力显著下降,解决这个问题的一种主要方法就是微调,但这需要大量的特定领域的标签数据,而这是十分稀缺的。然而,一些数据集自带的,不需要额外花费的元数据却被浪费,于是文章提出了这个FINO(FIne tuning with NO labels)框架,来使用元数据得到弱监督而不必刚需大量的特定领域的标签数据。
相关工作主要包含三大方向:一是以 DINO 为代表的自监督表征学习,无需标注便可习得通用视觉特征,但迁移至生物、遥感、医学科研影像时,极易受批次效应、成像伪影干扰,模型容易学习虚假关联捷径,域外泛化能力较差;二是域泛化与域自适应方法,依托域标签通过梯度反转、特征对齐、事后特征校正等手段剔除域偏移噪声,但这类方法只能适配少量离散域,一刀切抹去所有域信息会丢失有效语义,也无法兼容连续型元数据;三是各类场景下依托元数据辅助训练的方案,大多局限于单一模态设计、扩展性弱,部分方法推理阶段还必须携带元数据,实用性受限。
现有方法普遍无法兼顾细粒度离散 + 连续混合元数据,只会单纯删除干扰信息或是片面利用元信息,且大多依赖下游任务标注、难以跨领域通用。本文 FINO 框架以 DINO 为基础,无需下游标签,将元数据划分为有效因子与干扰因子,分别通过正向梯度对齐、梯度反转抑制双向约束主干表征;训练借助元数据优化主干权重,推理舍弃所有元分支,一套框架适配多类科研影像,在跨域鲁棒性上全面优于各类基线方法。
方法:
FINO基于经典的DINO自监督改在而来,在原有的的学生-教师双分支网络上加入多个监督分支,来利用元数据的监督信号。
FINO为每个元数据都单独设立损失函数,将元数据按照信息是否有用分为信息元数据,干扰元数据(人来分);按照数据类别分为离散型和连续型。信息元数据正常使用监督信号,干扰元数据通过梯度反转抑制、抹除批次伪影带来的捷径 。而连续型和离散型分别使用MLP 回归 L2 损失 和原型对比 InfoNCE 损失;
基本来说,FINO这篇文章的最主要创新点已经介绍完了,整体来说:就是相当于学生模型输出被教师模型和新加的预测头使用 教师用来和自己的输出计算损失,其余的预测头使用这个作为输入 然后输出和元数据计算损失。
此外的都是一些修修补补的工作,比如:离散元损失、连续元损失的数值范围、梯度变化规律完全不一样 ,如果直接相加一起训练,会导致训练不稳定、效果变差,于是当同时启用多条元数据分支训练时,对每条分支的梯度乘以一个经过 EMA 滑动平均平滑的缩放系数,均衡各分支梯度大小。
实验:
主表对比囊括四类方法:领域专属 SOTA 模型、从头训练 ViT、监督微调、传统域泛化算法(DANN、CORAL、Group-DRO)、纯自监督 DINO 适配。
与多种微调方式对比:

迁移学习效果:

消融实验:

