【读点论文】Efficient Universal Perception Encoder

Efficient Universal Perception Encoder

  • 在智能边缘设备上运行人工智能模型可以解锁多种用户体验,但由于计算有限且需要同时处理多个任务,因此带来了挑战。这需要一个尺寸小但功能强大且多功能的视觉编码器。我们提出了我们的方法,高效通用感知编码器(EUPE),它为不同的下游任务提供了推理效率和普遍良好的表示。我们通过从多个领域专家基础视觉编码器中提炼来实现这一目标。与之前直接从多个教师缩小到高效编码器的凝聚方法不同,我们展示了首先扩展到大型代理教师,然后从该单个教师中提取的重要性。实验表明,EUPE 在不同的任务域上实现了与相同规模的单个领域专家相当或更好的性能,并且也优于以前的凝聚编码器。我们发布了完整的 EUPE 模型系列和代码以促进未来的研究。
  • Meta 团队提出EUPE(高效通用感知编码器) ,针对边缘设备算力有限、需多任务适配的痛点,创新采用**先扩容(训练 1.9B 参数大型代理教师)再蒸馏(缩放到 < 100M 高效学生)*的三阶段蒸馏策略,整合 PEcore、PElang、DINOv3 三类领域专家知识;模型覆盖 ViT、ConvNext 多尺寸架构,在图像理解、密集预测、视觉语言建模三大任务上*持平或超越同规模领域专家,显著优于 RADIO、DUNE 等聚合模型,同时开源模型权重与代码,适配各类边缘算力场景。
  • 摒弃直接多教师蒸馏的方案,采用 "大容量代理教师融合多领域知识,再蒸馏到高效学生" 的策略,解决高效模型容量不足、难以吸收多元知识的问题。全程:无新增大算力任务,只用蒸馏

Introduction

  • 基础视觉编码器在架构和训练配方方面都取得了实质性进展。流行的架构包括卷积神经网络和视觉 Transformer。它们通过完全监督,文本-图像对的弱监督 或自我监督.它们提供了强大的特征表示,用于迁移到下游视觉任务。

  • 与此同时,下游任务也在快速发展,经典的任务包括图像理解,如图像分类等和图像检索,以及密集预测,例如分割,深度和关键点通信。最近,视觉语言建模任务越来越受欢迎。将语言模型与视觉编码器相连接已成为视觉问答任务的通用范例。将这些任务大致分为四个类别:OCR、以视觉为中心、知识和常规。

  • 单个基础视觉编码器通常在一个或两个任务领域表现出色。例如,在文本-图像对上训练的编码器,如CLIP,SigLIP ; SigLIP 2和PEcore 在图像理解和视觉语言建模方面表现出强大的性能,然而,他们在密集预测任务中的表现往往低于预期的和SAM 擅长密集预测,但缺乏令人满意的视觉语言能力。因此,下游应用需要仔细选择特定编码器以避免性能下降。此外,对于涉及多个域的用例,我们要么需要牺牲计算效率以包括多个编码器,要么接受由于依赖于特定编码器而造成的性能折衷。

  • 为了解决这个问题,PE 将对齐调整应用于中间层,从而产生了三种分别擅长图像理解、密集预测和视觉语言建模的变体。然而,这仍然提出了一个问题:我们能否将多个领域的能力聚集到一个编码器中?RADIO 表明,这可以通过从多个教师模型中提取无标签知识来实现,其中教师是各个领域的专家。虽然它适用于大型编码器(例如,超过300 M的参数),但我们在将其应用于高效骨干时观察到明显的局限性

  • 如图1左图所示,RADIOv2.5-B 在密集预测和VLM任务上与领域专家相比存在显著差距。另一方面,高效的编码器对于边缘设备上的个人超级智能至关重要。在其上运行的模型需要处理有限的计算资源,并且通常部署在多任务设置中。因此,开发高效通用编码器的配方是为边缘设备提供多功能AI体验的基础

    • 图 1 将我们的蒸馏配方 (EUPE) 应用于 ViT-B,提供了一个平衡良好的通用编码器,与 ViT-B 领域专家和现有的聚合 ViT-B 相比,该编码器在不同的任务领域都表现出色。左:三个任务域的基准性能,越高越好。 IN1k-ZS 和 IN1k-KNN 是 ImageNet1k 上的图像理解基准。 TextVQA、SQA、Realworld、GQA、POPE 是视觉语言建模任务。 SPair 和 ADE20k 是密集预测任务。我们省略了没有文本编码器的模型(PEspatial-B、DINOv3-ViT-B、DUNE-B)的 IN1k-ZS 分数和没有类标记输出的模型(PEspatial-B)的 IN1k-KNN 分数。右图:通过 PCA 投影到 RGB 空间来可视化 EUPE-ViT-B 的特征。

  • 在这项工作中,我们研究了产生高效通用感知编码器的预训练方法。我们发现,在高效编码器上实现通用能力的原则是先放大,然后缩小。由于编码器没有足够的能力直接从多个基础教师中吸收各种特征表示,并将其转化为一个通用的表示,因此,像以前的方法那样直接从多个基础教师中缩减不能得到令人满意的结果 。我们提出了代理教师的概念,它是一个具有足够能力的重模型,可以统一来自多个基础教师的知识。代理教师然后将学习到的知识传输到编码器中,并将其转换为一个通用的表示通过蒸馏将通用知识转化为高效学生。为了充分利用代理教师的能力,我们通过更长的固定分辨率阶段和更短的多分辨率阶段从学生中提取学生,以适应不同分辨率的下游任务。将此配方应用于高效编码器,从而产生了我们的高效通用感知编码器(EUPE)系列。

  • 实验表明,所提出的放大和缩小蒸馏管道在没有额外的花里胡哨的情况下,可以产生与相同大小的单个领域专家相当或优于相同大小的单个领域专家的高效通用编码器。例如,在图1左所示的ViT-B架构下,我们的EUPE与PEcore 等图像理解专家相当,SigLIP 2 和DINOv 3分别对ImageNet-zeroshot和ImageNet-knn指标进行了研究。

  • 它在SPair 和ADE 20 k 上的表现甚至超过了密集预测专家DINOv 3 。与视觉语言建模专家PEcore和SigLIP 2 相比,它在RealworldQA xAI上的表现明显更好。GQA,同时保持TextVQA 、SQA 和POPE 的标准性能。此外,它优于现有的凝聚方法,如RADIO 和DUNE 图1右通过PCA投影可视化了EUPE-ViT-B的特征。定性地说,该特征可以同时捕获语义一致性(行1&2)、细粒度(行3)、复杂空间结构(行4)和文本感知(行5&6)。总而言之,我们的主要贡献包括:

    • 一个简单的放大和缩小蒸馏配方,产生强大有效的通用感知编码器,优于现有的凝聚方法。
    • 一系列高效的模型检查点,在不同的计算预算下,针对不同的设备上用例,在各种下游任务上具有与领域专家编码器同等或更好的性能。
    • 对蒸馏配方的全面研究,分享有关训练阶段,教师和其他超参数选择的见解。
  • 边缘设备部署困境 :智能边缘设备算力、存储有限,需同时处理图像分类、分割、视觉问答等多任务,亟需小体积、强表征、多任务均衡的视觉编码器。单领域专家局限

    • CLIP/SigLIP2/PEcore:擅长图像理解、视觉语言建模,密集预测(分割 / 深度估计)性能弱
    • DINOv3/SAM:擅长密集预测,视觉语言能力不足
  • 现有聚合模型缺陷 :RADIO、DUNE 等直接从多领域专家蒸馏高效编码器,小参数量下无法融合多领域知识,性能远低于领域专家,无法适配边缘场景。

阶段 核心操作 关键参数 核心作用
阶段 1 多教师联合蒸馏 1.9B 参数代理模型,教师:PEcore-G、PElang-G、DINOv3-H+ 融合多领域知识,训练通用大型代理教师
阶段 2 固定分辨率蒸馏 256×256 分辨率,<100M 高效学生,390k 迭代 长周期训练,高效模型快速学习通用表征
阶段 3 多分辨率微调 256/384/512 多尺度,100k 迭代 适配下游多尺度任务,提升空间鲁棒性
  • 基础视觉编码器。现代视觉基础模型(VFM)利用各种预训练目标来捕获特定的图像属性。自监督模型,如MAE,DINOv1和DINOv2,提供了出色的结构和几何描述符。最近引入的7B参数DINOv3 进一步利用Gram锚定在大规模训练期间保持密集特征局部性。同时,像CLIP和SigLIP 2 这样的对比模型将视觉特征与语言对齐,尽管通常以空间粒度为代价。其他方法,例如AIMv2 ,引入了多模态自回归目标来统一这些能力,而SILC 将对比学习与局部自蒸馏相结合。

  • 另一方面,Segment Anything Model(SAM)通过对海量分割数据集进行训练,实现了前所未有的零样本分割。最近的突破,如感知编码器(PEcore),通过证明高质量的一般特征存在于单个对比训练网络的中间层中,挑战了这些目标相互排斥的概念。此外,PElang 通过语言对齐这些内部特征来扩展多模态LLM。然而,这些编码器通常是有限任务领域的专家,他们的域外性能低于预期。我们的工作EUPE通过将多个专家教师的知识提取到一个单一的通用学生编码器中来解决这个问题

  • 视觉编码器的知识蒸馏。知识蒸馏(KD)最初由辛顿提出,提供了一个通用框架,用于训练紧凑的学生模型来模仿更大的教师。这个基本概念已经被许多单一教师蒸馏变体扩展。教师助理知识蒸馏(TAKD)通过引入中等规模的"教师助理"模型,弥合了教师和学生之间的巨大能力差距 。其他作品专注于从强大的基础模型中提取特定能力:EfficientSAM 利用掩码图像预训练将SAM的分割能力提取到一个更小的编码器中,和PE提取了感知编码器中间层中发现的强空间特征。还开发了在提取过程中保留特定特征属性的技术,例如DINOv3 中的Gram锚定方法,该方法在整个训练过程中保持了密集的局部特征的质量

  • 我们的工作建立在简单而有效的原则之上,但将其扩展到多教师环境。我们有意保持每个教师的蒸馏流程尽可能简单,以专注于将来自多个不同专家的知识结合成小型高效学生的挑战。

  • 聚集和多教师方法。为了同时受益于多个强编码器,一些工作探索了组合多个来源知识的理论基础。Formont 提出了一个任务不可知的信息理论框架,用于基于多数投票目标的多教师蒸馏,提供了一个系统的探索框架("ComBo"),以识别和联合收割机从不同的基础模型中最相关的任务特征。另一个方向是多教师蒸馏。UNIC 引入了"投影机阶梯"和"教师下降",以防止任何单一教师主导梯度,而其继任者DUNE 通过异质共蒸馏成功地融合了2D视觉和3D感知教师。

  • AM-RADIO 介绍了一种用于多教师蒸馏的聚合框架,该框架通过逐步合并网络深层中的类似图像令牌,从CLIP,DINOv 2和SAM中创建统一的学生;其继任者RADIOv2.5 进一步解决了解决模式转变和教师失衡问题。然而,当涉及到一个高效的计算场景,如边缘设备上,这些方法是没有竞争力的领域专家。我们的工作EUPE发现,保持缺失的部分是放大到代理模型之前,直接从多个老师缩小

  • 特征匹配:添加 2 层 MLP 适配器,匹配学生与教师特征维度;2D 插值对齐空间分辨率。

  • 损失函数 :类别 token 用余弦相似度损失 ,patch token 用0.9 余弦损失 + 0.1 平滑 L1 损失,总损失为多教师损失之和。

  • 特征归一化 :训练前固定教师特征均值与方差,避免单教师 / 单 token 主导蒸馏,提升训练稳定性。

  • 三阶段必要性 :仅阶段 2(直接多教师蒸馏)性能最差;阶段 1+2 提升图文能力;阶段 1+3 提升密集预测;三阶段组合实现最优均衡代理模型规模 :7B 代理模型性能优于 1.9B,但蒸馏到 ViT-B 时性能下降,存在容量差距过大问题。

Efficient Universal Perception Encoder

Pipeline Overview

  • 我们提出了一种多级蒸馏管道,其原理是:放大,然后放大,如图2所示。我们在设计中选择了简单性,以证明在缩小规模之前扩大规模的重要性。我们的管道有三个阶段。

    • 图2 多级蒸馏管道(按比例放大→按比例缩小)。在第一阶段,我们从多个基础模型中提炼出一个重型代理模型。对于第 2 阶段,蒸馏从代理模型发生到目标高效编码器。在第 3 阶段,我们以多种分辨率对第 2 阶段模型进行微调。图像金字塔表示多分辨率输入。

  • 第一阶段是多教师蒸馏成一个大的代理模型,例如,1.9B参数。我们选择重模型作为代理,因为它有足够的能力从不同域的各种基础编码器学习普遍良好的表示。输入由标签组成,自由图像,以其本机分辨率并行传递给所有教师。每个教师输出一个类标记和一组补丁标记。同一图像还通过代理模型并输出一个类令牌和补丁令牌。他们与每个教师的令牌进行比较,以计算蒸馏损失。对于教师,我们从每个任务域中选择代表性的基础编码器。PEcore被选为零样本图像分类和检索的领域专家,DINOv3 被选为稠密预测的领域专家。此外,我们发现PElang 是视觉语言建模的关键

  • 第二阶段是从阶段1代理模型到目标高效编码器的固定分辨率蒸馏。我们假设高效编码器从通用代理老师那里学习比直接从不同领域专家那里学习要容易得多,主要是因为高效编码器有效地将多个老师的知识统一为通用表示的能力较低。在这个阶段,我们保持图像分辨率固定在256 × 256,以便训练步骤在计算上是有效的,并且我们可以提供更长的学习时间表。

  • 第三阶段是从阶段1代理模型到目标高效编码器的多分辨率微调。学生编码器从第2阶段提取的检查点初始化。我们不将相同的图像传递给教师和学生,而是将图像的大小调整几次,使其成为一个金字塔,并让教师和学生独立地从金字塔中随机选择一个比例。因此,学生可以在不同的粒度上从教师的表示中学习。该阶段被设计为适应下游的各种分辨率任务

    • 图3 每师蒸馏流程。雪花符号表示冻结参数,火焰符号表示可训练参数。如果学生的输出和教师的输出具有不同的空间维度,则将 2D 插值应用于补丁标记。

  • 在所有阶段中,从教师到学生的提取遵循与图3中相同的流程。i)是由i参数化的第i个教师编码器,其中在阶段1中i可以大于1。给定学生的输入xS和教师的输入xTi,它们各自输出类令牌y c和补丁令牌y p:

    • (ySc,ySp)=S(xS;θ),ySc∈Rds,ySp∈RNs∗ds(yTic,yTip)=Ti(xTi,ϕi),yTic∈RdTi,yTip∈RNTi∗dTi (y^c_S,y^p_S)=S(x_S;\theta),y^c_S\in \R^{d_s},y^p_S\in \R^{N_s*d_s}\\ (y^c_{T_i},y^p_{T_i})=T_i(x_{T_i},\phi_i),y^c_{T_i}\in\R^{d_{T_i}},y^p_{T_i}\in\R^{N_{T_i}*d_{T_i}} (ySc,ySp)=S(xS;θ),ySc∈Rds,ySp∈RNs∗ds(yTic,yTip)=Ti(xTi,ϕi),yTic∈RdTi,yTip∈RNTi∗dTi

    • 其中dS,NS,dTi,NTi分别是学生和教师的特征维度和补丁标记的数量。为了连接学生和第i个教师的输出,我们将适配器头模块附加到学生输出以匹配特征维度。具体地,令Hc i(·; Hp i)和Hp i(·; Hp i)分别是由Hp i和Hp i参数化的第i个教师的类令牌和补丁令牌的适配器头,则第i个教师的适配类令牌和补丁令牌为:

    • zTic=Hic(ySc;ψic),zTic∈RdTizTip=Hip(ySp;ψip),zTip∈RNS×dTi,(3) z^c_{T_i} = H^c_i (y^c_S ; ψ^c_i ), z^c_{Ti} ∈ R^{d_{T_i}} \\ z^p_{T_i} = H^p_i (y^p_S ; ψ^p_i ), z^p_{T_i} ∈ R^{N_S×d_{T_i}}, (3) zTic=Hic(ySc;ψic),zTic∈RdTizTip=Hip(ySp;ψip),zTip∈RNS×dTi,(3)

  • 为了匹配z p Ti和y p Ti之间的空间分辨率,我们将较小的一个2D插值到较大的尺寸中,因此它们将具有相同的形状max(NS,NTi)× dTi。最后,学生和第i个教师之间的蒸馏损失Li根据学生的自适应令牌z c Ti,z p Ti和教师的归一化令牌<ycTi,y<y c Ti,y <ycTi,y<p Ti计算:

    • Li=Lci(zcTi,y¯cTi)+Lpi(zpTi,y¯pTi)(4) Li = L c i (z c Ti , y¯ c Ti ) + L p i (z p Ti , y¯ p Ti ) (4) Li=Lci(zcTi,y¯cTi)+Lpi(zpTi,y¯pTi)(4)

    • 其中L c i,Lp i分别是类令牌丢失和补丁令牌丢失,我们将在下面介绍。在训练期间,θ,c i,p i是可学习的参数,i被冻结。

Loss

  • 为了简单起见,我们对所有阶段使用相同的损失公式。根据AM-RADIO ,类令牌损失是余弦相似性损失,补丁令牌损失是余弦相似性损失和平滑L1损失的组合:

    • Lci(zcTi,y¯cTi)=Lcos(zcTi,y¯cTi)Lpi(zpTi,y¯pTi)=αLcos(zpTi,y¯pTi)+βLsmooth−L1(zpTi,y¯pTi)(5) L c i (z c Ti , y¯ c Ti ) = Lcos(z c Ti , y¯ c Ti ) L p i (z p Ti , y¯ p Ti ) = αLcos(z p Ti , y¯ p Ti ) + βLsmooth−L1(z p Ti , y¯ p Ti ) (5) Lci(zcTi,y¯cTi)=Lcos(zcTi,y¯cTi)Lpi(zpTi,y¯pTi)=αLcos(zpTi,y¯pTi)+βLsmooth−L1(zpTi,y¯pTi)(5)

    • 其中α = 0.9,β = 0.1是损失重量。总蒸馏损失L是所有教师损失的总和:

    • L=XiLci(zcTi,y¯cTi)+Lpi(zpTi,y¯pTi)(6) L = X i L c i (z c Ti , y¯ c Ti ) + L p i (z p Ti , y¯ p Ti ) (6) L=XiLci(zcTi,y¯cTi)+Lpi(zpTi,y¯pTi)(6)

    • 对于第一阶段,i的范围是所有教师的指数。对于第二阶段和第三阶段,只有一个教师(代理模型)。

Feature Normalization

  • 我们在蒸馏过程中对教师输出进行归一化,即y c Ti → y <c Ti,y p Ti → y <p Ti。这有助于稳定特征蒸馏,特别是在阶段1中。正如UNIC 所指出的那样,教师输出的类标记和补丁标记可能具有非常不同的特征均值范数和标准差。也非常多样化。没有特征归一化的提取将导致一种类型的令牌占主导地位与RADIOv2.5 中使用的复杂PHI-S归一化不同,我们选择简单地减去平均值并除以标准差(std),这被证明是有效的。我们通过运行每个教师通过一小批训练数据来计算归一化统计量,然后固定其余训练的均值和标准差。这也不同于UNIC 它在蒸馏过程中使用指数移动平均值实时计算统计数据。实时计算需要在每一步收集所有GPU上的特征,这会消耗更多内存,并且难以在多个节点上扩展批量大小。

Data

  • 对于所有阶段,我们在相同的DINOv 3数据集上进行训练,它由LVD-1689 M组成,平衡覆盖了Web上出现的所有视觉概念和高质量的公共数据集,如ImageNet 1k 。我们还采用了DINOv 3中相同的数据采样策略,使用来自ImageNet 1 k的同质批次数据和来自LVD1689 M的异质批次数据进行训练。。从ImageNet 1 k采样的概率被设置为10%。

Experiments

  • 在本节中,我们通过将EUPE与现有的高效视觉编码器在各种计算机视觉任务上进行比较来对EUPE进行基准测试。为了比较它们在多个任务上的泛化能力,我们将所有编码器保持冻结状态,并在没有适配器头的情况下单独使用它们的表示。我们的测试基准由三个主流视觉任务域组成。一个是图像理解,以测试编码器的全局表示,包括ImageNet 1 k上的零样本分类(IN 1 k-ZS)和ImageNet 1 k上的KNN分类另一个是密集预测,以衡量他们的空间理解能力,包括语义分割(AKE 20 k ),单目深度估计(NYUv 2 ),以及语义关键点对应估计(SPair )。最后,我们还测试了视觉语言建模任务。我们在插入编码器的情况下训练了Llava模型。我们遵循Cambrian提出的定义-1的四种VLM基准。我们从每种类型中选择一个或两个代表性的基准,即OCR(TextVQA ),知识(SQA ),以视觉为中心(Realworld xAI和POPE )和一般(GQA和MME )。我们在补充材料中分享了有关设置的更多细节。

Implementation Details

  • 在第1阶段,我们选择基础教师编码器为PEcore-G(1.9B),PElang-G(1.7B),和DINOv 3 H+(840 M)。我们遵循AM-Radio论文系列中描述的配方。我们以本地分辨率运行所有教师(PEcore/lang为448,DINOv 3-H+为256)在训练过程中。我们使用4个寄存器令牌训练1.9B参数代理模型。我们通过测量教师输出来对教师输出进行粗略居中在训练前的500次迭代中,每个坐标的均值和方差。我们使用标准的ImageNet常量进行输入的均值-标准化。

  • 在第二阶段,我们使用256 × 256的固定分辨率、8192的批量大小、余弦学习率计划、2e −5的基本学习率和1 e −4的权重衰减进行390 k次迭代。我们使用随机调整大小的裁剪、随机水平翻转、颜色抖动、高斯模糊和随机日光化来增强输入图像。对于高效的学生编码器,我们选择具有小于100 M参数的主干。ViT家族包括ViT-B(86 M)、ViT-S(21 M)和ViT-T(6 M)。CNN家族包括ConvNext-Base(89 M)、ConvNext-Small(50 M)和ConvNext-Tiny(29 M)。

  • 在第三阶段,我们使用三个尺度(即256、384和512)构建图像金字塔。所有其他数据增强步骤与第二阶段相同。学生和教师在每次迭代中独立地从金字塔中随机选择一个尺度。我们在微调中选择了较短的学习时间表,批量大小为4096,10万次迭代的基本学习率为1e−5

  • 对于所有适配器头,我们采用了一个简单的2层MLP设计,从一个无偏置的线性投影开始,然后是LayerNorm和GELU,最后是另一个无偏置的线性投影。隐藏维度在第1阶段是1536,在第2和第3阶段是3072。在需要空间对齐的地方,我们使用PyTorch内置的双三次插值模式来调整补丁令牌的大小。

Comparison with SOTA

  • 我们将我们的模型与SOTA领域专家和以前的凝聚编码器在我们的测试床上进行比较。我们专注于高效的架构,并确定所有方法最常见的高效骨干是ViT-B。我们对EUPE-ViT-B和其他方法进行了基准测试,并在表1和图1中报告了性能。

    • 表 1 与代表性领域专家和凝聚编码器在图像理解、VLM 和密集预测基准方面的比较。最佳结果以粗体表示。括号中的数字表示与最佳领域专家的差距。 "no txt"表示没有文本编码器。 "no cls"表示没有类标记输出。 *与 结果的差异是由于仅对没有适配器头的编码器部分进行了基准测试。

  • 总的来说,我们的EUPE-ViT-B是最通用的可转移编码器,与该基准的最强模型相比,在图像理解,密集预测和视觉语言建模的每个基准上都具有同等甚至更好的性能。与凝聚方法相比,它在所有VLM任务和大多数密集预测任务上的性能都超过了RADIOv 2.5-B和DUNE-B B,与DUNE只有很小的差距。NYUv 2上的B。与领域专家相比,它在ImageNet 1 k上的图像理解方面表现出色,在ADE 20 k上优于密集预测专家(DINOv 3-ViT-B),在Realworld、POPE和GQA上优于VLM专家(SigLIP 2-B和PEcore-B)。在其他基准测试中,如NYUv 2、SQA、TextVQA和MMEp,它与相应领域专家的差距很小。

Ablation Studies

  • 我们在下面详细介绍了我们的关键消融研究。关于数据混合,损失权重和代理模型大小的进一步实验在补充材料中提供。除非另有说明,否则所有消融都使用ViT-B架构。

  • 阶段的必要性。表2验证了所有三个阶段都有助于互补增益。(直接将多教师蒸馏成高效学生)产生较弱的VLM性能,特别是在OCR上,并且也产生较差的密集预测性能。添加阶段1显著改善了视觉语言建模任务,如TextVQA和Realworld,但这种设置仍然落后于密集任务的完整管道。阶段1+3变体在阶段1之后执行多分辨率蒸馏。在这种情况下,我们采用与阶段2相同的学习计划。这种设置在密集预测任务上提供了最强的性能,例如SPair(53.3)和NYUv2(0.388),但VLM领域专家的差距很大。此外,多分辨率训练的计算成本很高,我们无法承担很长的时间表。在阶段3中运行一次迭代的时间是阶段2的两倍。因此,我们选择在第2阶段进行长时间的固定分辨率训练,然后在第3阶段进行短时间的多分辨率训练。这种设置通常会提高VLM指标,而不会过多牺牲图像和密集性能,从而实现最佳的整体平衡。

    • 表2 三级管道必要性的消融。 "仅第 2 阶段"意味着从多个教师直接蒸馏到目标高效编码器。最佳结果以粗体表示。

  • 教师基础模型的选择。表3显示,在第1阶段中选择教师模型的正确组合很重要。教师集会影响强调哪些功能。我们从结合PEcore-G和DINOv 3-H+开始,这在图像理解和密集预测任务中显示出有希望的信号。然而,在VLM OCR基准测试上与SOTA性能的差距巨大,然后我们探索在VLM OCR任务上增加另一个强大的专家。SigLIP 2-G本身在所有VLM基准测试上都实现了上级性能,但是当与PEcore-G和DINOv 3-H+结合时,它大大降低了OCR度量。

    • 表 3 第一阶段教师基础编码器选择的消融。作为参考,SOTA 是所有现有视觉编码器中每基准性能最好的。 PEc = PEcore-G。 PEl = PElang-G。 S2 = SigLIP2-G。 Dv3 = DINOv3-H+。最佳结果以粗体显示。

  • 这表明SigLIP 2的特性可能与其他教师不兼容。我们的假设是,同时组合PEcore-G和SigLIP 2-G这两种CLIP风格的模型是没有帮助的。PEelang-G是通过与语言模型对齐而从PEcore-G衍生出来的以语言为中心的模型。事实证明,这是对组合的一个很好的补充。在比较的集合中,添加PELang-G提供了最强的OCR和一般VLM性能,而不会牺牲图像和密集性能太多。因此,我们使用PEcore-G,PELang-G和DINOv 3-H+作为默认集合,以最大限度地提高多任务鲁棒性。

  • 代理模型的性能。我们还报告了不同代理模型的性能作为参考。表4显示PEcore-G和DINOv 3-H+分别是VLM和密集预测的专家。将它们结合在一起为所有三个任务域提供了良好的基础。PELang-G对于VLM任务尤其是OCR相关任务至关重要。另一方面,SigLIP 2-G,与PEcore-G和DINOv 3-H+配合使用效果不佳,导致VLM性能大幅下降。这些观察结果与表3中的目标高效编码器的最终结果一致,表明学生从老师那里学得很好

    • 表 4 用于训练第一阶段代理的不同教师集的代理模型性能。还包括教师(PEcore-G、DINOv3-H+)表现作为参考。 PEc = PEcore-G。 PEl = PElang-G。 S2 = SigLIP2-G。 Dv3 = DINOv3-H+。最佳结果以粗体显示。

Feature Visualization

  • 为了定性地比较模型的特征表示,我们使用主成分分析(PCA)将密集的补丁标记投影到三维空间中,并将这些维度映射到RGB。我们将这种可视化技术应用于领域专家和凝聚ViT-B,如图4所示。

    • 图 4 通过使用 PCA 将补丁标记投影到 RGB 空间来比较密集特征。从左到右:EUPE-ViT-B16(我们的)、DINOv3-ViT-B16、DUNE-B14、RADIOv2.5-B16、SigLIP2-B16、PEcore-B16。

  • 对于像PEcore和SigLIP 2这样的图像-文本对训练的模型,它们的补丁标记包含语义信息,但空间上不一致,导致噪声表示;另一方面,DINOv 3具有高度尖锐的特征和语义一致性,但缺乏对细粒度细节的区分能力(例如具有类似表示的食物和盘子)。对于凝聚DUNE模型,由于从多个密集的预测专家中提取,因此其特征与DINOv 3相似。我们的EUPE模型可以联合收割机结合两个世界的最佳效果,另一个凝聚模型RADIO的特征过于敏感,破坏了语义的连贯性(例如,在第2行中,狗的黑色皮毛与背景合并)

  • 我们进一步分析了使用不同阶段设置训练的编码器的特征。图5通过前几个主成分的可视化帮助我们理解它们的差异。使用阶段2训练的编码器只显示嘈杂的特征图,很难识别语义连贯性。这可以通过在阶段1中放大然后缩小来有效解决,如第二行所示,这表明与直接从多个领域专家学习高效编码器相比,从单个通用大型教师学习是更容易的路径。然而,在没有阶段3多分辨率训练的情况下,语义一致性可能被空间感知破坏。如第2行的组件1和4所示,由于训练和推理过程中的分辨率不匹配,可视化被划分为局部区域。2第三阶段训练可以解决这个问题,并使特征表示更加清晰。

    • 图 5 使用阶段变体训练的编码器的密集特征 PCA 组件的比较。输入与图 4 第 1 行中的图像相同。"仅第 2 阶段"意味着从多个教师直接蒸馏到目标高效编码器。最好以彩色形式观看。

Full Family of EUPE

  • 整个系列包括基于Vision Transformer(ViT)和ConvNeXt架构的变体。这些模型涵盖广泛的参数大小和推理成本,以适应不同计算预算下的各种设备上用例。除了表1中的结果外,表5和表6还报告了剩余EUPE系列与相应大小的其他模型集合的比较。

    • 表 5 ViT 系列在图像理解、VLM 和密集预测任务方面的评估。 "no cls"表示没有类标记输出。 "no txt"表示没有文本编码器。

  • 对于表5中的ViT-S/T系列,我们的EUPE型号在三个任务域中提供了均衡的性能。在小规模下,EUPE在密集预测任务上实现了很大的利润。在小规模下,EUPE在SPair和ADE 20 k上接近DINOv 3级别的性能,同时保留甚至改进了PEcore的视觉语言建模能力。

    • 表 6 跨 VLM 和密集预测任务的 ConvNext 系列评估。我们省略了图像理解任务的结果,因为模型没有类标记输出。

  • 对于表6中的ConvNext系列,我们的EUPE系列在密集预测任务中的Tiny,Small和Base大小方面始终优于领域专家DINOv3系列。此外,EUPE释放了更好的视觉语言建模功能,特别是对于OCR和以视觉为中心的情况。

Conclusion

  • 我们引入了EUPE,这是一种简单而有效的方法,可以通过首先扩大知识聚合,然后缩小到紧凑的学生模型来获得高效的通用感知编码器。在跨越图像理解,视觉语言建模和密集预测的各种基准测试中,EUPE在几乎没有任务的情况下产生平衡的零发射传输和一贯的强劲性能-我们希望EUPE作为在紧张的计算预算下部署多功能视觉系统的实用基础,并作为未来扩展代理教师和改进边缘和多任务设置的通用表示的工作的基线。

Additional Ablation Studies

  • 在本节中,我们将提供有关代理模型大小、datamix和损失权重的进一步实验。

  • 扩大教师规模的影响。我们探索进一步扩大教师规模是否可以保持绩效的提高。在主要论文设置中,我们在第一阶段使用DINOv 3-H+(840 M),在第二阶段和第三阶段使用代理模型ViT-G(1.8B)。在这里,我们同时将第一阶段的DINOv 3教师和第二阶段和第三阶段的代理模型扩大到ViT-7 B规模。

  • 表7验证了与现有的1.9B代理模型相比,将DINOv 3教师和代理模型扩展到7 B可以在大多数基准测试中创造新的记录。在IN 1 k-ZS、Realworld和POPE上,与最佳代理模型的性能差距很小。这是有希望的,但是当将此7 B代理模型提取到ViT-B学生中时,我们观察到混合信号,如表8所示。尽管图像理解和密集预测略有改善,但VLM质量通常比以前更差。几乎所有VLM基准测试都下降,并且在TextVQA、Realworld和MMEp上观察到严重降级。这表明代理的知识没有完全提取给学生。主要原因可能是7 B代理和86 M ViT-B之间的巨大尺寸差异。一个可能的解决方案可能是通过Mirzadeh等人(2020)提出的教学助手进行渐进式提取,我们将其作为未来的工作。

    • 表 7 用于训练第一阶段代理的不同教师集的代理模型性能。 PEc = PEcore-G。 PEl = PElang-G。 S2 = SigLIP2-G。 Dv3 = DINOv3-H+。 Dv3-7B = DINOv3-7B。括号中的数字是代理模型的参数大小。最佳结果以粗体显示。

    • 表 8 在第 1 阶段扩大 DINOv3 教师规模以及在第 2 和第 3 阶段扩大代理模型的影响。报告的表现来自第三阶段后最终 ViT-B 学生的表现。

  • datamix的影响。我们还比较了LVD-1689 M 和MetaCLIP 的训练效果。我们保持ImageNet 1 k的采样概率为10%,并改变LVD和MetaCLIP之间的异构批次。第一阶段的教师是PEcore-G和DINOv 3-H+。第2阶段和第3阶段的代理模型为1.9B。表9显示,尽管MetaCLIP拥有2.5B图像,比LVD多出约0.8B,但LVD上的训练在几乎所有基准测试中都产生了更好的性能,表明LVD的质量更高。

    • 表 9 训练对具有 1689M 图像的 LVD-1689M 与具有 2.5B 图像的 MetaCLIP 的影响

  • 在这项工作的早期探索中,我们观察到DINOv3老师的补丁损失在蒸馏过程中表现得与其他老师不同,因此用不同的权重对其进行消融。我们在DINOv3老师LDv3的蒸馏损失中引入了一个超参数γ:

    • LDv3=Lc(zcDv3,y¯cDv3)+γLp(zpDv3,y¯pDv3)(7) LDv3 = L c (z c Dv3 , y¯ c Dv3 ) + γLp (z p Dv3 , y¯ p Dv3 ) (7) LDv3=Lc(zcDv3,y¯cDv3)+γLp(zpDv3,y¯pDv3)(7)

    • 并且它以与主论文中的等式(6)所示的其他教师相同的方式对总损失做出贡献。我们采用"仅阶段2"设置,通过直接将多个教师提取为ViT-B学生,教师包括PEcore-G,PElang-G和DINOv 3-H+。表10报告了结果。总的来说,更高的贴片失重(γ = 2.0)给出了更好的图像理解和密集预测结果,但导致TextVQA、SQA和Realworld上的视觉语言建模更差。忽略DINOv 3的补丁标记(γ = 0.0)导致低密度预测性能,尽管TextVQA的结果上级。这意味着DINOv 3的补丁标记在密度预测任务中起着重要作用,但如果对它们赋予太多权重,可能会损害几个VLM基准测试。为了实现为了平衡性能,我们保持与其他教师相同的权重,并将此设置转移到第1阶段的大型代理模型的训练中。

    • 表 10 改变等式7 DINOv3 斑块损失权重的影响. SPair@224 表示基准测试以 224 × 224 分辨率进行。

Inference Cost Comparison

  • 为了在真实的边缘设备上支持AI用例,在向下选择最适合的架构以获得最佳用户体验时,模型推理成本是需要考虑的重要因素。因此,我们提供了两个推理FLOP和上-我们EUPE系列中所有型号的设备延迟如表11所示。通过将编码器导出为Executorch型号并在移动的设备上分析这些型号来完成推理延迟测量。我们还报告了未包含在EUPE系列中的大型架构的成本,以显示其在边缘设备上部署的局限性。

    • 表 11 模型大小和推理成本比较。我们展示了每个模型的参数数量以及通过 FLOP 和大小为 256 × 256 和 512 × 512 的图像的延迟来测量的成本。延迟是在 iPhone 15 Pro CPU 上测量的。 *模型不包含在我们的 EUPE 系列中,但表明它们不兼容在边缘设备上运行。

  • 当模型大小小于 100M 参数时,即使分辨率高达 512,我们也观察到可接受的推理延迟。建议在高分辨率场景下选择 ConvNext 架构,在低分辨率场景下选择 ViT 架构。另请注意,与 ViT 相比,ConvNext 的小 FLOP 不一定会导致更低的延迟。这是因为与 ViT 中使用的高度优化的矩阵乘法 (GEMM) 运算相比,卷积运算在 CPU 架构上的效率通常较低。

Detailed Benchmark Settings

  • 在本节中,我们提供有关本文中所有基准的设置的详细信息,包括数据集、附加训练方案(如果有)以及评估协议。
Image Understanding
  • 我们通过 ImageNet1k 上的图像分类来评估视觉编码器的全局质量 验证集并报告 top-1 准确性。对于每张图像,我们以 224 × 224 分辨率输入,并将视觉编码器的类标记作为该图像的特征表示。然后使用类标记使用两种协议来预测图像的类别标签:1)KNN; 2)零样本。在 KNN 协议中,我们在训练集中的图像上预先生成类标记。给定测试图像的类标记,我们从训练集中选择 k 个图像,其类标记与测试类标记之间的 L2 距离最近。然后选择他们的大多数类别作为预测标签。我们在 KNN 协议中设置 k = 10。
  • 在零样本协议中,我们使用视觉编码器的文本塔来构建零样本分类器权重,文本输入是 ImageNet1k 的 1000 个类别名称。给定测试图像的类标记,我们计算它和分类器权重的点积,然后使用 softmax 来输出概率分布。概率最高的类名就是最终的预测。请注意,对于我们的 EUPE ViT 系列,我们使用教师的文本塔来构建分类器权重,并使用适配器头将类标记投影到教师的空间中。
Vision-Language Modeling
  • 在此任务领域中,我们通过遵循 LlaVA-1.5 范式,使用 MLP 投影仪将视觉编码器的补丁标记连接到语言模型,从而评估它们的质量。除了将其视觉编码器与待测试的编码器交换之外,我们保持 LlaVA 中的所有内容不变。我们首先仅在 558K 图像-文本对上训练投影仪,以实现视觉-语言对齐。然后我们在 665K 语言图像指令跟踪数据上对投影仪和语言模型进行微调。对于这两个阶段,我们都使用余弦学习率计划、0.03 学习率预热比、0 权重衰减、AdamW 作为 1 epoch 的优化器进行训练。
  • 第一阶段和第二阶段的学习率分别为1e-3和2e-5。对于补丁大小为 14 的视觉编码器,我们使用输入分辨率 336 × 336;对于补丁大小为 16 的视觉编码器,我们使用输入分辨率 384 × 384,以保持视觉标记的数量固定。经过两阶段训练后,我们在 Cambrian-1 定义的 4 种任务类型的 6 个基准上评估模型,即针对 OCR 的 TextVQA 、针对知识的 SQA、Realworld xAI和 POPE 表示以视觉为中心,GQA 和 MME 表示一般。对于 POPE,我们报告 F1 分数。对于 MME,我们报告其感知得分。对于所有其他人,我们报告准确性。
Dense Prediction: Semantic Segmentation
  • 我们使用 ADE20k 数据集上的线性探测来评估视觉编码器在语义分割中的性能。评估指标是标准平均交并集 (mIoU)。具体来说,我们将线性分类层附加到冻结编码器的补丁标记(层归一化后),并在 ADE20k 训练集上对其进行训练。我们训练批量大小为 16,学习率为 1e − 3,权重衰减为 1e − 3,分辨率为 512 × 512,AdamW 作为优化器进行 40k 次迭代。
Dense Prediction: Depth Estimation
  • 我们使用 NYUv2 数据集 上的线性探测来评估视觉编码器在深度估计中的性能。使用均方根误差 (RMSE) 指标报告结果(越低越好)。我们在训练集上训练线性分类器。该线性层应用于冻结编码器的补丁输出特征(在层归一化之后)之上,并使用经过训练的批量归一化层进一步对特征进行归一化。我们训练批量大小为 16,学习率为 3e − 4,权重衰减为 1e − 3,AdamW 作为 38k 迭代的优化器。
Dense Prediction: 3D Keypoint Matching
  • 我们在 SPair-71k 数据集 Min 等人上评估了视觉编码器在语义对应方面的性能在无训练的环境中使用与以前的作品 类似的协议。对于补丁大小为 14/16 的模型,我们分别使用边长调整为 448/512 像素的图像。给定带有注释源关键点的图像对,我们首先从两个图像的冻结编码器中提取密集特征图。对于每个源关键点,通过将特征图双线性上采样到图像分辨率并在舍入的关键点像素位置提取特征来获得其相应的特征向量。
  • 然后,我们计算该源特征与目标图像中的所有空间特征之间的余弦相似度,以生成相似度图,并预测对应关系作为具有最大相似度的位置。预测位置被映射回图像坐标并与地面真实目标关键点进行比较。使用正确关键点百分比 (PCK) 来衡量性能,其中如果与地面实况的距离在目标图像中对象边界框的特定像素阈值内,则认为预测是正确的。我们选择 0.1 作为阈值 (PCK@0.1),其中预测点必须在最大对象边界框尺寸的 10% 范围内。我们还将每个类别的图像对数量设置为 100 以进行评估。

EUPE 针对边缘设备视觉编码器的核心痛点

  • 核心痛点有两点:一是单领域专家编码器仅擅长 1-2 类任务,跨领域性能差,无法满足边缘设备多任务并行需求;二是现有聚合模型直接从多教师蒸馏高效编码器,小参数量下无法有效融合多领域知识,性能远低于领域专家,难以平衡算力与性能。

EUPE"先扩容、再蒸馏" 范式中,大型代理模型(阶段 1)的核心价值是

  • 代理模型为1.9B 参数的大容量模型 ,核心价值是作为多领域知识融合枢纽 :利用其充足容量,吸收 PEcore、PElang、DINOv3 三类专家的多元知识,训练出单一通用表征模型;后续高效学生模型只需从这一个通用教师蒸馏知识,大幅降低小容量模型融合多领域知识的难度,避免直接多教师蒸馏的性能损失。

EUPE 模型在边缘设备部署中相比现有模型的核心优势

  • 多任务均衡强性能:单模型同时胜任图像理解、密集预测、视觉语言建模,性能持平或超越同尺寸领域专家;
  • 多尺寸适配算力:覆盖 6M-89M 参数,适配手机、嵌入式设备等不同算力边缘设备;
  • 低延迟高效部署:ViT-T 在 256 分辨率下延迟仅 6.8ms,兼顾性能与实时性,远超同尺寸聚合模型。

高效编码器没有足够的表征容量,无法直接将来自多个基础教师的异构特征统一为通用表示。整体架构一句话概括:用三阶段流水线,先把多个专家的知识压缩到一个重型代理模型,再从这个"通才"逐步蒸馏到高效学生模型。

EUPE 核心主张:高效小模型不能直接从多个领域专家那里 "硬学",容量不够,学不全、学不匀、效果差。所以流程反过来:

  • Stage 1:把知识先装进一个超大代理模型(Proxy Teacher)
  • Stage 2:从大代理蒸馏到目标高效模型(长固定分辨率训练)
  • Stage 3:多分辨率微调,适配各种输入尺寸

Stage 1:多教师 → 大型代理模型(Multi-Teacher → Proxy)

  • 多个领域最强专家 (Image / 密集 / VLM)的知识,融合到同一个 1.9B 的大代理模型里
    • PEcore‑G(1.9B):图像理解、对比式视觉语言
    • PElang‑G(1.7B):语言对齐、VLM/QA 更强
    • DINOv3‑H+(840M):密集预测、几何 / 空间强

为什么不加 SigLIP2?实验显示:两个 CLIP 系模型一起会互相干扰、VLM 掉点

  • 学生 = Proxy Model,大小:1.9B ViT‑G,输入分辨率:按教师原生尺寸

    • PEcore/PElang:448×448
    • DINOv3‑H+:256×256
  • 每张图同时送进:所有教师(冻结),Proxy(可训练)

  • 适配器(Adapter),学生特征维度和教师不同,用 2 层 MLP Adapter 把学生输出映射到教师维度:

    • z_c = H_c(y_c):对齐 CLS
    • z_p = H_p(y_p):对齐 patch
  • 学生 / 教师 patch 数量不同 → 2D 插值把小的上采样到大的尺寸,保证形状一致。

  • 损失函数(Stage1/2/3 都一样)

    • Li=Lcos(zc,yˉc)+αLcos(zp,yˉp)+βLsmoothL1(zp,yˉp) L_i=L_{cos}(z_c,\bar y_c)+αL_{cos}(z_p,\bar y_p)+βL_{smooth}L_1(z_p,\bar y_p) Li=Lcos(zc,yˉc)+αLcos(zp,yˉp)+βLsmoothL1(zp,yˉp)

    • yˉ\bar yyˉ:教师特征做归一化(mean/std) ,总损失:所有教师损失相加 L=∑iLiL=∑_iL_iL=∑iLi。归一化非常关键:防止 CLS/patch、不同教师间尺度差异导致某一类主导、另一类学不到

  • 数据:LVD‑1689M(主)+ 10% ImageNet‑1k ,大量、稳定,目标是让 Proxy 成为全能强模型

  • Proxy 同时强在:ImageNet 零样本 /knn,DINO 级密集预测,PEcore/PElang 级 VLM/QA。Proxy = 多专家知识的 "融合大模型"

Stage 2:Proxy → 高效学生(固定分辨率长训练)

  • 把 Stage1 训练好的单一全能大代理 ,蒸馏到最终要部署的小模型 (ViT‑B/S/T、ConvNext‑B/S/T,<100M)。

  • 不再同时面对 PEcore、DINO、PElang 三个老师,只有 Proxy 一个老师 ,小模型压力大幅下降,学得更稳、更均衡固定 256×256(低分辨率、省算力、能跑长训练)。

  • 教师:冻结的 Proxy(1.9B) ,学生:可训练,Adapter、插值、损失、归一化:和 Stage1 完全一样

  • Stage2 产出,得到一个小而均衡的编码器 (但:只在 256 训练,对 384/512 等分辨率适配不够):

    • 图像理解 ≈ PEcore/SigLIP2
    • 密集预测 ≈ DINOv3
    • VLM/QA 强于 RADIO/DUNE

Stage 3:多分辨率微调(Multi‑Resolution Finetune)

  • 在 Stage2 基础上,让小模型适应不同输入尺寸(256/384/512),提升下游任务鲁棒性。

  • 构建 3 个尺度:256、384、512 。每次迭代:学生随机选一个尺度,教师(Proxy)也随机选一个尺度,各自独立,不必对齐。目的:让学生学会 "不管老师用多大图,都能学到一致特征"

  • Stage1 :把 PEcore/PElang/DINOv3 三个专家,蒸馏成一个 1.9B 全能 Proxy

  • Stage2 :用 固定 256、长训练 ,从 Proxy 蒸馏到 <100M 高效学生,打好均衡底子。

  • Stage3 :用 256/384/512 多分辨率、短微调,让学生适配各种尺寸、更鲁棒。

相关推荐
指针常量2 天前
【RL相关笔记】RL 效率综述
人工智能·笔记·大语言模型·后训练
指针常量4 天前
【RL系列文章】难样本学习等
学习·大语言模型·rl·后训练
海天一色y13 天前
深入解析 DeepSpeedPPOTrainer:基于 PPO 的大规模 RLHF 训练实现
人工智能·强化学习·deepspeed·后训练
thesky1234561 个月前
27届大模型面试准备(十六):后训练全攻略——SFT、RLHF、DPO、PPO 一次讲透
大模型·sft·rlhf·ppo·dpo·面试准备·后训练
NutShell Wang1 个月前
DeepSeek-V4-Flash正式版深度拆解:不换架构,后训练如何让Agent能力暴涨7倍
人工智能·ai·架构·agent·后训练·deepseek
koharu1235 个月前
大模型后训练全解:SFT、RLHF/PPO、DPO 的原理、实践与选择
人工智能·llm·后训练
安如衫10 个月前
【学习笔记更新中】Deeplearning.AI 大语言模型后训练:微调与强化学习导论
人工智能·llm·sft·后训练·deepseek
聚梦小课堂1 年前
用于大语言模型后训练阶段的新方法GVPO(Group Variance Policy Optimization)
人工智能·语言模型·后训练
镰刀韭菜1 年前
【大语言模型】大模型后训练入门指南
人工智能·自然语言处理·大语言模型·强化学习·ppo·后训练·grpo