算法论文/数据集3——CLD(TMLR2025)压缩训练集,仅保留对验证集有益的样本

Coresets from Trajectories: Selecting Data via Correlation of Loss Differences

中文翻译讲解

论文信息

  • 标题:Coresets from Trajectories: Selecting Data via Correlation of Loss Differences
  • 作者:Manish Nagaraj, Deepak Ravikumar, Kaushik Roy(普渡大学电气与计算机工程系)
  • 发表:Transactions on Machine Learning Research (TMLR), 2025年11月
  • arXiv:2508.20230v2(2025-11-19)
  • OpenReview:QY0pbZTWJ9

一、论文速览

一句话概括

提出 CLD(Correlation of Loss Differences,损失差异相关性) ------一种仅需训练过程中逐样本损失标量即可衡量数据价值的 coresets 选择方法,无需梯度、Hessian 或特征相似度计算,在 CIFAR-100 和 ImageNet-1k 上全面匹敌或超越现有方法,且具备收敛性理论保证。

核心思想图解

复制代码
训练过程(proxy 模型)
├── 每个 epoch 记录:所有训练样本的 loss → 形成逐样本 "损失差分轨迹"
├── 每个 epoch 记录:验证集样本的 loss → 形成 "验证集平均损失差分轨迹"
│
├── 对每个训练样本:计算其轨迹与同类验证集轨迹的 Pearson 相关系数 → CLD 分数
│
└── 按 CLD 分数从高到低,各类内选 top-k → 组成类别均衡的 coreset

直觉:如果一个训练样本的 loss 在训练过程中"跌落"的节奏与验证集 loss 的"跌落"节奏高度同步(正相关),说明这个样本对泛化有正向贡献;反之,节奏背离的样本可能是噪声、歧义或无关数据。

四大贡献

编号 贡献 对应章节
1 提出 CLD 指标用于 coreset 选择 第4节
2 建立收敛性理论框架,证明训练在高 CLD 子集上收敛误差有界 第5节
3 在 CIFAR-100 和 ImageNet-1k 上全面验证,匹敌或超越 SOTA 第6节
4 证明 CLD 低计算/存储开销、可跨架构迁移、对 checkpoint 稀疏化鲁棒 第7-8节

二、背景与动机

问题是什么?

深度学习模型依赖大规模数据集才能达到最佳性能,但在实时场景或资源受限环境中,训练成本(计算 + 内存)成为瓶颈。核心问题:哪些数据子集最能支持泛化?

Coresets------紧凑、有代表性的训练子集------正是为此而生:用更少的数据训练,仍能达到全量数据的性能。

现有方法的不足

论文将现有 coreset 方法分为三大类,并逐一指出局限:

类别 代表方法 核心思路 主要局限
评分型 Forgetting, EL2N, GraNd, AUM, Herding, Moderate, Cal, CCS 用预定义指标(遗忘次数、梯度范数、特征距离等)给样本打分 评分准则与泛化无直接关联;部分方法需在大模型上跑早期训练(成本高);CCS 等需丢弃高达30%的数据
优化型 CRAIG, GradMatch, Glister, GraphCut, BoundarySet-CCS 将选择建模为显式优化问题(梯度匹配、双层优化等) 需要重复优化循环或存储高维特征/相似度矩阵,大规模数据集上不可扩展
训练动态型 TracIn, SloCurv, TDDS, Dyn-Unc, DUAL 利用训练过程中的动态信号(梯度对齐、曲率、不确定性等) TracIn/SloCurv/TDDS 需要梯度或二阶信息,成本高;Dyn-Unc/DUAL 仅用前向信号但缺乏理论保证

CLD 的定位

CLD 属于"训练动态型"中的轻量分支------与 Dyn-Unc/DUAL 一样仅依赖前向传播产生的标量信号(loss),但 不同之处在于

  1. 有理论保证:CLD 的对齐目标支持收敛性证明(Theorem 1),而不确定性方法没有。
  2. 无需比率自适应采样:DUAL 依赖 Beta 分布采样策略和超参数,CLD 直接按 CLD 分数排序选择。
  3. 与泛化直接关联:CLD 衡量的是"训练样本 loss 变化与验证集 loss 变化的同步性",这本质上是在追踪样本对泛化的贡献。

三、CLD 方法详解

3.1 基本设定

考虑监督学习问题 X → Y \mathcal{X} \to \mathcal{Y} X→Y,训练集 S = { z ⃗ 1 , ... , z ⃗ N } S = \{\vec{z}_1, \ldots, \vec{z}_N\} S={z 1,...,z N} 含 N N N 个样本,验证集 V = { q ⃗ 1 , ... , q ⃗ Q } V = \{\vec{q}_1, \ldots, \vec{q}_Q\} V={q 1,...,q Q} 含 Q Q Q 个样本( Q ≪ N Q \ll N Q≪N),验证集代表真实分布。

训练目标是最小化总体风险 R D ( θ ) = E z ⃗ ∼ D ℓ ( θ , z ⃗ ) R_\mathcal{D}(\theta) = \mathbb{E}{\vec{z} \sim \mathcal{D}}\\ell(\\theta, \\vec{z}) RD(θ)=Ez ∼Dℓ(θ,z ),但由于 D \mathcal{D} D 未知,实际最小化经验风险 R ^ ( θ , S ) = 1 N ∑ m = 1 N ℓ ( θ , z ⃗ m ) \hat{R}(\theta, S) = \frac{1}{N}\sum{m=1}^{N} \ell(\theta, \vec{z}_m) R^(θ,S)=N1∑m=1Nℓ(θ,z m)。

3.2 损失差分轨迹

训练样本的轨迹 :对每个样本 z ⃗ \vec{z} z ,记录训练过程中每一步的 loss 变化量:

Δ ⃗ ( z ⃗ ) = ℓ ( θ S 1 , z ⃗ ) − ℓ ( θ S 0 , z ⃗ ) , ... , ℓ ( θ S T , z ⃗ ) − ℓ ( θ S T − 1 , z ⃗ ) ∈ R T \vec{\Delta}(\vec{z}) = \big\\ell(\\theta_S\^1, \\vec{z}) - \\ell(\\theta_S\^0, \\vec{z}),\\ \\ldots,\\ \\ell(\\theta_S\^T, \\vec{z}) - \\ell(\\theta_S\^{T-1}, \\vec{z})\\big \in \mathbb{R}^T Δ (z )=ℓ(θS1,z )−ℓ(θS0,z ), ..., ℓ(θST,z )−ℓ(θST−1,z )∈RT

验证集的平均轨迹:对验证集所有样本的 loss 变化取平均:

Δ ⃗ V ′ = 1 Q ∑ j = 1 Q ℓ ( θ S 1 , q ⃗ j ) − ℓ ( θ S 0 , q ⃗ j ) , ... ∈ R T \vec{\Delta}'V = \frac{1}{Q}\sum{j=1}^{Q} \big\\ell(\\theta_S\^1, \\vec{q}_j) - \\ell(\\theta_S\^0, \\vec{q}_j),\\ \\ldots\\big \in \mathbb{R}^T Δ V′=Q1j=1∑Qℓ(θS1,q j)−ℓ(θS0,q j), ...∈RT

关键点 :这些 loss 值在标准训练循环中就会产生,不需要额外的前向/反向传播。唯一的额外开销是每个 proxy epoch 对验证集做一次前向传播( Q ≪ N Q \ll N Q≪N)。

3.3 CLD 定义

定义 1(CLD) :训练样本 z ⃗ m \vec{z}_m z m 的 CLD 分数是其损失差分轨迹与验证集平均轨迹之间的相关系数:

CLD ( z ⃗ m ) : = ρ ( Δ ⃗ m , Δ ⃗ V ′ ) \text{CLD}(\vec{z}_m) := \rho\big(\vec{\Delta}_m,\ \vec{\Delta}'_V\big) CLD(z m):=ρ(Δ m, Δ V′)

论文使用 Pearson 相关系数,因为其具有尺度不变性和计算简便性。

实际实现中的改进------按类对齐 :不用全局验证轨迹,而是对每个类别 c c c 计算类内验证轨迹 Δ ⃗ V , c ′ \vec{\Delta}'_{V,c} Δ V,c′,训练样本按其标签匹配对应类别的验证轨迹:

CLD ( z ⃗ m ) : = ρ ( Δ ⃗ ( z ⃗ m ) , Δ ⃗ V , c ′ ) , ∀ z ⃗ m : y m = c \text{CLD}(\vec{z}_m) := \rho\big(\vec{\Delta}(\vec{z}m),\ \vec{\Delta}'{V,c}\big), \quad \forall \vec{z}_m : y_m = c CLD(z m):=ρ(Δ (z m), Δ V,c′),∀z m:ym=c

这样做的好处:(1) 确保语义对齐;(2) 降低相关估计的方差;(3) 天然实现类别平衡。

3.4 Coreset 选择流程

复制代码
算法:CLD Coreset 选择
────────────────────────────────────
输入:训练集 S,验证集 V,proxy 模型,T_proxy 个 epoch
输出:大小为 k 的 coreset C

1. 用 proxy 模型在 S 上训练 T_proxy 个 epoch
   - 每个 epoch 记录所有 N 个训练样本的 loss(训练过程中自然产生)
   - 每个 epoch 对验证集 V 做一次前向传播,记录 Q 个样本的 loss

2. 构造损失差分轨迹
   - 每个训练样本 → Δ(z_m)
   - 每个类别的验证集 → Δ'_{V,c}

3. 对每个类别 c:
   - 对该类所有训练样本计算 CLD(z_m) = ρ(Δ(z_m), Δ'_{V,c})
   - 选 top-k_c 个 CLD 最高的样本 → C_c

4. 合并所有类别:C = ∪_c C_c

架构灵活性:CLD 分数可以用小 proxy 模型(如 ResNet-18)计算,然后直接迁移给更大的目标模型(如 ResNet-50、DenseNet-121)训练。


四、理论保证

4.1 三条假设

假设 内容 直觉
假设1(L-平滑) 对任意样本 z ⃗ \vec{z} z ,损失函数 ℓ ( θ , z ⃗ ) \ell(\theta, \vec{z}) ℓ(θ,z ) 关于 θ \theta θ 是 L-平滑的 损失曲面不能太"崎岖",梯度变化有界
假设2(梯度范数有界) 存在 B > 0 B > 0 B>0,使得所有样本的梯度范数 ≤ B \leq B ≤B 防止单个样本的梯度爆炸
假设3(验证集代表性) 以至少 1 − δ ′ 1-\delta' 1−δ′ 的概率,验证集梯度与真实风险梯度的偏差 ≤ δ \leq \delta ≤δ,其中 δ = O ( B / Q ) \delta = O(B/\sqrt{Q}) δ=O(B/Q ) 验证集要能代表真实分布;Q 越大,代表性越好

这些假设在训练动态分析中被广泛采用,是标准且合理的。

4.2 三个引理

引理1(高 CLD → 梯度对齐) :如果 CLD ( z ⃗ m ) ≥ 1 − ϵ \text{CLD}(\vec{z}_m) \geq 1 - \epsilon CLD(z m)≥1−ϵ,则该样本的梯度与验证集梯度高度对齐:

cos ⁡ ( ∠ ( ∇ θ ℓ ( θ S t , z ⃗ m ) , G V ( θ S t ) ) ) ≥ 1 − ϵ t ′ \cos\big(\angle(\nabla_\theta \ell(\theta_S^t, \vec{z}_m),\ G_V(\theta_S^t))\big) \geq 1 - \epsilon'_t cos(∠(∇θℓ(θSt,z m), GV(θSt)))≥1−ϵt′

其中 ϵ t ′ → 0 \epsilon'_t \to 0 ϵt′→0 当 ϵ → 0 \epsilon \to 0 ϵ→0。

证明直觉 :loss 差分的一阶 Taylor 展开表明 Δ ℓ ≈ ⟨ ∇ ℓ , δ θ ⟩ \Delta\ell \approx \langle \nabla \ell, \delta\theta \rangle Δℓ≈⟨∇ℓ,δθ⟩(梯度与参数更新的内积)。如果两个序列的 loss 差分高度相关,意味着它们的梯度在更新方向上的投影高度相关,进而推出梯度本身方向对齐。

引理2(对齐稳定性) :在 coreset 上训练时,只要 coreset 训练的参数轨迹与全数据训练的参数轨迹接近( ∥ θ C t − θ S t ∥ \|\theta_C^t - \theta_S^t\| ∥θCt−θSt∥ 小),引理1的对齐关系仍然成立:

cos ⁡ ( ∠ ( ∇ θ ℓ ( θ C t , z ⃗ m ) , G V ( θ C t ) ) ) ≥ 1 − κ \cos\big(\angle(\nabla_\theta \ell(\theta_C^t, \vec{z}_m),\ G_V(\theta_C^t))\big) \geq 1 - \kappa cos(∠(∇θℓ(θCt,z m), GV(θCt)))≥1−κ

其中 κ = ϵ t ′ + 4 L B ∥ δ t ∥ 2 + 3 L 2 B 2 ∥ δ t ∥ 2 2 \kappa = \epsilon'_t + \frac{4L}{B}\|\delta_t\|_2 + \frac{3L^2}{B^2}\|\delta_t\|_2^2 κ=ϵt′+B4L∥δt∥2+B23L2∥δt∥22,对轨迹偏差有线性+二次依赖。

引理3(近似误差有界):coreset 上的平均梯度与真实风险梯度的偏差:

∥ γ C t − ∇ θ R D ( θ C t ) ∥ 2 ≤ B 2 κ + δ \|\gamma_C^t - \nabla_\theta R_\mathcal{D}(\theta_C^t)\|_2 \leq B\sqrt{2\kappa} + \delta ∥γCt−∇θRD(θCt)∥2≤B2κ +δ

4.3 主定理

定理1(CLD-Coreset 的收敛性) :在假设1-3下,学习率 η ≤ 1 / L \eta \leq 1/L η≤1/L,在高 CLD coreset C C C 上训练 T T T 步:

min ⁡ 0 ≤ t < T ∥ ∇ θ R D ( θ C t ) ∥ 2 2 ≤ 2 ( R D ( θ C 0 ) − R inf ) η T + L η B 2 ⏟ 全数据训练的收敛界 + ( B 2 κ + δ ) 2 ⏟ CLD 附加误差 \min_{0 \leq t < T} \|\nabla_\theta R_\mathcal{D}(\theta_C^t)\|2^2 \leq \underbrace{\frac{2(R\mathcal{D}(\theta_C^0) - R_\text{inf})}{\eta T} + L\eta B^2}{\text{全数据训练的收敛界}} + \underbrace{\big(B\sqrt{2\kappa} + \delta\big)^2}{\text{CLD 附加误差}} 0≤t<Tmin∥∇θRD(θCt)∥22≤全数据训练的收敛界 ηT2(RD(θC0)−Rinf)+LηB2+CLD 附加误差 (B2κ +δ)2

解读

  • 前两项与全数据训练的收敛界完全一致 (标准的 SGD 收敛率 O ( 1 / T ) O(1/T) O(1/T) + 步长噪声 L η B 2 L\eta B^2 LηB2)。
  • 附加项 ( B 2 κ + δ ) 2 (B\sqrt{2\kappa} + \delta)^2 (B2κ +δ)2 是 CLD coreset 训练独有的,由两个因素控制:
    • κ \kappa κ(对齐间隙) :反映 coreset 梯度与验证集梯度的匹配程度。CLD 分数越高、coreset 越大, κ \kappa κ 越小, κ → 0 \kappa \to 0 κ→0 当 ϵ → 0 \epsilon \to 0 ϵ→0。
    • δ \delta δ(验证集代表性误差) : δ = O ( B / Q ) \delta = O(B/\sqrt{Q}) δ=O(B/Q ),验证集越大, δ \delta δ 越小。

推论1(高 CLD 的必要性) :要达到与全数据训练可比的收敛率,必须选择接近最大 CLD 分数的样本,且验证集必须可靠地代理真实风险梯度。这说明高 CLD 不仅是充分的,也是必要的。


五、实验结果

5.1 实验设置

项目 CIFAR-100 ImageNet-1k
训练样本 50,000 ~1,280,000
测试样本 10,000 50,000
类别数 100 1,000
验证集占比 10%(5,000) 1%(~12,800)
默认模型 ResNet-18 ResNet-18
训练 epoch 164(lr=0.1, decay@81/121) 90(lr=0.1, decay@30/60)
重复次数 5 个随机种子 5 个随机种子
全数据精度 70.95 ± 0.68 69.91 ± 0.01

对比基线(14种):

  • 评分型:Forgetting, EL2N, GraNd, AUM, Cal, Herding, Moderate, CCS(AUM), D2-Pruning
  • 优化型:CRAIG, Glister, GraphCut
  • 训练动态型:SloCurv, TDDS, Dyn-Unc, DUAL
  • 随机选择(Random)

所有方法使用相同的 backbone(ResNet-18)、相同的训练设置,统一使用 DeepCore 库或官方实现。

5.2 CIFAR-100 结果

以下选取关键子集大小的 top-1 精度(5 seeds 均值 ± 标准差):

子集大小 Random EL2N CCS(AUM) D2-Pruning DUAL CLD
1% 9.38±0.41 13.2±0.46 12.1±0.49 13.1±0.47 10.4±0.51 13.04±0.54
5% 22.41±0.54 27.8±0.44 27.1±0.44 28.4±0.43 27.5±0.43 27.26±0.83
10% 32.75±1.02 35.8±0.32 35.0±0.33 35.4±0.32 36.2±0.31 35.81±0.21
50% 43.17±1.02 47.2±0.24 48.3±0.25 49.0±0.24 47.5±0.23 46.18±0.13
75% 63.21±0.50 65.8±0.20 66.9±0.21 67.8±0.20 66.2±0.19 68.01±0.82

观察

  • 在极小子集(1%)时,CLD 以 13.04 领先大部分方法。
  • 在 10% 时,CLD(35.81)与 DUAL(36.2)接近,差距 <0.4%。
  • 在 50% 时,DUAL(47.5)和 D2-Pruning(49.0)略优于 CLD(46.18),差距 <1%。论文诚实指出这一点。
  • 在 75% 时,CLD(68.01)达到最高,接近全数据精度 70.95。
  • 整体趋势:CLD 在 CIFAR-100 上与大子集时的最优方法差距在 1% 以内。

5.3 ImageNet-1k 结果

子集大小 Random Forgetting EL2N CCS(AUM) D2-Pruning DUAL CLD
0.1% 0.7±0.03 0.64±0.01 0.88±0.25 1.52±0.5 1.95±0.4 0.41±1.06 1.96±0.7
1% 7.86±0.43 12.67±0.51 15.2±0.5 14.86±0.25 16.01±0.4 4.85±0.75 15.92±0.41
5% 39.78±0.23 44.86±0.74 40.43±0.03 44.04±0.1 45.75±0.5 16.2±0.4 46.5±0.19
10% 51.24±0.04 53.19±0.06 45.16±0.4 52.01±0.2 50.65±0.3 50.75±0.5 53.81±0.23
30% 60.87±0.13 60.9±0.05 53.22±0.25 61.84±0.5 60.75±0.1 60.19±0.03 62.91±0.51
50% 64.11±0.12 63.18±0.05 59.46±0.45 64.31±0.04 64.92±0.65 65.21±0.04 65.78±1.03
65% 65.21±0.03 65.24±0.02 61.28±0.25 65.17±0.1 67.01±0.1 68.31±0.01 68.02±0.38
75% 68.41±0.02 68.01±0.1 65.45±0.2 69.01±0.03 69.42±0.05 69.92±0.01 69.42±0.05
80% 68.12±0.03 68.81±0.5 66.95±0.25 69.93±0.02 69.93±0.02 69.92±0.01 69.93±0.02
90% 69.1±0.78 70.04±0.52 68.81±0.3 70.12±0.03 70.12±0.03 70.12±0.03 70.12±0.03

关键发现

  • CLD 在 ImageNet-1k 上全面领先:从 0.1% 到 90% 的所有子集大小,CLD 要么最优要么并列最优。
  • 80% 即可恢复全数据精度:CLD 在 80% 子集达到 69.93±0.02,与全数据 69.91±0.01 几乎一致。
  • 75% 即可在 0.5% 容差内匹配全数据:CLD 75% → 69.42,差距仅 0.49%。
  • DUAL 在极小子集(1%)时崩溃:仅 4.85%,远低于 CLD 的 15.92。这是因为 DUAL 的不确定性信号在极少数据时失效。
  • Herding 表现最差:在所有子集大小上均低于 Random,说明基于特征的 herding 在 ImageNet 上不适用。

5.4 跨架构迁移

在 ImageNet-1k 上,用 ResNet-18 作为 proxy 计算 CLD 分数和 coreset,然后迁移到不同目标架构训练。对比"Oracle"(目标架构自己计算 CLD):

目标模型 迁移来源 10% coreset Oracle (自选) 差距
ResNet-34 ResNet-18 54.83±0.05 54.75±0.35 +0.08
ResNet-50 ResNet-18 56.14±0.05 57.03±0.03 -0.89
DenseNet-121 ResNet-18 55.18±0.61 55.88±0.03 -0.70
VGG-19(bn) ResNet-18 53.18±0.03 54.12±0.47 -0.94

结论:跨架构迁移的精度退化始终 <1%,包括跨架构族(ResNet → DenseNet/VGG)的迁移。这意味着可以用轻量 proxy 模型选数据,再用大模型训练,大幅降低选择成本。

跨不同子集大小(5%--100%)的完整数据均确认这一规律。


六、计算与存储效率

6.1 CLD 的代价公式

Compute CLD = 3 N T proxy ⋅ f ⏟ 训练 proxy + Q T proxy ⋅ f ⏟ 验证集前向 + 3 k T ⋅ f large ⏟ 在大模型上训练 coreset \text{Compute}{\text{CLD}} = \underbrace{3NT\text{proxy} \cdot f}{\text{训练 proxy}} + \underbrace{QT\text{proxy} \cdot f}{\text{验证集前向}} + \underbrace{3kT \cdot f\text{large}}_{\text{在大模型上训练 coreset}} ComputeCLD=训练 proxy 3NTproxy⋅f+验证集前向 QTproxy⋅f+在大模型上训练 coreset 3kT⋅flarge

Storage CLD = O ( ( N + Q ) ⋅ T proxy ) (标量 loss 日志) \text{Storage}{\text{CLD}} = O\big((N+Q) \cdot T\text{proxy}\big) \quad \text{(标量 loss 日志)} StorageCLD=O((N+Q)⋅Tproxy)(标量 loss 日志)

其中 f f f 是 proxy 的单样本前向 FLOPs, f large f_\text{large} flarge 是大模型的。

6.2 ImageNet-1k 实例(10% coreset, ResNet-18 proxy → ResNet-50)

方法 计算量 (PFLOPs) 存储开销 (GB)
CLD 904.821 0.461
DUAL 625.985 0.051
Forgetting 560.122 0.005
AUM 902.724 0.005
Dyn-Unc 902.724 0.051
Herding 905.031 763.692
Moderate 905.031 763.739
D2-Pruning 905.031 763.692
CRAIG 902.724 7.671
SloCurv 978.827 0.011
TDDS 1,525.387 0.051
EL2N 3,360.725 0.005
GraNd 6,472.507 0.005
BoundarySet-CCS 1,248.648 0.005
Glister 60,297.481 ~0
GraphCut 905.031 6,434.944

分析

  • CLD 的计算量(904.8 PFLOPs)与 AUM/Herding/D2-Pruning 等方法相当,远低于 GraNd(6,472)、EL2N(3,360)和 Glister(60,297)。
  • CLD 的存储开销 (0.461 GB)远低于特征/相似度方法(Herding/Moderate/D2-Pruning 约 764 GB,GraphCut 约 6,435 GB),略高于纯标量方法(AUM/Forgetting 约 0.005 GB),因为需要存储 ( N + Q ) × T proxy (N+Q) \times T_\text{proxy} (N+Q)×Tproxy 个 loss 标量。
  • DUAL 最便宜(626 PFLOPs),但仅使用早期 proxy epoch,且在极小子集上性能崩溃。
  • 在精度-计算-存储的三维权衡中(论文 Figure 4),CLD 位于 Pareto 前沿附近。

6.3 CLD45:进一步省一半计算

论文还测试了 CLD45------仅用前 45 个 checkpoint(共 90 个)计算 CLD 分数。这将近乎减半选择阶段的计算量,而精度几乎不变。


七、稳定性与偏差分析

7.1 时间稀疏化稳定性

在 ImageNet-1k 上测试不同时间分辨率下的 CLD 性能:

配置 说明 效果
30/90 checkpoints 仅用前30个 epoch 的 loss 精度几乎不变
45/90 checkpoints 仅用前45个 epoch 的 loss 精度几乎不变
2× 降采样 每隔一个 checkpoint 取一次 精度保持
3× 降采样 每隔两个 checkpoint 取一次 轻微下降

结论:CLD 的信息信号在训练早期就被捕获,不需要完整的训练轨迹。这对大规模部署非常实用。

7.2 随机种子稳定性

在 ImageNet-1k 上用 5 个独立种子计算逐样本 CLD 分数,成对 MAE(平均绝对误差)始终低于 10 − 5 10^{-5} 10−5。这意味着不同随机初始化下,CLD 对样本的排名几乎完全一致------高度可复现。

7.3 偏差 reduction 与分层采样

发现 :在 CLD 分数上额外施加 CCS 式分层采样(按分数百分位分层),反而持续降低精度

原因:CLD 通过按类对齐验证集轨迹,已经天然实现了类别平衡和偏差 reduction。外部的分层采样会扰动 CLD 的验证对齐排名,重新引入信息量低的样本。

对比:AUM 等方法需要 CCS 分层才能有效,CLD 不需要。

7.4 验证集组成的影响

在 CIFAR-100 上用 memorization score(mem)构建不同验证集:

验证集类型 效果
Highest-mem(偏向非典型/错误标注样本) 持续降低性能
Lowest-mem(偏向典型样本) 通常更好,但完全排除高 mem 样本也不利
Proportional(按原始分布比例采样) 最可靠
Random 中等
Equal-Bin(均匀分箱) 中等

结论:CLD 的效果本质上受限于验证集质量------"coreset 无法超越其验证信号的保真度"。这启示未来需要研究如何构建干净、有代表性的验证集。


八、与影响力方法的对比(附录 F)

8.1 CLD 作为影响力的代理

论文将 CLD 修改为 pairwise 版本 CLD infl ( z ⃗ m , z ⃗ q ) = ρ ( Δ ⃗ m , Δ ⃗ q ) \text{CLD}_\text{infl}(\vec{z}_m, \vec{z}_q) = \rho(\vec{\Delta}_m, \vec{\Delta}_q) CLDinfl(z m,z q)=ρ(Δ m,Δ q),用于衡量训练样本 z ⃗ m \vec{z}_m z m 对查询样本 z ⃗ q \vec{z}_q z q 的影响力,并与 TDA(Training Data Attribution)方法对比。

8.2 Linear Datamodeling Score (LDS) 对比

在 CIFAR-10 / ResNet-9 上,对比 TRAK、Arnoldi、TracIn、Infl、Datamodels:

  • CLD 的 LDS 与 TracIn 和 TRAK 接近 ,且随采样比率 α \alpha α 增大而收敛。
  • Infl 和 Datamodels 的 LDS 更高,但它们需要预计算分数,计算成本极高。
  • CLD 仅需 loss 标量,资源效率远优于这些方法。

8.3 Prediction Brittleness

移除 CLD 识别的 top-k 样本后重新训练,观察预测翻转率:

  • 移除 CIFAR-10 的 top-800 样本(仅 1.6% 的数据),超过一半的查询样本预测发生翻转
  • CLD 的翻转率与 TracIn、TRAK 相当。
  • Infl 和 Datamodels 影响更大,但计算成本使其无法用于大规模 coreset 生成。

九、讨论与局限

9.1 超越有监督视觉:范围与注意事项

CLD 的核心只需逐样本 loss 和小验证集,理论上可扩展到:

  • 对比学习(用验证 loss)
  • 目标检测(将逐实例 loss 聚合为逐图像分数)

但论文明确将范围限定在有监督图像分类,不做超出此范围的实证声明。

9.2 LLM 微调的挑战

将 CLD 应用于大语言模型微调面临**"挤压效应"(squeezing effect)**:

随着微调进行,模型将概率质量集中在精确的训练序列上,这可能反而降低相似但不完全相同的验证样本的被分配概率。这导致训练 loss 轨迹与验证 loss 轨迹之间的背离------促进泛化的训练样本不保证有高 CLD 分数。

这一发现与 Xia et al. (2024) 的观察一致:与视觉不同,在指令微调中最小化验证 loss 不能可靠地改善模型性能。为 LLM 开发 CLD 式选择器需要设计任务适当的泛化代理指标,是重要的未来方向。

9.3 明确的局限

局限 说明
需要训练 loss 轨迹 不适用于模型作为黑盒部署的场景,或从预训练 checkpoint 微调而不完整重训的场景
需要留出验证集 减少了可用于训练的样本数量
LLM 微调 "挤压效应"导致训练-验证轨迹背离,难以直接套用

十、总结

核心要点

  1. CLD 是什么:一个用 Pearson 相关系数衡量训练样本 loss 差分轨迹与验证集 loss 差分轨迹同步性的指标。高 CLD = 样本对泛化有正向贡献。

  2. 为什么有效:高 CLD 意味着样本梯度与验证集梯度方向对齐(引理1),这种对齐在 coreset 训练中保持稳定(引理2),从而保证 coreset 梯度近似全数据梯度(引理3),最终收敛误差有界(定理1)。

  3. 实验表现

    • ImageNet-1k 上全面领先,80% 子集即恢复全数据精度。
    • CIFAR-100 上与最优方法差距 <1%。
    • 跨架构迁移退化 <1%。
    • 5 个种子间 MAE < 10 − 5 10^{-5} 10−5,高度可复现。
    • 仅用早期 checkpoint(30/90)精度几乎不变。
  4. 效率优势:仅依赖训练中自然产生的 loss 标量,无需梯度/Hessian/特征。计算量与 AUM 等轻量方法相当,存储仅需 0.461 GB(ImageNet-1k 场景),远低于特征/图方法。

  5. 理论贡献 :收敛界中附加误差 ( B 2 κ + δ ) 2 (B\sqrt{2\kappa} + \delta)^2 (B2κ +δ)2 明确由对齐质量 κ \kappa κ 和验证集大小 Q Q Q 控制,且高 CLD 是必要条件(推论1),不只是充分条件。

论文的诚实之处

  • 在 CIFAR-100 50% 子集上,诚实指出 DUAL(47.5)和 D2-Pruning(49.0)略优于 CLD(46.18)。
  • 明确承认 CLD 不适用于 LLM 微调("挤压效应")和黑盒模型场景。
  • 验证集质量实验坦诚展示了 CLD 受限于验证信号保真度的事实。

对实践者的启示

  • 如果你的场景是有监督图像分类,CLD 是一个计算高效、理论有保证、跨架构可迁移的 coreset 选择方法。
  • 如果计算预算极紧,DUAL 更便宜(仅用早期 proxy epoch),但要注意它在极小子集(1%)上可能崩溃。
  • 如果验证集质量存疑(如有标签噪声),需要先清洗验证集------CLD 无法超越其验证信号的质量。
  • 如果要用于 LLM 微调,需要先解决"挤压效应"问题,不能直接套用。

论文链接arXiv:2508.20230

代码:作者声明代码已在 GitHub 公开(见论文脚注1)。

资助:DARPA JUMP 2.0 CoCoSys 中心、SRC、NSF、Collins Aerospace。

相关推荐
长沙京卓18 分钟前
Copilot Coding Agent 变了:AI 编程正在从插件变成项目成员
人工智能·ai
Tim_1029 分钟前
【LeetCode】29、两数相除
算法·leetcode·职场和发展
AIGC大时代34 分钟前
知网 AIGC 检测在罚什么:均匀句长、低指代、零口癖,并不等于「用过 ChatGPT」
人工智能·chatgpt·nlp·aigc·论文·知网·学术规范
华奥系科技38 分钟前
银发经济浪潮下,智慧养老该如何落地生根
大数据·人工智能
czxxxc41 分钟前
创客匠人AI观察:模型竞赛再提速,安全与治理成新主线
人工智能·知识付费
IT_陈寒1 小时前
Redis缓存雪崩把我坑惨了,这次长记性了
前端·人工智能·后端
百胜软件@百胜软件1 小时前
百胜软件入选“828精选AI解决方案图谱”,胜券AI助力零售品牌构建专属智能体
大数据·人工智能·零售
ai小陈1 小时前
Hunyuan3D-2云端部署实战:图生3D、文生3D怎么跑更稳
人工智能·科技·3d·ai·音视频·gpu算力
智驭未来掌门人1 小时前
别再让员工偷偷用 ChatGPT 了:用一台内网网关,把大模型变成"自来水"
人工智能