Coresets from Trajectories: Selecting Data via Correlation of Loss Differences
中文翻译讲解
论文信息
- 标题:Coresets from Trajectories: Selecting Data via Correlation of Loss Differences
- 作者:Manish Nagaraj, Deepak Ravikumar, Kaushik Roy(普渡大学电气与计算机工程系)
- 发表:Transactions on Machine Learning Research (TMLR), 2025年11月
- arXiv:2508.20230v2(2025-11-19)
- OpenReview:QY0pbZTWJ9
一、论文速览
一句话概括
提出 CLD(Correlation of Loss Differences,损失差异相关性) ------一种仅需训练过程中逐样本损失标量即可衡量数据价值的 coresets 选择方法,无需梯度、Hessian 或特征相似度计算,在 CIFAR-100 和 ImageNet-1k 上全面匹敌或超越现有方法,且具备收敛性理论保证。

核心思想图解
训练过程(proxy 模型)
├── 每个 epoch 记录:所有训练样本的 loss → 形成逐样本 "损失差分轨迹"
├── 每个 epoch 记录:验证集样本的 loss → 形成 "验证集平均损失差分轨迹"
│
├── 对每个训练样本:计算其轨迹与同类验证集轨迹的 Pearson 相关系数 → CLD 分数
│
└── 按 CLD 分数从高到低,各类内选 top-k → 组成类别均衡的 coreset
直觉:如果一个训练样本的 loss 在训练过程中"跌落"的节奏与验证集 loss 的"跌落"节奏高度同步(正相关),说明这个样本对泛化有正向贡献;反之,节奏背离的样本可能是噪声、歧义或无关数据。
四大贡献
| 编号 | 贡献 | 对应章节 |
|---|---|---|
| 1 | 提出 CLD 指标用于 coreset 选择 | 第4节 |
| 2 | 建立收敛性理论框架,证明训练在高 CLD 子集上收敛误差有界 | 第5节 |
| 3 | 在 CIFAR-100 和 ImageNet-1k 上全面验证,匹敌或超越 SOTA | 第6节 |
| 4 | 证明 CLD 低计算/存储开销、可跨架构迁移、对 checkpoint 稀疏化鲁棒 | 第7-8节 |
二、背景与动机
问题是什么?
深度学习模型依赖大规模数据集才能达到最佳性能,但在实时场景或资源受限环境中,训练成本(计算 + 内存)成为瓶颈。核心问题:哪些数据子集最能支持泛化?
Coresets------紧凑、有代表性的训练子集------正是为此而生:用更少的数据训练,仍能达到全量数据的性能。
现有方法的不足
论文将现有 coreset 方法分为三大类,并逐一指出局限:
| 类别 | 代表方法 | 核心思路 | 主要局限 |
|---|---|---|---|
| 评分型 | Forgetting, EL2N, GraNd, AUM, Herding, Moderate, Cal, CCS | 用预定义指标(遗忘次数、梯度范数、特征距离等)给样本打分 | 评分准则与泛化无直接关联;部分方法需在大模型上跑早期训练(成本高);CCS 等需丢弃高达30%的数据 |
| 优化型 | CRAIG, GradMatch, Glister, GraphCut, BoundarySet-CCS | 将选择建模为显式优化问题(梯度匹配、双层优化等) | 需要重复优化循环或存储高维特征/相似度矩阵,大规模数据集上不可扩展 |
| 训练动态型 | TracIn, SloCurv, TDDS, Dyn-Unc, DUAL | 利用训练过程中的动态信号(梯度对齐、曲率、不确定性等) | TracIn/SloCurv/TDDS 需要梯度或二阶信息,成本高;Dyn-Unc/DUAL 仅用前向信号但缺乏理论保证 |
CLD 的定位
CLD 属于"训练动态型"中的轻量分支------与 Dyn-Unc/DUAL 一样仅依赖前向传播产生的标量信号(loss),但 不同之处在于:
- 有理论保证:CLD 的对齐目标支持收敛性证明(Theorem 1),而不确定性方法没有。
- 无需比率自适应采样:DUAL 依赖 Beta 分布采样策略和超参数,CLD 直接按 CLD 分数排序选择。
- 与泛化直接关联:CLD 衡量的是"训练样本 loss 变化与验证集 loss 变化的同步性",这本质上是在追踪样本对泛化的贡献。
三、CLD 方法详解
3.1 基本设定
考虑监督学习问题 X → Y \mathcal{X} \to \mathcal{Y} X→Y,训练集 S = { z ⃗ 1 , ... , z ⃗ N } S = \{\vec{z}_1, \ldots, \vec{z}_N\} S={z 1,...,z N} 含 N N N 个样本,验证集 V = { q ⃗ 1 , ... , q ⃗ Q } V = \{\vec{q}_1, \ldots, \vec{q}_Q\} V={q 1,...,q Q} 含 Q Q Q 个样本( Q ≪ N Q \ll N Q≪N),验证集代表真实分布。
训练目标是最小化总体风险 R D ( θ ) = E z ⃗ ∼ D ℓ ( θ , z ⃗ ) R_\mathcal{D}(\theta) = \mathbb{E}{\vec{z} \sim \mathcal{D}}\\ell(\\theta, \\vec{z}) RD(θ)=Ez ∼Dℓ(θ,z ),但由于 D \mathcal{D} D 未知,实际最小化经验风险 R ^ ( θ , S ) = 1 N ∑ m = 1 N ℓ ( θ , z ⃗ m ) \hat{R}(\theta, S) = \frac{1}{N}\sum{m=1}^{N} \ell(\theta, \vec{z}_m) R^(θ,S)=N1∑m=1Nℓ(θ,z m)。
3.2 损失差分轨迹
训练样本的轨迹 :对每个样本 z ⃗ \vec{z} z ,记录训练过程中每一步的 loss 变化量:
Δ ⃗ ( z ⃗ ) = ℓ ( θ S 1 , z ⃗ ) − ℓ ( θ S 0 , z ⃗ ) , ... , ℓ ( θ S T , z ⃗ ) − ℓ ( θ S T − 1 , z ⃗ ) ∈ R T \vec{\Delta}(\vec{z}) = \big\\ell(\\theta_S\^1, \\vec{z}) - \\ell(\\theta_S\^0, \\vec{z}),\\ \\ldots,\\ \\ell(\\theta_S\^T, \\vec{z}) - \\ell(\\theta_S\^{T-1}, \\vec{z})\\big \in \mathbb{R}^T Δ (z )=ℓ(θS1,z )−ℓ(θS0,z ), ..., ℓ(θST,z )−ℓ(θST−1,z )∈RT
验证集的平均轨迹:对验证集所有样本的 loss 变化取平均:
Δ ⃗ V ′ = 1 Q ∑ j = 1 Q ℓ ( θ S 1 , q ⃗ j ) − ℓ ( θ S 0 , q ⃗ j ) , ... ∈ R T \vec{\Delta}'V = \frac{1}{Q}\sum{j=1}^{Q} \big\\ell(\\theta_S\^1, \\vec{q}_j) - \\ell(\\theta_S\^0, \\vec{q}_j),\\ \\ldots\\big \in \mathbb{R}^T Δ V′=Q1j=1∑Qℓ(θS1,q j)−ℓ(θS0,q j), ...∈RT
关键点 :这些 loss 值在标准训练循环中就会产生,不需要额外的前向/反向传播。唯一的额外开销是每个 proxy epoch 对验证集做一次前向传播( Q ≪ N Q \ll N Q≪N)。
3.3 CLD 定义
定义 1(CLD) :训练样本 z ⃗ m \vec{z}_m z m 的 CLD 分数是其损失差分轨迹与验证集平均轨迹之间的相关系数:
CLD ( z ⃗ m ) : = ρ ( Δ ⃗ m , Δ ⃗ V ′ ) \text{CLD}(\vec{z}_m) := \rho\big(\vec{\Delta}_m,\ \vec{\Delta}'_V\big) CLD(z m):=ρ(Δ m, Δ V′)
论文使用 Pearson 相关系数,因为其具有尺度不变性和计算简便性。
实际实现中的改进------按类对齐 :不用全局验证轨迹,而是对每个类别 c c c 计算类内验证轨迹 Δ ⃗ V , c ′ \vec{\Delta}'_{V,c} Δ V,c′,训练样本按其标签匹配对应类别的验证轨迹:
CLD ( z ⃗ m ) : = ρ ( Δ ⃗ ( z ⃗ m ) , Δ ⃗ V , c ′ ) , ∀ z ⃗ m : y m = c \text{CLD}(\vec{z}_m) := \rho\big(\vec{\Delta}(\vec{z}m),\ \vec{\Delta}'{V,c}\big), \quad \forall \vec{z}_m : y_m = c CLD(z m):=ρ(Δ (z m), Δ V,c′),∀z m:ym=c
这样做的好处:(1) 确保语义对齐;(2) 降低相关估计的方差;(3) 天然实现类别平衡。
3.4 Coreset 选择流程
算法:CLD Coreset 选择
────────────────────────────────────
输入:训练集 S,验证集 V,proxy 模型,T_proxy 个 epoch
输出:大小为 k 的 coreset C
1. 用 proxy 模型在 S 上训练 T_proxy 个 epoch
- 每个 epoch 记录所有 N 个训练样本的 loss(训练过程中自然产生)
- 每个 epoch 对验证集 V 做一次前向传播,记录 Q 个样本的 loss
2. 构造损失差分轨迹
- 每个训练样本 → Δ(z_m)
- 每个类别的验证集 → Δ'_{V,c}
3. 对每个类别 c:
- 对该类所有训练样本计算 CLD(z_m) = ρ(Δ(z_m), Δ'_{V,c})
- 选 top-k_c 个 CLD 最高的样本 → C_c
4. 合并所有类别:C = ∪_c C_c
架构灵活性:CLD 分数可以用小 proxy 模型(如 ResNet-18)计算,然后直接迁移给更大的目标模型(如 ResNet-50、DenseNet-121)训练。
四、理论保证
4.1 三条假设
| 假设 | 内容 | 直觉 |
|---|---|---|
| 假设1(L-平滑) | 对任意样本 z ⃗ \vec{z} z ,损失函数 ℓ ( θ , z ⃗ ) \ell(\theta, \vec{z}) ℓ(θ,z ) 关于 θ \theta θ 是 L-平滑的 | 损失曲面不能太"崎岖",梯度变化有界 |
| 假设2(梯度范数有界) | 存在 B > 0 B > 0 B>0,使得所有样本的梯度范数 ≤ B \leq B ≤B | 防止单个样本的梯度爆炸 |
| 假设3(验证集代表性) | 以至少 1 − δ ′ 1-\delta' 1−δ′ 的概率,验证集梯度与真实风险梯度的偏差 ≤ δ \leq \delta ≤δ,其中 δ = O ( B / Q ) \delta = O(B/\sqrt{Q}) δ=O(B/Q ) | 验证集要能代表真实分布;Q 越大,代表性越好 |
这些假设在训练动态分析中被广泛采用,是标准且合理的。
4.2 三个引理
引理1(高 CLD → 梯度对齐) :如果 CLD ( z ⃗ m ) ≥ 1 − ϵ \text{CLD}(\vec{z}_m) \geq 1 - \epsilon CLD(z m)≥1−ϵ,则该样本的梯度与验证集梯度高度对齐:
cos ( ∠ ( ∇ θ ℓ ( θ S t , z ⃗ m ) , G V ( θ S t ) ) ) ≥ 1 − ϵ t ′ \cos\big(\angle(\nabla_\theta \ell(\theta_S^t, \vec{z}_m),\ G_V(\theta_S^t))\big) \geq 1 - \epsilon'_t cos(∠(∇θℓ(θSt,z m), GV(θSt)))≥1−ϵt′
其中 ϵ t ′ → 0 \epsilon'_t \to 0 ϵt′→0 当 ϵ → 0 \epsilon \to 0 ϵ→0。
证明直觉 :loss 差分的一阶 Taylor 展开表明 Δ ℓ ≈ ⟨ ∇ ℓ , δ θ ⟩ \Delta\ell \approx \langle \nabla \ell, \delta\theta \rangle Δℓ≈⟨∇ℓ,δθ⟩(梯度与参数更新的内积)。如果两个序列的 loss 差分高度相关,意味着它们的梯度在更新方向上的投影高度相关,进而推出梯度本身方向对齐。
引理2(对齐稳定性) :在 coreset 上训练时,只要 coreset 训练的参数轨迹与全数据训练的参数轨迹接近( ∥ θ C t − θ S t ∥ \|\theta_C^t - \theta_S^t\| ∥θCt−θSt∥ 小),引理1的对齐关系仍然成立:
cos ( ∠ ( ∇ θ ℓ ( θ C t , z ⃗ m ) , G V ( θ C t ) ) ) ≥ 1 − κ \cos\big(\angle(\nabla_\theta \ell(\theta_C^t, \vec{z}_m),\ G_V(\theta_C^t))\big) \geq 1 - \kappa cos(∠(∇θℓ(θCt,z m), GV(θCt)))≥1−κ
其中 κ = ϵ t ′ + 4 L B ∥ δ t ∥ 2 + 3 L 2 B 2 ∥ δ t ∥ 2 2 \kappa = \epsilon'_t + \frac{4L}{B}\|\delta_t\|_2 + \frac{3L^2}{B^2}\|\delta_t\|_2^2 κ=ϵt′+B4L∥δt∥2+B23L2∥δt∥22,对轨迹偏差有线性+二次依赖。
引理3(近似误差有界):coreset 上的平均梯度与真实风险梯度的偏差:
∥ γ C t − ∇ θ R D ( θ C t ) ∥ 2 ≤ B 2 κ + δ \|\gamma_C^t - \nabla_\theta R_\mathcal{D}(\theta_C^t)\|_2 \leq B\sqrt{2\kappa} + \delta ∥γCt−∇θRD(θCt)∥2≤B2κ +δ
4.3 主定理
定理1(CLD-Coreset 的收敛性) :在假设1-3下,学习率 η ≤ 1 / L \eta \leq 1/L η≤1/L,在高 CLD coreset C C C 上训练 T T T 步:
min 0 ≤ t < T ∥ ∇ θ R D ( θ C t ) ∥ 2 2 ≤ 2 ( R D ( θ C 0 ) − R inf ) η T + L η B 2 ⏟ 全数据训练的收敛界 + ( B 2 κ + δ ) 2 ⏟ CLD 附加误差 \min_{0 \leq t < T} \|\nabla_\theta R_\mathcal{D}(\theta_C^t)\|2^2 \leq \underbrace{\frac{2(R\mathcal{D}(\theta_C^0) - R_\text{inf})}{\eta T} + L\eta B^2}{\text{全数据训练的收敛界}} + \underbrace{\big(B\sqrt{2\kappa} + \delta\big)^2}{\text{CLD 附加误差}} 0≤t<Tmin∥∇θRD(θCt)∥22≤全数据训练的收敛界 ηT2(RD(θC0)−Rinf)+LηB2+CLD 附加误差 (B2κ +δ)2
解读:
- 前两项与全数据训练的收敛界完全一致 (标准的 SGD 收敛率 O ( 1 / T ) O(1/T) O(1/T) + 步长噪声 L η B 2 L\eta B^2 LηB2)。
- 附加项 ( B 2 κ + δ ) 2 (B\sqrt{2\kappa} + \delta)^2 (B2κ +δ)2 是 CLD coreset 训练独有的,由两个因素控制:
- κ \kappa κ(对齐间隙) :反映 coreset 梯度与验证集梯度的匹配程度。CLD 分数越高、coreset 越大, κ \kappa κ 越小, κ → 0 \kappa \to 0 κ→0 当 ϵ → 0 \epsilon \to 0 ϵ→0。
- δ \delta δ(验证集代表性误差) : δ = O ( B / Q ) \delta = O(B/\sqrt{Q}) δ=O(B/Q ),验证集越大, δ \delta δ 越小。
推论1(高 CLD 的必要性) :要达到与全数据训练可比的收敛率,必须选择接近最大 CLD 分数的样本,且验证集必须可靠地代理真实风险梯度。这说明高 CLD 不仅是充分的,也是必要的。
五、实验结果
5.1 实验设置
| 项目 | CIFAR-100 | ImageNet-1k |
|---|---|---|
| 训练样本 | 50,000 | ~1,280,000 |
| 测试样本 | 10,000 | 50,000 |
| 类别数 | 100 | 1,000 |
| 验证集占比 | 10%(5,000) | 1%(~12,800) |
| 默认模型 | ResNet-18 | ResNet-18 |
| 训练 epoch | 164(lr=0.1, decay@81/121) | 90(lr=0.1, decay@30/60) |
| 重复次数 | 5 个随机种子 | 5 个随机种子 |
| 全数据精度 | 70.95 ± 0.68 | 69.91 ± 0.01 |
对比基线(14种):
- 评分型:Forgetting, EL2N, GraNd, AUM, Cal, Herding, Moderate, CCS(AUM), D2-Pruning
- 优化型:CRAIG, Glister, GraphCut
- 训练动态型:SloCurv, TDDS, Dyn-Unc, DUAL
- 随机选择(Random)
所有方法使用相同的 backbone(ResNet-18)、相同的训练设置,统一使用 DeepCore 库或官方实现。
5.2 CIFAR-100 结果
以下选取关键子集大小的 top-1 精度(5 seeds 均值 ± 标准差):
| 子集大小 | Random | EL2N | CCS(AUM) | D2-Pruning | DUAL | CLD |
|---|---|---|---|---|---|---|
| 1% | 9.38±0.41 | 13.2±0.46 | 12.1±0.49 | 13.1±0.47 | 10.4±0.51 | 13.04±0.54 |
| 5% | 22.41±0.54 | 27.8±0.44 | 27.1±0.44 | 28.4±0.43 | 27.5±0.43 | 27.26±0.83 |
| 10% | 32.75±1.02 | 35.8±0.32 | 35.0±0.33 | 35.4±0.32 | 36.2±0.31 | 35.81±0.21 |
| 50% | 43.17±1.02 | 47.2±0.24 | 48.3±0.25 | 49.0±0.24 | 47.5±0.23 | 46.18±0.13 |
| 75% | 63.21±0.50 | 65.8±0.20 | 66.9±0.21 | 67.8±0.20 | 66.2±0.19 | 68.01±0.82 |
观察:
- 在极小子集(1%)时,CLD 以 13.04 领先大部分方法。
- 在 10% 时,CLD(35.81)与 DUAL(36.2)接近,差距 <0.4%。
- 在 50% 时,DUAL(47.5)和 D2-Pruning(49.0)略优于 CLD(46.18),差距 <1%。论文诚实指出这一点。
- 在 75% 时,CLD(68.01)达到最高,接近全数据精度 70.95。
- 整体趋势:CLD 在 CIFAR-100 上与大子集时的最优方法差距在 1% 以内。
5.3 ImageNet-1k 结果
| 子集大小 | Random | Forgetting | EL2N | CCS(AUM) | D2-Pruning | DUAL | CLD |
|---|---|---|---|---|---|---|---|
| 0.1% | 0.7±0.03 | 0.64±0.01 | 0.88±0.25 | 1.52±0.5 | 1.95±0.4 | 0.41±1.06 | 1.96±0.7 |
| 1% | 7.86±0.43 | 12.67±0.51 | 15.2±0.5 | 14.86±0.25 | 16.01±0.4 | 4.85±0.75 | 15.92±0.41 |
| 5% | 39.78±0.23 | 44.86±0.74 | 40.43±0.03 | 44.04±0.1 | 45.75±0.5 | 16.2±0.4 | 46.5±0.19 |
| 10% | 51.24±0.04 | 53.19±0.06 | 45.16±0.4 | 52.01±0.2 | 50.65±0.3 | 50.75±0.5 | 53.81±0.23 |
| 30% | 60.87±0.13 | 60.9±0.05 | 53.22±0.25 | 61.84±0.5 | 60.75±0.1 | 60.19±0.03 | 62.91±0.51 |
| 50% | 64.11±0.12 | 63.18±0.05 | 59.46±0.45 | 64.31±0.04 | 64.92±0.65 | 65.21±0.04 | 65.78±1.03 |
| 65% | 65.21±0.03 | 65.24±0.02 | 61.28±0.25 | 65.17±0.1 | 67.01±0.1 | 68.31±0.01 | 68.02±0.38 |
| 75% | 68.41±0.02 | 68.01±0.1 | 65.45±0.2 | 69.01±0.03 | 69.42±0.05 | 69.92±0.01 | 69.42±0.05 |
| 80% | 68.12±0.03 | 68.81±0.5 | 66.95±0.25 | 69.93±0.02 | 69.93±0.02 | 69.92±0.01 | 69.93±0.02 |
| 90% | 69.1±0.78 | 70.04±0.52 | 68.81±0.3 | 70.12±0.03 | 70.12±0.03 | 70.12±0.03 | 70.12±0.03 |
关键发现:
- CLD 在 ImageNet-1k 上全面领先:从 0.1% 到 90% 的所有子集大小,CLD 要么最优要么并列最优。
- 80% 即可恢复全数据精度:CLD 在 80% 子集达到 69.93±0.02,与全数据 69.91±0.01 几乎一致。
- 75% 即可在 0.5% 容差内匹配全数据:CLD 75% → 69.42,差距仅 0.49%。
- DUAL 在极小子集(1%)时崩溃:仅 4.85%,远低于 CLD 的 15.92。这是因为 DUAL 的不确定性信号在极少数据时失效。
- Herding 表现最差:在所有子集大小上均低于 Random,说明基于特征的 herding 在 ImageNet 上不适用。
5.4 跨架构迁移
在 ImageNet-1k 上,用 ResNet-18 作为 proxy 计算 CLD 分数和 coreset,然后迁移到不同目标架构训练。对比"Oracle"(目标架构自己计算 CLD):
| 目标模型 | 迁移来源 | 10% coreset | Oracle (自选) | 差距 |
|---|---|---|---|---|
| ResNet-34 | ResNet-18 | 54.83±0.05 | 54.75±0.35 | +0.08 |
| ResNet-50 | ResNet-18 | 56.14±0.05 | 57.03±0.03 | -0.89 |
| DenseNet-121 | ResNet-18 | 55.18±0.61 | 55.88±0.03 | -0.70 |
| VGG-19(bn) | ResNet-18 | 53.18±0.03 | 54.12±0.47 | -0.94 |
结论:跨架构迁移的精度退化始终 <1%,包括跨架构族(ResNet → DenseNet/VGG)的迁移。这意味着可以用轻量 proxy 模型选数据,再用大模型训练,大幅降低选择成本。
跨不同子集大小(5%--100%)的完整数据均确认这一规律。
六、计算与存储效率
6.1 CLD 的代价公式
Compute CLD = 3 N T proxy ⋅ f ⏟ 训练 proxy + Q T proxy ⋅ f ⏟ 验证集前向 + 3 k T ⋅ f large ⏟ 在大模型上训练 coreset \text{Compute}{\text{CLD}} = \underbrace{3NT\text{proxy} \cdot f}{\text{训练 proxy}} + \underbrace{QT\text{proxy} \cdot f}{\text{验证集前向}} + \underbrace{3kT \cdot f\text{large}}_{\text{在大模型上训练 coreset}} ComputeCLD=训练 proxy 3NTproxy⋅f+验证集前向 QTproxy⋅f+在大模型上训练 coreset 3kT⋅flarge
Storage CLD = O ( ( N + Q ) ⋅ T proxy ) (标量 loss 日志) \text{Storage}{\text{CLD}} = O\big((N+Q) \cdot T\text{proxy}\big) \quad \text{(标量 loss 日志)} StorageCLD=O((N+Q)⋅Tproxy)(标量 loss 日志)
其中 f f f 是 proxy 的单样本前向 FLOPs, f large f_\text{large} flarge 是大模型的。
6.2 ImageNet-1k 实例(10% coreset, ResNet-18 proxy → ResNet-50)
| 方法 | 计算量 (PFLOPs) | 存储开销 (GB) |
|---|---|---|
| CLD | 904.821 | 0.461 |
| DUAL | 625.985 | 0.051 |
| Forgetting | 560.122 | 0.005 |
| AUM | 902.724 | 0.005 |
| Dyn-Unc | 902.724 | 0.051 |
| Herding | 905.031 | 763.692 |
| Moderate | 905.031 | 763.739 |
| D2-Pruning | 905.031 | 763.692 |
| CRAIG | 902.724 | 7.671 |
| SloCurv | 978.827 | 0.011 |
| TDDS | 1,525.387 | 0.051 |
| EL2N | 3,360.725 | 0.005 |
| GraNd | 6,472.507 | 0.005 |
| BoundarySet-CCS | 1,248.648 | 0.005 |
| Glister | 60,297.481 | ~0 |
| GraphCut | 905.031 | 6,434.944 |
分析:
- CLD 的计算量(904.8 PFLOPs)与 AUM/Herding/D2-Pruning 等方法相当,远低于 GraNd(6,472)、EL2N(3,360)和 Glister(60,297)。
- CLD 的存储开销 (0.461 GB)远低于特征/相似度方法(Herding/Moderate/D2-Pruning 约 764 GB,GraphCut 约 6,435 GB),略高于纯标量方法(AUM/Forgetting 约 0.005 GB),因为需要存储 ( N + Q ) × T proxy (N+Q) \times T_\text{proxy} (N+Q)×Tproxy 个 loss 标量。
- DUAL 最便宜(626 PFLOPs),但仅使用早期 proxy epoch,且在极小子集上性能崩溃。
- 在精度-计算-存储的三维权衡中(论文 Figure 4),CLD 位于 Pareto 前沿附近。
6.3 CLD45:进一步省一半计算
论文还测试了 CLD45------仅用前 45 个 checkpoint(共 90 个)计算 CLD 分数。这将近乎减半选择阶段的计算量,而精度几乎不变。
七、稳定性与偏差分析
7.1 时间稀疏化稳定性
在 ImageNet-1k 上测试不同时间分辨率下的 CLD 性能:
| 配置 | 说明 | 效果 |
|---|---|---|
| 30/90 checkpoints | 仅用前30个 epoch 的 loss | 精度几乎不变 |
| 45/90 checkpoints | 仅用前45个 epoch 的 loss | 精度几乎不变 |
| 2× 降采样 | 每隔一个 checkpoint 取一次 | 精度保持 |
| 3× 降采样 | 每隔两个 checkpoint 取一次 | 轻微下降 |
结论:CLD 的信息信号在训练早期就被捕获,不需要完整的训练轨迹。这对大规模部署非常实用。
7.2 随机种子稳定性
在 ImageNet-1k 上用 5 个独立种子计算逐样本 CLD 分数,成对 MAE(平均绝对误差)始终低于 10 − 5 10^{-5} 10−5。这意味着不同随机初始化下,CLD 对样本的排名几乎完全一致------高度可复现。
7.3 偏差 reduction 与分层采样
发现 :在 CLD 分数上额外施加 CCS 式分层采样(按分数百分位分层),反而持续降低精度。
原因:CLD 通过按类对齐验证集轨迹,已经天然实现了类别平衡和偏差 reduction。外部的分层采样会扰动 CLD 的验证对齐排名,重新引入信息量低的样本。
对比:AUM 等方法需要 CCS 分层才能有效,CLD 不需要。
7.4 验证集组成的影响
在 CIFAR-100 上用 memorization score(mem)构建不同验证集:
| 验证集类型 | 效果 |
|---|---|
| Highest-mem(偏向非典型/错误标注样本) | 持续降低性能 |
| Lowest-mem(偏向典型样本) | 通常更好,但完全排除高 mem 样本也不利 |
| Proportional(按原始分布比例采样) | 最可靠 |
| Random | 中等 |
| Equal-Bin(均匀分箱) | 中等 |
结论:CLD 的效果本质上受限于验证集质量------"coreset 无法超越其验证信号的保真度"。这启示未来需要研究如何构建干净、有代表性的验证集。
八、与影响力方法的对比(附录 F)
8.1 CLD 作为影响力的代理
论文将 CLD 修改为 pairwise 版本 CLD infl ( z ⃗ m , z ⃗ q ) = ρ ( Δ ⃗ m , Δ ⃗ q ) \text{CLD}_\text{infl}(\vec{z}_m, \vec{z}_q) = \rho(\vec{\Delta}_m, \vec{\Delta}_q) CLDinfl(z m,z q)=ρ(Δ m,Δ q),用于衡量训练样本 z ⃗ m \vec{z}_m z m 对查询样本 z ⃗ q \vec{z}_q z q 的影响力,并与 TDA(Training Data Attribution)方法对比。
8.2 Linear Datamodeling Score (LDS) 对比
在 CIFAR-10 / ResNet-9 上,对比 TRAK、Arnoldi、TracIn、Infl、Datamodels:
- CLD 的 LDS 与 TracIn 和 TRAK 接近 ,且随采样比率 α \alpha α 增大而收敛。
- Infl 和 Datamodels 的 LDS 更高,但它们需要预计算分数,计算成本极高。
- CLD 仅需 loss 标量,资源效率远优于这些方法。
8.3 Prediction Brittleness
移除 CLD 识别的 top-k 样本后重新训练,观察预测翻转率:
- 移除 CIFAR-10 的 top-800 样本(仅 1.6% 的数据),超过一半的查询样本预测发生翻转。
- CLD 的翻转率与 TracIn、TRAK 相当。
- Infl 和 Datamodels 影响更大,但计算成本使其无法用于大规模 coreset 生成。
九、讨论与局限
9.1 超越有监督视觉:范围与注意事项
CLD 的核心只需逐样本 loss 和小验证集,理论上可扩展到:
- 对比学习(用验证 loss)
- 目标检测(将逐实例 loss 聚合为逐图像分数)
但论文明确将范围限定在有监督图像分类,不做超出此范围的实证声明。
9.2 LLM 微调的挑战
将 CLD 应用于大语言模型微调面临**"挤压效应"(squeezing effect)**:
随着微调进行,模型将概率质量集中在精确的训练序列上,这可能反而降低相似但不完全相同的验证样本的被分配概率。这导致训练 loss 轨迹与验证 loss 轨迹之间的背离------促进泛化的训练样本不保证有高 CLD 分数。
这一发现与 Xia et al. (2024) 的观察一致:与视觉不同,在指令微调中最小化验证 loss 不能可靠地改善模型性能。为 LLM 开发 CLD 式选择器需要设计任务适当的泛化代理指标,是重要的未来方向。
9.3 明确的局限
| 局限 | 说明 |
|---|---|
| 需要训练 loss 轨迹 | 不适用于模型作为黑盒部署的场景,或从预训练 checkpoint 微调而不完整重训的场景 |
| 需要留出验证集 | 减少了可用于训练的样本数量 |
| LLM 微调 | "挤压效应"导致训练-验证轨迹背离,难以直接套用 |
十、总结
核心要点
-
CLD 是什么:一个用 Pearson 相关系数衡量训练样本 loss 差分轨迹与验证集 loss 差分轨迹同步性的指标。高 CLD = 样本对泛化有正向贡献。
-
为什么有效:高 CLD 意味着样本梯度与验证集梯度方向对齐(引理1),这种对齐在 coreset 训练中保持稳定(引理2),从而保证 coreset 梯度近似全数据梯度(引理3),最终收敛误差有界(定理1)。
-
实验表现:
- ImageNet-1k 上全面领先,80% 子集即恢复全数据精度。
- CIFAR-100 上与最优方法差距 <1%。
- 跨架构迁移退化 <1%。
- 5 个种子间 MAE < 10 − 5 10^{-5} 10−5,高度可复现。
- 仅用早期 checkpoint(30/90)精度几乎不变。
-
效率优势:仅依赖训练中自然产生的 loss 标量,无需梯度/Hessian/特征。计算量与 AUM 等轻量方法相当,存储仅需 0.461 GB(ImageNet-1k 场景),远低于特征/图方法。
-
理论贡献 :收敛界中附加误差 ( B 2 κ + δ ) 2 (B\sqrt{2\kappa} + \delta)^2 (B2κ +δ)2 明确由对齐质量 κ \kappa κ 和验证集大小 Q Q Q 控制,且高 CLD 是必要条件(推论1),不只是充分条件。
论文的诚实之处
- 在 CIFAR-100 50% 子集上,诚实指出 DUAL(47.5)和 D2-Pruning(49.0)略优于 CLD(46.18)。
- 明确承认 CLD 不适用于 LLM 微调("挤压效应")和黑盒模型场景。
- 验证集质量实验坦诚展示了 CLD 受限于验证信号保真度的事实。
对实践者的启示
- 如果你的场景是有监督图像分类,CLD 是一个计算高效、理论有保证、跨架构可迁移的 coreset 选择方法。
- 如果计算预算极紧,DUAL 更便宜(仅用早期 proxy epoch),但要注意它在极小子集(1%)上可能崩溃。
- 如果验证集质量存疑(如有标签噪声),需要先清洗验证集------CLD 无法超越其验证信号的质量。
- 如果要用于 LLM 微调,需要先解决"挤压效应"问题,不能直接套用。
论文链接 :arXiv:2508.20230
代码:作者声明代码已在 GitHub 公开(见论文脚注1)。
资助:DARPA JUMP 2.0 CoCoSys 中心、SRC、NSF、Collins Aerospace。