摘要
本文解读 CVPR 2026 论文《POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse》。该论文提出POUR(可证明最优的表示遗忘) ,通过融合Neural Collapse 的 simplex ETF 几何 、表示级弱遗忘定义 与RUS 评估指标 ,把"遗忘一个类"重述为沿该类方向做一次正交投影,其特别之处在于证明了 ETF 在正交投影下保持 ETF 结构、保留类仍 Bayes 最优。实验表明 POUR-P 在 CIFAR-10 上达到 AUS 1.01(超过重训练上界)、遗忘类精度 0%,POUR-D 在表示级 RUS 上以 0.47 全面领先基线,为 GDPR 合规与医学影像等敏感场景的机器遗忘提供了重要借鉴。
视频讲解 :点击观看 B 站视频
- 摘要
- 论文基本信息
- [背景与动机:为什么 logit 对齐 ≠ 真正遗忘?](#背景与动机:为什么 logit 对齐 ≠ 真正遗忘?)
- 研究主线:从问题到结论
- [基准/方法设计:表示级弱遗忘 + RUS 指标](#基准/方法设计:表示级弱遗忘 + RUS 指标)
- 分类全景:机器遗忘方法的版图
- 方法细节:一次正交投影的遗忘
- 实验设计与结果
- 评测协议
- [CIFAR-10 主结果](#CIFAR-10 主结果)
- CIFAR-100(更困难的类纠缠场景)
- [PathMNIST 域偏移(内部 vs 外部测试)](#PathMNIST 域偏移(内部 vs 外部测试))
- [跨模态扩展(CLIP 文本嵌入遗忘)](#跨模态扩展(CLIP 文本嵌入遗忘))
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- [POUR 和传统机器遗忘方法的核心区别是什么?](#POUR 和传统机器遗忘方法的核心区别是什么?)
- [POUR-P 和 POUR-D 两个变体怎么选?](#POUR-P 和 POUR-D 两个变体怎么选?)
- [为什么 CIFAR-100 上所有方法都更困难?](#为什么 CIFAR-100 上所有方法都更困难?)
- [RUS 指标和 AUS 指标有什么区别?](#RUS 指标和 AUS 指标有什么区别?)
- [POUR 能在 LLM 或基础模型上直接用吗?](#POUR 能在 LLM 或基础模型上直接用吗?)
- [遗忘类在 POUR 之后变成什么?](#遗忘类在 POUR 之后变成什么?)
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse |
| 标题(中文) | 神经坍缩驱动的可证明最优表示级机器遗忘 |
| 作者 | Anjie Le · Can Peng · Yuyuan Liu · J. Alison Noble |
| 机构 | Institute of Biomedical Engineering, University of Oxford |
| 会议 | CVPR 2026 |
| arXiv | arXiv:2511.19339 |
| 项目网站 | github.com/ale256/representation_unlearning |
背景与动机:为什么 logit 对齐 ≠ 真正遗忘?
机器遗忘的目标,是让模型在不从头重训的前提下,移除特定类别或训练数据的影响。现有方法大多只对齐遗忘集与保留集的预测概率,被称为弱遗忘(weak unlearning)------但 Kim 等人 2025 年的研究用线性探测攻击证明:只扰动分类器 logits 并不会真正擦除内部表示中的知识,残余信息仍可被线性探测或特征反演恢复,带来隐私泄露风险。
关键问题在于:表示层仍在泄露 。此前的最相关工作 Kodge 等人 2024 年用 SVD 分解在激活空间做启发式投影遗忘,但缺少几何一致性与理论保证。与此同时,Papyan 等人 2020 年提出的 Neural Collapse 理论 揭示了深度分类器收敛后的几何规律:类特征集中在等距中心附近,分类器权重构成一个单纯形等角紧框架(simplex ETF)------每个类对应一条 ETF 方向,遗忘一个类,本质上就是移除这条方向。
从历史脉络看,机器遗忘经历了三个阶段:2021 年 SISA、梯度上升等范式建立(Bourtoule 2021, Graves 2021)→ 2024 年 SVD 投影做无保证的启发式擦除 → 2026 年 POUR 证明 ETF 投影不变性,让遗忘第一次拥有最优性定理。下图展示 POUR 在病理图像上的实际擦除效果。

图 1:PathMNIST 上 POUR 遗忘 adipose 类前后的 Grad-CAM:遗忘类激活完全消失,保留类(debris/lymphocytes/mucus)注意力保持清晰
理论层面,本文还给出一个三项目标分解:遗忘模型与重训练模型的特征分布差距,受类分离项、遗忘类差异项、保留类差异项共同约束。当类间分离弱时(如 CIFAR-100),仅用遗忘集的监督不足------这个理论预言精确解释了后续实验现象。
研究主线:从问题到结论

图 6:POUR 研究主线(Mermaid 流程图)------从表示层泄露问题到域偏移下全面 SOTA
基准/方法设计:表示级弱遗忘 + RUS 指标
本文先把弱遗忘的定义提升到表示层面:遗忘后模型的特征分布,必须与只用保留集重训的参考模型不可区分,即差距 \\mathcal{K}(P_z\^{\\mathcal{U}(M,\\mathcal{D}_f)}, P_z\^{M_r}) \< \\epsilon 对某个分布度量成立。
为了在实践中估计这个差距,作者引入 RUS(Representation Unlearning Score),把遗忘效力与保留保真两个目标用调和均值统一为 \\mathrm{RUS} = \\frac{2\\Phi_f\\,\\mathrm{CKA}_r}{\\Phi_f + \\mathrm{CKA}_r}。 其中保留保真 \\mathrm{CKA}_r 用 Centered Kernel Alignment 衡量,对特征旋转与缩放不变,鲁棒应对训练随机性;遗忘指标 \\Phi_f 取"偏离原模型"或"接近重训练参考"两种形式。RUS 取值 \[0,1\],两个目标缺一不可,随成功遗忘单调上升。CKA 定义式:\\mathrm{CKA}(X,Y) = \\frac{\\langle XX\^{\\top}, YY\^{\\top}\\rangle_F}{\|XX\^{\\top}\|_F \|YY\^{\\top}\|_F}。
分类全景:机器遗忘方法的版图

图 7:机器遗忘方法版图(Mermaid 流程图)------POUR 属于带理论保证的表示级擦除
方法细节:一次正交投影的遗忘
POUR 的核心建立在两个新的 Neural Collapse 理论性质上:
- ETF ⇒ Bayes 最优:在各向同性高斯假设下,单纯形 ETF 唯一最大化类均值间的最小夹角,极限下等价于 Bayes 最优分类器------保持 ETF 几何就等于保持最优分类能力。
- ETF 投影不变性(核心命题):设 P = I - v_u v_u\^{\\top} 为遗忘类方向的正交投影,则 {Pv_i / \|Pv_i\|}_{i \\neq u} 仍是 C-1 类的 simplex ETF------遗忘一个类不会破坏保留类的最优角分离。
基于此,POUR-P 用闭式投影 P = I - w_u w_u\^{\\top}/\|w_u\|\^2 直接作用于特征(z' = Pz),瞬时完成遗忘;当分类器权重不可得时(如视觉语言模型),用遗忘集特征的类均值估计 w_u。
POUR-D 是投影引导的蒸馏变体:把 POUR-P 投影后的模型作为教师,学生在遗忘集上最小化 L2 损失 \\mathcal{L}_{\\mathrm{POUR-D}}(x) = \|\\theta_s(x) - P\\theta(x)\|_2\^2,把遗忘效果下沉进特征提取器本身,通常几百步内收敛。

图 2:POUR 框架总览------训练时用正交投影算子移除遗忘类贡献,保留类 NC 几何不变,遗忘类预测退化为均匀分布
最优性定理保证:POUR-P 得到的保留类表示与重训练模型仅差一个正交变换(表示级差距为零),遗忘类特征坍缩到原点、预测均匀。一句话总结:遗忘被重述为"沿遗忘类方向做正交投影"------闭式、可解释、且有定理保证最优。
实验设计与结果
评测协议
实验遵循标准遗忘协议:只用遗忘集、不访问保留集、不干预原始训练。数据集:CIFAR-10/100(ResNet-18)、PathMNIST(ImageNet 预训练 ViT-S/16,评测内部+外部测试集考察域偏移)、CLIP 跨模态、VOC2012 分割。指标分两类:分类级(Acc_r、Acc_f、AUS)与表示级(rMIA、CKA、RUS),基线覆盖 Finetune、FCS、随机标签、梯度上升、边界收缩/扩展、DELETE。
CIFAR-10 主结果
| 方法 | Acc_r ↑ | Acc_f ↓ | AUS ↑ | RUS\^{(r)} ↑ |
|---|---|---|---|---|
| Gradient Ascent | 86.71 | 15.37 | 0.80 | 0.29 |
| Boundary Shrink | 85.30 | 12.33 | 0.81 | 0.42 |
| DELETE | 88.73 | 2.43 | 0.92 | 0.39 |
| POUR-P(ours) | 94.97 | 0.00 | 1.01 | -- |
| POUR-D(ours) | 92.86 | 0.37 | 0.97 | 0.47 |
| Retrained(上界) | 94.68 | 0.00 | 1.00 | 1.00 |
POUR-P 以 94.97% 保留精度实现 0% 遗忘类精度,AUS 1.01 甚至超过重训练上界;POUR-D 表示级 RUS 0.47 为全部 forget-set-only 方法最佳(DELETE 0.39、梯度上升 0.29)。

图 3:CIFAR-10 遗忘后表示空间 t-SNE------POUR 的保留类结构与重训练(Gold)模型最接近,遗忘类被压离原有流形
CIFAR-100(更困难的类纠缠场景)
| 方法 | Acc_r ↑ | Acc_f ↓ | AUS ↑ | RUS\^{(r)} ↑ | rMIA ↓ |
|---|---|---|---|---|---|
| Gradient Ascent | 50.46 | 6.00 | 0.69 | 0.44 | 50.00 |
| Random Label | 61.98 | 11.00 | 0.76 | 0.46 | 49.00 |
| DELETE | 64.67 | 8.00 | 0.81 | 0.58 | 60.00 |
| Boundary Shrink | 68.87 | 4.00 | 0.88 | 0.62 | 49.00 |
| POUR-P(ours) | 77.65 | 0.00 | 1.00 | -- | 62.00 |
| POUR-D(ours) | 73.44 | 1.00 | 0.95 | 0.65 | 46.00 |
CIFAR-100 类间纠缠更强、类分离更弱,理论预测的"遗忘集监督不足"现象确实出现;即便如此,POUR-P 仍以 77.65 保留精度实现完全遗忘,POUR-D 表示级(CKA_r、RUS、rMIA)全面领先。

图 4:CIFAR-100 遗忘后表示空间 t-SNE------即使类间纠缠更强,POUR 表示结构仍最接近重训练模型
PathMNIST 域偏移(内部 vs 外部测试)
| 方法 | 内 Acc_r | 内 Acc_f | 外 Acc_r | 外 Acc_f | 外 AUS |
|---|---|---|---|---|---|
| Random Label | 78.71 | 23.73 | 70.61 | 25.34 | 0.67 |
| Gradient Ascent | 81.43 | 9.03 | 76.72 | 10.61 | 0.81 |
| DELETE | 72.75 | 0.00 | 73.04 | 0.00 | 0.86 |
| POUR-P(ours) | 87.14 | 0.00 | 87.44 | 0.00 | 1.00 |
| POUR-D(ours) | 81.09 | 7.88 | 80.90 | 7.92 | 0.87 |
随机标签、梯度上升在外部测试集显著掉点,暴露其"学会掩盖遗忘集"而非真正擦除;POUR 两个域上均 AUS 1.00,证明真擦除能在域偏移下泛化,为预训练与基础模型的合规遗忘提供可行路径。
跨模态扩展(CLIP 文本嵌入遗忘)
词嵌入与视觉-语言模型嵌入呈近各向同性结构,几何遗忘原则可直接迁移。POUR-P 从图像编码器移除对应文本嵌入方向后,CIFAR-10 零样本设置下遗忘类准确率显著下降、其余类基本不变,还观察到概念纠缠现象(遗忘 airplane 影响 bird、遗忘 ocean 波及 ship)。

图 5:CLIP 零样本遗忘(CIFAR-10 前五类)------每色为遗忘一个类,柱高为该类准确率变化量
此外,VOC2012 语义分割遗忘实验中,遗忘类 IoU 消失而保留类 IoU 保持;分类器权重角分布与理想 ETF 角在三个数据集上几乎重合(PathMNIST 偏差 < 1.1°),验证了 NC 前提在实际训练中成立。
结果对比总结

图 8:结果对比总结(Mermaid 流程图)------分类级与表示级双维度 SOTA,域偏移下内外一致
关键发现
- 闭式遗忘超越重训上界:POUR-P 在 CIFAR-10 上 AUS 1.01、遗忘类精度 0.00%、保留精度 94.97%,全程无需训练,单次投影即可完成。
- 表示级遗忘真正发生:POUR-D 的 rMIA 降至 51.8(CIFAR-10)/ 46(CIFAR-100),均为 forget-set-only 方法最低,线性探测攻击成功率显著下降。
- 域偏移暴露"掩盖式"方法:随机标签、梯度上升在 PathMNIST 外部测试上大幅掉点(外 AUS 0.67/0.81 vs 内 0.74/0.86),POUR 内外一致 AUS 1.00。
- NC 前提在数据上成立:三个数据集分类器权重角分布与理想 ETF 角几乎重合,PathMNIST 偏差 < 1.1°。
- 跨模态可迁移:CLIP 文本嵌入遗忘精准降低对应类准确率,VOC2012 分割遗忘类 IoU 消失、保留类保持。
- 理论闭环完整:ETF 投影不变性(Prop.)+ Bayes 最优性(Prop.)+ 最优性定理(Thm.)三者互相印证,紧度证明显示投影模型与重训练模型仅差正交变换。
局限性
- 依赖 NC 假设:理论需要充分过参数化与训练收敛;NC 弱或部分坍缩时投影可能不再最优,POUR-P 修改表示的能力有限。
- 弱类分离时监督不足:理论分解表明仅用遗忘集的策略受限于重训练空间的类间距离,CIFAR-100 表现弱于 CIFAR-10 印证。
- RUS\^{(o)} 只是代理:无法访问重训练模型时,它以原模型为参考,衡量"相对变化"而非绝对最优对齐。
- 未来方向:动态估计 NC 强度、为部分坍缩表示设计自适应投影、推广到大规模预训练与多模态基础模型(CLIP / LLaVA 类共享子空间)。
常见问题(FAQ)
POUR 和传统机器遗忘方法的核心区别是什么?
传统方法(梯度上升、边界收缩、DELETE 等)只调整分类器层的输出分布,不动内部表示;POUR 直接在表示空间沿遗忘类方向做正交投影,并证明保留类的 ETF 几何不变、仍 Bayes 最优,从根源上消除表示层泄露。
POUR-P 和 POUR-D 两个变体怎么选?
POUR-P 是闭式投影,秒级完成、无需训练,适合只修改特征或分类头;POUR-D 用遗忘集做几百步蒸馏,把遗忘下沉进编码器参数,表示级指标(RUS、rMIA)更强,适合需要彻底修改骨干的场景。
为什么 CIFAR-100 上所有方法都更困难?
CIFAR-100 类间纠缠更强、类分离 \\Delta_c 更小,理论分解显示此时"仅用遗忘集"的监督信号不足,遗忘更难同时保留类结构------这也是本文理论直接预测的实验现象。
RUS 指标和 AUS 指标有什么区别?
AUS 只基于分类准确率(保留精度下降 + 遗忘类精度);RUS 基于特征表示的 CKA 相似度,量化的是表示层的遗忘与保留,能捕捉 AUS 看不到的"logit 对了但表示还在泄露"的情况。
POUR 能在 LLM 或基础模型上直接用吗?
CLIP 跨模态实验证明其几何原则可迁移到近各向同性嵌入空间(词嵌入、视觉-语言模型),作者也把大规模预训练与多模态基础模型列为未来方向;对非 ETF 几何的模型需先验证 NC 强度。
遗忘类在 POUR 之后变成什么?
投影后遗忘类特征坍缩到原点(Pv_u = 0),其在保留类上的 logits 全部消失,预测退化为保留类上的均匀分布(\\alpha = 0)------不偏向任何保留类,也不会残留可探测的旧知识。
参考链接
- arXiv:2511.19339 --- POUR 论文原文
- POUR 官方代码仓库(representation_unlearning)
- Papyan et al. --- Prevalence of Neural Collapse (PNAS 2020)
- Kodge et al. --- Deep Unlearning via SVD-based Representation Erasure (2024)
- Zhou et al. --- DELETE: Decoupled Unlearning(2025)
- CVPR 2026 官方主页
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群 :白拾的小屋 (750365700)
⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页 :YhbCode000(工程文件)