【CVPR 2026】POUR:神经坍缩驱动的可证明最优表示级机器遗忘|从隐私合规与表示几何视角

摘要

本文解读 CVPR 2026 论文《POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse》。该论文提出POUR(可证明最优的表示遗忘) ,通过融合Neural Collapse 的 simplex ETF 几何表示级弱遗忘定义RUS 评估指标 ,把"遗忘一个类"重述为沿该类方向做一次正交投影,其特别之处在于证明了 ETF 在正交投影下保持 ETF 结构、保留类仍 Bayes 最优。实验表明 POUR-P 在 CIFAR-10 上达到 AUS 1.01(超过重训练上界)、遗忘类精度 0%,POUR-D 在表示级 RUS 上以 0.47 全面领先基线,为 GDPR 合规与医学影像等敏感场景的机器遗忘提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse
标题(中文) 神经坍缩驱动的可证明最优表示级机器遗忘
作者 Anjie Le · Can Peng · Yuyuan Liu · J. Alison Noble
机构 Institute of Biomedical Engineering, University of Oxford
会议 CVPR 2026
arXiv arXiv:2511.19339
项目网站 github.com/ale256/representation_unlearning

背景与动机:为什么 logit 对齐 ≠ 真正遗忘?

机器遗忘的目标,是让模型在不从头重训的前提下,移除特定类别或训练数据的影响。现有方法大多只对齐遗忘集与保留集的预测概率,被称为弱遗忘(weak unlearning)------但 Kim 等人 2025 年的研究用线性探测攻击证明:只扰动分类器 logits 并不会真正擦除内部表示中的知识,残余信息仍可被线性探测或特征反演恢复,带来隐私泄露风险。

关键问题在于:表示层仍在泄露 。此前的最相关工作 Kodge 等人 2024 年用 SVD 分解在激活空间做启发式投影遗忘,但缺少几何一致性与理论保证。与此同时,Papyan 等人 2020 年提出的 Neural Collapse 理论 揭示了深度分类器收敛后的几何规律:类特征集中在等距中心附近,分类器权重构成一个单纯形等角紧框架(simplex ETF)------每个类对应一条 ETF 方向,遗忘一个类,本质上就是移除这条方向。

从历史脉络看,机器遗忘经历了三个阶段:2021 年 SISA、梯度上升等范式建立(Bourtoule 2021, Graves 2021)→ 2024 年 SVD 投影做无保证的启发式擦除 → 2026 年 POUR 证明 ETF 投影不变性,让遗忘第一次拥有最优性定理。下图展示 POUR 在病理图像上的实际擦除效果。

图 1:PathMNIST 上 POUR 遗忘 adipose 类前后的 Grad-CAM:遗忘类激活完全消失,保留类(debris/lymphocytes/mucus)注意力保持清晰

理论层面,本文还给出一个三项目标分解:遗忘模型与重训练模型的特征分布差距,受类分离项、遗忘类差异项、保留类差异项共同约束。当类间分离弱时(如 CIFAR-100),仅用遗忘集的监督不足------这个理论预言精确解释了后续实验现象。

研究主线:从问题到结论

图 6:POUR 研究主线(Mermaid 流程图)------从表示层泄露问题到域偏移下全面 SOTA

基准/方法设计:表示级弱遗忘 + RUS 指标

本文先把弱遗忘的定义提升到表示层面:遗忘后模型的特征分布,必须与只用保留集重训的参考模型不可区分,即差距 \\mathcal{K}(P_z\^{\\mathcal{U}(M,\\mathcal{D}_f)}, P_z\^{M_r}) \< \\epsilon 对某个分布度量成立。

为了在实践中估计这个差距,作者引入 RUS(Representation Unlearning Score),把遗忘效力与保留保真两个目标用调和均值统一为 \\mathrm{RUS} = \\frac{2\\Phi_f\\,\\mathrm{CKA}_r}{\\Phi_f + \\mathrm{CKA}_r}。 其中保留保真 \\mathrm{CKA}_r 用 Centered Kernel Alignment 衡量,对特征旋转与缩放不变,鲁棒应对训练随机性;遗忘指标 \\Phi_f 取"偏离原模型"或"接近重训练参考"两种形式。RUS 取值 \[0,1\],两个目标缺一不可,随成功遗忘单调上升。CKA 定义式:\\mathrm{CKA}(X,Y) = \\frac{\\langle XX\^{\\top}, YY\^{\\top}\\rangle_F}{\|XX\^{\\top}\|_F \|YY\^{\\top}\|_F}

分类全景:机器遗忘方法的版图

图 7:机器遗忘方法版图(Mermaid 流程图)------POUR 属于带理论保证的表示级擦除

方法细节:一次正交投影的遗忘

POUR 的核心建立在两个新的 Neural Collapse 理论性质上:

  1. ETF ⇒ Bayes 最优:在各向同性高斯假设下,单纯形 ETF 唯一最大化类均值间的最小夹角,极限下等价于 Bayes 最优分类器------保持 ETF 几何就等于保持最优分类能力。
  2. ETF 投影不变性(核心命题):设 P = I - v_u v_u\^{\\top} 为遗忘类方向的正交投影,则 {Pv_i / \|Pv_i\|}_{i \\neq u} 仍是 C-1 类的 simplex ETF------遗忘一个类不会破坏保留类的最优角分离。

基于此,POUR-P 用闭式投影 P = I - w_u w_u\^{\\top}/\|w_u\|\^2 直接作用于特征(z' = Pz),瞬时完成遗忘;当分类器权重不可得时(如视觉语言模型),用遗忘集特征的类均值估计 w_u

POUR-D 是投影引导的蒸馏变体:把 POUR-P 投影后的模型作为教师,学生在遗忘集上最小化 L2 损失 \\mathcal{L}_{\\mathrm{POUR-D}}(x) = \|\\theta_s(x) - P\\theta(x)\|_2\^2,把遗忘效果下沉进特征提取器本身,通常几百步内收敛。

图 2:POUR 框架总览------训练时用正交投影算子移除遗忘类贡献,保留类 NC 几何不变,遗忘类预测退化为均匀分布

最优性定理保证:POUR-P 得到的保留类表示与重训练模型仅差一个正交变换(表示级差距为零),遗忘类特征坍缩到原点、预测均匀。一句话总结:遗忘被重述为"沿遗忘类方向做正交投影"------闭式、可解释、且有定理保证最优。

实验设计与结果

评测协议

实验遵循标准遗忘协议:只用遗忘集、不访问保留集、不干预原始训练。数据集:CIFAR-10/100(ResNet-18)、PathMNIST(ImageNet 预训练 ViT-S/16,评测内部+外部测试集考察域偏移)、CLIP 跨模态、VOC2012 分割。指标分两类:分类级(Acc_r、Acc_f、AUS)与表示级(rMIA、CKA、RUS),基线覆盖 Finetune、FCS、随机标签、梯度上升、边界收缩/扩展、DELETE。

CIFAR-10 主结果

方法 Acc_r Acc_f AUS ↑ RUS\^{(r)}
Gradient Ascent 86.71 15.37 0.80 0.29
Boundary Shrink 85.30 12.33 0.81 0.42
DELETE 88.73 2.43 0.92 0.39
POUR-P(ours) 94.97 0.00 1.01 --
POUR-D(ours) 92.86 0.37 0.97 0.47
Retrained(上界) 94.68 0.00 1.00 1.00

POUR-P 以 94.97% 保留精度实现 0% 遗忘类精度,AUS 1.01 甚至超过重训练上界;POUR-D 表示级 RUS 0.47 为全部 forget-set-only 方法最佳(DELETE 0.39、梯度上升 0.29)。

图 3:CIFAR-10 遗忘后表示空间 t-SNE------POUR 的保留类结构与重训练(Gold)模型最接近,遗忘类被压离原有流形

CIFAR-100(更困难的类纠缠场景)

方法 Acc_r Acc_f AUS ↑ RUS\^{(r)} rMIA ↓
Gradient Ascent 50.46 6.00 0.69 0.44 50.00
Random Label 61.98 11.00 0.76 0.46 49.00
DELETE 64.67 8.00 0.81 0.58 60.00
Boundary Shrink 68.87 4.00 0.88 0.62 49.00
POUR-P(ours) 77.65 0.00 1.00 -- 62.00
POUR-D(ours) 73.44 1.00 0.95 0.65 46.00

CIFAR-100 类间纠缠更强、类分离更弱,理论预测的"遗忘集监督不足"现象确实出现;即便如此,POUR-P 仍以 77.65 保留精度实现完全遗忘,POUR-D 表示级(CKA_r、RUS、rMIA)全面领先。

图 4:CIFAR-100 遗忘后表示空间 t-SNE------即使类间纠缠更强,POUR 表示结构仍最接近重训练模型

PathMNIST 域偏移(内部 vs 外部测试)

方法 内 Acc_r 内 Acc_f 外 Acc_r 外 Acc_f 外 AUS
Random Label 78.71 23.73 70.61 25.34 0.67
Gradient Ascent 81.43 9.03 76.72 10.61 0.81
DELETE 72.75 0.00 73.04 0.00 0.86
POUR-P(ours) 87.14 0.00 87.44 0.00 1.00
POUR-D(ours) 81.09 7.88 80.90 7.92 0.87

随机标签、梯度上升在外部测试集显著掉点,暴露其"学会掩盖遗忘集"而非真正擦除;POUR 两个域上均 AUS 1.00,证明真擦除能在域偏移下泛化,为预训练与基础模型的合规遗忘提供可行路径。

跨模态扩展(CLIP 文本嵌入遗忘)

词嵌入与视觉-语言模型嵌入呈近各向同性结构,几何遗忘原则可直接迁移。POUR-P 从图像编码器移除对应文本嵌入方向后,CIFAR-10 零样本设置下遗忘类准确率显著下降、其余类基本不变,还观察到概念纠缠现象(遗忘 airplane 影响 bird、遗忘 ocean 波及 ship)。

图 5:CLIP 零样本遗忘(CIFAR-10 前五类)------每色为遗忘一个类,柱高为该类准确率变化量

此外,VOC2012 语义分割遗忘实验中,遗忘类 IoU 消失而保留类 IoU 保持;分类器权重角分布与理想 ETF 角在三个数据集上几乎重合(PathMNIST 偏差 < 1.1°),验证了 NC 前提在实际训练中成立。

结果对比总结

图 8:结果对比总结(Mermaid 流程图)------分类级与表示级双维度 SOTA,域偏移下内外一致

关键发现

  • 闭式遗忘超越重训上界:POUR-P 在 CIFAR-10 上 AUS 1.01、遗忘类精度 0.00%、保留精度 94.97%,全程无需训练,单次投影即可完成。
  • 表示级遗忘真正发生:POUR-D 的 rMIA 降至 51.8(CIFAR-10)/ 46(CIFAR-100),均为 forget-set-only 方法最低,线性探测攻击成功率显著下降。
  • 域偏移暴露"掩盖式"方法:随机标签、梯度上升在 PathMNIST 外部测试上大幅掉点(外 AUS 0.67/0.81 vs 内 0.74/0.86),POUR 内外一致 AUS 1.00。
  • NC 前提在数据上成立:三个数据集分类器权重角分布与理想 ETF 角几乎重合,PathMNIST 偏差 < 1.1°。
  • 跨模态可迁移:CLIP 文本嵌入遗忘精准降低对应类准确率,VOC2012 分割遗忘类 IoU 消失、保留类保持。
  • 理论闭环完整:ETF 投影不变性(Prop.)+ Bayes 最优性(Prop.)+ 最优性定理(Thm.)三者互相印证,紧度证明显示投影模型与重训练模型仅差正交变换。

局限性

  • 依赖 NC 假设:理论需要充分过参数化与训练收敛;NC 弱或部分坍缩时投影可能不再最优,POUR-P 修改表示的能力有限。
  • 弱类分离时监督不足:理论分解表明仅用遗忘集的策略受限于重训练空间的类间距离,CIFAR-100 表现弱于 CIFAR-10 印证。
  • RUS\^{(o)} 只是代理:无法访问重训练模型时,它以原模型为参考,衡量"相对变化"而非绝对最优对齐。
  • 未来方向:动态估计 NC 强度、为部分坍缩表示设计自适应投影、推广到大规模预训练与多模态基础模型(CLIP / LLaVA 类共享子空间)。

常见问题(FAQ)

POUR 和传统机器遗忘方法的核心区别是什么?

传统方法(梯度上升、边界收缩、DELETE 等)只调整分类器层的输出分布,不动内部表示;POUR 直接在表示空间沿遗忘类方向做正交投影,并证明保留类的 ETF 几何不变、仍 Bayes 最优,从根源上消除表示层泄露。

POUR-P 和 POUR-D 两个变体怎么选?

POUR-P 是闭式投影,秒级完成、无需训练,适合只修改特征或分类头;POUR-D 用遗忘集做几百步蒸馏,把遗忘下沉进编码器参数,表示级指标(RUS、rMIA)更强,适合需要彻底修改骨干的场景。

为什么 CIFAR-100 上所有方法都更困难?

CIFAR-100 类间纠缠更强、类分离 \\Delta_c 更小,理论分解显示此时"仅用遗忘集"的监督信号不足,遗忘更难同时保留类结构------这也是本文理论直接预测的实验现象。

RUS 指标和 AUS 指标有什么区别?

AUS 只基于分类准确率(保留精度下降 + 遗忘类精度);RUS 基于特征表示的 CKA 相似度,量化的是表示层的遗忘与保留,能捕捉 AUS 看不到的"logit 对了但表示还在泄露"的情况。

POUR 能在 LLM 或基础模型上直接用吗?

CLIP 跨模态实验证明其几何原则可迁移到近各向同性嵌入空间(词嵌入、视觉-语言模型),作者也把大规模预训练与多模态基础模型列为未来方向;对非 ETF 几何的模型需先验证 NC 强度。

遗忘类在 POUR 之后变成什么?

投影后遗忘类特征坍缩到原点(Pv_u = 0),其在保留类上的 logits 全部消失,预测退化为保留类上的均匀分布(\\alpha = 0)------不偏向任何保留类,也不会残留可探测的旧知识。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
IvanCodes4 小时前
RAG 实战教程(一):RAG 工作原理与完整流程——分片、索引、召回、重排和生成
人工智能·后端·agent
今天AI了吗5 小时前
合规场景下的 AI 推理可解释性:Attention 可视化与推理路径追踪的工程实践
人工智能
周末程序猿5 小时前
浅析大模型推理十二篇之KV Cache
人工智能
鱼樱前端5 小时前
用 AI 做内容变收入
前端·人工智能·ai编程
Dawson Zhu6 小时前
基于Palantir Foundry构建半导体制造AI友好型数据中台:从良率分析场景谈起
人工智能·语言模型·架构·制造·agi
fthux6 小时前
装闭 RenoPit 源码解析(04):装修图纸和合同文件上传处理流程
人工智能·ai·开源·github·open source·renopit
weixin_446260857 小时前
从被动镜像到主动智能体:面向网络物理人工智能的整体论数字孪生(HDT-Net)
网络·人工智能
秋枫要学习7 小时前
你的鼠标,正在被 AI 抢走
人工智能·计算机外设
满怀冰雪8 小时前
19-图像数据处理:PaddleVision Transform 实战
人工智能·深度学习·计算机视觉·paddle