机器遗忘

thesky1234563 小时前
大模型·红队·对齐·大模型安全·机器遗忘·越狱·拒答
27届大模型面试准备(二十八):大模型安全与对齐——越狱、红队、拒答与机器遗忘前面讲完后训练(A16 SFT/RLHF/DPO)和幻觉(A26),解决的分别是"让模型听话"和"让模型说真话"。但还有一个更尖锐的问题没正面回答:如果有人故意诱导模型干坏事,模型扛不扛得住?2023 年以来,越狱(jailbreak)、提示注入、数据投毒、模型提取层出不穷,安全与对齐(safety & alignment)已经从"可选加分项"变成大厂面试的必考题,甚至独立成岗。这是本系列第二十八篇。本文按"为什么要安全 → 攻击面全景(越狱/注入/投毒/提取)→ 越狱手法分类 → 防御手段(拒答/系统提
白拾4 天前
人工智能·机器遗忘·表示学习·医学影像ai·cvpr 2026·pour 论文分享·神经坍缩
【CVPR 2026】POUR:神经坍缩驱动的可证明最优表示级机器遗忘|从隐私合规与表示几何视角本文解读 CVPR 2026 论文《POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse》。该论文提出POUR(可证明最优的表示遗忘),通过融合Neural Collapse 的 simplex ETF 几何、表示级弱遗忘定义与RUS 评估指标,把"遗忘一个类"重述为沿该类方向做一次正交投影,其特别之处在于证明了 ETF 在正交投影下保持 ETF 结构、保留类仍 Bayes 最优。实验表明 PO
Better Bench2 年前
数据安全·攻击·思维导图·隐私保护·数据保护·机器遗忘
2024机器遗忘(Machine Unlearning)技术分类-思维导图机器遗忘(Machine Unlearning)是指从机器学习模型中安全地移除或"遗忘"特定的数据点或信息。这个概念源于数据隐私保护的需求,尤其是在欧盟通用数据保护条例(GDPR)等法规中提出的"被遗忘的权利"(Right to be Forgotten)。机器遗忘的目标是确保一旦用户请求删除其个人数据,相关的机器学习模型也能够相应地更新,以确保不再利用这些数据进行预测或分析。
我是有底线的