跳转至

Can Vision Models Truly Forget? Mirage: Representation-Level Certification of Visual Unlearning

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/YuZhenyuLindy/Mirage
领域: 优化/理论
关键词: 机器遗忘, 纵向联邦学习, 表征审计, 遗忘差距, 线性探针

一句话总结

针对视觉模型遗忘验证仅依赖输出端指标而掩盖表征残留的严重缺陷,本文提出表征级审计框架 Mirage,通过线性探针恢复度、CKA 全局对齐、特征可分性与逐层追踪四项诊断,揭示了“输出遗忘但表征残留”的遗忘假象以及效用、行为遗忘、表征遗忘无法兼得的三难困境。

研究背景与动机

在跨机构特征共享、医疗影像协作与模型服务化等合规受限场景中,模型必须满足“被遗忘权”以选择性清除特定类别或样本的记忆。现有的机器遗忘(Machine Unlearning)评估几乎完全建立在输出层行为之上,即检验保留类别准确率、遗忘目标预测概率的下降程度以及遗忘算法的计算开销。只要模型对指定遗忘目标的输出变得完全不可区分或趋于均匀分布,传统文献便判定遗忘过程已经完成。

然而,这种基于行为抑制的评估范式在深度视觉模型中存在致命漏洞。深度卷积网络与视觉主干将类别语义深度编码在高维特征几何空间中,类条件子空间在特征空间内部呈现天然的可分性与紧凑性。仅通过微调分类头或决策边界来压制最终预测输出,根本无法迫使深层表征空间中的内在类别结构发生瓦解。尤其在纵向联邦学习(VFL)等分布式场景下,多个参与方直接计算并向持有标签的主导方传输中间隐层嵌入,暴露在外的表征使攻击者或下游模块可以直接绕开被修改的分类器,通过简单的线性探测重新破译已被“遗忘”的私密信息。

输出端遗忘与表征级真正擦除之间的脱节,导致现有方法构建了一种脆弱的安全假象。为了建立可靠的合规审计基准,遗忘评估必须深入隐层几何空间,并以从头重新训练的参考模型为真值基准来度量表征层面的多余残留。核心 idea:提出表征级视觉遗忘审计框架 Mirage,以从头重训模型为几何参考基准,通过线性探针恢复度、结构相似度、特征可分性与逐层持久性四大互补诊断,形式化定义“遗忘差距”以彻底打破行为抑制所掩盖的遗忘假象。

方法详解

整体框架

Mirage 旨在全面诊断视觉遗忘模型是否真正实现了表征层面的信息消除,还是仅仅对分类器进行了浅层行为抑制。框架将待审计的遗忘模型与全量数据训练的原始模型、仅在保留集上从头训练的理想参考模型置于同一评测空间下。针对模型底层的特征嵌入,Mirage 依次执行四项互补诊断:利用线性探针检测遗忘类别的可解码性并计算遗忘差距;通过中心化核对齐(CKA)审视全局几何结构向重训基准的漂移趋势;借助无需训练的 Fisher 分离度打分量化特征几何的判别性;最后沿网络深度展开逐层分析,定位残存信息的层级穿透特征。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:原始模型 Θ* / 遗忘模型 Θu / 从头重训参考基准 Θr"] --> B["线性探针恢复度与遗忘差距<br/>冻结深层表征训练二分类探针,以重训基准标定过量恢复率"]
    B --> C["CKA 全局结构对齐审计<br/>计算跨模型特征内积对齐度,检验几何是保留原貌还是趋向重训"]
    C --> D["几何特征可分性评分<br/>基于类均值与协方差的 Fisher 判据,提供探针无关的几何间距度量"]
    D --> E["逐层表征持久性诊断<br/>跨浅层、中层与深层多尺度探测,揭示表征残留的纵深穿透性"]
    E --> F["输出:表征级遗忘认证结论<br/>精准判别行为抑制假象、全局表征崩塌与真正表征擦除"]

关键设计

1. 线性探针恢复度与遗忘差距:以从头重训基准标定过量表征残留

由于视觉表征在自然训练下即便从未接触过某一类别标签,也会由于通用视觉先验而在隐层自发聚集并具有一定的线性可分性,因此单纯看探针绝对分类准确率无法证明遗忘是否失败。Mirage 冻结被审计遗忘模型的特征提取器,在倒数第二层特征上训练一个带有 \(\ell_2\) 正则化的线性二分类探针,目标是区分输入样本属于遗忘集合还是保留集合。为了剔除内在视觉结构带来的自然可分性,Mirage 引入在保留集上从头重新训练的模型作为几何真值基准,形式化定义了表征层面的遗忘差距:

\[\Delta_{\text{LPR}} = \text{LPR}(\Theta_u) - \text{LPR}(\Theta_r)\]

其中 \(\text{LPR}(\Theta)\) 表示线性探针对模型特征的最佳分类准确率。当 \(\Delta_{\text{LPR}} > 0\) 时,表明遗忘模型在表征层保留了显著超出重训基准的类特异性结构。只有当遗忘差距收敛至零或在统计容差内时,表征层面的擦除才具备严格的认证基础。

2. CKA 全局结构对齐审计:全局几何相似度对齐检验

线性探针虽然能够敏锐捕捉特征的可解码性,却无法全面刻画表征空间的全局流形结构。Mirage 引入中心化核对齐(Centered Kernel Alignment, CKA)来对比遗忘模型、原始模型与重训模型之间的全局表征相似性。在相同的输入样本集上,提取两两模型在对应隐层的特征矩阵并进行中心化 Gram 矩阵相似度计算:

\[\text{CKA}(X, Y) = \frac{\|Y^\top X\|_F^2}{\|X^\top X\|_F \cdot \|Y^\top Y\|_F}\]

该指标具有正交变换不变性与各向同性缩放不变性。如果遗忘模型与原始模型的 CKA 相似度接近 1.0,而与从头重训模型的对齐度极低,则从全局几何视角证实了该算法并未对底层流形产生实质重构,而是几乎完整继承了原始模型的全部几何关系,输出端的所谓遗忘完全是分类头的浅层伪装。

3. 几何特征可分性评分:独立于优化的 Fisher 空间度量

线性探针的结果往往依赖优化迭代次数、学习率与正则化超参数的选择。为了提供一个完全不依赖探针训练过程的客观几何指标,Mirage 设计了受 Fisher 判别分析启发的特征可分性评分。通过直接统计遗忘集特征均值 \(\mu_u\) 与保留集特征均值 \(\mu_r\) 的欧氏间距,以及两类样本各自的协方差矩阵迹之和:

\[\mathcal{F} = \frac{\|\mu_u - \mu_r\|_2^2}{\mathrm{Tr}(\Sigma_u) + \mathrm{Tr}(\Sigma_r)}\]

在各向同性高斯假设下,该评分是特征空间信噪比(SNR)的归一化代理,且与线性分类器的理论贝叶斯最优准确率严格单调对应。若遗忘模型的可分性分数显著高于重训模型,便可直接在几何层面判定遗忘类仍然保持着异常的聚类与边界面,为探针解码能力提供了坚实的几何学解释。

4. 逐层表征持久性诊断:空间深度的表征穿透性追踪

遗忘操作对特征空间的影响并非在网络各层均匀分布。Mirage 将探针测试与几何分析沿主干网络逐层前推,在浅层、中间层与深层分别计算层级遗忘差距 \(\Delta_{\text{LPR}}^{(l)}\)。实测发现,许多试图通过修改损失函数来抹除特征的方法,其影响往往只局限在极靠近分类器的最顶层,而在中间表征层中,类别特征仍然高度可分且差距保持为正。这种逐层审计清晰刻画出表征残留如何在网络不同深度中潜伏,彻底封堵了仅在顶层打补丁的敷衍式遗忘。

损失函数 / 训练策略

Mirage 作为审计框架,其核心测试流程包括:使用逻辑回归(\(C=1.0\))在冻结特征上迭代训练 1000 次以构建探针;线性 CKA 使用 5000 个随机样本构建核矩阵以消除计算偏差;特征可分性评估使用遗忘类别全量数据与平衡抽样的保留集数据。所有对比实验在两方纵向联邦学习设定下展开,输入特征被平均切分至各被动方,主导方持有标签并运行分类器。

实验关键数据

主实验

在涵盖单标签遗忘(Class-level Unlearning)的七个数据集(包含六个视觉基准与一个文本基准)上,评估了主流遗忘算法在输出层与表征层的真实表现。如主实验表格所示,传统方法在输出指标与表征指标之间展现出巨大的断裂。

数据集 评估维度 / 指标 从头重训 (Retrain) 微调 (FT) 边界遗忘 (BU) SSD 目标方法 (Target)
CIFAR-10 保留精度 \(Acc_r\) (%) ↑ 89.7 89.7 47.4 89.6 24.1
遗忘标签精度 \(y_u\) (%) ↓ 0.0 48.5 0.0 88.2 0.0
探针恢复率 LPR (%) 82.8 90.4 86.8 91.3 82.0
遗忘差距 \(\Delta_{\text{LPR}}\) (%) +7.5 +4.0 +8.5 -0.8
原始模型 CKA 对齐度 0.989 0.999 0.956 1.000 0.928
特征可分性 \(\mathcal{F}\) 0.093 0.160 0.149 0.246 0.104
COVID-19 保留精度 \(Acc_r\) (%) ↑ 92.8 92.0 77.9 92.1 34.3
遗忘标签精度 \(y_u\) (%) ↓ 0.0 91.8 0.0 90.9 0.0
探针恢复率 LPR (%) 79.2 96.2 94.7 96.5 69.9
遗忘差距 \(\Delta_{\text{LPR}}\) (%) +17.0 +15.4 +17.3 -9.4
原始模型 CKA 对齐度 0.981 0.998 0.957 1.000 0.841
特征可分性 \(\mathcal{F}\) 0.031 0.280 0.115 0.340 0.089
Brain Tumor 保留精度 \(Acc_r\) (%) ↑ 99.1 98.5 72.4 98.8 33.3
遗忘标签精度 \(y_u\) (%) ↓ 0.0 77.4 0.0 74.7 0.0
探针恢复率 LPR (%) 79.8 91.8 88.1 91.5 79.9
遗忘差距 \(\Delta_{\text{LPR}}\) (%) +12.0 +8.3 +11.7 +0.1

消融实验

为了探究简单增加遗忘训练轮数能否消除表征残留(打破遗忘假象),作者以最具代表性的边界遗忘方法(Boundary Unlearning, BU)进行了不同遗忘轮数下的灵敏度分析。

遗忘轮数配置 (BU) CIFAR-10 \(Acc_r\) (%) CIFAR-10 \(\Delta_{\text{LPR}}\) (%) CIFAR-100 \(Acc_r\) (%) CIFAR-100 \(\Delta_{\text{LPR}}\) (%) COVID-19 \(Acc_r\) (%) COVID-19 \(\Delta_{\text{LPR}}\) (%)
Epoch 0 (从头重训基准) 89.7 62.2 92.7
Epoch 1 79.2 +4.4 57.4 +6.2 89.3 +15.9
Epoch 3 58.9 +4.5 42.3 +7.3 85.6 +15.1
Epoch 5 43.3 +2.9 32.9 +3.4 81.7 +15.1
Epoch 10 32.7 +2.0 25.5 +3.4 78.8 +14.9
Epoch 20 21.8 +0.6 22.0 +1.1 68.2 +15.9

关键发现

  • 遗忘假象的普遍性:以 Boundary Unlearning (BU) 为代表的先进算法,在输出端成功将遗忘类别精度压至 0.0%,呈现出完美的遗忘表象;但在 COVID-19 上其探针恢复率高达 94.7%,遗忘差距达到惊人的 +15.4 个百分点,且与原始模型的 CKA 结构相似度高达 0.957。增加训练轮数只能破坏保留集的实用性(CIFAR-10 精度从 79.2% 坠落至 21.8%),表征残留却始终顽固存在。
  • 不可兼得的遗忘三难困境(Unlearning Trilemma):现有方法在(1)保留集高精度实用性、(2)输出端彻底遗忘、(3)表征层遗忘差距收敛(低 \(\Delta_{\text{LPR}}\))之间陷入不可能三角。FT 与 SSD 保持了精度却无法遗忘;BU 实现了行为遗忘但表征残留严重;Target 与 Fisher 虽然在部分任务上打崩了探针恢复率,但付出了整体模型效用毁灭性崩塌(CIFAR-10 精度降至 10-24%)的代价,属于全局破坏而非选择性遗忘。
  • 类别级与样本级遗忘的鲜明不对称性:类别级遗忘在特征空间中留下了极难磨灭的聚类与几何痕迹(LPR 普遍超过 90%);而当遗忘目标换成 5% 或 10% 的随机样本时,所有方法(包括从头重训)的探针恢复率均在 50% 随机猜测水平徘徊。这证明类别信息依赖于稳定的全局子空间结构,而单样本从属关系并未在线性表征空间形成可分超平面,审计不同粒度的遗忘必须采用完全不同的数学工具。

亮点与洞察

  • 重训相对基准的理论严密性:巧妙地指出视觉表征的内在聚集性使得绝对探测准确率失去意义,创造性地以“从头重训模型”作为抵消通用语义先验的零点,使遗忘差距 \(\Delta_{\text{LPR}}\) 成为衡量过量残留的严格标尺。
  • 四维一体的立体审计闭环:结合了可学习解码能力(LPR)、全局流形形状(CKA)、参数无关几何间距(Fisher 可分性)以及纵深分布(逐层追踪),有效辨别出“行为浅层抑制”与“表征全局崩塌”这两种截然相反但同样失效的伪遗忘模式。
  • 对隐私合规实践的警示价值:在联邦学习或特征即服务(FaaS)体系中,向第三方传输“已遗忘目标”的特征极度危险,攻击者无需原始模型即可通过下游浅层探针轻易重建敏感信息,颠覆了传统基于混淆矩阵或困惑度的合规认证体系。

局限与展望

  • 线性探针的下界保守性:作者在文末承认,线性分类探针仅探测了特征空间中的一阶线性可分流形,属于可恢复信息的保守下界。若采用轻量多层感知机(MLP)或核方法等非线性探针,可能会捕获到更为深层的非线性拓扑残留。
  • 仅局限于审计而未提出原生消除算法:Mirage 本质是一套诊断评估协议,指出了当前遗忘领域的普遍困境与失效机理,但并未直接给出一个能同时完美兼顾三难困境的崭新正向优化算法。
  • 异构与横向联邦推广:当前评测主要基于特征切分的纵向联邦协议(VFL),未来需要将该表征几何认证体系进一步推广至异构客户端分布的横向联邦学习以及更大尺度的自监督多模态基准中。

相关工作与启发

  • vs 输出端遗忘评估 (Boundary Unlearning / SSD / UNSIR):以往工作将评估局限在 \(Acc_r\)\(y_u\) 的数值权衡,Mirage 证明了这些方法通过移动分类决策边界达成零误差预测,但完全没有触动底层卷积表征,存在严重的安全漏洞。
  • vs 差分隐私式理论遗忘 (Certified Unlearning):现有差分隐私与信息论认证通常局限于输出分布的理论有界性,Mirage 从经验表征几何与实际解码可恢复性切入,提供了更直观可验证的实证安全审计防线。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性揭露视觉遗忘中输出抑制与表征残留的脱节,提出以重训为基准的遗忘差距四维审计体系。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖七大基准数据集、七大主流基线算法,结合多方划分、训练轮数、逐层分析及类别/样本不对称性实验,论据极为扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑层层递进,形式化定义清晰严整,图表对比鲜明,深入剖析了表征几何与安全合规的内在联系。
  • 价值: ⭐⭐⭐⭐⭐ 为机器遗忘与隐私联邦学习领域敲响了警钟,对确立下一代合规表征审计标准具有重大指导意义。