跳转至

Open-Vocabulary Domain Unlearning

会议: NeurIPS2026(录用信息来自任务元数据)
arXiv: 2609.31356
领域: 知识编辑 / 多模态 VLM
关键词: 开放词汇域遗忘、Fisher 掩码、定向流形散射、少样本学习、零样本保留

一句话总结

本文把视觉域遗忘从“训练过的类别上失效”推进到“未参与遗忘训练的类别也应失效”,通过 Fisher 掩码限制视觉参数更新,再用定向流形散射(TMS)强化局部几何扰动,在少样本 CLIP 分类实验中改善遗忘与保留的折中,但不构成数据删除或语义保留的认证保证。

研究背景与动机

视觉语言模型(VLM)可以用文本类别描述进行零样本识别,但物体语义与图像风格并不天然分离。域遗忘希望降低模型对某一种视觉风格的识别能力,同时保留其他风格下相同物体的识别能力。例如,遗忘卡通域并不等于删除“汽车”这个类别;目标是卡通汽车不再被正确分类,真实汽车仍然被正确分类。论文以自动驾驶和医学示意图为动机,实际验证则限于通用图像分类数据集,不能据此推断临床或驾驶安全收益。

既有 Approximate Domain Unlearning(ADU)在遗忘训练与测试中使用相同类别,可能只改坏若干“类别—风格”组合,却没有形成跨类别的域遗忘。本文将部分物体类别留出,要求这些类别在保留域仍可识别、在遗忘域也出现识别下降。难点在于,同一视觉参数可能同时服务于风格和语义:直接提升遗忘域的分类损失容易损坏保留域,提示调优配合最大均值差异(MMD)又可能产生受已见类别影响的整体特征位移。

本文将“更新哪些权重”和“遗忘特征向哪里变化”分开处理:前者用两种域的 Fisher 敏感度差异筛选,后者用具有明确目标的几何损失驱动,而不是只让分类错误变大。核心 idea:在限制更新的视觉参数上,使保留样本优先接近同类保留样本,同时把遗忘样本拉向异类保留样本,以尝试获得能够跨类别迁移的局部域遗忘。

方法详解

整体框架

输入为预训练 OpenCLIP、带类别及域标签的少量图像,以及指定的遗忘域和保留域。训练前估计参数对两类域的敏感度,得到固定 Fisher 掩码;训练中在该掩码约束下,联合优化保留分类、遗忘分类反向目标和 TMS 的两项几何约束。输出仍是视觉—文本分类模型,不增加推理时的域检测器。

开放词汇协议首先把类别划为互斥的已见集合与未见集合。已见类别比例取 \(\gamma\in\{0.25,0.50,0.75,1.0\}\),遗忘训练仅接触已见类别;测试覆盖两集合的并集,即全部类别,而不是仅测试未见类别。\(\gamma=1.0\) 没有类别留出,是闭词汇对照。因主表汇总已见与未见类别,整体 HM 提高不能直接替代未见类别单独的遗忘成绩。

Fisher 掩码、保留偏好、定向混淆是三个贡献组件;后两者在同一训练目标中并行作用,图中上下排列只表示解释顺序,不是先后训练两个网络。实线表示训练约束,虚线表示更新完成后的推理数据流。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["已见类别图像<br/>保留域 + 遗忘域"] --> B["Fisher 掩码"]
    A --> C["保留偏好"]
    A --> D["定向混淆"]
    B -->|参数更新门控| E["联合目标<br/>仅更新视觉权重"]
    C -->|TMS 保留项| E
    D -->|TMS 混淆项| E
    E --> F["更新后的 OpenCLIP"]
    G["测试图像 + 类别文本"] -.-> F
    F -.-> H["全部类别的分类结果"]

关键设计

1. Fisher 掩码:把更新集中到对遗忘域更敏感的视觉权重

论文先建立 NegGrad+Fisher 基线。普通 NegGrad 最小化保留域交叉熵、最大化遗忘域交叉熵,其梯度差为原文式(1):

\[ g_{i}^{\mathrm{NegGrad}}=\nabla_{\theta_{i}}\mathcal{L}_{\mathrm{CE}}(x_{r},y_{r};\theta)-\lambda\nabla_{\theta_{i}}\mathcal{L}_{\mathrm{CE}}(x_{f},y_{f};\theta) \]

只改变梯度符号并没有区分语义权重和风格权重。因此作者对两个域分别估计每个参数的对角经验 Fisher:对逐样本损失梯度平方取平均,而非取最大值,希望降低离群样本对重要性判断的影响。原文式(2)为:

\[ F_{\mathcal{D}}(i)=\frac{1}{N}\sum_{j=1}^{N}\left(\nabla_{\theta_{i}}\ell_{j}(\theta)\right)^{2} \]

再按原文式(3)计算归一化敏感度差,避免把两个域都很重要的参数简单视作域专属参数:

\[ \rho_{i}=\frac{F_{\mathcal{D}_{f}}(i)-F_{\mathcal{D}_{r}}(i)}{F_{\mathcal{D}_{f}}(i)+F_{\mathcal{D}_{r}}(i)+\epsilon} \]

仅允许 \(\rho_i>\tau\) 的参数更新,其余参数的梯度被置零。正文使用 \(\tau=0.3\);因此这里是敏感度阈值筛选,不是固定保留某个百分比的权重。掩码在遗忘训练前计算一次,后续保持固定,文本编码器始终冻结。主表的 Baseline 结合实验设置应理解为 NegGrad+Fisher,不是未编辑的原始模型。

这种选择的合理性在于,同类别的两个域共享部分语义,域敏感度差可能提供比单域梯度大小更有针对性的更新位置。然而,两个域都活跃并不推出语义参数必有 \(\rho_i\leq0\),风格和语义也未必可按坐标分离。原文把掩码等同于投影到语义零空间,并声称数学保证零样本保留;给出的对角梯度统计与二值筛选并未证明这一点。本笔记将其解释为经验性的干扰限制,而不是正交投影或保留定理。

2. 保留偏好:让保留样本更接近同类保留样本而非同类遗忘样本

单纯让遗忘样本分类失败,不能保证保留簇仍有清楚的结构。TMS 的第一项以保留嵌入为锚点,将同类保留嵌入设为正样本、同类遗忘嵌入设为不希望接近的样本。通过比较两个余弦相似度,模型被鼓励优先维持保留域内部的语义邻近关系。

原文式(5)如下,其中视觉嵌入做 L2 归一化,\(s\) 为余弦相似度,\(\sigma\) 为 sigmoid,\(\beta\) 为缩放系数,\(m_{\mathrm{retain}}\) 为偏好间隔:

\[ \mathcal{L}_{\mathrm{retain}}=\mathbb{E}_{(z_{r},z_{f})\mid y_{r}=y_{f}}\left[-\log\sigma\left(\beta\left(s(z_{r},z_{\mathrm{r\_pos}})-s(z_{r},z_{f})-m_{\mathrm{retain}}\right)\right)\right] \]

这不是冻结保留嵌入,而是通过相对偏好施加约束。它既维护同类保留聚合,也减少遗忘域同类样本对该簇的占据。损失作用于视觉编码器投影之前的 CLS-token 空间;分类交叉熵则继续约束最终视觉—文本分类,因此几何项与分类项并非完全重复。

3. 定向混淆:给遗忘嵌入一个异类的局部目标

受限于稀疏权重和少量已见类别,NegGrad 可能仅把样本推过分类边界,原有风格结构仍大体保留。TMS 不满足于“远离正确答案”,而是为每个遗忘嵌入选择当前最相似的异类保留嵌入,要求它们的相似度超过混淆间隔。这里的 hard mining 是在异类候选中取最大相似度,即寻找最容易混淆的局部目标,不是选最远的负样本。

原文式(6)为:

\[ \mathcal{L}_{\mathrm{confuse}}=\mathbb{E}_{z_{f}}\left[-\log\sigma\left(\beta\left(\max_{z_{r}\mid y_{r}\neq y_{f}}s(z_{f},z_{r})-m_{\mathrm{confuse}}\right)\right)\right] \]

不同遗忘样本可以靠近不同异类区域,因此作者希望形成分散的局部几何变化,而不是 MMD 式整体平移。log-sigmoid 对偏好差提供连续的软惩罚,区别于硬间隔铰链损失;不过候选最大值的切换仍可能不可微,不能把整个 hard-mining 目标称为处处光滑。将错误类别相似度提高也是一种可观察的表征扰动,不能自动证明风格信息已从模型中消失。

损失函数 / 训练策略

保留偏好与定向混淆按权重相加形成 TMS,原文式(7)为:

\[ \mathcal{L}_{\mathrm{TMS}}=w_{\mathrm{retain}}\mathcal{L}_{\mathrm{retain}}+w_{\mathrm{confuse}}\mathcal{L}_{\mathrm{confuse}} \]

再加入保留交叉熵与负的遗忘交叉熵,原文式(8)为:

\[ \mathcal{L}_{\mathrm{total}}=(1-\lambda_{\mathrm{ce}})\mathcal{L}_{\mathrm{retain\_CE}}-\lambda_{\mathrm{ce}}\mathcal{L}_{\mathrm{forget\_CE}}+\lambda_{\mathrm{pref}}\mathcal{L}_{\mathrm{TMS}} \]

负号意味着优化时提高遗忘域分类损失,而不是训练该域正确分类。正文实现另说明按保留与遗忘样本占比分别动态缩放两个交叉熵项;它没有完整交代这种缩放与式(8)中 \(\lambda_{\mathrm{ce}}\) 的对应关系,因此不将二者自行合并成作者未给出的公式。

主实验采用 OpenCLIP ViT-B/16,8-shot,AdamW,学习率 \(1\times10^{-5}\),训练 10 epochs。附录补充 batch size 64、weight decay \(1\times10^{-2}\)、A100 40GB,每个配置重建优化器并从同一预训练权重开始。Fisher 用 10 个 minibatches 预估;正文不提供实测运行时间,附录的计算效率主要是定性讨论。

附录设置 \(\beta=0.1\)、\(m_{\mathrm{retain}}=0\)、\(w_{\mathrm{retain}}=w_{\mathrm{confuse}}=1\)。网格搜索范围为 \(\lambda_{pref}\in\{0.5,1.0,2.0,5.0\}\) 和 \(m_{confuse}\in\{0.3,0.5,0.75\}\),但没有列出每种设置最终选值。附录还说明一种经验证阈值得到的多域 rank-matched 掩码:平均各域掩码大小,在混合遗忘域重算敏感度并选 top-k;不能把它与正文固定阈值版本不加区别地视为同一配置。

实验关键数据

主实验

三个分类基准各有四个域:OfficeHome 为 65 类,Mini-DomainNet 为 126 类,PACS 为 7 类;主表将 Mini-DomainNet 简写为 DomainNet。每次指定一个遗忘域,其余为保留域;以下保持原表的 F / R / HM 数值顺序,单位为 %,测试覆盖所有类别。

F 是遗忘域分类准确率,越低越好;R 是保留域分类准确率,越高越好。HM 衡量 R 与遗忘率的调和平均,不是 R 与 F 的调和平均:

\[ \mathcal{E}=100-\mathcal{A}_{f},\qquad \mathcal{H}=\frac{2\cdot\mathcal{A}_{r}\cdot\mathcal{E}}{\mathcal{A}_{r}+\mathcal{E}} \]
数据集 方法 0.25:F / R / HM 0.50:F / R / HM 0.75:F / R / HM 1.0:F / R / HM
OfficeHome Baseline 59.54 / 65.65 / 50.07 51.62 / 67.92 / 56.51 36.97 / 71.90 / 67.17 31.31 / 77.90 / 73.01
OfficeHome ADU 21.97 / 27.61 / 40.79 28.26 / 49.22 / 58.38 33.63 / 67.96 / 67.16 36.37 / 80.36 / 71.02
OfficeHome TMS 53.33 / 63.24 / 53.71 39.34 / 68.33 / 64.27 24.90 / 68.68 / 71.75 24.61 / 75.45 / 75.42
DomainNet Baseline 55.58 / 77.72 / 56.53 27.98 / 77.08 / 74.46 20.04 / 77.24 / 78.58 18.02 / 77.77 / 79.82
DomainNet ADU 14.64 / 24.45 / 38.01 19.68 / 49.25 / 61.06 23.41 / 67.27 / 71.63 27.86 / 81.48 / 76.53
DomainNet TMS 34.04 / 74.97 / 70.18 20.06 / 75.39 / 77.60 14.60 / 75.97 / 80.41 14.44 / 76.84 / 80.97
PACS Baseline 78.64 / 90.02 / 34.52 57.75 / 93.76 / 58.25 59.40 / 93.42 / 56.60 41.01 / 95.60 / 72.96
PACS ADU 64.97 / 28.65 / 31.52 64.07 / 59.53 / 44.81 68.36 / 74.40 / 44.40 72.48 / 93.16 / 42.49
PACS TMS 76.085 / 90.39 / 37.82 47.06 / 93.49 / 67.60 47.07 / 93.24 / 67.53 38.35 / 95.64 / 74.97

数据来自原文表 1;76.085 保留原有精度。论文说明多次独立运行取平均,但没有给出运行次数或置信区间。聚合 HM 未必等于把表内聚合 F、R 再代入公式的结果,因此保留作者数字,不自行“修正”。

消融实验

下表截取表 2 的整体平均及局部反例,以区分“平均最优”与“每个域都最优”。配置分别只保留 TMS 混淆项、只保留 TMS 保留项、同时保留两项;不要把它解释成移除了基础交叉熵或 Fisher 掩码。

遗忘域 / 汇总 类别比例 Confuse Only:F / R / HM Retain Only:F / R / HM Both:F / R / HM
Clipart 1.00 16.03 / 78.10 / 80.93 18.73 / 77.78 / 79.49 17.30 / 77.08 / 79.79
Real 0.50 31.27 / 71.48 / 70.08 38.57 / 72.86 / 66.66 32.38 / 72.70 / 70.06
Sketch 0.50 14.44 / 75.08 / 79.98 13.49 / 76.98 / 81.47 12.53 / 75.23 / 80.88
DomainNet (Avg) 0.50 21.67 / 75.49 / 76.81 24.68 / 77.06 / 75.97 20.06 / 75.39 / 77.60
DomainNet (Avg) 1.00 17.30 / 77.53 / 79.97 17.90 / 77.59 / 79.69 14.44 / 76.84 / 80.97

两项结合在整体平均 HM 上最好,但 Clipart 1.00、Real 0.50、Sketch 0.50 分别有单项更好的情况。因此“两个组件对每个设置都严格必要”超出了表 2 能支持的结论。

为核对语义保留,表 4 另报告遗忘 DomainNet 某个域后的外部零样本分类;表题未注明对应类别比例,不能自行假定为某个开放词汇配置。

遗忘域 方法 ImageNet-val (%) CIFAR-100 (%)
无遗忘 Base Model 63.38 61.99
Clipart Baseline 54.11 57.40
Clipart ADU 36.73 49.37
Clipart TMS 57.33 57.50
Painting Baseline 51.76 50.45
Painting ADU 28.45 32.54
Painting TMS 49.30 52.26
Sketch Baseline 46.87 52.49
Sketch ADU 39.42 57.01
Sketch TMS 48.82 56.21

关键发现

  • 表 1 中 TMS 在三个数据集、四种比例上都取得最高 HM,但不总有最低 F 或最高 R。例如 DomainNet 0.25 的 ADU 遗忘更强,却把 R 降到 24.45;TMS 的 R 为 74.97,HM 为 70.18。
  • 多域表 3 遗忘三个域时,TMS 在前三种比例的 HM 为 73.05、75.34、78.02,均优于对照;1.0 时 ADU 的 80.02 高于 TMS 的 78.86。多域并非所有设置都由 TMS 最优。
  • 图 3 配套正文报告 4-shot 的 HM:1.0 时为 80.80,对比 8-shot Baseline 79.76、ADU 76.53;0.5 时为 76.79,对比 74.09、61.06。两个 Baseline 数字与表 1 的 79.82、74.46 不一致,原文未解释,保留两组出处而不合并。
  • 表 4 支持相对 ADU 的保留改进,但所有 TMS 外部准确率仍低于原始模型;Painting 的 ImageNet 为 49.30,低于 Baseline 51.76,Sketch 的 CIFAR-100 为 56.21,低于 ADU 57.01。正文“所有域均最佳”的表述不成立。
  • 附录表 5–7 在 ViT-L-14 上补充结果。例如表 5 的 Real、8-shot、0.5:Baseline 的 F / R / HM 为 0.8651 / 0.8386 / 0.2324,TMS 为 0.2937 / 0.8069 / 0.7533;这里是 0–1 比例,不是主表的百分数。

亮点与洞察

  • 评测类别与遗忘训练类别分离比只看已见类别更加严格。它能暴露“改坏训练类别”和“跨类别风格抑制”之间的差别,但仍应补充未见类别独立结果。
  • 敏感度差异筛选与几何目标解决不同问题:前者限制干扰位置,后者给出局部扰动方向。与只增加分类损失相比,这种组合更容易解释少样本下的结构性变化。
  • 保留项与混淆项不是简单镜像。一个以保留样本作锚点维护同类关系,另一个以遗忘样本作锚点寻找异类目标,允许局部遗忘而不强制全局域平移。

局限与展望

  • 作者承认对角 Fisher 忽略参数间依赖,并建议研究更丰富的敏感度结构;当前二值掩码没有提供语义零空间或零样本保留的证明。
  • 冻结文本编码器限制了干预范围,作者也指出可能存在跨模态残留。分类准确率降低只说明当前评测下识别受损,不代表训练数据影响已被认证删除。
  • 主表覆盖全部类别,缺少已见与未见分项、重复次数、误差条,以及明确的验证类别划分。后续应在避免未见类别参与调参的条件下,单独报告遗忘迁移与保留损伤。
  • 没有 Fisher 移除、阈值扫描或直接几何测量足以单独归因其“语义保护”作用。可补充与特征子空间约束的同预算比较,但不能预先假设二者等价。
  • 4-shot 优势、外部测试最优和多域普适最优等叙述需要按表格边界收窄。通用风格分类结果也不能替代真实部署的风险评估。

相关工作与启发

  • vs ADU:ADU 通过提示调优与 MMD 分离域分布;本文改用受限视觉权重更新与样本级几何目标,并强调跨类别测试。局部几何扰动比全局位移更有针对性,但这里的比较不证明所有 MMD 或提示调优都会失败。
  • vs NegGrad+Fisher:双方使用相同类型的参数门控;TMS 新增保留偏好与异类混淆,主表支持其平均折中收益。提升不能被简单归为“首次使用 Fisher”。
  • vs DPO / NPO:本文借用 log-sigmoid 偏好形式,但优化的是视觉相似度差,不是语言生成序列概率。没有原版 DPO 的参考策略概率比,不能将两者机制完全等同。
  • vs SEMU:附录认为域子空间高度重叠妨碍直接 SVD 式隔离;图 4–5 提供定性补充,缓存没有可引用的 SEMU 数值表。值得进一步研究的线索是:用独立未见类别评测检验敏感度筛选是否真正减小语义干扰,而不只提升聚合 HM。

评分

  • 新颖性: 4/5 — 跨类别域遗忘协议与局部几何目标的组合有明确价值。
  • 实验充分度: 3/5 — 有三基准、消融、多域与更大骨干,但未见类别分项和统计信息不足。
  • 写作质量: 3/5 — 方法较清楚,数学保证和若干最优性叙述超出证据。
  • 价值: 4/5 — 提供更严格的域遗忘评测视角,实际使用仍需独立验证与保留审计。