Open-Vocabulary Domain Unlearning¶
会议: NeurIPS2026(录用信息来自任务元数据)
arXiv: 2609.31356
领域: 知识编辑 / 多模态 VLM
关键词: 开放词汇域遗忘、Fisher 掩码、定向流形散射、少样本学习、零样本保留
一句话总结¶
本文把视觉域遗忘从“训练过的类别上失效”推进到“未参与遗忘训练的类别也应失效”,通过 Fisher 掩码限制视觉参数更新,再用定向流形散射(TMS)强化局部几何扰动,在少样本 CLIP 分类实验中改善遗忘与保留的折中,但不构成数据删除或语义保留的认证保证。
研究背景与动机¶
视觉语言模型(VLM)可以用文本类别描述进行零样本识别,但物体语义与图像风格并不天然分离。域遗忘希望降低模型对某一种视觉风格的识别能力,同时保留其他风格下相同物体的识别能力。例如,遗忘卡通域并不等于删除“汽车”这个类别;目标是卡通汽车不再被正确分类,真实汽车仍然被正确分类。论文以自动驾驶和医学示意图为动机,实际验证则限于通用图像分类数据集,不能据此推断临床或驾驶安全收益。
既有 Approximate Domain Unlearning(ADU)在遗忘训练与测试中使用相同类别,可能只改坏若干“类别—风格”组合,却没有形成跨类别的域遗忘。本文将部分物体类别留出,要求这些类别在保留域仍可识别、在遗忘域也出现识别下降。难点在于,同一视觉参数可能同时服务于风格和语义:直接提升遗忘域的分类损失容易损坏保留域,提示调优配合最大均值差异(MMD)又可能产生受已见类别影响的整体特征位移。
本文将“更新哪些权重”和“遗忘特征向哪里变化”分开处理:前者用两种域的 Fisher 敏感度差异筛选,后者用具有明确目标的几何损失驱动,而不是只让分类错误变大。核心 idea:在限制更新的视觉参数上,使保留样本优先接近同类保留样本,同时把遗忘样本拉向异类保留样本,以尝试获得能够跨类别迁移的局部域遗忘。
方法详解¶
整体框架¶
输入为预训练 OpenCLIP、带类别及域标签的少量图像,以及指定的遗忘域和保留域。训练前估计参数对两类域的敏感度,得到固定 Fisher 掩码;训练中在该掩码约束下,联合优化保留分类、遗忘分类反向目标和 TMS 的两项几何约束。输出仍是视觉—文本分类模型,不增加推理时的域检测器。
开放词汇协议首先把类别划为互斥的已见集合与未见集合。已见类别比例取 \(\gamma\in\{0.25,0.50,0.75,1.0\}\),遗忘训练仅接触已见类别;测试覆盖两集合的并集,即全部类别,而不是仅测试未见类别。\(\gamma=1.0\) 没有类别留出,是闭词汇对照。因主表汇总已见与未见类别,整体 HM 提高不能直接替代未见类别单独的遗忘成绩。
Fisher 掩码、保留偏好、定向混淆是三个贡献组件;后两者在同一训练目标中并行作用,图中上下排列只表示解释顺序,不是先后训练两个网络。实线表示训练约束,虚线表示更新完成后的推理数据流。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["已见类别图像<br/>保留域 + 遗忘域"] --> B["Fisher 掩码"]
A --> C["保留偏好"]
A --> D["定向混淆"]
B -->|参数更新门控| E["联合目标<br/>仅更新视觉权重"]
C -->|TMS 保留项| E
D -->|TMS 混淆项| E
E --> F["更新后的 OpenCLIP"]
G["测试图像 + 类别文本"] -.-> F
F -.-> H["全部类别的分类结果"]
关键设计¶
1. Fisher 掩码:把更新集中到对遗忘域更敏感的视觉权重
论文先建立 NegGrad+Fisher 基线。普通 NegGrad 最小化保留域交叉熵、最大化遗忘域交叉熵,其梯度差为原文式(1):
只改变梯度符号并没有区分语义权重和风格权重。因此作者对两个域分别估计每个参数的对角经验 Fisher:对逐样本损失梯度平方取平均,而非取最大值,希望降低离群样本对重要性判断的影响。原文式(2)为:
再按原文式(3)计算归一化敏感度差,避免把两个域都很重要的参数简单视作域专属参数:
仅允许 \(\rho_i>\tau\) 的参数更新,其余参数的梯度被置零。正文使用 \(\tau=0.3\);因此这里是敏感度阈值筛选,不是固定保留某个百分比的权重。掩码在遗忘训练前计算一次,后续保持固定,文本编码器始终冻结。主表的 Baseline 结合实验设置应理解为 NegGrad+Fisher,不是未编辑的原始模型。
这种选择的合理性在于,同类别的两个域共享部分语义,域敏感度差可能提供比单域梯度大小更有针对性的更新位置。然而,两个域都活跃并不推出语义参数必有 \(\rho_i\leq0\),风格和语义也未必可按坐标分离。原文把掩码等同于投影到语义零空间,并声称数学保证零样本保留;给出的对角梯度统计与二值筛选并未证明这一点。本笔记将其解释为经验性的干扰限制,而不是正交投影或保留定理。
2. 保留偏好:让保留样本更接近同类保留样本而非同类遗忘样本
单纯让遗忘样本分类失败,不能保证保留簇仍有清楚的结构。TMS 的第一项以保留嵌入为锚点,将同类保留嵌入设为正样本、同类遗忘嵌入设为不希望接近的样本。通过比较两个余弦相似度,模型被鼓励优先维持保留域内部的语义邻近关系。
原文式(5)如下,其中视觉嵌入做 L2 归一化,\(s\) 为余弦相似度,\(\sigma\) 为 sigmoid,\(\beta\) 为缩放系数,\(m_{\mathrm{retain}}\) 为偏好间隔:
这不是冻结保留嵌入,而是通过相对偏好施加约束。它既维护同类保留聚合,也减少遗忘域同类样本对该簇的占据。损失作用于视觉编码器投影之前的 CLS-token 空间;分类交叉熵则继续约束最终视觉—文本分类,因此几何项与分类项并非完全重复。
3. 定向混淆:给遗忘嵌入一个异类的局部目标
受限于稀疏权重和少量已见类别,NegGrad 可能仅把样本推过分类边界,原有风格结构仍大体保留。TMS 不满足于“远离正确答案”,而是为每个遗忘嵌入选择当前最相似的异类保留嵌入,要求它们的相似度超过混淆间隔。这里的 hard mining 是在异类候选中取最大相似度,即寻找最容易混淆的局部目标,不是选最远的负样本。
原文式(6)为:
不同遗忘样本可以靠近不同异类区域,因此作者希望形成分散的局部几何变化,而不是 MMD 式整体平移。log-sigmoid 对偏好差提供连续的软惩罚,区别于硬间隔铰链损失;不过候选最大值的切换仍可能不可微,不能把整个 hard-mining 目标称为处处光滑。将错误类别相似度提高也是一种可观察的表征扰动,不能自动证明风格信息已从模型中消失。
损失函数 / 训练策略¶
保留偏好与定向混淆按权重相加形成 TMS,原文式(7)为:
再加入保留交叉熵与负的遗忘交叉熵,原文式(8)为:
负号意味着优化时提高遗忘域分类损失,而不是训练该域正确分类。正文实现另说明按保留与遗忘样本占比分别动态缩放两个交叉熵项;它没有完整交代这种缩放与式(8)中 \(\lambda_{\mathrm{ce}}\) 的对应关系,因此不将二者自行合并成作者未给出的公式。
主实验采用 OpenCLIP ViT-B/16,8-shot,AdamW,学习率 \(1\times10^{-5}\),训练 10 epochs。附录补充 batch size 64、weight decay \(1\times10^{-2}\)、A100 40GB,每个配置重建优化器并从同一预训练权重开始。Fisher 用 10 个 minibatches 预估;正文不提供实测运行时间,附录的计算效率主要是定性讨论。
附录设置 \(\beta=0.1\)、\(m_{\mathrm{retain}}=0\)、\(w_{\mathrm{retain}}=w_{\mathrm{confuse}}=1\)。网格搜索范围为 \(\lambda_{pref}\in\{0.5,1.0,2.0,5.0\}\) 和 \(m_{confuse}\in\{0.3,0.5,0.75\}\),但没有列出每种设置最终选值。附录还说明一种经验证阈值得到的多域 rank-matched 掩码:平均各域掩码大小,在混合遗忘域重算敏感度并选 top-k;不能把它与正文固定阈值版本不加区别地视为同一配置。
实验关键数据¶
主实验¶
三个分类基准各有四个域:OfficeHome 为 65 类,Mini-DomainNet 为 126 类,PACS 为 7 类;主表将 Mini-DomainNet 简写为 DomainNet。每次指定一个遗忘域,其余为保留域;以下保持原表的 F / R / HM 数值顺序,单位为 %,测试覆盖所有类别。
F 是遗忘域分类准确率,越低越好;R 是保留域分类准确率,越高越好。HM 衡量 R 与遗忘率的调和平均,不是 R 与 F 的调和平均:
| 数据集 | 方法 | 0.25:F / R / HM | 0.50:F / R / HM | 0.75:F / R / HM | 1.0:F / R / HM |
|---|---|---|---|---|---|
| OfficeHome | Baseline | 59.54 / 65.65 / 50.07 | 51.62 / 67.92 / 56.51 | 36.97 / 71.90 / 67.17 | 31.31 / 77.90 / 73.01 |
| OfficeHome | ADU | 21.97 / 27.61 / 40.79 | 28.26 / 49.22 / 58.38 | 33.63 / 67.96 / 67.16 | 36.37 / 80.36 / 71.02 |
| OfficeHome | TMS | 53.33 / 63.24 / 53.71 | 39.34 / 68.33 / 64.27 | 24.90 / 68.68 / 71.75 | 24.61 / 75.45 / 75.42 |
| DomainNet | Baseline | 55.58 / 77.72 / 56.53 | 27.98 / 77.08 / 74.46 | 20.04 / 77.24 / 78.58 | 18.02 / 77.77 / 79.82 |
| DomainNet | ADU | 14.64 / 24.45 / 38.01 | 19.68 / 49.25 / 61.06 | 23.41 / 67.27 / 71.63 | 27.86 / 81.48 / 76.53 |
| DomainNet | TMS | 34.04 / 74.97 / 70.18 | 20.06 / 75.39 / 77.60 | 14.60 / 75.97 / 80.41 | 14.44 / 76.84 / 80.97 |
| PACS | Baseline | 78.64 / 90.02 / 34.52 | 57.75 / 93.76 / 58.25 | 59.40 / 93.42 / 56.60 | 41.01 / 95.60 / 72.96 |
| PACS | ADU | 64.97 / 28.65 / 31.52 | 64.07 / 59.53 / 44.81 | 68.36 / 74.40 / 44.40 | 72.48 / 93.16 / 42.49 |
| PACS | TMS | 76.085 / 90.39 / 37.82 | 47.06 / 93.49 / 67.60 | 47.07 / 93.24 / 67.53 | 38.35 / 95.64 / 74.97 |
数据来自原文表 1;76.085 保留原有精度。论文说明多次独立运行取平均,但没有给出运行次数或置信区间。聚合 HM 未必等于把表内聚合 F、R 再代入公式的结果,因此保留作者数字,不自行“修正”。
消融实验¶
下表截取表 2 的整体平均及局部反例,以区分“平均最优”与“每个域都最优”。配置分别只保留 TMS 混淆项、只保留 TMS 保留项、同时保留两项;不要把它解释成移除了基础交叉熵或 Fisher 掩码。
| 遗忘域 / 汇总 | 类别比例 | Confuse Only:F / R / HM | Retain Only:F / R / HM | Both:F / R / HM |
|---|---|---|---|---|
| Clipart | 1.00 | 16.03 / 78.10 / 80.93 | 18.73 / 77.78 / 79.49 | 17.30 / 77.08 / 79.79 |
| Real | 0.50 | 31.27 / 71.48 / 70.08 | 38.57 / 72.86 / 66.66 | 32.38 / 72.70 / 70.06 |
| Sketch | 0.50 | 14.44 / 75.08 / 79.98 | 13.49 / 76.98 / 81.47 | 12.53 / 75.23 / 80.88 |
| DomainNet (Avg) | 0.50 | 21.67 / 75.49 / 76.81 | 24.68 / 77.06 / 75.97 | 20.06 / 75.39 / 77.60 |
| DomainNet (Avg) | 1.00 | 17.30 / 77.53 / 79.97 | 17.90 / 77.59 / 79.69 | 14.44 / 76.84 / 80.97 |
两项结合在整体平均 HM 上最好,但 Clipart 1.00、Real 0.50、Sketch 0.50 分别有单项更好的情况。因此“两个组件对每个设置都严格必要”超出了表 2 能支持的结论。
为核对语义保留,表 4 另报告遗忘 DomainNet 某个域后的外部零样本分类;表题未注明对应类别比例,不能自行假定为某个开放词汇配置。
| 遗忘域 | 方法 | ImageNet-val (%) | CIFAR-100 (%) |
|---|---|---|---|
| 无遗忘 | Base Model | 63.38 | 61.99 |
| Clipart | Baseline | 54.11 | 57.40 |
| Clipart | ADU | 36.73 | 49.37 |
| Clipart | TMS | 57.33 | 57.50 |
| Painting | Baseline | 51.76 | 50.45 |
| Painting | ADU | 28.45 | 32.54 |
| Painting | TMS | 49.30 | 52.26 |
| Sketch | Baseline | 46.87 | 52.49 |
| Sketch | ADU | 39.42 | 57.01 |
| Sketch | TMS | 48.82 | 56.21 |
关键发现¶
- 表 1 中 TMS 在三个数据集、四种比例上都取得最高 HM,但不总有最低 F 或最高 R。例如 DomainNet 0.25 的 ADU 遗忘更强,却把 R 降到 24.45;TMS 的 R 为 74.97,HM 为 70.18。
- 多域表 3 遗忘三个域时,TMS 在前三种比例的 HM 为 73.05、75.34、78.02,均优于对照;1.0 时 ADU 的 80.02 高于 TMS 的 78.86。多域并非所有设置都由 TMS 最优。
- 图 3 配套正文报告 4-shot 的 HM:1.0 时为 80.80,对比 8-shot Baseline 79.76、ADU 76.53;0.5 时为 76.79,对比 74.09、61.06。两个 Baseline 数字与表 1 的 79.82、74.46 不一致,原文未解释,保留两组出处而不合并。
- 表 4 支持相对 ADU 的保留改进,但所有 TMS 外部准确率仍低于原始模型;Painting 的 ImageNet 为 49.30,低于 Baseline 51.76,Sketch 的 CIFAR-100 为 56.21,低于 ADU 57.01。正文“所有域均最佳”的表述不成立。
- 附录表 5–7 在 ViT-L-14 上补充结果。例如表 5 的 Real、8-shot、0.5:Baseline 的 F / R / HM 为 0.8651 / 0.8386 / 0.2324,TMS 为 0.2937 / 0.8069 / 0.7533;这里是 0–1 比例,不是主表的百分数。
亮点与洞察¶
- 评测类别与遗忘训练类别分离比只看已见类别更加严格。它能暴露“改坏训练类别”和“跨类别风格抑制”之间的差别,但仍应补充未见类别独立结果。
- 敏感度差异筛选与几何目标解决不同问题:前者限制干扰位置,后者给出局部扰动方向。与只增加分类损失相比,这种组合更容易解释少样本下的结构性变化。
- 保留项与混淆项不是简单镜像。一个以保留样本作锚点维护同类关系,另一个以遗忘样本作锚点寻找异类目标,允许局部遗忘而不强制全局域平移。
局限与展望¶
- 作者承认对角 Fisher 忽略参数间依赖,并建议研究更丰富的敏感度结构;当前二值掩码没有提供语义零空间或零样本保留的证明。
- 冻结文本编码器限制了干预范围,作者也指出可能存在跨模态残留。分类准确率降低只说明当前评测下识别受损,不代表训练数据影响已被认证删除。
- 主表覆盖全部类别,缺少已见与未见分项、重复次数、误差条,以及明确的验证类别划分。后续应在避免未见类别参与调参的条件下,单独报告遗忘迁移与保留损伤。
- 没有 Fisher 移除、阈值扫描或直接几何测量足以单独归因其“语义保护”作用。可补充与特征子空间约束的同预算比较,但不能预先假设二者等价。
- 4-shot 优势、外部测试最优和多域普适最优等叙述需要按表格边界收窄。通用风格分类结果也不能替代真实部署的风险评估。
相关工作与启发¶
- vs ADU:ADU 通过提示调优与 MMD 分离域分布;本文改用受限视觉权重更新与样本级几何目标,并强调跨类别测试。局部几何扰动比全局位移更有针对性,但这里的比较不证明所有 MMD 或提示调优都会失败。
- vs NegGrad+Fisher:双方使用相同类型的参数门控;TMS 新增保留偏好与异类混淆,主表支持其平均折中收益。提升不能被简单归为“首次使用 Fisher”。
- vs DPO / NPO:本文借用 log-sigmoid 偏好形式,但优化的是视觉相似度差,不是语言生成序列概率。没有原版 DPO 的参考策略概率比,不能将两者机制完全等同。
- vs SEMU:附录认为域子空间高度重叠妨碍直接 SVD 式隔离;图 4–5 提供定性补充,缓存没有可引用的 SEMU 数值表。值得进一步研究的线索是:用独立未见类别评测检验敏感度筛选是否真正减小语义干扰,而不只提升聚合 HM。
评分¶
- 新颖性: 4/5 — 跨类别域遗忘协议与局部几何目标的组合有明确价值。
- 实验充分度: 3/5 — 有三基准、消融、多域与更大骨干,但未见类别分项和统计信息不足。
- 写作质量: 3/5 — 方法较清楚,数学保证和若干最优性叙述超出证据。
- 价值: 4/5 — 提供更严格的域遗忘评测视角,实际使用仍需独立验证与保留审计。