跳转至

Rethinking Robust Adversarial Concept Erasure in Diffusion Models

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Qhong-522/S-GRACE
领域: 图像生成
关键词: 扩散模型 / 概念擦除 / 对抗鲁棒性 / 语义先验 / 文本编码器微调

一句话总结

针对对抗概念擦除方法在擦除鲁棒性与计算开销之间的根本权衡,S-GRACE 利用 CLIP 文本编码器的图文语义先验,提出单样本语义引导对抗优化与自动代理概念擦除机制,仅需 4 分钟即可实现前沿的抗对抗攻击擦除鲁棒性与优异的图像生成效用。

研究背景与动机

文本到图像扩散模型由于训练于海量开放网络数据,极易生成包含非安全(NSFW)、版权艺术风格或特定有害对象的图像。为解决安全隐患,概念擦除技术旨在永久修改模型内部知识以移除特定目标概念,同时保留非目标通用概念的生成能力。然而,现有的静态擦除模型在面对对抗性提示词或对抗嵌入扰动攻击(如 P4D、Ring-A-Bell、UnlearnDiff)时极易失效,隐藏在模型深层的目标概念表征会被攻击者轻易重新激活。

为防御此类攻击,对抗概念擦除框架引入两阶段交替对抗优化:首先在对抗阶段通过梯度搜索揭示扩散模型中残留的目标概念表征,随后在擦除阶段对模型权重进行微调。然而,现有对抗擦除方法普遍深陷鲁棒性与计算开销之间的尖锐权衡。这一矛盾的根本诱因在于其对抗目标函数的近似机制:现有方法借鉴扩散模型的零样本分类器性质,依赖蒙特卡洛随机采样来估计对抗损失。多步且多样本的采样估计虽然能精确定位目标概念空间并换来高鲁棒性,但单步反向扩散求导极其耗时;而若像 AdvUnlearn 或 R.A.C.E 那样大幅削减采样数至少数甚至单一固定样本,生成的对抗嵌入就会严重偏离真实目标概念空间,导致残留概念擦除不彻底。

本文切入角度是:与其在无约束的高维参数空间中依赖大量随机噪声样本进行盲目近似,不如直接挖掘扩散模型自身预训练文本编码器中蕴含的丰富图文语义先验。核心 idea:提出 S-GRACE 框架,在对抗阶段利用预训练 CLIP 文本编码器的语义相似度先验引导单样本对抗优化,以极低开销精准锚定目标概念空间;在擦除阶段直接微调文本编码器,将对抗嵌入自动对齐到语义相邻的良性代理概念并借助 LLM 锚点保留通用效用,实现耗时仅 4 分钟的高鲁棒双阶段擦除。

方法详解

整体框架

S-GRACE 建立在交替进行的两阶段对抗概念擦除框架之上,目标是在冻结去噪网络(UNet)的前提下,通过微调 CLIP 文本编码器 \(\mathcal{T}_\theta\) 来擦除敏感概念。整个流水线迭代执行 4 轮,每轮包含两个串联阶段:首先执行「语义引导对抗优化」,以目标概念嵌入为起点,在单一样本扰动下结合语义先验,生成 \(P\) 个精准覆盖残留目标概念空间的对抗嵌入;随后执行「语义引导概念擦除」,优化文本编码器参数,在推离目标概念表征的同时,将擦除后的嵌入自适应拉近到预训练语义空间的良性代理概念,并通过 \(Q\) 个 LLM 挖掘的正交锚点提示词惩罚表征漂移,从而保护无关概念生成效用。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:目标概念嵌入 c_tar 与初始扩散模型"] --> B["语义引导对抗优化<br/>单样本噪声 + 冻结 CLIP 语义先验,优化生成对抗嵌入 c_adv"]
    B --> C["语义引导概念擦除<br/>微调文本编码器 T_theta:推离目标概念 + 自动代理映射"]
    C --> D["锚点语义保护机制<br/>LLM 提取正交锚点 c_anc,约束 T_theta 参数更新不伤通用效用"]
    D -->|判断是否达到迭代轮数| E{"是否达到 4 轮迭代?"}
    E -->|否| B
    E -->|是| F["输出:鲁棒概念擦除后的扩散模型"]

关键设计

1. 语义引导对抗优化:单样本下利用文本编码器语义先验精确约束残差空间 针对传统零样本分类对抗损失因单样本采样导致对抗嵌入脱离目标语义空间的缺陷,该设计在优化目标中直接引入预训练冻结文本编码器 \(\mathcal{T}\) 的余弦相似度先验正则项。在每次对抗迭代中,仅需采样单次高斯噪声 \(n \sim \mathcal{N}(0, I)\) 与单步扩散时间步 \(t \sim \mathcal{U}(1, 1000)\),利用冻结扩散模型生成对应噪声潜变量 \(z_t\)。对抗损失函数由两部分组成:

\[\mathcal{L}_{\mathrm{adv}} = \|n - \Phi_\theta(z_t, t, c_{\mathrm{adv}})\|^2 + \lambda \left(1 - \operatorname{sim}(\mathcal{T}(c_{\mathrm{tar}}), \mathcal{T}(c_{\mathrm{adv}}))\right)\]

其中 \(\operatorname{sim}(a, b) = \frac{\langle a, b \rangle}{\|a\| \|b\|}\) 为余弦相似度,\(\Phi_\theta\) 为待防御扩散模型,\(\lambda\) 为平衡先验强度的超参数。第一项驱动对抗嵌入 \(c_{\mathrm{adv}}\) 欺骗当前扩散模型以重建目标概念图像,第二项语义先验项则强制约束 \(c_{\mathrm{adv}}\) 在 CLIP 文本特征空间中不得远离真实目标概念 \(c_{\mathrm{tar}}\)。该设计在维持单样本极低计算开销的同时,显著消除了优化过程中的伪对抗解与空间发散,使得生成的对抗嵌入能高保真捕捉被擦除模型遗留的暗病灶。

2. 语义引导概念擦除:自适应良性代理映射与文本编码器高效更新 以往概念擦除方法多聚焦于微调庞大的 UNet 噪声预测器,不仅反向传播计算代价高昂,而且缺乏模型间的迁移性;同时,显式指定替代概念(如把梵高指定为“普通画作”)易引入人工偏差,而无约束擦除又常造成语义坍缩。本文将擦除操作完全收敛到 CLIP 文本编码器 \(\mathcal{T}_\theta\) 上,不仅规避了对 UNet 的链式求导,而且利用预训练表征空间的几何结构自动寻找最适代理。擦除目标通过联合优化目标推离与代理对齐实现:

\[\mathcal{L}_{\mathrm{erase\_core}} = \frac{1}{P} \sum_{i=1}^P \left[ \operatorname{sim}(\mathcal{T}(c_{\mathrm{tar}}), \mathcal{T}_\theta(c_{\mathrm{adv}}^{(i)})) + \alpha \left(1 - \operatorname{sim}(\mathcal{T}(c_{\mathrm{adv}}^{(i)}), \mathcal{T}_\theta(c_{\mathrm{adv}}^{(i)}))\right) \right]\]

第一项最小化微调编码器对对抗嵌入的输出与原始目标概念特征 \(\mathcal{T}(c_{\mathrm{tar}})\) 的相似度,彻底清除目标语义;第二项则最大化 \(\mathcal{T}_\theta(c_{\mathrm{adv}}^{(i)})\) 与原始冻结特征 \(\mathcal{T}(c_{\mathrm{adv}}^{(i)})\) 的相似度,权重由 \(\alpha\) 调节。这一关键项确保了模型在剥离目标敏感属性后,自动将其映射至与原始输入语义最邻近的良性代孕概念(如将对抗裸露提示词映射至自然穿衣人物,而非不可控的噪波或几何失真),实现了无需人工介入的高质量安全重定向。

3. 锚点语义保护机制:LLM 挖掘正交概念防止非目标效用退化 为了彻底阻断参数更新对非目标概念生成能力的破坏,S-GRACE 利用大语言模型(GPT-4)提示词工程自动发掘 \(Q\) 个与目标概念在日常语境中高频共现但语义正交的锚点提示词(例如针对“教堂”,生成“尖塔”、“彩色玻璃”、“广场鸽子”等)。在优化 \(\mathcal{T}_\theta\) 期间,对所有锚点提示词施加表征冻结惩罚:

\[\mathcal{L}_{\mathrm{anc}} = \beta \frac{1}{Q} \sum_{j=1}^Q \|\mathcal{T}(c_{\mathrm{anc}}^{(j)}) - \mathcal{T}_\theta(c_{\mathrm{anc}}^{(j)})\|^2\]

该设计构建了局域语义保护屏障,使得微调仅在目标概念的高维邻域内产生手术刀式的重塑,杜绝了概念擦除引发的灾难性遗忘与通用图文生成质量滑坡。

损失函数 / 训练策略

整个概念擦除阶段的联合损失函数总结如下:

\[\mathcal{L}_{\mathrm{era}} = \frac{1}{P} \sum_{i=1}^P \left[ \operatorname{sim}(\mathcal{T}(c_{\mathrm{tar}}), \mathcal{T}_\theta(c_{\mathrm{adv}}^{(i)})) + \alpha \left(1 - \operatorname{sim}(\mathcal{T}(c_{\mathrm{adv}}^{(i)}), \mathcal{T}_\theta(c_{\mathrm{adv}}^{(i)}))\right) \right] + \beta \frac{1}{Q} \sum_{j=1}^Q \|\mathcal{T}(c_{\mathrm{anc}}^{(j)}) - \mathcal{T}_\theta(c_{\mathrm{anc}}^{(j)})\|^2\]

训练配置上,以 Stable Diffusion v1.4 为底座模型,进行 4 轮交替对抗擦除。对抗优化阶段采用 Algorithm 2 单样本设置,学习率 \(\eta = 1 \times 10^{-3}\),优化步数 \(N = 10\),先验权重 \(\lambda = 0.1\);概念擦除阶段每轮收集 \(P = 8\) 个对抗嵌入与 \(Q = 16\) 个 LLM 锚点,学习率设为 \(1 \times 10^{-5}\),优化步数 50 步,超参数设为 \(\alpha = 1.2, \beta = 1.2\)。单概念完整擦除耗时仅约 4 分钟。

实验关键数据

主实验

在非安全内容(NSFW:裸露 Nudity、暴力 Violence、非法活动 Illegal Activity)擦除任务上,本文使用自然提示词(Prompt)以及三种对抗攻击方法(P4D、RAB、UD)评估攻击成功率(ASR % ↓),并使用 COCO-30K 评估文本-图像对齐度(CLIP-Score ↑)和生成质量(FID ↓)。

概念 方法 Prompt↓ P4D↓ RAB↓ UD↓ 平均 ASR↓ CLIP-Score↑ FID↓
裸露 (Nudity) SDv1.4 (原始) 92.25 100.00 100.00 100.00 98.06 31.34 14.05
ESD 14.00 75.00 26.06 80.00 48.77 30.12 14.36
AdvUnlearn 7.75 19.72 16.90 21.13 16.38 29.30 15.04
R.A.C.E 5.00 49.00 19.72 47.00 30.18 29.42 16.05
RECE 15.49 64.79 13.38 65.49 39.79 30.95 14.45
Receler 26.76 31.20 1.10 42.25 25.33 31.02 14.10
CPE 3.52 37.32 0.00 30.28 17.78 31.19 13.89
STEREO 3.52 29.58 7.75 30.99 17.96 30.23 15.70
S-GRACE (本文) 2.11 14.79 5.63 12.68 8.80 29.44 15.01
暴力 (Violence) SDv1.4 (原始) 42.57 100.00 99.01 100.00 85.40 31.34 14.05
ESD 27.00 84.00 88.12 79.00 69.53 30.19 15.15
R.A.C.E 11.00 75.00 79.21 68.00 58.30 29.15 18.94
Receler 30.69 89.11 59.20 86.14 66.29 30.77 15.24
S-GRACE (本文) 6.93 38.61 6.93 37.62 22.52 29.85 16.00
非法活动 (Illegal) SDv1.4 (原始) 37.76 95.92 - 96.94 76.87 31.34 14.05
ESD 29.00 89.00 - 85.00 67.67 30.36 14.69
R.A.C.E 20.00 85.00 - 80.00 61.67 29.71 17.19
S-GRACE (本文) 12.24 66.33 - 73.47 50.68 29.64 17.28

在艺术风格(梵高 Van Gogh、毕加索 Picasso)及特定对象(教堂 Church、降落伞 Parachute、垃圾车 Garbage Truck、丁鱥 Tench)的擦除任务中,S-GRACE 同样表现卓越:梵高擦除平均 ASR 达到 0.00%(CLIP-Score 31.22,FID 13.87),毕加索平均 ASR 仅 1.00%(FID 13.43);在物体擦除中,教堂平均 ASR 为 2.00%、降落伞 1.00%、垃圾车 0.00%、丁鱥 0.50%,全面压制 ESD 与其他 SOTA 擦除方法。

消融实验

在“裸露 (Nudity)”概念擦除任务下,针对核心超参数 \(\lambda\)\(\alpha\)\(\beta\)、候选提示词数 \(P\) 及锚点生成 LLM 类型的消融实验结果如下:

配置 / 变体 \(\lambda\) \(\alpha\) \(\beta\) \(P\) 锚点来源 UD ASR↓ CLIP-Score↑ FID↓ 结论与说明
完整模型 (默认) 0.1 1.2 1.2 8 GPT-4 12.68 29.44 15.01 兼顾极佳鲁棒性与高质量生成效用
去除对抗语义先验 0.0 1.2 1.2 8 GPT-4 73.94 31.23 13.36 退化为普通单样本,对抗解失真致擦除彻底失败
过度强化语义先验 0.5 1.2 1.2 8 GPT-4 37.32 30.97 11.98 先验过强限制了对抗探索能力,残留概念未除
去除代理映射约束 0.1 0.0 1.2 8 GPT-4 0.00 16.04 91.12 缺乏良性代理锚定,生成流形崩溃(伪鲁棒)
去除锚点保护机制 0.1 1.2 0.0 8 GPT-4 0.00 16.70 87.27 无关概念发生灾难性遗忘,完全丧失图文效用
增加对抗样本规模 0.1 1.2 1.2 16 GPT-4 11.97 29.21 15.96 鲁棒性微弱提升,但对非目标流形扰动略增
更换开源 LLM 锚点 0.1 1.2 1.2 8 Llama-3 23.94 29.37 15.26 开源 LLM 略逊于 GPT-4,但仍大幅领先基线

关键发现

  • 语义先验是打破单样本优化质量瓶颈的核心催化剂:当将 \(\lambda\) 从 0.1 置为 0(即直接运行普通单样本优化)时,UD 攻击成功率从 12.68% 暴增至 73.94%。这强力证实了在极少样本估计下,单纯依赖去噪损失会导致梯度在非真实概念流形上发散,唯有注入文本编码器的图文语义先验,才能精准锚定残留漏洞。
  • 代理对齐与锚点保护构成了生成效用的双保险:若单纯追求防御而置 \(\alpha = 0\)\(\beta = 0\),虽然攻击成功率能降至 0.00%,但 FID 飙升至 87~91,CLIP 分数腰斩。这揭示了概念擦除中常见的“盲目置零”陷阱:丧失图像生成能力的模型具备平凡的鲁棒性,但毫无实用价值。
  • 计算效率取得量级突破:得益于微调文本编码器而非 UNet,S-GRACE 无需经历耗时的网络多步反向求导,单概念擦除仅耗时 4 分钟,而 AdvUnlearn 需 100 分钟以上,STEREO 和 CPE 亦需数十分钟。

亮点与洞察

  • 对抗样本质量决定擦除深度:论文揭示了现有对抗概念擦除中深层的矛盾——单样本/少样本近似下的对抗扰动并非真正的概念攻击,而是离题的噪声,导致防御方“在错误的靶子上练兵”。将先验引入对抗求解,以极轻量的方式找回了多样本蒙特卡洛采样的真实概念精度。
  • 以表征对齐替代显式文本替换:以往方法强行将“梵高”映射到人工指定的“油画”,容易引入人为偏见并破坏相邻风格;S-GRACE 利用余弦相似度拉扯,在预训练特征连续空间中自适应滑动至最邻近的良性特征,兼具平滑性与自动化。
  • 文本编码器微调的高迁移红利:由于所有擦除修改均作用于 CLIP 文本编码器,擦除后的编码器可直接即插即用到任何基于同一文本编码器的下游扩散模型(如 SDXL、ControlNet 等),展现出强大的跨架构安全迁移能力。

局限与展望

  • 作者承认的局限:方法设计依赖于启发式损失加权,缺乏严格的因果擦除理论保障;擦除效果天然受限于预训练 CLIP 模型自身的语义偏差与表征盲区;良性代理概念在几何空间中的确切边界仍不透明;在面对更极端的连续嵌入攻击(CCE)时仍存在一定的脆弱性。
  • 探索中发现的局限:对于“暴力”和“非法活动”等语义内涵极为宽泛、抽象且缺乏单一视觉主体的复杂复合概念,所有基于文本嵌入的擦除方法 ASR 仍偏高(S-GRACE 在非法活动下平均 ASR 为 50.68%),这表明高维抽象概念在隐空间中的纠缠程度远超单一物体或艺术风格。
  • 未来改进方向:可进一步探索结合多模态大模型(MLLM)的语义分解能力,将高层抽象概念解构为原子视觉基元后实施分层对抗擦除;同时将防御范式从文本端延伸到跨模态隐层协同过滤。

相关工作与启发

  • vs ESD (Erasing Concepts from Diffusion Models): ESD 依赖于无条件分支进行无监督隐式擦除,不仅需要微调 UNet 参数,且由于缺乏对抗训练机制,在 P4D 和 UD 等对抗提示词攻击下极易崩溃(裸露擦除平均 ASR 达 48.77%);S-GRACE 引入对抗博弈循环且专攻文本端,平均 ASR 降至 8.80%,耗时仅为其几分之一。
  • vs AdvUnlearn: AdvUnlearn 首次在概念擦除中系统化引入对抗训练,但在对抗阶段采用多步小样本重新采样(Few samples),计算代价高昂且难以兼顾收敛精度;S-GRACE 证明了借助语义先验,单样本即可生成匹配甚至超越多样本质量的对抗表征。
  • vs R.A.C.E / Receler / STEREO: R.A.C.E 使用完全无先验的单样本优化,生成对抗向量偏离靶心,残留概念难以除尽;Receler 和 STEREO 通过额外构建复杂轻量擦除器或两阶段框架来弥补鲁棒性,导致架构沉重。S-GRACE 在架构上极其轻盈,仅用简洁的相似度约束便在所有维度上实现了帕累托最优。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [敏锐洞察到采样近似造成的对抗失真痛点,巧妙将文本编码器语义先验引入对抗概念擦除]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3 大场景共 9 类概念,包含 4 种对抗攻击测试、全维度消融实验与 SDXL 拓展]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,从理论分析、形式化算法到实证可视化均极其严密清晰]
  • 价值: ⭐⭐⭐⭐⭐ [将对抗概念擦除从数小时压缩至 4 分钟,且具备即插即用迁移性,工业界实用价值极高]