跳转至

Push–Pull Attentional Anchoring for Diffusion Concept Erasure

会议: ECCV 2026
论文: ECCV 官方海报
代码: https://push-pull-concept-eraser.github.io
领域: 图像生成
关键词: 概念擦除, 扩散模型, 交叉注意力, 语义保留, 相对余弦比率

一句话总结

提出推拉注意力锚定机制(PPAA),通过在扩散模型交叉注意力投影空间施加归一化相对余弦相似度的有界“推-拉”约束,在有效消除敏感目标概念的同时避免局部语义过度扭曲,实现了擦除彻底度与非目标同域概念保留间的最佳帕累托平衡。

研究背景与动机

文本到图像扩散模型凭借强大的生成质量在内容创作领域取得了突破,但也引发了隐私泄露、有害/违规内容传播以及版权侵权等一系列合规与安全挑战。为了规避昂贵的全量重新训练成本,概念擦除(Concept Erasure)技术应运而生,其核心在于直接针对预训练模型进行权重微调,精准剔除特定敏感或受保护的概念。早期的无分类器引导或负向提示缩放等方法多停留在“隐藏”概念层面,极易在对抗性提示搜索下被绕过或探测出来;因此,近期的前沿方案更倾向于采用彻底改变模型内部表征的权重破坏式微调。

然而,这种追求极高对抗鲁棒性的破坏式微调带来了一个尖锐的核心矛盾:越是强力深度的擦除,对语义空间的附带伤害(Collateral Damage)就越严重。现有的两阶段鲁棒擦除框架(如 STEREO、SUMA)虽然在第一阶段能通过对抗搜索发现诱导提示,但第二阶段所继承的擦除目标函数往往依赖无界的参数更新或刚性的绝对欧氏距离映射。这导致模型在消除目标概念(例如“Barack Obama”)时,不仅扭曲了局部语义邻域,连带严重破坏了训练阶段未参与优化的同域紧密相关实体(例如“Will Smith”);尽管通用的通用域概念(如 COCO 自然物体)相对容易保留,但同域相似实体的保全此前几乎处于未解状态。

本文的切入角度是重新检视擦除目标函数本身的几何性质:传统绝对距离无法自适应不同网络层在语义抽象度上的尺度差异,而过度的语义位移会导致过度擦除。核心 idea:在扩散模型交叉注意力键值投影空间构建“推-拉注意力锚定(PPAA)”机制,通过以原始目标-通用锚点相似度为基准的相对余弦比率设置有界容差,既推动目标表征远离原始语义,又精准将其拉向通用锚点,实现跨层统一且受控的概念位移。

方法详解

整体框架

PPAA 聚焦于扩散模型条件生成中承担核心语义路由的交叉注意力层,通过冻结模型大部分权重、仅微调交叉注意力的 Key 和 Value 投影矩阵(\(W_K\)\(W_V\))来实现高效、受控的概念擦除。系统接收用户指定的待擦除目标概念 token \(p_e\) 与对应的通用锚点概念 token \(p_g\)(例如将“Barack Obama”映射至“Person”)。整体优化目标由两个方向性的语义修改损失(推力与拉力)以及两个保持模型原有生成能力的保留损失(语义保留与去噪基线保留)组合而成,通过有界的余弦约束将目标表征严格限制在安全的通用语义范围内。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:目标概念 token pe<br/>通用锚点 token pg"] --> B["交叉注意力 K/V 投影计算<br/>W·pe 与 W·pg"]
    B --> C["语义推力损失 Lpush<br/>推离原始表征 W0·pe"]
    B --> D["语义拉力损失 Lpull<br/>按相对余弦比率锚定 W0·pg"]
    B --> E["通用语义保留损失 Lpreserve<br/>对齐 W·pg 与 W0·pg 角度"]
    F["终端时间步空文本 pnull"] --> G["基础去噪一致性损失 Ldenoise<br/>对齐 ε(xT, pnull)"]
    C --> H["联合优化 Ltotal<br/>更新微调 WK 和 WV 投影权重"]
    D --> H
    E --> H
    G --> H
    H --> I["输出:消除目标且保留同域实体的扩散模型"]

关键设计

1. 语义推力损失:施加有界余弦下限驱动表征偏离

为了消除目标概念的生成倾向,必须确保更新后的投影表征 \(W p_e\) 充分脱离其原始表征 \(W_0 p_e\)。以往方法采用无界的 \(L_2\) 距离或负向引导向量,极易引起梯度的过度惩罚,导致表征被无限推向无法预测的未知区域。本文直接在余弦相似度空间定义单侧有界下限,设定推力边界 \(m_{\text{push}} \in [0, 1]\): $\(\mathcal{L}_{\text{push}}(W_0, W, p_e) = \max\left(\text{sim}(W p_e, W_0 p_e) - m_{\text{push}}, 0\right)\)$ 当微调表征与原始表征的余弦相似度降至预设阈值 \(m_{\text{push}}\) 以下时,损失自动截断为零并停止施加推力。这种设计不仅直观地赋予使用者通过调节 \(m_{\text{push}}\) 控制擦除强度的能力,更从源头上遏制了由于表征无限远离所引发的邻近同域概念失真。

2. 语义拉力损失:基于相对余弦比率的自适应语义锚定

单纯的推力虽然能破坏目标表征,却无法约束其迁移终点,可能导致“Barack Obama”所包含的“人类”、“男性”、“西装肖像”等共享语义一同被剥夺。若强制使用固定的绝对距离将其拉向通用锚点 \(W_0 p_g\),又会因为不同神经网络层在抽象层级上的特征分布差异、以及不同概念初始距离的显著不同(例如“护士”到“专业人士”与“街头艺人”到“专业人士”的初始余弦差异巨大)而导致浅层过拟合或深层欠约束。为此,本文创新地提出了以原始距离为分母的“相对余弦比率”拉力损失: $\(\mathcal{L}_{\text{pull}}(W_0, W, p_e, p_g) = \max\left(m_{\text{pull}} - \frac{\text{sim}(W p_e, W_0 p_g)}{\text{sim}(W_0 p_e, W_0 p_g)}, 0\right)\)$ 由于分母采用了微调前的基准相似度 \(\text{sim}(W_0 p_e, W_0 p_g)\),阈值 \(m_{\text{pull}}\)(例如设定为 0.40 或 0.80)直接代表了目标表征对通用语义的“保留比例百分比”。这一相对归一化设计赋予了拉力损失自适应各层特征尺度的能力,使得单个超参数即可跨层、跨概念无缝复用,精准实现“擦除个体身份、保全上位通用语义”。

3. 双重保留正则化:通用概念与全局去噪流向对齐

为了防止对 \(W_K\)\(W_V\) 矩阵的改动破坏未被擦除的通用概念以及扩散模型的全局流形结构,方法引入了两项专门的保留正则化。首先是通用语义保留损失 \(\mathcal{L}_{\text{preserve}}\),与早期 Unified Concept Editing (UCE) 采用的 \(L_2\) 正则不同,本文保持余弦方向的一致性: $\(\mathcal{L}_{\text{preserve}}(W_0, W, p_g) = 1 - \text{sim}(W p_g, W_0 p_g)\)$ 确保通用锚点自身表征在参数微调过程中的方向偏差最小化。其次是去噪一致性损失 \(\mathcal{L}_{\text{denoise}}\),在终端扩散步 \(T\) 处对空文本提示词 \(p_{\text{null}}\) 计算输出噪声预测与原始未修改模型之间的误差: $\(\mathcal{L}_{\text{denoise}} = \mathbb{E}_{x_T \sim \mathcal{N}(0, \mathbf{I})} \left\| \epsilon(x_T, p_{\text{null}}) - \epsilon_0(x_T, p_{\text{null}}) \right\|_2^2\)$ 两者的协同确保了扩散模型的先验流形与通用生成能力不发生崩塌。

损失函数 / 训练策略

总优化目标将所有层 \(l \in [1, L]\) 与所有投影类型 \(j \in \{K, V\}\) 的损失加权平均: $\(\mathcal{L}_{\text{total}} = \frac{1}{2L} \sum_{l=1}^L \sum_{j \in \{K, V\}} \left( \lambda_{\text{push}} \mathcal{L}_{\text{push}}^{(l,j)} + \lambda_{\text{pull}} \mathcal{L}_{\text{pull}}^{(l,j)} + \lambda_{\text{preserve}} \mathcal{L}_{\text{preserve}}^{(l,j)} \right) + \lambda_{\text{denoise}} \mathcal{L}_{\text{denoise}}\)$ 针对多 token 概念,分别计算各 token 及 EOS 标记的损失并求均值。在训练配置上,固定 \(\lambda_{\text{push}} = \lambda_{\text{pull}} = \lambda_{\text{denoise}} = 1\)\(\lambda_{\text{preserve}} = 32\)\(m_{\text{pull}} = 0.40\)。使用 Adam 优化器在 Stable Diffusion v1.4 上仅微调 cross-attention 层的 \(K\)\(V\) 权重 1,000 步。

实验关键数据

主实验

论文在四类典型任务(名人身份、艺术风格、IP 实体、裸露风险)上进行了全面评测,使用预训练分类器检测残留率(越低越好),并采用对人类感知更鲁棒的 CMMD 指标(\(\times 1000\),越低越好)衡量生成质量与保留度。在 FLUX 架构上的迁移性验证及 CCE 对抗攻击下的裸露擦除测试展现了显著优势。

下表摘自原论文 Table 2(CCE 对抗攻击与裸露概念擦除保留度对比):

方法 ASR (攻击成功率) ↓ CMMD (非目标概念保留度) ↓ 说明
ESD 0.69 13.94 负向引导更新过大,保留度较差
UCE 0.79 4.05 线性映射难以抵御对抗攻击
DUO 0.01 6.44 鲁棒性极强但视觉分布受损
STEREO 0.04 139.47 两阶段重度破坏模型流形,CMMD 严重恶化
Ours (PPAA) 0.20 1.43 在无显式对抗训练下达到优异防守,且保留度最佳

下表摘自原论文 Table 1(UnlearnDiff 逆向对抗攻击下的裸露擦除鲁棒性测试):

方法 Pre-ASR ↓ ASR (最终攻击成功率) ↓ Avg Time (平均破解耗时/分钟) ↑
ESD 0.26 0.92 9.89
UCE 0.41 0.92 8.35
MACE 0.55 0.92 7.11
AC 0.20 0.88 9.98
SUMA 0.16 0.83 11.80
Ours (PPAA) 0.08 0.83 11.46
DUO 0.02 0.47 13.45
STEREO 0.00 0.08 14.74

而在现代流匹配架构 FLUX 上的定量评测(原论文 Fig. 4b)中,Ours 取得了 0.01 的目标残留分类准确率(Acc. ↓)与 239.61 的 CMMD ↓,明显优于 ESD(Acc 0.00, CMMD 1511.69,非目标严重畸变)和 UCE(Acc 0.33 擦除失败,CMMD 268.42)。

消融实验

消融实验深入验证了相对余弦比率、余弦度量与显式保留损失的关键作用(参考原论文 Fig. 6 曲线趋势):

配置 核心指标与权衡特征 机制分析说明
Full Model (Ours) 帕累托最优边界(最低 CMMD 与极低残留率) 相对余弦比率提供跨层自适应锚定,兼顾彻底性与保真度
替换为绝对边界拉力 (Abs-Margin) 同等擦除下 CMMD 显著升高 各层初始相似度分布跨度大,固定绝对阈值引发深浅层约束失衡
替换为 \(L_2\) 距离空间 (\(L_2\)-Push/Pull) 曲线明显劣于余弦方案,敏感度高 \(L_2\) 范数无界,搜索空间不可测且容易破坏基模权重
去除保留损失 (w/o \(\mathcal{L}_{\text{preserve}}, \mathcal{L}_{\text{denoise}}\)) 非目标概念分布发生剧烈漂移 缺乏对通用概念和未加条件扩散路径的约束,导致流形崩塌

关键发现

  • 相对比率彻底解决了跨层阈值调节难题:经验证,不同概念与不同层之间的 \(W_0 p_e\)\(W_0 p_g\) 原始相似度波动剧烈;采用比率归一化后,单个 \(m_{\text{pull}}\) 超参数即能自适应各个网络深度。
  • 推力阈值成为可预测的控制旋钮\(m_{\text{push}}\) 从 0.80 下调至 0.20 的过程中,生成图像平滑有序地褪去目标概念的特定特征,而画面主体结构与质感保持完整,具备优异的可控渐进擦除特性。
  • 无需对抗训练即可大幅提高攻击耐受度:PPAA 在 UnlearnDiff 攻击下使得攻击者搜索耗时提升至 11.46 分钟,在未引入对抗生成博弈的情况下显著优于 ESD、UCE 和 MACE 等同类单阶段模型微调方法。

亮点与洞察

  • 优雅的相对归一化余弦拉力:巧妙地将各层原始语义相似度作为分母进行自适应归一化,既消除了繁琐的逐层超参微调,又完美定义了语义保全的百分比意义。
  • 针对同域非目标实体的无损保护:首次系统性直面并解决了擦除“Barack Obama”时同领域相似实体“Will Smith”严重受损的痛点,兼顾了局部选择性与全局鲁棒性。
  • 优异的跨架构通用性:仅需微调交叉注意力的 Key 和 Value 矩阵,使得该数学目标能几乎不加修改地直接迁移部署至 FLUX 等新一代 DiT/流匹配大模型上。

局限与展望

  • 未内置主动防御对抗搜索机制:作者指出模型自身不包含对抗性提示挖掘循环,在面对针对特定后门或极端优化的重度白盒对抗攻击时,依然存在一定脆弱性;未来可作为第二阶段微调目标,与 STEREO 的第一阶段对抗提示发现深度融合。
  • 依赖人工先验锚点概念:算法需要用户为每个待擦除实体手工指定一个合理的上位概念(如 Obama 对应 Person);自动化挖掘最适配的通用替换词是值得探索的方向。

相关工作与启发

  • vs ESD (Gandikota et al., ICCV 2023):ESD 依赖负向无分类器引导外推去噪轨迹,参数修改剧烈且无界;PPAA 引入有界余弦推力与锚定拉力,将非目标扰动降至最低。
  • vs UCE / MACE (Gandikota et al., WACV 2024; Lu et al., CVPR 2024):UCE/MACE 采用绝对映射或闭式正规方程修改权重,无法灵活调整擦除程度且会误伤同域概念;PPAA 通过相对余弦控制实现了连续渐进调节与高保真度。
  • vs SUMA (Nguyen et al., ICCV 2025):SUMA 依靠文本反转的早期步数嵌入充当参考锚点,易发生过早收敛失效且依然采用欧氏距离;PPAA 使用明确通用概念配合相对余弦比率,数学性质更稳定。

评分

  • 新颖性: ⭐⭐⭐⭐ [相对余弦推拉机制在交叉注意力表征空间设计优雅,自适应层级抽象度]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖名人、风格、IP、裸露四大基准,包含对抗攻击与 FLUX 大模型验证]
  • 写作质量: ⭐⭐⭐⭐⭐ [问题动机剖析深入,公式推导严密直观,图表自洽]
  • 价值: ⭐⭐⭐⭐⭐ [直击版权防范与同域概念误伤的核心痛点,工程迁移性强]