EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/HiDream-ai/EraseSAE
领域: 视频生成 / AI安全
关键词: 概念擦除、稀疏自编码器、文生视频扩散模型、单义特征、时空掩码
一句话总结¶
针对文生视频扩散模型中概念纠缠与全局擦除损伤背景的问题,EraseSAE 提出分解-归因-擦除范式,利用双分支卷积稀疏自编码器(PConvSAE)提取单义特征并结合时步动态时空掩码进行空间调制分类器自由引导,实现高精度、低附带损伤的手术式概念擦除。
研究背景与动机¶
基于扩散变换器(DiT)的文生视频(T2V)模型取得了极高保真度的动态生成效果,但因训练集包含海量未过滤的网络数据,极易生成侵犯版权、涉黄暴以及公众人物虚假伪造(Deepfake)的不良视频。为规避重新训练模型带来的巨大算力开支,概念擦除成为模型安全部署的重要技术路线。现存针对图像或早期视频扩散模型的擦除方法主要分为两类:无需训练的推理引导方法(如负提示词引导、文本嵌入正交投影)和基于权重训练的方法(如跨注意力层微调、闭式权重编辑与神经元剪枝)。然而,这两类范式均面临严重的粒度不匹配问题。
这一困境的核心矛盾在于:现有方法作用于粗粒度的网络神经元或注意力权重,而深度神经网络中的概念表征具有高度分布式与多义性(Polysemanticity),即单个神经元往往同时编码多种语义概念。全局微调权重极易引发无关概念的灾难性遗忘,局部层编辑会残留深层语义泄漏使得模型脆弱于对抗攻击,而神经元级剪枝则不可避免地连带损伤共存的良性概念。雪上加霜的是,DiT 架构固有的 3D 全注意力机制导致时空特征高度纠缠,现有方法缺乏时空局部性约束,往往在全图全时段粗暴应用全局抑制,导致未涉及目标概念的背景布局、全局光影和时序连续性遭受毁灭性破坏。
解决该矛盾的关键在于将干预粒度下沉至单义特征(Monosemantic Features)层面,使每个干预单元仅严格对应单一可解释概念。核心 idea:利用分块卷积稀疏自编码器(PConvSAE)在保持视频时空拓扑的前提下将密集表征解耦为独立的单义概念特征与场景上下文,通过难负样本对比对数比归因精确锁定概念核,并在去噪时步动态生成时空掩码实施局部空间调制的负向引导,实现兼顾高擦除率与背景无损的手术式概念消除。
方法详解¶
整体框架¶
EraseSAE 针对 DiT 类 T2V 扩散模型构建了标准的三阶段解耦-归因-擦除(Decompose-Attribute-Erase)流程。在解耦阶段,模型在经过分层特征探测选定的干预层插入双分支分块卷积稀疏自编码器(PConvSAE),将折叠时序维度的密集时空特征正交投影到解耦的稀疏潜空间中,分别由上下文分支(Context Branch)与概念分支(Concept Branch)独立重构背景与目标概念;在归因阶段,通过离线对比成对的正负样本提示词激活分布,利用对数比评分与难负样本最大化抑制机制,从概念分支中锁定极高纯度的概念专用特征核;在擦除阶段,在去噪的每一时步利用锁定的概念核与上下文热力图在线生成时步自适应时空掩码,并借助空间调制分类器自由引导(SM-CFG)将概念抑制严格限制在目标活动区域内,实现对背景环境的零扰动保留。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:密集时空激活张量<br/>X ∈ R^(B×T)×D×H×W"] --> B["双分支解耦卷积稀疏自编码器(PConvSAE)<br/>时空拓扑保持 + 空间感知局部激活"]
B --> C["对比式对数比归因机制<br/>单对多最大难负样本排除 + 稳定性滤波锁定概念核"]
C --> D["动态时空掩码空间调制引导(SM-CFG)<br/>时步自适应掩码交集 + 局部负向扩散引导"]
D --> E["输出:手术式擦除后的干净视频<br/>目标语义清除且背景细节完全无损"]
关键设计¶
1. 双分支解耦卷积稀疏自编码器(PConvSAE):保持时空拓扑并彻底分离概念与背景 传统的 MLP 稀疏自编码器强行将高维特征展平成一维向量,彻底破坏了视频原生的空间拓扑邻域与时序连续性,导致概念定位模糊与严重的闪烁伪影。PConvSAE 保持张量原生结构,将时序维度折叠进 Batch 维度,并在空间维度构建独立的 2D 卷积编码器与解码器。更关键的是,架构强制将潜空间划分为互不共享参数的上下文分支与概念分支:上下文分支 \(f_{\text{ctx}}\) 负责学习布局、背景纹理与时序稳定信息,而概念分支 \(f_{\text{cpt}}\) 则进一步按目标概念切分为 \(C\) 个互斥的通道子空间。引入空间感知局部激活机制,通过各通道在空间平面的峰值响应 \(s_c = \max_{h,w} z_{c,h,w}\) 筛选前 \(K\) 个激活通道,从而保留局部语义斑块的完整几何结构。在训练时,利用交叉注意力先验分割的目标掩码 \(M_{\text{tgt}}\) 与背景掩码 \(M_{\text{bg}}\) 联合施加五重损失函数约束: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{ctx}} + \mathcal{L}_{\text{cpt}} + \mathcal{L}_{\text{leak}} + \mathcal{L}_{\text{temp}} + \mathcal{L}_{\text{aux}}\)$ 其中 \(\mathcal{L}_{\text{ctx}}\) 强制上下文分支仅重构背景而在目标区域归零,\(\mathcal{L}_{\text{cpt}}\) 约束双分支加和完整恢复目标区域,\(\mathcal{L}_{\text{leak}}\) 对概念核在非目标区域的激活施加 L1 惩罚以绝除语义泄漏,\(\mathcal{L}_{\text{temp}}\) 约束相邻帧间上下文激活的光滑性以消除抖动,\(\mathcal{L}_{\text{aux}}\) 则利用残差误差激活休眠特征以提升字典利用率。
2. 对比式对数比归因机制:基于难负样本排除锁定单义概念核 在庞大的稀疏特征字典中,若在推理阶段动态检索概念核将带来无法承受的延迟,且容易混淆良性共现语义。EraseSAE 引入离线对比式对数比归因策略,在模型部署前一次性锁定每个概念的紧凑特征核子集。针对目标概念 \(c_i\),首先在成对正向样本的目标区域内统计其平均激活剖面 \(\mu_{c_i}\);为彻底剔除背景纹理噪声及其余相似概念的重叠激活,算法构建难负样本基线: $\(\mu_{\text{base}} = \max\left(\mu_{\text{bg}},\, \max_{j \neq i} \mu_{c_j}\right)\)$ 该公式实施了严苛的“一票否决”式最大排他原则:一个特征核仅当其对目标概念的响应强于纯背景均值且高于任何其他无关概念的最强响应时,才能被判定为目标特异核。在此基础上,通过对数比对比得分量化概念特异性: $\(S_{\text{attr}} = \mu_{c_i} \odot \max\left(0,\, \log\frac{\mu_{c_i} + \epsilon}{\mu_{\text{base}} + \epsilon}\right) \odot M_{\text{stable}}\)$ 其中乘以 \(\mu_{c_i}\) 确保优先保留高幅度主导特征,二值掩码 \(M_{\text{stable}}\) 过滤掉跨样本激活频次低于阈值 \(\tau\) 的瞬态核。最终将得分排名前列的核与概念分支预分配的通道索引求交,锁定具备超高单义性纯度的概念核集合 \(K_{\text{tgt}}\)。
3. 动态时空掩码空间调制引导(SM-CFG):时步自适应手术式局部擦除 扩散模型的逆向去噪过程具有从全局低频轮廓逐步演变至局部高频细节的时变特性,静态空间掩码必然因轮廓漂移引发边缘伪影与概念残留。EraseSAE 在推理阶段引入动态时空掩码生成机制。在特定的去噪时步区间内,从冻结的 PConvSAE 上下文分支激活中提取空间补集作为动态前景掩码 \(M_{\text{fg}}\),同时聚合已锁定的概念核 \(K_{\text{tgt}}\) 激活热力图得到概念区域 \(M_{\text{cpt}}\)。二者通过阿达马乘积与动态阈值二值化获得时步自适应掩码: $\(M_t = \text{Norm}(M_{\text{fg}}) \odot \text{Norm}(M_{\text{cpt}})\)$ 该设计通过 \(M_{\text{fg}}\) 约束干预不溢出前景主体,通过 \(M_{\text{cpt}}\) 限制干预严格聚焦于概念活跃像素。在此基础上,将掩码融入分类器自由引导中,提出空间调制分类器自由引导公式: $\(\hat{\epsilon}_\theta(x_t) = \epsilon_\theta(x_t, c_{\text{pos}}) - s \cdot \left(\epsilon_\theta(x_t, c_{\text{pos}}) - \epsilon_\theta(x_t, c_{\text{neg}})\right) \odot M_t\)$ 当像素位于目标概念内部(\(M_t \approx 1\))时,实施强负向引导将轨迹推离危险语义;而对于外部广阔背景(\(M_t \approx 0\)),噪声预测保持原样无扰动,从而以纯局部化的方式完成了无痕概念擦除。
损失函数 / 训练策略¶
PConvSAE 在特征干预层训练,采用 Adam 优化器,学习率设为 \(1 \times 10^{-4}\),在 8 张 NVIDIA A100 GPU 上针对各个视频生成主干模型进行 30 个 epoch 的轻量训练。训练期间扩散模型主干参数全量冻结,仅更新 PConvSAE 参数。由于单义核的对比归因在离线一次性完成,在线推理时除轻量的前向探测外无需任何反向传播或动态搜索,维持了与原生扩散模型高度接近的生成吞吐率。
实验关键数据¶
主实验¶
论文在两大代表性开源 DiT 文生视频模型 CogVideoX-5B 与 HunyuanVideo 上进行了系统评估,主要涵盖裸露(Nudity)擦除与名人身份(Celebrity)擦除两大任务。
下表为主实验在 CogVideoX 与 HunyuanVideo 上的裸露概念擦除定量对比(包含常规提示词 Gen 与对抗攻击基准 Ring-A-Bell 的三个难度子集 K16/K38/K77):
| 方法 | 模型 | 裸露率 (Gen) ↓ | 物体类别 (↑) | 主体一致性 (↑) | SSIM (↑) | Ring-A-Bell K16 ↓ | Ring-A-Bell K38 ↓ | Ring-A-Bell K77 ↓ | 推理延迟 (s/frame) |
|---|---|---|---|---|---|---|---|---|---|
| Original | CogVideoX | 28.25 | 79.91 | 95.12 | - | 14.47 | 20.26 | 29.34 | 3.61 |
| Neg Prompt | CogVideoX | 27.75 | 75.68 | 95.87 | 47.02 | 10.79 | 34.34 | 38.03 | 3.66 |
| SAFREE | CogVideoX | 5.75 | 45.19 | 94.49 | 42.39 | 15.13 | 16.58 | 15.66 | 3.72 |
| VideoEraser | CogVideoX | 18.88 | 73.86 | 96.47 | 44.36 | 7.11 | 18.03 | 23.68 | 4.03 |
| T2VUnlearning | CogVideoX | 2.88 | 51.98 | 93.55 | 42.39 | 5.30 | 7.60 | 8.65 | 3.67 |
| Ours (EraseSAE) | CogVideoX | 2.62 | 77.80 | 94.30 | 74.99 | 2.63 | 5.26 | 4.74 | 3.66 |
| Original | HunyuanVideo | 68.13 | 83.88 | 96.12 | - | 21.97 | 30.53 | 23.55 | 3.55 |
| Neg Prompt | HunyuanVideo | 57.25 | 87.59 | 95.48 | 47.06 | 22.37 | 29.34 | 31.97 | 6.95 |
| SAFREE | HunyuanVideo | 46.38 | 71.47 | 95.33 | 41.78 | 36.05 | 31.71 | 19.74 | 3.59 |
| T2VUnlearning | HunyuanVideo | 10.89 | 77.33 | 95.96 | 60.67 | 5.13 | 7.82 | 9.95 | 3.60 |
| Ours (EraseSAE) | HunyuanVideo | 7.13 | 80.61 | 96.04 | 65.69 | 4.47 | 6.84 | 5.13 | 6.97 |
在 5 位公众人物(特朗普、奥巴马、马斯克、英女王、泰勒·斯威夫特)的身份消除实验中,EraseSAE 在 CogVideoX 上的平均目标身份检出率降至 8.00(原始为 63.40),非目标人物保留率达到 58.60,背景 SSIM 高达 63.38;在 HunyuanVideo 上的目标检出率降至 19.20(原始为 67.10),保留率 61.50,SSIM 达到 77.47,全方位领先基线。
消融实验¶
论文在 HunyuanVideo 的裸露消除任务上进行了详尽的模块消融分析。
-
损失函数逐步消融表: | 配置 | \(\mathcal{L}_{\text{ctx}}\) | \(\mathcal{L}_{\text{cpt}}\) | \(\mathcal{L}_{\text{leak}}\) | \(\mathcal{L}_{\text{temp}}\) | 裸露率 (Gen) ↓ | SSIM (↑) | 说明 | |---|---|---|---|---|---|---|---| | 基线上下文重构 | ✓ | | | | 24.50 | 40.12 | 缺少概念约束,概念分离不充分 | | + 概念重构损失 | ✓ | ✓ | | | 10.21 | 43.33 | 明确划分两分支职责,擦除率显著改善 | | + 语义泄漏惩罚 | ✓ | ✓ | ✓ | | 8.09 | 47.37 | 消除概念核跨空间伪激活,纯度提升 | | 完整模型 (+时序一致性) | ✓ | ✓ | ✓ | ✓ | 7.13 | 65.69 | 稳定时序特征流,SSIM 暴增 18.32 点 |
-
自编码器网络架构与推理策略消融表: | 消融维度 | 变体方法 | 裸露率 (Gen) ↓ | SSIM (↑) | 说明 | |---|---|---|---|---| | 自编码器架构 | Linear SAE (展平向量) | 12.76 | 56.97 | 破坏时空拓扑,特征混叠,重构与定位差 | | | PConvSAE (单分支卷积) | 9.06 | 61.37 | 保持拓扑但缺少概念-背景解耦 | | | PConvSAE (双分支解耦) | 7.13 | 65.69 | 彻底解耦单义概念与上下文,取得最优平衡 | | 推理干预策略 | 直接特征相减 (SAE-Sub) | 51.30 | 62.31 | 无法有效扭转扩散生成轨迹,擦除失败 | | | 全局空间置零 (SAE-Mask) | 6.56 | 53.51 | 擦除强硬但连带毁坏局部背景结构 | | | 空间调制引导 (SM-CFG) | 7.13 | 65.69 | 局部负向引导,擦除彻底且完美保全背景细节 |
关键发现¶
- 时序连续性损失是视频自编码器的质变支柱:消融数据显示,加入 \(\mathcal{L}_{\text{temp}}\) 后,视频结构相似度 SSIM 直接从 47.37 跃升至 65.69(绝对提升 18.32 点),证明了对上下文分支跨帧平滑性约束对杜绝视频背景频闪至关重要。
- 单义特征纯度大幅领先传统架构:通过单义纯度度量实验,PConvSAE 锁定的概念核平均单义纯度达到 \(\bar{P} = 0.76\),是传统 Linear SAE(0.37)的两倍以上;跨名人干扰热力图呈现极强的对角线占优特征,验证了通道独立划分与一票否决式归因的卓越排他性。
- 对抗攻击下的高鲁棒性:面对 Ring-A-Bell 的隐晦对抗攻击提示词,传统表面词汇拦截方法全部失效(裸露率飙升至 30% 以上),而 EraseSAE 仍稳稳将违规率压制在 5% 上下,表明单义特征深层拦截切中了语义实质。
亮点与洞察¶
- 将机械可解释性(SAE)升华为可控生成与安全擦除工具:以往 SAE 主要用于大语言模型的机理分析与特征可视化,EraseSAE 极具开拓性地将其引入复杂的文生视频 DiT 模型,利用单义特征作为精准外科手术解剖刀,打通了“可解释分析”向“可控干预”的范式闭环。
- 一票否决的难负样本对比归因设计:巧妙设计了 \(\mu_{\text{base}} = \max(\mu_{\text{bg}}, \max_{j \neq i} \mu_{c_j})\) 与对数比率得分,从原理上杜绝了虚假关联,使特征字典具备天然的互斥排他能力。
- 动态时步掩码与空间调制 CFG 的优雅结合:敏锐捕捉到视频扩散特征由粗到细的时空漂移特性,避免静态硬掩码造成的边界撕裂,在推理端无缝桥接 CFG 负向外推机制,几乎不引入额外推理延迟。
局限与展望¶
- 作者承认的局限:在极端复杂的密集多主体互动场景下,若目标概念与前景其他保留实体发生严重物理重叠或紧密交互,动态前景与概念掩码的分离难度增大,偶发轻微的局部边缘不自然。
- 潜在改进方向:当前方法依赖离线探测锁定的特定干预层,未来可探索跨 Transformer 多深度的多尺度层次化稀疏自编码联合干预;此外,可进一步扩展至视频动作风格或复杂因果物理常识的微观编辑。
相关工作与启发¶
- vs SAFREE / VideoEraser: 后两者属于无需训练的提示词或文本嵌入投影方法,仅在模型输入端做浅层语义正交偏移,无法消除模型内部隐层中自发关联的危险表征,极易被对抗提示词绕过;EraseSAE 在中间潜层单义特征核处阻断概念表征并引导去噪,防御鲁棒性与彻底性碾压基线。
- vs T2VUnlearning: T2VUnlearning 通过反向优化修改全网权重,不可避免地破坏多义神经元并引发非目标概念的灾难性遗忘;EraseSAE 保持主干权重完全冻结,借助外置 PConvSAE 单义掩码做空间局部负向引导,在实现更低擦除残留率的同时,SSIM 提升了 5~28 个百分点,实现了真正意义上的无损手术式擦除。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐(首次将稀疏自编码器成功落地于视频扩散模型的单义概念擦除,解耦-归因-擦除框架设计精巧完备)
- 实验充分度: ⭐⭐⭐⭐⭐(横跨 CogVideoX-5B、HunyuanVideo 与 Flux.1,覆盖裸露、名人及对抗鲁棒性,消融与单义度量极度详实)
- 写作质量: ⭐⭐⭐⭐⭐(问题剖析一针见血,数学推导与架构设计环环相扣,逻辑清晰规范)
- 价值: ⭐⭐⭐⭐⭐(为大模型与视频生成领域的安全治理、版权保护和机械可解释性落地提供了极高参考价值的基石方法)