FaceArmor: A Universal Facial Image Protection Against Diffusion-Based Manipulations¶
会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 扩散模型防御, 对抗扰动, 人脸隐私保护, 跨架构迁移, 空间梯度解耦
一句话总结¶
针对扩散模型人脸伪造与篡改,FaceArmor 摆脱对特定生成网络内部模块的依赖,通过在图像内在表征空间联合破坏结构层(全局隐空间与精细纹理)与语义层(图文对齐与生物特征识别),并结合自引导注意力软权重与 PCGrad 解决多目标空间冲突,实现了面向未知生成架构与多样化篡改范式的通用高鲁棒主动防御。
研究背景与动机¶
扩散模型的快速演进极大地降低了高保真图像生成与定制编辑的技术门槛,但这一能力也带来了严峻的个人隐私泄露与虚假信息传播风险。恶意攻击者可以通过公开社交平台抓取个人肖像,利用多样化的扩散操作范式生成具有极高迷惑性的伪造内容。当前主流人脸操纵工具已分化为四大典型范式:用于局部重绘的图像修复(Image Inpainting)、全局语义修改的图像编辑(Image Editing)、通过微调注入特定人物形象的人脸拟合(Face Mimicry,如 DreamBooth 和 LoRA),以及基于视觉提示的身份保持生成(Identity-Preserving Generation,如 InstantID)。面对如此异构且复杂的篡改生态,如何在用户将照片上传至互联网之前赋予其可靠的自防护能力,成为计算机视觉与安全交叉领域的关键挑战。
现有的主动防御方案普遍依赖限制性的白盒假设,将对抗扰动过度过拟合于已知生成模型的特定内部组件上。例如,PhotoGuard 与 EditShield 重点扰动变分自编码器(VAE)编码器,AdvDM 与 SDST 专注于破坏去噪 U-Net 的隐层表征,而 FaceLock 与 IDProtector 则主要攻击特定的人脸识别或跨模态注意力模块。这种针对孤立组件的防御设计在面对跨任务或跨网络架构迁移时极为脆弱——当面临未知的黑盒生成模型(如从 U-Net 迁移到 Diffusion Transformer 架构)或截然不同的操纵流程时,原本针对特定模块优化的扰动方向往往会彻底失效,无法提供全谱系的防护效能。
本研究的切入点在于:尽管各类生成模型的具体网络拓扑千差万别,但基于扩散的篡改流程必然依赖于从人脸图像中提取并对齐两大核心要素——底层的物理空间结构与高层的概念语义。因此,防御应从“攻击特定模型组件”转向“破坏图像本身的内在表征流”。核心 idea:将人脸防御空间解耦为控制物理布局与纹理的结构层,以及控制图文绑定与身份一致性的概念层,并利用替代网络内生提取的连续注意力热力图作为自引导自适应软权重,配合梯度手术机制消除多层级优化目标间的空间冲突,生成具备零知识跨架构迁移能力的通用人脸装甲。
方法详解¶
整体框架¶
FaceArmor 在用户端对输入人脸图像生成人眼几乎不可察觉的有界对抗扰动 \(\delta\)(满足 \(\|\delta\|_\infty \le \eta\))。整个防御流程由两个协同机制驱动:第一阶段,构建图像内在特征空间的双层防御目标,将人脸特征解耦为结构层(包含全局隐空间表征扰动与精细纹理表征破坏)和概念层(包含跨模态图文对齐剥离与生物特征身份混淆);第二阶段,针对结构扰动与语义扰动在空间区域上的天然分布差异,利用替代特征提取器在前向传播中内生生成的连续注意力热力图构建空间自适应软掩码,并结合连续投影梯度(PCGrad)算法消除重叠过渡带的梯度碰撞,最终在期望转换(EOT)框架下通过投影梯度下降(PGD)生成鲁棒的防护图像。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入人脸图像 x"] --> B["内在表征多层级特征解耦<br/>结构层 (VAE/ReferenceNet) + 概念层 (CLIP/ArcFace)"]
B --> C["自引导连续注意力软权重构建<br/>提取人脸/前景/背景自适应空间热力图"]
C --> D["平滑过渡梯度投影与冲突消除<br/>阿达马积软掩码 + PCGrad 梯度手术"]
D --> E["期望转换与投影梯度更新<br/>EOT 真实世界变换扰动加固"]
E --> F["输出防护图像 x + δ<br/>阻断修复/编辑/拟合/ID保持四类操纵"]
关键设计¶
1. 内在表征多层级特征解耦:摆脱模型架构过拟合的通用攻击空间
传统方法直接攻击特定扩散模型的去噪网络或编码器,极易陷入模型特定的结构过拟合。FaceArmor 转向以图像为中心的内在表征体系,将攻击表面拆分为结构层与概念层共四个正交的表征维度。在结构层中,为摧毁物理布局并阻断宏观重构,FaceArmor 聚合了来自不同生成模型(如 SD v1.5 与 SDXL)的预训练 VAE 编码器集合 \(\mathcal{E} = \{E_i\}_{i=1}^N\),通过最大化平均欧氏距离迫使潜在编码严重偏离: $$ \mathcal{L}E(x, x+\delta) = \frac{1}{N} \sum^N |E_i(x) - E_i(x+\delta)|2 $$ 同时引入预训练 ReferenceNet \(R\),通过最大化其密集空间参考特征差异 \(\mathcal{L}_R(x, x+\delta) = \|R(x) - R(x+\delta)\|_2\) 来瓦解局部细粒度纹理一致性,诱导生成图像发生严重的物理质感崩溃。在概念层中,针对提示词引导的语义篡改,使用预训练 CLIP 图像编码器 \(C\) 同时施加无目标偏离损失与有目标语义引导损失,将图像特征强制推向无关目标语义概念 \(t_{\text{target}}\): $$ \mathcal{L}_C^t = \frac{(C(x) - C(x+\delta)) \cdot (C(t $$ 配合 ArcFace 特征提取器 }}) - C(t_{\text{target}}))}{|C(x) - C(x+\delta)| \cdot |C(t_{\text{orig}}) - C(t_{\text{target}})|\(F\) 最大化生物特征身份距离 \(\mathcal{L}_F(x, x+\delta) = \|F(x) - F(x+\delta)\|_2\),彻底阻断身份保持生成和定制拟合。
2. 自引导连续注意力软权重:内生语义驱动的精细空间解耦
在多目标对抗联合优化中,不同损失函数所关注的空间区域具有高度异质性:生物特征损失 \(\mathcal{L}_F\) 的有效梯度完全集中于五官等核心人脸区域,而精细纹理破坏损失 \(\mathcal{L}_R\) 主要作用于发丝、服装及背景区域。若直接将各目标梯度线性加权求和,会导致面部边缘等过渡区域发生激烈的梯度抵消与优化震荡,既削弱了防御强度,又在原始图像上留下突兀的人工视觉瑕疵。FaceArmor 放弃引入外部人脸分割模型,而是直接利用各替代特征提取器在前向传播时内生生成的注意力热力图作为连续软权重。具体而言,提取 ArcFace 最后一个卷积层的人脸空间注意力图记为人脸权重 \(W_{\text{face}}\);利用 CLIP 视觉编码器针对目标文本提示(如 "a person")计算 Grad-CAM 激活图作为前景权重 \(W_{\text{fg}}\),其补集作为背景权重 \(W_{\text{bg}} = 1 - W_{\text{fg}}\);将 ReferenceNet 损失的作用区域限定在非人脸区域,设定参考权重为 \(W_{\text{ref}} = 1 - W_{\text{face}}\);而全局潜在表征损失则以均匀权重 \(W_{\text{latent}} = 1\) 全图作用。这种基于内在注意力的软加权方案保证了梯度在空间维度上的自然过渡与平滑约束。
3. 平滑过渡梯度投影与变换加固:解决残余梯度冲突与现实鲁棒性
尽管空间软权重降低了异构目标的大范围冲突,但在人脸轮廓等语义过渡区域,各任务的加权梯度 \(\hat{g}_j = W_j \odot \nabla_\delta \mathcal{L}_j(x, x+\delta)\)(其中 \(j \in \{F, C, R, E\}\))依然可能存在反向分量。为此,FaceArmor 将连续软权重与多任务投影梯度算法(PCGrad)相结合,在加权梯度集合中,一旦检测到两个梯度方向夹角大于 \(90^\circ\)(即内积 \(\hat{g}_i \cdot \hat{g}_j < 0\)),便将 \(\hat{g}_i\) 正交投影到 \(\hat{g}_j\) 的法平面上。由于软权重在边界区域构筑了渐变的连续缓冲区,极大增强了正交投影的数值稳定性,杜绝了硬掩码导致的边界突变伪影。此外,针对现实社交网络中图像常见的二次压缩与缩放,算法引入期望转换(EOT)机制,在优化迭代中融入高斯模糊、JPEG 压缩、高斯噪声以及随机缩放等常见图像变换算子集合 \(T\): $$ g_t^{\text{update}} = \mathbb{E}{t \sim T} \left[ \text{PCGrad}\left( { W_j \odot \nabla\delta \mathcal{L}j(t(x), t(x+\delta_t)) } \right) \right] $$ 最终利用梯度的符号方向在 \(L_\infty\) 范数有界球内完成对抗扰动迭代,确保扰动既具备跨区域协同性,又具备抵御现实物理信道损耗的稳健性。
损失函数 / 训练策略¶
防御扰动的优化严格采用带 EOT 的符号投影梯度下降算法(PGD)。每次迭代计算经过软加权、梯度投影及变换期望合成的更新梯度 \(g_t^{\text{update}}\) 后,扰动按固定步长进行符号更新并投影回 \(\eta\)-邻域内: $$ \delta_{t+1} = \Pi_\eta \left( \delta_t + \alpha \cdot \text{sign}(g_t^{\text{update}}) \right) $$ 实验中对抗扰动上界设为 \(\epsilon = \eta = 8/255\),优化迭代轮数设为 \(N = 100\)。由于全部替代特征提取器(VAE、CLIP、ArcFace、ReferenceNet)均为冻结权重的离线预训练模型,用户端仅对单张输入图像进行一次性离线优化,无需对下游扩散模型进行任何反向传播或参数更新。
实验关键数据¶
主实验¶
评估在 CelebA-HQ 与 VGG-Face2 数据集(共 800 张图像、200 个不同身份)上展开,测试针对图像修复(Inpainting)、图像编辑(InstructPix2Pix)、人脸拟合(DreamBooth)和身份保持生成(InstantID)四类主流篡改任务的防御效能。以 SD v1.5 作为已知生成模型,并直接迁移至更大参数量的 SD XL 模型上。评估指标中,FID 与 LPIPS 衡量操纵后图像与正常生成图像的质量退化程度(数值越高防御破坏力越强);SSIM、CLIP 分数和人脸识别一致性得分(FR Score)衡量操纵结果与原始参考图像/文本的相似度(数值越低防御越成功)。
| 操纵场景 | 测试模型 | 防御方法 | FID ↑ | LPIPS ↑ | SSIM ↓ | CLIP ↓ | FR ↓ |
|---|---|---|---|---|---|---|---|
| 图像修复 | SD v1.5 | PhotoGuard | 117.41 | 0.3721 | 0.5754 | 0.8548 | 0.8784 |
| AdvDM | 140.89 | 0.3733 | 0.5439 | 0.8689 | 0.8988 | ||
| FaceLock | 119.04 | 0.3512 | 0.5492 | 0.8866 | 0.6752 | ||
| FaceArmor (本文) | 139.15 | 0.4772 | 0.4385 | 0.8177 | 0.6162 | ||
| SD XL | PhotoGuard | 106.39 | 0.3416 | 0.6013 | 0.8772 | 0.8960 | |
| AdvDM | 127.30 | 0.3483 | 0.5691 | 0.8857 | 0.9059 | ||
| FaceLock | 108.83 | 0.3274 | 0.5712 | 0.9045 | 0.7109 | ||
| FaceArmor (本文) | 129.30 | 0.4562 | 0.4617 | 0.8338 | 0.6355 | ||
| 图像编辑 | SD v1.5 | AdvDM | 131.59 | 0.5235 | 0.3748 | 0.6187 | 0.4950 |
| FaceLock | 132.80 | 0.4932 | 0.3968 | 0.6635 | 0.3002 | ||
| FaceArmor (本文) | 163.43 | 0.5727 | 0.3121 | 0.6247 | 0.3425 | ||
| SD XL | AdvDM | 119.00 | 0.4876 | 0.4002 | 0.6475 | 0.5203 | |
| FaceLock | 120.90 | 0.4620 | 0.4225 | 0.6855 | 0.3302 | ||
| FaceArmor (本文) | 150.10 | 0.5466 | 0.3355 | 0.6380 | 0.3610 | ||
| 人脸拟合 | SD v1.5 | Mist | 167.09 | 0.5933 | 0.2762 | 0.6721 | 0.3956 |
| AdvDM | 136.91 | 0.6338 | 0.2147 | 0.6751 | 0.3716 | ||
| FaceArmor (本文) | 160.70 | 0.6634 | 0.2252 | 0.6745 | 0.3657 | ||
| SD XL | Mist | 152.55 | 0.5605 | 0.3029 | 0.6925 | 0.4275 | |
| FaceArmor (本文) | 149.65 | 0.6419 | 0.2484 | 0.6887 | 0.3857 | ||
| 身份保持生成 | SD v1.5 | IDProtector | 161.05 | 0.5344 | 0.3502 | 0.7591 | 0.6006 |
| FaceArmor (本文) | 168.94 | 0.5533 | 0.3484 | 0.7647 | 0.5528 | ||
| SD XL | IDProtector | 147.62 | 0.5125 | 0.3732 | 0.7765 | 0.6257 | |
| FaceArmor (本文) | 159.57 | 0.5336 | 0.3786 | 0.7834 | 0.5780 |
在面向全新 Diffusion Transformer 架构(SD 3 和 Flux)的黑盒跨架构零知识迁移评估中(在图像修复任务上),传统基线方法性能严重退化,而 FaceArmor 在两个 DiT 模型上均取得最优防篡改指标: - Stable Diffusion 3: FaceArmor 取得 FID 156.44、LPIPS 0.3131、SSIM 0.6839、CLIP 0.7826、FR 0.9479,显著优于第二名 AdvDM(FID 143.88、LPIPS 0.2830、SSIM 0.7048、CLIP 0.8480); - Flux: FaceArmor 取得 FID 115.23、LPIPS 0.2906、SSIM 0.7218、CLIP 0.7332、FR 0.9464,防篡改破坏性全面超越基线(如 Mist 的 FID 108.17,AdvDM 的 CLIP 0.8946)。
消融实验¶
为了量化各特征损失分量(结构层 \(\mathcal{L}_E, \mathcal{L}_R\) 与概念层 \(\mathcal{L}_C, \mathcal{L}_F\))的具体贡献,下表展示了在全场景跨任务平均下的消融结果:
| 配置 | \(\mathcal{L}_E\) (隐空间) | \(\mathcal{L}_C\) (语义) | \(\mathcal{L}_F\) (人脸ID) | \(\mathcal{L}_R\) (参考纹理) | FID ↑ | LPIPS ↑ | SSIM ↓ | CLIP ↓ | FR ↓ | 说明 |
|---|---|---|---|---|---|---|---|---|---|---|
| Baseline | ✓ | 132.15 | 0.5215 | 0.3830 | 0.7604 | 0.7540 | 仅基础 VAE 扰动 | |||
| + Semantic | ✓ | ✓ | 145.40 | 0.5329 | 0.3523 | 0.6928 | 0.7615 | 显著压低 CLIP 语义对齐 | ||
| + Face ID | ✓ | ✓ | 138.63 | 0.5086 | 0.3614 | 0.7533 | 0.4308 | 人脸匹配率骤降至 0.4308 | ||
| + Texture | ✓ | ✓ | ✓ | 162.01 | 0.5510 | 0.3405 | 0.7010 | 0.4796 | 纹理崩坏显著增加 FID 破坏度 | |
| 完整模型 | ✓ | ✓ | ✓ | ✓ | 158.32 | 0.5781 | 0.3205 | 0.6846 | 0.4522 | 四维特征协同,综合防御指标最佳 |
此外,在针对优化机制的消融中: - 仅使用基线损失 \(\mathcal{L}_E\) 时,四任务平均 LPIPS 为 0.5215; - 引入全部四个损失但采用朴素求和(不带区域感知解耦与 PCGrad)时,LPIPS 提升至 0.5510,但边缘伪影明显; - 引入基于自引导注意力的区域感知优化与平滑梯度投影后,LPIPS 达到最优的 0.5781,SSIM 下降至 0.3205,在消除局部视觉瑕疵的同时实现了更深度的扰动破坏。
针对现实图像变换鲁棒性测试,在无变换基准下 FaceArmor 达到 LPIPS 0.557 / SSIM 0.325;在 JPEG 压缩(质量系数 75)下仍保持 LPIPS 0.431 / SSIM 0.449,远优于 EditShield 的 0.265 / 0.640 与 AdvDM 的 0.310 / 0.595;在高斯噪声(\(\sigma=0.05\))、随机旋转(\(\pm 10^\circ\))和尺度缩放(\(0.9\times\))后,LPIPS 均稳定维持在 0.40 以上,展现了极强的现实抗损耗能力。
关键发现¶
- 单一功能模块的局限性:仅优化 VAE 隐空间损失只能提供基础的结构失真,无法防范针对人脸特征提示的定制微调(FR 高达 0.7540);而加入 \(\mathcal{L}_F\) 后,身份识别得分直接从 0.7540 骤降至 0.4308,证明了针对生物特征提取器显式施加对抗约束对抵御人脸仿冒的决定性作用。
- 空间梯度冲突的真实危害:未经软加权解耦的多目标梯度直接相加会导致面部边界处的梯度向量产生大量负内积(方向对抗),导致局部扰动相互抵消;注意力软掩码与 PCGrad 协同不仅保护了人脸主体的视觉平滑度,还使得全局感知破坏力(LPIPS)额外提升了约 0.027。
- 架构无关的迁移壁垒突破:在 SD 3 与 Flux 等最新的 Flow Matching 与 DiT 架构中,所有基于特定 U-Net 内部特征匹配的基线均出现大幅性能衰减,而 FaceArmor 凭借基于图像本质表征(CLIP 与 VAE 隐空间泛化表征)的攻击,成功将防护效能跨越到完全不同的生成模型家族中。
亮点与洞察¶
- 架构无关的内在表征防御范式:改变了长期以来依赖特定扩散模型白盒结构的狭隘防御路线,通过在人脸物理结构与高维概念语义层建立普适攻击平面,使得生成的对抗人脸具备对黑盒架构甚至 DiT 模型的极强泛化破坏力。
- 基于内生注意力的免分割软解耦机制:无需引入外部分割网络增加额外开销,直接复用 ArcFace 卷积层注意力与 CLIP Grad-CAM 热力图作为连续空间软权重,既契合了不同任务的天然生效区域,又通过连续权重缓冲消除了边界伪影。
- 面向现实部署的全生命周期鲁棒性:将 EOT 数据变换流深度融合进对抗优化循环,解决了对抗扰动在社交媒体平台上传转码、二次压缩过程中极易被抹除的痛点。
局限与展望¶
- 优化计算耗时相对较高:由于前向传播与反向传播需要同时经过 VAE 集合、ReferenceNet、CLIP 和 ArcFace 多个异构替代网络并执行多次梯度正交投影,FaceArmor 单张图像平均耗时约为 90.2 秒(NVIDIA A800),高于 PhotoGuard(28.5s)与 AdvDM(55.8s)。尽管作为发布前的离线单次预处理该开销可接受,但在移动端即时防护场景下仍需轻量化加速。
- 强力扩散降噪净化攻击的理论抗性:当前针对输入图像的前处理滤波(如高阶扩散净化模型 Diffusion Purification)可能在一定程度上平滑高频对抗扰动,未来可进一步研究将隐式低频扰动或频域鲁棒模式整合入结构层中。
相关工作与启发¶
- vs PhotoGuard / EditShield: 这类早期方法主要以白盒方式针对单一生成模型(如 SD v1.5)的 VAE 编码器或 U-Net 交叉注意力施加扰动。FaceArmor 证明了单模块攻击面对跨模型迁移和多任务篡改时极易崩溃,提出结构与概念双层解耦表征空间,在保持高隐蔽性的同时实现了全任务覆盖。
- vs FaceLock / IDProtector: 专注于身份保持生成防御的方法往往将扰动死锁在人脸核心区域,导致背景替换与全局属性编辑场景下防御全面失效。FaceArmor 采用四维特征全面破坏与注意力自引导软权重,兼顾了人脸身份保护与非面部全局纹理/概念的防御平衡。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 摆脱针对单一扩散模型模块的过拟合限制,创新性提出基于内在双层表征与自引导注意力软权重的通用人脸防护机制。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 大篡改范式、4 种代表性扩散架构(含 DiT 架构 SD 3 与 Flux)、7 种主流基线模型,并在现实变换干扰与消融分析上进行了充分验证。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,问题定义清晰,数学推导与实验数据支撑完备,视觉机制图表清晰直观。
- 价值: ⭐⭐⭐⭐⭐ 为社交网络环境下的个人肖像隐私保护提供了高度可行且具备强大跨模型泛化能力的落地级主动防御方案。