跳转至

DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders

会议: ECCV 2026
论文: ECCV 原文
代码: 待开源
领域: AI安全 / 人体理解
关键词: 不可学习样本, 扩散自编码器, 语义扰动, 数据隐私, 对抗重学习

一句话总结

DiffUE 借助预训练扩散自编码器(DiffAE)将不可学习样本(UE)的防御扰动从传统像素空间映射到解耦的语义隐空间,通过双层最小化优化与定向属性编辑引导,在保留真实图像流形结构与极高感知质量的同时,显著增强抵御对抗训练、频域滤波、强重学习攻击与有损压缩的防御鲁棒性。

研究背景与动机

随着深度学习与基础大模型的飞速发展,未经授权从社交媒体与公开平台抓取个人肖像及敏感数据用于商业 AI 训练的现象愈发泛滥。尽管 GDPR、CCPA 等数据隐私保护法规已相继确立,但这类规章多集中于事前采集与准入监管,一旦数据进入模型训练管线,用户缺乏有效的技术机制阻止个人数据被无休止地剥削。为此,不可学习样本(Unlearnable Examples, UEs)应运而生。经典方法(如 EM 误差最小化噪声)尝试向样本中注入不可察觉的高频扰动,制造极低的训练损失假象,从而抑制有效梯度的回传,使模型无法学到真实的判别特征。

然而,现有的不可学习样本技术深陷于「防御脆弱性」与「视觉可用性」的双重困境之中。一方面,现存方法普遍依赖脆弱的像素空间扰动,极易被对抗训练、灰度化、图像变换增强(如 UEraser)以及扩散纯化模型(如 LUE、Avatar)轻易剥离或绕过,导致防御机制快速失效。另一方面,为了对抗上述重学习策略,REM、SEM 等改进方案选择加大扰动半径或引入额外的对抗/随机噪声分量,这直接在像素空间引发了大量如高频噪点、色块撕裂和边缘毛刺等严重的视觉伪影,彻底破坏了图像的美学价值与格式一致性。对于摄影师、数字艺术家以及普通社交媒体用户而言,画质严重受损的图片根本无法用于日常分享与展示。

面对这一根本矛盾,本文打破了在像素空间做微小扰动的传统惯性思维,提出将不可学习信号嵌入到图像的高层语义流形中。核心 idea:利用扩散自编码器(DiffAE)将输入图像解耦为全局语义隐码与随机纹理隐码,将防御性误差最小化噪声注入连续的语义空间,并借助条件 DDIM 确定性解码重建不可学习样本,不仅从根本上消除了像素级高频伪影,还能结合属性分类器实现受控的自然照片修饰,在真实图像流形上构建高鲁棒的防滥用屏障。

方法详解

整体框架

DiffUE 的核心架构建立在预训练扩散自编码器(DiffAE)之上。输入原始图像 \(x_0\) 首先由语义编码器 \(\mathcal{E}\) 与条件 DDIM 编码器进行解耦表征,分别提取出包含全局非空间语义特征的高维向量 \(z_{sem} = \mathcal{E}(x_0) \in \mathbb{R}^{512}\),以及保留空间几何细节与局部纹理信息的随机隐码 \(x_T\)。防御者的目标是在 \(z_{sem}\) 上搜索一个语义扰动 \(z_\delta\),构成防御语义隐码 \(z_{def} = z_{sem} + z_\delta\)。随后,条件 DDIM 解码器 \(\mathcal{D}\) 以 \(z_{def}\) 为指导条件、从 \(x_T\) 出发进行确定性逆向去噪采样,重建出具有防御能力的不可学习图像 \(x_u = \mathcal{D}(z_{sem} + z_\delta, x_T)\)。该图像送入代理分类模型 \(g_\theta\) 计算交叉熵损失,通过双层优化驱动模型迅速产生近乎为零的损失响应,彻底瓦解模型对真实数据特征的提取。

整个防御流水线由双隐变量解耦、语义防御扰动生成、可选的定向属性编辑引导以及条件 DDIM 解码四大部分紧密协同运转:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入原始图像 x0"] --> B["双隐变量解耦编码<br/>语义编码器 E 提取 zsem + 随机隐码 xT"]
    B --> C["语义隐空间防御优化<br/>投影梯度下降 PGD 迭代更新 zδ"]
    C --> D["定向语义编辑引导<br/>余弦相似度对齐目标属性方向 zM (可选)"]
    D --> E["条件 DDIM 确定性解码<br/>基于 zdef 与 xT 逆向采样生成 xu"]
    E --> F["代理模型双层博弈<br/>诱导低训练损失并抑制有效学习梯度"]

关键设计

1. 语义隐空间防御扰动注入:从像素高频破坏转向流形语义偏移 传统不可学习样本直接在 RGB 像素矩阵上累加受限范数扰动 \(\delta\),这类高频加性噪声违背了自然图像的数据流形分布,极易被中值滤波、高斯平滑以及图像压缩算法破坏。DiffUE 转向利用 DiffAE 的连续隐空间,将扰动限制在高级语义向量 \(z_{sem}\) 之内。在优化过程中,算法采用带投影的梯度下降法(PGD),在限制半径 \(\rho_u\) 的 \(L_p\) 球域内沿损失梯度的反方向迭代更新防御噪声 \(z_\delta\): $\(z_{\delta}^{(t+1)} = \Pi_{\rho_u} \left( z_{\delta}^{(t)} - \eta \cdot \mathrm{sign}\left(\nabla_{z_\delta} \mathcal{L}_{ule}\right) \right)\)$ 其中 \(\Pi_{\rho_u}\) 表示范数投影截断操作,\(\eta\) 为更新步长,\(\mathcal{L}_{ule}\) 为分类诱导损失。通过将对抗信号约束在学习到的图像流形流向中,扰动转化为图像全局光照、色调或轻微材质等符合人类视觉感知的自然微调,避免了任何突兀的外来空间噪点。由于深度神经网络对隐层线性特征极其敏感,极小的语义偏移就能剧烈改变分类器内部的特征响应,使得 DiffUE 仅需较小的扰动预算即可实现强力欺骗,同时天然抵御绝大多数像素级几何滤波与增强。

2. 代理模型协同的双层最小化优化:精确刻画学习动态轨迹 不可学习样本的本质并非如对抗攻击那样诱导预测错误,而是通过制造捷径特征让模型「误以为已经学成」,从而在整个训练周期内停滞在近零损失状态。这就要求防御噪声必须高度契合深度网络在训练初期的梯度流动规律。DiffUE 将不可学习样本的生成建模为一个 min-min 双层优化问题: $\(\min_{\theta} \; \mathbb{E}_{(x_0, y)} \left[ \min_{\|z_\delta\|_p \le \rho_u} \mathcal{L}\left( g_\theta\left( \mathcal{D}(\mathcal{E}(x_0) + z_\delta, x_T) \right), y \right) \right]\)$ 内层优化固定模型参数 \(\theta\),更新语义噪声 \(z_\delta\) 以最小化分类损失;外层优化则更新代理模型参数 \(\theta\) 以进一步拉低拟合误差。为了防止未充分训练的模型梯度失真,DiffUE 在优化防御噪声前先预先训练代理模型参数 \(\theta\) 共 \(Q\) 个步长,使其真实反映典型的特征学习动态,并在每轮外层更新后执行 10 步内部 PGD 迭代。整个双层对抗交替执行,直到代理模型在加噪样本上的训练准确率超过设定阈值 \(\lambda\)(如 99%),从而确保注入的语义捷径足以彻底屏蔽真实特征。

3. 属性与风格受控编辑引导:将防御噪声转化为实用照片修饰 为了彻底解决隐私保护以牺牲视觉质量为代价的用户痛点,DiffUE 提出将无序的语义防御扰动重定向为人类用户乐于接受的良性图像编辑。利用 DiffAE 隐空间高度解耦且支持线性操控的特性,作者针对特定视觉属性(如微笑、发型、性别)或风格滤镜,在语义特征空间上训练轻量线性分类器,提取分类超平面的法向量并单位化作为目标编辑方向 \(z_M = w_{cls} / \|w_{cls}\|\)。随后将防御损失改写为结合分类欺骗与方向对齐的多目标优化目标: $\(\mathcal{L}_{ule} = \mathcal{L}\left( g_\theta\left( \mathcal{D}(\mathcal{E}(x_0) + z_\delta, x_T) \right), y \right) + \gamma \cdot \left( 1 - \cos(z_\delta, z_M) \right)\)$ 其中 \(\cos(\cdot)\) 代表向量余弦相似度,\(\gamma\) 为调节目标编辑显著程度的缩放权重。通过这种方式,原本随机弥散的防御噪声被精确导向预设的美化方向,使输出的不可学习图片不仅毫无噪点,反而呈现出自然的精修效果(如面带微笑、色调微调),既实现了保护隐私的根本目的,又赋予了用户分享高品质内容的强烈意愿。

损失函数 / 训练策略

在实验实现中,DiffUE 采用 ResNet-18 作为默认代理模型 \(g_\theta\)。对于语义扰动半径 \(\rho_u\) 的选定,由于隐空间距离无法直接映射为像素距离,作者通过控制 DiffAE 隐空间的 50 个激活维度在 2,000 张样本上进行实证映射,将 CIFAR-10/100 的 \(\rho_u\) 设为 0.20,ImageNet 设为 0.35,这严格对应于像素空间中最大 4/255 的微小变动(仅为传统基线 8/255 预算的 50%)。对于受控属性修改任务(如 CelebA-HQ),\(\rho_u\) 适度放宽至 0.35 以呈现明显的视觉属性变化。双层优化循环持续进行,直至代理模型的训练集准确率突破 99%。

实验关键数据

主实验

为了评估 DiffUE 抵抗对抗训练(Adversarial Training, AT)重学习策略的能力,论文在 CIFAR-10、CIFAR-100 以及 ImageNet Subset(前 100 类)上对 ResNet-18 进行了广泛测试。在对抗重学习中,攻击者在训练时引入扰动半径为 \(\rho_t\) 的对抗训练来强行破坏样本防御性。测试集准确率越低,说明不可学习保护越有效。

数据集 对抗训练半径 \(\rho_t\) 干净基线 (Clean) EM [9] REM [4] (\(\rho_a=4/255\)) SEM [20] (\(\rho_r=4/255\)) 本文 DiffUE
CIFAR-10 0 95.64% 11.98% 31.27% 25.14% 10.79%
2/255 89.24% 20.96% 37.75% 26.65% 12.59%
4/255 86.92% 76.95% 64.64% 46.85% 17.11%
CIFAR-100 0 85.32% 1.76% 19.30% 18.61% 2.17%
2/255 76.76% 67.29% 18.35% 12.56% 3.78%
4/255 72.19% 64.59% 32.22% 26.19% 4.92%
ImageNet Subset 0 82.54% 1.89% 17.74% 10.11% 2.11%
2/255 73.22% 70.67% 31.40% 36.22% 12.45%
4/255 70.23% 67.86% 45.49% 38.57% 17.20%

消融实验与多防御/重学习评估

在 CIFAR-10 上评估不同滤波技术与前沿重学习攻击下的测试集恢复准确率(越低越安全),对比 EM、REM、SEM 与 DiffUE;并测试 CelebA-HQ 与 ImageNet 下的感知图像质量(FID 越低越好,SSIM/PSNR 越高越好)。

任务 / 评估维度 指标 / 攻击配置 EM [9] REM [4] SEM [20] 本文 DiffUE 表现优势说明
CIFAR-10 滤波防御 均值滤波 (Mean) 37.87% 29.92% 28.55% 13.32% 保持低准确率,滤波无法去除语义扰动
高斯滤波 (Gaussian) 32.71% 28.53% 24.22% 12.43% 相比次优降幅超 11.7%
灰度化变换 (GrayScale) 83.23% 63.87% 34.23% 13.99% 彻底免疫通道去除型防御
CIFAR-10 强重学习 增强重学习 (UEraser) 90.23% 87.39% 81.56% 14.19% 次优破防至 81.56%,DiffUE 稳固防御
扩散纯化模型 (LUE) 90.33% 89.57% 89.29% 33.97% 对抗扩散反向纯化展现断层领先优势
有损图像压缩测试 CIFAR-10: JPEG 压缩 45.22% 38.12% 32.92% 17.22% 相比 EM 精度回弹降低 28.0%
CIFAR-10: WebP 压缩 55.57% 41.78% 35.96% 18.05% WebP 压缩下依然坚挺
感知画质 (CelebA-HQ) FID (↓) 11.612 10.971 10.145 5.355 FID 降低 47.2%,接近真实自然图像流形
SSIM (↑) / PSNR (↑) 0.704 / 30.11 0.561 / 29.41 0.611 / 29.87 0.814 / 32.44 结构一致性与峰值信噪比全方位领跑

关键发现

  • 对重学习攻击的非对称防御优势:在先进重学习方法 UEraser(利用对抗数据增强破解 UE)面前,所有基于像素的基准几乎全线崩溃(EM 90.23%、REM 87.39%、SEM 81.56%),而 DiffUE 仅取得 14.19% 的测试准确率,证明语义特征层面的捷径完全不受像素域几何变换的影响。在面对扩散纯化模型 LUE 时,DiffUE 的模型测试准确率仅为 33.97%,比基线低出 55% 以上。
  • 卓越的有损压缩鲁棒性:在真实社交平台普遍经历的 JPEG、WebP 和 HEIC 有损压缩中,传统像素噪声因属于高频分量而被压缩编码器优先滤除,使模型准确率大幅反弹(如 EM 在 JPEG 后恢复到 45.22%);DiffUE 依托流形上的低频高层属性调制,压缩后准确率仍死锁在 17.22%(CIFAR-10)与 4.12%(ImageNet)。
  • 极佳的跨架构迁移性(Transferability):在以 ResNet-18 生成的不可学习样本上训练 VGG-16、ResNet-50 与 DenseNet-121,Grad-CAM 显著图显示所有受试模型均从面部判别区域发生剧烈偏移,CIFAR-100 上迁移至 DenseNet-121 仍能将测试准确率压制在 10.98%(基准普遍在 50%~66%)。
  • 用户主观实验的高偏好度:56 位专业摄影师与数字内容创作者的双盲评分中,DiffUE 取得 4.65 的高自然度评分(干净图像为 4.90),可用性接受度达到 98.5%(REM 仅 19.2%),综合排序以 1.22 的平均名次斩获绝对第一。

亮点与洞察

  • 防御空间升维的降维打击:传统方法困在像素空间的微观对抗中,极易被去噪、低通滤波和重平衡抹除。DiffUE 将防御战场迁移至生成模型的隐语义空间,利用流形本身的非线性与语义完整性保护数据,思路兼具前瞻性与普适性。
  • 将对抗噪声优雅伪装为实用美学修饰:创造性地将不可学习的误差极小化目标与属性分类器方向对齐,让保护隐私的过程同步成为「添加微笑」或「提升质感」的自愿行为,成功化解了隐私保护与用户体验的长期对抗。
  • 即插即用的跨域启发:语义隐空间的梯度引导思路完全可推广至多模态图文对齐、3D Gaussian Splatting、音频扩散保护等新兴模态,为生成式 AI 时代的内容创作者维权提供了标准范式。

局限与展望

  • 计算开销与时间成本:生成过程中依赖扩散自编码器的多次 DDIM 去噪采样以及双层优化的梯度反传,生成单批次样本的时间开销显著高于轻量的一阶像素扰动算法,大规模工业级部署尚需结合流形蒸馏或一步生成技术。
  • 先验依赖与域外泛化约束:DiffUE 的防御质量高度依仗预训练扩散自编码器的隐空间表征质量与重建保真度;若输入样本所属领域超出 DiffAE 预训练分布(如极端特殊领域的显微病理图),其重建失真可能加剧。
  • 未来方向探索:作者指出可进一步优化语义噪声半径的自适应搜索策略,并将防御机制扩展到多模态大语言模型(MLLMs)和视频跟踪生成场景。

相关工作与启发

  • vs EM (Huang et al., ICLR 2021): EM 提出像素空间误差最小化扰动,开创不可学习样本先河,但在对抗训练与简单滤波下脆弱不堪且伪影严重;DiffUE 将其拓展至语义隐空间,全面攻克了脆弱性与可用性难题。
  • vs REM (Fu et al., ICLR 2022) & SEM (Liu et al., AAAI 2024): REM 和 SEM 试图通过在像素空间联合优化对抗噪声或随机扰动来加固 UE,但付出了惨痛的画质代价(FID 劣于 10.0,用户接受率低至 19.2%);DiffUE 在扰动预算减半的同时,各攻击场景准确率全面领先,且画质逼近原图。
  • vs LUE (Jiang et al., ACM MM 2023) & Avatar (Dolatabadi et al., SaTML 2024): 探索利用扩散纯化模型破坏不可学习样本;DiffUE 表明直接立足于扩散隐空间生成的语义级扰动能反向抵御扩散逆向纯化。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次将不可学习样本从像素空间升级至扩散自编码器的语义隐空间,并实现受控编辑]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖4大主流数据集、5类强重学习攻击、3类图像压缩、跨架构迁移与56人专业用户调研]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑紧密,数学表达精准,实验分析透彻,图表详实直观]
  • 价值: ⭐⭐⭐⭐⭐ [为 AIGC 与大数据采集时代的个人隐私防护与数字版权提供了高实用价值的工程范式]