跳转至

BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models

会议: ECCV 2026
论文: CVF / ECCV 2026
代码: https://github.com/OVER-CODER/BiSLW
领域: 图像生成
关键词: 扩散模型水印, 潜空间双谱嵌入, 离散余弦变换, 跨频带一致性, 再生成攻击防御

一句话总结

针对扩散模型生成图像版权归属与再生成擦除痛点,BiSLW 通过通道级 2D-DCT 将扩散潜在张量无损解耦为低频语义与高频纹理双频带,利用轻量残差网络与 FiLM 条件调制在 VAE 解码前独立注入对齐身份水印,辅以跨频带一致性约束,在实现 37.40 dB 高保真度与 1 ms 极低开销的同时显著提升对抗扩散再生成与复合图像失真的鲁棒性。

研究背景与动机

随着去噪扩散概率模型(DDPM)与潜在扩散模型(LDM)在视觉合成领域确立核心主导地位,模型生成的图像在逼真度与细节丰富度上已逐渐让人眼难以辨别,随之而来的未经授权传播、伪造造假与知识产权溯源困境日益严峻。隐形数字水印作为解决可信归属的关键手段,早期多以后处理形式直接作用于像素域,但这类方案不仅计算代价高昂,而且在面对基于扩散过程自身的“再生成攻击”(Regeneration Attacks,即图像加噪后重新反向去噪采样)时极其脆弱,嵌入的微弱信号极易被反向采样过程彻底洗去。

基于潜在空间的生成期水印方法虽降低了延迟,但现有方案大多将潜在张量视作扁平的静态空间特征图,未曾发掘潜在空间内在的频域分层结构;而仅有的频域工作(如 Tree-Ring)通常将固定的傅里叶环状模式硬编码在初始扩散高斯噪声中,依赖反演采样进行水印提取,不仅无法端到端自适应学习,且单一表征维度的水印一旦遭遇几何形变、图像重采样或频段滤波便会出现结构性失效。潜在空间中表征全局语义布局的低频信息与表征局部精细纹理的高频信息,在面对不同类型的物理和算法扰动时表现出天然的互补鲁棒特性。

为了打破单一表征维度的鲁棒性瓶颈,本文切入的角度是直接在扩散生成轨迹的最终潜在张量中建立基于频率分解的双通道协同嵌入机制。核心 idea:利用通道级离散余弦变换(DCT)将反向扩散生成的潜在特征解耦为语义低频与纹理高频双频带,通过轻量级网络将对齐的水印信号独立注入两个互补频段并在解码前精确重构,辅以跨频带一致性约束构建双谱冗余防御。

方法详解

整体框架

BiSLW 架构在潜在扩散模型(LDM)反向去噪轨迹输出的干净潜变量 \(z_0 \in \mathbb{R}^{C \times H \times W}\) 与预训练 VAE 解码器 \(D\) 之间建立嵌入通道。系统首先通过通道级二维离散余弦变换(2D-DCT)将潜变量转换至频域,并通过径向频率掩码将其解耦为表征粗粒度语义结构的低频张量与表征细粒度纹理的高频张量。随后,目标二进制水印向量 \(w \in \{-1, +1\}^{d_w}\) 通过轻量级特征线性调制(FiLM)分别驱动低频和高频扰动网络生成自适应残差,分别完成双频带加权注入。重组后的全谱张量经逆离散余弦变换(IDCT)无损映射回空间潜变量,并交付 VAE 解码器生成带水印图像。水印提取阶段,受扰图像重新编码回潜在空间并经频域分解后,由双频带解码器独立提取并加权判决。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["反向扩散完成潜变量 z₀<br/>+ 待嵌入水印向量 w"] --> S1["潜空间双谱解耦<br/>通道级 2D-DCT + 径向频带划分"]
    S1 --> S2["双谱水印注入<br/>FiLM 条件调制残差注入"]
    S2 --> S3["双谱逆变换与全谱重组<br/>IDCT 映射与 VAE 解码"]
    S3 --> Out["带水印图像 x̃ 生成"]
    Out -.->|失真/攻击通道| Ex["图像 VAE 重编码 E(x̃')"]
    Ex --> S4["双通道频谱解码与一致性判决<br/>DL/DH 独立提取 + 跨频带符号判决"]
    S4 --> Rec["恢复水印 ŵ"]

关键设计

1. 潜空间双谱解耦:基于径向频域划分的互补表征剥离 现有潜在水印直接在空间维度叠加扰动,极易在反向采样高斯模糊或纹理微调时被单向抹除。针对此痛点,BiSLW 发掘了扩散模型潜在流形内部的频率层级特性:低频系数主导全局结构与构图轮廓,高频系数主导局部高频细节与边缘纹理。方法对潜在变量 \(z_0\) 执行逐通道 2D-DCT: $\(Z_c^{\mathrm{freq}} = \mathrm{DCT}_{2D}(\mathbf{z}_{0,c}), \quad c=1,\ldots,C\)$ 由于频域中 DC 直流分量与高频 AC 交流分量在数值量级上相差悬殊,直接输入神经网络会导致梯度失衡与训练崩溃,BiSLW 在频带切分前对每个通道实施 z-score 归一化。随后,利用以归一化低频角为原点的径向二值掩码 \(\mathcal{M}\) 进行频谱硬划分: $\(\mathcal{M}[i, j] = \begin{cases} 1, & \text{if } \sqrt{(i/H)^2 + (j/W)^2} \le r \\ 0, & \text{otherwise} \end{cases}\)$ 将频谱分解为 \(Z^{\mathrm{low}} = Z^{\mathrm{freq}} \odot \mathcal{M}\) 和 \(Z^{\mathrm{high}} = Z^{\mathrm{freq}} \odot (1 - \mathcal{M})\)。该分解过程严格满足无损可加性 \(Z^{\mathrm{low}} + Z^{\mathrm{high}} = Z^{\mathrm{freq}}\),使水印能够分别靶向对不同扰动具有互补防御属性的频域载体。

2. 双谱水印注入:FiLM 条件自适应残差调制 为了摆脱固定傅里叶模式难以抵抗非刚性失真的缺陷,BiSLW 设计了低频扰动网络 \(\Delta_L\) 和高频扰动网络 \(\Delta_H\)。两网络均采用轻量卷积编码器-解码器架构,并通过特征线性调制(FiLM)层将水印编码 \(w\) 映射为通道级仿射变换参数(缩放因子与偏置量),自适应调整潜在频谱特征。扰动注入形式定义为: $\(\tilde{Z}^{\mathrm{low}} = Z^{\mathrm{low}} + \alpha_L \Delta_L(Z^{\mathrm{low}}, \mathbf{w}), \quad \tilde{Z}^{\mathrm{high}} = Z^{\mathrm{high}} + \alpha_H \Delta_H(Z^{\mathrm{high}}, \mathbf{w})\)$ 其中 \(\alpha_L\) 与 \(\alpha_H\) 为超参数注入强度标量。在配置中设置 \(\alpha_L > \alpha_H\)(例如默认 \(\alpha_L=0.8, \alpha_H=0.3\)),其深层机理在于低频潜变量能够承受更高强度的扰动且在经过剧烈图像退化与几何变换后依然稳定存活,而高频注入则以较弱强度补充细粒度冗余,避免图像解码产生伪影。

3. 双谱逆变换与全谱重组:解码前本征融合 区别于传统在生成图像后进行像素修改的 post-hoc 做法,BiSLW 将加水印后的双频带重新求和并还原通道反归一化,得到带水印频域张量 \(\tilde{Z}^{\mathrm{freq}} = \tilde{Z}^{\mathrm{low}} + \tilde{Z}^{\mathrm{high}}\)。随后通过逐通道逆离散余弦变换计算空间潜变量: $\(\tilde{\mathbf{z}}_0 = \mathcal{T}^{-1}(\tilde{Z}^{\mathrm{freq}})\)$ 最终图像由冻结的预训练 VAE 解码器生成 \(\tilde{x} = D(\tilde{\mathbf{z}}_0)\)。由于水印扰动在潜在空间内已完成几何与统计结构适配,经 VAE 深度非线性变换映射回像素空间后,天然符合自然图像分布与解码器流形先验,彻底根除了传统像素域水印在平滑区域易出现色带或颜色漂移的视觉伪影。

4. 双通道频谱解码与一致性判决:跨频带对齐与冗余集成 在水印提取阶段,提取器面临受损图像 \(\tilde{x}'\)。首先将其经冻结 VAE 编码器映射至潜空间 \(z' = E(\tilde{x}')\) 并执行 2D-DCT 与相同掩码划分,分别得到 \(Z'^{\mathrm{low}}\) 与 \(Z'^{\mathrm{high}}\)。双频提取器网络 \(D_L\) 与 \(D_H\) 独立预测位序列: $\(\hat{\mathbf{w}}_L = D_L(Z'^{\mathrm{low}}), \quad \hat{\mathbf{w}}_H = D_H(Z'^{\mathrm{high}})\)$ 为防止两路频带在训练过程中学习到相互脱节或漂移的身份表征,BiSLW 显式施加跨频带一致性损失 \(\mathcal{L}_{\mathrm{cons}} = \|\hat{\mathbf{w}}_L - \hat{\mathbf{w}}_H\|_2^2\)。在推理推断时,最终软输出由双分支预测均值给出:\(\hat{\mathbf{w}} = \frac{1}{2}(\hat{\mathbf{w}}_L + \hat{\mathbf{w}}_H)\),经符号函数 \(\mathrm{sign}(\cdot)\) 硬判决还原二进制水印。若图像遭遇高斯模糊等低通滤波,高频分支受损而低频分支兜底;若遭遇大面积局部裁剪等空间低频破坏,高频纹理分支提供有效补充,形成互补冗余。

损失函数 / 训练策略

在训练阶段,扩散主干与 VAE 编码/解码器全程冻结,仅联合优化轻量嵌入模块 \(\{\Delta_L, \Delta_H\}\) 与提取模块 \(\{D_L, D_H\}\)。总优化目标由四项损失加权构成: $\(\mathcal{L} = \lambda_w \mathcal{L}_w + \lambda_{\mathrm{cons}} \mathcal{L}_{\mathrm{cons}} + \lambda_z \mathcal{L}_z + \lambda_{\mathrm{rob}} \mathcal{L}_{\mathrm{rob}}\)$ 其中水印恢复损失 \(\mathcal{L}_w = \|\hat{\mathbf{w}}_L - \mathbf{w}\|_2^2 + \|\hat{\mathbf{w}}_H - \mathbf{w}\|_2^2\) 保证双分支对真值水印的拟合;潜在保真度损失 \(\mathcal{L}_z = \|\tilde{\mathbf{z}}_0 - \mathbf{z}_0\|_2^2\) 控制潜在流形漂移量;鲁棒性损失 \(\mathcal{L}_{\mathrm{rob}} = \mathbb{E}_{\mathcal{A} \sim \mathcal{P}_A} [\|\hat{\mathbf{w}}_L(\mathcal{A}(\tilde{x})) - \mathbf{w}\|_2^2 + \|\hat{\mathbf{w}}_H(\mathcal{A}(\tilde{x})) - \mathbf{w}\|_2^2]\) 通过在训练步中动态采样可微失真池 \(\mathcal{P}_A\)(包含 JPEG 压缩、高斯模糊、加性噪声、随机裁剪及扩散再生成模拟)实现端到端抗攻击对齐。超参数配置为 \(\lambda_w=1.0, \lambda_{\mathrm{cons}}=0.5, \lambda_{\mathrm{rob}}=1.0, \lambda_z=2.0\)。

实验关键数据

主实验

在由 MIRFLICKR-1M 训练后,模型在 AI 生成图像(32 位载荷)与通用基准 CLIC(48 位载荷)上进行了评测,涵盖无攻击以及中心裁剪、随机裁剪、缩放、旋转、高斯模糊、对比度调整、亮度调整、JPEG 压缩以及复合攻击(Comb.)。

方法 (位数) PSNR/SSIM ↑ 嵌入耗时 (ms) 无攻击 Acc ↑ 中心裁剪 Acc ↑ 旋转 15° Acc ↑ 高斯模糊 Acc ↑ JPEG-70 Acc ↑ 复合攻击 Acc ↑ 平均 Acc ↑
DCT-DWT (32) 39.47 / 0.97 139 0.91 0.51 0.52 0.51 0.51 0.51 0.55
HiDDeN (30) 32.59 / 0.95 17 0.91 0.91 0.79 0.76 0.53 0.59 0.77
SSL (32) 33.23 / 0.89 870 1.00 0.74 0.99 1.00 0.99 0.85 0.92
RoSteALS (32) 29.31 / 0.93 144 1.00 0.50 0.47 1.00 1.00 0.50 0.77
RivaGAN (32) 40.53 / 0.98 57 0.99 0.98 0.91 0.99 0.98 0.93 0.92
Tree-Ring (32) 33.64 / 0.90 46 0.88 0.81 0.72 0.88 0.83 0.81 0.83
LaWa* (32) 34.25 / 0.89 1 1.00 1.00 1.00 1.00 1.00 0.97 0.99
BiSLW* (32, 本文) 37.40 / 0.91 1 1.00 1.00 1.00 1.00 1.00 0.98 0.99
BiSLW-post-gen (32) 37.42 / 0.91 33 1.00 1.00 1.00 1.00 1.00 0.98 0.99

生成质量与潜在流形保真度评测结果(Table 2):

方法 FID ↓ CLIP 相似度 ↑ PSNR (dB) ↑ KL 散度漂移 ↓ 潜在特征偏移 ↓ 再生成精度 \(t^*=250/500\) ↑
Vanilla SD (原始无水印) 8.7 0.312 — — — —
LaWa* 9.8 0.307 34.25 0.021 0.014 0.94 / 0.89
Tree-Ring 9.9 0.302 33.64 0.024 0.018 0.88 / 0.81
BiSLW* (本文) 9.0 0.311 37.40 0.018 0.011 0.96 / 0.92

消融实验

为了验证双谱联合嵌入的必要性,论文对比了仅低频嵌入、仅高频嵌入与双谱完整嵌入在 AI 生成图像(48 位载荷)下的表现(Table 4):

嵌入策略配置 PSNR (dB) ↑ SSIM ↑ 复合攻击位精度 (Comb.) ↑ 说明
仅低频嵌入 (Low-frequency only) 38.96 0.92 0.88 图像质量最高,但在复杂失真叠加下鲁棒性明显不足
仅高频嵌入 (High-frequency only) 37.12 0.89 0.90 具备一定抗复合失真能力,但视觉保真度下降较多
BiSLW 全模型 (Low + High) 37.71 0.89 0.93 双频带互补产生结构冗余,取得最优抗复合攻击性能

针对潜在空间保真度权重 \(\lambda_z\) 的超参敏感性消融(48 位载荷,Table 5):

\(\lambda_z\) 正则权重 PSNR (dB) ↑ SSIM ↑ 无攻击位精度 (None) ↑ 复合攻击位精度 (Comb.) ↑
0.5 36.85 0.86 1.00 0.96
2.0 (默认选定配置) 37.71 0.89 0.99 0.93
5.0 38.53 0.91 0.98 0.91
10.0 39.14 0.92 0.98 0.89
20.0 39.59 0.92 0.97 0.88

关键发现

  • 双频协同优于单频独立:单低频虽然视觉指标优越(PSNR 38.96 dB),但面对复合攻击位精度暴跌至 0.88;高频仅能达到 0.90;而双谱联合在仅略微牺牲低频 PSNR 的前提下,复合鲁棒性显著拉升至 0.93,表明双谱冗余有效覆盖了不同频段的攻击盲区。
  • 再生成攻击韧性极高:在防御难度极高的扩散模型重新加噪反向采样攻击中,即使在 \(t^*=500\)(破坏了潜在空间大部分高斯噪声分布)的极度恶劣条件下,BiSLW 仍维持 0.92 的高精度,大幅领先 LaWa(0.89)和 Tree-Ring(0.81)。
  • 保真度与生成流形极度贴近原生:BiSLW 的 FID 达到 9.0,无限逼近无水印原始 SD 的 8.7,相比强基线 LaWa(9.8)PSNR 提升了 3.15 dB,KL 散度偏移仅 0.018,证实双谱自适应残差未破坏预训练潜在流形。

亮点与洞察

  • 从平坦空间表征走向潜在频域分层:敏锐指出扩散模型潜变量在频域天然具有语义与纹理分层结构,跳出了传统空间特征图改写的思维定势,利用 channel-wise DCT 实现了低代价的结构化正交解耦。
  • 动态学习替代硬编码频域模式:与 Tree-Ring 在初始噪声硬编码傅里叶环不同,BiSLW 在生成末端的潜变量中利用可学习的轻量卷积网络结合 FiLM 动态调制水印,既保有频域鲁棒性,又具备极强的非线性图像自适应能力。
  • 跨频带一致性与极速推断:显式施加 \(\mathcal{L}_{\mathrm{cons}}\) 约束消除了双谱解码漂移,且轻量设计仅在潜在张量上计算,在生成管线内部仅耗时 1 ms,完全不影响扩散模型的实际吞吐效率。

局限与展望

  • 极端大角度旋转几何失真下的衰减:在载荷扩充至 96/128 位且遭受 15° 旋转时,由于频域系数在网格旋转下发生相位与能量扩散,高频分支提取精度出现下降(96 位旋转 Acc 为 0.77),未来可结合极坐标频域变换或空间变换网络(STN)进行预校正。
  • 频带切分半径与网络解耦的静态性:当前径向分割阈值 \(r=0.25\) 与双分支独立架构固定,未来可探索自适应频率通道注意力机制,根据图像内容复杂度动态分配高低频嵌入比重。

相关工作与启发

  • vs Tree-Ring Watermarks: Tree-Ring 在扩散初始噪声中放置固定的傅里叶环状模具,必须依赖基于 DDIM 的确定性反演采样来提取,无法端到端训练且不具备有效有效载荷容量扩展性;BiSLW 在最终潜在潜变量中采用双频带端到端自学习注入,支持任意长比特消息直接解码。
  • vs Stable Signature / LaWa: Stable Signature 需要对 VAE 解码器进行参数微调,而 LaWa 虽在潜在空间操作但将潜在张量视为普通空间特征;BiSLW 全程冻结 VAE 和扩散网络,通过双谱解耦在不改动底座的同时使 PSNR 相比 LaWa 提升了 3.15 dB。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次将扩散潜在张量进行双谱频域解耦并用于可学习双频带冗余水印嵌入]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 9 类单一失真、复合攻击、再生成抗性、超参及消融,且验证了高比特承载力]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机链条严密,方法推导清晰,实验图表信息完备]
  • 价值: ⭐⭐⭐⭐⭐ [为 AIGC 内容追溯与扩散模型生成安全提供了兼具极高画质、强鲁棒性与 1 ms 推理开销的工业级方案]