跳转至

Spectral Prior for Reducing Exposure Bias in Diffusion Models

会议: ECCV 2026
论文: ECCV 2026
领域: 图像生成
关键词: 扩散模型, 曝光偏差, 频谱先验, 引导采样, 频域SNR

一句话总结

针对扩散模型多步迭代采样中的曝光偏差(分布漂移)表现为频率与时间步相关的信噪比失真问题,本文提出基于离线拟合幂律频谱先验并在推理时进行轻量 FFT 梯度校准的 Spectral Alignment(SPA)引导采样方法,以仅 3-4% 的计算开销全面提升像素、潜空间及流匹配模型的生成质量。

研究背景与动机

扩散模型通过多步迭代去噪实现了极高保真度的图像生成,然而在实际采样过程中,单步预测误差会随着时间步推进不断累积,导致采样轨迹逐渐偏离训练时真实前向过程的边际分布,这种现象通常被称为曝光偏差(Exposure Bias)。已有研究主要将曝光偏差归结为推理噪声水平与预设调度之间的失配,并提出了如噪声预测重缩放(\(\epsilon\)-rescaling)、时间步偏移采样(Time-shift sampling)以及基于小波变换的频带重加权等修复方案。然而,这些方法要么预设了误差在全频段上是均匀分布的标量方差偏移,要么依赖针对特定分辨率或步数手工调优的启发式规则,缺乏普适的理论刻画与跨架构适应能力。

深入探究中间预测步的频域特性可以发现,曝光偏差在本质上对应着具有显著频率依赖性的有效信噪比(SNR)误差。更关键的矛盾在于,不同模型架构、不同隐空间表征以及不同去噪时间步下的频域失配模式存在本质差异:例如 ADM 在高频区域严重衰减,Stable Diffusion 2.0 却在低频段呈现能量亏损,而更现代的 SDXL、SD3.5 及 FLUX 则呈现出高度复杂的通道级、时间步异质性失真。这种强烈的架构多样性意味着任何固定的先验修正规则(如盲目增强高频或全局缩放)都无法在不同模型间通用,亟需一种能够数据驱动地刻画特定模型理想频谱并自适应纠正的机制。

本文的切入角度是直接校准采样过程中单步 Tweedie 干净预测值的功率谱,使其对齐到前向过程单步无累积误差的参考功率谱。核心 idea:将单步前向预测的径向平均功率谱建模为随时间步演化的参数化幂律先验,在推理阶段通过不对称惩罚的频域引导损失与快速反向 FFT,以无网络额外前向的反向梯度极低开销校准采样轨迹。

方法详解

整体框架

Spectral Alignment(SPA)整体分为两个独立阶段:阶段一为离线频谱先验拟合(仅需在模型发布或部署前单次执行),阶段二为推理阶段频谱对齐引导采样。在阶段一中,利用少量训练集图像进行前向加噪,通过预训练模型的单步 Tweedie 去噪预测提取各通道的二维功率谱,经径向平均(RAPS)降维后拟合带偏移和线性项的幂律函数,并通过三次样条插值得到连续时间步的先验模型 \(S(t, f)\)。在阶段二中,在常规迭代去噪步骤计算出 CFG 噪声后,通过 Tweedie 公式得到当前步的去噪估计 \(\hat{x}_{0|t}\),计算其当前功率谱与先验目标 \(S(t, f)\) 的对数均方误差,引入对频谱能量亏损施加更强惩罚的不对称函数 \(\phi_a\),通过对 \(x_t\) 计算反向梯度施加引导更新,再执行常规去噪单步更新。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入噪声状态 x_t 与条件 c"] --> B["前向去噪与 CFG 组合<br/>计算 ε_CFG 与 Tweedie 预测 x̂_0|t"]
    B --> C["目标功率谱建模<br/>计算 2D FFT、RAPS y_t(f) 与先验 S(t, f) 对齐"]
    C --> D["不对称引导损失与状态校准<br/>计算不对称对数谱误差并通过 iFFT 梯度更新 x_t"]
    D --> E["标准单步去噪更新<br/>基于校准后状态推进至 x_{t-1}"]

关键设计

1. 目标功率谱建模:数据驱动的连续时间幂律拟合 针对不同模型在不同时间步频域失配方向迥异、且无法直接利用真实未知 \(x_0\) 衡量推理信噪比的问题,该设计利用前向过程单步 Tweedie 估计 \(\hat{x}_{0|\tau}\) 作为无累积误差的参考代理。对每个通道的 2D 离散傅里叶变换取模方得到功率谱 \(\mathbf{Y}_\tau = |\mathcal{F}[\hat{x}_{0|\tau}]|^2\),通过角向积分转换为一维径向平均功率谱(RAPS)\(y_\tau(f) = \text{RadialAvg}(\mathbf{Y}_\tau)\),其中归一化频率 \(f \in (0, 0.5]\)。考虑到自然图像及模糊图像普遍遵循能量随频率幂律衰减的统计规律,将目标谱参数化建模为: $\(S(t, f) = p_t \cdot f^{-q_t} + r_t \cdot f + s_t\)$ 其中 \(p_t, q_t, r_t, s_t\) 为各时间步与通道独立的参数,第一项捕捉幂律衰减,偏移项 \(s_t\) 与线性项 \(r_t \cdot f\) 捕捉偏离幂律的细粒度偏差(默认 \(r_t=0\),仅在 SDXL、FLUX 等复杂模型中启用)。在离散时间步上通过最小二乘拟合后,对参数进行时间轴三次样条插值,构建起对任意采样步长和调度器通用的连续目标频谱函数 \(S(t, f)\)。

2. 不对称引导损失与状态校准:惩罚能量亏损并利用快速算子校准采样 在推理去噪时,由于直接反传主干网络计算引导开销过大,SPA 借鉴扩散后验采样(DPS)思路,对 Tweedie 估计施加非线性先验约束,并通过阻断 \(\epsilon_\theta\) 梯度将计算严格限定在闭式解析变换内。统计分析表明,推理中功率谱低于理论先验的概率及幅度会导致严重的模糊与结构塌陷,而高于先验的影响相对良性。为此,设计了分段不对称惩罚函数 \(\phi_a(x)\)(其中 \(a > 1\) 为惩罚强度,当误差 \(x < 0\) 时放大 \(a\) 倍),构建多通道与各频带的对数频谱均方损失: $\(\mathcal{L}_{\text{spec}}(x_t, t) = \frac{1}{N} \sum_{c=1}^{N} \sum_{k=1}^{K} \left( \phi_a\left( \log_{10} y_t(f_k^c) - \log_{10} S(t, f_k^c) \right) \right)^2\)$ 梯度计算仅涉及对数谱差分、径向均值展平及二维逆傅里叶变换(iFFT),复杂度仅为 \(\mathcal{O}(D \log D)\),无需对神经网络执行任何反向传播,将中间隐变量直接更新为 \(x_t \leftarrow x_t - \eta \nabla_{x_t} \mathcal{L}_{\text{spec}}\)。

损失函数 / 训练策略

离线建模阶段仅需使用 10K 张训练集样本(如 ImageNet、CelebA-HQ 或 LAION-Aesthetics V2)前向加噪并执行一次模型推断,单次计算成本与计算一次 FID 相当,拟合判定系数 \(R^2\) 在绝大多数场景下均超过 0.9。在推理采样阶段,超参数仅包含引导步长 \(\eta\) 与不对称惩罚系数 \(a\):在 DDPM 上取 \((\eta, a) = (0.01, 1.0)\),ADM 上为 \((0.05, 2.0)\),SD2.0 与 SDXL 共享 \((0.2, 5.0)\),SD3.5 为 \((0.75, 3.0)\),FLUX.1 [dev] 为 \((0.2, 2.0)\)。

实验关键数据

主实验

在无条件/类别条件生成(像素空间 ADM 与 DDPM)及文生图模型(潜空间 SD2.0、SDXL 与流匹配 SD3.5、FLUX.1)上进行全面测试,对比了基线 Vanilla、\(\epsilon\)-rescaling、Time-shift 及小波频带调控(Wavelet reg.)。

模型与数据集 评测方法 FID ↓ KID (×1000) ↓ Density ↑ Coverage ↑
ADM (ImageNet 256×256) Vanilla 9.29 19.48 1.133 0.5939
ADM (ImageNet 256×256) \(\epsilon\)-rescaling 8.00 11.01 1.146 0.5976
ADM (ImageNet 256×256) Time-shift 15.35 77.47 0.761 0.4321
ADM (ImageNet 256×256) Wavelet reg. 8.35 12.80 1.122 0.5929
ADM (ImageNet 256×256) SPA (Ours) 7.81 10.25 1.226 0.6184
DDPM (CelebA-HQ) Vanilla 49.44 43.57 0.8186 0.0169
DDPM (CelebA-HQ) \(\epsilon\)-rescaling 48.53 40.98 0.8791 0.0169
DDPM (CelebA-HQ) SPA (Ours) 48.63 41.36 0.8344 0.0167

在文生图模型评测中,主要采用反映人类偏好的奖励模型评分 HPSv3 和 ImageReward,同时监控 CLIP Score(ViT-G/14)以验证文本对齐保持度(5K MS-COCO 验证集提示词):

模型配置 评测方法 HPSv3 ↑ ImageReward ↑ CLIP Score ↑ 提升幅度说明
SD2.0 (\(w=7.5\)) Vanilla 7.043 0.393 0.333 基准
SD2.0 (\(w=7.5\)) Wavelet reg. 7.193 0.429 0.332 启发式波段加权
SD2.0 (\(w=7.5\)) SPA (Ours) 7.238 0.421 0.333 最佳综合画质
SDXL (\(w=7.5\)) Vanilla 8.426 0.791 0.341 基准
SDXL (\(w=7.5\)) \(\epsilon\)-rescaling 8.528 0.800 0.340 标量缩放
SDXL (\(w=7.5\)) Wavelet reg. 8.576 0.807 0.340 小波调控
SDXL (\(w=7.5\)) SPA (Ours) 8.829 0.829 0.341 约 +4.5% 显著增益
SD3.5 (\(w=5.0\)) Vanilla 9.782 0.939 0.335 流匹配基准
SD3.5 (\(w=5.0\)) SPA (Ours) 9.975 0.976 0.334 偏好分稳步提升
FLUX.1 dev (\(w=2.5\)) Vanilla 12.53 (11.55†) 1.044 (0.989) 0.328 (0.332) 括号内为未蒸馏真实 CFG
FLUX.1 dev (\(w=2.5\)) SPA (Ours) 12.57 (11.76) 1.054 (1.005) 0.328 (0.332) 真实 CFG 提升更显著

计算开销与长尾分析

在 SDXL 上详细测算了单步去噪的耗时构成:标准去噪前向步骤(主干网络评估与 CFG 组合)平均耗时 2.47 s,而 SPA 额外引入的 Tweedie 提取、FFT/RAPS 计算与反向梯度校准耗时仅 0.0952 s,整体推理延时开销仅增加 +3.86%。

针对 FLUX.1 [dev] 引导蒸馏模型的消融分析揭示,SPA 对质量处于长尾底部的缺陷样本具有强力的纠偏修复效果:

评估子集 评测指标 Vanilla 表现 SPA (Ours) 表现 净收益 / 胜率
FLUX.1 全集 (\(w=2.5\)) 胜率 Win-rate 50.0% 53.3 ± 1.5% \(p = 2.3 \times 10^{-5}\) 显著提升
FLUX.1 后 20% 较差样本 (\(w=3.5\)) 胜率 Win-rate 50.0% 54.1 ± 3.3% \(p = 0.02\) 显著纠偏
FLUX.1 后 5% 极端畸变样本 (\(w=2.5\)) HPSv3 增益 基准 +0.70 绝对分 畸变/残缺结构获得修复
FLUX.1 后 5% 极端畸变样本 (\(w=3.5\)) HPSv3 增益 基准 +0.19 绝对分 维持纠偏有效性

关键发现

  • 架构普适性与异质性:在 ADM、SD2.0、SDXL、SD3.5 与 FLUX 等截然不同的生成架构中,SPA 均实现稳定正向增益。不同于启发式小波重加权需要针对分辨率调谐且易在背景引入高频振铃假影,SPA 能够平滑修复失真。
  • 形状畸变修复机制:定性与统计结果表明,校准频域信噪比不仅改善了亮度和色彩对比度,还能显著修复生成物体的物理结构残缺(如球拍、球棒畸变)。这是因为前向去噪初期信噪比对齐后,网络能更充分地提取和传递宏观语义信号,且 VAE 潜变量通道具有解耦的内容控制属性。

亮点与洞察

  • 诊断视角清晰精辟:揭示了曝光偏差在频域上的本质是时间步和模型高度敏感的频率依赖型 SNR 误差,打破了以往“固定提升高频”或“全域标量方差缩放”的教条假设。
  • 极佳的实用性与低计算开销:通过将约束施加在 Tweedie 单步闭式估计上,利用快速傅里叶变换的解析梯度绕过了对庞大扩散骨干网络的反向传播,仅以 3-4% 的微小延迟实现了即插即用的质量收益。
  • 与 CFG 及采样器解耦:SPA 作用于 CFG 合成之后的估计量,既不破坏下游文本对齐,又天然兼容 Euler、DDIM 等任意数值采样器及高级 CFG 变体。

局限与展望

  • 类别/提示词无关的全局统一先验:当前拟合的目标频谱在整个训练集上平均得到,忽略了特定视觉域(如线条插画、医学切片)独特的频谱分布差异,未来可探索根据文本或类别条件动态选择/条件化频谱先验。
  • 频带加权策略尚未探索:目前损失函数在对数谱空间采用未加权 MSE,未引入基于人类视觉敏感度(如感知对比敏感度曲线 CSF)的频段权重分配。
  • 引导优化形式较基础:当前基于一阶梯度下降(DPS 风格)进行步进校准,未来可探索动量校准或二阶修正算子以进一步稳定更新轨迹。

相关工作与启发

  • vs \(\epsilon\)-rescaling (Ning et al., ICLR 2024): 他们仅通过标量乘子重缩放预测噪声来拉齐全局噪声模长,假设全频段误差均匀;本文指出误差在不同频段、模型下高度非均匀且方向相反,SPA 实现了频域全谱校准,表现全面占优。
  • vs Wavelet Regulation (Yu & Zhan, ACM MM 2025): 他们使用小波变换按离散高低频带进行手工系数重加权,超参对分辨率和采样步数极度敏感且容易在边缘引入振铃伪影;SPA 基于拟合的连续物理幂律先验,跨模型泛化性更强且视觉伪影更少。
  • vs Discriminator Guidance (Kim et al., ICML 2023) / MPGD (He et al., ICLR 2024): 判别器引导需对抗训练额外模型且推理开销翻倍,MPGD 需反传自编码器;SPA 纯无监督免训练网络,单步 FFT 开销微秒级,计算效率高出数量级。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次系统揭示曝光偏差的频率依赖型 SNR 异质性并提出基于 RAPS 幂律先验的轻量解析引导]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖像素模型、潜扩散模型及前沿流匹配模型,度量兼顾分布真实度与人类奖励模型,消融详实]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑链条清晰,理论推导与经验观察紧密咬合,图表可视化深入直观]
  • 价值: ⭐⭐⭐⭐⭐ [即插即用、开销微弱且对现代大模型(如 SDXL、FLUX)长尾缺陷样本有切实改善效果,极具部署价值]