跳转至

D2PO: Optimizing Diffusion Samplers via Dynamic Preference

会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
领域: 对齐/RLHF
关键词: 扩散模型, 采样调度优化, 直接偏好优化, 能量模型, 动态偏好

一句话总结

将扩散采样器参数优化从传统的固定教师回归范式重塑为直接偏好对齐问题,通过能量代理模型、预训练分数多尺度能量度量与动态自进阶教师机制,在极低采样步数下显著提升生成图像的感知质量与高频纹理。

研究背景与动机

扩散概率模型(DPM)在高质量图像与视频合成中取得了极具突破性的表现,但其固有的迭代去噪过程需要大量函数评估次数(NFE),高昂的推理计算开销严重阻碍了实际落地部署。为了在极少步数下实现高质量生成,除了加速数值求解器与少步知识蒸馏外,直接优化采样策略参数——包括离散时间步调度 \(S\) 和无分类器引导(CFG)权重 \(\omega\)——已成为轻量且正交的加速前沿。然而,现有的采样策略优化方法面临着严峻的范式瓶颈:以 FID/KID 等全局分布为目标的搜索方法,在低维采样器参数空间中产生的梯度方差极大且信号微弱;而以 LD3 为代表的实例级学生-教师蒸馏方法,则依赖 \(\ell_2\) 或 LPIPS 损失强行让低 NFE 学生模仿固定的高 NFE 教师轨迹。

这种基于回归的蒸馏范式在追求极限加速(即教师与学生的步数差距显著扩大)时暴露出本质矛盾。当学生采样器在极严格的计算预算约束下被强制回归高步数教师轨迹时,其受限的表达容量难以兼顾全局结构与局部高频细节,最终只能牺牲高频纹理以迁就低频轮廓的一致性。实验表明,当保持学生步数为 4 步而不断提高教师步数时,生成画面的模糊度和失真伪影反而加剧,表明回归固定教师的范式存在无法逾越的内在误差下界,极大地限制了采样器对高保真特征的利用能力。

为了打破静态教师回归对生成质量的钳制,本文将采样器参数优化重新诠释为基于偏好的强化对齐问题。本文的核心 idea 是:将确定性采样策略建模为以预训练分数网络为能量度量的平滑能量代理分布,并引入随学生策略演化自适应加密时间步的动态教师构建偏好对,使采样器通过最小化自身离散化误差实现自我进阶。

方法详解

整体框架

D2PO(Dynamic Direct Preference Optimization)旨在冻结预训练扩散主干权重的前提下,端到端优化采样策略参数 \(\phi = \{S, \omega\}\)(离散时间步集合与逐步 CFG 权重)。针对确定性 ODE 采样器引发的退化概率密度问题,D2PO 构建了能量代理模型(EBM),并将偏好评估直接建立在预训练扩散模型隐式编码的多尺度去噪分数场上。训练时,系统摈弃静态外部教师,通过对当前策略进行时间步插值加密生成动态高阶胜者样本,同时对当前输出施加频域退化生成负样本,在统一的 DPO 目标下驱使采样器逐步消除离散化截断误差。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入噪声与文本条件<br/>x_T ~ N(0, I), c"] --> B["能量代理模型<br/>确定性采样映射转平滑 EBM 似然"]
    B --> C["多尺度分数能量度量<br/>多尺度加权去噪分数残差计算"]
    C --> D["动态教师进阶机制<br/>当前调度 2x 插值生成高保真胜者样本"]
    D --> E["动态偏好对齐优化<br/>DPO 目标驱使离散化误差单调收敛"]
    E --> F["优化后的采样策略<br/>离散调度 S 与逐步权重 omega"]

关键设计

1. 能量代理模型:使确定性 ODE 采样的偏好对齐数学可导

针对确定性 ODE 采样映射 \(x_\phi = \Phi_\phi(x_T, c; \theta)\) 导致的退化狄拉克分布 \(q_\phi(x|x_T, c) = \delta(x - x_\phi)\) 无法直接计算似然与梯度的问题,D2PO 构造了能量代理策略 \(\pi_\phi(x|c, x_T) = \frac{1}{Z(\phi, c, x_T)} \exp(-\alpha E(x; \phi, c, x_T))\),将能量定义为候选样本与采样器输出之间的距离度量 \(E(x; \phi, c, x_T) \equiv d(x, x_\phi)\)。在同一初始噪声与提示词条件下,正负样本间的对数似然比使配分函数 \(Z\) 完美抵消,将原本病态的扩散策略偏好优化精确转化为能量差值的对数几率分类问题。

2. 多尺度分数能量度量:利用预训练模型几何信息捕获高频纹理

传统的 \(\ell_2\) 或 LPIPS 感知损失对采样累积截断误差的敏感度不足,容易导致高频模糊。D2PO 直接发掘预训练去噪网络自身对数据流形几何的感知能力,将样本相对于流形几何的偏离度定义为沿连续扰动尺度的分数不一致性。利用去噪网络与分数的内在等价关系 \(s_\theta = -\epsilon_\theta / \sigma_t\),引入权重 \(w(t) = \sigma_t^2\) 抵消低噪声区间的数值发散爆炸,推导出可经由蒙特卡洛采样的噪声预测距离公式:

\[d_\theta(x, x_\phi; t) = \|\epsilon_\theta(x_t, t) - \epsilon_\theta(x_{\phi, t}, t)\|_2^2\]

高噪声尺度监督粗粒度语义轮廓,低噪声尺度精确约束微细纹理,使偏好信号具备超越通用视觉感知特征的多尺度保真分辨力。

3. 动态教师进阶机制:打破静态教师残差下界的自我进化闭环

为解决固定教师蒸馏中固有存在的渐进误差下限 \(\epsilon_{fix}\),D2PO 提出了动态演进的胜者构造逻辑。在每轮训练中,对于拥有 \(N\) 个时间步的当前学生调度 \(S\),系统通过在线线性插值插入中间步,自适应构造出拥有 \(2N\) 步的动态教师调度 \(S'\),并由同一数值求解器执行生成胜者样本 \(x_w\);负样本 \(x_l\) 则通过对当前学生输出施加低通滤波降质算子得到。对于参考策略 \(\phi_{ref}\),调度 \(S_{ref}\) 在每个 epoch 结束时直接同步复制当前学生调度,CFG 权重 \(\omega_{ref}\) 则采用动量参数 \(\lambda\) 进行平滑 EMA 更新。在理论上,数值求解器的收敛阶数 \(k\) 确保了 \(2N\) 动态教师的真实误差满足 \(\epsilon_{\phi'}^{true} \approx 2^{-k} \epsilon_\phi^{true}\),使得优化损失动态构成真实误差的紧致上界,驱使采样器在迭代中不断压缩自身的数值离散化残差。

损失函数 / 训练策略

结合能量代理与多尺度分数能量,D2PO 的经验优化目标表述为对连续噪声扰动时间 \(t \sim \mathcal{U}(0, T)\) 的无偏期望估计:

\[\mathcal{L}_{\mathrm{D2PO}}(\phi) = -\mathbb{E}_{\mathcal{D}}\left[ \log \sigma \left( \mathbb{E}_{t \sim \mathcal{U}(0, T)} \beta \Delta_\phi(x_w, x_l; t) \right) \right]\]

其中差分项展开为:

\[\Delta_\phi(x_w, x_l; t) = d_\theta(x_w, x_{\phi_{\mathrm{ref}}}; t) - d_\theta(x_w, x_\phi; t) - d_\theta(x_l, x_{\phi_{\mathrm{ref}}}; t) + d_\theta(x_l, x_\phi; t)\]

训练时,仅针对低维采样策略参数 \(\phi = \{S, \omega\}\) 反向传播梯度,扩散主干与去噪网络参数保持完全冻结。

实验关键数据

主实验

在 Stable Diffusion v1.5 上使用 MS-COCO 30k 提示词评估文本到图像合成质量,对比 DMN、GITS 和 LD3 在三种典型高阶 ODE 求解器(iPNDM, UniPC, DPM Solver++)下的表现:

求解器 步数 方法 HPSv2 ↑ Aesthetic ↑ FID ↓
iPNDM 4 DMN 0.2030 5.0936 21.39
iPNDM 4 GITS 0.2128 5.1413 18.12
iPNDM 4 LD3 0.2191 5.1756 17.60
iPNDM 4 D2PO 0.2237 5.2024 15.69
iPNDM 5 LD3 0.2346 5.2463 13.59
iPNDM 5 D2PO 0.2385 5.2701 13.38
UniPC 4 LD3 0.2180 5.1755 18.34
UniPC 4 D2PO 0.2185 5.1761 16.97
DPM-Solver++ 4 LD3 0.2191 5.1736 17.46
DPM-Solver++ 4 D2PO 0.2216 5.1854 16.84

在 ImageNet-256(潜空间,3阶 iPNDM 求解器)与 Flow Matching 架构 InstaFlow 上的泛化性评估显示:在 ImageNet 4 步采样下,D2PO 的 FID 达到 7.28(显著超越 LD3 的 9.19 与 Uniform 的 13.86);在 InstaFlow 2 步极低步数下,D2PO 取得 FID 40.68 / Aesthetic 5.0924(优于 Uniform 的 44.27/5.0060 及 LD3 的 63.55/4.6270)。

消融实验

基于 Stable Diffusion v1.5 与 iPNDM 求解器,针对核心组件进行消融分析:

步数 配置 Aesthetic ↑ FID ↓ 说明
4 D2PO (Full) 5.2024 15.69 完整模型
4 w/o 动态偏好 (采用固定 \(N+1\) 教师) 5.1810 16.91 退化为静态监督,丧失自进阶驱动力
4 w/o 分数能量度量 (替换为 LPIPS) 5.1796 17.88 掉点最严重,缺乏多尺度流形几何约束
4 w/ EMA 参考时间步更新 5.1937 15.75 连续平滑更新不如 epoch 同步稳定
5 D2PO (Full) 5.2701 13.38 完整模型
5 w/o 动态偏好 (采用固定 \(N+1\) 教师) 5.2615 13.70 偏好上限受限
5 w/o 分数能量度量 (替换为 LPIPS) 5.2630 14.59 细节纹理损失导致显著劣变
5 w/ EMA 参考时间步更新 5.2639 13.42 离散时间步优化震荡

关键发现

  • 分数能量函数是性能基石:消融实验显示,移除预训练分数能量函数而采用常规 LPIPS 会带来最剧烈的性能暴跌(4 步下 FID 从 15.69 恶化至 17.88),证明基于扩散模型自监督扰动场的多尺度能量度量对于纠正极端压缩步数下的纹理截断至关重要。
  • 步数与优化机制的行为转变:在 4-5 步极低算力预算下,D2PO 主要充当强大的“离散化截断误差校正器”,全面碾压所有基线指标;而在 6-7 步下,数值截断误差已显著减小,模型重心平滑转移至“感知偏好对齐”,在保持 HPSv2 与 Aesthetic 显著领先的同时呈现出合理的质量-多样性权衡(FID 与强基线相当)。
  • 参考模型的异步更新策略:对连续参数(CFG 权重)使用 EMA 更新十分合适,但对离散时间步调度使用直接的 epoch-wise 拷贝远比 EMA 稳定,能够避免时间步在连续插值轨迹中产生破坏性的梯度抖动。

亮点与洞察

  • 将 DPO 优雅扩展至退化确定性系统:巧妙通过 EBM 能量代理构造,利用正负样本似然比的配分函数对消特性,彻底消除了 ODE 采样器确定性狄拉克分布不可微的理论障碍。
  • 动态相对进阶替代绝对目标拟合:以当前策略的 \(2N\) 步精细化轨迹作为动态胜者,使学生策略从“被动模仿外部静态教师”转变为“主动超越当前的自我”,从数学上严格论证了截断误差界随迭代逐步收敛的性质。
  • 无需改动主干权重的纯调度优化:不触碰数十亿参数的扩散网络本体,仅凭优化几个标量时间步与引导系数即可获取巨大的感知质量增益,具备极高工程实用性与跨任务可迁移性。

局限与展望

  • 动态胜者采样的在线计算开销:在训练阶段构建 \(2N\) 步动态教师样本需要实时调用扩散模型推理,虽然相比调整大模型参数依然非常轻量,但比离线预缓存静态教师轨迹的训练耗时更长。
  • 负样本构造策略较为启发式:当前负样本依赖低通滤波等简单图像退化算子生成,未能充分覆盖解剖结构错误、语义失真等更深层的复杂生成失败模式。
  • 可拓展至多维采样参数联合搜索:未来可进一步将高阶求解器积分系数、多步预测修正因子等更多动力学超参数纳入该统一偏好优化体系中。

相关工作与启发

  • vs LD3 (Learning to Discretize Denoising Diffusion ODEs): LD3 采用松弛匹配损失向固定的高步数静态教师进行特征和输出回归,当步数压缩较大时遭遇严重的纹理模糊瓶颈;D2PO 采用偏好优化与动态相对自进阶机制,从根本上消除了静态教师的性能下限。
  • vs Diffusion-DPO / Direct Preference Optimization in T2I: 现有的扩散模型偏好对齐工作(如 Diffusion-DPO、SPPO 等)通常需要端到端微调 U-Net 或 DiT 的全量权重,代价高且易破坏基础分布;D2PO 保持主干冻结,仅优化极紧凑的采样调度策略,形成轻量且完全正交的对齐新路径。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将 DPO 思想成功映射到扩散采样器时间步与 CFG 参数优化,提出创新的 EBM 代理与动态相对进阶框架。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 3 种主流求解器、2 个经典图像生成基准、Flow Matching 新架构及细致的理论误差界证明与消融分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰严密,对传统蒸馏瓶颈的剖析一针见血,图文对应与论证逻辑极佳。
  • 价值: ⭐⭐⭐⭐⭐ 为扩散模型超快推理提供了一种通用、免调权、高性能的采样策略训练范式,实用价值与学术启发性兼备。