Cross-Resolution Distribution Matching for Diffusion Distillation¶
会议: ECCV 2026
论文: ECCV 原文
领域: 模型压缩
关键词: 扩散蒸馏, 少步生成, 跨分辨率分布匹配, logSNR 对齐, 级联生成
一句话总结¶
本文提出 RMD,把"降分辨率"作为与"降步数"并列的第二条加速维度:用 logSNR 曲线把去噪轨迹切成若干段并为每段指定分辨率,再把低分辨率生成器的样本经可微上采样投到教师的高分辨率空间做 DMD 式分布匹配,配合预测噪声回注稳定训练,在 SDXL 上以 2+2 步取得 33.4× 加速、在 Wan2.1-14B 上以 3+3 步取得 25.6× 加速,同时保住生成保真度。
研究背景与动机¶
扩散与流模型的生成质量依赖几百步迭代去噪,每一步都是一次大网络的前向;在 DiT 架构下这个代价被进一步放大,因为 token 数随空间尺寸增长、注意力复杂度随之平方上升。已有的加速路线大致两条:training-free 的快速求解器(DPM-Solver++、各类 cache 与 token 剪枝方法)能把步数压到几十步,但仍然需要数十次前向;步蒸馏(渐进蒸馏、InstaFlow 这类轨迹拉直、一致性模型及其后续、以及 DMD 系列分布匹配蒸馏)则能把采样压到 4–8 步并基本保住质量。问题在于,经验证据表明继续往 1–3 步压会出现性能断崖式下跌——也就是说,"只减少步数"这条路在 4 步附近已经接近饱和,想再要一个数量级的加速,必须换一个可压缩的维度。
本文换的维度是分辨率。已有的观察是:去噪过程中每个时刻的作用并不相同,高噪声阶段主要在恢复全局结构与布局,低噪声阶段才精修细节纹理。既然如此,在高噪声阶段就以全分辨率计算那些"此刻还用不上"的细节就是纯粹浪费。自然的做法是改成粗到细的多分辨率级联:先用低分辨率把全局结构粗去噪出来,再把高分辨率运算留到后段做细节精修。但这条路有一个硬障碍:同一个模型在不同分辨率下诱导出的数据分布并不一致——原文 Fig. 1 用同一个 SDXL、同一 prompt、同一随机种子,在 512×512 与 1024×1024 下生成出明显不同的图像。这个偏差的根源在于当代 SOTA 扩散模型的训练范式本身就是"先在低分辨率、质量参差的大规模数据上预训练,再在精选的高分辨率数据上微调"的多阶段课程式调度。于是级联采样时,全局结构实际是从质量较低的低分辨率分布里采出来的,而不是从保真度更高的高分辨率分布里采出来的,质量下降几乎是必然的。
要弥合这个差距,直接让低分辨率模型"画得像高分辨率"是不可行的,因为两者根本不在同一个数据空间里。本文的切入点是:既然两条轨迹的噪声水平可以用 logSNR 这把统一的尺子来对齐,那就可以把低分辨率样本投到教师的高分辨率空间,在噪声水平相同的时刻上去做分布匹配,让生成器的低分辨率分布显式地向教师的高分辨率分布靠拢。核心 idea:把分辨率当作与步数并列的压缩维度,用 logSNR 不变性把不同分辨率的去噪时刻对齐、用可微上采样把低分辨率生成器状态投影进教师空间,再在该空间做 DMD 式分数蒸馏,从而在低于 4 步的算力预算下维持高保真生成。
方法详解¶
整体框架¶
RMD 的输入是一个预训练好的扩散/流模型(教师 \(p_\varphi\))和一批纯文本提示;输出是一个能在少数几步内完成生成、并且中途会切换分辨率的级联生成器 \(G_\theta\)。整条流程可以拆成四件事:先按 logSNR 曲线把教师的去噪轨迹切成 \(K\) 段并为每段分配一个分辨率(分辨率轨迹划分);训练时把低分辨率的生成器状态一步还原成干净潜变量、上采样到教师分辨率、再按教师在对应时刻的噪声水平重新加噪,得到与教师处在同一 logSNR 上的对齐样本(可微上采样变换 + 跨分辨率分布匹配);匹配用的目标沿用 DMD 的分数蒸馏,生成器的 score 由一个在线更新的假扩散模型估计;加噪时不用纯高斯噪声,而是把生成器预测的噪声上采样后与高斯噪声按 \(\alpha^2+\beta^2=1\) 混合回注,让样本既继承教师的 ODE 轨迹方向、又保留跨分辨率所需的随机性。训练先只蒸馏低 logSNR 的语义段做 warm-up,再整条轨迹端到端训;推理时从最低分辨率的纯噪声出发,逐时刻判断是否需要升分辨率,逐级升到目标分辨率。
关键设计¶
1. 按 logSNR 曲线划分分辨率轨迹:让不同分辨率的去噪状态可以对话
要在哪一步切换分辨率,不能靠拍脑袋,因为"加了多少噪声"这件事在不同分辨率下并不等价:相同的独立噪声幅度,分辨率越高造成的像素破坏相对越弱,等效噪声水平更低。论文用 logSNR 把这个效应量化出来(原文 Fig. 3):不同分辨率的 logSNR 曲线增长率不同,低 logSNR 区间低分辨率去噪更快,而高 logSNR 区间反而是高分辨率去噪更快。于是论文按预设阈值 \(\{\text{logSNR}_1,\dots,\text{logSNR}_{K-1}\}\) 把教师的 logSNR 曲线切成 \(K\) 个互不重叠的段,每段 \(i\) 对应一个时刻区间 \([T_{i-1},T_i]\) 和一个预置分辨率 \(r_i\)(\(r_1<\dots<r_K\),\(r_K\) 就是教师的生成分辨率)。阈值到时刻的换算走 Rectified Flow 的 logSNR–timestep 关系:
(RF 的加噪是 \(x_t=(1-\sigma_t)x_0+\sigma_t\epsilon\),故 \(\text{logSNR}=2\log\frac{1-\sigma}{\sigma}\),反解即得上式。⚠️ 缓存 PDF 中该式 OCR 损坏,此处按 RF 定义复述,精确写法以原文为准。)
只有这一步还不够,因为阈值是按教师分辨率定的,低分辨率上的等效噪声与之不同。论文沿用 SD3 的分辨率相关缩放,按分辨率比 \(r_i/r_K\) 的对数给 logSNR 加一个补偿项,得到该分辨率下的等效 logSNR,再代回上式换算出学生在这个分辨率上对应的时刻区间 \([T_{i-1}^{(r_i)},T_i^{(r_i)}]\)。原文 Fig. 3 里补偿后的低分辨率曲线整体位于高分辨率曲线之上,说明每个时刻上低分辨率的等效噪声更弱。这两步合起来的意义是:当两条曲线在 logSNR 上对齐时,教师此刻看到的噪声水平与低分辨率生成器此刻看到的噪声水平是同一个数——蒸馏因此发生在相同的去噪状态上,与空间分辨率无关。这是后面所有分布匹配能成立的前提。默认配置 \(K=2\)、\(\text{logSNR}_1=-2.5\):4 步 SDXL 推理时高噪声段 \(t\in[502,1000]\) 在低分辨率上跑,精修段 \(t\in[0,502]\) 在高分辨率上跑。
2. 跨分辨率分布匹配 + 可微上采样变换:在教师空间里对齐两个分布
RMD 的目标是联合 KL 散度——生成器的"加噪分布 × 反向去噪条件分布"要匹配教师的对应联合分布,写成 \(\min_\theta \mathrm{KL}\big(p_\theta(\tilde{x}_{t_i})p_\theta(x_0\mid\tilde{x}_{t_i})\,\|\,p_\varphi(x_t)p_\varphi(x_0\mid x_t)\big)\),其中下标 \(t_i:=(r_i,t)\) 表示在分辨率 \(r_i\) 上与教师时刻 \(t\) 按 logSNR 对齐后的分辨率感知时刻。这个目标有两个直接的困难。第一,沿着生成轨迹做逐点匹配不足以支撑有效蒸馏(TDM 已经指出这一点)。第二,也是这个设定独有的困难:\(\tilde{x}_{t_i}\) 是低分辨率状态,而 \(x_0\) 和 \(x_t\) 是高分辨率的,直接把 \(\tilde{x}_{t_i}\) 去噪回 \(x_0\) 是病态的;而且 \(\tilde{x}_{t_i}\) 里带着随机扩散噪声,朴素上采样会把低分辨率阶段辛苦建立的结构先验拉变形。
论文的解法是先用一个可微的上采样变换把生成器状态搬进教师空间,再在分布层面匹配。具体地,用生成器自己的噪声预测一步估出干净潜变量,用插值上采样到教师分辨率,最后按教师在时刻 \(t_j\) 的噪声水平重新加噪:
其中 \(U_{r_K}(\cdot)\) 是到教师分辨率的插值上采样算子(论文用双线性插值),\(\epsilon_\theta\) 是生成器的噪声预测,整个过程对 \(\theta\) 可微;\(\tilde{x}^{(t_{i,j})}_0\) 表示低分辨率分布在时刻 \(t_{i,j}\) 上对应的干净潜变量。对齐之后,最小化边缘反向 KL 即可(这就是 score distillation 的形式):
生成器的 score \(s_\theta\) 不可解,梯度按分数差乘上采样雅可比近似:
沿用 DMD 与 TDM 的做法,引入一个假扩散模型 \(s_\phi\) 估计生成器的 score(\(s_\varphi\) 当真分数),并把分数差项放进 stop-gradient,写成一次"梯度下降精修"式的回归目标:
(⚠️ 缓存 PDF 中该式 OCR 严重损坏,上式按 DMD2 的 stop-gradient 形式复述,精确形式以原文为准。)假分数模型用标准去噪目标在线跟踪生成轨迹上的分数变化:以 \(U_{r_K}(\tilde{x}^{(t_i)}_0)\) 为干净目标、以该时刻该分辨率的 SNR 为权重去拟合。这里还有一个很关键的工程取舍:直接按上式的形式在所有时刻逐点对齐既昂贵、又会造成监督不均衡(不同分辨率段需要的采样步数不同,梯度尺度不一致导致收敛慢),所以论文改成按分辨率段做分布匹配——在每个段内均匀采一个时刻 \(t_i\sim\mathcal{U}\big([T_{i-1}^{(r_i)},T_i^{(r_i)}]\big)\) 做对齐,各段用 \(\lambda_{r_i}\) 加权,训练时这层期望用蒙特卡洛采样近似。
与 DMD 的差别正是这篇论文的立身之处:DMD 的匹配发生在同一分辨率上,学生与教师共享同一个 \(x_t\);RMD 里进入匹配的 \(x_t^{(t_i)}\) 是"低分辨率生成 → 可微上采样 → 重加噪"三步得到的,梯度必须穿过上采样这个算子(\(\partial x_t^{(t_i)}/\partial\theta\) 里含 \(U_{r_K}\) 的雅可比,也正是它让梯度能回传到低分辨率生成器),而且匹配时刻是 logSNR 对齐的结果而不是同一个 \(t\)。
3. 预测噪声回注:让上采样样本既接住教师轨迹、又保留跨分辨率的随机性
第 2 点里"重新加噪"那一步的噪声 \(\epsilon\) 取什么,直接决定了训练能不能收敛。用纯高斯噪声可以让两个分布跨分辨率对齐,但代价是相当于重新解一条 SDE 轨迹,完全不继承教师的 ODE 轨迹,结构一致性变弱;反过来,把生成器预测的噪声上采样后直接当作 \(\epsilon\),虽然严格沿着教师轨迹走,但分辨率差一大时上采样伪影会被当成硬引导,退化严重。论文的做法是把两者按 \(\alpha^2+\beta^2=1\) 加权混合:
预测噪声那一项提供轨迹方向,随机那一项提供跨分辨率的自由度。直觉上,分辨率差越大、两个分布错配越严重,就越需要更强的随机性去填补,因此 \(\alpha\) 应该随分辨率差增大而减小。实验(原文 Fig. 7,PixArt-α、NFE=2+2)扫出来的最优值是 \(\alpha=0.2\):\(\alpha=0\) 结构一致性弱,\(\alpha=1\) 在大分辨率差下退化,0.2 在轨迹继承与随机灵活性之间取得最好的生成保真度。值得注意的是最优点明显偏向随机一侧,而不是两端的中点。
4. 低 logSNR 语义段 warm-up 与多分辨率级联推理
低分辨率生成轨迹诱导出的分布,基本决定了最终高分辨率分布的全局布局,所以如果从第一步就让整条级联轨迹端到端训练,低分辨率分布与目标高分辨率分布之间的巨大错配会阻碍收敛。论文借 Wan2.2 的 logSNR 分段方案,取阈值 \(\text{logSNR}_{K/2}\) 把生成过程分成语义段(低 logSNR)与细节段,先单独蒸馏低 logSNR 的语义段做 warm-up,给级联一个稳定的初始化,再放开整条轨迹端到端训练,从而加速整体蒸馏过程。推理侧对应的是多分辨率级联采样:从最低分辨率 \(r_1\) 的纯高斯噪声开始去噪,对每个时刻先判断是否需要升分辨率——若下一个时刻分辨率不变,就做标准条件去噪;若分辨率要变,则先把当前段的分布投到目标段,再上采样并回注噪声,以匹配下一时刻的高分辨率分布。这样逐级升到目标分辨率,既保证了跨段的分辨率切换,又维持了时间轴上的连贯性(完整伪代码见原文附录 A 的 Algorithm 1 / 2,缓存未包含附录)。
损失函数 / 训练策略¶
训练总损失由两部分组成:生成器侧是上文那条带 stop-gradient 的跨分辨率分数蒸馏损失,假分数模型侧是标准的去噪回归损失,用该时刻该分辨率的 SNR 作为分辨率感知权重。整个训练是 image-free 的,只用 JourneyDB 的提示词,不需要真实图像或视频。CFG 尺度按骨干分别设为 7.5(SDXL)、3.5(PixArt-α)、4.5(SD3.5)、5.0(Wan2.1),上采样统一用双线性插值,所有基准与速度测量在单张 NVIDIA A100 上完成。主实验把分辨率从 512px 升到 1024px(图像)、从 480p(834×480)升到 720p(1280×720)(视频),即 \(K=2\)、\(\text{logSNR}_1=-2.5\)。原文称 RMD 的蒸馏训练成本与 TDM 相当、低于 DMD2(细节在原文附录 B)。
实验关键数据¶
主实验¶
图像侧在 SDXL(UNet)、PixArt-α(Transformer)、SD3.5 medium 三个骨干上与对抗蒸馏(SDXL-Turbo / SDXL-Lighting / YOSO / SD3.5-Turbo)和分布匹配蒸馏(DMD2、TDM)对比,RMD 统一用 2 个低分辨率步 + 2 个高分辨率步(记作 NFE 2+2)。表中 HPS 为 HPS v2.1 四个类别(Animation / Art / Painting / Photo)的平均值。
| 骨干 | 方法 | NFE | 加速比 | HPS↑ | Aes↑ | CLIP↑ |
|---|---|---|---|---|---|---|
| SDXL | Base Model-1024 | 40×2 | 1.0× | 29.14 | 6.48 | 35.64 |
| SDXL | SDXL-Turbo-512 | 4 | 20.0× | 29.46 | 6.41 | 34.36 |
| SDXL | SDXL-Lighting | 4 | 20.0× | 30.83 | 6.54 | 34.62 |
| SDXL | DMD2 | 4 | 20.0× | 31.30 | 6.71 | 35.10 |
| SDXL | TDM | 4 | 20.0× | 31.93 | 6.70 | 35.03 |
| SDXL | RMD (Ours) | 2+2 | 33.4× | 31.99 | 6.73 | 35.13 |
| PixArt-α | Base Model-1024 | 25×2 | 1.0× | 30.74 | 6.73 | 34.12 |
| PixArt-α | YOSO-512 | 4 | 12.5× | 30.60 | 6.23 | 31.83 |
| PixArt-α | DMD2 | 4 | 12.5× | 31.36 | 6.71 | 33.53 |
| PixArt-α | TDM | 4 | 12.5× | 32.05 | 6.82 | 33.63 |
| PixArt-α | RMD (Ours) | 2+2 | 21.0× | 32.23 | 6.89 | 33.89 |
| SD3.5 | Base Model-1024 | 40×2 | 1.0× | 30.29 | 6.49 | 34.76 |
| SD3.5 | SD3.5-Turbo | 4 | 20.0× | 28.23 | 6.35 | 32.97 |
| SD3.5 | DMD2 | 4 | 20.0× | 30.42 | 6.32 | 32.16 |
| SD3.5 | TDM | 4 | 20.0× | 30.03 | 6.37 | 32.25 |
| SD3.5 | RMD (Ours) | 2+2 | 32.0× | 30.56 | 6.38 | 32.51 |
视频侧把 RMD 扩到 Wan2.1-T2V-14B,用 3 个低分辨率步 + 3 个高分辨率步,对比同样 6 步的 DMD2 与 TDM,评测用 VBench 与 T2V-CompBench。
| 方法 | NFE | 加速比 | VBench Total↑ | Quality↑ | Semantic↑ | T2V-CompBench↑ |
|---|---|---|---|---|---|---|
| Base Model-720p | 50×2 | 1.0× | 83.75 | 85.44 | 76.95 | 54.17 |
| DMD2 | 6 | 16.7× | 80.30 | 81.98 | 73.60 | 52.81 |
| TDM | 6 | 16.7× | 80.48 | 81.85 | 75.00 | 52.27 |
| RMD (Ours) | 3+3 | 25.6× | 82.51 | 84.37 | 75.05 | 54.00 |
消融实验¶
组件消融在 SDXL / Wan2.1 上统一协议进行:RM 指跨分辨率分布匹配,UP 指级联上采样,训练都从 512px/480p 基分辨率出发,目标分辨率由 UP 决定。
| 目标分辨率 | RM | UP | HPS↑ | Aes↑ | CLIP↑ | VBench↑ |
|---|---|---|---|---|---|---|
| 512px/480p | × | × | 22.64 | 6.15 | 28.76 | 80.01 |
| 512px/480p | ✓ | × | 30.28 | 6.63 | 34.81 | 80.81 |
| 512px/480p | × | ✓ | 29.57 | 6.58 | 33.68 | 81.11 |
| 1024px/720p | ✓ | ✓ | 31.99 | 6.73 | 35.13 | 82.51 |
分辨率轨迹划分的阈值 \(\text{logSNR}_1\) 决定了步数在两个分辨率上的分配(PixArt-α):
| \(N_{512}+N_{1024}\) | \(\text{logSNR}_1\) | 加速比 | HPS↑ | Aes↑ | CLIP↑ |
|---|---|---|---|---|---|
| 0+4 | – | 1× | 32.05 | 6.82 | 33.63 |
| 1+3 | -6.00 | 1.25× | 32.12 | 6.87 | 33.64 |
| 2+2 | -2.50 | 1.68× | 32.13 | 6.83 | 33.86 |
| 3+1 | 0.00 | 2.54× | 24.79 | 6.03 | 32.22 |
进一步把级联从 2 级推到 3 级、4 级(SDXL,括注为该级的 NFE,为 1 时省略):
| 方法 | 分辨率 (NFE) | \(\text{logSNR}_1,\text{logSNR}_2\) | 加速比 | HPS↑ | Aes↑ | CLIP↑ |
|---|---|---|---|---|---|---|
| Baseline | 1024(4) | – | 1.00× | 31.93 | 6.70 | 35.03 |
| Baseline | 512(2)→1024(2) | -2.5 | 1.56× | 29.57 | 6.58 | 33.68 |
| RMD | 512(2)→1024(2) | -2.5 | 1.56× | 31.99 | 6.73 | 35.13 |
| RMD | 256→512→1024(2) | -6.0, -2.5 | 1.73× | 31.59 | 6.70 | 34.84 |
| RMD | 256→512(2)→1024 | -6.0, -0.0 | 2.54× | 31.48 | 6.68 | 34.77 |
| RMD | 256(2)→512→1024 | -2.5, -0.0 | 2.90× | 31.03 | 6.67 | 34.57 |
| RMD | 128→256→512→1024 | -6.0, -2.5, -0.0 | 3.08× | 29.48 | 6.59 | 33.41 |
关键发现¶
- 收益来自跨分辨率对齐,而不是来自"上采样"本身。 组件消融里最刺眼的一行是:只加朴素级联上采样、不加 RM,HPS 只有 29.57,反而低于"不升分辨率但做了 RM"的 30.28;而完全不升分辨率也不匹配的 512px 基线只有 22.64。也就是说,多分辨率级联本身不涨点,甚至因为低分辨率段缺乏强结构先验而在后续上采样中被放大成伪影(原文 Fig. 6 的定性对比印证了这一点),真正的增益全部来自 RM 把低分辨率分布拉向教师的高分辨率分布。两者叠加到 1024px 才拿到最好的 31.99 / 6.73 / 35.13。
- 能省的是高噪声段的分辨率,不能省的是精修段的步数。 步数分配表里,1+3 的美学分略高(6.87 vs 6.83)但提速只有 1.25×;把高分辨率精修压到 1 步(3+1)虽然提速 2.54×,HPS 却断崖跌到 24.79、CLIP 掉到 32.22,视觉上表现为明显模糊与细节纹理整体丧失。这与"低噪声段负责细节精修"的先验完全一致:高噪声段在低分辨率上跑是划算的,低噪声段必须留足步数。
- 噪声回注的混合系数 \(\alpha\) 是非单调的,最优点显著偏向随机侧。 两端都差、中间(0.2)最好,说明继承教师 ODE 轨迹与保留跨分辨率随机性之间需要显式权衡,且这个权衡点比"一半一半"更靠近随机性一边——分辨率差越大越需要随机性来填补分布错配。
- 级联可以继续外推,但最低分辨率会先成为瓶颈。 3 段 256→512→1024 在 2.90× 加速下仍保住 HPS 31.03,说明粗到细的逻辑可扩展;但加到 4 段、从 128px 起就掉到 29.48,速度收益(3.08×)远小于质量损失,瓶颈在于最低分辨率下能建立的语义结构本身就不够可靠。
- 视频上的收益比图像更明显,但语义对齐仍有差距。 DMD2 与 TDM 在 6 步下 VBench Total 掉到 80.30 / 80.48、Quality 掉到 82 附近,RMD 的 3+3 拿到 82.51 / 84.37,已经很接近 50 步教师的 83.75 / 85.44;但 Semantic score 75.05 仍低于教师的 76.95,说明文本语义一致性是这条路线还没补上的一块。
- 一个值得留心的现象:分布匹配类方法在 SDXL 上的 HPS 普遍高于教师基座(29.14),作者归因于"从易出错的多步轨迹转向直接映射,消除了累积采样漂移"。这个解释合理,但也要注意 HPS/Aes 这类指标本身偏好"讨喜"的图像,未必等价于分布层面更贴近教师。
亮点与洞察¶
- 把"分辨率"显式提升为与"步数"并列的加速维度,并用 logSNR 这把尺子把两者统一起来。这是全文最值得迁移的一点:加速不止能靠减少迭代次数,也可以靠降低每次迭代的表示成本;而只要能用噪声水平把两条轨迹对齐,不同算力预算下的"同一去噪状态"就是可比较的。
- 可微上采样把"学生与教师不在同一空间"变成可训练的问题。只要 \(U\) 可微,分数蒸馏的梯度就能穿过这个变换回传到低分辨率生成器(雅可比 \(\partial x_t^{(t_i)}/\partial\theta\) 是这套机制的核心)。原则上有任何可微的空间或模态变换——超分网络、时序插帧、token 上采样——都能塞进这个框架,比如把视频教师蒸到图像生成器、把多视角教师蒸到单视角生成器。
- 噪声回注的 \(\alpha\) 插值是一个干净且实用的 trick。DMD 式蒸馏里"重新加噪到底用真随机还是用预测噪声"以前基本靠约定俗成,这里给出了一个显式的、可扫描的连续插值(\(\alpha^2+\beta^2=1\)),并用实验指出最优点明显偏向随机侧。
- 低 logSNR 语义段 warm-up 几乎是免费收益。先单独蒸馏决定全局布局的语义段,再端到端放开,本质上是把"课程学习"用在跨分辨率蒸馏上,符合高噪声定布局的经验规律。
- 加速比的来源值得单独算一笔账:SDXL 上 40×2 降到 2+2 只相当于 20× 的 NFE 缩减,实测却是 33.4×,多出来的部分来自两个低分辨率步在 1024px 下省掉的二次注意力开销;Wan2.1 上 100 次前向降到 6 次(16.7×)实测为 25.6×,同理。这说明"低分辨率步"在 DiT 上的实际收益远大于其 NFE 占比。
局限与展望¶
- 分段方案全是手工超参。段数 \(K\)、阈值 \(\text{logSNR}_1\)、各级分辨率 \(r_i\) 都是人工设定的:主实验取 \(K=2\)、\(\text{logSNR}_1=-2.5\),但不同骨干用的是不同 schedule(原文附录 B),说明这套配置不通用、换模型要重扫。论文没有给出自动搜索或自适应决定分段的办法。
- 分辨率补偿项本身没有被消融。跨分辨率对齐完全依赖 Eq. (2) 那个基于 SD3 分辨率相关缩放的补偿,但论文没有报告"去掉这个补偿、直接用老师时刻"会退化多少。这是最值得补的一个实验,因为它直接决定"logSNR 对齐"这一核心主张的成色。
- 缺少分布距离指标。评测用的是 HPS、Aes、CLIP、VBench 这类偏好/一致性指标,三者都不直接度量与教师分布的差距,表格里也没有 FID。"跨分辨率匹配真的缩小了分布差距"目前只有定性图(Fig. 6)作证据。
- 训练与评测都是 image-free 的(仅用 JourneyDB 提示词),没有验证在有真实图文/视频配对数据时的行为;也没有报告加速在显存与批大小上的实际收益——低分辨率段本可以用更大的 batch,这个潜在收益论文没有利用。
- 级联意味着同一套权重要在多个分辨率上工作,模型可能对分辨率过拟合;4 段外推时掉到 HPS 29.48 也提示最低分辨率的语义保真度是硬瓶颈。
- 可改进方向:把阈值与分段数做成可学习或按骨干自适应搜索;把 \(U_{r_K}\) 从固定双线性插值换成可学习的轻量上采样器(同时补掉上采样伪影);在 loss 里直接加一项与教师的分布距离(如 FID 或基于特征的 MMD)来约束跨分辨率对齐;把该框架推广到模态间的"上采样"。
相关工作与启发¶
- vs DMD / DMD2:三者都是分布匹配蒸馏,但 DMD 的学生与教师共享同一分辨率的 \(x_t\),匹配是"同空间"的;RMD 的学生样本要先经过"低分辨率生成 → 可微上采样 → 重加噪"才进入教师空间,匹配时刻由 logSNR 对齐而非同一个 \(t\),梯度需穿过上采样雅可比。DMD2 额外引入判别器做 GAN 式对齐,RMD 没有判别器,靠跨分辨率 score 匹配加噪声回注来稳定。
- vs TDM:TDM 的诊断是"沿轨迹逐点匹配不够,要做轨迹级分布匹配";RMD 沿用这个诊断,但把匹配对象从"教师的整条轨迹"换成"按分辨率切出的段",并把逐时刻对齐降为逐段采样对齐(这既是效率考虑,也是为了消除不同分辨率段之间的监督不均衡)。
- vs 一致性模型 / 一致性轨迹模型:一致性类方法要求逐实例的轨迹自洽(instance-level trajectory matching),因此受困于教师概率流 ODE 的数值误差与轨迹一一对应问题;RMD 只要求分布一致,完全回避了实例级对应。
- vs Bottleneck Sampling:同样采用 high-low-high 的分辨率调度,但那是 training-free 的采样器改造,低分辨率段带来的分布偏移只能硬吃;RMD 把多分辨率级联纳入蒸馏训练,并用分布匹配显式补偿这个偏移(论文正是把 [41] 当作要解决的问题来引用)。
- vs SD3 的分辨率相关噪声调度:SD3 用它来训练单个模型跨分辨率工作;RMD 反其道而行——当模型已固定时,用它把不同分辨率的去噪时刻换算对齐,从而把"分辨率"这个变量从障碍变成可用的加速手段。
- vs PixelFlow 等像素空间级联生成:PixelFlow 需要从零训练像素空间的级联流;RMD 不重训教师,只在蒸馏阶段引入分辨率级联,因此可以直接套在 SDXL、PixArt-α、SD3.5、Wan2.1 这类现成模型上。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把分辨率纳入分布匹配蒸馏、用 logSNR 不变性对齐跨分辨率时刻的框架干净且有说服力;但各个零件(DMD 的分数蒸馏、SD3 的分辨率补偿、DMD2 的 stop-gradient、bottleneck sampling 的多分辨率调度)都有先例,属于组合式创新。
- 实验充分度: ⭐⭐⭐⭐ 四个骨干、图像与视频两个模态、组件消融与两级超参分析都在,14B 视频模型上的验证尤其有说服力;但缺 FID 一类分布距离指标,也没有消融分辨率补偿项本身。
- 写作质量: ⭐⭐⭐ 方法与动机的叙述清楚,跨分辨率匹配的动机链完整;但关键超参与训练成本细节都推给了附录(缓存中不可见),部分公式的排版与呈现质量一般。
- 价值: ⭐⭐⭐⭐ 提供了一条正交于降步数的加速维度,实测在 14B 视频模型上把 6 步基线再提速 1.53×,对工业界少步生成的部署有直接参考价值。