跳转至

Learning to Corrupt for Better Restoration

会议: ECCV 2026
论文: ECCV 原文
领域: 图像恢复
关键词: 图像恢复, 扩散模型, 图像超分辨率, 知识蒸馏, 输入自适应加噪

一句话总结

针对现有单步扩散图像恢复采用启发式加噪导致偏离预训练轨迹的问题,提出 IAC-IR 框架,通过高斯统计特性间接监督自适应预测最优时间步与噪声,并将其融入基于分数的知识蒸馏,实现了兼顾保真度与真实感的高效单步恢复。

研究背景与动机

图像恢复(Image Restoration, IR)致力于从退化的低质(Low-Quality, LQ)图像中重建真实的高质(High-Quality, HQ)图像。传统基于生成对抗网络(GAN)的方法虽能缓解逐像素回归造成的过度平滑,但常伴随训练不稳定与模式崩溃。近年来,预训练扩散模型凭借其强大的生成先验在超分辨率等低质恢复任务中展现出卓越的感知细节重建能力。早期的扩散恢复方法将 LQ 作为条件引导完整的反向去噪采样,这不仅伴随数十甚至上百步采样的沉重计算负担,而且在早期的随机加噪步骤中往往重复抹除了 LQ 输入中原本保留的高频线索。

为了提升推理效率,后续研究转向了单步扩散恢复模型。然而,扩散模型的预训练先验本质上建立在“从受标准高斯噪声污染的样本逐步恢复清晰分布”这一假设之上。现有单步恢复方法通常采用极度简化的加噪策略:要么直接将 LQ 潜变量喂入去噪网络(完全省略加噪过程),要么注入固定尺度的随机高斯噪声,或者采用固定的时间步长。这种启发式的固定假设忽略了真实场景退化的多样性与空间非均匀性,使得送入去噪器的潜变量严重偏离了预训练扩散模型的有效流形轨迹。更严重的是,在基于分数的单步扩散蒸馏中,随机采样时间步和噪声所产生的目标分数往往具有极大的方差与不稳定性,导致蒸馏梯度质量低下。

这种困境的核心矛盾在于:真实低质图像并无已知的加噪真值(Ground-Truth Timestep/Noise),使得直接监督加噪参数变得不可行;而一旦缺少合理的加噪对齐,去噪器便无法在单步内充分激活预训练生成先验。本文的核心 idea 是:利用预训练扩散模型的内生高斯统计特性与去噪一致性构建间接自监督,为每个输入样本端到端预测自适应的时间步 \(\hat{t}\) 与噪声 \(\hat{\epsilon}\),并将这一输入自适应加噪因子直接注入分数蒸馏,实现稳定高效的单步对齐。

方法详解

整体框架

IAC-IR 的整体流程在预训练 VAE 潜空间内展开。输入低质图像 \(I_{\text{LQ}}\) 首先通过图像编码器 \(E_\theta\) 映射为最优加噪潜变量 \(\mathbf{X}\)。随后,轻量级时间步估计器 \(\mathcal{T}\) 预测样本对应的时间步 \(\hat{t}\);同时,LoRA 微调的去噪 UNet \(\mathcal{U}_\phi\) 结合 \(\mathbf{X}\)\(\hat{t}\) 分解预测出清晰潜变量 \(\hat{\mathbf{x}}_0\) 与噪声分量 \(\hat{\epsilon}\)。为了克服无直接监督标签的困难,模型在训练阶段通过高斯统计矩搜索伪真值时间步 \(t_{\text{GT}}\),并引入冻结预训练去噪器 \(\mathcal{U}_\psi\) 施加去噪一致性约束。最终,预测的 \(\hat{\mathbf{x}}_0\) 通过冻结解码器输出恢复图像,并在自适应蒸馏损失与常规感知判别损失的联合驱动下完成优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    A["输入低质图像 $I_{\text{LQ}}$"] --> B["潜空间编码器 $E_\theta$<br/>映射为加噪潜变量 $\mathbf{X}$"]
    B --> C["高斯统计约束搜索最优时间步 $t_{\text{GT}}$"]
    B --> D["时间步估计器 $\mathcal{T}$<br/>预测自适应时间步 $\hat{t}$"]
    C -->|交叉熵损失 $\mathcal{L}_t$| D
    B & D --> E["可学习去噪器 $\mathcal{U}_\phi$<br/>预测噪声 $\hat{\epsilon}$ 与清晰潜变量 $\hat{\mathbf{x}}_0$"]
    E --> F["冻结去噪器一致性约束<br/>基于加噪潜变量 $\tilde{\mathbf{x}}_{\hat{t}}$ 优化 $\mathcal{L}_\epsilon$"]
    E --> G["自适应分数蒸馏 $\mathcal{L}_{\text{distill}}$<br/>基于预测 $(\hat{t}, \hat{\epsilon})$ 引导编码器更新"]
    E --> H["解码输出与组合优化<br/>$\mathcal{L}_1 + \mathcal{L}_{\text{VGG}} + \mathcal{L}_{\text{adv}}$ 重建图像 $I_{\text{IR}}$"]

关键设计

1. 高斯统计约束搜索最优时间步 \(t_{\text{GT}}\):为无监督变量建立伪真值引导

为了使编码器输出的潜变量 \(\mathbf{X}\) 严格落在预训练扩散模型的加噪分布轨迹上,模型需满足 \(\mathbf{X} = \sqrt{\bar{\alpha}_t}\mathbf{x}_0 + \sqrt{1-\bar{\alpha}_t}\epsilon\)。针对无加噪标签的问题,作者利用了预训练扩散模型的核心内生性质——注入的噪声必须服从标准高斯分布 \(\mathcal{N}(0, \mathbf{I})\)。对于任一候选时间步 \(t \in \{0, \dots, T-1\}\),由真实清晰样本潜变量 \(\mathbf{x}_0\) 可以解析反推出对应的候选残差噪声:

\[\mathbf{r}_t = \frac{\mathbf{X} - \sqrt{\bar{\alpha}_t}\mathbf{x}_0}{\sqrt{1-\bar{\alpha}_t}}\]

本文设计了高斯偏离度度量函数 \(\mathcal{G}(\mathbf{r}_t)\),综合考察样本的均值 \(\mu\)、方差 \(\sigma^2\)、偏度 \(\gamma\) 和峰度 \(\kappa\)

\[\mathcal{G}(\mathbf{r}_t) = \|\mu(\mathbf{r}_t)\|^2 + \|\sigma^2(\mathbf{r}_t) - 1\|^2 + \|\gamma(\mathbf{r}_t)\|^2 + \|\kappa(\mathbf{r}_t) - 3\|^2\]

在此基础上,令残差最贴合标准高斯分布的候选时间步作为真值标签 \(t_{\text{GT}} = \arg\min_t \mathcal{G}(\mathbf{r}_t)\)。该设计巧妙避开了主观人工设定时间步的缺陷,为后续轻量化时间步预测器提供了明确、自适应的优化靶标。

2. 时间步估计器 \(\mathcal{T}\) 与交叉熵监督:实现推理期无真值自适应预测

在测试推理阶段,真实清晰图像 \(\mathbf{x}_0\) 无法获取,因而无法通过残差搜索 \(t_{\text{GT}}\)。为此,IAC-IR 引入了一个轻量级的 Vision Transformer 模块作为时间步估计器 \(\mathcal{T}\)(包含 12 层 ViT,仅占总参数量的约 2%)。该估计器将可学习的类别标记(Class Token)与展平后的潜变量 \(\mathbf{X}\) 拼接后编码,最后通过线性分类层输出全部 \(T\) 个离散时间步的激活概率分布,预测时间步即为最大激活索引 \(\hat{t} = \arg\max_t \mathcal{T}(\mathbf{X})_t\)。在训练阶段,直接采用标准交叉熵损失 \(\mathcal{L}_t = \text{CE}(\mathcal{T}(\mathbf{X}), t_{\text{GT}})\) 监督分类概率。这一设计让模型在测试阶段仅依靠低质输入自身即可在单步前向中实时输出最佳对齐时间步。

3. 冻结去噪器一致性约束:端到端自监督学习内容保持噪声 \(\hat{\epsilon}\)

不仅加噪幅度(时间步)影响恢复效果,所注入噪声的空间结构同样决定了去噪能否保留输入的可恢复内容。先前工作(如 InvSR)仅对噪声进行隐式优化,容易导致预测噪声退化或严重偏离高斯分布。本文提出利用预训练且参数完全冻结的扩散去噪器 \(\mathcal{U}_\psi\) 建立显式自监督。具体而言,模型利用可学习去噪器 \(\mathcal{U}_\phi\)(带有 LoRA 适配层)根据当前预测的 \(\hat{t}\)\(\mathbf{X}\) 分解出 \(\hat{\epsilon}\) 与清晰潜变量 \(\hat{\mathbf{x}}_0\)。随后,将真实清晰潜变量 \(\mathbf{x}_0\) 与预测出的 \(\hat{\epsilon}\) 在时间步 \(\hat{t}\) 下前向加噪生成合成潜变量 \(\tilde{\mathbf{x}}_{\hat{t}} = \sqrt{\bar{\alpha}_{\hat{t}}}\mathbf{x}_0 + \sqrt{1-\bar{\alpha}_{\hat{t}}}\hat{\epsilon}\),并送入冻结去噪器 \(\mathcal{U}_\psi\) 重新估计噪声 \(\tilde{\epsilon} = \mathcal{U}_\psi(\tilde{\mathbf{x}}_{\hat{t}}, \hat{t})\)。最终通过均方误差损失强制两者对齐:

\[\mathcal{L}_\epsilon = \|\tilde{\epsilon} - \hat{\epsilon}\|^2\]

该设计迫使可学习网络输出的 \(\hat{\epsilon}\) 正是预训练扩散先验能够最稳定去噪的标准噪声模式,既保留了输入图像的语义骨架,又杜绝了模式坍塌。

4. 自适应分数蒸馏:以确定性对齐加噪稳定单步梯度

传统基于分数的扩散蒸馏依赖于在随机采样的时间步和随机高斯噪声下评估教师与学生网络的分数差异。这种随机性在单步恢复任务中极易产生方差过大、方向不可靠的伪目标梯度。IAC-IR 创新地将上述学得的自适应加噪因子直接用于构建蒸馏监督:潜变量 \(\mathbf{X}\) 本身即作为确定性加噪样本,学生的去噪输出为 \(\hat{\mathbf{x}}_0 = (\mathbf{X} - \sqrt{1-\bar{\alpha}_{\hat{t}}}\mathcal{U}_\phi(\mathbf{X}, \hat{t})) / \sqrt{\bar{\alpha}_{\hat{t}}}\),而蒸馏目标则通过将同一样本和同一预测时间步 \(\hat{t}\) 送入冻结教师网络 \(\mathcal{U}_\psi\) 获得输出 \(\hat{\mathbf{x}}_0^\psi\)。蒸馏损失定义为:

\[\mathcal{L}_{\text{distill}}(\theta) = \mathbb{E}\left[\|\hat{\mathbf{x}}_0 - \hat{\mathbf{x}}_0^\psi\|^2\right]\]

在该损失中仅对编码器 \(E_\theta\) 计算梯度反向传播。这一设计消除了传统蒸馏中的启发式噪声方差干扰,提供了高质量、方向聚焦的知识迁移信号,大幅强化了恢复结果的高频微结构质感。

损失函数 / 训练策略

模型的总训练目标包含四大组成部分: 1. 时间步与噪声损失:即上述交叉熵损失 \(\mathcal{L}_t\) 与一致性均方误差损失 \(\mathcal{L}_\epsilon\); 2. 分数蒸馏损失:自适应蒸馏项 \(\mathcal{L}_{\text{distill}}\),专门指导编码器更新; 3. 图像域重建与感知损失:清晰潜变量 \(\hat{\mathbf{x}}_0\) 经冻结 VAE 解码器重构为图像 \(I_{\text{IR}}\) 后,计算与真实高清图 \(I_{\text{HQ}}\) 间的像素级 \(\mathcal{L}_1\) 损失及基于预训练 VGG 网络的感知损失 \(\mathcal{L}_{\text{VGG}}\); 4. 对抗判别损失:引入补丁判别器优化的对抗损失 \(\mathcal{L}_{\text{adv}}\),强化微观纹理分布拟合。

模型以 Stable Diffusion 2.1 为基底,在 4 块 H100 GPU 上采用 AdamW 优化器进行 300k 次迭代训练,初始学习率 \(1\times 10^{-4}\),每 100k 次减半。输入 patch 尺寸为 \(512 \times 512\)

实验关键数据

主实验

论文在合成退化数据集(ImageNet)以及多种真实复杂退化基准(RealSR, DRealSR, RealLR200, RealPhoto, RealSet80)上与前沿单步扩散超分及图像恢复方法进行了系统对比。下表汇总了主论文 Table 1 中的代表性基准定量结果:

数据集 指标 IAC-IR(本文) HYPIR InvSR OSEDiff 相对优势
RealSR PSNR (dB) ↑ 22.509 21.408 22.559 23.589 保持良好像素保真度
SSIM ↑ 0.672 0.656 0.685 0.707 结构相似度处于高位
LIQE ↑ 4.668 3.970 4.039 4.068 显著超越前代 SOTA(+0.600)
MUSIQ ↑ 69.853 66.247 68.537 69.091 感知评分全场最佳
CLIPIQA ↑ 0.709 0.638 0.679 0.668 图像自然语义匹配度最高
MANIQA ↑ 0.589 0.476 0.455 0.472 纹理质量大幅领先(+0.113)
ImageNet PSNR (dB) ↑ 22.187 21.116 22.018 23.056 超越 HYPIR 且贴近 InvSR
LIQE ↑ 4.721 4.606 4.560 4.561 合成域全场最高感知得分
MUSIQ ↑ 73.546 72.693 72.382 71.751 显著领先 OSEDiff 等竞品
MANIQA ↑ 0.617 0.561 0.469 0.459 细节真实感全面占优
RealPhoto LIQE ↑ 4.829 4.686 1.863 4.625 无预插值原图场景下稳健领先
MANIQA ↑ 0.635 0.581 0.298 0.483 避免了 InvSR 的严重失常崩溃

消融实验

论文围绕时间步选择机制、噪声监督形式及蒸馏策略展开了详尽的消融验证。下表摘自原论文 Table 2、Table 3 与 Table 5(在 RealSR 基准评测):

表 1:加噪时间步策略消融分析(原论文 Table 2)

时间步配置 PSNR (dB) ↑ SSIM ↑ LIQE ↑ MUSIQ ↑ CLIPIQA ↑ MANIQA ↑ 机制说明
固定 \(t = 100\) 23.064 0.660 3.816 66.122 0.694 0.559 偏向保真但感知生成不足
固定 \(t = 200\) 22.077 0.669 4.448 69.756 0.684 0.559 权衡折中
固定 \(t = 400\) 20.492 0.615 4.571 69.927 0.709 0.588 感知稍增但像素失真严重
自适应 \(\hat{t}\)(本文) 22.509 0.672 4.668 69.853 0.709 0.589 动态权衡感知与保真,感知全面最优
真值 \(t_{\text{GT}}\)(上限) 22.698 0.690 4.656 70.466 0.717 0.606 基于真实清晰图的理想理论上限

表 2:噪声监督机制与蒸馏策略消融(原论文 Table 3 & Table 5)

消融维度 具体配置 LIQE ↑ MUSIQ ↑ CLIPIQA ↑ MANIQA ↑ 核心观察
噪声监督 \(\mathcal{L}_\epsilon\) 无监督(W/O loss) 4.004 67.256 0.626 0.483 缺失监督导致噪声偏离高斯先验,性能骤降
显式 KL 散度约束 \(\mathcal{L}_{\text{KL}}\) 4.218 69.363 0.659 0.523 强制均一高斯导致空间多样性塌缩
一致性损失 \(\mathcal{L}_\epsilon\)(本文) 4.668 69.853 0.709 0.589 保持高斯先验的同时保留样本特异性噪声分布
分数蒸馏 \(\mathcal{L}_{\text{distill}}\) 随机时间步 + 随机噪声 3.990 68.120 0.636 0.479 常规随机采样蒸馏方差大,效果受限
预测 \(\hat{t}\) + 随机噪声 4.174 69.234 0.676 0.506 准确的时间步带来显著增益
随机时间步 + 预测 \(\hat{\epsilon}\) 4.045 68.519 0.653 0.499 单独使用预测噪声提升有限
预测 \(\hat{t}\) + 预测 \(\hat{\epsilon}\)(本文) 4.668 69.853 0.709 0.589 两者协同注入蒸馏,全面激活生成质量

关键发现

  1. 固定时间步的刚性 trade-off 破局:实验证明任意固定的时间步都陷入“低 \(t\) 保真度高但细节模糊,高 \(t\) 细节丰富但几何形变严重”的困境。IAC-IR 预测的自适应时间步不仅感知指标全面碾压任一固定配置(LIQE 提升至 4.668),且高度逼近利用全参考真值计算的 \(t_{\text{GT}}\) 上限性能。
  2. 高斯约束并非越硬越好:直接对预测噪声使用严格的 KL 散度约束,会迫使网络对不同输入生成趋同的均一噪声(在 t-SNE 降维投影中聚成团),抹杀了低质图像不同区域退化异质性的表达;而本文基于冻结去噪器重构误差的 \(\mathcal{L}_\epsilon\) 和统计矩函数 \(\mathcal{G}(\cdot)\),在维持高斯整体特性的同时赋予了不同样本充足的噪声多样性。
  3. 推理延迟极低:在 A100 GPU 上对 \(512\times 512\) 图像单步恢复,IAC-IR 的推理延迟仅为 110ms,计算量 1384 GMACs,明显快于 InvSR(117ms / 2123 GMACs)与 HYPIR(220ms / 1784 GMACs),比多步扩散基线(StableSR 3460ms)提速超过 30 倍。

亮点与洞察

  • 将退化建模逆向转译为标准加噪对齐:传统方法试图训练网络生硬地适应非标准的 LQ 潜变量分布,而 IAC-IR 巧妙地将其转化为“为每个退化样本反推其在预训练扩散正向轨迹上的等价起始点”,最大化释放了冻结生成骨干模型的先验潜力。
  • 无需配对真值的自监督加噪搜索策略:通过统计矩(均值、方差、偏度、峰度)检验高斯性获得伪真值时间步 \(t_{\text{GT}}\),并借助冻结预训练去噪器实现无标签自监督噪声校验,机制严密且易于复现。
  • 确定性自适应因子革新分数蒸馏:打破了常规分数蒸馏采用随机时间步与高斯噪声导致高梯度方差的行业惯性,用输入专属的 \((\hat{t}, \hat{\epsilon})\) 产生稳定、收敛迅速的高质量梯度指导,为生成式蒸馏领域提供了通用范式。

局限与展望

  • 失真度与感知质量的天然张力:虽然感知评分(LIQE、MANIQA 等)全线拔尖,但在极端强调像素绝对对齐的 PSNR 指标上略低于部分保守回归型方法。未来可在推理阶段引入用户可调节的保真度控制因子,按需动态插值 \(\hat{t}\)
  • 空间均一加噪假设的延展空间:当前时间步 \(\hat{t}\) 为整张图像的全局标量预测。面对局部模糊但局部清晰的极端非均匀复杂真实退化,探索像素级或补丁级(Patch-wise)的局部时间步矩阵将是值得深入的方向。

相关工作与启发

  • vs InvSR (CVPR 2024):InvSR 虽提出反推噪声,但采用固定的时间步,且对噪声预测缺乏显式的有效监督约束,假设 LQ 与 HQ 共享退化;IAC-IR 首次实现了时间步与噪声的双自适应预测,并通过高斯统计矩与去噪一致性构建了严密闭环监督,在真实场景(如 RealPhoto)中彻底避免了 InvSR 的崩溃现象。
  • vs HYPIR (2024):HYPIR 引入复杂的大型 Transformer 模块处理退化,参数开销大且在特定真实光学变焦数据集上表现欠佳;IAC-IR 仅增加约 2% 参数量的轻量 ViT 估计器,保留了 SD 骨干的高效管线,延迟降低 50% 且全场景表现优异。
  • vs TSD-SR (CVPR 2025):TSD-SR 意识到单步蒸馏梯度的不稳定性并引入辅助目标,但仍依赖启发式噪声;IAC-IR 直接用网络预测的自适应加噪因子重塑蒸馏目标,从根源上净化了分数匹配的引导信号。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用预训练扩散内生统计特性自监督学习输入自适应加噪,思路极具启发性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 6 大真实与合成基准、全面的固定对比与消融实验、用户偏好调研及详实效率测评。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对应清晰,理论推导与工程实现结合紧密。
  • 价值: ⭐⭐⭐⭐⭐ 成功攻克单步扩散恢复偏离预训练流形的核心痛点,兼具卓越的视觉质量与极速推理实用性。