跳转至

Generative Manifold Distillation: Aligning Restoration Trajectories with the Natural Image Prior

会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
领域: 图像恢复 / 图像生成
关键词: 图像恢复, 无监督域自适应, 生成先验蒸馏, 流匹配, 流形对齐

一句话总结

本文提出生成流形蒸馏(GMD),在严格仅有低质未标注目标图像的无监督域自适应设定下,通过冻结的大规模文生图流匹配模型进行离线正交投影生成高质量伪目标,并结合质量门控过滤与源域轨迹锚定,在零推理时延与零结构修改的前提下将强大的自然图像生成先验蒸馏进轻量恢复模型。

研究背景与动机

基于扩散模型与流匹配的图像恢复方法在超分辨率、去模糊和图像修复等任务中展现出了强大的感知重建能力。然而,这类模型通常依赖于合成退化数据进行训练;当将其部署到具有复杂未知真实退化的分布外(OOD)场景时,往往会遭遇显著的性能崩溃(流形漂移)。由于在现实场景中很难获取配对的真实高清监督真值,如何在无需目标域清晰图像且不更改模型推理架构的前提下,将高效恢复模型自适应到新的无标注真实域,成为了底层视觉领域亟待解决的关键难题。

回顾以往的无监督域自适应(UDA)方法,主流工作主要受困于两类范式瓶颈:第一类是传统的非配对自适应(如 CycleGAN 体系或双向映射方法),它们不仅严重依赖繁复不稳定的对抗训练与判别器结构,破坏了已有预训练模型即插即用的部署便利,而且通常仍苛求目标域存在一组未配对的高质量清晰图像作为参考分布;第二类是直接在测试阶段引入超大规模文生图基础模型(如 12B 参数的 FLUX),利用 SDEdit 或逆向求解进行零样本引导恢复,但这会引入巨大的测试期计算开销与显存延迟(推理耗时暴增数倍),且缺乏任务约束的强大生成先验容易喧宾夺主,诱发严重的语义漂移与几何幻觉。

这就引出了一个核心诉求:我们既渴望超大规模基础模型所蕴含的深厚自然图像先验来驱散严苛的真实退化,又必须保持轻量恢复网络极速的单步推理效率与对输入结构的刚性保真。本文的切入角度是将在线先验调用重构为完全离线的几何流形蒸馏。核心 idea:将无监督域自适应建模为两阶段几何流形对齐过程——在离线阶段利用冻结的 12B 生成模型执行带注意力注入的正交流形投影并经过质量门控筛选伪目标,再以高比例源域数据为物理锚点进行轨迹正则化蒸馏,实现零附加推理时延与零架构变动的分布外自适应。

方法详解

整体框架

GMD 面向最严格的无监督域自适应设定:源域拥有配对数据 \(\mathcal{D}_{id} = \{(y_{id}^{(i)}, x_{id}^{(i)})\}_{i=1}^{N_{id}}\),而目标域仅提供未标注的低质退化图像 \(\mathcal{D}_{ood} = \{y_{ood}^{(j)}\}_{j=1}^{N_{ood}}\),完全不存在目标域的高清清晰图像。从几何角度看,自然高清图像构成低维流形 \(\mathcal{M}\)。当基线恢复模型 \(f_{\theta_{id}}\) 面对分布外低质输入 \(y_{ood}\) 时,由于无法建模真实噪声分布,其初次推理结果 \(\tilde{x}_{ood}\) 会偏离流形落入低密度的“伪影空间”(Off-Manifold)。

为此,GMD 构建了包含离线投影生成与联合自适应蒸馏的完整管线:首先运行基线模型得到初步恢复结果 \(\tilde{x}_{ood}\);接着利用冻结的大规模文生图基础模型执行正交流形投影,通过前向 ODE 边缘化未建模伪影,并在反向 ODE 积分中注入前向自注意力键值,将估计结果拉回自然流形 \(\mathcal{M}\) 得到高质量伪目标 \(\hat{x}_{ood}\);随后通过基于 NIMA 评分的质量门控过滤淘汰低置信度和幻觉样本;最后在微调紧凑的学生网络时,采用源域配对数据(90%)与过滤后的目标域伪配对数据(10%)构建双任务联合损失,既学到了目标域的自然纹理分布,又彻底锁死了原有的物理保真能力。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["无标注目标域低质输入 y_ood"] --> B["初始离线推理<br/>基线模型生成离流形估计 x_init"]
    B --> C["正交流形投影<br/>前向ODE伪影边缘化 + 反向ODE注意力注入"]
    C --> D{"质量门控流形过滤<br/>NIMA 评分 s(x) ≥ α"}
    D -->|通过| E["合格伪目标集合 D_sel^ood"]
    D -->|淘汰| F["丢弃低质与幻觉样本"]
    E --> G["源域锚定轨迹正则化蒸馏<br/>90% 源域物理锚定 + 10% 目标域流形对齐"]
    H["源域配对数据 D_id"] --> G
    G --> I["最终高效自适应模型 f_θ<br/>零附加推理延迟 / 零结构改动"]

关键设计

1. 正交流形投影:前向伪影边缘化与反向注意力注入锁定语义

直接将存在 OOD 伪影的初步恢复结果 \(\tilde{x}_{ood} = x_{clean} + \epsilon_{art}\) 映射回自然图像流形 \(\mathcal{M}\) 时,普通生成模型极易出现语义漂移(生成一张在流形上合法但内容与原图无关的新图)。GMD 将 12B 的 FLUX.1.dev 整流流(Rectified Flow)模型解构为正交投影算子 \(\Pi_\mathcal{G}\),巧妙地由两步完成对齐:

第一步是前向 ODE 提升与伪影边缘化。在空文本条件 \(c_\emptyset\) 下,沿着常微分方程 \(\frac{d x}{d\tau} = v(x, \tau, c_\emptyset)\) 从 \(\tau=0\) 积分至 \(\tau=1\)。在潜空间中,高频非结构化伪影惩罚 \(\epsilon_{art}\) 在积分向各向同性高斯先验推进的过程中被渐近吸收和边缘化;同时,场景的低频拓扑与几何轮廓被完整隐式编码至前向轨迹的自注意力图谱之中。

第二步是带注意力注入的引导反向投影。使用文本提示(Prompt: “A sharp, focused, high quality photograph”)在分类器无引导(CFG)速度场 \(v_{cfg}\) 驱动下求解反向 ODE:

\[\hat{x}_{ood} = \Pi_\mathcal{G}(\tilde{x}_{ood}) = x(1) + \int_{1}^{0} v_{cfg}(x(\tau), \tau, c_{prompt}) d\tau\]

反向速度场天然指向数据分布的高密度区域,保证了积分结果必定落入自然图像流形 \(\mathcal{M}\)。为了强制投影为“正交投影”——即在 \(\mathcal{M}\) 上寻找与输入几何空间结构最接近的点,GMD 在反向积分的每个步骤中,将自注意力机制中的 Key 和 Value 矩阵替换为前向提升阶段缓存的对应键值。这种注意力注入技术刚性锁定了空间布局,迫使生成流只负责剥离低密度伪影并填补高保真真实细节,严防几何形变与语义失真。

2. 质量门控流形过滤:客观感知质量截断防止误差传播

尽管正交流形投影大幅抑制了幻觉,但在遭遇极度恶劣的未知退化时,部分样本仍可能偏离自然流形或出现生成瑕疵。若将所有伪目标不加甄别地用于下游蒸馏,学生网络会严重过拟合这些生成伪影,甚至导致训练发散。

为此,GMD 在进入微调阶段前引入了一道质量门控流形过滤器。系统借助在自然图像感知质量上充分预训练的无参考图像质量评估模型(NIMA)作为流形邻近度的代理度量 \(s(\cdot)\),仅保留质量评分达到预设阈值 \(\alpha = 4.0\) 的样本对:

\[\mathcal{D}_{sel}^{ood} = \left\{ (y_{ood}^{(i)}, \hat{x}_{ood}^{(i)}) \;\middle|\; s(\hat{x}_{ood}^{(i)}) \ge \alpha \right\}\]

该过滤机制构成了坚固的安全屏障:低于阈值的低置信度生成样本被直接剔除,确保流入蒸馏阶段的伪监督信号全部处于高密度、高逼真度的流形区域,杜绝了教师模型的偶发瑕疵污染紧凑学生网络的表征空间。

3. 源域锚定轨迹正则化蒸馏:混合监督规避流形坍塌

在获取筛选后的目标域高质量伪目标后,若仅使用 \(\mathcal{D}_{sel}^{ood}\) 对基础恢复网络 \(f_\theta\) 进行单向微调,模型将迅速遭遇“流形坍塌”——即模型逐渐退化为单纯输出平滑美观纹理的生成器,而丧失反演物理退化映射的严谨结构保真能力(在无监督域自适应中极易发生灾难性遗忘)。

GMD 提出双目标受约束流形对齐策略,构建包含大比例源域锚定的混合批次损失:

\[\mathcal{L}_{total}(\theta) = \underbrace{\frac{1}{B_{id}} \sum_{i=1}^{B_{id}} \left\| f_\theta(y_{id}^{(i)}) - x_{id}^{(i)} \right\|^2}_{\text{源域轨迹正则化 } (\mathcal{L}_{id})} + \lambda \underbrace{\frac{1}{B_{ood}} \sum_{j=1}^{B_{ood}} \left\| f_\theta(y_{ood}^{(j)}) - \hat{x}_{ood}^{(j)} \right\|^2}_{\text{目标域流形对齐 } (\mathcal{L}_{ood})}\]

其中 \(\mathcal{L}_{ood}\) 引导模型在处理真实 OOD 输入时向自然流形逼近,而 \(\mathcal{L}_{id}\) 扮演着至关重要的“刚性物理锚栓”。实验表明,设置极高比例的源域锚定数据(混合比例为 9:1,即 90% 源域 + 10% 目标域)能够有效约束优化路径仅在符合逆问题物理约束的解空间内平滑插值。这使得学生模型既继承了教师模型在目标域的逼真纹理,又牢牢守住了源域建立的严密结构对应关系。

损失函数 / 训练策略

学生模型采用 1.3B 参数的 MMDiT 架构潜在扩散模型(LDM),预训练在源域迭代 500K 步。在 GMD 自适应阶段,整个离线优化由两部分构成: 1. 伪目标离线生成阶段:使用 12B FLUX.1.dev,采用 Euler 解算器求解 50 步,分类器引导权重 \(w = 3.5\) 并启用自注意力注入。在 4 张 TPUv5p 芯片上耗时约 3 小时即完成目标域所有样本的投影。 2. 知识蒸馏微调阶段:采用 Adam 优化器,在 32 张 TPUv5p 芯片上仅训练约 4 小时。训练批次中保持 9:1 的源域配对数据与目标域过滤伪配对数据混合比例。完成微调后,该 1.3B 模型直接用于测试端单次前向恢复,完全卸载 12B 教师模型,不产生任何额外内存与时延开销。

实验关键数据

主实验

论文在四种极具挑战性的无监督跨域恢复场景中进行了全面测试: 1. 去模糊自适应: GoPro(源域)\(\to\) REDS(视频运动模糊)与 RealBlur-J(真实暗光与抖动模糊)。 2. 合成超分辨率(SR)自适应: 弱退化(DIV2K 低噪声弱模糊)\(\to\) 强退化(Flickr2K 重度模糊噪声)。 3. 真实超分辨率自适应: 合成退化 \(\to\) 真实手机采集(DPED-iPhone 真实传感器噪声与压缩伪影)。

下表汇总了去模糊跨域自适应任务(GoPro \(\to\) REDS 与 RealBlur-J)的综合量化对比(评估指标覆盖感知失真 LPIPS、无参考质量评估 NIMA、MUSIQ、CLIPIQA、生成质量 FID 以及像素失真度量 PSNR、SSIM):

数据集 方法类别 / 模型 LPIPS↓ NIMA↑ MUSIQ↑ FID↓ CLIPIQA↑ PSNR↑ SSIM↑
REDS DeblurGANv2 0.190 4.350 53.17 35.77 0.313 27.07 0.805
REDS Restormer 0.220 4.401 53.07 36.42 0.270 26.58 0.801
REDS Uformer 0.197 4.315 54.24 35.11 0.283 27.20 0.825
REDS Hi-Diff 0.205 4.305 54.04 39.26 0.277 27.21 0.831
REDS DA-CLIP 0.223 4.294 48.43 42.90 0.258 25.82 0.764
REDS LDM-Deblur (基线) 0.183 4.325 57.60 37.67 0.306 24.08 0.678
REDS LDM-Deblur w/ GMD (本文) 0.179 4.460 63.67 31.64 0.404 24.35 0.682
REDS Fully Supervised (上界参考) 0.169 4.578 65.04 32.49 0.462 24.51 0.686
RealBlur-J Restormer 0.150 4.060 47.71 23.97 0.245 27.07 0.824
RealBlur-J Hi-Diff 0.145 4.142 50.07 22.28 0.254 27.12 0.831
RealBlur-J DA-CLIP 0.239 3.859 38.96 42.26 0.236 20.53 0.680
RealBlur-J LDM-Deblur (基线) 0.145 4.081 50.71 25.74 0.214 26.74 0.780
RealBlur-J LDM-Deblur w/ GMD (本文) 0.132 4.480 61.33 20.33 0.354 26.88 0.796
RealBlur-J Fully Supervised (上界参考) 0.110 4.487 52.57 17.63 0.293 27.96 0.829

在超分辨率自适应任务中,GMD 同样表现突出: - 合成 4× SR (弱 \(\to\) 强 DIV2K):未经自适应的 LDM-SR 基线 MUSIQ 为 54.41,FID 为 30.11,LPIPS 为 0.386;经 GMD 自适应后,MUSIQ 跃升至 58.29(提升 3.88),FID 降至 28.30(改善 1.81),LPIPS 降低至 0.368,PSNR/SSIM 达到 22.32 / 0.578。 - 真实 2× SR (DIV2K \(\to\) DPED-iPhone):在无参考真实质量指标上,GMD 将 NIQE 从 5.467 降至 4.300,BRISQUE 从 19.02 降至 16.35,MANIQA 从 0.543 提升至 0.627,显著击败了包括 StableSR(NIQE 4.475, MANIQA 0.607)和 SeeSR(NIQE 5.110, MANIQA 0.619)在内的强力基线。 - 人工主观测评: 在覆盖 50 名受试者(去模糊)与 60 名受试者(超分)的双盲选择实验中,GMD 以压倒性优势领先所有基线(对基线模型的胜率超过 80%)。

消融实验

1. 质量门控流形过滤的必要性(在 REDS 去模糊上验证)

配置变体 PSNR↑ / SSIM↑ LPIPS↓ MUSIQ↑ FID↓ CLIPIQA↑ 说明
无过滤 (w/o filter) 23.51 / 0.652 0.293 50.17 41.26 0.272 受到伪影与幻觉污染,表现大幅劣于基线
含质量门控过滤 (Ours) 24.35 / 0.682 0.179 63.67 31.64 0.404 过滤淘汰低置信度投影,性能全面大幅领先

2. 源域锚定数据混合比例(ID:OOD)对蒸馏稳定性的影响

源域数据占比 (Ratio) LPIPS↓ MUSIQ↑ FID↓ CLIPIQA↑ 现象与分析
1.0 (仅源域数据,未自适应) 0.183 57.60 37.67 0.306 未适配目标域,保留严重分布外残余模糊
0.95 0.188 58.10 36.75 0.320 适应速度稍慢,开始出现清晰质感
0.90 (本文默认配置) 0.179 63.67 31.64 0.404 最佳折中:物理保真与自然细节达到最优平衡
0.60 0.187 62.15 39.09 0.379 约束减弱,FID 恶化至 39.09
0.30 0.198 62.03 39.73 0.375 物理对应关系松动,结构失真增加
0.00 (仅目标域伪目标) 0.217 52.61 53.56 0.287 发生流形坍塌与灾难性遗忘,质量全面崩溃

3. 在线基础模型投影 vs 离线 GMD 蒸馏的推理开销对比

部署机制 参数量 推理时延 LPIPS↓ MUSIQ↑ FID↓ CLIPIQA↑ PSNR / SSIM
LDM 基线 (GoPro) 1.3B 1.17s 0.183 57.60 37.67 0.306 24.08 / 0.678
+ SDEdit (在线调用) 1.3B+12B 1.17s + 2.40s 0.201 63.50 40.09 0.404 20.18 / 0.619
+ FLUX.1 Kontext (在线调用) 1.3B+12B 1.17s + 6.50s 0.180 63.60 32.10 0.400 21.50 / 0.630
+ RF-Solver (在线调用) 1.3B+12B 1.17s + 4.79s 0.186 63.47 33.57 0.404 22.15 / 0.643
w/ GMD (本文离线蒸馏) 1.3B 1.17s (+0s) 0.179 63.67 31.64 0.404 24.35 / 0.682

关键发现

  • 质量门控过滤是防止伪监督投毒的关键生命线:若不加过滤直接用伪目标训练,FID 会从 31.64 暴跌至 41.26(比未经自适应的原始基线 37.67 还要差),LPIPS 从 0.179 恶化到 0.293。这证明未约束的生成幻觉对轻量判别式/恢复模型的破坏力极强,过滤机制是整个自适应闭环的核心保障。
  • 高比例源域锚定是抵御流形坍塌的刚性约束:在混合微调中,一旦将源域比例降至 0(完全依赖目标伪目标),模型 FID 骤降至 53.56,发生灾难性遗忘;而维持 0.9 的高源域占比不仅没有阻碍目标域自适应,反而在 FID 上取得了最低值(31.64),说明物理逆问题先验在限制生成自由度方面发挥了决定性正向作用。
  • 注意力注入是保证正交投影保真的基石:对比 SDEdit 与无注意力机制的流匹配逆映射,注入前向自注意力键值能严密锁定车牌、文字、车辆外形等高阶语义结构,彻底杜绝了将未知退化“重绘”成无关物体的语义幻觉。
  • 结构泛化性强:补充实验验证,即便将学生网络替换为轻量级非扩散模型(如 SwinIR CNN/Transformer),或将教师模型降级为较小的 Stable Diffusion,GMD 依然能实现稳健跨域增强。

亮点与洞察

  • 将在线生成式先验的沉重计算负担完全转化为一次性离线训练成本:GMD 敏锐地解耦了先验提供者与实际推理端,通过离线投影+轻量蒸馏,使得 1.3B 小模型获得了逼近甚至超越 12B 在线大模型的纹理恢复能力,同时测试期耗时保持在惊人的 1.17s(零额外时延)。
  • 通过注意力注入实现了严格意义上的“正交几何投影”:利用前向 ODE 擦除伪影,反向 ODE 注入原始键值,该机制从根本上解决了生成模型用于逆问题时“高真实感但低保真度(幻觉)”的经典两难困境。
  • 双任务源域物理锚定机制具有高度可迁移性:90% 源域物理数据 + 10% 目标域流形伪数据的非对称混合策略极其优雅,为所有基于生成式伪标签的半监督/自监督域自适应任务提供了防止遗忘与崩溃的标准范式。

局限与展望

  • 依赖通用文生图模型的隐式覆盖域:离线教师模型(FLUX.1)的流形质量取决于其预训练数据的覆盖度;若遇到极具专业性或远离自然图像分布的特殊领域(如显微镜医学切片、极端红外或雷达图像),通用文生图先验的有效性可能受限。
  • 两阶段离线准备成本与静态性:尽管测试期零时延,但自适应需要数小时的 TPU 离线采样与微调,属于批处理范式,无法应对连续流式变化或动态演化的退化环境(Test-time Streaming Adaptation)。
  • 质量门控指标的局限性:当前过滤依赖 NIMA 等全局感知质量模型作为代理指标,对于某些局部语义合理但存在微妙物理失真的样本,标量评分可能存在漏检风险,未来可探索局部一致性与几何拓扑度量。

相关工作与启发

  • vs 传统无监督域自适应恢复 (如 CycleGAN / DualGAN / AdaIR / DA-CLIP):传统方法依赖脆弱的对抗判别器或复杂的解耦架构重构,且通常仍需目标域的高质清晰图;GMD 完全不改动基础网络架构,仅需目标域低质退化输入,大幅降低了工程落地与训练稳定的门槛。
  • vs 在线扩散先验求解器 (如 SDEdit / RF-Solver / DiffBIR / SeeSR):在线方法将重型模型置于测试前向流中,推理极慢且容易产生不可控的内容漂移与幻觉;GMD 将大模型先验沉淀在离线阶段,推理时兼具小模型的速度与保真度,同时规避了结构形变。
  • vs 伪标签自训练方法:常规伪标签容易累积确认偏差(Confirmation Bias);GMD 通过“大模型正交投影去除伪影 + 感知质量门控截断 + 90% 源域物理锚定”三重屏障,彻底阻断了错误轨迹的误差级联。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙重构了域自适应范式,将无监督自适应解构为离线正交流形投影与源域物理锚定蒸馏,兼具几何美感与实用性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖去模糊与超分辨四大跨域场景,包含主客观指标、消融实验、主观用户调研及在线/离线计算开销对比,论据严密。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述一针见血,数学推导与物理直觉结合紧密,实验分析条理清晰。
  • 价值: ⭐⭐⭐⭐⭐ 完美契合工业界与学术界对于底层视觉模型“高保真、零额外延迟、无缝适配真实环境”的迫切诉求,具有极高的实际落地参考价值。