Improving Image-to-Image Translation via a Rectified Flow Reformulation¶
会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 图像到图像翻译、整流流、回归重构、ODE细化、连续时间传输
一句话总结¶
本文提出图像到图像整流流重构(I2I-RFR),通过向现有图像回归主干网络输入拼接含噪目标图像、优化按时间重加权的像素损失并解析导出诱导速度场,在仅扩充输入通道且保留原生训练管线的前提下,将标准判别式回归模型无缝转化为仅需 3 步显式欧拉积分的高保真连续时间传输细化器。
研究背景与动机¶
图像到图像(I2I)翻译构成了底层计算机视觉的核心骨架,广泛涵盖超分辨率、图像去模糊、微光增强、水下图像恢复以及视频画质修复等多种任务。在工业界与学术界中,最具实用价值的主流方案始终建立在配对有监督的像素级回归框架之上,通过优化 \(\ell_1\) 或均方误差损失驱动卷积神经网络或 Transformer 主干。这类判别式回归方法训练极度稳定,易于针对特定退化设计归纳偏置(如 U-Net、Restormer、SwinIR、LEDNet 等),构成了视觉修复领域最重要的工程资产。然而,现实世界的许多图像退化具有高度不适定性(ill-posed),严重的边缘退化与信息丢失导致给定输入条件下的真实目标后验分布呈现复杂的多模态特性。传统的像素级回归在面对多模态分布时,其优化目标在数学上不可避免地塌陷至条件均值或中位数,从而引发严重的过平滑现象,造成高频纹理崩塌与明显的回归伪影。
为了打破多模态条件下的均值塌陷困境,生成式模型逐渐成为前沿探索的热点。然而,现有的两类主要生成方案在实践中均伴随着沉重的代价。条件对抗生成网络(cGAN)通过判别器约束高频真实感,但其极度依赖生成器与判别器之间的对抗动态平衡,训练波动剧烈且超参数敏感,极易引发难以预测的人工伪影。条件扩散模型(如 SR3、Palette)能够精细建模多模态分布,却通常强依赖于扩散专用的噪声调度算法、复杂的时间步嵌入调制模块,以及数十至数百步的耗时迭代去噪过程。若采用潜空间扩散或预训练生成先验模型,则进一步引入了自编码器和沉重的大模型权重,不仅推理延迟高昂,更彻底破坏了经过多年精细调优的专用配对回归架构的归纳偏置与简洁性。
整流流(Rectified Flow)通过构建源分布与目标分布之间的线性插值传输路径并学习常微分方程(ODE)速度场,提供了确定性且高效的生成路径,但现有整流流模型大多服务于非约束的无条件生成或文本生成图像任务,严重依赖显式时间调制的骨干网络,未曾考虑配对 I2I 中固有的像素级强空间对齐先验。本文的切入视角在于:在配对图像翻译任务中,退化输入图像已经为目标结构提供了极强的空间定位约束,中间传输状态无须在非约束的高斯潜空间中盲目探索,而更应当充当一个渐进式的残差细化变量。核心 idea:将传统像素级回归网络重构为整流流连续时间细化器(I2I-RFR),通过输入拼接加噪目标并直接预测干净图像,以时间重加权回归损失严格等价于整流流速度场训练,在保留原生回归接口的同时实现仅需 3 步显式欧拉积分的高质量无蒸馏快速生成。
方法详解¶
整体框架¶
I2I-RFR 的设计宗旨是在最小化结构侵入性的前提下,赋予任意成熟配对图像回归主干网络以连续时间流模型的渐进细化能力。整个系统的核心由训练阶段的重加权回归目标与推理阶段的少步显式 ODE 求解器构成。在训练期间,给定输入条件图像 \(x\) 和真实目标图像 \(y\),算法构建线性插值含噪目标 \(y_t\),将其与 \(x\) 在通道维度拼接并送入仅扩充了首层通道的主干网络 \(f_{\theta'}\) 中,模型直接预测干净目标图像 \(\hat{y}\)。在推理期间,模型从标准高斯噪声出发,利用网络预测值与当前状态解析导出的诱导速度场,沿时间反向执行 3 步确定性显式欧拉积分,逐步收敛至高保真修复结果。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入图像 x 与真实目标 y"] --> D1["噪声目标状态拼接<br/>构建线性插值 y_t 并通道拼接 [x; y_t]"]
D1 --> D2["Beta 分布时间步采样<br/>采样 t ~ Beta(p+1, 1) 抵消 1/t 权重方差"]
D2 --> D3["干净目标预测与诱导速度场<br/>主干输出干净图像并解析诱导 RF 速度"]
D3 --> D4["少步显式欧拉积分<br/>从高斯噪声沿时间反向 3 步求解 ODE"]
D4 --> Out["高保真输出图像 y_hat"]
关键设计¶
1. 噪声目标状态拼接:极简扩展现有回归主干输入 在以往将生成机制引入图像翻译的尝试中,研究人员通常需要重新设计网络以容纳复杂的时间步条件注入机制或交叉注意力模块。I2I-RFR 针对这一痛点,利用退化图像与目标图像在空间结构上的严格对应性,设计了基于通道维度的极简输入扩展。具体而言,定义干净目标端点 \(x_0 = y\),高斯噪声端点 \(x_1 = \varepsilon \sim \mathcal{N}(0, I)\),构建直线传输路径下的噪声目标状态: $\(y_t = (1 - t)y + t\varepsilon, \quad t \in (0, 1]\)$ 网络只需将原输入特征通道从 \(C_{\text{in}}\) 扩展为 \(C_{\text{in}} + C_{\text{out}}\),直接接收拼接张量 \([x; y_t]\) 作为输入。这一设计的巧妙之处在于,输入图像 \(x\) 为场景结构提供了稳固的强空间引导,而拼接的 \(y_t\) 本身直接表征了当前的退化污染程度与高频残差,使得网络无须额外引入任何时间嵌入编码器(Time Embedding MLP),即可自适应地感知当前时间尺度,最大限度地保留了各类经典及新型修复主干的原始架构完整性。
2. Beta 分布时间步采样:平衡加权方差与全噪声覆盖 在训练连续时间流模型时,若直接采用均匀分布 \(t \sim \mathcal{U}(0, 1)\) 采样时间步,由于损失函数中天然存在与 \(t^{-p}\) 相关的缩放因子,当 \(t\) 趋近于 0 时损失权重将急剧发散,导致梯度方差巨大且训练极不稳定。为此,I2I-RFR 引入了基于 Beta 分布的非均匀时间步采样机制: $\(t \sim \text{Beta}(p+1, 1), \quad t \leftarrow \max(t, t_{\min})\)$ 当采用默认的 \(\ell_1\) 损失(即 \(p=1\))时,时间步服从 \(\text{Beta}(2, 1)\) 分布,其概率密度函数正比于 \(t^1\),恰好与损失中的 \(t^{-1}\) 权重项在数学期望上相互对消,使得不同噪声尺度下的有效梯度权重保持近似恒定。实际采样通过逆累积分布函数(Inverse-CDF)高效实现,即从均匀分布采样 \(u \sim \mathcal{U}(0, 1)\) 后令 \(t = u^{1/(p+1)}\),并施加下限截断 \(t_{\min} = 10^{-3}\) 以规避数值奇异性。这一设计不仅消除了优化过程中的梯度剧烈震荡,还天然保证了模型在接近完全噪声区(\(t \approx 1\))获得充分的监督覆盖,极大增强了从纯噪声启动迭代时的初始去噪鲁棒性。
3. 干净目标预测与诱导速度场:规避直接速度预测的退化 标准整流流与流匹配模型普遍采用显式速度场预测(v-prediction)范式,即训练网络直接拟合 \(v^* = x_1 - x_0 = \varepsilon - y\)。然而,图像修复领域的专用主干架构(如具备频域滤波、梯度收敛或伪影抑制特性的网络)是专门针对生成干净、结构连贯的自然图像而构建的。若强行迫使模型拟合包含纯高斯白噪声的目标向量 \(v^*\),会引发严重的参数化失配与模式崩溃。I2I-RFR 坚持让网络保持其原生输出模式,即直接输出干净目标图像预测 \(f_{\theta'}([x; y_t])\),并通过整流流的线性性质解析导出诱导速度场: $\(v_{\theta'}(x, y_t, t) = \frac{y_t - f_{\theta'}([x; y_t])}{t}\)$ 由于直线路径恒等式满足 \(y_t - y = t(\varepsilon - y) = t v^*\),最小化带有 \(t^{-1}\) 加权的像素损失: $\(\mathcal{L}_{\text{RFR}} = \mathbb{E}\left[ \left\| \frac{y - f_{\theta'}([x; y_t])}{t} \right\|_1 \right]\)$ 在严格数学意义上与整流流的目标速度拟合损失 \(\mathbb{E}[\| v^* - v_{\theta'}(x, y_t, t) \|_1]\) 完全等价。这一参数化选择使得模型在深层特征提取中继续发挥滤除退化、恢复干净纹理的归纳偏置,彻底规避了直接速度回归在 LEDNet 等网络上导致的灾难性崩塌。
4. 少步显式欧拉积分:利用强空间先验实现免蒸馏快速细化 传统扩散模型和通用整流流在采样时通常需要数十甚至上百步的迭代,即使经过知识蒸馏也往往需要多阶段微调与繁琐的超参数调优。I2I-RFR 得益于输入条件 \(x\) 所注入的确定性全局结构约束,状态变量 \(y_t\) 仅需承担局部的多模态细节补充与去模糊重构。因此,推理阶段采用一阶显式欧拉积分器即可获得极其优异的图像质量。在推断时,从标准高斯先验 \(y_{t=1} \sim \mathcal{N}(0, I)\) 出发,沿离散时间序列 \(t_n = 1 - \frac{n}{N}\) 执行 \(N=3\) 步显式更新: $\(y_{t_{n+1}} = y_{t_n} - \Delta t \cdot v_n = y_{t_n} + \frac{1}{N} \frac{f_{\theta'}([x; y_{t_n}]) - y_{t_n}}{t_n}\)$ 每一次欧拉推进实质上都在输入条件 \(x\) 的锚定下,将含噪状态向当前网络的单步清晰预测推进一步。仅需 3 步推断,即可抹平单步回归的均值模糊,且参数量完全不增加,兼顾了极高的计算效率与优秀的生成保真度。
损失函数 / 训练策略¶
模型的标准优化目标采用 \(t\)-重加权的 \(\ell_1\) 损失函数。在拓展到任务专用的复合损失(Composite Loss, 标记为 I2I-RFR-CL)时,I2I-RFR 展现了极强的向后兼容性:系统保留特定领域模型原有的感知损失或对抗损失组件,仅将其中的底层像素回归项替换为 \(t^{-1}\) 重加权的加噪目标损失。所有模型在训练时统一采用 Adam 优化器,基础学习率设为 \(10^{-4}\),并配合余弦衰减调度器退火至 \(10^{-6}\)。
实验关键数据¶
主实验¶
为了系统评估 I2I-RFR 在不同任务和架构下的通用有效性,下表综合展示了在图像超分辨率(Urban100,4倍放大)、真实图像去模糊(RealBlur-J 测试集)以及暗光去模糊(LOLBlur 测试集)上的客观评测指标。对比涵盖了主流 CNN 架构、Transformer 架构、通用 U-Net 以及改用 I2I-RFR 重训的扩散主干 Palette。
| 任务 / 评测基准 | 主干模型 | 训练范式 / 变体 | PSNR (dB) ↑ | SSIM ↑ | LPIPS ↓ |
|---|---|---|---|---|---|
| 超分辨率 (Urban100, ×4) | NLSN | 传统 \(\ell_1\) 回归 | 27.22 | 0.8176 | 0.1945 |
| NLSN | + I2I-RFR | 26.83 (-0.39) | 0.8079 (-0.0097) | 0.1996 (+0.0051) | |
| SwinIR | 传统 \(\ell_1\) 回归 | 27.24 | 0.8199 | 0.1948 | |
| SwinIR | + I2I-RFR | 27.19 (-0.05) | 0.8180 (-0.0019) | 0.1897 (-0.0051) | |
| U-Net | 传统 \(\ell_1\) 回归 | 25.97 | 0.7810 | 0.2414 | |
| U-Net | + I2I-RFR | 25.55 (-0.42) | 0.7707 (-0.0103) | 0.2218 (-0.0196) | |
| Palette Backbone | 原版扩散 (DDPM 多步) | 19.58 | 0.5193 | 0.3035 | |
| Palette Backbone | + I2I-RFR (3步) | 26.40 (+6.82) | 0.7973 (+0.2780) | 0.1914 (-0.1121) | |
| 图像去模糊 (RealBlur-J) | NAFNet | 传统回归 | 28.62 | 0.8683 | 0.1557 |
| NAFNet | + I2I-RFR | 28.74 (+0.12) | 0.8737 (+0.0054) | 0.1449 (-0.0108) | |
| Restormer | 传统回归 | 28.73 | 0.8677 | 0.1522 | |
| Restormer | + I2I-RFR | 29.04 (+0.31) | 0.8812 (+0.0135) | 0.1408 (-0.0114) | |
| FFTFormer | 传统回归 | 28.19 | 0.8535 | 0.1691 | |
| FFTFormer | + I2I-RFR | 28.58 (+0.39) | 0.8685 (+0.0150) | 0.1487 (-0.0204) | |
| 暗光去模糊 (LOLBlur) | LEDNet | 传统回归基线 | 26.04 | 0.8450 | 0.1590 |
| LEDNet | + 对抗训练 (GAN) | 24.55 | 0.8110 | 0.1530 | |
| LEDNet | + I2I-RFR | 27.42 (+1.38) | 0.8740 (+0.0290) | 0.1380 (-0.0210) | |
| DarkIR | 官方基线 | 27.31 | 0.8960 | 0.1110 | |
| DarkIR | + I2I-RFR-CL (复合损失) | 27.72 (+0.41) | 0.9000 (+0.0040) | 0.1030 (-0.0080) |
消融实验¶
消融研究深入探索了参数化范式(直接干净目标预测 vs. 显式速度预测 \(v\)-prediction)以及显式时间步嵌入(Time Embedding)对模型收敛与生成质量的决定性影响。下表总结了在高度病态的暗光去模糊(LOLBlur)与老胶片视频修复(DAVIS 测试集)上的关键对比数据:
| 评估任务 / 评测集 | 测试配置与消融项 | PSNR (dB) ↑ | SSIM ↑ | LPIPS ↓ | 核心现象与机理解读 |
|---|---|---|---|---|---|
| 暗光去模糊 (LOLBlur) | LEDNet + I2I-RFR (默认: 直接目标预测) | 27.42 | 0.8740 | 0.1380 | 稳定收敛,成功抑制暗光噪声并重构清晰边缘 |
| LEDNet + I2I-RFR (\(v\)-prediction) | 11.57 (-14.47) | 0.0600 (-0.7850) | 0.8030 (+0.6440) | 发生灾难性参数化失配,网络无法从强噪声向量中提取纹理 | |
| DarkIR + I2I-RFR (默认) | 27.19 | 0.8970 | 0.1060 | 指标保持优秀,感知失真显著降低 | |
| DarkIR + I2I-RFR (\(v\)-prediction) | 16.73 (-10.58) | 0.4310 (-0.4650) | 0.5120 (+0.4010) | 严重退化,高频梯度被强行平铺的白噪声带偏 | |
| DarkIR + I2I-RFR + Time Embedding | 26.80 (-0.51) | 0.8770 (-0.0190) | 0.1270 (+0.0160) | 显式时间嵌入引入特征冗余,微调优化方差增加 | |
| 老胶片视频恢复 (DAVIS) | RTN + I2I-RFR (默认: 直接目标预测) | 25.05 | 0.8330 | 0.2100 | 时空一致性良好,显著压制划痕与闪烁 |
| RTN + I2I-RFR (\(v\)-prediction) | 20.76 (-3.78) | 0.7127 (-0.1167) | 0.3025 (+0.1463) | 帧间高频残差预测崩溃,时序闪烁加剧 | |
| RRTN + I2I-RFR (默认) | 25.87 | 0.8659 | 0.1699 | 相比原始 RRTN (22.66 dB) 大幅提升 3.21 dB | |
| RRTN + I2I-RFR (\(v\)-prediction) | 24.72 (-1.15) | 0.8566 (-0.0093) | 0.1565 | 虽能生成,但在失真指标上全面落后于直接目标预测 |
关键发现¶
- 直接目标预测是配对图像翻译的核心支柱:消融数据强有力地证明,\(v\)-prediction 在 LEDNet 与 DarkIR 上导致了崩盘式衰退(PSNR 分别狂跌 14.47 dB 与 10.58 dB)。这是因为底层去噪与复原网络内部充斥着残差连接与特征滤波机制,天生适配“从有损输入恢复纯净图像”这一映射,而要求其直接回归充满随机噪声的速度矢量违背了主干的归纳偏置。
- 时间嵌入并非不可或缺:在 DarkIR 上额外注入时间步正弦嵌入后,PSNR 反而下降了 0.51 dB,LPIPS 恶化 0.016。这表明拼接在输入端的 \([x; y_t]\) 已经提供了充分的噪声能级信息,冗余的时间嵌入不仅增加了模型参数与工程复杂度,还带来了优化干扰。
- 感知与失真的经典权衡(Perception-Distortion Trade-off):在对像素严格对齐的单图像超分辨率任务中,由于多模态假设允许合理的纹理幻觉,I2I-RFR 在明显改善 LPIPS 感知质量的同时,PSNR/SSIM 往往维持平盘或微幅下调;但在强病态的去模糊和暗光恢复任务中,I2I-RFR 实现了感知指标与客观保真度(PSNR/SSIM)的双重显著飞跃。
亮点与洞察¶
- 即插即用的数学重构框架:论文最精巧之处在于通过构造解析诱导速度场,在数学上证明了“带权重的时间重加权图像回归”等价于“整流流速度场训练”,实现了判别式回归与生成式 ODE 传输的优雅统一。
- 免蒸馏的高效推理:利用输入图像提供的强空间锚定,将扩散模型通常需要的数十步采样压缩至仅需 3 步显式欧拉积分,使得 Restormer 和 SwinIR 能够在亚秒级至秒级延迟内完成高质量图像细化,避免了复杂的蒸馏管线。
- 广泛的架构与任务泛化力:无需重新调参,仅通过扩展输入通道,即可全盘赋能 CNN、Transformer、纯 U-Net 以及视频递归网络,为存量视觉修复资产注入了强大的生成式升维潜力。
局限与展望¶
- 极端几何变形与无对齐翻译受限:当前框架高度依赖输入条件图像 \(x\) 与目标 \(y\) 在像素级或低频空间上的强对齐先验,在语义跨度极大(如非配对风格迁移或剧烈视点变换)的场景下,仅靠通道拼接与 3 步欧拉积分难以充分对齐几何分布。
- 单步超分任务中的保真度下降:在具有确定性单射特性的轻度退化超分任务中,多模态探索机制可能会引入细微的高频微观偏移,导致严格依靠像素对齐的 PSNR 出现轻微折损。
- 未来探索方向:探索与半对齐任务的自适应条件融合机制,以及将该重构思路推广至三维高斯重建或基于物理的非真实感渲染任务中。
相关工作与启发¶
- vs. DDPM / Palette (条件扩散模型):Palette 需要维护复杂的正向加噪方差排期,并要求在推理端执行数十步反向去噪,耗时巨大。本文证明在配对 I2I 中引入整流流重构,仅需 3 步欧拉推断即可在 Palette 主干上取得大幅超越原版 DDPM 训练范式的画质(LOLBlur 任务上 PSNR 从 8.03 dB 跃升至 26.88 dB)。
- vs. cGAN / SRGAN (条件对抗网络):GAN 训练需小心翼翼地平衡生成器与判别器的梯度对抗,超参敏感且容易引发假性伪影。I2I-RFR 完全摒弃了判别器,以单主干监督回归训练即可达到甚至超越对抗训练的清晰度与感知细节(在 LEDNet 上超越 LEDNet+Adv. 达 2.87 dB PSNR 与 0.015 LPIPS)。
- vs. 大规模预训练先验模型 (DiffBIR / SeeSR / FlowIE):虽然基于 Stable Diffusion 2.1 等百亿参数大模型的先验方案在绝对 LPIPS 上具备极强幻觉生成能力,但其参数量达 1600M~2500M 且单图推断动辄耗时 6~8 秒。SwinIR + I2I-RFR 仅凭 12M 极轻量参数与 0.14 秒即可实现兼具高保真度的出色恢复,更具边缘落地实用价值。
评分¶
- 新颖性: 4.5/5.0(构思巧妙地将配对图像回归与整流流通过诱导速度场建立了等价性桥梁,推导扎实)
- 实验充分度: 4.8/5.0(涵盖超分辨率、去模糊、暗光、水下、视频恢复 5 大任务,跨越 8 种以上主干,消融深入)
- 写作质量: 4.7/5.0(逻辑严密通透,数学论证与工程实操高度统一,图表清晰)
- 价值: 4.8/5.0(工程落地友好度极高,为存量庞大的图像修复网络提供了零蒸馏成本的生成式升级范式)