跳转至

RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing

会议: ECCV 2026
论文: ECCV 官方页面
代码: https://github.com/vincentweikey/RTE-FM-Dehazer
领域: 图像恢复 / 图像生成
关键词: 图像去雾 / 流匹配 / 辐射传输方程 / 物理正则化 / VLM数据合成

一句话总结

针对真实非均匀雾景中大气散射模型假设失效与生成式去雾的色彩漂移问题,提出将辐射传输方程(RTE)的扩散-吸收动力学作为可微切空间正则项嵌入流匹配连续速度场,并结合 VLM 几何对齐合成数据集 P-HAZE,实现无伪影的高保真真实场景图像去雾。

研究背景与动机

单幅图像去雾长期依赖经典大气散射模型(Atmospheric Scattering Model, ASM)作为物理先验反演清晰辐射强度。然而,ASM 建立在单一散射和均匀介质的严苛假设之上,而在真实的自然场景或工业烟雾环境中,悬浮颗粒往往呈现强烈的非各向同性多重散射与深度非均匀分布。传统手工先验(如暗通道先验 DCP、色线先验等)以及在均匀合成数据上拟合的 CNN/Transformer 模型(如 FFA-Net、DEA-Net),在面对复杂真实非均匀浓雾时普遍发生先验退化,导致显著的残留雾障、过曝与严重色偏。

为了突破监督学习对理想合成数据的依赖,近期基于扩散模型(如 DehazeDiff)和离散码本生成先验(如 RIDCP、IPC-Dehaze)的生成式去雾方法相继被提出。尽管此类方法在视觉逼真度上有所提升,但其本质是缺乏物理过程约束的无序反演:扩散模型固有的随机采样机制往往导致局部颜色向相邻色彩空间漂移,而 VQ-GAN 码本检索则易在边界区域引入视场外的拼接伪影。加之真实世界中高精度配对的清晰-有雾图像难以大规模采集,现有去雾算法陷入了“物理先验过于简化导致外推失败”与“纯生成式先验缺乏约束引发色彩失真”的双重困境。

本文的切入视角是寻找一种既能包容多重散射非均匀物理规律、又能无缝融入现代连续时间生成动力学的物理机制。辐射传输方程(RTE)完整涵盖了吸收与多重散射现象,其扩散-吸收逼近形式恰好与连续常微分方程(ODE)的瞬时速率具有相同的数学结构。核心 idea:将简化的辐射传输方程(RTE)扩散-吸收动力学转化为切空间物理投影正则化项约束流匹配(Flow Matching)的确定性速度场,并设计 VLM 提示词驱动结合稠密几何单应性对齐的数据管线 P-HAZE,实现物理自洽与高保真真实去雾。

方法详解

整体框架

RTE-FM-Dehazer 将单幅图像去雾重新公式化为 Stable Diffusion 潜在流形上的连续流匹配过程。如图所示,宏观上系统利用预训练冻结的 VAE 编码器将有雾输入 \(x_{\text{hazy}}\) 映射至紧凑的潜在表示 \(z_0 \in \mathbb{R}^{4\times 64\times 64}\),目标为通过确定性常微分方程将其沿最优传输轨迹运送至清晰图像潜码 \(z_1\);微观上,在连续演化时间 \(t \in [0, 1]\) 的每个微小步长中,U-Net 预测的神经速度场同时接受目标直线位移向量与基于辐射传输方程导出的局部扩散-吸收速度场的联合约束。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入有雾图像 x_hazy 与清晰图像 x_clean"] --> B["VLM驱动合成与几何单应性对齐管线<br/>构建50k配对数据集 P-HAZE"]
    B --> C["冻结 VAE 编码至潜在空间<br/>得到初始有雾潜码 z_0 与清晰目标 z_1"]
    C --> D["线性时间插值 z_t 与多尺度特征提取"]
    D --> E["辐射传输方程扩散-吸收物理正则化<br/>五点差分拉普拉斯核与自适应吸收估计"]
    D --> F["U-Net 神经速度场预测 v_θ"]
    E & F --> G["联合速度场约束与 L2 投影损失<br/>L_FM 最优传输拟合 + λ L_RTE 物理一致性"]
    G --> H["推理期确定性多步欧拉积分求解<br/>dz/dt = v_θ(z,t) 积分至清晰潜码 z_1"]
    H --> I["VAE 解码输出高保真去雾图像"]

关键设计

1. 辐射传输方程诱导的扩散-吸收物理正则化:以连续介质能量耗散约束速度场切空间 传统 ASM 忽略多重散射,而完整 RTE 形式复杂难以直接反演。本文从辐射传输方程的扩散近似出发: $$ \frac{\partial u}{\partial t} = D \nabla^2 u - \mu_a u $$ 其中空间扩散项 \(D \nabla^2 u\) 描述辐射能量在非均匀介质中的各向同性重新分配,在去雾反演过程中对应消除尖锐伪影、平滑边缘不连续过渡;吸收衰减项 \(-\mu_a u\) 则模拟介质对光子的指数吸收衰减,驱动能量态朝向清晰无雾流形单调衰减。作者将潜在特征图 \(z \in \mathbb{R}^{4\times 64\times 64}\) 视为辐射能量场的抽象代理,将该方程在离散网格上通过五点差分算子结合卷积核 \(K_{\nabla^2}\) 进行快速评估。扩散系数 \(D\) 由轻量 \(1\times 1\) 卷积与 Softplus 激活自适应预测,吸收系数则由无解码代理 \(\mu_a = \kappa \langle |z_t| \rangle\)\(\kappa=0.1\))实时确定。物理速度场定义为: $$ v_{\text{RTE}}(z) = -D \nabla^2 z + \mu_a z $$ 符号翻转使密度衰减方向与去雾净化方向精准对齐。

2. 确定性潜在空间流匹配与 L2 投影速度场:摆脱随机采样噪声与色彩偏移 扩散去雾模型因其多步高斯反向去噪过程的不确定性,极易使恢复图像的全局色调产生跳变。RTE-FM-Dehazer 采用确定性流匹配范式,定义直线速度场插值 \(z_t = (1-t)z_0 + t z_1\)。为同时满足数据分布迁移与物理演化规律,将总体训练目标构建为: $$ \mathcal{L} = \underbrace{|v_\theta(z_t, t) - (z_1 - z_0)|^2}{\text{最优传输直线拟合}} + \lambda \underbrace{|v\theta(z_t, t) - v_{\text{RTE}}(z_t)|^2_{\text{F}}}_{\text{RTE 物理动力学一致性}} $$ 该联合损失在数学上相当于执行了一个切空间 \(L_2\) 正交投影,迫使速度场 \(v_\theta\) 沿满足辐射平衡的最优方向推进。在推理阶段,模型直接使用显式欧拉积分器求解常微分方程 \(\frac{\mathrm{d}z}{\mathrm{d}t} = v_\theta(z, t)\),推荐使用 \(T > 10\) 步逐步平滑演化。由于速度场为全分辨率逐像素预测,不同浓度的雾区和局部边缘在时间推进中拥有自适应的速度与方向,既彻底根除了随机采样的色彩扰动,又保留了预训练生成流形丰富的高频细节。

3. VLM 驱动与稠密几何对齐的数据合成管线:打破真实世界配对样本匮乏瓶颈 真实世界配对去雾数据采集极其受限,而传统物理渲染的合成雾图缺乏真实大气扰动的多尺度随机性。本文提出由先进视觉语言模型(Qwen2.5-VL 与 Gemini-2-Flash)驱动的合成管线。首先通过细致的对抗性文本提示词指导模型在输入真实清晰图上注入符合底层几何但形状复杂的滚滚浓烟与非平稳薄雾,从而涵盖深度衰减与复杂光照;其次,针对 VLM 在生成图像时伴随的相机内参微变与坐标几何漂移,采用稠密特征匹配算法提取 800 至 1500 个匹配内点,解算平面单应性矩阵 \(H \in \mathbb{R}^{3\times 3}\),通过双线性重采样执行亚像素级几何对齐: $$ I_{\text{aligned}}(x) = I_{\text{hazy}}(H^{-1}x) $$ 最后利用 SAM2 分割掩码一致性检验结合人工筛查过滤幻觉目标,构建包含 50,000 对高质量、多天气、多样化场景样本的 P-HAZE 数据集。

损失函数 / 训练策略

模型以预训练 Stable Diffusion 2.1 的 VAE 结构为特征桥梁,U-Net 包含四层下采样与上采样残差块,最低分辨率处嵌入空间自注意力机制。损失权重标称设定为 \(\lambda = 0.5\)(在 \([0.3, 0.7]\) 宽工作区间内均保持稳健)。优化器选用 Adam,基础学习率 \(1\times 10^{-4}\),每 50 个 epoch 衰减一半,在单张 RTX 4090 上对 50,000 对 \(512\times 512\) 数据训练 200 个 epoch,总计耗时约 20 小时。

实验关键数据

主实验

模型仅在纯合成的 P-HAZE 数据集上训练,在涵盖真实室内烟雾(I-HAZE)、郊区密集乙二醇雾(D-HAZE)、真实非均匀浓雾(NH-HAZE)、户外火灾浓烟(SMOKE)、P-HAZE 测试集以及经典合成基准(RESIDE-6K)六个不同成因的评测集上进行了全面测试。定量评估采用 PSNR、SSIM 和感知相似度 LPIPS。

原论文 Table 1 主实验定量对比:

数据集 指标 本文 (RTE-FM) 之前最优 SOTA (次优方法) 提升 / 优势
NH-HAZE (真实非均匀) PSNR ↑
SSIM ↑
LPIPS ↓
19.53
0.600
0.233
15.60 (LHTD)
0.644 (IPC-Dehaze)
0.371 (LHTD)
+3.93 dB
-0.044
降低 37.2%
SMOKE (真实火灾浓烟) PSNR ↑
SSIM ↑
LPIPS ↓
18.67
0.554
0.222
15.67 (LHTD)
0.588 (IPC-Dehaze)
0.336 (IPC-Dehaze)
+3.00 dB
-0.034
降低 33.9%
I-HAZE (真实室内雾室) PSNR ↑
SSIM ↑
LPIPS ↓
18.81
0.812
0.145
16.96 (DEANet)
0.817 (RIDCP)
0.179 (RIDCP)
+1.85 dB
-0.005
降低 19.0%
D-HAZE (密集低能见度) PSNR ↑
SSIM ↑
LPIPS ↓
12.56
0.480
0.528
12.84 (LHTD)
0.474 (RIDCP)
0.580 (LHTD)
-0.28 dB
+0.006
降低 9.0%
P-HAZE (多样化复杂雾) PSNR ↑
SSIM ↑
LPIPS ↓
20.29
0.792
0.159
18.05 (DEANet)
0.786 (DEANet)
0.233 (IPC-Dehaze)
+2.24 dB
+0.006
降低 31.8%
RESIDE-6K (合成基准) PSNR ↑
SSIM ↑
LPIPS ↓
21.77
0.858
0.068
31.78 (DEANet)
0.981 (DehazeFormer)
0.012 (DEANet)
-10.01 dB (过拟合合成)
-0.123
+0.056

消融实验

为验证 RTE 各物理组成部分与对比先验的有效性,在相同训练配置下对正则化项进行了消融分析。

原论文 Table 2 物理正则化组件消融对比:

配置 P-HAZE (PSNR/SSIM/LPIPS) NH-HAZE (PSNR/SSIM/LPIPS) SMOKE (PSNR/SSIM/LPIPS) 说明与机理分析
完整模型 (RTE-FM) 20.29 / 0.792 / 0.159 19.53 / 0.600 / 0.233 18.67 / 0.554 / 0.222 联合空间扩散与能量吸收的完整切空间投影
仅吸收项 (Absorb-only FM) 18.11 / 0.636 / 0.378 12.77 / 0.459 / 0.441 11.88 / 0.400 / 0.399 缺失空间平滑导致非均匀斑块伪影,NH-HAZE 跌 6.76 dB
仅扩散项 (Diffusion-only FM) 18.91 / 0.552 / 0.356 13.85 / 0.505 / 0.480 12.21 / 0.421 / 0.411 缺乏能量衰减项驱动,致使残留雾障极其严重
暗通道先验正则化 (DCP-FM) 17.22 / 0.621 / 0.344 12.22 / 0.523 / 0.547 11.19 / 0.398 / 0.412 手工启发式硬约束与连续流匹配产生冲突,性能甚至不及裸模型
矫正流基线 (Rectified FM) 19.21 / 0.768 / 0.254 12.99 / 0.494 / 0.491 13.40 / 0.463 / 0.372 纯几何直线拟合,缺乏物理先验在真实浓雾中泛化受阻
无正则化流匹配 (Vanilla FM) 20.12 / 0.785 / 0.159 13.78 / 0.507 / 0.406 13.77 / 0.488 / 0.351 真实域外推剧烈掉点,NH-HAZE 相比本文落后 5.75 dB

关键发现

  • 物理先验决定泛化天花板:在纯合成均质数据集 RESIDE-6K 上得分极高的监督模型(如 DEANet 达到 31.78 dB),迁移至真实复杂有雾场景(NH-HAZE 仅 12.38 dB)时性能暴跌超过 19 dB;而仅在 P-HAZE 训练的 RTE-FM-Dehazer 在 NH-HAZE 上达到 19.53 dB,展现出压倒性的跨域泛化鲁棒性。
  • 扩散与吸收缺一不可:消融实验证明,单独保留吸收项或扩散项都会导致性能发生灾难性滑坡。缺少扩散项会导致空间梯度撕裂与斑驳色块;缺少吸收项则无法提供朝向清晰流形的演化驱动力,使去雾不彻底。
  • 经典手工先验与流模型不相容:将暗通道先验(DCP)梯度强行施加于流匹配时(DCP-FM),NH-HAZE 上 PSNR 跌至 12.22 dB,显著劣于完全无约束的 Vanilla FM(13.78 dB),证明基于一阶低维统计假设的硬性惩罚会破坏流匹配连续向量场的传输成本平衡。

亮点与洞察

  • 物理偏微分方程与连续生成模型的有机耦合:打破传统物理先验直接反演显式参数(透射率、大气光)的旧思路,将偏微分方程(RTE)的瞬态变化率作为速度场切空间的约束项,在保持生成模型强大表达力的同时注入了严谨的物理自洽性。
  • 确定性流动规避生成式幻觉:相比扩散去雾模型的随机朗之万反向采样,流匹配的单向确定性轨迹彻底消除了随机漂移引入的伪影和颜色失真,能够精确保留输入画面的原始光影结构。
  • 可复用的真实雾景合成 SOP:提出了利用大视觉语言模型(Qwen2.5-VL/Gemini)生成非平稳烟雾 + 亚像素单应性几何对齐(Homography Warping)+ SAM2 语义质检的工业级数据闭环,摆脱了对昂贵硬件深度传感器的依赖,可直接迁移至雨雪、低照度等复杂恶劣天气的图像恢复任务中。

局限与展望

  • 潜在空间下采样带来的高频损失:当前框架依赖 Stable Diffusion 的 8 倍下采样 VAE,在应对极度浓厚的遮蔽雾景或微小文字细节时,潜在空间的压缩表征可能会丢失微弱的边缘结构,未来向全分辨率像素级流匹配演进是重要方向。
  • 固定单应性假设的场景几何限制:数据对齐阶段采用平面单应矩阵 \(H \in \mathbb{R}^{3\times 3}\) 补偿相机内参及轻微抖动,当场景包含极端大视差或剧烈前景遮挡时,平面变换可能引入微小的局部不对齐。
  • 推理步长与算力开销权衡:尽管比数十步的扩散去噪采样快,但为获取最优视觉质量模型仍需 10 步以上的欧拉积分数值求解,未来需探索一致性蒸馏(Consistency Distillation)或高阶自适应 ODE 求解器以实现单步实时推理。

相关工作与启发

  • vs DCP 与经典物理先验:DCP、色线等基于静态低维经验假设,在天空亮区或多重散射雾霾中频频失效;RTE-FM-Dehazer 利用偏微分方程建模复杂的能量扩散吸收,具备连续可微的局部自适应性。
  • vs DehazeDiff 等扩散去雾模型:DehazeDiff 依赖高斯随机去噪反向链,对采样步长和方差调度高度敏感且极易出现颜色漂移;本文采用确定性常微分流动,速度场受到 RTE 物理梯度牵引,色彩还原精准度显著占优。
  • vs RIDCP / IPC-Dehaze 等 VQGAN 码本去雾:码本检索机制在面对域外真实复杂场景时容易引入拼接伪影或局部过曝;本文在连续潜空间中平滑输运,消除了离散码本匹配带来的空间结构撕裂。

评分

  • 新颖性: ⭐⭐⭐⭐⭐(首次将辐射传输方程扩散-吸收近似与流匹配连续切空间速度场深度结合,切入点极具洞察力)
  • 实验充分度: ⭐⭐⭐⭐⭐(覆盖 6 个横跨合成、室内、野外浓雾、火灾烟雾的多样化基准,主实验及多项物理消融数据详实严谨)
  • 写作质量: ⭐⭐⭐⭐⭐(数学推导严整自洽,框架设计与图表逻辑高度统一,叙述清晰流畅)
  • 价值: ⭐⭐⭐⭐⭐(有效打通了物理模型与现代生成流匹配之间的壁垒,为解决底层视觉任务中的真实域泛化难题提供了范式参考)