跳转至

HNDiff: Haze-Noise Diffusion for Image Dehazing

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://jin-ting-he.github.io/HNDiff/
领域: 图像恢复
关键词: 图像去雾 / 扩散模型 / 大气散射模型 / 潜在先验 / 特征门控

一句话总结

针对传统去雾回归模型在重雾下细节丢失严重、而常规高斯扩散模型缺乏物理归纳偏置导致内容失真的问题,HNDiff 创新性地将大气散射模型嵌入扩散过程,通过雾度自适应前向加噪与双估计器联合去雾去噪,并在潜在空间即插即用增强现有去雾骨干网络。

研究背景与动机

单幅图像去雾是计算机视觉中极具挑战性的经典病态逆问题。由于大气气溶胶对光线的散射与吸收,拍摄画面往往伴随显著的对比度衰减、色彩偏移以及微小结构遮蔽,直接恶化下游的目标检测、语义分割与自动驾驶感知精度。近年来,基于卷积神经网络(如 MSBDN、FocalNet)、视觉 Transformer(如 Dehamer、ConvIR)以及状态空间模型 Mamba 的去雾架构相继被提出,凭借强大的表征能力推动了去雾指标的持续刷新。然而,绝大多数主流方案本质上依赖确定性的端到端像素回归映射,一旦遭遇浓雾侵蚀或长景深极端退化区域,输入画面中的高频纹理信息几乎完全被淹没,回归模型由于无法凭空产生消失的语义细节,极易输出模糊平滑、残雾顽固的复原结果。

与此同时,生成式扩散模型凭借强大的图像先验和逼真的纹理合成能力,在底层视觉恢复中展现出巨大潜力。但将常规扩散模型(如 DDPM)直接移植到去雾任务中却面临根本性的物理失配矛盾。常规扩散过程从纯高斯白噪声出发进行迭代逆向采样,完全忽略了雾霾生成的真实物理机制。真实场景中的雾霾遵循大气散射模型(Atmospheric Scattering Model, ASM),其退化强度严格受局部场景景深与大气衰减系数的调制,呈现出高度结构化与非均匀的空间渐变特性。脱离物理先验的随机扩散不仅难以收敛到保真度高的真实场景,而且极易由于随机采样产生结构幻觉与颜色畸变;此外,全图统一的高斯噪声加注也无法兼顾不同浓度雾霾区域对“生成填充”与“确定性保留”截然相反的需求。

为了打破这种两难困境,本文从物理退化机理切入,重新审视了扩散前向过程与反向采样的本质联系。核心 idea:将大气散射模型作为物理归纳偏置显式嵌入扩散过程,提出前向雾-噪联合退化与反向双分支去雾去噪机制,并通过雾度感知噪声调度自适应分配生成容量,最终在潜在空间以即插即用先验形式大幅增强现有去雾骨干网络。

方法详解

整体框架

HNDiff 的整体架构由三个紧密耦合的核心部分组成:前向雾-噪扩散过程、反向去雾-去噪过程,以及即插即用的潜在空间增强架构 Latent HNDiff。在输入端,模型利用轻量级图像编码器提取输入有雾图像的潜在特征;随后,前向过程将传统扩散的高斯纯噪声退化替换为符合大气散射物理规律的“加雾-加噪”复合轨迹,并由雾度感知噪声调度器(HANS)根据局部雾浓度动态调整噪声方差;在反向过程中,模型基于严格的物理推导,利用两个解耦的神经网络分别估计大气残余雾分量与加性噪声分量,逐步逆转退化过程以重构纯净潜在先验;最后,生成的纯净先验通过特征门控模块(FGM)跨尺度注入到任意主流去雾骨干网络中,实现保真度与生成细节的高效兼顾。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入有雾图像 IH 与图像编码器 IE"] --> B["雾-噪联合前向扩散<br/>ASM 物理驱动均值偏移"]
    B --> C["雾度感知噪声调度器 (HANS)<br/>空间雾度自适应调控噪声强度"]
    C --> D["物理一致去雾-去噪反向过程<br/>双估计器解耦预测雾残差与噪声"]
    D --> E["潜在先验生成与特征门控融合 (FGM)<br/>仿射调制即插即用注入去雾骨干"]
    E --> F["输出高保真清晰去雾图像 Idehz"]

关键设计

1. 雾-噪联合前向扩散:将物理散射机制嵌入扩散均值偏移

传统扩散模型的前向过程仅向图像添加各向同性的零均值高斯噪声,导致末端状态沦为无意义的高斯分布,破坏了自然雾霾图像的内在结构。HNDiff 依据大气散射模型 \(I_H(x) = I_0(x)\tau(x) + A(1-\tau(x))\)(其中 \(\tau(x)=e^{-\sigma(x)d(x)}\) 为透射率,\(A\) 为全局大气光,\(\sigma\)\(d\) 分别代表散射系数与场景景深),将单步扩散转移重新建模为物理加雾与高斯扰动的联合演进。在时间步 \(t\) 下,前向转移方程定义为:

\[I_t(x) = I_{t-1}(x)e^{-\alpha_t \sigma(x)d(x)} + A\left(1 - e^{-\alpha_t \sigma(x)d(x)}\right) + \beta_t(x)\epsilon_t(x)\]

其中 \(\alpha_t = 1/T\) 为时间尺度步长,\(\epsilon_t \sim \mathcal{N}(0, I)\)。该式表明,每次退化并非随意破坏像素,而是将场景辐射沿散射路径衰减并混入全局大气光,使高斯分布的均值严格按照 ASM 的物理规律向浓雾状态漂移。通过重参数化推导,整个 \(T\) 步扩散可在任意步长下直接封闭采样,使得终端加噪状态 \(I_T(x) = I_H(x) + \bar{\beta}_T(x)\epsilon(x)\) 既承载了真实的自然有雾分布,又保留了扩散采样所需的随机扰动包络。

2. 雾度感知噪声调度器 (HANS):按空间雾密度自适应分配生成容量

在非均匀真实雾霾中,近处景物雾气稀薄但细节丰富,远处背景深陷浓雾导致高频纹理完全丧失。若对整图施加全局恒定的加噪调度,将导致轻雾区被过度扰动破坏保真度,而重雾区噪声不足无法激发生成先验的重构潜力。为此,HNDiff 设计了雾度感知噪声调度器(Haze-Aware Noise Scheduler, HANS),将空间像素级的噪声缩放系数与局域散射衰减直接绑定:

\[\beta_t(x) = 1 - e^{-\alpha_t \sigma(x)d(x)}\]

在重雾区域,\(\sigma(x)d(x)\) 极大,透射率急剧衰减,\(\beta_t(x)\) 趋近于较大值,向特征注入更高强度的扰动,从而赋予扩散反向过程足够的生成自由度来“脑补”遗失的物体轮廓与纹理细节;相反,在轻雾或无雾区域,\(\beta_t(x)\) 迅速收缩至接近 0,网络主要依赖确定性回归路径保持原有像素的结构保真度。累积 \(T\) 步后,整体噪声尺度因子 \(\bar{\beta}_T(x) = \sqrt{\frac{(1-e^{-\frac{1}{T}\sigma(x)d(x)})(1-e^{-2\sigma(x)d(x)})}{1+e^{-\frac{1}{T}\sigma(x)d(x)}}}\) 同样保持了这一空间自适应特性。

3. 物理一致的去雾-去噪反向过程:双分支解耦估计雾残差与大气噪声

在逆向去雾阶段,模型必须同时剥离混叠在一起的加性噪声与散射雾气。受确定性隐式采样 DDIM 的启发,作者通过变分下界与反向条件分布推导,证明了单步逆向采样可表示为从当前状态 \(I_t(x)\) 减去加性大气噪声项后再进行透射率补偿:

\[I_{t-1}(x) = \left( I_t(x) - N_t(x)\left(1 - e^{-\alpha_t \sigma(x)d(x)}\right) \right) e^{\alpha_t \sigma(x)d(x)}\]

其中复合项 \(N_t(x) = A + \epsilon_t(x)\) 统摄了全局环境光与高斯噪声。为了在无需真值透射率与光照先验的情况下求解该逆问题,HNDiff 引入了两个轻量化 U-Net 估计器进行协同预测:噪声估计器 \(N_t^\theta(I_t, I_H, t)\) 负责逼近复合大气噪声 \(N_t\),而雾度估计器 \(1 - e^{-\alpha_t o_\theta(I_t, I_H, t)}\) 专门预测残余透射差值项,其中 \(o_\theta\) 显式估计局域散射景深乘积 \(\sigma d\)。两路估计器解耦了物理散射成分与随机噪声成分,确保了反向逆推轨迹与前向退化在物理几何意义上的精确对称。

4. 潜在先验生成与特征门控融合:兼顾保真度与轻量即插即用

若直接在原生像素空间运行多步扩散,巨大的显存与推理延迟将使其难以落地,且像素级随机采样容易导致局部结构不稳定。为此,Latent HNDiff 将上述物理扩散体系迁移到压缩潜在空间中,由图像编码器提取紧凑特征表示。在完成 \(T\) 步反向去雾去噪重构出清晰潜在先验 \(Z_0\) 后,设计了特征门控模块(Feature Gating Module, FGM)将其无缝注入主流去雾主干。FGM 首先通过像素去混洗与全局平均池化压缩空间维度,再经多层感知机(MLP)映射为仿射变换标量对 \((z^{\alpha_i}, z^{\beta_i})\)

\[F_i^{out} = F_i^{in} \times z^{\alpha_i} + z^{\beta_i}\]

该门控操作动态调制主干网络各尺度的特征图,使去雾骨干在进行确定性恢复的同时,深度吸收来自扩散过程的丰富几何轮廓与纹理先验,且仅引入极小的额外计算负担。

损失函数 / 训练策略

Latent HNDiff 采用分阶段解耦后联合微调的稳定训练范式: 1. 骨干与先验预训练:固定真值潜在先验 \(Z_{gt} = \text{IE}(\text{Concat}(I_H, I_0))\),在输入有雾-清晰图像对的监督下,初步训练图像编码器 IE、特征门控模块 FGM 以及去雾骨干网络; 2. 扩散先验训练:冻结预训练特征提取器,利用前向过程生成退化潜在特征 \(Z_T\),在潜在空间训练雾-噪双估计器进行逆向去雾去噪,通过纯净潜在先验与真值之间的 L1 损失 \(\mathcal{L}_{prior} = \|Z_0 - Z_{gt}\|_1\) 优化扩散参数; 3. 端到端联合微调:将恢复出的纯净先验 \(Z_0\) 经 FGM 送入去雾骨干,联合微调所有模块,最终输出去雾图像 \(I_{dehz}\) 并由骨干原生的重建损失(如 L1 + 感知损失)端到端优化。在实际部署中,扩散步数仅需设为 \(T = 4\) 即可达到优异的先验引导效果。

实验关键数据

主实验

论文在两个合成基准(SOTS-Indoor、SOTS-Outdoor)和四个权威真实场景数据集(NH-HAZE、O-HAZE、Dense-HAZE、RW2AH)上,对 FocalNet、ConvIR、SGDN 等主流骨干进行了全方位强化评测。指标对比真实记录如下:

数据集 指标 FocalNet 基线 + HNDiff (本文) ConvIR 基线 + HNDiff (本文) SGDN 基线 + HNDiff (本文) 平均增益
NH-HAZE (真实非均匀) PSNR (dB)
SSIM
20.36
0.696
20.89 (+0.53)
0.697 (+0.001)
20.65
0.692
21.23 (+0.58)
0.701 (+0.009)
20.13
0.680
20.64 (+0.51)
0.686 (+0.006)
+0.54
+0.005
O-HAZE (真实室外) PSNR (dB)
SSIM
25.46
0.791
26.32 (+0.86)
0.801 (+0.010)
25.25
0.784
26.20 (+0.95)
0.799 (+0.015)
24.59
0.778
25.40 (+0.81)
0.782 (+0.004)
+0.87
+0.010
Dense-HAZE (真实浓雾) PSNR (dB)
SSIM
16.95
0.597
17.29 (+0.34)
0.599 (+0.002)
16.86
0.600
17.18 (+0.32)
0.623 (+0.023)
16.60
0.571
17.17 (+0.57)
0.611 (+0.040)
+0.41
+0.022
RW2AH (真实世界复杂) PSNR (dB)
SSIM
21.93
0.635
22.29 (+0.36)
0.647 (+0.012)
21.99
0.640
22.25 (+0.26)
0.646 (+0.006)
22.24
0.631
22.81 (+0.57)
0.653 (+0.022)
+0.40
+0.013
SOTS-Indoor (合成室内) PSNR (dB)
SSIM
40.82
0.992
41.19 (+0.37)
0.994 (+0.002)
41.53
0.994
42.10 (+0.57)
0.995 (+0.001)
41.01
0.992
41.47 (+0.46)
0.995 (+0.003)
+0.47
+0.002
SOTS-Outdoor (合成室外) PSNR (dB)
SSIM
37.71
0.995
38.10 (+0.39)
0.996 (+0.001)
37.95
0.994
38.83 (+0.88)
0.995 (+0.001)
36.22
0.986
37.10 (+0.88)
0.991 (+0.005)
+0.72
+0.002

此外,在无参考真实雾霾数据集 RTTS 上对 RIDCP 骨干进行评测: - 未处理有雾原图:FADE 2.484,NIMA 4.33,BRISQUE 37.01 - RIDCP 基线:FADE 0.944,NIMA 4.43,BRISQUE 18.78 - RIDCP + HNDiff:FADE 0.417(显著降低),NIMA 5.08(显著提升),BRISQUE 16.09(显著优化),展现出极强的真实场景视觉感知恢复能力。

消融实验

以 FocalNet 为骨干,在挑战性极大的 NH-HAZE 数据集上评估核心组件的消融效果(表 3 与表 4):

配置代号 噪声扩散 (Noise) 雾扩散 (Haze) 雾度调度 (HANS) PSNR (dB) SSIM 机制说明
Net1 (基线) 20.36 0.696 FocalNet 原生单阶段回归
Net2 20.46 0.695 仅添加常规 DDPM 高斯纯噪声扩散
Net3 20.61 0.696 仅按物理 ASM 加雾扩散,无随机噪声注入
Net4 20.68 0.696 联合雾-噪扩散,但使用统一非自适应噪声尺度
Net5 (HNDiff) 20.89 0.697 完整物理雾-噪扩散 + 雾度自适应调度 HANS

不同先验生成器在同等条件下的横向对比(表 4): - Net1 (无先验): 20.36 dB / 0.696 - Net2 (普通 U-Net 直出先验): 20.41 dB / 0.696 - Net3 (DDPM 纯高斯先验): 20.46 dB / 0.695 - Net4 (RDDM 残差扩散先验): 20.43 dB / 0.690 - Net5 (HNDiff 物理扩散先验): 20.89 dB / 0.697(显著超越普通扩散与残差扩散机制)

参数等量扩展对比(表 7): - FocalNet 基线: 3.74M 参数,30.53G FLOPs,PSNR 20.36 dB - FocalNet+ (拓宽通道 32→48): 8.40M 参数,68.54G FLOPs,PSNR 20.37 dB(仅 +0.01 dB) - FocalNet* (堆叠残差块 4→10): 8.28M 参数,64.05G FLOPs,PSNR 20.51 dB(仅 +0.15 dB) - FocalNet + HNDiff (本文): 7.82M 参数,36.38G FLOPs,PSNR 20.89 dB(显著提升 +0.53 dB,且计算量远低于暴力扩容)

空间选择对比(表 6,RW2AH 数据集): - FocalNet 基线: 21.18 dB / 0.5970,30.53G FLOPs - HNDiff (像素空间 Image Space): 21.37 dB / 0.6166,65.59G FLOPs - HNDiff (潜在空间 Latent Space): 21.52 dB / 0.625436.38G FLOPs(精度最高,计算代价显著更小)

关键发现

  • 物理先验与随机噪声的互补性:消融表明单独引入加雾扩散(+0.25 dB)效果明显优于单独引入传统 DDPM 加噪扩散(+0.10 dB),证明物理驱动的均值漂移是模型捕捉真实散射规律的关键;而当两者通过 HANS 自适应融合后,带来了 +0.53 dB 的阶跃性提升,证实了随机生成能力与物理约束相辅相成。
  • 结构化先验远胜蛮力堆叠参数:直接通过加宽通道或加深网络层数来扩大 FocalNet 参数(从 3.74M 增至 8.4M),FLOPs 激增超过一倍(68.54G),但 PSNR 几乎停滞在 20.37 dB;而 HNDiff 在相近甚至更小的模型体量(7.82M,36.38G FLOPs)下取得了 20.89 dB 的高增益,表明缺乏生成先验引导的单纯容量扩增存在严重瓶颈。
  • 极小步数即可收敛:通过步数敏感性分析发现,\(T=4\) 即可达到性能峰值,继续增加反向采样步数并未带来明显增益,从而使 Latent HNDiff 在保持高精度的同时维持了非常高效的推理吞吐。

亮点与洞察

  • 物理散射诱导偏置 (ASM Inductive Bias) 重构扩散前向轨迹:突破了传统扩散模型强行拟合高斯白噪声的范式,巧妙地将大气散射方程映射为高斯转移过程的物理均值偏移,实现了生成式先验与成像物理规律的深度闭环。
  • 空间非均匀雾度的动态噪声调度 (HANS):敏锐地捕捉到了真实雾霾中“薄雾重保真、浓雾重脑补”的矛盾需求,用连续透射衰减系数动态调控注入噪声的方差,兼顾了高频生成能力与局域像素保真度。
  • 潜在空间即插即用的先验架构:避免了在原始高分辨率像素空间进行昂贵的随机迭代扩散,将物理逆扩散限制在低维潜在空间,并通过特征门控模块(FGM)以仿射调制方式增强已有 SOTA 骨干,极大增强了工程实用性。

局限与展望

  • 物理先验假设的局限性:当前模型的前向扩散与反向估计高度绑定经典大气散射模型(ASM),对于非均匀雨雾交加、夜间低照度非均匀人工光源或镜头水滴模糊等不满足单一大气光假设的极端复杂天气,难以直接发挥物理建模优势。
  • 双估计器架构带来的额外显存开销:尽管处于潜在空间,反向去雾去噪过程中需要同时前向运行噪声估计器与雾度估计器,峰值训练显存(如 SGDN 达 23.9GB)仍然相对较高。
  • 未来方向:探索将该物理扩散思路推广至水下图像成像模型(光吸收与散射)或夜间低照度退化场景,并研究单网络多头联合估计以进一步压缩反向扩散开销。

相关工作与启发

  • vs 常规去雾扩散模型 (如 DDPM, DiffIR):传统方案采用纯高斯噪声加注,在逆向过程中容易出现无物理依据的纹理幻觉或颜色失真;HNDiff 通过 ASM 引导前向轨迹漂移,确保反向恢复的物理一致性。
  • vs 残差扩散模型 (如 RDDM):RDDM 仅在线性残差空间定义扩散,未考虑场景景深、散射系数随空间深度呈指数衰减的非线性物理规律;HNDiff 显式对透射率与空间雾度分布进行建模,性能显著优于残差扩散(20.89 dB vs 20.43 dB)。
  • vs 纯物理逆演算法 (如 PSD, RIDCP):传统物理方法依赖显式估计不稳定的透射率图和全局大气光,在重雾盲区易产生伪影;HNDiff 将物理模型转变为扩散隐式先验,利用生成模型补全极端缺失信息。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次将大气散射模型无缝嵌入扩散过程的均值漂移与空间噪声调度中,思路极具启发性]
  • 实验充分度: ⭐⭐⭐⭐⭐ [跨 7 个合成/真实数据集、涵盖 4 种主流去雾骨干、提供了极具说服力的消融与参数等量对比]
  • 写作质量: ⭐⭐⭐⭐⭐ [数学推导严密自洽,物理直觉阐述清晰,图表与实验结构完整规整]
  • 价值: ⭐⭐⭐⭐⭐ [为物理模型与生成式扩散模型的有机融合提供了典范框架,具有广泛的底层视觉迁移价值]