跳转至

Degradation-Agnostic Clarity Learning for Unpaired Image Dehazing

会议: ECCV 2026
论文: ECCV 原文
领域: 图像恢复
关键词: 非成对图像去雾, 退化无关清晰度学习, 多任务学习, 帕累托优化, 自监督纹理增强

一句话总结

针对非成对图像去雾中鉴别器因跨域语义鸿沟易产生严重语义幻觉的问题,提出退化无关清晰度学习(DCL),通过对抗退化挖掘与帕累托多任务优化提取跨退化的共性清晰度方向,并结合抗退化自监督约束实现高质量去雾与纹理恢复。

研究背景与动机

在真实场景图像去雾任务中,成对的“有雾-清晰”真实图像极难大规模采集。传统物理先验方法受限于大气散射模型的理想化假设,在复杂现实环境下容易出现色彩失真、去雾不彻底等伪影。近期以无监督图像翻译(如基于 CycleGAN-Turbo)为代表的非成对去雾方法摆脱了物理模型的刚性约束,展现出更强的复杂场景建模能力。

然而,非成对翻译框架在强雾区域常常产生严重的语义幻觉(semantic hallucinations)与内容畸变。由于非成对数据中有雾域与清晰域存在显著的语义分布差异,鉴别器极易过拟合于高层语义特征而非底层清晰度,生成器为了迎合鉴别器的全局分布匹配目标,往往会凭空捏造目标域的语义纹理,甚至篡改原有场景结构。直接依靠人工清洗对齐数据集代价过高且难以泛化,如何引导鉴别器纯粹聚焦于底层视觉清晰度成为核心挑战。

解决这一问题的技术难点在于:一方面要抑制鉴别器对高层抽象语义的依赖,另一方面在缺乏成对真值的情况下难以精确定义无偏差的清晰度目标。核心 idea:显式向清晰图像注入低阶退化作为表层统计捷径以强力压制高阶语义干扰,并将跨退化清晰度学习建模为多任务帕累托优化,动态对抗挖掘未习得退化并抽取内在共性下降方向,从机制上杜绝特定退化偏置与语义幻觉。

方法详解

整体框架

DCL 基于非成对图像到图像翻译架构构建,包含目标去雾生成器 \(G_{X \to Y}\)(将有雾域 \(X\) 映射至清晰域 \(Y\))、逆向合成生成器 \(G_{Y \to X}\) 以及对应的判别器 \(D_Y\)\(D_X\)。推理阶段仅使用生成器 \(G_{X \to Y}\)。整体方法包含两大核心模块:一是退化共享清晰度特征学习(DCFL),将判别器对清晰样本的学习转化为多任务优化,利用对抗强化学习挖掘具有挑战性的低阶退化组合,并借助帕累托优化(MGDA)寻找多退化任务间的共性梯度方向,提取纯净的清晰度表征;二是抗退化自监督纹理增强(E2R),在循环一致性中对中间生成图像引入高频扰动,迫使网络在潜空间恢复出抗扰动的结构细节。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["清晰图像 / 有雾图像输入"] --> B["对抗自动增强退化挖掘<br/>策略网络动态搜索困难退化样本"]
    B --> C["帕累托优化梯度解耦<br/>MGDA 求解多任务共性清晰度更新方向"]
    C --> D["抗退化自监督循环增强<br/>高频扰动下潜空间纹理不变性重构"]
    D --> E["生成高质量去雾图像<br/>抑制语义幻觉并保留细粒度纹理"]

关键设计

1. 对抗自动增强退化挖掘:动态暴露判别器未习得的退化分布

若仅使用静态或固定的低阶退化池,判别器随着训练推进会迅速适应特定退化模式,削弱低阶统计特征对高层语义特征的压制能力。为提供持续有效的表层统计捷径,本文引入基于策略网络 \(\pi(\tau|\theta_\pi)\) 的对抗自动增强机制,从预设退化空间(涵盖噪声、雨纹、模糊、锐化、灰度、暗光、JPEG 压缩等)中动态采样退化类型、发生概率和强度参数。该策略网络的优化目标是最大化判别器在退化清晰样本上的损失: $\(R(\tau) = \mathcal{L}_{D_Y}(T_\tau(y_c); \theta_{D_Y})\)$ 通过持续挖掘使判别器当前最难区分的 \(K\) 个困难退化变体,确保不同退化模式具有充分的异质性与冲突性,为后续消除特定退化偏置奠定统计基础。

2. 帕累托优化清晰度抽取:从多退化冲突中提取真实清晰度流形

面对对抗挖掘出的 \(K\) 个退化变体任务,若直接采用标量加权求和更新判别器,梯度幅度较大的主导退化会劫持优化过程,使模型过拟合于消除某类特定噪声或模糊。基于“不同退化变体指向同一内在清晰度”的理论假设,将判别器参数更新建模为多目标优化问题,利用多梯度下降算法(MGDA)求解各任务损失梯度构成的凸包中范数最小的点。令第 \(k\) 个退化任务的损失为 \(\mathcal{L}_k(\theta_{D_Y})\),在单纯形 \(\Delta^{K-1}\) 内求解最优权重 \(\boldsymbol{\alpha}\): $\(\min_{\boldsymbol{\alpha} \in \Delta^{K-1}} \left\| \sum_{k=1}^K \alpha_k \nabla_{\theta_{D_Y}} \mathcal{L}_k(\theta_{D_Y}) \right\|_2^2\)$ 当退化特征满足零均值假设时,退化专有分量在帕累托最优合成梯度中相互抵消,最终的更新方向 \(\Delta \theta_{D_Y} = \sum_{k=1}^K \alpha_k \nabla \mathcal{L}_k\) 完全由共享的清晰度梯度主导,从而引导生成器只学习低阶去雾与清晰度恢复,彻底剥离虚假高阶语义。

3. 抗退化自监督纹理增强:高频扰动下的结构信息保真

非成对去雾通常缺乏像素级清晰参考,细粒度纹理容易在去雾过程中被平滑抹除。本文根据相对清晰度假说提出 Enhance-to-Resist(E2R)机制:真实场景的固有纹理在经过未知高频扰动后仍应具备可逆的特征线索。该机制借助预训练的冻结 VAE 编码器 \(E\) 捕获潜在纹理结构,在生成去雾结果 \(y_{\text{gen}} = G_{X \to Y}(x)\) 后注入随机高频算子 \(T_{hf}\),再经过逆向映射 \(G_{Y \to X}\) 得到重构图像 \(x_{\text{rec}}^T\),并在 VAE 特征空间计算循环自监督损失: $\(\mathcal{L}_{\text{E2Rcycle}} = \mathbb{E}_{x \sim p_{\text{haze}}, T \sim p(\mathcal{T})} \left[ \| E(x) - E(x_{\text{rec}}^T) \|_2^2 \right]\)$ 该目标迫使生成器生成更具鲁棒性、有输入依据的高频纹理,使得即使中间结果被未知退化破坏,其本质结构依然能够稳定还原。

损失函数 / 训练策略

系统总损失函数整合了非成对图像翻译的基本约束与所提出的正则项: $\(\mathcal{L}_{\text{total}} = \lambda_{\text{GAN}} \mathcal{L}_{\text{GAN}} + \lambda_{\text{cycle}} \mathcal{L}_{\text{cycle}}^{L1} + \lambda_{\text{E2R}} \mathcal{L}_{\text{E2Rcycle}} + \lambda_{\text{idt}} \mathcal{L}_{\text{idt}}\)$ 其中判别器 \(D_Y\) 的对抗损失采用 MGDA 计算所得的帕累托权重进行梯度聚合。实验中超参数设定为 \(\lambda_{\text{cycle}}^{L1} = 1\)\(\lambda_{\text{E2R}} = 10\)\(\lambda_{\text{idt}} = 1\)\(\lambda_{\text{GAN}} = 0.5\)。退化采样子集候选大小设为 \(K = 3\)。使用 AdamW 优化器,学习率设为 \(1\times 10^{-5}\),批量大小为 1,在单张 NVIDIA RTX 4090 GPU 上训练 30k 步。

实验关键数据

主实验

在真实世界去雾基准数据集 RTTS、Fattal's dataset 以及 FoggyDriving 上,与代表性物理先验方法(Dehamer, KANet, D4+)和先进非成对生成方法(CycleGAN-Turbo, Diff-Dehazer, DehazeSB)进行了严格客观评估(无参考去雾度量 HazDesNet 越低越好,感知质量 CLIPIQA、MUSIQ、MANIQA 越高越好)。

数据集 方法 HazDesNet↓ CLIPIQA↑ MUSIQ↑ MANIQA↑
RTTS Dehamer 0.319 0.347 50.55 0.279
RTTS KANet 0.372 0.280 54.53 0.257
RTTS D4+ 0.333 0.305 53.29 0.289
RTTS CycleGAN-Turbo 0.372 0.289 56.63 0.286
RTTS Diff-Dehazer 0.321 0.356 57.80 0.271
RTTS DehazeSB 0.438 0.377 53.09 0.263
RTTS Ours 0.278 0.325 57.47 0.278
Fattal CycleGAN-Turbo 0.163 0.530 66.65 0.360
Fattal Diff-Dehazer 0.154 0.467 61.66 0.311
Fattal Ours 0.098 0.587 68.83 0.438
FoggyDriving (Web) CycleGAN-Turbo 0.387 0.367 58.00 0.307
FoggyDriving (Web) Ours 0.240 0.460 60.39 0.312

消融实验

在 RTTS 数据集上逐步剥离对抗自动增强(ARL)、帕累托优化(PO)以及自监督纹理增强(E2R),验证各核心模块对模型去雾程度与图像感知质量的具体增益:

配置 ARL PO E2R HazDesNet↓ CLIPIQA↑ MUSIQ↑ MANIQA↑
基线(CycleGAN-Turbo) 0.372 0.289 56.63 0.286
仅加入 ARL 退化挖掘 0.282 0.292 53.38 0.272
ARL + 帕累托优化 (PO) 0.299 0.264 54.67 0.243
完整模型 (DCL) 0.278 0.325 57.47 0.278

在候选退化采样子集大小 \(K\) 的敏感性研究中:当 \(K=1\) 时退化为单梯度更新,缺乏跨退化相互约束,导致特定退化过增强;当 \(K=3\) 时提供最佳互补约束并实现各向梯度抵消;当 \(K=5\) 时引入冗余易学样本,略微扰乱帕累托平衡,因此最终选定 \(K=3\)

关键发现

  • 引入低阶退化注入后,HazDesNet 从基线的 0.372 大幅下降至 0.282,表明表层统计捷径显著加速并强化了判别器对去雾程度的判别;而结合帕累托优化后,梯度方差与退化专有特征被大幅过滤,彻底消除了由于单一退化过拟合带来的伪影。
  • 在合成重雾数据集的高层语义分割测试(FoggyDriving)中,DCL 取得了 85.5% pxAcc、50.9% clsAcc 以及 37.7% mIoU,显著超越了 CycleGAN-Turbo(34.9% mIoU)与 Diff-Dehazer(33.3% mIoU),证明该方法从根源上保护了底层场景语义的一致性。
  • 在低照度图像增强任务的泛化测试中,E2R 展现出跨底层任务的普适性,在不同暗光强度下均自适应强化结构细节而不引入过度噪声。

亮点与洞察

  • 巧妙地将对抗样本思想反向用于构建“表层统计捷径”,利用深度模型对低阶统计更敏感的归纳偏置来压制高阶语义幻觉。
  • 创新性地将无监督清晰度学习形式化为多目标帕累托前沿搜索,证明并利用了不同退化变体在梯度空间的正交与反向抵消特性。
  • 提出的 Enhance-to-Resist 构想超越了传统的像素循环一致性,通过在潜空间对抗高频破坏,为非成对底层视觉逆问题提供了通用的自监督细节增强思路。

局限与展望

  • 当输入图像本身存在极强传感器噪声或严重 JPEG 压缩损伤时,E2R 的高频重建约束可能会误将原有的高频伪影当作有效结构一并增强。
  • 帕累托多任务梯度计算需要在每个训练步对 \(K\) 个退化样本分别计算判别器反向传播,相比标准非成对训练增加了约 \(K\) 倍的判别器反向传播计算开销。
  • 未来可探索自适应噪声强度的退化感知门控机制,将退化无关思想拓展至水下图像增强、雨雪全天候视觉恢复等多合一(all-in-one)底层恢复任务。

相关工作与启发

  • vs CycleGAN-Turbo [39]: CycleGAN-Turbo 依赖单步扩散模型的强大生成先验进行域转换,但缺乏对清晰度梯度的针对性引导,极易在无配对数据上捏造语义;本文通过引入多退化多任务判别器与帕累托优化,引导网络专注底层去雾,有效抑制了语义漂移。
  • vs Diff-Dehazer [28] & DehazeSB [29]: 现有方法试图将脆弱的物理散射模型与扩散先验或薛定谔桥结合,但在复杂现实场景下物理先验往往失效导致偏色;本文完全摆脱物理先验的刚性假设,从纯粹的数据分布与统计捷径角度解决非成对去雾难题。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次从多任务帕累托优化与统计捷径角度攻克非成对去雾的语义幻觉难题,视角独到。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖真实多数据集对比、消融实验、梯度正交性分析、语义分割下游测试及暗光泛化验证。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论假设清晰,数学形式化推导与实验论证严密,层次分明。
  • 价值: ⭐⭐⭐⭐⭐ 为无配对无监督图像恢复提供了强有力且易迁移的表征学习新范式。