Difficulty-Conditioned Attribute-Specific Restoration for Low-Light Image Enhancement¶
会议: ECCV 2026
论文: ECCV 官方海报
代码: https://github.com/mingzhuzhang1/DCASR-LLIE
领域: 图像恢复
关键词: 微光图像增强、困难度条件恢复、属性解耦、扩散先验学习、HVI色彩空间
一句话总结¶
针对真实微光图像中退化严重程度空间异质性的问题,提出困难度条件属性解耦恢复框架 DCASR,在 HVI 空间下分别以 GIM 矫正全局照度与以 DCT 频域 SRM 细化局部结构,并通过两阶段特权教师-扩散学生机制在测试期免残差合成困难度先验,在 LOL 系列数据集上取得最优表现。
研究背景与动机¶
微光图像增强(LLIE)致力于从严重欠曝、高噪点和色彩畸变的图像中恢复出可见度与自然结构,是诸多高级视觉下游任务的关键前置环节。现有的深度微光增强方法通常分为以 Retinex 分解或结构线索为代表的确定性回归方法,以及基于 GAN 或扩散模型的生成式方法。然而,大多数现有方案在处理整张图像时均采用全局均一的增强映射策略。在真实拍摄场景中,图像退化具有强烈的空间异质性:轻度欠曝区域相对容易恢复,而极暗、强噪或色彩失真的区域则异常复杂。全局均一的处理往往带来次优妥协,导致困难区域纹理被过度平滑,或平缓区域出现过度增强与噪声放大。残差诊断表明,高误差区域呈现高度结构化、内容相关的拓扑分布,而非孤立随机噪声。
要让模型将算力自适应倾斜至高难度区域,必须引入明确的恢复困难度先验。然而,朴素地引入困难度引导会面临两大核心矛盾:第一,微光退化的属性异质性十分显著——光照退化通常具有全局一致性且以低频为主,而结构细节与颜色畸变则具有局部空间敏感性和高频属性;如果在 RGB 空间直接用单一困难度标量进行空间调整,极易被主导的亮度变化淹没,难以为精细纹理恢复提供针对性指导。第二,监督训练时的困难度通常由预测与真值之间的残差显式推导,但在实际推理时 ground-truth 残差不可见,如何单凭单张微光输入推断出非唯一的潜在困难度分布是棘手挑战。
本文的切入角度是结合 HVI 色彩空间对退化属性进行正交解耦,并在特征调制与训练监督两个层面共同引入困难度感知。针对推理期无残差的问题,将先验预测重构为条件生成任务,利用特权教师蒸馏指导潜在扩散模型合成伪先验。核心 idea:将微光恢复拆解为 HVI 空间下的强度全局校正与高频结构细化,利用教师提取的残差困难度先验通过仿射变换与 DCT 频域门控分别调制双分支,并在测试期通过潜在条件扩散模型直接从微光输入中合成困难度先验。
方法详解¶
整体框架¶
DCASR 整体由基于 HVI 色彩空间的双分支增强主干、先验引导调制器(GIM 与 SRM)、自适应先验加权损失(APW)以及两阶段特权教师-扩散学生先验学习模块组成。输入微光图像首先转换至 HVI 空间,分离为强度特征分量 \(F_i\) 与色调-饱和度(HV)特征分量 \(F_{hv}\)。困难度先验向量 \(P\)(训练期来自特权教师网络,测试期由扩散学生网络合成)分别输入两个专属调制器:全局强度调制器(GIM)预测全局仿射参数作用于强度分支,确保亮度调整的一致性;结构细化调制器(SRM)利用离散余弦变换(DCT)从 \(P\) 中提取高频响应,调整 HV 分支的交叉注意力响应以聚焦难恢复细节。最后双分支特征融合经反变换重建输出图像。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入微光图像 I_low<br/>HVI 颜色空间转换"] --> B["双分支特征解耦<br/>强度分支 F_i / 结构分支 F_hv"]
P_in["困难度先验 P / ˆP<br/>(教师残差抽取 / 扩散学生合成)"] --> C["全局强度调制器 (GIM)<br/>通道级仿射变换参数 α, β"]
P_in --> D["结构细化调制器 (SRM)<br/>DCT 频域高频响应 P_hf + 交叉注意力"]
B -->|F_i| C
B -->|F_hv| D
C --> E["调制后特征融合<br/>逆 HVI 变换与残差重建"]
D --> E
E --> F["输出正常光照图像 I_output"]
关键设计¶
1. 全局强度调制器(GIM):保持低频光照全局一致性 光照退化以低频成分为主且具有大范围一致性,采用密集的逐像素局部调整容易导致光照不均或产生斑块状伪影。GIM 摒弃局部空间引导图,将紧凑的 \(D\) 维困难度先验 \(P \in \mathbb{R}^D\) 输入轻量单层映射网络 \(\mathcal{M}_{gain}\),直接解码生成通道级增益 \(\boldsymbol{\alpha}\) 与偏置 \(\boldsymbol{\beta}\): $\([\boldsymbol{\alpha}, \boldsymbol{\beta}] = \mathcal{M}_{gain}(P), \quad \boldsymbol{\alpha}, \boldsymbol{\beta} \in \mathbb{R}^{C' \times 1 \times 1}\)$ 将参数沿空间维度广播后,对强度特征 \(F_i \in \mathbb{R}^{C' \times H' \times W'}\) 实施残差通道仿射变换: $\(\tilde{F}_i = F_i \odot (\mathbf{1} + \boldsymbol{\alpha}) + \boldsymbol{\beta}\)$ 其中 \(\boldsymbol{\alpha}\) 调节全局动态范围对比度,\(\boldsymbol{\beta}\) 控制整体亮度提升偏移量。通过空间不变的通道调制,模型在先验指引下自适应感知整图欠曝严重程度,实现自然平滑的光照校准。
2. 结构细化调制器(SRM):DCT频域驱动的局部细节增强 HV 分支主要负责抑制噪声、色彩去畸变以及边缘纹理复原。单一的全局先验嵌入 \(P\) 缺少局部空间敏感性,直接空间注入易发生语义模糊。SRM 创新性地引入离散余弦变换(DCT)挖掘先验内部的高频退化线索。首先对 \(F_{hv}\) 施加基于 \(P\) 的粗调制得到 \(F_{coarse}\);接着将一维先验嵌入 \(P\) 视为离散序列,计算标准正交 DCT 系数 \(\mathcal{X}_k\): $\(\mathcal{X}_k = c_k \sum_{n=0}^{D-1} P_n \cos\left[\frac{\pi}{D}\left(n + \frac{1}{2}\right)k\right]\)$ 通过高通掩膜 \(m_\tau[k] = \mathbb{I}(k \ge \tau)\) 截留截断频率 \(\tau\) 以上的成分,经逆变换重构出高频结构响应标量序列 \(P_{hf} \in \mathbb{R}^D\)。将 \(P_{hf}\) 广播后调制交叉注意力中的 Query 向量: $\(\tilde{F}_{hv} = \mathrm{FFN}\left(\mathrm{Attn}\left(\phi_q(\bar{F} \odot (1 + \lambda P_{hf})), \phi_k(\bar{F}), \phi_v(\bar{F})\right)\right) + F_{coarse}\)$ 其中 \(\bar{F} = \mathrm{Norm}(F_{coarse})\),\(\lambda\) 调节调制幅度。借助频域高频先验对 Query 的锐化,促使注意力权重自适应聚焦于受强噪声或边缘模糊影响的复杂区域。
3. 自适应先验加权(APW):难例挖掘式监督重分配 常规 L1 损失同等对待所有像素,使网络倾向于在易恢复平坦区过拟合,而欠优化高难度暗区与强噪声区。APW 从预估残差图 \(I_{res}\) 聚合计算通道模长 \(M_{diff}\),经 Min-Max 归一化至 \([0, 1]\) 得到 \(\tilde{M}_{diff}\)。利用带截断梯度的 Sigmoid 缩放函数生成重要性权重基底: $\(\tilde{W} = \mathrm{sg}\left[\frac{\sigma(\omega \tilde{M}_{diff})}{\mathbb{E}[\sigma(\omega \tilde{M}_{diff})]}\right]\)$ 其中锐度系数 \(\omega = 6.0\),\(\mathrm{sg}[\cdot]\) 为停止梯度算子。结合可学习调节标量 \(\xi \in [0, 1]\),最终构造空间权重图 \(W = \xi \cdot \tilde{W} + (1 - \xi)\)。Prior-Guided 损失函数定义为加权平均绝对误差: $\(\mathcal{L}_{apw} = \|W \odot (\hat{I} - I_{gt})\|_1\)$ 在优化过程中,随 \(\xi\) 的自适应演进,监督重点平滑从均一损失平稳过渡到难例重点关注模式。
4. 特权教师-扩散学生先验学习:推理期无残差先验合成 残差图在测试阶段是不可见的。DCASR 采用两阶段特权蒸馏架构:在 Stage I(特权教师阶段),使用预训练微光模型计算真值残差 \(I_{res} = |I_{gt} - \Phi_{llie}(I_{low})|\),构建上下文分支 \(E_1(I_{low} \oplus I_{res})\) 与困难度分支 \(E_2(I_{res})\),经 GAP 池化为描述符后过 MLP 得到 oracle 先验 \(P \in \mathbb{R}^{256}\);在 Stage II(生成学生阶段),冻结教师网络提取的 \(P\) 作为真实隐空间分布,构建条件扩散过程 \(q(P_t | P)\)。学生编码器提取 \(I_{low}\) 的条件特征 \(C\),去噪网络 \(\epsilon_\theta(P_t, C, t)\) 在隐空间中学习从高斯白噪声 \(\epsilon_0 \sim \mathcal{N}(0, \mathbf{I})\) 迭代去噪合成先验 \(\hat{P}\),并以对齐损失 \(\mathcal{L}_{cdp} = \|\hat{P} - P\|_1\) 进行约束。测试期无需任何真值参考,单图即可端到端推理。
损失函数 / 训练策略¶
训练过程总计 1000 epoch。Stage I(前 500 epoch)联合训练增强主干与特权教师网络,采用双域复合损失: $\(\mathcal{L}_{stage1} = \mathcal{L}_1 + \mathcal{L}_{ssim} + \mathcal{L}_{edge} + \mathcal{L}_{perc}\)$ Stage II(后 500 epoch)冻结教师编码器,利用 \(\mathcal{L}_{apw}\) 替换普通 \(\mathcal{L}_1\),并引入扩散先验对齐损失: $\(\mathcal{L}_{stage2} = \mathcal{L}_{apw} + \mathcal{L}_{ssim} + \mathcal{L}_{edge} + \mathcal{L}_{perc} + \eta \mathcal{L}_{cdp}\)$ 其中权重因子 \(\eta = 0.01\)。采用 Adam 优化器,学习率由 \(1 \times 10^{-4}\) 经余弦退火衰减至 \(1 \times 10^{-7}\),批量大小为 8。
实验关键数据¶
主实验¶
在 LOL-v1、LOL-v2-real 以及 LOL-v2-synthetic 三大基准上对 DCASR 与 SOTA 方法进行了系统评测(摘自原文 Table 1 与 Table 3)。
| 数据集 | 指标 | 本文 (DCASR) | 次优方法 (CIDNet / CWNet) | 提升幅度 |
|---|---|---|---|---|
| LOL-v1 (成对测试) | PSNR (dB) ↑ | 24.042 | 23.830 (Retinexformer) / 23.809 (CIDNet) | +0.212 dB |
| LOL-v1 (成对测试) | SSIM ↑ | 0.850 | 0.857 (CIDNet) | -0.007 |
| LOL-v1 (成对测试) | LPIPS ↓ | 0.082 | 0.086 (CIDNet) | -0.004 |
| LOL-v2-real (成对真实) | PSNR (dB) ↑ | 24.053 | 23.920 (URetinex++) / 23.904 (CIDNet) | +0.133 dB |
| LOL-v2-real (成对真实) | SSIM ↑ | 0.874 | 0.866 (CIDNet) | +0.008 |
| LOL-v2-real (成对真实) | LPIPS ↓ | 0.109 | 0.122 (CIDNet) | -0.013 |
| LOL-v2-synthetic (成对合成) | PSNR (dB) ↑ | 25.610 | 25.501 (CWNet) / 25.129 (CIDNet) | +0.109 dB |
| LOL-v2-synthetic (成对合成) | SSIM ↑ | 0.940 | 0.939 (CIDNet) | +0.001 |
| LOL-v2-synthetic (成对合成) | LPIPS ↓ | 0.045 | 0.044 (CWNet) / 0.045 (CIDNet) | 持平 |
| Unpaired (4 数据集均值) | NIQE ↓ | 3.76 | 4.06 (CIDNet) | -0.30 |
消融实验¶
模块消融实验在 LOL-v2-real 数据集上展开(对应原文 Table 4 核心组件消融与 Table 5 模块配置/对调实验)。
| 配置 | GIM | SRM | \(\mathcal{L}_{apw}\) | PSNR (dB) ↑ | SSIM ↑ | LPIPS ↓ | 说明 |
|---|---|---|---|---|---|---|---|
| (a) Baseline (U-Net) | ✗ | ✗ | ✗ | 23.498 | 0.857 | 0.123 | 基础双分支框架,无任何先验调制 |
| (b) + GIM | ✓ | ✗ | ✗ | 23.625 | 0.868 | 0.113 | 仅在强度分支引入全局调制 (+0.127 dB) |
| (c) + SRM | ✗ | ✓ | ✗ | 23.765 | 0.868 | 0.111 | 仅在 HV 分支引入结构细化 (+0.267 dB) |
| (d) + GIM + SRM | ✓ | ✓ | ✗ | 23.894 | 0.870 | 0.112 | 双分支协同调制 (+0.396 dB) |
| (e) 完整模型 (DCASR) | ✓ | ✓ | ✓ | 24.053 | 0.874 | 0.109 | 加入难例加权自适应损失 (+0.555 dB) |
| * 对换测试 (SRM-I, GIM-HV) | - | - | - | 22.662 | 0.850 | 0.171 | 属性错配导致性能严重暴跌 (-1.232 dB) |
| * 通用替换 (CA-I, CA-HV) | - | - | - | 23.012 | 0.864 | 0.131 | 替换为普通通道注意力掉点 (-0.882 dB) |
关键发现¶
- 属性匹配是先验引导生效的前提:将 GIM 作用于强度分支、SRM 作用于 HV 分支的设计是完全匹配退化物理特性的;若将其对调(I 分支用 SRM、HV 分支用 GIM),PSNR 骤降 1.232 dB(由 23.894 跌落至 22.662),甚至大幅落后于不加先验的 baseline,说明低频光照不需要细粒度空间扰动,而高频纹理绝不能仅依靠全局标量调制。
- 扩散生成优于确定性先验回归:在先验预测器选型的消融中(Table 6a),采用条件扩散模型预测先验达到了 24.053 dB,显著优于 Transformer(23.611 dB)、ResBlock(23.534 dB)以及直接 MLP 回归(23.490 dB),证明了单图推断多义性困难度隐变量时,扩散概率模型对分布多峰特性的建模优势。
- 残差先验比常规统计先验更具监督性:对比信噪比 SNR、纯亮度图、注意力图等经验先验(Table 6b),基于残差蒸馏的困难度先验取得了最优表现,表明面向任务误差的反馈机制比无差别的物理统计量更精准。
亮点与洞察¶
- 将 DCT 频域滤波引入潜在先验嵌入:SRM 并非直接在空间特征上做频域变换,而是把 256 维的抽象先验向量做一维 DCT 变换,提取高频分量用于加权 Query 向量,实现从一维隐空间到空间交叉注意力的轻量化桥接。
- 特权蒸馏拆解无残差困局:训练阶段有 ground-truth 残差指路,推理阶段缺乏残差指导是难例学习的通用难题;该方案将“残差推断”转化为紧凑潜空间的“条件去噪扩散”,巧妙绕过了直接在像素级预测高维残差的不适定性与不稳定性。
- 自适应损失权重与停止梯度设计:在 APW 中利用停止梯度算子(stop-gradient)阻断权重生成分支对残差梯度的干扰,配合可学习因子 \(\xi\),保证了早期训练的平稳与后期的强力难例挖掘。
局限与展望¶
- 扩散采样引入额外推理时延:虽然在紧凑的 256 维隐空间进行采样,但多次反向去噪步数仍会引入计算开销,论文汇报单张 256×256 图像耗时约 0.148 秒,在超高清或端侧实时场景下需要进一步加速(如采用单步蒸馏或一致性模型)。
- 极端过曝与严重反光场景的鲁棒性未明确探讨:模型的设计重心在低照度严重欠曝和噪声畸变,若画面中同时存在局部极高亮度泛光与复杂动态眩光,全局仿射的 GIM 可能会对局部高光产生轻微次生过曝。
- 未来方向:可进一步将困难度隐先验直接接入下游检测与多模态感知模型,探索退化困难度与任务不确定性的联合联合协同优化。
相关工作与启发¶
- vs CIDNet:CIDNet 开创性地提出了 HVI 色彩空间下的双分支解耦架构,但其处理机制仍是整图均一的;DCASR 继承了 HVI 的解耦物理优势,引入了关键的“困难度感知”维度,通过 GIM 与 SRM 实现了动态算力再分配。
- vs Diff-Retinex / LightenDiffusion:传统扩散微光方法多直接在全图像空间或高维特征空间进行数十步迭代去噪,参数量大且推理极慢;DCASR 仅在 256 维紧凑隐空间做轻量先验扩散,主干恢复仍由前向卷积网络完成,平衡了生成质量与推理速度。
评分¶
- 新颖性: ⭐⭐⭐⭐ [困难度条件与 HVI 属性解耦结合紧密,一维隐先验 DCT 频域滤波设计巧妙]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖成对、未成对基准、跨域泛化及极其详尽的模块位置消融]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图文对照自洽,数学表述清晰完整]
- 价值: ⭐⭐⭐⭐ [为图像底层退化中的难例挖掘和两阶段先验估计提供了优雅范式]