跳转至

Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone Mapping

会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 高动态范围图像, 多曝光融合, 逆色调映射, 增益图, 扩散模型

一句话总结

DOME-HDR 提出一种双输出多曝光 HDR 重建框架,将基于 LoRA 扩散模型的 SDR 曝光融合与基于 HDR 先验引导的增益图网络(HPGM)解耦并协同训练,在单一管线内同步生成免色调映射的观赏级 SDR 图像与高保真物理 HDR 辐射度图。

研究背景与动机

自然场景中的光照动态范围往往跨越数个数量级,从幽暗阴影到强烈高光均存在极其丰富的视觉信息。然而,常规标准动态范围(SDR)传感器因受限于物理捕光能力与位深表示,仅能记录有限动态范围的低动态(LDR)图像。为了克服这一瓶颈,学术界主要演化出两条并行路径:多曝光融合(MEF)与高动态范围(HDR)重建。MEF 致力于将不同曝光的包围曝光序列融合成单张视觉曝光均衡、对比度舒适的 SDR 图像,近年基于潜在扩散先验的融合方法虽能生成极富质感的画面,但其本质仍局限于 8-bit SDR 空间,无法物理恢复场景真实的辐射度。

传统的端到端多曝光 HDR 重建方法直接回归线性域辐射度,但其面临两大难题:首先,现代强大的生成式骨干网络(如 VAE、扩散模型)通常在大规模 SDR 图像上预训练,直接迁移至线性 HDR 空间需要极其复杂的域适配;其次,物理 HDR 图像在常规显示设备上必须经由色调映射算子(TMO)压缩,导致最终的主观观感严重依赖显示器参数与特定算子,跨设备一致性较差。作为折中,增益图逆色调映射(GM-ITM)将 HDR 重建建模为以 SDR 为基准的乘性空间残差,具备出色的向后兼容性与显示自适应能力;但现有增益图方案普遍假设输入的单张 SDR 完好无损,一旦遇到过曝过饱和或严重裁切的区域,单靠增益系数缩放无法物理恢复缺失信息。若朴素地将 SDR 生成器与增益图网络前后串联,前序 SDR 的生成伪影与误差又会不可逆地放大至增益图预测中。

本文的切入角度是:将多曝光图像的互补观测能力引入增益图范式,打破此前 MEF 与 HDR 互不联通的壁垒。核心 idea:解耦感知曝光融合与物理 HDR 扩展,以中曝光为主干锚点构建双分支交叉注意力扩散模型生成基准 SDR,再利用多曝光辐射度先验引导的增益图网络(HPGM)预测空间残差与全局尺度,通过两阶段协同优化在单框架内同步交付观赏级 SDR 与高保真 HDR。

方法详解

整体框架

DOME-HDR 接收三张括号曝光的低动态图像输入:欠曝光 \(I_{ue}\)、中曝光 \(I_{me}\) 与过曝光 \(I_{oe}\)。整个流程解耦为两大紧密衔接的阶段: 1. 基准 SDR 图像合成(Stage 1):以中曝光图像 \(I_{me}\) 作为主要结构锚点,将其编码至潜在空间;欠曝光 \(I_{ue}\) 与过曝光 \(I_{oe}\) 分别提取互补的高光细节和暗部色彩特征,通过双路独立的交叉注意力机制注入中曝光隐特征中,驱动冻结主干的 LoRA 微调潜在扩散模型迭代去噪,经 VAE 解码生成高视觉质量的基准 SDR 图像 \(\hat{I}_{sdr}\)。 2. 增益图估计与逆色调映射(Stage 2):利用三张曝光输入的辐射度关系和亮度掩码构建物理 HDR 初始先验 \(G_{prior}\);接着由 HDR 先验引导增益图网络(HPGM)接收基准 SDR、跨曝光比值及饱和掩码,在瓶颈层融合物理先验特征并在边缘引导上采样后,分别预测增益图空间残差 \(\Delta g\) 与全局 HDR 尺度 \(\hat{Q}_{max}\),最终经乘性幂变换合成物理 HDR 图像 \(\hat{I}_{hdr}\)

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}%%
flowchart TD
    A["输入三曝光 LDR: I_ue, I_me, I_oe"] --> B["阶段 1: 双分支交叉注意力 SDR 合成<br/>中曝光锚定 + 独立欠曝/过曝特征引导"]
    B --> C["基准 SDR 图像 I_sdr"]
    A --> D["多曝光物理辐射度初始化<br/>伽马线性化 + 软饱和掩码加权"]
    D --> E["物理 HDR 初始先验 G_prior"]
    C & E --> F["阶段 2: HPGM 增益图与尺度估计<br/>11通道特征 + 瓶颈先验注入 + 边缘引导上采样"]
    F --> G["预测增益图 g = G_prior + Δg<br/>与全局尺度 Q_max"]
    C & G --> H["双输出结果交付<br/>观赏级 SDR + 物理保真 HDR"]

关键设计

1. 双分支交叉注意力特征注入:避免曝光互补信息互相抵消

在利用扩散模型合成基准 SDR 时,基线 UltraFusion 方案通常将多张参考曝光提取的特征在空间通道上做归一化相加后再注入注意力层。然而在三曝光场景下,欠曝光图像富含高亮反光处的精细纹理,而过曝光图像富含深色暗部的低噪色彩,二者信号分布极度悬殊;粗暴的均值求和会抹平关键高频细节并引入暗部噪声。DOME-HDR 以中曝光潜在表征 \(X_{me}\) 为 Query,为欠曝光和过曝光图像建立两个独立的 Key/Value 交叉注意力通道:

\[X_{out} = X_{me} + \text{Conv}_{1\times 1}\left(\text{softmax}\left(\frac{QK^\top}{\tau}\right)V\right)\]

该操作在 UE 与 OE 两个分支上独立执行,允许潜在特征自适应地从欠曝光中汲取高光结构、从过曝光中汲取阴影色彩。在此期间,扩散模型的 U-Net 主干与 VAE 编码/解码器保持完全冻结,仅在 Cross-Attention 的投影矩阵(\(W_q, W_v\))上加载 rank=8 的 LoRA 适配器,极大减少了训练显存与收敛开销。

2. 物理 HDR 辐射度先验构建:为增益图学习提供强归纳偏置

由于增益图本质是 HDR 与 SDR 像素之间的非线性乘性缩放因子,纯靠神经网络从 SDR 盲目回归极易陷入局部最优或产生色温漂移。为此,本文直接利用输入的物理多曝光序列,预先构造出物理先验增益图 \(G_{prior}\)。首先对三张 LDR 按照曝光值 \(ev_k\)\(\gamma=2.2\) 进行线性化得到物理辐射度估计:

\[X_k = \frac{I_k^\gamma}{2^{ev_k}}, \quad k \in \{ue, me, oe\}\]

随后基于中曝光亮度 \(l_{me}\) 计算高光与阴影软饱和掩码 \(S_{hi} = \sigma(\alpha \cdot (l_{me} - t_{hi}))\)\(S_{lo} = \sigma(\alpha \cdot (t_{lo} - l_{me}))\)(其中 \(t_{hi}=0.95, t_{lo}=0.05, \alpha=50\)),将曝光互补辐射度进行平滑加权拼合:\(\hat{I}_{hdr}^{prior} = S_{hi} X_{ue} + (1 - S_{hi} - S_{lo}) X_{me} + S_{lo} X_{oe}\)。最终将该混合辐射度与生成的基准 SDR 计算对数残差比例作为增益图先验:

\[G_{prior} = \frac{\log(\tilde{I}_{hdr}^{prior} + \epsilon)}{\log(\hat{I}_{sdr} + \epsilon)}\]

这一先验直接将后续网络的学习目标从“从零学习复杂映射”转换为“在物理粗估计上学习残差修正”,显著提升了高动态区域扩展的稳定性。

3. HPGM 先验引导增益网络与双输出协同:边缘门控残差学习

HPGM 采用 U-Net 结构,输入拼接了基准 SDR \(\hat{I}_{sdr}\)、曝光比值 \(R_{ue}=X_{ue}/X_{me}, R_{oe}=X_{oe}/X_{me}\) 以及饱和掩码 \(S_{hi}, S_{lo}\),共计 11 个通道。在网络瓶颈处,轻量级卷积先验编码器将 \(G_{prior}\) 及其掩码提炼出的先验特征 \(f_{prior}\) 通过残差相加注入瓶颈表征。在解码器阶段,为了防止亮暗过渡边缘因增益系数剧烈跳变而产生光晕(halo artifacts),网络引入基于 Sobel 滤波的边缘图作为空间门控信号进行特征锐化。最后,双预测头分别输出空间残差 \(\Delta g\)(最终增益图 \(\hat{g} = G_{prior} + \Delta g\))以及通过全局平均池化和两层 MLP 得到的全图亮度缩放因子 \(\hat{Q}_{max}\)。最终物理 HDR 表达由幂律加权与全局尺度联合重构:

\[\hat{I}_{hdr}(x,y) = \left(\hat{I}_{sdr}(x,y) + \epsilon\right)^{\hat{g}(x,y)} \cdot \hat{Q}_{max}\]

该公式保证了基准 SDR 的局部纹理被严格保留在底模中,同时动态范围被准确拉伸至真实辐射度水平。

损失函数 / 训练策略

模型采用图像级感知重构与增益图约束联合监督: 1. 图像级损失 \(\mathcal{L}_{img}\):在 \(\mu\)-law 压缩域(\(\mu=5000\))计算与真实 HDR 的 \(L_1\) 绝对误差,并辅以 VGG19 感知损失(\(\lambda_{perc}=0.01\)):

\[\mathcal{L}_{img} = \|\mathcal{T}_\mu(I_{hdr}) - \mathcal{T}_\mu(\hat{I}_{hdr})\|_1 + \lambda_{perc} \|\phi(I_{hdr}) - \phi(\hat{I}_{hdr})\|_1\]
  1. 增益级损失 \(\mathcal{L}_{gain}\):监督增益图残差与全局缩放因子,\(\mathcal{L}_{gain} = \sqrt{(\hat{g} - g)^2 + \varepsilon} + w_{qmax} |\hat{Q}_{max} - Q_{max}|\),其中 \(\varepsilon=10^{-3}, w_{qmax}=0.3\)。总损失为二者相加 \(\mathcal{L}_{total} = \mathcal{L}_{img} + \mathcal{L}_{gain}\)
  2. 两阶段解耦训练机制:Phase 1 联合训练 LoRA 扩散模块与 HPGM 30k 次迭代;Phase 2 将 Phase 1 实际推理生成的 SDR 离线作为 HPGM 的输入进一步微调 30k 迭代。这种策略有效弥合了训练期 GT SDR 与推理期生成 SDR 之间的分布漂移(domain gap)。

实验关键数据

主实验

在 Challenge123、Tel 与 Kalantari 三个标准多曝光基准测试集上(合并评测),DOME-HDR 与当前最先进的 HDR 重建方法对比(如原文 Table 1 所示):

方法 PU-PSNR (dB) ↑ PU-SSIM ↑ LPIPS ↓ DISTS ↓ CLIPIQA ↑ NIQE ↓ BRISQUE ↓
AHDRNet 41.99 0.9780 0.0438 0.0309 0.3963 3.61 24.78
HDR-Transformer 43.74 0.9806 0.0382 0.0232 0.3982 3.62 24.12
SCTNet 42.92 0.9783 0.0399 0.0246 0.3959 3.56 23.84
SAFNet 42.98 0.9802 0.0344 0.0213 0.4019 3.63 23.12
DiffHDR 42.50 0.9739 0.0464 0.0297 0.4101 3.86 26.15
RFG-HDR 43.16 0.9788 0.0367 0.0239 0.3927 3.59 23.98
AFUNet (SOTA) 44.48 0.9875 0.0205 0.0162 0.3983 3.68 27.13
DOME-HDR (本文) 44.63 0.9878 0.0156 0.0147 0.4137 3.56 22.18

在基准 SDR 输出的画质表现上,本文与专用多曝光融合(MEF)SOTA 方法对比(原文 Table 2):

方法 MANIQA ↑ CLIPIQA ↑ NIQE ↓ BRISQUE ↓
MEF-LUT 0.4064 0.5147 3.34 36.53
UltraFusion 0.3650 0.4070 3.92 17.01
DOME-HDR (本文) 0.4129 0.5233 3.37 16.52

消融实验

消融实验深入验证了各个关键模块的独立有效性:

1. 朴素串联与端到端联合训练对比(原文 Table 3) 将独立的预训练 UltraFusion 与预训练 GMNet 串联,由于误差级联传播,PU-PSNR 仅有 22.96 dB,LPIPS 高达 0.1042;而本文统一联合优化框架达到了 44.63 dB 与 0.0156 LPIPS。

2. 交叉注意力融合与输入配置消融(原文 Table 4 与 Table 5)

实验项 / 配置 PU-PSNR (dB) ↑ PU-SSIM ↑ LPIPS ↓ DISTS ↓ 说明
UltraFusion 均值融合 43.76 0.9876 0.0180 0.0157 特征求和导致互补信息衰减
双分支交叉注意力 (本文) 44.63 0.9878 0.0156 0.0147 提升 0.87 dB,显著增强高频细节
Prior 仅 SDR 输入 23.69 0.8487 0.1310 0.0846 无多曝光信息,极端欠拟合
Prior 欠曝+中曝 (UE+ME) 25.32 0.8794 0.1126 0.0732 缺乏暗部信息
Prior 过曝+中曝 (OE+ME) 26.16 0.8920 0.1041 0.0701 缺乏高光高饱和信息
Prior 全三曝光输入 44.63 0.9878 0.0156 0.0147 必须由完整包围曝光提供辐射度支撑

3. 两阶段训练策略消融(原文 Table 6) - 仅 Phase 1 训练:PU-PSNR 为 40.53 dB,LPIPS 为 0.0162。证明仅做联合初始化虽有较好感知指标,但数值保真度不足。 - 仅 Phase 2 训练:PU-PSNR 为 43.26 dB,DISTS 为 0.0143。 - 完整 Phase 1 + 2 协同:PU-PSNR 达到 44.63 dB,各指标全面超越前序 SOTA(AFUNet 44.48 dB)。

关键发现

  • 增益图先验是打破瓶颈的关键:消融表表明,若 HPGM 仅以单张 SDR 作为输入,PU-PSNR 会骤降至 23.69 dB,这印证了单图逆色调映射在高光裁切区域无法凭空恢复物理能量的根本局限;而引入物理多曝光加权先验直接使 PSNR 跃升了近 21 dB。
  • SDR 免色调映射的感知优越性:传统 HDR 方法生成的物理线性图经过 \(\mu\)-law、PQ 或 Reinhard 算子映射到普通屏幕时,CLIPIQA 普遍在 0.35~0.39 徘徊;而 DOME-HDR 的 Stage 1 直接生成的基准 SDR 在无需任何后处理调色算子的情况下,CLIPIQA 达到 0.4984,色彩生动且无光晕伪影。

亮点与洞察

  • 双模态输出规避显示端适配黑盒:传统 HDR 算法往往忽视了终端屏幕色调映射算子的不可控性,导致实验室评测良好但在手机或网页显示时发灰发暗。DOME-HDR 将 SDR 融合与 HDR 辐射度解耦,常规显示器直接使用极高品质的 SDR 图像,HDR 屏幕则直接通过增益图还原高光绚丽度,具备完美的向后兼容性。
  • 以多曝光物理辐射度作为增益图先验:过去逆色调映射多基于纯单图黑盒拟合,本文巧妙将传统多曝光图像加权融合成物理粗先验 \(G_{prior}\),再让神经网络仅预测微调残差 \(\Delta g\) 与全局标度 \(\hat{Q}_{max}\),极大减轻了深度模型的拟合负担。
  • 两阶段微调消除生成底模的域迁移漂移:在联合训练中,若始终用真实 SDR 训练增益图,模型在推理面对扩散模型生成的 SDR 时会因细微伪影崩溃;通过在 Phase 2 使用 Phase 1 扩散模型生成的 SDR 再次微调 HPGM,彻底消除了训练推理不一致问题。

局限与展望

  • 扩散去噪的计算延迟:Stage 1 依赖潜在扩散模型的多步去噪迭代,虽然画质优异且仅在 LoRA 参数上训练,但相比于轻量卷积或纯 Transformer 前向模型,单次推理耗时较长,暂难部署于手机端实时预览相机。
  • 剧烈动态运动下的对齐敏感性:虽然通过中曝光作为 Query 建立了软注意力约束,但在极端动态多物体剧烈运动场景下(如快速车流、摇晃树叶),物理先验合成阶段的加权融合仍可能产生局部的鬼影(ghosting)残差。
  • 后续优化方向:可进一步将扩散阶段蒸馏为 1~2 步的流匹配(Flow Matching)或加速扩散结构,并在先验构造阶段引入轻量变形对齐模块以增强对动态鬼影的鲁棒性。

相关工作与启发

  • vs UltraFusion (CVPR 2025):UltraFusion 是基于曝光在轨修复的扩散 MEF 方案,但它仅将过曝光作为底模,且将多曝光特征均值求和后只输出 8-bit SDR。本文将其拓展为以中曝光为主锚点的双通道交叉注意力结构,并在此基础上构建 HDR 先验与增益图逆色调映射,实现了从“纯图像融合”到“辐射度物理重建”的跃迁。
  • vs AFUNet (ICCV 2025):AFUNet 通过深度展开迭代交替优化对齐与融合,在传统端到端线性 HDR 重建上取得前序 SOTA。本文通过增益图残差框架不仅在 PU-PSNR(44.63 vs 44.48)和 LPIPS(0.0156 vs 0.0205)上全面胜出,更消除了必须依赖色调映射算子才能展示的弊端。
  • vs GMNet / Gain-MLP (ICLR 2025 / ICCV 2025):现有增益图工作主要面向单图逆色调映射,在高光完全饱和被截断时无能为力。本文首次将多曝光包围序列作为物理引导引入增益图估计中,填补了增益图无法重建极端截断信息的缺陷。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次将扩散多曝光融合与增益图逆色调映射深度统一,提出基于多曝光的物理辐射度增益先验与双路交叉注意力机制]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖全参考 PU-PSNR/PU-SSIM/LPIPS/DISTS 及无参考多指标,消融详尽覆盖输入配置、注意力结构、两阶段训练及跨色调映射器对比]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑链条严密,动机具体充实,公式与图表结构高度清晰]
  • 价值: ⭐⭐⭐⭐ [为 HDR 摄影与消费级终端展示提供了兼具高质量 SDR 与显示自适应 HDR 的实用落地思路]