跳转至

LIIFusion: Coarse-to-fine Framework for Generative MEF via Implicit Neural Representation

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://sangmin213.github.io/LIIFusion/
领域: 其他(多曝光图像融合 / 图像恢复)
关键词: 多曝光图像融合, 隐式神经表示, 扩散先验, 粗精两阶段, 自适应曝光校正

一句话总结

LIIFusion 将生成式多曝光融合解耦为“低分辨率扩散全局融合(配合自适应曝光校正)+ 高分辨率连续隐式神经表示细节精炼”两阶段管线,彻底摆脱耗时的滑动窗口采样,在取得最高主客观画质的同时实现了 3.5 倍的推理加速。

研究背景与动机

高动态范围(HDR)场景成像受限于常规图像传感器的物理动态范围,单次曝光往往面临“高光过曝发白”与“暗部欠曝死黑”的两难困境。多曝光图像融合(MEF)通过融合多幅不同曝光强度的低动态范围(LDR)图像,无需依赖繁琐的相机响应函数反演与色调映射即可合成色彩生动的图像。然而,传统基于多尺度金字塔分解的方法严重依赖对比度、饱和度等手工低级特征,在动态场景下极易因物体位移产生鬼影伪影,且在极端曝光缺失区无法合成缺失结构;近年基于 CNN 与 Transformer 的深度回归方案虽改善了抗位移鲁棒性,但面对严重过曝或严重欠曝导致信息彻底丢失的区域,依然无法无中生有地生成合理的真实细节。

近期出现的生成式扩散 MEF 方法(如 UltraFusion)将融合重新表述为隐空间内的引导式图像修复任务,借助预训练扩散模型的强大先验,成功消除了鬼影并生成了逼真的纹理。但这一路线面临致命的效率与结构稳定性瓶颈:扩散模型通常在固定低分辨率(如 \(512 \times 512\))下预训练,处理百万像素高分辨率图像时必须采用高重叠率的滑动窗口分块(patch-wise)推理,单张图像动辄经历数十次反复去噪采样,单数据集测试动辄耗费数小时;更严峻的是,当过曝区域严重饱和时,局部引导信号极度虚弱,分块独立采样极易引发空间拼缝不连续与结构畸变(如霓虹灯牌失真、地图边界坍塌)。

解决上述矛盾的破局点在于:全局色调统一与去鬼影并不需要在全分辨率下执行昂贵的扩散推理,而高频纹理的恢复也可以跳出离散像素上采样的桎梏。核心 idea:将生成式多曝光融合严格解耦为粗精两阶段——粗阶段在降采样尺度上运行扩散先验(引入自适应曝光校正稳固高光结构),以极少推理步数完成全局色调与语义对齐;精细阶段则首创将局部隐式图像函数(INR / LIIF)重构为多曝光条件连续融合函数,直接以原始高分辨率欠曝/过曝证据为条件,在任意连续坐标下高保真合成目标细节。

方法详解

整体框架

LIIFusion 的处理流程分为粗尺度扩散生成融合与细尺度连续隐式神经融合两个互补阶段。系统输入为高分辨率的过曝图像 \(I_{oe} \in \mathbb{R}^{H \times W \times 3}\) 和欠曝图像 \(I_{ue} \in \mathbb{R}^{H \times W \times 3}\)。首先通过双三次下采样获得对应的低分辨率输入 \(\{I_{oe}^{LR}, I_{ue}^{LR}\} \subset \mathbb{R}^{h \times w \times 3}\),并利用光流估计网络 RAFT 对输入对进行全局运动对齐,得到与过曝视角对齐的欠曝特征。在粗阶段,低分辨率对经由自适应曝光校正(AEC)调制后送入扩散模型 \(g\),以 1-2 次轻量前向生成全局色调均衡且无鬼影的粗融合图像 \(I_{mef}^{LR}\)。在精细阶段,隐式神经表示模型通过 SwinIR 骨干提取粗融合特征,同时使用轻量 CNN 编码原始高分辨率过曝/欠曝局部块,在任意目标坐标处拼接双分支特征并由 MLP 解码输出全分辨率的高保真融合图像 \(I_{mef}^{HR}\)

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["高分辨率输入对<br/>I_oe, I_ue (HR)"] --> B["双三次下采样与光流运动对齐<br/>RAFT 光流产生对齐低/高分辨率对"]
    B --> C["1. 自适应曝光校正<br/>LAB 空间提取亮度差计算衰减权重 W"]
    C --> D["2. 低分辨率生成融合<br/>扩散模型全局去鬼影生成 I_mef(LR)"]
    D --> E["3. 曝光条件隐式细节精炼<br/>SwinIR(粗) + 4-Layer CNN(HR 源) 提取特征"]
    E --> F["连续坐标查询与 MLP 解码<br/>按目标网格密集查询并由轻量 MLP 预测 RGB"]
    F --> G["高分辨率融合图像<br/>I_mef(HR) (任意目标分辨率)"]

关键设计

1. 自适应曝光校正:抑制过曝伪影并稳固粗融合结构 针对扩散模型在低分辨率下难以从严重过饱和的白阶区域提取可靠结构引导的痛点,该模块在低分辨率过曝图参与扩散忠实度引导前对其进行自适应强度重加权。若直接将完全过曝发白的区域作为参考,扩散模型 VAE 解码器中的引导项将退化,导致招牌文字、地图纹理等高频轮廓在粗阶段就发生不可逆的坍塌。该设计首先将低分辨率输入转换为 LAB 颜色空间并提取各自的亮度通道 \(L_{oe}^{LR}, L_{ue}^{LR} \in [0, 1]^{h \times w \times 1}\),计算截断曝光差异图: $\(L_{diff}^{LR} = \min(\max(L_{oe}^{LR} - L_{ue}^{LR}, 0), 1)\)$ 随后依据亮度差生成平滑衰减权重图 \(\mathbf{W}\),并通过 \(1/2.2\) 的感知伽马校正平滑过渡: $\(\mathbf{W} = (1 - \alpha \cdot L_{diff}^{LR})^{1/2.2}\)$ 经调节后的过曝图像 \(I_{oe}^{'LR} = I_{oe}^{LR} \odot \mathbf{W}\) 替代原始过曝图参与潜在引导生成。通过在送入扩散网络前压制高光失真,使得粗融合结果提前保留清晰的边缘与骨架,为后续细化阶段提供结构锚点。

2. 低分辨率生成融合:全局鬼影消除与高效语义补全 针对以往生成式 MEF 方案在全图切分数十个 \(512 \times 512\) 补丁进行滑动窗口扩散采样所导致的极度低效(单图耗时几分钟至数十分钟)与接缝不一致问题,LIIFusion 彻底解耦扩散模型的处理分辨率与输出图像分辨率。扩散模型(基于 UltraFusion 架构)仅在下采样后的整幅低分辨率视角下工作。由于无需滑动分块,整图的语义上下文可以在扩散网络内被全局感知,一次性完成大尺度动态物体的鬼影抑制与极端缺失区域的先验填充。全图推理通常仅需 1 至 2 次扩散前向扩散计算,推理耗时相较滑动窗口减少 70% 以上,从根本上移除了生成式多曝光融合的计算瓶颈。

3. 曝光条件隐式细节精炼:任意分辨率高保真特征融合 针对常规图像超分辨率(如纯 LIIF)仅能对单图做插值放大、无法从互补曝光源中恢复真实高频细节的缺陷,本设计将局部隐式图像函数扩展为多曝光条件下的连续融合算子。粗特征编码器 \(E_{coarse}\) 采用 SwinIR 架构提取粗融合表征 \(f_{coarse} = E_{coarse}(I_{mef}^{LR})\);同时构建轻量 4 层 CNN 细特征编码器 \(E_{fine}\),针对高分辨率对拼合张量 \(\{I_{oe}, \tilde{I}_{ue}\}\) 提取包含局部高频纹理的特征图 \(f_{fine}\)。对于任意连续归一化查询坐标 \(x \in [-1, 1]^2\) 与对应的像素单元尺寸 \(c=[c_h, c_w]\),分别在 \(f_{coarse}\)\(f_{fine}\) 上通过双线性插值采样局部特征向量 \(z_{coarse}\)\(z_{fine}\),拼接后由紧凑型 MLP \(f_\theta\) 回归 RGB 颜色值: $\(s = f_\theta([z_{coarse}, z_{fine}], [x, c])\)$ 该设计不仅消除了离散网格限制,更使得精细层能够直接吸纳原始高分辨率过曝和欠曝图像中的原生未压缩像素证据,在无需耗费扩散步数的情况下重建锐利清晰的毛发、文字与环境反光。

损失函数 / 训练策略

在训练阶段,粗阶段扩散模型保持冻结或预训练配置,精细阶段隐式神经融合网络端到端联合训练。训练数据基于 SICE 数据集采样过曝/欠曝图像对,并引入从 Vimeo-90K 提取的动态遮挡掩膜模拟真实物体的非刚性运动。高分辨率真值图像记为 \(I_{GT}\)。网络整体采用纯 \(L_1\) 重建损失进行优化: $\(\mathcal{L}_{fusion} = \| I_{mef}^{HR} - I_{GT} \|_1\)$ 优化器采用 Adam,学习率设为 \(1 \times 10^{-4}\),批大小(batch size)为 16。模型在单张 NVIDIA H100 GPU 上训练 500 个 epoch,大约耗时 22 小时实现完全收敛。

实验关键数据

主实验

主实验在包含复杂动态位移的 RealHDRV 数据集(50 个动态场景)与大曝光跨度的 UltraFusion Benchmark(100 个真实场景)上进行评测。评测指标采用无参考图像质量评估体系(MUSIQ、DeQA-Score、PAQ2PIQ、HyperIQA)以及结构相似度指标 MEF-SSIM。推理时间统一在单张 NVIDIA RTX A5000 GPU 上实测。

数据集 / 场景 模型 MUSIQ ↑ DeQA-Score ↑ PAQ2PIQ ↑ HyperIQA ↑ 推理总用时 ↓
RealHDRV (50 场景) Defusion (ECCV22) 56.38 3.2867 68.31 0.4838 2 min
MEF-LUT (ICCV23) 62.42 3.2864 70.04 0.5020 4 sec
HSDS-MEF (2024) 61.82 3.6045 71.14 0.5055 18 min
UltraFusion (CVPR25) 67.54 3.8998 73.39 0.5834 101 min
Ours (LIIFusion) 69.52 3.8908 74.06 0.6175 27 min
UltraFusion (100 场景) Defusion (ECCV22) 60.11 3.3529 71.83 0.5440 6 min
MEF-LUT (ICCV23) 64.06 3.2859 71.80 0.5103 8 sec
HSDS-MEF (2024) 65.23 3.6662 73.77 0.5786 46 min
UltraFusion (CVPR25) 68.40 4.0123 75.18 0.6214 203 min
Ours (LIIFusion) 70.19 3.9807 75.59 0.6467 59 min

同时,在针对单幅 \(1988 \times 1326\) 分辨率图像的单图算力对比中,LIIFusion 相比 UltraFusion 将计算量从 944.4 TFLOPs 骤降至 282.1 TFLOPs(降低 70.1%),模型参数仅由 1.860 B 微幅调整为 1.872 B。

消融实验

1. 精细阶段多曝光输入条件消融(在 UltraFusion Benchmark 上验证) 为了证明 LIIFusion 是真正的多曝光连续特征融合而非单纯的超分辨率上采样,作者对比了在细阶段不同输入源对网络的影响:

细阶段输入配置 MUSIQ ↑ DeQA-Score ↑ PAQ2PIQ ↑ HyperIQA ↑ 说明
w/o OE, UE(仅粗结果) 54.65 3.7961 74.09 0.4277 退化为单图超分辨率,细节丢失严重
w/ UE only 62.73 3.8412 74.59 0.5773 仅依靠欠曝图,易引入暗部噪声
w/ OE only 68.38 3.8438 75.58 0.6141 恢复高光细节,但饱和缺失处有限
w/ OE, UE (完整模型) 70.19 3.9807 75.59 0.6467 充分整合互补曝光,指标全面达到最佳

2. 自适应曝光校正(AEC)模块消融 - Ours (w/o AEC): MUSIQ 70.07, PAQ2PIQ 75.64, HyperIQA 0.6451, DeQA-Score 3.9870 - Ours (w/ AEC): MUSIQ 70.19, PAQ2PIQ 75.59, HyperIQA 0.6467, DeQA-Score 3.9807 分析:虽然 AEC 在量化数字上的提升相对克制,但在定性视觉感知上起决定性作用:缺乏 AEC 时,强过曝区域的霓虹灯牌轮廓与展示牌地图细节在粗融合阶段发生模糊塌缩,且细化阶段无法重新校正语义;而加入 AEC 后高频发光物体的边缘与结构被稳固保留。

关键发现

  • 生成融合与超分辨率解耦的必然性:单纯使用预训练 LIIF 对粗融合图进行超分辨率(MEFB 上 MEF-SSIM 仅 0.8942,HyperIQA 0.6389),表现远落后于端到端多曝光条件融合的 LIIFusion(MEF-SSIM 0.9201,HyperIQA 0.6418),证明高分辨率曝光输入的直接条件注入是消除模糊、还原字符细节的关键。
  • 主观偏好碾压基线:在 22 名受试者的用户盲测中,LIIFusion 获得了 61.36% 的首选率(Best-choice rate),平均排名为 1.52,大幅领先 UltraFusion(首选率 21.21%,平均排名 2.02)与 HSDS-MEF(13.64%,平均排名 2.89)。
  • 伪标签训练的可行性:直接采用 UltraFusion 离线生成的融合结果作为伪标签训练 LIIFusion,其 MUSIQ 达 69.34、HyperIQA 达 0.6323,与真实标注文档训练的性能(70.19 / 0.6467)极其接近,展现了无需密集人工校色即可扩展数据集的强大潜力。

亮点与洞察

  • 多曝光条件的连续隐式神经建模:首次将隐式神经表示(INR)引入多曝光融合任务,不是作为简单的图像超分辨率后处理,而是作为统一多分辨率曝光证据的连续函数,巧妙解决了传统卷积或扩散固定分辨率网格的桎梏。
  • 低成本全局感知与局部确定性修补协同:把非确定性的扩散采样限制在全局低分辨率语义层,把高确定性的像素级纹理交给轻量 MLP 连续查询,既规避了分块拼缝和漫长采样,又保全了扩散模型的抗鬼影能力。
  • 自适应曝光衰减策略(AEC)极具工程借鉴价值:通过 LAB 亮度差与伽马加权对过曝图进行物理感知预衰减,无需复杂参数即可避免扩散先验在高光死白区域的“幻觉发散”。

局限与展望

  • 粗阶段结构依赖性强:最终高分辨率图像的全局色调和拓扑轮廓仍高度依赖低分辨率粗阶段的扩散输出,若极端粗分辨率下出现严重透视畸变,细阶段难以完全修正。
  • 与实时推理仍有差距:虽然推理速度比 UltraFusion 提升 3.5 倍以上,但全图 27-59 分钟的耗时依然远慢于毫秒级的 MEF-LUT 等查表方案,难以直接部署至移动设备取景器或实时视频流。
  • 极端剧烈动态位移下的残存伪影:在超大位移或剧烈遮挡场景下,光流对齐仍可能出现微弱误匹配,导致细粒度边缘残存微弱鬼影。

相关工作与启发

  • vs UltraFusion (CVPR 2025): UltraFusion 采用纯扩散模型并在高分辨率下执行重叠滑动窗口修复,单图 TFLOPs 高达 944.4,耗时漫长且拼接处易失真;LIIFusion 将扩散限制在全局低分辨率,并由连续隐式表示恢复高频细节,TFLOPs 骤降 70%,速度提升 3.5 倍且感知质量更优。
  • vs LIIF (CVPR 2021): 原版 LIIF 是针对单幅低分辨率图像的连续坐标超分辨率算子;LIIFusion 首次将其拓展为双分支多曝光融合架构,联合吸收粗语义特征与高分辨率过曝/欠曝局部 patch 特征,赋予了 INR 跨曝光、跨分辨率多源信息融合的能力。
  • vs HSDS-MEF / MEF-LUT: 传统与轻量级深度学习 MEF 缺乏生成先验,在动态场景运动物体边缘极易产生剧烈重影,且高光溢出区呈现灰暗低对比度;LIIFusion 借助扩散先验完美去除了鬼影,色调更符合人类视觉感知。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [首次将隐式神经表示重构为多曝光连续条件融合算子,粗精两阶段解耦设计思路清晰]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖静态/动态三大基准,主观用户实验、算力对比与多维度消融详实完备]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图表清晰,针对痛点给出的方案针对性极强]
  • 价值: ⭐⭐⭐⭐☆ [大幅降低了生成式 HDR/MEF 的计算开销,为扩散模型落地高分辨率底层视觉提供了重要范式]