跳转至

SplitHDR: Saturation-Aware HDR Recovery and Denoising for Real-Time Detection

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/snu-srml/SplitHDR
领域: 目标检测
关键词: 高动态范围成像、目标检测、自动驾驶、边缘设备视觉、自适应推理

一句话总结

针对自动驾驶边缘计算平台严苛的低延迟约束与光照突变挑战,SplitHDR 提出基于输入亮度的区域自适应双模态架构,将过曝饱和区域的短曝融合与未饱和主导区域的轻量去噪任务解耦,仅用 2.47k 参数与 3.63 GMACs 计算量即在下游检测任务中达到超越重型多曝光网络的 SOTA 精度(38.38% AP / 58.75% AP50)。

研究背景与动机

自动驾驶系统高度依赖实时的视觉感知算法(如车辆、行人和交通标志检测)以保障决策与路径规划的安全性。然而,在进出隧道、夜间迎面强远光灯眩光以及高对比度明暗交替等极端光照场景下,传统低动态范围(LDR)图像极易发生大面积高光过曝剪切与暗部欠曝欠采,导致关键边缘轮廓与纹理线索彻底丢失。现有基于深度学习的多曝光高动态范围(HDR)重建方法多依赖重型注意力对齐或生成扩散先验,模型参数常达数百万甚至数千万、单帧计算复杂度高达数千 GMACs,在车载嵌入式边缘硬件(如 FPGA 或 ASIC)所要求的超低延迟与算力预算下完全无法实时运行。

这一困境的核心矛盾在于:传统 HDR 融合网络无差别地对整幅图像所有像素施加沉重的高复杂度多帧对齐与特征提取,但真实车载场景中的像素信息密度呈现出极强的不对称性。统计表明,在常规行车记录中,未饱和区域占据全图绝大多数面积(日间约 79.80%、夜间约 88.08%、全场景平均 83.94%),且未饱和区域中长/中曝光帧天然具备更高的信噪比与保真度;反之,仅有约 16% 的稀疏局部区域真正发生高光饱和剪切,急需短曝光帧补充辐射度物理信息。如果对全图通跑重型融合,算力大部分被白白浪费在曝光良好的平坦区域,甚至可能引入短曝光帧的高噪声退化。

面对上述算力浪费与物理信息特性的脱节,本文从「分而治之(Divide-and-Conquer)」的计算经济学视角切入:既然先进车载 CMOS 传感器已能在单曝光周期内通过物理分光提供空间对齐的多曝光采样,算法端应当将有限算力精准投放在最需要恢复的饱和区域。核心 idea:利用中曝光亮度自适应构建软饱和度掩膜,将 HDR 任务显式解耦为面向饱和区域的“多曝光全尺寸融合模态”与面向未饱和主导区域的“轻量去噪增强模态”,并在推理阶段通过分块条件计算将昂贵的多帧融合严格限制在饱和瓦片中。

方法详解

整体框架

SplitHDR 的整体管线围绕三曝光输入接口(短曝光 \(X_s\)、中曝光 \(X_m\)、长曝光 \(X_l\))构建,包含“软饱和度掩膜生成与路由”、“双模态动态残差骨干”、“排他性掩膜监督”以及“分块条件执行与软融合”四个紧密协同的阶段。模型首先以中曝光帧 \(X_m\) 的亮度为基准快速计算像素级连续软掩膜 \(\alpha \in [0, 1]\);根据掩膜对全图分块评估,若分块内饱和像素平均比例超过阈值 \(\gamma=0.01\),则启动包含短曝光输入与全通道的主干融合模态,否则仅激活剪裁了短曝光分支且通道减半的轻量去噪模态;最终在过渡边界通过 \(\alpha\) 实施无缝 Alpha 混合重建 HDR 残差。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["多曝光输入堆栈<br/>(短曝光 Xs, 中曝光 Xm, 长曝光 Xl)"] --> S1["软饱和度掩膜路由<br/>中曝光亮度提取与平滑阈值映射 α"]
    S1 --> S2{"分块饱和度判别<br/>Tile-wise Routing (128×128)"}
    S2 -->|饱和瓦片 α=1| M1["多曝光全尺寸融合模态<br/>全通道 GlobalNet + DetailNet (Xs+Xm+Xl)"]
    S2 -->|未饱和瓦片 α=0| M2["未饱和轻量去噪模态<br/>通道减半 GlobalNet + DetailNet (Xm+Xl)"]
    S2 -->|过渡瓦片 0<α<1| M3["双模态并行执行"]
    M1 --> S3["条件推理软融合<br/>按像素掩膜 α 进行平滑加权融合"]
    M2 --> S3
    M3 --> S3
    S3 --> Out["残差叠加与最终 HDR 输出<br/>Y = Xm + Δ"]

关键设计

1. 软饱和度掩膜路由:基于物理曝光归一化的无开销区域划分

传统硬性二值分割极易在亮度边界产生拼接伪影和空间不连续噪声。SplitHDR 提出基于中曝光输入亮度的解析式连续软掩膜生成策略,完全避免了额外神经网络开销。在数据预处理阶段,中曝光帧在保留线性动态范围的同时归一化至短曝光基准尺度,因此中曝光帧在短曝光尺度下的理论最大可表示值受限于曝光比率 \(r = t_s / t_m\)。模型首先在经由 \(\mu\)-tonemap 压缩变换 \(\mathcal{T}(\cdot)\) 的网络输入域提取中曝光亮度代理值: $\(Y_m = \frac{R_m + 2G_m + B_m}{4}\)$ 为了在过曝边缘构建缓冲过渡带,作者将上边界阈值设定为全饱和值 \(\tau_{upper} = \mathcal{T}(r)\),下边界阈值设定为过曝前兆点 \(\tau_{lower} = 0.9 \cdot \mathcal{T}(r)\),并通过线性斜坡截断构建软掩膜: $\(\alpha = \mathrm{clamp}\left(\frac{Y_m - \tau_{lower}}{\tau_{upper} - \tau_{lower} + \varepsilon}, 0, 1\right)\)$ 当 \(\alpha=0\) 时为确信未饱和区域,\(\alpha=1\) 时为完全饱和过曝区域,\(0 < \alpha < 1\) 则构成连续过渡带,为训练阶段的软性梯度分配与推理阶段的无缝过渡奠定了基础。

2. 任务解耦的双模态轻量主干:非对称通道与输入分支剪裁

针对两类区域截然不同的物理退化特性,SplitHDR 设计了共享网络拓扑但动态调整参数配置的双模态残差网络。骨干网络由全局特征提取分支 GlobalNet(基于轻量深度可分离卷积 U-Net)与全分辨率局部纹理分支 DetailNet(逐点点卷积序列)组成,以中曝光 \(X_m\) 为全局残差基准:\(\hat{Y} = X_m + \Delta\)。 在面对占图像 80% 以上的未饱和区域时,短曝光帧 \(X_s\) 因进光量极少天然充斥着剧烈的散粒噪声与读出噪声,强行引入反而会污染未饱和区域的高信噪比特征。因此,未饱和模态果断移除 \(X_s\) 输入分支,仅接收中曝光 \(X_m\) 与长曝光 \(X_l\);同时将 GlobalNet 的输入通道从 9 裁剪为 6,DetailNet 的中间通道从 32 减半至 16,激活参数量从 1.80k 骤降至仅 0.67k。而在饱和高光区域,网络无缝切换至全尺寸融合模态,引入 \(X_s\) 的不失真高光结构,配合全部通道全面恢复过曝丢失的信息。

3. 排他性掩膜监督机制:引导双分支权重解耦专精化学习

如果让单个网络同时最小化高光伪影和暗部噪声,两类相互冲突的目标会导致梯度震荡与权衡妥协。SplitHDR 引入排他性掩膜损失(Exclusive Masked Supervision),通过软掩膜 \(\alpha\) 对两个模态的预测结果 \(\hat{Y}_{unsat}\)\(\hat{Y}_{sat}\) 进行空间加权监督。训练时对于每个批次内的像素 \(p\),未饱和损失 \(\mathcal{L}_{unsat}\) 和饱和损失 \(\mathcal{L}_{sat}\) 分别定义为: $\(\mathcal{L}_{unsat} = \frac{\sum_p (1 - \alpha_p) \|\hat{Y}_{unsat, p} - Y_p\|_1}{\sum_p (1 - \alpha_p) + \varepsilon}, \quad \mathcal{L}_{sat} = \frac{\sum_p \alpha_p \|\hat{Y}_{sat, p} - Y_p\|_1}{\sum_p \alpha_p + \varepsilon}\)$ 总优化目标为 \(\mathcal{L} = \lambda_{unsat} \mathcal{L}_{unsat} + \lambda_{sat} \mathcal{L}_{sat}\)。通过这种软性解耦,未饱和区域的梯度专心引导去噪与色彩校正,饱和区域的梯度则集中驱动多曝光高光纹理恢复;而在 \(0 < \alpha_p < 1\) 的过渡带上,两个模态均可获得平滑监督,从根本上消除了模式切换时的接缝伪影。

4. 分块自适应条件推理与软融合:兼顾边界连续性与极致边缘能耗

在边缘硬件推理部署时,逐像素动态调度会引起严重的线程分叉与内存碎片。SplitHDR 采用硬件友好的分块(Tile-wise)条件执行策略。系统将整幅输入划分为 \(128 \times 128\) 大小的局部瓦片,并计算每个瓦片内的平均掩膜强度 \(\bar{\alpha} = \frac{1}{|T|}\sum_{p \in T} \alpha_p\): - 若 \(\bar{\alpha} < 0.01\),判定该瓦片为纯未饱和瓦片,硬件仅调用极简去噪算子(0.67k 参数、极低 FLOPs),短曝光帧完全不参与访存; - 若瓦片包含完全饱和像素(\(\bar{\alpha}\) 高),则调用全尺寸饱和融合算子; - 仅在跨越饱和边界的过渡瓦片中,系统并行执行两个模态并在像素级进行软混合:\(\hat{Y} = (1 - \alpha) \odot \hat{Y}_{unsat} + \alpha \odot \hat{Y}_{sat}\)。 实验表明,全图 345 个瓦片中,平均有 214 个瓦片为纯未饱和瓦片,无需执行完整融合,使得整图计算开销从静态执行的 10.23 GMACs 骤降至 3.63 GMACs,单帧推理延迟仅 15.0 ms。

损失函数 / 训练策略

模型采用端到端方式在全分辨率曝光切片上进行训练。训练集包含 16,089 个三曝光图像堆栈,切分为无重叠的 \(256 \times 256\) 补丁(总计 1,238,853 个样本)。采用 He 初始化与 Adam 优化器(\(\beta_1 = 0.9, \beta_2 = 0.999, \epsilon = 10^{-8}\)),学习率全程固定为 \(1 \times 10^{-3}\),批量大小为 4,总计训练 309,714 个优化迭代步。训练过程中随机施加水平翻转、垂直翻转及随机旋转几何增强。损失权重设定为 \(\lambda_{unsat} = 1.0, \lambda_{sat} = 1.0\)。下游目标检测网络(YOLOX-Tiny)则在基准真实色调映射 HDR 图像上预先独立训练 300 轮,评测时冻结检测器以客观衡量 HDR 重建质量对机器视觉任务的实质增益。

实验关键数据

主实验

在自动驾驶真实采集基准 ROD 数据集(包含日间与夜间 4,000 张测试全景图、标注 6 类交通目标)上,将 SplitHDR 与单图像方法(HDRUNet)、轻量双曝光融合(LightFuse)以及代表性重型多曝光 HDR 网络(AHDRNet、SCTNet、SAFNet)进行系统评估:

方法 参数量 (k) 计算量 (GMACs) PSNR-\(\mu\) (dB) SSIM-\(\mu\) 目标检测 AP (%) 目标检测 AP50 (%) 目标检测 AP75 (%) 目标检测 AR (%)
HDR (Ground Truth) - - - - 38.34 58.77 40.18 47.83
LDR (中曝光单帧) - - 30.41 0.865 34.24 53.35 36.13 43.67
Exposure Fusion [Mertens 07] - - 25.01 0.631 33.94 52.04 38.82 43.27
AHDRNet [Yan et al. 19] 1441.28 7733.12 47.37 0.994 38.38 58.72 40.19 47.84
HDRUNet [Chen et al. 21] 1651.49 1898.31 37.19 0.961 36.36 56.38 38.14 45.78
SCTNet [Tel et al. 23] 961.48 5256.57 48.28 0.995 38.33 58.61 40.12 47.78
SAFNet [Kong et al. 24] 1120.85 3473.70 41.23 0.950 38.16 58.51 39.98 47.63
LightFuse [Liu et al. 21] 1.57 7.13 40.67 0.958 37.88 58.24 39.75 47.20
Ours (SplitHDR) 2.47 3.63 44.96 0.985 38.38 58.75 40.31 47.87

分场景检测表现显示,SplitHDR 在日间场景达到全场最高的 38.67% AP 与 48.62% AR;在极具挑战的夜间强眩光场景中达到 38.27% AP,与参数量超过其近 600 倍的 AHDRNet(38.28%)差距仅为 0.01%,展现出极其强悍的环境适应性。

消融实验

作者针对输入曝光堆栈数、双模态配置、排他性掩膜监督以及分块自适应推理进行了逐级递进的消融验证(各配置模型参数与任务精度如下):

配置代号 输入堆栈数 运行模态数 排他性掩膜监督 分块条件推理 参数量 (k) GMACs PSNR-\(\mu\) (dB) 目标检测 AP (%)
C1 (双曝光单模态基准) 2 1 - - 1.57 7.13 40.67 37.88
C2 (扩展为三曝光输入) 3 1 - - 1.80 7.84 40.93 37.68
C3 (双模态未解耦全执行) 3 2 2.47 10.23 44.01 37.80
C4 (+ 排他性掩膜监督) 3 2 2.47 10.23 44.96 38.38
C5 (Ours 完整模型) 3 2 2.47 3.63 44.96 38.38

瓦片尺寸分析(Table 5)进一步表明,选用 \(128 \times 128\) 瓦片在掩膜调度开销(1.46 ms)与推理用时(13.78 ms)之间取得了最佳平衡,总延迟 15.24 ms(实测端到端 15.0 ms),显著优于 \(32 \times 32\) 瓦片(21.24 ms,调度开销高)和 \(256 \times 256\) 瓦片(17.10 ms,未饱和剪枝不充分)。

关键发现

  • 排他性掩膜监督是感知涨点的核心引擎:从 C3 到 C4,在计算量和参数量完全相同(10.23 GMACs)的情况下,加入排他性掩膜监督让下游检测 AP 猛增 0.58%(37.80% \(\to\) 38.38%)。这证明迫使两个分支针对性专精于高光重建与暗部去噪,能有效避免梯度污染,显著强化目标边界特征响应。
  • 条件执行打破了容量与计算量的绑定:C5 相比 C4 将计算量大幅削减 64.5%(从 10.23 GMACs 降至 3.63 GMACs),而重建与检测精度完全无损。相比基准 C1,计算量更是下降了 49.1%,而 AP 提升了 0.50%。
  • 软掩膜阈值对连续性至关重要:使用 90% 阈值的软掩膜相比硬二值掩膜,PSNR 提升近 0.1 dB,且彻底消除了模式交界处的过渡割裂伪影。

亮点与洞察

  • 空间信息稀疏性与非对称计算的深度契合:论文敏锐地捕获了自动驾驶场景中“饱和区域天然高度局部化(~16%)而未饱和主导区域(~84%)信噪比充裕”的物理规律,打破了传统网络对全画幅一视同仁的重型处理惯性,用最轻的算力获得了最高的感知信噪比。
  • 短曝光帧的按需隔离避免噪声负迁移:未饱和区域果断抛弃低进光量、高噪声的短曝光帧,不仅显著压缩了输入与通道维度,还物理性阻断了传感器散粒噪声向清爽暗部的扩散,这种“不看短曝光反而更好”的反直觉设计极具启发性。
  • 计算效率比(Benefit-to-Cost Ratio)断层领先:在 \(\Delta\text{PSNR}/\text{GMACs}\) 指标上,SplitHDR 达到 4.008,是轻量前作 LightFuse(1.439)的 2.8 倍;而在检测增益能效比 \(\Delta\text{AP}/\text{GMACs}\) 上达到 1.140,高出重型网络上千倍,为计算资源受限的车载硬件树立了能效标杆。

局限与展望

  • 依赖传感器级无运动伪影或硬件对齐假设:论文立足于现代先进车载 HDR 传感器(如 LOFIC、多增益读出或分光光电二极管架构),默认输入的多曝光堆栈无宏观运动错位。如果面对传统时序交替曝光相机在高速运动下的剧烈鬼影,缺乏光流或对齐模块的 SplitHDR 可能会出现伪影扩散。
  • 静态曝光比率先验的适应性:当前软掩膜阈值生成严重依赖相机的曝光比率 \(r = t_s / t_m\)。当在具有极端非线性响应、动态可变曝光或特定压缩曲线的第三方 ISP 系统中部署时,可能需要额外校准掩膜超参数。
  • 未来改进方向:可进一步探索将动态稀疏卷积算子直接与片上 ISP 硬件单元结合,实现传感器读出电路层级的局部按需激活,实现真正的微瓦级感算一体低延迟感知。

相关工作与启发

  • vs LightFuse [Liu et al. 2021]: LightFuse 采用固定的双曝光融合网络,缺乏针对未饱和区域的专用降维与去噪机制,且缺少中曝光物理基准使得短曝光噪声易渗透全图;SplitHDR 引入三曝光接口与残差基准,并通过双模态动态路由实现了 2.8 倍的重建能效提升与更高的检测精度(38.38% vs 37.88% AP)。
  • vs AHDRNet / SCTNet [Yan et al. 2019 / Tel et al. 2023]: 重型多曝光网络采用密集的非局部自注意力或 Transformer 结构在全图搜索对齐,参数量在 1M 以上、算力在 5,000~7,000 GMACs。SplitHDR 证明对于现代无运动位移车载传感器,免对齐的动态超轻量网络(仅 0.002M 参数)完全可以实现相同甚至更优的下游检测表现。

评分

  • 新颖性: ⭐⭐⭐⭐ [从信息密度与传感器曝光物理规律出发,提出基于掩膜路由的双模态解耦与非对称计算范式]
  • 实验充分度: ⭐⭐⭐⭐⭐ [完备的定量/定性重建与检测指标、详细的分瓦片和阈值消融、严谨的抗扰动鲁棒性验证与端到端硬件延迟评测]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑链严谨清晰,图表精美直观,动机与物理背景阐述极为透彻]
  • 价值: ⭐⭐⭐⭐⭐ [对于自动驾驶实时边缘感知、端侧低延迟机器视觉以及片上 ISP 算法设计具有极高的实用落地价值]