跳转至

Depth-guided Multi-view Exposure Bracketing for HDR Robot Vision

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5101
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/8851.pdf
项目: https://divisonofficer.github.io/dmeb
领域: 机器人视觉 / HDR 成像
关键词: 多视角曝光包围、度量深度、置信度融合、色调映射、机器人感知

一句话总结

DMEB 将不同曝光分配给同步多相机,利用外部深度对齐并融合互补观测,实现单次采集的 HDR 重建,在真实 modest-DR 三相机设置下取得 39.40 dB PSNR-µ,同时提供覆盖 121 个真实场景和 20 段合成视频的评测数据。

研究背景与动机

机器人面对车灯、阴影与明亮天空时,普通相机往往只能保住其中一部分亮度信息。传统曝光包围让一台相机先后拍摄短、中、长曝光,再融合成 HDR;但物体或相机一旦运动,同一个位置在不同帧里就可能对应不同内容。光流、注意力或对齐网络能够缓解错位,却依赖不同曝光之间仍有可匹配纹理:把曝光差拉大虽然有利于保留亮部和暗部,却会让饱和区、低信噪比区更加难以对应。

多相机同步拍摄去掉了跨时刻运动这一层困难,却仍存在视差。已有多相机 HDR 方法如果继续靠外观找对应,也需要限制曝光差。本文利用机器人和部分手机已配备深度传感器这一条件,把对应关系交给几何,把相机曝光更多地用于覆盖动态范围;与此同时,作者指出现有基准缺少同步、强曝光差、多视角且深度已标定对齐的数据,因此数据集和参考重建系统是同等重要的贡献。

核心 idea:用外部度量深度解除跨曝光匹配对外观相似性的依赖,让同步相机分别负责不同亮度区间,再根据曝光可靠性与几何可见性选择每个像素应相信的观测。

方法详解

整体框架

输入是同步采集的多视角低位深图像、各相机曝光参数、相机标定以及对齐的深度测量,输出是选定参考相机视角下的 HDR 图像。系统先根据上一帧调节当前各相机曝光,再进行深度置信度融合,最后以多色调映射细化处理残留误差。这里的 single-shot 指当前 HDR 的图像来源是同时拍摄的多相机观测,并不意味着曝光控制完全不读取历史帧,也不意味着只使用一个相机。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    previous["上一帧图像与曝光"] --> exposure["多视角曝光控制"]
    exposure --> capture["同步多曝光图像"]
    capture --> fusion["深度置信度融合"]
    depth["深度测量与标定"] --> fusion
    fusion --> refinement["多色调映射细化"]
    refinement --> output["参考视角 HDR"]

关键设计

1. 多视角曝光控制:让相机覆盖不同亮度区间

系统不是让所有相机都自动曝光到同样的平均亮度,而是在归一化强度 0.05 到 0.8 之间,给不同相机分配几何间隔的目标均值。每个相机比较自己的上一帧均值与目标值,按两者比例更新曝光,并裁剪到硬件允许范围。这样,较暗的目标相机优先保留强光结构,较亮的目标相机负责阴影;场景照明变化时,整体曝光还能随反馈调整。

对第 \(i\) 个相机,原文的曝光更新可写为:

\[ \xi_i\leftarrow\operatorname{clip}\!\left(\xi_i\frac{m_i}{m_i^*},\xi_{\min},\xi_{\max}\right). \]

其中 \(m_i\) 是目标均值,\(m_i^*\) 是上一帧实测均值,\(\xi_i\) 是曝光量。目标均值的几何间隔并不等于实际快门时间一定按固定倍率排列,因为不同视角的内容和实测亮度可能不同。曝光量再分解成时间与增益:先把曝光时间限制在 \(\tau_{\max}\) 以内,需要更大曝光时再提升增益,并受 \(g_{\max}\) 限制。主文给出的运行示例是 8 FPS 采集时约 50 ms 的最大稳定曝光时间,不能将它与后文网络推理 FPS 混为一谈。

2. 深度置信度融合:几何负责对齐,可靠性负责取舍

外部深度通常不是每个 RGB 像素都有值。DMEB 先将原始测量投影到各相机视角,再用预训练的 Depth Anything V2 单目先验补成稠密深度;稀疏测量通过尺度估计提供度量尺度约束。因此这不是直接把单目相对深度当真实距离使用,而是让传感器决定尺度、先验补充空间结构。每个视角都有对应的稠密深度,为后续几何重投影提供支撑。

对齐正确也不代表像素值得融合:某个视角可能已经饱和,另一个可能暗到噪声占主导。作者将显式亮度权重与可学习权重相乘:

\[ C_i=f_{\mathrm{trapezoid}}(I_i)\,f_{\mathrm{CNN}}(I_i,\widehat D_i). \]

梯形强度函数压低过暗、过亮观测,CNN 则结合图像和稠密深度估计更复杂的不可靠区域。随后,以参考视角的稠密深度和标定关系,将各视角图像、深度与置信度重投影到参考视角。系统先对对齐深度进行置信度加权平均,得到融合深度;再检查每个投影深度是否与这份融合几何一致。几何对齐与像素可信程度在这里承担不同职责,不能用其中一项代替另一项。

软可见性使用原文的深度一致性形式:

\[ V_{i\to t}=\sigma\!\left(\frac{(\dot D_t+\delta)-\widehat D_{i\to t}}{\tau_{\mathrm{rel}}(\dot D_t+\epsilon)}\right)+w_{\mathrm{floor}}. \]

这里 \(\dot D_t\) 是融合深度,\(\widehat D_{i\to t}\) 是重投影后的来源深度,\(\sigma\) 为 logistic 函数;\(\delta=1\,\mathrm{m}\) 吸收跨视角误差,\(\tau_{\mathrm{rel}}\) 控制相对深度容忍度,\(\epsilon\) 防止除零,\(w_{\mathrm{floor}}=0.05\) 避免将贡献完全硬截断。来源表面若明显落在融合表面后方,其权重会被压低。这个量是软融合权重,不应把它解读成严格落在 0 到 1 内的概率。

HDR 融合进一步用曝光时间与增益归一化各视角强度,使不同曝光观测处于可比较的辐射尺度,然后以置信度和软可见性的乘积加权归一化。投影无效或几何不可靠的观测只得到受限贡献,而不是凭空补出非重叠区域的信息。缓存中原文式 (5) 的排版抽取有错位,这里保留其操作含义,不把错位文本拼成未经确认的完整公式。

3. 多色调映射细化:让极宽亮度范围进入网络可处理的尺度

初步融合仍可能残留深度边缘错位或局部伪影,而 HDR 线性值的跨度过大,不同亮度部分在一个压缩尺度下不一定都容易处理。作者对同一融合结果应用三种 µ-law 色调映射,参数分别为 \(\mu_1=10^3\)\(\mu_2=5\times10^4\)\(\mu_3=10^6\),再交给 Transformer 组合并细化。三种映射展示的是同一辐射信息的不同压缩版本,不是额外采集了三帧,也不是重新估计跨视角对应。

网络结果经过逆 µ-law 映射返回线性强度域,形成最终 HDR。主文将置信度 CNN 的具体结构、细化网络的内部结构及更多融合细节留在补充材料;本地缓存只有主文,因此不补写层数、通道宽度、注意力配置或逆映射分支细节。

一个完整示例

以三相机拍摄车灯与暗处车辆为例,按原文目标均值规则可计算出 0.05、0.2、0.8 三档目标亮度;这是规则推导示例,不是额外实验读数。低目标亮度视角保住车灯,高目标亮度视角提供车身阴影,中间视角补充普通区域。

同步拍摄后,传感器深度和单目先验生成各视角的稠密度量深度。系统把车身及背景投影到参考视角,降低饱和车灯像素和被车身遮挡背景的权重,对剩余互补观测做曝光归一化与融合,再通过三种色调映射细化输出。若某个表面只在一个视角中可见且该观测也已饱和,这条流程并没有保证恢复真实细节的依据。

损失函数 / 训练策略

可训练模块为置信度网络和 HDR 细化网络。原文采用 9:1 训练/测试划分,先在 40k 合成训练场景上预训练 50 epochs,使用色调映射域的 HDR \(\ell_1\)、SSIM 与梯度损失,同时用深度 \(\ell_1\) 和 SILog 损失监督几何结果;再在 10k 真实训练场景上微调 10 epochs,只使用 HDR 重建损失。优化器为 Adam,学习率 \(10^{-4}\)

这里按原文保留 40k/10k 的训练计数,但它们与后文采集场景、视频帧数的采样关系未在主文中说明,不应当作额外独立采集场景相加。损失权重、训练分辨率及划分粒度等复现细节也不在当前缓存中补造。

实验关键数据

主实验

机器人平台使用六台 12-bit LDR 相机、两台提供伪真值参考的 24-bit HDR 相机,以及 RealSense D455 主动双目和 Ouster OS1 LiDAR。真实 modest-DR 数据含 31 个运动采集场景、15,000 帧;ultra-DR 数据含 80 个静态场景,以时间曝光包围构造 HDR 真值。iPhone 13 Pro 另有 10 个场景,所以真实场景合计为 121。CARLA 数据含六个环境中的 20 段视频、共 15,000 帧,渲染真值有效动态范围超过 150 dB;这不是重建输出已达到该动态范围的声明。

下表摘录原文表 1 的单次采集、三相机设置。PSNR-µ 和 SSIM-µ 在 µ-law 色调映射域评价;与 HDR-VDP 一样,表中数值越高越好。作者说明各基线从头训练,使用相同划分、分辨率、曝光设置、有效掩码和评价域,但 DMEB 额外使用深度输入,比较的是系统能力,并非完全等传感器输入的网络比较。

方法 FPS Modest PSNR-µ Modest SSIM-µ Modest HDR-VDP Ultra PSNR-µ Ultra SSIM-µ Ultra HDR-VDP
HDR Transformer 1.189 33.61 0.872 9.64 38.74 0.848 9.40
SAFNet 53.937 30.96 0.644 7.72 27.39 0.769 9.06
HDRFlow 77.519 27.09 0.541 6.29 27.44 0.617 8.95
AFUNet 0.795 32.25 0.819 9.18 34.69 0.877 9.39
DMEB 13.073 39.40 0.916 9.69 39.17 0.868 9.16

在 modest-DR 上,DMEB 相比 HDR Transformer 的 PSNR-µ 高 5.79 dB;在 ultra-DR 上只高 0.43 dB,而且 SSIM-µ 低于 AFUNet、HDR-VDP 低于 HDR Transformer 和 AFUNet。它不是所有数据和指标上的统一最优,也不是最快的方法。

原文表 3 的合成极端亮度测试提供另一个观察角度:

方法 FPS PSNR-µ SSIM-µ HDR-VDP
HDR Transformer 1.19 32.65 0.830 8.20
SAFNet 53.94 28.21 0.687 6.25
HDRFlow 77.52 26.33 0.475 7.12
AFUNet 0.80 33.52 0.830 8.02
DMEB 9.76 34.72 0.885 8.29

合成数据上 DMEB 的三项质量指标均最高,但其 9.76 FPS 不能概括成所有设置都超过 10 FPS。主文没有在该表旁提供完整测速硬件与开销拆分。

消融实验

原文表 2 在真实 modest-DR 数据上比较几何来源。末列为根据原表计算的相对完整配置差值,单位为 dB。

几何配置 PSNR-µ 距完整配置 含义
Flow 35.84 3.56 无深度输入,使用光流
Mono 37.09 2.31 单目深度
LiDAR-SV 37.90 1.50 单视角 LiDAR 锚定深度
LiDAR-MV 39.40 0.00 完整多视角 LiDAR 引导融合

这组消融支持从光度对应到度量几何、再到多视角融合的逐步收益,但不能据此分离置信度 CNN、软可见性和 Transformer 各自的贡献,因为主文没有提供这些模块的逐一移除实验。

关键发现

  • 同一模型也受益于同步多相机输入:modest-DR 上 HDR Transformer 从单相机多次采集的 31.26 提升到 33.61 dB,AFUNet 从 29.64 到 32.25 dB;DMEB 则从 30.72 到 39.40 dB。时间采集对照由 HDR 真值合成不同曝光的连续帧,不应视为完全相同的物理采集过程。
  • 原文表 4 中,iPhone 公共重叠区域的 PSNR-µ 为 HDR Transformer 23.35、AFUNet 25.21、DMEB 26.12;外部 Choi 双视角数据分别为 26.33、25.39、33.00。33.00 dB 对应 DMEB 无重训练的零样本结果,不能把这一标记自动套给全部基线。
  • 相机数从 3 增至 8 时,图 6 显示可恢复动态范围扩大、SSIM 相对稳定,最终受快门硬件限制。八路输入包含六路 LDR 和两路由 HDR 相机转换得到的 LDR;缓存图形无法可靠读出每个点的数值,因此不编造逐点表格。
  • 在 90 帧人工标注图像上的 YOLOv8 检测中,DMEB Recall/F1 为 0.83/0.73,HDRFlow 为 0.78/0.63,AFUNet 为 0.81/0.67。它提示图像改善能帮助感知,但规模不足以证明完整驾驶或机器人闭环收益。

亮点与洞察

  • 深度传感器在这里不仅输出距离,还使相机能够采用更激进的曝光差。传感器融合的收益发生在采集策略与重建两端,而不只是最终特征拼接。
  • 显式曝光置信度、学习置信度和深度可见性分工清楚。亮度正常却投影到错误表面的观测仍不可靠,这也是只做曝光加权不足的原因。
  • 数据覆盖机器人、消费手机与合成极端光照,能区分硬件配置收益和具体网络收益。将方法定位为数据集的参考系统,比仅强调单个排行榜数字更符合论文贡献。

局限与展望

  • 作者明确要求多相机和深度传感器共享视场;iPhone 定量评价只覆盖公共重叠区域。作者提出未来将 HDR 信息积累到三维场景表示,以探索超越单参考视角的建模方式。
  • 从机制看,标定误差、同步误差、稀疏深度失真和遮挡边界仍会影响融合;单目先验与软权重只能缓解,并不保证补回所有缺失信息。可进一步评测深度噪声、标定扰动及小距离遮挡边界的敏感性。
  • 主文没有置信度、可见性及细化模块的独立消融,也未解释 40k/10k 训练样本计数与采集数据的对应关系。补充材料未包含在缓存中,因此不能据此断言完整论文也缺少所有这些细节。
  • ultra-DR 的感知指标并非全面领先,iPhone 只有 10 个场景,下游检测只有 90 帧。需要更广泛的动态手机场景、跨设备测试和时序稳定性评测来支持更强的部署结论。

相关工作与启发

  • 对比 HDR Transformer、SAFNet、HDRFlow 与 AFUNet:这些方法以不同形式处理对齐和融合,DMEB 则引入外部深度,使几何对应不必依赖极端曝光之间的纹理相似性。优势伴随着额外深度硬件与标定要求。
  • 对比 Choi 等的 Dual Exposure Stereo for Extended Dynamic Range 3D Imaging:两者都利用多相机的互补曝光;本文进一步围绕外部深度引导的可扩展多视角 HDR 构建数据和流程,并在该双视角数据上报告零样本迁移。
  • 联系 Depth Anything V2 与稀疏深度尺度适配:预训练先验负责稠密结构,传感器负责度量锚点。可迁移的思路是让学习先验补足覆盖率,而把决定几何尺度的约束交给真实测量。
  • 资源说明:项目地址来自主文的公开资源声明,本次未联网核验发布状态;缓存未给出可确认的独立代码仓库链接,因此不添加猜测地址。

评分

  • 新颖性: 4/5。将同步互补曝光、外部深度和配套基准组织成完整系统,贡献主要在传感器配置与几何融合的结合。
  • 实验充分度: 4/5。包含真实、合成、手机、外部数据和下游任务,但模块消融与大规模部署证据仍有限。
  • 写作质量: 3/5。整体流程清楚,但主文训练计数解释不足,部分定性比较文字与图注指向不一致,阅读时需对照表格。
  • 价值: 4/5。对已有多相机和深度传感器的机器人有实际参考意义,收益受公共视场、标定和采集条件约束。