跳转至

LumiDepth: Stable Monocular Depth in Multi-Illumination Scenes

会议: ECCV 2026
论文: ECCV 2026
代码: https://drive.google.com/drive/folders/1-3txE3KiFiscACxs1Xch8UO1Ax82VBNg
领域: 3D视觉
关键词: 单目深度估计、多照明场景、扩散基础模型、免标签学习、频域一致性

一句话总结

针对真实多光源与变照度场景下深度估计严重失真的难题,LumiDepth 提出在免目标域真值深度的设定下,利用分歧校准概率伪监督(DCPS)与频域解耦一致性蒸馏(FaCD)从同场景多光照 RGB 图像组中自监督学习光照不变且保几何细节的单目深度。

研究背景与动机

单目深度估计(MDE)近年来随着大规模 RGB-D 预训练的深度基础模型(如 MiDaS、Depth Anything、Marigold、Lotus)取得了巨大突破。然而,这些模型绝大部分是在光照相对均匀的数据集上训练的。在真实的机器人操作工作台或夜间自动驾驶场景中,往往同时存在多个空间分布各异的光源,剧烈投射的阴影、高光镜面反射以及局部曝光突变会极大扭曲物体表面的表观线索。由于现有模型倾向于将表面明暗与光度纹理误当成几何结构,在光照变化下极易产生严重变形、结构缺失甚至完全失效的几何伪影。

直接解决这一痛点的常见思路面临双重障碍:一方面,真实多光源场景的高质量密集深度真值(GT)极难采集,现实中多照明 RGB-D 配对数据严重匮乏;另一方面,利用现有多光源重光照(relighting)生成模型进行数据增广,往往只注重视觉真实感而缺乏几何物理约束,容易在局部纹理中引入破坏几何线索的合成伪影。与此同时,单纯沿用视频深度估计的光流对齐或时间平滑约束,也无法适应静态场景中无几何位移却存在剧烈光照跃迁的现实情况。

本文的切入点在于:同一个静态场景在不同照明下的几何本质是完全相同的,应当直接从无深度标签的同场景多光照 RGB 组中挖掘不变先验。核心 idea:通过分歧校准概率伪监督(DCPS)筛选高置信假设并保留伪标签多样性,再借助频域感知一致性与蒸馏(FaCD)在低频对齐全局几何、在高频双向阻断梯度蒸馏结构细节,实现免真值深度的稳定几何学习。

方法详解

整体框架

LumiDepth 基于潜空间扩散模型(以 Marigold 和 Lotus 为骨干架构)构建。训练时输入包含常规带真实标签的均匀光照 RGB-D 样本,以及同静态场景在多种不同照明下的纯 RGB 图像组 \(\mathcal{G} = \{\mathbf{x}_1, \dots, \mathbf{x}_N\}\)。系统首先通过冻结部分参数的预训练模型为图像组生成多个候选深度假设,利用 DCPS 模块度量跨光照差异度,剔除不可靠预测并按置信度概率采样构建高质量伪标签;随后在扩散去噪训练中引入 FaCD 模块,将预测深度解耦为低频分量与高频分量,低频对齐形状,高频以双向 stop-gradient 机制将可靠边缘特征向不稳定视角蒸馏,在不引起过度平滑的前提下消除光照干扰。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多光照RGB图像组<br/>G = {x1, ..., xN}"] --> B["分歧校准概率伪监督 (DCPS)<br/>跨光照分歧度量 + 自适应过滤 + 概率采样"]
    B --> C["基础扩散去噪网络<br/>U-Net 条件去噪学习"]
    C --> D["频域感知一致性与蒸馏 (FaCD)<br/>低频几何对齐 + 高频梯度双向蒸馏"]
    D --> E["输出光照不变且锐利的深度图"]

关键设计

1. 分歧校准概率伪监督:自适应剔除离群点并维持监督多样性

在多光照图像组 \(\mathcal{G}\) 中,不同光照对模型各部位的干扰程度不同。若直接取所有预测的均值或中位数,不可靠的畸变假设会被引入并导致几何结构被平滑;而若贪婪选择单个方差最小的“最佳”预测,又极易过拟合到某一特定光照下的虚假高置信伪影。DCPS 首先计算每个候选深度 \(\mathbf{d}_i\) 相对组内其余样本的均方误差 \(v_i = \frac{1}{N-1}\sum_{j \neq i} \|\mathbf{d}_i - \mathbf{d}_j\|_2^2\) 作为分歧不确定性。接着,采用自适应样本分位数阈值 \(\tau = \mathrm{median}(\{v_i\}_{i=1}^N)\) 剔除高于中位数的不可靠预测,保留至少 \(N/2\) 个候选样本并重索引为 \(\{\mathbf{d}_1, \dots, \mathbf{d}_K\}\)(不确定性对应为 \(u_k\))。最后,通过带温度超参 \(T\) 的 softmax 将不确定性转化为归一化置信权重: $\(\rho_k = \frac{\exp(-u_k / T)}{\sum_{j=1}^K \exp(-u_j / T)}\)$ 并在每次迭代中根据分类分布 \(k^* \sim \mathrm{Categorical}(\rho_1, \dots, \rho_K)\) 随机抽取一个候选作为伪标签 \(\mathbf{d}^{\mathrm{pseudo}} = \mathbf{d}_{k^*}\)。这种隐式集成既避免了单一样本偏见,又杜绝了直接平均带来的边缘模糊。

2. 频域感知一致性与蒸馏:解耦全局几何对齐与高频细节迁移

简单的跨光照全图一致性约束(如直接拉近潜空间向量或深度图的二范数距离)是过度正则化的主要元凶——模型会倾向于丢弃高频边界来迎合高光或阴影造成的表观差异,导致深度变得平滑无细节。FaCD 将预测深度解码至真实深度空间 \(\hat{\mathbf{d}}_1 = \mathcal{D}(\hat{\mathbf{z}}_1)\) 和 \(\hat{\mathbf{d}}_2 = \mathcal{D}(\hat{\mathbf{z}}_2)\),并通过低通高斯滤波算子 \(\mathcal{LPF}(\cdot)\) 提取低频平滑几何,定义低频一致性损失: $\(\mathcal{L}_{\mathrm{LF}} = \big\|\mathcal{LPF}(\hat{\mathbf{d}}_1) - \mathcal{LPF}(\hat{\mathbf{d}}_2)\big\|_1\)$ 对于高频结构,利用深度梯度计算边缘幅值 \(g_i = \|\nabla \hat{\mathbf{d}}_i\|\) 并根据阈值 \(\tau_d\) 生成显著边缘掩膜 \(\mathbf{M}_i = \mathbb{I}(g_i > \tau_d)\)。为了防止光照缺陷造成的损坏边缘反向污染可靠视角,FaCD 引入了基于 DCPS 置信度权重 \(\rho\) 的非对称梯度阻断(stop-gradient)双向蒸馏: $\(\mathcal{L}_{\mathrm{HF}} = \rho_2 \big\|\nabla \hat{\mathbf{d}}_1 - \mathrm{sg}[\nabla \hat{\mathbf{d}}_2]\big\|_{1, \mathbf{M}_2} + \rho_1 \big\|\nabla \hat{\mathbf{d}}_2 - \mathrm{sg}[\nabla \hat{\mathbf{d}}_1]\big\|_{1, \mathbf{M}_1}\)$ 更可靠的预测分支作为教师提供更强的监督信号,使清晰且真实的边缘能够无损迁移至受光照退化的视角。

损失函数 / 训练策略

模型的总训练目标包含均匀光照合成真值监督、多光照伪监督以及频域一致性蒸馏三部分: $\(\mathcal{L}_{\mathrm{total}} = \mathcal{L}_{\mathrm{GT}} + \lambda_1 \mathcal{L}_{\mathrm{pseudo}} + \lambda_2 \mathcal{L}_{\mathrm{LF}} + \lambda_3 \mathcal{L}_{\mathrm{HF}}\)$ 在全部实验中固定权重超参 \(\lambda_1 = 0.5\)、\(\lambda_2 = 0.5\)、\(\lambda_3 = 0.1\)。训练时冻结 VAE 的编码器、解码器以及去噪 U-Net 的前两层下采样块,仅更新核心去噪特征层。低通滤波器采用核尺寸 11、\(\sigma = 10\) 的高斯滤波,边缘梯度截断阈值 \(\tau_d = 0.05\)。

实验关键数据

主实验

为了客观衡量多照明环境下的几何稳定性,作者提出了平均深度变化度量 \(\mathrm{MeanDV} = \frac{1}{N} \sum_i v_i\) 与最大单图偏差度量 \(\mathrm{MaxPIV} = \max_i v_i\)。在真实多光照基准 ReMID 及两个夜间驾驶基准(NuScenes-Night、RobotCar-Night)上的零样本评估如下表所示:

方法 ReMID MeanDV↓ ReMID MaxPIV↓ ReMID AbsRel↓ ReMID \(\delta_1\)↑ NuScenes-N AbsRel↓ NuScenes-N \(\delta_1\)↑ RobotCar-N AbsRel↓ RobotCar-N \(\delta_1\)↑
DAv2 [65] 0.051 0.076 0.119 0.857 0.262 0.707 0.242 0.514
DAv3 [36] 0.049 0.075 0.118 0.862 0.270 0.695 0.235 0.520
GenPercept [62] 0.052 0.088 0.111 0.880 0.256 0.584 0.228 0.663
DA-AC [51] 0.047 0.080 0.117 0.876 0.241 0.719 0.227 0.557
Marigold [26] 0.101 0.188 0.181 0.726 0.308 0.506 0.267 0.605
LumiDepth (n-step) 0.057 0.097 0.138 0.825 0.274 0.585 0.254 0.632
Lotus [20] 0.043 0.074 0.113 0.850 0.280 0.580 0.245 0.656
Lotus [20] (st) 0.048 0.085 0.120 0.835 0.306 0.554 0.289 0.632
LumiDepth (1-step) 0.030 0.055 0.085 0.914 0.223 0.636 0.217 0.676

消融实验

表 6 和表 7 验证了伪标签筛选机制与频域解耦设计的有效性:

配置 / 变体 ReMID AbsRel↓ ReMID \(\delta_1\)↑ NuScenes-N AbsRel↓ 说明
DCPS 采样策略消融
候选均值(Mean) 0.092 0.909 0.265 混入畸变假设导致整体模糊
候选几何中位数(Median) 0.091 0.911 0.262 离群点鲁棒但仍缺乏多样性
最小方差单选(Best) 0.088 0.912 0.245 易过拟合单一高置信光照伪影
DCPS 概率采样(完整) 0.085 0.914 0.223 自适应滤除离群点后概率加权集成
FaCD 一致性策略消融 (n-step)
潜空间直接约束(Latent) 0.365 0.629 0.738 强行对齐潜空间,几何严重退化崩溃
解码深度直接约束(Depth) 0.274 0.692 0.520 频域不解耦,高频细节被抹平
仅低频一致性(\(\mathcal{L}_{\mathrm{LF}}\)) 0.145 0.818 0.282 仅对齐轮廓,缺失精细边界
仅高频蒸馏(\(\mathcal{L}_{\mathrm{HF}}\)) 0.170 0.766 0.289 缺乏全局尺度约束,绝对误差上升
FaCD 完整模块 0.138 0.825 0.274 兼顾低频几何对齐与高频边界保留

关键发现

  • 单纯增加无标签多光照图像进行朴素自训练(Lotus st)反而因错误监督导致性能下滑(ReMID MeanDV 从 0.043 劣化至 0.048,AbsRel 从 0.113 劣化至 0.120),证明在缺乏几何约束时伪标签噪声极其有害,而 DCPS+FaCD 带来了实质性正向增益。
  • 频域解耦是防止模型退化的核心关键。在潜空间强制拉近特征会造成模型崩溃(AbsRel 升至 0.365),而在深度图上不分频域直接拉近距离会导致平滑模糊(AbsRel 为 0.274),仅有将低频对齐与高频有向梯度蒸馏解耦才能取得 0.138 的优异性能。
  • 该方案不仅适配生成式扩散模型,作为即插即用插件应用到判别式模型 DAv2 时,同样将 MeanDV 从 0.051 降低到 0.036,展现出很强的骨干无关性。

亮点与洞察

  • 置信度分歧度量与概率采样机制:利用跨照明视角的一致性方差构建无监督不确定度指标,并引入中位数阈值保证候选集动态有界,巧妙利用随机采样实现跨训练步的隐式集成,杜绝了硬平均带来的模糊。
  • 高频梯度的非对称阻断蒸馏:打破传统对称对齐容易互相污染的缺陷,利用置信度加权以及 stop-gradient 机制将可靠视角的边缘梯度单向蒸馏给退化视角,实现了跨恶劣照度的边缘保护。
  • 构建高规格多照度评估基准 ReMID:填补了单目深度领域缺乏真实物理同场景多照明 RGB-D 评测基准的空白,并提出 MeanDV 与 MaxPIV 指标,全面刻画平均与极端光照下的几何稳定性。

局限与展望

  • 对输入图像组的光照多样性存在依赖:DCPS 的置信度评估建立在同组内光照具有足够区分度与多源分布的前提上;若同一场景采集的光照条件高度同质化或全部处于极暗状态,分歧度量可能失去区分度。
  • 训练开销相比单帧模型有所增加:训练阶段需要对每组多幅图像进行前向推理以构建伪监督信号与频域损失,对显存管理和批处理流水线提出了更高要求。
  • 未来方向:可进一步探索如何将这种频域自监督机制扩展到动态运动场景中的光照解耦,或融合物理渲染先验以增强极端强逆光下的深度泛化能力。

相关工作与启发

  • vs Depth Anything 系列 (DA / DAv2 / DAv3):DA 系列依赖海量网络弱标注与强教师判别模型,但在未知暗光与强高光极端场景下仍会产生局部形变;LumiDepth 无需目标域密集真值,通过组内自监督使模型在变照度下的鲁棒性大幅提升。
  • vs Marigold / Lotus:作为扩散基础模型的代表,Marigold 和 Lotus 极易受局部阴影反光误导将亮暗边缘当成深度跳变;LumiDepth 继承了其强大的生成几何先验,并通过 FaCD 修正了表观诱导的虚假几何。
  • vs 视频深度一致性方法:传统视频方法强依赖相机位姿或光流场,而 LumiDepth 专攻无运动、纯光照跳变的静态多源环境,拓展了跨表观扰动的一致性学习范畴。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [提出专门解决多照明单目深度不稳定性的无监督学习框架,DCPS 与 FaCD 的频域解耦构思巧妙]
  • 实验充分度: ⭐⭐⭐⭐⭐ [自建真实 ReMID RGB-D 数据集,涵盖极端光照、夜间驾驶及 RoboDepth 18 种噪声鲁棒性全面验证]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑链条严密,数学表达简练清晰,图表与实验支撑非常扎实]
  • 价值: ⭐⭐⭐⭐⭐ [攻克了机器人与自动驾驶落地中光照突变致盲的实际安全痛点,免真值设计实用性极高]