跳转至

Don’t Mask Out the Background! Natural-Light Photometric Stereo via Illumination Reconstruction

会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 3D视觉
关键词: 光度立体 / 自然光照 / 环境光重建 / 逆向渲染 / 3D高斯泼溅

一句话总结

针对未标定自然光光度立体(NaPS)中环境光未知的强病态性,本文摒弃将背景扣除的传统做法,利用刚性绑定的相机-物体在多姿态移动中采集的背景观测,通过两阶段 3D 高斯泼溅(3DGS)显式重建连续保距的近场空间光照场,进而利用基于路径追踪的逆向渲染联合优化表面法线、Disney BRDF 材质与深度,在复杂室内近场光照下实现了高精度几何与材质解耦。

研究背景与动机

光度立体技术(Photometric Stereo, PS)通过固定视点下变化光照引起的多张图像明暗变化,高保真地解算物体的表面微观法线与反照率。然而,经典 PS 方法大多依赖实验室暗室中经过严格几何与强度标定的平行定向光源,这种严苛的受控采集环境极大限制了其在工业检测与日常现实场景中的普及。为了打破这一壁垒,自然光光度立体(Natural-light PS, NaPS)作为一种极具落地潜力的方案备受关注:它在未受控且空间复杂的固定室内光照下,通过将相机与待测物体整体刚性绑定并协同旋转或移动,在维持相对视点不变的前提下激发出丰富的光照阴影变化。

但在光照条件完全未知的未标定(uncalibrated)NaPS 设置下,问题具有极强的不适定性(ill-posedness)。室内场景中无处不在的近距台灯、天花板面板灯和显示器等近场光源,彻底打破了远场平行光与经典低频环境贴图(如球谐函数、球形高斯)的假设,引发复杂的空间非均匀光照、自遮挡阴影与强镜面高光。现有的通用学习型 PS 方法(如 UniPS 系列)仅依赖全局隐式光照上下文或启发式先验,不仅无法准确解耦近场光源的空间衰减与几何深度,而且在估计法线、反照率与粗糙度时往往各自为政、缺乏物理自洽性。更为关键的是,长久以来所有 PS 流程均惯性地将前景物体分割出来,将背景像素当作无用噪声直接遮盖扣除,导致画面中直接记录环境光空间分布、光源位置与辐射强度的最核心线索被白白废弃。

本文敏锐地抓住了 NaPS 采集机理的本质特征:既然相机与物体是保持刚性相对静止并在空间中运动的,那么镜头所扫过的周围背景区域,恰好就是全景环视该静态光照环境的多视角天然观测数据。核心 idea:与其将背景当作干扰剔除,不如将其作为空间光场的直接观测源,利用两阶段 3D 高斯泼溅显式重建连续、保距且具备辐射感知的近场光照发射场,从而将极度欠定的未标定 NaPS 转化为物理自洽的高精度逆向渲染联合优化问题。

方法详解

整体框架

本文方法的输入为固定相机-物体相对位姿下采集的 \(N\) 张多角度室内图像 \(\{I_i\}_{i=1}^N\)(通常约为 100 张),输出为目标物体的表面法线场 \(\mathbf{n}\)、双参数 Disney BRDF 材质(反照率 \(\mathbf{a}\)、粗糙度 \(r\))以及深度图 \(z\)。整个算法分为两个核心阶段:第一阶段是背景驱动的 3D 高斯光照场重建,通过 SfM 估计的相机外参,利用背景像素在 3DGRT 框架下拟合 3D 高斯发射器,并经由两阶段色彩优化完整捕捉室内环境的高动态范围(HDR)辐射;第二阶段是固定发射器下的物体几何与材质逆向渲染,保持重建好的 3D 高斯光源冻结,利用可微蒙特卡洛路径追踪、基于高斯中心的高斯混合模型(GMM)/vMF 重点采样以及物体表面可见性判定,端到端联合优化几何法线、反射参数和深度,实现光照、形状与反射特性的物理闭环。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入多视角 RGB 图像序列<br/>相机-物体刚性绑定 + 背景观测"] --> B["两阶段 3D 高斯发射器重建<br/>全场景粗建 + Otsu 亮度阈值高动态拟合"]
    B --> C["高斯先验引导的 vMF 重点采样<br/>GMM 拟合高斯中心 + MIS 多重重要性采样"]
    C --> D["遮挡感知光线追踪与 Disney BRDF 解耦<br/>深度网格投射阴影 + 漫反射与镜面反射分解"]
    D --> E["多任务几何与反射联合优化<br/>对数强度光度损失 + 法线-深度余弦一致性 + TV 正则"]
    E --> F["输出高保真物体几何与材质<br/>表面法线 / 反照率 / 粗糙度 / 深度图"]

关键设计

1. 两阶段 3D 高斯发射器重建:从背景观测中恢复保真 HDR 空间光场 传统逆向渲染通常使用远场环境贴图或低阶球谐函数,不仅无法表达近场光强的距离平方衰减,也难以建模高频锐利的光源边缘;而直接利用 3D Gaussian Ray Tracing (3DGRT) 拟合高动态范围(HDR)图像时,由于数值动态极大,极易导致高斯球在强光源处发散或撕裂背景几何。本文采用 3D 高斯基元(位置 \(\boldsymbol{\mu}_k\)、协方差 \(\boldsymbol{\Sigma}_k\)、不透明度 \(\sigma_k\) 与球谐色彩 \(\mathbf{c}_k\))显式建模环境光场,并设计了两阶段渐进训练策略。第一阶段仅在背景掩码区域监督下训练,采用抗大动态范围波动的对数强度 L1 损失优化全部高斯参数: $\(\mathcal{L}_{\text{stage1}} = \frac{1}{N_b}\sum_{j=1}^{N_b}\bigl|\log(\hat{\mathbf{m}}_j + 1) - \log(\mathbf{m}_j + 1)\bigr|\)$ 其中 \(N_b\) 为背景像素数,\(\hat{\mathbf{m}}_j\) 与 \(\mathbf{m}_j\) 分别为观测与渲染色彩。这一阶段稳健恢复了包含光源物理位置在内的全局背景空间结构。由于自然光下能量绝大部分来自极少数高亮区域(如灯管、窗户),第二阶段通过各基元颜色换算出的亮度 \(Y\) 执行 Otsu 自适应双峰阈值分割,筛选出“高亮度高斯基元(High-luminance Gaussians)”。随后冻结所有基元的几何与低亮颜色,仅微调高亮高斯基元的颜色参数,并采用带梯度阻断(stop-gradient)的归一化加权损失: $\(\mathcal{L}_{\text{stage2}} = \frac{1}{N_b}\sum_{j=1}^{N_b}\frac{\bigl|\hat{\mathbf{m}}_j - \mathbf{m}_j\bigr|}{\text{sg}(\mathbf{m}_j) + \epsilon}\)$ 该机制确保了发射器在高动态主导光源处能够精准收敛,为后续逆向着色提供了物理保真的空间辐射源。

2. 高斯先验引导的 vMF 重点采样:大幅降低蒙特卡洛路径追踪方差 在自然光环境中求解渲染方程,必须在着色点上半球空间对入射辐射进行角向积分。然而室内自然光能量分布极度不均匀,绝大多数半球方向几乎没有有效入射光,若直接采用常规的余弦加权半球采样或纯 BRDF 重要性采样,大量蒙特卡洛(MC)采样光线将被浪费在黑暗区域,造成极高的重渲染方差与强烈的梯度噪点。为了用有限的计算预算高效捕捉主导光源,本文直接利用已重建的 3D 高斯基元中心空间坐标集合,使用包含 \(K=64\) 个分量的高斯混合模型(GMM)进行空间聚类拟合。对于待着色表面点 \(\mathbf{x}\),将第 \(i\) 个高斯分量的均值 \(\boldsymbol{\mu}_i\) 与尺度集中度 \(\kappa_i\) 投影到以 \(\mathbf{x}\) 为原点的单位方向球面上,诱导出对应的 von Mises–Fisher (vMF) 局部方向分布: $\(\hat{\boldsymbol{\mu}}_i = \frac{\boldsymbol{\mu}_i - \mathbf{x}}{\|\boldsymbol{\mu}_i - \mathbf{x}\|}, \quad \hat{\kappa}_i = s \cdot \frac{\kappa_i}{\|\boldsymbol{\mu}_i - \mathbf{x}\|}, \quad \hat{\lambda}_i = \lambda_i\)$ 其中距离权重系数 \(s\) 设为 10,自动赋予距离着色点较近的光源高斯更高的锐度与聚集权重。随后,采用多重重要性采样(MIS)将此 vMF 混合光源采样与表面余弦采样结合,使每像素仅需 256 条采样光线即可在抑制高光噪点的同时准确保留漫反射软阴影。

3. 遮挡感知光线追踪与 Disney BRDF 解耦:自洽分解内蕴材质与自遮挡阴影 近场光照下非凸物体表面普遍存在强烈的自投射阴影(cast shadows)和视点相关的镜面反射高光。若不考虑可见性遮挡,逆向渲染网络极易将投射阴影错误地解释为表面反照率(albedo)的局部变暗,或将强高光当成几何法线的法向偏转。为此,本文将表面反射建模为双参数 Disney BRDF 模型,分解为漫反射率 \(\mathbf{a}(\mathbf{x}) \in [0, 1]^3\) 与基于各向同性 GGX 微表面分布、Schlick 菲涅尔近似和 Smith 几何遮挡项的镜面反射项 \(f_s(\mathbf{x}, \boldsymbol{\omega}_o, \boldsymbol{\omega}_i, r(\mathbf{x}))\),其中粗糙度 \(r(\mathbf{x}) \in [0, 1]\) 调控高光锐度。更重要的是,在每一轮优化时,系统将当前估计的深度图 \(z\) 显式重构为三角表面网格,向采样入射方向 \(\boldsymbol{\omega}_i\) 发射光线求交,计算精确的二值可见性标量 \(V(\mathbf{x}, \boldsymbol{\omega}_i) \in \{0, 1\}\)。最终有效入射光被表示为 \(V(\mathbf{x}, \boldsymbol{\omega}_i) L_i(\mathbf{x}, \boldsymbol{\omega}_i)\),配合可微路径追踪进行正向渲染计算。这一设计建立了严谨的自阴影物理约束,逼迫优化过程用真实的表面凹凸深度去拟合遮挡,从而干净彻底地剥离了反照率与真实阴影。

4. 多任务几何与反射联合优化:构建自监督物理闭环 为了避免在解耦高自由度反照率、粗糙度、法线与深度时陷入几何畸变或棋盘格噪点的局部极小,本文构建了由光度对数重渲染项、法线-深度可微互导项与平滑先验项组成的多任务目标函数: $\(\mathcal{L} = \mathcal{L}_{\text{color}} + \mathcal{L}_{\text{normal}} + \lambda_{\text{smooth}}\mathcal{L}_{\text{smooth}}\)$ 其中光度项在物体前景掩码 \(N_f\) 上计算对数强度 L1 损失,以均衡极亮高光与暗部弱光的监督梯度。几何一致性项 \(\mathcal{L}_{\text{normal}}\) 引入对当前估计深度图 \(z\) 取空间差分求得的伪法线 \(\hat{\mathbf{n}}\),通过余弦相似度直接拉齐优化变量法线 \(\mathbf{n}\): $\(\mathcal{L}_{\text{normal}} = \frac{1}{N_f}\sum_{j=1}^{N_f}\left(1 - \frac{\hat{\mathbf{n}}_j^\top \mathbf{n}_j}{\|\hat{\mathbf{n}}_j\|\|\mathbf{n}_j\|}\right)\)$ 此外,全变差(Total Variation, TV)正则项 \(\mathcal{L}_{\text{smooth}} = \mathrm{TV}(\mathbf{a}) + \mathrm{TV}(r) + \mathrm{TV}(z)\) 作用于反照率、粗糙度和深度,并在前 50 个 epoch 赋予 \(\lambda_{\text{smooth}}=0.01\) 以稳定初期几何结构,后 50 个 epoch 降为 0 以放开高频纹理与细微凹凸的学习,形成了强健的端到端自洽物理优化闭环。

损失函数 / 训练策略

整个优化在单块 NVIDIA RTX 6000 Ada GPU 上执行。背景 3D 高斯发射器两阶段各自训练 30K 次迭代,第一阶段采用 3DGRT 默认学习率,第二阶段将高亮高斯颜色学习率设为 \(1 \times 10^{-1}\)。物体几何与材质逆向渲染阶段共迭代 100 个 epoch(batch size 为 4,总耗时约 2 小时),每像素采样 256 条光线。采用 Adam 优化器,法线 \(\mathbf{n}\)、反照率 \(\mathbf{a}\)、粗糙度 \(r\) 与深度 \(z\) 的初始学习率分别设为 \(5 \times 10^{-4}\)、\(1 \times 10^{-2}\)、\(1 \times 10^{-2}\) 与 \(1 \times 10^{-4}\),并且每 25 个 epoch 学习率减半。反照率与粗糙度参数外接 Sigmoid 激活函数以严格限制在 \([0, 1]\) 物理区间内。表面法线与粗糙度采用 LINO-UniPS 的估计值作为收敛初值,初始深度则通过双边法线积分算法由法线初值恢复,在训练中随着深度图更新每个 epoch 同步刷新可见性求交网格。

实验关键数据

主实验

实验在合成数据集(涵盖 6 种几何形态各异的物体:SPHERE、BEAR、BUDDHA、COW、POT2、READING,以及 3 个真实室内照明环境:LIVING ROOM、STAIRCASE、WHITE ROOM,每物体 150 张 \(512 \times 512\) HDR 图像)和真实世界数据集(CAR、SNOWMAN、LION 三类真实物体,多曝光括号曝光合成 HDR,每物体约 130 视角)上全面展开。对比基线为两大学习型通用光度立体 SOTA 方法:SDM-UniPS 与 LINO-UniPS。评测指标为表面法线平均角度误差(MAngE,单位度,越低越好)、反照率峰值信噪比(PSNR,单位 dB,越高越好)以及粗糙度平均绝对误差(MAbsE,越低越好)。

方法 SPHERE
Norm↓ / Alb↑ / Rgh↓
BEAR
Norm↓ / Alb↑ / Rgh↓
BUDDHA
Norm↓ / Alb↑ / Rgh↓
COW
Norm↓ / Alb↑ / Rgh↓
POT2
Norm↓ / Alb↑ / Rgh↓
READING
Norm↓ / Alb↑ / Rgh↓
平均值 (Average)
Norm↓ / Alb↑ / Rgh↓
SDM-UniPS [15] 2.94 / 27.9 / 0.1070 4.05 / 34.4 / 0.0305 6.52 / 26.2 / 0.1730 4.48 / 29.3 / 0.0700 4.91 / 23.5 / 0.0603 6.60 / 27.8 / 0.0573 4.92 / 28.2 / 0.0830
LINO-UniPS [23] 3.47 / 28.9 / 0.0728 5.81 / 33.7 / 0.0189 7.52 / 24.8 / 0.1090 5.64 / 31.3 / 0.0896 6.36 / 22.6 / 0.0556 7.90 / 29.2 / 0.0502 6.12 / 28.4 / 0.0659
本文方法 (Ours) 1.38 / 34.1 / 0.0341 2.97 / 30.2 / 0.0536 7.31 / 29.3 / 0.1440 1.53 / 30.4 / 0.0276 2.57 / 34.1 / 0.0422 4.32 / 36.8 / 0.0643 3.35 / 32.5 / 0.0610

在真实物体测试中,定性结果与合成测试趋势完全一致:基线模型由于缺少环境光真实约束,反照率图像中残留大量阴影烘焙伪影,而本文方法成功恢复了表面平滑且无明暗串扰的本征颜色,粗糙度图与人眼视觉光泽感高度一致。

视角数量变化实验

探究输入图像数量(40、80、150 个视角)对未标定自然光光度立体性能的影响:

视角数量 (#views) SDM-UniPS [15]
Normal↓ / Albedo↑ / Roughness↓
LINO-UniPS [23]
Normal↓ / Albedo↑ / Roughness↓
本文方法 (Ours)
Normal↓ / Albedo↑ / Roughness↓
40 视角 4.84 / 27.7 / 0.0778 5.96 / 27.9 / 0.0601 5.10 / 23.6 / 0.1250
80 视角 4.79 / 28.2 / 0.0822 6.02 / 28.2 / 0.0659 3.59 / 32.1 / 0.0676
150 视角 4.92 / 28.2 / 0.0830 6.12 / 28.4 / 0.0659 3.35 / 32.5 / 0.0610

消融实验

在合成数据集上验证发射器引导重点采样(Light Sampling)与 3D 高斯发射器两阶段优化(Two-stage Optimization)的核心贡献:

配置 法线误差 (Normal MAngE) ↓ 反照率 (Albedo PSNR) ↑ 粗糙度 (Roughness MAbsE) ↓ 说明
完整模型 (Ours) 3.35° 32.5 dB 0.0610 包含两阶段 3DGS 重建与 vMF/MIS 重点采样
w/o light sampling 3.78° 32.2 dB 0.0731 替换为余弦采样与 GGX 重要性采样的通用 MIS 基准
w/o two-stage 3.59° 25.9 dB 0.0684 仅执行第一阶段单阶段优化,未针对高亮高斯微调颜色

关键发现

  • 打破学习型方法性能瓶颈:本文方法在平均法线角度误差上达到 3.35°,相较于先前最佳模型 SDM-UniPS(4.92°)提升了 31.9%,反照率 PSNR 更是从 28.2 dB 跃升到 32.5 dB(净增 4.3 dB)。这是因为深度学习前馈模型在面对极端室内近场光时,缺乏物理光路支撑,各参数独立推断破坏了光照-法线-反射的一致性;而本文基于逆向渲染的物理闭环保证了强约束。
  • 高动态两阶段重建对材质恢复至关重要:在消融实验中,去掉两阶段优化对法线影响较轻(3.35° 变为 3.59°),但使反照率 PSNR 暴跌 6.6 dB(降至 25.9 dB)。这是因为单阶段高斯训练无法拟合真实室内吸顶灯与窗口的极端高动态辐射,造成环境发射器光强被严重低估,逆向渲染为了弥补光照不足被迫错误抬高反照率,导致严重的亮度和颜色失真。
  • 背景光照累积的正向增益:如视角实验所示,前馈学习方法即使输入图像从 40 帧增加到 150 帧,指标基本完全走平;而本文方法随着视角密集化,背景 3DGS 覆盖的立体环境光更加完整无死角,反照率指标从 23.6 dB 飞跃到 32.5 dB,法线误差收敛至 3.35°,展现了基于环境光重建范式的独特规模化扩展红利。

亮点与洞察

  • “逆向思维”变废为宝的设计哲学:传统光度立体四十年来一直将背景扣除当成第一步标准预处理;本文敏锐地指出在刚性绑定 NaPS 设置中,背景恰恰是记录未知复杂光照场的最优质传感器,将“视点不变、光照变换”的几何劣势转换为“多视点重构环境光场”的绝对优势。
  • 高斯点先验与 vMF 渲染采样的精妙桥接:没有盲目进行低效的全空间光线轮询,而是将 3DGS 基元聚类转化为空间方向的 vMF 概率球分布,利用轻量 GMM 实现了快速且低方差的光线追踪重点采样,巧妙化解了自然光逆向渲染中计算开销与梯度方差的矛盾。
  • 可复用的通用研究范式:该工作提出的“背景重构光场 \(\to\) 冻结发射器 \(\to\) 前景物理可微逆向分解”两阶段管线,不仅适用于光度立体,也可直接平移迁移到任意在未知自然光下进行的手持多视角 3D 重建与神经重光照(Neural Relighting)任务中。

局限与展望

  • 忽略了物体表面复杂的全局互反射(Inter-reflections):当前物理渲染模型仅计算了发射器到表面的单次直射光与自遮挡阴影(Direct Illumination + Cast Shadow),对高反光或内凹复杂结构(如深孔、折角)的多次光线反弹缺乏建模。
  • 可微光线追踪带来较高的优化计算耗时:相比前馈神经网络的秒级推断,本文方法在单 GPU 上需要约 2 小时的迭代优化,在大规模工业实时快照场景下的吞吐受限。
  • 可改进方向:未来可探索引入轻量级神经辐射缓存(Neural Radiance Cache)或学习型粗光场先验来加速可微路径追踪收敛,并结合非局部射线反弹网络补偿高阶间接照明。

相关工作与启发

  • vs SDM-UniPS [15] / LINO-UniPS [23]:此类通用学习型 PS 方法利用多头卷积网络或 Transformer 直接从无背景的前景切片中回归法线与材质。其缺陷在于缺乏物理光线追踪闭环,面对室内近场空间异质光照时极易将阴影烧录在反照率中;本文显式利用背景重建 3D 光源,在真实光路引导下进行逆向渲染,物理自洽性与材质保真度远超纯黑盒预测。
  • vs Spin-UP [26]:Spin-UP 同样针对自然光光度立体,但它要求将相机和物体固定在转盘上绕单轴旋转,且仅仅依靠物体边缘轮廓的先验猜测光源方向;本文允许相机-物体整体在三维空间中进行完全自由的刚体运动,并首创性地从图像背景直接解析完整环境辐射,环境光建模精度与拍摄灵活性均实现质的跨越。
  • vs NeRF 逆向渲染发射器方法 (如 Ling et al. [28] / EnvGS [41]):Ling 等人使用体积 NeRF 表达环境发射器,计算昂贵且难以锐利捕捉微小强光源;EnvGS 侧重于视点合成中的反射着色。本文依托各向异性 3D 高斯基元结合两阶段 Otsu 亮度优化,获得了更轻量、更高动态范围且更利于 GMM/vMF 重点采样的近场空间光照场。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [颠覆性地打破了光度立体领域“背景扣除”的固有定势,首创利用背景高斯重建解决未标定 NaPS]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖 6 种几何物体、3 种室内光照、真机采集及 3 大维度(主评测/视点敏感性/消融)的全面定量验证]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述极其犀利直击痛点,数学公式推导扎实严谨,图表结构清晰完整]
  • 价值: ⭐⭐⭐⭐⭐ [为无受控暗室环境下的日常工业质检与真实世界高精度 3D 材质数字化提供了极具前景的物理落地范式]