Bridge-UniPS: Bridging Calibrated Photometric Stereo toward Universal Photometric Stereo¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D视觉
关键词: 泛日光度立体 / 校准光度立体 / 表面法线估计 / 动态神经查询 / 物理先验中间表示
一句话总结¶
Bridge-UniPS 提出了一种将泛日光度立体(UniPS)桥接到校准光度立体(CPS)的新范式,通过可学习的光照适配器将任意未知光照图像转化为 CPS 兼容的桥接图像-光照对,并在无中间监督下借助冻结的预训练 CPS 网络反传梯度,实现了物理可解释且高精度的表面法线估计。
研究背景与动机¶
光度立体技术(Photometric Stereo, PS)通过固定视点下不同光照方向的图像序列恢复物体表面高精度法线。传统的校准光度立体(CPS)与非校准光度立体(UPS)虽然在理想平行光假设下展现出极高的重建精度,但严格依赖精确的光源标定或理想光照物理模型,难以走出受控的暗室实验室环境。为了推动 3D 表面几何捕获走向开放真实场景,泛日光度立体(Universal PS, UniPS)应运而生,其目标是直接从任意未知、复杂非受控光照的图像序列中恢复表面法线。
然而,现存的 UniPS 方法大多采用纯粹端到端的数据驱动架构(如基于全局特征汇聚或 Transformer 隐式光照 token 的设计),在估计法线的同时隐式回归环境光照。这种纯黑盒学习范式面临两项根本瓶颈:第一,缺乏显式且具物理约束的中间表征,使得光照与表面几何高度耦合,极易在分布偏移或复杂未知照明下陷入几何歧义与不适定性;第二,依赖全局统计特征或抽象 token 往往抹杀了对于细粒度几何至关重要的局部光度变化(如局部阴影与微弱高光梯度)。
本文的核心洞察在于:现代预训练 CPS 网络在其权重中已经隐式固化了极其强大且严密的「定向光照-反射-几何」物理先验;与其让 UniPS 从零在未知光照中盲目拟合,不如将非受控观测转化为一组符合标准 CPS 输入假定的虚拟「桥接图像-光照对」。核心 idea:设计无显式中间监督的任务驱动光照适配器,以目标光照向量为神经查询从非受控观测中动态检索并重构 CPS 兼容的虚拟观测,借由冻结的预训练 CPS 网络提供物理梯度反馈,从而将高精度物理 CPS 先验无缝桥接至泛日真实场景。
方法详解¶
整体框架¶
Bridge-UniPS 的整体流水线划分为两个核心阶段:可训练的任务驱动光照转换阶段(Task-driven Lighting Transformation Stage)与冻结的校准光度立体阶段(Frozen Calibrated PS Stage)。
在第一阶段中,输入包含 \(N_{in}\) 张在任意非受控光照下拍摄的图像序列 \(\mathbf{I} \in \mathbb{R}^{N_{in} \times 3 \times H \times W}\)。骨干网络 ConvNeXt 提取多尺度图像特征,并通过上半球等面积采样预设固定数量的目标光照方向,生成光照嵌入特征。随后,动态神经查询模块(Dynamic Neural Query, DNQ)以目标光照为 Query,自适应评估输入图像与目标光照的物理兼容性,检索最具信息量的像素级特征,并结合注意力引导的多尺度跳跃连接解码生成 \(N_{out}\) 组虚拟桥接图像及其对应的标准光照方向 \((\mathbf{B}, \mathbf{L})\)。在第二阶段中,生成的桥接图像-光照对直接送入参数完全冻结的预训练 CPS 网络(Norm-PSN),输出最终表面法线图 \(\mathbf{N} \in \mathbb{R}^{3 \times H \times W}\)。整个系统仅在最终预测的法线上施加监督,梯度穿过冻结的 CPS 网络反向回传以约束光照适配器。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入非受控光照图像序列<br/>N_in × 3 × H × W"] --> B["ConvNeXt 多尺度特征提取<br/>提取特征 F 与全局置信度 G"]
B --> C["目标光照先验与图像兼容性评估<br/>上半球等面积采样与光照-图像相似度 S"]
C --> D["动态神经查询与注意力引导跳跃连接<br/>光照引导交叉注意力与Top-K可靠性筛选"]
D --> E["桥接图像-光照对<br/>N_out 组虚拟图像 B 与目标光照方向 L"]
E --> F["冻结的校准光度立体阶段<br/>预训练 Norm-PSN 物理网络"]
F --> G["预测表面法线 N<br/>余弦损失与 L1 损失反传优化适配器"]
关键设计¶
1. 目标光照先验与图像兼容性评估:构建定向光线锚点并过滤低质观测
为了让任意光照的观测能够映射到校准光度立体的输入空间,适配器必须首先定义一组规范的目标光照方向。基于经典光度立体数据集中超过 95% 的有效光照均位于正面半球(\(z > 0.6\))的物理规律,作者在上半球区域进行 \(N_{light}=64\) 个等面积均匀采样(Equiareal Sampling),并通过 MLP 映射为多通道光照特征 \(\mathbf{F}_l \in \mathbb{R}^{N_{light} \times C \times L}\)。与此同时,对于输入的每一张观测图像,网络通过两路轻量 MLP 分别沿通道和空间维度压缩特征,生成全局图像置信度矩阵 \(\mathbf{G} \in \mathbb{R}^{N_{light} \times N_{in}}\),用于度量图像在不同目标光照下的有效性与可靠性。
在此基础上,为了评估输入图像与指定目标光照之间的物理兼容性,网络利用通道 MLP 与空间卷积从原始图像特征中提取精炼 Key \(\mathbf{K}\) 并求空间均值得到 \(\bar{\mathbf{K}} \in \mathbb{R}^{N_{in} \times C}\),与光照特征 \(\mathbf{F}_l\) 计算内积并融合全局置信度,得到兼容性相似度矩阵: $\(\mathbf{S}_{j,i} = \text{Einsum}(\mathbf{F}_{l,j}, \bar{\mathbf{K}}_i) + \mathbf{G}_{j,i}\)$ 分数 \(\mathbf{S}_{j,i}\) 直观地反映了第 \(i\) 张输入图像对解释目标光照 \(j\) 下光度现象的适宜程度,为后续特征的有选择性检索与抑制无关阴影/伪影噪声奠定了依据。
2. 动态神经查询与注意力引导跳跃连接:按目标光照自适应检索特征并保真细节
在生成特定目标光照下的桥接图像时,全局均值池化会抹平高频细节,而盲目拼接所有图像又会引入互不兼容的光影干扰。动态神经查询模块将目标光照特征 \(\mathbf{F}_l\) 沿空间展开作为 Query 向量 \(\mathbf{Q} \in \mathbb{R}^{L \times N_{light} \times C}\),原始多帧特征与其精炼 Key 分别作为 Value \(\mathbf{V}\) 与 Key \(\mathbf{K} \in \mathbb{R}^{L \times N_{in} \times C}\),执行多头交叉注意力检索 \(\mathbf{T} = \text{Attn}(\mathbf{Q}, \mathbf{K}, \mathbf{V})\)。为了避免不一致观测强行融合成模糊影像,系统利用相似度分数 \(\mathbf{S}\) 进行阈值过滤(\(\mathbf{S} > 0.8\))并保留 Top-K 个最具物理一致性的有效观测,生成离散选择掩码。
针对解码阶段易丢失空间高频边缘与微观几何的问题,解码器结构对称匹配 ConvNeXt 编码器,并创新性地利用交叉注意力权重矩阵 \(\mathbf{A} \in \mathbb{R}^{L \times N_{out} \times N_{in}}\) 构建光照感知跳跃连接。在每个解码尺度 \(s\),将注意力权重双线性插值到对应空间分辨率 \(L_s = H_s W_s\) 得到 \(\mathbf{A}^{(s)}\),并对来自编码器的多尺度跳跃特征 \(\mathbf{F}^{(s)}\) 进行空间自适应加权聚合: $\(\mathbf{F}_{\text{skip}}^{(s)} = \sum_{i=1}^{N_{in}} \mathbf{A}^{(s)}_{:,:,i,:} \odot \mathbf{F}^{(s)}_{:,i,:,:}\)$ 该设计使得解码出的每一张虚拟桥接图像不仅具有全局一致的光照方向,而且能够精准继承原始观测中与该光照方向最契合的局部微观几何纹理。
3. 无显式中间监督的任务驱动桥接:借助冻结CPS网络反向传播诱导物理对齐
在训练该桥接流水线时,最直接的想法可能是利用合成数据去监督桥接图像与真实点光源图像一致。然而,真实未知场景的 BRDF 与环境光极其复杂,人工合成的点光源图像往往存在严重的域差距。Bridge-UniPS 采取了完全无中间监督(No Intermediate Supervision)的端到端任务驱动策略:在中间生成的桥接图像 \(\mathbf{B}\) 和目标光照向量 \(\mathbf{L}\) 上不加任何直接监督损失,而是直接送入完全冻结的预训练 CPS 网络 \(\mathcal{P}\)(如 Norm-PSN)预测表面法线: $\(\mathbf{N} = \mathcal{P}(\mathbf{B}, \mathbf{L})\)$
整个网络仅使用真实表面法线 \(\mathbf{N}_{gt}\) 计算最终任务损失: $\(\mathcal{L} = \gamma \mathcal{L}_{\cos}(\mathbf{N}, \mathbf{N}_{gt}) + \|\mathbf{N} - \mathbf{N}_{gt}\|_1\)$ 由于预训练 CPS 网络 \(\mathcal{P}\) 的权重被严格锁定,其内部固化的物理正向映射函数如同一座天然的「物理鉴别器」与微分求解器。梯度只能沿着 CPS 模型的物理传导路径反向传递至光照适配器,迫使适配器自动生成符合 CPS 模型输入分布、光影关系严谨自洽且稳定消除了非朗伯干扰的高保真桥接图像。
损失函数 / 训练策略¶
模型训练采用两部分组合的表面法线误差作为端到端目标函数: $\(\mathcal{L} = \gamma (1 - \cos(\mathbf{N}, \mathbf{N}_{gt})) + \|\mathbf{N} - \mathbf{N}_{gt}\|_1\)$ 其中第一项为余弦相似度损失,第二项为 \(L_1\) 绝对误差损失。
模型主要在 Uni-MS-PS 数据集训练集上训练,同时加入来自经典点光源合成集 PS-Sculpture 和 PS-Blobby 的约 10,000 个样本(占比约 10%)以维持基础光照物理保真度。优化器使用 AdamW,初始学习率设为 \(1 \times 10^{-5}\),每 20 个 epoch 乘以 0.8 衰减,批大小为 12。为增强对不同观测数量的鲁棒性,每批输入图像数量 \(N_{in}\) 在 6 到 24 之间随机采样。模型在 4 张 NVIDIA A100 GPU 上训练 140 个 epoch,耗时约 9 天。
实验关键数据¶
主实验¶
论文在受控点光源基准 DiLiGenT 和复杂非受控近场光照基准 LUCES 上分别进行了定量对比。指标采用平均角度误差(Mean Angular Error, MAE,单位为度 \(^\circ\),越低越好)。
在经典点光源基准 DiLiGenT 上,即便面对专门针对定向光源设计的 Calibrated / Uncalibrated SOTA 方法,Bridge-UniPS 仅需 16 张输入图像即可取得全场最优性能;在完整图像输入下,平均 MAE 进一步降至 \(4.3^\circ\)。
| 方法 | 任务范式 | 输入图像数 | Buddha | Goblet | Harvest | Reading | 平均 MAE (↓) |
|---|---|---|---|---|---|---|---|
| JS22 (Norm-PSN) | Calibrated | 96 | 7.1 | 7.5 | 12.3 | 9.9 | 6.8 |
| LL22a | Calibrated | 96 | 8.0 | 6.7 | 14.9 | 8.8 | 6.5 |
| JS23 (GR-PSN) | Uncalibrated | 96 | 6.7 | 6.8 | 12.0 | 9.7 | 6.6 |
| LL22b | Uncalibrated | 96 | 9.3 | 7.1 | 14.6 | 10.5 | 7.1 |
| IK22 (SDM-UniPS) | Universal | 96 | 19.4 | 24.2 | 25.2 | 18.8 | 14.7 |
| IK23 | Universal | 96 | 7.5 | 8.5 | 10.2 | 8.2 | 5.8 |
| LC25 (LINO-UniPS) | Universal | 96 | 6.2 | 5.2 | 8.6 | 6.7 | 4.7 |
| Ours (Bridge-UniPS) | Universal | 96 | 5.2 | 6.2 | 6.5 | 5.2 | 4.3 |
| Ours (K=16) | Universal | 16 | 5.3 | 6.5 | 6.7 | 5.5 | 4.5 |
| Ours (K=4) | Universal | 4 | 7.2 | 8.8 | 9.1 | 7.6 | 6.0 |
在高度非线性的近场光源非受控基准 LUCES(14 个物体场景,包含大量金属强反光材质)上,Bridge-UniPS 展现出对复杂非受控照明的强大泛化能力:
| 方法 | 任务类型 | Bell (金属) | Bowl | Cup (高反光) | House (复杂几何) | Squirrel | 平均 MAE (↓) |
|---|---|---|---|---|---|---|---|
| IK22 | Universal | 24.12 | 23.84 | 28.64 | 35.93 | 25.36 | 23.77 |
| IK23 | Universal | 12.76 | 8.44 | 19.67 | 26.07 | 16.01 | 13.50 |
| HQ24 (Uni-MS-PS) | Universal | 10.52 | 6.98 | 13.68 | 25.29 | 11.36 | 11.21 |
| LC25 (LINO-UniPS) | Universal | 8.78 | 6.96 | 8.15 | 22.91 | 10.25 | 9.43 |
| Ours (Bridge-UniPS) | Universal | 4.78 | 3.97 | 4.92 | 16.08 | 7.43 | 7.11 |
消融实验¶
论文对下游光度立体范式、光照适配器各组件以及关键控制变量进行了系统性消融评测(表 4):
| 配置 / 变体 | 考察维度 | DiLiGenT MAE (↓) | LUCES MAE (↓) | 说明 |
|---|---|---|---|---|
| Norm-PSN (Full model) | 完整模型 | 4.3 | 7.1 | 基于学习型 CPS 的完整架构 |
| Woodham (1980) | 下游 PS 范式 | 9.2 | 14.1 | 传统经典 CPS,严格朗伯假设导致非朗伯伪影 |
| SCPS-NIR | 下游 PS 范式 | 6.5 | 12.3 | 基于学习的非校准 UPS 模型 |
| GR-PSN | 下游 PS 范式 | 5.8 | 10.8 | 强 SOTA 学习型 UPS 模型 |
| CNN-PS | 下游 PS 范式 | 5.4 | 9.7 | 经典全卷积学习型 CPS 模型 |
| w/o dynamic query | 模块消融 | 6.3 | 12.5 | 禁用动态神经查询,退化为无自适应筛选的多层注意力 |
| w/o top-K selection | 模块消融 | 5.6 | 9.4 | 移除基于置信度与相似度分数的候选过滤 |
| w/o pixel feat | 模块消融 | 4.8 | 7.9 | 移除图像级像素特征分支 |
| w/o global conf | 模块消融 | 4.7 | 8.1 | 移除图像全局质量置信度评估矩阵 |
| w/o point-light data | 控制变量 | 4.4 | 7.1 | 训练时不混入点光源雕塑/Blobby数据,性能几乎未降 |
| learnable latent tokens | 控制变量 | 4.7 | 8.4 | 目标光照改为无物理意义的可学习隐式向量 |
| unfrozen CPS | 控制变量 | 5.4 | 7.9 | 解冻下游 CPS 网络参与端到端微调(出现过拟合/协同退化) |
| shuffled bridge pairing | 控制变量 | 44.5 | 43.8 | 随机打乱桥接图像与目标光照矢量的配对关系(出现灾难性崩溃) |
关键发现¶
- 动态神经查询(DNQ)是性能的核心支柱:消融实验显示,一旦去掉动态神经查询,模型在 DiLiGenT 上误差由 4.3 骤升至 6.3,在 LUCES 上更是从 7.1 暴跌至 12.5。可视化表明,失去 DNQ 后生成的桥接图像失去了定向平行光特征,光影变得杂乱无序。
- 图像与光照配对具有严密的物理真实性,绝非单纯图像增强:在控制实验中,将生成的桥接图像与其目标光照向量随机打乱(shuffled pairing),重建法线误差急剧飙升至 \(44.5^\circ\) 和 \(43.8^\circ\)。这从反面强力证明:适配器生成的桥接图像绝非碰巧讨好下游网络的伪特征,而是与给定光照方向保持了高度精确的物理几何渲染对应关系。
- 冻结 CPS 比微调 CPS 表现更好:将下游 CPS 网络一同解冻训练反而导致在 DiLiGenT 上退化至 5.4、LUCES 上退化至 7.9。原因在于联合微调引发了适配器与法线估计器的「共适应(co-adaptation)」退化,破坏了 CPS 原本严谨物理映射所充当的强约束作用。
- 跨物体对比度统计稳定化机制:论文统计了 DiLiGenT 各物体在原始图像与桥接图像上的光度对比度(标准差)。原本不同材质(如金属高反光 Goblet 与漫反射 Pot2)的对比度差异巨大,经适配器转换后,所有物体的对比度均值与中位数均稳定在 0.31-0.37 的极窄区间。这证明适配器在内部完成了反射特性的归一化与环境光抑制。
亮点与洞察¶
- 任务驱动的「无监督物理桥接」思想极具启发性:以往跨域重照明方法通常依赖庞大的配对渲染数据集进行显式像素重构监督。Bridge-UniPS 证明了无需任何中间真实光照真值,仅凭冻结的物理求解器反向传播的任务梯度,就能自发引导前置神经网络掌握复杂环境光到平行光源的物理重构映射。
- 光照引导的特征检索与跳跃连接设计精妙:将预设光照先验当作 Query 在多帧输入中检索证据,并直接将该注意力权重作为多尺度特征跳跃连接的动态门控,兼顾了光照方向的全局约束与原始观测微观几何纹理的低损耗传递。
- 强鲁棒性与少输入实用性:在仅有 16 张甚至 4 张输入的情况下仍能超越此前依赖 96 张全图输入的 SOTA 方法,极大降低了实际三维高精扫描的数据采集门槛。
局限与展望¶
- 弱光度变化与漫射环境光主导场景下的敏感度限制:当实际采集环境完全处于均匀漫射的柔光箱或弱环境光下、各图像之间缺乏显著的光度明暗差异时,光照适配器难以捕捉到足够的阴影与高光几何线索,容易导致法线平滑化。
- 计算与显存开销:由于需要同时生成并缓存多张具有多尺度特征的桥接图像送入 CPS,在训练期间显存占用较高,训练周期达到 9 天(4×A100)。
- 未来方向:探索针对微弱光度变化的敏感度增强策略,以及将桥接范式扩展至近距离多视点立体视觉或带有未知阴影的野外大场景三维重建中。
相关工作与启发¶
- vs. LINO-UniPS (LC25):LINO-UniPS 采用纯 Transformer 结构,通过 light register tokens 和交错注意力在端到端黑盒中推断光照与法线;Bridge-UniPS 则摒弃黑盒求解,通过动态查询将未知光照显式解耦为虚拟桥接图像-光照对,并复用成熟的 CPS 先验,在复杂近场光照(LUCES)上平均 MAE 从 9.43 显著降至 7.11。
- vs. Uni-MS-PS (HQ24):Uni-MS-PS 依赖多尺度编码器-解码器聚合全局上下文;Bridge-UniPS 进一步引入 Top-K 兼容性筛选和注意力跳跃连接,不仅能有效滤除不兼容观测的阴影噪点,还能保留细粒度表面法线细节。
- vs. 经典 CPS (Norm-PSN / JS22):传统 Norm-PSN 无法直接应用于未知光照环境,而 Bridge-UniPS 完美复用了其预训练权重,且直接输入原始图像通过 Norm-PSN 仅得 6.8 MAE,经 Bridge 适配后提升至 4.3 MAE,证明适配器具备强大的输入规范化与去伪影能力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次提出将泛日光度立体桥接到冻结校准模型的无中间监督自适应范式]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖受控点光、近场非受控、实拍弱光三类基准,配对打乱与CPS冻结等消融设计极其严密扎实]
- 写作质量: ⭐⭐⭐⭐⭐ [动机阐述深刻,方法推导流畅,图表与实验机理分析极具说服力]
- 价值: ⭐⭐⭐⭐⭐ [打通了高精度实验室光度立体算法走向开放自然环境的物理桥梁,工程与学术价值俱高]