跳转至

NeLU3D: Neural Inverse Structured Light without Modeling the Projector

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/geometryprocessing/neural-lookup
领域: 3D视觉
关键词: 结构光三维重建、神经逆渲染、神经隐式表面、投影仪免标定、可微体渲染

一句话总结

NeLU3D 提出一种无需对投影仪进行显式几何与辐射度标定的神经逆结构光重建方法,通过将单次标定的 3D 空间到投影模式颜色的映射固化为多分辨率哈希编码 MLP,并结合神经隐式表面体渲染与有界环境光解耦,仅用 3 幅单色非精确设计模式加 1 幅白光闪光图即可达到亚毫米级三维重建精度。

研究背景与动机

基于结构光(Structured Light, SL)的三维扫描因其非接触、高精度与强重复性,长期以来一直是文化遗产数字化、工业检测与具身智能等场景的核心三维采集技术。经典的结构光系统通常基于相机-投影仪双目立体匹配范式,利用投影仪投射随时间编码的时序光栅图案,并通过相机捕捉物体表面的条纹调制,最终借助射线三角测量求解空间稠密点云。然而,传统三角测量高度依赖于对整套光学系统的极端精确建模,包括相机与投影仪的外参位姿对齐、镜头畸变矫正、非线性辐射度响应、像素间隙(Inter-pixel gaps)以及透镜散焦与渐晕;一旦投影设备存在微小装配误差或光学暗角,重建质量便会断崖式下降。

为了规避脆弱的光学建模,近期涌现了两条探索路径:一是以 TurboSL 为代表的神经逆结构光渲染技术,虽然能以少量图像实现稠密曲面拟合,但其核心仍依赖对投影仪针孔模型、离散姿态及高斯模糊核的严苛参数化,且严重依赖为特定几何基线量身定制的特化图案(à la carte patterns),难以泛化至廉价易散焦投影仪;二是以 LookUp3D 为代表的数据驱动查找表法,通过将空间三维坐标与观测色彩直接绑定而绕过了投影仪建模,但其本质是基于逐像素的暴力最近邻搜索,数据存储体积高达数十上百吉字节,且缺乏空间连续性先验,导致重构点云极易被噪声和离群点淹没。

本文的切入角度是:能否将数据驱动查找表的“投影仪免建模”自由度,与神经隐式可微渲染的“空间平滑归纳偏置”深度融合?为此,研究者将庞大的离散查找表压缩为可微的紧凑连续色彩神经网络,并将其作为冻结的光照先验嵌入到符号距离函数(SDF)的有偏体渲染管线中。核心 idea:通过多分辨率哈希编码网络将三维空间点到投射光色的对应关系预标定为冻结的连续色彩映射场,结合 NeuS 神经隐式表面体渲染与有界环境光估计,彻底摆脱对投影仪几何/辐射度参数的显式建模,在任意次优光栅图案及廉价/模拟投影仪下实现亚毫米级单视角稠密曲面重建。

方法详解

整体框架

NeLU3D 的重建流水线分为“一次性离线神经标定”与“在线隐式曲面逆渲染重构”两个阶段。在离线标定阶段,利用高精度线性平移台带动附带基准标记(Fiducial markers)的白色标定平面在工作容积内平移扫描,记录不同三维深度下的 \(k\) 幅图案响应与白光闪光响应,并训练一个轻量级神经色彩网络 \(c(x)\);在在线重构阶段,冻结网络 \(c(x)\),将未知几何场景建模为空间点到符号距离的 SDF 神经网络 \(f(x)\) 与二维环境光照神经网络 \(a(i)\),利用可微体渲染合成虚拟相机观测,通过最小化合成图像与实际采集图像的差异迭代优化场景几何。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单次标定扫场数据<br/>标定板三维位姿 + k幅模式响应"] --> B["神经查找表学习<br/>MHE+MLP拟合3D坐标至投射色彩映射"]
    B -->|固化网络权重 c| C["投影解耦可微体渲染<br/>沿相机光线采样并融合SDF与色彩场"]
    D["未知目标结构光采集<br/>k幅结构光模式 + 1幅白光闪光图"] --> C
    C --> E["约束型环境光与混合损失优化<br/>预测有界环境光并反向传播更新SDF"]
    E --> F["输出高精度3D表面网格与法线"]

关键设计

1. 神经查找表学习:连续可微压缩与投影仪完全免建模

传统三角化或神经逆结构光必须显式拟合投影仪的内参、外参、多项式畸变及离散点扩散函数(PSF),任何光学暗角或散焦均会导致几何畸变。借鉴 LookUp3D 的物理洞察,任何三维空间点 \(x \in \mathbb{R}^3\) 在特定系统布局下被投射光束覆盖时,其所接收到的 \(k\) 幅图案光强比例是确定且唯一的。然而,离散显式网格在 \(512^3\) 分辨率下需消耗高达 15GB 显存,而在 \(1024^3\) 下直接耗尽 GPU 显存。为此,NeLU3D 采用多分辨率哈希编码(Multiresolution Hash Encoding, MHE)配合浅层 MLP 构建连续色彩函数 \(c: \mathbb{R}^3 \to [0, 1]^k\)。该网络仅需 3 分钟即可训练完成,将原本数十至上百 GB(如 \(k=3\) 时 50GB、\(k=11\) 时 121GB)的离散标定数据极度压缩至 49MB 的显存占用。更关键的是,该网络完全内化了透镜畸变、离焦模糊和像素间隙等复杂光学现象,在后续几何重建中全程保持权重冻结,提供完全可微的投射色彩先验。

2. 投影解耦可微体渲染:隐式曲面连续先验与离群噪声抑制

数据驱动查找表(LookUp3D)采用逐像素独立极小化搜索,极易受到图像局部传感器噪声、微小阴影或表面局部低反照率的干扰,导致生成的点云充斥着大量空间离群孤立点。NeLU3D 将场景几何表示为连续神经隐式表面 \(f: \mathbb{R}^3 \to \mathbb{R}\)(SDF),并遵循 NeuS 体系将 SDF 转换为沿光线的密度分布 \(\sigma(t)\)。对于相机第 \(i\) 个像素发出的光线 \(x(t) = o + t v_i\),体渲染积分累加沿线采样点的直接光照贡献:

\[\tilde{I}_i = \int_{t_{\min}}^{t_{\max}} T(t) \sigma(t) c(x(t)) dt\]

其中 \(T(t) = \exp(-\int_{t_{\min}}^t \sigma(s)ds)\) 为累积透射率,\(c(x(t))\) 直接由冻结的神经色彩映射网络输出。由于 SDF 神经网络具备全局连续光滑的归纳偏置,逆渲染优化天然滤除了高频局部随机噪声,无需后处理即可输出流形完整且法线精准的几何曲面。

3. 约束型环境光与混合损失优化:物理有界正则与宽动态范围拟合

真实场景普遍存在互反射(Interreflections)、次表面散射和未知背景环境光。若不加补偿,这些未建模的间接光照会直接污染几何。NeLU3D 引入二维卷积/MLP 网络 \(a: \mathbb{R}^2 \to [0, 1]\) 预测每个像素的残差环境光项 \(I_{\text{ambient}}\)。为了消除反向传播中由于数值不稳定导致的梯度爆炸,本文施加了基于辐射度守恒的物理硬约束:投影仪全开时的白光闪光图 \(I_{\text{white}}\) 代表了系统能接收到的最大能量上限,因此环境光严禁超出白光观测,即必须满足 \(I_{\text{ambient}} \le I_{\text{white}}\)。算法通过 Sigmoid 激活函数将 \(a(i)\) 约束在 \([0, 1]\) 并与 \(I_{\text{white}}\) 执行逐像素相乘实现该物理界。在训练目标上,综合平衡全曝光区域与弱光欠曝区域:

\[\mathcal{L}_{\text{image}} = (1 - \alpha) \mathcal{L}_{\text{pattern}} + \alpha \mathcal{L}_{\text{LookUp}}\]

其中 \(\mathcal{L}_{\text{pattern}}\) 直接度量预测图像 \(\tilde{I}_{\text{pattern}} = \tilde{I} + I_{\text{ambient}}\) 与实际捕获图案的偏差,抑制高光区噪声;\(\mathcal{L}_{\text{LookUp}}\) 则基于白光归一化色彩进行度量,保障弱光与低反照率材质的重建敏感度;参数设为 \(\alpha = 0.1\),彻底解决了单一损失函数在多反照率混杂场景下的发散问题。

损失函数 / 训练策略

除主图像重构损失 \(\mathcal{L}_{\text{image}}\) 外,系统在单张 NVIDIA RTX A6000 GPU 上针对每个未知场景优化 10,000 次迭代。整体优化目标包含几何正则化项:

\[\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{image}} + \lambda_{\text{mask}} \mathcal{L}_{\text{mask}} + \lambda_{\text{eik}} \mathcal{L}_{\text{eik}} + \lambda_{\text{sp}} \mathcal{L}_{\text{sp}}\]

其中: - 掩码损失 \(\mathcal{L}_{\text{mask}}\) 采用二值交叉熵(BCE),约束非阴影/有效几何区域的光线累积不透明度,权重 \(\lambda_{\text{mask}} = 0.1\); - 程函损失(Eikonal Loss)\(\mathcal{L}_{\text{eik}} = \sum_{i, d} (\|\nabla f(x(i, d))\|_2 - 1)^2\) 维持 SDF 梯度的单位范数性质,权重 \(\lambda_{\text{eik}} = 0.1\); - 稀疏正则项 \(\mathcal{L}_{\text{sp}} = \sum_{i, d} \exp(-|f(x(i, d))|)\) 压制自由空间中的漂浮伪影,权重 \(\lambda_{\text{sp}} = 0.01\); - \(\mathcal{L}_{\text{LookUp}}\)\(\mathcal{L}_{\text{pattern}}\) 内部混合 \(L_1\)\(L_2\) 范数,权重分别设为 1.0 与 10.0。

实验关键数据

主实验

论文在四种不同的硬件设置下评测了超过 25 个物理对象,涵盖高精度工业级 DLP 投影仪(TI DLP4710EVM-LC)、50 美元极低成本廉价 LCD 投影仪(VOPLLS Mini Beaner N3)以及搭载 35mm 胶片图案与千赫兹 LED 频闪的模拟投影仪。基准对比采用密集结构光(44 幅格雷码,22 横 22 竖)的高精度真值。

表 1:不同几何物体与投影图案组合下的绝对深度误差(MAE,单位:mm)与视差误差(单位:px)对比

测试物体 投影图案配置 ZNCC (mm / px) LookUp3D (mm / px) TurboSL (mm / px) NeLU3D (本文) (mm / px)
湿巾盒 (wipes) 3 幅 Hilbert 图案 196.70 / 832.95 8.81 / 153.23 29.91 / 181.68 3.87 / 8.13
急救包 (first aid) 3 幅随机图案 298.44 / 514.57 13.27 / 38.93 122.00 / 415.71 0.53 / 1.39
猴子雕像 (monkey) 3 幅随机图案 265.24 / 525.16 41.11 / 298.44 40.04 / 409.94 0.96 / 2.90
茶壶 (teapot) 3 幅特化定制图案 92.44 / 333.71 5.70 / 16.82 2.90 / 6.41 9.17 / 25.43
棋子 (pawn) 4 幅微相移 (MPS) 44.98 / 232.86 3.17 / 9.70 2.76 / 7.54 1.02 / 2.78
键盘 (keyboard) 11 幅格雷码 0.39 / 1.14 33.09 / 137.16 0.97 / 2.90 0.33 / 0.84

表 2:计算开销与显存对比(RTX A6000 单卡,测试对象为棋子与猴子,涵盖 3、6、11 模式)

方法 显存消耗 (VRAM, GB) 单帧重构耗时 (pawn, 秒) 单帧重构耗时 (monkey, 秒) 依赖投影仪显式标定
ZNCC (经典匹配) 0.1 ~ 0.3 0.002 ~ 0.004 0.100 ~ 0.101
LookUp3D (离散查表) 10.2 ~ 29.2 0.0016 ~ 0.0022 0.0018 ~ 0.0025
TurboSL (神经逆渲染) 4.3 ~ 5.2 1020 ~ 2364 1160 ~ 2468 是 (需精确外参/内参/PSF核)
NeLU3D (本文) 3.7 ~ 4.4 420 ~ 431 534 ~ 562 否 (全免标定)

消融实验

消融实验在数控铣削的高精度光泽象棋棋子(高精度 CAD 真值,尺寸约 10cm × 16cm × 10cm)上展开,统一使用 DLP 投影仪投射 3 幅次优混合图案(1 正弦 + 1 三角波 + 1 随机)及 1 幅白光闪光图。

表 3:模型各组件与约束条件的消融分析

实验配置 深度平均绝对误差 MAE (mm) 表面重构质量与物理表现说明
仅查找表损失(w/o \(I_{\text{ambient}}\),仅 \(\mathcal{L}_{\text{LookUp}}\) 1.63 表面严重受噪声与高光腐蚀,暗区伪影巨大
仅图案损失(w/o \(I_{\text{ambient}}\),仅 \(\mathcal{L}_{\text{pattern}}\) 0.99 噪声显著减少,曲面较平滑,但无法消除全局互反射形变
无约束环境光(\(\mathcal{L}_{\text{image}}\),未约束 \(I_{\text{ambient}} \le I_{\text{white}}\) 失败(梯度爆炸) \(I_{\text{white}} - I_{\text{ambient}}\) 出现负值,反向传播数值发散
完整模型 Full Model\(\alpha=0.1\) 且约束 \(I_{\text{ambient}} \le I_{\text{white}}\) 0.65 曲面紧密吻合真实 CAD 几何,法线过渡自然,实现亚毫米精度

关键发现

  • 对次优与非规则图案的超强鲁棒性:当投影图案为随机噪声或 Hilbert 空间填充曲线等次优图案时,TurboSL 与 ZNCC 彻底失效(误差高达数十至数百毫米),而 NeLU3D 凭借色彩标定场直接锚定几何,误差始终稳固在 0.5 ~ 3.8 mm 区间。
  • 极端廉价硬件的可用性跨越:在使用 50 美元廉价 LCD 投影仪(存在强烈镜头渐晕、畸变且焦平面弯曲严重)时,TurboSL 的 MAE 高达 74.33 mm(3 模式)与 41.63 mm(11 模式),而 NeLU3D 仅为 0.89 mm 与 0.94 mm,完全达到了高精密工业测量的精度标杆。
  • 动态场景捕捉能力:配合胶片模拟投影仪与 kHz 频闪 LED,NeLU3D 成功在 200 fps 高速摄影下实现了“织物高速撞击棋子”和“PLA 塑料板弯曲回弹”的瞬态微秒级三维动态曲面重建。

亮点与洞察

  • 将昂贵的光学物理建模转移为一劳永逸的神经场表征:摒弃传统透镜畸变系数、离焦散度与双目外参标定,把复杂光路全部“烘焙”(Bake)进多分辨率哈希编码网络,赋予了结构光系统极高的工程容错与换代自由。
  • 有界环境光假设消除神经逆渲染的数值不稳定性:基于白光闪光能量上限约束环境光输出(\(I_{\text{ambient}} \le I_{\text{white}}\)),既省去了反射率(BRDF/Albedo)预测网络的显存与计算负担,又从根本上遏制了除法截断带来的梯度爆炸问题。
  • 隐式场归纳偏置对无序离群点的本能过滤:彻底改变了数据驱动查找表方法依赖后处理去噪的缺陷,利用 NeuS 连续密度积分使得曲面在嘈杂低信噪比环境下依然保持拓扑严密与法线平滑。

局限与展望

  • 工作空间受限于标定容积:与 LookUp3D 类似,系统无法外推标定立方体之外的三维空间。若物体超出标定范围(如猴子雕像手中的头骨),对应区域将出现几何缺失或失真。
  • 极端高光与镜面反射未能彻底建模:环境光 MLP 属于低频假定,无法完美捕获强镜面高光与局部过曝光像素,高反光曲面上仍存在轻微几何微凹。
  • 单帧重建耗时较长:每帧场景 SDF 的逆渲染拟合需约 7~10 分钟(10,000 次反向传播),目前尚无法直接用于工业流水线的在线实时扫描。
  • 相机内参仍需传统标定:当前方案仅摆脱了投影仪建模,相机本身仍需传统棋盘格标定内参;未来可探索在单次机械平移中将相机标定同步隐式吸收。

相关工作与启发

  • vs LookUp3D (Pereira et al., 2025):LookUp3D 开创了免投影仪建模的离散颜色查表法,但采用逐像素最近邻匹配,显存占用极大(数十 GB)且点云伴随严重离群噪点;NeLU3D 采用 MHE-MLP 压缩了 99.9% 的体积,并通过 SDF 体渲染引入空间平滑先验,将散乱点云提升为高质量连续水密曲面。
  • vs TurboSL (Mirdehghan et al., 2024):TurboSL 是单视角神经逆结构光的先驱,但深度依赖投影仪显式针孔几何模型、模糊卷积核优化以及精心设计的特化条纹图案;NeLU3D 彻底脱钩投影仪参数,在任意随机/次优图案和廉价散焦投影仪下均能稳定工作,且单次逆渲染优化时间减半。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙结合了数据驱动查找表的光学免建模优势与神经隐式体渲染的连续先验,设计构思极具启发性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 种硬件配置、25+ 真实物体、静态与动态瞬态捕捉,消融实验严谨且包含真实的 CAD 与激光扫描真值对照。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑线索清晰,数学建模精准克制,插图与实验数据详实且富有说服力。
  • 价值: ⭐⭐⭐⭐⭐ 显著降低了高精度结构光三维扫描系统的硬件门槛与装配标定成本,对工业检测与计算摄影社区具有重要落地价值。