跳转至

M-plicits: Neural Implicit Surfaces via Nested Multiscale Residuals

会议: NeurIPS 2026
arXiv: 2609.28684
论文: 项目主页
代码: https://github.com/dsilvavinicius/m-plicits
领域: 3D 视觉
关键词: 神经隐式曲面、多尺度残差、嵌套窄带、球面追踪、属性映射

一句话总结

M-plicits 用全域粗 SIREN 加逐级窄带监督的残差 SIREN 重建有向点云,并让追踪、网格提取和属性映射复用这一层级,在较小参数量下获得实时渲染与较强的合成测量噪声鲁棒性,但并非所有精度和速度指标都胜出。

研究背景与动机

神经隐式曲面把三维位置送入网络,用输出场的零水平集表示表面;若输出接近有符号距离函数(SDF),就能同时支持法线、距离查询和球面追踪。SIREN 的正弦激活适合表达细节,但单个大 MLP 每次都要完整求值:远离表面的光线步进和密集网格采样,也付出了细节网络的成本。iNGP 的哈希网格提升了速度,却容易把输入噪声一起拟合;BACON 的显式频率控制提供多尺度表示,但硬频谱截断及其表达形式也有各自的伪影和容量问题。

单纯把网络拆成粗、细两部分,还没有解决“细网络应在哪里工作”。如果残差仍在整个空间接受监督,离表面很远的区域也要被学习、被查询;如果独立细网络只在表面附近训练,未监督区域又可能产生额外零水平集。本文因此把表示、监督域和下游求值策略一起设计:先建立全域距离先验,之后只在上一层表面附近修正,推理时也只在这些邻域调用更贵的层级。

这里的去噪来自小型粗网络的平滑偏置与逐级局部训练,而不是一个经过证明的频率截止滤波器。核心 idea:用残差耦合保持粗到细的几何联系,用嵌套窄带集中细层监督,再让渲染和提取利用同一窄带减少高成本查询。

方法详解

整体框架

输入是带法线的点云,纹理任务还需要颜色;主要输出是粗、中、细三个神经距离场及其曲面。全域基础场先拟合大尺度形状,嵌套残差细化逐级补细节;多尺度几何求值负责球面追踪和网格提取,神经属性映射则在已有几何上查询细法线或颜色。

训练和推理需要区分:点、法线以及可选颜色提供训练监督,并不是渲染时的输入。渲染时输入的是相机光线,网格提取时输入的是网格顶点;两者查询已经训练好的层级。图中的虚线表示监督,实线表示阶段依赖与推理查询。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["有向点云<br/>法线 / 可选颜色"] -.->|点与法线监督| B["全域基础场"]
    B --> C["嵌套残差细化"]
    A -.->|窄带采样监督| C
    C --> D["多尺度几何求值"]
    R["相机光线 / 网格顶点"] -->|推理查询| D
    D --> E["神经属性映射"]
    C -->|细场梯度| E
    A -.->|可选颜色监督| E
    D -->|球面追踪 / 网格提取| O["几何 / 渲染输出"]
    E -->|法线 / 颜色| O

关键设计

1. 全域基础场:让远离表面的查询不必访问细节网络

基础场是覆盖整个训练域的小型 SIREN。它从输入点位置、法线方向及域内 Eikonal 正则获得监督,先建立可供后续使用的整体几何与近似距离。这里不是用一个预先给定的真实 SDF 作所有位置的标签;主体任务从有向点云出发,在离散数据之外靠正则约束场的行为。

SIREN 的正弦频率参数决定表示高频细节的倾向与容量。本文粗、中、细层分别取 30、45、100,配合网络大小实现逐级细化。不能把较小频率参数理解为复合正弦 MLP 的严格带限证明,也不能据此断言粗网络无论训练多少轮都绝不会吸收噪声。实验支持的是给定配置下的平滑先验和去噪表现。

2. 嵌套残差细化:修正上一层,而不是重新学习独立的局部距离场

细化层以残差相加形成新的距离场,而不是独立预测一个与粗层没有联系的场。默认使用三个 SIREN,即一个基础网络和两个残差网络;细层求值时需包含此前各层,不是只查询最后一个残差。

\[ f_{i+1}(x)=f_i(x)+r_i(x),\qquad i=1,2. \]

训练完一层后,下一层只在上一层训练域与其近零区域的交集中接受监督。窄带宽度由输入点上的最大拟合误差乘安全余量获得;这保留了输入点,让尚未被上一层精确解释的部分仍有修正空间。

\[ \Omega_1=\Omega,\qquad \Omega_{i+1}=\{x\in\Omega_i:\lvert f_i(x)\rvert<\delta_i\},\qquad \delta_i=(1+\varepsilon)\max_{j=1,\ldots,n}\lvert f_i(x_j)\rvert. \]

最大值取自输入表面点,不是全域函数范数。逐级相交保证监督域嵌套;但残差依然是普通连续 MLP,不具备由结构保证的紧支撑,未监督域的残差也不必严格为零。原文把全局零水平集嵌套描述为构造保证,仅凭局部监督与数据误差选带宽,尚不足以证明这个更强命题。实际训练及带裁剪推理提供了经验支撑,应与全空间数学保证分开理解。

为了给 Eikonal 项采样,作者在输入点附近逐坐标抖动,再拒绝落在有效窄带外的样本。这比在整个体积均匀采样更集中于曲面附近。另一类样本沿输入法线偏移:在仍满足局部距离关系的范围内,用偏移距离作 SDF 标签、用输入法线作梯度方向标签。作者通过逐步缩短偏移,并与到点云的距离比较来选择有效范围;这一近似依赖可靠法线及可用的局部管状邻域,不是任意偏移点都有精确标签。

3. 多尺度几何求值:先用便宜的偏移曲面接近目标,再调用细层

普通球面追踪每一步都查询目标 SDF。本文改为先追踪粗场的正偏移水平集,再追踪中场的正偏移水平集,最后追踪细场零水平集。这样远处的大步前进主要由小网络承担,只有接近曲面时才求值高容量网络;粗层步长减去窄带宽度,避免只命中粗曲面就结束。

\[ p_{k+1}=p_k+v\bigl(f_j(p_k)-\delta_j\bigr). \]

上式用于粗、中层的偏移追踪;最终细层使用不减偏移的常规步进。实验固定粗层 20 次、每个后续层 5 次迭代,方便 GPU 批量并行。带宽太小可能漏掉细层轮廓,太大又使有限细层迭代不够而产生孔洞。训练正则并不提供神经场的全域 Lipschitz 证书,也没有把这个固定预算变成严格收敛保证;原文的“确保收敛”措辞应理解为依赖距离近似和层级假设的算法描述。

网格提取同样复用带结构:先在网格顶点评估粗场,窄带外保留粗场结果,窄带内再加上残差,逐级执行后应用 marching cubes。所谓裁剪是跳过昂贵细层求值,不是删掉所有带外顶点或令其值为零。补充消融对全域监督残差使用全域提取,避免把未经验证的带裁剪强加给不满足同一训练设定的基线。

4. 神经属性映射:在低成本几何上查询高细节外观

可以先追踪粗曲面,再在交点直接查询细场梯度作为着色法线。这省掉追踪细曲面的额外迭代,让外观拥有更细的凹凸信息;但几何位置仍是粗曲面的位置,轮廓不会仅因法线映射而改变。图 9 的轮廓改善来自继续在中层执行球面追踪,而不是法线本身移动了曲面。

法线计算用链式法则解析传播坐标导数。实现把三个坐标方向的导数分别批处理,交替使用 GEMM 和逐元素激活导数内核;对残差场还要累加各网络的梯度。它避开推理时的 autograd 计算图,也不是有限差分。平滑性来自连续可微的表示,GEMM 提供的是高效计算路径;补充表 S16 的加速幅度随模型和分辨率变化,不能一概写成恰好翻倍。

颜色则由三维坐标到 RGB 的网络编码,在表面拟合颜色,并在邻域惩罚沿 SDF 梯度方向的变化。这样颜色从细曲面向邻近粗曲面延伸,不需要 UV 参数化;它不是把三维颜色场约束成处处常数,而是尽量沿法线方向保持一致。

\[ \mathcal{T}(\phi)=\int_{f^{-1}(0)}\lVert g_\phi(x)-\bar g(x)\rVert^2\,dx +\int_{\{x:\lvert f(x)\rvert\le\delta\}}\lVert Dg_\phi(x)\nabla f(x)\rVert^2\,dx. \]

此式把原文颜色真值与预测都显示成相同字形的问题显式区分:带横线者是颜色真值,第二项按 RGB 各通道的方向导数解释。它是对原文属性损失的记号澄清,不增加新的训练项。

一个完整示例

以带法线的 Lucy 点云为例,首先用全域基础场得到平滑但缺少细节的几何。计算输入点上的拟合误差来决定窄带,再用抖动拒绝采样和法线偏移样本训练中、细残差;干净模型的实测两层带宽为 2.67E-02 和 1.43E-02(补充表 S15,单位球域)。

渲染时有两种不同选择:为了较低成本,可只追踪粗几何,再查询细法线改善着色;为了让轮廓也接近细几何,则继续运行中、细层追踪。前者改善外观而不替换几何,后者真正改变光线交点。若要导出网格,则在窄带内调用细层、带外使用粗值,而不是先完整评估所有细网络。

损失函数 / 训练策略

每一层的目标由输入点处的零值约束、法线对齐和当前训练域内的 Eikonal 正则组成。以下保留正文式 (4) 的机制;实际离散实现需要采样和项权重,不能把连续积分当成已经精确计算。

\[ \mathcal{L}_i(f_i)=\frac{1}{n}\sum_j\left[f_i(x_j)^2+\bigl(1-\nabla f_i(x_j)\cdot N_j\bigr)\right] +\int_{\Omega_i}\bigl(\lVert\nabla f_i(x)\rVert-1\bigr)^2\,dx. \]

残差阶段优化的是组合场的拟合,而不是要求残差自身在输入点处等于零。法线偏移样本补充非零距离监督,Eikonal 项约束局部距离性质;有颜色时另行训练上述属性场,不把颜色误差当作几何监督。

默认网络记号为 (128, 2) ▷ (256, 2) ▷ (400, 2),每层含两个相应宽度的隐藏层。训练按基础场、中残差、细残差顺序进行,使用 Adam。补充表 S15 的带宽测量采用安全余量 0.3;不要把不同实验的架构和带宽测量混成单一固定配置。

实验关键数据

主实验

主体评测为 Stanford 与 Thingi32,点云居中并归一化到单位球,使用单张 NVIDIA RTX 5090(32 GB)。网格提取分辨率为 \(512^3\),在重建网格上均匀采样 500K 点计算 L2 Chamfer Distance(CD);IoU 衡量占据一致性。渲染速度使用 \(512^2\) 图像,这不是多设备或跨分辨率的通用速度结论。

表 1:正文表 2 的干净输入结果。CD 越低越好,IoU/FPS 越高越好;采样指网格场求值。

方法 mean CD median CD mean IoU median IoU 参数量 训练 min 采样 s FPS
iNGP coarse 6.87E-05 6.43E-05 4.12E-01 4.05E-01 2,040,864 8.22 0.40 86
iNGP fine 6.44E-05 6.04E-05 4.20E-01 3.90E-01 9,113,760 10.59 0.89 88
IDF 6.13E-02 7.74E-04 4.09E-01 9.20E-02 1,191,943 8.26 42.38 N/A
BACON 8.12E-03 2.18E-05 5.15E-01 7.32E-01 530,953 8.43 0.24 N/A
Ours coarse 5.36E-05 3.80E-05 4.48E-01 4.59E-01 17,153 4.07 1.51 180
Ours fine 6.57E-05 1.87E-05 5.86E-01 8.67E-01 246,627 8.53 5.29 43

粗模型的 mean CD 最好;细模型的 median CD 及两项 IoU 最好,但 mean CD 略差于 iNGP fine。细模型也不比所有基线更快:BACON 采样最快,iNGP fine 的 FPS 更高,Ours fine 的训练时间比 IDF 和 iNGP coarse 更长。参数紧凑、抗噪和连续法线才是组合优势,不能将这张表总结成全面第一。

表 2:正文表 3 的合成测量噪声结果;沿真实法线随机位移最多为包围盒尺度的 1.0%。

方法 mean CD median CD mean IoU median IoU
Ours coarse 7.42E-05 5.33E-05 3.81E-01 4.03E-01
Ours medium 4.62E-05 3.03E-05 5.37E-01 6.38E-01
Ours fine 3.36E-05 1.62E-05 5.82E-01 5.91E-01
iNGP coarse 6.70E-04 3.76E-04 1.90E-01 1.88E-01
iNGP fine 2.80E-04 1.09E-04 3.09E-01 3.05E-01
IDF 8.37E-02 2.49E-05 3.22E-01 3.08E-01
BACON 1.68E-03 1.51E-04 1.76E-01 1.65E-01

这里细层四项汇总指标最佳,逐级 CD 改善也支持去噪后细化的作用;但该设定保留真实法线,不等价于真实传感器数据、法线污染或无向点云。噪声表的 CD 比干净表更低也不说明“加噪必然改善”:它们是不同输入与拟合结果,不能用跨表变化代替受控因果结论。

消融实验

表 3:补充表 S12,10 个形状子集;各变体共享架构、频率安排与粗网络。不能与全数据集表 1、2 直接比较。

设定 变体 mean CD median CD mean Hausdorff mean IoU
1% noise (a) 残差 + 窄带 6.39E-05 1.49E-05 1.45E-03 0.687
1% noise (b) 残差 + 全域监督 6.34E-05 2.26E-05 5.23E-03 0.555
1% noise (c) 独立场 + 窄带 1.04E-04 2.36E-05 5.72E-03 0.669
clean (a) 残差 + 窄带 3.87E-05 1.38E-05 5.86E-03 0.653
clean (b) 残差 + 全域监督 4.26E-05 2.36E-05 6.75E-03 0.655
clean (c) 独立场 + 窄带 3.47E-05 1.62E-05 4.01E-03 0.749

噪声下 (b) 的 mean CD 略优于 (a),但 Hausdorff 明显更差,说明窄带的收益主要体现在远离真实曲面的误差尾部与占据结构,而非所有平均点误差都下降。干净输入下 (c) 的 mean CD、Hausdorff 和 IoU 更优,因此残差也不是无条件提升精度;其必要性更多体现在噪声稳定性与带外行为。

独立窄带场若取消提取裁剪,噪声检查点的 mean CD 变为 2.8E-01,并出现 365 到 4,109 个分量;残差场取消裁剪仅从 6.39E-05 变到 6.42E-05。这是未监督区域行为的经验对照,不构成“残差永远没有带外零水平集”的证明。

关键发现

  • 正文表 4 的三层模型完整几何追踪为 35 FPS,省掉最后一层追踪的法线映射版为 43 FPS;单大 SIREN 为 19 FPS。正文表 2 同时把细模型 43 FPS 标为无属性映射的几何评测,两处口径不能完全对齐,保留原值而不擅自修正。
  • 正文表 5 的 Armadillo 网格提取从基线 4.87 s 降到裁剪版 0.99 s,Lucy 从 4.87 s 到 1.07 s;这是特定网格提取配置的收益,不意味着主体表的采样速度胜过 BACON。
  • 补充表 S15 的干净带宽最大为 2.93E-02,确实低于单位球半径的 3%;但噪声 Thai 的两层带宽为 6.9E-02、5.2E-02,不能把“所有带都小于 3%”扩展到噪声输入。
  • 补充表 S14 中 Lucy 的 1% 离群点污染使本文 IoU 降至 0.002,Poisson 不裁剪为 0.004、密度裁剪后为 0.938。最大误差选带宽可被离群点拉大,测量噪声鲁棒性并不意味着离群点鲁棒性。

亮点与洞察

  • 表示层级同时成为计算预算层级。与只给多分辨率输出的网络不同,窄带让“何时需要细网络”成为可以在训练与推理两侧复用的空间条件。
  • 残差耦合与监督域收缩承担不同职责。前者继承全域基础场,后者集中表面附近的正则与采样;消融的 Hausdorff 结果比单一 CD 更能解释为什么需要二者。
  • 细法线和细几何可以分开花预算。属性映射适合用着色表现细节,但轮廓敏感任务仍需真正追踪更细的曲面。

局限与展望

  • 平滑偏置牺牲极尖锐边缘与微细几何;作者提出加入局部特征,但本文未给出一个已经解决该问题的完整方案。
  • 最大拟合误差决定带宽,对孤立离群点敏感。可考虑分位数或可靠性加权带宽,但舍弃最大值后还需重新处理数据覆盖与推理安全条件,不能直接宣称保证保持不变。
  • 局部监督不保证全域零水平集嵌套,Eikonal 正则也不认证全域距离下界。更可靠的方向是验证带外符号、限制残差幅度或引入可证明的安全步长。
  • 主评测依赖有向点云和合成法线方向噪声;非闭合网格、薄结构、自交及分离小分量会引入困难,但分离分量本身并不使连续 SDF 在数学上不存在。
  • 补充材料展示图像重建、动态图形和大场景的扩展,尚不足以证明通用场景鲁棒性。DTU 的平均 PSNR 从 28.86 dB 到 29.94 dB,但 Scan 37、Scan 40 分别从 27.10、28.13 降到 26.50、27.78,原文“始终改善”的表述过强。

相关工作与启发

  • vs SIREN:沿用连续正弦 MLP,但用残差与局部监督减少细层的工作区域;不是通过新的严格频率带限架构获得理论保证。
  • vs iNGP:连续网络不依赖空间哈希网格,在本文噪声设定中更稳定;iNGP fine 在干净 mean CD、FPS 和采样速度上仍有优势。
  • vs BACON / IDF:本文把残差细化与监督域收缩结合,并直接提供多尺度追踪;基线在主体实验有伪影或异常误差,但不能据此断言所有实现和输入都如此。
  • vs BANF:补充对比使用本文作者自建实现,并非 BANF 官方点云拟合基线;作者报告细分辨率上与 BANF 已发表结果存在优化差距,绝对数值排名需要谨慎。
  • vs Screened Poisson:补充表 S6 的干净子集上 Poisson mean IoU 为 0.910,本文为 0.653;本文优势在距离场查询与层级属性表达,不是声称 Poisson 网格不能实时光栅化。

评分

  • 新颖性: 4/5 — 嵌套监督与多尺度求值共同设计,比单纯残差网络更完整。
  • 实验充分度: 4/5 — 包含抗噪、隔离消融和离群点失败,但主要依赖有限形状与合成设定。
  • 写作质量: 3/5 — 方法脉络清楚,嵌套保证、带限解释及部分表格口径仍需校准。
  • 价值: 4/5 — 适合紧凑隐式几何与实时着色,需接受尖锐细节及异常数据上的边界。