跳转至

Incremental Online Scene Reconstruction by 3D Gaussian Triangulation

会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 高斯三角化, 增量重建, 3D高斯泼溅, 稠密几何高斯, 在线建图

一句话总结

提出一种基于稠密几何高斯三角化的增量在线三维场景重建框架,通过将高斯图元约束为高不透明度平面椭圆表面微元(Surfels)并实施平面拉拽约束与直接局部三角化,结合历史稳定区域动态冻结机制,实现了高效、高精度的在线网格重建与逼真新视角合成。

研究背景与动机

增量式三维场景重建在增强现实、机器人自主感知与实时决策中具有不可替代的作用。传统的在线重建方案(如 KinectFusion 及其派生工作)大多基于截断符号距离场(TSDF)体素融合,再定期调用 Marching Cubes 提取网格表面。这类方法受限于预设的固定体素分辨率和极高的显存开销,难以在大尺度连续扩展的场景中捕捉细粒度几何,且网格提取频率显著滞后于帧率,无法提供低延迟的实时几何反馈。

近年来,以 3D Gaussian Splatting(3DGS)为代表的显式辐射场技术在高质量实时渲染方面取得了突破,但其离散、无拓扑结构的图元特性给高质量显式表面重建带来了新的困难。SuGaR、2D GS 和 GOF 等已有方案大多采用两阶段离线模式:先全局优化所有高斯图元,再将其转化为全局隐式场或占用场,最终通过泊松重建(Poisson Reconstruction)或 Marching Cubes/Tetrahedra 全局抽取网格。这种离线解耦设计导致一旦有新帧输入,就必须全局重新优化并重新跑一遍耗时数十秒乃至数分钟的网格提取流水线,完全切断了其与下游实时任务交互的可能。

要打破离线批处理与在线高精度重建之间的隔阂,必须摒弃维护全局隐式体素的中间层,让高斯图元本身具备作为网格顶点的几何严密性与快速拓扑连接能力。核心 idea:将 3D 高斯图元显式约束为具备强几何约束的平面椭圆微元(Surfels),通过几何平面拉拽约束校正传感器深度噪声,利用切平面极角排序实现无需隐式场的快速直接三角化与局部重新网格化,并结合已收敛历史区域动态冻结机制,实现无显存爆炸的在线增量高精度网格重建与高质量渲染。

方法详解

整体框架

输入为带已知位姿的连续 RGB-D 视频流 \(\{I_i, D_i\}_{i=1}^M\)。系统以稠密几何高斯表征(Dense Geometric Gaussian Representation)为核心基元,同时服务于可微光度渲染与显式网格抽取。在前端在线建图阶段,根据输入的定向点云与渲染残差增量补全高斯并剪枝;在优化阶段,结合渲染光度与深度残差,并施加局部平面拉拽约束与法向一致性损失,将高斯精细贴合于底层几何表面;在几何网格提取阶段,筛选高置信度的几何高斯子集(Geometric Gaussian Set),通过局部切平面极角排序完成直接三角化;最后采用局部各向同性重新网格化(Local Remeshing)消除接缝拓扑冲突,并对观测充分且优化收敛的历史区域执行动态冻结,将显存占用限制在局部滑动窗口内。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据流<br/>连续 RGB-D 帧序列"] --> B["稠密几何高斯表征<br/>平面椭圆微元初始化"]
    B --> C["在线建图与高斯优化<br/>光度/深度误差驱动添加与剪枝"]
    C --> D["平面拉拽与法向约束<br/>对齐底层表面并矫正噪声"]
    D --> E["几何高斯筛选与直接三角化<br/>切平面候选剪枝与极角贪心连边"]
    E --> F["局部重新网格化与动态冻结<br/>各向同性拓扑缝合与历史区域冻结"]
    F --> G["最终输出<br/>在线增量高精度网格 + 实时高质量渲染"]

关键设计

1. 稠密几何高斯表征:消除体积伪影的平面椭圆微元 标准 3DGS 针对辐射场体积渲染设计,图元空间分布松散且允许半透明重叠,无法直接作为显式三角网格的顶点。为使其适配高精度表面重建,本文将高斯图元约束为平面椭圆表面微元(Planar Elliptical Surfels):将沿法向的第三尺度分量极小化(\(s_{i3} \to 10^{-6}\)),强制高斯扁平化在局部切平面上;同时将不透明度硬性约束在高位(\(\alpha_i \to 0.99\)),模拟实体物理表面。渲染时采用双分支机制,光度分支采用标准 \(\alpha\)-blending 累积颜色,而几何深度分支则直接计算视线光线与最前端不透明高斯图元的解析几何交点深度 \(\hat{D}(u, v)\),从根本上消除了标准透射深度模糊导致的网格凹凸不平。

2. 平面拉拽与法向几何约束:引导高斯贴合真实表面 消费级深度传感器采集的深度图通常伴随高频噪声与测量空洞,单独依靠渲染反向传播容易产生局部几何畸变。本文将输入定向点云 \(P\) 视为物体表面零水平集的离散逼近,构建了点面几何拉拽损失(Local Plane Loss): $\(\mathcal{L}_{plane} = \sum_{(\boldsymbol{\mu}_i, \mathbf{p}_i) \in \mathcal{C}} |\mathbf{n}_i^\top (\boldsymbol{\mu}_i - \mathbf{p}_i)|\)$ 其中 \(\mathbf{p}_i\)\(\mathbf{n}_i\) 分别表示对应参考点的位置与法向量,\(\boldsymbol{\mu}_i\) 为高斯中心。该项在法向投影方向上产生拉拽力,强迫高斯中心紧密贴靠局部切平面,同时赋予高斯在切向平面内自由滑移以捕捉外观细节的自由度。此外,利用高斯最短主轴近似的高斯法向 \(\mathbf{n}^g_i\),构建法向一致性损失 \(\mathcal{L}_{n} = \sum |\mathbf{n}^{g \top}_i \cdot \mathbf{n}_i|\),并结合稀疏熵正则 \(\mathcal{L}_{sparse}\) 促使不透明度极化为 0 或 1,促使高斯图元形成平滑连续且严格贴合边界的几何薄层。

3. 快速高斯直接三角化:免除隐式场的局部拓扑重建 传统高斯建图依赖 Marching Cubes 等全局隐式体素评估,在大场景下计算极为缓慢且显存吞吐巨大。本文设计了无需隐式场的纯几何直接三角化算法:首先设定不透明度与深度保真度双阈值条件 \(G_{geo} = \{G_g \mid \alpha_g > 0.95, \, |(\mathbf{T}_{cw} \boldsymbol{\mu}_g)_z - \hat{D}| < \tau\}\) 剔除漂浮与半透明渲染补偿图元;随后利用压缩八叉树在自适应搜索半径内检索 \(k\) 邻近高斯,施加切平面互可见性与法向夹角阈值(\(\langle\mathbf{n}_i, \mathbf{n}_j\rangle > 0.9\))进行有效候选过滤;通过加权位置平滑校正中心高斯坐标后,将邻域投影至中心高斯的局部切平面,以中心高斯为极点按极坐标角度逆时针排序,依次将角相邻且夹角大于 \(10^\circ\) 的邻居连接成三角形,避免生成退化的长条针状三角形(Sliver Triangles),直接在局部毫秒级生成严格水密的显式表面。

4. 局部重新网格化与动态冻结:长序列在线防爆炸机制 视角连续移动引入的增量网格与已有历史网格拼合时,局部视差与噪声扰动会导致接缝处拓扑重叠与顶点错位。本文引入局部各向同性网格优化流水线:对平均边长 \(\bar{L}\) 异常的大边(\(> 1.5\bar{L}\))进行边分裂、短边(\(< 0.5\bar{L}\))进行边坍缩,对目标度数偏离 6 的边执行边翻转,并辅以 3 次局部拉普拉斯平滑,使新旧边界无缝平滑缝合。更重要的是,为防止连续大范围探索时显存和算力无限膨胀,系统记录每个区域高斯的有效观测次数与优化损失;当局部多视角观测次数超过阈值 \(N_{obs}\)(设为 10)且重建损失稳定收敛至最小阈值 \(\epsilon_{gs}\)(设为 0.1)时,将该成熟区域的高斯图元与三角网格从反向传播计算图中彻底分离并冻结,优化聚焦于局部活动窗口,实现了常数级开销的超长序列连续重建。

损失函数 / 训练策略

模型综合光度渲染、几何约束与稀疏正则进行联合端到端优化,总损失函数定义为: $\(\mathcal{L} = \lambda_c \mathcal{L}_{color} + \lambda_d \mathcal{L}_{depth} + \lambda_p \mathcal{L}_{plane} + \lambda_n \mathcal{L}_{n} + \lambda_s \mathcal{L}_{sparse}\)$ 其中光度项采用 \(L_1\) 颜色损失 \(\mathcal{L}_{color} = \sum |\mathbf{C}_i - \hat{\mathbf{C}}_i|\),深度项采用光线投射交点深度 \(L_1\) 损失 \(\mathcal{L}_{depth} = \sum |\mathbf{D}_i - \hat{\mathbf{D}}_i|\)。权重配置为:\(\lambda_c = 0.8\)\(\lambda_d = 1.0\)\(\lambda_p = 0.05\)\(\lambda_n = 0.2\)\(\lambda_s = 0.001\)。几何高斯筛选深度残差容差 \(\tau = 0.001\)。在线运行时,Replica 数据集滑动窗口大小设为 6,每帧迭代 50 次;ScanNet++ 数据集滑动窗口大小设为 3,每帧迭代 75 次。

实验关键数据

主实验

在 Replica 数据集(8 个序列)上评估三维几何重建精度,指标包括点到网格的几何精度误差(Acc.,越低越好)、精度比率(Acc. Ratio < 5cm,越高越好)以及完整度比率(Comp. Ratio < 5cm,越高越好)。基线涵盖体素 TSDF 方法 KinectFusion、经典隐式神经 SLAM 方法 NICE-SLAM、基于高斯的 SLAM 方法 MonoGS 与 RTG-SLAM。

数据集 / 序列 指标 本文 RTG-SLAM [19] MonoGS [16] NICE-SLAM [29] KinectFusion [18]
Replica Avg. Acc. [cm] \(\downarrow\) 1.34 1.41 2.77 8.16 12.76
Replica Avg. Acc. Ratio [%] \(\uparrow\) 99.70 99.54 86.73 80.42 34.34
Replica Avg. Comp. Ratio [%] \(\uparrow\) 85.95 81.71 81.83 85.01 62.84
ScanNet++ Avg. (Novel View) PSNR [dB] \(\uparrow\) 24.40 21.65 - - -
ScanNet++ Avg. (Novel View) SSIM \(\uparrow\) 0.85 0.83 - - -
ScanNet++ Avg. (Novel View) LPIPS \(\downarrow\) 0.32 0.33 - - -
Replica Off0 运行速度 [FPS] \(\uparrow\) 10.34 3.65 1.48 - -
Replica Off0 峰值显存 [MB] \(\downarrow\) 2325 2751 5434 - -

在网格提取效率方面,与隐式场抽取网格的代表工作 GOF 在 Replica Office0 局部子集上对比:GOF (Marching Cubes) 耗时 444.26 秒、导出的网格文件达 964.95 MB;GOF (泊松重建) 耗时 415.27 秒、网格大小 14.05 MB;而本文的高斯直接三角化仅需 5.34 秒、生成网格大小仅 3.32 MB,网格提取速度提升了近 80 倍且模型轻量化极其显著。

消融实验

在 Replica Office1 序列上针对关键模块与各损失约束项进行消融分析(几何误差以 Acc. [cm]、Acc. Ratio [%] 和 Comp. Ratio [%] 为基准):

消融配置 Acc. [cm] \(\downarrow\) Acc. Ratio [%] \(\uparrow\) Comp. Ratio [%] \(\uparrow\) 说明
完整方法 (Full Method) 0.88 99.99 88.32 包含所有几何模块与完整损失组合
w/o 平面约束 (Planar Constraint) 1.19 99.04 88.58 未强制高斯扁平化,表面拟合精度明显下滑
w/o 邻域选择 (Neighborhood Selection) 1.26 98.59 85.14 缺少切平面互见与法向过滤,拓扑连接易错连
w/o 直接三角化 (改为 Poisson 重建) 0.89 99.98 84.49 采用泊松重构虽精度接近但完整度下降且失去在线性
w/o 局部重新网格化 (Local Remeshing) 1.32 97.99 91.10 接缝产生拓扑撕裂与冲突,几何精度显著下降
w/o 动态冻结 (Freezing) 0.92 99.59 89.27 全局持续优化带来参数退化与高昂显存开销
仅基线损失 (Baseline) 1.13 98.58 86.34 仅使用基础渲染损失
+ \(\mathcal{L}_{sparse}\) 1.09 98.92 86.50 抑制半透明杂质高斯
+ \(\mathcal{L}_n\) + \(\mathcal{L}_{sparse}\) 0.95 98.72 86.13 增强高斯图元法向一致性
+ \(\mathcal{L}_{plane}\) + \(\mathcal{L}_{sparse}\) 0.93 99.78 86.50 平面拉拽直接拉平离散几何误差
+ \(\mathcal{L}_{plane}\) + \(\mathcal{L}_n\) 0.90 99.77 86.04 结合平面贴合与法向对齐

关键发现

  • 局部平面拉拽约束的决定性贡献:消融表明,引入 \(\mathcal{L}_{plane}\)\(\mathcal{L}_n\) 能够直接将几何重建误差从 1.13 cm 压制到 0.88 cm。缺乏几何拉拽时,仅靠深度渲染光线反向传播只能恢复粗糙的物体轮廓,重建网格呈现明显的凹凸不平与噪点,而平面约束促成了大面积平滑连续表面的生成。
  • 直接三角化的高效与轻量:将网格提取从隐式场查询转变为切空间内的二维极角贪心连边,使网格提取时间由几百秒压缩至 5.34 秒,且生成的三角形紧密贴合物理表面,避免了 Marching Cubes 在空白或近平面区域生成冗余密集面片的问题。
  • 几何筛选阈值 \(\tau\) 的权衡关系:阈值 \(\tau\) 负责判定哪些高斯图元具有真实的几何意义。实验证明,过小的 \(\tau\)(如 \(0.0001\))会导致许多微小结构被误删造成几何空洞;过大的 \(\tau\)(如 \(0.1\))虽微幅提升了完整度,但会吸纳过多漂浮的杂散高斯,损害几何精度。系统最终选取 \(\tau = 0.001\) 达到了精度与完整度的最优折中。

亮点与洞察

  • 将 3DGS 解锁为显式顶点拓扑直接载体:改变了以往 3DGS 只能作为渲染器或需要先转成隐式场再抽网格的固有范式,直接将高斯中心作为网格顶点,通过切平面局部排序实现了秒级、水密的显式表面增量重建。
  • 切向松弛的平面拉拽机制:通过点面投影损失仅沿法向对高斯中心施加约束,既能抚平深度传感器测量噪声,又保留了图元沿物体表面切向自由滑动以精准拟合纹理边缘的能力。
  • 常数级开销的动态区域冻结:基于观测计次和损失收敛性判定成熟区域并脱离计算图,成功打破了连续在线建图时显存随场景面积单调暴涨的瓶颈,使得 3DGS 在真实机器人巡检与边缘设备上的实时部署成为可能。

局限与展望

  • 强依赖高质量深度传感器输入:本方法依赖输入的初始带法向点云及深度图作为几何拉拽依据,在强反光、透明介质或远距离室外等深度传感器失效场景下表现会受到限制;未来可探索单目纯 RGB 输入下的自监督几何表面收敛机制。
  • 对未观测盲区缺乏先验补全能力:由于直接在几何高斯图元上进行拓扑连边,对于视线遮挡、死角等无观测区域无法像神经隐式场那样依靠全局先验“自动脑补”完整表面,可能在复杂死角处遗留网格孔洞。

相关工作与启发

  • vs TSDF / KinectFusion [18]:传统 TSDF 方法依赖固定分辨率的离散体素网格,在大场景中显存呈立方级暴增且细节受体素栅格限制;本文基于自适应高斯微元与局部三角化,仅需 2.3 GB 显存即可实现精细表面与逼真纹理渲染。
  • vs SuGaR [7] / GOF [27]:SuGaR 与 GOF 均需离线等待所有高斯图元收敛后,再调用 Poisson 重建或 Marching Tetrahedra 全局抽取网格,单次网格抽取耗时达数百秒;本文提出了切平面直接三角化算法,将抽取耗时压至 5 秒内,支持新观测帧到来时的逐帧增量局部缝合。
  • vs RTG-SLAM [19]:RTG-SLAM 实现了高斯实时建图,但其提取网格必须借助球旋转算法(Ball Pivoting Algorithm)等离线点云后处理;本文在优化端通过平面拉拽约束原生保证高斯贴合真实表面,端到端在线生成高质量水密三角形网格。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 创新性地将 3D 高斯作为显式网格顶点直接进行切平面局部三角化与在线缝合,摆脱了隐式场依赖。
  • 实验充分度: ⭐⭐⭐⭐☆ 在 Replica 与 ScanNet++ 数据集上提供了详实的几何精度、渲染质量、运行帧率、显存开销及充分的模块/损失消融对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 结构清晰完整,数学形式严密,图文对照直观,问题动机与技术方案层层递进。
  • 价值: ⭐⭐⭐⭐☆ 为神经辐射场与显式网格在线增量重建的结合提供了极具参考价值的工程范式,对机器人实时建图与 AR 具有显著实用价值。