跳转至

Confidence-Based Mesh Extraction from 3D Gaussians

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/r4dl/CoMe
领域: 3D视觉
关键词: 3D高斯泼溅, 网格提取, 表面重建, 置信度框架, 方差约束

一句话总结

针对 3D 高斯泼溅在强视点相关与光照变化场景下易用几何伪造外观导致网格畸变的问题,提出纯自监督置信度加权、混合颜色与法向方差损失,以及解耦 D-SSIM 的外观建模,在无需大模型先验和多视图约束的高效前提下实现 SOTA 无界网格重建。

研究背景与动机

基于多视角图像的高精度三维表面重建是计算机视觉的基础核心任务。近年来,3D 高斯泼溅(3DGS)凭借显式表达和高速软光栅化,在保证高保真新视角合成的同时,极大地加速了从辐射场中提取网格几何的流程。传统范式通常在光度损失引导下加入几何正则项优化三维高斯,再以后处理方式(如 Marching Tetrahedra)提取连续三角网格。然而,3DGS 的本质属性在于几何图元与外观特征紧密耦合,每个高斯既承载位置姿态又承载球谐函数颜色,这使得几何更新与外观更新之间存在严重的模糊性。

在包含高频视点相关高光、反光或复杂光照变化的实际场景中,低阶球谐函数无法表达复杂高频反射,优化过程往往倾向于通过扭曲几何来强行降低光度误差。最典型的退化表现为:算法在半透明真实表面后方生成高不透明度的高斯图元,仅在特定视点可见以“伪造”高光,从而破坏了真实表面的几何平整度,并在致密化阶段引发恶性过度致密化(over-densification)。现有方案为了抑制这一歧义,要么引入开销巨大的多视角一致性几何约束,要么在训练中不断进行双向网格提取迭代,甚至依赖大型预训练单目深度/法向模型,这些外加模块彻底牺牲了 3DGS 固有的轻量与高速优势。

面对上述两难,能否在完全不引入任何外部大模型先验、多视图几何搜索或反复网格提取的前提下,将 3DGS 的表面提取精度推向全新高度?本文从贝叶斯不确定性与前馈重建模型中汲取灵感,将置信度机制引入显式辐射场优化。核心 idea:为每个高斯赋予可学习的自监督置信度以动态平衡光度误差与几何正则,配合抑制射线混合颜色与法向方差的收敛损失,以及仅在亮度通道解耦的外观模型,无需任何外部先验即实现高保真无界网格提取。

方法详解

整体框架

本文方法(命名为 CoMe)建立在显式辐射场与四面体网格提取(Marching Tetrahedra)流水线之上。输入为已知相机位姿的多视角图像序列,输出为完整精细的无界表面网格。整个系统在标准 3DGS 优化循环中引入了三大核心贡献:首先,对每幅输入图像联合渲染 RGB 图像与置信度图,利用自监督置信度损失动态调节光度监督的梯度权重,并据此修正高斯分裂的梯度阈值;其次,在光线累积混合阶段,引入针对图元颜色方差与法向方差的收敛正则项,迫使图元对齐到物理表面;最后,对图像传感器处理(ISP)引起的曝光变化引入解耦外观嵌入,仅在 D-SSIM 的亮度分量上使用外观修正,保障结构一致性。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视角图像 + 相机姿态"] --> B["解耦外观建模<br/>仅对L1与D-SSIM亮度项修正"]
    B --> C["前向渲染与置信度累积<br/>同时光栅化颜色、法向与标量置信度"]
    C --> D["自监督置信度框架与导向致密化<br/>动态平衡光度/几何损失并约束克隆"]
    C --> E["混合方差惩罚损失<br/>约束沿射线颜色与法向方差"]
    D --> F["几何场联合优化<br/>联合SOF几何损失"]
    E --> F
    F --> G["Marching Tetrahedra 表面提取<br/>二分查找提取高精度无界网格"]

关键设计

1. 自监督置信度框架与导向致密化:动态平衡多义性区域的光度与几何梯度

在镜面反射、细长叶片或视角稀疏观测区域,由于光度重投影误差极大,标准 3DGS 会产生剧烈的位置梯度,导致算法在这些困难区域频繁克隆或分裂细小高斯,形成严重的过度致密化并破坏宏观几何结构。为此,本文为每个三维高斯图元赋予一个标量参数 \(\gamma_i\)(初始化为 0),通过指数映射 \(\tilde{\gamma}_i = \exp(\gamma_i)\) 确保初始置信度为 1。在渲染视线 \(r\) 时,与颜色渲染完全相同,利用透明度累积权重 \(w_i(r)\) 通过 alpha-blending 渲染出像素级置信度图 \(\hat{C}(r) = \sum_{i} w_i(r) \tilde{\gamma}_i\)。随后,构建自监督置信度损失:

\[\mathcal{L}_{\text{conf}} = \mathcal{L}_{\text{rgb}} \cdot \hat{C} - \beta \cdot \log \hat{C}\]

其中 \(\beta > 0\)(默认设为 0.075)为置信度惩罚平衡超参数。由于该式对光度误差的导数满足 \(\partial \mathcal{L}_{\text{conf}} / \partial \mathcal{L}_{\text{rgb}} = \hat{C}\),当遇到难以重建的高光或遮挡模糊区域时,模型可以通过主动预测较低的 \(\hat{C} < 1\) 来下调光度梯度的缩放尺度,同时保留未受置信度缩放的几何损失(如深度-法向一致性损失),避免光度误差压倒几何约束。更关键的是,针对标准致密化策略仅依据位置梯度绝对值阈值 \(\tau_{\text{grad}}\) 的缺陷,本文引入了置信度导向的自适应分裂阈值:

\[\bar{\tau}_{\text{grad}} = \frac{\tau_{\text{grad}}}{\min(\tilde{\gamma}_i, 1)}\]

通过在分母端截断为最大为 1,确保低置信度(\(\tilde{\gamma}_i < 1\))的高斯分裂门槛大幅提高,从而在根本上遏制了困难区域无休止的病态过度致密化,使高斯总数更紧凑且分布更有利于几何重建。

2. 混合方差惩罚损失:消除沿射线图元堆叠伪造视点外观的几何歧义

即使置信度机制有效抑制了梯度失控,标准 alpha-blending 仍然存在内在缺陷:损失函数仅计算整条光线最终混合后的颜色与真实像素之差,而并不约束单个图元的自身属性。这使得优化器极易寻找“捷径”——在半透明表面后方堆叠高度不透明但不同色彩的高斯,在不同观察视角下通过几何遮挡变化拟合高频高光。为了破除这种用几何作弊的退化解,本文提出了沿光线混合的图元颜色方差损失:

\[\mathcal{L}_{\text{color-var}} = \sum_{i=0}^{N-1} w_i(r) \left\| \text{sh}(\boldsymbol{\theta}_i, d) - I_{\text{gt}} \right\|_2^2\]

在假定累积渲染颜色接近真实图像像素值 \(I_{\text{gt}}\) 的条件下,最小化该项等价于严格最小化单条射线参与混合的各图元颜色方差,直接剥夺了图元通过错落透明度伪造颜色的自由度。同理,对于点云法向,由于通过表面法向与深度梯度一致性渲染得到的像素法向同样经过了 alpha-blending,各图元法向分散会导致提取出的等值面出现大量凹凸噪声。本文进一步定义了法向方差损失:

\[\mathcal{L}_{\text{normal-var}} = \sum_{i=0}^{N-1} w_i(r) \left\| \mathbf{n}_i - N \right\|_2^2 = 1 - \|N\|_2^2\]

其中 \(N = \sum_i w_i(r) \mathbf{n}_i\) 为混合像素法向。由于单位法向满足 \(\|\mathbf{n}_i\|_2 = 1\),展开后可简化为极其精炼的解析形式 \(1 - \|N\|_2^2\)。当沿射线分布的高斯表面朝向高度一致时,累积法向量模长接近 1,损失趋于 0;一旦图元法向杂乱,累积模长骤降,损失施加惩罚,从而在零额外网格推理开销下迫使局部高斯严格与真实表面平滑对齐。

3. 解耦光照外观建模:分离 D-SSIM 亮度项以杜绝纹理梯度污染

真实多视角采集场景不可避免地存在曝光变动和光照不一致(如野外日光变化与相机 ISP 差异)。传统基于 VastGaussian 的外观修正模型通过卷积网络根据图像潜编码预测单通道修正图 \(\hat{I}_{\text{app}} = \hat{I} \odot \sigma(\mathbf{M}_i)\),但过去的工作由于认定 SSIM 纯粹测量结构信息,仅将修正图用于 L1 损失,而对 D-SSIM 仍然输入未修正的原图 \(\hat{I}\)。然而深入分析 SSIM 的三项分解式 \(l(I, \hat{I}) \cdot c(I, \hat{I}) \cdot s(I, \hat{I})\) 发现,亮度项 \(l(\cdot)\) 极度敏感于整体光照强弱,不具备光照不变性;在强光照变化下,亮度误差常比结构误差高出一个数量级,导致无外观补偿的 D-SSIM 强迫三维高斯去拟合瞬时曝光,从而在三维几何上烙下虚假明暗褶皱。若粗暴地将所有 SSIM 项均换为 \(\hat{I}_{\text{app}}\),则 CNN 上采样造成的模糊伪影又会严重污染对比度与结构项的高频梯度。针对这一机理冲突,本文提出解耦 D-SSIM 形式:

\[\mathcal{L}_{\text{D-SSIM}}^{\text{dec}} = l(I_{\text{gt}}, \hat{I}_{\text{app}}) \cdot c(I_{\text{gt}}, \hat{I}) \cdot s(I_{\text{gt}}, \hat{I})\]

仅将经外观网络补偿后的图像 \(\hat{I}_{\text{app}}\) 注入亮度比较项 \(l(\cdot)\),而对比度项 \(c(\cdot)\) 和结构项 \(s(\cdot)\) 继续使用纯高斯渲染输出 \(\hat{I}\)。该设计既消除了宏观光照不一致对几何的扭曲,又确保了底层几何优化能够接受原始、锐利的高频结构监督,显著提升了无界真实场景的几何还原度。

损失函数 / 训练策略

系统的整体优化目标由置信度加权光度损失、几何正则项以及本文提出的两项方差损失构成:

\[\mathcal{L} = \mathcal{L}_{\text{conf}} + \mathcal{L}_{\text{geom}} + \lambda_{\text{color-var}} \mathcal{L}_{\text{color-var}} + \lambda_{\text{normal-var}} \mathcal{L}_{\text{normal-var}}\]

其中几何损失项 \(\mathcal{L}_{\text{geom}}\) 继承自 SOF 基线,包括深度连续性与深度-法向一致性损失。权重参数在所有场景中保持一致:\(\lambda_{\text{color-var}} = 5 \times 10^{-1}\)\(\lambda_{\text{normal-var}} = 5 \times 10^{-3}\)。可学习置信度参数 \(\gamma_i\) 的学习率设置为 \(2.5 \times 10^{-4}\),超参数 \(\beta = 0.075\)(同时提供更轻量的 \(\beta = 0.05\) 备选项)。置信度损失 \(\mathcal{L}_{\text{conf}}\) 自第 500 次迭代起随高斯分裂致密化同步开启。训练完成后,直接利用基于二分查找的快速 Marching Tetrahedra 算法从连续不透明度场中提取无界三角网格。

实验关键数据

主实验

在经典无界大规模室外与室内场景基准 Tanks & Temples 以及高保真室内多视角数据集 ScanNet++ 上,以三维重建 F1-score(越高越好)为核心评价指标,对比主流无界网格提取与代表性有界多视角基线。所有无界方法均在单张 RTX 4090 GPU 上统一基准测试。

数据集 / 场景 PGSR (有界) QGS (有界) GOF (无界) SOF (无界) RaDe-GS (无界) MILo (无界) 本文 Ours (Full) 本文 Ours (\(\beta=0.05\))
Tanks & Temples (Avg F1) 0.496 0.474 0.453 0.474 0.461 0.485 0.521 0.505
- Barn 0.548 0.536 0.484 0.535 0.529 0.541 0.534 0.519
- Caterpillar 0.437 0.374 0.402 0.408 0.464 0.389 0.472 0.451
- Courthouse 0.238 0.183 0.288 0.297 0.316 0.322 0.333 0.315
- Ignatius 0.728 0.733 0.674 0.736 0.536 0.757 0.782 0.752
- Meetingroom 0.367 0.374 0.275 0.309 0.343 0.281 0.372 0.358
- Truck 0.658 0.645 0.596 0.558 0.576 0.617 0.634 0.637
优化耗时 (Runtime) 28 min 41 min 40 min 17 min 8 min 60 min 18 min 16 min
ScanNet++ (Avg F1) 0.631 0.573 0.623 0.615 0.613 0.624 0.668 0.667

消融实验

在 Tanks & Temples 与 ScanNet++ 上逐步拆解各项自监督设计组件的量化贡献(Precision、Recall 与 F1-Score):

配置 Tanks & Temples F1 ScanNet++ F1 说明
SOF [49] (基线) 0.474 0.615 基础 3DGS 无界表面提取框架
+ 解耦外观建模 (Improved Appearance) 0.493 0.625 独立提升 0.019 / 0.010,克服真实光照漂移
+ 自监督置信度损失 (\(\mathcal{L}_{\text{conf}}\)) 0.509 0.655 动态平衡梯度并抑制难区过度致密化,室内增益显著 (+0.030)
+ 颜色方差损失 (\(\mathcal{L}_{\text{color-var}}\)) 0.519 0.658 强力约束视点相关高光引发的图元深度堆叠
+ 法向方差损失 (\(\mathcal{L}_{\text{normal-var}}\)) (Full) 0.521 0.668 促进大面积平面与精细表面的法向一致性,室内再提 0.010

解耦外观建模机制单独比对(Tanks & Temples): - 经典 VastGaussian 外观模型:F1 = 0.475 - PGSR 外观学习机制:F1 = 0.478 - H3DGS 曝光修正:F1 = 0.484 - VastGaussian 结构改进版(全项使用 \(\hat{I}_{\text{app}}\)):F1 = 0.490 - 本文仅对亮度项解耦(Ours D-SSIM Decoupled):F1 = 0.493

关键发现

  • 置信度框架贡献突出且兼顾效率:加入 \(\mathcal{L}_{\text{conf}}\) 后,ScanNet++ 的 F1-score 实现了从 0.625 到 0.655 的飞跃。这是因为室内弱纹理墙面、阴影边缘的模糊误差不再引起梯度的盲目过度更新,使几何正则项发挥了主导作用。
  • 混合方差约束切断“以几何代外观”路径:颜色方差损失对视点变化强烈的室外场景(Tanks & Temples)提升显著(+0.010),而法向方差损失对室内大平面(ScanNet++)规范化效果极佳(+0.010),两者互补。
  • 超参数 \(\beta\) 具备稳健的物理意义:\(\beta\) 代表光度误差与置信度代偿的折中点。当 \(\beta=0\) 时模型缺乏提高置信度的动力,产生严重欠重建;当 \(\beta=0.2\) 时惩罚过重导致图元爆炸;\(\beta=0.075\) 在所有数据集中无需微调即取得 SOTA,且图元总数甚至略低于无置信度基线;\(\beta=0.05\) 则可作为内存更加紧凑的轻量化部署配置。

亮点与洞察

  • 将自监督置信度转化为致密化阻尼器:传统 3DGS 极易在未观测或强镜面区域因局部重构误差过大而诱发梯度爆炸与高斯狂增。本文将学习到的图元置信度直接融入致密化分裂阈值公式的分母中,巧妙实现了“越不确定的区域越禁止滥用分裂”,从根本上改善了显式辐射场收敛的拓扑病态。
  • 将 D-SSIM 的物理分量与外观补偿精细解耦:发现并证明了 SSIM 并非完全具备光照不变性,其亮度项 \(l(\cdot)\) 在光照漂移下误差极大。将神经网络外观补偿严格限制在亮度项,同时保留原图计算对比度与结构项,既隔绝了 CNN 伪影,又卸下了光照对几何的拉扯,具有极高的跨任务通用复用价值。
  • 解析形式的法向方差极简实现:巧妙利用单位法向量模长为 1 的几何性质,将沿射线混合法向方差简化为 \(1 - \|N\|_2^2\),以微乎其微的计算代价完成了对散射高斯法向朝向的强约束。

局限与展望

  • 中度密集视点依赖:方法仍依赖相对密集的输入视图。在极端稀疏或严重遮挡场景下,置信度下调虽然避免了过度致密化,但由于缺乏强外加几何先验,在未观测死角仍可能产生空洞,未来可探索在置信度低下区域按需引入轻量单目几何先验。
  • 远景背景几何细节不足:受限于常规相机视角在远距离处采样密度较低,背景区域的高斯密度仍不够精细,未来可结合多视角扩散生成模型以补充远距离背景的几何先验。
  • 向通用 3DGS 任务扩展:自监督置信度损失具备摆脱启发式阈值、自适应控制辐射场图元增长的潜力,后续有望推广至 3D 修复(Inpainting)、超分辨率重构等广泛下游应用。

相关工作与启发

  • vs SOF / GOF: SOF 与 GOF 奠定了基于四面体网格划分的 3DGS 表面提取体系,但未解决强反射和曝光不一致导致的几何扭曲。本文作为 SOF 的直接演进,在完全不增加提取时间(18 分钟 vs 17 分钟)的前提下,通过自监督置信度和方差损失大幅扫除了表面伪影并增强了细节边缘。
  • vs MILo: MILo 在优化期间不断抽取网格并施加高斯与网格的双向一致性约束,不仅带来了每场景长达 60 分钟的高昂耗时,且极易诱发过度平滑效应抹杀真实纹理。本文无需在线网格迭代,保持了 18 分钟的极致速度,网格细节和几何完整度全面超越 MILo。
  • vs PGSR / QGS: PGSR 与 QGS 引入重型多视图极线与光度约束,仅适用于有界对象,面对室外无界复杂场景时泛化能力与处理速度受限。本文无需昂贵的多视角立体匹配,即可在无界大场景上取得更优的几何精度。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次在 3DGS 表面提取中引入图元级自监督置信度动态重权机制,并设计了 D-SSIM 亮度解耦与混合方差损失,构思精巧扎实。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 Tanks & Temples、ScanNet++ 与 Mip-NeRF 360,横向对比涵盖所有代表性基线,消融实验设计清晰完备。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,对光度-几何耦合与 D-SSIM 分量机理的分析鞭辟入里,公式简洁推导自然。
  • 价值: ⭐⭐⭐⭐⭐ 完全摒弃外部大模型与昂贵多视角迭代开销,以极小计算增量刷新无界网格提取 SOTA,对辐射场几何提取落地具备重大实用价值。