Graph-GSReg: Leveraging 3D Scene Graphs for Gaussian Splatting Registration¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://lee-jaewon.github.io/Graph-GSReg/
领域: 3D视觉
关键词: 3D高斯泼溅, 场景图配准, 场景拼接, 最大团搜索, 测试时优化
一句话总结¶
将 3D 高斯泼溅场景升维构建为融合几何与语义属性的 3D 场景图,利用 TRIMs 距离一致性约束与最大团搜索求解刚体配准,并通过自监督测试时优化消除拼接伪影与空洞,实现免预训练的高质量大场景无缝融合。
研究背景与动机¶
在大规模三维建图、机器人具身导航以及虚拟现实应用中,3D 高斯泼溅(3DGS)凭借极高的渲染保真度与实时的推流速度,已迅速成为主流的新型地图表征。然而,在真实开放物理世界中,单次手持扫描或机器人单程巡航几乎不可能完整覆盖整座建筑或复杂环境;同时,直接在超大场景下端到端优化海量高斯基元会导致显存消耗指数级激增,引发严重的优化不稳定与内存崩溃。因此,将大规模空间解构为局部子场景分别重构,再将多个独立生成的 3DGS 地图鲁棒对齐并无缝拼接,成为实现长期大尺度场景建图的必由之路。
然而,现存的 3DGS 配准与融合方案面临着严重的机制瓶颈。一方面,基于深度学习的点云配准范式(如 GaussReg)依赖在大规模配准数据集上预训练的高斯特征网络,泛化代价高昂;且其拼接阶段采用粗暴的场景中心欧氏距离截断,容易在尺度或分布不均的场景交界处造成大片结构缺失与空洞。另一方面,依赖通用大模型的跨图像匹配方案(如 PhotoReg)借助 DUSt3R 等 2D 基础模型对渲染视点对进行粗对齐,再执行耗时数分钟的光度迭代优化;一旦粗阶段在弱纹理或大视差下失准,微调阶段便极易陷入局部极值,且简单的直接并集叠加会在重叠区域滋生大量的半透明悬浮伪影(floaters)与冗余噪点。
这一困境的核心症结在于:3DGS 原始高斯基元本质上是一堆仅携带空间坐标、协方差、不透明度与球谐颜色的无序低级微元,缺乏高阶语义辨识度与几何上下文结构,难以在空间不完全重叠时建立可靠对应。为此,本文提出将低层次的高斯微元升维为包含物体几何质心与局部上下文特征的 3D 场景图,将场景配准转化为图兼容性与全局一致性搜索,并设计无需人工标注的自监督测试时优化。核心 idea:将低级 3DGS 基元升维为包含物体节点与局部上下文嵌入的 3D 场景图,利用成对距离一致性约束构建兼容图并通过最大团搜索求解鲁棒刚体配准,最后以原场景各视角重渲染为自监督参考进行测试时优化,实现无需监督训练的无缝场景融合。
方法详解¶
整体框架¶
Graph-GSReg 的整体流程接收两个待对齐的独立 3DGS 场景模型 \(S^A=(G^A, C^A)\) 与 \(S^B=(G^B, C^B)\),其中包含高斯基元集合 \(G\) 与对应训练相机位姿集 \(C\)。系统首先从均匀采样的子集视点重渲染高斯场景,借助 2D 分割与视觉大模型提取物体掩码及特征,并将其反投影回 3D 空间以跨帧关联形成具有全局一致性的 3D 场景图;接着,系统计算节点对语义嵌入相似度生成候选匹配,利用成对刚体测距不变量(TRIMs)构建兼容图,并通过最大团搜索解出最大几何一致内点集,通过 SVD 求解刚体变换并辅以高斯质心 ICP 精修;最终,系统对刚体变换对齐后的高斯集执行空间体素化去冗余,并利用原始场景视角重渲染作为自监督目标进行测试时轻量微调,生成无空洞且无悬浮伪影的统一 3DGS 场景。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:独立 3DGS 场景对 (S^A, S^B)"] --> B["跨帧关联与上下文增强的 3D 场景图构建<br/>渲染采样视点 + SAM/CLIP 提取 + 3D GIoU 跨帧关联 + 3-hop 局部直方图"]
B --> C["TRIMs 距离一致性约束与最大团配准<br/>语义余弦相似度候选 + 刚体距离比率约束兼容图 + 最大团过滤 + SVD/ICP 求解位姿"]
C --> D["体素化初筛与自监督测试时优化融合<br/>SE(3) 对齐并集 + 0.01m 空间体素化降冗余 + 原场景重渲染 L1 损失微调"]
D --> E["输出:无缝统一的合并 3DGS 场景"]
关键设计¶
1. 跨帧关联与上下文增强的 3D 场景图构建:从无序高斯到高阶语义几何节点
针对高斯微元底层表征缺乏语义理解、不同视角重建基元难以建立显式对应的问题,该模块利用预训练 3DGS 的高保真可渲染特性,将无序微元抽象为物体级 3D 场景图。算法首先在相机位姿集 \(C^X\) 中均匀下采样得到关键视点子集 \(C^X_{\text{sampled}}\) 并渲染图像。对每张图像,利用 SAM 提取高置信度物体掩码,并通过 CLIP 编码器提取该掩码区域的视觉语义特征。随后,算法根据相机内参 \(K\) 与外参 \((R_j^X, T_j^X)\),将场景中所有三维高斯中心 \(\boldsymbol{\mu}_i\) 透视投影到像平面坐标 \(\mathbf{p}_{i,j}^X\)。凡落在当前物体掩码内且位于相机前方的三维高斯点集被聚合为物体点云 \(\mathcal{A}_{j,k}^X\),其均值坐标即作为该物体节点的空间 3D 质心 \(\mathbf{x}_{j,k}^X\): $\(\mathbf{x}_{j,k}^X = \frac{1}{|\mathcal{A}_{j,k}^X|} \sum_{\boldsymbol{\mu}_i \in \mathcal{A}_{j,k}^X} \boldsymbol{\mu}_i\)$ 为了克服多视差下的碎片化分割,算法执行跨帧增量节点关联:当后续帧新出现的掩码高斯点集与已有节点在 CLIP 图像特征余弦相似度与 3D 广义交并比(GIoU)之和超过阈值 \(\tau_{asso}\) 时,判定为同一物体并合并,合并后对点云进行体素下采样并融合归一化 CLIP 特征;反之则开辟新节点。最后,为防止仅凭单一外观特征在重复纹理或相似家具间发生混淆,系统在基于空间距离阈值建立的局部拓扑图上,统计各节点 3-hop 邻域内的 CLIP 特征直方图 \(f_{\text{hist}}(v)\),并将节点归一化语义特征与其拼接得到最终嵌入 \(f(v) = [f_{\text{CLIP}}(v), f_{\text{hist}}(v)]\),兼顾个体外观与空间拓扑上下文。
2. TRIMs 距离一致性约束与最大团配准:全局几何一致性下的无监督鲁棒配准
针对跨场景初筛对应对中存在大量假阳性匹配的问题,该设计将对应对之间的空间几何刚性约束编码进图结构,化解局部歧义。首先,基于拼接后的节点嵌入余弦相似度筛选出初筛候选对应集合 \(\mathcal{V}_{\text{comp}} = \{(q', p') \mid s(q', p') \ge \tau_{\text{node}}\}\)。由于错误匹配虽可能在个别视角具有相似外观,但必然违背刚体运动下物体间相对几何距离守恒的物理定律,本文引入平移与旋转不变量(TRIMs)在候选对之间构建兼容图 \(G_{\text{comp}}\)。两个候选对 \((q'_1, p'_1)\) 与 \((q'_2, p'_2)\) 之间连边的充要条件是它们在各自场景中的两两欧氏距离比值严格逼近 1: $\(((q'_1, p'_1), (q'_2, p'_2)) \in \mathcal{E}_{\text{comp}} \iff 1 - \tau_{\text{TRIMs}} < \frac{\|q'_1 - q'_2\|}{\|p'_1 - p'_2\|} < 1 + \tau_{\text{TRIMs}}\)$ 在兼容图中,所有真正满足同一刚体变换的正确对应对将在拓扑上互相连通,构成极高密度的全连接完全子图(团);而偶然满足某一条距离约束的异常值匹配则无法与其他所有正确对应保持互通。通过在兼容图上求解最大团(Maximum Clique),能够以极高确定性滤除所有离群点,提取出全局几何一致的最大内点集。随后通过 SVD 闭式解求出粗对齐刚体矩阵 \(T_{\text{graph}} \in SE(3)\)(若含尺度缩放则调用 Umeyama 算法),并以此为初始位姿对两场景的高斯点云执行轻量 ICP 精调,获得亚毫米级精确变换 \(T_{AB}\)。
3. 体素化初筛与自监督测试时优化融合:利用原场景参考消除伪影与空洞
针对刚体变换后两组高斯在重叠过渡区由于微小位姿误差、视角覆盖不对称导致的密度重叠悬浮伪影(floaters)与遮挡空洞问题,该设计摒弃了传统按中心距离硬截断剔除点云的破坏性做法。系统将变换后的高斯场景 \(G^{B'} = T_{AB}(G^B)\) 与 \(G^A\) 初始直接求并集 \(G^A \cup G^{B'}\),首先在空间施加 0.01m 分辨率的三维网格体素化下采样,迅速剔除重叠区域内物理空间完全重复冗余的高斯点,降低显存并提供平滑的初始化底模 \(G^{\text{merged}}\)。 由于场景合并缺乏真实完整场景的物理真值,本模块发掘出关键先验:两个原始子场景在其各自历史位姿 \(C^A\) 与 \(C^{B'}\) 下本身就是高保真渲染器。因此,算法将合并场景 \(G^{\text{merged}}\) 沿各个原始视点进行可微渲染,并强制其与对应原始视点渲染图保持一致。在仅需 1 分钟左右的极快测试时优化中,最小化全局视点下的光度 \(L_1\) 渲染损失: $\(\arg\min_{G^{\text{merged}}} \sum_{j} \left\| \textit{Render}(G^{\text{merged}} \mid R_j^X, T_j^X) - I_j^X \right\|_1, \quad X \in \{A, B'\}\)$ 该过程自适应调整重叠交界处高斯基元的不透明度、位置与球谐系数,使冗余漂浮高斯自然衰减淡出,而视线受阻区域被平滑填补,既保全了全场景所有原始视角的结构完整性,又实现了无缝过渡。
损失函数 / 训练策略¶
整个配准流水线无需任何预训练权重微调,仅依赖冻结的通用 SAM 与 CLIP 基础模型。在场景合并阶段,测试时自监督微调仅针对合并后高斯参数 \(G^{\text{merged}}\) 进行梯度反向传播。优化过程在单卡 NVIDIA RTX 4070 上执行约 1 分钟,批次遍历全部采样视点,学习率与原始 3DGS 训练策略保持兼容,仅计算 \(L_1\) 图像重建差异即可收敛。
实验关键数据¶
主实验¶
论文在真实室内基准 ScanNet-GSReg(包含 82 个部分重叠场景对)与大规模多房间合成基准 uHumans2(包含 69 个局部重叠场景对)上进行了全方位评测。衡量配准精度的指标包括相对旋转误差(RRE,单位度)、相对平移误差(RTE)、相对尺度误差(RSE)以及绝对平移误差(ATE,单位米);衡量融合渲染质量的指标包括 PSNR、SSIM 以及感知误差 LPIPS。
表 1:ScanNet-GSReg 真实场景配准精度与耗时对比
| 方法 | RRE (°) ↓ | RTE ↓ | RSE ↓ | 运行时间 (s) ↓ | 说明 |
|---|---|---|---|---|---|
| GaussReg (Coarse) | 3.403 | 0.061 | 0.034 | 3.700 | 依赖监督预训练网络 |
| GaussReg (w/ Fine) | 2.827 | 0.042 | 0.032 | 4.800 | 体积特征精细网络优化 |
| PhotoReg (Coarse) | 7.825 | 0.082 | - | 16.231 | DUSt3R 图像级初始对齐 |
| PhotoReg (w/ Fine) | 7.366 | 0.072 | - | 585.216 | 耗时近 10 分钟光度优化 |
| Liu et al. (骨架引导) | 2.595 | 0.045 | 0.013 | 5.041 | 骨架与自适应特征 |
| Graph-GSReg (Coarse) | 3.247 | 0.039 | 0.013 | 2.784 | 场景图最大团搜索 |
| Graph-GSReg (w/ Fine) | 1.970 | 0.025 | - | 3.658 | 最大团 + 高斯质心 ICP |
表 2:uHumans2 大规模多房间场景配准与鲁棒性对比
| 方法 | RRE (°) ↓ | RTE ↓ | ATE (m) ↓ | 运行时间 (s) ↓ | 失败机理与特性 |
|---|---|---|---|---|---|
| TEASER++ & ICP | 9.099 | 0.071 | 1.669 | 4.570 | 依赖传统几何特征 FPFH,噪声下失效 |
| MAC (FPFH) | 108.089 | 0.652 | 17.118 | 6.359 | 局部几何特征匹配混淆导致极大误差 |
| MAC (FCGF) | 60.021 | 0.335 | 8.862 | 5.462 | 深度几何特征在低重叠率下失效 |
| PhotoReg (Coarse) | 15.895 | 0.154 | 6.916 | 17.814 | 大视差下图像特征匹配漂移 |
| PhotoReg (w/ Fine) | 9.959 | 0.077 | 2.754 | 342.754 | 陷入局部极值,微调难以脱困 |
| Graph-GSReg (Coarse) | 1.748 | 0.010 | 0.243 | 1.805 | 语义图结构初解准确稳健 |
| Graph-GSReg (w/ Fine) | 0.711 | 0.006 | 0.192 | 3.782 | 绝对平移误差降至 0.19m 级 |
表 3:不同场景融合策略在统一配准基准下的渲染画质对比
| 配准基准 | 拼接融合策略 | ScanNet PSNR ↑ | ScanNet SSIM ↑ | ScanNet LPIPS ↓ | uHumans2 PSNR ↑ | uHumans2 SSIM ↑ | uHumans2 LPIPS ↓ |
|---|---|---|---|---|---|---|---|
| Oracle (单场景渲染) | 理论上界(无融合) | 22.2913 | 0.8566 | 0.3347 | 32.0999 | 0.9218 | 0.1416 |
| 真值位姿 (GT) | PhotoReg 直接合并 | 20.1588 | 0.8117 | 0.3844 | 20.9777 | 0.7081 | 0.3316 |
| GaussReg 距离截断 | 20.9512 | 0.8306 | 0.3551 | 23.3410 | 0.7368 | 0.2871 | |
| Graph-GSReg (Ours) | 21.8954 | 0.8465 | 0.3484 | 25.4032 | 0.7608 | 0.2801 | |
| Graph-GSReg 配准 | PhotoReg 直接合并 | 19.3298 | 0.7926 | 0.4026 | 20.7897 | 0.7048 | 0.3370 |
| GaussReg 距离截断 | 20.1133 | 0.8089 | 0.3715 | 23.1519 | 0.7321 | 0.2904 | |
| Graph-GSReg (Ours) | 21.5248 | 0.8304 | 0.3698 | 25.2425 | 0.7607 | 0.2868 |
消融实验¶
消融实验深入验证了 3D 场景图构件、几何约束策略以及体素化融合的独立有效性。
表 4:3D 场景图配准各组件在 ScanNet-GSReg 上的消融分析
| 实验变体配置 | RRE (°) ↓ | RTE ↓ | RSE ↓ | 配准耗时 (s) ↓ | 机制分析与结论 |
|---|---|---|---|---|---|
| 去除 3-hop CLIP 直方图 | 4.865 | 0.052 | 0.019 | 2.755 | 仅凭局部外观易在相似家具间误匹配,误差大幅增加 |
| 去除 TRIMs 距离一致性 | 6.047 | 0.140 | 0.104 | 2.903 | 缺乏刚体相对距离校验,异常值大量渗入,平移误差翻倍 |
| 去除最大团搜索 | 6.575 | 0.151 | 0.120 | 2.801 | 无法获取全局一致内点集,导致配准完全失常 |
| 引入 FPFH 点云几何特征 | 3.190 | 0.039 | 0.013 | 3.645 | 精度微弱提升但显著增加提取耗时,最终未选用 |
| 增大直方图至 5-hop | 3.867 | 0.045 | 0.015 | 4.341 | 邻域过大引入无关结构噪声,配准精度不升反降 |
| 极大团(CLIP-Clique 准则) | 3.981 | 0.045 | 0.013 | 2.805 | 仅挑选最高得分单团,内点覆盖不全导致鲁棒性弱于最大团 |
| 完整方案 (Ours) | 3.247 | 0.039 | 0.013 | 2.784 | 兼顾语义、几何拓扑与高计算效率的最优均衡 |
表 5:融合阶段体素化去冗余与存储开销消融分析
| 融合设置 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | 存储显存占用 (MB) ↓ | 现象与结论 |
|---|---|---|---|---|---|
| GaussReg 距离中心筛选 | 20.1905 | 0.8106 | 0.3698 | 148.18 | 距离启发式容易误删非中心高斯,导致空洞 |
| Ours (无体素化下采样) | 21.4538 | 0.8304 | 0.3675 | 238.10 | 重叠区保留全部重复高斯,显存与文件膨胀严重 |
| Ours (包含 0.01m 体素化) | 21.5248 | 0.8304 | 0.3698 | 82.84 | 显存与体积直降 65.2%,消除了重叠冗余并提升画质 |
关键发现¶
- 拓扑上下文与最大团是剔除离群点的决定性支柱:消融数据表明,去掉 TRIMs 或最大团搜索会导致旋转误差激增至 6° 以上,平移误差翻倍。这是因为纯语义外观匹配不可避免在相似结构(如同款椅子、门框)处混淆,只有刚体距离互斥过滤能形成排他性的密集全连接子图。
- 免训练方案在跨域大场景下全面逆袭:在合成数据集 uHumans2 的复杂大场景测试中,依赖监督预训练或传统低级特征的 MAC 与 TEASER++ 完全失效(RRE 高达 60°~108°),而 Graph-GSReg 粗配准即实现 1.748°,精调后达 0.711° / 0.192m,展现了高阶语义图表征对抗环境剧烈域偏移的极强泛化能力。
- 体素化预剪枝带来计算与存储的双赢:在重叠区引入 0.01m 空间网格体素化,不仅将合并后模型文件大小从 238MB 压缩至 82.8MB(优于 GaussReg 的 148MB),而且减小了测试时优化阶段在重叠密度区的光度冲突,使得重建 PSNR 进一步提高 0.07 dB。
亮点与洞察¶
- 将连续高斯微元升维为离散语义图拓扑:跳出在无序、底层高斯点云直接计算几何距离的窠臼,通过渲染-分割-反投影将高斯粒子凝结为具有几何质心和 CLIP 语义的物体节点,使 3DGS 能无缝接入经典的图匹配算法体系。
- 重渲染自监督测试时优化的巧妙闭环:在缺乏融合后全景真值标注的困境下,将两个已建好的独立子场景作为天然的无偏物理渲染参照源,通过两路视点一致性驱动 L1 损失,以极低的 1 分钟计算代价自适应消除悬浮伪影与遮挡空洞。
- 可复用的通用子图设计思想:3-hop 局部直方图增强不仅适用于 3D 场景图匹配,同样可以迁移至大模型驱动的具身空间定位(Embodied Spatial Grounding)与大尺度点云回环检测中,有效突破单一局部物体视觉特征的感知歧义。
局限与展望¶
- 依赖预建图视点渲染与离线图构建前处理:尽管图构建为一次性开销且可跨任务复用,但在建图前仍需下采样重渲染部分视角并调用 SAM 与 CLIP 进行前处理,对于极端动态环境或超低延迟的在线边缘建图仍存在计算瓶颈。
- 极端开放或无纹理空旷场景的物体检测挑战:若场景缺乏明显的离散物体(例如空旷走廊、均匀无纹理隧道),SAM 分割出的节点数量稀疏或几何质心退化,可能降低兼容图内点的置信度,需引入基于超体素或几何特征线元作为补充图节点。
- 未来改进方向:可进一步探索结合增量 SLAM 回环后端的在线动态场景图更新,以及将测试时优化拓展为支持神经辐射场与高斯泼溅跨模态联合对齐的通用框架。
相关工作与启发¶
- vs GaussReg (ECCV 2024): GaussReg 需要在密集配准数据集上端到端训练点云特征网络,并在融合时使用场景中心距离截断;而本文完全无需预训练网络,通过图结构与最大团求解,在融合时采用体素化与自监督测试时优化,彻底解决了 GaussReg 边缘挖空与跨域失效的缺陷。
- vs PhotoReg (arXiv 2024): PhotoReg 依赖通用 2D 基础模型 DUSt3R 进行初始对齐并耗时近 10 分钟迭代优化,容易受图像视差与光照干扰陷入局部解,且融合采用粗暴直接叠加;本文利用 3D 场景图仅需 3.6 秒即可解算全局高精度初值,并在 1 分钟内自监督消除叠加伪影。
- vs TEASER++ & MAC: 传统的点云几何配准算法在低重叠率或对称室内环境下因几何特征(FPFH)辨识度低而严重漂移;本文引入 CLIP 视觉特征与拓扑直方图,以多模态高阶表征赋能全局一致性配准。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [创造性地将高斯基元升维为 3D 语义场景图,并提出利用原始视角重渲染指导的自监督测试时融合机制。]
- 实验充分度: ⭐⭐⭐⭐⭐ [在真实数据集 ScanNet-GSReg 与大规模合成多房间基准 uHumans2 上进行了极其严谨的配准与渲染消融评测。]
- 写作质量: ⭐⭐⭐⭐⭐ [叙述条理清晰,图表完备,数学公式表述严谨克制,问题建模与实验分析层层推进。]
- 价值: ⭐⭐⭐⭐⭐ [为大规模 3DGS 机器人建图、子地图多机协同拼接以及长周期环境维护提供了极具实用价值的免训练工程范式。]