LEGO: Leveled Language Gaussian Splatting¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://pz0826.github.io/LEGO-Webpage/
领域: 3D视觉
关键词: 高斯泼溅, 3D语义层级, 开放词表场景理解, 3D场景图, 链式检索
一句话总结¶
针对现有 3D 语言高斯泼溅受制于 2D 视角依赖或单一尺度超参的缺陷,LEGO 通过自适应多视角峰值检测将多粒度 SAM 掩码重评定为 3D 一致的结构层级,结合解耦特征对比蒸馏与层级语言场景图,实现了多层级开放词表分割与复杂空间链式推理。
研究背景与动机¶
三维开放词表场景理解正从粗粒度的闭集分类演进为对任意概念的开放式解析。然而现实世界的语义本质上是多层级嵌套的,人类对场景中物体的感知天然存在自粗至细的结构隶属关系,例如“花盆 → 花束 → 花苞 → 花瓣”。构建真正鲁棒的 3D 开放词表系统,不仅需要识别孤立物体的语义标签,更要在三维空间中显式建模这种内在的语义层级。
目前利用 Segment Anything Model (SAM) 构建 3D 层级分割的主流范式存在两类根本矛盾:一是基于 2D 粒度的直接蒸馏方法强行将 SAM 预设的“整体-部分-子部分”映射到 3D 空间,但 2D 粒度严重依赖视距与视角变化(例如同一种花朵在远景中呈现为完整花苞,在近景中则被切分成独立花瓣),跨视角标签冲突导致三维层级模糊;二是基于 3D 绝对物理尺度的聚类方法,虽然具备视角不变性,却因同类物体内部天然存在的尺寸差异而遭遇“语义-尺度割裂”(例如花束中尺寸差异悬殊的花朵,在固定尺度阈值下,大花被过度分割为花瓣,而小花仍保持整朵状态)。
本文认为,构建精准 3D 语义层级的关键在于从视点相关的 2D 粒度和人工设定的物理尺度,跃迁至内在的结构层级(Structural Levels)。核心 idea:将多视角 SAM 掩码视为对场景语义层级的局部不完整观测,利用局部空间共视掩码的 3D 物理尺度直方图自适应重评定其层级标签,并在正交解耦的特征子空间中进行层级对比蒸馏,进而构建层级语言场景图赋能 LLM 上下文感知推理。
方法详解¶
整体框架¶
LEGO 的整体流程始于多视角图像与由 MASt3R-SfM 重建的三维高斯初值。系统首先在预处理阶段聚合所有 2D SAM 掩码,反投至 3D 空间估算物理尺度,并通过局部共视峰值检测自适应分配三维一致的结构层级;随后,设计层级密集指标与解耦特征对比损失,独立优化各高斯基元的层级身份嵌入;最终,结合最优视角选择提取 CLIP 语义特征,并将分割实体按垂直隶属度与水平邻接度升华为层级语言场景图,交由大语言模型执行链式检索。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多视角图像 + 几何点云输入"] --> B["3D 物理尺度估计与局部峰值层级重评定<br/>消除视角依赖与语义-尺度割裂"]
B --> C["层级一致性密集指标构建<br/>单调性/递归包含/结构继承约束"]
C --> D["解耦特征空间层级对比蒸馏<br/>独立优化各层级并施加单位超球归一化"]
D --> E["递归自顶向下层级场景聚类<br/>HDBSCAN 分割生成树状结构基元"]
E --> F["视角感知语义嵌入与层级语言场景图<br/>最优视角 CLIP 特征绑定与 CoR 空间推理"]
F --> G["多层级开放词表分割与空间查询输出"]
关键设计¶
1. 3D 物理尺度估计与局部峰值层级重评定:化解跨视角粒度冲突 传统方法直接使用 SAM 的粒度标签,导致近景与远景下的结构归属互相矛盾。针对该痛点,LEGO 建立像素到三维点云的投影映射 \(F: u \mapsto p\)。对于全局池中的任意 2D 掩码 \(m_i\),将其像素反投影为 3D 点集 \(P_{m_i} = \{F(u) \mid u \in m_i\}\),并以点集标准差定义其物理空间尺度 \(s_i = 2\sqrt{\sum_{d \in \{x,y,z\}} \text{std}(P_{m_i, d})^2}\)。随后在空间共视邻域 \(\mathcal{N}(m_i) \cup \{m_i\}\) 内统计尺度直方图,自适应检测出 \(L\) 个由粗至细的主峰 \(K_i = \{p_1, p_2, \dots, p_L\}\),并将 \(m_i\) 投射至最近峰所代表的离散层级: $\(l_i = \arg\min_{l \in \{1,\dots,L\}} |s_i - p_l|\)$ 该设计将视角受限的 2D 局部观测缝合成全局一致的语义组成阶数,从物理尺寸代理自然涌现出语义层级。
2. 层级一致性密集指标构建:解决层级稀疏掩码监督崩塌 由于场景推断出的 3D 层级数显著多于 SAM 自带的 3 种粒度,单个层级重评定后分配到的有效掩码高度稀疏,直接监督会导致特征场崩塌。LEGO 引入像素对并行指示器 \(\mathbb{I}_k(i, j)\),判断视点下像素 \(i\) 与 \(j\) 是否属于同一第 \(k\) 层实体。为确保拓扑有效性,指示器严格遵循三项公理:单调性(粗层合并的像素在深层只可分裂、绝不重新融合)、递归包含(细粒度同实体严格要求在全部父层同属一体)与结构继承(当目标层缺乏有效掩码时,自动从最近父层继承有效标签)。这为大规模高斯优化提供了无冲突、密实且高度并行化的成对监督信号。
3. 解耦特征空间层级对比蒸馏:防止跨层级语义缠绕与高斯混合衰减 为彻底杜绝上下层级间的特征干扰,LEGO 为每个高斯基元配备复合身份特征 \(f \in \mathbb{R}^{L \times d}\),解耦为 \(L\) 个独立的 \(d\) 维子空间,第 \(k\) 层的特征 \(f_k \in \mathbb{R}^d\) 仅负责该层级的对比学习。对于渲染特征图 \(F_{v,k}\),利用尺度平衡权重 \(w_k^{i,j} \propto (A_i^k \cdot A_j^k)^{-1}\) 消除大面积物体主导梯度的失衡问题,结合余弦对比损失与正样本 \(L_2\) 紧凑性惩罚 \(\mathcal{L}_{pos} = \|F_{v,k}^i - F_{v,k}^j\|_2^2\)。针对体积渲染沿光线插值引起的视角虚假特征衰减,将 3D 基元与其投影 2D 特征均约束至单位超球面上: $\(\mathcal{L}_{3d} = \left|1 - \|\mathbf{f}_k\|_2\right|, \quad \mathcal{L}_{2d} = \left|1 - \|\mathbf{F}_{v,k}^i\|_2\right|\)$ 优化收敛后,在每一层递归执行 HDBSCAN 聚类,产生严格嵌套的树状结构实体。
4. 视角感知语义嵌入与层级语言场景图:驱动 LLM 空间链式检索 单纯的均值池化易引入视线遮挡引起的视觉噪声。LEGO 提出最优视角选择策略,依据“3D 可视度”、“2D 视场覆盖率”以及“与 2D SAM 掩码的语义对齐 IoU”综合评分 \(S(c, v)\),筛选出前 \(\tau\) 个高质量视点,裁剪后输入 CLIP 编码并加权聚合为无污染的开放词表特征 \(E_c\)。在图结构构建上,定义垂直方向的包含边 \(E_{hier}\) 与水平方向的外接球相交邻接边 \(E_{adj}\)。在面对如“找到擀面杖旁边水壶的把手”等复合查询时,大语言模型将其分解为链式检索路径(擀面杖 → 水壶 → 把手),以粗粒度物体为空间针脚逐层下钻,彻底解决单一 CLIP 嵌入的词袋混淆缺陷。
损失函数 / 训练策略¶
训练过程对每个高斯视点 \(v\) 与层级 \(k\) 端到端联合优化总损失: $\(\mathcal{L}_{total} = \mathcal{L}_{contrast} + \lambda_{pos} \mathcal{L}_{pos} + \lambda_{norm} (\mathcal{L}_{3d} + \mathcal{L}_{2d})\)$ 其中层级对比损失采用尺度平衡归一化。在特征收敛后,直接在静态高斯场上完成自顶向下的聚类切分,无需额外的后处理网络微调。
实验关键数据¶
主实验¶
论文在可提示分割(NVOS、SPIn-NeRF)以及开放词表 3D 理解(LERF-OVS、Mip-NeRF 360)等基准上进行了详尽评测。
| 数据集 | 指标 | LEGO(本文) | 强基线(SAGA/LaGa) | 次优基线 | 提升幅度 |
|---|---|---|---|---|---|
| NVOS | mIoU(%) | 94.2 | 92.6 (SAGA) | 92.2 (SA3D-GS) | +1.6% |
| NVOS | mAcc(%) | 98.7 | 98.6 (SAGA) | 98.6 (COB-GS) | +0.1% |
| SPIn-NeRF | mIoU(%) | 94.2 | 93.4 (SAGA) | 94.3 (OmniSeg3D) | 与SOTA持平 |
| SPIn-NeRF | mAcc(%) | 99.3 | 99.2 (SAGA) | 99.3 (OmniSeg3D) | 持平 |
| LERF-OVS | 定位 mAcc(%) | 88.4 | 80.3 (LaGa) | 84.3 (LangSplat) | +4.1% (相比次优) |
| LERF-OVS | 分割 mIoU(%) | 68.4 | 64.0 (LaGa) | 61.3 (Occam's LGS) | +4.4% |
| Mip-NeRF 360 | 定位 mAcc(%) | 92.6 | 85.6 (LaGa) | 88.7 (GAGS) | +3.9% |
| Mip-NeRF 360 | 分割 mIoU(%) | 73.0 | 63.7 (LaGa) | 69.4 (LangSplatV2) | +3.6% |
在包含 120 个复杂空间与从属关系的 Chain-of-Retrieval (CoR) 专项测试基准中,LEGO 的图检索能力相比对比方法优势极为显著:
| 方法 | Teatime mIoU(%) | Kitchen mIoU(%) | Bonsai mIoU(%) | Counter mIoU(%) | Overall mIoU(%) |
|---|---|---|---|---|---|
| BBQ | 5.6 | 2.6 | 8.1 | 8.2 | 6.1 |
| THGS | 9.9 | 5.0 | 10.3 | 12.9 | 9.5 |
| LaGa (原生) | 5.8 | 5.2 | 12.0 | 10.4 | 8.3 |
| LaGa w/ CoR | 8.4 | 14.5 | 13.8 | 20.5 | 14.3 |
| LEGO w/o CoR | 25.2 | 10.0 | 30.2 | 25.6 | 22.7 |
| LEGO (完整方案) | 52.2 | 44.9 | 57.6 | 51.4 | 51.6 |
消融实验¶
在 Mip-NeRF 360 的 Room 复杂室内场景中对核心训练组件进行逐项消融验证:
| 配置 | 尺度再加权 (W) | 正样本 L2 惩罚 (\(\mathcal{L}_{pos}\)) | 单位模长归一化 (\(\mathcal{L}_{3d/2d}\)) | mAcc(%) | mIoU(%) | 说明 |
|---|---|---|---|---|---|---|
| 完整模型 | ✓ | ✓ | ✓ | 93.1 | 67.3 | 完整模型性能最优 |
| 去除尺度加权 | ✗ | ✓ | ✓ | 86.2 | 63.6 | 大物体梯度主导,微小物体学习受损 (-3.7% mIoU) |
| 去除正样本L2 | ✗ | ✗ | ✓ | 86.2 | 62.3 | 余弦相似度聚拢不足,边界模糊 (-1.3% mIoU) |
| 去除特征归一化 | ✗ | ✗ | ✗ | 82.8 | 60.7 | 渲染加权捷径导致 3D 视角一致性崩塌 (-1.6% mIoU) |
关键发现¶
- 细粒度微小物体分割优势巨大:在包含复杂食材与微小部件的场景中(如拉面碗中的“玉米粒”、“洋葱丁”,盆景场景中的“钢琴踏板”),基线往往混淆于整碗面或整架钢琴,而 LEGO 在 Ramen 场景上实现了超过最佳基准 +11.2% mAcc 与 +11.9% mIoU 的性能跃升。
- 尺度平衡权重的决定性:消融实验表明,缺乏尺度加权(\(\mathcal{W}\))直接导致 mAcc 暴跌 6.9%,证明在多层级任务中平衡不同物理尺度物体的梯度至关重要。
- 场景图对复杂推理的使能效果:在 CoR 任务上,缺少场景图引导的直接 CLIP 相似度查询仅能达到 22.7% mIoU,而结合层级场景图的链式推理飙升至 51.6%,验证了“空间粗粒度锚定 + 细粒度语义下钻”的有效性。
亮点与洞察¶
- 将 2D 粒度矛盾转化为局部尺度聚类:将 SAM 碎片化、随视距漂移的多粒度掩码视作对连续三维尺度空间的离散采样,利用局部空间邻域直方图自适应寻找峰值,优雅地绕开了手工预设尺度或固定三层划分的死板限制。
- 解耦特征空间杜绝语义污染:针对多层级表征中“粗物体特征侵蚀细微部件”的常见痼疾,采用独立的子空间向量对应不同物理层级,辅以超球面长度归一化,保证了光线渲染时高斯混合特征的纯净度。
- 多层级场景图打通 LLM 空间交互:将传统的离散辐射场分割拓展为带有垂直从属与水平拓扑关系的语义图,使大模型具备了在三维空间中按图索骥的能力。
局限与展望¶
- 依赖初始几何重建质量:物理尺度的准确计算严重依赖 MASt3R-SfM 产生的点云精度,在弱纹理或高反光导致的几何退化区域,尺度估计偏差可能传导至层级重评定。
- 动态场景拓展受限:目前框架假设场景静态,若存在物体形态变化或移动部件,局部的空间共视与层次拓扑将面临重构难题。
- 未来方向:可进一步探索结合开放世界多模态大模型的自反馈拓扑修正,并在机器人具身操作中利用此种层级场景图进行细粒度机械臂抓取规划。
相关工作与启发¶
- vs SAGA / OmniSeg3D: 传统 3D 交互分割依赖全局物理尺度参数或交互式点击,难以直接自适应解析整场景的复杂内嵌层级;LEGO 实现了全自动自顶向下的稳定层次化挖掘。
- vs LangSplat / LaGa: 现有多层级语言高斯大多机械套用 SAM 的三级粒度,受困于 2D 视角依赖导致的近景/远景粒度冲突;LEGO 提出的 3D 一致层级重评定与解耦特征蒸馏从根本上解决了标签冲突问题。
- vs BBQ / THGS: 现有 3D 场景图方法缺乏细粒度语义层级或受限平铺对象层级;LEGO 构建的层级场景图完整保留了从大物体到极端微小部件的垂直包含关系。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出将跨视角 2D SAM 粒度通过 3D 尺度聚类重评定为绝对结构层级,思路新颖且洞察深刻。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖可提示分割、开放词表理解、极细粒度解析与自建 120 复杂查询 CoR 基准,消融与对比极详尽。
- 写作质量: ⭐⭐⭐⭐⭐ 概念界定清晰,三层架构与数学机制推导严密连贯。
- 价值: ⭐⭐⭐⭐⭐ 为 3D 高斯泼溅走向精细化可解释场景理解与具身智能空间交互提供了重要的基础支撑。