跳转至

LESV:Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding

会议: ECCV 2026
论文: ECCV 原文
PDF: 官方 PDF
领域: 3D视觉
关键词: 3D场景理解, 稀疏体素光栅化, 开放词表, 多模态特征融合, 基础模型

一句话总结

针对 3D 高斯泼溅在开放词表场景理解中空间重叠模糊与多层级语义计算开销大的瓶颈,LESV 基于显式稀疏体素与 AM-RADIO 聚集型基座模型构建确定性置信度门控融合框架,大幅削减预处理开销并在点云开放词表分割上取得 SOTA。

研究背景与动机

开放词表 3D 场景理解是空间智能、机器人具身导航与增强现实的基础能力。随着 3D 隐式神经辐射场(NeRF)与显式 3D 高斯泼溅(3DGS)的兴起,主流方案(如 LERF、LangSplat、Dr. Splat)尝试将 2D 视觉语言特征(如 CLIP、SAM)提升至 3D 图元中。早期基于 2D 特征蒸馏优化的方案依赖渲染比较,计算耗时常达数小时;近年直接特征注册(Direct Feature Registration)方案虽将特征提升时间大幅缩短,但受制于 3DGS 无结构化与各向异性椭球的物理属性,在实际查询与交互中暴露出严重的瓶颈。

当前方案的核心痛点主要体现在两个维度:其一是无结构几何带来的空间二义性。3DGS 的高斯图元在三维空间中高度重叠,将 2D 高维特征反向投影到 3D 图元必须依赖逆体积渲染的概率式加权与视点相关全局深度排序,导致物体交界处产生严重的语义渗透(semantic bleeding)与射线状伪影(ray-like spillovers),无法满足精细的 3D 原生交互需求;其二是层次化概念造成的多尺度语义二义性。三维点天然兼具局部部件、父级构件与全局物体等层级语义(例如“熊鼻子”同时属于“鼻子”、“头部”和“熊”),现有方案多依赖多层级 SAM 掩码分别提取特征并训练多组独立特征场,使得单场景数据预处理耗时高达数小时,且掩码池化操作抹杀了密集的局部细节。

面对上述两难困境,本文从三维底层几何表征与二维多模态特征编码两方面重构技术范式。在几何端,摒弃连续重叠的高斯图元,改用离散结构化的稀疏体素光栅化(SVRaster),并辅以单目先验与多分辨率 TSDF 深度置信度门控,建立物理边界清晰的确定性投影;在特征端,抛弃传统 SAM 掩码池化与多分支层次结构,借助新型聚集视觉基座模型(AM-RADIO)内在的密集语言对齐能力实现多尺度语义解耦。核心 idea:采用显式稀疏体素配合几何置信度门控建立确定性 3D 空间特征投影,并利用 AM-RADIO 稠密 Patch 标记的原生语言对齐特性单阶段解析多层级语义,实现高精度、低显存且免繁琐预处理的开放词表 3D 场景理解。

方法详解

整体框架

LESV 的整体流程由结构化几何构建、高分辨率稠密语言特征提取、几何置信度评估与确定性局部体素批量融合四个阶段构成。输入多视角 RGB 图像,一方面通过结合单目几何约束(Patch 级深度与表面法线)的稀疏体素光栅化(SVRaster)优化出几何连续且表面完整的 3D 体素场;另一方面通过自校正滑动窗口机制调用 AM-RADIO 提取原生语言对齐的稠密 Patch 特征。随后,利用从体素网格提取的多分辨率 TSDF 表面深度比对渲染深度生成几何置信度权重,指导 2D 稠密特征确定性、无冲突地聚合到对应 3D 稀疏体素中,最终支持 3D 物体检索与点云开放词表语义分割任务。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视角 RGB 图像输入"] --> B["稀疏体素几何正则化<br/>Patch 深度与表面法线单目先验约束"]
    A --> C["聚集型视觉基座稠密语义对齐<br/>AM-RADIO Patch 语言头映射"]
    B --> D["TSDF 深度置信度门控<br/>多分辨率 TSDF 网格深度比对加权"]
    C --> E["自校正滑动窗口与语义滤波<br/>高斯衰减拼接与硬阈值余弦注意力去噪"]
    D --> F["确定性局部体素批量融合<br/>O(1) 显存独立空间批次加权聚合"]
    E --> F
    F --> G["开放词表 3D 场景表征<br/>3D 物体检索与点云零样本语义分割"]

关键设计

1. 稀疏体素几何正则化:引入单目先验消除几何空洞与结构破碎

原生 SVRaster 在仅利用光度一致性训练时极易过度拟合表面颜色,导致底层显式体素出现空洞与破碎几何,直接毁坏后续投影的几何基准。为解决此问题,LESV 在体素渲染优化中引入单目结构先验。为克服单目预测与真实场景之间普遍存在的全局尺度和偏移歧义,模型引入局部 Patch 深度归一化一致性损失 \(\mathcal{L}_{\text{patch}}\),按局部区域均值与方差做标准化对比以精准保留物体轮廓和曲率拓扑;同时引入解析表面法线损失 \(\mathcal{L}_{\text{norm}}\),惩罚视线边缘和边界区域的法线偏差:

\[\mathcal{L}_{\text{patch}} = \frac{1}{|\mathcal{P}|} \sum_{p \in \mathcal{P}} \left\| \frac{\mathbf{D}_{\text{ren}}(p) - \mu_{\text{ren}}}{\sigma_{\text{ren}}} - \frac{\mathbf{D}_{\text{prior}}(p) - \mu_{\text{prior}}}{\sigma_{\text{prior}}} \right\|_1\]

通过两阶连续几何约束,确保稀疏体素不仅合成图像保真度高,且构建出闭合致密的真实三维表面。

2. 多分辨率 TSDF 深度置信度门控:抑制多视角渲染深度抖动与语义泄露

即使经过单目几何正则化,单视点下光栅化渲染得到的深度图依然包含视点依赖的高频渲染噪声,直接以此计算空间投影高斯核权重会导致语义特征发生跨表面误投。LESV 利用体素网格的显式数据结构优势,从体素内部的截断符号距离场(TSDF)中提取无视点噪声的全局一致表面网格。针对单一分辨率下粗网格丢失细部、细网格由于未观测区域产生孔洞的矛盾,提出跨多分辨率融合 TSDF,重建出拓扑连续且细节精细的全局网格。将网格重新投影回相机平面获得基准深度 \(\mathbf{D}_{\text{mesh},k}\),并根据其与渲染深度 \(\mathbf{D}_{\text{ren},k}\) 的绝对偏差构建高斯置信度权重 \(w_{\text{conf},k}\):

\[w_{\text{conf},k} = \exp\left( - \frac{|\mathbf{D}_{\text{mesh},k} - \mathbf{D}_{\text{ren},k}|^2}{2\sigma_{\text{conf}}^2} \right)\]

将此置信度与基于空间欧式几何距离的投影权重 \(w_{s,i,k}\) 相乘,得到复合体素聚合权重 \(w_{i,k} = w_{s,i,k} \cdot w_{\text{conf},k}\)。当某视角渲染深度存在遮挡穿透或漂移时,置信度迅速衰减,从机制上根除了边缘语义泄露。

3. 聚集型视觉基座稠密语义对齐:免多尺度掩码的单阶段层级语义解耦

传统方案(如 LangSplat)使用多层次 SAM 掩码进行特征池化,既丢失了精细局部纹理,又导致预处理开销翻倍。LESV 引入 AM-RADIO 聚合基座模型,该模型已在预训练阶段将 DINOv2、SAM 与 SigLIP 的特征空间相互蒸馏。研究发现 AM-RADIO 的空间 Patch 标记在未经过密集语言监督的情况下,展现出极强的稠密语言对齐涌现性。模型跳过全局分类标记,直接将密集空间标记序列 \(\mathbf{T}_{\text{patch}}\) 传入多层感知机语言头 \(h_{\text{lang}}(\cdot)\) 映射至统一对齐空间:

\[\mathbf{F}_{\text{lang}} = h_{\text{lang}}(\mathbf{T}_{\text{patch}})\]

由于每个 Patch 标记兼具 DINOv2 的细粒度局部结构与 SigLIP 的广义语义,单一特征场即可同时响应全局宏观概念(如“熊”)与微观局部构件(如“熊鼻子”),彻底规避了冗余的多层次掩码生成与多场存储负担。

4. 自校正滑动窗口与自相关去噪:突破原生分辨率限制与拼接伪影

AM-RADIO 的原生输入分辨率为 \(512 \times 512\)(上限限制严格),直接对高分辨率输入进行全图降采样会导致微小物体特征严重混叠;而使用基于注意力的学习型上采样器(如 AnyUp)又会破坏零样本检索所需的严格高维几何余弦空间。LESV 采用自校正滑动窗口机制,将高分辨率图像切分为重叠切片分别编码,并利用以切片中心为基准的 2D 高斯核权重平滑衰减边界区域,无缝拼接为高分辨率特征图 \(\mathbf{F}_{\text{high}}\)。随后,引入基于自相关递归注意力(SCRA)和硬阈值余弦相似度的全局聚合模块,直接将余弦相关性为负的噪声标记归零屏蔽,强力滤除窗口融合引入的高频语义杂波,确保最终注入体素的 2D 特征拥有锐利的物体边缘。

5. 确定性局部空间投影与可扩展批量融合:实现 \(O(1)\) 显存开销

3DGS 方案(如 Dr. Splat)将 2D 特征提升至 3D 时,必须依赖全局图元沿光线的深度排序来确定体积积累权重,在大型密集场景下内存需求暴增至 256GB 以上。与之相反,SVRaster 空间中的每个稀疏体素 \(v_i\) 拥有确定性的三维空间物理坐标,体素到物体表面的欧式距离与可见性权重完全局部可算,彻底解耦了视点之间的关联。因此,融合过程可将全场景稀疏体素任意划分为独立的空间切片(Spatial Batches),以常数级别 \(O(1)\) 的显存流水线化执行多视角聚合,将峰值内存牢牢锁定在 ~25GB 以内,具备优异的可扩展性。

损失函数 / 训练策略

几何体素场训练采用复合几何与光度损失:\(\mathcal{L}_{\text{geom}} = \mathcal{L}_{\text{rgb}} + \lambda_1 \mathcal{L}_{\text{patch}} + \lambda_2 \mathcal{L}_{\text{norm}}\)。在几何优化收敛并完成多分辨率 TSDF 网格提取后,2D 特征提取与 3D 体素融合为完全确定性的前向投影过程,无需任何额外的反向传播或下游蒸馏训练。多视角特征投影公式为:

\[\mathbf{F}_i = \frac{\sum_{k \in \Omega_i} w_{i,k} \mathbf{f}_{i,k}}{\sum_{k \in \Omega_i} w_{i,k} + \epsilon}\]

其中 \(\mathbf{f}_{i,k}\) 为视点 \(k\) 特征图在投影坐标处双线性插值所得向量,\(w_{i,k}\) 为深度距离与 TSDF 置信度联合权重。

实验关键数据

主实验

开放词表 3D 场景理解评估在 ScanNet 点云语义分割基准以及 LERF 3D 开放词表物体检索基准上展开。

表 1: ScanNet 点云开放词表语义分割性能对比 (mIoU / mAcc %)

方法 表征基座 19 类 mIoU 19 类 mAcc 15 类 mIoU 15 类 mAcc 10 类 mIoU 10 类 mAcc
LangSplat 3DGS 3.78 9.11 5.35 13.20 8.40 22.06
OpenGaussian 3DGS 24.73 41.54 30.13 48.25 38.29 55.19
LaGa 3DGS 32.50 49.10 35.50 53.50 42.60 63.20
Dr. Splat 3DGS 31.66 48.64 37.59 56.54 44.87 64.27
LESV (本文) SVRaster 53.22 70.41 54.78 73.62 65.25 82.95

表 2: LERF 开放词表 3D 物体检索对比 (mIoU % / Acc@25 %)

方法 预处理/优化策略 ramen figurines teatime waldo_kitchen 平均 mIoU 平均 Acc@25
LangSplat 3DGS + 蒸馏 5.96 / 9.86 6.05 / 8.93 18.89 / 23.73 12.96 / 18.18 10.97 15.18
OpenGaussian 3DGS + 单层对比 31.01 / 42.25 39.29 / 55.36 60.44 / 76.27 22.70 / 31.82 38.36 51.43
Dr. Splat 3DGS + 直接注册 37.49 / 69.01 61.73 / 83.93 59.45 / 72.88 52.00 / 81.81 52.67 76.91
LaGa (单层) 3DGS + 对比学习 31.60 / 46.48 49.01 / 83.93 58.73 / 89.83 38.80 / 63.64 44.54 70.97
LaGa† (多层) 3DGS + 层次对比 47.95 / 70.42 55.87 / 80.35 69.53 / 89.83 61.92 / 90.09 58.82 82.88
LESV (本文) SVRaster + 确定性融合 53.34 / 81.69 55.87 / 87.50 71.40 / 89.83 43.84 / 81.81 56.11 85.21

消融实验

消融实验围绕底层几何约束组件与视觉特征基座解耦两个方面展开验证。

表 3: 底层几何正则化与置信度门控消融 (固定使用 SAM+CLIP 特征)

配置组合 LERF 3D mIoU LERF Acc@25 ScanNet mIoU ScanNet mAcc 说明
Dr. Splat (3DGS 基线) 52.76 76.91 31.66 48.64 经典 3DGS 逆体积渲染基准
SVRaster (Vanilla 原生) 50.80 70.63 30.62 48.90 无单目几何监督,几何表面易出现空洞
+ 单目先验监督 (\(\mathcal{L}_{\text{patch}}+\mathcal{L}_{\text{norm}}\)) 53.32 71.56 31.37 49.78 改善底层曲面连续性,超越原生 SVRaster
+ TSDF 深度置信度门控 (完整几何) 53.37 72.91 32.06 50.67 过滤多视角渲染噪声,在相同特征下全面超越 3DGS

表 4: 几何表征与特征提取器正交解耦对比

架构基准 特征提取器 LERF 3D mIoU LERF Acc@25 ScanNet mIoU ScanNet mAcc 说明
Dr. Splat CLIP 52.76 76.91 31.66 48.64 原版 Dr. Splat
Dr. Splat AM-RADIO 53.42 70.60 37.57 47.80 3DGS 显存限制迫使其退化为掩码池化,收益微弱
LESV (本文) CLIP 53.37 72.91 32.06 50.67 显式体素配合置信度门控带来扎实几何基础
LESV (本文) AM-RADIO 56.11 85.21 53.22 70.41 稀疏体素无损融合密集 Patch 特征,性能大幅跃升

表 5: 计算耗时与峰值显存对比 (~300 张图像典型室内场景)

方法 特征预处理耗时 几何优化耗时 特征提升/注册耗时 平均峰值显存 (GB)
LangSplat ~120 mins ~20 mins ~60 mins N/A
LaGa (多层) ~120 mins ~20 mins ~70 mins N/A
Dr. Splat - (复用离线码本) ~20 mins ~10 mins 131.8 (官方代码超 256GB)
LESV (本文) ~14 mins ~15 mins ~3 mins 22.5

关键发现

  • 在 ScanNet 19 类点云开放词表分割上,LESV 取得了 53.22% mIoU,相较最佳 3DGS 基线 Dr. Splat(31.66%)实现了 +21.56% 的巨大跃升,充分证实显式离散体素杜绝高斯重叠后对三维空间原生交互的巨大优势。
  • 特征解耦消融表明:若使用 3DGS 架构,即使换用强大的 AM-RADIO 模型,由于无法承受逐像素稠密特征的反向投影导致显存爆炸,只能妥协退化为掩码级平均池化,导致性能增益极其有限(ScanNet mIoU 仅从 31.66% 升至 37.57%);而 LESV 的确定性体素融合能以稠密 Patch 颗粒度原生消化高维特征,从而将指标彻底激活至 53.22%。
  • 在计算效率上,LESV 仅需单次前向提取 AM-RADIO 特征,免去了生成数千个多尺度 SAM 掩码的繁重预处理,将准备耗时由 ~120 分钟缩减至 ~14 分钟(提速逾 8 倍);特征注册仅耗时 ~3 分钟,且平均显存仅需 22.5GB。

亮点与洞察

  • 显式离散表征破解概率模糊:敏锐指出 3DGS 在特征提升领域的根本瓶颈是“各向异性高斯重叠引发的逆体积渲染概率模糊”,采用显式无重叠的稀疏体素(SVRaster)从拓扑上彻底消除了表面交界处的语义渗透与射线伪影。
  • 基座模型密集涌现特性的巧妙利用:巧妙避开行业对“多尺度 SAM 掩码 + 层次特征场”的重度依赖,发掘并利用 AM-RADIO 空间 Patch 标记在经过 SigLIP 映射头后自然涌现出的多尺度密集语言对齐能力,兼得局部微细部件与全局语义。
  • 双重几何保障机制:不仅在训练端用单目 Patch 深度与法线保证体素不空洞,还在推理融合端用多分辨率 TSDF 提取的无噪声全局网格作为置信度过滤器,双重闭环极大增强了抗视角噪点能力。
  • 可复用的批次化流水线工程:局部确定性加权使得体素特征融合无需全局深度排序,使系统具备真正的 \(O(1)\) 显存扩展能力,这一思路为未来城市级或大规模开放词表 3D 场景重建提供了高价值范式。

局限与展望

  • 单目先验依赖性:几何正则化强烈依赖预训练单目深度和法线估计器的质量;在强镜面反射、高反光玻璃或剧烈光照变化的极端室内环境中,单目先验失效可能引入几何畸变。
  • 微小物体细节受体素分辨率制约:尽管稀疏体素光栅化支持分层网格,但极小零部件的表示能力受限于底层八叉树体素的最小体素网格物理尺寸,在极端细小物体解析上可能受离散量化限制。
  • 未来方向:探索体素内部神经隐式连续残差插值,将离散体素的确定性与连续场的高分辨率细微几何表达相结合;进一步引入时序多帧联合滤波以支持动态场景的开放词表理解。

相关工作与启发

  • vs LangSplat / LeGaussians: LangSplat 采用“渲染并与 2D 特征对比”的蒸馏路线,依赖特定场景自编码器压缩特征并耗时数小时优化,且 2D 偏向导致其在 3D 原生物体检索上 mIoU 仅有 10.97%;LESV 采用确定性直接特征提升,无需特征降维自编码器与蒸馏训练,3D 检索 mIoU 达 56.11%,提速超 20 倍。
  • vs Dr. Splat: Dr. Splat 采用基于 3DGS 视线相交 Top-K 的逆体积渲染特征注册,存在不可避免的高斯重叠模糊与边界渗漏,且显存开销巨大(超 256GB);LESV 改用显式 SVRaster,空间距离确定且体素互不重叠,显存锁定在 ~25GB,ScanNet 语义分割 mIoU 高出 21.56%。
  • vs LaGa: LaGa 依赖层次 SAM 掩码和多尺度对比学习构建多层级特征场,单场景预处理与训练达 190 分钟;LESV 依靠 AM-RADIO 的自涌现密集语义对齐,单次前向即解析多层级语义,在性能持平甚至超越的同时将全流程耗时压缩至 30 分钟以内。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [指明 3DGS 特征提升的重叠与概率缺陷,将显式稀疏体素光栅化与 AM-RADIO 密集语义自涌现结合,设计构思精准新颖]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3D 点云语义分割、3D 物体检索与 2D 定位,涵盖细致的几何及特征正交消融、显存和耗时对比]
  • 写作质量: ⭐⭐⭐⭐⭐ [问题提炼切中要害,逻辑推导清晰严密,实验分析深刻透彻]
  • 价值: ⭐⭐⭐⭐⭐ [为开放词表三维具身智能与大场景语义重建提供了高精度、超低预处理开销、工程可扩展的强力基础方案]