跳转至

Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM

会议: ECCV 2026
论文: ECCV 2026 Official Poster
代码: https://github.com/AmolHarsh/ground3d-lmm
领域: 多模态 VLM / 3D 视觉
关键词: 3D 点云定位, 细粒度部件分割, 空间度量推理, 3D 大多模态模型, 具身智能

一句话总结

Ground3D-LMM 提出了首个将 3D 点级掩码定位与真实世界物理公制度量输出联合统一的多模态大模型框架,并构建了涵盖约 250 万问答对的细粒度 3D Grounded Measurement 基准,在对象级与部件级定位及度量推理上全面超越现有方案。

研究背景与动机

在具身智能、机器人交互与 AR/VR 场景中,智能体对 3D 物理环境的自然语言交互若要具备真正的可执行性,必须满足两大核心先决条件:其一是“可验证性”(Verifiability),即模型在生成自然语言回复时,必须显式将指代内容定位到场景中的具体 3D 点云区域;其二是“公制度量性”(Metric numeric awareness),即系统不能仅输出“更长”或“更大”等定性模糊词汇,而必须给出基于米或厘米等真实世界物理单位的具体数值(如物体长宽高、间隙厚度或障碍物距离),从而指导机器人的抓取、避障与导航规划。

然而,现有的 3D 视觉-语言模型普遍无法在单一架构中兼顾两者。现存的 3D 会话与问答系统(如 ScanQA、SQA3D 等)往往仅输出纯文本描述,缺乏与 3D 点云掩码对应的显式几何落点,存在严重的幻觉且难以验证;而专注于 3D 定位或开词表分割的模型(如 Open3DIS、SeeGround、SegPoint 等)则采用孤立的检测/分割头,不支持交互式多轮对话,更无法输出单位自洽的物理度量。更为棘手的是,真实交互中用户频繁涉及对象的功能性部件(如椅子的坐垫、抽屉的把手),但开放词表的部件级 3D 定位与度量数据依然极度匮乏。

为了弥合这一鸿沟,本文将 3D 点云感知、显式部件级定位与物理度量推理纳入口语化多轮交互的统一范式。核心 idea:将稀疏 3D U-Net 提取的超点几何特征作为软 Token 嵌入大多模态语言模型中,通过在文本流中自回归生成特殊触发元 <SEG> 动态诱发可学习分割 Query 与点云交互,并在同一架构中联合学习点级掩码与物理公制度量。

方法详解

整体框架

Ground3D-LMM 整体由三大核心组件构成:负责提取场景层级几何表征的 3D 点云编码器、充当跨模态推理中枢的大多模态语言模型(Point LMM),以及负责产生细粒度 3D 点级掩码的交互式轻量分割头。系统输入包含着色点云 \(\mathbf{X} \in \mathbb{R}^{L \times 6}\)(坐标与 RGB)、自然语言指令以及可选的相机视角参考 RGB 图像。

整个系统的运行流程清晰直观:点云首先经过体素化降采样为 \(M\) 个超点,通过稀疏卷积网络提取出几何特征;几何特征经线性投影层转化为点 Token,与参考图像 Token 和文本 Token 一起喂入 LMM;LMM 在生成回复时,如果提到特定目标实体,便会生成包裹标签 <p>实体名</p><SEG>;其中的 <SEG> 隐状态随即被转译为分割 Query,通过与密集点云特征进行交叉注意力机制的迭代精炼,解码出该实体的 3D 二值点云掩码,同时文本流中直接解析输出其物理公制尺寸或空间间距。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:点云 X (L×6) + 参考图像 I + 文本指令 q"] --> B["体素超点下采样与稀疏 3D U-Net"]
    B --> C["多模态对齐投影层<br/>点特征 Fp 映射为点 Token Tp"]
    C --> D["Point LMM 跨模态自回归推理<br/>Qwen3-VL 联合处理文本/图像/点云"]
    D --> E{"检测输出中是否含 &lt;SEG&gt; 触发词"}
    E -->|包含定位实体| F["Query 映射与注意力分割头<br/>Cross-Attn 交互密集点特征 Fp"]
    E -->|纯文本/度量数字| G["语言流解析:输出公制度量与空间关系文本"]
    F --> H["点云掩码解码器:输出 3D 点级二进制掩码 M"]
    G --> I["最终多模态输出:可验证 3D 掩码 + 精确公制度量"]
    H --> I

关键设计

1. 几何超点编码与多模态对齐:在计算效率与细粒度几何间取得平衡
直接将海量原始 3D 场景点云(通常数十万点)作为 Token 序列输入大模型会导致显存爆炸且丢失局部拓扑。针对这一痛点,本文首先采用基于体素化的超点聚类算法将点云降采样为 \(M\) 个超点(\(M \ll L\)),并在其上构建稀疏 3D 卷积神经网络(Sparse 3D U-Net)以提取兼顾局部几何构型与全局场景上下文的分层点级表征 \(\mathbf{F}_p \in \mathbb{R}^{M \times d}\)。随后,通过可学习的线性投影模块 \(\mathcal{P}\) 将几何嵌入映射至大多模态模型的公共潜空间 \(\mathcal{T}_p = \mathcal{P}(\mathbf{F}_p)\)。在指令构造阶段,提示词中预留 \(M\) 个专用占位符 <|point|>,在输入端被动态替换为投影后的点 Token \(\mathcal{T}_p\)。同时,引入可选的相机视角对齐参考图像 Token \(\mathcal{T}_{img}\),提供高分辨率的 2D 纹理与视角线索,显著降低了原始点云在方位辨识中的歧义性。

2. 触发式 Query 交互分割头:实现从语言概念到点级掩码的无缝解耦
为使语言模型具备灵活输出定点掩码的能力,模型采用了类似 <p>object_name</p><SEG> 的触发式标记协议。在生成文本响应阶段,当模型推理出目标实体需要显式定位时,自回归解码出 <SEG> 特殊 Token。系统截取对应位置在 LMM 最后一层的隐藏状态 \(\mathbf{t}\),利用轻量级 MLP 查询嵌入函数 \(Q\) 转换为初始分割 Query \(\mathbf{q}^{(0)} = Q(\mathbf{t})\)。为了让 Query 能够充分感知三维几何精细结构,设计了级联注意力精炼流程:

\[\mathbf{q}^{(1)} = \text{Cross-Attn}(\mathbf{q}^{(0)}, \mathbf{F}_p), \quad \mathbf{q}^{(2)} = \text{Self-Attn}(\mathbf{q}^{(1)}), \quad \mathbf{q}^{(f)} = \text{FFN}(\mathbf{q}^{(2)})\]

最后,轻量级掩码解码器通过计算精炼后的 Query \(\mathbf{q}^{(f)}\) 与点云密集特征 \(\mathbf{F}_p\) 之间的点积相似度,经由 Sigmoid 激活输出点级别的二值分割掩码 \(\mathcal{M} = \text{Decoder}(\mathbf{q}^{(f)}, \mathbf{F}_p) \in \{0, 1\}^N\)。这种设计使得模型无需修改语言主体架构,即可直接将富含语义的文本隐藏状态映射为物理世界的几何点集。

3. Ground3D 大规模细粒度度量基准:多层次的自动构建与多重验证管线
现有学术界缺乏同时标注点级 3D 部件与公制度量问答的基准。为此,作者基于 ScanNet 与 ScanNet++ 的 2.5K 个真实室内场景构建了 Ground3D 数据集。该管线分为五大阶段:首先使用前沿 VLM(Qwen3-VL-30B)对选定关键帧做开词表对象及部件的层级框提议;接着利用 SAM2 生成精细 2D 掩码,并通过结合 3D 实例几何与距离变换滤波消除边界噪声;第三阶段将掩码反投影至 3D 摄像机坐标系,利用百分位滤波剔除深度飞点;第四阶段提取当前视角下可见几何体的外接定向包围盒(OBB)尺寸、摄像机距离与对象间最小表面距离等度量真值;最后利用大模型生成覆盖 8 类子任务的约 250 万条多轮 QA 对。全部评估集经过人工 100% 盲审核验(清洗掉了 26% 存在缺陷的样本),确立了严谨的标准评估协议。

损失函数 / 训练策略

Ground3D-LMM 采用端到端的多任务联合优化策略,整体目标函数 \(\mathcal{L}_{total}\) 由自回归文本损失 \(\mathcal{L}_{text}\) 与掩码分割损失 \(\mathcal{L}_{seg}\) 组成:

\[\mathcal{L}_{total} = \lambda_{seg}\mathcal{L}_{seg} + \lambda_{text}\mathcal{L}_{text}\]

在实际实现中,权重系数均设为 \(\lambda_{seg} = \lambda_{text} = 1.0\)。针对文本生成部分,采用标准的交叉熵损失监督语言序列中包括触发词在内的每个 Token。对于分割掩码部分,为了应对 3D 稀疏点云中极端的前景/背景类别不平衡(尤其是细长型小部件),结合了点级二元交叉熵损失与 Dice 损失:

\[\mathcal{L}_{seg} = \mathcal{L}_{BCE}(\mathcal{M}, \mathcal{M}_{gt}) + \mathcal{L}_{Dice}(\mathcal{M}, \mathcal{M}_{gt})\]

训练时采用分层学习率策略:点云编码器使用 SSTNet 预训练权重并以 \(1\times 10^{-6}\) 微调;语言模型骨干(Qwen3-VL-4B-Instruct)采用 LoRA 以 \(1\times 10^{-5}\) 学习率微调;投影层与分割头等新增模块以 \(1\times 10^{-4}\) 优化。

实验关键数据

主实验

在作者提出的 Ground3D 基准上,针对对象级与部件级分割评测 mIoU 指标,以及文本回答中的度量绝对误差百分比(Mean APE)与 \(\delta\) 成功率(预测值与真值比值 \(\le 1.25\))。表 1 汇总了 Ground3D-ScanNet 与 ScanNet++ 上的分割结果,表 2 汇总了公制度量与对话质量评测。

数据集 / 设定 方法 模态 Overall mIoU (%) Func. Obj / Part (%) Gnd. Mea. (%) 相对 SOTA 增益
ScanNet (Object) Image baseline (Qwen-VL + Grounded-SAM) 2D 32.52 31.46 36.67 基线
ScanNet (Object) Reason3D 3D 9.31 6.09 -23.21
ScanNet (Object) UniSeg3D 3D 22.97 23.64 24.00 -9.55
ScanNet (Object) Ground3D-LMM (本文) 3D 37.40 37.79 37.64 +14.43 vs UniSeg3D
ScanNet (Object) Ground3D-LMM (本文) 3D+2D 42.22 41.37 43.73 +9.70 vs 2D baseline
ScanNet (Part) Image baseline 2D 21.52 20.70 22.94 基线
ScanNet (Part) Reason3D 3D 8.19 7.04 -13.33
ScanNet (Part) UniSeg3D 3D 11.28 11.71 10.14 -10.24
ScanNet (Part) Ground3D-LMM (本文) 3D 30.06 30.47 27.27 +18.78 vs UniSeg3D
ScanNet (Part) Ground3D-LMM (本文) 3D+2D 36.57 37.33 31.70 +15.05 vs 2D baseline

此外,在纯粹的公制度量估计(Table 4)上,针对 ScanNet 验证子集: - Image baseline (2D): Mean APE 为 166.91%,\(\delta\) 成功率仅为 25.05%; - SD-VLM (2D): Mean APE 为 231.03%,\(\delta\) 成功率为 20.12%; - Ground3D-LMM (3D+2D): Mean APE 显著骤降至 74.03%\(\delta\) 成功率攀升至 43.55%(幻觉评分 9.16/10)。

在外部权威指称分割基准 ScanRefer(Table 6)上,Ground3D-LMM 在纯 3D 输入下 mIoU 达到 38.72%[email protected] 为 55.73%),而此前 3D 领域 SOTA(UniSeg3D 为 29.10%,Reason3D 为 13.05%);在 3D+2D 设定下达到 41.30% mIoU,相较 MLLM-For3D+VideoLISA (30.45%) 提升多达 10.85%。

消融实验

表 7 针对 Ground3D-ScanNet 对象级任务深入探索了各模块的作用机制(基准为 3D+2D 模型):

配置 / 变体 mIoU (%) APE (%) \(\delta\) 成功率 (%) 幻觉评分 (0-10) 说明
Full model (3D+2D) 42.22 76.07 46.34 9.16 完整模型设定
(a) 缩减至 25% 训练数据 36.93 99.23 40.26 8.86 缺乏大体量监督导致度量误差显著增大
(a) 缩减至 50% 训练数据 39.64 81.89 40.84 8.93 表现随数据量增加持续单调上升
(b) 仅文本监督 (w/o mask loss) 77.41 45.62 9.02 无法输出掩码,且度量与幻觉质量略有下滑
(c) 掩码监督注入 25% 随机噪声 41.43 77.97 44.09 8.91 mIoU 仅微跌 0.79%,展现出强抗噪稳健性
(c) 掩码监督注入 50% 随机噪声 41.06 79.60 43.84 9.01 仍维持超 41% mIoU,说明超点特征具有几何归纳偏置

关键发现

  • 3D 几何特征对物理度量不可或缺:2D 视觉模型(包括依赖深度插件的 SD-VLM)在公制度量估计上的平均百分比误差高达 166%~231%,而引入原生 3D 点云后误差缩减了一倍以上(降至 74%),证实仅凭透视 2D 图像存在深度与比例歧义,必须依托真 3D 几何支持度量。
  • 定位与度量任务相互增益:消融实验显示,如果只通过文本监督度量数值而不施加掩码分割约束(w/ text-only),模型的度量误差与 \(\delta\) 成功率均出现劣变。这表明显式预测点云区域能够强迫模型聚焦于局部目标几何,反哺其对几何尺寸的感知。
  • 2D 图像与 3D 点云互补:在纯 3D 输入下,Ground3D-LMM 已经大幅击败专用的 3D 分割模型;而加入视角参考图像后,对象级 mIoU 从 37.40% 进一步飞跃至 42.22%,部件级 mIoU 从 30.06% 提升至 36.57%,这表明 2D 纹理与语义先验有效化解了点云稀疏带来的歧义。

亮点与洞察

  • 触碰式自回归掩码诱发:将 <SEG> 符号作为统一的交互桥梁,既保持了纯语言模型自回归生成的开放灵活性,又在需要时刻动态拉起几何分割流水线,结构极其干净简洁。
  • 以可见局部视锥几何定义度量:数据集创新性地摒弃了不可观测的全网格补全真值,而是按照当前视点实际可见的点云 OBB 来定义尺寸。这种设计紧密贴合现实机器人与车载传感器所面对的真实感官输入。
  • 可复用的跨模态部件级标注管线:将 Qwen3-VL 的开放语义提议、SAM2 的精准边界切分、3D 反投影与几何百分位去噪串联,为学术界提供了从普通 RGB-D 视频生成数百万规模点级细粒度监督信号的标准工具链。

局限与展望

  • 当前度量以定向包围盒(OBB)为主:论文针对复杂异形物体(如曲面茶壶嘴、弯曲管线)的厚度或尺寸仍依赖简化盒状拟合,对非刚体拓扑的几何度量能力仍有待提升。
  • 视点遮挡敏感性:由于度量均基于当前视点可见点云,在物体遭遇严重遮挡时,测得的“尺寸”实质上是“可见残缺部分的包围盒”,尚未内化 3D 形状先验下的完整补全度量。
  • 未来方向:可进一步结合神经隐式场或 3D 高斯泼溅(3DGS),将多视角一致性融入交互解码中,拓展至室外开放道路场景的超大尺度动态度量。

相关工作与启发

  • vs Reason3D (Huang et al., 2024):Reason3D 仅处理开放词表语义分割,在面对多目标场景、同类多实例定位以及细粒度部件时性能严重崩溃(Ground3D 上 mIoU 仅个位数);Ground3D-LMM 引入了细粒度超点注意力与实例级度量交互,实现了质的跨越。
  • vs SD-VLM (Chen et al., 2025):SD-VLM 将深度图编码进 2D VLM 进行空间度量,但其本质仍是 2D 像素平面的推理,度量误差高达 180%+ 且不具备 3D 点云掩码输出能力;本文模型采用点云稀疏卷积直接编码真实 3D 坐标空间,从根本上保障了公制尺度的一致性。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次将 3D 点级掩码定位与物理公制度量输出统一进会话式 LMM 范式]
  • 实验充分度: ⭐⭐⭐⭐⭐ [自建 250 万级标注数据集,涵盖 8 项子任务并在 ScanRefer 和 Reason3D 上均取得显著 SOTA]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图表清晰详尽,任务与评估指标定义极其明确]
  • 价值: ⭐⭐⭐⭐⭐ [为具身机器人操作、AR 环境度量与 3D 空间语言理解树立了重要的新基线]