跳转至

OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://why-102.github.io/openground.io/
领域: 3D视觉
关键词: 3D视觉定位、零样本场景理解、任务链规划、上下文引导感知、开放世界

一句话总结

针对现有零样本 3D 视觉定位受限于离线预定义对象查找表(OLT)而无法定位表外未见目标的问题,OpenGround 提出任务链规划将复杂长文本查询解构为渐进式子目标序列,并利用已定位锚点实现上下文引导的在线 2D 感知与 3D 几何提升,在新建的开放世界基准 OpenTarget 上大幅超越强基线。

研究背景与动机

三维视觉定位(3D Visual Grounding, 3DVG)旨在根据自然语言描述在 3D 场景中定位目标物体,是具身导航、机器人交互以及空间计算的核心感知基石。传统的全监督 3D-VLM 受限于 3D 配对标注数据的极度匮乏,且受模型上下文窗口限制往往只能输入稀疏视点,导致在复杂真实大场景中泛化能力脆弱。为此,近期主流方法纷纷转向基于 2D 大视觉语言模型(VLM)的零样本(Zero-Shot)定位范式。这类方法普遍采用基于离线对象查找表(Object Lookup Table, OLT)的单步定位流程:先由 3D 实例分割预先构建全场景三维候选物体表,再通过 VLM 结合多视角投影渲染完成一次性匹配确认。

然而,这种离线 OLT 单步范式在真实的开放世界落地中暴露出根本性缺陷。离线 OLT 依赖固定类别的 3D 分割模型生成,无法预知开放世界中海量的长尾细粒度目标或部件级构件(例如特定抽屉的把手、橱柜门夹层);一旦目标处于预定义表外(Out-of-OLT),单步查找机制即刻失效。现有的补救尝试走向了两个极端:一种是试图堆叠更强分割器以穷举构建超稠密 OLT,但算力开销巨大且依旧不可避免遗漏细长微小部件;另一种则是彻底放弃 OLT,每次查询都在全场景做无差别反复扫描,这不仅丧失了三维锚点的结构化先验,且在面对长句多级空间关系的复合查询时极度脆弱。

本文的切入视角在于重新思考人类在复杂物理空间中定位未见物体的渐进式认知规律:人在面对“找到厨房橱柜顶层抽屉上的金属把手”时,绝不会在全屋所有小零件中盲目搜索,而是先借助显著语义定位橱柜,逐层缩小搜索域定位抽屉,最后在抽屉这一局部空间上下文内精准辨识细粒度把手。核心 idea:将开放世界 3D 定位建模为「任务链规划引导的自适应在线感知」过程,通过任务链规划将复杂查询解构为由易到难的上下文依赖子目标链,并利用已确认的粗粒度空间锚点触发局部上下文引导感知,在线动态将新发现目标提升并注册进 OLT,从而以统一接口实现由粗到精的开集三维定位。

方法详解

整体框架

OpenGround 继承了主流基于 OLT 的零样本单步定位骨干,并针对开放世界环境扩充了“任务链规划(Task-Chain Planning)”与“上下文引导感知(Context-Guided Perception, CGP)”两大核心模块。面对用户输入的自然语言描述与 3D 点云场景,系统首先通过大模型解析查询中包含的目标与上下文参照物,并综合候选集大小、依赖结构构建自适应执行链。在执行过程中,系统逐项迭代子目标:若当前子目标在现有 OLT 中已有候选,则直接复用高效的单步三维定位;若遇到表外缺失目标,则激活 CGP 模块,以已定位的上下文物体为几何锚点智能挑选局部高覆盖率视角,调用开放词表 2D 基础模型在线检测并提升至 3D 空间更新 OLT,使静态离线查找表在线进化为动态表,进而完成最终目标的精准定位。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["自然语言查询 Q + 3D点云场景"] --> B["任务链规划<br/>依赖解析与子目标排序"]
    B --> C{"当前子目标是否存在于 OLT?"}
    C -->|存在候选| D["单步定位推理<br/>多视角候选投影与 VLM 匹配"]
    C -->|表外缺失| E["上下文引导视角选择<br/>以已定位锚点贪心最大化覆盖"]
    E --> F["2D到3D在线感知增补<br/>开集分割、反投影聚合与增量入表"]
    F --> D
    D --> G{"是否完成任务链末端目标?"}
    G -->|未完/中间锚点| B
    G -->|完成目标| H["输出最终目标 3D Bounding Box"]

关键设计

1. 任务链规划:兼顾依赖结构与候选空间的分步解构

传统零样本单步定位在处理包含空间介词、从属关系的多跳长查询时极易由于搜索空间爆炸或上下文错乱而匹配失败。任务链规划模块首先利用 VLM 从查询 \(Q\) 中抽取目标标签 \(L_{\text{tgt}}\) 以及相关联的上下文环境标签集合 \(\{L_{\text{ctx}}^j\}_{j=1}^n\)。随后系统在离线 OLT 中检索各标签对应的初始三维候选集大小 \(|C_j|\)。确定执行序列并非简单的字典序或单一启发式规则,而是综合平衡三大关键制约因素:其一是候选可用性(Candidate Availability),对于 \(|C_j|=0\) 的表外缺失目标必须排在其所依赖的上下文锚点之后;其二是定位难度(Grounding Difficulty),候选集越庞大(即 \(|C_j|\) 越大)意味着搜索空间越开阔、歧义度越高,应当后置以利用先前锚点剪枝;其三是语义依赖关系(Semantic Dependency),诸如“抽屉上的把手”这类具有物理空间从属关系的实体必须遵循由父至子的几何拓扑依赖。系统通过构造包含候选基数与缺失标记的结构化提示词,驱动大语言模型生成最优索引执行链: $\(\text{taskchain} = f_{\text{vlm}}\left(Q, L, \{|C_j| \mid j \in [1, n+1]\}\right)\)$ 同时引入软约束机制:原则上将最终目标置于链条末端执行,但若目标本身具有强判别性的少候选甚至全局唯一视觉属性时,允许大模型灵活将其前置以节省计算开销。

2. 上下文引导视角选择:最大化锚点覆盖的高效观测策略

在感知缺失目标时,盲目在全场景渲染视点会导致大量视点冗余与细节丢失,而单纯的俯视图(BEV)又饱受垂直遮挡困扰。OpenGround 的核心洞察在于:前序步骤中已定位的三维物体序列 \([O_1, \dots, O_{t-1}]\) 构成了待发现目标的强先验空间锚点。因此,CGP 模块将视角挑选问题形式化为一个以已定位上下文点云为目标的贪心集合覆盖优化。对于候选视点集合中的视点 \(k\),其对前序全部上下文锚点点云的边际覆盖增益定义为各物体未观测点集比例之和: $\(\Delta^{(k)} = \sum_{O_i} \frac{|P_{O_i} \cap P_k \setminus \mathcal{R}_{O_i}^{v-1}|}{|P_{O_i}|}\)$ 其中 \(P_{O_i}\) 为物体 \(O_i\) 的 3D 点集,\(P_k\) 为第 \(k\) 个视角可见的三维点集,\(\mathcal{R}_{O_i}^{v-1}\) 表示经过前 \(v-1\) 轮挑选后累积覆盖的该物体表面点集。算法通过多轮贪心选择 \(\arg\max_k \Delta^{(k)}\),直到累积点覆盖率达到阈值 \(\tau_{\text{cov}}\)(设为 0.95)或达到最大预设视点预算 \(V\)(选定为 3)。这种设计使得渲染出的 2D 图像高度聚焦于父级物体的近邻交互区域,为细粒度子部件的高分辨率辨识提供了最佳视点输入。

3. 2D到3D在线感知增补:开集分割与三维几何提升

在获得聚焦上下文的精简多视角图像集 \(I^*\) 后,CGP 利用强大的 2D 开集基座感知模型突破预定义 3D 分割模型的类别词表封闭边界。对每个视角图片 \(I_k\),采用 GroundedSAM 依据当前子目标的文本标签 \(L_{T_t}\) 提取高精度 2D 实例掩码 \(M_k = \text{SEG}(I_k, L_{T_t})\)。随后,借助相机的精确内外参矩阵与场景点云深度,将 2D 像素级掩码投影提升(lifting)至 3D 空间。由于跨视角的独立分割可能在同一三维实体上生成多份碎片化候选,系统计算跨视角三维提议间的 3D 空间交并比(3D IoU),对 IoU \(\ge \tau_{\text{iou}}\)(默认 0.5)的重叠点簇执行迭代几何融合。最终将去重聚类后的三维实例包围盒及其新分配的全局唯一 ID 动态注入当前的查找表中: $\(\text{OLT} \leftarrow \text{OLT} \cup \Big\{\big(\text{ID}(i),\, L_{T_t},\, \text{bbox}(P_i)\big)\Big\}_{i=1}^M\)$ 这一机制优雅地完成了 OLT 从“离线只读静态表”到“在线可写动态表”的范式跃迁,使后续单步定位器无缝感知新物体的 3D 包围盒并继续执行图文几何推理。

一个完整示例

以复杂自然语言指令“找到厨房主料理台右侧双开门地柜最上方抽屉的银色拉手”为例,系统运行全流程如下: 1. 解析与链构建:VLM 提取标签:地柜(主料理台旁)、抽屉(地柜上方)、拉手(抽屉上)。查询离线 OLT,地柜候选有 2 个,抽屉候选有 6 个,而拉手作为细粒度部件候选数为 0(\(|C_{\text{拉手}}|=0\))。大模型输出三步执行链:[地柜 -> 抽屉 -> 拉手]。 2. 第一步(地柜):现有 OLT 中有候选,触发单步多视点投影与 VLM 空间关系比对,直接锁定右侧特定地柜。 3. 第二步(抽屉):在地柜约束下筛选候选,将搜索范围从全屋 6 个抽屉严格缩小到该地柜包围盒范围内的 2 个抽屉,迅速定位出最上方抽屉。 4. 第三步(拉手):检测到拉手缺失,以第二步定位出的抽屉三维点云为几何锚点,贪心挑选 3 张高清晰视角;GroundedSAM 在选出的图像局部区域内精准检测到“银色拉手”2D 掩码,反投影后合并为一个全新的 3D 边界框并分配新 ID 写入 OLT。 5. 收敛:单步确认模块在更新后的 OLT 上一击即中,输出该银色拉手的精确三维空间坐标。

实验关键数据

主实验

论文在新建的开放世界评测基准 OpenTarget(共 7,724 个查询对,含 50 种母物体类别与 70 种细粒度部件类别,基于 ScanNet++ 与 Articulate3D)上进行了全量评测,并在传统通用定位基准 ScanReferNr3D 上验证了兼容性。

在 OpenTarget 上的对比测试(Easy 为层级深度 \(\le 2\) 的 5,737 样本,Hard 为深度 \(>2\) 的 1,987 样本):

方法 OLT 来源 Easy [email protected] Easy [email protected] Hard [email protected] Hard [email protected] Overall [email protected] Overall [email protected]
SeeGround Mask3D 13.3 11.2 1.2 1.1 10.2 8.6
VLM-Grounder* 无 (OLT-Free) 14.5 12.1 6.1 2.3 12.3 9.6
VLM-Grounder* Mask3D 16.4 12.0 10.2 4.8 14.8 10.1
SeqVLM Mask3D 13.6 11.2 1.4 1.1 10.5 8.6
GPT4Scene Mask3D 10.1 7.7 0.9 0.7 7.7 5.9
ZSVG3D Mask3D 8.9 6.9 0.8 0.7 6.8 5.3
OpenGround (Ours) Mask3D 51.8 38.9 30.2 20.6 46.2 34.2
SeeGround Ground-Truth 20.2 19.8 11.3 10.4 17.9 17.4
VLM-Grounder* Ground-Truth 31.4 21.3 20.6 17.8 28.6 20.4
SeqVLM Ground-Truth 21.5 21.3 13.4 13.2 19.4 19.2
OpenGround (Ours) Ground-Truth 57.9 57.4 45.7 45.3 54.8 54.3

注: 表示由于计算成本极高,在随机选取的 300 个测试样本上评测。

在经典 ScanRefer 基准上的表现(分 Unique 单目标与 Multiple 多干扰项场景):

方法 监督类型 骨干 VLM Unique [email protected] Unique [email protected] Multiple [email protected] Multiple [email protected] Overall [email protected] Overall [email protected]
3D-R1 全监督 - - - - - 65.8 59.2
GPT4Scene 全监督 - 90.3 83.7 56.4 50.9 62.6 57.0
SeeGround 零样本 Qwen2-VL-72B 75.7 68.9 34.0 30.0 44.1 39.4
Ours 零样本 Qwen2-VL-72B 76.6 70.3 48.1 40.4 53.7 46.3
SeqVLM 零样本 Doubao-1.5-pro 77.3 72.7 47.8 41.3 55.6 49.6
Ours 零样本 Doubao-1.5-pro 78.3 75.1 59.2 49.4 63.0 54.4
SPAZER 零样本 GPT-4o 80.9 72.3 51.7 43.4 57.2 48.8
Ours 零样本 GPT-4o 83.5 75.2 59.9 51.2 64.5 55.9

消融实验

针对任务链排序策略、初始 OLT 先验以及基础 VLM 的选择在 OpenTarget 数据集上的 [email protected] 消融结果如下表所示:

配置编号 初始 OLT 规划策略 视觉语言模型 (VLM) [email protected] (%) 结论与分析
(1) Yes (Mask3D) Task Chain (本文) GLM-4.5V 34.2 完整模型设定,表现最佳
(2) No (纯空表起步) Task Chain GLM-4.5V 27.1 脱离初始 OLT 仍超所有带 GT 表的旧基线 (20.4%)
(3) Yes Jump (一旦确认锚点直跳目标) GLM-4.5V 29.8 跳步略过中间关键容器,掉点 4.4%
(4) Yes Relevance (按语义相关度排序) GLM-4.5V 32.6 忽略物理包含与因果依赖结构,轻微掉点
(5) Yes Difficulty (按候选数排序) GLM-4.5V 31.5 机械按候选数排序易出现表外目标过早触发
(6) Yes Random (随机乱序规划) GLM-4.5V 29.2 缺乏拓扑合理性导致误差级联放大,掉点 5.0%
(7) Yes Task Chain Qwen3-VL-32B 30.4 较小规模开源 VLM 仅掉 3.8%,依然极其强劲
(8) Yes Task Chain Qwen3-VL-235B 32.8 接近前沿闭源旗舰表现
(9) Yes Task Chain Step3 33.4 证明框架对各类主流商业及开源 VLM 高度通用

关键发现

  • 打破预定义 OLT 的致命掣肘:在 OpenTarget 开集细粒度测试中,传统零样本方法(SeeGround、SeqVLM、ZSVG3D)在 Mask3D 离线表下整体准确率断崖式跌至 5.3%~10.5%,其根源在于部件级物体根本不存在于离线表中;即使人工注入 Ground-Truth 全景 OLT,旧方法因候选干扰激增整体也仅达到 11.0%~20.4%。而 OpenGround 凭借在线感知和任务链逐步剪枝,以常规 Mask3D 表取得 34.2%[email protected],在 GT OLT 下更暴涨至 54.3%,实现了真正意义上的开放世界能力跃升。
  • 任务链分解消解多干扰项歧义:在 ScanRefer 的 Multiple 子集上,由于同类干扰项繁多,常规单步匹配极易误检;OpenGround 使 GPT-4o 骨干下的 [email protected] 从 SPAZER 的 43.4% 跃升至 51.2%(相对提升近 18%),证明循序渐进的上下文锁闭能显著净化候选空间。
  • 视角预算与覆盖率的饱和拐点:视角消融显示,将观测视角数 \(V\) 从 1 提升至 3 时准确率呈现显著陡峭上升;继续增加到 \(V=4\) 虽达到最高的 34.7%,但额外耗费 33.3% 的推理视点仅换来 0.52% 的微弱边际增益,超过 4 甚至会因信息冗余与多视点视觉混淆导致性能滑落,最终选定 \(V=3\) 达成精度与开销的帕累托最优。

亮点与洞察

  • 将封闭静态表演化为开放动态表:不仅没有盲目抛弃成熟的 OLT 单步架构,反而通过 CGP 赋予了 OLT “按需在线扩充、三维动态注册”的能力,完美兼顾了现有三维定位管线的高效性与开集环境的延展性。
  • 几何锚点驱动的贪心局部视点采样:传统视点采样往往是全景随机或单一几何投影,本文将前序已定位物体的点云直接作为视点覆盖优化的先验锚点,以极轻量贪心算法精准捕获待定部件的黄金视角。
  • 高兼容性的外挂式插件架构:实验证明任务链规划与 CGP 能够即插即用地嫁接于 SeeGround、SeqVLM 或 SPAZER 之上,显著提升其在复杂长文本与开集细粒度目标下的表现。

局限与展望

  • 静态局部邻近假设:当前 CGP 依赖于上下文参照物与目标之间具有紧密空间物理邻近关系的假设,若遇到跨越多个房间的长程空间跳跃关联(如“放在客厅的、与卧室同款的花瓶”),局部视角挑选将受到挑战。
  • 依赖底层 2D 分割器的泛化上限:在线感知的质量与 3D 包围盒的边界吻合度直接受制于 GroundedSAM 等 2D 基础模型在特定视角下的分割完整性与遮挡分割能力。
  • 动态复杂交互与移动机器人扩展:目前系统主要针对静态三维点云重建场景,未来可探索结合主动具身探索(Embodied Exploration)在动态连续视频流中实现边移动边更新的在线感知。

相关工作与启发

  • vs SeeGround / SeqVLM: 传统零样本方法严格依赖离线静态 OLT,遇到表外长尾细粒度部件直接失灵;OpenGround 引入 CGP,通过上下文锚点将 2D 开集掩码反投影回 3D 动态扩充 OLT,彻底解锁了开放世界细粒度定位能力。
  • vs VLM-Grounder: VLM-Grounder 采取极端无 OLT 方案,每次定位都在全场景执行高耗时的盲目全局扫描,且长句复合推理表现较弱;OpenGround 保留了结构化 OLT 作为记忆与缓存底座,通过任务链按需局部感知,推理速度与精准度显著胜出。
  • vs SPAZER: SPAZER 聚焦于通过空间几何语义推理增强多视角匹配;OpenGround 与其非但互斥,更能作为更高层级的任务规划与感知前端无缝集成,在 Nr3D 上结合 SPAZER 达到了 64.8% 的全新零样本 SOTA。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出面向表外未见目标的在线感知与任务链解构范式,彻底破除 OLT 封闭集瓶颈。
  • 实验充分度: ⭐⭐⭐⭐⭐ 构建了包含 7,724 个细粒度样本的高质量 OpenTarget 基准,并在三大数据集上开展了翔实的对比与消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,方法流向严谨连贯,图文配合与实验论证高度自洽。
  • 价值: ⭐⭐⭐⭐⭐ 为具身智能与开放世界三维场景理解提供了优雅且工程兼容性极高的全新范式。