Abstract the Layout, Focus the Detail: A Dual-Granularity Representation Framework for Zero-Shot 3D Visual Grounding¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5726
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/12553.pdf
代码: https://github.com/VIPL-VSU/ALFD
领域: 3D视觉
关键词: 零样本视觉定位、语义空间布局、物体细节图、查询引导过滤、空间视觉联合推理
一句话总结¶
本文将三维场景改写成用于空间推理的抽象布局和用于外观核验的物体细节图,让现成 VLM 按“先空间、后视觉”选择目标,在 ScanRefer 达到 45.0% [email protected],在不提供 GT 物体类别的 Nr3D 达到 63.2% 准确率。
研究背景与动机¶
3D 视觉定位要求根据一句自然语言,在三维场景中找到对应实例并返回其边界框。困难常常不在识别“柜子”这个类别,而在多个柜子之间解释“门对面的床下面那个棕色柜子”。监督方法可以学习语言和三维关系,但依赖昂贵的实例级语言标注;零样本方法于是借助已有 LLM/VLM,把三维场景转换成它们熟悉的文字或图像。ZSVG3D、LaSP 一类方法把关系转成坐标运算或程序,SeeGround 等方法则让 VLM 查看场景视图。
这两条路径保留的信息各有偏向。坐标能够表达全局位置,却难以用固定规则充分解释“正对着”“塞在桌下”等带有视觉语境的关系;相机图像保留颜色、材质和形状,却受视野和遮挡限制,可能无法同时看到相距很远的床与门。单纯给模型增加局部视图,仍然要求它自己拼出房间布局;把整个场景俯视渲染出来,也可能留下大量背景噪声和物体遮挡。真正的瓶颈因而是输入表示是否把任务所需证据清楚地呈现出来,而不只是推理提示是否复杂。
本文借鉴“先概览,再过滤,按需看细节”的信息可视化原则,让不同证据分别使用合适的表示。核心 idea:先按查询保留目标与参照物,再用语义空间布局显式呈现全局关系,用物体细节图单独验证外观,使 VLM 不必从局部图像中重建全局空间。
方法详解¶
整体框架¶
输入包括场景点云、对应的 RGB-D 帧以及定位查询;输出是目标实例 ID,再由该实例取得三维边界框。查询引导过滤先完成实例语义标注、语言实体解析和软语义匹配,随后并行构建语义空间布局(Semantic Spatial Layout,SSL)与物体细节图(Visual Detail Patches,VDP),最后做空间视觉联合推理。
两张图并不是同一场景的两个普通视角。SSL 主动舍弃纹理,把相关实例画成带 ID 的俯视多边形;VDP 则放弃表达物体之间的全局位置,只保留适于检查颜色、形状和状态的局部图像。实例 ID 将两种证据对应起来,必要时附加高度描述,避免俯视投影丢失垂直信息。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
INPUT["点云、RGB-D帧<br/>与自然语言查询"] --> FILTER["查询引导过滤"]
FILTER --> SSL["语义空间布局"]
FILTER --> VDP["物体细节图"]
SSL -->|"布局与按需高度描述"| REASON["空间视觉联合推理"]
VDP -->|"带实例ID的外观证据"| REASON
REASON --> OUTPUT["目标实例ID<br/>及三维边界框"]
关键设计¶
1. 查询引导过滤:保留关系链需要的实例,而不只筛目标类别
系统先用现成三维实例分割网络获得候选物体,但不直接把网络的闭集类别当作最终语义。对每个候选实例选择合适的二维帧,将三维掩码投影到图像中得到高亮提示,同时把原始 RGB 帧、标记帧以及三维预测类别交给 VLM。类别只是软先验:它帮助模型区分“书架上的书”和“整个书架”,而不是把开放词汇识别限制在预训练类别表内。由此得到的实例标签成为后续语言对齐的基础,视图选择复用物体细节图中的机制。
接着,LLM 从查询中抽取目标实体和参照实体,并判断各实体需要哪些证据:是否为目标候选、是否需要细粒度外观验证、是否涉及高度,以及是否存在视角或位置条件。原文记为 \(\tau_{tgt},\tau_{vis},\tau_{hgt},\tau_{cam},\tau_{pos}\)。这些标记不是新的学习目标,而是后续生成哪类输入的开关。例如,“床下面”触发高度证据,“棕色柜子”需要外观核验,“面朝门”要求对齐观察方向。实体解析与标签对齐实际合并在一次 LLM 推理中完成;通过同义词、上下位词和功能等价进行软匹配,再取匹配标签对应的全部实例。这样能保留“门、床、柜子”整条关系链,也避免用严格字符串匹配漏掉同义描述。代价是上游语义漏检会让后续推理失去必要实例。
2. 语义空间布局:把全局位置变成可直接阅读的抽象地图
对于过滤后保留的每个实例,系统将其三维点投影到地面 XY 平面,再计算二维凸包。这个转换保留大体占地范围和相对分布,同时去掉纹理与点云噪声;原文的核心几何操作可以写为:
这里 \(P_k^{xy}\) 是第 \(k\) 个实例点云的 XY 投影,\(H_k\) 是绘制到全局画布上的凸包。画布通过类别颜色、数字 ID、坐标网格和外围坐标轴,把物体身份、位置和距离参照显式化。对“面朝门时左边”这类查询,系统还会从视角条件中确定参照锚点和朝向,旋转布局,使查询隐含的观察方向对齐图像向上方向。它把心理旋转变成输入预处理,减少 VLM 在原始坐标系和语言观察视角之间转换的负担。
俯视图本身无法完整表达“上面”和“下面”。作者因此按照物体的 Z 轴边界计算拓扑绘制顺序,用半透明多边形与实线黑色边框展示重叠实例;当高度标记触发时,再提供相关边界框的 \((z_{min},z_{max})\) 文本描述。半透明显示帮助模型看清平面重叠,高度文本则负责区分垂直关系,两者不能互相替代。SSL 不是完整的三维重建,更不是预先给出答案的关系图,而是让模型在统一画布上读取空间证据的中间表示。
3. 物体细节图:选择适合辨认外观的视图,不让局部裁剪承担空间推理
细节分支先对 RGB 序列做清晰度预筛选:在小时间窗口中,用灰度图拉普拉斯方差衡量清晰度,只保留最清晰的帧。之后对候选视角评估几何暴露程度与画面构图,选取两项评分乘积最大的视图。几何评分利用投影深度与传感器深度之差是否落在容差 \(\delta\) 内判断点是否可见,同时结合可见点比例和法向加权的表面暴露量,鼓励正对较大表面的观察方向。构图评分则依据物体投影框占图像的面积比例,通过梯形衰减惩罚过小或过大的物体,并惩罚边界截断。也就是说,最合适的帧不一定是物体投影最大的帧,还必须看得清、看得全。
选好帧后,系统按照投影二维框裁剪,并将框扩大 1.5 倍以保留局部上下文,再把带实例 ID 的裁剪拼成紧凑图像。推理阶段仅为目标候选或明确需要外观验证的实例提取这些细节,减少无关物体造成的视觉和 token 开销;这不意味着场景初始化完全不需要逐实例视觉标注。缓存中的式(1)和式(2)存在排版抽取损坏,因此这里仅保留正文可以核验的选帧机制,不猜测完整法向符号约定、权重或阈值。正文也没有给出时间窗口长度、深度容差、评分权重和梯形函数断点的具体数值。
4. 空间视觉联合推理:先找符合关系的候选,再检查外观是否成立
VLM 同时接收查询、SSL、VDP,以及按需生成的高度描述。提示要求先用布局图推断空间关系,再用细节图验证视觉属性,并在输出目标 ID 前给出分析。这里的“先后”指同一次联合推理中的证据使用顺序,并不是一个不断调用工具和搜索新视角的多轮代理系统。图像抽象把困难提前转移到了表示构造,最终提示不需要为“对面”“中间”等关系分别编写复杂执行模板。
空间步骤根据布局排除不满足关系的实例,外观步骤再在剩余 ID 上检查颜色、形状或状态,也能核验候选是否确实属于目标类别。这样的分工避免 VLM 在裁剪拼图里误读物体的全局相对位置,也避免它从没有纹理的布局里猜颜色。作者使用自由形式推理而非确定性的关系求解器,所以结构化证据能够降低歧义,但并不保证每次空间判断都正确。
一个完整示例¶
原文图 1 使用“门对面的床下面那个棕色柜子”。过滤模块保留门、床和柜子,而不是只留下柜子;“下面”要求高度证据,“棕色”要求视觉细节。布局显示有两张床,其中床 1 在门对面,柜子 3、4 位于床 1 下方,于是空间候选缩小到 3、4。
细节图显示柜子 4、5 是棕色。将“空间条件满足”和“颜色条件满足”两组证据对应到同一实例 ID 后,目标为 4:柜子 3 满足空间但不满足颜色,柜子 5 满足颜色却不属于正确空间位置。这个例子直接来自论文示意图,并非新增测量结果,也不应把其中的实例数量当作数据集统计。
损失函数 / 训练策略¶
这是不进行任务专用训练的零样本推理框架,没有提出新的定位损失或微调流程,但依赖已经预训练的感知模型和基础模型。默认核心引擎为 gpt-4o-2024-08-06,各提示的 temperature 为 0.1,top_p 为 0.3;ScanRefer 使用预训练 Mask3D 产生实例候选,细节裁剪扩大比例为 1.5。完整提示和额外实现细节被作者放在补充材料中,本次本地缓存只有主论文,不据此补写未见配置。
实验关键数据¶
主实验¶
ScanRefer 包含 51,583 条描述和 11,046 个物体,报告预测框与真值框 IoU 达到阈值时的正确率;Nr3D 包含 41,503 条查询,报告给定实例候选中的选择准确率。以下保留论文表 1、2 中最能说明贡献的结果,单位均为百分比;GT 类别是是否提供真实类别标签,不等于是否提供实例候选。
| 数据集与设置 | 指标 | 本文 | 对照方法 | 对照结果 | 差值(百分点) |
|---|---|---|---|---|---|
| ScanRefer,Overall | [email protected] | 51.1 | CSVG | 49.6 | +1.5 |
| ScanRefer,Overall | [email protected] | 45.0 | CSVG | 39.8 | +5.2 |
| ScanRefer,Multiple | [email protected] | 39.7 | SeeGround | 30.0 | +9.7 |
| ScanRefer,Unique | [email protected] | 66.8 | SeeGround | 68.9 | -2.1 |
| Nr3D,无 GT 类别 | Overall Acc | 63.2 | LaSP | 52.9 | +10.3 |
| Nr3D,有 GT 类别 | Overall Acc | 74.7 | Transcrib3D | 70.2 | +4.5 |
这些对照不是统一基础模型下的严格替换实验:SeeGround 使用 Qwen2-VL-72B,CSVG 使用 Mistral 系列,Transcrib3D 使用 GPT-4,本文与 LaSP 使用 GPT-4o。因此结论应限定为表中零样本系统的整体比较,不能把全部增益都归因于单一表示模块,也不能声称每个子集都最优。Unique 上落后于 SeeGround,恰好说明收益主要在同类干扰物消歧,而不是所有类别识别场景。
消融实验¶
以下来自论文表 4,全部在不提供 GT 类别的 Nr3D 抽样子集上测量,与上表完整验证集结果分开解读。
| 查询过滤 | 空间输入 | 细节图 VDP | Overall Acc(%) |
|---|---|---|---|
| 无 | 全场景 Raw BEV + ID | 无 | 48.8 |
| 有 | SSL | 无 | 60.8 |
| 有 | 无,仅局部裁剪 | 有 | 56.0 |
| 有 | SSL | 有 | 66.0 |
完整模型比“过滤 + SSL”高 5.2 个百分点,比“过滤 + VDP”高 10.0 个百分点,说明局部外观与全局布局互补。Raw BEV 到“过滤 + SSL”提升 12.0 个百分点,但这个变化同时增加了过滤和布局抽象,不能解释成过滤模块单独贡献 12.0 个百分点。表中也没有单独关闭视角对齐、半透明绘制或选帧评分的控制实验。
效率与关键发现¶
论文表 3 在与代理式基线相同的抽样子集上比较;Nr3D 不提供 GT 类别,三种方法均使用 GPT-4o。时间单位为秒/查询,不能把此处子集准确率直接与完整验证集相减。
| 方法 | ScanRefer 子集 [email protected](%) | Nr3D 子集 Acc(%) | 平均推理时间(秒/查询) |
|---|---|---|---|
| VLM-Grounder | 33.5 | 48.0 | 50.3 |
| SPAZER | 48.8 | 63.8 | 23.5 |
| 本文 | 49.2 | 66.0 | 10.9 |
相对 SPAZER,本文在两个子集分别高 0.4、2.2 个百分点,平均时间由 23.5 降到 10.9 秒。作者将效率优势归因于紧凑布局和少量对象裁剪替代长多视图输入;主文没有逐阶段延迟、token 数或初始化摊销明细,因此这些结果支持该评测下的推理效率优势,而非实时机器人部署结论。
亮点与洞察¶
- 空间图主动去掉外观,外观图主动去掉全局空间任务。这不是简单增加模态,而是为两类问题分别安排低干扰证据,适合迁移到物体检索或具身问答的输入设计。
- 查询相关的视角对齐把坐标变换外显化。与要求 VLM 凭文字自行完成心理旋转相比,这种可计算的预处理把有限的推理能力留给关系判断。
- 消融表支持“清楚的整体布局”比“更多真实画面”更重要,但也说明布局无法替代视觉核验。对于基础模型应用,值得先审视信息如何被呈现,再增加推理步骤。
局限与展望¶
- 以下为基于方法和实验的阅读判断,主文没有独立局限章节。实例分割、开放词汇标注和查询过滤构成串行依赖;目标或参照物一旦被漏掉,后续两张图都无法恢复证据,可考虑低置信度时扩大候选而非直接丢弃。
- 凸包投影会抹平凹形结构和部分三维细节,高度区间只能补回有限垂直信息。复杂堆叠或非地面布局可能需要补充侧视截面,但本文没有验证该扩展。
- Nr3D 从无 GT 类别的 63.2% 提升到有 GT 类别的 74.7%,显示类别信息仍是重要因素。这 11.5 个百分点不能严格当作纯感知误差,因为两种设置也改变了后续推理获得的信息。
- 基础模型并非全部统一,且缺少过滤独立消融、各选帧因素消融和随机性区间。现有实验支持整套设计有效,却不能精确排序每项工程选择的独立贡献。
- 自采真实场景展示被放在补充材料,主文没有可核验的机器人任务成功率或开放环境规模。可把部署表述为初步探索,不能外推成已经证明的闭环导航能力。
相关工作与启发¶
- 对比 ZSVG3D / LaSP:这类方法以视觉程序或空间代码执行关系判断,本文把空间关系放到抽象布局中由 VLM 阅读。前者更容易审查执行逻辑,后者避免为自然语言关系逐个设计刚性规则,但仍可能出现推理错误。
- 对比 CSVG:CSVG 以约束满足组织全局符号推理,因此不能把所有符号方法都简单称为“没有全局上下文”。本文的区别在于用视觉化布局表达上下文,并用对象裁剪补上细粒度外观。
- 对比 SeeGround / VLM-Grounder / SPAZER:这些方法利用局部渲染、视频帧或更广阔的场景视图,本文使用几何抽象的全局布局,局部图像只承担属性验证。可复用的启发是让表示匹配证据需求,而不是要求单张真实图像同时完成所有推理。
评分¶
- 新颖性:4/5。双粒度输入与查询适配形成清晰的方法贡献,核心在表示和流程设计,而非新的基础模型。
- 实验充分度:4/5。覆盖两个基准、GT 类别设置、模块消融和效率对比,但独立组件归因与统计稳定性仍不足。
- 写作质量:4/5。动机、示意图与推理流程呼应良好,若干实现参数和真实场景细节依赖补充材料。
- 价值:4/5。提供了把三维任务转成 VLM 可读证据的实用范式,部署价值仍受感知质量和模型调用成本制约。