跳转至

MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model

会议: ECCV2026
论文: ECCV 原文
领域: VLM 推理
关键词: 空间推理、多跳组合推理、视觉定位、VLM 评测基准、强化学习后训练

一句话总结

本文提出 MultihopSpatial:把「属性 / 位置 / 关系」三类空间线索按 1–3 跳串成链式四选一题的 VLM 基准(4,500 题、题题带人工标注的真实边界框、自我中心与外部视角各半),配套主指标 Acc@50IoU(选项答对预测框 IoU ≥ 0.5 才算对)与 6,791 条训练语料;对 37 个 SOTA VLM 的评测显示最强模型也仅 40.6% Acc@50IoU,而用该语料做 GRPO 后训练可同时提升模型的内在空间推理与下游 VLA 操作成功率。

研究背景与动机

物理 AI 的兴起让 VLM 越来越多地充当 VLA 智能体的「大脑」,而智能体要在真实环境里执行动作,前提是它既能听懂复合指令、又能把目标物准确框出来。但现有的空间推理基准基本停留在单跳关系判断上:BLINK 考的是「X 是否在 Y 右边」这类基础感知,3DSRBench 把维度扩到 3D 属性,OmniSpatial 铺开了很细的分类学,SpatialMQA 引入视角,MMSI-Bench 做多图上下文,SpatiaLab 强调真实世界复杂度。它们的共同点是每题只涉及一次空间判断,而且绝大多数只要求模型选出一个选项,不要求它指出目标在哪里。这带来一个被文献称为「空间盲区」的后果:模型完全可以跳过定位、靠属性词与语言先验把选项选对,评测分数与它真实的场景理解能力脱钩。

更具体地说,评测信号和部署需求之间存在两处错配。第一处是「答对」与「指准」被混为一谈——真实指令要求智能体在找到目标后才能操作,而单选题的判对条件里根本没有定位这一项。第二处是单跳问题把所有条件当成一次平行合取,模型不需要维护任何中间状态;而真实指令像「把右边那个最远的圆杯子拿过来」是需要先确立视角参考系、再按属性筛、最后按关系比较的链式过程,任何一步出错都会传到最终答案,单跳基准无法诊断错误发生在哪一跳。已有的少数带训练集的基准(OmniSpatial、SpatialScore)也大多不验证下游的端到端 VLA 执行,VLM 的空间推理分数和机器人实际能不能抓起来之间始终隔着一层。

本文选择的做法是同时把这两处错配补上:用人工标注把「跳数」变成可调的难度旋钮,用带边界框的答案把「定位」变成判对的必要条件,再把同一套标注管线派生出的训练语料拿去验证这些能力是否买得回来。核心 idea:把空间线索(属性 att / 位置 pos / 关系 rel)逐跳串成链式选择题,让每一步的中间结论收窄下一步的搜索空间,并用「答对且框准」的 Acc@50IoU 把推理与定位绑成一个不可互相补偿的信号。

方法详解

整体框架

这篇论文的产出分两层:一层是 4,500 题的评测基准,每题的输入是一张日常室内/外场景图(自我中心或外部视角)加一道四选一问题,模型必须同时给出选项和答案所指目标的边界框;另一层是从同一批图像与标注管线派生出的 6,791 条训练语料。评测用三个指标把能力拆开看:MCQ 准确率只看选项,平均 IoU 只在选项答对的样本上统计(因此隔离了推理错误、单独衡量定位精度),Acc@50IoU 则是本文主指标,要求选项正确且框的 IoU ≥ 0.5。最后论文用训练语料做 GRPO 后训练,把内在空间推理的提升一路验到 CALVIN 与 Libero 两个下游操作任务上。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["3,563 张图像<br/>COCO + PACO-Ego4D"] --> B["三跳组合的空间推理谜题设计<br/>att/pos/rel 逐跳收窄候选"]
    B --> C["人工标注与三轮交叉验证<br/>10 位标注员 + 3 位核验员"]
    C --> D["MultihopSpatial 评测集<br/>4,500 题 + GT 边界框"]
    C --> E["MultihopSpatial-Train<br/>6,791 条训练语料"]
    D --> F["Acc@50IoU 三档指标<br/>答对且 IoU ≥ 0.5"]
    E --> G["复合可验证奖励<br/>格式 + 选项 + GIoU"]
    F -->|37 个 VLM 评测| H["CALVIN / Libero 迁移验证"]
    G --> H

关键设计

1. 三跳组合的空间推理谜题设计:让每一步的输出成为下一步的搜索约束

论文先把空间线索收敛成三类:Attribute(att,材质、形状、颜色、纹样、材料等视觉属性)、Position(pos,左右、前后等方位)、Relation(rel,远近、高低等关系)。然后用这三类线索去组装跳数递增的问题。1 跳只用单一类别,并且刻意排除 att——属性脱离空间度量时本质上是纯感知任务,与空间推理无关;这一档(pos 或 rel)被保留下来当受控基线,用来和更深的组合做同口径对比。2 跳把两类线索叠加,共有 att+pos、att+rel、pos+rel 三种组合,结构是两阶段:先用一类线索缩小候选集,再用另一类把目标挑出来,两个约束必须同时满足,谁先谁后不影响定义。3 跳则三类全上,并且有明确的先后:att 先把候选缩到某一类物体,pos 再从其中挑出空间上合法的子集(例如「在她前面的」),rel 最后在这个子集里做比较、选出唯一目标(例如「最远的」)。

这里的关键在于组合方式是链式而非并列合取:每一个中间结论都实实在在地改变下一步的搜索空间,模型必须先冻结一个中间判断才能往下走,中途的任何一次误判都会传播成最终的错误答案。数据的规模与配比也按这个结构对齐:4,500 题在三个跳数上完全平衡(每跳 1,500 题),每个跳数内部视角也平衡(750 自我中心 / 750 外部视角),图像取自 COCO 与 PACO-Ego4D 的 3,563 张空间结构较复杂的日常场景。这样设计的好处是把「跳数」变成了一个可读的难度旋钮——评测结论不再是「模型会不会空间推理」,而是「它在第几跳、哪个视角下开始坏掉」。论文的定性分析正好抓到了这种失败模式:在一道 3 跳自我中心问题上,三个模型在推理文本里都明确复述了 "in front of" 这个位置约束,最终却只按属性与关系选出「最远的矩形物体」,把已经算出来的中间条件丢掉了。只看最终选项正确率是看不出「链条掉环」的,只能看到一个错字。

2. 人工标注与三轮交叉验证:把生成式数据的幻觉风险挡在基准之外

基准的可信度上限由标注决定,而这恰恰是当前不少空间基准的软肋——用大模型批量合成 QA 对,题目本身可能就带着模型自己的空间偏见,分数低到底是模型不行还是题目有问题说不清。本文的选择是完全不用 AI 生成:3,563 张图上的 4,500 条问答对与全部边界框由十位经过训练的专家标注,每条样本都经过多阶段的严格校验,其中包含三轮相互独立的交叉复核。最后由三位核验员逐条确认三件事——(i) 选项里提到的实体确实存在于图像中,(ii) 边界框精确对应问题所指的那个目标,(iii) 标注答案为正确答案且是问题唯一支持的那个答案。论文报告标注者间一致性达到 Krippendorff's ω = 0.90。

其中第 (iii) 条是这套协议里最容易被忽略、但对评测公平性最关键的一条。空间描述天然带歧义,如果一道题存在两条都能自洽的推理路径,那么模型选了「另一个正确答案」时被记为错误,评测就在惩罚题目本身的缺陷而不是模型的能力。「唯一支持」的强制要求把这类歧义题在入库前就剔除了。ω = 0.90 则从另一个方向佐证了同样的事:这类多跳空间判断在人类标注者之间是稳定的,因此 3-hop 上模型的大面积失败不可能是标注噪声造成的。

3. Acc@50IoU:把「指得准」并入判对条件

只有选项正确率时,模型可以完全不做定位、靠属性词与语言先验猜对答案,而这种「答对但没看」在单指标评测里与真正理解场景不可区分。论文把这种脱钩量化了出来:37 个模型的平均「无定位比例」(答对但框不准)是 59%,分家族看,专有即时模型高达 93%,Gemma-3-IT、Molmo2、Claude-Sonnet-4.5 这三个模型甚至超过 98%——它们几乎完全靠捷径作答。

本文的应对是让三个指标分工而不是替代。MCQ 准确率保持原义,只统计选项。平均 IoU 只在选项答对的样本上计算,因此它把定位能力和推理错误隔离开:答错的题不参与惩罚,剩下的数值回答的是「一旦认对了,指得准不准」。Acc@50IoU 是本文的主指标,判对条件是两个条件的合取——选项正确,且预测框与真值框的 IoU 不低于 0.5。写成式子就是 \(\hat{y}=y^{*}\)\(\mathrm{IoU}(\hat{B},B^{*})\ge 0.5\) 时为正确,其中一个条件不满足即整题判错,两者不存在互相补偿的空间。

这个设计直接改写了排行榜。由于 MCQ 与 Acc@50IoU 在很大程度上互相独立,模型名次在两个指标之间剧烈翻转:Claude-Opus-4.5 在 MCQ 上排第 7,到 Acc@50IoU 掉到第 29;反过来,体量小得多的 Qwen3-VL-4B 从第 25 升到第 10。也就是说,只用 MCQ 评测会把「靠语言捷径答对」和「真的看懂场景」的两类模型判成同一档,而 Acc@50IoU 是目前成本最低、最容易迁移到其他基准上的修补手段。

4. 复合可验证奖励:把定位写进 RL 的回报里

如果 RL 只奖励最终选项正确,模型会继续优化那条已经被验证可用的捷径,训练不会改变行为。要让后训练真正提升定位,奖励里必须有一个可自动判定、不需要奖励模型的定位项。MultihopSpatial-Train 的 6,791 条样本恰好满足 RLVR 的条件:每题有唯一正确选项(二值可判),又有真值边界框(可以连续度量)。论文规定模型按固定格式作答——先输出 "Answer: (X)",再输出 "Bounding Box: [x1, y1, x2, y2]",其中 X ∈ {a, b, c, d},四个坐标归一化到 [0, 1000] 区间——总奖励是三项之和:

\[R = R_{\text{format}} + \omega R_{\text{mcq}} + \varepsilon R_{\text{bbox}}, \qquad \omega = \varepsilon = 1\]

格式奖励与选项奖励都是 0/1 信号(解析失败一律记 0),框奖励则取自预测框与真值框的 Generalized IoU 并做正区间归一化:

\[R_{\text{bbox}} = \frac{\text{GIoU}(\hat{B}, B^{*}) + 1}{2}\]

完美重合时该项等于 1,两个框完全不相交时低于 0.5,无法解析出框的一律记 0。选择 GIoU 而不是普通 IoU 的原因在于后者在两框完全不重叠时恒为 0,给不出任何可优化的方向,而这一区间恰恰是训练早期模型所处的位置;归一化则把取值范围压到 [0, 1],得到一个稠密的正向信号。三项奖励职责分明:格式奖励保证框能被解析出来,选项奖励负责「答对」,框奖励负责「指准」,任何一项缺位都会让另外两项被钻空子。论文特别强调这套 RL 是刻意保留的最简配置(没有引入专用空间模型使用的高级训练技巧),因此报告的增益是下界而非调优后的上限。

一个完整示例

用论文里的一个 3 跳自我中心问题走一遍:「从戴眼镜的女士的视角看,她前面那个圆的或圆柱形的物体,哪个离她最远?」(选项:水杯 / 盐瓶 / 银锅 / 白锅)。四步依次收紧候选集:

  1. 定参考系:先在图里找到「戴眼镜的女士」,她决定了后面所有方位词的坐标系——这正是自我中心视角比外部视角多出来的那一步,也是 3 跳自我中心成为最难切分的原因;
  2. att 收窄:在全图物体里只保留「圆的或圆柱形的」,此时候选从整张图降到一小组容器类物体;
  3. pos 再收窄:在这组候选里只留下位于她前方区域的,不符合位置条件的直接出局;
  4. rel 定答案:在剩下的少数几个候选里比较与她的距离,取最远的那个。

整条链上每一步都依赖前一步的输出,候选集从「全图物体」收缩到「唯一目标」。论文的失败案例恰好卡在第 3 步:模型保住了 att 和 rel 两步(挑出了「最远的矩形物体」),却把 pos 这一步丢掉了,于是从全图而不是从「她前面的子集」里选。这也解释了为什么 Acc@50IoU 会掉得比 MCQ 更狠——中间条件丢掉之后,模型给出的框往往落在一个语义上很像、空间上完全错误的位置。

损失函数 / 训练策略

后训练用 GRPO:它对同一输入采样一组回答,用组内归一化后的序列级奖励作为优势更新策略,因而不需要额外的 critic 模型。基座是 Qwen3-VL-4B-Instruct,LoRA 挂在 LLM backbone 上,训练 10 个 epoch,学习率 5e-5,batch size 128。VLA 侧则把训练后的 VLM 接入 VLM4VLA 框架,在 CALVIN ABC→D 与 Libero 上沿用 VLM4VLA 的超参设置训练,用来检验空间推理的提升能否传导到动作执行。

实验关键数据

主实验

论文在完全相同的指令模板与条件下评测了 37 个 VLM,覆盖专有即时(3)、专有推理(5)、开源即时(13)、开源推理(9)与专用空间推理模型(7)五类。下表摘取各类别中最具代表性的模型:

模型 类别 Acc. (%) Acc@50IoU (%) avg IoU (%)
Gemini-3-Pro 专有·推理 64.7 40.6 55.0
Gemini-3-Flash 专有·推理 57.2 40.2 61.2
GPT-5.2-Thinking 专有·推理 57.9 11.5 29.0
Claude-Opus-4.5-Thinking 专有·推理 47.0 4.7 16.7
Claude-Opus-4.5 专有·即时 45.1 3.2 13.3
Qwen3-VL-32B-Thinking 开源·推理 46.8 37.4 67.2
Qwen3-VL-235B-Instruct 开源·即时 41.3 34.8 71.1
GLM-4.6V 开源·即时 43.2 35.2 69.5
Qwen3-VL-4B-Instruct 开源·即时 37.8 31.0 69.9
InternVL-3.5-38B 开源·即时 40.8 9.7 28.7
Gemma-3-IT-27B 开源·即时 33.1 0.4 5.4
Cosmos-Reason2-8B 专用空间推理 37.8 27.9 61.4
SenseNova-InternVL3-8B 专用空间推理 42.3 17.3 38.8
SpaceThinker-3B 专用空间推理 31.1 14.4 45.2

按跳数与视角拆开看,最能说明难度增长的是同一模型在 1 跳外部视角与 3 跳自我中心之间的落差(Acc / Acc@50IoU,%):

模型 1Hop-Exo 1Hop-Ego 2Hop-Exo 2Hop-Ego 3Hop-Exo 3Hop-Ego
Gemini-3-Pro 88.4 / 62.3 71.1 / 41.1 81.2 / 55.5 36.8 / 20.5 71.1 / 45.3 39.7 / 18.8
GPT-5.2-Thinking 76.4 / 11.7 65.6 / 12.5 63.6 / 18.0 49.7 / 7.6 55.7 / 10.4 36.1 / 8.5
Qwen3-VL-32B-Thinking 79.6 / 63.2 30.4 / 23.1 70.1 / 60.0 24.3 / 18.1 57.5 / 47.1 19.2 / 12.9
GLM-4.6V 80.1 / 63.7 32.4 / 24.3 61.6 / 53.2 22.7 / 18.4 46.7 / 39.3 15.9 / 12.3
Qwen3-VL-4B-Instruct 70.3 / 57.2 26.7 / 21.2 53.5 / 46.9 20.9 / 16.0 40.1 / 33.7 15.5 / 10.9

消融实验

对基准类论文而言,对应的「消融」是验证这套语料作为训练数据是否真的有用。论文以 Qwen3-VL-4B-Instruct 为基线,用 MultihopSpatial-Train 做 GRPO 后训练,在同域基准、五个域外基准与两个 VLA 任务上对比:

配置 MultihopSpatial Acc / Acc@50IoU / avg IoU BLINK 3DSRBench OmniSpatial VSI-Bench SpatialMQA
Qwen3-VL-4B-Instruct 37.8 / 31.0 / 69.9 82.5 56.1 42.7 62.8 39.6
w/ MultihopSpatial-Train 62.9 / 53.8 / 72.6 85.3 56.3 43.9 63.2 41.1
VLA 配置 Task-1 Task-2 Task-3 Task-4 Task-5 Calvin 平均 Libero
Qwen3-VL-4B-Instruct 92.4 81.8 74.1 66.8 59.9 3.75 35.8
w/ MultihopSpatial-Train 93.0 85.4 79.3 73.2 66.9 3.98 40.0

关键发现

  • 准确率随跳数单调衰减,视角会放大衰减幅度。 37 个模型上 MCQ 与 Acc@50IoU 都从 1 跳向 3 跳陡降,而自我中心条件下的降幅明显更大。最直观的一组对照是 Gemini-3-Pro:从 1 跳外部视角到 3 跳自我中心,MCQ 从 88.4% 掉到 39.7%,Acc@50IoU 从 62.3% 掉到 18.8%。论文据此判断视角采择与多步推理之间是相乘而非相加的关系——在更高跳数上 ego 与 exo 的差距被拉宽,说明两个难度源在互相放大。
  • 思考模式在深链上收益递减。 推理模型在 1 跳上比对应的即时模型最多高出约 8 个百分点,但到 3 跳差距被大幅压缩;即使是带扩展思考的推理模型,在 3 跳自我中心切分上也普遍掉到 20% 以下 MCQ、10% 以下 Acc@50IoU。测试时计算无法买回组合步骤累积带来的损失,这是本文认为基准尚未饱和的直接证据。
  • 基准整体远未饱和,且难题上的参考线只有随机猜测。 最强模型的总分停在 40.6% Acc@50IoU;在最难的 3 跳自我中心切分上,37 个模型里只有 3 个超过 25% 的随机选项基线,只有 9 个超过 10% Acc@50IoU。需要说明的是,论文没有报告人类在该基准上的准确率,因此这里唯一可用的参照是 25% 的随机基线,而不是人类水平(⚠️ 人机差距缺少直接测量,以原文为准)。
  • 答对与指准严重脱钩,且脱钩程度按家族分层。 平均 59% 的正确回答没有匹配的定位;专有即时模型的无定位比例高达 93%,而开源推理模型最低为 43%,其中 Qwen3-VL 与 GLM 家族低于 20%。Gemma-3-IT、Molmo2、Claude-Sonnet-4.5 超过 98%,基本可视为完全靠捷径作答。
  • 专业空间模型的优势只在定位,不在推理。 与同量级(≤10B)的通用模型相比,七个专用空间推理模型在每一跳的 MCQ 上都落后(差距从 1 跳的 4.6 个百分点收敛到 3 跳的 1.6 与 0.8),但在 Acc@50IoU 上排序反转、且领先幅度随跳数扩大(+1.6 / +4.0 / +3.4)。也就是说通用模型更会选答案,专用模型更会把选中的目标框准,两者的强项互补,目前没有任何一个家族同时具备。
  • 扩语言模型的规模解决不了定位。 跨三个开源家族的缩放曲线显示 MCQ 缓慢提升并趋于饱和,Acc@50IoU 基本走平(Qwen3-VL)甚至接近零(Gemma-3-IT)。唯一的例外是 InternVL-3.5 在 38B 上的跳变(从 5 个百分点出头跃到 27.4%),而这次跳变恰好伴随视觉编码器从 300M 升级到 6B,与之相对,沿用固定小视觉编码器(如 Qwen3-VL 的 400M)的家族早早饱和。论文由此强调多跳空间推理更依赖视觉空间表征的容量,而不是语言侧的推理能力。
  • 多标签组合是共同的瓶颈。 按标签组合统计错误率,pos-rel 组合的错误率显著高于单标签设置,说明「同时处理方位定位与关系比较」这一步即使对专用空间模型也仍然困难。
  • 训练语料的收益能穿透到动作层。 GRPO 后训练让同域分数从 37.8/31.0 提升到 62.9/53.8,平均 IoU 只从 69.9 小幅升到 72.6——这说明主要增益来自「推理对了」,而定位质量本身改善有限。更值得关注的是五个域外基准全部提升,以及 VLA 侧的迁移:CALVIN 平均完成任务数从 3.75 升到 3.98,且增益随任务链变长而扩大(Task-1 的 +0.6 到 Task-5 的 +7.0),Libero 上提升 4.2 个百分点(35.8% → 40.0%),说明长程序列操作受益更明显。

亮点与洞察

  • 把「定位」变成判对的必要条件,是最便宜也最有效的评测修补。 Acc@50IoU 并不需要重新造数据,任何已有的带框空间基准都能立刻套用;它把「答对」从语言行为改造成必须由可视化证据背书的行为,一次性暴露出 59% 的无定位回答。这个思路可以原样搬到任何「模型可以猜对但不会做」的评测场景,例如图表推理或文档理解。
  • 「推理」与「定位」解耦的发现具有设计指导意义。 论文用同一套指标证明了通用模型擅长选答案、专用模型擅长框目标,且两者在 Acc@50IoU 上排序反转。这提示后续的空间模型不应只在定位数据上做微调,而需要联合优化——本文用复合奖励做了一次最小验证,结果支持这个方向。
  • 模型规模的分析把瓶颈从语言侧移到了视觉侧。 InternVL-3.5 在 38B 上伴随视觉编码器 300M→6B 的跳变,与 Qwen3-VL 用固定 400M 编码器早早饱和形成鲜明对照。这条对比对做多模态预训练的人是一个明确的投资信号:想提升多跳空间推理,扩视觉表征可能比扩 LLM 更划算。
  • GIoU 归一化作为稠密奖励的做法可以复用。 纯 IoU 在没有重叠时恒为零、无法提供梯度,而 RL 早期模型给出的框几乎总是不重叠;把 GIoU 线性映射到 [0, 1] 之后,奖励在整个失败区间上都有可用的梯度方向。任何需要「连续可验证奖励」的定位类任务都可以直接借用这个形式。
  • 把评测基准反向当作训练语料,并用下游动作任务收尾。 论文没有止步于「我们的基准很难」,而是用同一套管线派生训练集,再把增益一路验到 CALVIN 与 Libero。长任务上增益扩大这一点尤其有说服力:它说明模型学到的是可累积的中间状态维护能力,而不只是对答案分布的拟合。

局限与展望

  • 人机差距没有被直接测量。 论文用 25% 的随机选项基线刻画难度,但没有给出人类在该基准上的准确率,因此「3 跳自我中心上只有 3/37 超过随机线」无法换算成与人类水平的距离。补一个人工评测子集会显著增强结论的说服力。
  • 训练语料与评测集的图像重叠情况在正文中未说明。 4,500 道评测题来自 3,563 张图(平均每图 1.26 题),另有 6,791 条训练语料,正文只说训练细节见附录;若两者共享图像,同域大涨(37.8 → 62.9)中会混入图像级记忆的成分,域外增益相对更可信(⚠️ 需要查附录 A 确认切分方式)。
  • 1 跳档位缺少 att 单类,跳数分析与类别分析存在混杂。 1 跳只有 pos 与 rel,att 只在 2 跳及以上出现,因此「1→3 跳的性能衰减」里同时包含「链变长」和「类别集合变化」两个因素,论文没有做拆解实验来分离二者。
  • RL 后训练只在一个基座、一个规模上验证。 论文自述这是刻意从简的最简基线,正文只报了 Qwen3-VL-4B-Instruct 的结果(其他规模见附录 B.4),因此「空间语料的后训练增益是否随模型规模变化」在正文层面无法判断。
  • 坐标归一化到 [0, 1000] 给定位精度设了上限。 在常见分辨率下这相当于图像的千分之一,对小目标而言量化误差本身就会吃掉一部分 IoU 余量;同时 0.5 IoU 的通过门槛对细长或小物体来说相当宽松,Acc@50IoU 可能会高估这类目标上的定位能力。一个更严格的 IoU 阈值曲线(例如报告 IoU 0.5/0.75 两条线)会更有诊断力。
  • 图像来源限于 COCO 与 PACO-Ego4D。 两个数据集都以日常生活场景为主,缺少工业、驾驶、可穿戴等更能体现长链条空间推理的域;基准宣称面向 VLA 部署,但图像域与机器人操作场景之间仍隔着一段距离。

相关工作与启发

  • vs OmniSpatial:OmniSpatial 把空间推理的分类学铺得很细,但问题仍然是单跳的、只判选项。本文的差异在于把类别组合成 1–3 跳的链式约束,并用 Acc@50IoU 强制定位;代价是类别粒度不如对方细,收益是能诊断错误发生在哪一跳。
  • vs 3DSRBench:3DSRBench 关注 2D 图像上的 3D 属性推断(如高度、遮挡关系),同样是单跳 MCQ。本文不引入 3D 属性,而是引入自我中心视角与链式组合;两者在难度来源上是正交的,理想情况下应同时使用。
  • vs SpatialMQA:SpatialMQA 也强调视角采择,本文沿用了自我中心/外部视角的二分并把它作为平衡因子,但额外把视角与跳数交叉,从而发现视角与多步推理是相乘关系——这是单看视角或单看跳数都得不到的结论。
  • vs MMSI-Bench:MMSI-Bench 走的是多图上下文路线,考的是跨图空间一致性;本文始终在单图内做文章,难度来自同一张图内的多次条件收窄。两者反映的是空间智能的不同侧面。
  • vs SpatialVLM / BLINK:早期工作(也是最早给 VLM 补空间能力的一批)聚焦基础关系与简单指代,其答题模式与本文的 1 跳档位接近,但本文的 1 跳被刻意保留为受控基线而不是评测终点,价值在于提供跨跳数的可比性。
  • vs SpatialScore:SpatialScore 提供了训练数据与更广的任务面,但没有把评测延伸到端到端的 VLA 执行。本文的主要区别是把训练增益验到 CALVIN 与 Libero 的动作成功率上,从而闭合了「VLM 空间分数 → 机器人是否真能操作」这条链路。
  • 启发:如果把 hop 数当成可插拔的推理深度,这套链式构造可以迁移到任何需要「多条件逐步收窄」的评测——例如文档问答里的多约束检索、GUI 操作里的多步定位。更有价值的是它的评测哲学:只要判对条件里不包含「中间产物是否可验证」,任何多步任务基准都会高估模型能力。

评分

  • 新颖性: ⭐⭐⭐⭐ 首个把多跳组合空间推理与强制定位绑在同一个判对条件里的基准,Acc@50IoU 虽然简单但切中要害,方法层面的创新有限。
  • 实验充分度: ⭐⭐⭐⭐⭐ 37 个模型、五类家族、按跳数与视角双重分解,另有域外基准与两个 VLA 任务的迁移验证,覆盖面在基准类论文中属上乘。
  • 写作质量: ⭐⭐⭐⭐ 结构清晰、八条洞察组织有条理,但关键细节(训练/评测切分、可视化细节)大量下放附录,正文对若干结论只给方向不给数值。
  • 价值: ⭐⭐⭐⭐ 对具身智能与 VLM 评测两条线都有直接可用性:Acc@50IoU 可立即移植,多跳组合与「推理-定位解耦」的发现会改变后续空间模型的训练配方。