跳转至

Why Far Looks Up: Probing Spatial Representation in Vision-Language Models

会议: ECCV2026
论文: ECCV 原文
领域: 多模态VLM
关键词: 视觉语言模型、空间推理、对比探针、透视投影偏置、表示分析

一句话总结

本文提出一套表示层分析框架:用「只交换物体顺序」的最小对比问题对抽取中间层隐状态差向量,度量三条空间轴在 VLM 表示空间里如何被组织,发现模型普遍把图像的垂直位置当作距离的代理(垂直-距离纠缠);作者用解耦了垂直位置与深度的合成基准 SpatialTunnel 证明该偏置是模型内禀的,并指出距离轴一致性高的模型才是真正在反先验样本上更稳的模型。

研究背景与动机

视觉语言模型在空间推理基准上的分数逐年走高——EmbSpatial-Bench、CV-Bench、BLINK 上的成绩常常强到让人以为它们真的在做 3D 推理——但这些模型绝大多数是用 2D 图文对训出来的。问题在于,单目图像本身就带着一条很强的统计规律:站在同一地面上的物体,越远的在图像里越靠上(经典的 elevation cue)。这意味着模型只要学会「图像里更高 ⇒ 更远」,就能在一大批深度问题上拿分,而不需要理解任何 3D 结构。更棘手的是,行为基准只看答案对不对,看不出答案是怎么来的:两个基准分数几乎一样的模型,一个可能把左右、上下、远近编码成结构化、彼此可分离的方向,另一个则只是抓住了自然图像里恰好和深度相关的线索,一旦评测分布偏移就会原形毕露。要区分这两种情况,必须去看模型内部的表示,而不是停在输出层的准确率上。

已有的努力基本分成两支。一支是受控行为评测,What's Up、COMFORT 等工作用改写过的问题和参考系一致性检查,揭示了 VLM 在基础方位判断上的系统性失败;另一支开始探内部机制,比如 ADAPTVIS 分析空间推理时的注意力动态,DepthCues 用线性探针说明视觉编码器本身就表征了单目深度线索,还有工作发现早期层会把几何坐标绑定到物体激活上,Spatial Forcing 则显式对齐中间层与 3D 结构。但这些工作要么只测单项任务的成败,要么只检测某个空间原语"存在与否"、或只调整局部注意力行为,都没有回答一个更整体的问题:不同的空间维度在表示空间里是占据了彼此分离的方向,还是被塞进了同一个方向?孤立探针恰好看不见这种纠缠——一个模型完全可以在 above 和 far 上分别都探得很准,却把它们编码到了同一根轴上。

本文因此从两个互补角度切入。行为侧,把深度问题按真值与「远=上」先验是否一致切成一致 / 反向两组,比对两组准确率之差 Δ;再搭一个单点透视的合成隧道场景 SpatialTunnel,让物体沿隧道断面上下移动而深度顺序不变,从而在几何上切断「图像更高 ⇒ 更远」这条相关性,用它检验 Δ 到底来自模型还是来自评测集的偏斜。表示侧,把同一个问题里的两个物体顺序对调,构造一对只看关系翻转的最小对比问题,取中间层末位 token 隐状态之差作为 delta 向量,用轴一致性和垂直-距离纠缠指数刻画空间轴在表示空间中的几何关系。核心 idea:把"模型究竟靠 3D 结构还是靠透视捷径"这个只靠分数说不清的问题,重写成表示空间里空间轴之间的方向关系(轴一致性 + 纠缠指数),并用一个几何上解耦了垂直位置与深度的合成基准把模型偏置与评测集偏斜拆开。

方法详解

整体框架

论文的输入是一张图像加一个空间关系问题(左右 / 上下 / 远近),输出是对"这个模型的空间能力是结构化的还是捷径式的"的诊断结论。整条分析线分两段:先做行为诊断——按「远=上」先验把深度问题切成一致 / 反向 / 模糊三类,在真实基准上量出一致组与反向组的准确率差 Δ(第 3 节),再用 SpatialTunnel 合成的隧道场景做同一套划分与度量,把 Δ 从评测集偏斜中剥离出来(第 4 节)。然后转到表示层——对每张图构造一对只交换物体顺序的问题,取固定中间层末位 token 的隐状态之差作为 delta 向量,按空间类别聚合后算出轴一致性与 VD-EI,得到"这个模型的左右 / 上下 / 远近轴长什么样"(第 5 节)。最后把表示指标和反向样本准确率、跨基准表现对上,看表示结构与鲁棒性是否同步。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["图像 + 空间关系 VQA"] --> B["一致 / 反向划分<br/>按 y 坐标判定先验方向"]
    B --> C["SpatialTunnel<br/>解耦垂直位置与深度"]
    C --> D["最小对比问题对<br/>交换物体顺序取 delta 向量"]
    D --> E["轴一致性与 VD-EI<br/>度量空间轴的几何组织"]
    E --> F["表示结构 ↔ 反先验准确率<br/>跨模型 / 跨基准对照"]

关键设计

1. 一致 / 反向样本划分:把「远=上」这条透视先验变成可度量的行为差异

"模型在走捷径"这种话很容易说、很难证。本文的做法是:只取涉及深度比较的问题,比较两个被问物体在像素空间的垂直中心坐标——如果更远的那个 y 坐标更小(即在图像里更靠上),这个样本记为一致;反之记为反向;若两者 Δy 小于图像高度的 5%,说明垂直位置几乎没提供方向信息,记为模糊并排除。这个划分完全不依赖任何模型输出,只用了标注和坐标,因此可以看作一条纯先验判据。判据的用法很直接:如果模型不依赖垂直位置,它在一组和反向组上的准确率应当相当;一致组显著更高,就构成了模型拿垂直位置当深度代理的行为证据。

作者用这套划分统计了现有基准,结果本身就说明问题:EmbSpatial-Bench 的 1206 个深度问题里一致样本 976 个(80.9%),反向仅 129 个(10.7%);CV-Bench-3D 的 600 个里一致 363 个(60.5%),反向 65 个(10.8%)。这些基准的样本分布几乎是自然照片统计的翻版,因此一个纯粹依赖垂直线索的模型也能拿到不错的"平均分"。这个设计的价值在于零成本、可移植:任何带深度标注的空间问答都可以按同一把尺子切开重算,而不必重新造数据。

2. SpatialTunnel:用隧道几何把垂直图像位置与深度解耦

真实照片里垂直位置、近大远小、遮挡等多个深度线索同时变化,想把其中任意一条单独拧出来做干预是做不到的。SpatialTunnel 用 Blender 搭了一个单点透视的隧道走廊:墙面、天花板、地板关于相机光轴对称,物体只能贴在隧道内表面上,于是每个物体可以用「深度 z + 断面上的角位置 θ」两个参数描述。关键在于固定 z、只改 θ 时,物体在图像里上下左右移动,但深度顺序完全不变——隧道顶部的物体和底部的物体可以离相机一样远,「图像里更高 ⇒ 更远」这条先验被几何地打破。基准把断面离散成 16 个角位置,两个物体各取一个,构成 16×16 的 \((\theta_1,\theta_2)\) 网格,可以画成热力图直接看模型在哪些配置上对、哪些配置上错;物体颜色、大小、形状与光照在渲染间随机化,避免模型靠外观记忆作弊。

评测协议上,模型看到一张含两个物体的渲染图,被问一个二选一的深度比较问题(如"{obj1} 比 {obj2} 离相机更近还是更远")。作者不看生成的文本,而是取首个生成 token 处 Yes / No 两个 logits 归一化后的局部概率作为 Yes 的概率 \(p\)(⚠️ 原文该处公式在缓存中损坏,此处按正文描述还原,以原文为准),单样本得分取 \(v=p\)(真值为 Yes)或 \(v=1-p\)(真值为 No)。用连续概率而不是硬答案,是为了在模型接近随机水平时也能看出它究竟偏向哪一边。聚合出四个指标:平均准确率 \(v\)、一致组准确率 \(v_{cons}\)、反向组准确率 \(v_{ctr}\),以及准确率差 \(\Delta = v_{cons} - v_{ctr}\)——后者就是垂直-距离纠缠在行为上的直接读数,完全不偏的模型应当有 \(\Delta \approx 0\)

3. 最小对比问题对与 delta 向量:把空间关系从视觉内容里剥出来

直接拿隐状态做探针,探到的多半是物体类别、场景风格、问句措辞这些共同成分,而不是空间关系本身。本文的对策是构造最小对比对:同一张图,问句只交换两个物体的顺序——「A 在 B 的左边还是右边?」与「B 在 A 的左边还是右边?」。两个问题的视觉输入完全相同,真值关系互为反向(左变右、远变近、上变下)。对每个问题取某个固定中间层 \(L^*\) 的末位 token 隐状态,两者相减得到 delta 向量 \(\delta = h_{q_2} - h_{q_1}\)。由于视觉内容和绝大部分语言内容在相减时被抵消,剩下的位移就近似只承载"关系被翻转"这一件事,这正是把关系编码从混杂因素里剥出来的关键。把同一空间类别(above、below、far、close、left、right)在大量图像上的 delta 向量汇总,就得到每个方向在表示空间里的一簇向量,它也是后面两个指标唯一的输入。层 \(L^*\) 按模型族各固定一个,选层依据沿用已有的层选择工作(原文附录 D.3 / D.4)。

4. 轴一致性与 VD-EI:给表示层的空间轴组织定两个可比的标量

有了 delta 向量簇,还需要能跨模型、跨训练规模横向比较的数。轴一致性(axis coherence)回答"这根轴有没有一个稳定方向":对某一根轴,把它两个相反类别(如 far 与 close)的 delta 向量并到一起,先把相反类别的向量取负、使所有向量都指向同一规范方向,再在这个符号校正后的集合上计算平均成对余弦相似度(⚠️ 该式在缓存中损坏,按正文描述还原,以原文为准):

\[\tilde{\delta}^{(i)} = \begin{cases}\delta^{(i)}, & \text{canonical (e.g. far)}\\ -\delta^{(i)}, & \text{opposite (e.g. close)}\end{cases}\]
\[\text{Coh}_{\text{axis}} = \frac{2}{N(N-1)}\sum_{i<j}\cos\left(\tilde{\delta}^{(i)}, \tilde{\delta}^{(j)}\right)\]

值高说明该轴在表示空间里对应一个稳定方向,模型对这个方向的编码是自洽的;值接近 0 说明向量互相乱指,模型自己都说不清"更远"往哪边变。垂直-距离纠缠指数(VD-EI)则回答"两根轴是否被绑在一起、而且是按透视投影预测的方式绑的":先求 above、below、far、close 四个类别的平均 delta 向量 \(\mu_c\),再比较四组夹角余弦——

\[\text{VD-EI} = \frac{1}{4}\left[\cos(\mu_{\text{above}},\mu_{\text{far}}) + \cos(\mu_{\text{below}},\mu_{\text{close}}) - \cos(\mu_{\text{above}},\mu_{\text{close}}) - \cos(\mu_{\text{below}},\mu_{\text{far}})\right]\]

前两项是透视"对齐"的配对(上↔远、下↔近),后两项是透视"相反"的配对;正值意味着模型确实把垂直和距离按透视投影的方式耦合起来,0 表示两者在表示空间里独立。这个指标比"分别在 above 和 far 上做探针都准"严格得多:后一种探针完全探不出两个概念被编码到同一根轴上的情况,而 VD-EI 直接量的是两轴之间的角度关系,这正是孤立探针的盲区。

损失函数 / 训练策略

本文不训练新方法,但为了看数据规模与纠缠的关系,作者在三个模型族上做了配方受控的空间 SFT:把 SAT、RoboSpatial、SPAR-7M、RefSpatial、PRISM 五个空间理解数据集均匀混合,再下采样到 80k / 400k / 800k / 2M 四个规模,其余训练设置保持一致;base 指未做空间微调的原始权重。此外纳入 RoboRefer-2B-SFT(与 NVILA-Lite-2B 同底模,但训练样本超过 20M 且包含 RGB-D 图像)和 Qwen3-VL-235B-A22B-Instruct 作为两个不同训练范式的参照。原文未给出学习率等具体优化超参;探针侧只规定"每个模型族固定一个中间层 \(L^*\)",取值见附录。需要说明的是,论文的全部证据链——行为上的 Δ 差、合成基准上 Δ 依然存在、表示空间里 CohD 低而 VD-EI 高、CohD 与反向准确率跨基准相关——都是相关性证据,作者没有做激活替换或"消掉某个方向再测"这类因果干预,因此"表示纠缠导致推理失败"与"读出层没有利用好已有结构"目前还不能被严格区分开。

实验关键数据

主实验

表 1 先给出评测集本身的样本分布(模糊样本定义为两物体 Δy 小于图像高度的 5%):

基准 一致 反向 模糊
EmbSpatial-Bench 976 (80.9%) 129 (10.7%) 101 (8.4%)
CV-Bench-3D 363 (60.5%) 65 (10.8%) 172 (28.7%)

表 2 是行为层的核心证据:深度问题上一致组 vs 反向组的准确率,括号内为差值(百分点)。这里只列 base 与 2M 两端,中间规模的走势在表后说明。

模型 EmbSpatial 一致 EmbSpatial 反向 CV-3D 一致 CV-3D 反向
Molmo-7B-O-0924 63.5 34.9 (−28.6) 93.1 75.4 (−17.7)
Molmo + 2M 65.3 39.5 (−25.8) 90.6 72.3 (−18.3)
NVILA-Lite-2B 49.0 27.1 (−21.9) 74.4 40.0 (−34.4)
NVILA + 2M 60.7 41.1 (−19.6) 97.2 93.8 (−3.4)
RoboRefer-2B-SFT 87.0 59.7 (−27.3) 98.9 95.4 (−3.5)
Qwen2.5-VL-3B-Instruct 54.7 32.6 (−22.1) 75.5 55.4 (−20.1)
Qwen2.5-VL + 2M 60.9 24.0 (−36.9) 62.0 53.8 (−8.2)
Qwen3-VL-235B-A22B 73.3 41.7 (−31.6) 98.1 90.8 (−7.3)

所有模型在两个基准上都是反向组更低,差距从 3.4 个百分点(NVILA 2M 的 CV-Bench-3D)到 36.9 个百分点(Qwen2.5-VL 2M 的 EmbSpatial-Bench)不等,且与模型族、参数量、微调数据量都无关。更值得注意的是数据规模并不单调地解决问题:Qwen2.5-VL 从 base 的 −22.1 一路拉大到 2M 的 −36.9,一致组涨到 60.9 的同时反向组掉到 24.0,说明它学到的更多是"把先验用得更狠";NVILA 则相反,随规模扩大把 CV-Bench-3D 上的差压到 −3.4,但 EmbSpatial 上仍有 −19.6。中间规模还出现过反复:NVILA 的 400k / 800k 分别为 −27.0 / −24.4(EmbSpatial)、−22.8 / −16.9(CV-3D),Molmo 的 400k / 800k 在 EmbSpatial 上是 −35.6 / −31.1。

除准确率之外,论文还比较了五个格式、难度各异的任务(EmbSpatial 总体、CV-Bench-2D Relation、CV-Bench-3D Depth / Distance、BLINK 的 Rel. Depth 与 Spat. Rel.),结论是微调变体的表现在基准之间来回震荡,单个分数无法代表 3D 概念的内化程度:NVILA (2M) 在 CV-3D Depth 上拿到 93.8%,到 BLINK Spatial Relation 只有 62.9%;Qwen2.5-VL (2M) 在 BLINK Spatial Relation 上有 78.3%,在 CV-3D Distance 上只有 52.2%。而 RoboRefer-2B-SFT 与 Qwen3-VL-235B-A22B 在所有任务上都稳定高位(RoboRefer:92.0 / 96.5 / 95.7 / 90.5 / 84.7 / 79.7;Qwen3-VL-235B:82.0 / 96.5 / 93.3 / 91.0 / 84.7 / 90.2,列序同上)。论文随后在表示层指出,正是这两个模型拥有最结构化的空间表示。

消融实验

第一个分析实验是在合成基准 SpatialTunnel 上重做一致 / 反向划分。\(v\) 为平均得分,\(v_{cons}\)\(v_{ctr}\) 为两组得分,\(\Delta = v_{cons} - v_{ctr}\)

模型 v v_cons v_ctr Δ
Molmo-7B-O-0924 0.528 0.565 0.487 +0.078
Molmo + 2M 0.666 0.703 0.630 +0.073
NVILA-Lite-2B 0.488 0.504 0.471 +0.033
NVILA + 2M 0.812 0.875 0.749 +0.127
RoboRefer-2B-SFT 0.793 0.816 0.770 +0.046
Qwen2.5-VL-3B-Instruct 0.570 0.776 0.360 +0.416
Qwen2.5-VL + 2M 0.500 0.648 0.353 +0.295
Qwen3-VL-235B-A22B 0.908 0.948 0.880 +0.068

把合成图里的垂直位置和深度解耦之后,全部模型仍然是一致 > 反向,说明这个偏差不是评测集偏斜能解释的。Qwen2.5-VL base 的 \(v_{cons}=0.776\)\(v_{ctr}=0.360\),是全部模型里最大的 \(\Delta\)(+0.416);NVILA-Lite-2B base 的 \(\Delta\) 虽然小(+0.033),但整体 \(v=0.488\) 已接近随机,小差距只是因为两组都不会做,而不是因为表示干净。训练规模上去之后偏置明显缓解:RoboRefer(20M 以上样本)在高于随机的模型里 \(\Delta\) 最小(+0.046),Qwen3-VL-235B 拿到最高平均分 0.908 且 \(\Delta\) 仅 +0.068,说明极大规模预训练即使不做针对性空间微调也能大幅削弱这条偏置。Molmo 的 16×16 网格热力图进一步显示,若预测真的对 2D 摆放不敏感,准确率应在网格上近似均匀,实际却呈现出一致区与反向区鲜明的对比。

第二个分析实验把 delta 向量汇成两个标量指标(CohH / CohV / CohD 分别为水平、垂直、距离轴的轴一致性,VD-EI 为纠缠指数):

模型 CohH CohV CohD VD-EI
Molmo-7B-O-0924 0.143 0.228 0.075 0.279
Molmo + 2M 0.239 0.574 0.112 0.474
NVILA-Lite-2B 0.323 0.289 0.052 0.539
NVILA + 2M 0.241 0.553 0.104 0.550
RoboRefer-2B-SFT 0.649 0.830 0.182 0.362
Qwen2.5-VL-3B-Instruct 0.367 0.293 0.043 0.457
Qwen2.5-VL + 2M 0.485 0.586 0.052 0.472

三个结论:距离轴最弱——所有模型、所有训练规模下 CohD 都是三根轴里最低的,而微调能大幅拉高垂直轴一致性(Molmo 0.228 → 0.574,Qwen2.5-VL 0.293 → 0.586),距离轴却几乎不动(Qwen2.5-VL 全程 0.043 → 0.052)。距离轴一致性与反向准确率同步:在 EmbSpatial-Bench 上(也就是算一致性用的同一批数据)从某个规模起两者同向上升——NVILA 自 80k 起、Molmo 自 400k 起,CohD 涨、反向准确率也涨;而 Qwen2.5-VL 的 CohD 始终平坦,反向准确率随之下降、Δ 被拉大。跨域有效:在 SpatialTunnel 上算出的 CohD 与其他基准上的反向准确率相关(与 EmbSpatial-Bench ρ = 0.759,与 CV-Bench-3D ρ = 0.804,均 \(p < 10^{-3}\)),说明 CohD 不是同域计算带来的假象。图 7 的 PCA 给出了直观对照:base NVILA 的距离 delta 向量坍缩在原点附近、形不成方向;2M 微调后开始散开但垂直与距离两簇仍然重叠;RoboRefer 则呈现三个彼此分离、各对齐一个主成分的簇(CohD 0.182、VD-EI 0.362,对应 EmbSpatial 反向准确率 59.7%,而 NVILA 2M 只有 41.1%)。Qwen3-VL-235B 未在指标表中给出数值,仅在 PCA 图中展示出与 RoboRefer 类似的清晰三簇结构。

关键发现

  • 垂直-距离纠缠是跨模型族、跨规模、跨评测方式的普遍现象:真实基准上与合成基准上都存在一致组高于反向组的问题,且合成基准上依旧存在,说明它由模型而非评测集带来。
  • 加大空间微调数据并不自动解决纠缠,方向甚至可能相反:Qwen2.5-VL 在 EmbSpatial 上的差从 base 的 −22.1 拉大到 2M 的 −36.9,因为一致组上升的同时反向组从 32.6 掉到 24.0;Molmo/NVILA 则各有起落,并非单调收敛。
  • 基准分数高不等于表示结构化:NVILA (2M) 在 CV-3D Depth 上 93.8% 却在 BLINK Spatial Relation 上 62.9%,Qwen2.5-VL (2M) 反之(78.3% vs 52.2%),而表示结构化程度最高的 RoboRefer 与 Qwen3-VL-235B 在所有任务上一致强。
  • 三根轴里距离轴最难:CohD 一致垫底,且只有 CohD 与反先验准确率呈现跨基准的稳定相关(ρ = 0.759 / 0.804),说明"距离轴是否被编码成稳定方向"是比平均分更有预测力的诊断量。
  • 组合使用两个指标更可靠:CohD 高但 VD-EI 也高的模型仍可能粘连两轴,RoboRefer 的价值恰在于同时拿到最高 CohD 与最低 VD-EI。

亮点与洞察

  • 把"是不是在走捷径"做成可测的量:一致 / 反向划分只用标注和像素坐标,不含任何模型信息,因此它既是行为诊断判据,也能当作数据审计工具——现有基准里反向样本只有约 10%,这个数字本身就值得所有空间推理评测引用。
  • 交换物体顺序构造最小对比对,是这套方法里最巧的一步:视觉输入完全不变、只翻转关系真值,两者隐状态相减就把物体、场景、措辞等共同成分抵消掉,剩下的位移近似只承载"关系方向"。这套"最小改动 → 取表示差 → 按类别聚合"的套路可以原样迁移到颜色、材质、数量、因果方向等任何"概念是否占据独立方向"的问题上。
  • VLM 空间推理的短板更像编码问题而非读出问题:纠缠出现在中间层表示里(距离 delta 向量坍缩、CohD 长期垫底),并且表示结构与反先验鲁棒性跨模型、跨基准同步变化,这指向"概念本身没被分开编码",而不是"编码好了但解码层没用上"。⚠️ 不过这一判断仍是相关性的,作者没有做因果干预来区分两种解释。
  • 指标可以当训练期的诊断器:CohD 不需要额外标注、只需要对比问题对,且在不同基准间可迁移,因此可以直接嵌进空间数据配比或课程学习的迭代里,用来判断"这一批数据到底有没有改善距离表示"。

局限与展望

  • 证据链是相关性而非因果:论文展示了 CohD 与反向准确率同步变化,以及表示结构强弱与鲁棒性的对应关系,但没有做方向消融、激活替换或因果干预,因此不能断定"提高 CohD 就会提升准确率",反过来也一样。
  • 指标绝对尺度偏小:即便是表现最好的 RoboRefer,CohD 也只有 0.182,其余模型多在 0.04–0.11。数值低到什么程度才算"这个轴其实没被编码"、高到什么程度才算够用,论文没有给出可解释的阈值。
  • 层选择是预设的:\(L^*\) 按模型族固定一个中间层,依据来自已有层选择工作。不同层是否会得到不同的纠缠结论、以及纠缠是否随层数加深而缓解,正文和缓存文本中都没有给出。
  • SpatialTunnel 只有一个单点透视隧道、两个物体、固定深度差,外观虽随机化但域差距仍然明显;它证明了"去掉垂直-深度相关性后性能会掉",但隧道几何本身也是一种新的分布,模型在其中可能受其他未控因素影响。
  • RoboRefer 同时改变了数据规模(20M+)、数据模态(含 RGB-D)和监督形式,作者自己也承认只能把它当作说明性参照,无法把收益归因到单一因素;Qwen3-VL-235B 同理,规模与训练配方一起变了,并且没给出 CohD / VD-EI 的数值。
  • 改进方向:把探针从相关性推进到因果——按 delta 向量方向做激活消融或方向替换,看反向样本准确率是否随之变化;把 CohD 直接做成微调时的辅助目标(对齐距离方向的表示),验证它是否能换来反先验鲁棒性。

相关工作与启发

  • vs What's Up / COMFORT 等受控行为评测:他们通过改写问题、检查参考系一致性来暴露 VLM 的方位判断失败,测的是"会不会错";本文测的是"错在内部的哪里",并进一步用合成环境把评测集偏斜从模型偏置里剥出来。
  • vs ADAPTVIS 等注意力机制分析:他们解释空间推理为何难时看的是注意力聚焦到哪里,属于局部机制;本文看的是表示空间里三根空间轴的几何关系,能发现"单点机制探针探不到"的轴间纠缠。
  • vs DepthCues / 线性机制探针:那些工作用线性探针证明视觉编码器或早期层里存在深度线索、几何坐标被绑定到物体激活上;本文不检测某个原语是否存在,而是量它与其他原语的相对方向,因此能指出"深度线索存在但与垂直方向共用同一方向"这种更细的情形。
  • vs Spatial Forcing 等表示对齐方法:那类方法显式把中间层对齐到 3D 结构,是训练手段;本文提供的是诊断手段,且 CohD 具备跨基准迁移性,适合在训练迭代中充当用于判断"对齐有没有真的发生"的观测量。

评分

  • 新颖性: ⭐⭐⭐⭐ 把"捷径 vs 结构"从定性说法做成表示层可测指标(轴一致性 + 纠缠指数 + 解耦合成基准),三件套组合在空间推理分析里是新的。
  • 实验充分度: ⭐⭐⭐⭐ 三个模型族 × 四个数据规模 + 两个参照模型、五个基准加一个自建合成基准,覆盖很足;扣分在探针只到相关性、层选择与超参细节推给附录、且未做因果干预。
  • 写作质量: ⭐⭐⭐⭐ 论证链条清晰、指标定义完整、对 RoboRefer 这类混杂因素的归因保持了克制;个别公式在缓存版本中损坏,需以原文为准。
  • 价值: ⭐⭐⭐⭐ CohD 是一个便宜、可跨域迁移、能嵌进训练迭代的空间表示诊断量,对做空间数据配比和 VLM 表示分析的工作都有直接参考价值。