Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models¶
会议: ECCV2026
论文: ECCV 原文
领域: 机器人/具身智能
关键词: 视觉-语言-动作模型、几何基础模型、VGGT、线性探针、空间理解
一句话总结¶
本文以 GR00T-N1.5 与 VGGT 为固定组合,用线性探针首次量化了 VLA 相对几何基础模型(GFM)的"几何鸿沟",把已有文献中五花八门的几何注入方式归纳为早融合、晚融合、空间强制三条受控可比的路线,并系统扫描数据规模、相机数量与重建质量等非架构因素:任务级微调下几何 VLA 并不显著更好,但放大训练数据、或退化到单相机设定后,几何信息的价值才显现出来。
研究背景与动机¶
视觉-语言-动作模型(VLA)近两年成为机器人操作的主流范式:一个视觉-语言模型(VLM)把机器人相机拍到的图像与用户指令("把粉色水瓶拿起来")对齐到相关像素,再由动作专家根据机器人本体与 VLM 的理解输出一段动作序列。这套"VLM + 动作专家"的组合在语义 grounding 和泛化上非常成功,但它继承自 VLM 的一个短板是空间理解差——已有工作反复观察到 VLM 在估计距离、相对位姿、物体摆放约束这类几何推理上不可靠(SpatialVLM、SpatialBot 等)。而操作任务恰恰是几何说了算的:几厘米的偏差就决定了抓取成功还是失败。由此出现了 3D VLA 路线,用 RGB-D 相机或点云给策略补上深度信息(PointVLA、RVT-2、3D-VLA 等),代价是额外传感器与额外的数据采集。
另一条线索来自计算机视觉自身。以 DUSt3R、MASt3R、VGGT 为代表的几何基础模型(GFM)用单个前馈 transformer 直接从多视角图像回归相机位姿、深度图与稠密点图,不再需要传统 SLAM / SfM 那种"特征提取→匹配→光束法平差→稠密重建"的多阶段流水线,也不需要标定相机。这对 VLA 有特殊的吸引力:VLA 本来就只吃 RGB,GFM 让"不采新数据、不加新传感器也能补 3D 信息"变成一件近乎免费的事,因此近期一批工作(Evo-0、VGGT-DP、Spatial Forcing 等)把 GFM 的 token 塞进 VLA 并报告了收益。
问题在于,这批工作留下的疑问比结论更多。第一,没人量化过 VLA 究竟缺多少几何理解——"VLA 缺乏空间理解"一直只是直觉性观察,而如果 VLA 自己已经够了,注入几何就是无用功。第二,各家提出的注入架构差异极大(有的改视觉编码器输出、有的改 VLM 输出、有的根本不动结构只加训练损失),且实现细节各不相同,导致"哪种注入更好"无法公平比较,也说不清好在哪。第三,几何 VLA 的表现显然还受一批非架构因素影响——用几路相机、训练数据有多少、GFM 在自己场景里重建得准不准——这些都没有被系统检验过。本文的做法是刻意把范围收窄到一个确定组合(VLA 选 GR00T-N1.5,GFM 选 VGGT),然后在这一个组合上做受控实验分析。核心 idea:先用线性探针把"VLA 缺多少几何"变成一个可测量的数字,再把已有文献的注入方式归纳成三条在实现细节上尽量对齐的路线做同条件对比,最后把数据量、相机数、重建质量这些非架构变量单独拎出来逐个扫描,看几何信息到底在什么条件下才真正换来成功率。
方法详解¶
整体框架¶
本文不是一个新模型,而是一项围绕"几何如何进入 VLA"的受控实验研究,因此它的"方法"由三块可复用的分析装置组成:一把尺子(线性探针)、一组可控的注入结构(三种策略 + 一个共享融合模块)、一套严格的评测协议。基线 VLA 沿用 GR00T-N1.5 的标准形态:输入是当前时刻机器人相机拍到的图像集合 \(I\)、语言指令 \(L\) 与机器人状态 \(R\)(关节角等);三者分别经视觉编码器、文本 tokenizer、状态编码器变成视觉 token \(V_e\)、语言 token \(L_e\) 与状态 token \(R\);\(V_e\) 与 \(L_e\) 送进 VLM 里的 LLM backbone,产出新的视觉 token \(V_l\) 与语言 token \(L_l\);这些 token 连同 \(R\) 一起交给动作专家,由它预测未来 \(T\) 步的动作序列 \(a_{0:T}\)。动作专家采用扩散策略式的流匹配(flow matching)形式,在训练时学习把随机噪声积分回可行动作,推理时对该去噪场做欧拉积分得到动作(原文中该损失的具体表达式在缓存文本中已损坏,此处不复原)。
在这个骨架上,几何基础模型 VGGT 吃的是同一批图像 \(I\),输出一组几何 token \(G\)。本文的全部工作就是回答 \(G\) 该以什么形式、在什么位置、在什么条件下进入上面这条流水线。三条注入路线——早融合(把 \(G\) 与视觉编码器输出 \(V_e\) 融合后送进 LLM)、晚融合(把 \(G\) 与 VLM 输出 \(V_l\) 融合后送给动作专家)、空间强制(结构完全不变,只在训练时用对齐损失把 LLM 内部 token 拉向 \(G\))——构成了本文的受控自变量;线性探针则用一个冻结网络上的轻量 MLP,分别去读视觉编码器输出、VLM 输出、VGGT、以及两个融合模型的 VLM 输出,量出每一层还剩多少深度信息。整套流程再放到 RoboCasa、LIBERO 两个仿真基准与 Unitree G1 真机上评测。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:多路 RGB<br/>+ 语言指令 + 机器人状态"] --> B["GR00T-N1.5 基座<br/>VLM + 动作专家"]
A --> C["VGGT 前向<br/>输出几何 token G"]
B --> D["线性探针量化几何鸿沟"]
C --> D
D -->|几何信息在 VLM 输出前已丢失| E["三条注入路线的受控实现"]
C --> E
E --> F["带门控的交叉注意力融合"]
F --> G["几何 VLA(早融合 / 晚融合)"]
E -->|空间强制:不改结构,加对齐损失| G
G --> H["受控实验与显著性检验<br/>RoboCasa / LIBERO / Unitree G1"]
关键设计¶
1. 线性探针量化几何鸿沟:把"VLA 不懂几何"从直觉变成数字
此前文献说 VLA 缺空间理解,靠的是定性观察或下游成功率,无法回答"缺多少"。本文借线性探针把这变成可测量的量:把待测网络整层冻结,只在它的某一层输出上接一个简单的 MLP,仅训练这个 MLP 去解单目深度估计——如果该层特征里真的含有几何信息,这个轻量模块就能把它读出来,反之读不出来。探针在 NYU Depth V2(24,000 对训练、645 对验证)上训练 10 个 epoch,用尺度不变对数(SILog)损失,并以 RMSE 深度误差(越低越好)与 δ1(预测落在真值 25% 以内的像素比例,越高越好)作为读数。关键在于探针对比的分母:VGGT backbone 自身的特征探针给出了"几何信息充裕时"的性能上限,VLA 侧探针与它的差距就是所谓"几何鸿沟"。这个设计同时暴露了一个细节——探针接在视觉编码器输出上时隐藏维是 1024,接在 VLM 输出与 VGGT 上时是 2048,因此视觉编码器那一行的读数会因 MLP 容量偏小而偏低,作者在脚注中明确承认这一点,读者不能把两行当作严格同容量的比较。
2. 三条注入路线的受控实现:让"哪种注入更好"第一次可以公平比较好
已有几何 VLA 工作各自改自己的结构、用各自的实现细节,结论之间不可比。本文把文献归纳为三条路线,并在同一基座上用尽量一致的底层实现复现它们。早融合把 GFM 当成"额外的编码器":VGGT 对同一批图像 \(I\) 输出几何 token \(G\),与视觉编码器的输出 \(V_e\) 融合成 \(\text{fuse}(V_e, G)\),直接顶替原来的视觉 token 送进 LLM;这条路线的直觉是让几何信息在进入语言模型之前就参与表征,Evo-0 等早期工作走的就是它。晚融合则在流水线的出口动手:\(V_l\) 已经被 LLM 处理过、即将交给动作专家,此时把 \(G\) 与 \(V_l\) 融合成 \(\text{fuse}(V_l, G)\) 替代原 token,目的是在动作专家看到之前给 VLM 的输出"补几何"。第三条路线空间强制根本不改架构,只在训练时额外加一项对齐损失,用余弦相似度把 LLM 内部 token 拉向 GFM token,让 VLM 在微调过程中自己把几何信息留在内部表征里。三者在训练监督、传感器输入、动作专家上完全一致,差异被压到只剩"几何在哪一步进入",这是本文能给出可比结论的前提;作者也明确说明,早融合与晚融合当时没有开源实现,是他们自己在 GR00T-N1.5 上写的原型,而空间强制虽有开源代码但基于 OpenVLA 与 π0,也被移植到 GR00T 上以对齐比较条件。
3. 带门控的交叉注意力融合:让几何 token 不至于把预训练好的动作专家冲垮
早融合与晚融合共用同一个融合模块 \(\text{fuse}(\cdot,\cdot)\),其难点不在注意力本身,而在于整个下游架构是在没有几何 token 的情况下预训练好的,几何 token 一旦"硬塞"进去,动作专家就来不及适应。具体做法是先分别从 VLA token \(X\)(早融合时 \(X=V_e\),晚融合时 \(X=V_l\))与几何 token \(G\) 投影出查询、键、值,做标准交叉注意力并投影回 VLA 的特征维度,从而保证融合后的 token 尺寸与原来完全一致、不破坏下游接口;随后用一个可学习的注意力门 \(A\) 对交叉注意力的输出逐元素加权,再把它当作残差修正项加回原 token:
(该式按正文描述整理,⚠️ 符号细节以原文为准。)门 \(A\) 被初始化到接近零,意味着训练初期模型几乎就是原来的 VLA,几何信息随训练逐步"渗"进来。作者把这一点视为该策略奏效的关键:消融显示,不加注意力门时这个策略基本失效,而早融合尤其依赖它。此外,投影矩阵 \(W_Q, W_K, W_V, W_O\) 都用 LoRA 低秩层参数化,并给 VLA token 与 GFM token 都加上位置编码以保留对应的空间排布。
4. 受控实验与统计显著性:把"随机波动"从"真实提升"里挑出来
动作专家的扩散采样本身带随机性,即使固定场景生成的种子,同一模型不同次评测的成功率也会波动,因此"某个几何 VLA 比基线高 2 个点"未必意味着什么。本文的应对是三点:固定随机种子与扩散 transformer 的噪声生成、不为性能调种子;每个模型都在 1、5、10、15、18、20、25、30、40、50、60、70、80、90、100 这些 checkpoint 上评测并取最优成功率,避免"某次采样恰好踩中"的偏差;最后用双侧 McNemar 检验给出每个对比的 p 值,并把 p 值 \(\ge 0.05\) 的差异判定为不显著。表 2 "Average" 列的 p 值不是各行 p 值的平均,而是按全部任务的成功次数重新计算的。正是这套设计让本文给出了一个反直觉结论:任务级微调后三个几何 VLA 在平均成功率上都不显著优于 GR00T 基线。
损失函数 / 训练策略¶
三类模型的训练配置被刻意拉平。GR00T-N1.5 基线按标准协议只训练动作专家(从预训练权重出发);早融合与晚融合训练融合模块加动作专家,其余全部冻结;空间强制把对齐损失加在 GR00T LLM 第 9 层(共 13 层),并且只微调视觉编码器与 LLM 之间的线性投影——作者也尝试过在空间强制里微调 LLM,结果更差(见补充材料)。探针实验则完全相反:待测网络保持原始预训练权重全冻结,只训练探针 MLP。所有模型在 RoboCasa 每个任务上用约 300 条演示做任务级微调,训练 100 个 epoch,硬件是 320 GB 显存的 A100 集群,微调耗时 2–3 天;5.3 节的 mid-training 先在整个 RoboCasa(8 个任务)上继续训练再任务级微调,耗时约 1 周。
实验关键数据¶
主实验¶
评测覆盖两个仿真基准与一个真机基准。RoboCasa 取 8 个 pick-and-place 任务,每个任务 5 个 episode(对应不同厨房场景与不同待抓物体),每个 episode 重复 15 次并随机化场景外观,共 600 次操作实验,使用左、右、腕三路相机;LIBERO 含 LIBERO-SPATIAL / OBJECT / GOAL / 100 四个套件,每任务 500 次试验;真机用 Unitree G1 人形机器人,针对瓶、球、盒三类物体做 90 次测试,随机化物体位置、朝向与同类中的具体实例。
| 方法 | CabToCtr | CtrToCab | CtrToMicrowave | CtrToSink | CtrToStove | MicrowaveToCtr | SinkToCtr | StoveToCtr | 平均 |
|---|---|---|---|---|---|---|---|---|---|
| GR00T-N1.5(基线) | 42.7 | 74.7 | 73.3 | 93.3 | 77.3 | 58.7 | 65.3 | 88.0 | 71.7 |
| Early Fusion | 32.0 (p=0.186) | 69.3 (p=0.289) | 65.3 (p=0.377) | 88.0 (p=0.388) | 73.3 (p=0.664) | 62.7 (p=0.742) | 80.0 (p=0.019) | 86.7 (p=1.000) | 69.7 (p=0.399) |
| Late Fusion | 46.7 (p=0.710) | 72.0 (p=0.625) | 74.7 (p=1.000) | 85.3 (p=0.146) | 69.3 (p=0.307) | 69.3 (p=0.115) | 69.3 (p=0.689) | 81.3 (p=0.267) | 71.0 (p=0.806) |
| Spatial Forcing | 29.3 (p=0.123) | 68.0 (p=0.227) | 66.7 (p=0.499) | 76.0 (p<0.001) | 72.0 (p=0.454) | 60.0 (p=1.000) | 84.0 (p=0.007) | 90.7 (p=0.804) | 68.3 (p=0.154) |
| Early Fusion(mid-trained) | 52.0 (p=0.281) | 72.0 (p=0.727) | 69.3 (p=0.700) | 94.7 (p=1.000) | 80.0 (p=0.815) | 68.0 (p=0.189) | 81.3 (p=0.023) | 84.0 (p=0.607) | 75.2 (p=0.104) |
表内 p 值均相对 GR00T-N1.5 基线、由双侧 McNemar 检验给出。作为参照,表中未列出的文献方法在 RoboCasa 上的平均成功率明显更低(π0 33.8、π0-Fast 48.3、Video Policy 47.3、RS-CL 59.0),说明本文花大力气复现的 GR00T-N1.5 基线本身已经远强于早期方法。
| 方法 | Approach | Grasp | Lift | Placement | Overall |
|---|---|---|---|---|---|
| GR00T-N1.5 | 57.78 | 51.92 | 85.19 | 86.96 | 22.22 |
| Early Fusion | 84.44 (p<0.001) | 60.53 (p=0.824) | 89.13 (p=1.000) | 65.85 (p=0.180) | 27.78 (p=0.511) |
| Late Fusion | 57.78 (p=0.855) | 59.62 (p=1.000) | 93.55 (p=1.000) | 79.31 (p=0.625) | 25.56 (p=0.710) |
Unitree G1 真机结果按抓取阶段拆分:Approach 表示成功接近并触到目标物,Grasp 表示成功抓稳,Lift 表示正确举离桌面,Placement 表示正确放回桌面,四个阶段都成功才算整条 episode 成功。
消融实验¶
第一组消融是线性探针,用来量每一层的几何信息存量(VGGT 一行是"上限"参照):
| 探针接入位置 | RMSE [m] (↓) | δ1 (↑) |
|---|---|---|
| GR00T 视觉编码器输出 | 0.92 | 0.51 |
| GR00T VLM 输出 | 0.73 | 0.63 |
| VGGT backbone | 0.41 | 0.89 |
| Early Fusion(VLM 输出) | 0.44 | 0.88 |
| Late Fusion(VLM 输出) | 0.45 | 0.87 |
第二组消融把相机数量降到单路(只用左相机),检验"VLA 肉眼可见的多视角几何"是否才是它撑住成功率的原因:
| 配置 | 平均成功率 | 与单相机基线的 p 值 |
|---|---|---|
| GR00T-N1.5(单相机,无 mid-training) | 17.2 | — |
| Early Fusion(单相机,无 mid-training) | 21.5 | p=0.030 |
第三项分析把 VGGT 的重建质量与成功率挂钩:对 8 个任务 × 5 个 episode 的每一组,统计该 episode 内所有图像、所有相机上 VGGT 的平均深度 RMSE,再与成功率求 Spearman 相关系数,得到 \(\rho = -0.202\)。
关键发现¶
- 几何 VLA 在任务级微调下没有换来统计显著的成功率提升。三路注入在 RoboCasa 上的平均成功率分别是 69.7 / 71.0 / 68.3,全部低于基线的 71.7,但 p 值分别为 0.399 / 0.806 / 0.154,差异都不显著;作者据此判断这些波动更可能来自动作专家的随机性。⚠️ 注意正文在讨论该表时写作"69.7% 对基线 71.2%",与表 2 中基线的 71.7 不一致,此处以表格数值为准。
- 真机上几何信息的作用更明显、也更局部。Early Fusion 把 Approach 阶段成功率从 57.78% 提到 84.44%(p<0.001,全文唯一一个强显著的提升),整体成功率 27.78% 对基线 22.22% 但不显著(p=0.511);Grasp 与 Lift 也略有改善,Placement 反而下降。作者推测原因在于 VLM(尤其其中的 LLM)对新信息的可塑性更强,而动作专家相对"僵硬"、不擅长利用新增的数据源——这与探针实验里观察到的可塑性一致。实操中 Early Fusion 能稳定抓住小球、小盒子这类基线很难处理的小物体,Late Fusion 的收益则温和得多。
- 把训练数据放大,几何的价值才显出来。在完整 RoboCasa(8 个任务)上先做 mid-training 再任务级微调,Early Fusion 平均成功率升到 75.2,反超基线 71.7(p=0.104),单任务上 SinkToCtr 达到 81.3(p=0.023);补充材料进一步证明,在同样 mid-training 的条件下 Early Fusion 仍优于 GR00T,排除了"提升只是来自 mid-training 本身的信息泄漏"。这一点很关键:放大训练不需要额外数据采集,因而是一条现实可行的路线。
- 传感器越少,几何模型越值钱。降到单相机后所有模型成功率都大幅下滑(17.2%),印证多视角输入对抓取至关重要;但 Early Fusion 相对基线的优势反而扩大(21.5% vs 17.2%)并且首次变得显著(p=0.030),说明在 VLA 自己无法从多视角三角化出几何的场景里,GFM 提供的是不可替代的补充。
- 探针给出了鸿沟的定量证据,并定位了信息丢失的位置。VGGT 特征的深度 RMSE 为 0.41,GR00T VLM 输出为 0.73(几乎翻倍),而视觉编码器输出就已经是 0.92——几何信息在进入 LLM 之前就丢掉了,LLM 并没有"弄丢"它。有意思的是,注入几何后探针读数几乎追平 VGGT 本身(早融合 0.44、晚融合 0.45),也就是说早融合在 LLM 完全冻结的条件下也能把稠密深度预测能力带出来,这一点并不平凡。
- VGGT 重建质量与成功率之间存在弱负相关(\(\rho=-0.202\),RMSE 越低成功率越高)。相关不强,说明成功率更多由任务复杂度等其它因素主导,但趋势提示:在目标场景上继续微调 VGGT,可能是给几何 VLA 再挤一点性能的可行方向。
亮点与洞察¶
- 用探针把"几何鸿沟"变成标量:与其争论 VLA 懂不懂几何,不如冻结网络、接一个 MLP 去做稠密深度预测,直接读出每一层还剩多少几何信息。这把一个模糊的定性判断转化为可复现的测量,且顺带定位了信息丢失发生在视觉编码器之后,为"该在哪一层注入"提供了依据。
- 注意力门 + 近零初始化是这条路线的隐藏前提:早融合与晚融合在结构上都很朴素,真正决定成败的是门被初始化到接近零,让几何 token 渐进注入一个本已预训练完毕的架构。作者明确写出这一点在已有文献里没被提及,是踩过坑之后的经验——这类"实现细节即方法"的发现,往往比架构本身更有迁移价值。
- 单相机实验是一个漂亮的反向验证:如果几何 VLA 的增益来自 VGGT 的补充,那么当 VLA 自己失去多视角几何时,增益应当放大——实验正好如此且首次达到显著。用一个"让基线变弱"的设定去证明方法的价值,这个实验设计思路可以迁移到任何"补足某类缺失信息"的研究里。
- 用统计检验对抗 diffusion 策略的随机性:固定种子、多 checkpoint 取最优、双侧 McNemar 检验三件套,把"提升 2 个点"这类噪声结论挡在门外。本文因此敢于给出"三个几何 VLA 都不显著优于基线"这种与流行叙事相反、但更可信的结论,这种严谨性本身值得复制。
局限与展望¶
- 作者承认结论只绑定在 GR00T-N1.5 + VGGT 这一组合上。其它 VLA 与其它 GFM(如 MASt3R、Depth Anything 系列、MapAnything)虽在架构上有相似性,但不能外推;换个基座结论是否成立仍是开放问题。
- 大部分证据来自仿真基准,且部分基准已接近饱和,可提升的空间被压缩;真机只做了 G1 一个平台、三类物体、90 次测试,早期融合在 Approach 上的显著优势目前只是单点证据。
- 设计空间没有被穷尽:空间强制加在第几层、是否存在不依赖交叉注意力的融合方式、门控的其它参数化,都没有做消融,理由是单个训练实验动辄接近一周、成本不允许。
- 一个自洽性上的小瑕疵:正文在总结 RoboCasa 主表时把基线平均写成 71.2%,与表内 71.7 不符;真机表中 Placement 阶段从 86.96 掉到 65.85,作者却用 "slightly worse" 描述,措辞与幅度不匹配。
- 可以继续做的方向:在目标场景上微调 VGGT 后重测成功率(本文只给出相关性证据);把 mid-training 的规模继续放大到跨机器人数据;以及检验其它 GFM 是否带来同样的"单相机增益"。
相关工作与启发¶
- vs 空间强制(Spatial Forcing):它不改架构,只在训练时对齐 LLM 内部 token 与几何特征,工程上最轻;本文把它移植到 GR00T 后发现,在 RoboCasa 上它的平均成功率 68.3 是三条路线中最低的,但个别任务(CtrToSink p<0.001、SinkToCtr p=0.007)出现了显著的变化——方向不一致,说明对齐损失的效果高度依赖所在层与任务。本文的价值在于把这条路线放进了同一张对照表。
- vs 3D VLA(PointVLA、RVT-2、3D-VLA):它们靠 RGB-D 相机或点云直接喂显式几何,优点是几何是"真的"、精度高,代价是需要额外传感器与相应的数据采集;本文关心的 GFM 路线只用 RGB、零额外硬件,因此更适合已有 RGB 数据的大规模训练,缺点是几何质量受 GFM 泛化性限制(\(\rho=-0.202\) 的弱相关正是这种依赖的表现)。
- vs 早融合先驱(Evo-0 等):他们提出了把 GFM token 与视觉 token 融合的思路,但在实现细节上(是否加注意力门、门如何初始化、位置编码怎么加)没有说明;本文复现了这条路线并指出缺了注意力门就会失效,把"架构思路"和"让思路能跑通的实现条件"区分开来——这也是本文相对既有工作最实际的贡献。
评分¶
- 新颖性: ⭐⭐⭐ [不提出新模型,价值在于首次量化几何鸿沟并把三条注入路线放到同一对照下]
- 实验充分度: ⭐⭐⭐⭐⭐ [两个仿真基准 + 真机 G1,覆盖探针、融合策略、数据规模、相机数、重建质量五个维度,且全程带显著性检验]
- 写作质量: ⭐⭐⭐⭐ [问题拆解清楚、结论克制,但个别数值与措辞不自洽(71.2 vs 71.7、Placement 的 "slightly")]
- 价值: ⭐⭐⭐⭐ [给出了一批"增加训练数据比换架构更有用""相机越少几何越值钱"的实用结论,对做几何 VLA 的人有直接的决策参考]