Stand Up and Move: Benchmarking Interactive Spatial Intelligence in WalkerBench¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/lalayang123456-ctrl/WalkerBench
领域: 机器人/具身智能
关键词: 具身交互空间智能, 空间基准测试, 显式拓扑记忆, 顺行性空间遗忘症, 人形机器人实机导航
一句话总结¶
针对静态“旁观者视角”基准无法测验主动视差消除几何歧义的问题,本文提出覆盖全球 161 城的交互式空间智能基准 WalkerBench,揭示 VLM 一维线性上下文与 3D 拓扑之间的表征错位,并提出通过显式拓扑记忆与感知-推理认知解耦的免训练脚手架 Spatial-IDE,在基准与宇树人形机器人实机上实现大幅提升。
研究背景与动机¶
空间智能的最终前沿在于物理世界中的具身交互,这要求智能体从对静态冻结图像的语义模式识别,转向与动态三维环境的主动交互。然而,现有的空间智能基准测试绝大多数采用了“旁观者视角”(Spectator View),要么基于单张静态图像评估几何属性,要么依赖预录制的无交互视频流。在单张第一人称静态视点下,几何感知存在天然的退化与尺度歧义——例如 VLM 依赖不可靠的语义先验容易产生严重幻觉(将 500m 外的物体误估为 300m),而人类或具身智能体只需主动横向移动几米,即可利用几何视差(parallax)精确锚定距离。现有基准剥夺了智能体主动探索与通过位移消除不确定性的能力,评估的仅是静态视觉常识,而非真正的交互式空间智能。
另一方面,现有具身导航(VLN)基准大多受限于合成室内环境或极少数手工标注的室外城市,缺乏全球尺度的真实环境多样性。当将前沿多模态大模型(VLMs)直接部署于开阔复杂城市场景时,模型性能发生了剧烈崩塌:人类基线可达 69.43%,而最强商用模型在多轮交互下仅有 24.49%,且性能随探索步数增加呈断崖式下跌。本文将这种随步数累积而丧失全局空间一致性的现象诊断为“顺行性空间遗忘症”(Anterograde Spatial Amnesia)。
其核心矛盾在于表征错位(Representation Mismatch):自回归 VLM 的一维线性 Token 上下文结构,在本质上与三维非欧几里得拓扑环境不相容。随着交互轮次增加,线性历史同时混杂了即时感知、长期记忆与路径规划三种认知负载,导致关键地标信息被海量历史描述稀释,产生不可逆的空间遗忘。针对这一矛盾,核心 idea:打破线性上下文累积,提出免训练认知脚手架 Spatial-IDE,将隐式历史外化为程序级显式拓扑记忆图(ETM),并将单步推理分解为目标导向感知与纯拓扑空间决策两个无状态调用,并在全球 161 城基准 WalkerBench 与物理人形机器人上验证其有效性。
方法详解¶
整体框架¶
Spatial-IDE 的核心原则是“打破线性上下文”,彻底摆脱多轮对话中未剪裁的历史图像与文本堆叠。整个架构由三大支柱协同构成:目标导向感知模块(Perception Core)、程序级显式拓扑记忆(ETM)、以及纯决策的高级空间推理引擎(Reasoning Core)。在每一个决策步 \(t\),智能体执行两次单轮无状态 VLM 调用,且两次调用均由 ETM 介导:首先,感知模块接收当前图像与上一轮生成的精确提问,提取极简的局部事实语义摘要;接着,更新后的 ETM 被序列化为紧凑的固定长度状态快照(包含当前坐标、路径与拓扑可通行边),输入推理引擎完成动作选择与下一轮感知提问。推理引擎在需要精细多视角几何推理时,还可根据 ETM 的几何位姿记录,精准调取历史最互补的单帧图像,杜绝无节制的上下文通胀。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["当前视点全景图像与环境观测"] --> B["目标导向视觉感知<br/>按先前提问提取极简语义事实"]
B --> C["显式拓扑记忆更新<br/>维护度量拓扑图与语义节点标注"]
C --> D["空间推理引擎决策<br/>固定长度记忆快照驱动动作与生成新提问"]
D -->|动作执行| E["环境动作执行与人形机器人位姿转移"]
D -.->|按需几何检索| C
关键设计¶
1. 目标导向视觉感知:将开放式场景转为定向事实提取 传统视觉导航智能体通常要求 VLM 在每一步进行全局开放式场景描述,这不仅产生了冗余的自然语言叙述,而且极易引入无关干扰物,将有限的注意力预算耗散在与导航目标无关的背景细节中。目标导向视觉感知模块(Goal-Directed Perception, GDP)采用“定向盘问”替代泛化描述:该模块接收上一轮空间决策引擎生成的精确问题(例如“前方视线右侧是否有药房标志,相对朝向是多少?”),仅对当前单张图像进行针对性解析。感知核心输出严格限制在极短的事实命题(Semantic Note,不超过 25 个词),过滤掉所有主观臆测与描述性废话。该调用完全无状态,每一步的 Token 消耗和计算代价严格恒定,从感知端切断了注意力漂移。
2. 显式拓扑记忆更新:非自回归的程序级三维图存储
为彻底解决 1D 上下文无法表征 3D 拓扑导致的顺行性空间遗忘,本文在模型外部构建了显式拓扑记忆(Explicit Topological Memory, ETM)。ETM 是一个独立的动态拓扑图结构 \(\mathcal{G}_t = (\mathcal{V}_t, \mathcal{E}_t)\),而非大语言模型的上下文缓存。其中每个节点 \(v \in \mathcal{V}_t\) 严格记录物理坐标(米级整数)、相机航向角与俯仰角,并挂载由感知模块生成的局部语义命题列表;每条边 \(e \in \mathcal{E}_t\) 则编码物理位移矢量与相对方位。由于 ETM 在 Python 程序级存储和运算,节点的坐标与连通性绝不会随交互步数增加而发生注意力退化、幻觉漂移或信息衰减。在决策前,ETM 投影为包含当前位置 [POSITION]、历史路径 [PATH]、紧凑日志 [OBSERVATION LOG] 和可选动作 [AVAILABLE MOVES] 的固定 Token 模板,保证空间推理输入信号的质量不受探索长度影响。
3. 空间推理引擎决策:认知解耦驱动的高层规划与按需视差检索 空间推理引擎在每一步只接收当前视点图像与序列化后的 ETM 结构快照,完全不加载冗长的历史对话记录。它将原本纠缠在一起的低级视觉测量与高级路径规划彻底解耦,使大模型能够专注于纯粹的图搜索与拓扑决策。此外,针对距离估计或视角三角测量等精细度量任务,推理引擎支持“按需多视点几何检索”:当单帧几何欠定需验证时,引擎从 ETM 的坐标与朝向记录中计算基线距离与夹角,直接定向检索几何互补性最强的历史视点帧,以最小的计算代价实现精细双目/多视点视差推理。
实验关键数据¶
主实验¶
WalkerBench 评估涵盖 Tier-I 粗粒度空间任务(路径导航 Nav 与视觉定位 Vis)以及 Tier-II 细粒度度量任务(建筑物高度 Height、距离 Dis 与相对朝向 Angle),采用各子任务准确率(%)及全任务宏平均 Total 进行评估。实验评估了 9 个代表性商业与开源模型在原始多轮对话(Original)和接入 Spatial-IDE 框架下的表现,并以 5 名人类标注者的平均水平作为参考上限。
| 评估模型 | 评测设置 | 导航 (Nav) | 视觉定位 (Vis) | 建筑高度 (Height) | 距离估计 (Dis) | 相对朝向 (Angle) | 总分 (Total) | 相对提升 |
|---|---|---|---|---|---|---|---|---|
| Claude-Opus-4.6 | Original | 52.86 | 18.57 | 14.0 | 9.0 | 18.0 | 24.49 | — |
| Claude-Opus-4.6 | w/ Spatial-IDE | 68.29 | 38.57 | 35.0 | 38.0 | 36.0 | 43.17 | +76.28% |
| Kimi-K2.5 | Original | 54.86 | 9.71 | 17.0 | 12.0 | 15.0 | 21.71 | — |
| Kimi-K2.5 | w/ Spatial-IDE | 69.14 | 28.57 | 37.0 | 31.0 | 33.0 | 39.74 | +83.05% |
| Gemini-3-Pro | Original | 50.86 | 10.29 | 12.0 | 16.0 | 11.0 | 20.03 | — |
| Gemini-3-Pro | w/ Spatial-IDE | 65.43 | 29.14 | 33.0 | 35.0 | 28.0 | 38.11 | +90.26% |
| GPT-5-chat-latest | Original | 20.00 | 10.86 | 16.0 | 19.0 | 20.0 | 17.17 | — |
| GPT-5-chat-latest | w/ Spatial-IDE | 45.14 | 29.71 | 37.0 | 38.0 | 39.0 | 37.77 | +119.98% |
| Qwen3-VL-235B | Original | 16.00 | 10.86 | 46.0 | 1.0 | 13.0 | 17.37 | — |
| Qwen3-VL-235B | w/ Spatial-IDE | 40.57 | 30.00 | 58.0 | 20.0 | 31.0 | 35.91 | +106.74% |
| Qwen3-VL-8B | Original | 10.29 | 10.00 | 39.0 | 6.0 | 8.0 | 14.66 | — |
| Qwen3-VL-8B | w/ Spatial-IDE | 32.29 | 28.57 | 52.0 | 23.0 | 25.0 | 32.17 | +119.44% |
| GLM-4.6V | Original | 29.14 | 11.43 | 1.0 | 13.0 | 12.0 | 13.31 | — |
| GLM-4.6V | w/ Spatial-IDE | 46.57 | 30.29 | 21.0 | 31.0 | 30.0 | 31.77 | +138.69% |
| 全模型平均 | Original | 34.67 | 11.43 | 18.33 | 12.33 | 13.00 | 18.17 | — |
| 全模型平均 | w/ Spatial-IDE | 52.92 | 30.41 | 37.11 | 32.11 | 30.78 | 36.66 | +104.97% |
| Human (参考基准) | Baseline | 78.29 | 68.86 | 73.0 | 66.0 | 61.0 | 69.43 | — |
消融实验¶
为定量剥离 ETM 与 GDP 两大核心机制的相对贡献,论文在全量 WalkerBench 上对全部 9 种模型进行了系统消融实验,结果汇报为 9 种模型的平均表现。
| 实验配置 | 导航 (Nav) | 视觉定位 (Vis) | 高度 (Height) | 距离 (Dis) | 角度 (Angle) | 全局总分 (Total) | 相对基线绝对提升 (\(\Delta\)) |
|---|---|---|---|---|---|---|---|
| Original (基线) | 34.67 | 11.43 | 18.33 | 12.33 | 13.00 | 18.17 | — |
| + 仅显式拓扑记忆 (ETM only) | 47.14 | 21.00 | 25.00 | 23.00 | 23.00 | 27.83 | +9.66 |
| + 仅目标导向感知 (GDP only) | 39.00 | 26.57 | 33.00 | 26.57 | 25.57 | 30.14 | +11.97 |
| + 完整框架 (ETM + GDP) | 52.92 | 30.41 | 37.11 | 32.11 | 30.78 | 36.66 | +18.49 |
关键发现¶
- 模块分工明确且高度互补:ETM 显著释放了长程导航能力(Nav 提升 12.47 个百分点),因为导航本质上是拓扑一致性与记忆管理问题;而 GDP 则对视觉定位(Vis 提升 15.14 个百分点)和度量估计任务(Height/Dis/Angle 均提升超 12 个百分点)起决定性作用,有效削减了杂乱场景对细粒度视觉线索的注意干扰。两者结合的总提升(+18.49)超过了简单相加的线性预测,显示出明显的协同增益。
- 表征错位是普遍的架构级缺陷:无论模型规模如何(Qwen3-VL 8B 与 235B 分别提升 +119.44% 与 +106.74%),均受困于线性上下文的记忆稀释。即便是参数量较小的 8B 模型,在赋予外置显式拓扑记忆与感知解耦后,其总分(32.17%)也能反超原始设置下的顶级专有模型(Opus 24.49%、GPT-5 17.17%)。
- 实机零样本迁移成功:部署于宇树(Unitree)G1 人形机器人后,高层推理引擎直接接收板载 RGB 视点与 VLM 可行域候选点,无需针对实机做任何微调,即在砖石铺地、斑马线、红绿灯十字路口等长跨度多街区场景下完成了全自主路口导航。
亮点与洞察¶
- 从“旁观者”走向“主动交互”的范式跃迁:指出当前空间智能基准普遍依赖静态图片或预录视频的致命缺陷,通过在 161 个全球城市街景拓扑中引入主动位移与几何视差,将评测重点转移到具身主动消除歧义上。
- 对 VLM 顺行性空间遗忘的精准病理学诊断:深刻剖析了 1D 自回归序列与 3D 非欧几何环境的不相容性,用简单外置结构化图记忆(ETM)彻底阻断长交互下的注意力漂移。
- 完全免训练的即插即用认知脚手架:无需改动底层大模型权重,通过提示词解耦与外部数据结构建模,在带来性能翻倍(平均 +104.97%)的同时大幅缩减每步上下文开销,兼具极高的学术解释力与工程落地价值。
局限与展望¶
- 作者承认的局限:实机部署依赖官方运动控制抽象层与前端 VLM 可行域检测器,动态障碍物(如行人和突发车辆)的主动规避策略仍相对初步;此外,虽然模型总分翻倍,但与人类 69.43% 的水平相比仍有 26 个百分点的显著差距(尤其是细粒度跨视角匹配 Vis 任务)。
- 潜在改进方向:可进一步将可变形 3D 高斯泼溅(3DGS)或轻量神经辐射场(NeRF)无缝集成进 ETM 节点中,使智能体不仅具备拓扑图记忆,还能在脑海中自主渲染任意视角的连续几何,从而进一步拔高精细度量与空间推理上限。
相关工作与启发¶
- vs 静态空间基准 (Spatial-Bench, SpatialRGPT, VSR):先前工作局限于单图或离线视频分析,智能体无法改变视点;WalkerBench 则构建了全球 161 城的开放交互图,强制智能体通过主动运动消除尺度与距离歧义。
- vs 传统室内 VLN (R2R, RxR, Habitat):室内环境大多局限于几百至上千栋住宅或合成网格,且依赖深度或手工轨迹标注;WalkerBench 纯利用街景拓扑与客观地理 API 自动构建,不提供特权深度或 GPS,逼近真实人类行人的感知约束。
- vs 经典长上下文/智能体记忆 (ReAct, Swe-agent):常规智能体将历史简单堆砌在对话提示中;Spatial-IDE 证明在复杂三维具身任务中,必须将隐式记忆剥离成显式几何拓扑图,才能彻底根除注意力稀释。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统性揭示 VLM 的顺行性空间遗忘症,构建了全球真实城市场景的主动交互式空间基准与外置拓扑解耦架构。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 9 大主流开源与闭源前沿模型、消融实验细致完整,且完成了真实物理人形机器人的街区实机部署。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑论证极其清晰,直击自回归模型空间推理的核心病灶,图表表达专业准确。
- 价值: ⭐⭐⭐⭐⭐ 为具身智能、空间智能评测以及人形机器人城市导航落地提供了重要的基准与可泛化的方法论参考。