STEP: Spatial Thinking and Egocentric Pointing for Embodied Instruction Following¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/VIPL-VSU/STEP
领域: 多模态VLM / 机器人/具身智能
关键词: 具身指令跟随, 空间思维, 第一人称视觉指向, 鸟瞰语义图, 思维链规划
一句话总结¶
STEP 将全局鸟瞰语义图与第一人称可通行区域视觉标记融合,通过自动化构建的 40 万高质量多模态思维链数据引擎,实现了从“看第一人称视角、用全局地图思考、向路径路标点指向”的可解释中粒度具身规划范式。
研究背景与动机¶
具身指令跟随(Embodied Instruction Following, EIF)要求智能体在复杂的物理环境中,基于自然语言指令协同完成全局导航与细粒度交互操作。随着大语言模型与多模态大模型在零样本推理上的突破,学术界广泛采用 LLM/VLM 作为具身规划中枢。然而,现有的具身智能体范式长期受困于感知与规划两个维度的极端分化,难以在真实物理约束与高级语义理解之间建立可靠纽带。
在感知层面,智能体面临显著的“空间近视(Spatial Myopia)”瓶颈:端到端控制器通常仅依赖局部第一人称视角(Egocentric View),缺乏全局拓扑记忆和场景外不可见区域的空间先验;而高级文本规划器则脱离底层连续感知,仅依赖抽象符号列表。在规划层面,存在严重的“粒度失衡(Granularity Imbalance)”:输出底层原子动作(如 move_ahead、rotate_left)的端到端执行器决策效率极低、步数冗长且缺乏语义可解释性;而仅输出抽象子目标(如 go to the kitchen)的高级规划器又过于模糊,在连续空间中存在巨大的“执行落差(Execution Gap)”,难以对齐到底层运动控制器。
受到认知心理学中托尔曼“认知地图(Cognitive Maps)”理论与人类基于物理锚点规划行为的启发,人类在复杂空间中行动既依赖全局布局表象,又依赖眼前视场中具体落脚点的指向。本文的切入角度是:通过建立多模态融合的全局鸟瞰地图与第一人称视角联合感知,在第一人称可通行地面显式投影离散视觉路标点(Waypoints),由模型先生成显式思维链(CoT)推理再预测目标路标点。核心 idea:提出结合“空间思维”与“第一人称指向”的 STEP 框架,以“看视场、思地图、指目标”为范式,并利用自动化 STEP-CoT 数据引擎对齐全局图、局部视场与动作思维链,填补具身智能在感知与规划上的双重断层。
方法详解¶
整体框架¶
STEP 的整体架构旨在将异构的多模态输入映射为物理可执行、语义可验证的点级动作。系统的输入包含三部分:自然语言任务指令 \(\mathcal{T}\)、动态构建的带标注鸟瞰语义地图(Annotated Semantic Map, ASM)\(\mathcal{G}_t\)、以及带有可通行区域离散视觉路标编号标注的第一人称图像 \(I_t\)。
整个流水线分为感知与规划两大核心环节:感知端首先通过环境滤波生成轻量级语义 BEV 地图,并通过第一人称可通行区域定位为地面打上带有离散数值编号的视觉标记;多模态主干网络(基于 Qwen2.5-VL-7B 构建)通过三编码器与跨模态投影层将三类特征对齐到统一潜空间;决策端模型通过思维链显式推导空间方位与障碍关系,最终输出选定的路标点标号或基础动作指令,底层运动系统则利用快速行进法(Fast Marching Method, FMM)平滑生成连续控制轨迹。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
IN["RGB-D 连续输入 + 任务指令"] --> A["第一人称可通行区域定位<br/>Grounded-SAM 分割与网格投影"]
IN --> B["环境滤波与语义地图抽象<br/>3D 体素投影与目标感知过滤"]
A --> C["三编码器跨模态对齐<br/>视场、地图、指令特征投影"]
B --> C
C --> D["思维链与点级动作生成<br/>CoT 推理轨迹与路标点预测"]
D --> E["底层轨迹求解<br/>FMM 快速行进法生成控制轨迹"]
关键设计¶
1. 第一人称可通行区域定位:解决地面同质化区域的视觉空间锚定
纯视觉语言模型对室内空间中的显著前景物体(如冰箱、台灯)具备极强的零样本定位能力,但在视觉外观极度同质化的空旷地面与地毯区域,难以直接通过像素坐标预测合理的导航落脚点。为此,STEP 引入第一人称可通行区域定位机制,将连续平面的空间选择转化为离散的视觉提示(Visual Prompting)问题。具体而言,系统利用开放词表检测器与 Segment Anything Model(Grounded-SAM)对第一人称视场中的地面类文本提示词(如 ground, carpet)提取二值语义分割掩码 \(\mathcal{M}_{sem}\)。
在此基础上,系统在智能体前方 3D 地面上构建局部规则栅格,并通过相机内参矩阵 \(\mathbf{K}\) 与外参矩阵 \(\mathbf{T}_c\) 将三维网格点投影到二维像素坐标系中,仅保留落在可通行掩码 \(\mathcal{M}_{sem}\) 内部的候选落脚点集合 \(\mathcal{V}_{pts}\): $$ \lambda_i \mathbf{u}i = \mathbf{K}\mathbf{T}_c \mathbf{P}_i, \quad \mathcal{V}} = { \mathbf{ui \mid \mathcal{M}_w } $$ 随后,系统采用 Set-of-Mark(SoM)策略为每一个候选路标点叠加唯一数字编号标签。这一设计巧妙地将复杂的物理空间位姿回归转化为了多模态大模型最擅长的离散视觉标记选择任务,不仅大幅减轻了模型的空间几何负担,而且严格保证了输出动作的物理可通行性。}(\mathbf{P}_i) = 1, \mathbf{P}_i \in \mathcal{P
2. 环境滤波与语义地图抽象:化解全局高维观测的空间近视与认知过载
仅依赖当前视场必然导致智能体在拐角、障碍物遮挡后失去长期空间记忆。STEP 采用环境滤波管线构建持久化的二维语义鸟瞰图。智能体在每个时步将分割后的 RGB-D 语义点云反投影至三维世界坐标,经过体素化后沿高度轴正交投影,形成包含 \(C\) 个物体通道、障碍物及未探索区域的多通道栅格地图 \(M_t\)。然而,未经处理的高维密集栅格若直接输入 VLM,会带来极大的视觉 token 开销与严重的信息冗余。
STEP 设计了目标感知抽象机制:首先利用膨胀核扩大障碍物边界以确保防碰撞安全余量;然后引入目标感知聚合算子,根据当前指令过滤与任务无关的冗余物体类别,优先保留当前任务相关的关键实体;最后借助基于力导向算法的标签排布技术,将物体语义名称清晰渲染到鸟瞰图上,输出轻量级、图文结构清晰的标注语义图(ASM)\(\mathcal{G}_t\)。该表示使大模型能够直接“阅读”地图全局拓扑,在极大扩展感知视野的同时显著压低认知推理开销。
3. 三编码器跨模态对齐:在统一潜在表征下融合视场、地图与指令
为了协同推理第一人称局部视场、全局拓扑地图与自然语言任务,STEP 在 Qwen2.5-VL 骨干架构上构建了三编码器框架。文本指令 \(\mathcal{T}\) 通过语言编码器获得序列嵌入 \(\mathbf{X}_{inst} \in \mathbb{R}^{L \times d}\);局部第一人称画面 \(I_t\) 与语义地图 \(\mathcal{G}_t\) 则分别通过冻结的视觉编码器抽取高阶表征 \(\mathbf{X}_{vis}\) 与 \(\mathbf{X}_{map}\)。
为弥合地图拓扑空间与第一人称透视投影之间的显著表征域隙,STEP 分别引入轻量级模态投影层 \(g_v\) 与 \(g_m\),将视觉与地图特征映射到统一的 \(d\) 维嵌入空间: $$ \mathbf{Z}{vis} = g_v(\mathbf{X}}) \in \mathbb{R}^{V \times d}, \quad \mathbf{Z{map} = g_m(\mathbf{X} $$ 最终输入由模态边界特殊 token 显式拼接构成:}) \in \mathbb{R}^{K \times d\(\mathbf{H}_t = [s_{inst}; \mathbf{X}_{inst}; s_{map}; \mathbf{Z}_{map}; s_{view}; \mathbf{Z}_{vis}]\)。在训练阶段,视觉与地图编码器保持冻结以保留通用的感知能力,仅对 LLM 主干与两个投影层进行全参数微调,促使模型学会在第一人称视场局部线索与全局拓扑之间进行跨视角几何关联。
4. 自动化 STEP-CoT 数据引擎:双流合成驱动的跨模态空间推理对齐
具备点级规划能力的具身多模态模型极度缺乏高质量、配对的空间思维链数据。STEP 提出了具备高度可扩展性的 STEP-CoT 自动化数据引擎,分为两路互补数据流构建了超过 42 万条样本: - Stream A(基于动作接地的推理链标注):在专家轨迹上设定前向回溯窗口 \(\Delta\),选定视场内投影距离最远且可通行的未来位姿作为目标路标点 \(v^*\)。为了消除视角歧义并防止模型产生方向幻觉,管线实施朝向归一化与关键物体过滤;随后利用强大的教师模型(Qwen3-VL-235B-Instruct)生成紧扣任务意图、视场观察与地图方位的显式思维链 \(C_t\)。最后通过双阶段验证(代码级终点逻辑一致性校验与 VLM-as-a-Judge 语义审计)剔除不合格样本,最终沉淀出 22.9 万条高质量长程推理轨迹。 - Stream B(具身基元技能数据合成):为了强化底层空间认知,引擎进一步将导航能力解耦为四项基础技能——相对地图的朝向估计(Pose Estimation, 4.5 万条)、目标实体相对方位预测(Relative Direction, 1.8 万条)、场景实体枚举(Semantic Perception, 0.9 万条)、以及局部拓扑推断(Topological Reasoning, 7.2 万条),同时补充任务分解数据(4.5 万条)。基元任务的引入赋予了模型稳固的跨模态几何推理内功,彻底解决了纯端到端微调容易陷入局部捷径学习的问题。
实验关键数据¶
主实验¶
在具身长程交互最具挑战性的 ALFRED 基准上,STEP-7B 在验证集(Val Seen 与 Val Unseen)上全面对比了专用强化学习/监督专家模型(Specialists)与基于大语言模型的通用具身规划方案(Generalists)。
| 方法 | 训练范式 | Val Seen SR (%) ↑ | Val Seen GC (%) ↑ | Val Unseen SR (%) ↑ | Val Unseen GC (%) ↑ | \(\Delta\text{SR}\) (%) ↓ |
|---|---|---|---|---|---|---|
| E.T. | 从头训练 (Specialist) | 46.59 | 52.92 | 7.32 | 20.87 | 39.27 |
| FILM | 模块化 (Specialist) | 24.63 | 37.20 | 20.10 | 32.45 | 4.53 |
| LEBP | 模块化 (Specialist) | 27.63 | 35.76 | 22.36 | 29.58 | 5.27 |
| SayCan | Few-shot (Generalist) | 12.30 | 24.52 | 9.88 | 22.54 | 2.42 |
| LLM-P (GPT) | Few-shot (Generalist) | 16.45 | 30.11 | 15.36 | 29.88 | 1.09 |
| R2C-Mistral-7B | 微调 (Generalist) | 22.31 | 32.40 | 22.35 | 31.97 | 0.04 |
| Qwen2.5-VL-7B (Base) | 零样本 (Generalist) | 9.96 | 18.59 | 7.87 | 18.26 | 2.09 |
| Qwen3-VL-32B | 零样本 (Generalist) | 15.20 | 26.69 | 11.76 | 24.54 | 3.44 |
| GPT-4o | 零样本 (Generalist) | 16.00 | 27.13 | 16.00 | 25.00 | 0.00 |
| GPT-5.4 | 零样本 (Generalist) | 18.00 | 28.68 | 16.00 | 25.38 | 2.00 |
| STEP-7B (本文) | 全参数微调 (Generalist) | 30.28 | 39.69 | 26.77 | 39.36 | 3.51 |
注:SR 为任务成功率,GC 为目标条件达成率,\(\Delta\text{SR}\) 为 Seen 与 Unseen 环境间的泛化下降幅度。
在零样本跨任务迁移实验中,未经 AI2-THOR 导航数据微调的 STEP-7B 在 ObjectNav 任务上取得了大幅超越现有模型的优异性能:
| 方法 | 厨房 SR / SPL (%) | 起居室 SR / SPL (%) | 卧室 SR / SPL (%) | 浴室 SR / SPL (%) | 全局平均 SR / SPL (%) |
|---|---|---|---|---|---|
| Random | 10.40 / 4.80 | 11.47 / 3.40 | 13.07 / 8.20 | 21.60 / 11.13 | 14.13 / 6.88 |
| SAVN | 43.60 / 17.80 | 21.60 / 7.71 | 29.20 / 8.65 | 69.60 / 28.49 | 40.86 / 16.15 |
| S2P | 45.50 / 31.05 | 28.50 / 19.00 | 50.40 / 25.29 | 60.25 / 36.70 | 46.16 / 28.01 |
| R2C | 45.00 / 27.10 | 46.00 / 26.27 | 33.00 / 17.31 | 85.00 / 47.38 | 52.25 / 29.52 |
| STEP-7B (本文) | 50.00 / 34.38 | 56.00 / 34.87 | 55.00 / 33.41 | 82.00 / 52.43 | 60.75 / 38.77 |
消融实验¶
在 ALFRED 验证集上逐步叠加核心模块的递进消融实验结果如下:
| 配置 | Val Seen SR (%) | Val Seen GC (%) | Val Unseen SR (%) | Val Unseen GC (%) | 增益与机制说明 |
|---|---|---|---|---|---|
| Qwen2.5-VL-7B (基座) | 9.96 | 18.59 | 7.87 | 18.26 | 初始零样本能力较差,缺乏具身底层控制先验 |
| + 第一人称动作微调 (RGB) | 12.75 | 23.44 | 13.92 | 22.38 | 纯图像到动作映射初步建立物理动作空间对应 |
| + 视觉标记 (Marker) | 19.68 | 30.66 | 18.43 | 30.61 | 带来 +6.93% / +4.51% SR 激增,验证点级提示对空间接地的决定性作用 |
| + 地图模态 (Map) | 21.12 | 31.25 | 19.22 | 29.85 | 引入全局拓扑感知,但仅凭模态拼接增幅有限,缺乏跨视角对齐逻辑 |
| + 思维链标注 (+CoT) | 28.40 | 40.35 | 23.72 | 33.33 | 迎来最大跨度跃升(Unseen SR +4.50%, GC +3.48%),显式 CoT 真正激活了图文空间对齐 |
| + 基元技能 (+Primitive / 完整模型) | 30.28 | 39.69 | 26.77 | 39.36 | 显式解耦拓扑方位与朝向估计,Unseen SR 进一步提升至 26.77% |
| 真值分割 (Oracle Seg.) | 38.55 | 46.76 | 41.57 | 50.45 | 排除建图与感知噪声后性能上限 |
| 真值目标分解 (Oracle Goal) | 45.20 | 52.50 | 55.69 | 61.52 | 消除指令歧义后的理想具身决策能力 |
关键发现¶
- 思维链数据引擎是跨视角协同的核心杠杆:消融表明,仅向模型提供地图图像(+Map)仅能带来小幅提升(Seen SR 仅增 1.44%);唯有注入 STEP-CoT 合成的长链思考后(+CoT),Seen/Unseen 成功率立即飙升 7.28% 和 4.50%。这证明 MLLM 无法天然自发实现 BEV 地图坐标到第一人称透视坐标的映射,必须由结构化的推理链驱动跨视角对齐。
- 路标点级别规划显著削减长程决策延迟:在计算效率分析中,相比输出原子动作的方案每轮需交互上百次,以及 R2C 产生极长文本输出(~1.5k tokens),STEP-7B 的单步推理延迟仅 0.978 秒,且平均每个任务仅需 23 次高层决策调用,有效平衡了长程规划的效率与实时性。
- 强大的未见场景泛化稳定性:专业模型(如 E.T.)虽然在训练见过的场景中表现惊艳(Seen SR 46.59%),但在未见场景骤降至 7.32%(掉点 39.27%)。STEP-7B 将泛化差距压制在 3.51%,证实基于全局地图与显式推理的马尔可夫决策范式能够有效防止场景记忆过拟合。
亮点与洞察¶
- 将连续地面导航转化为可通行的 SoM 离散分类:利用 Grounded-SAM 提取安全可通行地面并投影编号标记,巧妙避开了传统具身智能中回归连续位姿的累积误差与物理悬空违背,利用 VLM 原生分类能力实现了精准接地。
- 认知地图与第一人称视角的解耦与交融:“看视场、思地图、指目标”的设计范式完美契合具身智能的认知层次。全局地图负责提供长程拓扑与全局目标定位,第一人称负责感知当前视场障碍与细粒度物体状态,两者互补破解了空间近视与信息过载的二律背反。
- 双流数据合成体系的可迁移性:STEP-CoT 提出将具身智能拆分为高层动作接地推理(Stream A)与朝向、拓扑、相对方位等基元技能(Stream B),这一机制可直接迁移至机器人移动操作、无人机巡检等需要跨视点协同推理的具身场景。
局限与展望¶
- 拥挤环境下的地图构建退化:作者指出,在极度杂乱、物体密集堆叠摆放的场景中,现有的 2D 语义正交投影会产生严重的“多对一”遮挡重叠,导致生成的语义标注地图质量下降。
- 高质量思维链合成高度依赖昂贵的大规模前沿模型:STEP-CoT 的推理链蒸馏依赖 Qwen3-VL-235B 或 GPT-4 系列等超大参数量模型,数据生成与双阶段清洗的计算与 API 成本较为昂贵。
- 未来方向:作者计划探索针对复杂 3D 拓扑更具表征能力的地图形式,并探索基于强化学习(RL)的后训练自演进范式,以降低对昂贵蒸馏 CoT 数据的依赖,进一步增强具身智能体的自主演化能力。
相关工作与启发¶
- vs 端到端动作执行器 (如 RT-2, NaVid):RT-2 等方法直接将图像序列映射为低级控制 token,决策缺乏透明度且长程交互步数过多;STEP 引入中粒度的点级规划,每个路标点可跨越数个物理步长,既大幅降低推断调用频率,又保留了每一步决定的完整可解释推理链。
- vs 纯文本高级规划器 (如 SayCan, LLM-Planner):SayCan 等仅将场景抽象为离散 API 或文本列表,缺乏精细的连续几何空间感知,易在不可见区域盲目试错;STEP 通过自建鸟瞰语义图与第一人称标记,实现了视觉与几何层面的双重空间落地。
- vs 语义地图导航方法 (如 MapNav, VLFM):此前语义地图方法直接将地图送入模型或使用固定启发式价值函数,缺乏地图与第一人称透视画面之间的深层交互;STEP 通过多模态三编码器与基元技能微调,打通了“全局地图 ↔ 局部视场”的双向映射。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次系统化构建图图混合输入、第一人称路标点提示与空间思维链相结合的具身规划新范式]
- 实验充分度: ⭐⭐⭐⭐⭐ [在 ALFRED、AI2-THOR 上展开系统对比与细致消融,并成功部署于真实 LoCoBot 轮式机器人]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑架构清晰严密,形式化定义精炼完整,图表制作精美且富有洞察力]
- 价值: ⭐⭐⭐⭐⭐ [为多模态大模型切入复杂具身控制提供了兼顾计算效率与空间几何接地的极佳参考基准]