跳转至

LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/xxx
领域: 机器人/具身智能
关键词: 视觉语言导航 (VLN)、隐式视觉推理、世界模型、特权学习、具身智能

一句话总结

LatentPilot 提出将未来视觉动力学内化至 VLM 决策骨干网络中,利用离线轨迹中的未来帧作为两步特权监督来学习单步传递的 Pilot Token,在推理时无需外置世界模型即可因果化“预见未来”,在 R2R-CE、RxR-CE 及真实机器人导航中取得显著 SOTA。

研究背景与动机

连续环境下的视觉语言导航(VLN-CE)要求具身智能体遵循自然语言指令在 3D 物理场景中进行多步自主决策与位移。当前的具身导航模型大多采用条件策略学习范式,即基于过往轨迹和当前观测帧直接预测下一步动作。这种范式本质上属于静态的“感知后行动”模式,极易陷入短视决策(step and see):智能体无法预知某一候选动作对未来视觉场景所带来的因果影响,常在复杂的多岔走廊或开阔区域误入歧途,导致严重的反复试探、碰撞以及不可逆的导航失败。

人类在未知环境中穿行时,极少仅仅根据眼前瞬间看到的静态画面做决断,而是在行动前本能地在脑中进行前向物理模拟与想象(例如推测左转是否能看到走廊、前行是否会遭遇死胡同)。近来部分工作尝试为智能体引入外部世界模型或扩散视频生成模型来“想象”未来视图并辅助规划。然而,这类方案将前向预测外置为独立复杂的生成器或多轮树搜索回放,不仅在推理端引入数秒级的巨大时延和显存开销,更面临复合预测误差累积以及策略-世界模型失配的困境。

离线训练轨迹本身就完整记录了动作执行后真实发生的未来视觉演进,构成了天然的“事后诸葛(hindsight)”因果数据。本文的切入角度是:为何不将这些记录在案的未来帧作为训练期的特权监督信号,把外置的想象机制“内化”为决策骨干内部的持续隐式计算?核心 idea:将动作条件下的未来视觉演化内化为端到端多模态大模型的因果传递隐式表征(Pilot Token),通过两步未来特权监督使模型在训练期学习动作与环境演化的因果动态,在推理端仅凭轻量读写缓存实现零未来帧、零额外耗时的前向预测推理。

方法详解

整体框架

LatentPilot 是一个端到端的多模态决策导航系统,由三个核心模块构成:基于 SigLIP 初始化的视觉编码器 \(E_\phi\)、基于 7B LLaVA-Video 初始化的多模态决策大模型骨干网络 \(F_\theta\),以及极轻量的线性投影 Pilot 模块 \(G_\psi\)。在每个时间步 \(t\),模型接收语言指令 \(x\)、当前单目第一人称观测 \(o_t\) 以及上一时间步传递下来的隐式推理状态 Pilot Token \(z_{t-1}\),联合输出当前的离散导航动作 \(a_t\) 和更新后的 Pilot Token \(z_t\)。更新后的 \(z_t\) 写入只读写缓存并在下一步作为 Pilot slot 的输入,使智能体能够在单一骨干网络内形成跨步序贯演化的前向推演能力。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:指令 x + 当前观测 o_t + 缓存 Pilot Token z_{t-1}"] --> B["连续隐式状态传递<br/>Pilot Token 作为内部工作记忆输入与更新"]
    B --> C["两步未来特权监督<br/>训练期以 t+1 帧为输入、t+2 帧均值池化为回归目标"]
    C --> D["飞轮式在线策略学习<br/>多轮滚演收集 + 偏航专家接管修正策略分布漂移"]
    D --> E["严格因果缓存推理<br/>单步前向读写 IPilotCache,零外置生成模型"]
    E --> F["输出:执行动作 a_t ∈ {FWD, LEFT, RIGHT, STOP}"]

关键设计

1. 连续隐式状态传递:以轻量 Pilot Token 承载长程轨迹推理 以往隐式推理方案或显式 CoT 往往产生庞大的语言 token 开销,或者在步进过程中丢失时空因果连续性。LatentPilot 构造了一个常驻的专用占位符槽位(Pilot slot <|placeholder|>)。在初始时刻 \(t=1\),该槽位由可学习的静态嵌入 \(z_0\) 填充;在后续时刻 \(t\),它被前序决策产出的连续向量 \(z_{t-1} \in \mathbb{R}^d\) 直接替代。多模态输入序列组合为: $\(u_t = [\mathrm{Tok}(x);\, v_t;\, \texttt{PILOT}(z_{t-1})]\)$ 其中 \(v_t = E_\phi(o_t) \in \mathbb{R}^{N_v \times d}\) 为视觉编码器输出的视觉 token。整个序列经由 LLaVA-Video 因果注意力计算隐状态 \(H_t \in \mathbb{R}^{N \times d}\)。模型不仅通过常规动作头从动作位置隐状态 \(h_t^{\mathrm{act}}\) 输出动作概率分布 \(\pi_\theta(a_t \mid x, o_t, z_{t-1}) = \mathrm{Softmax}(W_a h_t^{\mathrm{act}})\),还通过极简单的单层线性投影层 \(G_\psi\) 将 Pilot 槽位对应的隐状态 \(h_t^{\mathrm{pil}}\) 映射回隐式空间: $\(z_t = G_\psi(h_t^{\mathrm{pil}})\)$ 该设计无需为想象机制单独搭建外部网络,\(z_t\) 既是当前决策的内部潜变量产物,又是下一步决策的时空因果先验,在连续潜空间中打通了时间跨度的跨步前瞻流。

2. 两步未来特权监督:将后验观测因果化转化为先验预见表征 若缺乏针对性的监督,连续潜变量 \(z_t\) 极易退化成无信息的常数向量(即潜变量坍塌)。本文基于特权信息学习范式(LUPI),利用离线轨迹中原本就存在的后续真实帧构造因果监督。设计上的精妙之处在于显式拆分了两步未来:将 \(t+1\) 步观测作为特权输入,而将 \(t+2\) 步观测作为 Pilot Token 的特权回归目标。 具体而言,未来观测通过均值池化压缩为全局特征 \(\bar{v}_{t+k} = \mathrm{Pool}(E_\phi(o_{t+k})) \in \mathbb{R}^d\)。在训练阶段,模型将 \(\bar{v}_{t+1}\) 强制填入 Pilot slot,并监督模型生成的 \(z_t\) 去逼近 \(t+2\) 步的全局视觉特征 \(\bar{v}_{t+2}\): $\(\mathcal{L}_{\mathrm{pil}} = \sum_{t=1}^{T-2} \|z_t - \bar{v}_{t+2}\|_2^2\)$ 这一两步时序解耦极为关键:它迫使决策骨干网络不仅理解当前输入与动作的即时关系,还必须在潜空间中根据当前动作预测出跳步演变后的世界样貌。由于这一监督仅在训练期通过重构损失反向传播,模型在推理期完全不需要 \(o_{t+1}\)\(o_{t+2}\),成功将离线数据的“后验因果事实”沉淀为推理期的“前瞻预见能力”。

3. 飞轮式在线策略学习:偏航专家接管与闭环滚演自迭代 离线行为克隆在连续导航中普遍存在严重的复合误差与分布漂移。为此,LatentPilot 构建了名为 PilotLoop 的飞轮式闭环训练管线。在每一个飞轮轮次中,算法包含四个闭环阶段:首先利用当前策略在连续 Habitat 仿真环境中进行在线 rollouts 采样;当智能体偏离参考轨迹过大触发偏航阈值时,专家策略(最短路径跟踪器)强制接管并提供纠偏动作,将智能体引导回正轨;接着从收集的完整轨迹中提取包含真实后验帧的特权监督数据对;最后使用动作交叉熵损失 \(\mathcal{L}_{\mathrm{act}}\) 与特权预测损失 \(\mathcal{L}_{\mathrm{pil}}\) 联合微调模型: $\(\min_{\theta, \phi, \psi} \mathbb{E}_{\tau \sim \mathcal{D}} \left[ \mathcal{L}_{\mathrm{act}}(\tau) + \lambda \mathcal{L}_{\mathrm{pil}}(\tau) \right]\)$ 实践中设定平衡系数 \(\lambda = 0.1\)。这种类似 DAgger 的专家接管机制不仅赋予模型极强的纠错恢复能力,还确保了所学到的隐式视觉前瞻表征覆盖了智能体实际可能探索到的边缘状态分布,彻底打破了开环静态仿造的脆弱性。

4. 严格因果缓存推理:无未来帧泄漏的高效闭环部署 在实际部署和测试时,LatentPilot 严守因果性约束。系统维持一个轻量缓存结构 IPilotCache。在第一步 \(t=1\) 时,输入占位符嵌入 \(z_0\);在完成第 \(t-1\) 步前向传播后,输出的向量 \(z_{t-1}\) 被立即写入缓存。在时刻 \(t\),系统无需执行任何额外的生成采样、分支 rollouts 或跨模型调用,仅需直接读取缓存中的 \(z_{t-1}\) 填入输入序列,前向推理产生 \(a_t\) 和新的 \(z_t\),并将 \(z_t\) 覆写回缓存。这一机制使单步决策耗时仅需 130 ms,显存占用仅为 22.8 GB,以纯因果单次前向实现了媲美甚至超越外置昂贵视频世界模型的环境演变预见效果。

损失函数 / 训练策略

模型训练分为两阶段:第一阶段在 Matterport3D(包含 R2R、RxR、EnvDrop 增强集)以及 HM3D 场景合成的 ScaleVLN 混合指令轨迹上,利用 Habitat 最短路径专家进行监督模仿冷启动预训练;第二阶段执行 8 轮 PilotLoop 飞轮式微调。总损失函数由两部分加权组成: $\(\mathcal{L} = \mathcal{L}_{\mathrm{act}} + \lambda \mathcal{L}_{\mathrm{pil}}\)$ 其中 \(\mathcal{L}_{\mathrm{act}} = -\sum_{t=1}^T \log p_\theta(a_t^{\mathrm{col}} \mid x, o_t, \bar{v}_{t+1})\) 衡量动作预测的负对数似然,\(\mathcal{L}_{\mathrm{pil}} = \sum_{t=1}^{T-2} \|z_t - \bar{v}_{t+2}\|_2^2\) 衡量 Pilot Token 与两步未来视觉表征之间的均方误差。优化器采用 AdamW,在 8 张 NVIDIA A100 GPU 上进行并行微调,数据采集由 16 张 RTX 4090 GPU 并行执行。

实验关键数据

主实验

在连续视觉语言导航基准 R2R-CE 和 RxR-CE 的未见验证集(Val-Unseen)上,LatentPilot 在仅使用单目 RGB(SRGB)输入的条件下,显著超越了所有既有单目 VLM 导航方法,并在多项指标上比肩或击败了依赖全景图、里程计和深度图的重度传感器系统。

方法 观测模式 (Pano/Odo/D/SRGB) R2R Val-Unseen NE↓ R2R Val-Unseen SR↑ R2R Val-Unseen SPL↑ RxR Val-Unseen NE↓ RxR Val-Unseen SR↑ RxR Val-Unseen SPL↑ RxR Val-Unseen nDTW↑
ETPNav (2023) Pano + Odo + D 4.71 57.0 49.0 5.64 54.7 44.8 61.9
ScaleVLN (2023) Pano + Odo + D 4.80 55.0 51.0
NaVid (2024) 单目 RGB 5.47 37.4 35.9
NavMorph (2025) 单目 RGB + D 5.75 47.9 33.2 8.85 30.8 22.8 44.2
Uni-NaVid (2025) 单目 RGB 5.58 47.0 42.7 6.24 48.7 40.9
NaVILA (2025) 单目 RGB 5.22 54.0 49.0 6.77 49.3 44.0 58.8
StreamVLN (2025) 单目 RGB 4.98 56.9 51.9 6.22 52.9 46.0 61.9
JanusVLN (2025) 单目 RGB 4.78 60.5 56.8 6.06 56.2 47.5 62.1
LatentPilot (本文) 单目 RGB 4.41 62.0 58.0 5.19 58.2 49.9 67.5

在具备真实物理动力学和行走碰撞缺陷的人形机器人基准 VLN-PE(Unitree H1)上,LatentPilot 在未见环境中的成功率达到 56.42%,跌倒率(FR)仅为 10.65%,卡死率(StR)仅为 0.97%,大幅刷新物理具身基准。

消融实验

消融实验对比了不同特权监督模态(表 3)以及内化隐式前瞻与外置即插即用视频世界模型的效率和性能差异(表 4)。

配置 / 监督模态 目标形式说明 R2R Val-Unseen SR↑ R2R Val-Unseen SPL↑ R2R Val-Unseen NE↓ R2R Val-Unseen OS↑
Vision (本文) 未来帧 SigLIP 均值池化特征 \(\bar{v}_{t+2}\) 62.0 58.0 4.4 66.3
Text Qwen2.5-VL 生成的未来视野文本描述词元 53.2 48.7 5.2 59.6
NaN 无任何特权监督,仅端到端优化动作交叉熵 51.7 47.1 5.3 57.0
3D VGGT 几何大模型抽取的 3D 空间特征 50.3 45.6 5.4 55.8

下表对比了内化特权前瞻与外挂视频世界模型在推理延迟与显存开销上的差距:

模型方案 机制类型 单步延迟 T/Act (ms)↓ 峰值显存 (GB)↓ R2R Unseen SR↑ R2R Unseen SPL↑
Wan2.1 (1.3B) 外挂视频生成模型扩散采样 2040 41.5 53.9 48.6
CogVideoX1.5 (5B) 外挂视频扩散世界模型 5460 32.4
V-JEPA2 插件 外挂视觉特征预测器 143 23.6 58.1 52.5
LatentPilot (本文) 内化 Pilot Token 隐式因果前瞻 130 22.8 62.0 58.0

关键发现

  • 视觉特征监督最直接有效:直接监督未来视觉均值特征效果最为显著(SR 62.0%)。相比之下,采用文本描述(SR 53.2%)因损失细粒度空间拓扑而表现受限;而 3D 特征(SR 50.3%)不仅没有带来增益反而低于纯无监督的 NaN(SR 51.7%),说明跨域几何表征与 VLM 视觉空间的分布不对齐会引入负迁移。
  • 内化前瞻在延迟与精度上双赢:相比外置 Wan2.1 视频世界模型长达 2040 ms 的步间时延与 41.5 GB 的显存占用,LatentPilot 仅需 130 ms 和 22.8 GB,提速超过 15 倍,且 SR 反超 8.1 个百分点。这证明了将因果动态吸收在策略主干内可有效规避外置模型的复合累积误差。
  • PilotLoop 带来稳步增益且潜空间未坍塌:飞轮迭代从第 1 轮(SR 54.0%)持续提升至第 7 轮(SR 62.0%)并平稳收敛;对收集的 Pilot Token 进行 PCA 降维可视化证实,不同动作(FWD, LEFT, RIGHT)呈现出清晰分离的聚类簇,表明隐式向量切实捕获了动作相关的环境动态,未发生表征坍塌。

亮点与洞察

  • 训练特权与推理因果的时空解耦:巧妙利用离线轨迹数据中“已发生事实”充当未来监督,使得模型在测试阶段不破坏单向时间因果性的前提下,免费习得预见未来视觉状态的内化直觉。
  • 单 Token 循环传递的极简低耗架构:通过一个由线性层维持的 Pilot Token 穿针引线,将离散的动作预测与跨步状态记忆串联,避免了传统多轮文本 CoT 的推理负担和外挂生成式世界模型的庞大参数包袱。
  • 卓越的跨形态与实机泛化力:不仅在 Isaac Lab 的双足人形 Unitree H1 上展示了对行走摆动和非理想控制的高容忍度,还在轮式 AgileX LiMO Pro 与四足 Unitree Go2 机器人实机部署中实现长程指令稳定导航。

局限与展望

  • 局限性:当前仅采用单步 Pilot Token 以及均值池化特征作为预测目标,对包含多个动态障碍物或高保真细节的复杂场景表征粒度偏粗;此外,两步固定的时间跨度(\(t+1\)\(t+2\))无法根据机器人的行进速度灵活自适应调节前瞻步长。
  • 未来方向:可进一步探索层次化或变长多 token 的隐式推演空间,并结合自适应前瞻步长机制,提升具身智能体在极端杂乱动态交互环境中的预见精度。

相关工作与启发

  • vs NavMorph / Pathdreamer: 后者依赖显式构建世界模型或自演进神经网格生成未来视野,推理开销昂贵且面临像素生成伪影;LatentPilot 将预见能力内化为骨干网络的潜变量动力学,推理时单次前向直接出动作,更适合低延迟边缘部署。
  • vs NaVid / StreamVLN: 既有流式单目 VLM 主要针对历史视频观测做时序滑动窗口编码,关注“过去看到了什么”;LatentPilot 进一步引入对“执行该动作后未来将看到什么”的因果建模,从根本上缓解了短视决策引起的偏航震荡。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [将离线轨迹未来帧作为特权监督内化为隐式前瞻 Token,设计巧妙而轻盈]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖连续仿真、物理仿真实体人形、消融与实机双构型测试,数据详实严谨]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑紧密,架构与数学表述清晰,消融论证充分扎实]
  • 价值: ⭐⭐⭐⭐⭐ [为端到端具身大模型融合世界模型前瞻能力提供了一条高效率、强落地的技术范式]