跳转至

Language-Conditioned World Modeling for Visual Navigation

会议: NeurIPS 2026(任务元数据标注 Oral / 0.36%;未独立核实官方录用等级及统计口径)
arXiv: 2603.26741v2
代码: https://github.com/UWMILab/LCVN
领域: 机器人/具身智能
关键词: 语言条件导航、世界模型、潜空间想象、演员–评论家、离线轨迹预测

一句话总结

本文构建语言条件视觉导航数据集,并比较“扩散世界模型 + 潜空间演员–评论家”与“统一自回归动作/图像预测”两种替代方案:前者在已见环境的图像结构保真度上更强,后者在未见环境的离线轨迹预测上更好,但实验不验证真实闭环控制。

研究背景与动机

以目标图像为条件的导航模型需要用户提供目的地照片,而自然语言可以直接表达目的地、沿途地标以及转弯要求。问题在于,“在玻璃办公室后的灰色门处左转”并不直接对应一个连续控制量:模型既要理解地标和空间关系,又要推断行进后会看见什么,并把这些判断转成平面位移与偏航角。GNM、NoMaD 一类策略模型主要直接预测动作;NWM 一类世界模型显式想象后续画面,但视觉预测本身不等于语言条件策略学习。

本文沿用目标条件导航的离线轨迹预测协议,而不是让机器人每走一步都获得新摄像头反馈。测试时只给起始第一人称图像和指令,之后的整条动作序列依赖模型自己的想象。这让不同平台的已有真实轨迹能够进入同一可复现评测,也把误差累积暴露得更清楚:一次转弯后的画面想象失真,可能使后续动作失去地标锚点,即使模型最初理解了正确转向。这个任务与交互式 VLN 互补,不能视为后者的替代评测。

为比较语言、动力学预测和策略耦合方式,作者同时提供三种英语指令风格及两种方法范式。核心 idea:用语言取代目标照片,在同一离线轨迹任务中比较“先学可想象的动力学、再学潜空间策略”与“共享自回归表征、联合预测动作和画面”,观察语义目标如何影响控制与长期预测。

方法详解

整体框架

LCVN 的输入是起始 RGB 图像与持续有效的语言指令,输出是连续导航动作序列;每个动作包含两个平面位移分量和一个偏航角,空动作表示停止。训练阶段可以使用完整记录轨迹、真实动作与未来图像;测试阶段不能再读取沿途真实观测、专家未来状态或目标照片。

两条方法路线是并列替代方案,不是串成一个大模型。第一条先训练 LCVN-WM,再冻结世界模型训练 LCVN-AC;推理从起始潜变量选出首个动作,随后按“上一动作 → 想象下一潜状态 → 再选动作”递归展开。第二条 LCVN-Uni 把指令、图像和动作编码成统一 token 序列,联合生成下一动作与下一观测,再把生成观测送入下一步。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    D["多风格轨迹标注"]
    I["起始图像 + 指令"]
    W["语言条件潜动力学"]
    A["专家对齐潜策略"]
    U["统一动作图像预测"]
    O["离线预测轨迹"]
    D -.->|真实轨迹监督| W
    D -.->|专家计划与潜状态监督| A
    D -.->|动作和图像联合监督| U
    I -->|潜空间方案| W
    W -->|想象潜状态| A
    A -->|下一动作与想象历史| W
    I -->|统一方案| U
    U -->|生成观测回馈| U
    A --> O
    U --> O

图中的实线回馈均发生在模型内部,没有真实环境观测回流;虚线只表示训练数据监督。潜空间方案的首个动作直接由起始图像编码产生,不需要先凭空预测一个首帧。

关键设计

1. 多风格轨迹标注:让指令描述真正的路线,而不是相机抖动

数据集汇集 Go Stanford、ReCon、SCAND、HuRoN 与 TartanDrive 五个来源。作者用各来源的平均步长归一化逐帧位移,剔除后退运动与不足三步的轨迹,再用 Qwen-3.5-9B 按场景语义切分。归一化使不同平台的动作更容易进入共享控制空间,但它只是数据表示标准化,不能证明同一预测动作能够直接执行在所有实体机器人上。

标注流程先由人工写种子指令,再把匹配风格、场景和路线复杂度的示例连同第一人称视频、俯视二维轨迹图送入 Qwen-3.5-9B,最后由人工检查与修订。二维图给出航向和转角,作用是避免把地形抖动或局部侧移误标成全局转弯;它是标注阶段的辅助信息,不是测试时提供给导航模型的地图。每条轨迹有简洁式(Concise)、细节式(Intricate)和地标式(Landmark-based)三种英语指令,分别检验最少方向信息、冗长描述中的有效信息提取、以及地标与动作的对应。

最终有 39,016 条轨迹与 117,048 条指令,训练、已见验证、未见验证、测试分别为 28,813、3,602、1,500、5,101 条轨迹。TartanDrive 不进入训练,独占未见验证集,并构成混合测试集的一部分。附录用 640 条抽样轨迹检查质量,每个轨迹–指令对由三名未参与标注的研究组志愿者评定,跨五个维度平均为 5.2/6.0;这是作者组织的质量评估,不是外部独立认证。

2. 语言条件潜动力学:用异质噪声历史学习指令约束的视觉变化

LCVN-WM 先用从头训练的 ImageVAE 把图像压缩为 32×32 潜表示,再用约 1B 参数的 DiT-XL 预测下一潜状态。语言不是简单加到一个全局条件向量里:冻结 CLIP 文本编码器后,在每个 DiT 块的自注意力与前馈层之间插入多头交叉注意力,让视觉位置可以读取指令嵌入。这样“左侧玻璃墙”“门后左转”等语义能够影响画面演化,而不仅在最终动作头处使用。

动作、相对时间偏移和扩散时间步采取另一条条件通路。各标量经正弦/余弦编码及 MLP 后形成嵌入,再求和用于 AdaLN 的缩放与平移;动作告诉模型实际移动方向,时间偏移标明预测跨度。语言提供目的地与地标约束,但不能代替动作对动力学的限定,这也是后续条件消融中动作缺失损失很大的原因。

Diffusion Forcing 不把整个历史窗口统一污染到同一噪声等级,而是给每个潜状态独立选择噪声等级。核心变换为:

\[ \hat{s}_{t-m}^{(\ell_m)}=\sqrt{\alpha_{\ell_m}}\,\hat{s}_{t-m}+\sqrt{1-\alpha_{\ell_m}}\,\epsilon_m. \]

这里各帧噪声独立,噪声来自标准高斯分布。训练时模型会见到可靠程度不同的历史,使它更适应推理时含预测误差的上下文;这是一种训练设计及其动机,并不意味着想象历史已经获得真实反馈纠错。正文历史下标与附录伪代码对窗口端点的记法并不完全一致,本文按实验的上下文大小解释,不把差异猜补成额外历史帧。

3. 专家对齐潜策略:用记录轨迹监督想象中的动作选择

LCVN-AC 的关键不是在真实环境在线试错,而是在冻结世界模型的潜空间中学习策略。序列到序列 CVAE 把轨迹压缩成潜计划:训练时专家编码器读取完整未来轨迹,学习者编码器仅根据当前潜状态和 CLIP 指令预测计划;二者通过从专家分布到学习者分布的 KL 散度对齐。未来信息只属于专家训练支路,测试时必须由学习者自己采样计划。

演员结合潜状态、指令和潜计划选动作,世界模型据此想象下一潜状态。训练奖励来自预测状态与同一步专家潜状态的相似程度,而不是实体机器人是否到达、是否碰撞或是否遵守社会规范。作者的归一化内在奖励为:

\[ r_t^{\text{int}}(s^E_{t+1},\hat{s}^{\pi}_{t+1})=\frac{s^E_{t+1}\cdot\hat{s}^{\pi}_{t+1}}{\max(\lVert s^E_{t+1}\rVert,\lVert\hat{s}^{\pi}_{t+1}\rVert)^2}. \]

它不仅比较向量方向,还会受范数不匹配影响,因此不应直接称为普通余弦相似度。评论家估计折扣内在回报,演员学习让想象轨迹更接近专家示范;另一个指令对齐损失提高匹配的潜状态–指令对相似度、降低不匹配对相似度,防止潜计划只拟合几何而忽略目的地。

测试时用起始潜状态重复填充尚不存在的历史,学习者先生成潜计划并由演员选首个动作,之后只把世界模型生成的潜状态推进历史。模型预测空动作或达到最大步数便终止。附录算法使用“执行轨迹”的措辞,但全文任务定义及局限章节明确是离线预测,不能据此写成已经在真实机器人上闭环执行。

4. 统一动作图像预测:让计划与想象共享自回归上下文

LCVN-Uni 不另配演员–评论家,而是在预训练 GAIR Anole-7B 上做 LoRA 微调。图像用 VQ tokenizer 转成视觉 token,指令和提示用 BPE,三维动作按互不重叠的分箱 token 集合离散化。每个训练样本包含当前观测、当前动作、起始观测与指令,并同时监督下一动作及下一图像,而不是把动作预测和图像预测拆成两类交替样本。

论文将这一方式称为在一次统一前向处理中预测二者,重点是避免交替调用规划子步与想象子步。其骨干仍是因果自回归模型,不能把“联合预测”解释成所有视觉 token 都无需自回归生成。测试时它把自己的下一观测预测送回输入,持续保留语言与起始观测条件,因此同样是在想象流中展开整条轨迹,并没有在下一步读取真实摄像头图像。

4096-token 窗口限制了上下文与空间信息的组合。上下文为 1 或 2 时每张图有 784 个视觉 token;增至 4 时只能使用 625 个,空间分辨率随之降低。因此上下文消融不是单一变量的“历史越长越好/越差”证据。预训练 7B 模型的语义先验也使其与从头训练的 1B 世界模型存在能力与规模混杂,不能把未见场景优势全部归因于联合架构。

一个完整示例

设起始图像是走廊,指令要求经过左侧玻璃办公室,在灰色门处左转,最后沿左侧墙停下。这是用于解释流程的示意输入,不是新增实验或测得的机器人执行结果。

潜空间方案从起始潜状态和指令生成潜计划,先预测向前动作;LCVN-WM 接收该动作及历史,想象前进后的走廊潜状态。LCVN-AC 再依据这个想象状态更新动作判断,到了模型认定的门口位置后预测左转,随后在满足停止判断时输出空动作。训练时能用真实门口画面约束相应潜状态;测试时若门的位置被想象错,后续路线没有外部观测自动校正。

统一方案把相同起始条件与当前状态放入共享 token 序列,每一步联合生成动作 token 与下一画面 token,再递归输入。它可能最初选对左转,却在转弯后丢失走廊或目的地门;论文的失败案例正说明正确方向意图不保证后续视觉落地。两条路线中“看见门”的状态都可能只是预测,不等于真实传感器已经确认。

损失函数 / 训练策略

训练分为两条独立路线。LCVN-WM 按附录算法累计扩散预测损失,对噪声上下文和真实下一潜状态学习去噪;缓存没有完整展开该扩散损失的参数化细节,本文不自补为作者的精确噪声/速度预测公式。世界模型训练完后冻结,LCVN-AC 的评论家以带停止梯度的目标评论家所构造的 λ-return 做平方误差回归,演员最小化负 λ-return 加权 KL 计划一致性损失及指令对齐损失。

LCVN-Uni 的联合目标为:

\[ \mathcal{L}_{\text{joint}}=\mathcal{L}_{\text{plan}}+\lambda\mathcal{L}_{\text{imagine}}. \]

动作损失平均三个动作维度的真实分箱 token 负对数概率,并包含文本 token 的交叉熵。视觉损失则不是简单把生成图像与真实图像做像素 MSE,而是按预测 token 的码本概率,求真实视觉嵌入到各码本向量的平方距离期望:

\[ \mathcal{L}_{\text{imagine}}=\frac{1}{m}\sum_{j=1}^{m}\sum_{k=1}^{K}\lVert\mathbf{u}_j-\mathbf{c}_k\rVert^2\,P(s_j=\mathbf{c}_k). \]

前者约束控制分箱,后者让视觉预测考虑码本中视觉相近程度,共享骨干因而同时接受计划和想象监督。附录给出目标形式,但没有在这些文本段落中指定联合权重的数值,不猜填该超参数。

LCVN-WM 用 AdamW、线性预热及固定学习率 1e-4,推理采用 50 步确定性 DDIM;NWM 对照用 250 步去噪。LCVN-Uni 冻结三个 tokenizer,仅更新 qkv 投影的 rank=16 LoRA,训练 20 个 epoch、学习率 2e-4、全局 batch size 8;使用 4 张 80GB A100,每卡 batch size 1、梯度累积 2。两条路线共享当前任务的训练数据,但训练初始化、参数规模和推理预算并不相同。

实验关键数据

主实验

ATE 衡量对齐后的预测与参考位姿的全局轨迹偏差,RPE 衡量相邻位姿之间的相对运动误差。SR 只判断预测终点距离目标是否小于该智能体的平均步长,定义如下:

\[ \text{SR}=\frac{1}{N}\sum_{i=1}^{N}\mathbf{1}\!\left[d\!\left(\hat{p}^{(i)}_T,p^{(i)}_g\right)<\bar{s}\right]. \]

这一终点阈值不检查整条路径是否碰撞、是否安全或是否有纠错能力;不同来源还经过平均步长归一化,不宜把表中误差直接当作所有实体平台共享的米制控制精度。下表选取正文表 1 的关键配置,数值均按原文保留。

方法 上下文 已见 ATE↓ 已见 SR↑ 未见 ATE↓ 未见 SR↑ 测试 ATE↓ 测试 SR↑
GNM (lang) 4 1.18 0.21 2.72 0.10 1.89 0.16
NoMaD (lang) 4 1.08 0.24 2.61 0.11 1.78 0.18
NWM (lang) + LCVN-AC 4 0.72 0.29 2.21 0.13 1.31 0.22
LCVN-Uni 2 0.36 0.42 1.21 0.27 0.65 0.36
LCVN-Uni 4 0.37 0.41 1.24 0.25 0.65 0.35
LCVN-WM + LCVN-AC 4 0.34 0.43 1.51 0.19 0.76 0.34

视觉评测单独使用 SSIM、PSNR、LPIPS 与 DreamSim。附录 C.1 明确:长期测试递归输入生成帧,却以真实动作序列为条件;“@8”比较第八步预测图与真实图,不是前八步指标的平均,也不是用策略预测动作完成的导航成功率。

正文表 2 中,LCVN-WM 上下文 4 的单步 SSIM/PSNR/LPIPS/DreamSim 为 0.435/20.316/0.189/0.078,第八步为 0.293/11.527/0.315/0.127。LCVN-Uni 上下文 2 的对应单步值为 0.423/13.325/0.298/0.072,第八步为 0.218/7.412/0.451/0.119。潜空间方案在结构与像素相关指标上较强,统一方案的 DreamSim 更低;不能概括成一个模型在所有视觉指标上全面获胜。

消融实验

下表精简正文表 3、表 4 与附录表 A3,均在已见验证集上评测。条件消融行使用 LCVN-WM 上下文 4;指令风格行与统一策略行使用 LCVN-Uni 上下文 2,属于不同实验族,不能跨族直接视为同一次模块删除实验。

实验族与配置 ATE↓ SR↑ SSIM@8↑ DreamSim@8↓
WM:仅时间条件 1.82 0.12 0.095 0.798
WM:动作 + 时间 0.46 0.35 0.241 0.161
WM:语言 + 动作 0.37 0.41 0.275 0.138
WM:语言 + 动作 + 时间 0.34 0.43 0.293 0.127
Uni:简洁式 0.37 0.41 0.218 0.121
Uni:细节式 0.39 0.38 0.211 0.123
Uni:地标式 0.32 0.47 0.225 0.116
Uni:交替预测 0.34 0.44 0.201 0.115
Uni:联合预测 0.36 0.42 0.218 0.119

去掉 WM 语言条件后,已见 SR 从 0.43 降为 0.35,说明语义目的地对动作条件动力学仍有补充作用。Uni 的“w/o ins”只从观测预测子步去掉指令,并非整套模型完全不读语言;不能把它与 WM 的无语言训练当成对称消融。

指令风格诊断显示,地标式比细节式更有用,但只支持这三类英语标注的比较。潜空间/像素空间消融的 SR 分别为 0.43/0.36;额外 Ego4D 数据也改善未见视觉预测,但这是额外数据实验,不应混入主要训练数据一致的比较。

附录表 A2 的延迟包括动作预测与想象,NWM 和 WM 还包括 LCVN-AC 的耗时;它们是每一步耗时,不能把“联合方案更快”解释成相对所有世界模型都更快。

每步动作预测 + 想象配置 秒/步 证据状态
NWM + LCVN-AC 11.2 原文报告,250 步去噪
LCVN-Uni 20.5 原文报告,统一自回归方案
LCVN-WM + LCVN-AC 6.4 原文报告,50 步 DDIM
LCVN-WM + 蒸馏 0.6 附录报告,去噪降至 6 步;未给对应精度表
LCVN-WM + 4-bit 量化 0.1 估计值;作者明确尚未探索,不是实测

关键发现

  • LCVN-Uni 的未见 SR 为 0.27,高于 WM + AC 的 0.19;这与预训练先验和统一表征相容,但现有实验不能把二者的因果贡献分开。
  • 语言指定“去哪里”,动作约束“怎么变”,时间只是辅助;仅时间条件无法支撑有效动力学与导航。作者关于“控制落地比语言理解更是瓶颈”的判断有条件消融支持,但不是对语言理解能力的独立测量。
  • 联合预测相对交替预测快 1.3 倍,却将 SR 从 0.44 降到 0.42、ATE 从 0.34 增到 0.36;部分视觉指标改善、部分变差,属于效率–精度取舍。
  • 正文表 1/3 的完整 WM 已见 SR 为 0.43,而表 5 的潜空间配置为 0.43、表 4 简洁式为 0.42;这些不同实验表的值应各按原文保留,不能擅自统一成一个“标准成绩”。

亮点与洞察

  • 任务把“语言理解正确”和“整条路线预测正确”分开。起始图像之后没有环境反馈,让转弯后视觉锚点丢失成为明确可研究的失败机制,而不是把生成漂亮画面等同于会导航。
  • 二维轨迹图用于标注而非测试,解决的是语言监督几何正确性。这个做法可迁移到跨平台路线描述数据,关键是把里程计支持的全局转向与第一人称相机局部运动区分开。
  • 世界模型与策略在同一紧凑潜空间交互,使专家示范能够直接提供想象奖励。可借鉴的是“训练时用未来轨迹约束潜计划、测试时用当前状态预测计划”的信息分工,而不是宣称完全无专家监督。
  • 更丰富的描述未必更利于控制;可识别地标携带的路线信息密度更重要。未来可以研究显式筛选指令中的转向和地标证据,但这属于延伸方向,不是本文已经实现的模块。

局限与展望

  • 不是闭环机器人验证:缺少执行噪声恢复、动态行人交互、碰撞率和实体平台安全评测。SR 终点接近与真实路线可执行性之间仍有距离。
  • 范式比较存在混杂:Uni 是预训练 7B + LoRA,WM 是约 1B 从头训练;相同任务数据不等于相同预训练知识、容量或计算预算。需要更匹配的初始化与规模对照才能归因架构收益。
  • 上下文消融同时改变分辨率:在固定 4096-token 上限下,4 帧历史使用 625 个视觉 token,而 1/2 帧使用 784 个。应进一步固定空间 token 数或扩大窗口后再分离历史长度效果。
  • 语言与域外覆盖有限:只有英语的三种预设风格,主要未见域来自 TartanDrive 越野场景;多语言、口语噪声、歧义指令和更多室内/平台迁移仍未验证。
  • 延迟与精度证据不完整:6.4 秒/步原始 WM 和 20.5 秒/步 Uni 不能当作实时控制证明;蒸馏 0.6 秒没有配套精度结果,4-bit 的 0.1 秒明确是未探索的估计。
  • 专家潜状态奖励的偏差:奖励鼓励靠近记录轨迹,但同一指令可能允许多条有效路线。未来应区分“偏离示范”与“偏离语义目标”,并用闭环观测验证想象误差。

相关工作与启发

  • vs GNM / NoMaD:本文把目标照片换成语言,并显式比较世界模型路线与策略-only 对照;这些对照经过 CLIP 文本编码器及 MLP 适配,因此比较的是该任务的语言改造版本,不是原始论文全部能力。
  • vs NWM:NWM 提供动作条件的视觉动力学,本文加入逐块语言交叉注意力、Diffusion Forcing 和专门的潜策略学习。NWM (lang) 使用 AdaLN 条件融合,故差异不只在是否有文本,也包含语言注入方式与世界模型训练设计。
  • vs UniWM:统一自回归路线保留共享多模态序列,将交替动作/观测预测改成联合训练与预测。附录的速度提升支持减少交替调用的价值,但同时暴露导航精度下降,不能写成无代价优化。
  • vs Dreamer / LUMOS / DITTO:LCVN-AC 延续潜空间想象、潜计划与专家一致性奖励思路,将其用于语言条件离线导航。真正值得研究的是语义目标和动力学误差如何共同影响策略,而不是把离线奖励优化等同于在线强化学习。

评分

  • 新颖性: 4/5 — 任务、三风格标注及两范式系统比较有价值,组件主要继承已有世界模型与潜计划框架。
  • 实验充分度: 3/5 — 覆盖域外、条件、风格及效率诊断,但缺少闭环执行、匹配预训练对照和加速后精度验证。
  • 写作质量: 4/5 — 主文与附录能解释机制;“执行”“单次前向”等措辞需要结合协议谨慎理解。
  • 价值: 4/5 — 适合作为语言–想象–控制关系的离线研究基准,不应直接作为部署或安全证明。