Language-Conditioned World Modeling for Visual Navigation¶
会议: NeurIPS 2026(任务元数据标注 Oral / 0.36%;未独立核实官方录用等级及统计口径)
arXiv: 2603.26741v2
代码: https://github.com/UWMILab/LCVN
领域: 机器人/具身智能
关键词: 语言条件导航、世界模型、潜空间想象、演员–评论家、离线轨迹预测
一句话总结¶
本文构建语言条件视觉导航数据集,并比较“扩散世界模型 + 潜空间演员–评论家”与“统一自回归动作/图像预测”两种替代方案:前者在已见环境的图像结构保真度上更强,后者在未见环境的离线轨迹预测上更好,但实验不验证真实闭环控制。
研究背景与动机¶
以目标图像为条件的导航模型需要用户提供目的地照片,而自然语言可以直接表达目的地、沿途地标以及转弯要求。问题在于,“在玻璃办公室后的灰色门处左转”并不直接对应一个连续控制量:模型既要理解地标和空间关系,又要推断行进后会看见什么,并把这些判断转成平面位移与偏航角。GNM、NoMaD 一类策略模型主要直接预测动作;NWM 一类世界模型显式想象后续画面,但视觉预测本身不等于语言条件策略学习。
本文沿用目标条件导航的离线轨迹预测协议,而不是让机器人每走一步都获得新摄像头反馈。测试时只给起始第一人称图像和指令,之后的整条动作序列依赖模型自己的想象。这让不同平台的已有真实轨迹能够进入同一可复现评测,也把误差累积暴露得更清楚:一次转弯后的画面想象失真,可能使后续动作失去地标锚点,即使模型最初理解了正确转向。这个任务与交互式 VLN 互补,不能视为后者的替代评测。
为比较语言、动力学预测和策略耦合方式,作者同时提供三种英语指令风格及两种方法范式。核心 idea:用语言取代目标照片,在同一离线轨迹任务中比较“先学可想象的动力学、再学潜空间策略”与“共享自回归表征、联合预测动作和画面”,观察语义目标如何影响控制与长期预测。
方法详解¶
整体框架¶
LCVN 的输入是起始 RGB 图像与持续有效的语言指令,输出是连续导航动作序列;每个动作包含两个平面位移分量和一个偏航角,空动作表示停止。训练阶段可以使用完整记录轨迹、真实动作与未来图像;测试阶段不能再读取沿途真实观测、专家未来状态或目标照片。
两条方法路线是并列替代方案,不是串成一个大模型。第一条先训练 LCVN-WM,再冻结世界模型训练 LCVN-AC;推理从起始潜变量选出首个动作,随后按“上一动作 → 想象下一潜状态 → 再选动作”递归展开。第二条 LCVN-Uni 把指令、图像和动作编码成统一 token 序列,联合生成下一动作与下一观测,再把生成观测送入下一步。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
D["多风格轨迹标注"]
I["起始图像 + 指令"]
W["语言条件潜动力学"]
A["专家对齐潜策略"]
U["统一动作图像预测"]
O["离线预测轨迹"]
D -.->|真实轨迹监督| W
D -.->|专家计划与潜状态监督| A
D -.->|动作和图像联合监督| U
I -->|潜空间方案| W
W -->|想象潜状态| A
A -->|下一动作与想象历史| W
I -->|统一方案| U
U -->|生成观测回馈| U
A --> O
U --> O
图中的实线回馈均发生在模型内部,没有真实环境观测回流;虚线只表示训练数据监督。潜空间方案的首个动作直接由起始图像编码产生,不需要先凭空预测一个首帧。
关键设计¶
1. 多风格轨迹标注:让指令描述真正的路线,而不是相机抖动
数据集汇集 Go Stanford、ReCon、SCAND、HuRoN 与 TartanDrive 五个来源。作者用各来源的平均步长归一化逐帧位移,剔除后退运动与不足三步的轨迹,再用 Qwen-3.5-9B 按场景语义切分。归一化使不同平台的动作更容易进入共享控制空间,但它只是数据表示标准化,不能证明同一预测动作能够直接执行在所有实体机器人上。
标注流程先由人工写种子指令,再把匹配风格、场景和路线复杂度的示例连同第一人称视频、俯视二维轨迹图送入 Qwen-3.5-9B,最后由人工检查与修订。二维图给出航向和转角,作用是避免把地形抖动或局部侧移误标成全局转弯;它是标注阶段的辅助信息,不是测试时提供给导航模型的地图。每条轨迹有简洁式(Concise)、细节式(Intricate)和地标式(Landmark-based)三种英语指令,分别检验最少方向信息、冗长描述中的有效信息提取、以及地标与动作的对应。
最终有 39,016 条轨迹与 117,048 条指令,训练、已见验证、未见验证、测试分别为 28,813、3,602、1,500、5,101 条轨迹。TartanDrive 不进入训练,独占未见验证集,并构成混合测试集的一部分。附录用 640 条抽样轨迹检查质量,每个轨迹–指令对由三名未参与标注的研究组志愿者评定,跨五个维度平均为 5.2/6.0;这是作者组织的质量评估,不是外部独立认证。
2. 语言条件潜动力学:用异质噪声历史学习指令约束的视觉变化
LCVN-WM 先用从头训练的 ImageVAE 把图像压缩为 32×32 潜表示,再用约 1B 参数的 DiT-XL 预测下一潜状态。语言不是简单加到一个全局条件向量里:冻结 CLIP 文本编码器后,在每个 DiT 块的自注意力与前馈层之间插入多头交叉注意力,让视觉位置可以读取指令嵌入。这样“左侧玻璃墙”“门后左转”等语义能够影响画面演化,而不仅在最终动作头处使用。
动作、相对时间偏移和扩散时间步采取另一条条件通路。各标量经正弦/余弦编码及 MLP 后形成嵌入,再求和用于 AdaLN 的缩放与平移;动作告诉模型实际移动方向,时间偏移标明预测跨度。语言提供目的地与地标约束,但不能代替动作对动力学的限定,这也是后续条件消融中动作缺失损失很大的原因。
Diffusion Forcing 不把整个历史窗口统一污染到同一噪声等级,而是给每个潜状态独立选择噪声等级。核心变换为:
这里各帧噪声独立,噪声来自标准高斯分布。训练时模型会见到可靠程度不同的历史,使它更适应推理时含预测误差的上下文;这是一种训练设计及其动机,并不意味着想象历史已经获得真实反馈纠错。正文历史下标与附录伪代码对窗口端点的记法并不完全一致,本文按实验的上下文大小解释,不把差异猜补成额外历史帧。
3. 专家对齐潜策略:用记录轨迹监督想象中的动作选择
LCVN-AC 的关键不是在真实环境在线试错,而是在冻结世界模型的潜空间中学习策略。序列到序列 CVAE 把轨迹压缩成潜计划:训练时专家编码器读取完整未来轨迹,学习者编码器仅根据当前潜状态和 CLIP 指令预测计划;二者通过从专家分布到学习者分布的 KL 散度对齐。未来信息只属于专家训练支路,测试时必须由学习者自己采样计划。
演员结合潜状态、指令和潜计划选动作,世界模型据此想象下一潜状态。训练奖励来自预测状态与同一步专家潜状态的相似程度,而不是实体机器人是否到达、是否碰撞或是否遵守社会规范。作者的归一化内在奖励为:
它不仅比较向量方向,还会受范数不匹配影响,因此不应直接称为普通余弦相似度。评论家估计折扣内在回报,演员学习让想象轨迹更接近专家示范;另一个指令对齐损失提高匹配的潜状态–指令对相似度、降低不匹配对相似度,防止潜计划只拟合几何而忽略目的地。
测试时用起始潜状态重复填充尚不存在的历史,学习者先生成潜计划并由演员选首个动作,之后只把世界模型生成的潜状态推进历史。模型预测空动作或达到最大步数便终止。附录算法使用“执行轨迹”的措辞,但全文任务定义及局限章节明确是离线预测,不能据此写成已经在真实机器人上闭环执行。
4. 统一动作图像预测:让计划与想象共享自回归上下文
LCVN-Uni 不另配演员–评论家,而是在预训练 GAIR Anole-7B 上做 LoRA 微调。图像用 VQ tokenizer 转成视觉 token,指令和提示用 BPE,三维动作按互不重叠的分箱 token 集合离散化。每个训练样本包含当前观测、当前动作、起始观测与指令,并同时监督下一动作及下一图像,而不是把动作预测和图像预测拆成两类交替样本。
论文将这一方式称为在一次统一前向处理中预测二者,重点是避免交替调用规划子步与想象子步。其骨干仍是因果自回归模型,不能把“联合预测”解释成所有视觉 token 都无需自回归生成。测试时它把自己的下一观测预测送回输入,持续保留语言与起始观测条件,因此同样是在想象流中展开整条轨迹,并没有在下一步读取真实摄像头图像。
4096-token 窗口限制了上下文与空间信息的组合。上下文为 1 或 2 时每张图有 784 个视觉 token;增至 4 时只能使用 625 个,空间分辨率随之降低。因此上下文消融不是单一变量的“历史越长越好/越差”证据。预训练 7B 模型的语义先验也使其与从头训练的 1B 世界模型存在能力与规模混杂,不能把未见场景优势全部归因于联合架构。
一个完整示例¶
设起始图像是走廊,指令要求经过左侧玻璃办公室,在灰色门处左转,最后沿左侧墙停下。这是用于解释流程的示意输入,不是新增实验或测得的机器人执行结果。
潜空间方案从起始潜状态和指令生成潜计划,先预测向前动作;LCVN-WM 接收该动作及历史,想象前进后的走廊潜状态。LCVN-AC 再依据这个想象状态更新动作判断,到了模型认定的门口位置后预测左转,随后在满足停止判断时输出空动作。训练时能用真实门口画面约束相应潜状态;测试时若门的位置被想象错,后续路线没有外部观测自动校正。
统一方案把相同起始条件与当前状态放入共享 token 序列,每一步联合生成动作 token 与下一画面 token,再递归输入。它可能最初选对左转,却在转弯后丢失走廊或目的地门;论文的失败案例正说明正确方向意图不保证后续视觉落地。两条路线中“看见门”的状态都可能只是预测,不等于真实传感器已经确认。
损失函数 / 训练策略¶
训练分为两条独立路线。LCVN-WM 按附录算法累计扩散预测损失,对噪声上下文和真实下一潜状态学习去噪;缓存没有完整展开该扩散损失的参数化细节,本文不自补为作者的精确噪声/速度预测公式。世界模型训练完后冻结,LCVN-AC 的评论家以带停止梯度的目标评论家所构造的 λ-return 做平方误差回归,演员最小化负 λ-return 加权 KL 计划一致性损失及指令对齐损失。
LCVN-Uni 的联合目标为:
动作损失平均三个动作维度的真实分箱 token 负对数概率,并包含文本 token 的交叉熵。视觉损失则不是简单把生成图像与真实图像做像素 MSE,而是按预测 token 的码本概率,求真实视觉嵌入到各码本向量的平方距离期望:
前者约束控制分箱,后者让视觉预测考虑码本中视觉相近程度,共享骨干因而同时接受计划和想象监督。附录给出目标形式,但没有在这些文本段落中指定联合权重的数值,不猜填该超参数。
LCVN-WM 用 AdamW、线性预热及固定学习率 1e-4,推理采用 50 步确定性 DDIM;NWM 对照用 250 步去噪。LCVN-Uni 冻结三个 tokenizer,仅更新 qkv 投影的 rank=16 LoRA,训练 20 个 epoch、学习率 2e-4、全局 batch size 8;使用 4 张 80GB A100,每卡 batch size 1、梯度累积 2。两条路线共享当前任务的训练数据,但训练初始化、参数规模和推理预算并不相同。
实验关键数据¶
主实验¶
ATE 衡量对齐后的预测与参考位姿的全局轨迹偏差,RPE 衡量相邻位姿之间的相对运动误差。SR 只判断预测终点距离目标是否小于该智能体的平均步长,定义如下:
这一终点阈值不检查整条路径是否碰撞、是否安全或是否有纠错能力;不同来源还经过平均步长归一化,不宜把表中误差直接当作所有实体平台共享的米制控制精度。下表选取正文表 1 的关键配置,数值均按原文保留。
| 方法 | 上下文 | 已见 ATE↓ | 已见 SR↑ | 未见 ATE↓ | 未见 SR↑ | 测试 ATE↓ | 测试 SR↑ |
|---|---|---|---|---|---|---|---|
| GNM (lang) | 4 | 1.18 | 0.21 | 2.72 | 0.10 | 1.89 | 0.16 |
| NoMaD (lang) | 4 | 1.08 | 0.24 | 2.61 | 0.11 | 1.78 | 0.18 |
| NWM (lang) + LCVN-AC | 4 | 0.72 | 0.29 | 2.21 | 0.13 | 1.31 | 0.22 |
| LCVN-Uni | 2 | 0.36 | 0.42 | 1.21 | 0.27 | 0.65 | 0.36 |
| LCVN-Uni | 4 | 0.37 | 0.41 | 1.24 | 0.25 | 0.65 | 0.35 |
| LCVN-WM + LCVN-AC | 4 | 0.34 | 0.43 | 1.51 | 0.19 | 0.76 | 0.34 |
视觉评测单独使用 SSIM、PSNR、LPIPS 与 DreamSim。附录 C.1 明确:长期测试递归输入生成帧,却以真实动作序列为条件;“@8”比较第八步预测图与真实图,不是前八步指标的平均,也不是用策略预测动作完成的导航成功率。
正文表 2 中,LCVN-WM 上下文 4 的单步 SSIM/PSNR/LPIPS/DreamSim 为 0.435/20.316/0.189/0.078,第八步为 0.293/11.527/0.315/0.127。LCVN-Uni 上下文 2 的对应单步值为 0.423/13.325/0.298/0.072,第八步为 0.218/7.412/0.451/0.119。潜空间方案在结构与像素相关指标上较强,统一方案的 DreamSim 更低;不能概括成一个模型在所有视觉指标上全面获胜。
消融实验¶
下表精简正文表 3、表 4 与附录表 A3,均在已见验证集上评测。条件消融行使用 LCVN-WM 上下文 4;指令风格行与统一策略行使用 LCVN-Uni 上下文 2,属于不同实验族,不能跨族直接视为同一次模块删除实验。
| 实验族与配置 | ATE↓ | SR↑ | SSIM@8↑ | DreamSim@8↓ |
|---|---|---|---|---|
| WM:仅时间条件 | 1.82 | 0.12 | 0.095 | 0.798 |
| WM:动作 + 时间 | 0.46 | 0.35 | 0.241 | 0.161 |
| WM:语言 + 动作 | 0.37 | 0.41 | 0.275 | 0.138 |
| WM:语言 + 动作 + 时间 | 0.34 | 0.43 | 0.293 | 0.127 |
| Uni:简洁式 | 0.37 | 0.41 | 0.218 | 0.121 |
| Uni:细节式 | 0.39 | 0.38 | 0.211 | 0.123 |
| Uni:地标式 | 0.32 | 0.47 | 0.225 | 0.116 |
| Uni:交替预测 | 0.34 | 0.44 | 0.201 | 0.115 |
| Uni:联合预测 | 0.36 | 0.42 | 0.218 | 0.119 |
去掉 WM 语言条件后,已见 SR 从 0.43 降为 0.35,说明语义目的地对动作条件动力学仍有补充作用。Uni 的“w/o ins”只从观测预测子步去掉指令,并非整套模型完全不读语言;不能把它与 WM 的无语言训练当成对称消融。
指令风格诊断显示,地标式比细节式更有用,但只支持这三类英语标注的比较。潜空间/像素空间消融的 SR 分别为 0.43/0.36;额外 Ego4D 数据也改善未见视觉预测,但这是额外数据实验,不应混入主要训练数据一致的比较。
附录表 A2 的延迟包括动作预测与想象,NWM 和 WM 还包括 LCVN-AC 的耗时;它们是每一步耗时,不能把“联合方案更快”解释成相对所有世界模型都更快。
| 每步动作预测 + 想象配置 | 秒/步 | 证据状态 |
|---|---|---|
| NWM + LCVN-AC | 11.2 | 原文报告,250 步去噪 |
| LCVN-Uni | 20.5 | 原文报告,统一自回归方案 |
| LCVN-WM + LCVN-AC | 6.4 | 原文报告,50 步 DDIM |
| LCVN-WM + 蒸馏 | 0.6 | 附录报告,去噪降至 6 步;未给对应精度表 |
| LCVN-WM + 4-bit 量化 | 0.1 | 估计值;作者明确尚未探索,不是实测 |
关键发现¶
- LCVN-Uni 的未见 SR 为 0.27,高于 WM + AC 的 0.19;这与预训练先验和统一表征相容,但现有实验不能把二者的因果贡献分开。
- 语言指定“去哪里”,动作约束“怎么变”,时间只是辅助;仅时间条件无法支撑有效动力学与导航。作者关于“控制落地比语言理解更是瓶颈”的判断有条件消融支持,但不是对语言理解能力的独立测量。
- 联合预测相对交替预测快 1.3 倍,却将 SR 从 0.44 降到 0.42、ATE 从 0.34 增到 0.36;部分视觉指标改善、部分变差,属于效率–精度取舍。
- 正文表 1/3 的完整 WM 已见 SR 为 0.43,而表 5 的潜空间配置为 0.43、表 4 简洁式为 0.42;这些不同实验表的值应各按原文保留,不能擅自统一成一个“标准成绩”。
亮点与洞察¶
- 任务把“语言理解正确”和“整条路线预测正确”分开。起始图像之后没有环境反馈,让转弯后视觉锚点丢失成为明确可研究的失败机制,而不是把生成漂亮画面等同于会导航。
- 二维轨迹图用于标注而非测试,解决的是语言监督几何正确性。这个做法可迁移到跨平台路线描述数据,关键是把里程计支持的全局转向与第一人称相机局部运动区分开。
- 世界模型与策略在同一紧凑潜空间交互,使专家示范能够直接提供想象奖励。可借鉴的是“训练时用未来轨迹约束潜计划、测试时用当前状态预测计划”的信息分工,而不是宣称完全无专家监督。
- 更丰富的描述未必更利于控制;可识别地标携带的路线信息密度更重要。未来可以研究显式筛选指令中的转向和地标证据,但这属于延伸方向,不是本文已经实现的模块。
局限与展望¶
- 不是闭环机器人验证:缺少执行噪声恢复、动态行人交互、碰撞率和实体平台安全评测。SR 终点接近与真实路线可执行性之间仍有距离。
- 范式比较存在混杂:Uni 是预训练 7B + LoRA,WM 是约 1B 从头训练;相同任务数据不等于相同预训练知识、容量或计算预算。需要更匹配的初始化与规模对照才能归因架构收益。
- 上下文消融同时改变分辨率:在固定 4096-token 上限下,4 帧历史使用 625 个视觉 token,而 1/2 帧使用 784 个。应进一步固定空间 token 数或扩大窗口后再分离历史长度效果。
- 语言与域外覆盖有限:只有英语的三种预设风格,主要未见域来自 TartanDrive 越野场景;多语言、口语噪声、歧义指令和更多室内/平台迁移仍未验证。
- 延迟与精度证据不完整:6.4 秒/步原始 WM 和 20.5 秒/步 Uni 不能当作实时控制证明;蒸馏 0.6 秒没有配套精度结果,4-bit 的 0.1 秒明确是未探索的估计。
- 专家潜状态奖励的偏差:奖励鼓励靠近记录轨迹,但同一指令可能允许多条有效路线。未来应区分“偏离示范”与“偏离语义目标”,并用闭环观测验证想象误差。
相关工作与启发¶
- vs GNM / NoMaD:本文把目标照片换成语言,并显式比较世界模型路线与策略-only 对照;这些对照经过 CLIP 文本编码器及 MLP 适配,因此比较的是该任务的语言改造版本,不是原始论文全部能力。
- vs NWM:NWM 提供动作条件的视觉动力学,本文加入逐块语言交叉注意力、Diffusion Forcing 和专门的潜策略学习。NWM (lang) 使用 AdaLN 条件融合,故差异不只在是否有文本,也包含语言注入方式与世界模型训练设计。
- vs UniWM:统一自回归路线保留共享多模态序列,将交替动作/观测预测改成联合训练与预测。附录的速度提升支持减少交替调用的价值,但同时暴露导航精度下降,不能写成无代价优化。
- vs Dreamer / LUMOS / DITTO:LCVN-AC 延续潜空间想象、潜计划与专家一致性奖励思路,将其用于语言条件离线导航。真正值得研究的是语义目标和动力学误差如何共同影响策略,而不是把离线奖励优化等同于在线强化学习。
评分¶
- 新颖性: 4/5 — 任务、三风格标注及两范式系统比较有价值,组件主要继承已有世界模型与潜计划框架。
- 实验充分度: 3/5 — 覆盖域外、条件、风格及效率诊断,但缺少闭环执行、匹配预训练对照和加速后精度验证。
- 写作质量: 4/5 — 主文与附录能解释机制;“执行”“单次前向”等措辞需要结合协议谨慎理解。
- 价值: 4/5 — 适合作为语言–想象–控制关系的离线研究基准,不应直接作为部署或安全证明。