跳转至

Walk through Paintings : Ego-centric World models from Internet Priors

会议: ECCV 2026
论文: ECCV 官方页面
项目主页: egowm.github.io
领域: 图像生成 / 具身智能世界模型
关键词: 世界模型、视频扩散模型、动作条件控制、人形机器人控制、结构一致性评估

一句话总结

EgoWM 提出了一种架构通用的动作条件注入范式,将压缩对齐后的动作序列复用到底层视频扩散模型的去噪时间步调制通道,无需重构主干网络即可将大规模互联网预训练视频模型转化为支持 3-DoF 导航与 25-DoF 人形机器人全身操纵的高精度第一人称世界模型,并提出了基于被动场景追踪的结构一致性评估指标 SCS。

研究背景与动机

在物理世界中,生物体通过视觉观察和自主交互获得预测未来视觉状态的能力,即世界模型。对智能体而言,精准的世界模型是实现无碰撞导航、复杂抓取以及模型预测规划(MPC)的基础。然而,高质量的具身交互视频数据极难采集,尤其是对于自由度多、运动耦合复杂的类人双足机器人(如 25-DoF 人形机器人),构建覆盖全开放环境的动作-观测配对数据集成本高昂。现有方法大多在狭窄的仿真环境或固定桌面操纵场景中从头训练模型,严重限制了物理常识的理解与跨场景泛化能力。

近期以 Navigation World Models (NWM) 为代表的探索尝试从头训练端到端自回归扩散模型,但由于无法直接继承互联网级视频大模型的视觉先验,模型在长程推演中容易出现空间漂移与失真;而现有的视频微调方案(如 Ctrl-World 与 GrndCtrl)往往引入全局动作嵌入或定制的交叉注意力层,一方面与现代 DiT 架构中常见的时序潜空间压缩(Temporal VAE)存在时间对齐脱节,另一方面破坏了预训练模型内在的通用表征。

面对动作数据稀缺与视频预训练先验割裂的核心矛盾,本文提出的切入点是:现代视频生成模型早已通过海量网络视频学会了物理常识和多样的视觉风格,真正缺失的仅仅是精准的物理驱动信号。核心 idea:复用视频扩散模型通用的去噪时间步调制通道,将降采样对齐的高维动作与初始位姿表征融合注入各层调制参数,以最轻量级的结构改动将预训练视频生成模型转变为通用第一人称世界模型。

方法详解

整体框架

EgoWM 的核心目标是在给定初始第一人称视角图像 \(x_0\) 和多步控制指令序列 \(A \in \mathbb{R}^{D \times T}\)(其中 \(D\) 为动作维度,\(T\) 为时间步长)的前提下,合成严格受动作因果支配的连贯未来视频帧 \(\hat{X}_{1:T} \in \mathbb{R}^{T \times H \times W \times 3}\)。整个流程无需修改预训练视频扩散主干(无论是 U-Net 架构还是 DiT 架构)的内部注意力计算方式,完全通过共享潜空间与自适应去噪时间步调制接入。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
    A["输入动作轨迹 A (T×D)<br/>3-DoF 或 25-DoF"] --> B["动作时序投影与对齐<br/>MLP映射 + 1D卷积降采样至 T/k"]
    C["初始状态输入 (人形机器人)<br/>初始关节角与位姿 Zs"] --> D["动作与时间步融合调制<br/>Zts + Za (+ Zs)"]
    B --> D
    E["扩散去噪时间步 ts<br/>时序复制为 Zts (T/k×d)"] --> D
    D --> F["通用调制参数生成<br/>输出 scale, shift, gate"]
    G["初始帧 x0 + 潜变量编码<br/>VAE 压缩得到 T/k 潜视频"] --> H["主干视频扩散去噪网络<br/>U-Net / DiT 架构"]
    F -->|直接调制潜特征| H
    H --> I["时空 VAE 解码器<br/>还原生成高清动作驱动视频"]

关键设计

1. 动作时序投影与潜空间对齐:消除时序潜空间压缩与控制信号的速率失配 现代高质量 DiT 视频模型(如 Cosmos、Wan)通常利用 3D 时空 VAE 在时间维度进行下采样(如时序压缩因子 \(k=4\)),使得潜特征在时间轴上分辨率缩减为 \(T/k\)。若直接输入逐帧动作,会导致特征失配或时序信息模糊。EgoWM 设计了轻量级的动作投影模块:首先通过一系列 MLP 将各时刻的 \(D\) 维动作映射到潜特征维度 \(d\);随后利用两层步长匹配的 1D 卷积,将动作序列降采样为 \(Z_a \in \mathbb{R}^{d \times (T/k)}\)。这使得动作特征在时间分辨率上与视频潜编码严格对齐,无论是 3-DoF 轮式导航控制 \((\Delta x, \Delta y, \Delta \phi)\) 还是 25-DoF 人形机器人全身关节控制,均以相同的几何拓扑进入模型。

2. 复用时间步调制通道注入动作:保持预训练先验的同时实现细粒度时序控制 以往方案往往引入外挂交叉注意力层,这既增加了训练参数,又容易破坏预训练模型对自然场景的表征分布。EgoWM 观察到所有扩散架构均保留了去噪时间步 \(t_s\) 的条件调制通路(AdaLN / 仿射变换层)。模型将全局时间步嵌入沿压缩后的时间轴复制扩展为 \(Z_{t_s} \in \mathbb{R}^{d \times (T/k)}\),并直接与时序对齐的动作嵌入逐元素相加。在每个调制模块 \(i\) 中,通过原模型的投影层 \(F_i(\cdot)\) 计算缩放、偏移和门控参数: $\(P^{\text{scale}}_i, P^{\text{shift}}_i, P^{\text{gate}}_i = F_i(Z_{t_s} + Z_a)\)$ 这种注入方式使得网络中的每一个潜特征块在不同帧上均能接收到针对该时刻特定动作的物理驱动信号,既保留了基座模型强大的纹理与生成先验,又赋予了对摄像机与机械臂精细运动的控制能力。

3. 人形机器人初始未见状态补偿:消除第一人称局部观测下的关节多义性 在 25-DoF 人形机器人(如 EVE 1X)的第一人称视角下,机器人躯干、下肢以及大部分背侧关节完全处于视野盲区之外。相同的未来关节位移序列在不同的初始物理构型下可能导致截然不同的动态轨迹与相机抖动。针对这一局部观测痛点,EgoWM 将机器人初始关节状态通过独立 MLP 映射为状态嵌入 \(Z_s\),并将其同步整合进时间步调制计算中: $\(P^{\text{scale}}_i, P^{\text{shift}}_i, P^{\text{gate}}_i = F_i(Z_{t_s} + Z_a + Z_s)\)$ 这一设计使扩散网络能够结合机器人当前的真实静止姿态来解耦视线运动与末端执行器的接触行为。

4. 结构一致性评估指标 SCS:剥离表面感知纹理、量化真实动作因果响应 传统视频生成评测指标(如 LPIPS、DreamSim、FVD)主要依赖深度神经网络的特征余弦距离,极度偏向画面清晰度与整体语义,往往给“生成了清晰逼真画面却完全违背物理转向”的错误预测打出高分。为此,论文提出了针对动作对齐的结构一致性指标(Structural Consistency Score, SCS)。SCS 首先借助稠密点追踪算法 AllTracker 剔除视场全部移出初始区域的过长时序帧;接着利用分割追踪基础模型识别并追踪场景中由智能体运动引起视差变化的被动静态元素(如建筑、家具、被操纵物体)以及视野内可见的机器人机体部件,在预测序列与真实视频上分别生成二值掩膜 \(\mathcal{M}_{\text{pred}}^{(t,j)}\)\(\mathcal{M}_{\text{gt}}^{(t,j)}\)。最终在 \(N\) 个物体与 \(T\) 帧上计算平均交并比(IoU): $\(\text{SCS} = \frac{1}{N \cdot T} \sum_{j=1}^{N} \sum_{t=1}^{T} \frac{|\mathcal{M}_{\text{pred}}^{(t,j)} \cap \mathcal{M}_{\text{gt}}^{(t,j)}|}{|\mathcal{M}_{\text{pred}}^{(t,j)} \cup \mathcal{M}_{\text{gt}}^{(t,j)}|}\)$ SCS 指标只关注几何拓扑的相对演变,独立于渲染风格与纹理细节,能够直接暴露模型动作响应的微小漂移。

损失函数 / 训练策略

微调阶段完全遵循基座扩散模型的原始预训练目标函数(即标准噪声预测 MSE 损失或流匹配 Flow Matching 目标),在正向加噪潜变量 \(z_{t_s}\) 上优化: $\(\mathcal{L} = \mathbb{E}_{z, t_s, \epsilon} \left[ \|\epsilon - \epsilon_\theta(z_{t_s}, e_c, t_s)\|^2 \right]\)$ 其中注入的条件嵌入 \(e_c\) 即为整合了动作与初始状态的调制特征。为了让全新初始化的动作投影 MLP 和 1D 卷积能够迅速适应预训练特征空间,动作投影模块的学习率设置为视频扩散主干学习率的 10 倍。整个微调过程在 8 张 A100 GPU 上即可完成,计算开销仅为从头训练 NWM 的八分之一。

实验关键数据

主实验

论文在 3-DoF 室内外导航基准(RECON 验证集,在 RECON、SCAND 和 TartanDrive 上混合训练)以及 25-DoF 人形机器人数据集(1X Humanoid Dataset,涵盖导航与精细操纵)上系统评估了基于 SVD (\(k=1\))、Cosmos-2B (\(k=4\)) 和 Wan2.1-14B (\(k=4\)) 的 EgoWM 变体。

表 1:RECON 验证集 3-DoF 导航评测(对标基线 NWM,原论文 Table 1 核心数据)

方法 时序压缩 \(k\) Frame 2 (0.5s) LPIPS↓ / SCS↑ Frame 4 (1.0s) LPIPS↓ / SCS↑ Frame 8 (2.0s) LPIPS↓ / SCS↑ Frame 16 (4.0s) LPIPS↓ / SCS↑
NWM (CVPR2025) \(k=1\) 0.26 / 58.4 0.30 / 56.2 0.35 / 46.8 0.45 / 33.4
EgoWM (SVD) \(k=1\) 0.25 / 62.0 0.27 / 61.7 0.31 / 57.2 0.39 / 55.2
EgoWM (Cosmos-2B) \(k=4\) 0.20 / 63.1 0.22 / 60.4 0.26 / 56.4 0.33 / 47.5
EgoWM (Wan-14B) \(k=4\) 0.22 / 62.7 0.26 / 59.0 0.29 / 53.9 0.34 / 49.7

在 3-DoF 导航任务中,EgoWM 在所有时段和所有指标上均显著优于专用设计的 NWM 基线。特别是在长程推演(Frame 16)下,SVD 变体的 SCS 达到了 55.2,相较 NWM 的 33.4 提升了高达 65.3%,大幅削减了因动作漂移导致的空间脱节。

表 2:1X Humanoid 25-DoF 人形机器人全身控制评测(原论文 Table 2 核心数据)

任务类型 模型配置 Frame 2 LPIPS↓ / SCS↑ Frame 4 LPIPS↓ / SCS↑ Frame 8 LPIPS↓ / SCS↑ Frame 16 LPIPS↓ / SCS↑
25-DoF 导航 SVD (预训练微调) 0.11 / 75.6 0.16 / 66.4 0.26 / 50.3 0.35 / 34.4
25-DoF 导航 SVD (从头训练 Scratch) 0.17 / 69.7 0.25 / 56.0 0.37 / 40.0 0.47 / 21.6
25-DoF 导航 Cosmos-2B (\(k=4\)) 0.11 / 65.2 0.19 / 54.0 0.27 / 42.3 0.40 / 27.0
25-DoF 导航 Wan-14B (\(k=4\)) 0.09 / 70.2 0.15 / 61.3 0.27 / 45.2 0.39 / 30.2
25-DoF 操纵 SVD 0.04 / 86.8 0.06 / 81.8 0.10 / 75.0 0.13 / 76.6
25-DoF 操纵 Cosmos-2B 0.04 / 86.2 0.07 / 82.0 0.10 / 78.2 0.12 / 67.7
25-DoF 操纵 Wan-14B 0.05 / 81.1 0.07 / 78.5 0.11 / 76.0 0.14 / 65.6

在更具挑战性的 25-DoF 复杂控制中,预训练 SVD 相比从头训练的 SVD 在 Frame 16 导航上将 SCS 从 21.6 跃升至 34.4,LPIPS 降低 0.12,直接证实了海量被动网络视频先验对复杂实体动力学预测的关键促进作用。

消融实验

表 3:动作注入机制消融与分布外泛化测试(原论文 Table 3 核心数据,Frame 16)

测试配置与数据集 动作条件化消融变体 LPIPS ↓ DreamSim ↓ SCS ↑ 结论说明
人形导航 25-DoF (\(k=4\)) Cosmos-2B (本文: 时间步时序对齐调制) 0.40 0.19 27.0 基准性能,强动作对齐
人形导航 25-DoF (\(k=4\)) Cosmos-2B (全局条件注入 Global) 0.46 0.20 14.9 SCS 暴跌 -44.8%,失去长效控制
人形导航 25-DoF (\(k=4\)) Cosmos-2B (分块条件注入 Chunked) 0.42 0.17 23.7 SCS 下降 -12.2%,颗粒度较粗
RECON 零样本 OOD 泛化 SVD (本文: 时间步调制) 0.59 0.43 29.7 在 SCAND 上训练、RECON 零样本测试
RECON 零样本 OOD 泛化 SVD (Ctrl-World: 交叉注意力 X-attn) 0.64 0.46 22.7 SCS 低 23.6%,预训练先验受损

关键发现

  • 去噪时间步调制优于交叉注意力与全局注入:消融实验表明,全局动作注入在 25-DoF 人形控制下 SCS 暴跌 44.8%(仅 14.9),完全丧失了对精细关节动作的跟随能力;而将动作作为类似时间步的调制输入,保留了模型原本的跨模态先验,在跨数据集(SCAND \(\rightarrow\) RECON)OOD 泛化下 SCS 提升 23.6%。
  • 时序压缩因子的权衡效应:未压缩模型(SVD, \(k=1\))在长程推演(Frame 16)中维持了更高的空间结构稳定性(SCS 55.2 / 76.6),因为其没有潜时序下采样的几何折损;而 DiT 变体(Cosmos, Wan, \(k=4\))在视觉真实感和纹理细节(LPIPS / DreamSim)上全面领先。
  • 极端跨域泛化能力:借助网络规模视频预训练先验,EgoWM 能够将真实世界的 3-DoF 导航或 25-DoF 抓取动作施加于完全虚构的画作(如古典油画室内场景)中,生成符合对应绘画风格且符合动作透视变换的漫游与交互视频,实现了前所未有的“画中行走”(Walk through Paintings)。
  • 支持下游无模拟器规划:在模型预测规划测试中,基于 EgoWM 模拟未来结合交叉熵方法(CEM),3-DoF 导航在 RECON 上的平均轨迹误差(ATE)降至 3.13(优于 NWM 的 3.25);在 25-DoF 人形操纵任务中,毛巾入篓成功率达到 100%,堆叠积木抓放成功率达到 80%。

亮点与洞察

  • 极简且通用的设计哲学:EgoWM 放弃了复杂的自定义模块堆叠,精准利用视频生成模型“必须依赖去噪时间步控制生成”的通用机制注入动作。这种设计对底层模型完全无感,即插即用适配各类 UNet 与 DiT 模型。
  • 首创解耦外观与物理运动的评测标准 SCS:借助基础分割追踪模型跟踪静态物体视差与可见机体轨迹,首次建立了一套不受生成画质、色彩滤镜干扰的纯物理动作响应评价标准,为世界模型领域提供了亟需的客观基准。
  • 低成本激活多任务与高自由度人形控制:相比于 NWM 耗费 64 张 H100 从头训练,EgoWM 仅需 8 张 A100 微调即可支持高达 25-DoF 的全身人形世界模型,推理速度提升高达 6 倍。

局限与展望

  • 时序压缩带来的微小位移平滑:在 \(k=4\) 的 DiT 模型中,极短时间步内的细微末端微调容易受到 1D 卷积和 VAE 时序下采样的平滑影响,长程动作一致性略逊于 \(k=1\) 的模型。
  • 长时间推演的外推累积漂移:当前评测主要集中在 16 帧(约 4 秒)未来预测;对于数分钟级的大范围开放漫游,仍面临幻觉积累和地图回环闭合问题。
  • 多物体复杂动力学交互建模:在涉及软体物体、液体或多智能体碰撞时,缺乏明确物理仿真的隐式扩散推演仍可能发生违反质量守恒的穿模现象。

相关工作与启发

  • vs NWM (Navigation World Models, CVPR 2025):NWM 从头训练参数量达 10 亿的 cDiT 自回归模型,局限于 3-DoF 轮式平面移动,缺乏跨域泛化能力且算力需求巨大;EgoWM 复用预训练视频基座,仅用 1/8 训练算力即实现了更强的动作控制,并跨越到 25-DoF 全身人形机器人。
  • vs Ctrl-World (ICLR 2026):Ctrl-World 专注于固定外置视角的桌面机械臂操作,并使用额外的交叉注意力层注入控制;EgoWM 针对第一人称自中心视角,设计了时间步调制加算机制与初始状态嵌入,天然适配时序压缩架构且抗分布偏移能力更强。
  • vs GrndCtrl (2025):GrndCtrl 采用全局动作条件,无法精确指引逐帧瞬时动作;EgoWM 通过显式时序对齐的逐帧调制,将高自由度控制下的结构一致性提升了近一倍。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [巧妙将高维动作信号映射为扩散时间步调制参数,打破了从头训练世界模型的算力与数据壁垒]
  • 实验充分度: ⭐⭐⭐⭐⭐ [跨越 3-DoF 到 25-DoF、多骨干模型微调、首创 SCS 评估指标并验证了画作极端泛化与 CEM 规划]
  • 写作质量: ⭐⭐⭐⭐⭐ [问题定义切中要害,理论推导与实验设计层次分明,逻辑链严密自洽]
  • 价值: ⭐⭐⭐⭐⭐ [为机器人学与具身智能领域利用通用多模态基础模型构建开放世界动力学模拟器指明了极具扩展性的道路]