跳转至

RoMan-4D: Learning Robot Arm Manipulation from 4D World Models

会议: ECCV 2026
论文: ECCV 原文
代码: https://gem-4d.github.io/
领域: 机器人/具身智能
关键词: 4D世界模型、具身智能、流匹配、几何蒸馏、逆动力学

一句话总结

提出结合 4D 几何特征蒸馏与自适应逆动力学的视频世界模型(GEM-4D),在训练期通过非对称流匹配将预训练几何大模型的时空结构先验注入视频生成主干,在零推理开销下实现跨帧物理一致的视频预测与 6-DoF 机械臂精准操控。

研究背景与动机

通用机器人操作策略通常依赖大规模真实演示数据与特定构型(embodiment)微调,泛化成本极高。基于视频扩散的世界模型通过预测语言指令驱动的未来视觉演化,为机器人规划提供了一种无需任务级动作标注的通用表征途径。然而,现有的通用视频扩散模型以像素或隐空间重建损失为主导,其本质是高度多对一的映射——不同的场景深度、相机位姿与物体流形可以在视觉投影上呈现出完全一致的像素外观。这种优化机制导致生成的视频虽然画面逼真,却频繁出现刚体形变、接触点漂移和深度时空不连贯等致命物理缺陷。

当下游策略试图从视频中提取可执行动作时,任何跨帧对应点(correspondence)的物理破损都会直接导致逆动力学或末端位姿估计彻底失效。先前引入显式几何监督的工作(如 TesserACT)通常被迫改变模型输出空间,要求模型联合预测 RGB、深度图和表面法线。这种做法不仅严重受制于高精度几何标注的匮乏,还破坏了预训练大规模视频主干的表征容量,在推理时更引入了成倍的计算与显存负担。

两相邻帧间的像素对应关系在几何本质上由相机内参、相机位姿变换、场景深度与物体运动矢量(3D scene flow)唯一决定。现代 4D 几何基础模型(如 PAGE-4D、Depth Anything V3 等)在跨帧表征中早已内化了这些几何因子。核心 idea:将预训练 4D 几何基础模型作为训练期教师,通过非对称双路流匹配将稠密 4D 对应几何先验蒸馏至视频 DiT 的中间特征层,实现不修改输出空间、零额外推理成本的几何一致性视频生成,并辅以置信度门控的自适应逆动力学系统稳定提取 6-DoF 机械臂操作轨迹。

方法详解

整体框架

RoMan-4D(论文正文命名为 GEM-4D)包含两大核心阶段:训练期的几何增强速度对齐(Geometry-Enhanced Velocity Alignment)与部署期的自适应逆动力学系统(Adaptive Inverse Dynamic System, AIDS)。在训练阶段,模型采用非对称双路流匹配架构,主路为条件视频 DiT,辅路为几何 DiT。主路输入加噪视频隐变量,输出视频去噪速度;辅路输入预训练几何基础模型提取的几何隐变量,以视频 DiT 中间特征为唯一场景条件预测几何速度。辅路仅在训练期反向传播几何梯度,推理时直接剥离,保持单流生成的高效性。在部署阶段,生成的连贯视频输入 AIDS,通过目标与末端分割、置信度门控跨帧追踪、几何运动学姿态回退和抓取合成,最终输出机械臂关节执行轨迹。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["初始观测图像 + 文本指令"] --> B["几何流对齐特征蒸馏<br/>非对称双路流匹配训练 DiT"]
    B --> C["物理一致未来视频 Rollout"]
    C --> D["双判据置信度门控追踪器<br/>区分渐进漂移与突发崩溃"]
    D --> E["几何运动学姿态回退与动作合成<br/>深度回退 + GraspGen + IK 解算"]
    E --> F["可执行 6-DoF 机械臂控制轨迹"]

关键设计

1. 几何流对齐特征蒸馏:在零推理开销下约束跨帧物理对应

针对标准生成损失无法约束真实 3D 运动因子的本质缺陷,作者首先建立了相邻帧物理点对应的显式投影关系:若场景点 \(\mathbf{X}_t\)\(t\) 帧像素投影为 \(\mathbf{p}_t\),其在 \(t+1\) 帧的投影点 \(\mathbf{p}_{t+1}\) 完全由相机内参 \(\mathbf{K}\)、相对外参 \((\mathbf{R}_{t\to t+1}, \mathbf{T}_{t\to t+1})\)、深度 \(\mathbf{D}(\mathbf{p}_t)\) 以及物体自身流场 \(\Delta\mathbf{X}_t\) 决定: $\(\mathbf{p}_{t+1} \sim \mathbf{K} \left[ \mathbf{R}_{t\to t+1}\,\mathbf{D}(\mathbf{p}_t)\,\mathbf{K}^{-1}\,\mathbf{p}_t + \mathbf{T}_{t\to t+1} + \Delta\mathbf{X}_t \right]\)$ 若内部特征完整编码了这四组几何要素,则跨帧对应关系被唯一确定,无法出现假性形变。基于此,框架引入冻结的 4D 几何基础模型 \(G\) 提取输入视频的全序列稠密几何表征 \(\mathbf{g}_0 = G(\{\mathbf{I}_t\}_{t=0}^T)\)。在视频流匹配去噪过程中,从视频 DiT 的中间层抽取特征 \(\mathbf{m}_t\) 作为条件,驱动轻量级几何 DiT 去噪几何隐变量 \(\mathbf{g}_t\)。几何分支不接触任何原始像素或真实深度,迫使中间特征 \(\mathbf{m}_t\) 必须同时承载视觉外观迁移与 3D 几何演化机制。推理时直接丢弃几何分支,视频 DiT 独力输出几何对齐的高质量视频。

2. 双判据置信度门控追踪器:细粒度隔离渐进漂移与突发崩溃

从视频预测中提取机械臂末端执行器(End-Effector, EE)轨迹时,生成视频中的残余瑕疵往往引发视觉追踪器失效。现有方法盲目依赖单步追踪或全盘重启大模型检测,前者累积误差严重,后者开销过大且带来时序抖动。设计构建了基于双重指标的动态门控机制:利用初始帧 SAM 2 生成的末端掩码密集采样锚点关键点集合 \(\mathcal{V}_{t_0}\),在后续帧通过 CoTracker3 追踪保留的关键点子集 \(\mathcal{V}_t\)。系统实时监测锚点保留率 \(s_t = |\mathcal{V}_t| / |\mathcal{V}_{t_0}|\) 及其帧间差分 \(\Delta s_t = s_t - s_{t-1}\)。若 \(s_t < \tau\) 且变化平缓,判定为机械臂移动引起的正常累积渐进漂移,仅需从最近可靠掩码重采样关键点;若 \(\Delta s_t < -\delta\) 发生突变,则断定视频出现了帧级生成跳变或突发遮挡,触发 Qwen3.5-VL 多模态大模型进行语义级重新定位。

3. 几何运动学姿态回退与动作合成:深度解耦与几何插值保障可执行性

在获得末端掩码后,利用 FoundationPose 结合深度估计与 CAD 模型预测 6D 姿态 \((\mathbf{R}_{\text{ee}}^t, \mathbf{T}_{\text{ee}}^t)\) 及置信度 \(\kappa_t\)。当模型置信度不足(\(\kappa_t < \kappa^*\))或相邻帧姿态突变超出阈值(平移跳变 \(\|\mathbf{T}_{\text{ee}}^t - \mathbf{T}_{\text{ee}}^{t-1}\|_2 > \epsilon_t\)\(SO(3)\) 测地线距离 \(d_{\text{geo}}(\mathbf{R}_{\text{ee}}^t, \mathbf{R}_{\text{ee}}^{t-1}) > \epsilon_R\))时,系统自动启动几何-运动学回退策略:直接将末端掩码内的有效深度点反投影至 3D 空间计算质心作为平移估计,并在时间轴最近的有效姿态之间使用球面线性插值(SLERP)平滑旋转。在完整末端轨迹上,系统锚定距目标物体最近的姿态,调用 GraspGen 生成 6-DoF 抓取候选,综合平移偏差与旋转偏差选出最优抓取位姿 \(\mathbf{T}_{\text{grasp}}^*\),通过逆运动学解算(IK)输出平滑可执行的关节动作序列。

损失函数 / 训练策略

模型采用联合流匹配目标函数进行训练: $\(\mathcal{L} = \mathcal{L}_{\mathrm{FM}}^{\text{vid}} + \alpha \mathcal{L}_{\mathrm{FM}}^{\text{geo}}\)$ 其中视频速度损失和几何速度损失分别表述为: $\(\mathcal{L}_{\mathrm{FM}}^{\text{vid}} = \mathbb{E}_{\mathbf{z}_t, t} \left[ \|\mathbf{v}_\theta^{\text{vid}}(\mathbf{z}_t, t, c) - \mathbf{v}^*(\mathbf{z}_t, t)\|_2^2 \right]\)$ $\(\mathcal{L}_{\mathrm{FM}}^{\text{geo}} = \mathbb{E}_{\mathbf{g}_t, t} \left[ \|\mathcal{M}(\mathbf{v}_\psi^{\text{geo}}(\mathbf{g}_t, t, \mathbf{m}_t)) - \mathbf{v}^*(\mathbf{g}_t, t)\|_2^2 \right]\)$ 对视频主干参数 \(\theta\) 的总梯度展开为外观去噪梯度与几何引导梯度的和: $\(\nabla_\theta \mathcal{L} = \nabla_\theta \mathcal{L}_{\mathrm{FM}}^{\text{vid}} + \alpha \cdot \frac{\partial \mathcal{L}_{\mathrm{FM}}^{\text{geo}}}{\partial \mathbf{m}_t} \cdot \frac{\partial \mathbf{m}_t}{\partial \theta}\)$ 通过链式法则,几何分支直接拉动中间隐特征 \(\mathbf{m}_t\) 的空间表征,剔除外观逼真但不符合 3D 几何规律的病态解。

实验关键数据

主实验

实验在包含 400 个未见样本的真实数据集 Droid 与 780 个合成数据集 RLBench 上全面评估 4D 场景预测质量及下游操控任务成功率。

数据域 方法 FVD ↓ SSIM ↑ PSNR ↑ AbsRel ↓ \(\delta_1\) \(\delta_2\) Chamfer L1 ↓ Tracking \(\delta_{\text{vis}}^{\text{avg}}\)
真实 (Droid) CogVideoX 35.56 75.91 20.18 22.33 68.32 83.17 0.2670 66.22
真实 (Droid) Wan 2.2-14B 33.43 76.24 20.70 21.39 71.18 84.35 0.2349 68.18
真实 (Droid) TesserAct 33.28 75.66 20.08 22.07 66.80 82.60 0.2630 67.14
真实 (Droid) Geometry-Forcing 33.17 76.12 20.53 21.96 69.74 83.83 0.2443 67.97
真实 (Droid) GEM-4D (本文) 31.82 82.05 21.11 20.13 78.19 88.21 0.2001 71.23
仿真 (RLBench) CogVideoX 40.21 75.51 20.03 15.41 70.99 92.90 0.2913 58.32
仿真 (RLBench) Wan 2.2-14B 49.20 73.01 19.87 17.81 67.07 90.16 0.1762 61.99
仿真 (RLBench) TesserAct 41.97 76.72 19.71 16.02 69.26 93.03 0.1813 61.15
仿真 (RLBench) Geometry-Forcing 34.06 77.92 19.48 15.34 68.96 92.80 0.1488 60.84
仿真 (RLBench) GEM-4D (本文) 27.94 80.27 23.36 14.11 74.13 95.01 0.0702 68.18

在下游机器人规划成功率评估中,真实 Droid 场景经人工盲审评分,GEM-4D 在 AUTOLab(75% vs 58%)、CLVR(83% vs 65%)、RAIL(87% vs 59%)和 Numbered Rubbish(78% vs 21%)上全方位大幅领先 TesserAct;在 RLBench 7 项高精仿真操控任务中(如 Reach Target, Lift Lamp, Slide Puzzle),GEM-4D 达成 63%–82% 成功率,而 TesserAct 多数任务因轨迹不连贯成功率在 0%–49% 之间震荡。

消融实验

消融实验对比了不同几何监督形式与基础模型选择对生成表征质量的影响:

数据域 配置 FVD ↓ SSIM ↑ PSNR ↑ AbsRel ↓ \(\delta_1\) \(\delta_2\) Chamfer L1 ↓ 说明
真实 GEM-4D (完整模型) 31.82 82.05 21.11 20.13 78.19 88.21 0.2001 完整 4D 动态几何蒸馏
真实 GEM-4D (Dep) 32.91 78.58 20.75 20.89 74.60 86.67 0.2229 替换为显式深度流匹配监督
真实 GEM-4D (VGGT) 33.68 75.89 20.64 21.73 71.03 83.80 0.2370 换用静态/准静态几何模型 VGGT 先验
真实 Wan 2.2-14B 33.43 76.24 20.70 21.39 71.18 84.35 0.2349 无几何先验直接微调基线
真实 CogVideoX 35.56 75.91 20.18 22.33 68.32 83.17 0.2670 无几何先验直接微调基线

关键发现

  • 动态几何教师优于静态先验:GEM-4D (VGGT) 表现甚至略逊于纯深度监督配置,表明机器人操作强依赖物-手动态交互,专为静态几何设计的预训练模型缺乏对时变场景流(\(\Delta\mathbf{X}_t\))的刻画,反而会引入动态不相容的特征噪声。
  • 隐式特征蒸馏优于显式多头预测:对比 TesserAct 显式输出深度/法线的方式,GEM-4D 既不需要复杂的联合重建损失微调,又避免了因显式通道约束降低生成多样性的弊端,点追踪准确率 \(\delta_{\text{vis}}^{\text{avg}}\) 从 67.14% 提升至 71.23%。
  • 逆动力学容错鲁棒性:双判据追踪结合姿态回退机制使原本脆弱的开环视频控制具备抗噪能力,在长程复杂装配类任务(如 Slide Puzzle)中仍能维持稳定闭环输出。

亮点与洞察

  • 几何作为正则项而非预测目标:绝大多数 3D/4D 增强生成模型执着于在输出端多拼几个通道(RGB-D-Normal),GEM-4D 则揭示几何大模型的中间表征本身就是最好的时空物理正则项,用完即弃的设计在工程上极为优雅。
  • 追踪失败的二元分治:在逆动力学模块中明确将视觉追踪失效划分为“渐进位移漂移”与“离散跳变崩溃”,分别施加轻量重采样与重量级 VLM 语义重对齐,大幅平衡了执行效率与鲁棒性。
  • 具身生成范式的可扩展性:将视频生成从“视觉玩具”转变为“动作执行底座”,证明了无需大规模真实机器人带动作轨迹的数据,纯利用仿真与互联网视频配合几何教师亦可涌现出强泛化操控能力。

局限与展望

  • 严重依赖预训练几何教师质量:若几何基础模型在强镜面反射、高透明物体或极细线缆上的预测出现系统性拓扑错误,蒸馏过程可能会误导视频主干。
  • 开环视频生成长程累积误差:当前 pipeline 是一次性自回归生成一段未来视频后再提取全部轨迹,若执行前期出现物理交互偏差,无法在单次 Rollout 内动态校正规划路径。
  • 未来探索方向:构建基于流匹配的即时重规划机制(Closed-loop Diffusion MPC),在机械臂执行动作的同时将新环境观测持续注入 DiT 隐变量,实现流式交互纠偏。

相关工作与启发

  • vs TesserAct: TesserAct 采用多任务联合预测,输出空间包含 RGB、深度与法线,计算开销大且受限标注文档;GEM-4D 采用单流视频模型 + 几何特征隐式蒸馏,推理零额外开销且几何一致性更优。
  • vs Geometry-Forcing: Geometry-Forcing 仅做简单的扩散特征与静态 3D 特征显式对齐;GEM-4D 建立了时空物理点对应的数学闭环,利用 4D 动态流匹配从深层动力学约束生成。
  • vs Track2Act / UniPi: UniPi 与 Track2Act 在纯 2D 像素或点追踪层面抽取动作,易受外观形变欺骗;GEM-4D 通过 4D 几何约束与 3D 点云/CAD 姿态解耦,实现了真正具备度量尺度真实感的 6-DoF 控制。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将 4D 几何基础模型转化为流匹配生成模型的训练期表征正则项,构思巧妙。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖真实 Droid、仿真实体 RLBench 及真实 UF 机械臂真机闭环,指标极其完备。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述数学逻辑自洽,推导与系统设计严丝合缝。
  • 价值: ⭐⭐⭐⭐⭐ 为具身智能与大模型视频规划的结合树立了兼顾精度与部署效率的新基准。