跳转至

EgoSim: Egocentric World Simulator for Embodiment Interaction Generation

会议: ECCV 2026
论文: ECCV 原文
代码: https://egosimulator.github.io
领域: 3D视觉
关键词: 第一人称世界模型, 具身交互生成, 3D点云状态更新, 扩散变压器, 跨本体迁移

一句话总结

EgoSim 提出了一种闭环第一人称世界模拟器,通过将 3D 环境表征为可更新的点云世界状态,结合几何与动作感知的视频扩散模型和交互感知状态更新模块,实现了空间一致且支持跨本体迁移的连续具身交互视频生成。

研究背景与动机

具身智能与交互式世界模型是空间智能、虚拟现实以及机器人仿真系统的核心技术基石。随着基于 Diffusion Transformer(DiT)的视频生成模型快速演进,世界模拟器已逐步从早期的潜空间状态转移扩展至高保真度的视觉动态合成。然而,现有的世界模型(如 Genie、The Matrix 等)多聚焦于第三人称视角下的全景漫游或粗粒度导航控制,观察者在虚拟世界中往往沦为被动的旁观者。而在第一人称(Egocentric)视角下,人类与机器人作为具备高度灵巧操作能力的物理参与者,不仅伴随着剧烈的相机自运动,更要求系统能够精确响应复杂、细粒度的手部交互动作,生成符合物理接触与空间约束的环境反馈。

近期涌现的第一人称交互世界模型(如 PlayerOne、Hand2World、DWM 等)在生成真实感交互方面做出了探索,但仍受制于两大关键瓶颈。首先是空间几何约束的缺失与状态漂移:纯粹依赖隐式相机位姿注入的视频扩散模型在大视点移动和遮挡下极易发生 3D 几何坍塌与视角不一致;即使部分方法尝试显式解耦静态背景与动态交互,也普遍将环境视为一成不变的“冻结状态”,无法在多阶段交互过程中记忆和更新物体的物理构型变化,导致被移开的物品在后续序列中离奇复原。其次是数据可扩展性的严重制约:主流方法高度依赖昂贵且难以扩展的多视角同步动捕系统或合成虚拟环境,训练数据规模远落后于网络级视频,导致模型面对复杂野外场景和多样化交互动作时泛化能力严重受限。

针对几何不一致、状态不可持续以及训练数据匮乏三大核心痛点,本文提出了端到端闭环的第一人称世界模拟器 EgoSim。该方法将 3D 场景定义为可随交互演进的动态点云记忆,通过自动化数据管线从海量单目野外视频中解构几何与动作对齐三元组,使世界模型具备了高保真生成与长程状态闭环的双重能力。核心 idea:将第一人称交互模拟建模为“显式 3D 静态背景渲染与跨本体动作驱动的观测生成”与“基于开词表跟踪与增量 TSDF 融合的交互感知 3D 状态持久化更新”的闭环迭代过程,实现空间严格一致且支持跨本体迁移的持续具身物理交互模拟。

方法详解

整体框架

EgoSim 采用视觉观测生成与底层 3D 状态持久化更新交替进行的闭环架构。在时间步 \(k\),模拟器维护当前场景的显式 3D 世界状态 \(S_{k-1}\)(以点云形式存储)。外部输入动作 \(A_k = (C_k, H_k)\) 被显式解耦为 6-DoF 相机位姿轨迹 \(C_k\) 以及具身端执行器(人手或机械臂)交互动作序列 \(H_k\)

模拟系统的单步推进由两个连续阶段构成:首先,几何与动作感知观测模拟模型根据相机轨迹 \(C_k\) 投影渲染当前静态场景背景 \(\Pi(S_{k-1}; C_k)\),并在动作条件 \(H_k\) 引导下合成动态交互残差 \(\Delta O(H_k)\),生成该阶段的视频观测 \(O_k\): $\(O_k = \Pi(S_{k-1}; C_k) + \Delta O(H_k)\)$ 随后,交互感知状态更新模块 \(\mathcal{U}\) 从生成的视觉观测 \(O_k\) 中解析受交互影响的动态物体最终几何构型,并将其增量融合写回 3D 场景,形成更新后的世界状态 \(S_k\): $\(S_k = \mathcal{U}(S_{k-1}, O_k)\)$ 该闭环更新有效防止了被操作物体在后续时间步中复原回初始状态,为持续长程交互模拟提供了坚实的物理锚点。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["初始 3D 场景状态 S_k-1<br/>与交互动作 (C_k, H_k)"] --> B["几何与动作感知的观测模拟<br/>DiT 结合点云渲染与关键点生成 O_k"]
    B --> C["交互感知物体状态解耦与更新<br/>SAM3 跟踪与分层滤波提取最新物体点云"]
    C --> D["姿态对齐与增量 TSDF 状态融合<br/>Sim3 对齐与截断符号距离场融合更新 S_k"]
    D -->|更新后 3D 状态闭环流转| A

关键设计

1. 几何与动作感知的观测模拟:静态渲染与跨本体动作表征的显式解耦

为了消除传统视频生成中大视点变化导致的背景扭曲,该设计将输入的 3D 点云沿相机轨迹 \(C_k\) 投影为几何参考视频,为生成模型提供强先验的空间几何锚点。对于手部交互动作 \(H_k\),模型放弃了绑定特定拓扑的密集手部网格(Hand Mesh),转而提取核心三维关节关键点并将其透视投影至 2D 观测图像平面,生成动作关键点视频 \(O_{action}\)。这种设计不仅天然具备由深度引起的近大远小几何缩放规律,更作为一种通用紧凑的动作表征,消除了人手网格与异构机械臂夹爪之间的形态壁垒。针对点云投影在未观测视线或遮挡区域产生的空洞,模型构建了二值可见性掩码视频 \(M\)。在模型架构上,采用扩散变压器(DiT)在预训练视频 VAE 的潜空间中运作,输入端扩展为 52 通道,将带噪潜变量 \(z_t\)、背景参考潜变量 \(z_{bg}\)、手部动作潜变量 \(z_{hand}\) 与掩码下采样张量 \(M\) 拼接输入: $\(z_{in}^{(t)} = \text{Concat}(z_t, z_{bg}, z_{hand}, M)\)$ 网络以预训练视频修复权重进行初始化。该初始化赋予模型双重生成优势:在掩码为 1 的缺失区域充当生成补全先验以合成合理视场,而在掩码为 0 的已知区域充当恒等映射,严格锁定背景 3D 结构并集中生成手部操作诱导的动态残差。

2. 交互感知物体状态解耦与更新:开词表实例追踪与分层几何滤波

若直接从生成的交互视频中重构点云并写回场景,人体手部的快速运动、形变与接触假象极易在 3D 空间中引入严重的鬼影噪点和表面伪影,破坏原本纯净的静态几何结构。为此,该设计提出了免训练的交互感知物体状态解耦机制。系统首先利用视觉语言模型(VLM)解析与交互动作相关的物体短语(如“杯盖”、“水壶”),随后利用 SAM3 构建开词表实例分割与时序跟踪管道,为每个受操纵物体预测 3D 掩码序列 \(\mathcal{M}_{int}^i\)。在提取过程中引入分层过滤策略:以手部为中心建立空间邻域锚定交互候选对象,通过时空 IoU 重叠率和跨帧深度一致性校验剔除误检。在点云重建阶段,过滤掉手部掩码及非稳定动态成分,将排除交互物体的纯净背景区域融合入静态背景点云 \(\mathcal{P}_{bg}\);对于被操纵的交互物体,则专门抽取其在当前观测段最后一帧的最新几何形态与空间位姿,并将其回贴复合至背景点云中,生成当前片段的候选状态 \(\hat{S}_k\)。该设计有效支持了包含铰接机构旋转(如柜门开合)与多部件装配在内的复杂物理状态持久化。

3. 姿态对齐与增量 TSDF 状态融合:基于重叠位姿对齐的长期时空状态维护

在跨片段的连续长期模拟中,单目深度估计与位姿追踪不可避免地受到尺度不确定性(Scale Ambiguity)和累积漂移的影响,直接合并离散片段的点云会导致场景出现断裂、重影和尺度失真。针对该问题,增量状态融合模块通过比对连续两个片段重叠视角的相机位姿序列 \(C_{k-1}\)\(C_k\),利用 Umeyama 算法计算三维相似变换 \(\text{Sim}(3)\)(包含旋转、平移和全局缩放因子),将新候选状态 \(\hat{S}_k\) 的坐标系精确对准至全局历史坐标系 \(S_{k-1}\)。在几何融合层面,引入截断符号距离场(TSDF)点云融合算法对重叠的静态区域执行体素级空间加权平均,滤除单帧视差噪声并补齐盲区几何,而对于标记为交互物体的点集,则直接采用最新帧观测覆盖历史位置。该机制不仅确保了静态全局背景随探索范围扩大而渐进式完整,更为长程连续交互模拟提供了稳定不变的绝对物理坐标基准。

一个完整示例:桌面取冰与连续交互

以 EgoDex 数据集中的“用勺子取冰块放入水杯(Scooping Ice)”双阶段长程交互任务为例: - 阶段 1 输入与渲染:输入初始单帧,SAM3 抠除人手后经 Qwen-Image-Editing 修复背景,DepthAnything3 预测深度反投影得到初始桌面点云 \(S_0\)。用户给定相机俯仰轨迹 \(C_1\) 与舀冰动作序列 \(H_1\)。 - 阶段 1 观测生成:点云沿 \(C_1\) 渲染出带空洞的桌面背景流,人手 3D 关节点投射为 2D 骨架序列。DiT 接收 52 通道特征,在 61 帧内平滑生成手持勺子插入冰盒、舀出冰块的逼真动态观测 \(O_1\)。 - 阶段 1 状态持久化:VLM 识别受操纵物体“勺子”与“冰块”,SAM3 跟踪提取其运动轨迹并剥离手部点云;分层滤波锁定冰块在第 61 帧处于被舀起悬空的新空间坐标;经 TSDF 融合更新生成 \(S_1\)。 - 阶段 2 连续推演:进入第二片段(总计 121 帧),系统仅以更新后的 \(S_1\) 与后续动作 \(H_2\)(将勺子移动至杯口倾倒)为输入。渲染器从 \(S_1\) 中直接投射出冰块已被移出冰盒的新状态,DiT 在此基础上顺利生成冰块落入水杯并激起水花的过程,完全杜绝了冰块在阶段 2 开头瞬移回初始冰盒的物理逻辑错误。

损失函数 / 训练策略

  • 骨干网络架构:基于 Wan-2.1-Fun-14B-InP 视频扩散模型,将 DiT 输入通道拓展至 52 通道以容纳 3D 背景渲染潜变量、动作关节点潜变量及未观测掩码。文本编码器 T5、视觉 VAE 及 CLIP 图像编码器全部冻结。
  • 生成分辨率与时序:输出视频规格为 61 帧、分辨率 \(832 \times 480\),帧率设定为 16 FPS。
  • 优化参数与目标:采用 Flow Matching 目标函数进行端到端全量参数微调(DiT 部分)。使用 AdamW 优化器,学习率设为 \(1 \times 10^{-5}\),在一台包含 8 张 NVIDIA H200 GPU 的节点上以单卡 Batch Size 为 4 训练 4,000 步。推理采用 Flow Matching 求解器,步数 50,无分类器引导(CFG)比例设为 1.0。
  • 海量对齐数据管线:处理了来自 EgoDex(240K 片段,高精度细粒度操作)与 EgoVid(160K 片段,真实野外第一人称视频)的 400K 训练数据对,并在 AgiBot-World 50K 机械臂视频上进行跨本体微调。同时开发了轻量级手机采集方案 EgoCap,通过 3DGS 地图构建与 6-DoF 稠密重定位实现无标定真实场景秒级适配。

实验关键数据

主实验

在单片段生成评估中,从 EgoDex(桌面细粒度交互)和 EgoVid(非结构化野外场景)中各抽取 100 段未见测试视频,对比当前先进的交互视频生成与图像修复基线。空间几何评估指标中,Depth-ERR 测量生成视频深度与真实深度的偏差,Cam-ERR 测量 Plücker 光线嵌入误差以评估视点一致性。

数据集 方法 PSNR ↑ SSIM ↑ LPIPS ↓ Depth-ERR ↓ Cam-ERR ↓
EgoDex (桌面精细操作) Wan-2.1-14B-InP 17.998 0.447 0.708 42.335 0.0300
EgoDex (桌面精细操作) Mask2IV 20.622 0.814 0.299 38.339 0.0181
EgoDex (桌面精细操作) CosHand 17.119 0.776 0.386 56.524 0.0499
EgoDex (桌面精细操作) InterDyn 22.250 0.830 0.255 44.345 0.0226
EgoDex (桌面精细操作) EgoSim (本文) 25.056 0.896 0.170 8.888 0.0013
EgoVid (野外开放场景) Wan-2.1-14B-InP 11.754 0.430 0.503 34.470 0.0174
EgoVid (野外开放场景) Mask2IV 12.311 0.414 0.571 34.413 0.0175
EgoVid (野外开放场景) CosHand 11.805 0.408 0.600 39.373 0.0516
EgoVid (野外开放场景) InterDyn 14.612 0.466 0.484 38.180 0.0308
EgoVid (野外开放场景) EgoSim (本文) 16.684 0.509 0.421 19.260 0.0105

消融实验

消融实验包含核心架构模块验证(Table 3)、多阶段连续生成衰减评估(Table 2)以及机械臂跨本体预训练迁移实验(Table 4)。

配置 / 实验类型 PSNR ↑ SSIM ↑ LPIPS ↓ Depth-ERR ↓ Cam-ERR ↓ 说明
EgoDex 消融:完整模型 25.056 0.896 0.170 8.888 0.0013 完整架构,具备真实轨迹渲染与掩码引导
EgoDex 消融:w/o trajectory 23.380 0.845 0.244 10.238 0.0015 首帧背景复制,缺失相机运动几何先验,背景产生畸变
EgoDex 消融:w/o mask 23.988 0.886 0.186 14.124 0.0022 全黑掩码输入,仅依赖模型内生先验补全动态区域
连续生成:单片段 (61帧) 25.056 0.896 0.170 8.888 0.0013 使用真实第一帧与真实初始点云渲染
连续生成:两阶段闭环 (121帧) 19.165 0.835 0.220 10.943 0.0017 仅给首帧,阶段间经由交互感知更新模块传递 3D 状态
机器人迁移:无人类预训练 16.36 0.69 0.31 - - 在 AgiBot 机械臂数据上单独训练 1,400 步
机器人迁移:有人类预训练 18.67 0.72 0.28 - - 经人手交互预训练 1,200 步,机器人数据微调 200 步

关键发现

  • 显式 3D 几何锚点决定了空间控制上限:相比于基于 2D 掩码驱动的 InterDyn,EgoSim 的 Depth-ERR 从 44.345 骤降至 8.888,Cam-ERR 下降超过一个数量级(0.0226 降至 0.0013)。去除相机轨迹渲染(w/o trajectory)导致 PSNR 显著下跌 1.676 dB,证实了将 3D 点云按真实轨迹投影是消除背景漂移的关键所在。
  • 状态更新闭环有效控制了长程误差发散:在仅提供第一帧的 121 帧连续长程推演中,EgoSim(Continuous)依然维持了 19.165 的高 PSNR 和 0.835 的 SSIM,Depth-ERR 仅微增 2.055,证明了交互感知解耦与 TSDF 融合有效消除了手部噪点积累与尺度畸变。
  • 跨本体灵巧交互知识具备高泛化迁移性:仅需在 AgiBot 机械臂数据上微调 200 步,经第一人称手部数据预训练的模型指标便大幅超越了纯机器人数据训练 1,400 步的模型(PSNR 提升 2.31 dB,SSIM 提升 0.03),表明核心关节关键点表征与 3D 背景交互动力学具有高度普适的跨本体泛化价值。

亮点与洞察

  • 将 3D 点云与 2D 关键点作为异构动作媒介:将交互动作提炼为通用的 3D 关节点并经相机几何透视投影,既免去了繁重的人手 Mesh 拟合计算,又自然保留了空间近大远小的物理深度约束,使得向二指或多指机械爪的迁移仅需简单运动学重映射。
  • 视频修复先验与几何生成的巧妙融合:利用成熟的视频修复网络权重初始化 DiT,使得模型在已知未遮挡点云投影处发挥“恒等映射”功能锁定几何精度,而在遮挡与手部动作交互区发挥强生成式补全能力,避免了传统模型对未观测视角胡乱脑补的弊端。
  • 免训练的开词表交互感知几何回写闭环:通过 VLM 语义定位、SAM3 实例时空追踪与 TSDF 空间融合相结合,在无需额外训练 3D 动态点云重建网络的前提下,完美达成了“生成观测更新物理世界,物理世界指导下一轮观测”的闭环。

局限与展望

  • 单目深度与位姿估计在极端场景下的失效风险:在极度遮挡、反光材质或高动态剧烈晃动场景下,单目深度估计(DepthAnything3)与 SLAM 轨迹追踪可能出现局部尺度漂移与空洞,导致初始点云畸变。
  • 点云离散性对微小流体与复杂拓扑形变的表达限制:当前状态记忆依赖点云与 TSDF 表达,对刚体位移、铰接旋转表现优异,但在处理面团捏合、液体飞溅等非拓扑守恒形变时,难以在点云层面维持连续光滑更新。
  • 未来方向:探索引入多视角神经辐射场(NeRF)或 3D 高斯泼溅(3DGS)作为连续几何显式表征,并进一步结合接触力学与刚体碰撞物理引擎约束,提升接触瞬间的动力学保真度。

相关工作与启发

  • vs Wan-2.1-14B-InP: 后者仅能在 2D 像素层面进行局部修补,缺乏 3D 几何感知与显式动作驱动能力,在视点变化时无法保持空间连续性;EgoSim 通过注入 3D 几何投影与交互动作,将其提升为交互式世界模型。
  • vs InterDyn: InterDyn 仅依赖 2D 手部掩码并通过 ControlNet 隐式注入运动,极易混淆手部动作与背景相机位移,引发严重的背景漂移与深度重影;EgoSim 依靠显式点云渲染彻底锚定了空间基准。
  • vs DWM (Dexterous World Models): DWM 同样探索了点云背景与手部网格解耦,但其场景在初次生成后完全固化,缺失环境状态更新能力;EgoSim 首次构建了交互感知的状态更新闭环,支持长程多阶段物理模拟。
  • vs VIPE / Spatia: VIPE 等工作主要致力于去除动态物体以重构纯净静态点云;EgoSim 进一步突破,将交互物体从人体手部中精确解耦,并实时将其最新的位置构型回写至全局状态中。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出具备可更新 3D 世界状态的闭环第一人称交互模拟器,解耦设计与数据管线极具启发性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 400K 级多源数据集、单段对比、长程连续生成、模块消融以及机械臂真实迁移,实验扎实完备。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,问题定义清晰,方法流程与可视化分析极具说服力。
  • 价值: ⭐⭐⭐⭐⭐ 为具身智能、第一人称视频合成及机器人大模型仿真训练提供了全新的基础设施与研究范式。