跳转至

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/Mutual-Luo/EmbodiedVAE
领域: 图像生成 / 机器人/具身智能
关键词: 视频VAE / 具身操作 / 动作控制 / 解耦表示 / 最优传输

一句话总结

针对具身操作世界模型中通用视频VAE时空压缩导致机械臂动作语义丢失的瓶颈,EmbodiedVAE通过双编码器非对称压缩将机械臂动作与静态背景解耦,并结合最优传输一致性约束,在0.39%超高压缩率下实现了高保真重建并带来下游动作生成2dB的PSNR提升。

研究背景与动机

近年来,潜在扩散模型(LDM)在具身智能领域被广泛用作构建高表现力的机器人操作世界模型,让智能体能够以极低试错成本预演未来人机-环境交互。然而,当前具身世界模型底层所依赖的潜在表征面临着两难困境:若直接采用2D图像VAE进行逐帧压缩,虽然能保留精细的时序连续性,却无法利用视频帧间的巨大时间冗余,生成体积极大的潜变量,严重拖慢下游扩散骨干网的训练效率与扩展能力;若转向主流的通用视频VAE,其时空下采样策略通常面向自然视频场景设计,缺乏对机器人操控动作的显式建模,强行时序压缩会导致高频机械臂动作动力学语义严重丢失。

这一矛盾在具身控制视频生成中尤为致命。机器人操控任务的核心是在给定历史观测与未来动作指令下,精确预测机械臂位姿变化及物体交互响应。现有视频VAE(如Wan-VAE、Cog-VAE)在压缩后往往生成视觉上平滑但物理动作完全不符的画面,机械臂末端甚至出现虚假形变或控制失敏。根本原因在于机械臂在前景色中仅占据局部的空间区域,却承载着全剧最核心的高动态信息;而背景环境广阔但变化极其缓慢。通用VAE对全图一视同仁的时空下采样,不可避免地让广阔静态背景淹没了微弱而关键的机械臂动作特征。

本文的切入角度是打破对全场景统一下采样的惯性思维,依据具身场景特有的动态异质性实现动静分离。核心 idea:构建双编码器-单解码器的非对称时空压缩架构,仅在训练期借助掩码引导将机械臂运动与背景环境解耦为两个独立潜变量,并引入最优传输(Optimal Transport)一致性损失显式对齐帧间机械臂运动动力学,实现既极度紧凑又支持高精度动作注入的具身潜空间。

方法详解

整体框架

EmbodiedVAE由前景机械臂编码器、背景环境上下文编码器以及一个包含双头独立升采样与共享尾部的统一重建解码器组成。系统在推理阶段完全不需要任何外部分割掩码或传感器输入,输入原始视频即可自动将高维视觉流映射为两组紧凑的潜变量:一组专注于捕获机械臂的细粒度位姿与交互动态,另一组专注于编码全局静态环境上下文。两者随后在统一解码器中按各自的空间和时间分辨率对齐融合,恢复完整高保真操作视频。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入操作视频<br/>X ∈ R^(T×H×W×C)"] --> B["双编码器非对称时空下采样<br/>AlphaBlender 混合 2D+1D 分支"]
    B --> C["前景机械臂潜变量 Z_arm<br/>4×(16×16) 空间重压缩"]
    B --> D["背景环境潜变量 Z_env<br/>8×(8×8) 时间重压缩"]
    C --> E["OT 运动一致性约束<br/>Sinkhorn 算法最小化帧间迁移代价"]
    C --> F["统一重建解码器<br/>双头异构升采样 → 通道拼接 → 共享尾部"]
    D --> F
    F --> G["重建高保真视频<br/>X_hat"]

关键设计

1. 双编码器非对称时空压缩:动静异质特征的定制化降维

通用视频VAE之所以在具身场景中失真,是因为它用同一套下采样倍率处理空间局部的快速运动与全局静态的桌面背景。针对具身操作视角中机械臂面积占比小但时序变化快、背景范围大但帧间极其静态的特点,EmbodiedVAE设计了两套差异化的编码流。为兼顾计算开销与因果时序性,编码器避免使用沉重的全3D卷积,仅在首尾层采用因果3D卷积,中间堆叠由AlphaBlender算子融合的2D空间与1D因果时间卷积块: $$ \mathbf{x}_{\text{down}} = \alpha \cdot \mathbf{x}_1 + (1 - \alpha) \cdot \mathbf{x}_2 $$ 其中 \(\mathbf{x}_1\)\(\mathbf{x}_2\) 分别来自插值下采样分支与卷积下采样分支,\(\alpha = \text{Sigmoid}(0.2)\) 固定配比。在压缩比例上,机械臂编码器采用4个空间下采样块与2个时间下采样块,形成 \(4\times(16\times16)\) 的非对称压缩(时间方向仅压缩4倍以防动作混叠,空间方向强压缩16倍);而背景环境编码器则采用3个空间块与3个时间块,达到 \(8\times(8\times8)\) 压缩,激进压除时间冗余。两路潜变量通道数均设为4,整体潜空间体积相较原始视频仅占0.39%,在极致轻量化下完整保留了动作高频语义。

2. 基于最优传输的运动一致性约束:跨帧机械臂动力学对齐

强行压缩时间维时,相邻帧的机械臂微小位移极易被量化或下采样平滑掉,导致潜变量丧失时序连续性。常规配对相似度仅衡量局部像素或特征亲和力,无法反映结构性运动。EmbodiedVAE基于稳定运动在潜空间中具有视觉不变性的先验,将连续两帧潜变量切片 \(\mathbf{Z}_p\)\(\mathbf{Z}_q\) 看作离散概率测度,构建以负余弦相似度为代价矩阵 \(c(i,j) = -\langle \mathbf{Z}_p[i], \mathbf{Z}_q[j] \rangle / \sqrt{d}\) 的熵正则化最优传输问题: $$ \mathbf{T}^\star = \arg\min_{\mathbf{T}} \sum_{i,j} \mathbf{T}{ij} c(i,j) + \epsilon \mathcal{H}(\mathbf{T}), \quad \text{s.t.} \quad \mathbf{T}\mathbf{1} = \mu_p, \ \mathbf{T}^\top\mathbf{1} = \mu_q $$ 通过Sinkhorn-Knopp算法高效求得可微的传输矩阵 \(\mathbf{T}_{p\rightarrow q}\),并在此基础上施加运动一致性损失: $$ \mathcal{L}}} = \frac{1}{N} \sum_{p=1}^{N} \sum_{q=p}^{p+\Delta} |\mathbf{Zq - \mathbf{T}|_F $$ 该损失利用全局最优传输方案引导特征对齐,同时置换正则项 } \mathbf{Z}_p|_2 + \gamma |\mathbf{T}\mathbf{T}^\top - \mathbf{I\(\|\mathbf{T}\mathbf{T}^\top - \mathbf{I}\|\) 强约束传输映射趋于单射置换。这在数学上保证了机械臂动作在时间滑移中的单调与连贯性,防止潜空间产生突变伪影。

3. 两阶段掩码引导解耦训练策略:推理期零掩码开销

直接联合端到端训练双编码器会导致两路潜变量发生语义共振与信息泄漏,无法自发将机械臂与背景干净拆分。本文设计了两阶段训练范式:在第一阶段,借助预训练的SAM2与Grounding DINO(提示词“robotic arm”)离线生成机械臂空间掩码 \(\mathbf{M}\)。机械臂分支仅重建掩码内区域 \(\mathcal{L}_{\text{rec}} = \|(\hat{\mathbf{X}} - \mathbf{X}) \odot \mathbf{M}\|\) 并附加 \(\mathcal{L}_{\text{motion}}\) 约束;环境分支仅重建背景区域 \(\mathcal{L}_{\text{rec}} = \|(\hat{\mathbf{X}} - \mathbf{X}) \odot (1-\mathbf{M})\|\)。在第二阶段,彻底舍弃各自分支的独立临时解码器,冻结两路编码器权重,仅训练统一解码器完成完整视频重建 \(\mathcal{L}_{\text{rec}} = \|\hat{\mathbf{X}} - \mathbf{X}\|\)。由此,模型在训练后不再需要任何掩码输入,即可依靠编码器内部学到的表征偏置自发解耦前景动作与背景结构。

损失函数 / 训练策略

第一阶段机械臂编码器总损失为: $$ \mathcal{L}{\text{arm}} = \mathcal{L}}}(\mathbf{M}) + \alpha \mathcal{L{\text{motion}} + \beta \mathcal{L}}} + \lambda \mathcal{L{\text{aux}} $$ 背景环境编码器损失为 \(\mathcal{L}_{\text{env}} = \mathcal{L}_{\text{rec}}(1-\mathbf{M}) + \beta \mathcal{L}_{\text{KL}} + \lambda \mathcal{L}_{\text{aux}}\)。辅助损失 \(\mathcal{L}_{\text{aux}}\) 结合了特征级感知损失与判别器对抗损失。 第二阶段统一解码器训练损失为: $$ \mathcal{L}|}} = |\hat{\mathbf{X}} - \mathbf{X1 + \beta \mathcal{L} $$ 下游结合IRASim-L(461M)扩散骨干网进行动作条件视频预测时,两路潜序列经投影后进入共享DiT块,每 }} + \lambda \mathcal{L}_{\text{aux}\(k=2\) 层交替插入一层跨注意力(Cross-Attention)以保证动作与光照/接触响应之间的物理协调。

实验关键数据

主实验

论文在Agibot-2025与Bridge两个基准数据集上评测了视频VAE重建能力(如表1),并在RT-1与Bridge上评测了下游动作可控视频生成性能(如表2)。

Table 1: 视频 VAE 视频重建质量对比(原论文 Table 1)

方法 压缩率↓ Agibot-2025 PSNR↑ Agibot-2025 SSIM↑ Agibot-2025 FVD↓ Bridge PSNR↑ Bridge SSIM↑ Bridge FVD↓
OpenSoraPlan 1.04% 30.7553 0.9257 290.2550 30.3755 0.8948 340.5284
Cosmos 2.08% 28.2329 0.8778 889.7757 27.8812 0.8386 715.6345
iVideoGPT 1.50% 29.2503 0.9096 760.6489 28.3325 0.8738 522.1818
MAGVIT-v2 0.65% 27.1014 0.7197 849.5063 26.8635 0.6986 549.9939
VidTwin 0.20% 30.8263 0.9202 443.1976 29.7386 0.8531 585.8065
EMU-3 0.53% 28.9081 0.8926 599.8921 27.5814 0.8317 736.5338
CV-VAE 0.53% 30.2767 0.9128 392.6846 29.8419 0.8789 418.8394
CMD 6.85% 31.4030 0.8995 439.9010 31.3764 0.8996 358.6915
EmbodiedVAE (本文) 0.39% 31.6745 0.9345 368.5511 30.6957 0.9017 309.7604

Table 2: 机器人操作动作可控视频生成质量对比(原论文 Table 2,骨干网固定为 IRASim-L)

方法 压缩率↓ RT-1 PSNR↑ RT-1 SSIM↑ RT-1 FVD↓ Bridge PSNR↑ Bridge SSIM↑ Bridge FVD↓
SDXL (2D Image VAE) 8.32% 23.1988 0.8074 761.7837 22.3624 0.7915 455.7345
OpenSoraPlan 1.04% 21.6494 0.7432 958.0784 21.0405 0.7577 785.5559
EMU-3 0.53% 21.6749 0.7286 1049.2935 20.8573 0.7053 986.3582
CV-VAE 0.53% 20.3296 0.6859 2529.3193 19.3068 0.6568 1829.7292
CMD 6.85% 20.9454 0.7671 2644.7208 20.1799 0.7419 1464.6843
VidTwin 0.20% 21.1037 0.6697 1824.3383 20.4466 0.6889 1690.1818
Cog-VAE 2.08% 21.2231 0.7907 1135.6917 21.6951 0.7807 1302.4434
Wan-VAE 2.45% 22.7334 0.8138 802.2071 22.1690 0.8211 548.9621
EmbodiedVAE (本文) 0.39% 24.7082 0.8263 716.3273 24.2484 0.8366 631.6450

消融实验

Table 3: 掩码引导与最优传输运动损失在重建与动作控制任务上的消融实验(原论文 Table 3)

任务 配置 Agibot-2025 PSNR↑ Agibot-2025 LPIPS↓ Bridge PSNR↑ Bridge LPIPS↓
Recon. (重建) EmbodiedVAE (完整模型) 31.6745 0.0723 30.6957 0.1060
Recon. w/o Mask (无掩码两阶段引导) 31.1812 0.0728 29.6680 0.1211
Recon. w/o \(\mathcal{L}_{\text{motion}}\) (无OT运动一致性损失) 31.0213 0.0835 29.9769 0.1087
任务 配置 RT-1 PSNR↑ RT-1 LPIPS↓ Bridge PSNR↑ Bridge LPIPS↓
Manip. (具身控制生成) EmbodiedVAE (完整模型) 24.7082 0.1707 24.2484 0.1409
Manip. w/o Mask (无掩码两阶段引导) 23.8044 0.1904 23.7306 0.1705
Manip. w/o \(\mathcal{L}_{\text{motion}}\) (无OT运动一致性损失) 23.8187 0.1863 23.9726 0.1643

关键发现

  • 对动作生成控制力碾压无时序压缩的2D VAE:在RT-1与Bridge两个具身预测任务中,EmbodiedVAE以仅0.39%的压缩率击败了以逐帧无时序压缩著称的SDXL(8.32%占用),PSNR高出1.5~1.9 dB,并比次优的视频VAE(Wan-VAE)平均领先约2.02 dB PSNR,证明解耦动作潜变量有效消除了环境噪声对微小动作指令的掩蔽效应。
  • 消融模块对于下游动作生成影响远大于单纯重建:去掉 \(\mathcal{L}_{\text{motion}}\) 后,在Agibot重建任务上PSNR仅下降0.65 dB,但在RT-1下游动作生成任务上下跌近0.89 dB,LPIPS显著劣化;去掉两阶段Mask引导后下游动作PSNR同样暴跌约0.9 dB,印证了动作与背景解耦对于世界模型动作条件对齐的关键价值。
  • 大幅削减下游世界模型训练时间:预编码潜变量实验显示,相比于SDXL逐帧潜变量的高昂显存与漫长步时,EmbodiedVAE在1000步训练耗时缩短接近4倍,使大规模具身交互扩散模拟器的扩展成为可能。

亮点与洞察

  • 将“动静异质性”具象化为非对称时空压缩比:机械臂侧4倍时序/16倍空间下采样保动作轨迹,背景侧8倍时序/8倍空间下采样压冗余,用最纯粹的架构直觉解决了动作丢失与显存爆炸的矛盾。
  • 训练用掩码引导、推理无掩码依赖的两阶段设计:巧妙绕开了在测试时需要精确分割或多传感器输入的部署枷锁,让模型将语义解耦能力完全内化为双编码器的前向先验。
  • 最优传输从局部匹配升维到全局分布置换:将跨帧特征匹配建模为带熵正则化与正交惩罚的最优传输,不仅具有显式的单射数学保证,还通过Sinkhorn保持了端到端可微性,可无缝迁移至各类视频动力学建模任务。

局限与展望

  • 依赖第一视角固定或平缓运镜假设:非对称压缩中背景采用8倍超高时间压缩,高度依赖操作台场景中摄像头静态或仅有微弱晃动的物理前提;当机械臂搭载于移动底盘(Mobile Manipulation)发生全场景剧烈位移时,背景的高压缩率可能会引发背景模糊或伪影。
  • 受操作主体种类约束:训练第一阶段的掩码监督依赖于“机械臂”这一通用目标的先验分割;对于灵巧手微动、双臂协同以及柔性变形物体的精细交互,单一机械臂掩码可能不够精细。
  • 展望:可进一步将解耦分支从两路拓展为“机械臂-被操作刚体/柔性物体-静态背景”三路潜变量,在世界模型中对物体物理接触属性进行独立解耦与因果干预。

相关工作与启发

  • vs. Wan-VAE / Cog-VAE: 传统通用高质量视频VAE侧重自然景观与人物运动的大规模时空平滑压缩,无法为下游具身控制器提供纯净的动作潜特征;本文通过动静解耦不仅压缩率低至0.39%,还在具身操控动作生成中取得了2dB以上的质量与物理一致性优势。
  • vs. VidTwin / CMD: VidTwin和CMD虽然也尝试解耦视频结构与动态,但主要依赖全局流或无先验自监督,在复杂桌面机械臂遮挡交互中难以聚焦机械臂本身微小且至关重要的动作;EmbodiedVAE利用操作场景特异性设计非对称压缩与OT约束,动作控制鲁棒性大幅提升。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (针对具身场景特征创新性提出非对称时空压缩与OT运动一致性解耦机制)
  • 实验充分度: ⭐⭐⭐⭐⭐ (跨越百余万条真实机器人操控数据,涵盖两套重建测试集与两套具身生成测试集,消融严谨)
  • 写作质量: ⭐⭐⭐⭐⭐ (逻辑链条清晰紧密,动机、数学推导与实验论证环环相扣)
  • 价值: ⭐⭐⭐⭐⭐ (为具身世界模型与交互式机器人仿真提供了一个兼具极低计算开销与极高动作可控性的视频基础潜空间)