跳转至

Exo2EgoPolicy: Pose-Aligned Cross-View Policy Learning

会议: ECCV 2026
论文: ECCV 原文
领域: 机器人/具身智能
关键词: 跨视角迁移、位姿流扩散模型、时序流形正则、具身协同训练、双手机器人操作

一句话总结

Exo2EgoPolicy 摒弃了容易产生空间形变与高频抖动的像素级跨视角视频生成范式,将第三人称人类操作视频直接投影并扩散翻译为第一人称 SE(3) 手-物位姿流,借助时序收敛正则与统一状态-动作空间,成功与少量真机遥操作数据联合训练人形双臂控制策略,使长程任务成功率显著提高。

研究背景与动机

从海量非结构化的人类活动视频中学习机器人操作策略,是突破具身智能数据匮乏瓶颈的关键路径。人类神经系统拥有天然的镜像神经元机制,能够通过观察他人的第三人称动作直观推断出自身第一人称视角下的相对运动与抓握几何。然而,互联网中压倒性多数的人类演示均以第三人称(外中心视角)记录,直接应用到以第一人称(自中心视角)为基准的机器人闭环控制时存在严重的视点错位与几何盲区。外中心记录中频繁出现的手部自遮挡、物体背面接触盲区以及相机外参未知性,使跨视角映射成为极端欠定的逆问题。

现有探索主要沿着两条路径展开:几何回归方法(如 NeRF/3DGS 视角合成)高度依赖密集多视角输入,在单目重度遮挡下极易退化;而基于生成式扩散模型的像素级视频转换虽然能产生视觉上逼真的第一人称图像,却往往伴随严重的几何漂移、结构畸变和帧间高频抖动。这种逐帧独立幻觉生成的像素噪点直接破坏了机器人底层控制器所需的平滑运动学与速度/加速度连续性。更为根本的问题在于研究目标的错配:机器人操作策略关心的本质上是末端执行器与操作对象之间的相对几何位姿演化,而非场景背景纹理的真实渲染,在像素空间死磕生成反而引入了大量与任务无关的冗余方差。

面对这一核心矛盾,本文提出从「像素空间图像生成」全面转向「流形空间几何位姿对齐」。作者通过马尔可夫决策过程理论证明,在准静态操作任务中手-物相对位姿是策略学习的充分统计量。核心 idea:将单目第三人称视频转换建模为 SE(3) 流形上的视点条件扩散位姿生成过程,结合物体相对坐标系消除相机外参不确定性,并引入具有收缩性质的前向动力学时序正则,直接输出平滑且几何自洽的第一人称手-物运动轨迹与机器人遥操作数据联合训练。

方法详解

整体框架

Exo2EgoPolicy 的整体流程由四个紧密耦合的阶段组成:单目外中心几何特征提取、SE(3) 流形视点条件位姿扩散、时序流形平滑正则,以及第一人称统一状态-动作空间协同策略训练。整个系统从非标定单目外中心视频开始,逐帧提取视觉与外中心先验位姿编码;随后在以操作物体为原点的局部参考系中,通过连续时间扩散逆向过程生成自中心手-物位姿;接着引入基于李代数测地距离的前向运动先验,对位姿轨迹施加时序平滑与误差收缩约束;最后将生成的人类第一人称手部运动与真机遥操作数据一同映射到统一状态-动作空间,驱动双臂策略网络端到端学习。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单目外中心视频 + 粗估计位姿"] --> B["几何特征编码器<br/>DINOv2 + MLP 提取几何潜码"]
    B --> C["SE(3) 物体局部坐标扩散模型<br/>消除未知外参并逆扩散生成第一人称位姿"]
    C --> D["时序动力学正则化<br/>李代数低通滤波与有界误差收缩"]
    D --> E["统一状态-动作空间协同训练<br/>人类演示与真机遥操作联合模仿学习"]
    E --> F["人形双臂机器人操作策略输出"]

关键设计

1. SE(3) 物体局部坐标系与跨视角位姿扩散:消除相机外参歧义 单目第三人称到第一人称的映射存在不可逆的深度与相机外参未定性。若在世界全局坐标系下直接回归绝对坐标,模型必须在无外参先验下同时解耦相机自运动与手-物交互,导致解空间极度发散。为此,作者将生成目标严格定义为手部相对于操作目标物体的局部相对位姿: $\(p_t = (p_t^{\text{obj}})^{-1} \cdot p_t^{\text{hand}} \in \mathcal{M}_{\text{pose}}\)$ 其中手部状态包含 6-DoF 手腕位姿与 \(K\) 维手指关节自由度,物体状态为 6-DoF 刚体位姿。通过以局部刚体物体为几何参考针脚,动态相机的晃动与绝对外参被完全边缘化。在生成架构上,框架构建了连续时间高斯扰动前向过程与逆向随机微分方程(Reverse SDE),在条件分数网络 \(s_\psi(p_t^{(\tau)}, \tau, z_t)\) 的引导下逐步去噪,其中 \(z_t\) 融合了 DINOv2 视觉表征与外中心粗估计位姿,从而将像素生成难题化简为刚体运动学流形上的精确推断。

2. 基于李代数差分的前向运动先验:实现轨迹全局收敛与防抖 独立逐帧扩散生成的位姿序列虽然空间几何合理,但缺乏时序物理连贯性,极易造成执行器指令的高频颤动。为此,分数网络显式自回归拼接上一帧状态 \(p_{t-1}\),并引入基于 GRU 学习的前向运动先验模型 \(\Phi(p_{t-1}, z_t)\)。为度量非欧几里得流形上的运动偏差,采用李群差分算子 \(a \boxminus b \triangleq \log_{\text{SE}(3)}(a \cdot b^{-1})\),构建时序一致性损失: $\(\mathcal{L}_{\text{temp}} = \sum_{t=2}^{T} \left( \|\hat{p}_t^{\text{hand}} \boxminus \Phi_{\text{hand}}(p_{t-1}, z_t)\| + \beta \|\hat{p}_t^{\text{obj}} \boxminus \Phi_{\text{obj}}(p_{t-1}, z_t)\| \right)\)$ 该损失在流形测地线上充当低通滤波器,过滤掉非物理跃变。通过谱归一化将转移算子 \(\Phi\) 的 Lipschitz 常数严格约束为 \(L < 1\)(实验中设为 0.95),从理论上证明了全局累积误差上界 \(\sup_{t} \mathbb{E}[d_{\mathcal{M}}(\hat{p}_t, p_t^*)] \le \frac{\epsilon}{1-L}\),彻底根除了跨视角动作生成的累积漂移风险。

3. 准静态 MDP 充分统计量与跨实体统一协同训练:打破真实机器人数据荒 以往跨实体学习常受困于人类肉手与机械夹爪/灵巧手之间的外观鸿沟。针对准静态物体操作,操作回报 \(R\) 完全取决于末端接触面与物体的相对几何构型 \(\delta_t = (p_t^{\text{obj}})^{-1} \cdot p_t^{\text{hand}}\)。背景杂物、环境光照与相机内参均为马尔可夫决策过程中的冗余变量。据此,作者构建统一状态-动作表示,将转换后的人类第一人称轨迹(人类手部末端位移)与昂贵的真机遥操作数据汇入共享空间,通过 Action Transformer 构建策略网络 \(\pi_\theta(a_t \mid p_{t-H:t})\),执行加权联合行为克隆: $\(\mathcal{L}_{\text{policy}}(\theta) = \mathbb{E}_{(p,a)\sim\mathcal{D}_{\text{robot}}} [\ell(\pi_\theta(p), a)] + \mu \mathbb{E}_{(\hat{p},\hat{a})\sim\mathcal{D}_{\text{human}}^{\text{trans}}} [\ell(\pi_\theta(\hat{p}), \hat{a})]\)$ 利用梯度范数平衡超参数 \(\mu=0.3\),使数以万计的人类视频无缝注水至机器人策略,赋予策略强大的开环探索基线与闭环操作鲁棒性。

损失函数 / 训练策略

整个系统采用分步解耦训练: 1. 位姿扩散模型训练:在 OakInk V2、H2O、AssemblyHands 和 Assembly101 上联合训练 200 个 epoch,采用 AdamW 优化器,学习率 \(3 \times 10^{-4}\),5K 步预热搭配余弦退火。总体优化目标为 \(\mathcal{L}_{\text{diff}} + \alpha \mathcal{L}_{\text{temp}}\),其中扩散损失 \(\mathcal{L}_{\text{diff}}\) 采用连续时间分数匹配加权 \(\lambda(\tau) = 1 - \cos(\pi \tau / 2)\),时序平衡权重 \(\beta=0.5\)。 2. 前向运动先验 \(\Phi\):采用 2 层 GRU,隐藏层维度 256,利用真值位姿轨迹预训练 20 个 epoch,并施加谱归一化确保收缩性。 3. 策略协同训练:在 Isaac Lab 环境中结合 Unitree H1 双臂人形机器人遥操作数据与 TACO、Mimicplay 转换生成的数据,采用 Action Transformer 结构,预测视界 \(H\) 历史帧对应的动作序列。

实验关键数据

主实验

论文在 H2O 数据集上对比了多种外中心到自中心生成的位姿质量(从像素合成基准中使用 HAMER 和 FoundationPose 提取位姿),并在 Unitree H1 人形机器人操作基准(Ego Humanoid Manipulation Benchmark)上评估短程与长程操作策略成功率。

表 1:H2O 跨视角手部位姿转换精度对比(原论文 Table 1 节选)

方法 Unseen Objects PA-MPJPE (mm)↓ Unseen Objects F@5mm↑ Unseen Objects F@15mm↑ Unseen Actions PA-MPJPE (mm)↓ Unseen Actions F@15mm↑
Pix2PixHD 42.6 0.142 0.412 46.3 0.374
Exo2Ego-V 24.1 0.312 0.645 28.4 0.601
EgoWorld 19.4 0.421 0.762 23.1 0.714
4Diff 18.2 0.448 0.782 21.7 0.738
EgoX 15.7 0.521 0.844 18.9 0.798
Ours (Exo2EgoPolicy) 11.4 0.685 0.912 14.2 0.874

表 2:长程操作任务策略成功率对比(原论文 Table 4 节选,Unitree H1 双臂)

方法类别与代表方法 Seen 环境平均成功率 SR (%)↑ Seen 环境平均进展率 PSR (%)↑ Unseen 环境平均成功率 SR (%)↑ Unseen 环境平均进展率 PSR (%)↑
纯机器人遥操作 (ACT) 2.2 26.5 0.6 23.5
纯机器人遥操作 (EgoVLA-NoPretrain) 26.7 54.9 11.2 36.2
人类数据无视角转换 (Exo-only) 27.6 56.3 12.1 37.6
像素级跨视角视频生成 (EgoX) 41.5 73.1 23.9 61.9
第一人称视频直接预训练 (EgoVLA) 45.9 80.8 28.8 69.1
位姿流跨视角协同训练 (Ours) 53.3 84.3 36.1 74.5

消融实验

论文在 H2O 未见物体测试集(位姿生成指标)与具身评测 Unseen 环境(策略成功率)下全面验证了各核心组件的作用。

表 3:核心机制消融分析(原论文 Table 5)

配置 PA-MPJPE (mm)↓ F@15mm↑ Short-Horizon SR (%)↑ Long-Horizon SR (%)↑ 说明
Ours (完整模型) 11.4 0.912 73.7 36.1 完整模型性能
(a) 移除物体局部坐标系 18.4 0.712 58.3 20.1 在世界系预测,丧失局部不变性,外参漂移严重
(b) 移除几何隐变量 \(z_t\) (直接回归) 21.6 0.671 54.7 17.4 退化为普通确定性映射,无法应对单目视点模糊
(c) 移除自回归条件 \(p_{t-1}\) 17.1 0.783 62.4 24.8 去噪失去时序上下文支撑,轨迹抖动加大
(d) 移除完整时序正则模块 \(\mathcal{L}_{\text{temp}}\) 19.3 0.748 57.9 19.8 失去李代数前向先验约束,长程任务累积抖动加剧

关键发现

  • 直接加入第三人称位姿收效甚微:Exo-only 对比 EgoVLA-NoPretrain 在短程 Seen 环境下成功率仅微增 1.1%(64.6% vs 65.7%),长程 Unseen 环境下仅增加 0.9%(11.2% vs 12.1%),说明如果不进行严格的几何视点转换,视点分布漂移导致网络无法吸收外中心动作知识。
  • 几何抽象优于像素幻觉生成:对比最先进的像素级视频生成模型 EgoX,本文直接生成位姿的方法将手部关节误差从 15.7mm 降至 11.4mm,在机器人长程 Unseen 任务中成功率从 23.9% 提升至 36.1%,绝对提升达 12.2 个百分点,充分印证了像素级视频中的结构形变会严重劣化提取出的动作指令。
  • 时序正则化是长程任务的决胜因素:在消融实验中,去掉时序正则损失 \(\mathcal{L}_{\text{temp}}\) 导致长程操作成功率近乎腰斩(36.1% 暴跌至 19.8%),这证实了具有收缩保证的运动学先验对于抑制复合决策误差具有不可替代的价值。

亮点与洞察

  • 范式重塑(从像素纹理到几何流形):将跨视角视频迁移从昂贵的视频渲染降维为 SE(3) 流形上的动力学位姿生成,以极低的信息冗余直击具身操作的核心状态表征。
  • 以物体为锚点的坐标解耦机制:巧妙地利用操作对象构建局部坐标系,直接规避了移动单目相机未知外参的数学不适定性,使单视角视频具备确定性的刚体可辨识性。
  • 有理论保障的时序防抖设计:将机器人控制领域的李代数滤波理念与扩散模型相结合,引入谱归一化前向先验实现误差收缩上界,彻底解决了生成式模型应用于控制任务时的抖动隐患。

局限与展望

  • 高度依赖上游单目姿态估计器:流程依赖 HAMER 与 FoundationPose 进行离线提取,若初始外中心视频出现极端大面积遮挡或透明/无纹理物体,上游姿态噪声会直接污染扩散模型的输入潜码。
  • 准静态假设与接触形变限制:方法假设操作任务主要是准静态且奖励由刚体相对几何主导,对于流体倾倒、布料揉捏等非刚体变形操作,刚体 SE(3) 相对位姿表征将面临表达力瓶颈。
  • 未来方向:可进一步将末端触觉力反馈与全身动力学(Whole-body Control)纳入该几何流形框架,并探索从野外单目视频中无监督自适应微调位姿估计器。

相关工作与启发

  • vs EgoWorld / 4Diff / EgoX: 这类像素生成方法致力于补全外中心缺失视角的 RGB 画面,但存在几何失真与时序闪烁;本文将视点转换限制在流形位姿空间,生成的动作轨迹满足平滑运动学约束,更适合直接用于控制。
  • vs EgoVLA: EgoVLA 依赖大量稀缺的第一人称人类视频进行预训练;本文证明通过高质量的跨视角几何投影,海量的第三人称人类视频可以完全对齐为第一人称数据,在长程任务上甚至超越了仅利用第一人称数据的基线。
  • vs DexCap / HumanPlus: 传统跨实体模仿依赖昂贵的数据手套或复杂的外骨骼动捕重定向;本文仅需单目 RGB 视频即可完成端到端动作迁移,数据扩展潜力显著更高。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙跳过像素合成瓶颈,首创基于 SE(3) 流形扩散的跨视角位姿对齐框架,理论与动机自洽。
  • 实验充分度: ⭐⭐⭐⭐⭐ 在 H2O、Assembly101 等位姿基准以及 Isaac Lab 人形双臂 12 项长/短程任务中进行了详尽评测与严谨消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论证明完整,数学推导与流程架构清晰,问题动机切中具身控制实际痛点。
  • 价值: ⭐⭐⭐⭐⭐ 为低成本将互联网海量第三人称人类动作视频转化为高精度机器人操作数据开辟了极其扎实可行的技术路径。