跳转至

EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/DCVL-3D/EgoGVAE_release
领域: 3D视觉
关键词: 第一人称人体网格重建、变分自编码器、潜空间引导、单步采样、实时推理

一句话总结

针对第一人称仅凭头部轨迹重建全身人体网格时扩散模型采样缓慢的问题,EgoGVAE 提出用以全身姿态为输入的变分自编码器潜空间先验来引导头部到动作网络,实现高保真度全身网格的单步快速重建(推理速度提升 50 倍以上)。

研究背景与动机

随着物理 AI 与具身智能的发展,智能眼镜(如 Project Aria)及头戴式显示设备(HMD)正逐步成为日常生活中的关键交互终端。在这类第一人称交互场景中,精准感知穿戴者的全身 3D 人体动作对于虚拟化身驱动、运动辅助和具身交互至关重要。然而,由于第一人称视角的穿戴相机无法观察到穿戴者绝大部分身体躯干与四肢,仅依赖头部单个关节(Head pose / SLAM 轨迹)推断高度欠定、未被观测的全身各关节动态具有极大的挑战性。

早期工作通常依赖控制器或腕带等手部运动跟踪传感器提供手部显式观测,但这限制了无需额外穿戴设备的轻量化日常场景。近期研究转向基于扩散模型(Diffusion Models)的头部条件动作生成方法(如 EgoEgo、EgoAllo),虽能利用强大的生成能力建模全身动作分布,但多步迭代去噪过程带来了极高的计算开销与推理延迟(处理 128 帧需数秒以上);若强制削减去噪步数,则容易产生严重抖动与肢体姿态不稳定。

本文的切入角度是:不必依赖高开销的扩散去噪循环,而是借助变分框架中丰富且紧凑的全身运动先验。若在训练阶段构建一个接收完整身体姿态作为输入的辅助先验网络,并将其潜空间分布作为“师范信号”来对齐仅输入头部轨迹的生成网络,就能在推理阶段实现质量稳定且仅需一次前向采样的极速网格重建。核心 idea:构建基于变分自编码器的引导式潜空间对齐机制(EgoGVAE),通过可学习身体 token 弥补视觉缺失,使头部动作网络在训练时与全身动作潜分布严格对齐,从而在测试时仅凭头部姿态进行单步快速采样与高保真全身网格解码。

方法详解

整体框架

EgoGVAE 由两个变分自编码网络协同构成:一个是以完整全身姿态序列为输入的动作到动作引导网络(Motion-to-Motion Network),另一个是仅以穿戴者头部轨迹及可学习补充 token 为输入的头部到动作生成网络(Head-to-Motion Network)。在训练阶段,两网络同时学习序列级高斯潜分布,并通过对称 KL 散度约束使头部生成网络的潜分布紧密逼近全身运动先验分布;在推理阶段,彻底丢弃全身引导网络,仅需将穿戴设备估算的头部姿态与可学习 token 送入编码器,单步采样潜特征并由共享解码器生成 SMPL-H 人体网格。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入头部轨迹<br/>(16维规范化相对姿态)"] --> B["头部嵌入与身体可学习Token拼接"]
    B --> C["头部到动作变分编码器<br/>输出参数 (μ^H, Σ^H)"]
    D["训练时全身姿态序列<br/>(关节局部旋转)"] --> E["动作到动作变分编码器<br/>输出参数 (μ^M, Σ^M)"]
    C & E --> F["变分潜空间分布对齐<br/>(对称 KL 散度与标准高斯正则)"]
    F --> G["单步重参数化采样潜特征 z^H"]
    G --> H["共享 Transformer 运动解码器"]
    H --> I["预测 SMPL-H 网格参数与触地概率"]

关键设计

1. 变分潜空间引导:全身运动先验对齐头部生成分布 仅输入头部轨迹难以直接恢复复杂的躯干与下肢动作,容易产生过平滑、手臂静止或肢体悬空的局部退化。为此,本文设计了一个以真实全身姿态序列为输入的 Motion-to-Motion 辅助分支作为 Variational Guide。该分支的 Transformer 编码器追加均值 token \(\boldsymbol{\mu}_{token}^M\) 与方差 token \(\boldsymbol{\Sigma}_{token}^M\),提取全序列的紧凑高斯分布 \(\mathcal{N}(\boldsymbol{\mu}^M, \boldsymbol{\Sigma}^M)\) 作为可靠的运动先验。Head-to-Motion 同样预测对应的参数 \(\boldsymbol{\mu}^H, \boldsymbol{\Sigma}^H\)。训练时通过最小化双向对称 Kullback–Leibler 散度使两者的潜空间强行靠拢:

\[ \mathcal{L}_\text{KL}^{H,M} = D_\text{KL}(\mathcal{N}(\boldsymbol{\mu}^H, \boldsymbol{\Sigma}^H) \parallel \mathcal{N}(\boldsymbol{\mu}^M, \boldsymbol{\Sigma}^M)) + D_\text{KL}(\mathcal{N}(\boldsymbol{\mu}^M, \boldsymbol{\Sigma}^M) \parallel \mathcal{N}(\boldsymbol{\mu}^H, \boldsymbol{\Sigma}^H)) \]

同时将两分布分别约束至标准正态分布 \(\mathcal{N}(\mathbf{0}, \mathbf{I})\)。这种分布级对称对齐使头部网络在潜空间内“学会”了全身运动的真实流形结构,推理阶段无需反复去噪迭代,直接通过单步采样即可解码出自然的全身姿态。

2. 可学习身体 Token 补全:消除异构输入的潜空间语义鸿沟 头部姿态轨迹(16 维/帧,包含相对运动、规范化朝向与绝对高度)与全身 21 个关节的旋转特征之间存在显著的维度与语义鸿沟。如果直接仅将头部特征输入 Transformer 编码器,难以和以全关节为输入的引导网络建立同质的注意力上下文。本文引入随时间步展开的可学习 token 序列 \(L_{token} \in \mathbb{R}^{T \times \text{dim}}\),用来显式隐式表征未被直接观测到的全身其余身体部位。轻量级 Transformer 先将头部轨迹提取为头部嵌入 \(E_W \in \mathbb{R}^{T \times \text{dim}}\),随后将其与可学习 token \(L_{token}\) 进行通道拼接后再送入变分编码器。这让自注意力机制能够在全序列维度建立头部与虚拟未观测躯干之间的交互拓扑,有效弥合了单关节输入与全身先验之间的表示差距。

3. 共享时序 Transformer 解码器与解耦查询机制 为了确保从对齐潜空间采样的隐变量能够精确还原为各时间步的人体姿态,模型采用参数共享的 Transformer 动作解码器。在解码阶段,将单步采样的全序列全局潜变量 \(\mathbf{z}^H \sim \mathcal{N}(\boldsymbol{\mu}^H, \boldsymbol{\Sigma}^H)\) 作为多头交叉注意力的 Key 和 Value;将编码器输出的时间步序列嵌入(头部与可学习 token 的融合表征)作为 Query。这样,全局潜变量 \(\mathbf{z}^H\) 提供了整段动作的整体风格、流形先验与协调性约束,而 Query 序列则保留了细粒度的时间对齐与头部运动驱动信号,最终解码输出各时间步的 SMPL-H 关节旋转 \(\hat{\theta}_t\)、身材参数 \(\hat{\beta}\) 与关节触地概率 \(\hat{\psi}_t\)。

损失函数 / 训练策略

模型采用端到端联合训练策略,总损失函数结合了全身重建误差、变分正则化以及平滑度约束:

\[ \mathcal{L}_\text{total} = \mathcal{L}_\text{rec} + \lambda_\text{KL}\mathcal{L}_\text{KL} + \lambda_\text{vel}\mathcal{L}_\text{vel} \]

其中重构损失 \(\mathcal{L}_\text{rec} = \mathcal{L}_\text{rot} + \mathcal{L}_\text{pos} + \lambda_\text{shape}\mathcal{L}_\text{shape} + \lambda_\text{contact}\mathcal{L}_\text{contact}\)。位置损失 \(\mathcal{L}_\text{pos}\) 基于 SMPL-H 正向运动学(FK)计算关节点 3D 欧氏距离;速度损失 \(\mathcal{L}_\text{vel}\) 惩罚相邻帧预测关节点速度与真值速度的差异以消除高频抖动;超参数设为 \(\lambda_\text{shape}=0.003, \lambda_\text{contact}=0.003, \lambda_\text{KL}=0.0004, \lambda_\text{vel}=0.003\)。测试长序列时采用滑动窗口机制,在线模式下单帧推理仅需 26 毫秒。

实验关键数据

主实验

在代表性动作捕捉基准 AMASS(128 帧序列)以及跨数据集测试(在 AMASS 训练并在富接触数据集 RICH 上零样本评估)上,EgoGVAE 与现有基于扩散模型(EgoEgo、EgoAllo)和回归模型(AvatarPoser、EgoPoser 改编版)进行了全面对比。

数据集 方法 MPJPE (mm) ↓ PA-MPJPE (mm) ↓ Ground (mm) ↓ \(T_{head}\) (mm) ↓ Jitter (\(10^2 m/s^3\)) ↓ Foot sliding (mm) ↓
AMASS AvatarPoser† 142.2 127.5 48.1 42.9 4.74 13.5
AMASS EgoPoser† 143.9 121.0 49.3 40.8 5.27 10.6
AMASS EgoEgo 167.4 145.8 47.1 54.9 4.22 11.7
AMASS EgoAllo (SOTA) 119.7 101.1 26.3 6.2 4.06 10.2
AMASS EgoGVAE (本文) 106.7 89.9 21.6 5.5 3.08 8.2
RICH (跨数据) AvatarPoser† 297.5 287.4 281.8 75.6 4.43 12.4
RICH (跨数据) EgoPoser† 314.4 305.9 161.3 108.5 5.12 9.5
RICH (跨数据) EgoEgo 210.7 180.1 93.6 134.5 3.61 12.7
RICH (跨数据) EgoAllo (SOTA) 193.1 172.9 71.9 7.7 5.07 15.9
RICH (跨数据) EgoGVAE (本文) 179.9 165.9 59.0 5.4 3.87 11.9

注:† 表示使用仅头部姿态重新训练的非扩散基线;在真实世界传感器数据 EgoBody 上,本文 MPJPE 亦达到 162.9 mm(优于 EgoAllo 的 172.9 mm)。

效率对比与消融实验

下表给出了处理 128 帧序列时与主流扩散方法的模型参数量、计算量及推理耗时对比,以及在 AMASS 上的关键架构消融分析。

模型 / 配置 参数量 (M) ↓ FLOPs (G) ↓ 推理时间 (s) ↓ MPJPE (mm) ↓ PA-MPJPE (mm) ↓ 说明
EgoEgo (扩散) 10.97 3025.13 7.222 167.4 145.8 1000步迭代采样,极其耗时
EgoAllo (扩散) 50.45 378.16 1.510 119.7 101.1 30步去噪,参数量膨胀且延迟超1秒
EgoGVAE (完整模型) 13.88 3.45 0.026 106.7 89.9 单步采样,速度快58倍,精度最高
无引导 (w/o Guidance) - - - 125.6 108.6 缺少全身分布引导,下肢动作严重失真
无可学习Token (w/o Learnable) - - - 113.7 94.5 仅用头部Token,潜空间对齐难度大
基线 (无引导 + 无Token) - - - 128.3 110.3 极度欠定,姿态僵硬
学习潜变量映射 (Latent-to-Latent) - - - 128.1 111.9 仅学确定性投影无法捕获分布方差
冻结预训练动作先验 - - - 111.2 94.5 先验固定不更新,限制了联合表征表达

关键发现

  • 对齐全身先验是克服欠定性的决定性因素:消融数据显示,仅加入变分潜空间引导即可使 MPJPE 从 128.3 mm 骤降至 113.7 mm(降低 14.6 mm),且显著减少了下肢动作的悬空或地面穿透现象。
  • 计算效率产生质的飞跃:相比需要 30 步迭代去噪的 SOTA 扩散模型 EgoAllo(耗时 1.51s,378G FLOPs),EgoGVAE 的单步变分采样机制将 FLOPs 压低至 3.45G,耗时降至 0.026 秒(26 毫秒),推理速度提升超 58 倍,满足了 AR/VR 设备的实时流式传输要求。
  • 联合训练显著优于冻结先验:对比使用冻结动作先验(MPJPE 111.2 mm),联合优化生成器与引导器(106.7 mm)能让潜流形兼顾头部条件引导的适配性,避免分布错配。

亮点与洞察

  • 训练期强指导、推理期零开销的蒸馏思想:将昂贵但信息完整的“全身动作潜空间”作为隐式教师,只在反向传播中施加分布对齐约束,推理阶段无需额外的教师计算或多步去噪,实现了高保真与极致轻量的双赢。
  • 以可学习 Token 充当隐式运动骨架骨架:由于头部单点输入信息严重稀疏,利用序列化可学习嵌入作为未观测身体关节的载体,成功规避了显式拼接伪关键点带来的级联误差。
  • 突破扩散模型在轻量化交互终端上的部署瓶颈:证明了在条件运动生成任务中,良好正则化的变分自编码器结合显式分布对齐,完全可以达到甚至超越小步数扩散模型的保真度与稳定性。

局限与展望

  • 极端剧烈剧烈运动下的动作多样性退化:由于变分自编码器趋向于平滑的高斯先验,在处理杂技、剧烈翻滚或非周期性高动态交互时,重建姿态可能略偏向平均姿态,生成多样性上限弱于充分采样的无约束扩散模型。
  • 环境交互与接触物理约束的感知缺失:模型仅凭头部运动与隐式触地概率预测姿态,缺乏外部 3D 场景网格(如沙发、楼梯、桌面)的物理碰撞检测,在复杂场景交互中偶有接触穿模。
  • 未来方向:可进一步探索将轻量级场景深度/表面法线或稀疏环境特征融入可学习 token,强化环境感知的接触一致性。

相关工作与启发

  • vs EgoAllo (SIGGRAPH Asia 2024):EgoAllo 采用扩散模型与地板对齐机制重建全身动作,虽然精度优于传统回归模型,但即便压缩至 30 步仍需 1.5 秒且模型体积达 50M;EgoGVAE 采用变分引导单步采样,参数量降低 72%,速度提升 58 倍,且在各个运动指标上全线超越。
  • vs EgoPoser / AvatarPoser:传统轻量级回归模型直接从稀疏跟踪点映射到 SMPL 旋转,在失去手部信号仅剩头部时性能断崖式下跌(MPJPE 突破 140 mm);EgoGVAE 证明只要在潜空间赋予正确的全身流形先验引导,单头部输入也能恢复出平滑自然的四肢动作。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [设计了简明高效的全身姿态潜空间变分引导与身体 Token 机制,打破了依赖扩散模型迭代的惯性思维]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖 AMASS、RICH 跨域评测、EgoBody 真实数据、长序列外推、在线流式以及细致的架构与设计消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密清晰,动机明确,方法架构与实验对比翔实自洽]
  • 价值: ⭐⭐⭐⭐⭐ [直接解决了智能眼镜与轻量 VR 终端全身化身驱动的低延迟落地痛点,开源代码具有极高实用价值]