跳转至

EgoExoMoCap: Distributed Human Motion Capture via Ego- and Exocentric Body Tracking from Head-Mounted Devices

会议: ECCV 2026
论文: ECCV 原文
代码: https://siplab.org/projects/EgoExoMoCap
领域: 人体理解 (human_understanding)
关键词: 分布式动捕、第一人称视觉、外中心跟踪、射线姿态表征、可见性门控

一句话总结

针对传统动捕依赖笨重多相机系统或穿戴式动捕服、而单视角穿戴设备难以准确估计下半身与全局运动的痛点,EgoExoMoCap 提出了一种仅需两人或多人佩戴头戴设备(如 Aria 智能眼镜)的分布式动捕框架,将第一人称连续惯导/SLAM 轨迹与第三人称间歇性图像的 3D 规范化射线相结合,并通过 DINOv3 上下文特征学习关键点置信度门控,在剧烈遮挡与出画场景下实现了高精度全身 3D 动作重建。

研究背景与动机

在真实开放场景下实现鲁棒、精确的人体动作捕捉,是机器人具身智能、VR/AR 协同交互以及数字人驱动的核心支撑技术。然而,传统的动作捕捉方案高度依赖专业搭建的多相机摄影棚或穿戴复杂的动捕服,部署成本高昂且受限于特定室内环境。近年来,随着搭载视觉惯性 SLAM 和相机的轻量化头戴显示设备(HMD,例如 Project Aria 智能眼镜)的普及,利用佩戴设备捕获第一人称(Egocentric)信号进行动捕成为热门路线。但纯第一人称方案面临视场角严重受限、佩戴者自身躯干和下肢极易不可见的根本瓶颈,仅凭头部和稀疏手部轨迹往往只能合成在统计上合理的动作,却无法忠实还原真实的下肢姿态(如坐姿、跪姿等)。

另一方面,依靠外部单目相机(如手机或旁观者视角)的外中心(Exocentric)人体动作估计方法,由于单目固有的尺度与深度二义性,难以在世界坐标系中稳定估计全局运动,同时极易受到旁观者相机快速晃动、运动模糊以及环境物体遮挡的严重干扰。以往研究通常将第一人称姿态估计与外中心多视角跟踪割裂开来,忽视了在多人协同现实场景中,每一个佩戴 HMD 的用户既是动作的执行主体,也是观察其他互动物体的移动观察者这一天然属性。

将多佩戴者之间的异构信号融合成统一的高保真动作捕捉框架,面临两大核心技术矛盾:其一是异构输入信号的坐标系对齐与观察者剧烈头动造成的视角扰动,其二是外中心观察具有高度间歇性——当观察者转头时被测者会完全离开画面,或在日常人-物交互中身体关键部位被桌椅家具大面积遮挡。本文的核心 idea 是:将第一人称粗估计作为锚点向外中心图像生成区域提议,将外中心 2D 关键点反投影为结合佩戴者-观察者间距的 3D 尺度射线并规范化至佩戴者头部局部坐标系,同时引入 DINOv3 提取全局语义上下文以学习关键点置信度软门控,在两阶段时空 Transformer 中以第一人称为主干、自适应吸收外中心几何线索。

方法详解

整体框架

EgoExoMoCap 整体流程划分为三大核心阶段:首先利用第一人称运动流经轻量时序网络粗估计佩戴者姿态并生成外中心视角的动态候选框(Region Proposal);其次在截取的候选区域内检测 2D 关键点,结合相机内外参和主体间距反投影为去旋转、尺度的规范化 3D 射线,并由 DINOv3 全局语义特征预测每个关节点对应的可见性置信度门控;最后构建 Ego Token 与 Exo Token,在空间 Transformer 中以第一人称为先验主导聚合多视角特征,再经过跨帧双向时序 Transformer 平滑输出全局旋转与关节局部姿态,并通过正向运动学(FK)解析求解根节点平移。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:佩戴者与观察者头部/手部轨迹 + 观察者图像"] --> B["EgoNet 粗估计与区域提议"]
    B --> C["外中心射线几何规范化"]
    B --> D["DINOv3 全局上下文置信度门控"]
    C --> E["Ego-Exo 时空两级聚合与解析解算"]
    D --> E
    E --> F["输出:全局 SMPL 全身人体运动轨迹"]

关键设计

1. EgoNet 粗估计与区域提议:摆脱对外部通用目标检测器的依赖 在观察者头部剧烈移动以及人-物体发生强交互遮挡时,通用 2D 检测器(如 YOLO)往往无法稳定给出佩戴者的边界框甚至直接漏检。为此,系统利用佩戴者自身的连续第一人称信号进行初始化引导。将佩戴者的头部 6DoF 位置、速度及其相对位移编码构造成 60 维特征向量(在配备手腕跟踪器时扩展为 54 维并结合 6 维位移),送入由单层 MLP-Mixer 构成的轻量 EgoNet 网络中,在时间维度与特征维度分别交叉混洗,快速回归出佩戴者的粗略全局方向与 SMPL 关节姿态。利用该粗估计姿态进行正向运动学推导得到世界坐标下的 3D 关节位置,并将其经由观察者的已知相机参数投影到观察者画面上,外扩预设裕度后生成稳定的动态 Region of Interest (RoI)。这一设计确保了后续视觉特征提取始终牢牢锁定被测者,即便佩戴者大半身形被遮蔽也不会丢失跟踪。

2. 外中心射线几何规范化:解耦观察者旋转漂移与绝对尺度二义性 在截取的 RoI 区域内通过 ViT-Pose 提取 \(K=13\) 个身体 2D 关键点。若直接将像素坐标送入神经网络,将与观察者相机的内参、瞬时朝向严重耦合,跨场景泛化极差。系统首先利用观察者相机的内参 \(K_{\text{obs}}\) 与世界旋转外参 \(R_{\text{obs}}\),将 2D 像素点反投影为世界坐标系下的单位方向射线 \(\hat{\mathbf{d}}_{t,j}\),消除了观察者快速转头导致的剧烈高频旋转方差。进一步,由于射线缺失绝对深度,系统计算观察者与佩戴者头部世界坐标之间的欧氏距离,以此尺度对单位射线进行拉伸,并以观察者头部全局位置为基底锚定出代理 3D 端点 \(\mathbf{e}_{t,j}\): $\(\mathbf{e}_{t,j} = \|\mathbf{p}_t^{w,\text{head}} - \mathbf{p}_t^{o,\text{head}}\| \cdot \hat{\mathbf{d}}_{t,j} + \mathbf{p}_t^{o,\text{head}}\)$ 为进一步消除佩戴者在空间中大范围位移带来的绝对坐标依赖,最终将代理端点转换到佩戴者头部的局部规范化坐标系下: $\(\mathbf{r}_{t,j} = \mathbf{R}_{w,\text{head}}^{-1} (\mathbf{e}_{t,j} - \mathbf{p}_t^{w,\text{head}})\)$ 由此得到的规范化射线特征 \(\mathbf{r}_t \in \mathbb{R}^{3K}\) 对两主体间距、观察者视角旋转以及佩戴者全局运动均具备严格的几何不变性。

3. DINOv3 全局上下文置信度门控:应对严重遮挡与出画干扰 在实际日常交互中,佩戴者下半身常被桌子、沙发等家具阻挡,或随观察者视角变化移出画幅外;此时传统 2D 检测器极易产生高置信度却严重错误的虚假预测。为了对不可靠的外中心信号进行自适应抑制,系统从相同的 RoI 裁剪块中提取 DINOv3 的全局分类标记特征 \(\mathbf{F}_{\text{CLS}} \in \mathbb{R}^{768}\),通过两层 MLP(维度 \(768 \to 512 \to K\))配合 Sigmoid 激活函数,预测各关节的独立可见性权重 \(w_{t,j} \in [0, 1]\): $\(\mathbf{w}_t = \sigma(\text{MLP}(\mathbf{F}_{\text{CLS}}))\)$ 将规范化射线与权重逐元素相乘得到门控射线 \(\hat{\mathbf{r}}_{t,j} = w_{t,j} \cdot \mathbf{r}_{t,j}\)。DINOv3 富含高阶场景语义与物体边界理解能力,能够明确判断某一身体部位是否实际暴露或掩映在障碍物后。当检测到身体部位完全被物体遮挡或位于视场边缘时,门控网络主动将其对应射线权重置零,迫使下游模型回退至平滑的第一人称先验。

4. Ego-Exo 时空两级聚合与解析根节点解算:保证稳健先验与时序平滑 将佩戴者的第一人称轨迹特征与 EgoNet 粗估计拼接得到 Ego Token,将门控射线特征映射为 Exo Token。每一帧的 [Ego Token, Exo Token] 构成短序列输入至单层 Spatial Transformer Encoder,仅保留 Ego Token 对应的聚合输出 \(\tilde{\mathbf{e}}_t\)。这一非对称设计赋予模型以第一人称信号为基底、外中心信号为辅助增强的归纳偏置,并且在存在 \(N\) 个观察者时可直接无缝扩展至 \([e_t, o_t^1, \dots, o_t^N]\)。随后,全序列 \(T=96\) 帧的聚合特征附加可学习时序位置编码送入双向 Temporal Transformer,捕获长程运动动力学约束。最后,轻量级 MLP 解码器回归根节点方向与 21 个身体关节的 6D 连续局部旋转,而全局根节点平移 \(\mathbf{p}_t^{w,\text{root}}\) 则无需网络拟合,直接由佩戴者头戴设备的已知世界位置结合姿态预测通过正向运动学链解析推导求得:\(\mathbf{p}_t^{w,\text{root}} = \mathbf{p}_t^{w,\text{head}} - \text{FK}_{\text{head}}(\hat{\boldsymbol{\theta}}_t)\),消除了全局平移累积漂移。

损失函数 / 训练策略

系统采用分步两阶段训练策略: 1. 阶段一(EgoNet 独立预训练):仅使用佩戴者第一人称数据训练 EgoNet,使其具备稳健的单人姿态初筛能力。 2. 阶段二(端到端融合训练):冻结预训练的 DINOv3 主干与 EgoNet,联合训练 ScoreNet、空间与时序 Transformer。训练采用联合 \(L_1\) 损失函数: $\(\mathcal{L} = \lambda_{\text{orient}} \mathcal{L}_{\text{orient}} + \lambda_{\text{rot}} \mathcal{L}_{\text{rot}} + \lambda_{\text{pos}} \mathcal{L}_{\text{pos}}\)$ 其中 \(\mathcal{L}_{\text{orient}}\) 监督根节点 6D 旋转,\(\mathcal{L}_{\text{rot}}\) 监督 \(J=21\) 个关节的 6D 局部旋转,\(\mathcal{L}_{\text{pos}}\) 计算经 SMPL 正向运动学派生出的 3D 关节笛卡尔坐标与真实值之间的距离。权重分别设定为 \(\lambda_{\text{orient}} = 0.02, \lambda_{\text{rot}} = 1.0, \lambda_{\text{pos}} = 1.0\)

实验关键数据

主实验

在真实复杂场景数据集 Nymeria(室内/室外日常长程活动)和 EgoHumans(动态剧烈多人运动交互,如羽毛球、网球、击剑)上开展评测。评测涵盖 3 点跟踪(头显 + 左右手腕)与 1 点跟踪(仅头显)两种硬件配置。评价指标包括关节平均位置误差(MPJPE, cm)、上半身误差(Upper, cm)、下半身误差(Lower, cm)、关节速度误差(MPJVE, cm/s)以及运动抖动度(Jitter, \(10^2 \text{ m/s}^3\))。

Table 1: Nymeria 数据集定量对比评测

方法 输入模态 3点 MPJPE (cm) 3点 Upper (cm) 3点 Lower (cm) 3点 MPJVE (cm/s) 3点 Jitter 1点 MPJPE (cm) 1点 Upper (cm) 1点 Lower (cm) 1点 MPJVE (cm/s) 1点 Jitter
AvatarPoser [39] Ego 8.16 3.82 14.43 13.62 2.20 12.38 9.22 16.94 18.90 4.07
EgoPoser [38] Ego 7.74 3.44 13.96 13.94 2.43 11.86 9.08 15.87 20.26 3.43
EgoAllo [99] Ego 8.77 3.18 16.84 12.81 1.72 12.53 8.27 18.68 20.17 1.96
RPM [12] Ego 12.19 3.50 24.74 17.62 1.29 16.83 9.39 27.58 18.93 1.15
PromptHMR [90] Exo 13.48 8.88 20.13 26.78 5.17 13.48 8.88 20.13 26.78 5.17
PromptHMR-Finetuned Exo 10.65 7.63 15.01 23.55 4.98 10.65 7.63 15.01 23.55 4.98
PromptHMR+EgoPoser EgoExo 6.47 3.41 10.90 17.49 3.08 9.03 6.74 12.34 17.52 3.17
EgoExoMoCap (本文) EgoExo 5.72 2.72 10.05 12.77 2.16 8.28 6.10 11.44 17.23 2.47

Table 2: EgoHumans 跨数据集及多观察者泛化评测

方法 / 配置 输入模态 3点 MPJPE (cm) 3点 Upper (cm) 3点 Lower (cm) 3点 MPJVE (cm/s) 3点 Jitter 1点 MPJPE (cm) 1点 Upper (cm) 1点 Lower (cm) 1点 MPJVE (cm/s) 1点 Jitter
AvatarPoser [39] Ego 9.60 4.34 17.18 32.94 3.08 14.17 10.38 19.64 54.60 3.84
EgoPoser [38] Ego 9.03 3.87 16.48 33.12 3.55 13.96 10.49 18.96 57.04 5.05
PromptHMR-Finetuned Exo 18.15 11.79 27.34 46.84 5.17 18.15 11.79 27.34 46.84 5.17
PromptHMR+EgoPoser EgoExo 8.62 4.24 14.94 34.01 2.79 13.27 8.96 19.50 41.88 2.71
EgoExoMoCap (本文) EgoExo 7.62 3.45 13.64 30.94 1.83 11.54 8.18 16.39 41.04 2.07
多视角评测子集:
EgoExo-单观察者* EgoExo 8.80 7.00 11.40 47.23 3.59 13.70 12.35 15.64 50.32 3.01
EgoExo-多视角三角化* Ego-Multi-Exo 8.49 6.58 11.25 44.38 3.23 13.34 11.83 15.52 49.04 2.90
EgoExo-多观察者 (本文)* Ego-Multi-Exo 7.11 5.89 8.87 37.31 2.58 10.48 9.59 11.77 45.50 2.83

消融实验

在 Nymeria 验证集上对核心设计要素进行模块化消融,考察第一人称/外中心模态贡献、提议机制、门控策略以及射线空间变换。

Table 3: Nymeria 消融实验

模块类别 变体配置 MPJPE (cm) Upper (cm) Lower (cm) MPJVE (cm/s) Jitter (\(10^2 \text{ m/s}^3\)) 关键说明
默认设置 EgoExoMoCap 完整模型 5.72 2.72 10.05 12.77 2.16 完整双模态融合架构
模态与提议 去除第一人称 (w/o Ego) 11.45 8.00 16.43 34.40 6.55 丧失强先验导致抖动剧增、平滑度恶化
去除外中心图像 (w/o Exo) 7.53 3.38 13.53 13.78 2.19 下肢无法获得视觉几何校验,误差增大
去除 Ego 区域提议 (w/o Ego BBX) 6.43 3.05 11.31 15.54 2.80 改用通用 YOLO,因交互遮挡导致候选框漂移
可见性门控 去除 DINO 分数 (w/o DINO Score) 6.30 3.00 11.08 14.42 2.38 虚假 2D 关键点未被抑制直接污染时空特征
改用 ViTPose 自身置信度 (w/ ViT Score) 6.29 2.92 11.16 13.91 2.23 2D 检测器置信度在遮挡下不可靠
显式置零硬门控 (w/ Masking < 0.2) 6.32 2.99 11.14 15.31 2.68 硬截断导致特征出现非平滑突变
射线几何表征 射线保持在世界坐标系 (w/ Ray in World-Space) 6.99 3.15 12.54 13.87 2.44 观察者头动未被解耦,泛化性能显著下降
射线保持在外中心局部坐标 (w/ Ray in Exo-Space) 6.14 2.92 10.78 13.22 2.21 缺失佩戴者自身局部坐标归一化
去除深度尺度缩放 (w/o Depth Scaling) 6.26 2.99 10.97 13.26 2.19 射线端点丧失距离约束,引入尺度歧义
去除 3D 射线直接用 2D (w/o Lifting) 6.26 2.97 11.00 13.81 2.33 无法建立空间立体对应

关键发现

  • 外中心视觉弥补下半身盲区:在纯第一人称基线中,下半身误差普遍高达 13.96~27.58 cm;引入外中心射线后,EgoExoMoCap 在 3 点配置下将下半身误差显著压制至 10.05 cm(相比 EgoPoser 降低了近 28%),证明第三人称视角是解决下肢坐姿、曲腿等隐藏姿态的关键线索。
  • DINO 上下文门控对遮挡鲁棒性起决定作用:直接结合 PromptHMR 与 EgoPoser 的朴素融合基线速度误差和抖动大幅恶化(MPJVE 达 17.49 cm/s);而通过 DINOv3 语义特征预测置信度门控后,模型不仅在消融中将 MPJPE 从 6.30 cm 降低至 5.72 cm,并在家具遮挡等真实案例中将关节点误差从 16.37 cm 压制到 7.92 cm。
  • 分布式多视角具备自然扩展增益:在 EgoHumans 多观察者子集上,单视角外中心估计的 MPJPE 为 8.80 cm,而随着多个佩戴者视角在空间 Transformer 中联合注视聚合,误差进一步下降到 7.11 cm,显著超越传统的多视角几何三角化基线(8.49 cm)。

亮点与洞察

  • 将多用户穿戴设备由单向采集器转变为协同动捕网络:以往研究把 HMD 视作孤立个体传感器,本文将其重构为“自身动作载体 + 他人移动观测哨”的分布式集群,仅需日常轻量眼镜即可免除动捕服和固定相机棚。
  • 巧妙的旋转解耦与尺度拉伸规范化射线:利用观察者外参将 2D 像素反投影为世界方向,并用头部欧氏间距赋予米制尺度后转换入佩戴者头部坐标系,消除了观察者摇头抖动带来的高频噪声与绝对世界坐标过拟合。
  • 可复用的高层视觉语义指导底层关键点门控机制:利用冻结的通用基础模型 DINOv3 判别物体拓扑与人身遮挡关系,为 2D 关键点学习连续软权重,这一设计可直接迁移到任何存在视线遮挡的多模态感知任务中。

局限与展望

  • 极端人身遮挡下的身份混淆:作者指出当佩戴者被另一名体态接近的路人或参与者完全重叠遮挡时,DINOv3 的区域特征可能会被干扰,导致置信度误判。
  • 体型参数先验依赖:当前系统假设佩戴者的 SMPL 体型参数(Shape)已知或采用标准模板,未在流程中端到端联合反演个性化体型网格。
  • 物理合理性约束仍可加强:长程外中心信号完全缺失时模型回退至纯第一人称,偶现微弱的足底滑动(Foot Skating)或肢体自穿透,未来可引入接触物理模拟或 3D 场景交互接触先验进行物理后验优化。

相关工作与启发

  • vs EgoPoser [38] / AvatarPoser [39]:经典第一人称动捕仅依赖佩戴者稀疏惯导和头部姿态,面对复杂下肢动作存在天然统计歧义;EgoExoMoCap 引入外中心协同观察流,用空间射线补足了缺失的视线几何。
  • vs PromptHMR [90] / WHAM [73]:传统单目外中心视频动捕依赖全局 SLAM 恢复相机轨迹,在剧烈运动模糊和视角出画时常发生崩溃;本文以连续无漂移的第一人称头显 SLAM 轨迹为主锚点,解析解算根节点位移,彻底克服了单目尺度漂移。
  • vs EgoHumans [43] 多视角基准:传统方法利用多视角多相机进行刚性三角化(Triangulation),对单视角遮挡极不敏感;本文采用学习型注意力软聚合,自适应滤除不可靠视角的干扰。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出去中心化的穿戴式分布式 Ego-Exo 协同动作捕捉架构,射线几何与 DINO 语义门控设计优雅。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 Nymeria 与 EgoHumans 两大顶尖多模态在野数据集,详实的消融与多视角对比充分验证了各模块有效性。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照自洽,问题建模与几何推导清晰透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为具身智能具身交互数据采集、VR/AR 协同提供了颠覆传统高昂动捕棚的高泛化、低成本可行方案。