Towards Real-World Wearable Motion Reconstruction¶
会议: ECCV 2026
论文: ECCV Official
领域: 人体理解
关键词: 穿戴式动作捕捉, 多模态融合, 条件流匹配, 传感器互补性, 稀疏姿态估计
一句话总结¶
针对真实日常穿戴设备组合多变且稀疏的痛点,本文构建了包含日常手机、手表、头显与足压鞋垫并由 120 目动捕系统标定的多模态数据集,提出基于流匹配的生成模型 WHIP,实现了任意传感器子集下的高质量全身三维人体动作重建与系统级互补性量化。
研究背景与动机¶
人体动作捕捉(MoCap)在虚拟现实、智能健康、机器人和动画影视中具有基础性地位。然而,传统光学动捕系统需要昂贵的标记服和受控室内棚,而纯视觉多相机方案对物理空间基础设施依赖极高,难以走出实验室。近年来以稀疏惯性测量单元(IMU)为核心的轻量化方案取得了长足进展,例如基于 6 个专用 IMU 的穿戴套装,但日常佩戴仍然繁琐且需要严格身体标定;头显(HMD)与手柄追踪在上半身精度突出,却受限于下半身视觉盲区与运动歧义性;而足底压力鞋垫虽能精确捕获足底与地面接触动力学及步态支撑,却往往局限在受控步态实验中,难以与其它穿戴传感器联合建模。
现有可穿戴动捕研究普遍存在一个核心矛盾:算法往往高度绑定于预设固定的传感器拓扑(例如必须佩戴完整 6-IMU 套装或专属 VR 套件),然而在真实日常生活中,用户佩戴的设备组合是动态异构且极度随意的——一个人可能只带手机和手表,也可能在室内戴头显,或在跑步时穿智能鞋垫。现有多模态模型缺乏统一的理论表征与时空对齐基准,遇到传感器缺失时往往彻底失效。
为了打破固定硬件捆绑的局限,本文的切入角度是直接面向消费级日常穿戴设备(智能手机、智能手表、足压鞋垫与 VR 头显),从基准数据集与自适应生成模型双向攻关。核心 idea:构建首个高精度动捕同步的多模态消费级穿戴数据集,并提出支持任意传感器子集即插即用的条件流匹配生成模型 WHIP,通过模态专用交叉注意力解耦稀疏信号输入,实现兼具高物理真实感的人体动作重建与系统的传感器互补性评估。
方法详解¶
整体框架¶
WHIP 旨在从任意传感器子集构成的稀疏观测序列中,恢复完整时序的三维人体骨骼运动 \(X = \{J_t\}_{t=1}^T \in \mathbb{R}^{T \times J \times 3}\)。系统不仅要容纳不同传感器采样频率、坐标系差异与缺失模态,还要建模稀疏甚至单模态输入到完整全身姿态之间的多义映射。
整体流程包含三个核心阶段:首先,将采集到的异构穿戴信号统一降采样至 30 Hz 并投影到设备局部坐标空间;其次,序列级条件(流时间步与可选动作标签)经由自适应层归一化(adaLN)注入骨干网络,而各传感器的时序特征由专属轻量 MLP 映射为时序 Token 并切分进状态空间的保留通道;最后,基于扩散 Transformer(DiT)搭建 8 层骨干网络,通过动态激活的模态专用交叉注意力模块,从标准高斯噪声中利用条件流匹配积分求解出物理合理的连续三维动作序列。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:任意穿戴传感器子集<br/>手机 / 手表 / 头显 / 鞋垫 / 动作标签"] --> B["多模态时空校准与特征投影<br/>局部坐标解耦 + 独立时序MLP编码"]
B --> C["条件流匹配生成骨干<br/>8层DiT + adaLN注入流时间与动作类别"]
C --> D["模态专属动态交叉注意力<br/>按活跃传感器子集计算并加权聚合"]
D --> E["常微分方程欧拉积分推断<br/>速度场迭代生成平滑3D人体动作"]
关键设计¶
1. 多模态时空校准与特征投影:统一异构非侵入设备坐标基准
真实消费级设备缺乏全局统一时钟且磁力计易受室内环境干扰。为了避免漂移严重的全局地磁航向估计,模型在设备局部坐标系中处理输入:手机(双侧裤袋)和手表(双侧手腕)提供局部姿态估计 \(R_{D,t}^S \in \mathrm{SO}(3)\)、角速度 \(\omega\) 与线性加速度 \(a\);Meta Quest 3 头显提供 6-DoF 头部追踪位姿;Moticon OpenGo 智能鞋垫则输出双脚 16 区域足底压力值 \(p \in \mathbb{R}^{16}\) 及内置 IMU 原始角速度和加速度。系统通过会话初始设计的激励动作优化外参变换矩阵 \(R_c, R_r\) 与时间偏移 \(t_0\) 完成标定;针对运动过程中的滑动,通过 20 秒动作块自适应补偿安装偏移。各模态经过专属轻量级时序 \(\mathrm{MLP}_m\) 投影为维度为 64 的时序特征 Token \(\mathbf{c}_t^m = \mathrm{MLP}_m(\mathbf{s}_t^m)\)。
2. 条件流匹配生成骨干:连续概率流建模稀疏输入的不确定性
稀疏传感器映射到全身骨骼姿态在动力学上严重欠定(例如仅靠头部无法唯一确定腿部弯曲状态)。传统确定性回归容易产生平均化模糊或滑步假象。WHIP 引入条件流匹配(Conditional Flow Matching)范式,学习向量场 \(u_\tau(X_\tau, C)\) 推动先验高斯噪声 \(X_0 \sim \mathcal{N}(0, I)\) 沿概率路径流向真实动作分布 \(X_1 \sim p_1(\cdot|C)\)。流匹配采用线性插值路径:
骨干网络基于 8 层 Diffusion Transformer(DiT)构建,隐层维度 \(d=768\)、12 个注意力头。骨骼动作 Token 空间显式划分为运动子空间与传感器保留子空间 \(x_t = [x_t^{\text{mot}}; x_t^{\text{sens}}]\)。流时间步 \(\tau \in [0, 1]\) 与动作类别标签转换为序列级嵌入,通过 adaLN 调制每个 Transformer 块的归一化层,从而引导去噪流场的演化方向。
3. 模态专属动态交叉注意力:即插即用的任意传感器子集聚合
为了实现任意传感器配置下的无缝切换与缺失鲁棒性,WHIP 放弃了直接拼接特征的做法,而是为每个传感器实例(HMD、智能鞋垫、左右手表、左右手机共 6 个模态源)构建独立的跨注意力模块 \(\text{CrossAttn}_m\)。在推断时,若某传感器缺失,其对应分支完全被跳过而不参与计算;若传感器存在,则动作 Token 作为 Query 检索对应传感器的特征序列。为了在动态变化的可用传感器集合 \(\mathcal{M}\) 下保持残差分支的方差稳定性,模型引入自适应平方根缩放归一化因子:
训练过程中引入模态级 Dropout(各传感器保留概率为 0.5),使网络在训练期充分适应从单传感器到全套装备的各种组合分布,赋予模型极端情况下的容错与即插即用特性。
损失函数 / 训练策略¶
模型在滑动时间窗口 \(T = 90\) 帧(30 fps 下对应 3 秒时序)上分块训练,批量大小为 64。训练目标为条件流匹配均方误差损失:
采用 AdamW 优化器,学习率设为 \(10^{-3}\),配合 WSD(Warmup-Stable-Decay)学习率衰减策略迭代训练 110k 步。推断阶段,从标准高斯噪声采样 \(X_0\),基于显式欧拉积分求解器沿时间步 \(\tau \in [0, 1]\) 进行数值积分;为了严格且客观地与确定性回归基准进行公平比较,评估时不采用投机性的 best-of-K 抽样,而是采用后验均值贝叶斯估计量,取 \(K=10\) 次生成样本的经验均值 \(\hat{X} = \frac{1}{K} \sum_{k=1}^K X_k\) 作为最终预测。
实验关键数据¶
主实验¶
论文在留出测试集(包含未见过的受试者 Unseen Actor 与未见过的动作类别 Unseen Action)上进行了多传感器配置评估。评价指标包括关节位置误差 MPJPE(对齐根节点后,mm)、均方根误差 MRE(mm)、尺度归一化误差 N-MPJPE(mm)及普氏对齐误差 PA-MPJPE(mm)。基线模型(参数量对齐的 MLP 与 Transformer 回归器)缺失传感器特征置零。
| 评估划分 | 方法 | 参数量 | MPJPE ↓ | MRE ↓ | PA-MPJPE ↓ | N-MPJPE (全套) ↓ | N-MPJPE (仅头显) ↓ | N-MPJPE (仅鞋垫) ↓ | N-MPJPE (表+机均值) ↓ | N-MPJPE (全配置均值) ↓ |
|---|---|---|---|---|---|---|---|---|---|---|
| 未见受试者 | MLP 回归基线 | 54.6M | 127.8 | 147.5 | 95.0 | 203.2 | 157.0 | 123.8 | 120.1 | 120.1 |
| (Unseen Actor) | Transformer 回归基线 | 57.4M | 78.3 | 135.9 | 61.8 | 125.9 | 147.6 | 98.9 | 93.9 | 93.9 |
| WHIP (本文) | 59.4M | 56.7 | 107.4 | 46.5 | 54.6 | 151.7 | 83.0 | 77.9 | 77.9 | |
| 未见动作 | MLP 回归基线 | 54.6M | 128.5 | 140.9 | 106.6 | 146.5 | 142.3 | 128.7 | 125.1 | 125.1 |
| (Unseen Action) | Transformer 回归基线 | 57.4M | 83.3 | 140.5 | 74.1 | 80.3 | 130.6 | 115.8 | 106.0 | 106.0 |
| WHIP (本文) | 59.4M | 60.0 | 106.6 | 55.7 | 37.5 | 121.8 | 99.5 | 87.0 | 87.0 |
在重训对比前序专用代表作的实验中(Tab. 3,N-MPJPE 指标,单位 mm),WHIP 在纯 IMU 场景(全量手机+手表)达到 61.7 mm(显著优于 IMUPoser 的 75.5 mm);在加入 HMD 后的全传感器配置下达到 52.6 mm(大幅优于 HMDPoser 的 74.6 mm 与 AvatarPoser 在头显+双表下的 78.2 mm)。
消融实验¶
为了量化传感器互补性与跨模态交互,论文对全部 \(2^7 = 128\) 种组合进行了网格评测,并计算各传感器对误差降低的边际贡献期望 \(\text{Marginal}(m)\),以及两两传感器之间的协同增益 \(I(a, b)\)(负值越小代表冗余度越高,数值越接近 0 代表互补协同性越强)。
| 传感器组合配置 | 边际得分 / 互补交互特征 | 说明与分析 |
|---|---|---|
| HMD (头显) | 边际降错绝对值最高(约 30-40 mm) | 唯一能恢复绝对公制尺度的核心设备;但 N-MPJPE 消除尺度后优势收敛 |
| Smartwatch (智能手表) | 边际降错位居第二(重点降低手臂误差) | 上半身手腕方向解耦的关键,对双臂位姿重建起到决定性约束作用 |
| Phone + Insole (手机与鞋垫) | 协同交互指数最优(\(I(a, b)\) 接近 -5 mm) | 手机捕获骨盆与大腿姿态,鞋垫感知足底接地反力与步态,下半身互补极强 |
| 2× Phone 或 2× Watch | 冗余度较高(\(I(a, b) \approx -20 \text{ mm}\)) | 同侧与对侧同类惯性传感器之间存在较强的运动学相关性与信息重叠 |
| Pareto 最优子集 (k=1,2,3) | k=1: HMD; k=2: Watch+Phone; k=3: HMD+Watch+Phone | 双设备时表机组合优于含头显组合(实现上下半身跨肢体覆盖);三设备达到性能拐点 |
关键发现¶
- 生成建模大幅领先确定性回归:在全传感器输入下,WHIP 的 MPJPE 达到 56.7 mm,相比 Transformer 回归基线的 78.3 mm 下降了 27.6%,证明连续流匹配能有效克服多模态时空不对齐带来的歧义震荡与姿态平滑现象。
- 最佳双设备配置反直觉:单设备时 HMD 表现最佳,但双设备帕累托前沿上,手表+手机组合(跨越上半身与下半身)性能反而超越了 HMD+手表或 HMD+手机,表明跨肢体运动学解耦的互补价值高于单一部位的高精度 6-DoF 信号。
- 足压鞋垫是绝佳的“动力学补丁”:虽然鞋垫单模态全局重建精度一般,但它与其他模态的交互值 \(I(a, b)\) 负值最小、协同性最强,能极大抑制脚底滑步(footskate)与下肢穿模。
亮点与洞察¶
- 模态动态交叉注意力与自适应归一化:采用 \(1/\sqrt{|\mathcal{M}|}\) 缩放因子有效平衡了 1 到 6 个动态可用传感器的残差更新能量,使单一模型在 128 种硬件缺失组合下即插即用,兼顾了模块化与数值稳定性。
- 消费级日常生态的跨模态互补性量化:首次通过严谨的边际贡献与合作博弈交互函数 \(I(a, b)\),量化了智能手表、口袋手机、智能鞋垫与头显之间的信息增益,为未来消费级硬件的组合设计提供了坚实理论支撑。
- 泛化性迁移与野外可用性:模型仅在 14 位受试者的棚拍数据集上训练,却能零样本迁移至 Nymeria 数据集及未经标定的日常野外穿戴场景,展现出极强的物理先验分布泛化力。
局限与展望¶
- 缺乏手柄与精细手势追踪:当前数据集未整合 VR 手柄或手部关键点追踪,对细粒度交互手势与抓握动作建模不足。
- 时序开销与轻量端侧部署:作为基于迭代积分求解的生成模型,WHIP 在推断时依赖多步 Euler 求解器,计算延迟较高,离智能手表或手机上的超低延迟实时运行仍有差距。
- 衣物滑动与动态在线校准依赖:目前手机在口袋中的滑动依赖 20 秒分段校准来补偿偏置,未来需要集成动态自适应在线标定(如 Transformer IMU Calibrator)以实现全自动随身动捕。
相关工作与启发¶
- vs IMUPoser / MobilePoser: IMUPoser 依赖离散分类或浅层回归网络,在缺失模态时需要针对特定传感器拓扑做退化适配;WHIP 采用连续条件流匹配,在任意传感器组合下均保持统一的生成式概率推理框架,动作平滑度与下肢物理逼真度显著占优。
- vs AvatarPoser / HMDPoser: AvatarPoser 等专门针对 HMD 与手柄设计,遇到仅有手机手表或足部鞋垫的日常场景无法运行;WHIP 将 HMD 视作可选模态之一,展现了更广义的日常全场景穿戴适配能力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 构建首个覆盖手机/手表/头显/鞋垫的高精度动捕数据集,提出自适应流匹配通用重建架构
- 实验充分度: ⭐⭐⭐⭐⭐ 评测全部 128 种传感器组合,给出详实的边际贡献与帕累托前沿分析,并包含跨数据集与野外验证
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,实验设计与数学形式化表述清晰,传感器协同性分析深刻
- 价值: ⭐⭐⭐⭐⭐ 为消费级穿戴无标记动作捕捉树立了多模态基准,对日常人机交互与元宇宙穿戴具有极高实用价值