Kinematics-Agnostic 3D Human Motion Prediction via Equivariant Latent Diffusion¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://ceveloper.github.io/publications/equifusion/
领域: 人体理解(注:当前分配于 image_generation,建议分类调整为 human_understanding 或 3d_vision)
关键词: 随机人体动作预测、运动学不可知、置换等变性、潜空间扩散模型、骨骼拓扑泛化
一句话总结¶
提出了首个运动学不可知(Kinematics-Agnostic)的随机人体动作预测架构 EquiFusion,通过显式将骨骼拓扑邻接矩阵作为输入并构建全流程关节置换等变潜空间扩散模型,彻底摆脱了传统方法对特定骨骼拓扑的硬编码绑定与有损重定向,实现了跨数据集联合训练以及未见骨骼结构与部分肢体遮挡下的零样本高保真动作预测。
研究背景与动机¶
从过去几帧观察中推测未来可能发生的动作,是具身空间智能和人机协作的关键前提。由于人类意图具备天然的多样性与不确定性,学术界已逐步从确定性轨迹外推转向随机人体动作预测(Stochastic Human Motion Prediction, SHMP),利用生成式模型探索未来物理合理动作的概率分布。然而,阻碍当前模型走向通用的核心瓶颈在于骨骼运动学拓扑(Kinematics)的刚性绑定:主流动作捕捉系统(如基于标记点优化的 Human3.6M、基于参数化人体的 AMASS/SMPL、以及穿戴式设备构建的 Nymeria)所采用的骨架在关节点数量、关节命名和层次连接上极不一致。现有扩散或深度模型几乎全部采用特定于单一骨骼的设计——将关节数目 \(J\) 硬编码进权重矩阵,或在时间 Transformer 中把关节点强行压为固定维度的特征通道,导致模型只能专用于某一特定数据集。
为了跨数据集复用模型,业界以往只能依赖骨骼重定向(Motion Retargeting)作为前处理环节。但不同骨架之间往往属于非同胚图结构(例如 17 关节的 H36M 与 22 关节的 AMASS 具有完全不同的末端执行器),重定向不仅计算开销大,而且必须无中生有地插值或折叠骨骼,不可避免地带来数十毫米的累积几何误差以及严重的测试分布偏移。更严重的是,在实际视频追踪或穿戴感知场景中,局部肢体遮挡、截断或传感器丢失(Partial Kinematics)屡见不鲜,现有硬编码全骨架的模型在此类非完整输入下直接崩溃。传统针对遮挡的手工设计方案缺乏通用性,无法从根本上实现零样本骨骼适应。
要破除这一瓶颈,核心在于让模型的可学习参数与输入关节点的数目彻底解耦(即参数量 \(|\Theta|\) 保持常数,不随关节数 \(J\) 增长)。研究团队从理论上证明,保证关节排列置换等变性(Permutation Equivariance)正是达成这一条件的充分准则。核心 idea:显式将骨骼拓扑邻接矩阵作为网络输入,构建端到端节点置换等变的 Transformer 自编码器与局部-全局图潜空间扩散模型,并配合刚体骨长恒定的相对骨骼方向表征,实现无须任何重定向即可在任意未见骨骼拓扑和缺失肢体上直接执行零样本推理的通用动作预测框架。
方法详解¶
整体框架¶
EquiFusion 将动作预测任务构建为显式依赖骨骼拓扑图 \(K = (V_\tau, E)\) 邻接矩阵 \(A \in \mathbb{R}^{J \times J}\) 的置换等变潜空间扩散流程。给定过去 \(T_P\) 帧的运动观察 \(X \in \mathbb{R}^{T_P \times J \times 3}\) 和骨架拓扑邻接矩阵 \(A\),模型目标是生成 \(T_F\) 帧符合物理规律的多样化未来轨迹 \(\tilde{Y} \in \mathbb{R}^{T_F \times J \times 3}\)。
整个预测管线分为两个核心阶段:首先是一个确定性置换等变 Transformer 自编码器,它在关节点维度上执行特征变换,将任意关节数的运动序列编码进紧凑的等变潜变量空间 \(z \in \mathbb{R}^{J \times L}\);随后是一个置换等变潜变量去噪扩散模型(Latent Denoiser),它以历史动作潜变量 \(z_{\text{past}}\) 和骨骼拓扑邻接矩阵 \(A\) 为联合条件,对高斯噪声逐步去噪生成未来动作的潜表达,最后通过解码器映射回动作轨迹。整个网络的所有操作严格满足置换等变性,使模型内部计算完全独立于关节的排列次序与节点数量。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入:历史轨迹 X 与骨架邻接矩阵 A"] --> D1["置换等变网络算子<br/>局部度归一化图卷积 + 全局关节自注意力"]
D1 --> D2["等变潜空间扩散架构<br/>拓扑感知的等变自编码器与条件潜变量去噪反演"]
D2 --> D3["相对骨骼方向表征<br/>解算父节点相对方向向量并在推理时恢复物理骨长"]
D3 --> Out["输出:多样化高保真未来轨迹 Ŷ"]
关键设计¶
1. 置换等变网络算子:解耦关节基数与排序对网络权重的硬编码
以往的人体动作预测网络常利用固定大小的全连接层 \(W \in \mathbb{R}^{J \times J}\) 或为每个关节独立分配权重 \(W_j\) 来强行拟合特定骨骼的几何先验,导致参数规模直接与关节数量 \(J\) 强绑定。一旦输入骨架发生增减或次序打乱,权重立即失效。EquiFusion 基于引理证明,要支持任意维度的骨骼拓扑,网络层必须满足对关节置换矩阵 \(P \in \mathbb{R}^{J \times J}\) 的置换等变性 \(P \cdot o(X) = o(P X)\)。为此,模型在局部尺度上采用严格等变的度归一化图卷积算子:
其中 \(Z \in \mathbb{R}^{J \times F_i}\) 为关节特征矩阵,\(D\) 为邻接矩阵 \(A\) 的度矩阵,\(G_0, G_1 \in \mathbb{R}^{F_i \times F_o}\) 分别学习关节点自身与其一阶图邻域的共享特征变换,\(b \in \mathbb{R}^{F_o}\) 为可学习偏置。该算子不仅对特征输入等变,对拓扑矩阵 \(A\) 的置换同样具备形式不变性。在此基础上,为了捕捉长距离的全身关节协同,模型进一步构建了以关节点为 Token 的多头图自注意力机制,其中注意力的 \(Q, K, V\) 变换均由此等变图卷积实现,且完全去除破坏等变性的关节点绝对位置编码,从根本上实现了参数量与骨架节点数的解耦。
2. 等变潜空间扩散架构:拓扑邻接矩阵显式输入与条件潜变量去噪
直接在高维动作空间执行扩散迭代计算代价高昂且难以施加严格的拓扑约束。EquiFusion 引入基于置换等变 Transformer 构建的确定性潜空间自编码器,将时空运动轨迹 \(M \in \mathbb{R}^{T \times J \times 3}\) 映射至潜变量 \(z \in \mathbb{R}^{J \times L}\)。不同于传统基于循环神经网络的架构,该自编码器在时间维度使用时序一维变换、在关节维度使用无位置编码的置换等变 Transformer,极大提升了并行效率并严守等变性。在扩散生成阶段,去噪模型将骨架拓扑邻接矩阵 \(A\) 作为显式的结构条件输入,采用包含等变图残差块与图注意力的 U-Net/DiT 结构,以历史运动特征 \(z_{\text{past}} = e(X)\) 为引导,对初始化随机潜变量进行迭代去噪反演:
由于先验采样是在每个关节点潜变量上独立同分布(i.i.d.)进行的,在固定噪声随机种子的设定下,整个去噪链条在样本级与分布级均严格保持关于关节置换与拓扑重排的等变性。这种设计使模型在推理时能够直接接收任意未见的全新骨架拓扑矩阵,甚至通过从矩阵中裁切节点实现天然的缺失肢体自适应生成。
3. 相对骨骼方向表征:相对父节点向量约束消除肢体畸变与拉伸
在运动表示的选择上,传统 3D 绝对笛卡尔坐标虽然直观,但在多步自回归或扩散采样中容易造成严重的肢体拉伸(Limb Stretching)与骨长颤动抖动(Jitter);而基于局部旋转角(如轴角或四元数)的表示虽然固定了骨长,却必须依赖特定骨架的静止基准姿态(Rest Pose),且在旋转空间优化时容易遭遇奇异点与梯度不稳定。EquiFusion 提出了一种通用的中间态表征——相对骨骼方向向量(Bone Direction Parametrization)。对任意骨骼肢体 \(i\),其方向向量 \(L_t^i\) 定义为该关节与运动学链条中父节点的差值归一化向量:
在模型前向传播过程中,网络仅预测各骨骼在时序上的相对方向演变;在推理阶段,系统直接利用前序历史观察中测量出的各受试者真实骨长对方向向量进行尺度恢复,从而在数学上百分之百杜绝了生成过程中的骨骼拉伸伪影。若遇到完全缺失的未观测肢体,则自适应回退至训练集统计的平均骨长作为先验,为跨数据集和部分遮挡推理提供了极强的几何物理先验支撑。
损失函数 / 训练策略¶
训练流程分为两步解耦进行: 1. 等变自编码器训练:联合优化重构误差与骨骼方向平滑损失,确保潜变量空间 \(z\) 能够高保真还原原始时空轨迹: $\(\mathcal{L}_{\text{AE}} = \|M - \hat{M}\|_2^2 + \lambda_{\text{dir}} \|L - \hat{L}\|_2^2\)$ 2. 条件潜空间扩散训练:冻结自编码器权重,在潜空间中训练等变去噪网络。利用标准扩散去噪均方误差优化模型参数 \(\theta\): $\(\mathcal{L}_{\text{diff}} = \mathbb{E}_{t, z_0, \epsilon \sim \mathcal{N}(0, I)} \left[ \|\epsilon - \epsilon_\theta(z_t, t, z_{\text{past}}, A)\|_2^2 \right]\)$ 得益于运动学不可知的算子设计,EquiFusion 能够首次实现跨异质数据集(如 AMASS 与 Nymeria 同时混合)的统一批次无障碍联合训练,无须任何前置动作对齐或重定向操作。
实验关键数据¶
主实验¶
在未经任何骨骼重定向的零样本运动学推理测试中(模型在 AMASS 的 22 节点 \(K_A\) 上训练,直接在 Human3.6M 的 17 节点 \(K_H\) 上评估),EquiFusion 与经过 Holden et al. 经典重定向算法适配的业界最强基线进行了全面对比。
| 方法 | 支持新拓扑 | 统一误差 uADE (cm) ↓ | 终点误差 uFDE (cm) ↓ | 角度误差 MAE (deg) ↓ | 多模态误差 uMMA (cm) ↓ | 多模态终点 uMMF (cm) ↓ | 多样性 uAPD (m) ↑ | 倒角距离 CMD ↓ | 真实度 FID ↓ | 骨长拉伸率 str (%) ↓ | 轨迹抖动 jit (%) ↓ |
|---|---|---|---|---|---|---|---|---|---|---|---|
| ZeroVel | ✓ | 11.77 | 17.88 | 6.753 | 13.74 | 18.56 | 0.000 | 22.822 | - | 0.00 | 0.00 |
| TPK + 重定向 | ✗ | 13.81 | 16.13 | 22.276 | 14.60 | 16.22 | 1.469 | 10.051 | 3.773 | 19.55 | 0.46 |
| DLow + 重定向 | ✗ | 12.71 | 14.80 | 21.887 | 13.60 | 14.97 | 2.060 | 9.204 | 2.875 | 20.26 | 0.53 |
| GSPS + 重定向 | ✗ | 9.29 | 11.91 | 8.107 | 10.85 | 12.35 | 2.069 | 7.409 | 1.735 | 11.51 | 0.38 |
| DivSamp + 重定向 | ✗ | 9.27 | 12.61 | 8.374 | 11.42 | 13.27 | 4.210 | 47.783 | 5.629 | 18.47 | 1.01 |
| BeLFusion + 重定向 | ✗ | 9.24 | 11.62 | 8.200 | 10.93 | 12.16 | 1.305 | 8.031 | 1.195 | 9.81 | 0.34 |
| CoMusion + 重定向 | ✗ | 10.07 | 12.15 | 21.066 | 12.49 | 12.96 | 2.070 | 8.587 | 1.426 | 15.98 | 0.51 |
| SkelDiff + 重定向 | ✗ | 10.81 | 14.99 | 14.947 | 12.75 | 15.42 | 0.992 | 7.616 | 5.252 | 11.25 | 0.28 |
| EquiFusion (A) | ✓ | 7.86 | 10.47 | 5.861 | 10.66 | 11.61 | 1.973 | 7.061 | 0.691 | 0.00 | 0.00 |
| EquiFusion (A+N) | ✓ | 7.71 | 10.21 | 5.683 | 10.58 | 11.36 | 1.797 | 7.349 | 0.504 | 0.00 | 0.00 |
消融实验¶
研究针对多数据集联合训练、等变性架构设计、关节排列以及骨骼表征开展了系统的消融实验。
表 1:多数据集训练与等变性设计消融(AMASS 域内测试与 H36M 零样本测试) | 模型配置 | AMASS 误差 ADE ↓ | AMASS 角度 MAE ↓ | AMASS 距离 CMD ↓ | H36M 零样本 ADE ↓ | H36M 零样本 MAE ↓ | H36M 零样本 CMD ↓ | | :--- | :---: | :---: | :---: | :---: | :---: | :---: | | 修改版 SkelDiff(多数据集训练) | 0.500 | 7.007 | 19.233 | 0.670 | 12.065 | 31.461 | | EquiFusion 移除等变性(加入位置编码) | 0.539 | 6.974 | 22.294 | 0.467 | 7.245 | 9.559 | | EquiFusion 完整模型 | 0.512 | 6.525 | 19.699 | 0.380 | 5.685 | 8.086 | | 置换测试:关节重排 + 噪声重排 (\(P + P_\epsilon\)) | 0.512 | 6.525 | 19.699 | 0.380 | 5.685 | 8.086 | | 置换测试:仅关节重排 (\(P\)) | 0.513 | 6.529 | 19.686 | 0.380 | 5.680 | 8.088 | | 加入显式关节语义嵌入 (+S) | 0.508 | 6.456 | 19.492 | 0.381 | 5.708 | 8.526 |
表 2:动作表征选择消融(骨骼方向向量 \(L\) vs 传统 3D 笛卡尔坐标 \(M\)) | 模型 | 运动表征 | ADE ↓ | FDE ↓ | MAE ↓ | 多样性 APD ↑ | 距离 CMD ↓ | 骨长拉伸 str (%) ↓ | 轨迹抖动 jit (%) ↓ | | :--- | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | | SkelDiff | 3D 坐标 \(M\) | 0.480 | 0.545 | 6.124 | 9.456 | 11.417 | 3.15 | 0.20 | | SkelDiff | 骨骼方向 \(L\) | 0.496 | 0.546 | 6.193 | 9.960 | 9.143 | 0.00 | 0.00 | | EquiFusion | 3D 坐标 \(M\) | 0.501 | 0.561 | 6.551 | 8.348 | 13.963 | 3.58 | 0.27 | | EquiFusion | 骨骼方向 \(L\) | 0.498 | 0.559 | 6.173 | 8.413 | 12.530 | 0.00 | 0.00 |
表 3:零样本部分肢体遮挡测试(AMASS 测试集随机移除整条肢体) | 方法 | 训练数据 | 遮挡应对策略 | 预测误差 ADE ↓ | 终点误差 FDE ↓ | 角度误差 MAE ↓ | 多样性 APD ↑ | 骨长拉伸 str (%) ↓ | | :--- | :---: | :---: | :---: | :---: | :---: | :---: | :---: | | SkelDiff | AMASS | 静止姿态补全 (+rp) | 0.574 | 0.727 | 6.996 | 8.890 | 8.15 | | SkelDiff | AMASS | 对称肢体镜像 (+sl) | 0.567 | 0.683 | 7.162 | 9.274 | 5.64 | | EquiFusion | AMASS | 原生图自适应 (零样本) | 0.553 | 0.618 | 10.190 | 10.152 | 0.00 | | EquiFusion | AMASS+Nymeria | 原生图自适应 (零样本) | 0.499 | 0.553 | 8.777 | 9.099 | 0.00 |
关键发现¶
- 等变性是零样本泛化的基石:消融表明,即便用海量异质骨架数据做数据增强,具有固定拓扑权重的基线模型(如修改版 SkelDiff)在面对全新骨骼时误差依然剧烈飙升(H36M 上 ADE 从 0.380 恶化至 0.670);而去掉等变性的 EquiFusion(Ours w/o Eq)性能也显著受损,证明零样本能力源于数学形式保证,而非单纯数据堆砌。
- 骨骼方向表征杜绝几何失真:无论在基线还是在本文模型中,采用相对骨骼方向表征均能直接将骨长拉伸率和抖动率清零(0.00%),同时改善动作真实度 CMD,且几乎不牺牲预测精度。
- 参数量缩减 75% 且复杂度与骨架解耦:得益于共享参数的等变图网络,EquiFusion 在单个数据集上的参数量仅为 SkelDiff 的 25%(参数量缩减 75%),在三数据集联合场景下参数压缩达 90%,且训练与推理延迟缩短近一半。
亮点与洞察¶
- 从拓扑绑定转向拓扑不可知:首次跳出了为每套动捕骨架单独训练特定网络的陈旧模式,将骨骼拓扑结构显式参数化为邻接矩阵输入,为构建人体运动大模型提供了关键架构基石。
- 置换等变性诱导更优泛化与轻量化:数学证明与实验表明,置换等变性不仅消除了对节点编号顺序的依赖,还将模型复杂度与关节数量解耦,凭借强大的几何对称先验以 1/4 的参数量碾压过往专用 SOTA。
- 原生支持遮挡与残缺肢体零样本预测:无需针对缺失数据开展特定 Mask 预训练,仅需调整拓扑矩阵即可优雅处理传感器丢失、部分遮挡乃至特殊残疾人群的运动推测。
局限与展望¶
- 中间关节遮挡暂无法完全兼容:当前相对骨骼方向表征依赖树状运动学链条,只支持末端叶子节点(如手、脚)的缺失;当树干内部关节点(如肘关节缺失但手腕存在)缺失时,相对向量链条断裂,尚无法天然处理。
- 跨数据集动态分布差异:联合训练发现,不同动捕数据集之间的动作剧烈程度分布差异较大(如 Nymeria 日常动作相对平缓,AMASS 包含高动态运动),数据间分布差异对生成多样性的细粒度影响仍需深入探索。
- 非人类骨骼拓展:当前验证主要集中于双足人类骨骼,未来可进一步拓展至四足动物、鸟类及任意机器人形态的运动建模。
相关工作与启发¶
- vs SkelDiff / BeLFusion 等固定骨架扩散模型:传统方法将关节维度作为特征通道或使用与节点数绑定的矩阵运算,无法接受未见拓扑与遮挡;EquiFusion 通过等变局部图卷积与关节注意力,实现了统一模型对任意骨骼形态的零样本泛化。
- vs Holden et al. 等非同胚骨骼重定向技术:传统重定向不可避免地产生十几至数十毫米的不可逆形变误差与分布偏移;EquiFusion 在原始骨架空间直接推理,彻底免除了重定向阶段。
- vs 分子生成置换等变扩散(如 EDM):分子生成领域的等变扩散多聚焦于 3D 空间的 E(3)/SE(3) 几何旋转平移,而 EquiFusion 首次将节点置换等变性系统引入到具备高自由度运动学约束的时空人体运动生成任务中。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出运动学不可知的随机人体动作预测范式,理论证明并实现了全流程节点置换等变潜变量扩散。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖跨拓扑零样本预测、多数据集联合训练、部分遮挡推理及详细的表征消融,指标严谨扎实。
- 写作质量: ⭐⭐⭐⭐⭐ 动机清晰,数学论证与图示完备,从问题定义到实验分析逻辑严密。
- 价值: ⭐⭐⭐⭐⭐ 解决了动作捕捉异质拓扑割裂数据集的长期痛点,是通向人体运动基础模型(Foundation Model)的重要突破。