MotionDreamer: Universal Skeletal Motion Generation for 3D Rigged Shapes¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://research.davytao.me/skelmo/
领域: 视频生成 / 3D 视觉
关键词: 骨骼动画生成, 拓扑无关扩散模型, 蒙皮权重语义注入, 双向跨模态交互, 跨物种动作重定向
一句话总结¶
针对绑定三维物体动作生成中模板受限与单例优化缓慢的难题,MotionDreamer(文内称 SkelMo)构建了含 25,200 个带骨骼动画序列的大规模数据集,提出了基于蒙皮语义注入与双向跨模态对齐的拓扑无关扩散框架,直接在全局笛卡尔坐标系下实现单目驱动视频向任意骨骼结构的高保真动作迁移。
研究背景与动机¶
为已绑定骨骼的 3D 资产生成自然逼真的动态序列,是可扩展 4D 数字内容制作与具身智能机器人仿生控制的基石。传统高精度动作捕捉严重依赖专业动捕棚或穿戴式传感器,成本高昂且基本局限于人类形态;而专业美术师手工逐帧 K 帧的劳动强度巨大,根本无法应对开放世界中成千上万形态迥异的虚拟角色。随着视频生成大模型(如 Wan、CogVideoX)的发展,从单目驱动视频中提取运动并迁移至 3D 模型已成为重要切入点。然而,现有方法要么受限于 SMPL、SMAL 等固定拓扑模板,无法处理多足兽、幻想生物或非人形态;要么依赖单例在线优化(如 Puppeteer、Animimic),需要借助光流与单目深度等脆弱先验,不仅极易陷入局部最优与视角模糊,而且单次优化耗时巨大;另一类前向预测顶点轨迹的 4D 生成方案(如 Motion 3-to-4、ActionMesh)则缺乏内在骨架约束,极易产生网格撕裂、粘连以及非刚性“融化”形变。
这一困局背后的核心矛盾在于:单目视频呈现的是二维外观动态投影,而目标驱动对象具备任意异构的 3D 骨骼拓扑与几何结构,如何在缺乏固定拓扑先验的情况下,建立 2D 像素运动线索与任意 3D 骨骼关节之间的确定性语义映射与运动学对齐?同时,现有开源 3D 数据集中兼具高精度绑定骨架与丰富动画序列的资产极度匮乏,制约了通用生成模型的泛化学习。
本文的切入角度是打破模板依赖,将骨骼动作生成建模为条件扩散过程,并从外观几何与运动学双向打通跨模态表征。一方面,整理出包含 2.52 万套高质量骨骼动画的大规模动态基座数据集;另一方面,利用多视角外观特征与蒙皮权重将表面语义聚合到骨骼关节点,并构建骨骼与视频的双向注意力交互通道。核心 idea:基于构建的 2.52 万套跨物种动画基座,提出一种拓扑无关扩散框架,直接在全局笛卡尔坐标下通过蒙皮权重将多视角 DINOv2 表面语义注入骨骼关节,并结合视频-骨骼双向跨模态注意力与骨骼树结构先验,实现从单目视频到任意拓扑骨骼的高保真、防形变动作生成与跨物种迁移。
方法详解¶
整体框架¶
给定任意类别的 3D 网格 \(\mathcal{M} = \{\mathcal{V}, \mathcal{F}\}\)、与其绑定的静止姿态骨骼 \(\mathcal{S}_0 = \{\mathcal{P}_0, \mathcal{G}\}\)(其中 \(\mathcal{P}_0 \in \mathbb{R}^{J \times 3}\) 为关节坐标,\(\mathcal{G}\) 为拓扑层次图),以及包含 \(L\) 帧的单目驱动视频 \(\mathcal{X} = \{I_l\}_{l=1}^L\),MotionDreamer 的目标是生成与驱动视频运动一致的时序骨骼序列 \(\{\mathcal{S}_l = (\mathcal{P}_l, \mathcal{G})\}_{l=1}^L\)。
整个流水线在扩散前向加噪与反向去噪循环中运作:在去噪步 \(t\),驱动视频由 DINOv2 提取帧特征后经由时空注意力模块编码为全局动态表征;同时,静止骨骼 \(\mathcal{S}_0\) 投影为隐向量 \(z_0\),与加噪潜变量 \(z_t\) 在时序维度拼接作为持久几何锚点。去噪主干由 \(M\) 层 Transformer 块组成,交替执行骨骼注意力、时序自注意力、视频-骨骼双向融合,以及网格纹理-语义交叉注意力注入。最终去噪潜变量 \(\hat{z}_0\) 映射回笛卡尔空间,并经由逆运动学(IK)投影后输出无骨骼拉伸的平滑运动。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:3D 网格 M、绑定骨骼 S0 与驱动视频 X"] --> B["网格多视角渲染与 DINOv2 顶点反投影"]
B --> C["蒙皮感知的纹理-语义注入<br/>归一化蒙皮权重聚合顶点特征至骨骼关节"]
A --> D["视频编码器<br/>DINOv2 + 时空自注意力提取全局动态特征"]
C --> E["双向视频-骨骼跨模态对齐<br/>骨骼查询视频 S→X 与视频感知骨骼 X→S 双向交互"]
D --> E
E --> F["全局笛卡尔坐标拓扑无关扩散<br/>骨骼树距离注意力去噪 + Rest-pose 条件拼接"]
F --> G["IK 运动学逆向求解精炼<br/>150 步迭代消除骨骼拉伸"]
G --> H["输出:高保真 3D 骨骼动画序列 {Pl}"]
关键设计¶
1. 蒙皮感知的纹理-语义注入:打通外观表象到骨架节点的语义桥梁
纯粹的骨骼坐标与拓扑图只包含空间几何结构,缺失了角色的外观语义信息。这导致生成网络难以分辨驱动视频中的动作部位与目标角色的具体肢体之间的对应关系(例如哪几根骨骼对应左臂、足部或躯干,或者怪兽的多肢在何处)。
为此,该设计将目标网格表面外观特征显式投影并注入到骨骼隐空间中。首先围绕网格 \(\mathcal{M}\) 渲染 \(N\) 个视角的静态图像 \(\{I_i^0\}_{i=1}^N\),通过冻结的 DINOv2 提取高维稠密空间特征图 \(F_i\)。随后利用相机投影矩阵 \(\pi_i\) 和可见性掩码 \(\text{Vis}(v, i)\),将特征反向投影至可见网格顶点上,通过多视角平均池化得到顶点级语义特征 \(f_v\):
为了将数以万计的顶点特征压缩并精准映射至 \(J\) 个离散骨骼关节,模型巧妙利用网格已有的绑定蒙皮权重矩阵 \(W \in \mathbb{R}^{J \times |\mathcal{V}|}\)。对第 \(j\) 个关节关联的所有顶点权重做归一化:
通过线性映射直接汇聚得到骨骼语义特征矩阵 \(\tilde{F}_{\mathcal{S}} \in \mathbb{R}^{J \times C}\):
在去噪块中,骨骼隐状态作为 Query,与由 \(\tilde{F}_{\mathcal{S}}\) 构成的 Key 和 Value 计算交叉注意力。由于蒙皮权重直接反映了几何顶点与关节的刚体驱动关系,这种加权聚合使每个骨骼天然具备了其驱动体表区域的语义画像,彻底解决了未知骨架语义冷启动匹配的难题。
2. 双向视频-骨骼跨模态对齐:双通道对称交互协调运动线索与骨骼拓扑
将 2D 视频的运动引导注入 3D 骨骼时,单向广播常常导致目标骨骼受到无关视频动态的干扰,或者无法根据目标异构拓扑合理过滤动作幅度。
该模块采用双向对称交叉注意力结构。驱动视频首先提取帧序列特征并通过空间与时序连续自注意力编码,获得包含轨迹动态的视频全局特征 \(F_{\mathcal{X}}^{\text{global}}\)。随后,在骨骼特征 \(\tilde{F}_{\mathcal{S}}\) 与视频特征 \(F_{\mathcal{X}}^{\text{global}}\) 之间构建两条对称通路: 一条为骨骼向视频发起查询(\(S \rightarrow X\)),以骨骼隐状态为 Query,视频特征为 Key 和 Value:
另一条为视频特征反向向骨骼发起拓扑查询(\(X \rightarrow S\)),以视频特征为 Query,骨骼特征为 Key 和 Value:
通过将双向通路的特征融合进统一时空表征中,网络不仅让骨骼关节点准确捕获视频动作节奏与关节位移,还能利用目标骨骼的结构约束过滤掉物理上不可达的视频伪影,实现运动细节与解剖合理性的双重对齐。
3. 全局笛卡尔坐标拓扑无关扩散与骨骼注意力:抑制误差累积与保持运动刚性
传统骨骼动画方法多依赖基于旋转角度(如欧拉角、四元数或轴角)的局部相对表示。但局部旋转在 2D 到 3D 提升过程中存在严重的非线性误差累积,微小的根节点偏差会在末端肢体产生巨大位移漂移。
本文反其道而行之,采用全局笛卡尔坐标 \(\mathcal{P} \in \mathbb{R}^{L \times J \times 3}\) 作为基础运动表征,直接与视频中 2D 像素运动轨迹建立直观的空间对应,极大稳定了扩散去噪过程。为确保生成的坐标严格受限于目标形态,模型在扩散每一步将静止参考骨骼 \(\mathcal{S}_0\) 投影后的潜向量 \(z_0\) 与带噪潜变量 \(z_t\) 在时序维度拼接,作为不变量几何锚点以维持骨长和身材比例。去噪主干利用骨骼拓扑树构建距离矩阵,调制自注意力权重(Skeletal Attention),确保具备直系父子生物学关系的关节获得强关联。最后,在推理阶段采用 150 步逆运动学(IK)后处理优化,将预测的笛卡尔关节投影回初始骨骼约束空间,完全消除关节拉伸与骨骼形变。
损失函数 / 训练策略¶
模型采用标准条件去噪扩散概率模型(DDPM)简化损失函数,预测添加到真实关节 3D 坐标中的高斯噪声:
其中 \(z_t\) 为时间步 \(t\) 的加噪关节坐标,\(C\) 为由驱动视频及网格语义构成的联合条件。模型使用 AdamW 优化器从零训练 80,000 步,初始学习率为 \(1 \times 10^{-4}\),每 10,000 步乘以 0.99 衰减;批大小设为 16,在 4 块 NVIDIA RTX 5880-48G GPU 上完成分布式训练。
实验关键数据¶
主实验¶
评估基准从新构建的数据集中随机抽取 100 个具备代表性的跨物种 3D 模型,统一在距离 2 米处渲染前向视角驱动视频(帧数 \(\le 40\) 帧)。对比基线包括骨骼优化生成方法 Puppeteer,以及基于密集顶点轨迹预测的 SOTA 视频到 4D 生成模型 Motion 3-to-4 与 ActionMesh。为了公平评估,顶点轨迹方法通过统一的骨骼拟合后处理转为骨骼运动。评价指标采用关节平均位置误差(MPJPE)衡量动作精度,以及 Chamfer Distance(CD)衡量表面几何保真度。
| 方法 | MPJPE (↓) | CD (↓) | 说明 |
|---|---|---|---|
| Motion 3-to-4 [4] (CVPR 2026) | 0.230 | 0.475 | 顶点轨迹预测易产生严重网格撕裂与粘连 |
| ActionMesh [22] (CVPR 2026) | 0.197 | 0.418 | 缺乏骨架约束,局部刚性区域出现融化失真 |
| Puppeteer [24] (NeurIPS 2026) | 0.161 | 0.155 | 基于光流与深度优化的骨骼拟合,耗时长且易陷入局部极值 |
| SkelMo (Ours) | 0.054 | 0.086 | 全面大幅领先,MPJPE 相比最优基线降低 66.5%,CD 降低 44.5% |
消融实验¶
消融实验验证了三个核心模块的必要性:“w/o Inject.”表示移除基于 DINOv2 与蒙皮权重的纹理语义注入;“w/o Bidir.”表示去除视频与骨骼之间的双向跨模态注意力;“Rel. Repr.”表示使用传统的局部相对骨骼旋转表示替代全局笛卡尔坐标。
| 配置 | MPJPE (↓) | CD (↓) | 说明 |
|---|---|---|---|
| Full Model | 0.054 | 0.086 | 完整模型,综合性能最优 |
| w/o Inject. | 0.234 | 0.235 | 缺少外观语义,关节聚团塌陷(MPJPE 恶化 +333%) |
| w/o Bidir. | 0.118 | 0.147 | 仅能捕捉大体运动,肢体精细角度与动态严重失准 |
| Rel. Repr. | 0.285 | 0.340 | 相对旋转导致误差级联放大,出现悬浮与骨长不一致 |
此外,针对非理想绑定的鲁棒性测试显示(在自动绑定工具 RigAnything 生成的不规则骨架下评估):SkelMo 的 MSE 由 GT 骨架下的 \(0.048 \times 10^{-1}\) 仅微增至 \(0.082 \times 10^{-1}\),Vertex-CD 由 \(0.107 \times 10^{-1}\) 变为 \(0.146 \times 10^{-1}\),依然显著超越基线方法在完美骨架下的表现(如 Puppeteer MSE 为 \(0.229 \times 10^{-1}\))。
关键发现¶
- 纹理-语义注入模块对保持解剖结构的完整性起决定性作用:去除该模块后,MPJPE 从 0.054 剧烈恶化至 0.234。可视化表明,由于缺失语义,复杂角色(如蜘蛛侠)的关节在运动中会向中心聚拢塌陷,失去肢体边界定义。
- 坐标表示方式的选择对扩散稳定性至关重要:相对坐标表示在去噪过程中无法有效利用视频的绝对轨迹先验,累计误差导致模型出现“漂浮”与脚底打滑;全局笛卡尔坐标配合 Rest-pose 拼接和 IK 投影,使模型拥有稳健的绝对运动锚定。
- 跨物种与异质迁移具备惊人鲁棒性:在真人驱动视频引导下,模型能成功驱动四足动物甚至多肢体怪兽完成逼真步态与跳跃,实现了高质量跨生物门类的运动重定向(Cross-entity Motion Transfer)。
亮点与洞察¶
- 巧妙利用蒙皮权重实现跨维度语义汇聚:利用现成的线性蒙皮权重矩阵将稠密网格顶点的 DINOv2 视觉语义线性下采样至离散骨骼节点,免去了复杂的关节-体素对应学习,以极低计算代价赋予纯几何骨架丰富的外观语义。
- 双向跨模态交互有效规避伪影:视频驱动 3D 骨架时,并非盲目接受 2D 像素位移,而是让骨架层次结构反向作用于视频特征,自适应滤除 2D 视频中与 3D 解剖约束矛盾的动作噪声。
- 大规模高质量数据重塑基座:通过结合 Objaverse、Articulation-XL、AutoRig-Pro 迁移与 Qwen 大模型空间朝向校准,构建了 2.52 万套带绑定的高保真动画数据集(超 350 万帧),填补了领域内非人多品类 4D 数据的长期空白。
局限与展望¶
- 缺乏细粒度文本控制接口:目前系统完全依赖单目视频作为驱动输入,作者明确提出下一步需引入细粒度文本描述,支持由自然语言提示词或音频驱动骨骼动画的多模态生成。
- 物理交互与环境感知缺失:当前生成的动作主要针对单体孤立模型的运动学合理性,尚未考虑角色与复杂三维地形碰撞、抓取物体等物理动力学约束。
- 视角模糊性与极端自遮挡:驱动视频若存在严重视角自遮挡或极速非刚性运动,模型在深度维度的关节定位仍可能存在轻微晃动,未来可引入多视角驱动或多视角视频生成模型辅助。
相关工作与启发¶
- vs Puppeteer: Puppeteer 依赖基于光流和深度估计的逐实例耗时测试期优化拟合,单样本生成极慢且易陷入局部极小;SkelMo 采用前向拓扑无关扩散生成网络,推理效率与动作泛化性均呈现数量级优势。
- vs Motion 3-to-4 / ActionMesh: 这类前沿 4D 顶点生成方法直接预测自由网格位移,但缺乏内在骨骼拓扑支撑,易出现网格自穿透、“融化”变形与撕裂;SkelMo 坚持结构化骨骼驱动范式,结合 IK 严格保持刚体几何与网格拓扑完整性。
- vs SMPL / SMAL 传统动捕: 传统动捕强依赖预定义物种的参数化统计模型,完全无法处理幻想生物、机械体与长尾物种;SkelMo 打破了模板限制,实现了通用的开放世界生物骨骼驱动。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出利用蒙皮权重实现网格表面语义向骨架关节的投射,并构建双向视频-骨骼对称交互扩散架构。
- 实验充分度: ⭐⭐⭐⭐⭐ 构建了包含 2.52 万套动画、350 万帧的大规模数据集,涵盖主实验、全面消融、自动骨骼鲁棒性测试与真实世界/AIGC 视频应用验证。
- 写作质量: ⭐⭐⭐⭐⭐ 论文逻辑清晰严谨,从动机、数学形式化到可视化分析均非常扎实详尽。
- 价值: ⭐⭐⭐⭐⭐ 为游戏、影视 4D 资产自动化生产以及具身智能非人机器人的动作合成提供了极具实用价值的范式与开源数据基座。