跳转至

ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos

会议: ECCV 2026
论文: ECCV 官方页面
代码: https://vision.cs.utexas.edu/projects/expert_edit/
领域: 人体理解
关键词: 动作编辑、运动生成、技能评估、专家动作先验、掩码序列建模

一句话总结

针对运动技能提升缺少成对新手-专家数据与推理时细粒度指令的痛点,ExpertEdit 提出仅利用非成对专家演示视频学习技能流形,并在推理时通过运动学峰值掩码与双向动作补全(contextual motion infilling)实现端到端技能自适应动作编辑。

研究背景与动机

运动技能学习在竞技体育训练与康复医学中具有核心价值。运动心理学中“视频自我建模”(Video Self-Modeling)的实证研究表明:相比于单纯观察顶尖专家的示范视频,观察“近乎完美状态下的自身动作表现”能够更高效地激活人类的感知-运动系统,显著加快运动技能习得速度并提升动作保持率。因此,能够将新手视频自动转化为保有自身体态、轨迹但动作细节达到专家级水准的“动作自动调音”(Motion Auto-Tune),成为 AI 动作教练、无替身影视特技演练及高质量机器人具身演示生成的关键驱动力。

然而,现有的 3D 人体动作编辑技术无法直接适用于技能微调任务。传统动作编辑范式依赖两类极具限制的前提:一是依赖显式文本提示词或对齐的参考动作片段进行编辑引导,但在技能纠正场景中,动作本身的类别语义并未改变,要求用户提供精确的低级运动学指令(如“投篮时右手肘内收15度”)本身就构成了极高的专业门槛;二是依赖大规模成对的“修改前-修改后”运动文本三元组,但在现实中构建技能动作的成对数据需要领域专家进行繁重的逐帧诊断与对准,数据搜集极其昂贵甚至不可行,导致目前学术界完全缺乏成规模的高质量新手-专家成对运动数据集。

本文的切入角度是:优秀动作的技能差异高度集中在特定的生物力学关键动作阶段(如投篮起跳出手、射门触球瞬间),无需推倒重置整段运动,只需将关键时段的局部动作投影至专家运动流形。核心 idea:将技能动作微调建模为上下文运动补全(contextual motion infilling)任务,仅在非成对专家视频上通过掩码语言建模(MLM)学习专家运动先验;在推理时利用运动学特征自动定位新手动作的技能关键峰值并施加掩码,一次性预测并填补专家级姿态,在无需成对数据和推理引导的情况下实现保全轨迹与身份的技能级动作编辑。

方法详解

整体框架

ExpertEdit 的目标是将新手 3D 动作序列 \(\mathbf{X}^{\text{nov}} = \{(\mathbf{r}_t, \mathbf{o}_t, \mathbf{p}_t)\}_{t=1}^{T}\)(其中 \(\mathbf{r}_t \in \mathbb{R}^3\) 为全局平移,\(\mathbf{o}_t \in \mathbb{R}^3\) 为根节点旋转,\(\mathbf{p}_t \in \mathbb{R}^{3J}\) 为 \(J\) 个骨骼关节点的轴角旋转)转化为持续时长一致但动作质量达到专家水准的编辑序列 \(\mathbf{X}^{\text{edit}}\)。为了保持执行者的空间位移路径和体态身份,系统直接保留全局平移 \(\mathbf{r}_t\) 与根节点方向 \(\mathbf{o}_t\),仅对选定时序窗口内的关节点局部旋转 \(\mathbf{p}_t\) 进行优化更新。

整体流程由三个紧密协同的阶段构成: 1. 因果姿态离散化分词(Pose Tokenizer):在专家动作序列上训练基于因果 Transformer 的 VQ-VAE,将连续运动动力学压缩为专家离散动作词表。 2. 运动学峰值掩码驱动的动作补全(MotionInfiller):利用标量运动学信号定位动作技能关键瞬时帧,在专家序列的关键帧周围施加时序掩码,以双向掩码语言建模(MLM)目标训练补全模型,学习专家运动先验。 3. 推理时掩码投影与姿态解码(Inference Mask-and-Infill):输入新手序列,提取同样的运动学峰值实施局部掩码,输入 MotionInfiller 双向重构出专家级 token 序列,最后经由解码器还原为 3D 关节姿态并拼回未修改的非关键帧。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入动作序列<br/>提取关节点与根轨迹"] --> B["因果姿态离散化分词<br/>时序因果 Transformer VQ-VAE"]
    B --> C["运动学峰值掩码驱动<br/>基于速度/加速度定位关键动作瞬时帧"]
    C --> D["动作补全网络训练与推理<br/>双向 Transformer 掩码填补"]
    D --> E["姿态解码与局部融合<br/>保留原平移/根旋转,输出编辑动作"]

关键设计

1. 因果姿态离散化分词:构建时序自洽的专家动作离散词表

传统的单帧姿态量化(Frame-wise Quantization)割裂了时序动力学约束,容易导致离散 token 序列缺乏物理平滑性与速度连贯性。ExpertEdit 采用因果 Transformer VQ-VAE 架构作为姿态分词器(Pose Tokenizer)。对于每一帧提取包含平移、根方向及关节旋转的组合特征向量 \(\mathbf{x}_t^{\text{exp}} = [\mathbf{r}_t^{\text{exp}}, \mathbf{o}_t^{\text{exp}}, \mathbf{p}_t^{\text{exp}}] \in \mathbb{R}^{6+3J}\),编码器 \(E_\phi\) 采用因果自注意力掩码(Causal Masking),使得时间步 \(t\) 的潜在向量 \(\mathbf{z}_t\) 仅聚合历史观测: $\(\mathbf{z}_t = E_\phi(\mathbf{x}_{\leq t}^{\text{exp}})\)$ 随后,潜在向量 \(\mathbf{z}_t\) 通过最近邻查找量化到预设规模为 \(K\) 的连续码本 \(\mathcal{C} = \{\mathbf{e}_k\}_{k=1}^K\) 中的对应码字 \(\mathbf{e}_{k_t^*}\)。因果解码器 \(D_\phi\) 结合当前及先前解码的 token 自回归重构原始运动 \(\hat{\mathbf{x}}_t\)。整个离散化分词模块使用标准 VQ-VAE 目标端到端训练: $\(\mathcal{L}_{\text{VQ}} = \|\mathbf{x}_t^{\text{exp}} - \hat{\mathbf{x}}_t\|_2^2 + \|\text{sg}[E_\phi(\mathbf{x}_{\leq t}^{\text{exp}})] - \mathbf{e}_{k_t^*}\|_2^2 + \beta \|E_\phi(\mathbf{x}_{\leq t}^{\text{exp}}) - \text{sg}[\mathbf{e}_{k_t^*}]\|_2^2\)$ 该设计赋予了每个离散 token 代表特定微观短程运动基元(motion primitive)的能力,为后续掩码补全奠定了具备几何自洽性与逆映射保障的离散表征空间。

2. 运动学峰值掩码驱动:自动化对齐动作核心功能阶段

在动作技能领域,运动执行的优劣并不平均分布在整个动作周期内,而是集中于决定动作成败的“操作性关键瞬时”(operative moment),例如篮球上篮的起跳蹬地、足球射门的脚球接触点或空手道出拳击打的瞬间。为了避免随机掩码导致模型破坏无关动作上下文,ExpertEdit 引入可解释的运动学标量信号 \(h(t)\) 自动检测峰值时刻 \(t^*\): $\(t^* = \arg\max_{t \in \{1,\dots,T\}} h(t)\)$ 在具体规则设定上:篮球动作采用垂直根节点速度寻找起跳点;足球点球提取下肢最大冲击跳跃(jerk magnitude);空手道冲拳提取极端姿态位移(postural extremeness);空手道腿法踢击则以足部末端最大加速度作为锚点。确定峰值 \(t^*\) 后,系统定义掩码区间跨度 \(\ell = \max(2, \lfloor \alpha T \rfloor)\)(其中最大跨度比例 \(\alpha = 0.3\)),并在其周围施加宽度为 \(2h\) 的对称遮蔽。该机制完全基于单条动作自身的力学规律计算,既不依赖外部人工微调标注,又能在训练与推理阶段精确捕获最具技能区分度的动作核心窗口。

3. 动作补全网络训练与推理:双向上下文约束下的专家流形投影

将关键窗口替换为可学习的 [MASK] 标记后,ExpertEdit 采用全注意力(bidirectional)Transformer 网络 MotionInfiller 重建被遮蔽区域内的专家 token 序列。相较于单向生成,动作补全能够双向结合被掩码区域前后的完整运动轨迹(如准备助跑与动作随挥落地),从而保证修补后的动作与原作者的入水/起跳/收尾姿势自然衔接: $\(\mathcal{L}_{\text{MLM}} = -\sum_{i=t^*-h}^{t^*+h} \log p_\theta(k_i^{\text{exp}} \mid \mathbf{k}_{\setminus [t^*-h:t^*+h]}^{\text{exp}})\)$ 在推理测试阶段,系统面对未经对齐的新手序列 \(\mathbf{X}^{\text{nov}}\),首先通过 \(E_\phi\) 转换为 token 序列,利用相同的运动学准则在其技能关键期施加 [MASK],随后由 MotionInfiller 执行单步前向推理将掩码区域补全为具备专家先验的 token。最后,解码器 \(D_\phi\) 解码得到修正后的关节轴角 \(\hat{\mathbf{p}}_t\)。非掩码时段的原始姿态被完整保留,平移 \(\mathbf{r}_t\) 与根朝向 \(\mathbf{o}_t\) 保持恒定,从而达成一种在“个人宏观轨迹”与“专家微观肢体形态”之间完美平衡的动作调优。

损失函数 / 训练策略

ExpertEdit 采用技术专属(Technique-specific)的解耦训练范式。针对每项具体动作技能 \(\tau\)(如反手上篮、反击冲拳),分别独立训练一组轻量化的 Pose Tokenizer 与 MotionInfiller。这种策略使模型能够在单一运动类别的流形上学得极其尖锐、纯净的专家动力学先验,有效避免了多技能多模态混合造成的姿态模糊与模式崩溃。同时,训练完全利用无配对的专家视频片段(Ego-Exo4D 中的“Late Expert”及空手道高段位数据),优化器最小化 \(\mathcal{L}_{\text{VQ}}\) 和 \(\mathcal{L}_{\text{MLM}}\),不引入任何人工反馈微调或复杂的强化学习奖励。

实验关键数据

主实验

为了客观衡量技能动作的修改质量,作者构建了首个跨两大数据集、涵盖 8 项典型运动技能(篮球 3 项、足球 1 项、空手道 4 项)的高质量评估基准库,并引入两项核心指标: - 姿态改善度(Pose Improvement, \(P\) ↑):计算模型编辑结果与对齐专家真实轨迹之间的 Procrustes 骨骼关节距离(PA-MPJPE),报告相较于原始新手动作的相对误差减小百分比。 - 分布拟合度改善(FID Improvement, \(F\) ↑):利用在专家/新手运动上预训练的动作分类器中间层特征空间,计算生成动作与专家流形之间的 Fréchet 距离改善率。

以下汇总了 ExpertEdit 与三大代表性动作编辑 SOTA 模型在篮球、足球及空手道各项目上的量化表现。

运动领域 动作技术 指标 ExpertEdit (本文) SimMotionEdit (监督微调) TMED (监督微调) FLAME (推理编辑)
篮球 Mikan Layup \(P\) (%) ↑
\(F\) (%) ↑
6.18
5.72
2.26
1.28
1.87
1.00
2.35
1.45
篮球 Reverse Layup \(P\) (%) ↑
\(F\) (%) ↑
5.87
12.08
2.31
4.88
2.20
4.30
2.09
6.13
篮球 Jumpshot \(P\) (%) ↑
\(F\) (%) ↑
5.34
7.66
3.95
1.24
2.58
2.03
3.13
1.54
足球 Penalty Kick \(P\) (%) ↑
\(F\) (%) ↑
6.03
9.14
3.20
2.38
2.57
1.95
2.90
2.22
空手道 Reverse Punch \(P\) (%) ↑
\(F\) (%) ↑
2.07
1.36
2.20
1.30
0.92
1.08
-
-
空手道 Spinning Back Kick \(P\) (%) ↑
\(F\) (%) ↑
1.79
4.23
1.43
3.30
0.86
2.25
-
-
空手道 Front Kick \(P\) (%) ↑
\(F\) (%) ↑
1.88
9.73
1.45
5.05
0.38
2.90
-
-
空手道 High Roundhouse Kick \(P\) (%) ↑
\(F\) (%) ↑
2.96
6.18
3.30
5.88
2.25
3.37
-
-

注:基线模型 SimMotionEdit 与 TMED 享有专属的 16k 伪成对数据微调特权,而 ExpertEdit 仅使用非成对专家样本。空手道数据集采用自定义 39 节点骨骼,预训练于 SMPL 的 FLAME 模型无法直接零样本迁移。

消融实验与人工评估

作者针对生成动作的实际指导价值组织了双盲 A/B 人类偏好测试(Blinded Human Preference Study),由具备真实篮球与足球竞技经验的受试者对匿名视频进行对比打分(“作为被编辑者,哪组视频对提升你的动作形态更有用?”)。

评估维度 偏好 ExpertEdit 偏好 SimMotionEdit (最强基线) 判定无差异 (Neither) ExpertEdit 胜率 (在非中立样本中)
篮球项目 (78 次裁决) 42.3% 26.9% 30.8% 61.1%
足球项目 (34 次裁决) 47.1% 23.5% 29.4% 66.7%
总体汇总 (112 次裁决) 43.8% 25.9% 30.4% 62.8%

关键发现

  • 显著超越特权监督基线:在未接触任何成对修正样本的前提下,ExpertEdit 在球类项目中的姿态改善(\(P\))与分布拟合(\(F\))达到监督扩散基线的 2 至 4 倍。反手上篮和点球上分别取得了 12.08% 与 9.14% 的分布跃迁提升。
  • 流形对齐优于盲目姿态过拟合:在空手道冲拳和高踢腿中,虽然 SimMotionEdit 在个别姿态欧氏距离误差上略占优势,但其分布改善度 \(F\) 明显弱于 ExpertEdit。这表明单纯的文本引导回归容易生成违背运动动力学先验的平庸过渡帧,而离散流形补全能真实合成符合高段位力学机制的下肢伸展与上身随动。
  • 质性动作纠错直观清晰:可视化显示,经由 ExpertEdit 编辑后,新手反手上篮时起跳侧膝盖抬升更为充分,跳投时托球手掌精准调整至球体正下方,空手道踢击的大腿高抬与膝盖锁扣动作更为干脆利落。

亮点与洞察

  • 将动作微调解耦为局部流形投影:摆脱了将动作编辑视作“整段动作重新生成”或“全局文本风格迁移”的定势思维,精准抓取技能表现的“低熵时段”(生物力学峰值),仅在局部施加专家流形补全,兼具动作真实性与主体保真度。
  • 无需成对监督的数据轻量化范式:现实世界中高水平专家的动作演示视频易于在网络上批量获取,而成对标注的纠偏数据极度匮乏。该方法证明只要利用好自监督掩码建模,仅凭单模态非成对专家库便足以训练出工业级微调模型。
  • 构建首个高质量技能编辑评测基准:结合动态时间规整(DTW)、镜像手性对齐与专业运动员双盲审查,公开了包含多技术、多视角的标准化基准集,填补了该领域定量化评估标准的长期缺失。

局限与展望

  • 依赖预定义的运动学标量规则:当前用于确定关键帧峰值 \(t^*\) 的物理量(如垂直速度、冲击度、末端加速度)依赖于针对不同动作的人工经验选取。未来可探索利用多模态大语言模型(MLLM)根据动作文字描述自主推导生物力学监测关节点与统计量。
  • 尚未显式建模物体与环境交互约束:模型目前完全在 3D 骨骼空间中运作,剥离了球体、球筐或地面对抗等物理接触。当新手的初始位置离篮筐过远时,单纯将起跳动作转为扣篮可能出现局部几何悬空或不合物理实情的空间位移。
  • 固定全局时间节律的限制:为了保障与原视频帧对齐,模型锁定了动作总时长与推进节奏。然而高水平运动员往往具备更爆发性的加速与收缩,未来可引入时间轴弹性自适应形变机制。

相关工作与启发

  • vs MotionFix / TMED [5]: MotionFix 依赖人工标注的“修改前动作-文字提示-修改后动作”三元组,在面对细粒度技术纠偏时,文字提示往往沦为空泛的“动作更流畅稳定”。ExpertEdit 完全摒弃了文本条件与成对数据,直接通过专家动作自监督掩码提取微观形态先验。
  • vs SimMotionEdit [32]: SimMotionEdit 试图依靠辅助模块预测 1D 时序编辑权重,但由于缺乏高密度的局部指令,时序定位经常失真。ExpertEdit 采用底层生物力学运动学峰值直接界定编辑区间,定点切入更加精确扎实。
  • vs ExpertAF [3]: ExpertAF 需要成对的新手-专家视频以及专家语音点评进行多模态对齐监督,标注成本高昂。ExpertEdit 仅学习专家视频流形,推理时零触发式补全,显著降低了商业化与规模化部署门槛。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次提出无成对监督、无推理指令的动作技能自动微调范式,掩码补全构思巧妙]
  • 实验充分度: ⭐⭐⭐⭐⭐ [跨越 3 种竞技运动、8 项高难度技能,结合 DTW 评测基准与专业运动员盲评]
  • 写作质量: ⭐⭐⭐⭐⭐ [问题定义明确,图表叙述紧凑,生物力学与计算机视觉结合深入]
  • 价值: ⭐⭐⭐⭐⭐ [为智能体育训练、AI 运动康复以及具身智能专家轨迹增强提供了全新基石]