跳转至

K-Mask: Kinematic-Aware Masked Modeling for Controllable Text-to-Motion Synthesis

会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 人体理解
关键词: 文本驱动动作合成、离散动作分词、运动学分组、掩码建模、局部动作编辑

一句话总结

K-Mask 提出了一种运动学感知的文本动作合成框架,通过将动作隐空间解耦映射到解剖学分组残差矢量量化(KG-RVQ),结合抗跨组泄漏的潜空间运动学丢弃损失(LAKD)与时空轴向分解掩码 Transformer,在无需独立分肢编码器的前提下实现了 SOTA 生成质量与精准的肢体级局部控制。

研究背景与动机

文本驱动的人体动作生成旨在根据自然语言描述合成真实连贯的 3D 动作序列,是角色动画、影视制作、具身智能与人机交互等领域的核心基础技术。随着扩散模型与离散掩码生成模型的发展,动作生成的保真度与文本对齐度大幅提升。然而,在实际应用场景中,用户往往不满足于生成单一的全局动作,而是需要针对特定身体部位进行细粒度编辑与局部重采样(例如保持行走的下肢步态不变,仅修改右臂做挥手动作),同时必须保证全身协同的生物力学自然性。

现有主流方法面临着可控粒度与架构复杂度的尖锐矛盾。基于连续扩散的方法虽然具有良好的多样性,但采样推理开销巨大,局部编辑通常依赖复杂的推理时交叉注意力引导或反向优化;而基于 RVQ-VAE 的掩码生成模型虽然支持快速并行采样与原生补全(inpainting),但绝大多数工作采用全身体(whole-body)的分词策略,将全身姿态压缩为单一的时序离散 token 流,导致部位级编辑指令极易引发无关肢体的伴随性漂移(collateral corruption)。少数关注部位感知的方案要么为每个肢体单独构建独立的局部编码器与生成器,大幅增加了系统参数量与协同开销;要么激进地将 token 粒度细化至单关节级别,导致离散通道严重碎片化并引入极其高昂的时空注意力计算代价。

本文的切入点在于:无需引入繁复的独立局部子网络,也可以在统一的全身分词器中实现严格的解剖学解耦。只要在统一潜空间中按运动学结构划分通道容量,并施加对抗信息泄漏的监督约束,就能让单一生成器直接操纵解剖学结构化的离散 token 晶格。核心 idea:构建基于运动学分组的残差矢量量化(KG-RVQ),提出潜空间感知运动学丢弃损失(LAKD)强制消除跨肢体信息串扰,并配合时空轴向分解注意力和结构化运动学掩码策略,实现全局协调与局部严格解耦的文本动作生成与编辑。

方法详解

整体框架

K-Mask 的整体架构构建在统一的运动学时空晶格 \((t, g)\) 上。系统由三个核心模块构成:首先,单阶段统一的运动学分组残差矢量量化器(KG-RVQ)将时序姿态序列编码为 6 个解剖学运动学流,通过非均匀通道容量分配与独立残差码本进行量化,并在 LAKD 损失约束下阻断跨组隐空间泄漏;其次,基础时空 Transformer(Base-T)采用时域优先的时空轴向分解自注意力机制,在大规模混合掩码(随机 token 掩码与结构化运动学子树掩码)下并行预测粗粒度基础层动作 token(\(q=0\));最后,残差时空 Transformer(Res-T)以粗粒度隐向量与历史残差为条件,逐层去噪生成精细残差层 token(\(q>0\)),最终经统一解码器重构出完整的 3D 骨骼运动。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入动作序列与文本提示词"] --> B["运动学分组残差量化与非均匀分配<br/>全身编码并切分6个运动学流与独立RVQ"]
    B --> C["潜空间感知运动学丢弃损失LAKD<br/>正向重构与跨组内外泄漏抑制"]
    C --> D["时空轴向分解自注意力机制<br/>时域-空域交替建模降低计算复杂度"]
    D --> E["混合结构化运动学分组掩码建模<br/>随机掩码与肢体子树协同掩码联合训练"]
    E --> F["双阶段生成与局部动作解耦编辑<br/>冻结无关组并重采样目标肢体Token"]

关键设计

1. 运动学分组残差量化与非均匀分配:解剖学生物力学与码本容量的自适应匹配

以往部位感知模型多为各肢体配置独立的轻量编码器,破坏了全身动理学特征提取的连贯性;若简单将统一全身体向量均分,又会忽视人体各部位运动自由度的非均匀性(如脊柱与四肢的动力学复杂度显著高于根节点轨迹)。K-Mask 采用统一的一维时序卷积编码器提取全身隐特征 \(Z_t \in \mathbb{R}^d\),并将其显式切分为 \(G=6\) 个运动学子流(根节点 root、脊柱 spine、左腿、右腿、左臂、右臂),即 \(Z_t = [Z_t^{(1)} \parallel \cdots \parallel Z_t^{(G)}]\)。受听觉感知编码的比特分配准则启发,模型放弃了均匀划分(\(d_g = d/G\)),而是根据各运动学组的原始输入特征维度 \(D_g\) 实行成比例的通道容量分配:

\[d_g \propto D_g, \quad \text{s.t.} \sum_{g=1}^G d_g = d, \quad d_g \ge d_{\min}\]

每个运动学组配置一组独立的深度为 \(Q\) 的残差矢量量化(RVQ)码本栈 \(\mathcal{C}_{g,q} = \{e_{g,q,k}\}_{k=1}^K\)。逐层残差逼近后,所有组的量化嵌入在通道维度重新拼接送入共享卷积解码器重构全身动作,将动作离散索引规整化为时间-分组-量化层级的结构化张量 \(I \in \{1, \dots, K\}^{T' \times G \times Q}\)。

2. 潜空间感知运动学丢弃损失LAKD:彻底阻断共享网络中的跨组信息串扰

虽然架构上人为划分了分组通道,但在没有显式约束的情况下,共享参数的编码器和解码器不可避免地利用某一肢体通道偷渡其他肢体的相关性信息(例如利用右臂通道记忆下肢行走的节律),导致局部编辑时产生严重的伴随动作形变。为此,K-Mask 提出了潜空间感知运动学丢弃损失(LAKD)。训练时随机选取一个运动学组 \(g\),通过空间二进制掩码分别构造“仅保留该组”的潜向量 \(\hat{Z}_{\text{only } g}\) 与“屏蔽该组”的潜向量 \(\hat{Z}_{\text{except } g}\),定义由正向保真与双向负向抑制组成的三元正则化目标:

\[\mathcal{L}_{\text{LAKD}}(g) = \mathcal{L}_{\text{pos}}(g) + \mathcal{L}_{\text{neg-in}}(g) + \mathcal{L}_{\text{neg-out}}(g)\]

其中各子项通过投影算子 \(P_g(\cdot)\) 在重构姿态空间中计算:正向重构项 \(\mathcal{L}_{\text{pos}}(g) = \|P_g(g_\phi(\hat{Z}_{\text{only } g})) - P_g(X)\|_1\) 强制要求组 \(g\) 的独立通道具备完整重构该肢体动作的自给自足能力;输入负抑制项 \(\mathcal{L}_{\text{neg-in}}(g) = \|P_g(g_\phi(\hat{Z}_{\text{except } g}))\|_1\) 严惩其他组的隐向量参与组 \(g\) 的动作重构;输出负抑制项 \(\mathcal{L}_{\text{neg-out}}(g) = \|P_{\bar{g}}(g_\phi(\hat{Z}_{\text{only } g}))\|_1\) 严惩组 \(g\) 的隐向量泄漏干预其他非目标肢体 \(\bar{g}\)。LAKD 将跨组泄漏率从 2.484 骤降至 0.088,奠定了纯净部位级控制的物理基础。

3. 时空轴向分解自注意力机制:兼顾跨肢体协调与高效长序列建模

直接在展平的 \(T' \times G\) 时空离散网格上应用标准全自注意力,计算复杂度高达 \(\mathcal{O}((T'G)^2)\),随时间序列延长呈二次方膨胀,且容易过早模糊肢体内部的时序动态。K-Mask 采用时域优先的时空轴向分解自注意力结构(Temporal-then-Spatial, T\(\to\)S):输入端融合共享 token 嵌入、时序位置编码 \(P_t\)、可学习运动学组嵌入 \(P_g\) 以及投影后的 CLIP 文本特征;网络交替级联时域自注意力和空域自注意力模块,先在各组内部沿时间轴进行独立动态建模,随后在同一时间步沿分组轴进行跨肢体协同注意力交互。该设计将复杂度降至 \(\mathcal{O}(T'^2 G + T' G^2)\),实验证明其在生成质量与文本对齐度上均优于空域优先(S\(\to\)T)及标准全自注意力。

4. 混合结构化运动学分组掩码建模:自适应学习跨肢体协同动力学

为了在推理时无缝支持任意肢体的局部补全与整体重构,基础生成器 Base-T 摒弃了单一的随机 token 掩码,设计了混合掩码策略。在训练过程中,以概率 \(p_{\text{kin}} = 0.25\) 触发结构化运动学掩码,直接掩盖整个序列中特定解剖学子树对应的全部 token(包括对称肢体如双腿、上下半身划分、或任意随机肢体子集),强迫模型仅根据其余未掩码肢体与文本上下文推断被遮蔽肢体的协同动力学;以概率 \(1 - p_{\text{kin}} = 0.75\) 执行基于余弦调度比例的随机 token 掩码,兼顾局部补帧与细节生成。推理阶段进行局部动作编辑时,只需固定非目标组 token,仅对目标肢体组执行迭代重采样,亦可自然拓展掩码范围至躯干或相邻关节以吸收生物力学校正补偿。

损失函数 / 训练策略

分词器 KG-RVQ 与两阶段生成器采用分步解耦训练: 1. 分词器训练:总损失包含平滑 \(\ell_1\) 重构损失 \(\mathcal{L}_{\text{rec}}\)、矢量量化承诺损失 \(\mathcal{L}_{\text{commit}}\) 以及加权 LAKD 正则项,超参数配置为 \(\lambda_{\text{com}}=0.02\)、\(\lambda_{\text{LAKD}}=2.0\),在 AdamW 优化器下以余弦退火学习率(初始 \(2 \times 10^{-4}\))训练 50 个 epoch。 2. 两阶段 Transformer 训练:Base-T 基于交叉熵目标预测被掩码的基础层 token,并引入分类器无关引导(CFG)随机丢弃文本条件;Res-T 针对随机采样的残差层 \(q \in \{1, \dots, Q-1\}\),在反量化历史隐特征中注入随机扰动以克服暴露偏差,训练 2000 个 epoch(batch size = 64)。推理时 Base-T 采用 18 步迭代掩码预测。

实验关键数据

主实验

在代表性学术基准 HumanML3D 与 KIT-ML 上,K-Mask 与主流扩散模型及离散掩码模型进行了全面的生成质量定量评测。

数据集 方法 FID ↓ R-Precision (Top-1) ↑ R-Precision (Top-3) ↑ Multimodal Dist ↓ Diversity →
HumanML3D T2M-GPT [56] 0.141±.005 0.492±.003 0.775±.002 3.121±.009 9.761±.081
HumanML3D MotionDiffuse [57] 0.630±.001 0.491±.001 0.782±.001 3.113±.001 9.410±.049
HumanML3D MoMask [16] 0.045±.002 0.521±.002 0.807±.002 2.958±.008 -
HumanML3D BAMM [35] 0.055±.002 0.525±.002 0.814±.003 2.919±.008 9.717±.089
HumanML3D ParCo [62] 0.109±.005 0.515±.003 0.801±.002 2.927±.008 9.576±.088
HumanML3D K-Mask (本文) 0.041±.003 0.531±.003 0.824±.002 2.917±.006 9.671±.074
KIT-ML T2M-GPT [56] 0.514±.029 0.416±.006 0.745±.006 3.007±.023 10.86±.094
KIT-ML MoMask [16] 0.204±.011 0.433±.007 0.781±.005 2.779±.022 -
KIT-ML BAMM [35] 0.183±.013 0.438±.009 0.788±.005 2.723±.026 11.008±.094
KIT-ML ParCo [62] 0.453±.027 0.430±.004 0.772±.006 2.820±.028 10.95±.094
KIT-ML K-Mask (本文) 0.154±.025 0.455±.006 0.793±.006 2.671±.020 10.993±.096

在包含 200 个样本的标准 HumanML3D 局部精准编辑评估集(覆盖单双臂抬起、挥手、踢腿、弯腰等 8 类动作)上,K-Mask 表现出压倒性的保真与编辑成功率优势:

方法 FID ↓ 目标成功率 (TSR ↑) 检索对齐 (R@3 ↑) 溢出位移 (Spillover ↓) 轨迹漂移 (Drift ↓) 脚滑率 (Skate ↓)
MoMask [16] 0.045 20.0 26.6 0.164 0.74 0.009
BAMM [35] 0.055 7.0 21.9 0.136 1.33 0.009
ParCo [62] 0.109 11.5 27.6 0.190 1.15 0.016
MoGenTS [54] 0.028 19.0 25.5 0.168 0.92 0.018
K-Mask (本文) 0.041 22.5 28.4 0.108 0.41 0.002

消融实验

在受控的 30-epoch 基准预算下对分组设置、容量分配及 LAKD 正则化强度的系统性消融如下表所示:

配置 分组数 \(G\) 容量分配策略 \(\lambda_{\text{LAKD}}\) 重构 FIDrec ↓ MPJPE (mm) ↓ 跨组泄漏比 (Leak.) ↓
Whole-body (全身体) 1 - - 0.033 30.6 -
Coarse (粗粒度) 3 Proportional 2.0 0.010 17.9 0.071
No LAKD (无正则) 6 Proportional 0.0 0.008 16.4 2.484
Low \(\lambda\) (低正则) 6 Proportional 0.5 0.009 18.7 0.184
High \(\lambda\) (高正则) 6 Proportional 4.0 0.015 19.5 0.104
Uniform (均匀分配) 6 Uniform 2.0 0.010 18.5 0.106
Joint-level (单关节) 22 Proportional 2.0 0.013 20.3 1.489
K-Mask (完整设定) 6 Proportional 2.0 0.010 17.2 0.088

关键发现

  • LAKD 是实现局部可控的核心屏障:在去除 LAKD 时,虽然模型由于容量自由共享使得单纯姿态重构指标略微更优(MPJPE 16.4mm vs 17.2mm),但跨组泄漏率从 0.088 剧增近 30 倍至 2.484,导致局部编辑完全失控。LAKD 的本质作用是牺牲极微小的无约束拟合冗余,换取严格的解剖学独立性。
  • 解剖学分组与细化粒度的权衡:单关节级细化(\(G=22\))反而使离散容量严重碎片化,导致泄漏率恶化至 1.489,且 MPJPE 退化至 20.3mm;而粗粒度分组(\(G=3\))虽然泄漏低但丧失单侧肢体控制力。\(G=6\) 结合非均匀成比例容量分配达成了最优平衡。
  • 结构化掩码显著增强协同生成:将运动学掩码概率从 \(p_{\text{kin}}=0\) 提升至 \(0.25\),使 HumanML3D 生成 FID 从 0.108 显著跃升至 0.041,证实了主动遮蔽肢体子树对于训练跨部位动力学协同至关重要。

亮点与洞察

  • 无需多模型分支的解耦分词:摒弃了以往部位控制模型为每个肢体单独搭建编码器/生成器的庞大开销,在单一紧凑编码器下仅通过隐空间通道运动学分配与 LAKD 负向抑制,就达成了近乎完美的解剖学解耦。
  • 兼顾独立性与协同补偿:在局部编辑时不仅支持对目标肢体组的绝对隔离重采样(Spillover 从基线的 0.164 降至 0.108,轨迹漂移降低超 40%),而且支持根据生物力学自适应拓展到躯干邻近组,化解了机械刚性拼接导致的动作断裂。
  • 高效时空轴向建模迁移性:时域优先再空域交互的分解自注意力设计(T\(\to\)S)不仅压低了二次方计算开销,还为具身智能中多动作流与多关节协同控制提供了通用的网络设计范式。

局限与展望

  • 极端动力学耦合动作的解耦受限:对于全身高度参与的剧烈复合动作(如翻滚、武术旋转跳跃),单肢体的强行独立编辑容易破坏全局动量守恒,出现视觉上的失真。
  • 解剖学分组粒度固定:当前预设 6 个固定组,对于手指微动作或面部表情等更高精度局部交互无法覆盖,未来可探索自适应层次化运动学树分词。
  • 长文本复杂序列的时序组合扩展:在超长动作序列的多阶段指令编辑中,时序边界处的平滑过渡仍依赖全局扩散重采样,后续可结合自回归或连续潜空间混合建模。

相关工作与启发

  • vs MoMask [16] / BAMM [35]:MoMask 与 BAMM 均采用全身全量 RVQ tokenization,局部编辑只能退化为时间窗口内的全量 inpainting,造成非目标肢体的严重窜改(Spillover 达 0.164);K-Mask 的空间解剖学 token 晶格使非目标肢体严格冻结。
  • vs ParCo [62]:ParCo 采用多个局部生成器和独立融合模块,系统复杂度与训练难度高;K-Mask 采用单一掩码生成器与统一分词器,模型更轻量且端到端协同更强。
  • vs MoGenTS [54]:MoGenTS 激进地划分到 22 关节级别,不仅面临通道容量稀疏碎片化问题,还导致计算复杂度激增;K-Mask 证明 6 运动学分组是非均匀解剖学控制的最佳结构先验。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出 LAKD 损失解决统一编码器的跨组泄漏问题,实现解剖学解耦分词。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖双 benchmark 全面主实验、标准局部编辑协议与极其详实的分组/正则消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严谨,动机阐述切中要害,方法图示与消融设计高度自洽。
  • 价值: ⭐⭐⭐⭐⭐ 为细粒度人体动作可控生成与动画局部精准编辑提供了通用且高效的技术路线。