跳转至

CtrlCoMo: Controllable Co-Speech Motion Generation with Gesture–Action Disentanglement

会议: ECCV 2026
论文: ECCV 2026
领域: 人体理解
关键词: 动作生成, 语音驱动手势, 手势与动作解耦, 多尺度残差量化, 多模态控制

一句话总结

针对语音驱动动作中手势与语义动作相互干扰的难题,CtrlCoMo 提出多尺度量化架构 Pyramid-VQ 与逐层衰减的 CLIP 语义正则,将高频局部手势与低频全局动作分层解耦,并结合 AdaLN 实现手势强度的显式连续可控生成。

研究背景与动机

生成与语音节律高度同步的人体动作是构建高真实感虚拟数字人与具身交互智能体的核心技术。现存的语音动作生成模型主要聚焦于从语音声学特征中映射出节奏性手势(如节拍手势与简单指示手势),但难以驱动虚拟角色在说话的同时执行具有明确上下文语义的具体动作。在真实的日常交流与互动中,说话人往往在执行特定任务动作(如倒茶、敲键盘、展示物品或拿取器具)的同时伴随自然的说话动作与手势。现有的语音手势数据集(如 TalkSHOW、BEAT 等)大多采集自 TED 演讲或新闻播报场景,动作模式高度退化为单一的站立会话手势;而传统的文本驱动人体动作数据集(如 HumanML3D、KIT-ML)虽然富含复杂的动作语义,却完全缺失语音同步的交互语境。

在此类伴随语音的复合动作生成中,最大的技术阻碍在于手势(Gestures)与动作(Actions)在时空上的高度交织与相互干扰。以边吹长笛边说话或边倒茶边讲解为例,受语音驱动的手势会与正在执行的器械操作动作产生时空重叠与动作叠加。这种内在干扰使得模型极易混淆文本提示词对应的动作语义特征与语音声学对应的节奏运动,导致文本对动作的控制力显著下降。另一方面,现有残差矢量量化(Residual VQ)架构缺乏对各级量化层语义职责的显式约束,不同频率的运动信息容易混杂在各个码本之中。

本文的核心洞察在于:伴随语音的手势在频域上通常表现为高频、局部且短时的细微运动;而承载具体语义的宏观动作则展现为低频、全局且跨越长时间步的稳定骨架轨迹。核心 idea:提出分层多尺度量化架构 Pyramid-VQ,通过自浅至深的显式时间分辨率金字塔与逐层衰减的 CLIP 语义约束,将低频全局动作与高频局部手势解耦至不同码本层级,并在自回归生成阶段通过 AdaLN 机制实现手势强度的显式独立可控生成。

方法详解

整体框架

CtrlCoMo 整体由两大部分构成:负责离散表征与解耦的动作分词器 Pyramid-VQ-VAE,以及负责多模态条件生成的层级自回归 Transformer(AR Generator)。系统对躯干(Body)与双手(Hand)分别训练独立的 Pyramid-VQ 分词器,以消除手部细微动作与全身运动的尺度差异。在表征阶段,Pyramid-VQ 将输入的动作序列逐步编码至由粗到细的 \(L\) 级离散残差码本中;在生成阶段,自回归生成器以文本描述与语音特征(MFCC)为条件,按照自粗至细的层级顺序依次预测各级动作 Token,并通过 AdaLN 注入用户指定的标量手势强度参数,最终通过解码器重构出完整的 3D 动作。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入动作序列 X"] --> B["多尺度量化 Pyramid-VQ<br/>粗到细时间分辨率下采样"]
    B --> C["逐层衰减语义正则化<br/>浅层强约束 / 深层零约束"]
    C --> D["动作手势解耦离散 Token<br/>分层残差码本表示"]
    E["输入文本 + 语音 MFCC"] --> F["跨模态层级自回归生成<br/>自粗至细依次预测 Token"]
    D -.->|预训练码本监督| F
    G["手势强度标量控制信号"] --> H["AdaLN 自适应调制模块<br/>动态缩放偏移隐层表征"]
    H --> F
    F --> I["解码输出 3D SMPL-X 动作"]

关键设计

1. 多尺度残差量化 Pyramid-VQ:按时间分辨率强制分离全局动作与局部手势 传统 Residual VQ 虽然具备多层残差细化能力,但每一层均在相同的时序分辨率下运行,无法对各层的语义职责与运动频率进行功能分工。Pyramid-VQ 显式地将 \(L\) 个量化层级绑定至递增的时间尺度 \(T_1 \le T_2 \le \dots \le T_L = T\)。在残差更新过程中,对于第 \(d\) 层,先将前一层的残差 \(R^{(d)}\) 沿时间维度进行线性插值下采样至粗分辨率 \(T_d\) 得到 \(\bar{R}^{(d)}\),在第 \(d\) 层专用码本 \(\mathcal{C}_d\) 中检索最近邻码字得到量化向量 \(\hat{Z}^{(d)}\),随后上采样回原始分辨率 \(T\) 并在残差中予以减除:

\[R^{(d+1)} = R^{(d)} - \text{Upsample}_d(\hat{Z}^{(d)})\]

下采样操作充当了低通滤波器,强制最浅层的 VQ 层仅能捕捉变化缓慢的全局动作轮廓与躯干轨迹;随着残差逐层向深处传递,时间分辨率逐步升高,较深层级自然聚焦于高频、局部的手部微小摆动与语音对齐手势。此外,全局语义动作需要更大的字典容量来覆盖开放词汇动作,而局部伴随手势具有更强的模式重复性,因此各层码本容量采用由大到小递减配置(\(K_1 > K_2 > \dots > K_L\)),使码本表达能力与运动层级深度严格对齐。

2. 逐层衰减语义正则化:引导浅层码本对齐文本语义 仅依赖时序下采样仍可能出现动作语义泄露到深层或手势节奏污染浅层的问题。为进一步加强层级间的语义解耦,模型引入了基于预训练 CLIP 文本特征的逐层衰减正则化。对于第 \(d\) 层量化后的表征 \(\bar{Z}^{(d)}\),通过时序全局平均池化得到特征向量 \(\tilde{z}^{(d)}\),并计算其与 CLIP 文本嵌入向量 \(Z_{\text{clip}}\) 之间的余弦相似度。该项正则化的损失函数定义为:

\[\mathcal{L}_{\text{semantic}}^{(d)} = -\lambda_d \cdot \text{sim}(Z_{\text{clip}},\, \tilde{z}^{(d)})\]

其中正则化权重系数 \(\lambda_d\) 随层数深度 \(d\) 逐渐衰减为零,设计为 \(\lambda_d = \left(1 - \frac{d-1}{L}\right)^\gamma\)。这种自浅向深逐层减弱的约束机制,确保最浅层的动作基底受到最强的文本语义先验引导,精准表征与文本指令对应的全局动作;而深层量化层则完全解除文本语义束缚,专注于捕捉由声学信号引导的自发性细微手势。

3. 跨模态层级自回归生成:自粗至细联合预测躯干与手部 Token 在生成阶段,自回归生成器采用 12 层 Decoder-only Transformer。对于身体(Body)与手部(Hand),多层量化 Token 按照“粗尺度到细尺度、层内自左向右”的固定栅格顺序展开为一维序列。解码器采用因果注意力掩码,使得每个时间步的预测不仅能关注当前层先前生成的 Token,还能完全感知所有更粗层级的全局动作信息。共享的隐层表征通过两个卷积输出头分别输出身体与手部的类别概率分布,保证了躯干与双手运动的时空协调性。

4. 基于重构残差与 AdaLN 的手势强度显式控制:连续调节说话表达幅度 借助 Pyramid-VQ 优秀的分层解耦特性,前 \(l\) 层的部分重构 \(\hat{X}^{(l)}\) 主要呈现基础宏观动作,而忽略了细微手势。因此,浅层重建残差能天然定量反映运动中伴随手势的幅度强度。定义浅层残差与全层残差之差作为手势强度信号:

\[\text{Intensity} = \mathcal{E}_{L//2} - \mathcal{E}_{L}\]

式中 \(\mathcal{E}_d = \|X - \hat{X}^{(d)}\|_F^2\)。在训练阶段,该标量强度经归一化后作为连续控制条件,通过 AdaLN-Zero(Adaptive Layer Normalization)层注入至自回归 Transformer 块中,动态调节归一化层的缩放与偏置系数。同时引入 \(p_{\text{intensity}} = 0.35\) 的随机丢弃策略,使得推理阶段用户不仅能自由指定 \([0, 2.0]\) 的手势强度系数来连续放大或抑制手势幅度,亦可置空使用模型学到的默认分布。

损失函数 / 训练策略

Pyramid-VQ 分词器的整体训练目标包含三项:运动重构损失 \(\mathcal{L}_{\text{rec}}\)(由关节位置 \(L_1\) 损失、速度损失与骨架几何约束组成)、码本承诺损失(Commitment Loss)以及逐层 CLIP 语义正则化损失:

\[\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{rec}} + \sum_{d=1}^{L} \mathcal{L}_{\text{commit}}^{(d)} + \sum_{d=1}^{L} \mathcal{L}_{\text{semantic}}^{(d)}\]

码本更新采用指数移动平均(EMA)。在配置上,\(L=10\) 层,时序分辨率序列配置为 \(\{2, 2, 3, 4, 5, 6, 7, 8, 11, 22\}\)(全分辨率长度为 176 帧,经 8 倍下采样后为 22)。码本大小从浅层到深层每两层减半(512 至 32)。自回归模型与 VQ 分词器均在 4 张 NVIDIA A800 GPU 上使用 AdamW 优化器独立训练 250k 迭代步,学习率固定为 \(1\times 10^{-4}\)

实验关键数据

为评测伴随语音的复杂动作生成,作者构建了包含 370 小时真实动作与语音对齐的大规模基准数据集 CoHuMo(涵盖 20 余种场景类型与 5 种以上语言,提供高质量 SMPL-X 标注与精确文本动作描述)。

主实验

在 CoHuMo 测试集上,将 CtrlCoMo 与当前主流的语音动作生成 SOTA 方法进行对比。评测指标包括:衡量动作真实感与分布距离的 Fréchet Gesture Distance (FGD ↓)、关节平均欧氏误差 (MAJE ↓)、文本-动作多模态特征距离 (MM-Dist ↓) 以及检索精度 (R-Precision Top-1/2/3 ↑)。

方法 FGD ↓ MAJE ↓ MM-Dist ↓ R-Precision Top-1 ↑ R-Precision Top-2 ↑ R-Precision Top-3 ↑
TalkSHOW 22.98 10.727 1.287 0.245 0.366 0.448
Syntalker 80.57 9.136 1.306 0.174 0.273 0.353
SemGes 183.74 9.467 1.306 0.180 0.284 0.366
Probtalk 29.85 9.288 1.270 0.310 0.444 0.532
CtrlCoMo (本文) 22.27 8.932 1.257 0.373 0.520 0.608

消融实验

消融实验验证了金字塔多尺度结构(Pyramid-VQ)与逐层语义正则(SemReg)的关键作用。“Res-VQ”表示使用固定时间分辨率的标准残差 VQ。

配置 FGD ↓ MAJE ↓ MM-Dist ↓ R-Precision Top-1 ↑ R-Precision Top-2 ↑ R-Precision Top-3 ↑ 说明
Res-VQ 109.63 9.342 1.274 0.308 0.441 0.528 缺乏多尺度约束,动作与手势混杂,真实度严重退化
Pyramid-VQ 23.61 9.252 1.235 0.344 0.484 0.574 引入分辨率金字塔,FGD 从 109.63 降至 23.61
Pyramid-VQ + SemReg (完整模型) 22.27 8.932 1.257 0.373 0.520 0.608 增加逐层语义对齐,Top-1 检索率进一步提升 2.9%

此外,输入控制模态的消融表明:在推理阶段移除文本条件会导致 R-Precision Top-1 骤降至 0.102,验证了文本对动作语义的绝对主导地位;而移除音频信号则导致 FGD 剧增至 109.42,说明音频是维持动作节律与自然度的关键支撑。数据规模扩展实验(从 10k 样本扩展至 200k 样本)表明模型指标呈现显著的单调收益,验证了 CoHuMo 大规模数据集构建的必要性。

关键发现

  • 多尺度时间金字塔是解耦的决定性基石:将 Pyramid-VQ 替换为标准 Res-VQ 后,FGD 剧烈恶化(从 22.27 暴增至 109.63)。这表明若不施加显式的时间分辨率阻断,高频语音手势会渗透到所有层级,严重破坏全局动作的学习稳定性。
  • 逐层语义正则显著增强文本控制准确性:加入语义正则化后,R-Precision Top-1 从 0.344 跃升至 0.373,Top-3 达到 0.608,证明浅层码本在 CLIP 约束下有效锁定了宏观动作意图。
  • 独立可控的手势强度调节能力:定性与可视化结果证实,在保持文本动作语义完全一致(如单手端茶杯喝水)的前提下,通过连续改变强度参数 \(\text{Intensity} \in [0.0, 2.0]\),虚拟人说话时的手臂挥动与辅助手势呈现出严格单调的幅度伸缩,且不会破坏端水、倒水等核心物理交互动作。

亮点与洞察

  • 将 VAR 的多尺度层级预测思想成功迁移至运动解耦领域:将图像领域的自回归尺度金字塔与人体运动的频域特性相结合,巧妙利用时间下采样作为天然的低通滤波器,实现了无需手工拆解骨架层级的全局动作与局部手势解耦。
  • 以多层残差重构差值定义连续手势强度:摆脱了以往手势生成任务需要繁琐的人工规则打标或外置动作幅度分类器的做法,直接从解耦架构本身的残差能量差中提取出精准的物理强度标量。
  • 补齐了动作+伴随手势双重标注的领域基准:发布了长达 370 小时的 CoHuMo 数据集,打通了文本动作(Text-to-Motion)与语音手势(Co-Speech Gesture)两大领域之间长久以来的数据孤岛。

局限与展望

  • 下半身运动与复杂场景物理接触尚未建模:论文主要聚焦于上半身躯干与双手运动(SMPL-X 上半身模型),在坐姿椅面接触、双脚行走位移及复杂物体交互物理接触方面的建模仍显不足。
  • 手势强度的定义仍依赖全局残差统计:目前的强度标量是一个全序列全局参数,尚无法支持精细到局部身体部位(如单手激动而另一手保持静止)或随句子重音动态波动的局部时变强度控制。
  • 未来方向:可进一步将全身根节点位移(Root Motion)与场景几何约束(Scene Affordance)融入多尺度残差体系,实现能够在 3D 复杂环境中边走边讲、边操作物体边解说的全能虚拟数字人。

相关工作与启发

  • vs TalkSHOW / EMAGE: 此类传统语音手势方法依赖音频驱动全身或上半身手势,缺乏强有力的文本动作语义控制分支,无法执行“边说话边打字”或“边解说边倒茶”等具有明确物理指向的复合动作;CtrlCoMo 引入文本驱动语义动作并实现了手势-动作解耦。
  • vs HumanML3D / T2M-GPT: 传统文本驱动动作生成模型仅关注纯净动作的合成,忽视了口语交流场景中语音声学信号对肢体高频节律的调节作用;CtrlCoMo 结合音频与文本,实现了双模态协同约束。
  • vs Res-VQ / RVQ-VAE: 传统 RVQ 各层缺乏物理或频域先验约束;CtrlCoMo 结合显式时间分辨率金字塔与衰减 CLIP 引导,为结构化解耦表征提供了可复用的范式。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出解决伴随语音场景下手势与动作交织干扰问题,Pyramid-VQ 与残差强度标定设计极为精妙。
  • 实验充分度: ⭐⭐⭐⭐⭐ 构建了 370 小时大规模开源级别基准 CoHuMo,对比基线全面,主客观与消融实验论证严密。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然流畅,数学形式化表达严谨,问题定义直击领域真实痛点。
  • 价值: ⭐⭐⭐⭐⭐ 在虚拟数字人、游戏智能 NPC、具身人机交互等产业级应用中具有极高的落地转化价值。