Practice Makes Perfect: From Explicit Decomposition to Reinforced Latent Planning in Text-to-Human Motion¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Erwin2233/LaCT-Motion
领域: 人体理解
关键词: 文本驱动动作生成、隐式思维链、隐空间规划、强化学习、GRPO
一句话总结¶
针对显式思维链在动作生成中推理延迟过高的问题,LaCT-Motion 模拟人类“练习-内化-精通”的技能习得规律,通过渐进式课程将离散显式推理压缩为连续隐标记,并结合共享缓存的隐空间 GRPO 强化对齐,在彻底消除推理期文本开销的同时超越了显式 CoT 的生成质量。
研究背景与动机¶
文本驱动的人体动作生成(Text-to-Motion Generation)是具身智能、三维动画和人机交互的核心技术。近年来,将动作离散量化(如 VQ-VAE)并基于大语言模型(LLM)进行自回归生成已成为重要范式。为了应对具有复杂时空逻辑和多关节协调的多阶段复合动作指令,最新方法(如 Motion-R1、UniMo)引入了显式思维链(Chain-of-Thought, CoT),先由模型自回归生成分步文本推理轨迹(如肢体分解、时序过渡与动力学约束),再解码动作标记,显著提升了动作的语义对齐度与物理合理性。
然而,显式规划范式面临着严重的推理效率瓶颈:在推理阶段生成冗长且变长的文本推理标记引入了数倍乃至数十倍的时延,导致整体验证与部署代价高昂。相比之下,传统的无规划直接生成(No Planning)虽然解码迅速,却极易在复合长时程指令下出现语义遗漏与动作坍塌。现有的自然语言隐式推理方法多针对数学与符号逻辑推理设计,不仅推理步长固定且具备确定性答案,难以直接迁移到时空维度开放、推理步骤异构(1–9 步原子分解)且包含复杂连续动力学的动作合成任务中。
本文的核心洞见在于:显式思维链应当是训练期的辅助脚手架(Scaffold),而非部署期的强制输出。如同人类钢琴演奏者从初学时的“逐音符视奏分解”逐步过渡为熟练后的“肌肉记忆与无意识自动化执行”,动作大模型也应当经历从显式推导到隐式表征的内化过程。核心 idea:提出 LaCT-Motion 动作隐式推理框架,通过“练习(显式 CoT 预热)- 内化(渐进式多轮前向隐标记压缩)- 精通(结合时空与语义奖励的全隐空间 GRPO 优化)”三阶段渐进范式,使模型在推理阶段零显式文本生成的条件下实现高质量时空动作规划。
方法详解¶
整体框架¶
LaCT-Motion 构建于预训练大语言模型(Qwen2.5-3B-Instruct)与预训练动作离散量化模型(T2M-GPT VQ-VAE)之上。整个训练管线分为三个连续演进的阶段:第一阶段(Practice)利用带有显式思维链分解的动作语料进行监督微调,赋予模型基础的时空动作因果推演能力;第二阶段(Internalization)引入基于课程学习的渐进式隐空间压缩与多轮前向注入机制,将可变长度的显式文本推理逐步替换为紧凑的连续隐标记(Latent Tokens);第三阶段(Perfection)在完全消除显式文本的全隐空间状态下,利用组相对策略优化(GRPO)结合格式合规、动作保真与文本语义三重可验证奖励进行强化精炼。在推理阶段,模型仅需经过一次多轮前向前向填充隐标记,随后即可直接复用 KV 缓存自回归贪婪解码动作标记,兼顾极速推理与深层规划。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入动作文本描述 q"] --> B["显式思维链预热与词表拓展<br/>引入动作与隐空间特殊标记构建结构化推理基座"]
B --> C["渐进式隐空间课程压缩与随机调度<br/>阶段性剔除显式步骤并按比例分配连续隐标记"]
C --> D["多轮前向隐状态注入与微分链<br/>前一位置隐藏状态覆盖隐标记嵌入且复用KV缓存"]
D --> E["全隐空间共享缓存强化精炼<br/>结合格式/动作/语义奖励且单次隐前向共享多分支Rollout"]
E --> F["输出离散动作编码序列 a"]
关键设计¶
1. 显式思维链预热与词表拓展:构建动作离散化与结构化推理基座
由于主流语言模型原生词表中不包含动作概念与隐推理边界,模型在初始状态下无法直接产生动作表征。为此,LaCT-Motion 对分词器进行扩展,新增 512 个对应 VQ-VAE 码本的独立动作标记 <Motion_0> 至 <Motion_511>、2 个动作序列起止符 <Motion> 与 </Motion>、2 个显式思维链标记 <think> 与 </think>,以及 3 个连续隐标记边界与占位符 <|start-latent|>、<|end-latent|> 和 <|latent|>。模型输入输出头相应扩充,其中 <|latent|> 嵌入以特殊分隔符初始化以提供稳定起点。在 Phase A 预热阶段,模型基于构建的 66,515 条配对数据接受全量显式 CoT 监督微调:输入动作描述文本 \(q\),模型在 <think>...</think> 内显式推导 \(N_i\) 个原子推理步骤 \(s_1, \ldots, s_{N_i}\),最后自回归输出动作序列 \(a\),为后续向隐表征迁移打牢动作生成的语言时空先验。
2. 渐进式隐空间课程压缩与随机调度:平滑过渡异构时空推理步骤
如果直接从头开始迫使模型在隐空间内完成多步推理,由于初始隐标记缺乏语义信息,优化极易崩溃陷入局部极小。为此,模型在 Phase B 采用分级课程调度。令样本 \(i\) 的显式推理步骤总数为 \(N_i\)(在动作数据集中动态分布在 1 至 9 步之间),最大课程阶段为 \(K_{\max}\)。当课程演进至第 \(k\) 阶段时,模型截断前 \(\min(k, N_i)\) 个显式文本步骤,并将其替换为 \(\min(k, N_i) \times c\) 个连续隐标记(超参数 \(c\) 为每个推理步分配的隐标记数量): $$ \mathbf{x}^{(k)} = \big(q, \; t_{\mathrm{s}}, \; \underbrace{l_1, \ldots, l_{\min(k, N_i) \cdot c}}{\text{latent}}, \; t\big) $$ 当 }}, \; \underbrace{s_{\min(k, N_i)+1}, \ldots, s_{N_i}}_{\text{explicit CoT}}, \; \mathbf{a\(k \ge N_i\) 时,显式文本推理完全消失。为了避免模型对固定的阶段边界产生过拟合,算法引入随机阶段采样机制:在训练中以概率 \(p_u\) 为每个样本独立随机抽取 \(k' \sim \text{Uniform}(0, N_i)\) 作为其实际替代步数。进入 Phase C 巩固阶段后,强制将步数固定为 \(K_{\max}\) 并禁用随机采样(\(p_u=0\)),填充固定长度的 \(K_{\max} \cdot c\) 个隐标记,完成由离散文本向纯连续隐表征的彻底蜕变。
3. 多轮前向隐状态注入与微分链:保持自回归依赖与端到端梯度传播
为了让连续隐标记真正承载前序步骤推演出的时空特征,而非退化为无意义的静态向量,模型提出基于最后一层隐状态覆盖的多轮前向注入机制。对于包含 \(M\) 个隐标记的序列,前向计算被解耦为 \(M\) 次迭代注入和 1 次最终前向。在第 \(i\) 次迭代中,模型计算至第 \(i\) 个隐标记 \(l_i\) 处,提取紧邻其前一个位置的最后一层隐藏状态 \(\mathbf{h}_{i-1}\),并通过可微原地写操作直接覆盖 \(l_i\) 的输入嵌入向量: $$ \mathbf{e}(l_i) \leftarrow \mathbf{h}_{i-1} $$ 由于 \(\mathbf{h}_{i-1}\) 来自残差流顶层,其维度与词嵌入空间完全一致,无需额外投影层即可自适应对齐。关键在于,\(\mathbf{h}_{i-1}\) 在计算图中不截断梯度(no detachment),每个隐标记的嵌入递归依赖于其前序所有隐状态 \(\mathbf{e}(l_i) = f_\theta(\mathbf{x}_{<\mathrm{pos}(l_i)}; \mathbf{e}(l_1), \ldots, \mathbf{e}(l_{i-1}))\),形成了一条完全可微的时序推理链。所有先前轮次计算的键值对(KV Cache)在后续轮次中无缝复用,极大摊薄了计算开销。损失计算时,问题描述 \(q\)、边界符 \(t_{\mathrm{s}}, t_{\mathrm{e}}\) 以及所有隐标记 \(l_1, \ldots, l_M\) 均被掩码设为 label=-100,交叉熵梯度只在未被压缩的显式标记和最终动作标记上产生,驱动隐状态完全服务于动作生成的保真度。
4. 全隐空间共享缓存强化精炼:零文本延迟下的多奖励组相对对齐
在经过课程微调后,隐标记已具备充分的规划表征,但动作的微观动力学与宏观语义仍有进一步提升空间。第三阶段引入针对全隐空间(\(k=K_{\max}\))定制的 GRPO 算法。针对动作生成无需价值网络、但需要可验证客观指标的特性,设计了三合一复合奖励体系:
$$
\mathcal{R} = \lambda_1 r_{\mathrm{format}} + \lambda_2 r_{\mathrm{motion}} + \lambda_3 r_{\mathrm{semantic}}
$$
其中格式奖励 \(r_{\mathrm{format}}\) 确保输出严格受 <Motion> 标签约束;动作保真奖励 \(r_{\mathrm{motion}} = \cos(f_{\mathrm{motion}}(\hat{\mathbf{m}}), f_{\mathrm{motion}}(\mathbf{m}))\) 利用冻结的预训练动作特征编码器衡量生成动作 \(\hat{\mathbf{m}}\) 与真实动作 \(\mathbf{m}\) 在运动流形中的余弦相似度;语义相似度奖励 \(r_{\mathrm{semantic}} = \cos(f_{\mathrm{motion}}(\hat{\mathbf{m}}), f_{\mathrm{text}}(\mathbf{q}))\) 衡量跨模态嵌入空间中的文本动作对齐性。尤为巧妙的是,在固定的策略网络权重下,由于隐状态的迭代注入机制是完全确定性的,对同一个文本提示采样的 \(G\) 个候选 Rollout 可以完全共享前序隐推理过程计算出的唯一一份 KV 缓存,各分支仅在动作标记自回归采样时以温度差异展开。这使得强化学习的数据收集开销从 \(G\) 次多轮注入压缩为 1 次,大幅加速了策略探索过程。
损失函数 / 训练策略¶
在 SFT 阶段(Phase A/B/C),模型采用序列级交叉熵损失: $$ \mathcal{L}{\mathrm{SFT}} = - \sum_j) $$ 其中有效监督集合 }} \log p_\theta(x_{j+1} \mid \hat{\mathbf{y}\(\mathcal{A}\) 仅包含保留的显式推理文本 \(s_{k+1}, \ldots, s_{N_i}\) 与目标动作序列 \(\mathbf{a}\)。在 GRPO 阶段,对每个提示输入采样 \(G=8\) 个候选动作序列,计算组内归一化优势值,并在目标函数中引入相对于 SFT 参考策略 \(\pi_{\mathrm{ref}}\) 的 KL 散度惩罚(权重 \(\beta=0.001\))。训练基于 Qwen2.5-3B-Instruct 基础模型,在 2 张 NVIDIA H200 GPU 上微调 7 个 Epoch,隐课程配置为 \(K_{\max}=8, c=2\)。
实验关键数据¶
主实验¶
在标准学术基准 HumanML3D(22 关节、263 维动作表征)上,LaCT-Motion 与当前最先进的扩散生成模型、离散自回归模型以及显式推理模型进行了系统比较。所有评价指标均经过 20 次独立运行并报告 95% 置信区间。
| 方法分类 | 模型 | R-Precision (Top-1) ↑ | R-Precision (Top-2) ↑ | R-Precision (Top-3) ↑ | FID ↓ | MM-Dist ↓ | Diversity ↑ |
|---|---|---|---|---|---|---|---|
| 扩散模型 | MDM | 0.320 ± .005 | 0.498 ± .004 | 0.611 ± .007 | 0.544 ± .044 | 5.566 ± .027 | 9.559 ± .086 |
| 扩散模型 | MLD | 0.481 ± .003 | 0.673 ± .003 | 0.772 ± .002 | 0.473 ± .013 | 3.196 ± .010 | 9.724 ± .082 |
| 扩散模型 | MotionDiffuse | 0.491 ± .001 | 0.681 ± .001 | 0.782 ± .001 | 0.630 ± .001 | 3.113 ± .001 | 9.410 ± .049 |
| 离散/LLM | T2M | 0.457 ± .002 | 0.559 ± .007 | 0.740 ± .003 | 1.067 ± .002 | 3.340 ± .008 | 9.188 ± .002 |
| 离散/LLM | TM2T | 0.424 ± .003 | 0.618 ± .003 | 0.729 ± .002 | 1.501 ± .017 | 3.467 ± .011 | 8.589 ± .076 |
| 离散/LLM | T2M-GPT | 0.491 ± .003 | 0.680 ± .003 | 0.775 ± .002 | 0.116 ± .004 | 3.118 ± .011 | 9.761 ± .081 |
| 离散/LLM | MotionGPT | 0.492 ± .003 | 0.681 ± .003 | 0.778 ± .002 | 0.232 ± .008 | 3.096 ± .008 | 9.528 ± .071 |
| 离散/LLM | MoMask | 0.521 ± .002 | 0.713 ± .002 | 0.807 ± .002 | 0.045 ± .002 | 2.958 ± .008 | 9.620 ± .064 |
| 离散/LLM | MotionAgent | 0.515 ± .004 | 0.691 ± .003 | 0.801 ± .004 | 0.230 ± .009 | 2.967 ± .020 | 9.908 ± .102 |
| 离散/LLM | MotionGPT-3 | 0.542 ± .003 | 0.741 ± .003 | 0.839 ± .002 | 0.065 ± .003 | 2.768 ± .008 | 9.744 ± .082 |
| 离散/LLM | MG-MotionLLM | 0.523 ± .003 | 0.718 ± .003 | 0.814 ± .002 | 0.090 ± .002 | 2.926 ± .009 | 9.632 ± .076 |
| 显式 CoT+RL | Motion-R1 | 0.515 ± .003 | 0.719 ± .002 | 0.818 ± .002 | 0.201 ± .004 | 2.854 ± .010 | 10.026 ± .075 |
| 显式 CoT SFT | UniMo | 0.539 ± .003 | 0.738 ± .002 | 0.831 ± .002 | 0.177 ± .004 | 2.768 ± .010 | 10.042 ± .076 |
| 隐式推理 | TBYM | 0.537 ± .005 | 0.721 ± .004 | 0.810 ± .005 | 0.040 ± .002 | 2.895 ± .017 | 9.668 ± .077 |
| 本文方法 | LaCT-Motion | 0.577 ± .002 | 0.783 ± .002 | 0.873 ± .002 | 0.167 ± .004 | 2.506 ± .005 | 9.507 ± .098 |
消融实验¶
1. 训练阶段与课程机制消融¶
消融实验对比了各个训练阶段(阶段 I: 练习; 阶段 II: 内化; 阶段 III: 精通)以及不同蒸馏/对齐机制对性能的影响。
| 实验配置 | 阶段 I (SFT) | 阶段 II (Curriculum) | 阶段 III (GRPO) | R Top-1 ↑ | R Top-2 ↑ | R Top-3 ↑ | FID ↓ | MM-Dist ↓ | Diversity ↑ |
|---|---|---|---|---|---|---|---|---|---|
| 阶段断点 Checkpoint 1 | ✓ | 0.167 | 0.240 | 0.289 | 24.119 | 7.069 | 5.655 | ||
| 阶段断点 Checkpoint 2 | ✓ | ✓ | 0.453 | 0.640 | 0.736 | 0.466 | 3.344 | 10.216 | |
| 阶段断点 Checkpoint 3 (完整) | ✓ | ✓ | ✓ | 0.577 | 0.783 | 0.873 | 0.167 | 2.506 | 9.507 |
| 独立基线 UniMo* (纯 SFT) | ✓* | 0.438 | 0.613 | 0.702 | 0.201 | 3.588 | 9.748 | ||
| 独立基线 (隐式课程收敛) | ✓ | ✓ | 0.486 | 0.660 | 0.756 | 0.244 | 3.190 | 9.915 | |
| 独立基线 UniMo† (显式 CoT + GRPO) | ✓† | ✓ | 0.529 | 0.739 | 0.832 | 0.203 | 2.743 | 9.780 | |
| 单轮前向蒸馏基线 ‡ | ✓ | ✓‡ | ✓ | 0.520 | 0.716 | 0.822 | 0.221 | 2.838 | 9.924 |
2. 每步隐标记预算 \(c\) 与 GRPO 奖励消融¶
下表评估了每个推理步骤分配的隐标记数量 \(c\)(在阶段 II 完成后评估,测试集 4,646 个样本),以及阶段 III 中不同奖励组合对生成质量的作用。
| 变量设置 | 具体配置 / 组合 | R Top-1 ↑ | R Top-2 ↑ | R Top-3 ↑ | FID ↓ | MM-Dist ↓ | Diversity ↑ | 推理耗时 (s) ↓ |
|---|---|---|---|---|---|---|---|---|
| 隐标记预算 \(c\) | \(c = 1\) | 0.458 | 0.629 | 0.724 | 0.536 | 3.357 | 9.802 | 369 |
| 隐标记预算 \(c\) | \(c = 2\)(默认) | 0.453 | 0.640 | 0.736 | 0.466 | 3.344 | 10.216 | 387 |
| 隐标记预算 \(c\) | \(c = 4\) | 0.451 | 0.630 | 0.729 | 0.529 | 3.381 | 9.873 | 455 |
| GRPO 奖励消融 | \(r_f + r_m\) | 0.581 | 0.768 | 0.861 | 0.217 | 2.543 | 9.745 | - |
| GRPO 奖励消融 | \(r_f + r_s\) | 0.576 | 0.771 | 0.859 | 0.261 | 2.529 | 9.641 | - |
| GRPO 奖励消融 | \(r_f + r_m + r_s\)(完整) | 0.577 | 0.783 | 0.873 | 0.167 | 2.506 | 9.507 | - |
关键发现¶
- 隐空间表征超越显式离散文本:完整模型在 R-Precision Top-1 上达到 0.577,不仅全面超越了基于纯 SFT 的 UniMo(0.539)与 MotionGPT-3(0.542),更是相较于采用显式 CoT+GRPO 的 Motion-R1(0.515)取得了 +0.062(相对提升 12.0%)的跃升。这有力证明了连续隐向量能够比受限的自然语言离散词汇更紧凑、更准确地编码多关节运动的高维时空动力学特征。
- 多轮前向注入机制是隐式推理的核心支撑:对比“单轮前向隐式蒸馏”基线(Top-1 为 0.520,FID 为 0.221),本文提出的渐进式课程结合多轮前向注入机制将 Top-1 提升了 0.057,FID 改善了 0.054。这表明在同一前向中简单压缩难以形成有效的因果推理链,逐步由浅入深的隐藏状态注入才是保证表征稳定沉淀的关键。
- 推理效率出现数量级飞跃:在全测试集评测耗时上,显式规划模型 Motion-R1 需要 1 小时,而完全运行在隐式模式下的 LaCT-Motion 仅需 7 分钟,耗时缩短了 88% 以上。同时,隐标记预算在 \(c=2\) 时取得了生成多样性(10.216)与生成质量(FID 0.466)的最佳平衡。
- 动作保真度奖励起主导作用:在 GRPO 奖励消融中,去除动作相似度奖励 \(r_m\) 导致 FID 从 0.167 恶化至 0.261;而结合语义对齐奖励 \(r_s\) 则进一步压低了多模态距离 MM-Dist 至 2.506,体现出多模态与动作自监督信号的高度互补性。
亮点与洞察¶
- 训练脚手架与推理内化的有机解耦:将大语言模型的显式 CoT 视作训练阶段的认知“脚手架”,在部署阶段通过多轮隐藏状态注入将其完全内化为连续隐向量,既保留了复杂动作分解的逻辑推理能力,又彻底杜绝了文本自回归生成的时延瓶颈。
- 隐空间规划下的无开销 GRPO 缓存共享:由于隐式注入在前序层是确定性的,在 GRPO 阶段对同一文本采样的 \(G\) 个候选序列能够共享前置隐状态的 KV Cache,使 Rollout 耗时从 \(G\) 倍压缩至接近 1 次前向,极大提升了强化学习在动作生成中的探索与收敛效率。
- 跨模态连续隐表征打破自然语言离散瓶颈:实验证明连续隐标记在表示多肢体空间拓扑与运动相位时显著优于自然语言,为多模态 LLM 如何超越纯文本思维链、走向具身连续控制提供了清晰的范式参考。
局限与展望¶
- 依赖高质量离散动作量化编解码器:模型生成质量受制于底层 VQ-VAE 的重构上限,在超长时程复杂特技动作或极细微肢体交互上可能出现运动抖动或地面穿模。
- 课程阶段转换步长为静态启发式超参数:当前针对每个样本的隐标记替换数量依赖经验性的固定步长 \(c=2\) 与最大阶段 \(K_{\max}=8\),尚未实现根据动作文本难度自适应分配隐推理步长与动态深度。
- 未来改进方向:可进一步探索动作难度感知的动态隐标记分配策略,并将该隐空间强化规划机制扩展至人-物交互(HOI)及双人交互等更高阶的具身物理场景中。
相关工作与启发¶
- vs Motion-R1: Motion-R1 同样采用思维链分解与 GRPO 强化学习,但在推理阶段必须自回归生成全部显式文本 CoT 标记,评测耗时长达 1 小时;LaCT-Motion 通过隐空间课程内化将推理完全收敛至隐表征中,仅耗时 7 分钟,且 R-Precision Top-1 反超 0.062。
- vs UniMo: UniMo 依赖显式思维链的监督微调实现统一生成与理解,但缺乏强化学习对齐且保持显式文本输出;LaCT-Motion 证明了隐式压缩结合 GRPO 可以在彻底摆脱文本依赖的同时显著降低多模态距离。
- vs TBYM (Think-Before-You-Move): 同期的 TBYM 从零训练专用动作自回归 Transformer 进行动作隐式推理,未利用通用预训练 LLM,且缺乏强化学习策略精炼;LaCT-Motion 依托通用大模型底座与三阶段“练习-内化-精通”训练配方,在语义对齐指标上全面占优。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将自然语言隐式思维链迁移到多模态连续动作合成,提出完整的“显式练习-隐式内化-强化精炼”学习范式。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 HumanML3D 主结果、阶段递进消融、隐标记预算分析、单轮蒸馏对比、奖励组成剖析以及多维度定性可视化。
- 写作质量: ⭐⭐⭐⭐⭐ 借用“熟能生巧”的认知发展类比,逻辑递进顺畅,技术细节、多轮微分注入机制与推导表述极为严谨清晰。
- 价值: ⭐⭐⭐⭐⭐ 为解决多模态大模型在复杂物理控制与具身生成中的“强推理与高延迟”矛盾提供了高可行性范式。