ActionPlan: Future-Aware Streaming Motion Synthesis via Frame-Level Action Planning¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5269
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/9686.pdf
项目: https://coral79.github.io/ActionPlan/
领域: 人体理解
关键词: 文本驱动动作生成、逐帧动作计划、流式生成、潜变量噪声调度、整流流
一句话总结¶
ActionPlan 先生成与时间轴对齐的动作语义计划,再通过逐潜变量噪声调度重叠生成 3D 人体动作,使同一模型兼顾离线质量与流式输出,在 HumanML3D-272 测试集上将流式 FID 从 MotionStreamer 的 11.790 降至 5.735。
研究背景与动机¶
文本驱动人体动作生成不仅要生成自然的姿态,还要正确执行描述中的动作及其先后关系。 对于“先向前走、转身、再坐下”,一句全局文本向量虽然包含全部意图,却没有明确告诉生成器哪个时间段应该执行哪个动作。 离线生成可以利用整段序列的双向上下文修正语义,但必须等待完整序列,不利于即时交互。 MotionStreamer 等流式方法在因果潜空间中逐步生成动作,能够提前输出,却容易遗漏后续动作或打乱次序。
问题并非只能在“看到真实未来”和“完全不考虑未来”之间选择:未来动作尚未生成,但未来要做什么可以先预测。 ActionPlan 因而把语义时间安排与具体关节运动分开,让较早输出的动作知道后面还需要转身或坐下。 它同时需要解决另一个工程约束:如果每个动作 token 都必须完成全部去噪,才开始下一个 token,即使语义正确,连续输出仍然很慢。 核心 idea:用同一个生成模型先形成逐帧动作计划,再以可独立调度、相互重叠的动作去噪过程执行计划,从而把未来语义可见性与动作流式输出解耦。
方法详解¶
整体框架¶
输入是序列级自然语言描述,输出是可以驱动 SMPL 的 3D 人体动作序列,而不是 RGB 视频或恢复后的图像。 动作以 272 维姿态表示,包含根部运动以及 22 个关节的位置、速度和旋转;因果时序自编码器将其压缩到连续潜空间。 编码器和解码器沿用 MotionStreamer 的 Causal TAE,训练好后冻结,已生成的潜变量可以立即解码,不必等待整段动作。
ActionPlan 的新增部分依次是逐帧语义对齐、异质噪声联合训练、动作计划先行、重叠渐进去噪。 训练时,模型同时学习动作潜变量和动作语义潜变量的生成;推理时,改变它们的去噪先后顺序即可切换任务。 离线模式先完成整段计划,然后随机激活动作位置;流式模式让计划与第一个动作潜变量一起生成,再按时间顺序继续输出。 因此,“先规划”在流式设置中不是额外等待整段动作完成,也不是外接一个文本规划模型。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["序列文本与训练动作"] --> B["逐帧语义对齐"]
B --> C["异质噪声联合训练"]
C --> D["动作计划先行"]
D --> E["重叠渐进去噪"]
E -->|"离线随机 / 流式时序"| F["因果解码为人体动作"]
关键设计¶
1. 逐帧语义对齐:把全局意图变成时间位置上的条件
只给整段动作一个文本条件,生成器必须隐式推断动作边界,复杂描述中的短动作尤其容易被忽略。 本文为时间轴上的动作建立语义潜变量:逐帧描述先经过 CLIP,再由预训练的 MLP 自编码器压缩至 16 维,与动作潜变量维度一致。 该文本自编码器逐潜变量独立运行,不像动作编码器那样做时序聚合;它需要保留相邻时间位置可能属于不同动作的区分。 训练包括原始嵌入重建、保持邻近关系以支持动作标签检索,以及防止潜空间维度坍缩的方差正则。
文本潜变量在时间轴上按 4 倍下采样后,与对应动作潜变量拼接,送入同一个 Transformer 去噪器。 “逐帧”因而指语义在时间轴上对齐,不应理解为推理时每个原始视频帧都单独生成一个文本句子。 实际计划是连续的文本潜变量,解码到 CLIP 空间后可以用近邻检索显示动作标签;这些可读标签不是又一次语言模型调用。 序列级 CLIP 文本条件仍然保留,负责给出全局意图,逐帧计划负责指出何时执行什么。
2. 异质噪声联合训练:让模型学会利用不同完成度的上下文
普通扩散通常让整段序列处于相同去噪阶段,难以自然处理“过去已完成、当前正在生成、未来仍是噪声”的流式状态。 ActionPlan 为每个动作潜变量分配独立的噪声时间,而所有动作计划潜变量共享另一个全局噪声时间。 模型接收这些时间条件,联合预测动作和文本在整流流中的去噪速度,因此可以面对干净计划与半成品动作并存的输入。 动作时间采样沿用原文引用的均值时间算法,而非简单声称所有位置独立均匀采样;精确采样细节被放在补充材料中。
监督来自 HumanML3D-272 的序列描述以及部分重叠样本的 BABEL 帧级标签。 只有约 30% 的动作带 BABEL 帧级标签,若强制所有训练样本都具有逐帧文本,会丢掉大部分动作数据。 本文保留完整动作训练集,只在帧级标签存在时启用文本监督,其他样本仍然训练动作生成。 这样做不增加基准外的动作序列,但确实引入了额外的细粒度标签;与没有这种标签的基线比较时应说明这一点。
3. 动作计划先行:先固定语义日程,再生成运动细节
联合训练不意味着推理必须同步生成文本和动作。 在离线模式的第一阶段,所有动作潜变量保持纯噪声,只对文本潜变量去噪,得到整段动作计划。 第二阶段把计划作为干净的语义条件保留,让动作去噪过程同时看到过去的运动信息和后续动作的语义安排。 这与只根据当前已生成姿态猜下一步不同,也与先生成完整未来姿态再回填当前动作不同。
流式模式将第一阶段与首个动作潜变量的去噪合并,减少启动等待,然后继续按时间顺序激活后续动作潜变量。 这里的“未来感知”来自根据当前描述生成的未来语义计划,不代表模型提前知道尚未到来的用户指令。 论文对比了文本与动作共同生成和计划先行两种推理方式:后者进一步改善 FID,说明有帧级标签还不等于充分利用了这些标签。 计划先完成,使动作生成不必在语义仍持续变化时同步决定所有运动细节。
4. 重叠渐进去噪:不等待一个 token 完全结束才启动下一个
若每个动作潜变量完整去噪后才启动下一位置,序列越长,累计等待越明显。 本文维护等待中的潜变量和正在去噪的潜变量,每隔若干步再激活一个位置,让多个位置在不同噪声水平下同时更新。 采用的配置是在新位置启动后推进 2 步,再激活下一位置;每个位置仍使用 25 步整流流去噪,不能把它误读成总共只去噪两步。 离线选择随机激活顺序,流式选择时间顺序,完成的动作 token 由因果解码器及时转成姿态。
同一种部分干净、部分噪声的输入还支持局部编辑和动作补间,而不需要再训练专用模型。 编辑时将保留区域的动作潜变量固定在干净状态,仅重新生成指定区域;补间时把起点和终点作为干净边界条件。 长动作则分块生成,每块根据自己的文本以及上一块末尾的 token 继续,以维持跨块衔接。 这些是推理调度带来的能力,但论文主要提供定性演示,不能将其理解为已经完成全面的编辑质量评测。
一个完整示例¶
考虑“向前走,转身,然后坐下”这一说明性输入;下面的动作顺序用于解释机制,不是论文额外公布的定量样本。 首先,全局文本经 CLIP 编码,动作计划潜变量从噪声中形成“行走—转身—坐下”的时间安排。 流式生成首个动作 token 的同时,计划也被去噪;后续生成行走姿态时,模型已经能利用后面转身和坐下的语义条件。 新的动作潜变量依次加入活动集合,旧的潜变量继续去噪,已完成的 token 则解码输出。 若之后希望修改中间动作,可固定需要保留的动作潜变量并重新生成选中区域,但这属于编辑设置,不等同于已经播放的历史动作可以被在线撤回。
损失函数 / 训练策略¶
去噪器采用 16 层 Transformer、16 个注意力头和 1024 隐藏维度,预测动作与文本的整流流速度。 动作监督是预测速度与“干净动作潜变量减高斯噪声”之间的均方误差;有帧级标签时,文本分支使用对应速度监督。 文本自编码器的邻近保持与方差正则、主模型正文提到的潜变量方差项,应与动作重建监督区分开。 本地缓存中的式(2)至式(4)存在符号缺失,尤其掩码文本损失和总损失无法完整恢复,因此这里不拼写未经核实的总目标公式。 正文足以确认条件掩码和速度预测机制,但各项权重、均值时间采样细节及文本自编码器的完整训练设定仍需补充材料核对。
实验关键数据¶
主实验¶
下表精选原文表 1,数据集为 HumanML3D-272 测试集,使用 MotionStreamer 的 TMR 评估器。 所有基线使用官方实现、相同 272 维表示从头重训;ActionPlan 额外使用训练集重叠部分的 BABEL 帧级标签。 FID 衡量生成与真实动作的特征分布差异,越低越好;R@3 是文本—动作检索的前三名命中率,越高越好;MatchS 是文本与动作的特征距离,越低越好。
| 方法 | 运行方式 | FID ↓ | R@3 ↑ | MatchS ↓ |
|---|---|---|---|---|
| MotionStreamer | 流式 | 11.790 | 0.859 | 16.081 |
| MARDM | 离线基线 | 7.044 | 0.860 | 15.892 |
| ActionPlan | 流式 | 5.735 | 0.877 | 15.315 |
| ActionPlan | 离线 | 5.522 | 0.892 | 15.09 |
按表 1 计算,流式 ActionPlan 相对 MotionStreamer 的 FID 降低约 51.4%,相对 MARDM 降低约 18.6%;离线相对 MARDM 降低约 21.6%。 这些是 FID 的相对降幅,不是人体动作质量提升了相同比例的直接物理度量。 第 4.2 节在单张 NVIDIA A100 上测量每个动作 token 的延迟,一个 token 对应 4 帧:ActionPlan 首 token 为 146 ms,后续为 40 ms。 对应的 MARDM 为 210/210 ms,MotionStreamer 为 360/360 ms,因此后续 token 加速分别是 5.25 倍和 9 倍,而不是都相对同一个基线。
消融实验¶
下表精选原文表 2 的离线设置,仍使用同一 HumanML3D-272 测试集,避免把主表与消融表的不同流式数值混在一起。 “无帧级文本”仍使用逐潜变量调度;“共同生成”引入帧级文本,但没有先计划后动作的两阶段推理。
| 配置 | FID ↓ | R@3 ↑ | MatchS ↓ |
|---|---|---|---|
| 普通并行扩散 | 6.520 | 0.866 | 15.410 |
| 普通扩散加动作计划 | 6.200 | 0.880 | 15.340 |
| 逐潜变量调度,无帧级文本 | 6.952 | 0.873 | 15.390 |
| 帧级文本与动作共同生成 | 6.093 | 0.878 | 15.234 |
| 完整 ActionPlan | 5.522 | 0.892 | 15.086 |
表 2 的流式完整模型 FID 为 5.878,而表 1 为 5.735;正文未明确解释这个差异,本笔记保留各表口径,不将两者视作同一次运行结果。 表 3 进一步显示,仅用约 30% 的重叠数据训练时,离线 FID 为 7.863,完整混合训练则为 5.522;该对比同时改变了可用动作数据量。
关键发现¶
- 帧级语义与生成顺序都有贡献:表 2 中,无帧级文本、共同生成、计划先行的离线 FID 依次为 6.952、6.093、5.522。
- 不能说所有新增组件单独都改善 FID:逐潜变量调度但无帧级文本的 6.952,实际差于普通并行扩散的 6.520,说明语义计划与调度需要结合看。
- 表 4 的完全并行配置 FID 为 5.420,优于选用配置的 5.522,但 R@3 为 0.886,低于 0.892;两步激活间隔是折中,不是所有指标最优。
- 第 4.4 节短动作用户研究包含 20 个提示、30 名参与者,ActionPlan 获得 67.5% 偏好;它支持主实验趋势,但样本规模仍有限。
亮点与洞察¶
- 将未来语义与未来姿态分开:提前生成语义日程不需要提前完成全部运动。这解释了为何流式输出不必等同于缺乏未来上下文。
- 训练联合、推理分阶段:同一模型可以共同学习两种潜变量,却按不同顺序生成。关键不是另加一个规划器,而是训练时允许不同噪声状态共存。
- 控制接口来自噪声时间:干净区域充当锚点,噪声区域等待重建。流式、编辑和补间因此能共享机制,但仍需各自评估适用范围。
局限与展望¶
- 作者明确的局限:模型没有手指细节与面部表情,也不具备场景或物体感知。因此自然的身体动作不保证真正完成环境中的交互任务。
- 读者判断:结果主要来自 HumanML3D-272 与部分 BABEL 标签,尚不足以证明跨动作分布或开放环境泛化;帧级监督的成本也是部署前提之一。
- 证据边界:编辑、补间和长序列展示以定性结果为主,表 1 与表 2 的流式数值不一致,部分训练公式抽取损坏且补充材料不在本地缓存中。
- 后续验证方向:优先补充提示切换时的启动延迟、跨块错误累积和物体接触约束评测,而不是仅延长生成序列来宣称通用交互能力。
相关工作与启发¶
- 与 MotionStreamer 对比:沿用其因果动作潜空间与评测协议,但加入帧级计划和重叠去噪。改进发生在语义条件与采样调度,而不是重新设计人体表示。
- 与 MARDM 对比:两者都利用连续动作潜变量,MARDM 是重要的离线质量基线;ActionPlan 希望用显式计划在流式激活顺序下保留较高质量。
- 与 UniMotion、Diffusion Forcing 对比:前者提供动作与文本共同建模的相关思路,后者展示逐帧噪声时间的灵活性。本文把时间对齐的语义计划优先生成与动作任务的可变采样顺序结合起来。
评分¶
- 新颖性: 4/5。动作计划优先与可变噪声调度的结合有明确任务针对性,但多个底层构件来自既有方法。
- 实验充分度: 3/5。包含统一协议重训、模块消融、延迟和用户研究,仍缺少多数据集验证及完整下游定量结果。
- 写作质量: 3/5。框架与动机易理解,但流式结果和加速基线的口径需要仔细分辨。
- 价值: 4/5。对低延迟数字人动作生成有直接参考价值,尚不能代替场景约束下的动作控制系统。