title: "InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization" description: >- ECCV2026 论文笔记:InfiniteDance 用物理修复构建 100.69 小时音乐舞蹈数据,ChoreoLLaMA 结合连续嵌入、训练集检索和频段专家生成三维舞蹈,并分析跨数据集泛化与足部接触质量。 tags: - ECCV2026 - 音频/语音 - 音乐驱动舞蹈生成 - 检索增强生成 - 人体运动修复 date: 2026-09-17
InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization¶
会议: ECCV2026
论文: ECCV 原文
项目: InfiniteDance
领域: 音频/语音
关键词: 音乐驱动舞蹈生成、人体运动修复、连续嵌入、检索增强生成、节奏混合专家
一句话总结¶
InfiniteDance 将互联网舞蹈视频转成经过物理与足部修复的 100.69 小时三维动作数据,再用连续嵌入、参考舞蹈检索和节奏混合专家训练 ChoreoLLaMA,在本数据集上将运动学 FID 从 Lodge 的 89.52 降至 30.54,但其真实场景泛化仍受慢音乐评价和长序列结构限制。
研究背景与动机¶
音乐驱动舞蹈生成需要同时处理音乐结构、动作风格和身体与地面的接触关系。 节拍对齐只是其中一部分:一段动作即使卡点准确,也可能持续滑脚、随机挥手,或者完全不符合慢速音乐的表达方式。 EDGE、FineDance 等扩散方法能生成短片段,Lodge 进一步用粗到细结构支持长舞蹈,但其面向高能量动作的手工先验不一定适合舒缓舞种。 Bailando 一类离散动作生成方法则依赖音乐与动作序列的对应关系,低层音乐输入未必足以表达完整的编舞结构。 这些问题使实验室数据集上的效果不能直接代表任意输入音乐下的表现。
扩大训练集看似直接,却受到采集方式约束。 专业动作捕捉能提供准确运动,但设备和舞者成本限制规模;单目网络视频来源丰富,却缺少可靠的三维接触监督。 从视频恢复的脚部滑动、悬浮和穿透不是无关噪声,而会成为生成模型学习的动作模式。 物理模拟可以消除部分不合理接触,但错误的地面摩擦估计又会把滑脚转化为抖腿。 因此,真正需要扩大的不是未经筛选的视频数量,而是能够保留舞姿表现力的音乐与三维动作配对数据。
本文把数据和生成器作为一个系统处理:先修复视频动作中的接触问题,再让模型利用已有舞蹈先验理解陌生音乐。 检索提供可参考的动作结构,频段专家则避免快节奏样本主导所有生成行为。 这里的“in-the-wild”同时涉及网络来源数据和陌生音乐测试,不能理解为所有现实场景均已解决。 核心 idea:用可扩展的物理感知动作采集支撑训练,再将音乐连续特征、检索舞蹈和不同动作频段联合送入自回归编舞模型。
方法详解¶
整体框架¶
系统包含离线数据准备和在线音乐条件生成两条路径。 离线输入单人舞蹈视频,经过全身运动估计、物理模仿和足部修复,得到带音乐、舞种、手部与表情信息的 InfiniteDance 数据。 在线输入音乐和可选舞种,先建立连续嵌入,再从训练集检索参考动作,通过 Cadence-MoE 融合后交给 ChoreoLLaMA 预测动作码。 预测码经过码本查询和动作解码恢复三维舞蹈,FRDM 还可用于生成结果的足部后处理。 因此,FRDM 不是 LLaMA 内部的专家,而是数据侧与输出侧都能使用的运动修复器。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Video["单人舞蹈视频"] --> Repair["物理感知采集<br/>与足部修复"]
Music["音乐与可选舞种"] --> Embed["连续嵌入接口"]
Repair -->|配对动作与音乐| Embed
Embed --> Retrieve["训练集舞蹈检索"]
Repair -->|训练集参考库| Retrieve
Retrieve --> Experts["节奏混合专家"]
Embed -->|音乐与舞种条件| Experts
Experts --> Generate["LLaMA 自回归预测<br/>码本查询与动作解码"]
Repair -.->|训练动作监督| Generate
Generate --> Output["FRDM 后处理<br/>三维舞蹈输出"]
关键设计¶
1. 物理感知采集与足部修复:扩充数据之前先处理接触伪影
采集管线先用 YOLOv8 得到单人片段,再用具有重力感知能力的 GVHMR 恢复身体运动。 SMPLest-X 补充手部和表情参数,使数据不局限于粗略身体骨架。 随后把估计动作作为物理环境中的模仿目标,借助物理约束减少穿透、悬浮和滑脚。 表 7 将该阶段标为 PHC;它显著降低穿透,却引入明显的腿部抖动。 作者没有对整个人体直接平滑,因为这种操作可能抹掉舞蹈细节,也可能破坏原本已经建立的足部接触。
足部修复扩散模型 FRDM 只调整根部、膝盖和脚,保持上半身不变。 它使用每帧 259 维的表示,把根部运动以及局部关节速度、位置、旋转放在一起,采用 22 个身体关节。 这与数据集整体提供 55 关节、手部和表情信息并不矛盾:修复表示只覆盖其需要操作的身体部分。 根部特征包含偏航角速度、地面平面内的线速度和根部高度。 位置与速度便于表达脚在地面上是否稳定,旋转则保留原始姿态的几何结构。
训练时从高质量 MoCap 动作采样,仅把根部、膝盖和脚的对应特征替换为加噪结果,再要求去噪网络恢复干净动作。 这种自监督损坏构造不需要人工标注每个网络视频中的错误位置,但仍依赖外部高质量动作作为训练来源。 推理时也保持其余身体区域为输入条件,在每个扩散步骤只更新待修复部分。 早期使用几何引导,使恢复结果不偏离原动作;最后阶段使用足部接触引导,强化接触时的稳定性。 训练中的足部损失和推理时的分阶段引导各有作用,不能简单归结为增大一个滑脚惩罚权重。
2. 连续嵌入接口:让语言模型接收带有音乐与动作细节的特征
音乐经过预训练 MuQ 提取特征,再线性投影到 LLaMA 的输入维度。 动作侧采用三层残差向量量化变分自编码器 RVQ-VAE,后续码本依次表示前一层未解释的残差。 每层有 512 个条目,量化嵌入维度为 1024;投影后的 LLaMA 输入维度为 2048。 关键差异不是“完全不使用离散码”,而是不把码索引交给一个重新学习的嵌入表就结束。 模型先查询已经训练好的动作码本,取回连续量化嵌入,再组织、投影这些多层特征作为动作条件。
这样做保留了 tokenizer 学到的局部动作结构,也让音乐输入保留 MuQ 提供的连续信息。 索引本身只是符号编号,不能直接表达两个动作码之间已有的特征关系。 作者认为重用这些表征有利于细粒度音乐与动作对应,而表 4 的输入接口消融提供了支持。 不过实验没有把所有可能的离散嵌入训练方案逐一比较,因此不能推出离散表示在原则上无法表达节奏。 最终预测目标仍是动作 token 索引,生成后通过同一码本回到连续表示,再由解码器得到动作。
3. 训练集舞蹈检索:为陌生音乐提供可组合的动作参考
MD-Retrieval 使用类似 CLIP 的双编码器结构,把音乐与舞蹈映射到可比较的特征空间。 音乐编码器和动作编码器使用高效注意力,在 InfiniteDance 训练集上用 InfoNCE 学习跨模态匹配。 在 ChoreoLLaMA 的训练和推理阶段,都从训练划分中取最相关的 10 段参考舞蹈。 检索库不是测试集动作库,这是理解结果和泄漏风险时的重要边界。 参考动作经投影与加权汇总,为后续融合提供动作先验,而不是直接拼接检索片段作为最终舞蹈。
舞种可由用户指定,也可以采用检索到的参考舞蹈所对应的舞种。 原文未清楚说明多个参考舞种冲突时如何汇总,不能把它补写成多数投票。 检索的价值在于为罕见音乐提供已有编舞模式,而不要求生成器仅凭音乐特征重新推导所有身体动作。 降低检索相似度后仍有收益、生成动作与参考动作具有一定特征距离,都是支持“利用先验而非直接复制”的证据。 但这类距离分析不能严格证明不存在重复视频、相近编舞或更细粒度的训练测试泄漏。
4. 节奏混合专家:在动作频率上分工,而不是给所有音乐套同一节奏规则
Cadence-MoE 对汇总后的参考动作沿时间维做实值快速傅里叶变换,将频谱划分为不同频带。 各频带之外的位置置零,再通过逆变换得到相应的时域分量,交给专门的专家处理。 每个专家包含线性层、多头注意力和 Mamba 块,用于建模该频段的动作结构。 音乐特征和重复到时间维的可学习舞种嵌入参与条件融合;线性层加 softmax 的门控预测专家权重。 标准配置使用 2 个频带,对应较慢的平滑变化和较快的动作变化,但不是把舞种硬分为两类。
这里分解的是参考动作的时间频率,不是把原始音频频率简单等同于舞蹈速度。 低频身体轨迹与高频动作细节可以共同构成一次舞姿,门控的任务是按条件改变它们的影响。 因此,作者希望缓解快节奏训练样本带来的生成偏置,而不是靠手写阈值决定模型必须快跳或慢跳。 融合结果送入以 LLaMA3.2-1B 初始化的 ChoreoLLaMA,模型逐个预测动作码。 每个已生成码都查询码本并投影为连续动作嵌入,作为后续预测的上下文,保持训练与生成接口一致。
一个完整示例¶
以输入一段舒缓音乐、由用户指定舞种为例,以下是机制说明,不是额外实验。 MuQ 首先提取音乐特征,MD-Retrieval 再从训练集取 10 段参考舞蹈。 这些参考动作经过频段分解,2 个专家分别处理不同时间变化尺度,门控结合音乐和舞种产生融合条件。 ChoreoLLaMA 逐个生成动作码,每一步将已预测的码转换成码本嵌入继续生成,而不是直接输出自然语言动作描述。 动作解码后,如果脚部仍在接触地面时抖动,FRDM 可以在不改写上半身表演的前提下修复根部和下肢。 这个例子也说明为什么检索和修复不能互相替代:前者提供编舞先验,后者处理生成或重建后的接触质量。
损失函数 / 训练策略¶
FRDM 的训练数据包括 MotoricaDance、FineDance、DD100 和 InterDance,并统一重定向到标准 SMPL-X 体型。 其目标包含动作重建、根部重建、接触脚位移约束,以及速度积分后与预测位置一致的约束。 其中原文可辨认的速度与位置一致性项为:
旋转经前向运动学得到的位置与直接预测位置之间,还使用允许小误差的 epsilon-insensitive 约束。 允许误差的原因是两种表示承担不同任务:旋转保持几何,位置与速度更直接服务于接触修复。 脚接触由速度和高度阈值共同判断,实验给出容差 0.1、速度阈值 0.001、脚趾高度阈值 0.05、脚踝高度阈值 0.08。 这些数值沿用论文实现设置;正文没有在此明确所有阈值的单位,不另行换算。 缓存中的式 (3)–(7) 有明显断裂,尤其是引导混合项与接触掩码,故此处只解释可核实机制,不重建其精确代数形式。
RVQ-VAE 在一张 A100 上训练 24 小时;ChoreoLLaMA 的批量大小为 8,学习率为 \(3\times10^{-4}\)。 推理使用温度 0.85、top-k 采样的 \(k=30\) 和 top-p 采样的 \(p=0.8\);这里的采样 k 与检索 10 个参考动作不是同一个参数。 InfiniteDance 按 85% / 5% / 10% 划分训练、验证和测试,并保持舞种分布一致。 第 5.1 节的一般训练配置会合并公开数据及其原始划分,但表 3 明确规定两种比较模型都在 InfiniteDance 上训练,应按该表的专用设定解读跨数据集结果。
实验关键数据¶
主实验¶
下表摘录原文表 2,第 12 页,在 InfiniteDance 上比较生成结果;FID 越低越好,FSR 是接触时足部滑动比例,BAS 衡量音乐与动作节拍对齐。 FIDk 和 FIDg 分别对应运动学与几何特征,Divk、Divg 是对应特征空间的多样性,不能把多样性升高自动等同于更好舞蹈。
| 方法 | FIDk ↓ | FIDg ↓ | FSR ↓ | Divk ↑ | Divg ↑ | BAS ↑ |
|---|---|---|---|---|---|---|
| Bailando | 117.38 | 82.37 | 15.56% | 5.46 | 5.28 | 0.2137 |
| EDGE | 96.07 | 63.53 | 14.15% | 4.36 | 4.97 | 0.2321 |
| FineDance | 94.39 | 62.29 | 13.53% | 4.42 | 4.85 | 0.2318 |
| Lodge | 89.52 | 60.38 | 6.72% | 3.93 | 5.00 | 0.2329 |
| ChoreoLLaMA | 30.54 | 16.31 | 5.33% | 6.23 | 5.11 | 0.2342 |
作者明确重训了 EDGE、Lodge 和 Bailando,也承认这些基线的默认配置未必适合新数据的规模与复杂性。 表 3,第 13 页的未见音乐 OOD 测试中,ChoreoLLaMA 的 FIDk 为 56.22,Lodge 为 119.66;但 BAS 分别为 0.2315 和 0.2332,前者并未全面领先。 该 OOD 设置包含训练范围之外的 BPM 和罕见乐器或风格,不等同于对全部网络音乐进行随机测试。
消融实验¶
下表来自原文表 4,第 13 页,是在 InfiniteDance 测试集上逐步加入组件的结果,不是所有组件组合的全因子实验。
| 配置 | FIDk ↓ | Divk ↑ | BAS ↑ |
|---|---|---|---|
| Token 索引,无 RAG、无 MoE | 79.84 | 13.09 | 0.2073 |
| 连续嵌入,无 RAG、无 MoE | 62.87 | 5.49 | 0.2269 |
| 连续嵌入 + RAG | 38.74 | 6.16 | 0.2325 |
| 连续嵌入 + RAG + MoE | 30.54 | 6.23 | 0.2342 |
为区分数据质量和生成质量,下表另摘录原文表 7,第 15 页的采集管线分析;Jitter 数值沿用原表,当前正文没有给出可复现定义或单位。
| 采集或修复方式 | FSR ↓ | Jitter ↓ | 穿透率 ↓ |
|---|---|---|---|
| FineDance,专业 MoCap | 6.22% | 12.69 | 0.6954% |
| GVHMR | 28.63% | 31.89 | 0.7864% |
| GVHMR + PHC | 8.87% | 78.60 | 0.0536% |
| GVHMR + PHC + Smooth | 14.29% | 15.39 | 0.0561% |
| GVHMR + PHC + FRDM | 5.09% | 14.33 | 0.0559% |
关键发现¶
- 连续嵌入降低 FIDk 并改善 BAS,即使 Divk 从 13.09 降至 5.49;这提示高多样性也可能来自无结构动作。
- 加入 RAG 后 FIDk 从 62.87 降至 38.74,再加入 MoE 降至 30.54;逐步消融支持二者互补,但不能独立测出全部交互效应。
- 采集侧 FRDM 相比普通平滑同时降低滑脚和抖动,但 Jitter 14.33 仍高于专业 MoCap 的 12.69,不能称所有质量指标超越 MoCap。
- 第 5.4 节另报告生成结果经 FRDM 后 FSR 从 8.89% 降至 5.33%;这与采集管线的 5.09% 是不同对象,不应混用。
亮点与洞察¶
- 数据修复与生成建模相互支撑。采集侧先移除容易被模型学进去的接触错误,输出侧再处理残余伪影,比仅追求生成网络容量更完整。
- 预训练码本不仅是压缩字典,也是输入表征来源。该接口思路可用于其他以离散目标预测、却仍希望保留连续局部结构的运动任务。
- 频段专家作用于参考动作,而不是预设舞种规则。可迁移之处在于按信号变化尺度组织专家,让条件门控决定组合方式;这种迁移仍需新任务实验验证。
局限与展望¶
- 作者承认 BAS 不适合评价慢舞:模型对慢音乐生成稍快、容易卡点的动作,可能让分数虚高,不能据此断言超过真人编舞。
- 长静音和突然切换舞种时,动作跟随音乐的可靠性下降;检索主要捕捉片段内部相似性,也限制长序列结构。
- 数据优先选择稳定相机和全身可见视频,因此采集管线对强遮挡、快速镜头运动等更困难场景的覆盖有限。
- 原文表 1 和贡献总结写 30 个舞种,第 3.2 节却写 6 大类、33 个细分类;两种口径关系未解释,应保留这一统计不确定性。
- 表 5 的 Top-10 与表 4 的 RAG 行存在 Divk、BAS 差异,尽管 FIDk 都为 38.74;此处不把两表拼成同一配置结果,也不自行修正数字。
- 本文展现了扩大数据与采用较大骨干后的效果,但缺少系统的模型容量缩放曲线;“可扩展”不等于已建立规模定律。
相关工作与启发¶
- vs Lodge:Lodge 用粗到细结构和编舞先验组织长舞蹈,本文用检索及频段专家增强跨音乐条件适应;长程结构仍是本文明确承认的薄弱点。
- vs Bailando:两者都涉及动作 token,本文的重点是复用连续音乐与码本嵌入,并加入参考动作条件,而不是完全放弃离散生成。
- vs GVHMR / PHC:前者提供视频身体运动估计,后者引入物理约束;FRDM 修补物理模仿后的足部抖动,并不替代前两步的全身估计与物理处理。
- 后续研究启发:可将片段检索扩展到乐句级结构规划,并分别评价慢舞表现力、长程编舞一致性和接触质量;这是读者建议,不是本文已完成的实验。
评分¶
- 新颖性: 4/5。物理修复数据管线与检索、频段专家形成具体组合,单个基础模块多有既有来源。
- 实验充分度: 4/5。覆盖生成、泛化和采集消融,但基线调优公平性、规模分析及部分指标定义仍有缺口。
- 写作质量: 3/5。整体路线清楚,类别口径和跨表数值需要澄清,缓存公式损坏另限制精确核读。
- 价值: 4/5。对规模化音乐与人体动作配对、物理质量控制及条件生成接口都有实际参考意义。