Music-to-Dance Generation via Atomic Movements¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/oceanflowlab/AtomicDance
领域: 音频/语音
关键词: 音乐驱动舞蹈生成、原子动作、离散扩散、结构感知生成、编舞可控编辑
一句话总结¶
把舞蹈显式建模成一串语义可读、可复用的「原子动作」,先用离散扩散模型在整首音乐的条件下规划出每个原子动作的类型、时长与时间位置(相当于一张符号谱),再用过渡感知的连续扩散生成器补全动作之间的过渡、并按时长最近原则检索实例后加掩码噪声重绘,在 AIST++ 上取得最低的 FID(25.26 / 9.03)、最高的 BAS(0.2470)与最高的结构一致性 R(26.6)。
研究背景与动机¶
音乐驱动舞蹈生成要同时满足两件事:动作本身要符合人体运动学、看起来自然,节奏和风格又要与音乐对得上。这条线近几年基本被生成模型包圆——FACT 用跨模态 Transformer 自回归地预测关节轨迹,Bailando 与 TM2D 用 VQ-VAE / GPT 学习离散动作码本来增强音乐条件下的可控性,EDGE 把扩散模型引入舞蹈生成并支持局部编辑与续写,LODGE、EDMG 则面向长序列做粗到细或高效生成。这些工作共享一个前提:把舞蹈当成一段连续信号,直接学「音乐帧 → 动作帧」的序列到序列映射。它们因此擅长的只是帧级或短时的对应关系——哪一拍落脚、哪一小节的局部节奏一致——而真实编舞赖以为生的组织方式被丢掉了。粒度问题具体体现在两处:VQ 码本里每个离散码通常只对应极短的运动片段,解码出来几乎是静态姿态,没有「过程」信息;扩散式方法通常在较短的时间窗上训练,感受野受限,捕捉不到跨小节展开的整体编舞结构,而且只能在信号层做 inpainting 编辑,没有符号级的可解释性。
矛盾在于:编舞学与音乐理论都强调,一段表演是由离散、有意义、可复用的单元组织起来的——同一个动作会在整支舞里反复出现,并在节奏、力度、幅度、方向上发生变化,可能被加速、放慢、放大、缩小、反向、拆碎再重组。也就是说「结构」本来就在数据里,但现有方法没有任何一层显式地表示「这一段时间是什么动作、持续多久、什么时候出现、哪里是连接」。缺了这一层,生成的舞蹈就缺少段落级的连贯性,用户也没法用「把第二个动作换成旋转」这种方式去改。
本文的选择是先把这层结构从数据里挖出来、再在它上面做生成,而不是指望网络隐式学到。作者把原子动作定义为「可重复、有变化、可自由组合的基本运动过程」,并用三条判据把它落到可操作的定义:必须是一段完整过程而非单帧(单帧姿态虽然完整地刻画了一个瞬间,却凝固在时间里,无法体现情绪与能量的变化,也就无法与音乐的节奏和分句互动);必须重复出现且重复时带变化(正是「重复 + 变化」让整支舞既统一又不单调);必须能用自然语言描述,从而支持检索和人工理解。在此基础上,作者设计了一个两阶段框架:第一阶段充当编舞者,在全曲音乐条件下预测原子动作的类型、时长与位置,输出一张符号舞谱;第二阶段充当舞者,按这张规划去实现每个动作、并生成动作之间的过渡。核心 idea:把音乐到舞蹈的生成显式拆成「原子动作规划 + 过渡补全」两层——用离散扩散在整曲条件下打出符号谱,再用带掩码噪声的连续扩散补过渡、重绘动作,从而在保住运动自然度的同时拿到段落级结构、可解释性与可编辑性。
方法详解¶
整体框架¶
给定长度为 \(L\) 的音乐 \(M^{1:L}\),目标是生成与之对齐的舞蹈序列 \(X^{1:F}\),其中 \(F = L \times R_F\)、\(R_F\) 是固定帧率。整篇论文的方法其实是两件事拼起来的:先离线地从舞蹈数据里造出一套原子动作词表(数据里没有任何段级标注,这套词表是后续一切的地基),再在线地做两阶段生成——第一阶段在整首音乐条件下规划出一串原子动作标签(每个标签带类型、起始位置和时长),第二阶段把这张符号谱翻译回连续动作,补出动作之间的过渡,并允许每个原子动作被带变化地重绘。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
A["AIST++ 舞蹈视频<br/>+ 3D 动作"] --> D1
subgraph D1["原子动作发现"]
direction TB
S1["切段:相似度矩阵<br/>+ 自适应切点"]
S2["聚类:TMR 编码<br/>+ K-Means 原型"]
S3["重聚类:LLM 打标<br/>+ 语义细分"]
S1 --> S2 --> S3
end
D1 --> D2
M["输入音乐(全曲)"] --> D2
D2["原子动作规划<br/>离散扩散打谱 + 后处理"] --> D3
M --> D3
subgraph D3["舞蹈补全"]
direction TB
C1["时长最近检索实例<br/>+ 掩码噪声"]
C2["过渡感知扩散<br/>补过渡 + 重绘动作"]
C1 --> C2
end
D3 --> O["完整舞蹈序列"]
值得注意的是音乐与动作的对应关系被拆到了两个层次。符号层由规划器建立:它以整首音乐而非音乐片段为条件,决定每个时刻该放哪一类原子动作、放多久、以及哪些帧应该留作过渡,因此能够对齐乐句与段落级的结构,而不只是节拍。信号层由补全模块建立:扩散去噪网络以音乐特征为条件,并额外用一项过渡损失把动作边界处的接缝抹平。与把音乐只当作节拍对齐信号、或者靠短窗扩散隐式建模的端到端做法相比,这里的音乐第一次被用来决定动作序列的符号编排。
关键设计¶
1. 原子动作发现:用「切段 → 聚类 → LLM 重聚类」把舞蹈数据自动拆成可复用的动作词表
AIST++ 只有整段舞蹈和配对的音乐,没有任何段级动作标注,而现有的 VQ 码本粒度又细到解码出来只剩姿态,所以作者必须先自己造词表。第一步是切段,目标是把连续动作切成一段段「过程完整、与周围语境可区分」的单元:踢腿是一个完整的原子过程,包含重心转移的预备、腿的伸展和收回,单独一帧伸展姿态或者一段极短的腿部移动都传递不了这个事件。作者沿用零样本时序事件提议的思路(算法 1):先用 I3D 提取逐帧视觉特征,算出帧间余弦相似度矩阵 \(A\),把第 \(t\) 帧与所有帧的相似度向量 \(c_t\) 拼上归一化帧序号后做聚类,即
再在聚类标签发生跳变的位置落切点,并把短于 \(L_{\min}\) 的段与较短的邻居迭代合并。这里的直觉是同一动作段内部的帧彼此相似、与段外帧不相似,因此段内帧拥有相同的相似度模式、会被分到同一个簇,切点自然落在动作交界处;拼上帧序号则是为了抑制在时间上远离的相似帧被误并到一组。随后用 Gemini-2.5-Pro 从「标志性姿态」和「运动动态」两个维度给每个视频段写描述,其中标志性姿态由 PoseScript 对运动节拍处(段内关节速度的局部极小值)的关键帧生成,作为辅助线索喂给 VLM,最终得到细粒度自然语言描述。
第二步是跨数据集聚类,找出「重复且带变化」的基本单元。每段用预训练 TMR 运动编码器编码,投到联合运动-文本嵌入空间里做 K-Means,把段组织成可重复的原子动作原型;因为 TMR 是在 HumanML3D 上用文本-运动对比学习训的,其 caption 偏重高层动作描述而非舞蹈细节,编码器天然会把高层相似、内部细节各异的段聚到一起——这恰好是「原型保留变化」想要的性质。为质量起见,作者只保留靠近簇心的段、丢弃语义模糊的边缘点,最终在完整 AIST++ 上得到 100 个原型,平均每个原型含 268.57 段。
第三步是组内重聚类,目的是把原型进一步拆成可解释的类别。先用舞种做一次预切分(不同舞种的动作用语义差别大),再让一个摘要式 LLM 迭代地做两件事:找出互相相似的一批 caption 作为子原型,把它蒸馏成一个简短的语义标签,重复直到未分组的段数低于阈值。平均每个原型得到 7.3 个子原型、每个子原型约 31.8 段——既保留了细粒度多样性,又没有把数据切得过于稀疏。语言模型在这里的价值是引入了「语义相似但运动学多样」这一维度上的合并准则,让词表比纯运动学聚类更贴近人对动作的理解。
2. 原子动作规划:用离散扩散在全曲条件下预测一张符号谱
传统做法让网络直接从音乐回归密集动作帧,学到的是局部节奏而看不到长程编排。而编舞的第一步其实是决定「用哪些动作、放在哪、放多久」,本文把这一步显式地写成符号序列预测:给每一帧分配一个原子动作类别,或者分配一个「该帧属于过渡」的标记。因为输出是离散标签,作者采用离散去噪扩散概率模型(D3PM)而不是连续扩散。假设有 \(K\) 类原子动作,用 \(0\) 到 \(K\) 编号,\(0\) 表示该帧不属于任何原子动作(即过渡帧),前向过程按转移矩阵 \(Q_t\) 逐步把真实标签扰动为随机噪声:
每一步以概率 \(\alpha_t\) 保留原 token、以概率 \(1-\alpha_t\) 把它替换成一个均匀随机的类别,\(T\) 步之后序列趋近均匀分布。反向过程由一个以音乐特征 \(c_{music} = \mathrm{Enc}(M)\) 为条件的 Transformer 扩散模型参数化,推理时从均匀随机序列 \(y^T\) 出发迭代采样到 \(t=0\),得到规划结果 \(\hat{Y} = [\hat{y}_1, \dots, \hat{y}_F]\),同时给出每个动作事件的类别与时间安排。条件用的是整首音乐而不是片段,这是与短窗方法最本质的区别:规划器能看到乐句和段落走向,因而能把动作放到合适的位置、并决定过渡应该出现在哪里,这直接解释了 BAS 与结构一致性指标的提升。另外,因为中间层是离散且时间落地的符号,用户可以在进入第二阶段之前手动改某一段的类型或时长、或者重排段落,无需重新训练。
作者还发现一个实践中很关键的问题:一个连续的原子动作段里只要有一帧被误标,规划结果就会被严重破坏。于是在第一阶段之后加了一个轻量后处理:先用滑动窗多数投票去掉孤立的帧级错误、平滑局部不一致,再用最短时长合并的启发式检测异常短的段,把它重新指派给语义最兼容的相邻段。两步分别针对过分割和局部抖动,纠正错误的同时保留真实的动作边界。
3. 舞蹈补全:检索实例 + 掩码噪声 + 过渡感知扩散,边接缝边重绘
规划出来的只是一张骨架——它规定了动作的类别组成,既没有把动作实现出来,也没有把相邻动作连起来;而编舞理论又指出,重复出现的结构动作在每次重复时都应当有变化。如果直接按标签把库里检索到的实例首尾拼接、只做时间缩放,动作确实保真,但多样性、节拍对齐和整体舞感都会塌下来。本文的做法是:对预测出的标签序列,先为每个标签检索时长与规划时长最接近的运动实例,缩放后填入对应帧区间,给这些被选中的原子动作加上掩码噪声(噪声比例由掩码 \(w\) 控制)以允许它们在去噪中被改写,未分配的过渡帧则保持未初始化,由此得到一条「原子段已填、过渡帧为空」的粗序列 \(M_0\)。接着用一个 DDPM 去噪网络 \(f_\theta(m_t, t, x_{music}, M_0, w)\) 同时以音乐特征、粗序列和掩码为条件,从 \(M_0\) 出发预测干净信号 \(m_0\),把空着的过渡帧补出来、把加噪的原子段重绘成与音乐更贴合、与邻居更连贯的版本。掩码噪声的大小相当于一个显式的「保语义 / 促多样」旋钮:噪声小则几乎照搬检索到的实例,保真但单调;噪声大则自由度更高、更容易跟上音乐,但可能偏离类别该有的语义。检索策略也做了三路对比,固定单实例会压低多样性,随机挑选因为需要更强的时长缩放而同时损害 FID 与结构一致性,时长最近检索在多样性、结构一致性和节奏一致性上最平衡。此外,为了让动作边界处不出现跳变,训练时额外加了一项过渡损失约束边界前后两帧的一致性。
损失函数 / 训练策略¶
第一阶段是标准的 D3PM 变分目标,\(\mathcal{L}_{\text{D3PM}}\) 最小化在音乐条件下还原被扰动标签的负对数似然。第二阶段沿用标准去噪损失,网络从 \(m_t\) 预测干净信号 \(m_0\):
在此之上加一项过渡损失,对每个原子动作边界取边界前后两帧的距离进行惩罚:
两个模块都使用 512 维隐变量、8 层 Transformer、8 个注意力头、前馈维度 1024、dropout 0.1;补全模块基于 EDGE 的去噪骨干改造成过渡感知版本。优化用 AdamW,学习率 \(2\times10^{-4}\)、权重衰减 0.01、梯度裁剪 1.0。数据侧使用 AIST++,含 1,408 段与音乐配对的 3D 舞蹈动作,共 5.2 小时,覆盖 10 个舞种、30 位受试者,带多视角标注。
实验关键数据¶
主实验¶
AIST++ 上与代表性基线的比较(\(\uparrow\) 越高越好,\(\rightarrow\) 表示越接近 Ground Truth 越好)。本文在 FID、BAS 和结构一致性 R 上全面领先,Div 也最接近真实舞蹈:
| 方法 | FID_k ↓ | FID_g ↓ | Div_k → | Div_g → | BAS ↑ | R ↑ |
|---|---|---|---|---|---|---|
| Ground Truth | 17.1 | 10.6 | 8.19 | 7.45 | 0.2374 | 42.1 |
| DanceNet | 69.18 | 25.49 | 2.80 | 2.85 | 0.143 | 14.1 |
| DanceRevolution | 73.42 | 25.92 | 3.52 | 4.87 | 0.195 | 13.7 |
| Bailando | 28.16 | 9.62 | 7.83 | 6.34 | 0.2332 | 17.9 |
| EDGE | 42.16 | 22.12 | 3.96 | 4.61 | 0.2334 | 16.3 |
| LODGE | 37.09 | 18.79 | 5.58 | 4.85 | 0.2423 | 18.2 |
| 本文 | 25.26 | 9.03 | 8.01 | 6.69 | 0.2470 | 26.6 |
评价指标中,FID_k / FID_g 分别衡量生成舞蹈与对应真值在运动学空间和几何空间上的分布距离;Div_k / Div_g 是特征空间内的平均成对欧氏距离,越接近真值越好;BAS 衡量生成动作与音乐的节拍同步程度。R(R-precision)是作者为衡量结构一致性提出的指标:把音乐切成若干片段、计算每个片段的音乐特征,检查每对最相似音乐片段所对应的舞蹈,其运动特征是否落进最相似的三个舞蹈片段之内,precision 记为 R——⚠️ 原文对该指标的定义表述较为简略,此处按原文直述,细节以原文为准。MultiModality 则取同一首音乐生成 5 个样本之间的方差,衡量模型在相同音乐下的输出多样性。
消融实验¶
原子动作发现的配置与重聚类(表 2):
| 聚类数 | 重聚类 | FID_k ↓ | FID_g ↓ | BAS ↑ | R ↑ |
|---|---|---|---|---|---|
| 75 | ✗ | 33.24 | 13.31 | 0.2413 | 20.2 |
| 100 | ✗ | 32.68 | 12.09 | 0.2420 | 21.3 |
| 125 | ✗ | 34.57 | 14.28 | 0.2415 | 21.1 |
| 100 | w/o LLM | 30.11 | 11.27 | 0.2431 | 23.3 |
| 100 | w/ LLM(完整) | 25.26 | 9.03 | 0.2470 | 26.6 |
舞蹈补全的灵活重绘与固定实例(表 4):
| 配置 | FID_k ↓ | FID_g ↓ | Div_k → | Div_g → | BAS ↑ | R ↑ | MultiModality ↑ |
|---|---|---|---|---|---|---|---|
| Ground Truth | 17.1 | 10.6 | 8.19 | 7.45 | 0.2374 | 42.1 | – |
| 固定原子动作 | 24.13 | 8.44 | 6.99 | 4.61 | 0.2356 | 27.2 | 1.43 |
| 灵活原子动作(完整) | 25.26 | 9.03 | 8.01 | 6.69 | 0.2470 | 26.6 | 2.25 |
⚠️ 表 2 的「重聚类」列在原文中取值为 ✗ / w/o LLM / w/ LLM,此处按「不做重聚类 / 做重聚类但不引入 LLM 语义标签 / 完整方法」解读,具体配置以原文为准。
关键发现¶
- 三个设计各自都有正贡献,语言先验的收益最大。 在同样 100 个簇的设置下引入 LLM 重聚类,FID_k 从 30.11 降到 25.26、R 从 23.3 提升到 26.6,说明把「语义相似但动态各异」的动作并成更可读的类别,确实为后续规划与补全提供了更可靠的基座。聚类粒度则存在明显的甜点:75 与 125 个簇都劣于 100,簇太少会把不同动作过度合并、削弱几何保真度,簇太多又把相似动作切碎、损害连贯性。
- 规划阶段的精度直接决定最终质量的上界。 表 3 显示,把规划结果直接交给第二阶段而不做后处理时,帧级误判会把连续原子动作打碎并进一步污染补全结果;加上滑动窗多数投票与最短时长合并后,FID_k 从 25.26 降到 24.02、R 从 26.6 提升到 27.5。而直接使用真值原子标签能让 FID_k 降到 21.59、R 升到 29.8,这也是框架与人工编辑兼容的证据——用户在补全前手动调规划,有可能拿到更好结构与质量的舞蹈。⚠️ 需要注意原文表 1 中本文方法的数值与表 3 中「未用后处理」一行完全一致,两表之间存在数值冲突,以原文为准。
- 重绘换来的是舞感,不是保真。 固定实例(直接拼接、只做时间缩放)反而拿到更低的 FID_g(8.44 vs 9.03),但 Div_k(6.99 vs 8.01)、BAS(0.2356 vs 0.2470)和 MultiModality(1.43 vs 2.25)全面落后。也就是说,照搬检索结果会牺牲表现力与节拍同步;允许扩散重绘则更像真实舞者在重复同一动作时自然引入的变化,模型不是从数据集里复制动作。
- 检索策略是多样性、结构与节奏之间的三方权衡。 随机挑选多样性最高(MultiModality 2.62)却因需要更强的时长缩放而 FID_k 最差(27.94)、R 最低(24.5);固定单实例多样性最低(Div_k 6.42、MultiModality 2.18)但 R 最高(28.9);时长最近检索处于平衡点,并靠更高的 MultiModality 证明「时长感知的检索」能在保持时间兼容性的前提下产出多样的舞蹈。
- 定性上能看出结构。 与 LODGE 的对比中,本文结果会反复出现典型原子动作,并在时长与幅度上变化,而 LODGE 输出过于平滑、看不出明确的动作基元。
亮点与洞察¶
- 把「动作词表」这件事认真做成了三段流水线,而不是顺手写个 K-Means。 切段保证了单元是完整过程而非片段,聚类保留了组内变化,LLM 重聚类补上语义可读性——三步各自对应原子动作三条判据中的一条,动机与机制是对齐的,而不是堆模块。
- 用离散扩散去「打谱」是这套框架的关键杠杆。 D3PM 天然输出离散标签序列,既让「这一帧属于哪类动作 / 是不是过渡」变成一个可采样的对象,又让中间结果成为人可读、可手改的符号;这一点是纯连续扩散(EDGE 的 inpainting 只能在信号层编辑)做不到的。
- 音乐与动作的对应被拆成符号层与信号层,是性能提升的机制解释。 整曲条件让规划器看到乐句结构,音乐条件下的去噪 + 过渡损失再把信号层接缝抹平;相比只在短窗里学节拍对应的做法,这解释了 BAS 与 R 的同时提升。
- 「掩码噪声」是一个可复用的旋钮式设计。 用掩码控制被检索实例保留多少、重绘多少,把「保真 vs 多样」显式交到推理时的手上;同样的思路可以迁移到任何「检索 + 生成」的混合管线(如文本驱动的人体动作编辑、检索增强的视频续写),只需要把掩码定义在需要保留语义的那部分 token 上。
- 把规划结果暴露给用户,是一个很实用的产品化视角。 因为规划是可读符号且与补全解耦,改动作、调时长、重排段落都不需要重训模型。
局限与展望¶
- 原文没有单列的局限章节。从实验配置看,原子动作词表固定为 100 个原型(平均每原型 7.3 个子原型),词表对更广舞种、更复杂编舞的覆盖能力没有讨论;子原型平均只有 31.8 段,长尾子原型的样本量更少,这会让稀有动作的生成质量更容易波动。
- 发现与生成全部只在 AIST++(1,408 段、5.2 小时、10 舞种)上验证,跨数据集、跨舞种的泛化未做实验;同时词表构建依赖 Gemini-2.5-Pro 与 PoseScript 的标注,标注成本与标注噪声对最终结果的影响没有量化。
- 第二阶段本质上是「检索 + 条件修复」:多样性上界受库里已有实例约束,且一旦规划错误,补全阶段只能局部补救,不会重排全局结构。规划与补全目前也是分开训练的,第二阶段的误差无法回传给规划器。
- 数值层面的可复现性有隐患:表 1 与表 3 存在冲突(本文方法行与「未用后处理」行完全一致),R-precision 又是自提指标、定义偏简略,与其他工作的横向比较需要谨慎。
- 生成质量与真值仍有明显差距(FID_k 25.26 vs 17.1),说明结构感知解决的是「编排是否连贯、是否可控」,并没有从根本上解决动作保真度的问题。
- 可改进的方向:把过渡也符号化(当前过渡是无标签的自由帧,是结构表示上的一个缺口);用规划器的输出做条件、对两个阶段做联合微调,让补全的重建误差回传;在更大规模的多舞种数据上扩充词表,并验证词表规模与生成质量的关系。
相关工作与启发¶
- vs Bailando / TM2D:它们用 VQ-VAE / GPT 学离散动作码本做音乐条件下的可控生成,但码本里每个码只对应极短的运动片段,解码结果接近静态姿态、缺少过程信息与段级结构。本文的离散单元是「完整的动作过程」,粒度从帧级提到段级,因此规划层能表达编排结构而不是局部姿态串。
- vs EDGE:EDGE 把扩散用于舞蹈生成并支持局部编辑与续写,但训练窗口短、感受野受限,难以捕捉长时间尺度上的整体编舞结构;其 inpainting 只能在信号层编辑,缺少符号可解释性。本文在整曲上做符号规划,再去条件生成,编辑发生在「动作类型 / 时长 / 位置」这一层。
- vs LODGE / EDMG:两者面向长序列舞蹈(粗到细扩散 / 高效生成),但生成的是没有清晰过程、也缺少语义可解释性的关键帧,因而难以按音乐结构组织出组合式的舞蹈序列。本文提供的是它们所缺的结构层,两者在思路上是互补的。
- vs 文本到动作(TEMOS / T2M-GPT / MDM):文本条件给出的是明确指令、要求动作精确;而舞蹈是艺术性与组合性的,既要运动学可信又要有审美创造,相同动作还要创造性地变化。直接套用文本条件下的动作框架无法刻画这种艺术性与层次性,这也是需要专门的原子动作词表的原因。
- 可迁移的启发:把「重复出现的结构单元 + 变化」显式建模成离散词表,再让规划层在长程条件下预测词表序列、生成层做条件修复,这种两层解耦可以搬到长视频生成、音乐驱动的其他表演任务(如音乐到手势、音乐到体操)以及任何「结构一致性差、又需要人可编辑」的序列生成问题上。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把编舞学里的「原子动作 + 重复变化」落成可自动构建的离散词表,并用离散扩散规划符号谱,视角新颖且自洽;单看任一组件(K-Means + LLM 标注、D3PM、DDPM 补全)都是已有技术的组合。
- 实验充分度: ⭐⭐⭐ 主实验 + 四组消融覆盖了词表粒度、LLM 重聚类、后处理、重绘与检索策略,分析到位;但只在 AIST++ 一个数据集上验证,表 1 与表 3 数值冲突,词表标注成本未量化。
- 写作质量: ⭐⭐⭐ 方法与动机的对应关系讲得清楚,图 2 的两阶段示意直观;但公式区 OCR 后多处损坏、个别表格自相矛盾,R-precision 的定义过于简略。
- 价值: ⭐⭐⭐⭐ 提供了一个可编辑、可解释的舞蹈生成范式,符号规划层对长序列舞蹈与人机协同编舞都有实用价值,掩码噪声的「保真—多样」旋钮可以迁移到其他检索 + 生成的混合管线。