Motion Style Slider: Endpoint-Supervised Continuous Style Control for Human Motion Diffusion¶
会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 人体理解 / 扩散模型
关键词: 动作风格迁移、人体动作扩散模型、连续风格控制、端点监督、外推评估
一句话总结¶
针对人体动作扩散生成中缺乏细粒度连续强度调节的问题,本文提出了端点监督的连续动作风格滑动条(Motion Style Slider),在冻结的运动语义隐空间中构建风格方向并结合标量滑块 \(\alpha\) 调节,利用扩散去噪配合线性度与单调性隐空间正则化,在无需中间强度真值动作的情况下实现了平滑、单调且可合理外推的动作风格控制。
研究背景与动机¶
在游戏动画制作、虚拟角色驱动和交互式内容生成中,生成兼具高度拟真度与灵活风格表现的人体动作是一项核心需求。近年来,基于扩散模型的人体动作生成方法取得了显著突破,不仅大幅提升了运动序列的多样性与物理合理性,也衍生出了多种动作风格迁移管线。然而,现有主流动作风格迁移方案普遍将风格视为离散标签(如单纯的喜怒哀乐分类),或是仅支持在固定目标风格参考下的单点迁移,缺乏对风格表现强度的细粒度连续调节机制。在缺少中间状态显式监督的情况下,简单的隐空间线性插值往往无法保证生成动作沿风格强度的单调递增,更难以支持超出端点强度的合理外推。
在真实的动画与游戏制作管线中,艺术总监和动画师的反馈通常是高度迭代且相对性的,例如“风格再稍微收敛一点”、“动作幅度再夸张一倍”、“比参考动作推得更极致”。由于不同创作者对风格强度的感知存在主观差异,绝对数值(例如全局通用的精确 2 倍风格)在工业界往往难以统一定义,最关键的诉求反而是可靠的相对可控性——当滑块数值递增时,动作风格应当严格保持可预测的单调递增顺序,过渡平滑自然,并且具备一定的超端点外推裕度。然而现实中的高质量动捕数据通常只提供中性内容动作与某种满级风格动作构成的配对端点,完全不存在连续不同强度梯度的真实动作序列,使得连续控制的训练面临极大的监督缺失。
本文正是从这一工业界真实痛点切入:既然绝对强度不可泛化且中间样本缺失,不如将风格控制形式化为以端点监督为锚点的相对控制坐标系。核心 idea:将风格变化建模为学习到的运动语义隐空间中的有向矢量,引入连续标量滑块 \(\alpha\) 进行条件注入,并在扩散去噪目标之上施加风格投影的线性度与单调性正则约束,仅凭两端点动作即可引导扩散模型生成平滑、单调且支持合理夸张外推的连续风格动作轨迹。
方法详解¶
整体框架¶
Motion Style Slider 的核心目标是在仅给定内容动作 \(m_c\) 和风格端点动作 \(m_s\) 的监督下,生成由连续强度参数 \(\alpha \ge 0\) 精确控制的动作序列 \(\hat{m}_\alpha\)。在 \(\alpha=0\) 时模型应重构中性内容动作 \(m_c\),在 \(\alpha=1\) 时达到标准风格强度 \(m_s\),而在 \(\alpha \in (0, 1)\) 或外推区间 \(\alpha > 1\) 时表现出平滑单调的风格渐变。整体管线基于预训练的人体动作扩散模型(MDM)骨干构建,通过冻结的语义特征提取器分别构建内容条件与风格方向条件,再经由轻量级可训练适配层(Adaptor)注入扩散去噪网络。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入动作对<br/>内容端点 mc 与风格端点 ms"] --> B["风格方向构建<br/>冻结TMR编码与方向估计"]
B --> C["滑块条件生成<br/>连续标量缩放与投影编码"]
C --> D["端点加权扩散去噪<br/>内容保持与冻结MDM骨干适配"]
D --> E["隐空间轨迹正则化<br/>线性度与单调性约束"]
E --> F["输出连续控制动作<br/>插值与外推动作序列"]
在训练时,网络接收带有加噪的人体运动序列以及由标量 \(\alpha\) 调制的条件向量;损失函数不仅对端点和中间样本施加差异化权重的去噪重建约束,更利用预训练特征空间中的风格投影算子,对中间及外推采样点施加线性与单调性正则,迫使去噪轨迹符合物理与语义上的平滑递增规律。
关键设计¶
1. 风格方向构建:在规范化语义隐空间中确立风格演进基准轴
直接在原始人体骨骼关节点坐标空间中进行插值会造成严重的骨骼拉伸、滑步和运动学失真,因此必须在高度结构化的语义空间中提取风格方向。本文采用基于对比学习的冻结运动文本检索编码器(TMR)作为风格特征提取器 \(E_s(\cdot)\),将任意运动序列映射到单位超球面上:\(\|z\|_2 = 1\)。针对给定的训练配对,分别提取内容端点与风格端点的嵌入向量 \(z_c = E_s(m_c)\) 和 \(z_s = E_s(m_s)\)。为了兼顾特定动作对的专属细节与跨动作全局风格的一致性,设计了三种风格方向构建模式:
在实例模式下直接取单对差值向量 \(d_s = d_{\text{instance}}\);在原型模式下采用整个数据集中该风格与中性类的全局聚类中心之差 \(d_s = d_{\text{prototype}}\);混合模式则通过超参数 \(\beta \in [0, 1]\) 实行加权融合:\(d_s = (1-\beta)d_{\text{prototype}} + \beta d_{\text{instance}}\)。这种单位化隐空间中的向量化定义抹平了因动作能量不同而导致的数值尺度偏移,使得后续标量 \(\alpha\) 真正充当沿该语义轴线位移的纯粹相对物理量。
2. 滑块条件生成:端点感知采样与动态强度注入机制
为了让扩散模型不仅能精确复现两端基准点,还能泛化到任意连续的中间与外推强度,系统将连续标量 \(\alpha\) 注入隐空间位置计算:\(z_\alpha = z_c + \alpha d_s\)。该混合向量经由轻量级线性投影层映射为风格条件标记 \(c_{\text{style}}\)。与此同时,为了严苛保留原始动作的时序结构与动作语义,冻结的内容编码器 \(E_c(\cdot)\) 对中性输入 \(m_c\) 进行带掩码的时序均值池化,提取全局内容特征并通过可学习映射层转换为内容条件标记 \(c_{\text{content}}\),一并输入至预训练 MDM 扩散模型每层的可训练适配层(Adaptor)中。
在训练阶段采样标量 \(\alpha\) 时,若单纯使用均匀采样,会导致模型对两个端点关键事实的记忆退化。为此设计了端点感知的非对称采样策略:以概率 \(p_0\) 采样 \(\alpha=0\),以概率 \(p_1\) 采样 \(\alpha=1\),其余概率则在均匀分布 \(\mathcal{U}(0, \alpha_{\max})\) 中抽取连续值(包括 \(\alpha > 1\) 的外推区间)。这种采样方案极大强化了锚点位置的监督密度,为连续滑块提供了极其稳固的几何支点。
3. 隐空间轨迹正则化:无需中间真值的线性度与单调性双重约束
由于动捕数据中完全不存在 \(\alpha \in (0, 1)\) 或 \(\alpha > 1\) 的真实动作中间态,扩散去噪目标 \(\mathcal{L}_{\text{diff}}\) 在非端点处仅能将端点数据作为弱参考(中间采样点采用降权系数 \(w_{\text{mid}}\)),无法约束风格强度的变化轨迹。为了解决中间形态无序漂移甚至反向退化的问题,本文利用端点差值方向 \(\Delta = z_s - z_c\),定义了标量风格投影函数:
该投影算子刻画了生成动作在目标风格轴上的实际行进距离。基于此,构建了两个无监督轨迹正则化项:
其中 \(\gamma \ge 0\) 为强度间隔裕度。线性度损失 \(\mathcal{L}_{\text{lin}}\) 迫使生成动作的风格投影视角随 \(\alpha\) 严格呈比例前移,抑制由于隐空间曲率造成的非线性突变;单调性损失 \(\mathcal{L}_{\text{mono}}\) 则对任意更大强度却生成更弱风格的反常逆序行为施加惩罚。两者结合使得生成模型在完全没有中间 Ground Truth 的极端条件下,自主学出一条高度保真且平滑单调的生成流形。
损失函数 / 训练策略¶
总体训练目标由扩散去噪损失与两项隐空间几何正则化项联合加权构成:
其中去噪损失对端点样本赋权重 1.0,对中间样本赋下采样权重 \(w_{\text{mid}}\)。网络优化基于 AdamW 算法,初始参数加载自预训练 MDM 权重。为了防止破坏预训练扩散模型学习到的人体运动物理先验,骨干网络完全冻结,仅微调注入内容和风格的轻量级 Transformer 适配层以及条件投影层。推理阶段,用户仅需输入一组动作对 \((m_c, m_s)\) 并任意指定浮点数 \(\alpha\)(如 0.3、1.0、1.8),网络便能基于内容序列的时长掩码,单次前向去噪生成保质保量、动作内容对齐且风格强度可控的全新骨骼动画。
实验关键数据¶
主实验¶
实验在三个权威的人体动作风格基准数据集(PerMo、Bandai-Namco、Xia)以及本文专属构建的真实夸张动作捕捉外推数据集(Over-Reaction)上展开。评测强度集合统一设为 \(\alpha \in \{0, 0.5, 1.0, 1.5, 2.0\}\)。采用统一的评价指标:动作真实度(FMD)、内容识别准确率(CRA)、风格识别准确率(SRA)、单调性违背率(MonoViol)、线性度误差(LinErr)以及在外推强目标上的外推误差(ExtraErr)。
表 1 汇报了全数据集平均的主定量评测结果:
| 方法 | FMD ↓ | CRA ↑ | SRA ↑ | MonoViol ↓ | LinErr ↓ | ExtraErr ↓ |
|---|---|---|---|---|---|---|
| DeepMotionEditing | 0.588 | 0.290 | 0.060 | 0.25 | 0.326 | 1.196 |
| MCM-LDM | 0.381 | 0.808 | 0.265 | 0.11 | 0.358 | 1.174 |
| Ours (Motion Style Slider) | 0.457 | 0.606 | 0.295 | 0.05 | 0.280 | 1.109 |
表 2 展示了在三个主流数据集上的分项细化对比(表中数据格式为 Ours / MCM-LDM):
| 数据集 | FMD ↓ | CRA ↑ | SRA ↑ | MonoViol ↓ | LinErr ↓ |
|---|---|---|---|---|---|
| PerMo | 0.531 / 0.474 | 0.700 / 0.880 | 0.140 / 0.080 | 0.03 / 0.22 | 0.421 / 0.464 |
| Bandai-Namco | 0.143 / 0.237 | 0.714 / 1.000 | 0.714 / 0.429 | 0.01 / 0.06 | 0.259 / 0.368 |
| Xia | 0.279 / 0.346 | 0.108 / 0.351 | 0.405 / 0.216 | 0.07 / 0.05 | 0.261 / 0.407 |
消融实验¶
在规模最大、包含 33 种风格与 10 类动作的 PerMo 数据集上,对风格方向构建策略以及正则化损失项进行消融分析:
| 变体配置 | \(\mathcal{L}_{\text{lin}}\) | \(\mathcal{L}_{\text{mono}}\) | 方向模式 | FMD ↓ | CRA ↑ | SRA ↑ | MonoViol ↓ | LinErr ↓ |
|---|---|---|---|---|---|---|---|---|
| Ours (Full Model) | Yes | Yes | instance | 0.531 | 0.70 | 0.14 | 0.03 | 0.421 |
| Dir=proto | Yes | Yes | proto | 0.584 | 0.60 | 0.06 | 0.04 | 0.513 |
| Dir=hybrid (\(\beta=0.3\)) | Yes | Yes | hybrid | 0.588 | 0.70 | 0.12 | 0.03 | 0.509 |
| w/o \(\mathcal{L}_{\text{lin}}\) | No | Yes | instance | 0.605 | 0.54 | 0.06 | 0.03 | 0.422 |
| w/o \(\mathcal{L}_{\text{mono}}\) | Yes | No | instance | 0.545 | 0.56 | 0.04 | 0.04 | 0.434 |
此外,在对 11 名专业级动画受试者进行的盲测用户调研中(6 组配对案例,7 级 Likert 量表),本文方法在强度区分度(Distinguishability)上达到 4.92(远超基线的 2.36),低/中/高强度的风格评分呈现阶梯式攀升(3.92 / 4.61 / 5.18 对比基线的 3.56 / 3.59 / 3.46),单调递增通过率达到 50%(基线仅为 0%),充分验证了连续可控性的感知优越性。
关键发现¶
- 实例方向构建(instance mode)在 PerMo 上表现最优,其 SRA 达到 0.14,线性误差降至 0.421;而原型模式由于平滑掉了动作实例独特的动力学特性,风格识别率严重跌落至 0.06,说明动作风格具有强烈的姿态与动作特异性。
- 移除线性度正则 \(\mathcal{L}_{\text{lin}}\) 会导致整体风格感知发生非线性突变,FMD 从 0.531 恶化到 0.605,SRA 锐减超过一半;移除单调性正则 \(\mathcal{L}_{\text{mono}}\) 则使单调违背率反弹,且内容识别准确率由 0.70 跌至 0.56。
- 在超端点外推场景下(\(\alpha=2.0\)),本文在外推误差 ExtraErr 上达到 1.109,显著优于 MCM-LDM(1.174)与 DeepMotionEditing(1.196),证明所学习到的隐空间方向并非简单的过拟合插值直线,而是真正捕捉到了向极端情绪/姿态夸张演化的语义切线。
亮点与洞察¶
- 将主观抽象的“风格倍率”解耦为相对控制坐标轴,通过端点监督避免了对不存在的中间强度真值动捕数据的依赖,精准击中了动画生产流程的真实交互范式。
- 提出了基于风格特征差值投影的线性度与单调性双损失,以极其优雅轻量的几何约束,解决了扩散生成过程容易出现强度忽高忽低、逆向退化的核心顽疾。
- 建立了首个包含真实“过度反应(over-reaction)”动捕捕获的高强度外推评测基准,跳出了传统风格迁移仅测试已知端点复原的局限,为生成模型的泛化边界提供了实测标尺。
局限与展望¶
- 风格矢量的鲁棒性高度依赖于端点动捕配对的纯度与语义对齐质量;若端点本身存在严重的姿态不同步或噪声,提取的风格方向易发生偏移。
- 当强度滑块外推过大(例如 \(\alpha > 2.0\))时,生成动作在极端帧中偶发脚部滑移或局部关节抖动,缺乏显式生物力学动力学约束。
- 当前评测与训练主要基于双样本动作配对;未来可探索结合文本描述与跨动作非成对参考的通用多模态风格滑块设计。
相关工作与启发¶
- vs DeepMotionEditing (Aberman et al., 2020): 该方法主要基于解耦自编码器在无配对数据下进行离散风格迁移,完全没有连续强度显式调节接口,在插值时极易产生伪影,风格准确度(0.060)与外推能力显著落后。
- vs MCM-LDM (Song et al., 2024): MCM-LDM 展现了强大的单点风格生成与内容保真度,但在连续强度控制上缺乏显式方向优化与轨迹正则,滑块变化时常发生风格倒挂(单调违背率高达 0.11,用户感知单调率 0%);本文在牺牲少量内容得分的前提下换取了显著更高的风格可控性与平滑度。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 针对动作生成中缺乏连续相对强度控制的问题,提出端点监督风格滑动条与隐空间几何正则,思路清晰且极具实用价值。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖三大基准库与专门实捕的外推测试集,结合严密的客观指标、消融实验以及完备的用户双盲实验,论证极其扎实。
- 写作质量: ⭐⭐⭐⭐⭐ 动机立足工业痛点,问题形式化规范严密,数学符号与管线逻辑清晰连贯。
- 价值: ⭐⭐⭐⭐☆ 为数字人动画、游戏资产制作提供了直接可用的连续风格调节工具链,其隐空间方向外推理念对视频与动作生成均有很强启发。