Training-free Controllable Motion Generation under Heterogeneous Constraints¶
会议: ECCV 2026
论文: ECCV 原文
领域: 人体理解
关键词: 运动生成, 可控扩散模型, 免训练控制, 随机最优控制, 异构约束协调
一句话总结¶
本文提出免训练可控运动生成框架 MIC(Motion-Inference-as-Control),将扩散去噪过程重构为随机最优控制系统,首次在统一控制接口下同时支持无解析梯度的规则判定型约束与可微目标型约束,并通过闭环反馈调节与时空控制分配消除多约束间的失衡与干扰。
研究背景与动机¶
基于文本的人体运动生成在虚拟现实、游戏角色动画以及人形机器人全身体态控制等场景中具有广阔的应用价值。真实世界的复杂交互任务往往需要生成的运动严格遵守各类环境限制与物理可行性约束。传统可控运动生成方法多依赖针对特定任务或约束的定制化重训练与微调,一旦下游任务的约束类型或场景几何发生变动,模型往往需要重新训练,泛化性与实用性受到严重制约。因此,直接利用预训练运动扩散模型(MDM)在推理阶段引入外部条件引导的免训练(training-free)可控生成逐渐成为主流探索方向。
然而,真实世界中的运动约束在数学性质与时空尺度上呈现出高度的异构性(heterogeneity)。一方面,部分约束是连续目标驱动的(continuous objective-based),如到达特定空间坐标或维持固定位移速度,可天然表述为平滑可微的损失函数;但更广泛的实际需求往往是准则规则驱动的(criterion-based),例如安全区域进出阈值规则、接触碰撞检测、足底滑动惩罚以及外部物理仿真引擎(如 MuJoCo)的有效性校验。这类准则型反馈本质上是不连续、稀疏甚至黑盒的,无法提供解析梯度,导致现有重度依赖梯度反传的免训练运动引导算法(如 ProgMoGen、DNO)无法直接处理或只能借助失真的连续代理损失。此外,当单一动作序列同时施加多个异构约束时,强弱信号悬殊容易造成强约束主导弱约束,而局部关节点约束与全局轨迹约束在时空覆盖范围上的错位更会引发严重的跨通道干扰,导致动作僵硬失真或关节剧烈抖动。
针对非可微准则与可微目标共存、多约束时空冲突与信号失衡这两大核心瓶颈,本文跳出了单纯依靠启发式梯度修饰的传统思路,将扩散去噪的多步动力学映射为随机动态系统的演化过程。核心 idea:将免训练扩散运动生成重构为随机最优控制问题,利用 Hamilton-Jacobi-Bellman(HJB)方程与 Stein 引理推导出仅依赖前向评估的无梯度期望控制律,与连续梯度引导统一在同一控制接口下,并结合闭环积分反馈与加权最小二乘时空分配器自适应平衡异构约束。
方法详解¶
整体框架¶
MIC(Motion-Inference-as-Control)的核心思想是将扩散去噪反向随机微分方程(SDE)视为由外部控制输入驱动的受控随机动力学系统。在从纯噪声向真实人体姿态序列去噪的每一步中,目标是寻找能够最小化终端约束违背代价、同时对原始运动先验产生最小扰动的步级最优控制律。随后,针对提取出的多路异构约束控制信号,通过由反馈调节器与控制分配器构成的双层协调机制,计算出全局一致且时空解耦的最终合成控制量,直接注入扩散模型的漂移项以引导去噪轨迹。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:文本提示词 + 异构约束集合<br/>准则型规则/仿真与连续目标"] --> B["统一随机最优控制律<br/>期望路径积分与解析梯度双轨并进"]
B --> C["步级控制实例化<br/>交叉熵重要性采样与Tweedie估计"]
C --> D["双层约束协调机制<br/>积分反馈调节与时空加权最小二乘分配"]
D --> E["受控扩散步级去噪更新<br/>兼顾约束满足与无损运动先验自然度"]
关键设计¶
1. 统一随机最优控制律:免梯度前向评估与连续梯度的理论并轨 针对准则型约束缺乏解析梯度且难以与连续目标型约束协同优化的矛盾,MIC 将扩散模型的逆向去噪方程定义为前向时间下的状态演化系统: $$ \mathrm{d}\mathbf{z}t = \mathbf{b}(\mathbf{z}_t, t)\mathrm{d}t + \sigma(t)\big(\mathbf{u}_t(\mathbf{z}_t, t)\mathrm{d}t + \mathrm{d}\mathbf{\varepsilon}_t\big) $$ 其中状态 \(\mathbf{z}_t = \mathbf{x}_{T-t}\),控制量 \(\mathbf{u}_t\) 代表对去噪方向的引导偏移。最优控制旨在最小化由终端约束违背项 \(\mathcal{E}(\mathbf{z}_T)\) 与控制能量惩罚项组成的累积期望代价。借助 HJB 方程与 Feynman-Kac 公式,理论上的最优控制律可表示为价值函数(Desirability Function)的对数梯度。针对黑盒或离散的准则型约束,本文利用扩散高斯增量的结构特性,通过 Stein 引理与鞅论中的全概率塔式法则,将该对数梯度精确重写为以终端违背惩罚指数为权重的噪声扰动条件期望: $$ \mathbf{u}^*_t(\mathbf{z}_t, t)\mathrm{d}t = \frac{\mathbb{E}}^0}\big[\exp(-\mathcal{E}(\mathbf{zT))\,\mathrm{d}\mathbf{\varepsilon}_t \mid \mathbf{z}_t\big]}{\mathbb{E} $$ 该公式构成了路径积分控制形式,其显著特性在于计算仅需对最终生成姿态进行前向黑盒验证与评分评估,完全规避了对约束函数求导的依赖。而在连续可微目标型约束下,该控制律退化为扩散后验采样(DPS)式的解析梯度形式 }^0}\big[\exp(-\mathcal{E}(\mathbf{z}_T)) \mid \mathbf{z}_t\big]\(\sigma(t)\nabla_{\mathbf{z}_t}\log p_t(\mathbf{d}\mid\mathbf{z}_t)\)。两种截然不同的约束类型由此被统一整合进同一控制接口中。
2. 步级控制实例化:交叉熵重要性采样与 Tweedie 干净运动预测 由于上述期望控制律在无受控扩散动力学先验 \(\mathcal{P}^0\) 下无法求得闭式解,MIC 引入了基于重要性采样的高效步级估计策略。在每个去噪时间步 \(t\),算法利用 Tweedie 公式从当前带噪状态 \(\mathbf{z}_t\) 一步外推预测干净运动序列 \(\hat{\mathbf{z}}_T\),使原本只能在扩散终点评估的终端代价得以在每一步提前求值。为了高效逼近加权噪声期望,MIC 从提议高斯分布 \(q = \mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Sigma})\) 中抽取 \(M=16\) 组噪声增量,并依据其引发的终端代价评估计算重要性权重。进一步地,为了解决高维运动空间下随机采样命中低代价轨迹概率过低的难题,MIC 引入了交叉熵优化方法(Cross-Entropy Method, CEM):在每一步依据样本重要性权重筛选出前 20% 的精英样本(elite samples),实时拟合并更新提议分布的均值与方差。这种自适应更新使提议分布迅速向满足物理准则的低违背区域聚集,显著降低了估计方差并提升了引导的精准度。
3. 双层约束协调机制:闭环积分反馈调节与时空控制分配 当人体动作需同时满足多个异构条件(例如特定关节点空间轨迹、全局防碰撞边界以及足底防滑准则)时,简单的加权求和极易引发强弱失衡与通道串扰。为此,MIC 借鉴控制系统理论,设计了包含反馈调节器与控制分配器的双层协调机制。首先,反馈调节器将各约束的动态加权视为闭环控制量。在去噪步 \(t\),基于 Tweedie 预测姿态计算出第 \(k\) 个约束的当前归一化违背量 \(c_{k,t}\),并采用离散积分控制律迭代更新其权重: $$ W_{k,t+1} = \Pi_{[0, W_{\max}]}(W_{k,t} + \gamma\,c_{k,t}) $$ 如果某项约束持续未被满足,其权重将以积分形式线性累加施加更大纠偏力度;一旦约束违背消除(\(c_{k,t}=0\)),其权重立即停止增长,避免过度压制其他约束。其次,控制分配器(Control Allocator)将人体骨骼动作序列按时空网格视为多路控制通道,利用对角掩码矩阵 \(\mathbf{M}_k\) 显式标记第 \(k\) 项约束所作用的特定关节与时间帧区间。最终的全局合成控制量 \(\mathbf{u}_t\) 通过求解带能量惩罚的加权最小二乘二次规划问题获得闭式解: $$ \mathbf{u}t = \left(\sum}^K W_{k,t}^2 \mathbf{Mk^\top \mathbf{M}_k + \lambda \mathbf{I}\right)^{-1} \sum}^K W_{k,t}^2 \mathbf{Mk^\top \mathbf{M}_k \mathbf{u} $$ 该闭式解可在毫秒级内完成计算,既能保证强约束在其专属作用域内充分生效,又能有效隔绝局部调节对其他关节点全局先验的负面干扰。
实验关键数据¶
主实验¶
实验基于开源 HumanML3D 数据集与预训练扩散骨干 MDM(配合 DDIM 采样器),在覆盖人-场景交互(HSI)、几何约束(GEO)及人-物交互(HOI)的代表性基准上与主流梯度类免训练方法进行了系统对比。评估指标包括滑动率(Skating)、最大关节加速度(Max Acc.)、约束误差(C.Err.)、约束失败率(Unsucc. Rate)以及基于 MuJoCo 刚体物理引擎的仿真通过率(Pass)。
表 1:开放集约束场景下的定量对比结果(源自原论文 Table 1,MDM 骨干)
| 任务 | 方法 | 滑动率 (Skating)↓ | 最大加速度 (Max Acc.)↓ | 约束误差 (C.Err.)↓ | 失败率 (Unsucc. Rate)↓ | 物理仿真通过率 (Pass)↑ |
|---|---|---|---|---|---|---|
| HSI-2 (障碍避让) | MDM (无约束基线) | 0.096 | 0.126 | 0.454 | 1.000 | 0.000 |
| DNO (CVPR 2024) | 0.196 | 0.162 | 0.051 | 0.375 | 0.531 | |
| ProgMoGen (CVPR 2024) | 0.180 | 0.150 | 0.097 | 0.219 | 0.563 | |
| ReAlign (AAAI 2026) | 0.245 | 0.155 | 0.067 | 0.250 | 0.469 | |
| MIC (本文方法) | 0.172 | 0.140 | 0.009 | 0.094 | 0.875 | |
| HSI-3 (限区行走) | ProgMoGen (CVPR 2024) | 0.125 | 0.093 | 0.012 | 0.344 | 0.594 |
| MIC (本文方法) | 0.112 | 0.089 | 0.004 | 0.250 | 0.719 | |
| GEO-1 (触碰墙面) | ProgMoGen (CVPR 2024) | 0.110 | 0.104 | 0.023 | 0.531 | 0.406 |
| MIC (本文方法) | 0.102 | 0.088 | 0.008 | 0.094 | 0.781 | |
| HOI-1 (物体搬运) | ProgMoGen (CVPR 2024) | 0.109 | 0.067 | 0.028 | 0.188 | 0.750 |
| MIC (本文方法) | 0.036 | 0.062 | 0.004 | 0.031 | 0.938 |
表 2:已知约束(HSI-1 头部高度控制)与文本生成保真度对比(源自原论文 Table 2)
| 方法 | 滑动率↓ | 最大加速度↓ | 约束误差↓ | 失败率↓ | 物理通过率↑ | FID↓ | 多样性 (Diversity)→ | R-Precision (Top3)↑ |
|---|---|---|---|---|---|---|---|---|
| MDM (无约束) | 0.086 | 0.097 | 0.118 | 0.718 | 0.193 | 0.545 | 9.656 | 0.610 |
| ProgMoGen | 0.075 | 0.094 | 0.012 | 0.088 | 0.776 | 0.556 | 9.611 | 0.597 |
| ReAlign | 0.096 | 0.104 | 0.024 | 0.189 | 0.757 | 0.619 | 9.433 | 0.635 |
| MIC (本文方法) | 0.074 | 0.093 | 0.009 | 0.068 | 0.857 | 0.494 | 9.656 | 0.635 |
消融实验¶
表 3:准则型约束不同处理机制在 HSI-2 任务上的消融分析(源自原论文 Table 3 与 Table 5)
| 实验组别 | 核心配置说明 | 滑动率↓ | 最大加速度↓ | 约束误差↓ | 失败率↓ | 物理通过率↑ |
|---|---|---|---|---|---|---|
| 基线 A | 连续替代损失 + 梯度引导 (Surrogate + Gradient) | 0.180 | 0.152 | 0.097 | 0.219 | 0.594 |
| 基线 B | 零阶优化梯度估计 (Zeroth-order Optimization) | 0.242 | 0.267 | 0.205 | 0.281 | 0.594 |
| 基线 C | 强化学习策略梯度拟合 (Reinforcement Learning) | 0.274 | 0.243 | 0.231 | 0.250 | 0.625 |
| 基线 D | 演化策略黑盒搜索 (Evolution Strategies) | 0.208 | 0.238 | 0.147 | 0.219 | 0.625 |
| 去除调节器 | 仅采用控制分配,固定约束权重 (w/o regulation) | 0.208 | 0.143 | 0.014 | 0.125 | 0.813 |
| 去除分配器 | 仅采用反馈调节,全局均匀施加 (w/o allocation) | 0.189 | 0.142 | 0.048 | 0.125 | 0.750 |
| 去除协调机制 | 简单平均各约束控制信号 (w/o coordination) | 0.220 | 0.146 | 0.054 | 0.156 | 0.688 |
| MIC (完整模型) | 期望路径积分控制 + 积分调节 + 空间分配 | 0.172 | 0.140 | 0.009 | 0.094 | 0.875 |
关键发现¶
- 准则型控制律的断层优势:在 HSI-2 障碍避让与 HOI-1 物体搬运任务中,采用期望路径积分控制律的 MIC 将未成功率分别压低至 0.094 与 0.031,相比前序 SOTA 方法 ProgMoGen(分别为 0.219 与 0.188)提升超过 50% 以上。这证实了用人工平滑代理函数近似离散逻辑规则会造成不可逆的引导偏差,而基于前向评估的控制律能够直接贴合离散准则。
- 物理真实度与生成质量的双赢:在物理仿真检测通过率(Pass)上,MIC 在 HSI-2 达到 0.875(对比 ProgMoGen 的 0.563)、HOI-1 达到 0.938(对比 0.750)。同时在 HSI-1 上取得了更低的 FID(0.494 vs 0.556),说明最优控制中加入控制能量惩罚 \(\lambda \|\mathbf{u}\|^2\) 能严格防止过度纠偏破坏预训练模型的先验流形。
- 协调机制各模块缺一不可:消融实验显示,如果去掉积分反馈调节器(w/o regulation),强弱约束失衡导致失败率上升至 0.125;若去掉时空分配器(w/o allocation),局部关节点纠偏蔓延至全躯干,约束误差由 0.009 飙升至 0.048;若两者皆抛弃,物理通过率从 87.5% 暴跌至 68.8%。
亮点与洞察¶
- 将扩散逆向采样严密映射为受控随机动力学:传统方法将测试时引导视为启发式经验工程,而本文从随机控制理论出发,利用 HJB 方程和 Stein 引理直接化解了离散非可微准则无法反传梯度的根本难题,给出了严格的数学收敛保证。
- 交叉熵提议更新实现低方差蒙特卡洛外推:通过在扩散中间步结合 Tweedie 干净动作估计与 CEM 局部自适应更新,以仅 16 个前向评估样本就在高维人体动作空间内实现了高精度期望估计,使免梯度控制具备了工程落地的极高效率。
- 可复用的通用即插即用控制接口:所提出的双层约束协调机制(反馈积分自适应调节 + 掩码空间分配二次规划)高度抽象且通用,不仅能无缝移植到视频生成、机械臂轨迹规划等其他扩散任务,更可以即插即用地与任何外部非可微物理仿真引擎或大模型裁判器联动。
局限与展望¶
- 采样计算开销随蒙特卡洛步级采样增加:由于每一步需要抽取 \(M=16\) 组样本并进行前向准则评估,尽管无需反向反传梯度,整体推理耗时仍显著高于常规单步无约束去噪,未来可探索提议分布的时序记忆缓存或轻量代理判别器加速。
- 超强冲突物理约束下的可行域坍缩:当多个约束在物理世界中存在互斥关系(例如极低的天花板与必须完成的大跳动作)时,受控系统可能会陷入局部极小值导致动作停滞,引入高层全局运动路径规划器或可行性提前剪枝将是有价值的发展方向。
相关工作与启发¶
- vs ProgMoGen (CVPR 2024):ProgMoGen 依赖预先设计的可微损失函数或利用可微网络近似几何关系,在面对安全阈值、仿真碰壁等离散逻辑判定时必须构建平滑代理,极易导致目标偏移;MIC 则基于随机控制期望律,直接支持前向黑盒评估与规则调用。
- vs DNO (CVPR 2024) / ReAlign (AAAI 2026):DNO 通过直接优化初始潜空间噪声实现控制,计算成本高且不易兼顾细粒度时空约束;ReAlign 引入奖励引导但依旧以显式梯度流为主。MIC 在去噪动力学中施加受控漂移扰动,并通过加权最小二乘显式解耦关节通道,在多约束同时施加时展现出压倒性的稳定性。
- vs PhysDiff (ICCV 2023) / CLoSD (ICLR 2025):物理驱动方法通常需要构建显式仿真物理投影或复杂训练回路,而 MIC 完全免训练,直接将外部物理引擎作为黑盒评估器无缝接入前向终端代价,为物理可信动作生成提供了更轻巧实用的新范式。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [将扩散生成严格重构为随机最优控制系统,首次实现免训练下无梯度准则与有梯度目标的统一数学建模]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖多种复杂人-场景、人-物及几何异构交互任务,指标涵盖约束满足、生成多样性及真实物理仿真引擎通过率]
- 写作质量: ⭐⭐⭐⭐⭐ [数学推导严谨自洽,控制理论概念阐释清晰透彻,图表呈现与消融分析逻辑周密]
- 价值: ⭐⭐⭐⭐⭐ [彻底突破了免训练扩散引导依赖可微损失的传统瓶颈,为具身智能与交互式动画生成提供了通用的控制基础设施]