跳转至

ComplexMimic: Human–Scene Interaction Imitation in Complex 3D Environments

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3457
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/1523.pdf
代码: https://github.com/LuPan23/ComplexMimic
领域: 机器人 / 人景交互 / 物理角色控制
关键词: 全身控制、双专家、难度感知蒸馏、可学习性筛选、运动捕捉

一句话总结

ComplexMimic 先分别训练严格跟踪动作的模仿专家与适应碰撞的交互专家,再按动作类型路由教师、优先学习仍能进步的困难轨迹,将能力蒸馏进单个控制器,使 TRUMANS 成功率达到 90.6%,但跨域姿态误差仍存在取舍。

研究背景与动机

运动捕捉提供的是人体关节如何运动,不保证对应轨迹能被一个有质量、有接触约束的仿真人体执行。场景一旦包含密集家具、狭窄通道和不规则网格,参考动作中的轻微穿透或位置误差就可能变成真实碰撞。以往无场景模仿或单物体交互中的优秀跟踪能力,因此不一定能迁移到复杂室内环境。这里的任务也不是从文字生成动作,而是在给定参考轨迹下闭环控制人体,尽可能保留动作意图并满足场景约束。

论文把这个困难具体定位到训练时的提前终止阈值:偏离参考动作就终止,能逼出精确跟踪,却会让策略尚未学会绕开障碍就结束回合;放宽阈值能增加探索与成功完成交互的机会,却允许动作逐渐失真。单纯调一个阈值无法同时提供两种监督,而把两个教师动作直接平均,也不保证得到既能避碰又像参考的有效动作。

本文于是先让两个教师各自形成专长,再决定每条动作应该向谁学。与此同时,不是失败次数越多的动作越值得训练:与场景严重冲突的参考可能长期不可行。核心 idea:把动作保真与场景可行性拆成两位专家,通过固定的动作级教师路由和随学生进步变化的困难样本采样,在在线物理交互中学习统一控制器。

方法详解

整体框架

输入是 MoCap 参考运动、当前仿真人体状态以及三维场景;输出是物理模拟器执行的控制动作,最终形成受动力学约束的人景交互序列。训练分为教师训练与学生训练两阶段,推理时使用单个学生,而不是让两个专家同时在线决策。

双流专家训练先提供两种能力:模仿专家在无场景网格环境中严格跟踪,交互专家在完整场景中利用局部高度图学习适应几何。进入蒸馏前,用模仿专家在有场景模拟器中逐条测试训练动作,建立教师路由;学生训练期间再根据失败历史与回报进步调整采样,结合教师分布监督和自己的 PPO 更新。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["参考动作与场景"] --> B["双流专家训练<br/>模仿专家 / 交互专家"]
    B --> C["动作级教师路由<br/>场景中评估模仿专家"]
    C --> D["难度与可学习性采样<br/>组间选择 / 组内挖掘"]
    D --> E["蒸馏与在线强化学习<br/>冻结教师 / 更新学生"]
    E -->|失败与回报反馈| D
    E --> F["单一学生控制器<br/>物理人景交互"]

关键设计

1. 双流专家训练:让精确跟踪和碰撞适应各自拥有可学习的环境

模仿专家使用无场景网格的物理模拟器,提前终止阈值取 \(\tau=0.25\);交互专家使用完整场景网格,阈值取 \(\tau=0.5\)。两者都依靠模仿奖励和 PPO 训练,差别在于场景约束、可见信息和允许的跟踪偏差。无场景不是取消物理模拟,而是移除复杂场景网格带来的干扰,让教师先学到高保真的动作控制;有场景教师则可以适度偏离参考,探索物理上可执行的动作。

交互专家额外观察以人体为中心、随朝向对齐的 \(20\times20\) 高度采样网格,相邻采样点间隔 8 cm。局部高度图帮助它理解附近几何,但真实碰撞仍由完整场景模拟器处理,不能把高度图等同于碰撞模型。两个专家均为隐藏层大小为 2048、1024、1024、512 的 MLP;因此这里的主要分工来自训练条件,不是两种不同的网络架构。

2. 动作级教师路由:只向适合该轨迹的教师请求监督

在蒸馏开始之前,作者让模仿专家进入有场景模拟器,评估全部训练动作。成功跟踪的动作归入跟踪友好组,失败的归入交互关键组;前者由模仿专家指导,后者交给交互专家。这个分组依据实际执行结果,不靠动作文字标签,也不是每个时间步临时选择教师。论文没有描述蒸馏期间重新划分这两个组。

学生仍观察自身状态与高度图,但监督来自所选教师在学生当前状态下的动作分布。模仿专家不接收高度图,交互专家接收高度图。这样的硬路由避免让学生在同一动作上反复接受不一致的教师目标,也避免把两个不同控制策略的动作平均后当成必然可行的中间解。路由只决定“跟谁学”,接下来的采样才决定“多久学一次”。

3. 难度与可学习性采样:困难动作优先,但长期停滞不能无限占用预算

每隔 \(K\) 次迭代,评估学生对各条动作的执行情况。如果某个时刻的平均关节距离超过 0.5 m,就将该动作记为失败。用指数移动平均维护难度,而不是让一次偶然失败立刻支配采样:

\[ D_k(m)=(1-\beta)D_{k-1}(m)+\beta f_k(m),\qquad f_k(m)\in\{0,1\}. \]

其中 \(m\) 是动作片段,\(k\) 是评估检查点,\(f_k\) 是失败指示量。先求每个教师组内的平均难度,用 softmax 分配组间概率,再在选中的组内用另一个 softmax 选择动作。这样可以同时处理“整类交互动作比普通跟踪更难”和“同一组内部有少数特别难的动作”,避免统一抽样主要重复已解决的轨迹。

但只看 \(D_k\) 会偏爱不可执行或噪声很大的动作。因此方法还维护回报增量 \(R_k(m)-R_{k-1}(m)\) 的移动平均 \(I_k(m)\),低于进步阈值就降权。下面依据正文语义整理采样关系;缓存中原式部分符号缺损,不能视为逐字核对后的公式抄录:

\[ \begin{aligned} s_k(m)&=D_k(m)-\lambda_u\max(0,\epsilon_u-I_k(m)),\\ p_k(m\mid c)&\propto\exp\!\left(\tau_{\mathrm{intra}}s_k(m)\right),\\ p_k(m)&=(1-\epsilon)p_k(c(m))p_k(m\mid c(m))+\frac{\epsilon}{|\mathcal M|}. \end{aligned} \]

这里 \(c(m)\) 是固定教师分组,\(\mathcal M\) 是训练动作集合。第一行等价于正文所述 \(s_k=D_k+\log u_k\) 的降权思路;最后一行的均匀混合保留了困难或暂时停滞动作被再次访问的机会。因此“可学习性筛选”实际是软降权,不是永久删样本,也不是从低回报直接判断一条动作永远不可学。

4. 蒸馏与在线强化学习:学生必须在自己造成的状态分布上修正行为

学生是四层 Transformer 编码器,4 个注意力头,隐藏维度 512,前馈层维度 2048。两位教师被冻结;学生在包含场景的模拟器中执行自己的动作,既接受教师监督,又利用环境回报做 PPO 更新。这样即使学生偏离教师访问过的状态,也能通过实际接触和失败信号继续调整,而不是只拟合静态教师数据。

策略被建模为高斯动作分布,蒸馏采用学生到所选教师的 KL 散度。以下是把原文式 (3) 的两个路由分支合并后的等价记法,不是新增损失:

\[ \mathcal L_{\mathrm{KD}}=\mathbb E_t\!\left[D_{\mathrm{KL}}\!\left(\pi_S(\cdot\mid s_t,hm_t)\,\|\,\pi_{T(m)}(\cdot\mid o_t^{T(m)})\right)\right]. \]

\(T(m)\) 为动作的固定教师,教师观测 \(o_t^{T(m)}\) 按专家类型包含或不包含高度图。这里的关键是分布监督与学生在线交互同时存在,而不是把 KL 当作奖励替代整个控制目标。缓存对 PPO 公式及联合目标的正负号抽取不完整,故不重写未经核实的总损失表达式;可以确认的是 PPO 改善环境回报,KL 约束学生不要丢掉教师专长。

一个完整示例

以一条需要从家具旁经过的参考动作为说明性例子,并非新增实验样本:无场景模仿专家先学会原轨迹,但放回完整网格后若平均关节偏差越过 0.5 m,就把该动作划给交互专家。学生随后在真实场景约束下执行,向能够利用高度图的交互教师学习,而不是机械复现可能穿过家具的轨迹。

如果学生反复失败,难度 EMA 会提高其训练机会;若回报仍持续改善,说明它可能正在学会绕障或恢复平衡,会继续被优先采样。相反,若参考与场景严重冲突、回报长期不再提高,可学习性项就降低其权重。这个过程中教师组不随失败历史切换,变化的是学生的采样概率,且 0.05 的均匀混合仍保留再次尝试的机会。

损失函数 / 训练策略

全部策略只在 TRUMANS 上训练:参考运动切成 121 帧片段,随机抽取 10% 作测试。LINGO 用于未见场景条件下的域外评估,GIMO 用于有重建噪声的真实扫描场景评估;后者仍是仿真执行,不是实体机器人实验。

实现使用单张 NVIDIA 4090 和 Isaac Gym,控制频率 30 Hz,模拟频率 60 Hz,采用平均 SMPL 体型。学生终止阈值固定为 0.5;critic 为隐藏层 1024、512 的 MLP。组间与组内 softmax 的缩放参数均为 1.0,均匀混合比例为 0.05,进步阈值 \(\epsilon_u=0.1\),惩罚强度 \(\lambda_u=1.0\)

正文报告失败和回报统计的 EMA 设置分别为 0.95、0.9,但未清晰说明它们与递推式中新样本权重的对应惯例,故不直接宣称 \(\beta=0.95\)。缓存仅包含正文与参考文献,不含补充材料;模仿奖励各项、评估间隔 \(K\)、完整训练预算及联合损失权重无法在此核实,不补造。

实验关键数据

主实验

Succ 是整段跟踪成功比例,越高越好;任一时刻平均关节距离超过 0.5 m 即失败。\(E_{g\text{-mpjpe}}\) 衡量全局关节位置误差,\(E_{\mathrm{mpjpe}}\) 衡量根节点相对误差;加速度和速度差分别以 mm/frame²、mm/frame 衡量。正文表头未明确标注两项位置误差的单位,本笔记保留原数值,不补填单位。所有比较基线都加了与本文同尺度的高度图。

下表从原表 1–3 选取 PHC、MaskedMimic 与完整模型,覆盖三种评估分布;没有把不同基线的最优指标拼成一个虚构模型。

数据集 方法 Succ ↑ 全局 MPJPE ↓ 根相对 MPJPE ↓ 加速度差 ↓ 速度差 ↓
TRUMANS PHC 0.853 85.793 65.365 13.559 12.055
TRUMANS MaskedMimic 0.872 120.260 105.099 26.913 24.717
TRUMANS ComplexMimic 0.906 77.840 64.128 12.931 10.721
LINGO PHC 0.615 120.472 84.782 23.648 20.383
LINGO MaskedMimic 0.719 163.525 132.315 38.387 36.499
LINGO ComplexMimic 0.746 124.665 90.575 20.641 17.303
GIMO PHC 0.443 173.580 109.696 47.151 38.556
GIMO MaskedMimic 0.405 286.629 191.210 69.821 68.460
GIMO ComplexMimic 0.579 161.969 104.590 36.845 29.749

TRUMANS 上相对 MaskedMimic 的成功率提升是 3.4 个百分点,相对增幅约 3.90%;相对 PHC 的全局误差下降按表中数值计算约 9.27%。引言写的 9.36% 与表中 85.793 → 77.840 不一致,本笔记采用可复算的表格结果,并明确两项提升使用不同基线。

消融实验

原表 4 的 TRUMANS 消融如下。保留局部误差与加速度差,是为了避免把“整体表现较好”误写成每个指标都占优。

配置 Succ ↑ 全局 MPJPE ↓ 根相对 MPJPE ↓ 加速度差 ↓ 速度差 ↓
去掉模仿专家 0.876 86.059 64.487 13.170 11.477
去掉交互专家 0.847 82.489 62.464 12.565 11.416
去掉组间采样 0.899 82.045 62.816 12.779 10.918
去掉组内优先级 0.898 80.735 61.016 13.349 11.248
去掉可学习性筛选 0.877 88.497 67.465 14.231 11.876
去掉 PPO 0.830 110.880 79.460 18.788 16.475
随机教师路由 0.874 83.016 63.715 12.625 10.945
教师动作平均 0.873 83.698 64.075 12.712 11.030
完整模型 0.906 77.840 64.128 12.931 10.721

关键发现

  • 在线 PPO 的作用最大:去掉后成功率下降 7.6 个百分点,全局误差由 77.840 升到 110.880,说明仅靠教师蒸馏不足以处理学生自己的状态分布。
  • 去掉交互专家,成功率下降 5.9 个百分点;去掉模仿专家,全局误差升到 86.059。两种监督确有互补性,但去掉交互专家反而改善部分局部误差指标,取舍没有完全消失。
  • 去掉可学习性筛选,成功率下降 2.9 个百分点,全局误差升到 88.497;难例挖掘必须结合是否仍有学习进展,而非只看失败率。
  • 完整模型在 LINGO 的成功率优于 PHC,但两种位置误差都更高。GIMO 的最强外部成功率基线其实是 AMP 的 0.446,本文 0.579 比它高 13.3 个百分点;这不是超过所有配置的所有指标。
  • 原表中的无 DAS 版本在 TRUMANS 加速度差为 12.759,优于完整模型 12.931;在 GIMO 根相对误差为 102.009,也优于完整模型 104.590。主张应限定为较好的综合折中。

亮点与洞察

  • 将终止阈值造成的行为偏好变成教师分工,比直接搜索一个折中阈值更有解释性。场景约束改变的不只是输入特征,也改变哪些动作能够在训练中被探索到。
  • 教师路由与课程采样分开处理:前者解决监督冲突,后者解决训练预算错配。这样的分离适合具有不同可行性条件的多教师控制任务。
  • “难且可学”用失败 EMA 和回报增量共同定义,不需要人工标注难度。均匀混合又避免了早期误判导致某些动作永久退出训练。

局限与展望

  • 作者没有独立的局限性章节;以下主要是依据实验边界的分析。真实扫描场景评估仍在模拟器中完成,没有实体机器人部署,也固定平均 SMPL 体型,不能直接推出跨体型或真实硬件鲁棒性。
  • TRUMANS 采用片段级随机 10% 留出,正文没有证明同源长序列或同场景被严格隔离。域内结果不应直接解释为未见场景泛化,跨域证据主要来自 LINGO 与 GIMO。
  • 成功率只检查平均关节偏差阈值,不等于独立的无碰撞率、接触正确率或任务语义完成率;误差统计是否仅基于成功片段也未在正文中说明。可进一步报告接触力、穿透深度和分场景失败类型。
  • 回报停滞可能意味着不可行动作,也可能只是需要更长探索。软降权和均匀混合只能缓解误判,可以考虑更长窗口、置信度或显式参考轨迹修复,但这些不是已验证结果。
  • 缓存缺少补充材料、重复运行方差及完整算力时间信息,难以评估采样策略的实际成本收益。高度图对复杂三维遮挡结构的表达能力也值得单独检验。

相关工作与启发

  • 与 DeepMimic、AMP 相比:前者用参考奖励学习物理动作,后者引入对抗运动先验;ComplexMimic 的重点是参考保真和复杂场景约束的冲突,并不以新的通用运动先验为贡献。
  • 与 PHC、MaskedMimic 相比:两者提供强跟踪或灵活全身控制基础。本文通过不同训练条件形成互补教师,再蒸馏成单个学生;实验为所有基线补充高度图,因此优势不能简单归因于只有本文看到了场景。
  • 与 LINGO、TRUMANS 的运动生成相比:这里把数据中的运动作为模仿参考,关注闭环物理执行,而不是替代文本到动作生成器。两类方法可以作为上游生成与下游执行连接,但本研究未量化这种组合。
  • 与 UNIHSI、TokenHSI 相比:它们关注接触链或任务表示驱动的交互控制;本文强调给定参考轨迹下的忠实复现。可借鉴之处是把可行性差异显式引入监督分配,而非增加一个泛化动作平均器。

评分

  • 新颖性: 4/5。双流训练、动作级路由与可学习性采样形成针对性组合,但 PPO、KL 蒸馏和困难样本采样本身并非新工具。
  • 实验充分度: 4/5。三个数据集、四个外部基线和多项消融支撑核心主张,仍缺少方差、训练成本及真实部署证据。
  • 写作质量: 3/5。动机与模块关系清楚,但“所有指标最优”等概括和部分提升数字需要对照表格修正。
  • 价值: 4/5。为噪声参考与复杂场景共同约束下的物理模仿提供可迁移训练思路,应用边界仍限于已验证的仿真设置。