ARMS: Anchor–Relational Motion Streaming for Seamless Solo-Social Motion Transitions¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5555
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/11382.pdf
项目: https://hkliu.com/arms/
领域: 人体动作生成 / 人际交互 / 因果扩散
关键词: 锚点关系表示、因果潜空间、分段去噪、模式门控、单人双人切换
一句话总结¶
ARMS 让一个人的轨迹持续向前生成、另一个人的位置相对前者表达,再用因果分段去噪与关系门控接入或退出交互,在不重启动作流的情况下将单人/交互切换的 PJ 从适配 InterMask 的 3.131 降至 0.077,但并非所有生成质量指标都领先。
研究背景与动机¶
文本动作生成已经能输出“走路”或“两人鞠躬”这样的短片段,但现实中的行为没有固定片段边界:一个人先独自行走,遇到另一个人后交谈或做动作,之后再分开。InterGen、InterMask 等方法主要针对固定双人配置;把前一个片段塞进下一个片段作为条件,并不自动保证角色位置、速度和交互关系能连续衔接。新提示词对应的动作可能很准确,连接处却突然跳到另一种站位。
表示方式使这一问题更尖锐。单人动作常在根节点附近描述姿态,通过逐帧位移累积得到长轨迹;两个角色各自累积时,误差会变成相对位置漂移。直接使用全局坐标能保留两人关系,却更依赖训练中出现过的坐标范围;对每一段重新规范化又容易引入边界跳变。因此,关键并不是简单加长生成窗口,而是让“个人持续运动”与“人际空间关系”以不同方式承担误差。
核心 idea:保留一个持续积分的锚点轨迹,让交互伙伴相对锚点定位,再通过因果潜空间中的关系门控和重叠去噪,把单人活动与双人互动变成同一条可持续延展的生成过程。
方法详解¶
整体框架¶
输入是逐步更新的文本指令、已经生成的动作历史和当前单人/双人配置,输出是接续历史的动作片段。ARMS 先用非对称动力学表示组织每个角色的状态,经共享因果编码形成潜变量,再用带关系门控的去噪器联合建模时间与人物关系;推理时以错开的去噪进度滚动前进,并在提示词变化时调整保留的历史长度。
这里的“因果”主要在潜变量片段之间成立:当前片段可以共同细化,不能读取未来片段。共享编码器也保证一个人的历史表征不需要未来帧,避免普通双向编码在流式生成时偷看尚未生成的动作。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["文本、历史与<br/>单人或双人配置"] --> Representation["非对称动力学表示"]
Representation --> Encoding["共享因果编码"]
Encoding --> Denoising["门控关系去噪"]
Denoising --> Streaming["重叠去噪与动态历史"]
Streaming --> Output["连续动作流"]
Output -->|保留历史并接收新指令| Streaming
关键设计¶
1. 非对称动力学表示:只让一个角色承担全局轨迹积分
两个角色使用相同的状态字段,但位置恢复方式不同。每帧包含根节点朝向的正弦/余弦、世界坐标水平面上的根速度与关系位移、根局部坐标中的关节位置和速度、非根关节的连续六维旋转,以及四个足部接触标记。朝向用正弦/余弦表示,避免角度跨越周期边界时发生数值突变;姿态局部化则让同一种动作不必在每个全局位置重新学习。
锚点角色 Anchor 的关系位移固定为零,其水平根位置由速度积分恢复;关系角色 Relational 在交互时记录相对锚点的水平位移,因此可由“锚点位置加关系位移”恢复自身水平位置,而不再独立积分出第二条全局轨迹。这样减少的是两条独立积分轨迹之间的相对漂移,并不意味着锚点绝对位置误差从此消失。字段相同、动力学职责不同,也使两分支可以共享网络参数。
单人模式直接使用关系位移为零的锚点状态,不必换一套生成器。进入交互时才激活关系角色,使它相对持续运动的锚点确定站位;这比突然要求模型生成一套全新的双人全局坐标更容易保持连续。但论文假设双方已处在训练数据覆盖的合理交互距离内,不解决远距离角色如何自动靠近的问题。
2. 共享因果编码:把单人与双人数据放进同一潜空间
ARMS 使用由一维因果卷积和残差块构成的时间变分自编码器。编码器输出高斯分布参数,经重参数化得到连续潜变量;解码器只依赖已有潜变量前缀恢复动作。时间下采样率为 4,潜变量维度为 64,因此 300 帧对应 75 个潜变量时间步,减少长窗口直接处理高维骨架的代价。
交互中的两个人分别经过同一个编码器,权重共享而时间编码独立。人物之间的关系不是由一个把双人拼成巨大向量的专用编码器硬编码进去,而是在状态中的关系位移和后续关系注意力里表达。HumanML3D 与 InterHuman 都被转换到这套共享状态,再按单人角色编码,使单人数据可以参与统一流式模型训练。评估前动作会转回各数据集原生表示,作者称该转换确定且可逆。
3. 门控关系去噪:让同时刻的两人同步细化,只读取当前及过去片段
将锚点与关系角色各自长度为 \(L\) 的潜变量流拼接后,沿每个角色的时间轴按 \(S\) 个潜变量划分片段。同一片段共享噪声水平,两个人在对应时间片段也使用相同噪声水平,避免一方已经定型、另一方仍高度随机。较早片段噪声更低,较晚片段仍保留修改余地;\(S=5\) 的默认配置意味着每个片段对应 20 帧,而非逐个潜变量孤立决定动作。
去噪器以 Transformer 同时处理这两条流。注意力是否可见由两个条件共同决定:键所在的时间片段不能晚于查询片段,并且人物连接必须被当前模式允许。交互模式允许跨人物读取当前和过去片段;单人模式只保留锚点到锚点的连接,关系角色不参与。为明确这里不是“每个 token 都严格只看前一个 token”,可将原文式 10 的规则写为:
其中 \(a\) 表示角色身份,\(s\) 表示各角色自身时间轴上的片段编号,\(\Gamma\) 是上述模式门控。不能按拼接后的位置直接做普通三角掩码,否则排在后面的关系流与前面的锚点流会得到错误的时间可见性。噪声水平通过 AdaLN 注入各层,RoPE 标记时间位置,冻结的 DistilBERT 提供文本 token,并通过每层交叉注意力控制动作语义;输出是用于流匹配的速度型残差,不是直接的一步姿态分类。
4. 重叠去噪与动态历史:连续输出,同时给新指令留出改变动作的空间
推理使用 \(K\) 次细化,相邻片段不是完全串行等待,而是错开 \(\delta\) 步开始去噪。默认 \(K=50\)、\(\delta=5\),所以前一个片段逐渐确定时,后续片段已经在较高噪声状态下参与细化。这一重叠日程与共享分段噪声共同减少片段各自生成后再硬连接的边界问题;它仍是迭代采样,不应只凭“streaming”就宣称满足某个实时帧率。
文本不变时保留完整上下文窗口 \(L=75\);文本变化时只保留较短历史 \(H\),同时替换未来片段的文本条件。全部丢掉历史会损失速度和姿态衔接,保留过多旧历史又会拖慢对新语义的适应。主文没有给出 \(H\) 的具体取值,精确推理流程指向补充材料,因此这里不补猜数值。
单人切换到交互时打开关系门控,关系分支可以从噪声初始化,也可以由已有动作提取相对动力学后编码初始化;主文默认从噪声开始。退出交互则屏蔽关系分支,锚点继续生成。该机制提供配置切换接口,但不是自动检测“何时应与谁互动”的规划器。
一个完整示例¶
考虑“独自行走→两人鞠躬→转身离开”的指令序列,这是对论文展示场景的流程说明,而非新增定量实验。行走阶段只使用锚点流,姿态和根速度不断接到已有历史之后;收到鞠躬指令时保留短历史,开启关系角色,以相对锚点的位移安排伙伴位置,两人对应片段同步去噪。
随后收到离开指令,系统不重新生成第一帧,而是在已有锚点姿态上关闭关系连接并继续单人动作。若伙伴一开始远在交互范围外,应先通过单人移动进入合理距离,再开启交互;不能把这一示例理解成任意位置都能直接无缝切换。
损失函数 / 训练策略¶
主文采用因果 VAE 和流匹配驱动的因果扩散生成,但未完整列出 VAE 损失权重或训练目标展开式,缓存的部分公式还有字符缺失,故不补造损失公式。已明确的配置为:去噪器 8 层、隐藏宽度 512、4 个注意力头;批大小 64,最长训练序列 300 帧,训练 500 epochs;AdamW 学习率 \(2\times10^{-4}\),betas 为 \((0.9,0.99)\),权重衰减 \(10^{-5}\)。
跨单人/双人场景的流式模型联合使用 HumanML3D 和 InterHuman;标准 InterHuman 交互比较则使用数据集专用模型,不能混为同一次评测。论文使用的 HumanML3D 变体含 26,846 条动作序列,InterHuman 含 7,779 条双人序列和 23,337 条描述;InterX 含 11,388 条动作序列、采用 SMPL-X 骨架。InterX 结果支持不同骨架表示上的适用性,但主文信息不足以把它称为无需训练的零样本跨骨架迁移。
实验关键数据¶
主实验¶
下表摘录原文表 1、2,保留报告的 95% 置信区间。R@Top3 是文本与动作检索的前三命中率,越高越好;FID 比较生成与真实动作的特征分布,MM Dist 是配对文本与动作的平均嵌入距离,二者越低越好。不同数据集的数值不可直接横比。
| 数据集 | 方法 | R@Top3 ↑ | FID ↓ | MM Dist ↓ |
|---|---|---|---|---|
| InterHuman | HINT | 0.672 ± 0.004 | 3.100 ± 0.035 | 3.796 ± 0.001 |
| InterHuman | TIMotion | 0.734 ± 0.006 | 4.702 ± 0.069 | 3.769 ± 0.001 |
| InterHuman | ARMS 全窗口 | 0.764 ± 0.004 | 4.436 ± 0.069 | 3.763 ± 0.002 |
| InterHuman | ARMS 流式 | 0.723 ± 0.005 | 4.444 ± 0.068 | 3.778 ± 0.001 |
| InterX | Interact2Ar | 0.737 ± 0.00 | 0.148 ± 0.01 | 3.581 ± 0.01 |
| InterX | HINT | 0.682 ± 0.003 | 0.278 ± 0.012 | 4.007 ± 0.016 |
| InterX | ARMS 流式 | 0.780 ± 0.003 | 0.279 ± 0.010 | 3.405 ± 0.016 |
ARMS 的 InterHuman 全窗口检索表现更强,但 FID 仍高于 HINT;InterX 流式的 R@Top3 和 MM Dist 较好,却没有超过 Interact2Ar 的 FID。原文“所有指标更优”的概括不符合表内数字,应按具体指标解读。
流式实验另构造 64 组、每组 8 段连续互动,以及 64 条“单人→互动→单人”序列。切换指标在边界中心的 2 秒窗口内计算:jerk 是加速度的时间导数,PJ 取所有关节上的瞬时 jerk 幅值峰值,AUJ 累积相对平均 jerk 的偏离。PJ 应接近真实动作,并非无限趋近零;AUJ 越低越好。下表为原文表 3 的均值,省略置信区间。
| 方法 | 单人↔互动 PJ | 单人↔互动 AUJ ↓ | 互动↔互动 PJ | 互动↔互动 AUJ ↓ | 互动子段 R@Top3 ↑ | 互动子段 FID ↓ |
|---|---|---|---|---|---|---|
| 真实动作 | 0.046 | 0.672 | 0.074 | 0.584 | 0.643 | 8.344 |
| InterMask Inpainting | 未报告 | 未报告 | 0.269 | 22.562 | 0.631 | 28.554 |
| InterMask Adapted | 3.131 | 7.444 | 0.265 | 22.440 | 0.557 | 32.307 |
| ARMS 流式 | 0.077 | 1.070 | 0.071 | 2.925 | 0.509 | 30.620 |
ARMS 显著减轻切换突变,但互动子段的语义检索不如两个 InterMask 版本。作者解释为连续运动需要逐步适应新动作,而基线更像为每条新提示重新起步;这支持“连续性与即时语义服从存在权衡”,不能写成无代价的全面提升。
消融实验¶
下表取原文表 4 均值。这里完整模型的 FID 为 4.446,不与表 1 的 4.444 强行统一;PJ 的真实动作参考值为 0.074,AUJ 为 0.584。
| 配置 | R@Top3 ↑ | FID ↓ | PJ,接近真实更好 | AUJ ↓ |
|---|---|---|---|---|
| ARMS 默认配置 | 0.723 | 4.446 | 0.071 | 2.925 |
| 改用 InterGen 表示 | 0.723 | 4.553 | 0.130 | 3.367 |
| 去除自回归生成 | 0.764 | 4.436 | 0.114 | 3.209 |
| 片段大小 S=1 | 0.674 | 6.832 | 0.131 | 3.353 |
| 片段大小 S=3 | 0.718 | 4.445 | 0.070 | 2.708 |
| 片段大小 S=10 | 0.729 | 4.600 | 0.082 | 2.980 |
| 采样步数 K=10 | 0.722 | 4.731 | 0.105 | 3.064 |
| 细化偏移 δ=50 | 0.662 | 8.645 | 0.065 | 3.068 |
关键发现¶
- 表示消融的主要证据是平滑性:InterGen 表示使 PJ 从 0.071 变成 0.130,AUJ 从 2.925 变成 3.367,而 R@Top3 均值相同,不能称为检索提升。
- 片段联合细化很重要:S=1 的 FID 为 6.832,明显差于默认配置;但 S=3 的 AUJ 2.708 优于默认 2.925,说明 S=5 不是各指标最优点。
- δ=50 的 PJ 数值更低,却离真实值并不更近,FID 还升到 8.645。只看最小 jerk 会错判生成质量。
亮点与洞察¶
- 将误差职责分开比单纯增加关系注意力更关键。只有锚点持续积分,伙伴以相对位置恢复,直接针对“双人各自漂移后对不齐”的结构性问题。
- 模式切换被落实为共享状态与注意力可见性的变化。它让单人数据和双人数据进入同一生成流程,而不是在两个专用模型之间切换。
- 动态历史提供了可迁移的条件更新思路。对于连续控制和分段生成,新条件到来时可保留足够的运动状态、减少旧语义约束,但保留长度仍需要验证。
局限与展望¶
- 作者明确指出,单人阶段不显式感知周围人物或场景,因此不能保证人群避碰、障碍规避或环境接触正确。
- 当前仅覆盖至多两人,且交互激活依赖合理距离。多人推广需要处理高阶关系及锚点选择,不能仅把两人关系复制多份就视为问题已解决。
- 硬模式门控在困难切换处仍可能突变;作者提出逐渐混合关系注意力作为后续方向,但未给出对应定量验证。
- 从实验角度看,流式基准是作者构造的,主要比较适配 InterMask,尚不足以确立所有流式方法中的普遍领先;较低 AUJ 也不等价于准确接触或无穿模。
- 主文缺少端到端延迟、吞吐量、显存与更长时程漂移曲线,也没有独立隔离模式门控和历史长度 H 的消融。实际部署前应补测这些风险。
相关工作与启发¶
- 对比 InterGen:全局表示便于约束双人空间关系,ARMS 则保留锚点增量轨迹并显式建模伙伴偏移。消融支持后者在切换平滑性上的作用,而不支持每项短片段指标都改善。
- 对比 InterMask:后者在离散 VQ 空间做掩码生成,ARMS 在连续因果潜空间滚动去噪。适配基线的子段语义可能更强,ARMS 的优势主要落在边界连续性。
- 对比 MotionStreamer 与因果动作扩散:ARMS 继承因果压缩和分段生成思路,新增贡献集中在单人/交互统一表示及模式感知关系建模,并非从头提出因果动作生成。
- 对比 HINT、Interact2Ar:这些方法已探索自回归交互,且部分 FID 更优。ARMS 更值得关注的是配置变化接口和对应切换评测,而不是把既有交互生成工作简单归为不能长时生成。
评分¶
以下为笔记作者的主观评价,满分 5 分,不是论文原有指标。
- 新颖性: 4/5。非对称状态和模式门控针对单人/双人切换形成清晰增量,基础因果扩散组件已有先例。
- 实验充分度: 3/5。包含双基准、切换实验和多项消融,但门控独立贡献、延迟和超长序列稳定性仍缺证据。
- 写作质量: 3/5。方法主线明确,不过“全部指标更优”等概括与表格不符,部分关键推理细节留在补充材料。
- 价值: 4/5。为需要不断进入和退出社交行为的虚拟角色提供实用建模方向,但尚不是带环境约束的完整控制系统。