跳转至

InterCMDM: Block-Causal Diffusion for Autoregressive Human Interaction Generation

会议: ECCV 2026
论文: ECCV 2026
领域: 人体理解
关键词: 双人交互动作生成 / 块因果扩散模型 / 自回归长序列 / 双流注意力 / 多任务掩码

一句话总结

提出基于块因果潜扩散的双人交互自回归生成框架 InterCMDM,通过双流因果 DiT、多任务块注意力掩码以及纯潜空间分块 Rollout,在无需真值动作前缀的前提下实现了高逼真度、强语义对齐且支持零样本控制交互模式的长时交互动作合成。

研究背景与动机

基于自然语言指令驱动的双手及全身双人交互动作生成,是智能数字人、具身协作和虚拟现实领域的核心技术。与单人人体运动生成相比,双人交互不仅要求个体内部在时序上维持长程平滑与动力学自洽,更要求双方在微秒级时间尺度上实现精确的空间相对朝向、肢体接触点与反应协调。微小的时序异步或姿态预测偏差会在交互时间线上被迅速放大,引发诸如身体穿透、虚空抓握、滑步以及角色动作不同步等严重的协调性漂移。

现有的双人交互生成方法主要受困于两种生成范式的固有缺陷。绝大多数主流交互扩散模型(如 InterGen、TIMotion)采用全序列双向自注意力机制进行全局去噪,其计算本质上严重依赖“未来时序上下文”,不仅破坏了运动演化的物理因果性,而且无法直接应用于流式在线交互,在拓展至超长序列时面临显存爆炸与分段拼接断裂的难题。另一方面,少部分自回归生成模型虽强加了严格的时间因果依赖,但通常直接在原始运动姿态空间中按单帧进行自回归迭代,缺乏全局协调约束,导致多步预测误差迅速累积产生漂移;部分方法甚至严重依赖数帧真值(Ground-Truth Prefix)作为热启动,限制了纯文本驱动的自主生成能力。

本文的切入视角在于:双人交互在本质上是由两个具备内在因果演化规律、但通过动态注意力机制频繁耦合的独立时序流所构成的。因此,既不能将两人简单拼成单一序列抹杀个体独立性,也不能完全依赖双向全局去噪忽略因果流向。核心 idea:将单人因果扩散机制拓展至双人交互领域,构建具备独立时序因果流的双流扩散 Transformer(DS-Causal-DiT),配合覆盖同步、反应、领从和独立的多任务块注意力掩码,在块级别潜空间中实现兼具块内并行去噪与跨块因果外推的稳定自回归交互动作生成。

方法详解

整体框架

InterCMDM 的端到端交互生成流程由三个核心构件紧密协同运转:时间运动变分自编码器(Temporal Motion VAE)、双流因果扩散 Transformer(DS-Causal-DiT)以及分块扩散去噪优化机制。

首先,两个交互者各自的运动序列 \(x^{(1)}, x^{(2)} \in \mathbb{R}^{T \times D}\) 经由参数共享的一维因果卷积时序 VAE 独立下采样 4 倍,压缩为局部动作视窗对齐的紧凑隐变量序列 \(z^{(1)}, z^{(2)} \in \mathbb{R}^{T' \times d_z}\)(每个潜变量 token 对应 4 帧动作,\(T'=T/4\))。随后,隐空间序列被划分为若干包含 \(B\) 个 token(即 \(4 \times B\) 帧)的不重叠时序块(Block)。在去噪过程中,DS-Causal-DiT 接收带有独立时序块噪声尺度的双人潜变量,在每层网络中分别对 Person 1 与 Person 2 维持平行的因果状态流,并通过统一的双流多任务注意力掩码注入跨人交互依赖与文本条件。在推断阶段,模型从纯高斯噪声初始化首块,以自回归方式逐块进行潜变量 Rollout 去噪,最终经因果 VAE 解码器重构出无缝连接的超长交互动作。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:文本描述 + 初始双人潜块噪声"] --> B["DS-Causal-DiT 与统一双流注意力<br/>解耦双人独立因果流并在拼接序列做联合注意力"]
    B --> C["多任务分块注意力掩码<br/>按同步/反应/领从/独立结构施加时序块注意力约束"]
    C --> D["分块扩散目标与纯潜空间 Rollout<br/>块内独立加噪并行去噪 + 跨块严格因果自回归外推"]
    D --> E["输出:因果 VAE 解码长时连贯双人交互动作"]

关键设计

1. DS-Causal-DiT 与统一双流注意力:解耦因果流与联合交互建模

以往交互扩散模型要么将两个人的姿态特征直接在通道或特征维度拼成单流,导致模型难以区分各自的个体动力学特征;要么设计完全隔离的自注意力与交叉注意力网络模块,显著增加了参数量与推理开销。针对这一缺陷,DS-Causal-DiT 确立了“独立表征演化、联合算子交互”的双流架构准则。网络堆叠 \(L\) 层双流块,在每一层中,Person 1 和 Person 2 拥有独立的线性投影层分别提取 Query、Key 和 Value,保留两人各自独特的运动属性与角色非对称性。随后,两人的特征 token 在序列维度完成拼接,通过一个统一的注意力核心算子完成信息交换,再经过各自独立的文本交叉注意力与前馈神经网络更新状态。该设计不仅严格保障了个体内部因序不乱,同时以极高计算效率显式捕捉了双人之间的动态互应。

2. 多任务分块注意力掩码:多模式交互监督与推断期零样本可控切换

真实物理世界中人类双人交互的协调模式呈现出高度的异构性与多样性,涵盖并行动作、受激反应、领舞跟随以及各自独立走动等多种信息流向,若仅用单一因果掩码训练,模型极易退化或对特定非对称动作欠拟合。InterCMDM 提出了多任务分块注意力掩码机制,将整个交互注意力矩阵划分为四个相互正交且覆盖典型交互范式的注意力配置: 1. 同步掩码(Simultaneous):两人在当前块均只能因果性地查看自身及对方当前块与过去所有块的信息,注意力完全对称流动; 2. 反应掩码(Reactive):Person 2 需在 Person 1 的动作块完全结束生成后,方能感知并产生动作响应,模拟受击、避让等延迟交互; 3. 领从掩码(Leader-Follower):跟随者以设定的时间步长滞后感知主导者的动作状态,用于模拟伴舞、尾随等主从动力学; 4. 独立掩码(Independent):彻底断开双流间的跨人注意力,仅保留个体内部因果自注意。

在训练阶段,模型按照经验分布(60% 同步、20% 反应、10% 领从、10% 独立)对四类掩码进行随机采样,实质上构成了一种强大的交互结构数据增强策略,促使单一模型学会泛化全谱系的交互依赖。在推断阶段,用户仅需显式指定掩码类型,即可实现零样本、免微调的精细交互行为模式控制。

3. 分块扩散目标与纯潜空间自回归 Rollout:兼顾块内并行与长序列无漂移外推

传统的全序列扩散模型无法因果生成,而逐帧自回归生成又会因步长过小而累积极大的单步复合误差。InterCMDM 借鉴扩散强迫思想,将连续运动序列离散为 \(N_B = T' / B\) 个非重叠的时间块,并将扩散时间步 \(k_b \in [0, K]\) 解耦至块级别,每个时序块拥有独立的加噪与去噪时间步:

\[z_{k_b}^{(i,b)} = \sqrt{\bar{\alpha}_{k_b}} z_0^{(i,b)} + \sqrt{1 - \bar{\alpha}_{k_b}} \boldsymbol{\epsilon}^{(i,b)}, \quad \boldsymbol{\epsilon}^{(i,b)} \sim \mathcal{N}(0, \mathbf{I})\]

训练损失定义为在给定当前及所有历史块条件下,联合预测两人噪声残差的期望:

\[\mathcal{L}_{\text{train}} = \mathbb{E}_{\mathbf{k}, \boldsymbol{\epsilon}} \left[ \sum_{b=1}^{N_B} \sum_{i=1}^2 \left\| \boldsymbol{\epsilon}^{(i,b)} - \mu_\theta^{(i)} \left( \mathbf{z}_{\mathbf{k},\le b}^{(1)}, \mathbf{z}_{\mathbf{k},\le b}^{(2)}, k_b, c \right) \right\|^2 \right]\]

在推断生成阶段,该设计催生了纯潜空间 Rollout(Latent Rollout)机制:首个时间块(\(b=1\))直接由纯高斯噪声采样去噪,后续时间块(\(b>1\))直接以之前已去噪生成的清洁潜变量块 \(z_0^{(i, <b)}\) 作为历史因果上下文条件进行增量去噪。由于所有历史上下文的传递均闭环在紧凑连续的隐空间中完成,彻底规避了传统自回归方法必须反复进行“解码为姿态 \(\to\) 截取前缀 \(\to\) 重新编码为隐变量”的循环编解码量化损耗,从根本上消除了分段拼接处的突变跳变与动力学漂移。

损失函数 / 训练策略

系统分为两阶段解耦训练: 1. 时序动作 VAE:在 64 帧滑动窗口切片上独立训练,优化目标包含姿态几何重构损失与 KL 散度正则 \(\mathcal{L}_{\text{VAE}} = \sum_{i=1}^2 (\mathcal{L}_{\text{rec}}^{(i)} + \beta \mathcal{D}_{\text{KL}}^{(i)})\)。采用 AdamW 优化器,学习率 \(2 \times 10^{-4}\),在单张 A100 GPU 上训练约 1 小时。 2. DS-Causal-DiT 扩散网络:冻结预训练 DistilBERT 文本编码器与 VAE,扩散主干设置 8 层 Transformer,隐藏层维度 512,注意力头数 4,块大小取 \(B=3\)(对应 12 帧动作)。使用 Flow Matching 调度器,采用 AdamW 优化器(学习率 \(10^{-4}\),batch size 64)训练 500 轮,耗时约 8 小时。推断阶段采用 50 步扩散采样,InterHuman 与 Inter-X 上的无分类器引导(CFG)强度分别设为 3.0 和 1.5。

实验关键数据

主实验

评估基准涵盖 InterHuman(22 关节点 AMASS 骨架,262 维特征)与 Inter-X(56 关节点 SMPL-X 骨架,含细腻面部与手部动作,336 维特征)。在所有无需真值动作前缀热启动的完全生成式方法中,InterCMDM 在文本动作对齐度、生成逼真度与多样性上均取得最优表现。

数据集 方法 R-Precision Top-1 ↑ R-Precision Top-3 ↑ FID ↓ MM Dist ↓ Diversity → MModality ↑
InterHuman Real Motions 0.452 ± 0.008 0.701 ± 0.008 0.273 ± 0.007 3.755 ± 0.008 7.948 ± 0.064
InterGen (扩散) 0.371 ± 0.010 0.624 ± 0.010 5.918 ± 0.079 5.108 ± 0.014 7.387 ± 0.029 2.141 ± 0.063
InterMask (掩码) 0.449 ± 0.004 0.683 ± 0.004 5.154 ± 0.061 3.790 ± 0.002 7.944 ± 0.033 1.737 ± 0.020
TIMotion (扩散) 0.501 ± 0.005 0.734 ± 0.006 4.702 ± 0.069 3.769 ± 0.021 7.943 ± 0.034 1.005 ± 0.020
InterCMDM (本文) 0.529 ± 0.007 0.757 ± 0.005 4.492 ± 0.087 3.765 ± 0.002 8.065 ± 0.034 3.044 ± 0.104
Inter-X Real Motions 0.429 ± 0.004 0.736 ± 0.003 0.002 ± 0.000 3.536 ± 0.013 9.734 ± 0.078
InterGen (扩散) 0.207 ± 0.004 0.429 ± 0.005 5.207 ± 0.216 9.580 ± 0.011 7.788 ± 0.208 3.686 ± 0.052
InterMask (掩码) 0.403 ± 0.005 0.705 ± 0.005 0.399 ± 0.013 3.705 ± 0.017 9.046 ± 0.073 2.261 ± 0.081
TIMotion (扩散) 0.411 ± 0.005 0.707 ± 0.004 0.261 ± 0.014 3.737 ± 0.015 9.112 ± 0.079 2.475 ± 0.075
InterCMDM (本文) 0.523 ± 0.009 0.820 ± 0.007 0.215 ± 0.014 3.154 ± 0.021 9.490 ± 0.120 2.391 ± 0.136

消融实验

1. 架构与注意力因果性消融(InterHuman 数据集)

对比双向注意力(Bidirectional)与不同块大小 \(B\) 下的块因果注意力,并评估单流(Single)、混合流(Hybrid,前半段双流后半段单流)与完整双流(Dual)配置:

注意力类型 块流设计 R-Precision Top-1 ↑ R-Precision Top-3 ↑ FID ↓ MM Dist ↓ 说明
Bidirectional Single 0.535 ± 0.003 0.771 ± 0.002 4.456 ± 0.058 3.758 ± 0.016 全局双向依赖,无法自回归
Bidirectional Hybrid 0.538 ± 0.003 0.768 ± 0.002 4.468 ± 0.061 3.760 ± 0.017 部分层双流
Bidirectional Dual 0.549 ± 0.003 0.778 ± 0.002 4.562 ± 0.064 3.754 ± 0.015 强行参考未来动作的上限基准
Causal (\(B=3\)) Single 0.484 ± 0.003 0.717 ± 0.003 5.068 ± 0.071 3.782 ± 0.018 两人拼接单流因果去噪
Causal (\(B=3\)) Hybrid 0.499 ± 0.003 0.734 ± 0.003 4.577 ± 0.063 3.774 ± 0.017 半层解耦架构
Causal (\(B=3\)) Dual (本文完整) 0.529 ± 0.007 0.757 ± 0.005 4.492 ± 0.087 3.765 ± 0.002 兼顾自回归因果性与生成质量
Causal (\(B=1\)) Dual 0.514 ± 0.007 0.735 ± 0.009 4.551 ± 0.098 3.773 ± 0.002 单 token 块尺寸过细
Causal (\(B=5\)) Dual 0.532 ± 0.007 0.763 ± 0.004 4.545 ± 0.097 3.763 ± 0.002 块过大,推断流式延迟增加

2. 长时序交互生成与边界过渡平滑性评估

在 64 条包含 32 组连续文本描述的长序列生成测试中,对比独立分段拼接(Naive)、反复重编码拼接(Composition)与纯潜空间 Rollout(Latent Rollout):

模型 自回归策略 片段质量 FID ↓ R-Top1 ↑ 关节位移突变 (Pos Disc.) ↓ 边界连续性比 (B/NB Ratio) ↓ 滑步程度 (Skating) ↓
InterMask AR Rollout 27.239 ± 0.39 0.320 ± 0.008 0.048 ± 0.002 2.51 ± 0.07 0.172 ± 0.004
InterCMDM Naive (独立生成拼接) 18.37 ± 0.37 0.423 ± 0.008 1.375 ± 0.053 98.58 ± 1.21 0.260 ± 0.006
InterCMDM Composition (解码再编码) 25.758 ± 0.35 0.338 ± 0.008 0.026 ± 0.001 1.91 ± 0.05 0.136 ± 0.003
InterCMDM Latent Rollout (本文) 25.104 ± 0.40 0.352 ± 0.007 0.024 ± 0.001 1.66 ± 0.04 0.157 ± 0.004

关键发现

  1. 双流结构消除个体混淆:在相同因果约束(\(B=3\))下,DS-Causal-DiT 相比单流结构将 Top-1 R-Precision 从 0.484 显著拉升至 0.529,FID 从 5.068 降至 4.492。参数消融证实,为双流配备各自独立的网络参数相比共享参数模型(Top-1 为 0.506),能更卓越地刻画击打/受击、领舞/伴舞等非对称角色动力学。
  2. 纯潜空间自回归消弭边界硬跳变:独立生成拼接(Naive)虽然局部单段逼真度看似更优,但分段边界的不连续性比率高达 98.58,视觉体验极度碎裂;Latent Rollout 借助时序连续隐空间传递上下文,将边界不连续比率压低至 1.66(完美连续理论值为 1.0),且较传统反复解码-编码拼接(Composition)取得了更低的位移残差(0.024)与更好的片段对齐度(Top-1 0.352)。
  3. 多任务掩码显著反哺特化任务:在单向受激反应生成任务(Person 1 固定、Person 2 响应)中,采用多任务掩码联合训练的模型反应 FID 达 2.121,远胜仅用同步掩码训练的 2.585 以及专用反应掩码训练的 2.216,证明异构交互掩码构成了极其高效的因果动力学数据增强。

亮点与洞察

  • 单模型统摄全谱系交互模式:将双人交互中的信息因果流抽象为统一双流注意力中的可配置掩码,在训练期充当数据增强、推断期充当无痛控制旋钮,优雅地在一套权重内兼顾了双人同步、单人反应、主从领舞与彼此独立动作的自如切换。
  • 扩散强迫与潜空间动作流的高效杂交:将 Diffusion Forcing 的块因果思路与因果一维卷积 VAE 相结合,既享受了扩散模型高逼真度分布覆盖的红利,又克服了以往自回归运动模型单步误差发散与依赖真值热启动的顽疾。
  • 推断高吞吐流式交互:模型首块延迟仅 0.662 秒,后续每 12 帧动作生成耗时仅 50.3 毫秒,达到 89 FPS 的超实时流式交互生成能力,峰值显存占用不到 600MB,非常便于部署落地于虚拟数字人双人交互系统。

局限与展望

  • 交互规模受限于双人:当前架构为严格对称的双流机制量化设计,若需扩展至三人及以上复杂群体社交或群体舞蹈,双流注意力需重构为动态图注意力或多流路由机制。
  • 缺乏显式物理与碰撞动力学惩罚:虽然注意力掩码显著改善了对齐与朝向,但并未显式建模刚体穿透与动力学接触力,在复杂纠缠摔跤等场景下仍可能出现局部肢体微弱穿模。
  • 文本指令颗粒度较粗:目前依赖预训练 DistilBERT 的整句语义嵌入,无法在长时交互中按时间片精确解耦双人各自细分肢体动作(例如无法精准指示“第 3 秒左边人伸手、右边人后退半步”)。未来可探索面向个体的组合式解耦文本引导。

相关工作与启发

  • vs InterGen / TIMotion: 经典工作采用全序列双向扩散机制,虽然全知上下文有助于单段动作去噪,但完全丧失因果性,无法流式生成与自回归扩展;InterCMDM 引入块因果约束,在无需牺牲生成质量的前提下实现了真正可在线流式运行的长时双人动作生成。
  • vs InterMask: InterMask 依靠协作掩码重建动作,但在长时外推时容易出现滑步与协调性漂移;InterCMDM 依托因果连续潜空间,结合块级别自回归扩散,将边界不连续比降低了 34% 以上(1.66 vs 2.51),且无需真值片段引导。
  • vs HINT / Interact2Ar: 该类自回归方法依赖真值前缀帧进行初始化与推进;InterCMDM 实现了从纯高斯噪声冷启动的首块去噪,是真正全自动端到端的完全生成式模型。

评分

  • 新颖性: 4.5/5 (巧妙地将块因果扩散引入双人交互领域,提出统一双流掩码机制解决多模式交互控制)
  • 实验充分度: 4.5/5 (主实验覆盖 InterHuman 与 Inter-X 两大权威基准,消融实验涵盖架构、掩码类型、长时序平滑度与流式效率)
  • 写作质量: 4.5/5 (概念阐述清晰,动机针对性极强,消融分析透彻到位)
  • 价值: 4.5/5 (为游戏 NPC 交互、虚拟角色互动以及具身多人协作动作生成提供了兼具高质量与流式因果性的标杆框架)