跳转至

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation

会议: ECCV 2026
论文: ECCV 官方页面
代码: https://mpi-lab.github.io/SparseCtrl-HOI
领域: 视频生成
关键词: 人-物交互、视频生成、稀疏时序控制、旋转位置编码、多模态大模型

一句话总结

针对人-物交互(HOI)视频生成中密集位姿控制标注成本高昂且破坏动作自然度的问题,本文提出基于 DiT 架构的稀疏时序控制框架 SparseCtrl-HOI,通过时间受控旋转位置编码(TiRoPE)实现指定时刻的交互状态锚定,结合 MLLM 运动先验注入与解耦两阶段训练,仅凭少量关键帧即可合成物理可信、高保真度的直播带货 HOI 视频。

研究背景与动机

人-物交互(HOI)视频生成旨在合成人类与各类物体交互的逼真动态视频,在虚拟现实、数字娱乐以及 AI 电商直播带货等领域具有巨大的商业价值与研究意义。在直播电商场景中,AI 驱动的虚拟主播需要对各类商品进行连续、精细的展示与操控,这要求生成模型既能精确维护人脸身份与商品外观纹理,又能准确建模手-物交互区域的微小形变、物理接触与复杂时空协调。

现有 HOI 视频生成方法大多采用密集控制范式:一类依赖逐帧的密集人体位姿、3D 网格序列或相对坐标图进行严格时序约束;另一类虽然探索了稀疏空间控制(如稀疏关键点或物体运动轨迹),但底层仍需通过解耦引导或动作致密化技术将其插值转化为逐帧约束。这种全帧密集同步强行剥夺了生成底模内生学习到的物理运动规律,将强大的扩散模型退化为纯粹的纹理渲染器,导致生成的交互僵硬死板、动作千篇一律;同时,外部位姿估计中的细微抖动与伪影会被放大并传导至视频帧中,加之定制化场景下逐帧标注的昂贵成本,严重制约了该技术的实际落地。

针对上述瓶颈,更具前瞻性的技术路线应当是摆脱逐帧密集束缚,实现稀疏时序控制——仅提供离散时间戳上的交互关键帧,由模型自主脑补平滑且物理自洽的过渡动态。本文的核心 idea 是:将稀疏交互关键帧在时序维度与噪声隐变量拼接,利用时间受控旋转位置编码(TiRoPE)在目标时刻精准锚定交互位姿,并借助多模态大语言模型(MLLM)提取跨时刻高层运动先验驱动 Q-Former 注入,配合解耦两阶段训练实现外观对齐与运动推理的分离。

方法详解

整体框架

SparseCtrl-HOI 以基于连续时间流匹配(Flow Matching)的 Wan2.1-DiT 为骨干网络,接受三路多模态输入:一张确定主播身份的参考人像 \(I_{\text{ref}}\)、一段同步驱动口型的音频序列,以及在指定时间戳 \(t_1, \dots, t_K\) 处的稀疏交互关键帧集合 \(I_1^{\text{ho}}, \dots, I_K^{\text{ho}}\)。通过因果 3D VAE 编码后,模型采用非对称方式将参考图与关键帧隐变量注入 DiT,利用自注意力机制传递手-物交互几何与纹理;随后通过 TiRoPE 在对应时刻建立注意力共振,并由 MLLM 抽取的紧凑运动语义引导中间帧的物理过渡。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态输入<br/>参考人像 + 音频 + 稀疏交互关键帧"] --> B["非对称多模态条件注入<br/>通道拼接身份参考 + 时序维度扩展键帧"]
    B --> C["时间受控旋转位置编码 (TiRoPE)<br/>键帧直接绑定目标时间戳时序索引"]
    D["Qwen2.5-VL 动力学推理<br/>长文本提示抽取跨键帧高层运动语义"] --> E["MLLM 运动先验注入模块<br/>MLP 投影 + 4 模块 Q-Former 压缩为 64 Tokens"]
    C --> F["解耦两阶段训练策略<br/>Stage 1 外观对齐 LoRA + Stage 2 运动交叉注意力"]
    E --> F
    F --> G["高保真 HOI 视频生成<br/>身份保真 + 键帧精准对齐 + 物理过渡平滑"]

关键设计

1. 非对称多模态条件注入:通道身份广播与时序键帧拼接

现有扩散模型若简单将离散关键帧按通道维度拼接到视频潜变量上,会导致非关键帧处通道被大量零填充(Zero-padding),造成隐空间特征稀疏、收敛速度极其缓慢且容易破坏预训练先验。为此,本文设计了非对称注入结构:代表人物外观与背景的单张参考帧隐变量 \(\mathbf{z}_{\text{ref}} \in \mathbb{R}^{1 \times \frac{H}{8} \times \frac{W}{8} \times C}\) 沿时间轴广播并与视频噪声潜变量 \(\mathbf{z}_{\text{v}}^{\text{noise}} \in \mathbb{R}^{\frac{T}{4} \times \frac{H}{8} \times \frac{W}{8} \times C}\) 在通道维度拼接,确保每一帧都能直接读取全局外观上下文;而包含手部与商品特写的 \(K\) 个稀疏交互键帧 \(\mathbf{z}^{\text{ho}} \in \mathbb{R}^{K \times \frac{H}{8} \times \frac{W}{8} \times C}\) 则与独立高斯噪声 \(\boldsymbol{\epsilon}_{\text{ho}}\) 通道对齐后,沿时间维度追加拼接:

\[\mathbf{z}_{\text{in}} = \text{Concat}_T\left(\text{Concat}_C(\mathbf{z}_{\text{v}}^{\text{noise}}, \mathbf{z}_{\text{ref}}), \; \text{Concat}_C(\boldsymbol{\epsilon}_{\text{ho}}, \mathbf{z}^{\text{ho}})\right)\]

这种构造使 DiT 内置的时空自注意力机制能够自适应地从键帧中检索手-物形态与商品细节。为消除背景干扰并避免模型退化为边缘复制粘贴,输入键帧预先应用了形态学膨胀与高斯平滑的手-物软掩码(Mask),并在手部区域叠加 HSV 色调抖动与空间缩放增强,强制 DiT 聚焦于关键帧的手指交互拓扑而非死记硬背局部纹理。

2. 时间受控旋转位置编码 (TiRoPE):跨时刻注意力的显式频率共振

虽然在时间维度拼接关键帧提供了几何线索,但标准 3D RoPE 仅按张量物理排列顺序为追加的键帧赋予孤立的末尾时序索引,导致模型无法感知某个键帧究竟应该在生成视频的第几秒或第几帧生效。若简单采用条件引导,模型往往在整个时段内产生模糊的平均动作。本文提出时间受控旋转位置编码(TiRoPE),其核心是在构建旋转位置编码时,打破张量内存顺序与时序索引的一一对应:对于噪声视频帧 \(\mathbf{z}_{\text{v}}^{\text{noise}}\) 保持标准的全局时空 RoPE 索引;对于第 \(i\) 个交互键帧隐变量 \(\mathbf{z}_i^{\text{ho}}\),直接将其时序位置索引重写为其指定的真实目标时间戳 \(t_i\)。

由于旋转位置编码的内积仅取决于相对位置差,将键帧的时序索引硬编码为 \(t_i\) 后,第 \(i\) 个键帧与目标时刻对应的生成帧在时序频率分量上的相对距离差严格归零。这在 DiT 自注意力计算中激发出强烈的时序共振,引导注意力权重在指定时刻自发对齐键帧的手-物姿态与接触状态,同时其空间 RoPE 编码维持原状以保护空间结构完整性。

3. MLLM 运动先验注入模块:跨键帧动力学推理与 Q-Former 压缩

TiRoPE 完美解决了稀疏锚点时刻的状态命中,但离散键帧之间的长间隔(如数秒之久)缺乏局部约束,在人手抓取、旋转、展示商品的剧烈视点变换下,单纯的插值极易引发手部结构崩塌、物体穿模或凭空漂浮。本文引入具备强大多模态理解与常识推理能力的 Qwen2.5-VL,输入按时序排列的稀疏键帧序列与结构化提示词,要求其显式推理从上一状态到下一状态手部姿势变化、物体空间朝向翻转以及手-物接触区域的迁移规律,从顶层输出全局动作语义表征 \(\mathbf{R}_{\text{mllm}}\)。

由于 MLLM 最后一层的原始特征序列过长且语义空间与生成 DiT 不匹配,本文构建了轻量化 Q-Former 适配器。该适配器包含 4 个级联模块,每个模块由自注意力、交叉注意力和前馈网络组成。原始特征经线性层投影后,由 64 个可学习查询向量 \(\mathbf{Q}\) 通过交叉注意力凝练出维度紧凑的高级动作先验令牌:

\[\mathbf{C}_{\text{mllm}} = \text{Q-Former}(\mathbf{Q}, \text{MLP}(\mathbf{R}_{\text{mllm}}))\]

随后,\(\mathbf{C}_{\text{mllm}}\) 被注入到 DiT 各 Transformer Block 专门新增的 Motion Cross-Attention 层中,为中间生成帧提供连续且符合物理逻辑的动力学先验,有效补足纯视觉几何特征在时序推理上的空白。

4. 解耦两阶段训练策略:外观对齐与运动推理分离

MLLM 擅长高维抽象时空因果推理,但对像素级微观纹理存在不可避免的幻觉(Hallucination);而 DiT 则精于高保真视觉渲染。若将整个系统端到端联合训练,MLLM 的高层运动特征会与 DiT 的纹理合成特征发生严重纠缠,导致生成的商品表面产生虚假几何形变或噪点瑕疵。为此,本文提出解耦两阶段训练策略:

  • 阶段一(外观特征迁移,Appearance Feature Transfer):固定 VAE 编码器,解冻 Patch Embedding 与音频打包模块,在 DiT 的自注意力与文本交叉注意力层上引入 LoRA(秩适配),基于流匹配损失优化 15,000 步。此阶段专注于让 DiT 掌握从参考人像提取主播外观、从 TiRoPE 键帧提取商品细节并在指定时间戳精确复现交互状态的能力。
  • 阶段二(动作过渡推理,Motion Transition Inference):冻结阶段一训练好的全部 LoRA 权重,锁定视频纹理渲染与键帧对齐能力不变;仅训练新增的 Q-Former 模块以及 DiT 内部的 Motion Cross-Attention 层,训练 10,000 步。此阶段使模型专门学习如何根据 \(\mathbf{C}_{\text{mllm}}\) 规划合理的运动过渡轨迹,杜绝了多模态幻觉对画面渲染细节的侵蚀。

损失函数 / 训练策略

骨干网络遵循连续时间流匹配范式,定义真实数据分布 \(\mathbf{z}_0\) 与标准高斯噪声 \(\boldsymbol{\epsilon} \sim \mathcal{N}(\mathbf{0}, \mathbf{I})\) 之间的线性插值路径 \(\mathbf{z}_t = (1 - t)\mathbf{z}_0 + t\boldsymbol{\epsilon}\),DiT 速度场预测网络 \(v_\theta\) 最小化速度场均方误差:

\[\mathcal{L}_{\text{flow}}(\theta) = \mathbb{E}_{t \sim \mathcal{U}(0,1), \, \mathbf{z}_0 \sim p_{\text{data}}, \, \boldsymbol{\epsilon} \sim \mathcal{N}(\mathbf{0},\mathbf{I})} \left\| v_\theta(\mathbf{z}_t, t, c) - (\boldsymbol{\epsilon} - \mathbf{z}_0) \right\|_2^2\]

训练在包含 4,800 个视频片段的 SparseHOI-5K 训练集上展开,采用 AdamW 优化器,学习率统一设置为 \(5 \times 10^{-6}\),全局批大小为 8,每个样本动态抽取 4 个手-物交互关键帧。

实验关键数据

主实验

实验在全新构建的直播电商基准 SparseHOI-5K(50 个不相交测试身份)以及通用交互基准 AnchorCrafter 测试集上展开。对比方法包括依赖密集网格/位姿控制的 AnchorCrafter、音频驱动基线 OmniAvatar(及其扩展基准 OmniAvatar-BL)、以及通用视频生成模型 VACE 和 Phantom。评估涵盖保真度指标(FID、FVD)、时序稳定性(VBench 运动平滑度 MS、闪烁度 TF、美学质量 AQ)、音频同步度(Sync-C),以及针对 HOI 任务定制的 RAFT 光流平滑度(MS-RAFT,越低越好)和基于 Qwen2.5-VL 的物理交互可信度评分(HOI-VLM,最高 5 分)。

数据集 方法 FID ↓ FVD ↓ MS ↑ TF ↑ AQ ↑ Sync-C ↑ MS-RAFT ↓ HOI-VLM ↑
AnchorCrafter AnchorCrafter [45] 91.9 726.4 0.99 0.98 0.46 - 0.43 2.90
VACE [19] 249.0 3809.2 0.98 0.97 0.418 - 0.60 2.90
Phantom [28] 254.3 2544.3 0.96 0.98 0.43 - 0.53 2.50
SparseCtrl-HOI (本文) 91.4 725.8 0.99 0.99 0.48 - 0.27 3.00
SparseHOI-5K AnchorCrafter [45] 258.4 2859.8 0.99 0.98 0.43 - 0.79 1.18
OmniAvatar [9] 131.2 1207.0 0.99 0.99 0.43 7.04 0.47 2.76
OmniAvatar-BL 129.3 1110.9 0.98 0.98 0.43 6.99 0.49 2.78
VACE [19] 212.9 1613.3 0.98 0.98 0.43 - 0.65 2.86
Phantom [28] 254.2 2701.7 0.99 0.98 0.44 - 0.48 1.56
SparseCtrl-HOI (本文) 89.1 629.6 0.99 0.99 0.43 6.98 0.45 2.92

消融实验

在 SparseHOI-5K 数据集上对核心架构组件、条件注入方式以及推理时稀疏关键帧数量 \(K\) 进行了全面消融,引入时间戳结构相似度(Ti-SSIM,衡量指定时刻的交互位姿命中精度)。

分组 变体 / 配置 FID ↓ FVD ↓ Ti-SSIM ↑ MS-RAFT ↓ 说明
核心组件 去除数据增强 (w/o Data Aug.) 95.14 709.14 0.65 0.52 失去形态平滑与抖动,产生明显剪贴伪影
去除 TiRoPE (w/o TiRoPE) 99.28 697.84 0.52 0.64 失去时序对齐,Ti-SSIM 大幅暴跌 0.14
去除运动先验注入 (w/o M.P.I.) 90.86 651.18 0.66 0.53 中间帧缺乏动力学约束,光流误差上升
完整模型 (Full model) 89.17 629.61 0.66 0.45 综合表现最佳
注入方案 参考图沿时序轴拼接 111.81 822.67 0.60 0.66 人物全局身份线索削弱,FVD 恶化
关键帧沿通道轴拼接 202.54 1292.19 0.50 0.79 严重依赖零填充,收敛极慢且性能崩溃
完整模型 (Full model) 89.17 629.61 0.66 0.45 非对称注入保证了全局外观与时序离散特征最优解耦
推理时键帧数 \(K\) \(K = 2\) 115.64 795.32 0.67 0.45 仅首尾约束,生成自由度高但分布偏离
\(K = 3\) 102.25 664.77 0.67 0.44 随着控制点增加,指标单调提升
\(K = 4\) (训练默认) 89.17 629.61 0.66 0.45 性能与控制开销达到优良平衡
\(K = 6\) 82.20 544.05 0.66 0.48 时序密度增加进一步提升视觉质量
\(K = 8\) 81.34 515.84 0.67 0.46 FVD 降至 515.84,且时间戳对齐精度高度稳健

关键发现

  • TiRoPE 是时序精准控制的决定性基石:消融 TiRoPE 会导致 Ti-SSIM 从 0.66 骤降至 0.52,降幅超过 21%,证明标准 RoPE 无法将特征绑定至目标时间戳,生成视频呈现无规律动作漂移。
  • 运动先验模块有效抚平中间帧物理形变:去除 MLLM 运动先验后,MS-RAFT 光流误差从 0.45 恶化至 0.53,物体在大角度旋转时出现严重的橡皮泥式形变与断裂,证实高层语义动力学对视频流平滑具有关键约束作用。
  • 解耦训练消除特征纠缠伪影:定性对比显示,单阶段联合训练会使 MLLM 的视觉幻觉污染 DiT,在前景物体表面造成粗糙噪点;而两阶段解耦方案成功保留了 DiT 的高保真外观生成能力。
  • 推理稀疏度具备极强弹性与可扩展性:虽然模型仅在 \(K=4\) 下训练,但在测试时无论是极稀疏的 \(K=2\) 还是较密集的 \(K=8\),Ti-SSIM 均稳定在 0.66~0.67 之间,表明模型真正学会了广义的时间戳控制能力而非过拟合特定插值间距。

亮点与洞察

  • 优雅的非对称注入与 TiRoPE 机制:将外观参考图按通道广播、交互关键帧按时间轴扩展,并通过篡改 RoPE 时序索引实现时间对齐。这一设计零额外推理参数,极其轻量却直击稀疏时序控制痛点。
  • LLM/MLLM 认知先验向生成先验的高效转化:不直接使用大模型生成像素,而是利用 Qwen2.5-VL 理解动作逻辑与因果演变,借助 Q-Former 将长上下文压缩为 64 个紧凑控制 Token,为跨模态运动引导提供了教科书级的工程范式。
  • 构建垂直领域高质量基准 SparseHOI-5K:提供了 4,850 个涵盖 34 位主播、超 1,000 件真实商品的广播级 512×512 视频,配套完整的精准手/物分割掩码与去物背景修复视频,填补了电商人-物交互多模态生成的无公开基准空白。

局限与展望

  • 复杂双手动能交互受限:当前数据集与模型主要聚焦于单手持物或相对规则的双手托举动作,对于多指穿插、双手拧开瓶盖、按压折叠等极度精细的拓扑变化,仍可能出现局部的指部遮挡与模糊。
  • 单帧物体图像的 3D 盲区:目前从关键帧中提取物体时,若商品具有复杂的背面图案或内部结构,且在视频中发生 360 度翻转,缺乏 3D 几何先验的 MLLM 仍可能产生合理的“臆造”而非完全复原真实背面。
  • 改进方向:未来可探索引入三维手部模型(如 MANO)作为几何辅助先验,或结合多视角商品网格引导,进一步扩展至超高分辨率数字人实时交互系统。

相关工作与启发

  • vs AnchorCrafter [45]: AnchorCrafter 采用 2D 骨架、手部网格与深度图的逐帧密集控制,在跨域泛化时极易因姿态估计抖动产生严重手部伪影且 FVD 高达 2859.8;SparseCtrl-HOI 仅需 4 帧稀疏关键帧即可实现平滑控制,FVD 大幅降低至 629.6,显著解放了标注成本。
  • vs OmniAvatar [9]: OmniAvatar 聚焦于单图驱动的肖像口型与身体摆动,无法实现指定物品的交互控制;本文在继承其高质量流匹配骨干的基础上,创新性开辟了手-物交互与时间受控维度,且口型同步度(Sync-C 6.98 vs 7.04)几乎无损。
  • vs HOMA [18] & VHOI [50]: 该类方法虽然输入稀疏轨迹,但本质仍依赖动作致密化算法将其插值为全时序密集控制,面临插值抖动瓶颈;本文依托 MLLM 语义动力学先验直接由 DiT 潜空间预测非线性运动场,在物理真实性上更具优势。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次在 HOI 视频生成中实现纯稀疏时序控制,TiRoPE 与解耦两阶段 MLLM 运动注入极具原创性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 2 个基准数据集、10 余项量化指标、完整的组件与参数消融,并自制了 4.8k 规模的多模态电商数据集。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨清晰,问题定义与解决切入点高度对齐,实验数据充实详尽。
  • 价值: ⭐⭐⭐⭐⭐ 直击 AI 电商带货与虚拟人产品演示的工业落地痛点,开源代码与数据集应用价值极高。