跳转至

LOOM: Weaving Geometry-Consistent Human-Object Interaction Videos via Progressive Curriculum Learning

会议: ECCV 2026
论文: ECCV 原文
代码: https://neutrinoliu.github.io/byteloom/
领域: 3D视觉 / 视频生成 / 人体理解
关键词: 人-物交互视频生成, 相对坐标图 (RCM), 课程学习, 3D几何一致性, 扩散Transformer (DiT)

一句话总结

针对人-物交互视频生成中多视角几何一致性差与重度依赖精细手部网格标注的双重瓶颈,ByteLOOM 提出 RCM-cache 机制将复杂新视角合成降维为空间纹理查找,并结合三阶段渐进式课程学习,在仅依赖简易 2D 骨架的条件下合成几何高度保真的 6-DoF 人-物交互视频。

研究背景与动机

逼真的人-物交互(Human-Object Interaction, HOI)视频生成在数字人展演、电商营销、广告合成及机器人具身模仿学习中具有极高价值。然而,不同于单纯的人体骨架驱动或静态背景下的主体动画,HOI 视频合成要求在剧烈运动与复杂遮挡下同时保证人体身份、手部精细动作以及被操作物体的 3D 几何与纹理一致性。现有方法(如 AnchorCrafter、DreamActor-H1、HunyuanVideo-HOMA 等)在推向大角度翻转、旋转等真实操作场景时普遍受挫,生成的物体极易发生几何扭曲、表面纹理崩塌,或只能局限于正面朝向的微小扰动。

这种退化的根源在于两大核心矛盾:其一,传统扩散模型通常以单张或极窄视角锥内的 2D 图像作为物体参考,缺乏有效的跨视角 3D 先验注入机制,导致模型在面对物体未见视角时只能“凭借幻觉瞎猜”;即便直接拼接多视角参考图,缺乏明确几何关联的扩散模型也会将其误当作多个独立物体并在帧间随机插值。其二,现存开源且具备完整标注的高质量 HOI 视频数据极度匮乏,先前方案为处理手-物遮挡与接触接触面,往往强制绑定 SMPL 人体模板、精细手部网格(Hand Mesh)或稠密深度图,标注成本高昂且难以向 wild 视频规模化扩展;而弱条件方案又因缺乏手部几何引导而频发穿模与悬浮。

本文的切入角度是解耦几何对应与接触学习:既然稠密 3D 对应关系可以被空间坐标紧凑参数化,便可通过相对坐标图将困难的新视角合成转化为跨视角的稳定纹理查找;同时利用多源异构视觉数据构建由易到难的渐进迁移路径。核心 idea:引入基于相对坐标图的 RCM-cache 作为持续 3D 空间先验以实现精确 6-DoF 刚体控制,并设计“人体姿态驱动 → 手-物接触建模 → 全身人-物交互微调”的三阶段渐进式课程学习,彻底摆脱对精细手部网格的依赖。

方法详解

整体框架

ByteLOOM 基于 Wan2.1 视频扩散 Transformer(DiT)架构构建。模型输入包括:目标人物参考图像、每帧由 DWPose 提取的简易人体骨架、物体的多视角 RGB 与相对坐标图(RCM)参考缓存,以及驱动每帧物体运动的 6-DoF 目标 RCM 图像。所有条件在潜空间内通过拼接与多层感知机(MLP Fuser)注入网络,依靠 DiT 内部的自注意力机制自主学习跨模态、跨视角的几何对应与遮挡关系。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态输入<br/>人物参考 + 2D骨架 + 3D物体网格"] --> B["RCM-Cache 几何先验缓存<br/>稀疏多视角 RGB 与 RCM 坐标图对齐绑定"]
    B --> C["逐帧 6-DoF 几何控制<br/>光栅化每帧目标 RCM 坐标图注入通道维"]
    C --> D["三阶段渐进式课程学习<br/>姿态预训练 → 手-物接触学习 → 全身交互微调"]
    D --> E["无深度图数据整理管线<br/>SAM2 分割 + MoGe-2 尺度校准 + FoundationPose"]
    E --> F["输出高保真 HOI 视频<br/>多视角几何一致且手-物遮挡自然"]

关键设计

1. RCM-cache 机制:将复杂新视角合成降维为确定性纹理查找
针对多视角参考图输入时扩散模型易发生形变和概念混淆的难题,本文引入相对坐标图(Relative Coordinate Map, RCM)。给定物体的 3D 网格顶点 \(V_i \in \mathbb{R}^3\) 及其轴对齐包围盒边界 \([b_{\min}, b_{\max}]\),将其在各坐标轴维度上做极值归一化,映射到三维归一化空间 \(C_i^{\text{RCM}} = (V_i - b_{\min}) / (b_{\max} - b_{\min}) \in [0, 1]^3\) 并量化为 RGB 颜色表示 \(c_i = \text{round}(255 \times C_i^{\text{RCM}})\)。在光栅化阶段,三角形面片内部的任意像素坐标颜色均由三个顶点的重心坐标 \((\alpha, \beta, \gamma)\) 线性插值决定: $\(c_{\text{pixel}} = \alpha c_i + \beta c_j + \gamma c_k\)$ 在此基础上,ByteLOOM 预先从稀疏视角(满足 Wan-VAE 特性的 9 个代表性视点)渲染出带有表面纹理的 RGB 图像与对应的 RCM 坐标图,构成配对的持久化 RCM-Cache,沿帧维度拼接为全局外观先验;在生成任意视频帧时,再根据当前时间步的 6-DoF 刚体位姿渲染出单通道目标 RCM 拼接进输入潜空间。由于 RCM 的每个像素颜色严格对应物体表面的物理三维坐标,DiT 在跨帧生成时能够利用自注意力在 Cache 的已知视角与当前目标位姿之间建立刚性点对点映射,将极具挑战性的 novel view synthesis 转化为简单的全局纹理检索与投影,根本性消除形变崩塌。

2. 三阶段渐进式课程学习:逐步解耦并习得复杂交互生成
针对高质量全身 HOI 数据极端匮乏与手-物接触极其复杂的矛盾,本文摒弃了“单阶段端到端强行拟合”或“依赖手部网格先验”的传统范式,提出覆盖多样化数据源的三阶段课程训练体系: - 阶段 I(人体姿态预训练):在涵盖超 10 万个视频片段的大规模专有人体动作数据集(约 640 万帧)上进行骨干预训练,利用 DWPose 提取人体关节点。此阶段不引入物体交互,专注让模型掌握基础人体运动学、时序动态平滑性及粗粒度解剖学先验。 - 阶段 II(手-物接触与交互预训练):引入公开且标注精良的手部操作数据集(DexYCB、HO3D、ARCTIC,总计约 136 万帧)。由于这些数据集包含精确的物体 3D 网格与高精手部姿态,模型结合 RCM-cache 在局部高频交互区域重点学习手指接触、抓握构型(Grasp Configuration)以及复杂的细粒度手-物遮挡规律。 - 阶段 III(全身 HOI 综合微调):在精心摄制的高质量全真交互数据集 Mani4D-Train(4.5 万帧)上完成最终调优。演员展示涵盖日用品旋转、翻转及大范围空间位移的完整动作,促使模型将前两阶段习得的全身时空平滑性与手-物细粒度接触能力融会贯通,在摆脱 3D 手部网格模板的束缚下仅凭 2D 骨架生成严密贴合的自然交互。

3. T-SSIM 几何一致性量化指标:基于 3D 高斯泼溅的前馈评估
针对传统跨帧一致性指标(如 MEt3R)仅能计算成对图像特征相似度、计算复杂度高达 \(\mathcal{O}(N^2)\) 且无法衡量整体空间几何连续性的缺陷,本文创新提出 T-SSIM 评测协议。首先借助 SAM2 从生成视频帧中分割出目标物体并填补统一白色背景;随后利用前馈式 3D 高斯重建模型 E-Rayzer,联合预测连续帧 \(I_0, \dots, I_n\) 的统一 3D 高斯基元集合 \(\mathcal{G}\)、共享内参 \(K\) 以及每帧的外参估计 \(E_i\): $\(\{\mathcal{G}, K, E_0, \dots, E_n\} = \text{E-Rayzer}(I_0, \dots, I_n)\)$ 将拟合出的连续 3DGS 通过可微泼溅重新投影渲染回各个视点得到重投影图像 \(I'_i = \text{Splat}(\mathcal{G}, K, E_i)\)。最后通过计算全视频时序内原始裁剪图与重投影图之间的结构相似性均值: $\(\text{T-SSIM} = \frac{1}{n}\sum_{i=1}^{n} \text{SSIM}(I_i, I'_i)\)$ 若生成的物体在多帧间保持严谨的 3D 刚体结构,则单套 3DGS 能够高精度重建出无伪影的多视角图像(高 T-SSIM);若物体在旋转过程中发生表面漂移或拓扑形变,重投影将产生模糊与破损,从而实现对生成视频 3D 几何一致性的免真实参考评测。

4. 摆脱真值深度的稳健 HOI 数据整理管线
为构建包含精确 3D 几何与 6-DoF 轨迹的训练数据,本文设计了一套自动化数据引擎:对展演视频使用 SAM2 分割出物体前景,利用 2DGS/PGSR 或扩散重建方法 ReconViaGen 获得封闭流形网格(对于严重遮挡则用 Amodal3R 补全);深度方面采用单目几何估计器 MoGe-2 配合 EXIF 相机内参及 RANSAC 跨帧全局对齐,并借助尺度校准模块消除尺度漂移;最终将 RGB、连续度量深度与物体网格输入 FoundationPose 提取高精度 6-DoF 轨迹,以极低人工成本获取高质量的多视角大角度旋转交互视频。

实验关键数据

主实验

在涵盖 5 位测试人物、15 组大角度旋转翻折动作(每段 97 帧,旋转角度达 90° 至 180°,含 6 种完全未见物体)的 Mani4D-Test 基准上进行评测。对比基线包括前沿开源方案 AnchorCrafter 以及基座相近的 UniAnimate-DiT 与 MimicMotion。

(原论文 Table 2: Quantitative results on Mani4D-Test)

方法 Obj-IoU ↑ Obj-CLIP ↑ Face-Cos ↑ LMD ↓ MEt3R ↓ T-SSIM ↑
Ground Truth 0.0419 0.9218
UniAnimate-DiT 0.4644 0.7655 0.7920 0.3260 0.0524 0.9101
MimicMotion 0.4647 0.7455 0.7391 0.2017 0.0638 0.9010
AnchorCrafter 0.6461 0.7355 0.5771 0.2629 0.0552 0.9079
Ours (I + II + III) 0.8288 0.9100 0.8891 0.1427 0.0454 0.9147

消融实验

(原论文 Table 3 与 Table 2 下半部分:模块与课程消融)

配置 Obj-IoU ↑ Obj-CLIP ↑ LMD ↓ MEt3R ↓ T-SSIM ↑ 说明
完整模型 (with RCM) 0.8288 0.9100 0.1427 0.0454 0.9147 完整模型:几何保真度与接触精度最佳
without RCM 0.6619 0.8639 0.1878 0.0540 0.9063 仅输入多视角图像,跨帧一致性骤降
课程消融: I + III (跳过手-物) 0.7627 0.8829 0.2054 0.0569 0.9048 缺少手-物预训练,手部动作误差 (LMD) 明显劣化
课程消融: I + Obj + III 0.7689 0.8901 0.1930 0.0492 0.9105 纯物体合成漂移任务对交互助益有限
课程消融: I + II + Obj + III 0.7770 0.8946 0.1861 0.0429 0.9183 T-SSIM 最优但域差异导致手部交互质量略有折损

关键发现

  • RCM 是跨视角几何一致性的决定性基石:消融掉 RCM 仅保留多视角 RGB 条件时,Obj-IoU 暴跌 0.1669(从 0.8288 降至 0.6619),MEt3R 显著增大,生成物体在旋转过程中发生严重的拓扑塌陷,证明单纯靠图像自注意力无法隐式对齐跨视角三维表面。
  • 手-物预训练课程(Stage II)不可或缺:从训练中移除 Stage II(I+III 配置)会导致衡量手部关节点误差的 LMD 从 0.1427 飙升至 0.2054,表明通用人体数据集难以提供足够密集的交互接触监督,必须依赖局部手-物数据集架设桥梁。
  • 纯物体新视角合成(Obj-NVS)的取舍:在课程中加入合成物体漂移训练任务(I+II+Obj+III)能将几何一致性指标推至最高(T-SSIM 0.9183,甚至逼近 GT 的 0.9218),但由于纯合成背景与真实交互场景存在显著分布差异,反倒使手部交互呈现退化,因而作者将其定为可选训练配置。
  • 未见人脸与泛化能力:在全新生成的未见人物与未见物体测试中(Table 4),ByteLOOM 的 Obj-IoU(0.8212)和 Face-Cos(0.7661)大幅超越 AnchorCrafter(分别为 0.2435 与 0.3700),证明模型真正学习了通用的几何对齐与遮挡关系,而非死记硬背训练样本。

亮点与洞察

  • 将视角生成转化为纹理索引:巧妙地将 3D 物体相对坐标映射为 RGB 色彩编码,利用标准 DiT 空间自注意力直接实现高精度的“坐标到外观”查询,在不引入复杂 3D 神经网络的前提下解决了视频生成中的 3D 几何坍塌。
  • 非对称式课程解耦设计:深刻洞察到“完整交互数据稀少”与“单项基础数据丰富”的分布不均,通过由易到难的阶段分解(全身骨架动量 → 局部抓握微观物理 → 全身协调合成),用极少量的终阶段交互视频(4.5 万帧)撬动了高质量生成。
  • 基于 3DGS 前馈重建的免真值评测准则:提出 T-SSIM,利用单目 3DGS 模型拟合视频物体并回测重投影一致性,填补了视频多视角几何一致性定量评估的技术空白。

局限与展望

  • 交互类型局限于外向型展演场景:当前数据集与实验主要聚焦于面向镜头的展示性操控(第三人称产品展示),尚未扩展至第一人称双手操作、复杂日常工具功能性使用(如切菜、书写)以及多物体协同交互。
  • 刚体几何假设的制约:RCM 编码高度依赖刚体物体的固定表面拓扑结构,对于衣服折叠、软体形变或铰接物体(如剪刀、折叠伞),顶点坐标与纹理映射关系被打破,尚需探索部位级或拓扑感知的坐标表示。
  • 缺乏显式物理与力学接触约束:当输入的 2D 骨架轨迹与 3D 物体位姿存在几何偏差时,模型无法像物理引擎一样施加碰撞排斥,可能诱发轻微的手指穿模或空气悬浮抓握。

相关工作与启发

  • vs AnchorCrafter: AnchorCrafter 依赖多视角图像、深度图、人体骨架及精细 Hand Mesh 构成繁琐的条件束,且物体参考局限于 30° 极窄视锥,面对大角度翻转必然崩塌;ByteLOOM 摆脱了手部网格与深度图输入,依靠 RCM-cache 支持高达 180° 的任意 6-DoF 视角操纵。
  • vs DreamActor-H1 & HunyuanVideo-HOMA: DreamActor-H1 严重依赖由大量 3D 动作捕捉构建的模版库,扩展代价极高;HunyuanVideo-HOMA 尝试弱条件扩展但缺乏多视角呈现能力。ByteLOOM 通过三阶段课程与紧凑 RCM,在弱条件输入下达成了更优的多视角可控性与泛化性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [将 RCM 坐标图巧妙嫁接至 DiT 作为显式 3D 先验,概念精炼而优雅]
  • 实验充分度: ⭐⭐⭐⭐⭐ [自建 Mani4D 评测集,定量消融与未见主体泛化实验详尽且具说服力]
  • 写作质量: ⭐⭐⭐⭐⭐ [问题提炼切中痛点,方法逻辑清晰,图表设计直观]
  • 价值: ⭐⭐⭐⭐⭐ [为电商数字人展示、虚拟拍摄及机器人操作模仿视频生成提供了极佳的工业落地范式]