跳转至

Reconstructing 3D Human-Object Interaction via a Unified Triplane Space

会议: ECCV 2026
论文: ECCV 2026
领域: 3D 视觉
关键词: 3D人-物交互、三平面表示、隐式几何重建、SMPL-H拟合、单目三维重建

一句话总结

针对单目 3D 人-物交互重建中人体参数化模板与多样化物体的结构失衡痛点,提出统一三平面特征空间(Unified Triplane Space),结合 HOIT-VAE 隐式几何先验、相机感知 HOIT-T 图像到三平面转换与 SMPL-H 姿态拟合,实现了平衡且高精度的交互网格重建。

研究背景与动机

从单张 RGB 图像重建三维人-物交互(3D Human-Object Interaction, HOI)是具身智能、机器人操作与虚拟现实的核心基础技术。然而,联合重建人体与交互物体面临着根本性的几何不对称:人体结构具有高度受约束的统计拓扑规律,通常遵循固定的参数化模板(如 SMPL);相比之下,交互物体的几何形状、拓扑和尺度千差万别,不存在统一的通用模板。这种结构差异导致传统的顶点级直接回归框架面临极不均衡的优化目标。

现有工作多采用局部交互约束或顶点级图网络来建模交互。例如 StackFLOW 通过人体与物体顶点间的相对位移建模交互,CONTHO 引入显式接触图以规避物理穿透。尽管局部接触约束能缓解悬空或穿模,但极易使网络过拟合于局部几何而牺牲全局网格的完整性与一致性。进一步地,HOI-TG 尝试通过图卷积与自注意力直接监督顶点位置以平衡局部与全局,但在统一施加均方误差时,模型天然偏向于易收敛的人体模板,对细长或形状不规则的物体产生严重的结构失真与尺度失衡。另一方面,基于点云扩散的方法(如 HDM)虽然摆脱了物体模板限制,但点云的无序性与多步去噪推断导致流程极不稳定且耗时严重。

这一困境的根源在于:缺乏一个既能抹平人体与物体拓扑差异、又能同时承载局部接触与全局空间排布的统一几何特征空间。本文的切入角度是将显式网格解耦为隐式占有场,并投射到紧凑正交的三平面(Triplane)空间中,使单目 HOI 重建转化为结构清晰的图像到三平面特征预测问题。核心 idea:构建统一三平面空间将人体与物体的连续占有场联合编码进共享的 3D 隐空间,配合 VAE 隐式几何先验、相机自适应 Transformer 预测与基于先验的 SMPL-H 姿态拟合,化解模板依赖与结构失配。

方法详解

整体框架

整个重建管线分为三个协同阶段:隐空间几何先验学习(HOIT-VAE)、单目图像到三平面预测(HOIT-T)以及几何引导的 SMPL-H 姿态拟合。首先,HOIT-VAE 接收人体和物体的采样点云,利用跨注意力与自注意力编码器将其压缩为紧凑的三平面潜变量分布,并通过卷积解码器预测高分辨率半连续占有场,利用 Marching Cubes 提取网格;其次,HOIT-T 提取 DINO 视觉特征并融合闭式求解的相机几何嵌入,通过自适应层归一化(adaLN)调制的 Transformer 解码三平面隐特征,与预训练 VAE 的后验分布对齐;最后,针对三平面离散量化造成的肢体细节模糊,利用轻量化优化模块将 SMPL-H 参数拟合到预测的人体表面,由 DPoser-X 强姿态先验约束生成解剖学合理的交互姿态。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入: 单张 RGB 图像 + 2D 掩码"] --> B["HOIT-T 图像预测<br/>DINO 特征 + 闭式相机嵌入"]
    B --> C["HOIT-VAE 隐空间对齐<br/>MSE + 余弦相似度 + KL 正则"]
    C --> D["三平面特征上采样与解码<br/>卷积升采样 + MLP 占有率预测"]
    D --> E["双体网格重建<br/>512³ 体素查询 + Marching Cubes"]
    E --> F["SMPL-H 姿态拟合<br/>Chamfer 距离 + DPoser-X 先验"]
    F --> G["输出: 空间对齐的人体与物体 3D 网格"]

关键设计

1. HOIT-VAE 与半连续占有场:构建无模板的统一几何隐空间 传统直接预测高分辨率三平面显式特征计算代价极大,且二值占有率建模在薄壁与精细边缘处容易断裂。为此,HOIT-VAE 将三维网格表面采样点与其法向量通过傅里叶位置编码融合后输入编码器,利用单层交叉注意力将离散几何信息汇聚至可学习的三平面初始 Token,再通过多层自注意力建模面内与面间几何依赖,输出紧凑的潜在三平面均值与方差分布。为了在体素解码阶段保留几何边缘的平滑性与薄结构完整性,设计了基于符号距离(SDF)的半连续占有率映射函数: $$ \tilde{o}_i(\mathbf{x}) = \begin{cases} 1, & \text{sdf}_i(\mathbf{x}) < -s \ \frac{1}{2} - \frac{\text{sdf}_i(\mathbf{x})}{2s}, & -s \leq \text{sdf}_i(\mathbf{x}) \leq s \ 0, & \text{sdf}_i(\mathbf{x}) > s \end{cases} $$ 其中过渡带阈值取 \(s = 1/512\)。卷积解码器将潜在特征上采样后,MLP 仅需查询三平面正交投影特征的总和即可预测高分辨率体素占有率,使得异构的人体与物体均能在无模板预设的前提下获得亚体素精度的几何还原。

2. HOIT-T 与相机感知嵌入:消除图像裁剪引起的空间歧义 单目 HOI 重建通常将目标人-物交互区域裁剪并缩放为固定尺寸输入骨干网络,但这种局部视口变换丢失了绝对距离和视野范围,导致单目深度与空间缩放产生严重歧义。HOIT-T 冻结预训练 DINO-ViT-B/14 提取富含 3D 几何感知的图像 Token,同时根据全图内参及人体-物体联合外接框通过几何约束解析求解出相机平移向量 \(t_c\) 与裁剪后等效内参 \(K_\text{crop}\)。将相机参数展平后经由 MLP 映射为 128 维几何相机嵌入 \(\tilde{c}\),并通过自适应层归一化(adaLN)动态调制 Transformer 模块中的特征状态: $$ \text{adaLN}_c(\mathbf{f}_j) = \text{LN}(\mathbf{f}_j) \cdot (1 + \gamma) + \eta $$ 调制后的三平面 Query 依次与图像 Token 执行交叉注意力以汲取外观线索,随后经由自注意力构建三维空间连通性,使 2D 视觉先验能够精确对应到真实空间物理尺度。

3. 隐空间多约束对齐:防止对人体模板过拟合与特征退化 直接使用回归损失监督三平面预测时,模型极易退化到仅拟合变化平缓的人体大形,导致对几何多变的物体预测失真甚至崩溃。本文在 HOIT-T 的训练目标中同时引入均方误差损失 \(\mathcal{L}_\text{MSE}\)、余弦相似度损失 \(\mathcal{L}_\text{SIM}\) 以及 KL 散度约束 \(\mathcal{L}_\text{KL}\)。其中余弦相似度损失显式拉齐预测三平面特征与 VAE 后验特征的方向向量,迫使网络关注物体细微凹凸与空间边界的高频几何表征;KL 散度则约束隐空间分布在先验流形内平滑演化。三者联合使网络在保持人体合理骨架的同时,大幅提升了任意几何物体的重建保真度。

4. 结合 DPoser-X 的几何引导姿态拟合:修复量化失真的手部交互细节 三平面特征经体素离散化与 Marching Cubes 抽取后,末端细小部位(如张开的手指、复杂的握持微形态)容易出现表面粘连或形态平滑。为得到符合解剖学结构的标准人体模型,系统在后处理中以 Hand4Whole 参数为初值,优化 SMPL-H 参数(姿态 \(\theta\)、体型 \(\beta\)、全局方向 \(\psi\)、平移 \(t_h\) 及尺度 \(s\))。优化目标不仅包含 SMPL-H 顶点与 HOIT-T 预测解离网格点云间的双向 Chamfer 距离 \(\mathcal{L}_\text{dist}\),更引入了基于扩散先验的全身姿态正则项 \(\mathcal{L}_\text{prior}\)(DPoser-X),严格阻止手指穿透或非自然形变,使得最终输出的人体既贴合解算出的隐式表面,又具备工业级可用的骨骼与手势参数。

损失函数 / 训练策略

HOIT-VAE 采用两阶段解耦训练机制。第一阶段训练 VAE,查询点集 \(\mathcal{Q}\) 由近表面精细点 \(\mathcal{Q}_s\)(20480点)和全空间均匀采样点 \(\mathcal{Q}_u\)(20480点)构成,联合二值交叉熵(BCE)与潜变量 KL 散度: $$ \mathcal{L}\text{VAE} = \sum}, \text{object}}} \mathbb{E{\mathbf{q} \in \mathcal{Q}} \left[ \text{BCE}(\tilde{o}_i(\mathbf{q}), \hat{o}_i(\mathbf{q})) \right] + \lambda\text{KL} \mathcal{L}\text{KL} $$ 其中 \(\lambda_\text{KL} = 10^{-6}\),在 4 张 RTX A6000 上采用 AdamW(学习率 \(5\times 10^{-5}\))于合成数据集 ProciGen 训练 130K 步。第二阶段固定 HOIT-VAE 解码器,训练 HOIT-T: $$ \mathcal{L}\text{all} = \lambda_1 \mathcal{L}\text{MSE} + \lambda_2 \mathcal{L}\text{SIM} + \lambda_3 \mathcal{L}_\text{KL} $$ 权重设为 \(\lambda_1 = 1.0, \lambda_2 = 1.0, \lambda_3 = 10^{-6}\),采用 AdamW(学习率 \(1\times 10^{-4}\))训练 100K 步。

实验关键数据

主实验

在 BEHAVE 与 InterCap 真实数据集上,以归一化相机坐标系下的 Chamfer Distance 计算 [email protected],并统计接触精度(Contact\(_p\))与召回率(Contact\(_r\))。对比方法涵盖基于模板的 CHORE、CONTHO、HOI-TG 以及基于点云扩散无模板的 HDM。

数据集 方法 人体 F-score ↑ 物体 F-score ↑ 联合 F-score ↑ 接触精度 ↑ 接触召回 ↑
BEHAVE CHORE 0.3454 0.4258 0.3966 0.587 0.472
CONTHO 0.5690 0.3177 0.5173 0.628 0.496
HOI-TG 0.5913 0.3278 0.5354 0.662 0.554
HDM 0.3925 0.5049 0.4604 - -
Ours (无拟合) 0.5560 0.5391 0.5723 - -
Ours (含拟合) 0.5199 0.5356 0.5497 0.619 0.684
InterCap CHORE 0.4064 0.5135 0.4687 0.339 0.253
CONTHO 0.4261 0.2305 0.3840 0.661 0.432
HOI-TG 0.4465 0.2118 0.3953 0.700 0.473
HDM 0.4399 0.6072 0.5344 - -
Ours (无拟合) 0.6323 0.6192 0.6432 - -
Ours (含拟合) 0.5882 0.6107 0.6298 0.726 0.560

消融实验

消融实验深入验证了 HOIT-VAE 的分辨率与连续性设计,以及 HOIT-T 的损失项与相机嵌入的有效性(在 BEHAVE 数据集上评估)。

表 1: HOIT-VAE 结构消融(体素分辨率与半连续占有率) | 体素分辨率 | 半连续表示 | 人体 F-score ↑ | 物体 F-score ↑ | 联合 F-score ↑ | |:---:|:---:|:---:|:---:|:---:| | 128 | ✗ | 0.9505 | 0.9625 | 0.9611 | | 128 | ✓ | 0.9647 | 0.9746 | 0.9740 | | 256 | ✗ | 0.9696 | 0.9731 | 0.9738 | | 256 | ✓ | 0.9848 | 0.9900 | 0.9905 | | 512 | ✗ | 0.9745 | 0.9814 | 0.9804 | | 512 (完整模型) | ✓ | 0.9858 | 0.9912 | 0.9913 |

表 2: HOIT-T 关键组件消融(多损失监督与相机感知嵌入) | 配置 | \(\mathcal{L}_\text{MSE}\) | \(\mathcal{L}_\text{SIM}\) | \(\mathcal{L}_\text{KL}\) | 相机嵌入 | 人体 F-score ↑ | 物体 F-score ↑ | 联合 F-score ↑ | 说明 | |:---|:---:|:---:|:---:|:---:|:---:|:---:|:---:|:---| | 仅 MSE | ✓ | ✗ | ✗ | ✓ | 0.5922 | 0.3885 | 0.5602 | 物体严重失真,过度偏向人体 | | MSE + SIM | ✓ | ✓ | ✗ | ✓ | 0.4838 | 0.4434 | 0.4934 | 缺乏分布正则,泛化度下降 | | 无相机嵌入 | ✓ | ✓ | ✓ | ✗ | 0.5002 | 0.4794 | 0.5144 | 缺失绝对尺度与视锥对齐先验 | | 完整模型 | ✓ | ✓ | ✓ | ✓ | 0.5560 | 0.5391 | 0.5723 | 取得人体与物体最佳平衡 |

关键发现

  • 解决人-物重建失衡:HOI-TG 等显式模板监督方法在物体指标上显著落后(BEHAVE 上物体仅 0.3278),而本文无拟合版本达到 0.5391,联合指标达到 0.5723(提升 0.0369),彻底改变了以往“人体重建极好但物体完全崩塌”的割裂局面。
  • 余弦损失对物体重建不可或缺:只使用 MSE 时物体 F-score 跌落至 0.3885,引入余弦相似度损失后,特征方向对齐显著压制了人体模板的支配效应,大幅改善对称物体(如桌椅、手提箱)的空间朝向辨识。
  • 半连续占有场的薄壁保护作用:HOIT-VAE 在 512 分辨率下使用半连续占有率相比二值占有率,人体提升 1.13%,物体提升 0.98%,避免了离散体素网格截断造成的薄结构镂空。
  • 姿态拟合的折衷效应:SMPL-H 拟合略微降低了表面 F-score(因为投影到了受限的低维骨骼流形),但在接触召回率上实现了大幅跃升(BEHAVE 上从 0.554 提升至 0.684),并彻底消除了手部在隐式重建中的肉团状伪影。

亮点与洞察

  • 空间表示的无模板统一性:巧妙地避开了显式网格难以对齐无规则物体的拓扑鸿沟,采用正交三平面隐式占有场包容所有拓扑,同时规避了纯点云扩散模型收敛慢、需繁琐后处理的缺陷。
  • 闭式相机求解与 adaLN 动态调制的结合:通过解析几何约束而非网络黑盒回归相机参数,再用 adaLN 将视锥与尺度参数注入特征通道,用极小的参数代价消除了局部裁剪与世界坐标间的比例歧义。
  • 向复杂交互场景迁移的潜力:统一三平面表征理论上不局限于单人单物交互,其正交投影视角与多尺度体素解码器可自然泛化至多人与多物体接触环境。

局限与展望

  • 未见类别的泛化边界:HOIT-T 依赖有限数据训练的条件预测,在面对训练集未涵盖的罕见几何物体或外形怪异工具时,物体三平面重建的凹陷细节会出现退化。
  • 严重遮挡下的几何幻觉:当人体与物体发生大面积相互遮挡时,单目线索极度匮乏,模型可能生成物理合理但在背面与真实物体存在偏差的补全网格。
  • 后处理拟合的阶段割裂:当前的 SMPL-H 姿态拟合作为独立后处理,未能将骨架与动力学先验反向梯度端到端传递给 HOIT-T,未来可探索可微姿态参数化的端到端联合迭代。

相关工作与启发

  • vs CONTHO / HOI-TG: 两者均在显式网格上建立顶点层面的接触损失或图卷积连接,极度受制于固定的 SMPL 拓扑,对形状多样的非标物体泛化能力差;本文使用无模板的统一三平面隐特征空间,同时均衡了人体的柔性形变与物体的刚性几何。
  • vs HDM / TriDI: HDM 采用去噪扩散模型直接生成联合无序点云,推断需要几十步迭代且常需复杂表面重建后处理;本文通过 VAE + 单步 Transformer 直接预测三平面特征,不仅单次推断速度快,且输出的隐式场天然平滑连续。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次将统一三平面特征空间引入单目人-物交互三维重建,解耦了模板依赖并兼顾连续性]
  • 实验充分度: ⭐⭐⭐⭐⭐ [在 BEHAVE、InterCap 及 HODome 多数据集上详尽对比基线,包含全面的网格消融与定性展示]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑紧密,架构与数学公式表述严谨清晰]
  • 价值: ⭐⭐⭐⭐ [为具身交互感知、无模板三维交互建模提供了简洁稳定的全新表征范式]