跳转至

Reconstructing Humans and Objects in Interaction using Large Reconstruction Models

会议: ECCV 2026
论文: ECCV 2026
代码: https://ac5113.github.io/MILO
领域: 3D视觉
关键词: 3D人-物交互 / 大重建模型 / SMPL-H拟合 / 几何脚手架 / 语义对应

一句话总结

MILO将单目3D人-物交互重建问题重新表述为“解释大重建模型(LRM)生成的联合网格”,将LRM网格作为保留相对空间与邻近线索的非参数化几何脚手架,通过多视角关键点三角化两阶段拟合SMPL-H人体模型与分割对齐物体,在无需任何真实接触先验的情况下刷新了多个数据集的SOTA。

研究背景与动机

在日常生活与人机协作中,人类无时无刻不在与周围形形色色的物体发生着复杂的物理接触与交互。从手持工具、日常器皿到大型家具,从单手抓握到全身协同支撑,单幅RGB图像的3D人-物交互(3D Human-Object Interaction, 3D HOI)重建是AR/VR沉浸式交互、远程遥操作以及具身智能机器人学习人类技能的核心基础技术。然而,从单张未校准RGB图像恢复三维人-物交互极具挑战性:单目视角天然存在尺度与深度的内在多义性,物体几何外形千差万别且缺乏像人体SMPL那样的通用参数化先验,加之交互过程中人与物体之间严重互相遮挡,使得传统方法难以准确解耦并对齐两者的空间相对位置。

现有主流范式主要分为基于显式物体CAD库检索拟合与基于接触约束优化的两条路线。然而,这两类方法都存在明显的泛化瓶颈:一方面,受限于现有受控实验室数据集(如BEHAVE、InterCap)较小的物体类别覆盖面,检索范式遇到开放世界未知几何物体时极易崩溃;另一方面,为了克服单目重投影优化的欠定性,许多方法强烈依赖特权信息,例如地面真值接触图(Ground-Truth Contact Maps)或预测的紧接触先验来约束人-物穿透和脱空。一旦脱离密集体素或顶点级接触监督,优化极易发散,无法泛化到复杂野外真实交互场景中。

本文的切入视角在于重新思考近年来大重建模型(Large Reconstruction Models, LRMs)在开放域3D生成中的涌现能力。作者发现,在大规模3D数据上预训练的LRM不仅能生成高质量单体物体,更能在接收人-物交互RGBA图像时自然生成包含人与物体的整幅粗几何网格——这个联合网格虽然表面细节不够精准且缺乏骨骼驱动绑定,但却天然编码了精准的人-物相对空间布局与邻近几何线索。核心 idea:将单目3D人-物交互重建解构为“解释LRM交互网格”,将联合网格作为整体几何脚手架,在其上分解出人与物体点云,通过多视角鲁棒三角化关键点进行两阶段SMPL-H人体拟合,并可选地利用跨视角语义对应对齐CAD模板,彻底摆脱对接触先验与特权标注的依赖。

方法详解

整体框架

MILO的输入为单张RGB图像及其实例分割遮罩(RGBA),输出为三维空间中对齐的SMPL-H人体网格以及对应物体的空间点云(或对齐的CAD网格)。整个处理流水线包含四个核心阶段:首先利用通用LRM(默认采用Hunyuan3D-2.0)直接预测联合的人-物3D网格脚手架;接着从60个虚拟视角渲染该网格,利用2D姿态估计器检测多视角人体与手部关键点,通过RANSAC鲁棒多视角三角化得到无漂移的3D骨骼点集;第三阶段以此3D点集和可见顶点Chamfer损失引导两阶段SMPL-H优化(全局根节点对齐与全身姿态拟合);最后在多视角下进行点云实例分割剥离出物体几何,并在可选模板模式下通过几何感知语义对应进行Sim(3)匹配与最近邻微调。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单张输入图像 (RGBA)"] --> B["联合网格生成<br/>Hunyuan3D-2.0 生成人-物几何脚手架"]
    B --> C["多视角渲染与3D关键点三角化<br/>60个虚拟视角 + ViTPose/HaMeR + 几何共识过滤"]
    C --> D["两阶段人体参数化优化<br/>根节点粗定位 + 锚定自适应姿态拟合"]
    B --> E["多视角点云实例分割<br/>视点质量与接触边界加权投票提取物体"]
    D --> F["无模板模式:组合人体与物体点云"]
    E --> F
    E --> G["双向语义对应与模板对齐<br/>前向匹配+循环一致性过滤+迭代Sim(3)拟合"]
    G --> H["模板模式:组合人体与精细CAD网格"]

关键设计

1. 联合网格生成与几何脚手架抽取:跳过2D单目深度多义性

以往方法将人与物体分别独立重建后再放入场景优化,极易受到单目相机下人体与物体尺度、深度不匹配的困扰。MILO反其道而行之,利用大重建模型在海量3D资产中学习到的空间结构先验,直接以包含人与物体的RGBA图像作为输入,运行现成的Hunyuan3D-2.0生成统一的非参数化联合网格。这个网格并非最终的直接输出,而是充当一个空间约束脚手架:由于网络前向推理时已经隐式考虑了人体四肢与物体的相对环抱、托举、倚靠等视觉空间关系,使得原本高度欠定的单目3D深度与相对朝向问题,被固定为一个具有物理近似有效性的三维参考体。

2. 多视角鲁棒3D关键点三角化与两阶段人体拟合:实现参数化解耦与抗遮挡锚定

为了从非参数化的粗糙LRM网格中恢复符合人体运动学结构、具有骨骼驱动能力的SMPL-H模型,MILO在虚拟球面上均匀采样60个视角渲染该网格,在每个渲染视角上分别运行ViTPose检测COCO-25身体关节点、运行HaMeR检测手部关节点。由于单视角预测可能存在误检与自遮挡漂移,系统在所有成对视点间进行光线三角化,以最大重投影内点集共识选定假设,并执行非线性优化得到 \(X \in \mathbb{R}^{67 \times 3}\) 的高质量3D关键点及聚合置信度 \(\bar{c}\)

在参数化拟合阶段,以单目回归模型HMR2.0与HaMeR输出作为初值,执行两阶段由粗到细优化: 第一阶段为根节点拟合(Root Fitting,30轮迭代),固定人体姿态与形状,仅优化全局旋转 \(\Phi\)、位移 \(\Gamma\) 以及人体全局缩放因子,采用Geman-McClure鲁棒核函数对齐骨骼点与三角化3D关键点: $\(\mathcal{L}_{rf} = \sum_{i} \rho(X_i^S - X_i)\)$ 第二阶段为姿态拟合(Pose Fitting,60轮迭代),全面解冻姿态 \(\Theta\)、手部姿态 \(\Theta_h\) 与体型 \(\beta\)。针对人体被物体严重遮挡时LRM可能脑补出穿模或畸变四肢的问题,引入人体姿态锚定损失(Human Anchoring Loss): $\(\mathcal{L}_{ha} = \sum_{j} \max\left(0, |\zeta_{bp, j} - \zeta_{bp, j}^{\mathrm{hmr}}| - \tau\right)\)$ 其中 \(\zeta_{bp}\) 为VPoser隐空间中的姿态表征,\(\tau=2.5\) 为容差阈值,允许姿态微调但强力抑制偏离单目真实观测的结构突变。同时,定义单向鲁棒可见表面Chamfer损失,仅从LRM观测点云 \(P^{\mathrm{obs}}\) 指向SMPL-H的可见顶点子集 \(P_{\mathcal{V}}^{\mathrm{pred}}\),有效避免未观测盲区引发的错误吸引。

3. 多视角点云分割与接触边界加权过滤:干净分离物体几何

将人体模型拟合到位后,必须从联合网格中精准剥离出物体几何。由于网格在人-物接触面处往往连成一体,单纯基于空间距离切割容易在手部或坐姿处残留人体碎块。MILO利用前述多视角渲染图,通过开放词表分割模型(如Grounding DINO + SAM)输入提示词 person.<obj_name> 获取语义掩码。在反投影标记顶点时,设计了综合视点观测法向量(视点质量)与物体接触边界距离权重的聚合投票策略:离接触交界处越近的像素给予更保守的判定权重,最后经过几何连通域滤波清理孤立悬空噪点,得到高信噪比的纯物体点云 \(P^{\mathrm{lrm}}\)

4. 跨模态语义对应与渐进式Sim(3)模板对齐:支持开箱即用与模板增强双模式

当交互场景预先提供CAD候选模板时,MILO支持将理想网格高精度对齐至脚手架。为解决无纹理CAD与真实渲染之间的域差异,算法在多视角渲染图上提取几何感知语义特征,计算全局相互最近邻相似度,从候选视角对中提取得分最高的双向密集像素匹配。利用2D投影距离与局部余弦阈值将2D匹配提升至3D顶点对,并施加反向近邻循环一致性检验过滤不稳定对应,形成稀疏加权对应点集 \(\mathcal{C} = \{(u_{i_k}, v_{j_k}, w_k)\}\)。首先利用带权Kabsch算法闭式求解初值 \(T(u) = s\mathbf{R}u + \mathbf{t}\),随后进入迭代微调:在每一轮中结合语义对应点与物体点云最近邻约束,并逐步收紧最近邻内点距离阈值 \(\tau_t\),兼顾全局语义朝向与局部几何轮廓吻合。

损失函数 / 训练策略

整个SMPL-H优化过程完全在测试时执行(Test-time Optimization),无需端到端重训网络权重。总优化目标函数定义为: $\(\mathcal{L}_{pf} = \lambda_{rf}\mathcal{L}_{rf} + \lambda_{bp}\mathcal{L}_{bp} + \lambda_{hp}\mathcal{L}_{hp} + \lambda_{\beta}\mathcal{L}_{\beta} + \lambda_{ha}\mathcal{L}_{ha} + \lambda_{3D}\mathcal{L}_{3D}\)$ 其中超参数权重分别设置为 \(\lambda_{rf} = 10\)\(\lambda_{bp} = \lambda_{hp} = 0.04\)(VPoser与MANO隐先验正则项),\(\lambda_{\beta} = 0.05\)\(L_2\) 体型先验),\(\lambda_{ha} = 10\)(姿态锚定先验),以及 \(\lambda_{3D} = 50\)(可见表面Chamfer约束)。

实验关键数据

主实验

论文在InterCap、HODome和IMHD三个具有高精度3D真值的主流人-物交互基准上进行了全方位评测,主要评估指标为经Procrustes刚性对齐后的Chamfer距离(PA-CD,单位cm),分别汇报人体(PA-CDh)、物体(PA-CDo)以及整体人-物联合体(PA-CDh+o)。

下表展示了InterCap数据集上的对比结果(遵循Cseke等人的域外评估协议,对比基线在BEHAVE上训练):

方法 (Methods) 类型 (Type) 依赖模板 (Template) 依赖接触 (Contact) PA-CDh (cm) ↓ PA-CDo (cm) ↓ PA-CDh+o (cm) ↓
CONTHO [CVPR 2024] 回归 (Reg.) 8.36 24.30 13.14
HOI-TG [CVPR 2024] 回归 (Reg.) 8.22 25.05 14.63
PHOSA [ECCV 2020] 优化 (Opt.) 10.07 23.36 13.38
Open3DHOI [ECCV 2024] 优化 (Opt.) 6.88 31.18 10.17
PICO [CVPR 2025] 优化 (Opt.) 7.43 21.85 10.33
Ours (带模板模式) 优化 (Opt.) 6.96 18.97 7.45
Ours (无模板模式) 优化 (Opt.) 6.85 20.74 9.36

在另外两个包含更丰富物体类别的HODome与IMHD基准上,MILO同样大幅超越了先前的最强基准PICO: - 在HODome上,MILO带模板模式的联合指标 PA-CDh+o 达到 6.68 cm(无模板 6.38 cm),相比PICO的 10.07 cm 误差下降超过 33%; - 在IMHD上,MILO无模板模式的 PA-CDh+o 仅为 6.98 cm(带模板 10.10 cm),显著优于PICO的 13.24 cm。

在人体接触预测指标上(Table 4),基于MILO空间几何计算的接触相较于前沿接触回归模型DECO(F1 9.37%、几何误差 126.70 cm),取得了 30.00% 的F1值和 39.57 cm 的几何误差,展现出压倒性的三维接触推断一致性。

消融实验

为了严格厘清性能增益的真正源泉,作者设计了针对网格骨干、联合脚手架作用及优化各阶段的系统消融。

1. 联合脚手架与独立重建对比消融(Table 6,InterCap)

重建基线 (Baseline) 接触损失约束 PA-CDh (cm) ↓ PA-CDo (cm) ↓ PA-CDh+o (cm) ↓
EasyHOI* 全身改版 (纯单体LRM+轮廓拟合) 41.57 77.06 37.21
EasyHOI* 全身改版 (纯单体LRM+接触优化) 9.48 27.93 12.08
SAM3D 独立重建 (独立预测+MoGe对齐) 18.18 31.07 15.89
MILO 联合脚手架 (Ours) 6.85 20.74 9.36

2. 人体优化阶段消融(Table 7,InterCap)

人体拟合配置 (Fitting Stage) 模板使用 PA-CDh (cm) ↓ PA-CDo (cm) ↓ PA-CDh+o (cm) ↓
未拟合 (No fitting,直接取LRM人体点云) 30.58 23.53 14.10
仅根节点拟合 (Root Fitting) 7.98 22.53 10.15
完整姿态拟合 (Pose Fitting) 6.85 20.74 9.36
未拟合 (No fitting) 14.97 37.02 14.57
仅根节点拟合 (Root Fitting) 7.79 18.63 7.99
完整姿态拟合 (Pose Fitting) 6.96 18.97 7.45

关键发现

  • 联合脚手架是解决HOI深度多义性的决定性因素:从Table 6可以看出,若把人与物体拆开独立重建再依靠2D轮廓重投影或MoGe深度拼接,整体误差高达 37.21 cm 与 15.89 cm;而联合LRM脚手架直接将整体误差压缩至 9.36 cm,证明大重建模型在多模态联合几何表征上具备极佳的空间关系先验。
  • 参数化SMPL-H拟合不仅规范人体,反哺整体一致性:如Table 7所示,未进行参数化拟合的原始LRM人体网格由于网格噪点与拓扑缺陷,人体PA-CD误差高达 30.58 cm;引入根节点与姿态两阶段优化后降至 6.85 cm,同时联合误差由 14.10 cm 降至 9.36 cm。
  • 算法对底层LRM不敏感:在Table 5中,换用SAM3D(联合模式)得到的 PA-CDh+o 为 9.80 cm,与Hunyuan3D-2.0的 9.36 cm 相当,验证了MILO是一种通用的“LRM后处理与解耦”框架,能够直接受益于未来更强LRM的演进。

亮点与洞察

  • 研究视角的颠覆性转换:不同于以往将HOI视为“分别估计然后费力拼合/碰撞避免”的传统思路,MILO将大模型生成从“端到端黑盒生成”降级为“粗粒度几何脚手架”,让经典的参数化SMPL优化与现代视觉几何在LRM网格上形成完美闭环。
  • 摆脱特权先验与接触标注束缚:以往SOTA方法(如PICO、CONTHO)必须仰赖密集体素接触标签或显式法向量碰撞损失,限制了野外应用。MILO在完全不用接触损失的前提下,在整体联合指标上全面超越依赖接触的基准,且能自发反推出高质量的接触图。
  • 模板自由度极高:提供“无模板(自由几何点云)”与“有模板(CAD语义检索对齐)”无缝切换能力,使算法既能在受控工业基准上高保真输出CAD位姿,又能在开放野外场景下处理任意拓扑形状的日常交互物品。

局限与展望

  • 性能上限受限于上游LRM的初始重建质量:当输入图像中人与物体尺度极度悬殊(如极细长画笔、小巧钥匙)或遮挡率极端严重时,LRM输出的脚手架可能存在拓扑粘连或局部缺失,后续点云分割与对齐难以完全挽救。
  • 点云多视角分割的边界精度依赖2D分割模型:目前依赖Grounding DINO与SAM的多视角投票,在手部抓握指缝等复杂微小接触面处,分割边界仍偶有毛刺与误分类。
  • 单帧与单人局限:目前框架针对单幅静态图像设计,尚未建模时序动态物理交互(如动量、摩擦力),且暂未扩展到多人-多物复杂协同交互场景。

相关工作与启发

  • vs EasyHOI [CVPR 2025]: EasyHOI仅将LRM用于单体手持物体的独立生成,后续仍需复杂的2D重投影与接触约束拼合;MILO首次将LRM拓展至“人+物”整幅联合场景脚手架,从根本上消除了人-物相对漂移与错位。
  • vs PICO [CVPR 2025]: PICO强依赖CAD检索库覆盖率以及真实接触热力图引导下的物理穿透惩罚;MILO通过非参数化脚手架提供全局相对定位,既无需接触输入,又支持无模板自由重建,对开放世界未知物体的适应能力显著更强。
  • vs CONTHO [CVPR 2024]: CONTHO依赖回归模型直接预测顶点级接触图并进行位姿微调,跨数据集泛化(域外评估)性能掉点严重;MILO采用测试时优化与通用视觉模型(ViTPose、HaMeR、Hunyuan3D),展现出卓越的域外迁移稳健性。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [敏锐洞察大重建模型在联合人-物空间布局上的隐式几何先验,重构了3D HOI技术管线]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖三个主流基准、消融设计极其严谨、设置独立重建与接触损失隔离基线]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密流畅,图表直观,方法各个模块的数学表达清晰明确]
  • 价值: ⭐⭐⭐⭐⭐ [为单目人-物具身交互重建探索出了一条与基础模型深度结合的极具实用价值的全新技术路径]