跳转至

MessyKitchens: Contact-rich object-level 3D scene reconstruction

会议: ECCV 2026
论文: ECCV 原文
项目主页: https://messykitchens.github.io/
领域: 3D 视觉
关键词: 3D场景重建, 物体级重建, 物理接触约束, 多物体解码器, 混乱场景基准

一句话总结

针对复杂杂乱场景中物体级单目 3D 重建缺乏物理真实感与跨物体穿透严重的痛点,本文提出了具备毫米级配准精度与接触保真度的 MessyKitchens 基准数据集,并构建了基于 SAM 3D 的多物体联合姿态微调解码器(MOD),显著提升了接触图预测与场景级几何重建质量。

研究背景与动机

单目 3D 场景重建在过去几年中取得了飞速进展,由大规模预训练模型驱动的单目深度估计与全场景几何重建已达较高水平。然而,在具身智能抓取操作、物理仿真和计算机动画等实际应用中,系统不仅需要全局表面网格,更高度依赖于将复杂场景精确解耦为独立的 3D 物体实例,并准确还原各物体之间的物理接触、支承与相对位姿关系。现有的物体级 3D 重建基准(如 GraspNet-1B、HouseCat6D、GraspClutter6D)受限于数据采集设备或多物体粗糙配准流程,真值网格中普遍存在不可忽略的跨物体相互穿透以及接触分离误差,无法为微观物理接触与精细位姿估计提供高保真评测标尺。

在方法层面,传统的物体级场景重建范式要么依赖局限的 CAD 检索匹配,要么直接利用单物体几何预测模型对检测框独立预测。例如,近期强大的基础模型 SAM 3D 能够基于输入图像和分割掩码以端到端方式估计单物体的 3D 形状与 7-DOF 空间姿态,但其将场景中的物体作为彼此隔离的独立 token 分别处理,缺乏对多物体空间排布与物理遮挡关系的端到端上下文建模。这种孤立预测机制在堆叠、嵌套等富接触复杂场景中极易导致物体相互穿透或处于不稳定的“悬空”姿态,破坏了整体场景的物理合理性与空间自洽性。

为了突破高保真评测基准与联合物理建模的双重瓶颈,本文从数据与算法两端同步切入:一方面设计了双面扫描与法向量一致性引导的高精度配准方案,构建了覆盖 100 个真实复杂厨房场景的高精度物理接触基准 MessyKitchens;另一方面,针对单物体预测割裂全局关系的弊端,核心 idea 是设计即插即用的多物体解码器(MOD),通过在物体级形状与姿态 token 间交替堆叠跨物体自注意力和几何交叉注意力,联合预测场景感知的姿态残差修正量,以纯数据驱动方式恢复全局自洽且物理可行的多物体 3D 场景。

方法详解

整体框架

整体管线以单张 RGB 图像和对应的 2D 目标实例掩码为输入。首先利用 SAM 3D 的图像编码器与掩码条件机制,为场景中检测到的 \(N\) 个物体分别提取形状 token 与姿态 token,并初步解耦出单物体的体素几何与初始 7-DOF 空间姿态 \(p_i=(q_i, t_i, \sigma_i)\)。随后,为了在保留高质量几何预测的同时消除跨物体穿透并修正相对位姿,方法将所有物体的几何与姿态 token 聚合输入到多物体解码器(Multi-Object Decoder, MOD)中。MOD 经过 \(K\) 层的物体内自注意力、多物体姿态自注意力以及姿态-形状跨注意力交互,预测各物体的场景感知姿态残差修正量 \(\tilde{p}_i=(\tilde{q}_i, \tilde{t}_i, \tilde{\sigma}_i)\),最终将残差与初始姿态相加输出物理协调的场景级 3D 重建结果。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单张 RGB 图像 + 2D 实例掩码"] --> B["SAM 3D 基础网络<br/>单物体独立编码与初始位姿估计"]
    B --> C["聚合场景级 Token 集合<br/>姿态 Tp 与形状 Ts"]
    C --> D["单物体内序列自注意力<br/>保留个体独立语义与表达能力"]
    D --> E["跨物体全局姿态自注意力<br/>扁平化序列关联全场所有物体姿态"]
    E --> F["几何感知跨模态交叉注意力<br/>查询所有物体的 3D 形状几何特征"]
    F --> G["线性回归姿态残差修正量<br/>Δq, Δt, Δσ"]
    G --> H["残差相加与坐标对齐<br/>物理可行的多物体场景重建"]

关键设计

1. 接触富集基准构建与法向一致性配准:解决真值穿透与薄壁对称歧义 针对现有基准标注精度不足及接触面穿透严重的痛点,数据采集搭建了专属双面光学扫描装置,将物体置于高透光学亚克力面板上,利用双面反光标记点在不移动物体的前提下采集上下两组稠密网格并融合成高保真 3D 资产(点到网格误差低于 0.05 mm)。场景构建分为易(4 个平铺无接触物体)、中(6 个含平放与稳定堆叠物体)、难(8 个含嵌套、深层重合与最大化接触物体)三档,真实扫描后采用两阶段配准算法:第一阶段优化最近点表面欧氏距离;第二阶段针对餐具大多为轻薄凹陷几何体的特点,引入严格的表面法向量一致性惩罚。由于薄壁物体的内外表面距离极其接近,常规 ICP 极易陷入将扫描面夹在物体两壁之间的局部极小,法向量共线性约束彻底避免了壁面误配,将场景配准的平均深度误差压缩至 1.62 mm,接触面与穿透面积比降至 0.14。

2. 多物体姿态-形状交叉解码器:解决独立预测导致的物理穿透与悬空 SAM 3D 单独估计每个物体的姿态会导致局部最优而全局冲突,MOD 构建了包含 \(K=3\) 个特征交互块的专用解码器。对于场景内 \(N\) 个物体的姿态 token \(T^p \in \mathbb{R}^{N \times F_p \times C}\) 与形状 token \(T^s \in \mathbb{R}^{N \times F_s \times C}\),每个交互块首先在批次维度为 \(N\) 的前提下对每个物体沿 token 序列维度做标准自注意力计算,巩固单物体表征;接着将物体维度与序列长度展平成一维长序列 \(\hat{T}^p \in \mathbb{R}^{1 \times (N F_p) \times C}\),施加多物体全局自注意力 \(\text{SA}_{\text{multi}}\),让网络在单一上下文中捕获所有物体间的相对朝向与距离线索;最后以展平的混合姿态特征为 Query、展平的几何形状特征 \(T^s \in \mathbb{R}^{1 \times (N F_s) \times C}\) 为 Key 和 Value 实施多物体交叉注意力 \(\text{CA}_{\text{multi}}\)。几何信息的融入为姿态网络提供了实体占位轮廓,使网络能够精准感知邻接边界、阻挡面与承载面,在保持原网格结构不劣化的前提下通过微调 7-DOF 参数消除几何侵入。

3. 对称鲁棒几何度量与四元数双重覆盖监督:解决刚体优化歧义 在模型训练阶段,姿态残差学习受到旋转、平移、尺度与全局几何的联合多任务约束。针对四元数旋转中 \(q\) 与 \(-q\) 表征同一 3D 旋转的二重覆盖(double-cover)特性,设计了内积平方旋转对齐损失 \(\mathcal{L}_{\text{ip}} = 1 - \langle q, \hat{q} \rangle^2\),直接最小化 \(\mathrm{SO}(3)\) 流形上的测地距离而不受符号跳变干扰。同时,针对厨房餐具普遍存在的旋转对称性(如圆形碗盘无论绕对称轴如何旋转,几何外形完全相同),若采用点对点硬性监督会产生错误的惩罚梯度,因而引入了对称 Chamfer 距离几何损失: $$ \mathcal{L}{\mathrm{CD}}(S, \hat{S}) = \frac{1}{|S|}\sum|}\min_{\hat{x} \in \hat{S}}|x - \hat{x2^2 + \frac{1}{|\hat{S}|}\sum|_2^2 $$ 利用最近邻动态匹配天然吸收连续对称不确定性。最终联合目标函数配置为 } \in \hat{S}}\min_{x \in S}|x - \hat{x\(\mathcal{L} = 0.1 \mathcal{L}_{\mathrm{CD}} + 100 \mathcal{L}_t + 100 \mathcal{L}_s + 10 \mathcal{L}_{\mathrm{ip}}\),确保平移尺度快速收敛的同时精确对齐接触面。

损失函数 / 训练策略

模型在合成数据集 MessyKitchens-synthetic 上使用 4 张 NVIDIA A100 (40GB) GPU 进行端到端训练。该合成集包含按易、中、难三级物理动力学仿真构建的 1800 个接触场景,利用 Blender Cycles 光线追踪引擎以仰角 \(\iota \in [\pi/4, \pi/2]\) 和全周方位角 \(\phi \in [0, 2\pi]\) 渲染了 10,800 张逼真视图。优化器采用线性 Warmup(前 10% 步数)配合最大学习率 \(5 \times 10^{-5}\),总计训练 10 个 epoch,耗时仅需约 2 小时。由于 MOD 仅包含约 81M 参数且只作用于轻量 token,训练计算开销显著低于全量 3D 生成网络。

实验关键数据

主实验

论文在 MessyKitchens 真实测试集以及三个未见过的真实跨域数据集(GraspNet-1B、HouseCat6D、GraspClutter6D)上进行了全 zero-shot 泛化测试。评估指标包含物体级与场景级的体素交并比(IoU↑)和对称倒角距离(CD↓),使用 Sim(3) ICP 消除全局坐标系差异后对齐。

数据集 评估层级 PartCrafter MIDI SAM 3D MOD (本文) 相对 SAM 3D 增益
MessyKitchens Object IoU↑ / CD↓ 0.071 / 0.495 0.186 / 0.285 0.409 / 0.064 0.445 / 0.061 +8.8% / -4.7%
Scene IoU↑ / CD↓ 0.133 / 0.228 0.238 / 0.165 0.431 / 0.054 0.472 / 0.050 +9.5% / -7.4%
GraspNet-1B Object IoU↑ / CD↓ 0.020 / 0.956 0.067 / 0.640 0.336 / 0.082 0.344 / 0.078 +2.4% / -4.9%
Scene IoU↑ / CD↓ 0.075 / 0.355 0.121 / 0.327 0.356 / 0.074 0.377 / 0.069 +5.9% / -6.8%
HouseCat6D Object IoU↑ / CD↓ 0.029 / 0.852 0.092 / 0.433 0.325 / 0.125 0.404 / 0.100 +24.3% / -20.0%
Scene IoU↑ / CD↓ 0.114 / 0.289 0.172 / 0.215 0.374 / 0.099 0.458 / 0.079 +22.5% / -20.2%
GraspClutter6D Object IoU↑ / CD↓ 0.067 / 0.674 0.086 / 0.500 0.328 / 0.105 0.340 / 0.103 +3.7% / -1.9%
Scene IoU↑ / CD↓ 0.227 / 0.227 0.213 / 0.201 0.487 / 0.059 0.496 / 0.058 +1.8% / -1.7%

在物理接触真实度评测中,采用 PhySIC 的接触图准确率评估重建结果(表 3):

方法 接触精确率 Prec (%) ↑ 接触召回率 Rec (%) ↑ 接触综合度 F1 (%) ↑
PartCrafter 27.2 17.4 21.2
MIDI 38.9 48.1 43.0
SAM 3D 66.0 48.3 55.8
MOD (本文) 70.0 62.5 66.1

消融实验

1. 配准算法精度消融(评估基准构建阶段的不同策略)

| 配准策略 | 均值绝对深度误差 \(\mu_{|\delta|}\) (mm) ↓ | 中位数绝对深度误差 \(\text{med}_{|\delta|}\) (mm) ↓ | 标准差 \(\sigma_\delta\) (mm) ↓ | 说明 | | :--- | :--- | :--- | :--- | :--- | | 粗糙人工初始化 | 4.689 | 3.209 | 7.439 | 人工目视粗配准,基线误差偏大 | | 仅距离优化(Distance only) | 2.892 | 2.141 | 4.822 | 薄壁区域易陷入局部极值造成错位 | | 距离+法向量对齐(本文) | 1.615 | 0.911 | 3.827 | 深度中位数误差降低 57.5%,贴合最紧密 |

2. MOD 模块注意力机制与 Transformer 深度消融

消融维度 具体配置 Object IoU ↑ Object CD ↓ Scene IoU ↑ Scene CD ↓ 说明
特征交互类型 仅形状特征(Shape only) 0.438 0.063 0.463 0.054 缺少姿态间的全局自注意力拓扑
仅姿态特征(Pose only) 0.432 0.065 0.457 0.056 缺少实体 3D 几何占用边界约束
形状+姿态交互(S+P 本文) 0.445 0.061 0.472 0.050 双重线索结合表现最优
网络层数 \(K\) \(K = 1\) 0.441 0.061 0.467 0.051 单层交互容量偏低
\(K = 3\)(本文默认) 0.445 0.061 0.472 0.050 性能饱和兼顾计算效率
\(K = 6\) 0.403 0.065 0.427 0.059 深层引起过拟合,退化 SAM 3D 先验

关键发现

  • 接触质量飞跃:MOD 使接触 F1 指标从 SAM 3D 的 55.8% 飙升至 66.1%(提升达 10.3 个百分点),其中召回率从 48.3% 大幅提升至 62.5%,表明多物体上下文使模型具备了感知被遮挡与深层支承接触的能力。
  • 跨域零样本泛化稳健:虽然仅在由 42 种日常器皿构成的合成数据上微调,但在包含大量非厨房工业零件与家庭杂物的 HouseCat6D 上获得了高达 +24.3% 的物体级 IoU 提升,说明物理自洽性与接触先验具备高度的几何通用性。
  • 轻量微调优于深层结构:\(K=6\) 的深层注意力反而导致物体级 IoU 骤降至 0.403,主要原因是 SAM 3D 预训练特征已具备极高的几何表达力,仅需浅层非线性映射即可学习到有效的姿态排布残差,过深网络容易破坏原始先验。

亮点与洞察

  • 法向一致性解锁薄壁接触真值标定:针对餐具等薄壁凹曲面易产生内外壁穿透的难题,巧妙地在距离配准中引入法向对齐惩罚,使真实场景配准深度误差降至 1.62 mm,为 3D 视觉领域提供了极其罕见的高精度接触物理真值。
  • 解耦“单物体几何”与“全局拓扑姿态”:不试图端到端同时重新生成多物体三维网格,而是冻结单物体几何预测、仅微调 7-DOF 刚体姿态残差,以仅 81M 参数量和 2 小时训练成本撬动了整体物理真实感的显著提升。
  • 可复用的迁移价值:该即插即用范式天然契合所有基于单物体检测与重建的具身感知系统,只需在后端添加 MOD 轻量模块即可解决机械臂抓取前的物体悬空与虚拟碰撞问题。

局限与展望

  • 几何形变未联合修正:当前 MOD 仅微调刚体 7-DOF 位姿,不对单物体网格本身进行形变优化;若前端 SAM 3D 对严重遮挡物体的形状预测有较大缺陷,后端无法通过接触挤压进行局部网格修复。
  • 对初始实例分割强依赖:模型依赖 SAM 3 提取的 2D 目标掩码,当场景极度混乱导致前序分割产生漏检或重叠粘连时,未检测到的物体将无法参与姿态图的全局消息传递。
  • 未来方向:探索可微分物理引擎融入训练损失,并尝试将刚体姿态残差扩展至接触界面的局部非刚性网格形变联合微调。

相关工作与启发

  • vs SAM 3D: SAM 3D 是单物体预测的强基线,但独立推断忽略了空间排布约束;MOD 作为轻量插件引入多物体交互,完美解决了 SAM 3D 常见的穿透与悬空缺陷。
  • vs PartCrafter & MIDI: 扩散模型虽能联合生成多物体,但在真实杂乱图像上面临极大的分布漂移与模式崩溃(IoU 普遍在 0.1 以下);MOD 继承基础模型的几何泛化能力,实测性能大幅领先。

评分

  • 新颖性: ⭐⭐⭐⭐ [构建了高精度双面扫描接触基准,设计了优雅的几何姿态联合解耦微调机制]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 个真实复杂基准、细致的法向消融、接触图 F1 评估与 OOD 泛化验证]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图文对照清晰,实验指标完备]
  • 价值: ⭐⭐⭐⭐⭐ [为机器人操作与物理自洽 3D 重建提供了极具标杆意义的数据集与强有力基线]