跳转至

GARDEN: Gravity-Aligned Reconstruction of Disentangled ENvironments from RGB images

会议: ECCV 2026
论文: ECCV 官方
代码: https://sunjiahaovo.github.io/garden/
领域: 3D视觉
关键词: 重力对齐 / 场景解耦 / 物理仿真 / 混合表示 / 3D点分类

一句话总结

GARDEN 提出一种纯 RGB 输入的物理场景解耦框架,以重力先验构建统一的 Gravity-View 坐标系消除全局旋转歧义,通过非模态 3D 网格生成与 6-DoF 位姿精炼重建前景刚体,并借助条件 3D 点云分类剔除背景重复几何,形成兼具物理可交互性与高视觉保真度的结构化混合场景表示。

研究背景与动机

从多视角 RGB 图像中重建 3D 场景并构建可交互的数字孪生,在具身智能(Embodied AI)与虚拟物理仿真中具有核心价值。然而,当前基于神经辐射场(NeRF)、3D 高斯泼溅(3DGS)以及前馈多视角大模型(如 VGGT、DepthAnything-3)的隐式或连续表面重建系统,普遍输出单一整体的“3D 照片”(monolithic representations)。这种表示将前景刚体与背景环境深度交织在一起,既缺乏物体级别的独立几何结构,其坐标系又存在任意全局旋转的规范自由度(gauge ambiguity),缺失绝对重力轴的对齐,导致物体在物理引擎中无法稳定受力与放置。

为了赋予重建场景物理交互能力,现有工作如 LiteReality 和 ACDC 等通常采用“检测-检索-替换”的 CAD 代理资产管线。该路线先估计物体的 3D 边界框,再从预定义数据库中检索相似的 CAD 模型进行位姿对齐替换。然而,外部 CAD 资产很难匹配现实中任意长尾物体的精确几何与局部细节,替换过程破坏了真实场景特有的几何保真度;同时,串联的布局估计、检索与对齐管线极度耗时且容错率低,严重制约了实际场景向物理仿真环境的高效转化。

本文的切入视角是摒弃笨重的 CAD 检索替换,将场景重建重构为“物理立足的场景因子分解”(physically-grounded scene factorization)。重力作为现实世界普适且天然的物理先验,正是消除全局位姿歧义与锚定刚体放置的破局点。核心 idea:利用多视角特征回归全局重力方向建立 Gravity-View 统一物理坐标系,在此基准下联合非模态网格生成、重力约束的 6-DoF 位姿优化与条件 3D 点分类解耦背景,直接输出由独立刚体网格与纯净背景组成的结构化混合表示。

方法详解

整体框架

GARDEN 的输入为多视角无位姿 RGB 图像,最终输出包含独立前景刚体三角网格与纯净静态背景(彩色点云或 3DGS)的混合表示,直接导入 MuJoCo 物理引擎。整个流程分为四个阶段: 1. 重力对齐模块(Gravity-View Align):利用多视角几何大模型提取全局相机特征,通过跨注意力聚合多视角重力几何线索,回归参考视角的 6D 连续旋转,将场景统一旋转到重力向下的 Gravity-View(GV)物理坐标系; 2. 目标驱动物体生成与布局估计(Target-Driven Object Generation & Layout Estimation):用户框选或 VLM 提示确定目标物体,利用 SAM-3 提取 2D 掩码,由 SAM-3D 恢复完整非模态网格,再借助 FoundationPose 在重力约束下精细优化 6-DoF 刚体位姿; 3. 点条件背景解耦(Point-Conditional Background Disentanglement):针对插入显式网格后背景点云残留重复几何的问题,设计基于 Transformer 的条件 3D 点分类器,以物体表面采样点为条件,精确滤除背景中属于该物体的多余点; 4. 统一物理仿真构建(Unified Physics Simulation):基于重力高度分布提取地面平面作为碰撞体,导入前景刚体网格赋物理属性,将解耦后的背景作为高保真视觉底衬,实现 MuJoCo 稳定物理交互。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视角 RGB 图像输入"] --> B["重力对齐模块<br/>多视角特征 cross-attn 回归 R_c2gv"]
    B --> C["GV 坐标系下多视角粗重建<br/>点云/3DGS 绝对朝向校正"]
    C --> D["目标驱动物体生成与布局估计<br/>SAM-3D 非模态重建 + 重力约束 6-DoF 位姿"]
    D --> E["点条件背景解耦<br/>Transformer 交叉注意力剔除冗余点"]
    E --> F["统一物理仿真与混合渲染<br/>MuJoCo 刚体碰撞 + 高保真背景底衬"]

关键设计

1. 重力对齐坐标系(GV-Align):以物理先验消除规范自由度
纯视觉多视角重建模型(如 DepthAnything-3、VGGT)的坐标系要么锚定在不可控的参考相机视角,要么产生任意全局旋转,导致场景倾斜、地面与物体在高度投影上严重纠缠,在物理仿真中极易翻倒。GARDEN 借鉴 GVHMR 的 Gravity-View 坐标定义,在相机参考系下确定重力方向 \(g\) 后,定义 \(y = g\)\(x = \frac{y \times v}{\|y \times v\|}\)(其中 \(v = [0, 0, 1]^\top\) 为视线方向,共线时退回原相机 \(x\) 轴)、\(z = x \times y\),构建从相机到 GV 坐标系的旋转矩阵 \(R_{c \to \text{gv}} = [x, y, z]^\top\)。在架构上,系统冻结 DepthAnything-3 骨干提取各视角的全局相机 token \(F \in \mathbb{R}^{N \times C}\),以参考视角 token \(f_{\text{ref}}\) 为 query、全局 tokens 为 key 和 value 经过 Context Transformer Decoder 进行跨视角注意力汇聚,经 MLP 回归连续 6D 旋转向量,转换为正交旋转矩阵 \(\hat{R}_{c_{\text{ref}} \to \text{gv}}\)。训练时使用合成数据集的真实相机外参计算真实重力投影 \(R_{c \to \text{gv}}^{\text{gt}}\),直接以 L1 损失监督: $\(\mathcal{L}_{\text{rot}} = \|\hat{R}_{c_{\text{ref}} \to \text{gv}} - R_{c_{\text{ref}} \to \text{gv}}^{\text{gt}}\|_1\)$ 重力对齐将场景在垂直方向自然展开,大幅增强了支撑面与物体的几何可分性。

2. 重力约束的 6-DoF 目标位姿优化:非模态几何与降低搜索维度
为了保留物体特异性的几何细节而不依赖 CAD 检索,系统支持由 2D 框直接驱动。通过级联 SAM-3 获得高精度掩码,输入非模态 3D 重建模型 SAM-3D 生成即使在遮挡下也几何完整的独立局部网格。然而,SAM-3D 自带的绝对位姿粗糙,不足以支撑精确接触。GARDEN 引入 FoundationPose 进行 6-DoF 位姿精炼。关键差异在于,SAM-3D 生成的网格具有天然轴对齐属性,在 GV 空间中其垂直轴与重力严格平行,从而将常规 6-DoF 位姿估计中复杂的 3D 旋转搜索解耦并退化为仅需估计平移向量与水平偏航角(yaw angle)。这一物理先验约束极大地缩窄了优化搜索空间,显著抑制了物体嵌入桌面或悬空的位姿漂移。

3. 点条件背景解耦网络:细粒度消除双重几何冗余
将重建出的物体网格插入场景后,原始点云或 3DGS 背景中仍存在原本属于该物体的点。若不剔除,将产生“一个物体两份几何”的鬼影重叠与物理穿模。简单的 3D 包围盒裁切会误删相邻的支撑桌面或地面;而跨视角多图 2D 分割在室内同类多物体(如多把同款椅子)时极易发生长程关联漂移。GARDEN 将其建模为点级条件二分类任务:输入在目标放大框内裁切出的局部场景点集合,以及从生成物体网格表面均匀采样的条件几何点集合;通过共享点云编码器与 6 层含自注意力与交叉注意力的 Transformer 模块,让场景点与网格表面点进行精细几何匹配,预测场景点属于前景物体的概率,以 0.5 为阈值过滤。为解决合成数据到真实重建的 domain gap,训练时引入多层重影、薄壁形变、虚拟多视扫描噪声等伪影增强策略,保证了在真实扫描数据上的泛化能力。

损失函数 / 训练策略

整个管线采用分阶段解耦优化策略: 1. 重力预测头:在 TartanAir、Hypersim 和 Virtual KITTI 2 数据集上训练 10k steps,使用 AdamW 优化器,峰值学习率 \(5 \times 10^{-6}\),线性预热 1k steps,损失函数为旋转矩阵 L1 距离 \(\mathcal{L}_{\text{rot}}\); 2. 点分类网络:在 InternScenes 室内物理场景合成数据集上训练 2k steps,学习率为 \(5 \times 10^{-4}\),batch size 为 48,采用二元交叉熵损失(BCE Loss); 3. 推理与物理环境构建:输入图像长边缩放至 504,FoundationPose 进行 5 次迭代精炼。在 MuJoCo 中设置时间步长 0.001s,每步 50 次 Newton 求解器迭代,重力加速度矢量对齐为 \(g_{\text{sim}} = [0, 9.81, 0]^\top\)

实验关键数据

主实验

为了真实反映重建场景的物理稳定度,论文遵循并升级了 LiteReality 的评测协议:不仅评估静态重投影,更将重建场景与刚体导入 MuJoCo 物理引擎,在重力作用下仿真物理运动 10 秒后,再渲染计算与真实观测的差异。任何悬空下落、穿模翻倒或坐标轴倾斜都会急剧恶化图像对齐指标。

表 1: 物体级材质与几何恢复对比(LiteReality 物体基准,10s MuJoCo 仿真后渲染评测)

方法 RMSE ↓ SSIM ↑ LPIPS ↓ 评测协议说明
PhotoShape 0.3225 0.2371 0.6558 静态裁剪框
MIR 0.2377 0.3981 0.6111 静态裁剪框
MIR + AO 0.2156 0.4203 0.5899 静态裁剪框
Sem&Vis (CAD检索) 0.2835 0.3758 0.6362 静态裁剪框
LiteReality 0.2163 0.4353 0.5854 静态裁剪框
GARDEN (3DGS, 仿真后) 0.1880 0.4181 0.5035 10s 物理仿真后
GARDEN (点云, 仿真后) 0.1887 0.4240 0.4444 10s 物理仿真后
GARDEN (3DGS, 静态对照) 0.1796 0.4494 0.4182 静态无仿真
GARDEN (点云, 静态对照) 0.1736 0.4656 0.3680 静态无仿真

表 2: 全场景级别图形就绪重建对比(全场景渲染与输入真值对比)

方法 全局 RMSE ↓ 全局 SSIM ↑ 全局 LPIPS ↓ 评测状态
Phone2Proc 0.3604 0.5512 0.7338 场景级
ACDC 0.3653 0.5531 0.7364 场景级
ACDC + Sem&Vis 0.3226 0.5425 0.6717 场景级
ACDC + MIR 0.3046 0.5492 0.6648 场景级
LiteReality 0.2664 0.5818 0.6522 静态图元
GARDEN (3DGS, 仿真后) 0.1670 0.5573 0.4709 10s 物理仿真后
GARDEN (点云, 仿真后) 0.1616 0.5735 0.4081 10s 物理仿真后
GARDEN (3DGS, 静态对照) 0.1593 0.5718 0.4379 静态对照
GARDEN (点云, 静态对照) 0.1511 0.5916 0.3770 静态对照

消融实验

论文设计了两个维度的消融:重力对齐方向估计精度,以及重力对齐与位姿约束对新视角合成(NVS)与点云几何精度的影响。

表 3: 重力估计角度误差对比(在 Hypersim 与 TartanAir 留出测试集上评测)

方法 Hypersim Mean ↓ Hypersim P90 ↓ Hypersim Fail@10°(%) ↓ TartanAir Mean ↓ TartanAir P90 ↓ TartanAir Fail@10°(%) ↓
Plane-RANSAC 24.87° 89.68° 26.7% 19.26° 83.22° 34.4%
Normal Clustering 30.98° 89.77° 33.3% 21.33° 88.70° 37.5%
COLMAP Manhattan 2.62° 6.38° 0.0% 8.37° 15.91° 12.5%
GeoCalib 7.59° 4.79° 6.7% 3.01° 6.50° 9.4%
GeoCalib + RANSAC 1.71° 3.79° 0.0% 2.69° 5.91° 9.4%
GARDEN GV 预测 1.40° 1.90° 0.0% 1.56° 3.48° 0.0%

表 4: 场景解耦与重力对齐消融实验(Hypersim 局部物体区域评测)

配置与变体 背景类型 渲染 RMSE ↓ 渲染 SSIM ↑ 渲染 LPIPS ↓ 完整度 Comp. ↓ 精度 Acc. ↓ 法向一致性 N.C. ↑
DA3 (未解耦骨干) 点云 0.2788 0.3482 0.5311 0.0516 0.0082 0.9129
w/o GV, 全FP位姿 w/o 仿真 点云 0.2961 0.3211 0.5917 0.0447 0.0726 0.7320
w/o GV, 全FP位姿 w/ 仿真 点云 0.3002 0.3096 0.5929 0.0743 0.3132 0.7078
w/ GV, 全FP位姿 w/o 仿真 点云 0.2753 0.3562 0.5351 0.0470 0.0674 0.7275
完整 GARDEN 点云 0.2751 0.3565 0.5338 0.0387 0.0658 0.7497
DA3 3DGS 0.3068 0.3141 0.6623 - - -
w/o GV, 全FP位姿 w/o 仿真 3DGS 0.3134 0.3000 0.6617 - - -
w/o GV, 全FP位姿 w/ 仿真 3DGS 0.3171 0.2885 0.6725 - - -
完整 GARDEN 3DGS 0.2840 0.3809 0.5575 - - -

关键发现

  1. 重力对齐是物理仿真的生命线:从表 4 可以看出,若去掉 GV 重力对齐(w/o GV, 全FP位姿 w/ 仿真),几何精度 Acc. 从 0.0658 急剧恶化到 0.3132,Comp. 恶化到 0.0743。这是因为缺少绝对重力轴时,估计的 6-DoF 刚体姿态倾斜,在物理仿真下发生不可逆的滑落或倾倒;而 GV 对齐不仅优化了初始位姿,还确保了物理受力的长期稳定。
  2. CAD-Free 架构带来显著速度优势:在端到端耗时对比中(表 5),LiteReality 在 5 个真实场景上的平均推理耗时为 4332.8s,而 GARDEN 仅需 560.2s,实现 7.7× 速度提升。彻底去除了耗时的 CAD 向量数据库检索与材质微调环节。
  3. 混合表示兼顾几何完整与真实度:相比单体模型 DA3,GARDEN 的完整度指标 Comp. 从 0.0516 降低到 0.0387,表明其非模态生成能够填补原始多视角观测中因遮挡而缺失的物体背面几何,同时条件点分类精准去除了重复背景点,避免了视觉重叠。

亮点与洞察

  • 将重力定义为万能物理先验:不同于常规仅将重力用于位姿估计的后处理,GARDEN 将重力贯穿在坐标系统一、位姿搜索空间降维(锁定俯仰与横滚)、地面平面提取以及物理仿真初始化全流程,从根本上化解了单目/多视角纯视觉重建的规范自由度缺陷。
  • 表面点驱动的 Transformer 条件背景抠取:避免了传统 3D 粗糙 Bbox 裁剪误伤桌面与传统多视角分割在同类物体间的长程关联漂移,通过在被扰动合成数据上预训练,使纯几何特征匹配具有出色的实测鲁棒性。
  • 仿真就绪(Simulation-Ready)评测范式:不同于以往将物体固定在空中测试 PSNR 的静态假象,采用“导入 MuJoCo 仿真 10 秒后再渲染”的严苛评测,为具身智能 3D 资产生成建立了具有物理说服力的新标杆。

局限与展望

  • 作者承认的局限:目前目标物体需要由用户通过 2D 框交互指定或依赖外部 VLM 的先验提示,尚未完全实现全场景全类别刚体的一键端到端全自动实例解耦;同时当前系统主要针对刚体物体,对铰接物体(articulated objects,如柜门、抽屉)和柔性体交互尚未支持。
  • 自行分析的局限:由于 SAM-3D 负责非模态生成,当物体底部或背部完全处于隐蔽状态且几何形态极具长尾异型特征时,生成的网格可能存在几何幻觉;此外,管线暂未集成高动态范围材质解耦(PBR 参数分解),在复杂光影交互下高保真渲染依赖原背景的高斯/点云基底。
  • 可改进方向:引入交互式具身动作交互(如机械臂抓取试探)实现主动闭环重构,并将铰接结构(Part-level Kinematic Tree)估计融合进解耦表示中。

相关工作与启发

  • vs LiteReality [Huang et al., NeurIPS 2024]: LiteReality 依赖 RGB-D 传感器输入与庞大的 CAD 模型检索库,将真实物体替换为预制 CAD,不仅单场景耗时高达 4000+ 秒,还会丧失物体真实几何细节;GARDEN 纯 RGB 驱动,单篇耗时缩短至 560 秒(7.7× 加速),且通过非模态生成完整保留场景特定的真实几何。
  • vs DepthAnything-3 [Lin et al., 2025] & VGGT [Wang et al., 2025]: 通用多视角几何大模型构建的是单体式静态场景,无独立物体级操作能力且坐标系任意翻转;GARDEN 复用了 DA3 的全局几何表征能力,在其之上构建重力对齐头与条件点解耦,成功将其拓展为可物理交互的结构化混合场景。
  • vs GVHMR [Shen et al., SIGGRAPH Asia 2024]: GVHMR 将 Gravity-View 引入人体运动恢复以防止人体漂移;GARDEN 将这一物理坐标基准创造性地迁移至 3D 场景重建与刚体物理仿真分解,证明了重力在场景因子分解中的泛化价值。

评分

  • 新颖性: ⭐⭐⭐⭐ [创新性地引入重力先验解决纯视觉重建的规范自由度,提出 CAD-free 的条件 3D 点云解耦]
  • 实验充分度: ⭐⭐⭐⭐⭐ [独创 10 秒 MuJoCo 动力学仿真后渲染评测,涵盖物体级、场景级、重力角与消融对比]
  • 写作质量: ⭐⭐⭐⭐⭐ [图表逻辑清晰严谨,从动机展开到关键公式均具扎实说服力]
  • 价值: ⭐⭐⭐⭐⭐ [为具身智能虚拟环境构建打通了一条从 casual RGB 视频到物理仿真数字孪生的高效实用路径]