Articulated Object Reconstruction from Rest-State Observation¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 铰接物体重建、静止状态观测、网格部件分割、视频扩散模型、数字孪生
一句话总结¶
Rest2Art 提出了首个仅从单一静止闭合状态网格重建多部件铰接物体的框架,通过视觉语言模型与分割模型的迭代互校解耦部件层级,并借助视频扩散模型合成运动假设结合网格刚体投影优化求解关节参数。
研究背景与动机¶
人类具备仅凭静态外观就能推断未知物体铰接运动机制的卓越先验能力,看到一个完全闭合的柜子,我们便能大致预判哪些柜门是向外平开、哪些抽屉是向外抽拉。但在三维视觉领域,现有的铰接物体重建方法几乎全部依赖显式可观测的多状态运动线索,要求输入成对的不同开合状态图像、交互视频或特定位移点云,甚至需要预先指定可动部件的数量。这种强依赖严重限制了铰接重建技术的实际落地,因为互联网开源三维资产、电商产品图谱以及现实场景扫描数据集(如 ScanNet 和 Replica)绝大多数都仅包含物体完全闭合的静止状态。
在缺乏直接运动线索的静止状态下推断铰接运动,是一个高度不适定的几何与运动反问题。闭合的家具通常具有均匀的颜色纹理、平整齐缝的接缝边界以及高度重复的箱式结构,使得单靠几何特征或浅层视觉线索难以分辨功能部件。虽然多模态预训练大模型具备丰富的语义与常识物理先验(例如视频扩散模型能想象闭合抽屉打开的动态过程),但直接将它们串联应用会导致严重的幻觉与错误传播:视觉语言模型预测的部件树往往漏掉隐蔽部件,分割模型容易在视角变化时丢失关键区域,而视频扩散模型在生成开合过程时经常凭空凭空捏造不存在的抽屉或产生形变。
面对多模型预测噪声大且相互冲突的矛盾,本文的核心切入点是将显式三角网格作为跨模型验证与证据融合的唯一空间物理锚点。利用网格连续的表面拓扑连接性来约束几何视线遮挡、聚合视点证据并消除伪影。核心 idea:以显式表面网格为物理与语义锚点,构建视觉语言模型与分割模型的双向冲突反馈迭代圈解耦多视角部件,并利用物理视频扩散模型生成铰接假设轨迹,通过网格重投影与穿透惩罚刚体优化闭环求解关节几何参数。
方法详解¶
整体框架¶
Rest2Art 的输入为单一闭合状态下的三维网格(可来源于多视角三维高斯重建 2DGS、单图生成模型或三维扫描),输出为解构好的部件网格集合 \(\{M_k\}_{k=1}^K\) 与对应的运动关节参数 \(\{\Psi_k\}_{k=1}^{K-1}\)(支持平动关节与转动关节),全流程自动确定部件数目 \(K\)。整体管线主要包含三大阶段:部件分割与跨视角融合、基于扩散假设的关节参数估计,以及面向仿真的实体网格补全。
首先,系统在多视点渲染下通过视觉语言模型(VLM)与通用分割模型(SAM3)构建层级树与实例掩码的互相质询纠错环路;经过验证的 2D 掩码通过置信度加权反投影至三维网格面片,并通过网格邻接图的测地最短路径进行标签平滑传播。随后,在最具信息量的视点上叠加半透明部件高亮,提示视频扩散模型生成铰接动作视频假说;通过稠密点追踪提取运动轨迹,结合相机位姿与网格深度反投影到 3D 空间,以极值刚体优化拟合关节轴线,并利用网格邻接边界和碰撞穿透惩罚修正轴线朝向。最后,针对单面片壳状部件执行法向自适应厚度扩展与参数化内部抽屉盒生成,导出可直接用于物理引擎的实体仿真资产。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["静态闭合网格输入<br/>2DGS / 单图生成 / 3D扫描"] --> B["部件层级与掩码迭代互校<br/>VLM 树 ↔ SAM3 掩码冲突闭环"]
B --> C["置信度加权网格证据抬升<br/>多视点支持度聚合与面片投票"]
C --> D["图拓扑引导标签传播<br/>网格测地最短路径与反投校验"]
D --> E["视频扩散假设生成与轨迹追踪<br/>Wan2.2 物理先验与 CoTracker3 追踪"]
E --> F["网格几何约束关节拟合<br/>重投影优化与部件穿透惩罚"]
F --> G["实体网格流形补全<br/>法向加厚与参数化抽屉几何生成"]
关键设计¶
1. 部件层级与掩码迭代互校:以跨模型冲突为自我修正信号
仅凭闭合状态的静止图像,VLM 容易漏数部件或误判层级,而 SAM3 在无语义先验引导时难以在平整齐缝的柜门之间切分出功能独立的实体。为此,设计了无需标注的双向互检机制。首先由 VLM 生成初始部件层次树 \(T\),解析出语义提示集合 \(S(T) = \{s_1, \dots, s_C\}\) 及其预期实例数量 \(n(s, T)\)。SAM3 接收每个文本提示生成对应多视角的掩码集合 \(M_{v,s}\) 并统计检测数 \(|M_{v,s}|\)。若检测数量与预期完全吻合,则存入可信证据池;若检测数量超过 VLM 预期(\(|M_{v,s}| > n(s, T)\)),表明 VLM 遗漏了潜在部件,此时系统将 SAM3 识别出的超额掩码以高饱和度伪彩色叠加回原图,强化边缘对比度后回传给 VLM 重新决策并扩充层级树;若检测数偏少,则暂缓剪枝并在全部候选视角聚合后综合判定。这种两轮上限的互相博弈,使得两类模型的互补优势得以完全释放。
2. 置信度加权网格证据抬升与图扩散传播:消除视角遮挡与伪影碎片
二维分割结果提升到三维表面时极易因视角投影失真和边缘遮挡产生冲突。系统先为每个部件候选 \(p\) 依据检测置信度与覆盖度筛选前 \(K\) 个最佳视点 \(V_p\),利用带背面剔除的 Z-buffer 光栅化建立像素到面片的对应关系 \(\phi_v\)。面片 \(f\) 归属于部件 \(p\) 的聚合证据得分由下式计算:
其中 \(w_p^v\) 为归一化视点权重,\(c_p^v\) 为检测置信度。初级赋标后,必然残留多视角冲突引起的锯齿边缘、离散噪点和未分配盲区。利用网格拓扑连通图,首先提取每个部件的最大面片连通分量作为高可信“种子源”,将其余离散碎片并入未分配候选集 \(U\)。随后沿网格顶点邻接边计算多源测地最短路径:
标签沿着实际三维几何表面向外平滑延展,而不是在空间欧氏距离上跨越几何间隙,最后通过重投影回最优视点掩码内部实施跨模态二次接纳,保障了部件边界与三维结构接缝的严格重合。
3. 视频扩散运动假设生成与几何抗穿透关节拟合:无运动条件下的刚体求解
由于静止观测中没有任何真实的动态轨迹,系统将半透明部件掩码投影覆盖到最佳视角的静态图上,作为条件图像输入给配备 VBVR 物理推理 LoRA 的 Wan2.2 视频生成大模型,同时由 VLM 构建提示词引导模型“脑补”各部件的物理展开视频。虽然生成的视频在几何上不具备绝对度量精度,但提供了可靠的运动类型与方向假设。随后使用 CoTracker3 追踪首帧部件上的锚点轨迹,并通过网格首帧精确深度反投影获得 3D 轨迹。利用位移变异系数(CV)与轨迹曲率区分转动关节(离轴距离不同导致位移差异大、轨迹弯曲)与平动关节(全点等位移平移、轨迹笔直)。
在参数优化上,通过最小化 2D 轨迹与 3D 刚体运动模型重投影误差确定关节初始参数。为解决单目投影固有的轴向朝向二义性,利用三维网格表面显式检测旋转可能导致的子部件穿透父部件现象,并在损失中施加几何碰撞惩罚,进一步将转动轴线 \(\hat{\omega}\) 与部件接触边界的主方向进行平滑对齐,彻底排除了不符合物理常识的反向开门与轴向错位。
损失函数 / 训练策略¶
该框架采用完全零样本(Zero-shot)和免训练(Training-free)架构,不改变底层基座模型权重。在测试阶段,关节参数估计通过优化重投影残差实现。对于转动关节参数 \(\Psi^r = \{\hat{\omega}, q, \theta\}\) 与平动关节参数 \(\Psi^p = \{\hat{v}, d\}\),定义带截断鲁棒核函数(Huber/Tukey-like loss)的 2D 轨迹投影误差优化目标:
其中 \(\mathbf{x}_t^j\) 为 CoTracker3 在时刻 \(t\) 提取的第 \(j\) 个轨迹点坐标,\(\pi\) 为相机投影函数,\(\mathbf{p}_t^j\) 由式 (5) 或式 (6) 计算得到。为了消除视频生成单次采样的随机性偶发错误,系统并行使用两个不同随机种子生成独立视频,并在两者运动分类一致时联合拟合,极大提升了解算收敛的稳定性。
实验关键数据¶
主实验¶
论文在 Articulated Containers Dataset (ACD) 的合成数据子集(HSSD 与 ABO)以及真实环境室内扫描数据集 MultiScan 上进行了全面评估。指标包含转动/平动轴线角度误差(Ang.,度)、轴线位置误差(Pos.,分米)以及关节类型分类准确率(Type Acc.,%)。
表 1:ACD 数据集上的关节参数估计对比(对应原文 Table 2)¶
| 方法 | 任务类型 | 输入观测状态 | ACD-HSSD Ang. (°)↓ | Pos. (dm)↓ | Type (%)↑ | ACD-ABO Ang. (°)↓ | Pos. (dm)↓ | Type (%)↑ |
|---|---|---|---|---|---|---|---|---|
| URDFormer | 生成式 | 1 (静止) | 14.59 | 6.52 | 16.23 | 13.64 | 6.11 | 19.12 |
| Singapo | 生成式 | 1 (静止) | 1.97 | 3.21 | 59.42 | 0.13 | 2.63 | 41.47 |
| Singapo + ⟳ (互校) | 生成式 | 1 (静止) | 2.24 | 2.85 | 61.21 | 0.14 | 2.33 | 67.94 |
| ArtGS | 重建式 | 2 (双状态) | 53.12 | 1.37 | 57.71 | 46.29 | 0.96 | 60.76 |
| REArtGS | 重建式 | 2 (双状态) | 58.02 | 6.95 | 33.30 | 59.20 | 6.77 | 35.61 |
| REArtGS++ | 重建式 | 2 (双状态) | 41.82 | 2.87 | 59.38 | 45.92 | 1.23 | 81.28 |
| Articulation in Motion | 重建式 | 交互视频 | 30.29 | N/A | 25.09 | 19.74 | 0.81 | 41.90 |
| Articulate AnyMesh | 重建式 | 1 (静止) | 11.35 | 1.31 | 67.12 | 25.65 | 0.08 | 38.94 |
| Ours (Rest2Art) | 重建式 | 1 (静止) | 11.35 | 0.85 | 74.49 | 4.78 | 0.20 | 73.38 |
表 2:真实扫描 MultiScan 数据集上的关节估计表现(对应原文 Table 3)¶
| 方法 | 任务设定 | 场景覆盖率 Cov. (%)↑ | 角度误差 Ang. (°)↓ | 位置误差 Pos. (dm)↓ | 关节类型准确率 Type (%)↑ |
|---|---|---|---|---|---|
| REArtGS | 2 状态重建 | 31.91 | 51.93 | 29.60 | 64.40 |
| REArtGS++ | 2 状态重建 | 36.17 | 62.72 | 6.85 | 48.74 |
| Articulate AnyMesh | 1 状态静止 | 61.70 | 30.51 | 3.45 | 12.63 |
| Ours (Rest2Art) | 1 状态静止 | 48.94 | 17.23 | 0.26 | 65.78 |
消融实验¶
表 3:部件层次树与数量预测的互校模型组合消融(对应原文 Table 4)¶
| 模型架构组合 | 是否执行迭代互校 (⟳) | 层次树准确率 T Acc. (%)↑ | 部件数量准确率 # Parts Acc. (%)↑ |
|---|---|---|---|
| GPT-5.2 (单独 VLM) | – | 62.3 | 59.4 |
| Qwen3-VL (单独 VLM) | – | 52.2 | 47.8 |
| GPT-5.2 + SAM3 (无互校) | ✗ | 62.3 | 59.4 |
| Qwen3-VL + SAM3 (无互校) | ✗ | 52.2 | 47.8 |
| Qwen3-VL + Grounded-SAM2 (无互校) | ✗ | 53.6 | 46.4 |
| GPT-5.2 ⟳ SAM3 (Ours) | ✓ | 72.5 (+10.2) | 59.4 (+0.0) |
| Qwen3-VL ⟳ SAM3 (Ours) | ✓ | 72.5 (+20.3) | 63.8 (+16.0) |
| Qwen3-VL ⟳ Grounded-SAM2 | ✓ | 60.9 (+7.3) | 47.8 (+1.4) |
表 4:不同三维网格重建后端对下游分割与关节估计的影响(对应原文 Table 5)¶
| 网格重建算法 | 分割 IoU ↑ | 分割 mAP ↑ | 关节轴线方向误差 Axis Dir (°)↓ | 关节位置误差 Axis Pos (dm)↓ |
|---|---|---|---|---|
| 3DGS | 0.30 | 0.83 | 1.69 | 0.154 |
| SVRaster | 0.83 | 0.96 | 1.86 | 0.146 |
| 2DGS (Ours 主选) | 0.97 | 0.99 | 3.67 | 0.154 |
关键发现¶
- 迭代互校的双向增益:单纯串联 VLM 与分割模型无法修正初始误判。引入互相博弈机制后,Qwen3-VL 的层次结构准确率大幅飙升 20.3 个百分点,部件计数准确率提高 16.0 个百分点,证明视觉掩码的不匹配是纠正语言模型幻觉的极佳反馈信号。
- 视频扩散引导的有效性与掩码提示作用:在视频生成阶段,单纯调用 Wan2.2 生成开启动态容易产生严重形变或幻觉(幻觉率达 23.1%);引入 VBVR 物理微调 LoRA 并施加部件掩码半透明高亮提示后,动作幻觉率被大幅压缩至 11.5%,且正确铰接动作生成率提升至 80.8%。
- 双状态基线在单状态合成下的脆弱性:依赖成对状态的重建基线(如 ArtGS、REArtGS++)若使用单状态由图像编辑模型生成的伪开合图像,常因微小几何非刚性漂移将静止底座判定为可动部件导致重建崩溃;而 Rest2Art 将运动视为轨迹假设并通过三维网格约束,表现出极强的抗噪鲁棒性。
亮点与洞察¶
- 将预训练基础模型从直接预测器降维为“假说生成器”:很多具身与三维工作试图直接让 VLM 或扩散模型输出精确的度量参数,容易受尺度漂移和幻觉影响;本文仅利用视频模型提供定性的运动假设和粗粒度 2D 轨迹,将严谨的几何与物理约束交由显式网格执行重投影与穿透优化求解,设计架构极其稳健。
- 以网格拓扑连通性化解跨视角 2D 预测不确定性:利用三维测地最短路径图算法进行部件标签平滑延展,既杜绝了体素/点云反投时的空洞与散斑,又使部件边界天然依附于物体的几何几何缝隙,展现了显式网格在可交互数字孪生管线中的独特价值。
局限与展望¶
- 复杂复合运动学与链式关节建模受限:目前主要针对家具类常见的单自由度平动(抽屉)与转动(平开门),对于折叠门、滑动联轴节以及复杂的闭环连杆结构尚未提供自适应求解机制。
- 未观测隐蔽内部几何的重建依赖简单启发式规则:由于静止状态下柜体与抽屉内部结构被完全遮挡,当前通过规则外扩与参数化托盘生成内部网格;对于具有内部隔板、滑轨等复杂内部机械构造的物体,难以恢复真实原貌。
相关工作与启发¶
- vs ArtGS / REArtGS / REArtGS++:后者强依赖显式输入两种不同开合状态的多视角观测,在只有单状态输入时难以工作或极易因合成状态对齐误差而崩溃;本文专注于单静止闭合状态观测,摆脱了人工干预改变物体形态的前提条件。
- vs Articulate AnyMesh:该方法同样面向单状态网格,但采用线性单向串联基座模型的方式,上一级模型的分割或识别错误会直接不可逆地毁坏下游关节估计;本文通过 VLM 与 SAM 的双向互校闭环,大幅提高了部件识别与关节类型判断的准确度。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次完整解决单静止闭合状态下铰接物体高精度几何解耦与关节参数估计,提出视频假说结合网格约束求解机制]
- 实验充分度: ⭐⭐⭐⭐⭐ [在合成基准 ACD 和真实扫描 MultiScan 上均做了跨类别定量对比,并针对互校模型、网格后端及视频先验设计进行了详尽消融]
- 写作质量: ⭐⭐⭐⭐⭐ [图表清晰凝练,问题定义明确,数学公式节制而精练,叙述逻辑严丝合缝]
- 价值: ⭐⭐⭐⭐⭐ [对于机器人交互环境建图、海量互联网单状态 3D 资产可动化以及具身智能仿真具有重大的实用转化价值]