跳转至

PolyLayout: Multi-room Manhattan Layout Estimation

会议: ECCV 2026
论文: ECCV 官方页面
项目: https://ghanning.github.io/PolyLayout
领域: 3D 视觉
关键词: 多视角室内布局估计、曼哈顿世界假设、特征度量对齐、多房间联合优化、自适应拓扑调整

一句话总结

PolyLayout 将室内多房间布局参数化为具有共享朝向与层高的三维曼哈顿多边形,基于 DINOv2 提取的特征图、边缘图与置信度构建可微目标函数,通过粗到细的 Levenberg-Marquardt 优化并结合自适应分裂/合并拓扑变换,实现了精准且强泛化的多房间 3D 布局重建。

研究背景与动机

从多视角透视图像重建室内 3D 布局是计算机视觉的基础课题,直接支撑室内机器人导航、增强现实(AR)虚实融合与整体场景几何理解。传统方法大量聚焦于单张透视图像或单张 360° 全景图重建,但受限于未知的物理尺度、视场角遮挡以及对单视角的强几何先验依赖,在复杂现实场景中极易产生尺度漂移与拓扑退化。尽管近期多视角方案如 Plane-DUSt3R 尝试微调预训练基础模型预测平面,却在跨域场景下表现出严重的泛化崩溃;而基于优化策略的 PixCuboid 虽然引入了多视角特征度量对齐(featuremetric alignment),但其严格局限于单房间矩形长方体(cuboid)的严苛假设,在真实建筑中普遍存在的 L 形、凹凸非凸多边形或复杂多房间户型中完全失效。

更关键的结构矛盾在于:现实建筑内部的多房间往往遵循全局一致的建筑规律(如共享的主导曼哈顿主轴、共面的地板基底与均一的吊顶高度),但绝大多数已有管线将各个房间割裂为独立空间分别求解。这种孤立预测不仅极易积累各房间朝向的微小旋转误差,更白白丢弃了多房间跨视角的强结构约束;若盲目使用无约束的三维点云或自由网格建模,又会因室内大面积白墙、无纹理区域及动态杂物遮挡导致点云稀疏与外点离群。

针对这一困境,本文选择解耦“可微网络特征打分”与“显式几何投影优化”,将布局参数化空间提升至更具表现力的曼哈顿 3D 多边形,并显式实现多房间层面的结构参数共享。核心 idea:将多房间室内布局统一建模为带全局共享主方向与标高的 3D 曼哈顿多边形,基于预训练 DINOv2 构建特征度量、边缘与灭点融合代价,通过可微粗到细的 LM 优化并辅以自适应墙面分裂与合并,实现高鲁棒、跨域泛化的多房间联合重建。

方法详解

整体框架

PolyLayout 的输入为同一建筑内一个或多个房间的 \(n\) 张已知位姿相机图像 \(\{I_i\}_{i=1}^n\)(含旋转 \(R_i\)、平移 \(t_i\) 及内参 \(K_i\)),以及各视角所属的房间归属信息。系统的目标是输出每个房间对应的闭合曼哈顿 3D 多边形 \(\mathcal{P}\)。

整体流程包含三个核心阶段:首先,通过基于 DINOv2 ViT-S/14 编码器与双头卷积解码器抽取多尺度致密特征图 \(F\)、边缘图 \(E\) 以及对应的置信度权重图 \(C_F, C_E\);其次,利用相机中心轨迹的凸凹包与灭点优化初始化各房间的初始曼哈顿多边形 \(\mathcal{P}_{\text{init}}\);最后,在三个尺度分辨率(1/16、1/4、1/1)上展开粗到细的 Levenberg-Marquardt(LM)非线性最小二乘优化。在每次 LM 步后,系统自适应地消除自相交、基于加权面积合并冗余共面墙体,并在中粗尺度自适应分裂过长墙面,最终输出紧凑严谨的三维户型多边形 \(\mathcal{P}_{\text{opt}}\)。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视角室内图像输入<br/>已知相机位姿与内参"] --> B["相机轨迹凹包与灭点初始化<br/>生成初始曼哈顿多边形 Pinit"]
    B --> C["DINOv2 多尺度特征与边缘抽取<br/>特征 F、边缘 E 与置信度权重 CF, CE"]
    C --> D["特征度量与结构代价函数优化<br/>Efeat + Eedge + EVP + Eper 联合求解"]
    D --> E["动态多边形拓扑自适应调整<br/>Visvalingam 简化、自相交修复与长墙分裂"]
    E --> F["多房间共享约束解算<br/>共享全局朝向 R 与地板/吊顶标高 d1, d2"]
    F --> G["最终 3D 曼哈顿多边形布局 Popt"]

关键设计

1. 曼哈顿多边形解耦参数化与多房间参数共享:打破孤立长方体约束与自由网格的自由度灾难

现有长方体假设将房间限制在 6 个面,无法表示带凹凸转角的真实空间;而常规的“位姿+尺寸 \((R, t, s)\)”三维盒表示又将各平面的空间位置与平移平滑耦合,导致多房间之间难以施加刚性约束。为此,PolyLayout 将全局到局部的空间变换与局部坐标系下的轴向平面偏移解耦,使用全局旋转 \(R \in \mathrm{SO}(3)\) 和一个 \(p\) 维平面偏移向量 \(d = [d_1, d_2, \dots, d_p]^\top\)(其中 \(p \ge 6\) 且为偶数)来定义每个房间。

在局部坐标系中,房间地面与天花板严格沿垂直 \(z\) 轴对齐,分别定义为水平面 \(z = d_1\) 与 \(z = d_2\);其余 \(p-2\) 个分量以 \(x\) 与 \(y\) 严格交替的方式表示垂直墙面:第 1 面墙为 \(x = d_3\),第 2 面墙为 \(y = d_4\),第 3 面墙为 \(x = d_5\),依次环绕至 \(y = d_p\)。在多房间场景下,整个建筑群的各房间强制共享同一个全局朝向 \(R\) 以及共面的地板/天花板偏移 \((d_1, d_2)\)。这种解耦表示大幅削减了联合优化的自由度,消除了跨房间积累的旋转发散,使未充分观测到的边缘房间能直接借用主房间稳健的地坪基准与主轴走向。

2. 混合视觉-几何联合优化代价:解耦深度特征学习与解析投影的粗到细 LM 求解

为了兼顾神经网络在非均匀光照下的鲁棒语义匹配能力与传统几何投影的严格可解释性,目标函数并不直接端到端回归坐标,而是定义显式几何投影下的残差最小化问题:

\[E(\mathcal{P}) = E_{\text{feat}}(\mathcal{P}) + \alpha E_{\text{edge}}(\mathcal{P}) + \beta E_{\text{VP}}(\mathcal{P}) + \gamma E_{\text{per}}(\mathcal{P})\]

其中各分量分工明确: - 特征度量代价 \(E_{\text{feat}}\):在多边形可见表面采样子像素点集,通过多边形几何关系反投影并重投影到邻近视角计算特征光度残差,残差被网络预测的置信度 \(w_{ijk} = C_{F,i}[x_{ik}] C_{F,j}[\mathcal{W}_{i \to j}(x_{ik}, \mathcal{P})]\) 加权,并经由通用自适应鲁棒损失核函数截断杂物外点;针对多边形非凸带来的潜在自遮挡,引入解析视线深度测试剔除不可见点。 - 边缘对齐代价 \(E_{\text{edge}}\):在多边形 3D 棱线上均匀采样三维点集并透视投影至各图像视平面,最小化其与卷积头预测的高分辨率结构轮廓图 \(E_i\) 的距离。 - 灭点先验代价 \(E_{\text{VP}}\):直接约束多边形法向构成的 3 个正交灭点方向与图像中检测出的 2D 线段的几何一致性。 - 周长正则代价 \(E_{\text{per}}\):针对单侧视角未完全覆盖的盲区,显式引入 2D 截面周长惩罚式:

\[E_{\text{per}}(\mathcal{P}) = |d_3 - d_{p-1}| + |d_4 - d_p| + \sum_{i=4}^{p-1} |d_{i+1} - d_{i-1}|\]

该正则项给多边形施加微弱的收缩偏置,防止在未观测盲区墙体无边界向外漂移发散。优化过程在 DINOv2 提取的 1/16、1/4、1/1 三个分辨率金字塔上按 coarse-to-fine 逐级推进。

3. 相机轨迹凹包初始化与自适应多边形拓扑调整:动态增删墙面的非刚性进化

梯度优化在高度非凸的多边形搜索空间中极易陷入局部极小,为此必须提供高质量的几何初值。系统首先统计所有已知相机的垂直轴均值作为重力法向,在水平正交基构成的平面内,对相机水平中心坐标点集提取带固定裕度扩展 \(\delta\) 的 \(\alpha\)-shape 凹包(concave hull),将其栅格化为二值占据图后提取闭合正交折线,直接生成贴合相机探索轨迹的初始曼哈顿多边形。

在粗到细的迭代优化过程中,拓扑结构并非静态固定: - 相机合法性检测:每次 LM 更新后,若发现相机中心漂出多边形外部,立即沿径向将最近墙面推至相机视锥之外; - 曼哈顿 Visvalingam 简化:为了避免噪声过拟合导致墙面数量爆炸,将经典 Visvalingam-Whyatt 折线简化算法推广至曼哈顿域,每次成对剔除相邻的一组 \(x, y\) 墙面,其重要度度量定义为该两墙所跨越的矩形面积;仅当墙面移动位移量 \(|\Delta d_i|\) 低于收敛阈值且重要度低于设定界限时触发合并; - 自交修复与长墙分裂:利用 Shapely 实时清除自相交环路;并在粗、中尺度的阶段末尾,将几何跨度大于预定阈值的长墙自适应对半细分,赋予多边形捕捉复杂小壁龛与走廊转折的自由度。

损失函数 / 训练策略

神经网络的训练采用端到端反向传播(Unrolled Optimization)。为了促使特征提取网络输出对几何错位敏感且平滑凸显单峰极值的特征图,在训练阶段将地面真值 2D-3D 对应点 \(\{(x_{ik}^{\text{GT}}, X_{ik}^{\text{GT}})\}\) 投影至经微扰初始化的多边形上,定义重建损失:

\[\mathcal{L}(\mathcal{P}) = \frac{1}{N} \sum_{i,k} \|\mathcal{P}(x_{ik}^{\text{GT}}) - \Pi_i(X_{ik}^{\text{GT}})\|_1\]

梯度通过展开的若干步 LM 迭代反向传播回卷积头与 DINOv2 骨干网络,同时联合学习每个优化参数的 LM 阻尼因子 \(\lambda\)。为避免精细特征图在优化发散时被过度平滑,仅当粗尺度优化损失低于阈值时才对高分辨率特征图施加梯度更新。在预训练阶段,边缘头单独通过带有渲染 Ground Truth 线框图的加权均方误差(MSE)进行结构化预热。

实验关键数据

主实验

论文在 Aria Synthetic Environments(ASE)、ScanNet++ v2 真实室内标注数据集以及 2D-3D-Semantics 经典基准上全面评估。对比方法涵盖点云表征基线 SceneScript、前沿无位姿基础模型 Plane-DUSt3R、多视角长方体优化 SOTA PixCuboid 以及 2D 户型图重建方案 RoomFormer。

数据集 方法 3D IoU (%) ↑ Chamfer (m) ↓ 墙体召回 (%) ↑ 房间召回 (%) ↑ 深度 RMSE (m) ↓ 法向召回 10° (%) ↑ 推理耗时 (s) ↓
ASE (多房间合成) SceneScript (稀疏点云) N/A 2.44 16.7 9.1 1.18 64.5 7.45
ASE Plane-DUSt3R N/A 23.16 0.1 0.0 1.90 19.7 105.60
ASE PixCuboid 68.1 0.93 54.9 45.5 0.57 90.0 1.01
ASE RoomFormer 13.8 2.37 5.0 0.5 1.75 67.8 0.06
ASE PolyLayout (本文) 94.3 0.12 89.0 79.0 0.09 98.2 5.48
ScanNet++ (真实多房间) SceneScript (COLMAP 点云) N/A 1.80 11.9 0.3 0.80 55.8 6.16
ScanNet++ Plane-DUSt3R N/A 16.82 0.2 0.0 1.06 18.2 57.72
ScanNet++ PixCuboid 78.8 0.36 58.9 26.1 0.26 87.8 0.87
ScanNet++ RoomFormer 10.3 1.61 3.4 0.0 0.98 48.6 0.11
ScanNet++ PolyLayout (本文) 87.4 0.20 69.3 36.3 0.16 91.6 3.54
2D-3D-S (长方体空间) PixCuboid 89.0 0.18 93.8 85.0 0.10 96.1 0.42
2D-3D-S PolyLayout (本文) 90.0 0.15 92.2 80.6 0.10 96.4 1.11

注:SceneScript 与 Plane-DUSt3R 输出未闭合墙体,无法可靠计算 3D 体积 IoU;其 Chamfer 距离计算时剔除了真值的地坪与天花板。SceneScript 若使用全部图像生成的全局 SLAM 半稠密点云,Chamfer 可达 0.12m、IoU 不可算。

消融实验

在 ASE 测试集上对参数共享策略、特征提取器架构、损失函数分量、初始化方案与拓扑动态调整机制进行系统级拆解:

消融维度 具体配置 3D IoU (%) ↑ Chamfer (m) ↓ 墙体召回 (%) ↑ 房间召回 (%) ↑ 深度 RMSE (m) ↓ 法向召回 10° (%) ↑
参数共享策略 独立无共享 (None) 93.5 0.13 88.5 78.5 0.11 97.9
参数共享策略 仅共享全局朝向 \(R\) 93.8 0.13 88.9 79.6 0.10 98.0
参数共享策略 共享朝向 + 地坪/吊顶标高 94.3 0.12 89.0 79.0 0.09 98.2
特征提取器 ResNet-101 (仅 \(E_{\text{feat}}\)) 24.6 3.55 8.5 0.5 1.70 28.5
特征提取器 DINOv2 ViT-S/14 (仅 \(E_{\text{feat}}\)) 45.1 2.05 24.1 7.3 1.05 58.1
特征提取器 ResNet-101 (完整损失) 82.7 0.43 66.8 43.2 0.29 93.9
特征提取器 DINOv2 ViT-S/14 (完整损失) 94.3 0.12 89.0 79.0 0.09 98.2
正则代价项 仅 \(E_{\text{feat}} + E_{\text{edge}} + E_{\text{VP}}\) 93.5 0.19 89.3 79.1 0.11 98.1
正则代价项 加入周长收缩正则 \(E_{\text{per}}\) 94.3 0.12 89.0 79.0 0.09 98.2
几何初始化 长方体包围盒 (Cuboid) 90.5 0.22 83.4 73.7 0.16 96.9
几何初始化 相机中心外接圆 (Circle) 93.2 0.15 87.3 77.7 0.11 97.8
几何初始化 相机轨迹凹包 (Concave Hull) 94.3 0.12 89.0 79.0 0.09 98.2
拓扑动态调整 禁用长墙分裂 (No split) 93.6 0.14 89.2 82.2 0.10 98.0
拓扑动态调整 禁用多边形合并简化 (No simplification) 92.9 0.16 86.9 72.5 0.11 97.5
拓扑动态调整 动态简化 + 动态分裂 (完整配置) 94.3 0.12 89.0 79.0 0.09 98.2

关键发现

  1. 多房间结构先验的有效性:在 ASE 复杂多房间场景中,仅引入共享全局朝向便能带来各维度的普适收益;若进一步绑定室内统一的地坪与天花板标高,3D IoU 提升至 94.3%,深度 RMSE 压缩至 0.09m。建筑物理常识的刚性约束显著增强了欠观测墙面的几何稳定性。
  2. 基础视觉编码器的绝对优势:在参数量相当(DINOv2 ViT-S/14 约 28.5M vs ResNet-101 约 30M)的前提下,基于自监督预训练的 DINOv2 在纯特征对齐驱动下即可实现 45.1% 的 IoU,远超 ResNet-101 的 24.6%;在完整目标函数下更实现 94.3% vs 82.7% 的断代式跨越,证实了自监督 ViT 特征在跨视角无纹理白墙匹配中的深层语义平滑性。
  3. 拓扑演化中简化的关键作用:相比于长墙分裂,Visvalingam 多边形简化的缺失会导致模型精度严重下滑(IoU 从 94.3% 跌至 92.9%,房间召回从 79.0% 跌至 72.5%)。这表明凹包初始化提供的墙体数量往往偏过拟合,及时的共面去冗余是防止陷入伪局部极小的关键。

亮点与洞察

  • 解耦“神经网络打分”与“模型驱动投影”:不依赖黑盒网络直接端到端回归 3D 坐标,而是将相机投影视线与多边形解析几何保留为显式模型,仅用网络提取抗光照与视角的致密不变特征,极大增强了面对陌生焦距、传感器畸变及新数据集时的零样本迁移能力。
  • 曼哈顿 Visvalingam 成对墙体消除算法:巧妙调整了制图学经典的折线简化算法,通过每次成对删除相邻直角折边并以所夹矩形面积衡量重要度,在严格维持曼哈顿正交闭环不变的前提下实现了非连续拓扑复杂度的动态收敛。
  • 面向未观测盲区的周长微收缩偏置:引入 \(E_{\text{per}}\) 周长惩罚项,在无需人工假定场景绝对尺寸的情况下,巧妙利用正则化梯度提供向内收缩拉力,从数学上杜绝了室内视线遮挡处外墙向无穷远发散的经典退化。

局限与展望

  • 曼哈顿直角世界假定的物理边界:核心数学参数化深度绑定于正交坐标系,面对包含斜切墙面、弧形飘窗或坡度屋顶的复杂异形建筑(如 Atlanta 世界或非垂直倾斜表面)时无法严格贴合。
  • 已知位姿与房间先验分组依赖:当前流水线依赖离线 SfM 恢复的已知外参位姿,并显式假定已知每张输入图像归属的具体房间 ID。尽管实验证明其对 \(\pi^3\) 等纯视觉位姿估计器具有较强兼容性(IoU 仅从 94.3% 轻微降至 89.4%),但若能实现端到端的无监督视点聚类与多房间图分割,实用性将进一步提升。
  • 墙体跨房间共面共享尚未激活:论文虽然证明了楼层主轴与层高共享的强大威力,但在多房间交界处,两房间共用的隔墙目前仍作为两套独立的 \(d_i\) 参量分别优化,未显式施加厚度约束或零距离重合约束。

相关工作与启发

  • vs PixCuboid:两者均采用特征度量对齐思想,但 PixCuboid 将解空间锁死为单房间 6 面长方体;PolyLayout 突破至任意边数的曼哈顿多边形,提出了相机凹包初始化、自适应增删墙面机制与多房间跨空间共享联合优化,在非规则户型与真实场景中展现出压倒性优势。
  • vs Plane-DUSt3R:Plane-DUSt3R 尝试在微调大模型 DUSt3R 框架下预测三维平面,但严重受制于域泛化崩溃,在跨数据集测试中出现大面积近乎为零的召回;PolyLayout 保持前向特征与后验优化的物理隔离,泛化鲁棒性极高且保证输出完全闭合的流形多边形。
  • vs SceneScript / 点云拟合方法:SceneScript 依赖高质量的密集体积点云(稠密重建需要额外耗费大量算力与时间,且遇白墙易失效);PolyLayout 直接在多视角 2D 图像特征上建立优化残差,对稀疏视点输入具有天然的高效率与几何抗噪性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐(将特征度量对齐推广至多边形拓扑演化与多房间联合解耦建模,体系完整优美)
  • 实验充分度: ⭐⭐⭐⭐⭐(自建高质量 ScanNet++ 真实精细标注,覆盖合成、真实与经典基准,消融极其详实)
  • 写作质量: ⭐⭐⭐⭐⭐(逻辑脉络清晰,数学公式严密,图文对应严谨)
  • 价值: ⭐⭐⭐⭐⭐(为具身智能建图、XR 空间计算与全景室内三维重建提供了极具工业实用价值的优雅范式)