跳转至

Pixel-wise Planarity for High-Precision Monocular Plane Segmentation

会议: ECCV 2026
论文: ECCV 2026
领域: 语义分割
关键词: 单目平面分割, 逐像素共面度, 几何一致性, 并行区域生长, 单目几何基座

一句话总结

本文提出了一种基于逐像素共面度预测的高精度单目平面分割框架,通过冻结预训练几何骨干、附加轻量共面度预测头,并结合 GPU 并行无迭代区域生长与高一致性真值重构,显著压低平滑非平面区域的伪检率,在严苛物理共面阈值下取得优异的 3D 分割精度。

研究背景与动机

平面结构是人造环境中最基础且占主导地位的几何构件,从室内的墙面、地板、天花板,到室外的路面与建筑立面,无处不在。精确的单目平面分割不仅能为三维场景提供紧凑而结构化的先验表达,更能直接赋能视觉 SLAM、平面引导的房间布局估计、神经辐射场(NeRF)以及三维高斯泼溅(3D Gaussian Splatting)等下游重建任务。然而,在现有实际应用中,哪怕极其微小的几何分割偏差或虚假平面伪检,都会在后续多视角融合中级联放大,导致严重的结构漂移与几何畸变。

以往的单目平面重建主要沿袭两条技术路线:一类是基于实例检测的架构(如 PlaneNet、PlaneRCNN、PlanarRecon),另一类是近年来基于 Transformer 查询机制的模型(如 PlaneTR、PlaneRecTR、Zeroplane)。这些方法通常直接回归平面参数与实例掩码,但在实际场景中极易受到平滑过渡非平面区域的干扰,产生大面积过分割与伪正例预测。更致命的是,社区长期忽视了平面真值标注本身的几何质量缺陷:现存基准普遍采用启发式几何拟合生成标注,在严格物理距离阈值下存在大量离群杂点与非共面面片,导致模型在训练时就缺乏区分“局部平滑曲面”与“严格平整平面”的有效监督。

针对上述矛盾,本文提出重新解耦单目几何感知与平面实例聚类,将平整度本身确立为一种密集的逐像素局部物理属性。核心 idea:通过在冻结的单目几何大模型上附加极轻量逐像素共面度预测头,结合全新重构的高一致性三维真实标注与单步全并行区域生长算法,以最小计算开销在严苛物理共面阈值下消除伪平面分割。

方法详解

整体框架

本文方法包含四个紧密咬合的核心阶段:首先,利用严格的三维距离与法向阈值结合语义过滤重构高质量真值;其次,以冻结的单目几何大模型 MoGeV2 提取深度、法向与 3D 点云先验;接着,利用法向头初始化的轻量共面度头密集预测逐像素平整度置信度;最后,通过 GPU 单步并行区域生长聚合平面实例,并以闭式 SVD 解析解求得无界平面几何方程。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单目 RGB 图像输入"] --> B["几何一致性平面真值生成<br/>网格严格距离/法向/语义联合过滤"]
    B -->|BCE 监督信号| C["轻量逐像素共面度预测头<br/>法向先验初始化输出密集平整度"]
    A --> D["冻结几何骨干 MoGeV2<br/>输出度量深度、表面法向与点云"]
    D --> C
    D --> E["几何引导单步并行区域生长<br/>联合置信度、法向平滑与相对深度"]
    C --> E
    E --> F["闭式奇异值分解平面拟合<br/>实例去中心化后点云 SVD 解析求解"]
    F --> G["高精度 3D 平面分割与参数输出"]

关键设计

1. 几何一致性平面真值生成:以严格三维容差重建高保真训练基准 传统平面分割数据集(如 PlaneRCNN 处理的 ScanNet)因深度传感器噪声与粗糙拟合算法,充斥着大量虚假共面标注。在 0.1cm 的严苛阈值下,原有标注的内点率急剧崩塌,甚至将床单、曲面沙发等非平面物体强行拟合为单一平面。为打破训练源头的几何失真,本文从高精度 3D 网格与致密深度图出发,设计了一套严谨的渐进式区域生长标注管线。在将像素反投影至三维空间 \(P = d \cdot K^{-1} [u, v, 1]^\top\) 后,对候选平面的每个点施加点面欧氏距离阈值 \(|n^\top P - c| < \tau\) 以及面片法向夹角阈值的双重过滤;同时引入语义一致性约束,严格限定同一平面实例不得跨越不同的语义类别边界,并剔除已知非平面物体类别。在 ScanNet++ 上,该流程重构的新真值在 0.1cm 严苛容差下的 F1 指标从原始标注的 42.8% 提升至 50.8%,在 1.0cm 容差下达到 81.3%,为模型学习真实物理共面性奠定了干净的数据基准。

2. 轻量逐像素共面度预测头:法向先验初始化与密集平整度置信度估计 几何直觉上,平整表面的法向量在空间上应保持局部零梯度,而曲面或杂乱区域的法向量会剧烈波动。因此,预测法向量所依赖的深层几何表征天然蕴含了平整度线索。本文并不端到端重新训练庞大的几何骨干,而是完全冻结预训练的 MoGeV2 模型,仅在其共享特征顶层挂载一个轻量级预测头(仅 4.7M 参数)。该预测头架构与预训练法向解码头完全一致,仅将最终输出层修改为单通道输出并施加 Sigmoid 激活函数,且权重直接由预训练法向头进行热启动初始化。训练阶段直接以二值共面真值进行监督,采用二值交叉熵损失函数: $\(\mathcal{L}_{\text{planarity}} = -\frac{1}{N} \sum_{i=1}^N \left[ y_i \log \hat{y}_i + (1 - y_i) \log (1 - \hat{y}_i) \right]\)$ 其中 \(y_i \in \{0, 1\}\) 表示像素是否属于真实物理平面,\(\hat{y}_i\) 为模型预测的置信度。该轻量头仅带来约 10% 的推理延迟开销,在单张 RTX 3090 上训练 2 个 epoch(12 小时)即可收敛。

3. 几何引导单步并行区域生长:融合法向平滑与相对尺度的无迭代聚类 传统平面实例聚类要么依赖固定数量的 Transformer Query,要么依赖 CPU 上的顺序深度优先(DFS)/广度优先(BFS)遍历,前者对多平面复杂场景缺乏弹性,后者则难以适配 GPU 并行加速。为此,本文设计了一种单步全并行的无迭代区域生长算子。首先筛选出平整度置信度超过阈值 \(\tau_p = 0.3\) 的候选像素;随后在 GPU 上同时对每个像素评估其 \(5 \times 5\) 局部邻域(排除中心像素共 24 个邻居),必须同时满足三项几何连通判据: (i) 邻居像素同样为共面候选点(置信度 \(\ge \tau_p\));
(ii) 邻居像素处于法向平滑区域,其 Sobel 算子计算的法向梯度模长满足 \(\|\nabla n\| \le \sqrt{2 - 2 \cos \theta}\)(实验设 \(\theta = 5^\circ\));
(iii) 邻居与中心像素的深度差满足尺度自适应相对深度容差 \(|d_c - d_n| < \tau_{\text{rel}} \cdot d_c\)(实验设 \(\tau_{\text{rel}} = 0.025\))。
当 24 个邻居中满足全部三项条件的邻居数达到 \(T = 8\) 时,该像素被标定为有效连通节点。最后在 GPU 上执行一次单步连通分支分析(Connected Components),自然得到任意数量的离散平面实例掩码,既保证了几何边界的绝对锐利,又具备无上限实例建模灵活性。

4. 闭式奇异值分解平面拟合:无固定实例上限的点云参数解析求解 若在神经网络中单独设置分支回归平面法向量与截距参数,往往会导致输出的代数参数与预测的 2D 像素掩码产生几何脱节。本文采用完全解析的几何求解方式:利用 MoGeV2 预测的高精度度量 3D 点云图,对于区域生长得到的每个平面实例点集 \(S = \{P_i\}_{i \in S}\),直接构建最小二乘优化问题: $\(\hat{\mathbf{n}}, \hat{d} = \arg\min_{\|\mathbf{n}\|=1, d} \sum_{i \in S} |\mathbf{n}^\top P_i - d|^2\)$ 该问题通过对去中心化后的点云矩阵进行奇异值分解(SVD)求解,最小奇异值对应的左奇异向量即为最优法向 \(\hat{\mathbf{n}}\),投影均值即为偏移标量 \(\hat{d}\)。这种闭式求解完全免去了额外的参数回归训练,确保了 2D 实例掩码与其 3D 平面方程在几何上严格自洽,单帧耗时仅数微秒。

损失函数 / 训练策略

整个几何骨干及原有的深度、法向和点云解码头在训练过程中严格保持冻结状态,仅优化 4.7M 参数量的共面度预测头。优化器选用 AdamW,初始学习率设定为 \(1 \times 10^{-4}\),权重衰减系数为 \(1 \times 10^{-5}\),批处理大小为 4。输入图像统一调整至 \(476 \times 644\) 分辨率,在由 ScanNet++(真实室内)、Hypersim(合成室内)、Virtual KITTI 2(合成室外)和 SYNTHIA(合成室外)组成的联合数据集上训练 2 个 epoch,在单张 NVIDIA RTX 3090 GPU 上总耗时约 12 小时。

实验关键数据

主实验

在室内基准 ScanNet++ 与 Hypersim 上,本文方法与主流单目平面重建模型展开对比。在严苛的 3D 内点距离阈值(门控比例 \(\rho=0.9\))以及标准 2D 分割指标(RI, VOI, SC)下均展现出决定性优势:

数据集 方法 RI (↑) VOI (↓) SC (↑) [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected]
ScanNet++ PlaneRCNN 0.78 2.28 0.54 32.3 26.0 28.8 60.8 48.8 54.1 72.3 57.7 64.2
PlaneTR 0.77 2.04 0.51 13.3 12.8 13.0 30.1 28.7 29.4 38.8 37.1 37.9
PlanarRecon 0.77 2.25 0.51 18.9 16.4 17.6 39.2 34.2 36.5 49.6 43.2 46.2
PlaneRecTR 0.77 2.06 0.52 11.6 8.6 9.9 28.2 21.6 24.4 38.9 29.9 33.8
Sequential-RANSAC 0.76 1.96 0.56 31.0 20.8 24.9 60.8 40.4 48.6 72.5 47.8 57.6
Zeroplane 0.81 2.04 0.58 28.3 25.8 27.0 58.8 53.6 56.1 70.4 64.1 67.1
本文 (Ours) 0.83 1.81 0.66 62.1 41.8 50.0 88.8 60.1 71.7 92.8 62.8 74.9
Hypersim PlaneRCNN 0.74 2.99 0.43 41.3 26.8 32.5 45.9 29.4 35.9 50.8 32.3 39.5
PlaneTR 0.72 3.11 0.37 10.4 9.6 10.0 11.5 10.5 11.0 12.9 11.7 12.3
PlanarRecon 0.76 3.38 0.36 17.1 13.5 15.1 19.4 15.2 17.0 21.4 16.7 18.8
PlaneRecTR 0.76 3.07 0.39 11.8 8.8 10.1 13.2 9.8 11.2 14.9 11.1 12.7
Sequential-RANSAC 0.73 2.63 0.47 43.2 25.6 32.1 48.9 28.6 36.1 53.6 31.3 39.5
Zeroplane 0.86 2.49 0.52 35.4 31.1 33.1 39.1 34.3 36.5 43.2 37.9 40.3
本文 (Ours) 0.80 2.68 0.54 78.4 46.8 58.6 83.1 49.4 62.0 85.3 50.6 63.5

消融实验

在 ScanNet++ 数据集上对区域生长模块所采纳的三种几何线索(法向平滑度 N、相对深度连续性 D、逐像素共面度置信度 P)进行系统性消融验证:

法向 (N) 深度 (D) 共面度 (P) RI (↑) VOI (↓) SC (↑) [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected] [email protected]
- ✓ - 0.33 2.32 0.31 0.6 0.6 0.6 1.5 1.5 1.5 2.1 2.1 2.1
✓ - - 0.81 2.32 0.58 43.0 36.4 39.5 72.9 61.6 66.7 81.1 68.4 74.2
✓ ✓ - 0.81 2.30 0.59 45.5 38.5 41.7 76.0 64.2 69.6 84.3 71.1 77.1
✓ ✓ ✓ 0.83 1.81 0.66 62.1 41.8 50.0 88.8 60.1 71.7 92.8 62.8 74.9

关键发现

  1. 显式共面度是压低伪检的核心门控:从消融表可见,仅靠法向与深度线索在 0.1cm 阈值下的精确度仅为 45.5%,加入逐像素共面度 P 后精确度骤增至 62.1%(绝对提升 16.6%),分割覆盖度 SC 从 0.59 提升至 0.66。这证明单纯的局部法向平滑很容易向平滑曲面溢出,唯有显式共面度能阻断非平面区域的非法连通。
  2. 纯深度无法独立完成平面聚类:仅使用深度差作为连通判据时,3D 内点指标几乎归零([email protected] 仅 0.6%),表明深度不连续性只能切分边缘,无法感知平面的方向性与共面约束。
  3. 极高推理效率与轻量化:在 ScanNet++ 1000 帧测试中,本文模型参数仅 335.6M(仅比纯 MoGeV2 增加 5.6M),推理帧率达 13.3 FPS;相比采用 DUSt3R 的 Zeroplane(621.4M 参数,3.4 FPS)和 DINOv2 版本的 Zeroplane(374.0M 参数,4.5 FPS),速度快 3-4 倍,且完全超越了基于 RANSAC 的迭代基线(1.4 FPS)。

亮点与洞察

  • 法向头热启动先验迁移:复用法向预测头的架构与预训练权重来初始化平整度头,使浅层网络无需从零摸索几何微积分特征,仅耗费 10% 算力开销即高效习得密集共面度判据。
  • 解耦感知与聚类的优雅设计:抛弃了端到端回归实例数上限的黑盒检测器,将连续几何先验(深度/法向/共面度)交给网络密集估计,将离散拓扑聚类交给无参数 GPU 并行几何生长,大幅提升了对复杂未知场景的拓扑自适应能力。
  • 跨域泛化能力出众:在仅使用室内数据训练、直接迁移至室外合成数据(Synthia / VKITTI2)乃至真实互联网杂乱图像的评测中,精度依旧保持在 60%~95% 以上,显著抑制了传统 Transformer 检测器在分布偏移下的虚警现象。

局限与展望

  • 依赖底层单目几何骨干质量:方法对 MoGeV2 预测的绝对深度与表面法向存在强依赖;在弱纹理大白墙、反光玻璃或强遮挡区域,若骨干网络给出的法向严重失真,区域生长可能出现局部孔洞或边缘毛刺。
  • 固定几何阈值的尺度适应性:当前区域生长的法向夹角容差与相对深度阈值是全图全局固定的,在近景微结构与超远景开阔视野共存的场景下,可能存在近处过严、远处过宽的次优权衡。
  • 真值重构仍受物理传感器分辨率限制:针对真实场景网格重构真值时,ScanNet++ 的 LiDAR 扫描噪声依然在亚毫米级别存在物理极限,未来可结合多视角不确定性建模进一步提升监督质量。

相关工作与启发

  • vs PlaneRCNN / PlanarRecon: 此类经典方法采用 Mask R-CNN 风格框架,将平面视为带有边界框的目标实例进行检测与参数回归,往往受制于预设 Anchor 与启发式生成的含噪真值,在曲面附近假阳性严重;本文转向致密共面度预测并配合并行区域生长,彻底摆脱了 Anchor 框对复杂平面的拓扑束缚。
  • vs PlaneTR / Zeroplane: 此类方法使用 Transformer Query 查询机制直接输出固定数量的平面掩码,在未见过的复杂建筑中容易产生漏检或将多个离散小平面合并;本文通过底层的全并行区域生长自然适应任意数量的平面实例,且在 0.1cm 严格几何指标下 F1 分数几乎为 Zeroplane 的两倍。
  • vs MonoPlane / Sequential-RANSAC: 传统无监督几何拟合依赖串行 RANSAC 迭代剔除平面,计算效率极低(1.4 FPS)且容易在噪声深度中拟合出虚假穿插平面;本文利用深度神经网络预测高层共面度作为几何门控,并以 GPU 并行连通分支替代迭代抽取,兼具高精度与 13.3 FPS 的准实时速度。

评分

  • 新颖性: ⭐⭐⭐⭐ [显式将共面度作为密集预测任务引入单目几何感知,并提出全并行 GPU 区域生长算子]
  • 实验充分度: ⭐⭐⭐⭐⭐ [跨越 ScanNet++、Hypersim、Synthia、VKITTI2 及野生图像,深入揭露并修正了既有基准的真值缺陷]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述逻辑极其清晰,几何数学定义严密,消融与对比实验层层推进]
  • 价值: ⭐⭐⭐⭐⭐ [为单目 3D 重建、SLAM 和平面高斯泼溅提供了即插即用、高精度的平面提取基底]