Don’t Starve the Boundaries: Boundary-Constrained Label Propagation for Weakly Supervised 3D Segmentation¶
会议: ECCV 2026
论文: ECCV 官方主页
代码: https://github.com/paul-swu/Bound3D
领域: 3D视觉
关键词: 弱监督学习 / 3D语义分割 / 标签传播 / 边界约束 / 伪标签
一句话总结¶
针对弱监督三维点云语义分割中边界区域缺乏有效监督导致的“边界饥饿”难题,本文提出 Bound3D 框架,通过多模态几何线索投影构建3D边界、施加流形约束与最远角采样的伪标签传播,并结合位置感知分治监督机制,在无需外部大模型与昂贵标注的前提下显著提升了点云边界划分精度与整体分割性能。
研究背景与动机¶
点云三维语义分割在具身智能、自动驾驶与三维场景理解中扮演着核心角色。然而,对海量三维点云进行逐点密集标注极其耗时且昂贵,这严重制约了训练数据的规模扩展与三维基础模型的发展。为了摆脱全监督对密集标注的依赖,弱监督三维语义分割(WS3DSS)应运而生,通常仅依赖极其稀疏的标注信号(如 0.01% 极小采样率或每类/每目标一个点)。当前主流方法广泛依赖扰动一致性正则化或基于自训练的伪标签生成范式,但在复杂三维场景中普遍表现出严重的边界形变与语义失真——诸如邻近杂物边界粘连、门与相邻墙体相互渗透渗透、或细长结构被大类物体侵蚀吞并等系统性失效屡见不鲜。
这种边界失效的本质往往被直觉性地归咎于边界隐式监督强度不足。然而,通过在一致性基线中引入可控干预实验可以发现一个反直觉现象:当人为识别真实边界区域并成倍提高其一致性损失权重时,模型的整体 mIoU 与专门衡量边界分割质量的边界均交并比(B-mIoU)不仅没有提升,反而遭遇了更剧烈的滑坡;降低边界权重反而带来了性能恢复。这表明简单粗暴的一致性约束平滑了边界处的语义差异,模糊了本该清晰的类别分界。另一方面,传统自训练方法依赖网络自身预测的最大 softmax 概率并采用全局单一高阈值(如 0.90)来筛选高置信度伪标签,这一策略具有强烈的“偏好内部、过滤边界”的固有偏差。即便边界点的伪标签预测完全正确,其输出置信度也往往无法达到苛刻的全局阈值,直接导致边界区域长期得不到可靠梯度反馈,即所谓的“边界饥饿”(Boundary Starvation)。若强行降低阈值,不可避免的模型确认偏差又会迅速将错误的边界伪标签当作后续迭代的种子点,造成灾难性的误差累积。
为了打破这一困局,本文摒弃了依赖模型自身预测递归生成或依赖 SAM 等庞大外部视觉基座模型进行高代价 2D-3D 反投影的路线,转而从多视图几何与局部流形连续性切入。核心 idea:将伪标签生成与主干网络解耦,利用多视图深度与法向不连续性点亮三维边界,借助流形密度检验与最远角采样实施保边界标签传播,并配合位置感知分治监督自适应优化内部与边界区域。
方法详解¶
整体框架¶
Bound3D 的整体处理管线由三个协同模块构成:边界照亮模块(Boundary Illumination Module, BIM)、受控伪标签生成器(Boundary-constrained Pseudo Label Generator, BPLG)以及位置感知分治监督策略(Position-Aware Divide-and-Conquer, PADC)。在输入包含极稀疏弱标注点云及对应已校准多视图 RGB-D 与表面法向图后,BIM 首先在二维图像中联合深度梯度过滤与法向跳变提取几何边缘,并反投影至三维空间生成高质量的粗糙 3D 伪边界点集。随后,BPLG 以给定的稀疏标注点为种子,在由伪边界界定的流形切片内沿着高密度路径进行单调不越界的空间标签传播,并通过最远角采样最大化伪标签空间覆盖多样性;同时引入边界到达率(BAR)动态监控边界伪标签覆盖增量以触发迭代,并在后续迭代中严格限定新种子仅从核心内部区域选取,阻断确认偏差。最终,PADC 针对生成的伪标签按空间位置实施解耦监督:在弱扰动分支中利用辅助预测头聚焦核心区域校准类内表征,在强扰动分支中依据到三维边界的欧氏距离对边界点实施渐进加权交叉熵监督,促使网络在保持内部稳定的同时大幅强化边界判别力。整个架构的数据与控制流如下图所示:
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入数据<br/>稀疏点云 + 多视图RGB-D/法向"] --> B["边界照亮模块 (BIM)<br/>深度过滤Canny + 法向跳变投影"]
B --> C["边界约束标签传播 (BCLP)<br/>流形密度检验 + 最远角采样FAS"]
C --> D["边界到达率迭代器 (BAR)<br/>动态增量触发 + 核心区安全种子"]
D --> E["位置感知分治监督 (PADC)<br/>弱视图核心校准 + 强视图距离加权"]
E --> F["输出预测<br/>推理期纯点云高保真分割"]
关键设计¶
1. 边界照亮模块(BIM):多模态几何线索诱导高保真3D伪边界 纯粹依赖稀疏三维点云直接检测边界极其困难,因为点云分布离散且弱监督缺乏语义轮廓先验。为此,BIM 充分利用标定的多视图观测几何线索来还原清晰边界。对于每个视点 \(j\),首先在 RGB 图像 \(I_j\) 上运行 Canny 边缘检测获得初始二值边缘 \(E_j\)。为了强力抑制物体内部由于纹理变化(如木纹、地毯图案)造成的误检噪声,模块引入对数空间深度梯度掩码 \(M_j^{\text{dep}}\): $\(M_j^{\text{dep}} = \mathbf{1}\left[\sqrt{(\partial_u \log D_j)^2 + (\partial_v \log D_j)^2} > \tau_d\right] \cdot \text{valid}(D_j)\)$ 将深度不连续边缘定义为 \(E'_j = E_j \cap M_j^{\text{dep}}\)。考虑到深度值对视线夹角极度敏感且在大距离场景中易发生退化,BIM 进一步在表面法向图 \(N_j\) 上计算局部窗口内的法向夹角突变,构造法向不连续掩码 \(M_j^{\text{norm}}\): $\(M_j^{\text{norm}} = \mathbf{1}\left[\min_{u' \in \mathcal{N}_{r_n}(u)} \left| n_j(u)^\top n_j(u') \right| < \cos \theta \right]\)$ 将二者取并集 \(B_j = E'_j \cup M_j^{\text{norm}}\) 后,利用相机内外参矩阵与对应深度反投影回三维空间,聚合生成全场景的 3D 伪边界点集 \(\Phi\)。这一过程完全规避了庞大基础模型的昂贵推理,仅凭借多模态原生几何连续性即可提取出干净利落的物理分界线。
2. 边界约束标签传播与最远角采样(BCLP & FAS):流形密度代理与空间各向同性扩展 在三维场景中,物体表面在几何上可视为嵌入在 \(\mathbb{R}^3\) 中的二维连通流形流形切片,语义标签在同一流形内部保持局部常数,仅在物理边界 \(\Phi\) 处发生突变。BCLP 确立了“边界优先于一致性”的传播原则:从标注种子点 \(x_\ell\) 出发,向其邻域候选边界点 \(x_b \in \mathcal{B}(x_\ell)\) 连成的三维线段 \(\text{Path}(x_\ell, x_b)\) 探索。为了低成本检验路径是否始终保持在同一表面流形而不横跨空间空洞或跳转至异质物体表面,BCLP 引入流形密度代理条件。在路径上等距采样离散点集合 \(\mathcal{G}\),要求集合中每个采样点 \(g\) 在半径 \(r\) 内的局部点云计数不低于设定阈值 \(\tau\): $\(\forall g \in \mathcal{G}: \quad |\mathcal{N}(g, r)| \ge \tau\)$ 一旦路径通过检验,即判定该路径安全未跨越边界,将整条路径周围搜索半径 \(r_s\) 内的所有点集 \(\mathcal{S}\) 全部落盘赋予与种子点相同的伪标签 \(y_{x_\ell}\)。此外,若穷举式检测所有边界候选点在计算上过于昂贵且易陷入局部聚集,BPLG 创新性地引入最远角采样(Farthest Angle Sampling, FAS)。针对候选边界方向向量,FAS 借鉴空间最远点采样的思想将其转移至角度域,贪心地挑选与已选方向集合具有最大角间距的候选点: $\(x_{k+1} = \arg\max_{x \in \mathcal{B}(x_\ell) \setminus S_k} \min_{x_m \in S_k} \theta\big(\mathbf{u}(x; x_\ell), \mathbf{u}(x_m; x_\ell)\big)\)$ 这种贪心角度分散机制确保了伪标签在各个物理方向上各向同性且均匀地向外铺展,极大增强了生成伪标签的空间多样性。
3. 边界到达率触发与双阈值动态迭代(BAR & BPLG):防确认偏差与区域自适应伪标签迭代 传统自训练方法采用预设固定的更新步长与全局置信度截断,容易在安全的核心区域形成无效冗余累加,同时由于模型在边界预测天然缺乏高置信度而漏掉真实的边界点。为此,BPLG 将点云场景显式解耦为边界缓冲区 \(\mathcal{R}_b\)(位于 \(\Phi\) 半径 \(r_b\) 范围内的点集)与核心内部区 \(\mathcal{R}_c\)。并定义边界到达率(Boundary Arrival Rate, BAR)覆盖度指标: $\(\mathcal{C}_{\text{bar}} = \frac{\sum_{x \in \mathcal{P}^{(t)}} \mathbf{1}[x \in \mathcal{R}_b]}{|\mathcal{R}_b|}\)$ 只有当当前轮次较上一轮的边界覆盖增量 \(\Delta \mathcal{C}_{\text{bar}} = \mathcal{C}_{\text{bar}}^{(t)} - \mathcal{C}_{\text{bar}}^{(t-1)} > \eta\) 时,才激活新的 BCLP 传播迭代;一旦增量放缓停滞,即刻终止生成以杜绝无意义的内部空耗。在伪标签过滤筛选阶段,PADC 采取区域特异的双阈值设计:为边界区 \(\mathcal{R}_b\) 赋予相对较低的预测截断阈值 \(\tau_b\),为内部区 \(\mathcal{R}_c\) 维持高阈值 \(\tau_c\)(即 \(\tau_b < \tau_c\))。这一非对称过滤打破了置信度偏差,使得被几何界定的边界点能够顺利获取伪标签。更为关键的是,为了杜绝自训练中最具破坏性的确认偏差与误差放大,新迭代所需的种子点被严格限制在核心区 \(\mathcal{R}_c\) 的超高置信度子集中选取,边界区 \(\mathcal{R}_b\) 被彻底移出候选种子池,从而在源头上切断了模糊边界预测污染全局传播的链路。
4. 位置感知分治监督(PADC):弱视图核心校准与强视图距离加权边界增强 将点云样本等同视之的统一约束会不可避免地削弱边界特征辨识度。PADC 构建了非对称扰动的双分支网络,针对核心区与边界区实施分治优化。在弱扰动分支中,为了防止反向传播更新破坏骨干网络的全局特征分布,引入轻量级辅助预测头并施加梯度截断(stop-gradient)。该头专门拟合核心区 \(\mathcal{R}_c\) 的高纯度伪标签: $\(\mathcal{L}_{\text{w}} = \frac{1}{|\mathcal{R}_c|} \sum_{x \in \mathcal{R}_c} \text{CE}(O_{a_x}, \tilde{y}_x)\)$ 使其充当稳定的类内表征锚点。在强扰动分支中,网络主要承担最具挑战性的边界样本优化。由于越靠近三维几何边界的点语义歧义性越大,PADC 为 \(\mathcal{R}_b\) 内的点赋予基于距最近伪边界欧氏距离 \(d_x\) 的动态权重: $\(w_x = 1 + \lambda_d \left( \frac{d_x}{r_d} \right)\)$ 并通过距离加权交叉熵损失 \(\mathcal{L}_{\text{s}}\) 聚焦于近边界特征判别: $\(\mathcal{L}_{\text{s}} = \frac{\sum_{x \in \mathcal{R}_b} w_x \cdot \text{CE}(O_{s_x}, \tilde{y}_x)}{\sum_{x \in \mathcal{R}_b} w_x}\)$ 为了避免主干网络过分偏执于边界而产生视野狭隘,PADC 进一步引入极小权重 \(\gamma\) 的核心区补充损失 \(\mathcal{L}_{\text{sup}}\),允许少许内部信号微调强分支。联合稀疏有标注点的真实监督损失 \(\mathcal{L}_{\text{gt}}\) 以及无标注点上强弱分支间的 Jensen-Shannon 散度一致性损失 \(\mathcal{L}_{\text{consis}}\),构建出整体优化目标: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{gt}} + \mathcal{L}_{\text{w}} + \lambda_1 \mathcal{L}_{\text{s}} + \lambda_2 \mathcal{L}_{\text{consis}} + \gamma \mathcal{L}_{\text{sup}}\)$ 从而在确保全局流形平滑的同时,将高锐度的语义跳变刻蚀在物理边界处。
实验关键数据¶
主实验¶
论文在 S3DIS 与 ScanNetV2 两个主流三维室内语义分割基准上展开了极其严格的对比验证。下表给出了 S3DIS Area 5 在极稀疏标注设置下的主结果对比:
| 数据集 / 标注预算 | 方法 | 骨干网络 | 发表年份 | mIoU (%) | B-mIoU (%) |
|---|---|---|---|---|---|
| S3DIS (0.01% GT) | SQN | SparseConv | ECCV 2022 | 45.3 | - |
| S3DIS (0.01% GT) | CPCM | MinkowskiNet | ICCV 2023 | 59.8 | - |
| S3DIS (0.01% GT) | PointMatch | PointNet++ | CG 2023 | 59.9 | - |
| S3DIS (0.01% GT) | AADNet | SparseConv | AAAI 2025 | 60.8 | - |
| S3DIS (0.01% GT) | Bound3D (本文) | MinkowskiNet | ECCV 2026 | 61.2 | 54.5 |
| S3DIS (1 pt/obj) | OTOC (0.02% 预算) | MinkowskiNet | CVPR 2021 | 50.1 | - |
| S3DIS (1 pt/obj) | DAT (0.02% 预算) | MinkowskiNet | ECCV 2022 | 56.5 | - |
| S3DIS (1 pt/obj) | RAC-Net (0.02% 预算) | MinkowskiNet | IJCV 2024 | 58.4 | - |
| S3DIS (1 pt/obj) | AO-PTv2 | Point Transformer v2 | CVPR 2024 | 62.7 | - |
| S3DIS (1 pt/obj) | Bound3D (本文) | MinkowskiNet | ECCV 2026 | 61.9 | 55.1 |
| S3DIS (1 pt/obj) | Bound3D-PTv2 (本文) | Point Transformer v2 | ECCV 2026 | 63.5 | 56.8 |
在 ScanNetV2 测试集上,即便面对更复杂杂乱的扫描点云,Bound3D 同样取得了显著超越前代 SOTA 的精度:在 0.1% 标注下达到 63.2% mIoU(超越经典 SQN 达 +6.3%);在 20 points/scene 的极度受限预算下达到 62.4% mIoU(分别超越 MIL、DAT 与 OTOC 达 +8.0%、+7.2% 与 +3.0%)。
消融实验¶
在 S3DIS Area 5(0.01% 弱监督设置)下对 Bound3D 核心模块逐级叠加与组件级排除分析如下表所示:
| 模块配置层级 | 配置说明 | mIoU (%) | B-mIoU (%) | 说明 / 相对增益 |
|---|---|---|---|---|
| 纯稀疏监督 | MinkowskiNet 仅用极少 GT 训练 | 49.3 | 44.4 | 缺乏无标注点利用机制 |
| 基础一致性框架 | Baseline (引入标准扰动一致性) | 55.8 | 49.0 | 显著激活无标注数据 (+6.5% mIoU) |
| 单轮离线传播 | Baseline + BCLP1 | 56.7 | 49.4 | 几何受控标签注入 (+0.9% mIoU) |
| 迭代传播生成 | Baseline + BCLPn (完整 BPLG) | 60.7 | 52.9 | BAR与双阈值动态驱动 (+4.0% mIoU) |
| 完整模型 | Bound3D (Baseline + BCLPn + PADC) | 61.2 | 54.5 | 分治加权监督提升边界锐度 (+0.5% mIoU / +1.6% B-mIoU) |
| 组件排除分析 | w/o FAS (最远角采样改为随机采样) | 59.3 | 51.6 | 采样方向聚集导致空间多样性匮乏 (-1.9% mIoU) |
| 组件排除分析 | w/o 区域特异双阈值 (统一高阈值) | 58.9 | 51.2 | 边界高置信度缺失引发严重边界饥饿 (-2.3% mIoU) |
| 组件排除分析 | w/o 距离加权损失 (边界区均匀权重) | 60.0 | 52.8 | 缺乏对难样本渐进梯度的针对性关注 (-1.2% mIoU) |
| 梯度截断验证 | w/o stop-gradient (辅助预测头不切断梯度) | 60.3 | 53.0 | 噪声反向渗透污染骨干网络表征 (-0.9% mIoU) |
伪标签质量与关键发现¶
- 纯度与覆盖均衡性远超 SAM 派系:在 S3DIS 1 pt/obj 设置下,第一轮标签传播 BCLP1 即可生成每场景 93,565 个伪标签,总体精度高达 94.4%,边界区域精度(B-Acc)达 92.7%。相比之下,CVPR 2024 的 SAM 投影基线 PP2S 虽然凭借致密掩码生成了 27.8 万个点,但其精度仅有 77.1%,边界精度更是低至 66.1%。在 ScanNetV2 上,BCLP1 的伪标签准确率同样达到 93.3%(边界 91.0%),大幅超越 SAM3D 的 81.8%。
- 非大类虚高而是全类别均衡保真:类别逐项精度分析显示,Floor(99.18%)、Beam(96.13%)、Ceiling(95.22%)、Sofa(95.19%)与 Wall(93.15%)维持极高准确率;即便面对中小型结构化类别如 Door(88.53%)与 Board(82.71%),准确率依然坚挺在 80% 以上,证明高总体准确率并非仅靠大面积地墙平面粉饰。唯一的相对短板是极细碎杂物类别 Clutter(75.34%),这是因为极薄微小物体在多视角投影中边界线索较弱。
- 边界阈值与距离加权的必要性:消融数据显示,去除区域特异双阈值会导致 mIoU 与 B-mIoU 分别大幅暴跌 2.3% 与 3.3%,证实统一高阈值正是诱发“边界饥饿”的罪魁祸首。此外,弱分支辅助预测头的 stop-gradient 机制是防止边界不确定性向内侵蚀骨干特征的生命线,去掉该操作会直接导致整体性能衰退近 1 个百分点。
亮点与洞察¶
- 跳出视觉基础大模型内卷,回归底层几何约束:当前诸多 3D 弱监督工作依赖庞大的 2D 视觉模型(如 SAM、CLIP)进行特征蒸馏或多视点投票,存在严重的 2D-3D 拓扑错配、多视点遮挡重叠漂移以及高昂的推理耗时。本文证明巧妙借助经典的 Canny 边缘、深度梯度与法向夹角突变,即可直接构建具有严格几何一致性的 3D 边界,其伪标签精度反而在纯度与鲁棒性上超越了 SAM 派系。
- “边界优先于一致性”的流形传播理念:将物体表面严谨建模为局部连通的 2D 流形,通过离散采样点云局部密度作为 co-manifold 代理条件,并结合最远角采样,在常数级时间内实现了防穿透、防跨空洞的高保真伪标签空间扩散。
- 非对称位置分治策略破除一致性悖论:敏锐地揭示并解决了单纯增强边界一致性反而劣化性能的“边界饥饿”反常现象。利用辅助头稳定弱分支核心语义,利用距离感知加权驱动强分支深挖边界特征,为密集预测中的非均匀监督提供了普适设计范式。
局限与展望¶
- 依赖较密集的已标定 RGB-D 与法向观测:BIM 模块依赖校准良好的多视点 RGB-D 图像及可靠的表面法向图。在极端无光照、远距离严重缺失深度或无纹理的大尺度室外场景(如远距离车载 LiDAR 点云)中,2D 边界提取与法向估计质量可能下降,限制了其在自动驾驶车载端的使用。
- 对极薄与微小几何物体的边界感知存在盲区:从实验中的 Clutter 类准确率(75.34%)可以看出,对于尺寸极其微小的杂乱物体或细管线,投影与离散深度梯度的分辨率有限,容易遗漏边界。作者指出未来引入基于隐式距离场的精细三维形状建模有望补全微小结构的边界精度。
相关工作与启发¶
- vs PP2S / SAM3D 等基于 SAM 的跨模态投影方法: 这类方法依赖 2D 基础模型的多视角提示分割再投影到 3D 聚类,生成的点虽密但夹杂大量的视差与透视噪声,边界不确定性高;Bound3D 规避了外部大模型,通过原生几何边缘与流形密度路径约束,生成更均匀、更高纯度(94.4% vs 77.1%)且计算开销极低的伪标签。
- vs CPCM / DAT 等扰动一致性框架: 传统一致性方法对所有点施加均匀对齐正则,在边界模糊区域往往引发语义过度平滑;Bound3D 提出了 PADC 位置感知分治机制,将内部核心锚定与近边界距离加权监督正交解耦,打破了边界特征被内部平滑惩罚稀释的困局。
- vs WS3D / BAGE 等边界引导点云分割: 全监督下的 BAGE 依赖密集 GT 边界作为硬阻隔,弱监督下的 WS3D 则需额外单独训练一个复杂的边界预测网络;Bound3D 无需辅助网络,直接由无监督多模态投影获得 3D 边界,并将其有机融于流形标签传播与分治损失中。
评分¶
- 新颖性: ⭐⭐⭐⭐ [针对弱监督点云分割敏锐揭示“边界饥饿”现象,提出流形几何约束与位置感知分治新范式]
- 实验充分度: ⭐⭐⭐⭐⭐ [在 S3DIS 与 ScanNetV2 多种极稀疏配额下全面评测,伪标签质量与消融实验分析极其扎实详尽]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密流畅,反直觉实验发现引人入胜,公式定义严谨,图表表达直观]
- 价值: ⭐⭐⭐⭐ [摆脱对重型基础模型的算力依赖,为低成本点云三维场景解析提供了高性价比的新基准]