跳转至

NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation

会议: ECCV 2026
论文: ECCV 原文
代码: 待开源
领域: 自动驾驶 / 3D点云分割
关键词: 交互式3D分割、点云体素化、负向提示、不确定度引导、跨域鲁棒性

一句话总结

NegROI 针对点云交互式分割中粗体素边界模糊与背景假阳性泛滥的顽疾,提出点击中心的多分辨率不确定度细化机制与场景条件负向原型学习,显著降低交互轮次并增强从室内到室外自动驾驶场景的泛化鲁棒性。

研究背景与动机

点云交互式分割旨在通过用户提供的极少量正负点击反馈,高效迭代提取复杂 3D 场景中的目标实例掩码,是自动驾驶高精标注与具身环境理解中大幅削减人工点级标注开销的关键技术。当前主流方法(如 InterObject3D、AGILE3D 与 Easy3D)大多先将连续点云离散化为规则体素网格以保证计算效率,再利用双向 Transformer 解码器在体素特征与交互点击标记之间建立交叉注意力。然而,在实际人机交互标注过程中,这种范式面临两个长期存在的结构性缺陷:其一是单分辨率粗网格带来的边界欠分割,在点击预算极其有限的前几轮交互中,粗体素池化会抹平纤细结构与几何分界;其二是复杂背景引发的顽固假阳性(Hard False Positives),与目标在几何或色彩上邻近的背景构件极易诱发高置信度的误激活。

当模型从密集的室内 RGB-D 重建(如 ScanNet)迁移到大范围、稀疏且分布差异巨大的室外车载激光雷达场景(如 KITTI-360)时,上述缺陷会被进一步放大。室内环境以平面墙体与规则家具接触为主,而室外车载场景则面临长距离扫描退化、非均匀点密度以及大跨度背景干扰物。现有基于启发式固定搜索或单纯依靠正向/纠错点击引导的模型,缺乏对复杂背景干扰的原型级显式建模,导致纠正一个假阳性往往需要额外耗费数次点击,交互效率急剧下降。

本文的切入视角在于将局部几何细化与全局背景抑制进行解耦协同:既然粗分辨率的全局感知不可或缺,精细计算就应按需分配在当前交互发生的高不确定度局部,同时必须建立显式的负向原型来锚定背景中的混淆区域。核心 idea:通过场景条件负向提示与边界难负样本挖掘显式压制结构性假阳性,并结合点击中心的不确定度门控,在细网格 ROI 内局部细化后残差回传至粗预测,实现低点击预算下高精边界与强跨域泛化。

方法详解

整体框架

NegROI 的完整交互推理流程围绕“粗分辨率全局感知 + 显式负向原型抑制 + 细网格不确定度局部细化”展开。给定原始点云与当前交互步已累积的用户点击集合,系统首先将点云离散为粗体素并提取场景特征标记;通过相对位置编码注入交互点击后,引入一组可学习的负向查询与场景标记做交叉注意力,生成反映当前场景干扰分布的负向原型标记;粗体素双向 Transformer 解码器输出初始前景预测。随后,系统以当前点击为几何中心、结合局部点云密度预测自适应半径并结合粗预测二值不确定度门控,仅筛选出高歧义点构建局部感兴趣区域(ROI);局部区域在细体素网格下重体素化,复用共享的主干编码器与解码器获取精细预测,最后通过最大值聚合映射回粗网格并执行残差融合更新。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入点云与用户交互点击"] --> B["场景条件负向提示与多样性正则<br/>跨注意力提取K个背景原型并惩罚相似度"]
    B --> C["边界感知难负样本注意力监督<br/>挖掘边界高置信假阳并监督原型注意力"]
    C --> D["双向Transformer解码器<br/>前背景差分计算生成粗体素预测Logits"]
    D --> E["不确定度引导的自适应 ROI 筛选<br/>局部密度自适应半径与二值不确定度门控"]
    E --> F["细网格局部细化与残差融合<br/>细分辨率重体素化+共享分支细化与Max残差更新"]
    F --> G["输出最终细化分割掩码"]

关键设计

1. 场景条件负向提示与多样性正则:显式解耦并表征场景专属背景干扰

常规交互方法在解码器中仅使用通用的前景/背景掩码标记与点击标记,难以区分结构相似的局部物体与复杂背景干扰。NegROI 引入 \(K\) 个可学习的负向查询向量 \(\{q_k\}_{k=1}^K\),在解码前让其与粗场景体素特征及相对位置编码进行交叉注意力交互,动态提炼出能够感知整场几何与纹理上下文的 \(K\) 个场景条件负向原型标记:

\[\hat{p}_k^{(c)} = \text{MLP}\left(\text{Attn}\left(q_k, H + P, H + P\right)\right) + e(\text{neg})\]

为了防止这 \(K\) 个负向原型在优化过程中退化崩塌至相似的平凡表征,设计了原型间多样性正则化损失 \(\mathcal{L}_{div}^{(c)}\),惩罚任意不同负向原型之间的非对角余弦相似度平方:

\[\mathcal{L}_{div}^{(c)} = \frac{1}{K(K - 1)} \sum_{i \neq j} \cos\left(p_i^{(c)}, p_j^{(c)}\right)^2\]

这种多样性约束迫使各负向原型在特征流形上正交分散,分别锚定墙壁、地板、相邻无关结构及远处散射噪点等异质背景模式,为解码器提供结构丰富的对比参照。

2. 边界感知难负样本注意力监督:定向引导负向原型聚焦边界易混淆假阳

单纯依靠最终分割损失难以直接迫使负向原型的注意力精准分布在最具破坏性的干扰区域。为此,NegROI 提出了边界感知难负样本挖掘机制。首先在粗体素网格中通过 6-邻域提取出紧贴真实目标边界的外侧背景候选体素集合 \(\mathcal{B} = \{j \mid y_j = 0, \exists j' \in \mathcal{N}(j) \text{ s.t. } y_{j'} = 1\}\);随后在候选集中选出当前粗预测前景概率 \(p_j = \sigma(s_j^{(c)})\) 最高的 Top-\(k\) 个体素构成难负样本集合 \(\mathcal{H}\)。通过最小化交叉熵损失,直接拉近负向原型注意力权重均值 \(\bar{A}^{(c)}\) 与难负样本均匀分布之间的距离:

\[\mathcal{L}_{hn}^{(c)} = - \sum_{j=1}^V t_j \log\left(\bar{A}_j^{(c)} + \epsilon\right), \quad t_j = \frac{1}{|\mathcal{H}|}\mathbb{I}[j \in \mathcal{H}]\]

该项监督让负向原型明确学习去“盯防”紧挨着目标边缘的那些高置信度假阳性体素,使得双向解码器在计算前景与背景标记差异时能精准压低目标边界外侧的激活响应。

3. 不确定度引导的自适应 ROI 筛选:按需分配高分辨率局部计算

针对全场景密集高分辨率体素化所带来的显存与计算爆炸瓶颈,NegROI 采取以当前点击为锚点的局部细化策略。为适应稀疏度剧烈变化的场景,半径 \(r_c\) 并非固定常数,而是以衰减基础半径 \(r_0 \gamma^{c-1}\) 为基准,利用 \(k\)NN 局部密度统计量(距离均值 \(\mu\) 与中位数 \(m\))和点击特征输入轻量 MLP 预测自适应膨胀/收缩系数 \(\Delta_c\),得到截断半径 \(r_c = \text{clip}(r_{base}^{(c)} \exp(\Delta_c))\)。更为关键的是,模型引入了粗体素预测的二值不确定度门控:

\[u_j = 1 - 2\left|\sigma(s_j^{(c)}) - 0.5\right| \in [0, 1]\]

仅将落在 ROI 球体内且其所在粗体素满足不确定度阈值 \(u_{v(i)} \ge \tau\)(默认 \(\tau=0.20\))的点送入局部细化流水线。此举将细网格计算彻底收敛于分类模糊和边界歧义区域,完全跳过了内部已经极度确信的前景与大片开阔背景,兼顾了高效性与抗噪性。

4. 细网格局部细化与残差融合:跨分辨率高精边界恢复与平滑更新

被筛选出的 ROI 点集按照缩小的体素尺寸 \(v_f = v/\eta\)(缩放因子 \(\eta=2\))执行重体素化,生成细网格体素。为保持模型轻量并利用预训练能力,细网格分支完全复用粗网格的主干编码器 \(E\) 与双向解码器 \(D\) 的权重,产生细粒度预测分对数 \(s_{f, u}^{(c)}\)。在反向回填时,每个细体素依据其在粗网格中的映射关系进行局部最大值聚合(Max-Aggregation):

\[\hat{s}_j^{(c)} = \max_{u \in \mathcal{M}(j)} s_{f, u}^{(c)}\]

聚合后的细预测以残差插值形式与原粗预测更新融合:\(s_j^{(c)} \leftarrow (1 - \alpha) s_j^{(c)} + \alpha \hat{s}_j^{(c)}\)(默认融合权重 \(\alpha=0.7\))。最大值聚合保证了纤细结构与微小突出部只要在细网格中被识别出就不会在离散化投影中丢失,而残差更新则防止了单次局部改写对全局一致性造成的剧烈扰动。

损失函数 / 训练策略

在训练阶段,NegROI 采用交互式模拟 Oracle 策略:首个点击采样在目标真实掩码内部,后续交互依次放置在当前预测误差最大的连通区域(若欠分割主导则添加正向点击,若过分割假阳性主导则添加负向点击),最多模拟 \(C\) 步。单步损失涵盖融合后的分割损失以及负向提示正则项:

\[\mathcal{L} = \frac{1}{C}\sum_{c=1}^C \left[ \mathcal{L}_{bce}\left(s^{(c)}, y\right) + \mathcal{L}_{dice}\left(s^{(c)}, y\right) + \lambda_{hn}\mathcal{L}_{hn}^{(c)} + \lambda_{div}\mathcal{L}_{div}^{(c)} \right]\]

为规避分布式数据并行(DDP)中自适应半径硬阈值截断导致的无梯度未使用参数报错,额外在自适应偏移 \(\Delta_c\) 上施加微弱的 \(L_2\) 正则项 \(\mathcal{L}_{rad} = \lambda_{rad}\|\Delta_c\|_2^2\)。

实验关键数据

主实验

主实验在统一的“ScanNet40 上训练”协议下开展,在室内 ScanNet40(域内)以及跨域室内 S3DIS 和室外自动驾驶场景 KITTI-360 上进行零样本跨域迁移测试,严格衡量各方法在不同点击预算 \(k \in \{1, 2, 3, 5, 10\}\) 下的点级交并比(IoU@k, %)。

数据集 方法 IoU@1 IoU@2 IoU@3 IoU@5 IoU@10
ScanNet40 (域内) InterObject3D 40.8 55.9 63.9 67.6 77.6
AGILE3D 63.0 70.6 75.1 79.7 83.5
Easy3D 68.2 74.6 77.3 79.6 81.7
NegROI (本文) 72.1 78.1 80.9 82.3 83.6
S3DIS (跨域室内) InterObject3D 38.5 54.0 62.5 72.4 79.9
AGILE3D 58.5 70.7 77.4 83.6 88.3
Point-SAM 38.8 n/a 67.1 72.2 80.6
Easy3D 65.7 76.0 80.8 84.9 87.8
NegROI (本文) 66.9 77.8 82.2 85.4 87.8
KITTI-360 (跨域室外) InterObject3D 2.0 5.1 8.5 72.4 83.6
AGILE3D 34.8 40.7 42.7 44.4 49.6
Point-SAM 44.0 n/a 67.1 72.2 80.8
Easy3D 46.3 58.7 66.7 76.2 83.6
NegROI (本文) 47.5 62.6 71.4 80.1 87.7

消融实验

为定量剥离各设计模块的独立增益,论文在 ScanNet40 与 S3DIS 上进行了逐级使能消融实验(汇报 IoU@1, IoU@5, IoU@10)。

实验变体配置 ScanNet40 IoU@1 ScanNet40 IoU@5 ScanNet40 IoU@10 S3DIS IoU@1 S3DIS IoU@5 S3DIS IoU@10 说明
Base (无 ROI, 无 NEG 提示) 67.0 78.8 80.8 62.5 80.8 83.8 基础双向 Transformer 基线
+ 场景条件负向提示 69.2 80.4 82.3 64.2 83.0 85.7 初步建立背景原型抑制
+ 细网格 ROI 局部细化 70.9 81.6 83.0 65.8 84.1 86.9 提升纤细边界还原能力
+ 不确定度引导 ROI 筛选 71.8 81.9 82.8 66.5 85.0 87.4 聚焦歧义区域削减误激活
+ 边界难负样本监督 (\(\mathcal{L}_{hn}\)) 71.2 82.1 83.1 65.6 85.2 87.1 定向引导负向原型关注边缘
+ 多样性正则 (\(\mathcal{L}_{div}\)) (完整模型) 72.1 82.3 83.6 66.9 85.4 87.8 防止原型退化,达到全指标最优

关键发现

  • 极少点击下收益最为悬殊:在 1 到 3 次点击的稀疏交互阶段,NegROI 的提升最为剧烈。例如在 ScanNet40 上 IoU@1 从 Easy3D 的 68.2% 飙升至 72.1%(+3.9%);在室外 KITTI-360 上,IoU@2 提升 3.9%(58.7% \(\rightarrow\) 62.6%),IoU@3 提升 4.7%(66.7% \(\rightarrow\) 71.4%)。这证明早期交互的主要瓶颈在于背景粘连与假阳性,而负向原型成功斩断了这种误激活。
  • 室外跨域鲁棒性卓越:在从未见过的 KITTI-360 车载激光雷达场景中,先前专注于室内的基线(如 AGILE3D)因点云稀疏和长距离尺度拉伸几乎失效(IoU@10 仅 49.6%),而 NegROI 最终达到了 87.7% 的高精度(比 Easy3D 的 83.6% 高出 4.1 个百分点),展现了极强的几何密度自适应性。
  • 双重正则化缺一不可:消融数据表明,单独加入 \(\mathcal{L}_{hn}\) 虽然增强了边界监督,但若缺少 \(\mathcal{L}_{div}\),原型容易向单一难负样本过度集中导致崩塌;加入 \(\mathcal{L}_{div}\) 后,各原型形成差异化正交表征,使得模型在 ScanNet40 与 S3DIS 上均取得全局最高性能。

亮点与洞察

  • 将难负样本先验显式沉淀为场景原型:传统交互方法往往被动等待用户放置负向点击来修正错误,而 NegROI 主动从场景特征中以注意力挖掘 \(K\) 个负向原型,将纠错由“人机串行试错”转为“模型自发抑制”,设计极具先验引导价值。
  • 解耦分辨率与计算开销的局部 ROI 机制:全场景高分辨率体素化计算不可承受,而 NegROI 巧妙利用用户点击的物理局部性与预测置信度,把细网格算力百分之百收敛在刀刃上,这种“按需精细化”范式对大尺度 3D 视觉系统有通用借鉴意义。
  • 最大值聚合的几何保全优势:在细网格向粗网格回传时采用最大值聚合而非平均池化,有效避免了边界孤立细小体素在降采样平均中被稀释抹除的痛点。

局限与展望

  • ROI 离散阈值不可导性:当前通过硬阈值截断筛选 ROI 点和半径,导致该模块在端到端反向传播时存在梯度截断,未来可探索连续概率门控或软分布体素化机制。
  • 仅限测试时前向更新:目前的交互依然依赖固定的离线训练参数,未能利用连续交互序列中用户提供的点击轨迹进行轻量化的测试时自适应(Test-Time Adaptation)。
  • 极度稀疏远距离激光雷达退化:在室外自动驾驶场景中,超过 50 米外的超稀疏扫描点云(单物体仅个位数回波点)上,局部密度估计可能产生较大方差,影响自适应半径的预测精度。

相关工作与启发

  • vs Easy3D: Easy3D 作为当前强基线,采用双向 Transformer 取得了出色的单分辨率交互表现,但缺乏对边界区域和难负样本的专门处理;NegROI 在保持相同主干架构与交互简洁性的前提下,引入负向提示和 ROI 双分辨率机制,全面超越了 Easy3D。
  • vs AGILE3D / InterObject3D: 早期 3D 交互方法对多尺度和复杂上下文建模不足,且在面临未见过的跨域场景(如从室内迁移至 KITTI 车载雷达)时性能大幅跳水;NegROI 凭借自适应局部密度估计和解耦原型学习,在跨域泛化能力上具备压倒性优势。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [提出场景负向原型与点击中心不确定度双分辨率细化结合,思路清晰且高度自洽]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖室内 RGB-D、跨域室内与室外 LiDAR 自动驾驶基准,消融完备深入]
  • 写作质量: ⭐⭐⭐⭐☆ [结构严谨,动机明确,数学推导与实验论证严丝合缝]
  • 价值: ⭐⭐⭐⭐⭐ [大幅提升 3D 点云交互标注效率,对自动驾驶海量激光点云数据低成本生产具有重要落地价值]