跳转至

Online Segment 3D Gaussians via Launching Virtual Drones

会议: ECCV 2026
论文: ECCV 原文
领域: 3D视觉
关键词: 3D高斯泼溅, 交互式3D分割, 虚拟无人机, 视点规划, 掩码视锥过滤

一句话总结

SAGO 将交互式 3D 高斯泼溅分割重构为虚拟无人机引导的在线次优视点(NBV)马尔可夫规划过程,彻底摒弃耗时的逐场景预处理阶段,实现亚秒级(0.4~0.9 秒)高质量 3D 资产提取。

研究背景与动机

3D 高斯泼溅(3DGS)凭借逼真的显式辐射场建模与极快的实时渲染效率,已成为三维重建与场景表征的重要技术支柱,并在具身智能、机器人交互、虚拟现实与沉浸式媒体等下游领域展现出广阔的应用前景。为了支持场景编辑、目标提取和具身交互,交互式 3D 分割成为赋予 3DGS 语义与实例理解能力的关键前置步骤。用户通常希望在某单一参考视角上通过点选、画框或文本提示快速圈定感兴趣目标,系统便能直接在底层 3D 高斯点云中准确剥离出对应的目标几何集合。

然而,现有的 3DGS 分割方法在实际交互部署中陷入了两难困境。绝大多数优化型方法(如 SAGA、Click-Gaussian、LangSplat 等)极度依赖繁重的离线预处理阶段:在用户能够进行交互之前,必须先渲染所有多视角图像、调用 2D 基础模型逐帧生成分割掩码,再通过对比学习或隐空间蒸馏将 2D 语义反向优化进高斯特征中,单场景初始化耗时高达数十分钟甚至数小时。另一方面,近期的免训练在线方法(如 GaussianCut、iSegMan)虽然试图跳过离线优化,却将巨大的计算开销转移到了实时交互阶段:例如通过构建密集高斯图执行全局最小割(耗时 40~60 秒),或者在交互过程中进行极线引导的多视角传播与高斯投票(耗时数秒至数十秒)。这种漫长的等待严重破坏了交互系统的即时性。

这一瓶颈的核心矛盾在于:如何在无需任何场景预训练与特征蒸馏的前提下,仅依靠单视角交互提示,在受限的亚秒级时间内精准捕获 3D 目标完整的全周几何边界并剔除背景高斯点。受主动机器人视觉中无人机自主探索与次优视点(Next-Best-View, NBV)规划的启发,本文的核心 idea 是发射两架虚拟无人机环绕目标进行在线视点规划,以马尔可夫决策过程动态搜寻信息增益最大的观测视角,并借助中心化掩码视锥过滤在数步之内实现 360 度几何修剪与亚秒级精确分割。

方法详解

整体框架

SAGO 的核心目标是在零预处理(Setup-free)的前提下,实现即时、高效的在线 3D 高斯分割。算法的输入为一个已训练好的原始 3D 高斯集合 \(\mathcal{G} = \{G_i\}_{i=1}^N\) 以及用户在初始交互视角上给出的几何提示(如前景/背景点选、边界框或文本提示);输出为相互正交且覆盖全集的目标前景高斯子集 \(\mathcal{A}\) 与背景高斯子集 \(\mathcal{B}\)。整个交互流程被形式化为一个面向虚拟无人机的马尔可夫决策过程,双向发射的虚拟无人机在目标周围进行自适应视点巡航,借助 2D 分割大模型(SAM2)在极少数自适应视角下的前向推理,快速剔除投影不匹配的背景高斯点。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["原始 3DGS 场景<br/>+ 用户交互提示"] --> B["双向虚拟无人机协同建模<br/>以深度反投影初始化质心与环绕轨迹"]
    B --> C["在线次优视点规划与自评估<br/>粗到细航向角搜索 + 跨视角一致性校验"]
    C --> D["中心化掩码视锥过滤与状态更新<br/>2D 掩码几何修剪 + 动态质心与记忆库刷新"]
    D -->|未覆盖 180 度| C
    D -->|双向完成 360 度覆盖| E["干净 3D 资产提取<br/>支持实时移除/位移/复制等下游编辑"]

关键设计

1. 双向虚拟无人机协同建模:建立目标为中心的球坐标探索空间

针对传统在线方法漫无目的地在预存训练视点间跳转或全量遍历导致的低效问题,SAGO 引入虚拟无人机机制并将相机位姿解耦在目标为中心的球坐标系中。在时间步 \(t\),虚拟无人机的状态被抽象为一个四元组 \(\mathcal{S}_t = \{\mathcal{A}^{(t)}, \mathbf{v}_t, \mathcal{M}_t, \tau_t\}\),其中 \(\mathcal{A}^{(t)}\) 为当前留存的前景高斯集合,\(\mathbf{v}_t = \{\mathbf{c}_t, r_t, \phi_t, \theta_t\}\) 表示无人机的观测位姿,\(\mathcal{M}_t\) 是维护目标时序关联的 SAM2 记忆库,\(\tau_t\) 则为覆盖率指标。系统从用户交互视角同时发射顺时针(\(\phi\) 从 \(0^\circ\) 增至 \(180^\circ\))与逆时针(\(\phi\) 从 \(0^\circ\) 减至 \(-180^\circ\))两架虚拟无人机,各自负责探索 \(180^\circ\) 的观测盲区。在初始步 \(t=0\),无人机观测距离 \(r_t\) 固定为初始相机到目标质心的欧氏距离并在后续探索中保持恒定,从而维持恒定的成像尺度与分辨率。初始目标质心 \(\mathbf{c}_0\) 通过对初始 2D 掩码内的深度图进行反投影快速粗估;随着背景点的逐轮剔除,目标几何边界愈发清晰,质心在后续轮次自动动态收敛至前景高斯点云的空间几何中心。

2. 在线次优视点规划与自评估:最大化背景剔除增益并防止误差级联

为了在尽可能少的步数内完成 3D 几何边界的收敛,系统采用“探索-评估(Exploration-Evaluation)”策略动态决策下一步的最优航向角增量 \(\Delta\phi \in \{90^\circ, 60^\circ, 30^\circ\}\) 与俯仰角 \(\theta \in \{\theta_0, 0^\circ, 30^\circ, 60^\circ\}\)。最优候选视点 \(\mathbf{v}^*\) 需在最大化修剪背景高斯数量的同时满足与初始视角的语义一致性约束:

\[ \mathbf{v}^* = \arg\max_{\mathbf{v} \in (\Delta\phi, \theta)} |\Delta\mathcal{A}'(\mathbf{v})| \quad \text{s.t.} \quad \text{mIoU}\bigl(\mathcal{I}(\mathbf{v}, \mathcal{A}^{(t)} \setminus \Delta\mathcal{A}'(\mathbf{v})), m_0\bigr) \ge \sigma \]

式中 \(\Delta\mathcal{A}'\) 表示在候选视点渲染图上经过 SAM2 跟踪预测并执行掩码过滤后所排除的高斯点增量。自评估机制通过设定 mIoU 门限 \(\sigma\) 充当安全护栏,有效避免了长程视角变化下 SAM2 发生漂移引起的级联错误分割。无人机首先大胆尝试 \(\Delta\phi = 90^\circ\) 的大跨度跃迁;若一致性检验通过,则仅需 2 步规划即可覆盖半球全周;若由于剧烈自遮挡或视角畸变导致跟踪评估未达标,系统则自适应回退到 \(60^\circ\) 或 \(30^\circ\) 的精细步长,兼顾了规划效率与跟踪鲁棒性。

3. 中心化掩码视锥过滤与状态更新:超轻量几何修剪与闭环状态迁移

在确定下一最优视角 \(\mathbf{v}^*\) 并飞抵采样后,SAGO 需要以极低计算成本将 2D 图像掩码的语义约束转化为 3D 高斯点云的修剪动作。传统方法常采用耗时的 3D 凸包求交或考虑高斯椭球完整投影形状的 Splat 级求交,计算开销较大。SAGO 提出了中心化掩码视锥过滤(Center-based Mask-shaped Frustum Filtering, MFF):利用透视投影矩阵将每个 3D 高斯的中心坐标 \(\mathbf{x}_i \in \mathbb{R}^3\) 投影至 2D 图像平面得到 \(\mathbf{x}_{i}^{2D} = \text{project}(\mathbf{x}_i)\),若中心点落在 2D 预测掩码外部,则立即将该高斯归入背景集合 \(\mathcal{B}\) 并从前景候选集 \(\mathcal{A}\) 中移除:

\[ \mathcal{A}^{(t+1)} = \mathcal{A}^{(t)} \setminus \Delta\mathcal{A}(\mathbf{v}^*), \quad \mathcal{B}^{(t+1)} = \mathcal{B}^{(t)} \cup \Delta\mathcal{A}(\mathbf{v}^*) \]

伴随前景高斯集合的收缩,系统将当前视角的图像与掩码特征压入 SAM2 记忆库 \(\mathcal{M}_{t+1} = \mathcal{M}_t + \mathcal{M}(\mathbf{v}^*, \mathcal{M}_t)\),并将目标空间质心闭环修正为 \(\mathbf{c}_{t+1} = \frac{1}{|\mathcal{A}^{(t+1)}|} \sum_{\mathbf{x} \in \mathcal{A}^{(t+1)}} \mathbf{x}\)。整个剔除过程仅涉及轻量级矩阵投影与点在多边形内的位置判断,无需任何反向传播与复杂图优化,单视角修剪通常在数毫秒内完成。

损失函数 / 训练策略

SAGO 是一个纯推理(Inference-only)、完全免优化的在线算法,在测试阶段不涉及任何神经网络参数更新或损失函数反向传播。渲染阶段采用标准 3DGS 栅格化流水线,高斯点云直接在 512×512 分辨率下快速渲染,该分辨率精确匹配 SAM2 图像编码器的输入尺度,从而最大限度地降低显存占用与视觉推理时延。在单张消费级 NVIDIA RTX 4090 GPU 上,双无人机并行探索与状态收敛的全流程耗时稳定在 0.4~0.9 秒之间。

实验关键数据

主实验

为了客观衡量 SAGO 在分割精度与运行效率上的综合表现,论文在 SPIn-NeRF、NVOS、LERF-Mask 和 3D-OVS 四个主流 3D 分割基准上进行了系统对比,涵盖了离线优化型与在线免优化型两类主流前沿方法。

方法 类型 SPIn-NeRF mIoU (%) SPIn-NeRF mAcc (%) NVOS mIoU (%) NVOS mAcc (%) 预处理时间 (Setup) 交互分割时间 (Seg.)
MVSeg Offline 90.4 98.8 - - - -
NVOS Offline - - 70.1 92.0 - -
ISRF Offline 71.5 95.5 83.8 96.4 - -
SA3D Offline 91.9 98.8 90.3 98.2 2~5 min 15~30 s
LangSplat Offline 69.5 94.5 74.0 94.0 ~2.5 h -
SAGA Offline 93.4 99.2 92.6 98.6 ~1 h 10 ms
Flashsplat Online - - 91.8 98.6 30~60 s 1~2 s
iSegMan Online 92.4 99.1 92.0 98.4 50~90 s 4~6 s
GaussianCut Online 92.9 99.2 92.5 98.4 无 (N/A) 40~60 s
SAGO (本文) Online 92.5 99.3 92.7 98.7 无 (N/A) 0.4~0.9 s

在复杂多物体场景 LERF-Mask 与 3D-OVS 上的定量指标如下所示:

数据集 指标 SAGO (本文) 强基线 (SAGA) 交互免训练基线 (GaussianCut/ClickGaussian) 表现分析
LERF-Mask Average mIoU (%) 91.0 - 89.1 (ClickGaussian) 领先 ClickGaussian 1.9%,Teatime 场景领先 5.4%
3D-OVS Mean mIoU (%) 96.2 96.0 86.8 (3D-OVS) 超越离线 SOTA 方法 SAGA 0.2%,5 个场景中 3 个取得最优

消融实验

论文设计了严密的消融实验,验证了主动 NBV 视点规划机制相较于原始预存训练视点的必要性,以及中心化 MFF 相比于完整高斯椭球 Splat 过滤的有效性。

配置 LERF-Mask mIoU (%) NVOS mIoU (%) SPIn-NeRF mIoU (%) 3D-OVS mIoU (%) 说明
Full model (完整模型) 91.0 92.7 92.5 96.2 主动 NBV 规划 + 中心化 MFF 过滤
移除 NBV 策略 (退化为仅用原始真实视点) 36.7 (-54.3) 89.1 (-3.6) 90.1 (-2.4) 91.6 (-4.6) 缺少主动视点探索,重度遮挡场景产生剧烈性能崩塌
移除中心化 MFF (改用全量 Splat 几何相交过滤) 90.4 (-0.6) 92.5 (-0.2) 91.1 (-1.4) 96.0 (-0.2) 椭球外沿容差导致背景边界保留过多模糊杂点且计算冗余

关键发现

  • NBV 主动规划是解决 3D 遮挡的决定性因素:在结构杂乱且伴随严重遮挡的 LERF-Mask 数据集上,若不进行主动视点规划而仅仅复用场景中原有的静态采集相机视点,mIoU 会直接从 91.0% 断崖式暴跌至 36.7%(跌幅达 54.3%)。这证明了预存相机往往无法提供紧密贴合目标边界的环绕视线,必须依靠虚拟无人机动态探索潜在遮挡区域。
  • 中心化 MFF 在保持极简算力的同时更具辨识度:将高斯椭球作为整体(Splat-based)进行相交判断容易受到高斯外侧低透明度羽化边缘的干扰,使得背景边界高斯被错误保留为前景;而中心点判断(Center-based)不仅计算速度极快,在各项指标上反而稳定高出 0.2%~1.4%,验证了高斯中心作为几何滤波表征的准确性。
  • 真正打破了“零预处理”与“亚秒交互”的不可能三角:前代免预处理方法(GaussianCut)虽然免去了离线蒸馏,但每次交互耗时高达近一分钟;SAGO 在分割质量小幅提升的同时,实现了超过 50 倍的交互速度提升,首次将真正的免预处理 3DGS 分割压缩至 1 秒以内。

亮点与洞察

  • 主动视觉与隐式辐射场交互的巧妙跨界:将主动机器人学中的 Next-Best-View (NBV) 规划思想移植到纯数字 3D 高斯场景中,把原本被动的 2D 多视角特征蒸馏转变为由虚拟无人机主动搜寻最具信息量视角的动态规划任务。这种跨领域视角的转换为 3D 场景理解提供了一种崭新的方法论。
  • 大跨度优先与一致性校验的回退机制设计:视点规划没有机械地按固定小角度细细旋转,而是默认优先尝试 \(90^\circ\) 的大幅度跳跃,配合 mIoU 自评估机制在跟踪不确定时平滑降级到 \(60^\circ\) 或 \(30^\circ\)。这种机制使得大多数视线开阔的目标仅用两步探索即达成完整周向修剪,兼顾了极致速度与长程鲁棒性。
  • 高可迁移性的 3D 资产即时交互范式:通过 center-based MFF 几何剔除与 SAM2 记忆库相结合的机制完全摆脱了对预训练特征的依赖,该设计思路可即插即用地迁移到 4D 动态高斯分割、开放词表场景编辑以及具身机械臂实时交互抓取等任务中。

局限与展望

  • 作者指出的局限性:由于 center-based MFF 将每个连续高斯核简化为一个理想的 3D 中心几何点,而实际的高斯基底具有物理尺度和各向异性延展,因此在目标边缘容易出现轻微的锯齿状边缘伪影。作者指出未来可以结合在线边界修剪方法(如 GaussianTrimmer)进一步平滑边缘过渡。
  • 初始视角质量强依赖:状态初始化依赖于用户在第一视角提供的输入质量;若初始观测视角存在极严重的初始遮挡或视线不佳,深度反投影估计的粗略质心可能会出现明显偏差,进而影响虚拟无人机后续的球坐标航线。未来可探索由虚拟无人机自主寻优最佳初始交互视角。

相关工作与启发

  • vs SAGA:SAGA 是特征蒸馏类离线分割的代表作,需要对整场景进行多视角预处理与约 1 小时的特征蒸馏优化才能建立 3D 语义关联。SAGO 在分割精度(NVOS 92.7% vs 92.6%)和交互体验相当的前提下,彻底省去了漫长的预处理阶段,真正做到即开即用。
  • vs GaussianCut:GaussianCut 虽然也实现了免预处理,但需要在交互触发后现场构建高斯点间的全连接亲和度图并求解最小割(Min-Cut),交互时延高达 40~60 秒。SAGO 通过主动发射虚拟无人机并借助中心投影修剪,将交互时延压至 0.4~0.9 秒,带来了超过 50 倍的推理加速。
  • vs iSegMan:iSegMan 采用极线几何约束传播多视角交互,但在交互阶段仍需 4~6 秒的在线传播与耗时的全场景高斯投票,且包含 50~90 秒的部分预处理。SAGO 的球坐标无人机规划机制具备更明确的目标聚焦能力,几何剔除逻辑更为精简高效。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将主动机器人视觉的 NBV 虚拟无人机规划引入 3DGS 交互分割,打破了传统重度依赖特征蒸馏的范式。
  • 实验充分度: ⭐⭐⭐⭐⭐ 在 4 个主流公开数据集上进行了严谨的定量对比,且包含多场景泛化测试与完备的消融实验。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题定义直截了当,核心矛盾分析深刻,数学形式化清晰严谨。
  • 价值: ⭐⭐⭐⭐⭐ 成功将免预处理 3DGS 交互分割推进至亚秒级实用水平,对下游 3D 场景编辑和具身智能交互具有显著推动作用。