跳转至

Online 3D Instance Segmentation at task-oriented granularity with Unposed Monocular Video

会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV 2026
领域: 3D 视觉
关键词: 3D 实例分割, 任务导向粒度, 未标定单目视频, 密集 SLAM, 跨视角掩码聚类

一句话总结

针对具身智能在无位姿单目视频下的在线感知需求,提出一种任务导向的 3D 实例分割系统,复用 MASt3R-SLAM 前馈密集像素对应构建几何关联度与帧内互斥约束,通过置信度优先聚类实现无需深度传感器与离线先验的实时 3D 实例解耦。

研究背景与动机

具身智能体要在开放物理环境中执行交互与操作,必须能够实时从在线视频流中解析周围物体的 3D 实例级空间边界与语义属性。然而,传统的 3D 实例分割方法绝大多数高度依赖离线采集的 RGB-D 传感器点云以及由精密位姿系统或离线 SfM 恢复的真实轨迹。这在现实具身场景中极不实用——机器人既无法预先跑遍全局场景采集完整传感器数据,低成本移动平台也往往只配备轻量单目相机,迫切需要直接基于未标定单目连续视频流完成在线 3D 实例感知。

现有结合视觉大模型(VFM)的 3D 实例分割范式通常分为两类,均无法胜任交互式具身任务。第一类是基于 SAM 或超点分割的自底向上策略,在识别语义之前盲目切分图像中所有可分解的视觉图块,这不可避免地导致海量碎片化过分割与高昂的后处理开销;第二类则依赖基于预定义封闭类别的 2D 或 3D 分割网络来决定实例粒度,其分割粒度在运行中完全固定,无法根据具体指令动态自适应。例如在“找出浴缸上的毛巾”这一任务中,自底向上或固定粒度模型往往将毛巾与浴缸合并为一个整体,导致目标实例彻底丢失。另一方面,若直接接入现代密集前馈 SLAM 系统,后端局部 BA 与回环检测会持续动态微调相机的位姿和每像素深度,这些时刻漂移的优化变量根本无法作为增量掩码关联的稳定参考,噪声点云更会导致既有 3D 分割算法性能断崖式下跌。

面对这些挑战,本文提出转变传统“先分割再识别”的自底向上模式,转向由具身指令明确约束候选类别的“任务导向分割”范式。核心 idea:利用前馈密集 SLAM 独立于后端位姿优化的跨帧像素对应建立几何关联度,结合帧内互斥约束与置信度降序聚类,实现仅凭未标定单目视频流的实时任务自适应 3D 实例分割。

方法详解

整体框架

系统以连续未标定单目 RGB 视频流和由大语言模型从任务指令中提取的开放词表类别集合 \(\mathcal{C}\) 作为输入。MASt3R-SLAM 负责增量维护关键帧位姿图、输出密集点图并快速生成帧间像素对应关系;对于新加入的关键帧,系统采用任务导向的开放词表检测器与提示分割模型提取无重叠实例掩码;随后依据 SLAM 位姿图的稀疏连通性建立候选边,结合几何关联度、语义相似度和帧内互斥矩阵进行优先排序在线聚类;最后将多视角聚类一致的掩码反投影至三维重建点云,实时输出任务相关的 3D 实例与语义地图。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入<br/>未标定单目视频流 + 任务词表集合"] --> B["任务导向 2D 掩码解耦<br/>YOLO-World + SAM2 小掩码优先"]
    B --> C["位姿图引导与密集对应复用<br/>MASt3R-SLAM 关键帧边与像素映射"]
    C --> D["特征先验与帧内互斥约束<br/>类别文本向量 + 互斥矩阵 MEM"]
    D --> E["置信度优先聚类与 3D IoU 合并<br/>GAM 降序合并 + 跨时空包围框关联"]
    E --> F["输出<br/>任务自适应 3D 实例与语义地图"]

关键设计

1. 任务导向 2D 掩码解耦:依据任务目标自顶向下约束候选类别与空间粒度 针对传统自底向上分割由于缺乏任务意图导致的碎片化与图块黏连问题,系统摒弃在全图盲目切分实例的做法。对于新进入的关键帧 \(K_i\),利用根据任务指令提取的开放类别集 \(\mathcal{C}\)(例如“寻找浴缸上的毛巾”对应类别集合 \(\{\text{towel}, \text{bathtub}\}\)),首先由开放词表检测器 YOLO-World 生成粗粒度 2D 候选检测框,再将检测框作为 prompt 输入 SAM2,生成高精度的边界分割掩码。为了解决复杂场景下前景与背景容器物体的层级重叠矛盾,系统引入“小掩码保留优先原则”,对同帧重叠区域进行像素级互斥归属划分,生成像素级无重叠的实例掩码表征 \(M_i \in \mathbb{Z}^{H \times W}\)。这一策略使感知粒度完全与具身任务对齐,只解耦任务关注的实体,大幅精简了候选数量并消除了冗余背景干扰。

2. 位姿图引导与密集对应复用:摆脱不稳定后端优化变量的高效几何关联 在单目稠密 SLAM 系统中,每像素估计的绝对深度和全局相机位姿在后端滑窗 BA 和回环检测中会被持续重构和拉伸,若以传统方式投影 3D 点云做空间交并比,不仅必须频繁回溯修正历史所有帧的投影状态,还会因为局部噪声造成掩码错误关联。本文发现,MASt3R-SLAM 在前端建立的双向像素对应关系 \(\pi_{ij}: p_i \to p_j\)(附带有效匹配掩码 \(V_{ij}\))仅依赖两帧前馈特征匹配与局部非线性求解,其对应关系具有长期有效性且严格独立于后端位姿变量。系统充分利用 SLAM 增量因子图的稀疏性,仅对位姿图中有边相连的关键帧对 \(\langle K_i, K_j \rangle\) 计算几何关联度。利用像素映射 \(\pi_{ij}\) 将关键帧 \(K_i\) 的掩码 \(M_{id=n}^i\) 前向投射至帧 \(j\) 的像平面,定义有效重叠比例为: $\(or(n, m) = \frac{|\pi_{ij}(M_{id=n}^i) \cap M_{id=m}^j|}{|(M_{id=n}^i, V_{ij})|}\)$ 考虑到动态巡检时物体往往仅被部分观测,若两帧间实例可见面积悬殊(\(M_{id=n}^i \gg M_{id=m}^j\)),单向重叠率会因匹配噪点而被严重低估。因此,系统对称计算双向重叠率并取最大值作为几何关联度: $\(GAM_{(n,m)} = \max\left(or(n, m), or(m, n)\right) \in [0, 1]\)$ 该指标在 GPU 端高度并行化,单对关键帧计算耗时仅约 9 ms,几乎不引入额外系统负担。

3. 特征先验与帧内互斥约束:零开销语义度量与切断跨视角错误合并传播链 在开放场景中,单纯依靠几何匹配极易因相邻物体的遮挡边界或视差匹配噪声导致误匹配,而离线方法常用的“裁剪图像块过 CLIP 图像编码器再跨视角池化”的做法在在线实时系统中开销过大。本文提出在任务开始时对任务类别集合 \(\mathcal{C}\) 用 CLIP 文本编码器离线预提取一次特征向量 \(F = \{f_c \mid c \in \mathcal{C}\}\),每个 2D 掩码直接继承其检测类别对应的文本嵌入 \(s_n^i = f_{c_n^i}\),两掩码之间的语义相似度 \(SSM_{(n, m)}\) 直接简化为两个已知单位向量的余弦相似度,查询耗时降为 \(O(1)\)。更关键的是,为了防止匹配噪声和个别 2D 欠分割掩码将完全不同的实例逐步“滚雪球”融合成巨型连通块,系统引入帧内互斥指标(MEM)。根据物理世界公理,在单帧图像中同时出现的不同实体必然属于不同的 3D 实例。在执行显式去重前,对于同帧重叠极小的掩码对(\(\text{IoU}(\hat{M}_n^i, \hat{M}_m^i) < \epsilon\)),在互斥矩阵中标记为硬互斥: $\(MEM_{(n, m)} = \mathbb{I}\left(\text{IoU}(\hat{M}_n^i, \hat{M}_m^i) < \epsilon\right)\)$ 互斥信息被缓存在紧凑稠密数组中,随时为在线聚类提供不可违背的硬约束拦截。

4. 置信度优先聚类与 3D 空间 IoU 闭环合并:长程一致性与历史误差阻隔机制 在多视角掩码增量合并阶段,传统贪婪增量匹配会严重受制于处理次序,一旦早期将低置信度噪声匹配成簇,后续帧将产生严重的不可逆误差累积。系统将多视角关联建模为带约束的在线图聚类,首先按阈值初筛候选掩码对,随后严格按照几何关联度 \(GAM\) 降序排序,优先处理匹配置信度最高的掩码边。遍历过程中,只有当待合并的两组簇或单掩码之间经由 MEM 检查确认不包含任何冲突对时,才允许执行并集操作,否则直接丢弃该边。此外,由于 SLAM 位姿图仅连接时空近邻或回环帧,对于时间跨度长但空间重叠的大跨度视线,系统在第一阶段聚类完成后,依据已有实例点云生成粗粒度 3D 包围框,按照 3D 包围框的交并比(IoU)降序执行二次簇合并,同样受 MEM 互斥矩阵保护。这既保证了长序列重访下的实例闭环一致性,又完全杜绝了不同实体的非法黏合。

损失函数 / 训练策略

本系统属于端到端在线零样本推理框架,整个流程完全免训练、免微调,不依赖任何 3D 标注数据集进行后训练。前沿检测与分割骨干均采用预训练权重(YOLO-World-L 与 SAM2-Hiera-Large),三维重建由预训练的 MASt3R-SLAM 实时驱动。系统在所有场景中保持统一超参数:帧内互斥阈值 \(\epsilon = 0.2\),几何关联度初筛阈值 \(\tau_{GAM} = 0.25\),语义相似度阈值 \(\tau_{SSM} = 0.85\),以及簇间 3D 包围框交并比阈值 \(\tau_{IoU} = 0.1\)。实验证明系统对超参数具有优良的稳健性。

实验关键数据

主实验

评估在 ScanNet200 验证集(312 个室内场景,198 个开放词表类别)与 Replica 数据集(48 个类别)上进行。采用标准 Average Precision 指标在 50% 与 25% 的 3D 掩码重叠阈值下评测(AP50 与 AP25),涵盖开放词表(Open-Vocabulary)与类别无关(Class-Agnostic)两种设定。当输入为未标定单目视频时,通过 evo 工具将估计轨迹与真值以 Sim(3) 刚体变换对齐后评估。

数据集 / 设定 方法 输入位姿与深度源 在线运行 零样本 分割粒度先验 AP50 ↑ AP25 ↑ 帧率 (FPS) ↑
ScanNet200 开放词表 Open-YOLO 3D MASt3R-SLAM (点云+位姿) × × Mask3D 0.8 2.0 -
ScanNet200 开放词表 OnlineAnySeg MASt3R-SLAM (点云+位姿) ✓ ✓ CropFormer 0.1 0.5 15
ScanNet200 开放词表 本文方法 (Ours) MASt3R-SLAM (仅单目视频) ✓ ✓ YOLO-World + SAM 7.4 19.3 7
ScanNet200 开放词表 (参考) Open-YOLO 3D 真实传感器深度 + GT 位姿 × × Mask3D 31.7 36.2 -
ScanNet200 开放词表 (参考) EmbodiedSAM 真实传感器深度 + GT 位姿 ✓ × ScanNet200 预训练 19.2 23.9 10
ScanNet200 类别无关 OnlineAnySeg MASt3R-SLAM (点云+位姿) ✓ ✓ CropFormer 4.7 19.5 15
ScanNet200 类别无关 本文方法 (Ours) MASt3R-SLAM (仅单目视频) ✓ ✓ YOLO-World + SAM 16.4 44.7 7
ScanNet200 类别无关 (参考) OnlineAnySeg 真实传感器深度 + GT 位姿 ✓ ✓ CropFormer 36.1 53.5 15
Replica 开放词表 PanSt3R MUSt3R (离线前馈) × × 离线 PanSt3R 20.9 34.3 -
Replica 开放词表 Open-YOLO 3D 真实传感器深度 + GT 位姿 × × Mask3D 28.6 34.8 -
Replica 开放词表 Open3DIS 真实传感器深度 + GT 位姿 × × ISBNet 24.5 28.2 -
Replica 开放词表 OVIR-3D 真实传感器深度 + GT 位姿 × ✓ Detic 20.5 27.5 -
Replica 开放词表 本文方法 (Ours) MASt3R-SLAM (仅单目视频) ✓ ✓ YOLO-World + SAM 23.4 37.3 11

消融实验

在 Replica 数据集上对几何关联度(GAM)、语义相似度(SSM)、帧内互斥矩阵(MEM)、3D 包围框 IoU 簇合并及置信度优先聚类机制进行逐项消融。

配置 AP50 ↑ AP25 ↑ 说明
完整模型 (Ours Final System) 23.4 37.3 保留全部关联度指标与优先聚类策略
去除几何关联度 (w/o GAM) 17.3 31.5 缺少跨视角前馈对应指导,AP50 下降 6.1%
去除语义相似度 (w/o SSM) 21.7 33.1 缺少类别先验过滤,产生少量跨类别误联结
去除帧内互斥约束 (w/o MEM) 8.2 12.0 断崖式暴跌(AP50 暴跌 15.2%),噪声导致大面积误合并
去除时空 IoU 合并 (w/o IoU) 13.8 31.4 无法关联无位姿图边的远距离视点实例,AP50 下降 9.6%
随机顺序替代置信度优先 (w/o Priority) 20.3 33.8 错误顺序导致低置信度噪声污染早期簇,AP50 下降 3.1%

关键发现

  • 现有 3D 实例分割高度脆弱于 SLAM 重建点云噪声:当把输入从真实深度点云替换为 MASt3R-SLAM 输出时,依赖 3D 卷积/预训练 3D 骨干的 Open-YOLO 3D 的 AP50 从 31.7 暴跌至 0.8,基于多视角几何投影交叠的 OnlineAnySeg AP50 仅为 0.1。这是因为前馈 SLAM 点云存在未对齐伪影与局部扭曲,既有模型严重泛化失效;而本文基于直接像素对应建立关联,在同样输入下取得 7.4 的 AP50,展现出对几何退化的极高鲁棒性。
  • 帧内互斥约束(MEM)是系统最核心的生命线:消融数据显示,去掉 MEM 会直接导致性能从 23.4 暴跌至 8.2。其内在原因是 SLAM 像素匹配与 2D 检测框不可避免地存在偶发噪点,一旦两个不相干物体在一个视角被轻微搭接,贪婪算法就会发生连锁反应将整屋物体融成单一杂合体;MEM 构筑了单帧物理不可重叠的硬防线,彻底阻断了传播链。
  • 纯单目在线感知超越离线与真值方法:在 Replica 数据集上,本文不仅以 37.3 的 AP25 超过所有采用真值位姿和传感器深度的经典离线方法(如 Open-YOLO 3D 的 34.8、Open3DIS 的 28.2),还显著击败了同样基于前馈三维重建但必须全序列离线处理的 PanSt3R(AP50 23.4 vs 20.9,AP25 37.3 vs 34.3)。
  • 运行效率与开销极低:在配备 RTX 3090 GPU 的单机上,Replica 场景运行帧率为 10.87 FPS,ScanNet 为 7.32 FPS,系统整体瓶颈完全在于底层的 MASt3R-SLAM(纯 SLAM 速度分别为 11.23 FPS 和 7.58 FPS)。单帧耗时细分中,YOLO-World 仅占 30.1 ms,SAM2 占 132.4 ms,而几何关联度计算每对关键帧仅需 9.0 ms,掩码聚类合并仅需 32 ms,表明所设计的对应复用与数组缓存策略几乎实现零额外运算负担。

亮点与洞察

  • 复用 SLAM 前馈匹配绕过动态几何漂移:敏锐发现前馈 3D 重建模型(MASt3R)输出的像素级对应是确定且长期有效的,彻底规避了后端 BA 动态更新对 3D 投影一致性的破坏,为 SLAM 与具身感知的协同提供了优雅接口。
  • 任务自适应粒度打破传统自底向上瓶颈:通过大模型将指令转化为任务关注类别集合,驱动 2D 检测与提示分割,彻底解决了诸如“桌子上的图纸”、“浴缸上的毛巾”等小目标在传统超点/Mask3D 范式中必被强行吞并的行业痛点。
  • 轻量互斥硬约束抵御累积误差:利用“单帧内不同检测实例必为不同三维物体”这一常识几何公理,以极低的空间开销(MEM 矩阵)换取了对贪婪图聚类连锁错误合并的完全免疫。

局限与展望

  • 受限于静态场景假设:当前系统强依赖 MASt3R-SLAM 的刚性静态世界假设,面对包含移动人或动态物体的具身交互环境,像素对应关系将产生严重伪影,未来亟待结合前馈 4D 动态重建技术。
  • 单向依赖而非双向增强:目前几何与语义属于单向流水线,SLAM 系统并未反向利用识别出的实例与语义信息。未来可探索利用语义掩码动态剔除移动物体、为回环检测提供对象级拓扑建议以及开展对象级局部重建。
  • 前段检测器漏检制约小目标上限:ScanNet200 开放词表性能受限于单目长尾小目标在低照度或快速转动下的初检召回率,若 2D 端漏检,后续 3D 聚类无法挽回。

相关工作与启发

  • vs OnlineAnySeg (CVPR 2025): OnlineAnySeg 采用自底向上的 CropFormer 产生固定粒度无类别掩码,严重依赖真值点云并在线提取多视角 CLIP 图像嵌入平均池化,在单目 SLAM 重建点云上 AP50 仅为 0.1;本文采用任务导向自顶向下检测,直接复用前馈像素对应与轻量文本向量,在 SLAM 点云上性能高出两个数量级。
  • vs Open-YOLO 3D (2024): Open-YOLO 3D 依赖预训练的 Mask3D 生成 3D 候选候选提议再进行 2D 检测对齐,高度脆弱于 SLAM 的非理想几何点云输入(AP50 从 31.7 暴跌至 0.8);本文完全脱离 3D 预训练主干,以纯 2D 基础模型在线向 3D 映射聚类,在真实嘈杂重建下稳健可靠。
  • vs PanSt3R (ICCV 2025): PanSt3R 同样基于前馈几何模型(MUSt3R),但需要全局所有视图离线执行全景优化;本文在保持全在线实时(10.87 FPS)运行的前提下,在 Replica 上的分割精度仍反超 PanSt3R。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (巧妙地将前馈 SLAM 像素对应与任务导向自顶向下 2D 基础模型结合,提出帧内互斥在线聚类,切中具身在线感知的核心痛点)
  • 实验充分度: ⭐⭐⭐⭐⭐ (ScanNet200 与 Replica 两个主流基准对比详实,真实 SLAM 点云下跨方法对比切中要害,消融与时延分析极其细致)
  • 写作质量: ⭐⭐⭐⭐⭐ (问题定义清晰,动机层层递进,系统流程与算法伪代码逻辑严密,图文呼应紧凑)
  • 价值: ⭐⭐⭐⭐☆ (为无需激光雷达与位姿真值的低成本自主机器人单目在线交互提供了极为实用的端到端范式)