Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training¶
会议: ECCV 2026
论文: ECCV 官方
代码: https://github.com/shangboyuan/Co-3DGT
领域: 3D视觉
关键词: 开放词表3D目标检测、协同蒸馏、不确定性正则化、层次化对齐、伪标签挖掘
一句话总结¶
针对开放词表3D目标检测中新物体发现阶段定位不准与分类错配、训练阶段对伪标签无差别监督的痛点,本文提出 Co-3DGT 框架,通过 2D-3D 空间语义双向协同蒸馏筛选高可靠候选,并在训练时引入场景感知不确定性正则化与大语言模型分层语义对齐,显著提升未见类别的 3D 检测精度。
研究背景与动机¶
开放词表 3D 目标检测(3D-OVD)致力于借助视觉语言基础模型(如 CLIP)将检测能力扩展到训练集未标注的新类别。然而,由于 3D 点云与 2D 图像之间天然的跨模态表示鸿沟,以及高质量三维标注数据的稀缺,直接在 3D 领域预训练通用大模型成本高昂。现有主流方案多采用“两阶段流水线”:首先利用 2D/3D 基础模型在未标注的场景中发现潜在的新类别 3D 候选框生成伪标签,随后将基类真实标注与新类伪标签混合,监督训练最终的 3D 检测网络。
然而,现存的发现流程存在天然的结构性缺陷:基于 2D 检测反投影的方法利用全局图像上下文能给出准确的语义类别,但粗糙的反投影极易受深度测量噪声及邻近背景点干扰,导致构建的 3D 边界框极其松散不准;相反,基于类别无关 3D 提案网络的方法能预测贴合紧密的 3D 几何包围盒,但在投影裁剪到 2D 图像交由 CLIP 识别时,极易因视角遮挡或视野不全导致严重的语义错配(例如桌子被椅子局部遮挡导致整盒被错误判定为椅子)。更严重的是,以往训练阶段对高质量基类真值与充斥噪声的新类伪标签采取一视同仁的同等损失加权,使得 3D 边框回归网络被劣质伪框严重带偏,分类头也深陷多义性分类噪声之中。
为了打破这种两端失衡的恶性循环,本文的切入角度是:解耦并融合 2D 语义与 3D 几何的互补优势,且在模型训练期对噪声源实施显式解耦约束。核心 idea:在发现阶段构建融合空间重叠、几何前景度与语义置信度的二分匹配代价,以协同蒸馏萃取精准的 3D 新类实例;在训练阶段利用基类的场景固有不确定性锚定新类回归损失,并由大语言模型提炼双层超类结构实现层次化多粒度语义对齐。
方法详解¶
整体框架¶
Co-3DGT 整体分为两大部分:协同蒸馏发现(Co-Distillation Discovery)与双重引导鲁棒训练(Dual Guidance Robust Training)。在发现阶段,模型并行运行开放词表 2D 检测器与类别无关 3D 提案检测器,通过二分匈牙利匹配将两者的优势(2D 的分类准度与 3D 的几何轮廓)紧密绑定;在训练阶段,模型接收基类真值与蒸馏所得新类伪标签,在 3D 边框回归分支施加场景感知不确定性约束,在分类分支施加 LLM 构建的三级概念层次对齐。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入数据<br/>RGB-D 图像 + 场景点云"] --> B["协同蒸馏候选发现<br/>2D语义检测与3D几何提案并行提取"]
B --> C["跨模态二分协同匹配<br/>3D IoU空间几何 + 2D/3D 置信度代价矩阵"]
C --> D["可靠新类伪标签集<br/>继承3D紧凑几何盒与2D准确语义标签"]
D --> E["双重引导鲁棒训练<br/>联合基类真值与新类伪标签优化检测器"]
E --> F["场景感知不确定性正则化<br/>以基类不确定性均值锚定新类回归权重"]
E --> G["LLM 引导层次化语义对齐<br/>top/mid/bottom 三级类别特征多粒度对齐"]
F --> H["最终开放词表 3D 检测输出"]
G --> H
关键设计¶
1. 跨模态协同蒸馏发现:融合空间几何一致性与语义可靠性的二分匹配
以往两阶段 3D-OVD 方法要么依赖易受深度抖动影响的 2D 边框反投影点云外包盒,要么依赖易受局部遮挡误判的 3D 提案图像裁剪。本文设计协同蒸馏方案,并行生成两组候选:一组来自预训练开放词表 2D 检测器并反投影至 3D 空间的候选集 \(\mathcal{O}_{2\text{D}} = \{(\mathbf{b}_{2\text{D}}^i, c_{2\text{D}}^i, s_{2\text{D}}^i)\}_{i=1}^M\);另一组来自预训练类别无关 3D 提案检测器的候选集 \(\mathcal{O}_{3\text{D}} = \{(\mathbf{b}_{3\text{D}}^j, s_{3\text{D}}^j)\}_{j=1}^N\)。为了在保持精确 3D 几何边界的同时赋予其准确的 2D 语义标签,模型将跨模态配对建模为全局二分匹配问题,构建代价矩阵:
其中 \(\text{IoU}_{ij}\) 为反投影 3D 盒与类别无关 3D 提案盒的三维交并比。当 \(\text{IoU}_{ij} < 0.1\) 时直接将代价置为 \(\infty\) 实行几何硬截断;对于几何重叠候选,\(\text{IoU}\) 充当主导项约束空间重合度,而 3D 前景概率 \(s_j^{\text{3D}}\) 与 2D 语义置信度 \(s_i^{\text{2D}}\) 作为软增益项。通过匈牙利算法求得最优分配集合 \(\mathcal{H}\) 后,保留匹配成功的 3D 紧凑空间盒 \(\mathbf{b}_j^{\text{3D}}\) 与其对应的 2D 开放词表类别 \(c_i^{\text{2D}}\),组建高纯度的新类伪标签集合 \(\mathcal{O}_{\text{Co-D}}^{\text{novel}}\)。
2. 场景感知不确定性正则化:基类自适应锚定抑制劣质新类回归
在监督检测网络学习 3D 边框回归时,基类样本具有人工标注的高精度坐标,而新类即使经过蒸馏仍存在不可避免的残留定位抖动。若直接共用异方差不确定性回归损失,网络由于在新类上缺乏强确定性先验,容易产生不合理的不确定性极值。针对基类,模型沿用异方差高斯似然回归:
其中 \(\sigma_i\) 为网络预测的不确定性,\(\lfloor \cdot \rfloor\) 表示梯度截断。针对新类,由于缺乏可靠的标定标准,若放任其自由预测会导致过拟合或退化。本文提出场景感知不确定性正则化:利用当前场景内基类对象不确定性对数的均值期望 \(\mathbb{E}[\lfloor \log \sigma_{\text{base}} \rfloor]\) 作为当前室内场景物理复杂度的锚点(若当前场景无基类,则使用跨场景动量更新的滑动平均值),构造新类回归损失:
该项正则化通过双向惩罚使得新类预测的不确定性水平向场景内基类基准收敛,避免新类预测出极低的不确定性从而被噪声框误导,也避免预测出无限大的不确定性从而直接放弃新类学习。
3. LLM 引导的层次化语义对齐:利用结构化超类降低分类多义性噪声
在开放词表分类中,细粒度新类别的文本描述与视觉特征容易在局部视角下产生歧义(例如不同款式的椅子与凳子、床头柜与储物柜)。直接使用最底层的细粒度类别名称进行 CLIP 特征对齐极易受误分类伪标签污染。为此,本文利用大语言模型(如 ChatGPT-5 等)对全部基类与新类候选构筑两级更具抽象性与共性的超类体系:最底层 \(\mathcal{C}^{\text{bot}}\) 为原始具体类名(如 chair, table, fridge);中间层 \(\mathcal{C}^{\text{mid}}\) 聚合功能与几何相似概念(如 seating, storage, domestic);顶层 \(\mathcal{C}^{\text{top}}\) 表达宏观抽象概念(如 furniture, appliance)。
模型利用冻结的 CLIP 文本编码器分别提取三级文本嵌入 \(\mathbf{h}^{(1)}, \mathbf{h}^{(2)}, \mathbf{h}^{(3)}\),并在 3D 检测网络的多尺度特征头输出对应层级的视觉特征 \(\mathbf{f}^{(1)}, \mathbf{f}^{(2)}, \mathbf{f}^{(3)}\)。通过计算余弦相似度并经 Sigmoid 映射为各层级概率 \(p_{ij}^{(l)}\),在三个层级上联合施加二值交叉熵损失:
借助顶层与中间层在几何轮廓和功能大类上的强容错性,即便底层标签被微弱分类噪声污染,多粒度特征空间仍能保持稳定的语义几何流形映射。
损失函数 / 训练策略¶
整个 3D-OVD 模型的总训练损失由边框回归损失与分层语义对齐损失联合构成:
模型基于 Uni3DETR 的体素编码器和 Transformer 解码器架构构建,输入仅为纯 3D 点云,无需在训练或推理阶段实时加载高分辨率 2D 图像特征,训练效率较跨模态融合框架明显提升。
实验关键数据¶
主实验¶
在 SUN RGB-D(10 个基类,36 个新类)和 ScanNetV2(10 个基类,50 个新类)两大基准上,Co-3DGT 与现有多模态及单模态开放词表 3D 检测 SOTA 方法进行了系统对比。
表 1: SUN RGB-D 和 ScanNetV2 上的 3D-OVD 主对比结果(AP25 / AR25,单位:%)
| 方法 | 输入模态 | SUN RGB-D APnovel25 | SUN RGB-D APbase25 | SUN RGB-D APmean25 | ScanNetV2 APnovel25 | ScanNetV2 APbase25 | ScanNetV2 APmean25 |
|---|---|---|---|---|---|---|---|
| Det-PointCLIP [43] | 点云 | 0.09 | 5.04 | 1.17 | 0.13 | 2.38 | 0.50 |
| Det-PointCLIPv2 [42] | 点云 | 0.12 | 4.82 | 1.14 | 0.13 | 1.75 | 0.40 |
| Det-CLIP2 [46] | 点云 | 0.88 | 22.74 | 5.63 | 0.14 | 1.76 | 0.40 |
| CoDA [3] | 点云 | 6.71 | 38.72 | 13.66 | 6.54 | 21.57 | 9.04 |
| INHA [17] | 点云 | 8.91 | 42.17 | 16.18 | 7.79 | 25.10 | 10.68 |
| CoDAv2 [4] | 点云 | 9.17 | 42.04 | 16.31 | 9.12 | 23.35 | 11.49 |
| OV-Uni3DETR [39] | 点云+RGB | 9.66 | 48.29 | 18.06 | 12.09 | 30.47 | 15.15 |
| Co-3DGT (本文) | 点云 | 14.37 | 49.85 | 22.63 | 21.91 | 32.83 | 23.75 |
在完全无人工 3D 标注设置下(遵从 OV-3DET 评测规范,在 ScanNetV2 前 20 个高频未见类上评测),本文方法在仅保留协同蒸馏与 LLM 层次对齐模块的简化配置下,依然取得显著领先:
表 2: ScanNetV2 无标注设置下 20 类未见类别逐类 AP25 对比(单位:%)
| 方法 | 平均 APmean | toilet | bed | chair | sofa | table | bathtub | refrigerator | lamp |
|---|---|---|---|---|---|---|---|---|---|
| OV-3DET [24] | 18.02 | 57.29 | 42.26 | 27.06 | 31.50 | 14.17 | 56.28 | 10.99 | 2.11 |
| CoDA [3] | 19.32 | 68.09 | 44.04 | 28.72 | 44.57 | 20.23 | 50.51 | 6.55 | 0.51 |
| CoDAv2 [4] | 22.72 | 77.24 | 43.96 | 15.05 | 53.27 | 13.96 | 55.60 | 24.41 | 4.37 |
| OV-Uni3DETR [39] | 25.33 | 86.05 | 50.49 | 28.11 | 31.51 | 24.03 | 63.73 | 14.41 | 5.58 |
| Co-3DGT (本文) | 36.15 | 92.75 | 70.42 | 81.27 | 60.64 | 39.15 | 69.52 | 34.57 | 38.61 |
消融实验¶
论文通过多组对照实验全面评估了候选发现模式与双重引导训练机制的核心作用。
表 3: 候选发现模式消融及对最终训练结果的影响(AP / AR,单位:%)
| 发现配置 | 训练集发现 APnovel,disc25 (SUN) | 训练集发现 ARnovel,disc25 (SUN) | 最终模型 APnovel,det25 (SUN) | 最终模型 APnovel,det25 (ScanNet) | 说明 |
|---|---|---|---|---|---|
| 2D-Detection-based | 6.21 | 16.10 | 9.59 | 11.92 | 反投影 3D 框受深度噪声干扰 |
| 3D-Proposal-based | 8.49 | 12.02 | 9.88 | 12.71 | 裁剪图像识别易受遮挡误导 |
| Co-distil (从头训练 3D 探测器) | 10.45 (+1.96) | 19.72 (+7.70) | 11.76 (+1.88) | 16.68 (+3.97) | 二分匹配显著剔除错配杂项 |
| Co-distil (预训练 CuTR 探测器) | 10.97 (+2.48) | 24.33 (+12.31) | 12.69 (+2.81) | 18.74 (+6.03) | 充分释放几何与语义协同优势 |
表 4: 双重引导训练策略消融(评测整体 APmean25,单位:%)
| 变体配置 | SGUR(不确定性正则) | LGHA(分层语义对齐) | SUN RGB-D APmean25 | ScanNetV2 APmean25 | 说明 |
|---|---|---|---|---|---|
| 无双重引导基线 | ✗ | ✗ | 20.62 | 20.15 | 基础伪标签联合微调 |
| 仅加入 SGUR | ✓ | ✗ | 22.17 (+1.55) | 23.12 (+2.97) | 约束新类回归防过拟合 |
| 仅加入 LGHA | ✗ | ✓ | 21.35 (+0.73) | 22.73 (+2.58) | 增加多尺度超类特征容错 |
| 完整双重引导模型 | ✓ | ✓ | 22.63 (+2.01) | 23.75 (+3.60) | 两项正交增益互补融合 |
关键发现¶
- 协同蒸馏在发现阶段起决定性作用:直接使用预训练 CuTR 作为类别无关探测器并配合匈牙利匹配时,新类候选在 ScanNetV2 上的发现召回率提升达 +12.01%,直接推动最终训练未见类检测 AP 攀升 6.03 个百分点。
- 不确定性正则与层级对齐呈正交互补性:SGUR 专注于几何回归空间中的方差校准,LGHA 专注于分类潜空间的多粒度抽象约束,两者在 ScanNetV2 上协同带来 +3.60% 的全类平均 AP 跃升。
- 对 LLM 底座模型的鲁棒性极高:对比 ChatGPT-5 (23.75%)、Gemini-3-Flash-Thinking (23.84%)、Qwen3.5-397B (23.34%) 和 Llama-3.3-70B (23.51%),ScanNetV2 的性能波动极小(<0.5%),表明增益源自超类概念结构先验本身,而非特定大语言模型的私有句式。
亮点与洞察¶
- 跨模态二分匹配的互补萃取:巧妙利用 2D 检测的判别力(全局上下文充分、不易漏检)与 3D 提案的轮廓规整性(原生点云几何紧致、不受反投影拉伸扭曲),以极轻量的二分匹配代价实现了两阶段伪标签从“互相拖累”到“互补提纯”的跃迁。
- 基于基类场景先验的不确定性锚定:传统主动学习或自监督常因伪标签噪声导致不确定性估计发散,本文以同场景下有监督基类的预测方差作为物理度量基准,通过类似最大均值差异(MMD)的软正则化限制新类置信度,构思极其稳健。
- 点云单模态推理的高效部署:尽管在挖掘阶段综合利用了 RGB 图像与 2D 检测器,最终部署的 3D-OVD 探测器仅依赖纯点云输入,不仅省去了实时反投影特征融合的耗时开销,还将训练时长从多模态 baseline 的 716 分钟缩短至 490 分钟(SUN RGB-D)。
局限与展望¶
- 严重依赖离线两阶段发现过程:协同蒸馏需要在训练前对全场景离线预先跑完 2D 与 3D 候选并完成全局分配,无法实现真正的单阶段流式在线增量开放词表学习。
- 依赖静态室内场景的配对质量:在遮挡极为极端或点云稀疏区域(例如距离传感器过远的杂物堆),2D 边框反投影可能因点数过少无法计算出有效 3D 几何,导致二分匹配无法建立连接。
- 展望方向:未来可将时序多视角融合机制整合进协同蒸馏中,并在移动机器人具身导航场景下探索轻量化实时开放词表感知。
相关工作与启发¶
- vs OV-3DET: OV-3DET 纯粹依靠 2D 开放词表检测结果反投影生成 3D 伪标签并直接微调,容易受到反投影噪声点云外包盒过度膨胀的影响;本文通过与 3D 几何提案的二分关联,用紧致真实的 3D 几何边界替代了反投影包围盒,新类检测精度呈倍数级提升。
- vs CoDA / CoDAv2: CoDA 系列依赖 3D 提案裁剪出 2D 图像块并交由 CLIP 进行直接分类,在视角遮挡与背景杂乱时极易误分类;本文从源头上结合 2D 全局检测器与 LLM 超类分层对齐,有效规避了局部裁剪图像的语义混淆。
- vs OV-Uni3DETR: OV-Uni3DETR 采用昂贵的多模态交叉注意力融合机制;本文证明通过在离线伪标签提纯和训练正则化上精细设计,仅使用单模态纯点云网络即可取得更优的检测效果,兼顾了精度与效率。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 提出 2D-3D 双向协同蒸馏与场景感知不确定性正则化,优雅化解了两阶段 3D-OVD 长期存在的伪标签噪声难题。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖主流室内双数据集、常规基类迁移与无标注严苛设置,包含各阶段伪标签纯度统计与不同大模型底座的详尽消融。
- 写作质量: ⭐⭐⭐⭐⭐ 结构清晰紧凑,图表逻辑自洽,数学形式规范严谨。
- 价值: ⭐⭐⭐⭐☆ 为室内具身智能、三维场景理解中的开放词表少样本拓展提供了非常扎实且高效的工程化范式。