跳转至

Calibrate Before Adapt: Training-Free Pseudo-Label Calibration for Semi-Supervised Cross-Domain Few-Shot Detection

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/xSheep123/Semi-CDFSOD.git
领域: 目标检测
关键词: 跨域少样本目标检测、半监督学习、伪标签校准、视觉自提示、免训练

一句话总结

针对半监督跨域少样本目标检测(Semi-CDFSOD)中开集检测器伪标签存在的严重类别误分类与漏检难题,提出一种无需额外训练的伪标签校准框架,通过结合中心加权原型语义校准与基于 SAM 的视觉自提示漏检找回,显著净化并补全无标签目标域监督信号。

研究背景与动机

跨域少样本目标检测(CDFSOD)致力于在极端标注匮乏条件下将检测器迁移至差异巨大的新目标域中。然而现存的主流范式存在一个脱离实际部署的基本假设:默认目标域仅能获取极少量的有标签支持样本(Support Set),却完全忽略了真实场景中极易廉价获取的海量无标签数据。将半监督学习与跨域少样本检测相结合(Semi-CDFSOD),利用海量无标签目标域图像弥合巨大的领域鸿沟与类别分布漂移,具有巨大的实际落地价值,但在学术界尚处于起步探索阶段。

直接利用微调后的开集检测器(如 MM-Grounding-DINO)在无标签数据上生成伪标签,是最直观的半监督利用途径。然而在剧烈的跨域分布漂移与少样本标注的双重挤压下,该策略遭遇了两个内生性缺陷的严重制约。其一是语义误分类(Semantic Misclassification):开集检测器虽然能在新域中准确定位目标边界框,但由于目标域特征激活了源域已有的错误决策边界,导致模型给出了极高置信度却完全错误的类别预测,甚至将前景错判为背景;其二是低召回率(Low Recall):域漂移使目标特征滑落到检测器的期望流形之外,绝大多数前景物体被直接遗漏。传统的置信度阈值过滤陷入了两难境地:低阈值引入海量带噪伪标签,高阈值则丢失大部分困难样本且无法纠正误分类,导致错误的监督信号在自训练中形成恶性滚雪球效应。

面对这一困境,与其在后续模型微调阶段被动设计复杂的抗噪鲁棒损失,不如从源头重构伪标签的生成质量。本文的核心 insight 在于:目标域中极少量的标注支持集虽然不足以直接端到端训练出泛化检测器,但足以作为纯净的语义锚点来校准伪标签;同时视觉基础模型(如 SAM)具备出色的跨域无类别泛化分割能力,能够作为独立于检测器的第二视角来补全漏检。本文的核心 idea 是:提出一种免训练的伪标签校准框架,在模型适配前通过支持集与高置信伪标签构建中心加权类原型纠正语义误分类,并以校准后的高质量检测框作为视觉自提示驱动 SAM 恢复漏检实例,以高质量伪标签实现跨域检测器的稳健自适应。

方法详解

整体框架

整个校准框架由两大互补且无需任何额外参数训练的模块构成:语义校准器(Semantic Calibrator)与基于视觉自提示的漏检目标找回模块(Missed Object Recovery via Visual Self-Prompting)。

在整体流程中,系统首先使用经过目标域少样本支持集微调的开集检测器(MM-Grounding-DINO)在无标签图像上生成初始候选伪标签;随后提取区域中心加权特征,并结合标注支持集与最高置信度伪标签构建稳健的类别原型,对所有候选框重新进行余弦相似度匹配以纠正类别错误;接着,选取校准后置信度最高的检测框作为视觉提示,配合类感知注意力引导图注入 SAM 中,检索场景中被检测器遗漏的同类目标实例;找回的候选框同样经过语义校准器检验净化,最后通过 NMS 融合两类伪标签并与支持集结合,完成目标域检测器的最终适配。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["无标签目标域图像 + 极少样本支持集"] --> B["开集检测器生成初始候选框<br/>MM-Grounding-DINO 粗筛"]
    B --> C["中心加权区域特征提取与类原型构建<br/>融合支持样本与高置信伪标签"]
    C --> D["原型引导的类别校准<br/>余弦相似度分配真实类别"]
    D --> E["基于视觉自提示的漏检目标找回<br/>高质量框作为提示注入 SAM"]
    E --> F["校准验证与 NMS 候选去重合并<br/>形成纯净高召回伪标签集"]
    F --> G["目标域检测器适配微调"]

关键设计

1. 中心加权区域特征提取与类原型构建:抑制边界噪声并锚定目标域表征

传统 RoI 池化或均值聚合在跨域场景下容易将候选框边缘杂乱的背景纹理混入特征中,严重污染语义表达。考虑到定位合理的边界框中,目标实体通常聚集在几何中心,本文利用冻结的通用大视觉模型 DINOv3(ViT-L/16)提取密集体特征图,并设计了随径向距离高斯衰减的中心加权聚合策略。设候选框内 RoI 的 patch 坐标集合为 \(\mathcal{O}\),中心为 \((c_x, c_y)\),对区域内每个坐标 \((x, y) \in \mathcal{O}\) 分配中心权重:

\[w_{\mathrm{center}}(x, y) = \exp\left(-\frac{(x - c_x)^2 + (y - c_y)^2}{2\sigma^2}\right)\]

经归一化 \(\hat{w}(x, y) = \frac{w_{\mathrm{center}}(x, y)}{\sum_{(i, j) \in \mathcal{O}} w_{\mathrm{center}}(i, j) + \epsilon}\) 后,区域特征表示为加权和 \(\mathbf{f}_{\mathrm{box}} = \sum_{(x, y) \in \mathcal{O}} \hat{w}(x, y) \mathbf{F}(x, y)\)。在此稳健表征之上,系统为每个目标类别 \(c\) 收集其少样本真值支持样本以及初始预测中置信度最高的 Top-3 伪标签,计算两者平均特征作为该类的目标域原型 \(\mathbf{p}_c = \frac{1}{N_c} \sum_{i=1}^{N_c} \mathbf{f}_i^c\)。这样既利用了支持集的绝对语义纯度,又引入了目标域特有的外观统计分布多样性。

2. 原型引导的类别校准:基于余弦相似度纠正语义误分类

初始开集检测器受源域分类头预训练偏差影响,容易将具有相似局部纹理的目标错分。由于构建的类原型已经根植于强大的预训练视觉特征空间并融合了目标域分布,类别重新判定不再依赖检测器脆弱的分类头,而是直接通过几何原型对齐来实现。对于任意初始伪标签候选框提取的区域特征 \(\mathbf{f}\),计算其与所有候选类别原型 \(\{\mathbf{p}_c\}_{c=1}^C\) 的归一化余弦相似度,将相似度最大者作为校准后的最终类别:

\[\hat{y} = \arg\max_{c \in \{1, \dots, C\}} \frac{\mathbf{f}^\top \mathbf{p}_c}{\|\mathbf{f}\|_2 \|\mathbf{p}_c\|_2}\]

这一免训练机制能够在完整保留检测器高质量空间定位框的同时,以近乎零计算开销将混淆类别(如将远距离卡车误识为轿车、或工业缺陷中不同纹理的错混)精准纠偏,从根源上阻断了错误语义向伪标签库的蔓延。

3. 基于视觉自提示的漏检目标找回:引导 SAM 突破检测器召回瓶颈

针对开集检测器召回率严重不足的问题,直接使用文本提示驱动开放词表分割在复杂跨域场景常因语义歧义而失效。本文提出以校准后的高质量伪标签作为视觉提示(Visual Prompts)输入 SAM。具体而言,对于每个类别 \(c\),选取置信度最高的校准伪标签 \(z_*^c = \arg\max_{z_i \in \hat{\mathcal{Z}}^c} s_i\) 作为主视觉提示框输入 SAM;为防止 SAM 仅关注单个提示而遗漏其他潜在实例,进一步构建类感知空间注意力增强掩膜 \(m^c(x, y)\)(当位置落在类别 \(c\) 的其余次高候选框内时置为 1,否则为 0)。将增强图缩放 \(\mathbf{E}^c = \lambda m^c(x, y)\)(取 \(\lambda = 5\))并与相对位置偏置相加:

\[\mathbf{A}^c = \mathbf{A}_{\mathrm{rpb}}(z_*^c) + \mathbf{E}^c\]

该偏置直接干预 SAM 的视觉交叉注意力计算,迫使其在全图范围内检索外观相似但此前未被检出的潜在目标。所有通过 SAM 找回的新候选框必须再次通过语义校准器的原型匹配验证以剔除误报背景,最终与初始校准集进行 NMS 融合,得到既高精度又高召回的伪标签闭环。

损失函数 / 训练策略

该框架的伪标签校准阶段完全是免训练(Training-Free)的,无需更新检测器或特征提取器的任何权重。在随后的目标域适配阶段,以带有 Swin-B 骨干的 MM-Grounding-DINO(由 LLMDet 权重初始化)为基准检测器,利用校准整合后的无标签目标域伪标签与有标签支持集组成联合监督数据,使用 AdamW 优化器进行 500 次迭代的端到端微调。基础学习率设为 \(2 \times 10^{-5}\)(在 ArTaxOr 和 DIOR 上设为 \(1 \times 10^{-4}\)),骨干网络学习率乘以 0.1 倍衰减率,以保证目标域特征微调的平稳收敛。

实验关键数据

主实验

论文建立了首个跨 6 个截然不同领域(涵盖艺术节肢动物 ArTaxOr、遥感影像 DIOR、卡通风格 Clipart1k、水下生物 UODD 与 FISH、工业表面缺陷 NEU-DET)的 Semi-CDFSOD 标准评测基准。以下表格汇总了在 1-shot、5-shot 和 10-shot 设置下各方法的检测性能(mAP)。

方法 类型 1-shot 平均 mAP 5-shot 平均 mAP 10-shot 平均 mAP
Detic-FT 传统 CDFSOD 微调 6.6 13.3 16.5
DE-ViT-FT 传统 CDFSOD 视觉微调 10.1 22.3 25.2
CD-ViTO 增强型开集 CDFSOD SOTA 13.9 26.1 29.6
MM-Grounding-DINO 开集检测器基线 (Few-shot FT) 31.2 40.6 45.1
阈值过滤 (thr=0) 传统半监督伪标签 (全量保留) 19.7 21.0 23.6
阈值过滤 (thr=0.5) 传统半监督伪标签 (常规阈值) 31.8 41.3 45.3
阈值过滤 (thr=0.9) 传统半监督伪标签 (严格阈值) 32.8 41.1 44.5
SAM3 (文本提示) 基础模型提示基线 28.8 33.8 37.9
SAM3 (视觉提示) 基础模型提示基线 32.1 40.5 44.1
SAM3 (图文联合提示) 基础模型提示基线 31.3 37.9 40.1
本文方法 (Ours) 免训练伪标签校准框架 35.9 44.1 46.7

详细的跨域主结果对比(以最具代表性的 1-shot 和 5-shot 为例):

数据集 领域类型 1-shot 基准基线 1-shot 本文 1-shot 增益 5-shot 基准基线 5-shot 本文 5-shot 增益
ArTaxOr 艺术/生物细粒度 44.0 56.2 +12.2 67.6 78.6 +11.0
Clipart1k 卡通水彩风格迁移 49.6 50.1 +0.5 55.6 55.8 +0.2
DeepFish 水下模糊低对比度 39.0 46.4 +7.4 41.0 43.3 +2.3
DIOR 大尺度光学遥感 18.6 23.7 +5.1 29.6 32.5 +2.9
NEU-DET 钢铁工业缺陷 13.9 16.8 +2.9 22.2 23.8 +1.6
UODD 水下机器人多目标 22.2 22.0 -0.2 27.8 30.3 +2.5
平均 (Avg.) 全域综合 31.2 35.9 +4.7 40.6 44.1 +3.5

消融实验

论文在具有显著域差异且类别丰富的遥感数据集 DIOR 与工业缺陷数据集 NEU-DET 上进行了递进式消融实验,验证语义校准器与视觉自提示找回机制的独立与协同有效性。

数据集 配置 / 模块组成 1-shot mAP 5-shot mAP 10-shot mAP 相对基线整体增益
DIOR Baseline (MM-Grounding-DINO) 18.6 29.6 35.7 -
DIOR + 类别校准器 (Calibrator) 20.6 32.1 36.0 +2.0 / +2.5 / +0.3
DIOR + 校准器 & 视觉自提示找回 (Ours) 23.7 32.5 37.3 +5.1 / +2.9 / +1.6
NEU-DET Baseline (MM-Grounding-DINO) 13.9 22.2 24.3 -
NEU-DET + 类别校准器 (Calibrator) 16.5 23.5 25.6 +2.6 / +1.3 / +1.3
NEU-DET + 校准器 & 视觉自提示找回 (Ours) 16.8 23.8 25.9 +2.9 / +1.6 / +1.6

关键发现

  • 校准器贡献显著:在 1-shot 极端少样本下,单纯加入类别校准器即可让 DIOR 提升 2.0 mAP,NEU-DET 提升 2.6 mAP。混淆矩阵分析显示,非对角线的类别混淆被大幅抑制,对角线命中率显著提升,证实了利用支持样本+高置信伪标签构建原型的语义纯化能力。
  • 视觉自提示有效解决低召回:在校准器纠偏的基础上,SAM 借助类感知空间偏置能够有效挖掘大量此前未被检测器捕捉到的难样本与弱对比度目标,在 DIOR 1-shot 上带来额外 3.1 mAP 的跨越式增长。
  • 视觉提示优于文本提示:在开集提示对比中,直接用 SAM 进行视觉提示的平均表现(32.1/40.5/44.1)显著击败文本提示(28.8/33.8/37.9),说明文本 prompt 在跨域陌生分布下极易产生语义漂移,而来自目标域本底的视觉 patch 提示能够精确锚定具体的表观线索。

亮点与洞察

  • “先校准再自适应”的范式革新:以往半监督检测多在模型微调时引入复杂的伪标签加权或自适应阈值,而本文揭示了跨域场景下伪标签的根本瓶颈是“误分类”与“漏检”的耦合恶性循环。在送入训练前直接通过冻结基础模型予以几何与视觉纠偏,以极简的计算代价取得了击败繁琐训练技巧的优异效果。
  • 巧妙的中心加权与自监督特征解耦:不依赖训练集微调的分类头,而是直接借力在大规模数据上预训练且具备出色空间密集语义的 DINOv3 与高斯距离加权聚合,实现了不带噪声的 RoI 表征与高纯度类原型。
  • 闭环视觉自提示机制:将自身生成的最高置信度检测框作为 SAM 的 Prompt,并通过类感知注意力掩码扩展关注视野,既克服了基础分割模型无类别判别的缺陷,又弥补了传统检测器特征漂移导致的漏检。

局限与展望

  • 对初始检测框定位精度的依赖:语义校准的前提是候选框至少覆盖了目标的主要区域(以便高斯中心加权生效)。若开集检测器在某些极端域中严重错位或生成极度虚假的重叠框,可能在原型构建时引入局部偏差。
  • 多阶段开销与两阶段串行推理:虽然方法无需反向传播训练,但涉及 DINOv3 区域特征提取与 SAM 逐类视觉提示分割,在面对数万张超大规模无标签数据集时,离线伪标签的生成时间开销相对较大。
  • 未来方向:可进一步探索在线动态原型更新机制,或者将 SAM 视觉提示与轻量单阶段检测架构深度融合,实现伪标签实时流式校准。

相关工作与启发

  • vs CD-ViTO 等传统 CDFSOD:传统方案仅使用极少量的目标域支持集进行微调与域提示适配,未开发利用无标签数据;本文拓展至 Semi-CDFSOD 新范式,在同等少样本条件下平均 mAP 提升超过 20 点(1-shot 从 13.9 提升至 35.9)。
  • vs 常规阈值伪标签过滤(Threshold-based Pseudo-Labeling):常规方法假设置信度高即正确,忽略了域迁移引发的“高置信误判”和“漏检”;本文通过类原型余弦校准纠偏,并用视觉自提示召回,突破了固定阈值的性能上限。
  • vs 纯 SAM/视觉大模型开集检测:单纯使用 SAM 进行文本或未校准框提示容易引发“提示噪声→输出噪声”的放大恶性循环;本文在提示前严格先执行原型语义净化,保证了输入 SAM 提示的高纯度。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次系统剖析 Semi-CDFSOD 伪标签的两大缺陷,提出免训练的原型校准与视觉自提示机制,构思巧妙简洁。
  • 实验充分度: ⭐⭐⭐⭐⭐ 建立了涵盖 6 个差异悬殊领域的标准基准,在 1/5/10-shot 下提供完备的对比基线与详尽消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构层次分明,数学公式表达精炼,图表分析透彻深入。
  • 价值: ⭐⭐⭐⭐⭐ 为少样本跨域目标检测落地到海量无标签实际场景提供了低成本、即插即用的实用范式。