跳转至

Ceptor: Vision-Language Model-Infused Diverse Guidance for Detecting Anything

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/jinyanglii/Ceptor
领域: 多模态VLM
关键词: 开放词表目标检测、视觉语言模型、多模态视觉提示、金字塔RoI提取器、多路径特征谐调

一句话总结

Ceptor 借鉴人类视觉搜索机制,将预训练视觉语言模型(VLM)同时作为检测骨干与提示生成器,结合空间增强金字塔 RoI 提取器与多路径谐调网络,实现了交互式视觉、通用视觉、文本及混合提示的统一开放词表目标检测。

研究背景与动机

开放集目标检测(Open-Set Object Detection, OSOD)致力于突破预定义类别的限制,是自动驾驶、工业质检、医疗成像以及多模态大模型视觉感知专家的核心使能技术。当前主流文本引导的开集检测范式极度依赖于预训练视觉-语言空间中的跨模态图文对齐。然而,面对长尾类别、细粒度罕见实体以及缺乏显式语义抽象或难以用自然语言精确描述的对象时,文本特征空间因语言离散性而表现得过于稀疏,导致检测器对文本引导的响应敏感度显著下降。

为了解决文本提示在低语义抽象对象上的表征瓶颈,近期研究探索了引入边界框坐标等视觉提示机制(如 T-Rex2、YOLOE)。但现有视觉提示方案存在显著缺陷:其一,感知主干与视觉提示生成机制缺乏内在泛化表征,依赖局部裁剪或孤立坐标编码使得实例级特征提取受限,且破坏了目标所处的上下文依赖;其二,文本提示与视觉提示通常采用独立的特征交互分支,缺乏统一的端到端联合优化约束,更缺失在不同类别分布下平滑过渡的中介提示机制;其三,特征提取的离散性导致多路径在深层交互时产生表示冲突与梯度干扰。

人类视觉搜索机制则展现出截然不同的灵活性:对于语义明确的常见物体,人脑可以直接通过名称检索概念记忆实施自顶向下的搜索;而对于陌生的长尾对象,人类则能依托示例的密集视觉特征模板快速进行比对与定位。本文的核心 idea 是将预训练视觉语言模型(VLM)同时作为检测主干和多样化提示生成器,构建与图像表征同源或严格对齐的通用特征空间,并通过金字塔 RoI 提取器(PRE)与多路径专家谐调网络,实现文本、交互式视觉、通用视觉与混合提示在统一框架下的端到端协同检测。

方法详解

整体框架

Ceptor 构建于 Deformable DETR 架构之上,包含三个协同核心模块:VLM 注入器(VLM Infuser)、提示动物园(Prompt Zoo)以及提示导向解码器(Prompt-Oriented Decoder, POD)。输入图像经由 VLM 的图像编码器(IE)与轻量卷积分支构成的空间增强器处理,生成具备多尺度空间归纳偏置的增强特征。各类提示由 Prompt Zoo 统一由 VLM 衍生生成,并在编码器阶段与图像特征进行早期交叉注意力交互(Early Interaction)。随后,更新后的目标查询在 POD 中通过自注意力、与图像特征的交叉注意力以及专用的提示交叉注意力完成实体定位,最终经由多路径前馈网络(Multi-Route FFN)输出分类预测与边界框回归。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与多模态线索"] --> B["VLM 注入与空间增强<br/>IE 提取特征 + 卷积分支拼接 + SFP 多尺度增强"]
    A --> C["提示动物园生成<br/>TE 文本 / PRE 交互视觉 / 离线通用视觉 / 混合提示"]
    B & C --> D["早期跨模态交互<br/>增强图像特征与提示特征执行 MHCA"]
    D --> E["高效编码器融合<br/>顶层特征 MHSA + CCFM 跨尺度融合"]
    E & C --> F["提示导向解码器<br/>查询自注意力 + 图像交叉注意力 + 提示交叉注意力"]
    F --> G["多路径专家 FFN 与谐调输出<br/>根据指令嵌入分流专属 FFN,完成框回归与分类匹配"]
    G --> H["跨模态实例级特征对齐<br/>预测特征 F_align 与 GT 视觉嵌入 V_G' 双向蒸馏对齐"]

关键设计

1. VLM 注入与空间增强:单尺度 ViT 表征到多尺度检测特征的归纳迁移 预训练 VLM 的纯 ViT 主干缺乏目标检测所需的显式多尺度空间归纳偏置,直接应用于 Deformable DETR 会损失密集小目标的定位精度。Ceptor 引入包含简单特征金字塔(SFP)与轻量卷积辅助网络 \(C\) 的空间增强器。输入图像 \(I\) 经图像编码器得到特征 \(F_I\) 后构建 SFP,并与卷积分支 \(C(I)^l\) 在每一层 \(l\) 进行通道拼接,随后通过 \(1\times1\) 卷积与归一化得到融合特征 \(F_{\text{enh}}^l\)。在编码阶段,模型仅对顶层融合特征执行自注意力与 FFN 计算,再经由跨尺度特征融合模块(CCFM)强化多尺度语义传播,在极低计算开销下完成了 VLM 稠密语义向高分辨率几何空间的映射。

2. 金字塔 RoI 提取器(PRE):上下文完备的交互式视觉提示提取 传统的示例坐标提示或直接裁剪图像送入编码器的方式,要么缺失实例上下文,要么引发巨额推理开销。针对交互式视觉提示 \(V_I\),Ceptor 设计了金字塔 RoI 提取器。PRE 首先利用轻量 CCFM 对 ViT 增强特征进行平滑与多尺度重整,确保任意尺度的用户选框均能映射到最佳分辨率层级;接着在多层特征上执行 RoI Align,利用 ViT 固有的全局自注意力保留目标周围的上下文语义背景;最后将各层区域特征沿嵌入维度拼接,经由 \(1\times 1\) 卷积融合与专用多层卷积下采样网络,在压缩维度的同时完整保留局部空间结构,输出紧凑而富含上下文的交互视觉嵌入 \(V_I'\)。

3. 多样化提示生态:从单样本交互到跨图像通用语义检索 Prompt Zoo 支持四种相互补充的提示类型,全方位覆盖各类检测场景: - 文本提示(\(T\)):通过冻结的文本编码器(TE)对 80 种模版生成的类别文本提取嵌入并归一化,提供全局高层抽象语义引导; - 交互式视觉提示(\(V_I\)):基于用户当前图像给出的单张边界框,经 PRE 实时抽取单样本特征,适用于图像内即时交互与密集计数; - 通用视觉提示(\(V_G\)):利用冻结的 IE 离线抽取各类别多个正样本的扩边裁剪特征,聚类并归一化为代表性类中心向量,专门用于跨图像、跨数据集的通用长尾目标搜索; - 混合提示(\(H\)):将通用视觉嵌入 \(V_G\) 与文本嵌入 \(T\) 进行直接加权均值并归一化,使得文本与视觉模态优势互补,在复杂分布下表现出极高的鲁棒性。

4. 多路径 FFN 专家与指令嵌入谐调机制:缓解多提示联合优化的梯度冲突 不同模态的提示特征在分布与几何敏感度上存在本质差异,共享同一前馈网络容易导致梯度相互抵消与性能震荡。Ceptor 在解码端构建了多路径 FFN(Multi-Route FFN),包含四套平行的前馈网络,分别充当专属专家处理对应类型的提示分支;同时为每种提示引入独立的单条可学习指令嵌入(Instruction Embedding),显式感知当前工作模态。此外,为进一步约束输出端一致性,模型提取当前图像所有真实标注框在冻结 IE 下的特征 \(V_G'\),与解码器预测匹配得到的特征 \(F_{\text{align}}\) 计算对齐均方误差损失: $\(\mathcal{L}_{\text{align}} = \frac{1}{n \cdot d} \sum_{i=1}^n \sum_{j=1}^d \left( F_{i,j,\text{align}} - V'_{i,j,\text{align}} \right)^2\)$ 该对齐损失从输出端隐式对齐了各提示路径的隐空间分布,并将 VLM 的开集泛化能力深度蒸馏至整个检测框架。

损失函数 / 训练策略

Ceptor 采用端到端的多任务监督。匹配阶段沿用匈牙利二分匹配算法,总损失函数包含分类对比损失、边界框回归损失及对齐损失: $\(\mathcal{L} = \lambda_{\text{cls}} \mathcal{L}_{\text{cls}} + \lambda_{\text{L1}} \mathcal{L}_{\text{L1}} + \lambda_{\text{GIoU}} \mathcal{L}_{\text{GIoU}} + \lambda_{\text{align}} \mathcal{L}_{\text{align}}\)$ 其中分类损失 \(\mathcal{L}_{\text{cls}}\) 计算输出检测查询与当前提示特征点积构成的逻辑回归对比 Focal 损失。训练分两阶段展开:第一阶段在 Objects365、V3Det 与 GoldG 共 1.56M 样本上执行文本引导预训练,IE 主干以 0.05 倍微调学习率适应 \(1024\times1024\) 分辨率;第二阶段在 Objects365、OpenImages、V3Det 和 HierText 共 2.5M 样本上执行全提示联合微调,通用视觉与文本提示按迭代交替,交互式视觉与混合提示每 5 个周期规律性注入,实现全局稳定收敛。

实验关键数据

主实验

在 COCO-val 与长尾开集基准 LVIS(minival 及完整 val 集)上,Ceptor 在交互视觉(Visual-I)、通用视觉(Visual-G)、文本(Text)及混合(Hybrid)四种引导模式下均展现出显著超越 SOTA 的检测性能。

方法 开源 主干网络 数据规模 引导模式 COCO AP LVIS-minival AP_all LVIS-minival AP_r LVIS-val AP_all LVIS-val AP_r
T-Rex2 ✗ Swin-T 7.3M Visual-I 56.6 59.3 64.4 62.6 71.9
Ceptor ✓ PEcoreS 3.2M Visual-I 65.1 (+8.5) 66.9 (+7.6) 77.0 (+12.6) 63.0 (+0.4) 74.6 (+2.7)
T-Rex2 ✗ Swin-L 7.3M Visual-I 58.5 62.5 70.1 65.8 72.6
Ceptor ✓ PEcoreL 3.5M Visual-I 71.9 (+13.4) 72.8 (+10.3) 81.3 (+11.2) 68.8 (+3.0) 80.2 (+7.6)
T-Rex2 ✗ Swin-T 7.3M Visual-G 38.8 37.4 29.9 34.9 32.4
YOLOE-11-L ✓ - 1.4M Visual-G - 33.7 28.1 - -
Ceptor ✓ PEcoreS 3.2M Visual-G 47.3 (+8.5) 39.1 (+1.7) 37.0 (+7.1) 30.9 28.8
Ceptor ✓ PEcoreL 3.5M Visual-G 54.0 (+7.5) 47.8 (+0.2) 47.2 (+1.8) 40.5 40.5
Grounding DINO ✗ Swin-T 5.4M Text 48.4 27.4 18.1 - -
T-Rex2 ✗ Swin-T 7.3M Text 45.8 42.8 37.4 34.8 29.0
Ceptor ✓ PEcoreS 3.2M Text 51.7 (+5.9) 43.1 (+0.3) 40.6 (+3.2) 34.3 28.2
Ceptor ✓ PEcoreL 3.5M Text 54.8 (+2.6) 54.0 54.7 (+5.5) 45.5 42.8
T-Rex2 ✗ Swin-T 7.3M Hybrid 42.5 - - 37.0 34.3
Ceptor ✓ PEcoreS 3.2M Hybrid 50.5 (+8.0) 44.1 40.9 35.9 31.4

消融实验

基于 Objects365 预训练与 PEcoreS 主干在三种基准引导模式下的关键模块消融结果如下:

引导模式 模型配置 COCO-val AP LVIS-minival AP_all LVIS-minival AP_r LVIS-minival AP_c LVIS-minival AP_f 说明
Visual-I Ceptor 完整模型 62.3 61.1 72.4 68.5 52.5 完整模型
Visual-I w/o 注入策略 (Infusion) 61.0 (-1.3) 57.5 (-3.6) 66.7 (-5.7) 64.0 (-4.5) 50.1 (-2.4) 缺失多尺度融合与早期对齐,长尾罕见类剧烈掉点
Visual-I w/o 谐调策略 (Harmonization) 61.3 (-1.0) 59.2 (-1.9) 69.5 (-2.9) 66.0 (-2.5) 51.3 (-1.2) 去除多路由 FFN 与指令嵌入,多模态梯度冲突
Visual-I w/o VLM (使用标准 ViT) 61.5 (-0.8) 53.6 (-7.5) 59.7 (-12.7) 59.9 (-8.6) 47.0 (-5.5) 缺乏开集泛化先验与跨模态对齐,稀有类暴跌 12.7 点
Visual-I w/o PRE (替换为交叉注意力) 59.3 (-3.0) 59.3 (-1.8) 70.3 (-2.1) 65.4 (-3.1) 51.9 (-0.6) 证实 PRE 保留上下文与空间几何特征的关键作用
Visual-G Ceptor 完整模型 48.1 31.5 25.6 30.2 33.7 完整模型
Visual-G w/o 注入策略 (Infusion) 47.9 (-0.2) 30.8 (-0.7) 24.9 (-0.7) 29.5 (-0.7) 33.0 (-0.7) 基础特征表达受限
Visual-G w/o 谐调策略 (Harmonization) 46.5 (-1.6) 29.6 (-1.9) 24.1 (-1.5) 27.8 (-2.4) 32.1 (-1.6) 通用视觉与其他模态严重脱节
Visual-G w/o VLM (使用标准 ViT) 47.6 (-0.5) 30.4 (-1.1) 21.4 (-4.2) 29.2 (-1.0) 33.0 (-0.7) 罕见类别性能急剧下滑
Text Ceptor 完整模型 50.2 33.7 32.2 31.9 35.7 完整模型
Text w/o 注入策略 (Infusion) 48.9 (-1.3) 32.8 (-0.9) 30.4 (-1.8) 31.0 (-0.9) 34.9 (-0.8) 文本与底层视觉特征融合变弱
Text w/o 谐调策略 (Harmonization) 48.1 (-2.1) 32.3 (-1.4) 31.1 (-1.1) 30.8 (-1.1) 33.9 (-1.8) 文本前馈专家不可或缺
Text w/o VLM (使用标准 ViT) 49.1 (-1.1) 33.1 (-0.6) 30.5 (-1.7) 31.6 (-0.3) 34.9 (-0.8) 丧失预训练多模态对齐红利

关键发现

  • 长尾实体依赖视觉同源特征:在 LVIS 罕见类(\(AP_r\))上,以 PEcoreS 为例,交互式视觉提示达到了 77.0 AP,大幅超越纯文本提示的 40.6 AP 与通用视觉提示的 37.0 AP;若将 VLM 替换为常规自监督 ViT,Visual-I 在罕见类上下跌 12.7 点,证明 VLM 图像编码器的稠密特征连续性是捕获长尾物体相似性的基石。
  • 混合提示的互补增益:在 LVIS-minival 上,混合提示(Hybrid)取得了 44.1 \(AP_{\text{all}}\),同时高于纯文本(43.1 AP)与通用视觉提示(39.1 AP),验证了高层语义概念(Text)与底层细节特征(Visual-G)深度联合能在复杂类别场景中形成有效互补。
  • PRE 结构优势显著:将 PRE 降级为直接利用全图做 Cross-Attention 提取提示时,COCO AP 显著下降 3.0 点,证明了金字塔多尺度 RoI 结合局部几何下采样的表征优越性。

亮点与洞察

  • 主干与提示生成器的“源生统一”:传统模型往往割裂看待骨干网络与外挂提示,Ceptor 让单一 VLM 双轨并进,兼顾主干特征抽取与提示构造,从根源上确保了隐空间的对齐自洽与表征稠密性。
  • 免裁剪的 Pyramid RoI Extractor 设计:巧妙结合了平滑 CCFM 与多尺度 RoI 机制,既绕过了耗时费算力的图像裁剪重编码流程,又完整吸收了 ViT 的全局上下文背景。
  • 可扩展的提示组合性:不同于前代工作仅限于单模态或后处理投票,Ceptor 证明通过多专家 FFN 与指令嵌入,可以在端到端训练阶段深度吸收混合提示模态,为未来构建全自动多轮 Prompt Agent 提供了优秀的基础检测底座。

局限与展望

  • 作者承认的局限:在极端复杂开集数据集 LVIS-val 全集评测上,Ceptor 在通用视觉引导(Visual-G)模式下的性能(30.9 AP)落后于依赖更大规模私有高质量训练集(7.3M)的闭源模型 T-Rex2(34.9 AP),表明通用视觉类中心的质量极大程度受制于跨图像训练样本的清洗质量与规模。
  • 探索与改进方向:当前通用视觉提示仅采用简单的跨图像特征离散聚类均值,未来可引入视觉语言大模型(VLM/MLLM)自动总结类别显著视觉特征并生成条件权重;此外,可进一步探索点(Point)、轮廓涂鸦(Scribble)等多形态交互视觉提示的统一支持。

相关工作与启发

  • vs Grounding DINO / OV-DINO: 后者专注于文本驱动的开集检测,在常规概念上精度高,但对无法言传的长尾类别完全失效;Ceptor 扩展了交互式与通用视觉提示,在长尾物体上取得了压倒性的定位精度提升。
  • vs T-Rex2: T-Rex2 虽然尝试了图文多提示,但未能完全开源,其多模态多为后处理组合,且提示特征提取缺乏多尺度上下文融合;Ceptor 提出了端到端训练的混合提示与 PRE 金字塔特征抽取,不仅在更小数据规模下刷新了指标,还全面开源了模型与代码。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 优雅地将预训练 VLM 特征解耦复用于主干与多模态提示生成,PRE 与多路由 FFN 结构设计严谨自洽。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 COCO、LVIS 各子集的全面测评,跨四种提示模式均有极详实的横向对比与关键消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照极清晰,动机推导与设计取舍环环相扣。
  • 价值: ⭐⭐⭐⭐⭐ 开源了高质量的通用 Detect Anything 框架,为交互式数据标注、机器人操作与多模态感知系统提供了关键工具。