跳转至

Task-Agnostic Incremental Vision-Language Object Detection via Prompt Augmentation and Distribution-Aware Fusion

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/yonghanjiang/TADA
领域: 目标检测
关键词: 增量学习, 开放词表目标检测, 提示词干扰, 参数冲突, 马氏距离

一句话总结

针对增量视觉语言目标检测在无任务先验时面临的跨任务提示词干扰与参数冲突难题,本文提出 TADA 框架,通过训练期随机提示词增强与测试期基于马氏距离的分布感知 LoRA 融合,在 ODinW-13 任务不可知基准上取得 64.5 mAP(相比此前 SOTA DitHub 提升 +32.0 mAP)。

研究背景与动机

基于大规模图文预训练的开放词表目标检测(OVOD)虽然具备强大的零样本泛化能力,但直接部署到专业垂直领域时,往往面临显著的域分布偏移。增量视觉语言目标检测(IVLOD)应运而生,其核心目标是让检测器在连续的下游任务数据流中不断学习新概念,同时克服灾难性遗忘并保持基础开放词表识别能力。近年来的主流方案(如 ZiRa 和 DitHub)主要依赖参数隔离与模块化微调,为不同任务或类别分配独立的 LoRA 专家模块,以兼顾可塑性与稳定性。

然而,现有 IVLOD 方法均建立在一个强假设之上,即任务增量(Task-Incremental)设定。在推理时,模型默认享有「任务标识神谕(Task Oracle)」,仅需使用包含当前任务类别的受限短提示词进行单任务检测。这种假设脱离了真实的开放世界场景——在无任务先验的环境中,检测器必须面对所有历史任务类别的联合词表,同时从混合测试集中检测目标。本文将其形式化定义为更贴合实际的「任务不可知增量视觉语言目标检测(TA-IVLOD)」。

当把单任务提示词直接拼接为全局跨任务长提示词时,现有模型暴露出致命的性能崩溃。其核心矛盾在于:一方面,跨模态注意力机制在面对冗长的异构类别文本时会出现注意力稀释(Attention Dilution),视觉特征无法准确定位目标类别词元;另一方面,各任务类别的 LoRA 专家是在孤立的阶段独立优化的,其优化轨迹差异巨大、跨任务方向相似度极低。DitHub 等方法采用朴素的算术平均进行参数合并,不可避免地引发剧烈的参数冲突与表征紊乱。核心 idea:在训练期通过注入历史类别与合成无意义随机噪声构造多变长提示词以增强抗干扰鲁棒性,在测试期利用在线估计的特征分布与马氏距离自适应加权融合类别 LoRA 专家。

方法详解

整体框架

本文提出的 TADA(Task-Agnostic Distribution-Aware Adaptation)基于预训练开放词表检测器 Grounding DINO 构建,将解决方案解耦为训练阶段的文本端抗干扰训练与推理阶段的视觉端动态参数路由。在训练阶段,模型引入随机提示词增强(SPA),动态拼装当前任务类别、历史采样类别与随机字符噪声,促使检测器在复杂文本上下文中精准对齐目标视觉特征;同时在流式学习过程中在线维护各类别特征均值与全局类内协方差矩阵。在推理阶段,面对包含所有已学类别的联合提示词,测试期分布感知融合(TTDF)计算输入图像视觉特征与各类别分布之间的马氏距离,通过带温度系数的 Softmax 得到匹配权重,自适应加权聚合类别 LoRA 投影矩阵,抑制不相关类别的参数噪声。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据<br/>当前图像 + 当前任务类别 C_cur"] --> B["随机提示词增强 SPA<br/>拼入历史类别采样 C_prev 与随机合成噪声 C_noise"]
    B --> C["Grounding DINO 文本与图像骨干<br/>多模态跨注意力特征增强与目标检测"]
    C --> D["在线特征分布建模<br/>流式更新各类别均值向量与全局协方差矩阵"]
    D --> E["测试期分布感知融合 TTDF<br/>输入测试图像特征与各类别中心计算马氏距离"]
    E --> F["自适应 LoRA 参数聚合<br/>Softmax 动态加权 A_c 矩阵并与共享 B 矩阵重组"]
    F --> G["最终任务不可知检测输出<br/>统一跨任务提示词下准确定位与分类"]

关键设计

1. 随机提示词增强(Stochastic Prompt Augmentation, SPA):前瞻性模拟跨任务文本干扰

针对任务不可知推理时长提示词带来的注意力稀释痛点,SPA 在训练期主动注入扰动以对齐训练与推理时的提示词分布。对于当前任务类别集合 \(\mathcal{C}_{cur}\),SPA 动态引入两类干扰词元构建训练提示词 \(\mathcal{P}_{train} = \mathcal{C}_{cur} \cup \mathcal{C}'_{prev} \cup \mathcal{C}_{noise}\)。第一类是历史重放词元 \(\mathcal{C}'_{prev}\),从先前已学习的任务类别中随机动态采样,迫使多模态交叉注意力在统一文本上下文中区分当前目标与旧知识;第二类是合成噪声词元 \(\mathcal{C}_{noise}\),注入数量与内容均随机生成的字符乱码串(如 "asdf", "ghjklk" 等)。这些合成无意义词元作为未来未知类别与开集扰动的代理,既不引入特定先验概念破坏零样本迁移能力,又迫使跨模态注意力网络适应不同长度与不同密度的提示词结构。所有额外注入的干扰词元仅参与多模态特征融合,不参与后续的目标匈牙利匹配与损失计算。

2. 在线特征分布建模:流式追踪各类别统计特征

为了在推理时量化当前输入图像与各个已学类别的视觉相关性,模型需要在无需缓存历史图像(Exemplar-Free)的前提下获取稳定的类别分布。TADA 为每个类别 LoRA 维护一个类别中心向量 \(\boldsymbol{\mu}_c\) 和样本计数器 \(t_c\),并维护一个跨类别共享的类内离差矩阵 \(\mathbf{S}\)。当输入批次中包含属于类别 \(c \in \mathcal{C}_{gt}\) 的图像特征 \(f(\mathbf{x})\) 时,以流式均值规则更新类别均值:

\[\boldsymbol{\mu}_c^{(t)} = \boldsymbol{\mu}_c^{(t-1)} + \frac{1}{t_c} \left( f(\mathbf{x}) - \boldsymbol{\mu}_c^{(t-1)} \right)\]

同时,增量累加中心化外积更新共享离差矩阵 \(\mathbf{S}\),最终通过对总有效样本计数归一化得到共享协方差矩阵 \(\boldsymbol{\Sigma} = \frac{1}{\sum_c t_c} \mathbf{S}\)。这一过程开销极小且无需保留历史样本,完整刻画了多任务特征空间的全局相关性与方差各向异性。

3. 测试期分布感知融合(Test-Time Distribution-Aware Fusion, TTDF):基于马氏距离的动态权重分配

针对 DitHub 静态均匀平均 \(\frac{1}{|\mathcal{P}|}\sum_{c} \mathbf{A}_c\) 导致的剧烈跨任务参数冲突,TTDF 提出以图像内容为导向的动态加权方案。在任务不可知推理时,面对测试图像 \(\mathbf{x}\),模型先提取全局图像池化特征 \(f(\mathbf{x})\),并计算其与每个候选类别中心 \(\boldsymbol{\mu}_c\) 之间的马氏距离:

\[d_c(\mathbf{x}) = \left( f(\mathbf{x}) - \boldsymbol{\mu}_c \right) \boldsymbol{\Sigma}^{-1} \left( f(\mathbf{x}) - \boldsymbol{\mu}_c \right)^\top\]

相比于假设特征各向同性的欧氏距离,马氏距离利用协方差矩阵校正了不同特征维度的方差差异与维度间相关性,能够有效抑制高噪声维度的扰动。通过引入带温度系数 \(\tau\) 的 Softmax 函数,将距离转化为归一化重要性权重 \(w_c(\mathbf{x}) = \frac{\exp(-d_c(\mathbf{x})/\tau)}{\sum_{j \in \mathcal{P}_{TA}} \exp(-d_j(\mathbf{x})/\tau)}\)。最终的 LoRA 权重矩阵由共享矩阵 \(\mathbf{B}\) 与加权求和后的类别特定矩阵组合而成:

\[\mathbf{W} = \mathbf{W}_0 + \mathbf{B} \left( \sum_{c \in \mathcal{P}_{TA}} w_c(\mathbf{x}) \mathbf{A}_c \right)\]

这种动态路由机制保证了与当前图像视觉内容最契合的 LoRA 专家占据绝对主导权重,大幅抑制无关类别的负迁移与参数干扰。

损失函数 / 训练策略

骨干网络(Grounding DINO Swin-Tiny)参数在增量训练期间保持冻结,仅更新当前类别对应的 LoRA 矩阵 \(\mathbf{A}_c\) 与跨任务共享矩阵 \(\mathbf{B}\)。训练目标沿用 Grounding DINO 标准的目标检测损失,包含二值交叉熵分类损失(Focal Loss)、L1 边界框回归损失与 GIOU 边界框损失。由于 SPA 注入的扰动词元被显式排除在真实标签匹配之外,分类损失仅监督图像中真实出现的当前任务类别。

实验关键数据

主实验

在 ODinW-13 基准(包含 Pascal VOC、Thermal、Aerial Maritime Drones、Aquarium 等 13 个异构专业领域子数据集)上进行连续 13 个任务的增量评测。模型在全部 13 个任务学习完成后,在合并的全局测试集上计算平均 mAP(Avg),并评测在 MS COCO 上的零样本 mAP(Zcoco)。

表 1: ODinW-13 基准在 TA-IVLOD 设定下的性能对比(摘自原论文 Table 1)

方法 Zcoco Avg Aerial (Ae) Aquarium (Aq) Cottontail (Co) EgoHands (Eg) Mushroom (Mu) Package (Pa) PascalVOC (Pv) Pistol (Pi) Pothole (Po) Raccoon (Ra) Shellfish (Sh) Thermal (Th) Vehicles (Ve)
Grounding DINO (0-shot) 48.4 24.0 15.9 11.5 16.3 28.1 21.0 5.2 46.7 36.4 2.4 0.0 20.4 55.3 53.0
TFA 42.7 22.0 15.0 10.1 16.9 25.9 22.2 4.1 43.6 29.5 1.6 0.0 16.2 50.7 50.4
iDETR 37.4 34.0 30.1 30.7 44.1 40.6 31.6 7.0 58.9 37.0 10.8 0.2 30.3 63.5 57.4
ZiRa 45.1 35.0 28.5 31.4 46.5 34.6 35.8 4.6 59.0 37.6 15.5 0.1 32.7 65.7 62.4
DitHub 46.8 32.5 23.8 16.8 38.2 30.6 37.5 8.5 63.2 40.2 3.8 0.0 30.2 67.9 62.2
TADA (本文) 47.2 64.5 43.4 50.3 82.0 70.6 51.0 89.0 69.3 68.6 53.3 61.4 56.2 71.4 71.3

在标准 IVLOD 设定(享有任务标识先验)下,TADA 同样维持显著优势(摘自原论文 Table 2): - DitHub: Avg mAP 66.3,Zcoco 46.8 - TADA (本文): Avg mAP 67.5 (+1.2),Zcoco 47.2

消融实验

表 2: 核心模块消融与提示词增强策略对比(摘自原论文 Table 4 与 Table 5)

配置 / 策略 TTDF SPA 增强策略详情 Zcoco AvgTA (mAP)
基线 (DitHub) - - - 46.8 32.5
仅加入 TTDF - - 47.4 45.9
仅历史已学类别 仅重放已学类别 47.0 57.2
仅合成噪声字符 仅注入随机字符串 47.4 60.3
引入外部真实类 注入 COCO 类名 46.0 58.2
完整模型 (TADA) 历史已学类别 + 随机噪声字符 47.2 64.5

表 3: TTDF 距离度量方式对比(摘自原论文 Table 6)

距离度量方式 Zcoco AvgTA (mAP) 说明
欧氏距离 (Euclidean Distance) 45.9 51.3 假设特征各向同性,易受噪声维度干扰
马氏距离 (Mahalanobis Distance) 47.2 64.5 考虑协方差矩阵与特征相关性,提升显著 (+13.2)

关键发现

  • 在 TA-IVLOD 严苛设定下,缺乏任务先验会导致传统方法性能剧烈雪崩(DitHub 从标准 IVLOD 的 66.3 骤降至 32.5;Raccoon 任务直接退化为 0.0 mAP)。而 TADA 达到 64.5 mAP,降幅极小,表明其对全任务联合提示词具备极强的抗混淆能力。
  • 模块消融显示,TTDF 带来 +13.4 mAP 提升,在此基础上叠加 SPA 进一步斩获 +18.6 mAP,两者协同构成了处理长提示词干扰与异构参数融合的核心防线。
  • 噪声字符增强显著优于使用外部真实语义类别(如 COCO 类名)。使用 COCO 类名充当负干扰会导致模型将有效语义视作负样本,致使 COCO 零样本 mAP 下滑至 46.0;而合成随机乱码串既提供了变长上下文扰动,又完美守护了基座模型的开集泛化能力。

亮点与洞察

  • 设定破局直击落地瓶颈:形式化定义了无需任务标识的 TA-IVLOD 任务,揭示了以往 IVLOD 依靠 Task Oracle 掩盖跨任务注意力稀释与参数冲突的问题,推动增量检测迈向真实开放世界。
  • 合成噪声作为语义中性正则项:在文本提示词中引入无具体语义的随机乱码字符串(Synthetic Noise Tokens),这一极简巧思在不破坏任何实体概念零样本表达的前提下,大幅增强了多模态交叉注意力面对复杂文本时的抗稀释鲁棒性。
  • 免回放样本的高效协方差建模:仅靠流式更新一阶矩和二阶矩统计量,便在测试期以极低的矩阵乘法代价实现了基于马氏距离的参数动态路由,为 LoRA 专家融合提供了极佳的通用范式。

局限与展望

  • 测试期动态融合带来额外计算开销:在每张测试图像输入时均需计算马氏距离与动态矩阵加权,相比离线预先合并静态权重的方式略微增加了推理时延。
  • 图像级特征匹配的粗粒度局限:当前 TTDF 的相关性计算基于整图池化后的全局视觉特征。当单张测试图像中同时密集存在来自多个不同历史任务的目标时,全局特征可能出现语义混叠,未来探索基于区域提议(Proposal-level)或实例级的细粒度动态参数路由将是重要演进方向。

相关工作与启发

  • vs DitHub: DitHub 提出了基于共享矩阵 B 和类别专有矩阵 A 的模块化 LoRA 库,但在推理时只能依赖单任务提示词或朴素静态平均,在全类别联合提示下陷入严重参数冲突(32.5 mAP)。本文在其骨架上增加了训练期 SPA 与测试期基于马氏距离的自适应动态融合,在 TA-IVLOD 设定下提升了 +32.0 mAP。
  • vs ZiRa: ZiRa 引入重参数化与零干扰损失维持基类能力,但强依赖任务边界且难以自适应处理长提示词。TADA 无需复杂的知识蒸馏损失,仅通过文本数据增强与统计度量路由便在下游任务平均指标与基类保持上全面胜出。
  • vs 传统类别增量目标检测 (IOD): 传统 IOD(如 iDETR, GCD)通常局限于闭集词表与单数据源。TADA 针对开放词表多源跨域数据流设计,在保持 47.2 COCO 零样本泛化性能的同时,实现了跨异构下游领域的连续自适应。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次正视并形式化 TA-IVLOD 设定,提出的随机噪声增强与马氏距离动态路由简洁有效。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 ODinW-13 13 个异构任务、全量与 Few-shot 设定、标准 IVLOD 与常规 IOD 泛化实验及详尽的消融分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述清晰透彻,图表可视化(注意力热图、LoRA 相似度矩阵)直观揭示了问题根源。
  • 价值: ⭐⭐⭐⭐☆ 为开放词表目标检测模型的持续学习与无缝部署提供了极具实用价值的工程范式。