跳转至

DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images

会议: ECCV2026
论文: ECCV 原文
领域: 目标检测
关键词: 无人机图像目标检测 / 参数高效微调 / 视觉语言模型 / 前景感知适配器 / 背景抑制

一句话总结

DroneFINE 在冻结的 GroundingDINO 上只用 1.54M 可训练参数(全量微调 27.5M 的 5.6%),用「前景感知的动态多路卷积适配器 HyperAdapter + 基于背景词表的门控查询重排 SemanticGate」两个域感知模块,把无人机图像检测拉到 VisDrone 38.4 mAP / 61.2 mAP50、UAVDT 26.5 mAP / 43.6 mAP50,与全量微调持平甚至在 UAVDT 上反超,并保持了对 COCO 的泛化。

研究背景与动机

无人机在智能巡检、应急救援、物流配送等场景中越来越依赖目标检测这一基础感知能力,而 GLIP、GroundingDINO、YOLO-World 这类视觉语言模型(VLM)检测器凭借图文对齐与开放词表能力,本应天然适合「开放、动态环境」中的通用检测。问题出在预训练数据与航拍图像之间的巨大域差:VLM 的视觉先验来自 COCO、Objects365、V3Det、GRIT 这类地面视角、前景主导的图像,而无人机图像是鸟瞰视角、背景主导、目标小且密集的。直接零样本迁移时差距触目惊心——"people"、"awning-tricycle" 这类类别在 VisDrone 上的 mAP50 只有约 2%–20%,整体的零样本成绩只有 16.5 mAP。走另一条路、做全量微调或重训练(SPAR、LAE-DINO 等)虽然能提精度,却要更新全部参数、依赖大规模航拍数据与算力,在域内小数据上还容易过拟合、甚至遗忘 VLM 宝贵的预训练知识,等于把「用 VLM」的初衷丢掉了。

于是很自然的想法是直接套用通用 PEFT 方法(LoRA、Adapter、VPT、Mona、CoOp 等)。作者的经验性分析指出这类方法在无人机域失效有两个具体原因。其一是秩不够:对 FFN 权重做 SVD 分解可以看到,要在航拍数据上维持较低的近似误差,需要非常高的秩(尤其在网络深层),把适配限制在低秩线性空间根本无法重建航拍目标的复杂空间细节。其二是结构是静态的:即便像 Mona 那样把卷积引入适配器、补上空间归纳偏置,全局共享的一组分核仍然是「一套参数、全图同一套特征提取范式」,无法应对航拍数据内部剧烈的尺度、密度与外观波动;缺少动态路由就意味着表征容量被大量冗余背景消耗。更麻烦的是,航拍图像背景主导,模型有限的注意力资源会被背景吸走,而前景小目标在鸟瞰视角下已经退化成稀疏像素簇、几乎与噪声难以区分,两者叠加使 VLM 主要在「小而密」的目标上失败。

本文的切入角度是:不再去堆域专用的检测模块,而是在冻结 VLM 主干的前提下做两件互补的事——把适配器里的卷积核变成由前景内容动态生成的高秩表达,同时把 VLM 的文本分支从「只描述目标」扩展为「显式描述背景」,用背景语义反向压制背景响应。核心 idea:在 GroundingDINO 上引入两个域感知 PEFT 模块——HyperAdapter 用可学习前景查询聚合全局前景语义、经一个跨层共享的超网络生成多路深度可分离卷积核;SemanticGate 用 20 个背景词的文本嵌入对语言引导的查询选择做门控重排,并用 token 级对比损失保证前景/背景文本特征可分离——只训练 1.54M 参数即达到全量微调的性能。

方法详解

整体框架

方法建立在预训练的 GroundingDINO 之上,视觉主干与文本主干全程冻结,只有插入的适配模块、解码器与检测头可训练。整体可以看成两路协同:视觉支路在每个 Transformer 块的注意力与 MLP 之后串接 HyperAdapter,先用 M 个可学习前景查询聚合出该样本的全局前景语义,再由共享超网络把它映射成动态卷积核,对低秩投影后的特征做多路深度可分离卷积,最后上投影回原维度并残差写回主干,从而在几乎不加参数的前提下提升表征的高秩性与空间选择性;文本—查询支路先用一套离线流水线构建 20 个背景词并预计算其文本嵌入,运行时把背景嵌入与图像特征算相似度得到每个候选的背景分,与原始前景分一起送入 SemanticGate 的三个门(保护门/抑制门/候选调整),对 GroundingDINO 语言引导查询选择产生的 top-K 查询重新排序,使被选中的查询更多落在真实前景上,最后由可训练的解码器与检测头输出检测框。两路的共同目标是同一件事:让有限的注意力与表征容量从背景转向前景。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 + 文本提示<br/>视觉与文本主干冻结"] --> B["前景感知的查询聚合"]
    B --> C["共享超网络的多路卷积生成"]
    C --> D["适配后的视觉特征<br/>残差写回主干"]
    E["背景词表构建<br/>采样→LLM→DINO-X→人工复核"] --> F["SemanticGate 门控查询重排"]
    D --> F
    F --> G["可训练解码器与检测头"]
    G --> H["检测框输出"]

关键设计

1. 前景感知的查询聚合:让「用什么核」由图里的前景决定

静态适配器的症结在于它对全图一视同仁:同一组卷积核既要在稀疏的行人像素簇上工作,又要在成片的路面背景上工作,容量被摊薄。HyperAdapter 的解法是维护 \(M\) 个可学习的前景查询,用它们与展平后的特征图做交叉注意力:查询本身在整个训练集上优化,因此编码了数据集级的跨图先验(「无人机视角下的前景大致长什么样」),而它与单张特征图的注意力分布又刻画了这张图内的前景位置,正好对应「跨样本共性 + 单样本个性」两件事。注意力权重对空间维归一化后,按权重对特征做加权求和、再把 \(M\) 个查询的结果取平均,就得到该样本的全局前景特征:

\[A=\operatorname{softmax}\!\left(q\,{x^{\mathrm{flat}}}^{\top}\right)\in\mathbb{R}^{M\times HW},\qquad z=\frac{1}{M}\sum_{j=1}^{M}\sum_{k=1}^{HW}A_{j,k}\,x^{\mathrm{flat}}_{k}\]

值得注意的是这里用的是隐式聚合而非显式定位:论文把 ESOD 的 ObjSeeker(靠密度图预测头找前景)接进 Adapter 做对照,结果 Adapter + ObjSeeker 只小幅优于 baseline(37.3/60.0),仍明显弱于 HyperAdapter(38.1/61.1);把 HyperAdapter 的注意力分数换成密度图预测分数也带不来任何提升。这说明「用什么特征去生成核」这件事,交叉注意力已经足够学到,额外挂一个辅助任务头反而要为每层适配器付出可观的算力,破坏了 PEFT 的省算力初衷。

2. 共享超网络的多路卷积生成:用极少的生成参数换高秩表达能力

动态生成卷积核的老问题是训练不稳、参数容易膨胀。HyperAdapter 的两条应对措施都很具体:一是所有适配器层共享同一个超网络 \(H\),而不是每层配一个生成器,这既省参数,又让来自不同深度的梯度汇聚到同一个生成器上,训练更稳;二是把生成目标设计成多路并行的 1×1、3×3、5×5 深度可分离卷积分支,多分支一方面覆盖航拍图里跨度极大的目标尺度,另一方面给生成器提供更丰富的梯度反馈。为了把生成参数量压到最低,还额外压缩了 \(H\) 的隐层维度、使用深度可分离卷积、并采用分组共享参数。完整的数据流是:输入特征先按 Mona 的方式做尺度缩放得到 \(\tilde{x}\),经 \(W_{down}\) 投影到低秩空间并 reshape,用动态核做卷积,GELU 激活后由 \(W_{up}\) 投回原维度、残差加回输入:

\[x_{out}=x+W_{up}\Big(\mathrm{GELU}\big(\mathrm{DynConv}(\,W_{down}\tilde{x};\,H(z)\,)\big)\Big)\]

它之所以比「把秩调大」更划算,在消融里体现得很清楚:把秩从 64 提到 96 反而从 38.4/61.2 掉到 37.9/60.9,把 LoRA 的秩放大到 128(2.26M 参数)仍然停在 37.1/59.6,Mona 的 r=128(2.97M 参数)也只有 37.9/60.6——参数量接近甚至翻倍于 HyperAdapter 的 1.54M(38.1/61.1),精度却更低。瓶颈不在参数多少,而在「核是不是随数据变」。

3. 背景词表构建:把「要忽略什么」变成可接地、可复用的文本先验

检测协议通常只关心目标类别,这等于白白浪费了 VLM 的开放词表能力:既然模型认识「路」「楼」「植被」,就可以反过来用它描述背景。但直接拿一批词去算相似度是没有意义的——论文的随机词表对照显示,把随机词从 5 个加到 20 个并没有带来一致增益。因此背景词表本身需要被认真构造,作者用一条四阶段流水线完成:先采样代表性航拍图分析背景分布,确定街道、自然地物、大气条件三类主导背景;再提示 GPT-4 生成一批候选关键词;由于并非所有文本概念从鸟瞰视角都可见,用 DINO-X 把候选词在真实航拍图上做接地,筛掉检测不出来的;最后人工复核,剔除检测结果不稳定或指代歧义的词,最终得到 20 个词(如 "road"、"building")。词表确定后其文本嵌入被预先计算好,运行时不再产生额外开销——这也解释了为什么加入 SemanticGate 后总可训练参数几乎没有变化。

4. SemanticGate 门控查询重排:用背景分数、而不是抬高前景分数来选查询

GroundingDINO 的语言引导查询选择本质上类似锚框生成,它决定了模型把注意力放在图像的哪些位置。航拍图里存在一种不对称的图文对齐:前景特征因域差难以与文本提示对齐,而主导性的背景元素反而高度可检测、响应很强,于是原始的前景相似度在背景区域缺乏分辨力。SemanticGate 的做法是不再被动忽略背景,而是主动识别并压制它:计算图像特征与背景词嵌入的最大相似度 \(s_{bg}\),与原始前景最大相似度 \(s_o\) 一起送入三个协同的门,用它们共同决定候选分数怎么调——

\[ \begin{aligned} g_{pg}&=\sigma\!\left(w_{pg}^{bg}s_{bg}+w_{pg}^{o}s_o+b_{pg}\right),\qquad g_{ig}=\sigma\!\left(w_{ig}^{bg}s_{bg}+w_{ig}^{o}s_o+b_{ig}\right)\\ a_{adj}&=\alpha\cdot\tanh\!\left(w_{ca}^{bg}s_{bg}+w_{ca}^{o}s_o+b_{ca}\right) \end{aligned} \]

其中保护门 PG 看前景置信决定原始分数的保留比例(前景分高的候选 \(g_{pg}\) 趋近 1,把潜在目标「保下来」),抑制门 IG 在「背景分高、前景分低」这种背景主导的候选上趋近 1、开启压制,候选调整模块 CA 给出被 tanh 压界、再由超参 \(\alpha\) 缩放的调整幅度;调整后的分数 \(S_{adj}\) 以前景分数为基础、由 \(g_{ig}\)\(a_{adj}\) 修正(⚠️ 三项在原文公式 (11) 中的具体组合方式,缓存文本损坏,以原文为准),并用它对 top-K 查询重新排序。门控成立的前提是 \(s_{bg}\)\(s_o\) 本身可分,所以论文在用于匹配的文本嵌入上加了一个基于 InfoNCE 的 token 级对比损失,把 "road" 与 "car" 这类不同语义的 token 在嵌入空间里推开。

这套机制的效果被量化得很实在:VisDrone 上,top-20 查询对 GT 框的 IoU 覆盖率在 19.3% 的图像上提升、6.0% 上下降,[email protected] 在 6.8% 的图像上提升、2.0% 上下降;尤其重要的是有 23.9% 的图像前景相似度反而略微下降——说明增益不是来自「把前景分数抬高」,而是用背景分数做了一次有效的重排;单门版本会掉 0.7 mAP50,支持多门协同的必要性。

损失函数 / 训练策略

训练目标由两部分组成:其一是 GroundingDINO 原有的检测损失,其二是新增的 token 级对比损失 \(\mathcal{L}_{con}\)——它把所有用于图文匹配的文本 token(前景提示词与背景词)拼在一起做 token 级 InfoNCE,把不同语义的 token 推开,保证上面那套背景压制建立在可分的高质量特征之上。实现上基于 MMDetection 的 GroundingDINO,所有微调策略统一使用 dim = 64 的低秩空间以保证公平比较;文本主干与视觉主干冻结,只训练解码器、检测头以及插入的适配模块,DroneFINE-T 相对 baseline 的可训练增量为 1.54M(全量微调为 27.5M)。原文正文未给出学习率、训练轮数等优化细节(可能在补充材料),此处不臆测。

实验关键数据

主实验

在 VisDrone 与 UAVDT 上,把 DroneFINE-T 与各类 PEFT 方法在同等设置下对比(下表节选自原文 Tab. 1;"可训练参数"为相对 baseline 的增量):

方法 可训练参数 VisDrone mAP VisDrone mAP50 UAVDT mAP UAVDT mAP50
Zero-shot 16.5 26.9 9.5 18.5
Baseline(仅解码器+检测头) 0 37.1 59.6 24.7 40.9
Full Fine-tuning 27.5M 38.4 61.3 22.4 38.6
Adapter 1.14M 37.4 60.1 22.5 39.3
LoRA 1.13M 36.7 59.3 25.0 40.8
NormTuning 0.025M 37.1 59.6 22.7 40.1
Mona 1.4M 37.9 60.5 22.2 37.6
VPT 0.08M 37.1 59.6 22.3 37.8
CoOp 0.012M 37.3 60.0 24.9 41.4
Shine 0.02M 37.0 60.1 24.3 42.4
DroneFINE-T (Ours) 1.54M 38.4 61.2 26.5 43.6

与 UAV 检测器 / 其他 VLM 检测器的横向对比(节选自原文 Tab. 2;其他 VLM 预训练于 LAE-1M,本文没有):

类别 方法 主干 VisDrone mAP / mAP50 UAVDT mAP / mAP50
传统 UAV 模型 ClusDet (ICCV'19) ResNet-50 26.7 / 50.6 13.7 / 26.5
传统 UAV 模型 UFPMP-Det (AAAI'22) ResNet-50 36.6 / 62.4 24.6 / 38.7
传统 UAV 模型 QueryDet (CVPR'22) ResNet-50 28.3 / 48.1
传统 UAV 模型 CEASC (CVPR'23) ResNet-50 28.7 / 50.7 17.1 / 30.9
近期 SOTA RemDet-X / RemDet-L (AAAI'25) YOLOv8X 40.0 / 61.9 20.6 / 34.5
近期 SOTA ESOD (TIP'24) YOLOv5 37.9 / 62.3 23.6 / 47.6
近期 SOTA Dome-DETR (ACM MM'25) HGNetv2L 39.0 / 61.1
VLM YOLO-World (CVPR'24) YOLOv8L – / 55.3 – / 35.8
VLM RT-OVAD (arXiv'25) ResNet-50 – / 64.6 – / 40.5
VLM LAE-DINO (AAAI'25) Swin-T – / 56.4 – / 36.5
本文 DroneFINE-T Swin-T 38.4 / 61.2 26.5 / 43.6
本文 DroneFINE-B Swin-B 38.8 / 61.9
本文 DroneFINE-L Swin-L 42.3 / 65.8

消融实验

配置 VisDrone mAP / mAP50 UAVDT mAP / mAP50 说明
Baseline 37.1 / 59.6 24.7 / 40.9 只调解码器与检测头
HyperAdapter(完整) 38.1 / 61.1 26.1 / 41.9 单独加入,mAP50 较 baseline +1.5 / +1.0
HyperAdapter w/o 前景感知 37.8 / 60.2 24.9 / 41.0 去掉前景聚合,mAP50 掉 0.9(两个数据集一致)
SemanticGate(完整) 37.9 / 60.8 26.0 / 42.0 单独加入,mAP50 较 baseline +1.2 / +1.1
SemanticGate w/o 对比损失 37.5 / 60.4 25.2 / 42.1 VisDrone 上 mAP 与 mAP50 双降;UAVDT 上 mAP50 反升 0.1
Mona + CoOp 37.5 / 60.3 24.5 / 41.7 视觉侧 + 文本侧的简单叠加,明显不如两模块协同
DroneFINE-T(完整模型) 38.4 / 61.2 26.5 / 43.6 两模块叠加,较 baseline +1.3 / +2.7 mAP

关键发现

  • 背景语义本身在起作用,而不是词表规模:完整 20 词达到 37.9/60.8,比最好的单类词表(自然地物,8 词,37.8/60.3)高 0.1/0.5,比同规模的随机 20 词(36.9/59.4)高 1.0/1.4;而随机词从 5 个加到 20 个并没有一致增益。单类词表里大气条件最差(37.2/59.6),说明三类背景的互补性才是增益来源。
  • 秩不是瓶颈,动态性才是:秩 64 最优(38.4/61.2),降到 32(37.3/60.0)或升到 96(37.9/60.9)都变差;把 LoRA 提到 r=128(2.26M)、Mona 提到 r=128(2.97M)仍分别只有 37.1/59.6 与 37.9/60.6,都低于仅 1.54M 的 HyperAdapter(38.1/61.1)。这直接支撑了作者「低秩结构限制表达」的诊断。
  • 域内过拟合是 PEFT 的真实风险,本文两边都稳:UAVDT 上全量微调 22.4/38.6 反而低于 baseline 的 24.7/40.9(视频帧高度相似导致过拟合),文本侧 PEFT 因参数少、正则强表现更好(CoOp 24.9/41.4、Shine 24.3/42.4);本文在 VisDrone 上与全量微调持平(38.4 vs 38.4),在 UAVDT 上以 26.5 反超全量微调 4.1 mAP。
  • 强泛化与抗遗忘:在 COCO 上本文达到 44.9 mAP,高于全量微调的 42.5 与 Mona 的 41.9,说明域内适配没有牺牲预训练知识;推理代价很小,单张 2080 Ti 上从原模型的 3.22 FPS 降到 2.79 FPS,仅慢 0.43 FPS。
  • 定性结果:baseline 会把 dumpster 误判为 car(航拍外观与预训练「car」概念的错误关联),本文能检出远处的 truck 与稀有类 bicycle,注意力图也显示前景感知模块确实聚焦在车辆、行人等前景上。
  • SOTA 对比的边界:DroneFINE-L(Swin-L)42.3 mAP 超过此前 UAV 检测器最高 40.0 mAP(RemDet-X)2.3 个点,mAP50 比 UFPMP-Det 的 62.4 高 3.4 个点;不过表中 RT-OVAD 的 mAP50 已达 64.6,与 65.8 只差 1.2,且它用了 LAE-1M 大规模航拍预训练,两者的数据条件并不对等。UAVDT 上本文 26.5 mAP 超 ESOD 2.9,mAP50 略低,作者解释为 ESOD 会重裁前景区域、更偏前景检出而非高 IoU 下的精确定位。

亮点与洞察

  • 把背景当成可利用的监督信号,而不是噪声:多数域适配工作把背景视为要滤除的干扰,本文反过来用 20 个可接地的背景词显式描述它、再用门控重排注意力。这个视角的好处是省参数(词嵌入预计算、几乎零可训练增量)且可复用——任何背景分布稳定的域都可以照此造一张词表。
  • 增益来源被验证得很干净:23.9% 的图像上前景相似度反而下降,却仍有 19.3% 的图像 GT 覆盖率提升,这一对统计量排除了「只是把前景分抬高」的平庸解释,证明门控做的是重排,是很扎实的证据式分析。
  • 超网络的省钱组合拳:跨层共享一个生成器 + 隐层压缩 + 深度可分离 + 分组共享 + 多路分支补梯度,把「每层一个生成器」的常见做法换成全局一个,同时用多分支保住尺度覆盖与梯度反馈,这套组合可直接迁移到任何想在低秩适配里补空间归纳偏置的场合。
  • 先诊断后设计:用 SVD 秩-能量曲线说明低秩不够、用特征相似度曲线说明 LoRA 与全量微调的表示差距,再据此设计模块——这种「先量出瓶颈再动手」的写法本身值得借鉴。
  • 隐式前景聚合反而更强:不用密度图预测头、不加辅助损失,仅靠前景查询与特征图的交叉注意力就学到了前景提示,对照实验里显式密度图方案(ObjSeeker)表现更差,说明对「聚合全局前景语义」这类任务,注意力已经够用。

局限与展望

  • 背景词表的构建重人工且不可自动化:从 GPT-4 生成候选词、DINO-X 接地验证到人工复核,整个流程依赖人工判断,换到夜航、红外、高楼密集城区等新域需要重做,论文没有给出自动构造或跨域迁移词表的方案。
  • 词表规模与覆盖面未充分探索:最终只保留 20 个词、覆盖三类背景;论文证明增加随机词无用,但没有回答「覆盖更多背景类型(如车辆以外的移动物体、阴影、水面反光)是否继续提升」。
  • 门控的逐项贡献不清晰:只做了单门 vs 多门的对比(单门掉 0.7 mAP50),没有分别去掉 PG / IG / CA 的消融;\(S_{adj}\) 的具体组合形式与 \(\alpha\) 的取值影响也未展开(⚠️ 原文该处公式在缓存中损坏,需回原文核对)。
  • 底座与数据集单一:全部实验都在 GroundingDINO + VisDrone/UAVDT 上,未验证在 YOLO-World 等其他 VLM 检测器或其他航拍数据集上的可迁移性;补充材料中的对比细节也无法从正文判断。
  • 参数量口径需注意:表中的 1.54M 是相对 baseline 的增量,而 baseline 本身已经训练了解码器与检测头;「5.6% 全量微调参数」是与 27.5M 的 Full FT 相比,两个口径的覆盖范围不同,引用时不宜混用。
  • 实时性仍受限:2.79 FPS(单张 2080 Ti)距离无人机机载部署尚远,论文没有讨论量化、蒸馏等部署侧优化。

相关工作与启发

  • vs LoRA / Adapter:它们更新的是固定低秩、固定结构的参数增量,缺乏样本自适应能力;在 VisDrone 这类空间复杂、小目标密集的数据上 LoRA 甚至低于 baseline(36.7 vs 37.1),在 UAVDT 上也未能建立优势。本文保持低秩投影的省参数优点,但把「核」交给数据生成。
  • vs Mona:Mona 同样引入卷积补空间归纳偏置,但核是静态且全图共享的;本文把核变成数据依赖,并在放大秩的对照中证明 Mona 即使把参数量提到 2.97M 仍不敌 1.54M 的 HyperAdapter,差距来自动态路由而非容量。
  • vs SPAR / LAE-DINO:它们走全量重训练路线,需要大规模航拍数据与算力,在域内小数据上有灾难性遗忘风险(本文全量微调在 UAVDT 上即掉到 22.4 mAP,低于 baseline);本文以 1.54M 可训练参数在 VisDrone 上追平全量微调,在 COCO 上还高出 2.4 mAP。
  • vs ObjSeeker (ESOD):都以「找前景」为目标,ESOD 用密度图预测头显式定位,本文用查询注意力隐式聚合,不需要为每层适配器挂辅助任务头,兼顾了精度与算力。

评分

  • 新颖性: ⭐⭐⭐⭐ 把「前景驱动的动态核生成」与「背景词表门控」组合进 PEFT 是新的,但两个部件分别可在 hypernetwork adapter 与提示学习中追溯到原型。
  • 实验充分度: ⭐⭐⭐⭐ 覆盖两个数据集、五类消融(模块、秩、词表、查询统计、抗遗忘与速度),但缺逐门消融与跨底座验证。
  • 写作质量: ⭐⭐⭐⭐ 动机有 SVD 秩分析、特征相似度与查询统计支撑,结构清楚;缺点是门控公式在正文中表达不够干净,部分细节需回原文核对。
  • 价值: ⭐⭐⭐⭐ 5.6% 参数达到全量微调水平且更抗遗忘,对想把 VLM 落到无人机检测的工程实践有直接参考价值。