DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images¶
会议: ECCV2026
论文: ECCV 原文
领域: 目标检测
关键词: 无人机图像目标检测 / 参数高效微调 / 视觉语言模型 / 前景感知适配器 / 背景抑制
一句话总结¶
DroneFINE 在冻结的 GroundingDINO 上只用 1.54M 可训练参数(全量微调 27.5M 的 5.6%),用「前景感知的动态多路卷积适配器 HyperAdapter + 基于背景词表的门控查询重排 SemanticGate」两个域感知模块,把无人机图像检测拉到 VisDrone 38.4 mAP / 61.2 mAP50、UAVDT 26.5 mAP / 43.6 mAP50,与全量微调持平甚至在 UAVDT 上反超,并保持了对 COCO 的泛化。
研究背景与动机¶
无人机在智能巡检、应急救援、物流配送等场景中越来越依赖目标检测这一基础感知能力,而 GLIP、GroundingDINO、YOLO-World 这类视觉语言模型(VLM)检测器凭借图文对齐与开放词表能力,本应天然适合「开放、动态环境」中的通用检测。问题出在预训练数据与航拍图像之间的巨大域差:VLM 的视觉先验来自 COCO、Objects365、V3Det、GRIT 这类地面视角、前景主导的图像,而无人机图像是鸟瞰视角、背景主导、目标小且密集的。直接零样本迁移时差距触目惊心——"people"、"awning-tricycle" 这类类别在 VisDrone 上的 mAP50 只有约 2%–20%,整体的零样本成绩只有 16.5 mAP。走另一条路、做全量微调或重训练(SPAR、LAE-DINO 等)虽然能提精度,却要更新全部参数、依赖大规模航拍数据与算力,在域内小数据上还容易过拟合、甚至遗忘 VLM 宝贵的预训练知识,等于把「用 VLM」的初衷丢掉了。
于是很自然的想法是直接套用通用 PEFT 方法(LoRA、Adapter、VPT、Mona、CoOp 等)。作者的经验性分析指出这类方法在无人机域失效有两个具体原因。其一是秩不够:对 FFN 权重做 SVD 分解可以看到,要在航拍数据上维持较低的近似误差,需要非常高的秩(尤其在网络深层),把适配限制在低秩线性空间根本无法重建航拍目标的复杂空间细节。其二是结构是静态的:即便像 Mona 那样把卷积引入适配器、补上空间归纳偏置,全局共享的一组分核仍然是「一套参数、全图同一套特征提取范式」,无法应对航拍数据内部剧烈的尺度、密度与外观波动;缺少动态路由就意味着表征容量被大量冗余背景消耗。更麻烦的是,航拍图像背景主导,模型有限的注意力资源会被背景吸走,而前景小目标在鸟瞰视角下已经退化成稀疏像素簇、几乎与噪声难以区分,两者叠加使 VLM 主要在「小而密」的目标上失败。
本文的切入角度是:不再去堆域专用的检测模块,而是在冻结 VLM 主干的前提下做两件互补的事——把适配器里的卷积核变成由前景内容动态生成的高秩表达,同时把 VLM 的文本分支从「只描述目标」扩展为「显式描述背景」,用背景语义反向压制背景响应。核心 idea:在 GroundingDINO 上引入两个域感知 PEFT 模块——HyperAdapter 用可学习前景查询聚合全局前景语义、经一个跨层共享的超网络生成多路深度可分离卷积核;SemanticGate 用 20 个背景词的文本嵌入对语言引导的查询选择做门控重排,并用 token 级对比损失保证前景/背景文本特征可分离——只训练 1.54M 参数即达到全量微调的性能。
方法详解¶
整体框架¶
方法建立在预训练的 GroundingDINO 之上,视觉主干与文本主干全程冻结,只有插入的适配模块、解码器与检测头可训练。整体可以看成两路协同:视觉支路在每个 Transformer 块的注意力与 MLP 之后串接 HyperAdapter,先用 M 个可学习前景查询聚合出该样本的全局前景语义,再由共享超网络把它映射成动态卷积核,对低秩投影后的特征做多路深度可分离卷积,最后上投影回原维度并残差写回主干,从而在几乎不加参数的前提下提升表征的高秩性与空间选择性;文本—查询支路先用一套离线流水线构建 20 个背景词并预计算其文本嵌入,运行时把背景嵌入与图像特征算相似度得到每个候选的背景分,与原始前景分一起送入 SemanticGate 的三个门(保护门/抑制门/候选调整),对 GroundingDINO 语言引导查询选择产生的 top-K 查询重新排序,使被选中的查询更多落在真实前景上,最后由可训练的解码器与检测头输出检测框。两路的共同目标是同一件事:让有限的注意力与表征容量从背景转向前景。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 + 文本提示<br/>视觉与文本主干冻结"] --> B["前景感知的查询聚合"]
B --> C["共享超网络的多路卷积生成"]
C --> D["适配后的视觉特征<br/>残差写回主干"]
E["背景词表构建<br/>采样→LLM→DINO-X→人工复核"] --> F["SemanticGate 门控查询重排"]
D --> F
F --> G["可训练解码器与检测头"]
G --> H["检测框输出"]
关键设计¶
1. 前景感知的查询聚合:让「用什么核」由图里的前景决定
静态适配器的症结在于它对全图一视同仁:同一组卷积核既要在稀疏的行人像素簇上工作,又要在成片的路面背景上工作,容量被摊薄。HyperAdapter 的解法是维护 \(M\) 个可学习的前景查询,用它们与展平后的特征图做交叉注意力:查询本身在整个训练集上优化,因此编码了数据集级的跨图先验(「无人机视角下的前景大致长什么样」),而它与单张特征图的注意力分布又刻画了这张图内的前景位置,正好对应「跨样本共性 + 单样本个性」两件事。注意力权重对空间维归一化后,按权重对特征做加权求和、再把 \(M\) 个查询的结果取平均,就得到该样本的全局前景特征:
值得注意的是这里用的是隐式聚合而非显式定位:论文把 ESOD 的 ObjSeeker(靠密度图预测头找前景)接进 Adapter 做对照,结果 Adapter + ObjSeeker 只小幅优于 baseline(37.3/60.0),仍明显弱于 HyperAdapter(38.1/61.1);把 HyperAdapter 的注意力分数换成密度图预测分数也带不来任何提升。这说明「用什么特征去生成核」这件事,交叉注意力已经足够学到,额外挂一个辅助任务头反而要为每层适配器付出可观的算力,破坏了 PEFT 的省算力初衷。
2. 共享超网络的多路卷积生成:用极少的生成参数换高秩表达能力
动态生成卷积核的老问题是训练不稳、参数容易膨胀。HyperAdapter 的两条应对措施都很具体:一是所有适配器层共享同一个超网络 \(H\),而不是每层配一个生成器,这既省参数,又让来自不同深度的梯度汇聚到同一个生成器上,训练更稳;二是把生成目标设计成多路并行的 1×1、3×3、5×5 深度可分离卷积分支,多分支一方面覆盖航拍图里跨度极大的目标尺度,另一方面给生成器提供更丰富的梯度反馈。为了把生成参数量压到最低,还额外压缩了 \(H\) 的隐层维度、使用深度可分离卷积、并采用分组共享参数。完整的数据流是:输入特征先按 Mona 的方式做尺度缩放得到 \(\tilde{x}\),经 \(W_{down}\) 投影到低秩空间并 reshape,用动态核做卷积,GELU 激活后由 \(W_{up}\) 投回原维度、残差加回输入:
它之所以比「把秩调大」更划算,在消融里体现得很清楚:把秩从 64 提到 96 反而从 38.4/61.2 掉到 37.9/60.9,把 LoRA 的秩放大到 128(2.26M 参数)仍然停在 37.1/59.6,Mona 的 r=128(2.97M 参数)也只有 37.9/60.6——参数量接近甚至翻倍于 HyperAdapter 的 1.54M(38.1/61.1),精度却更低。瓶颈不在参数多少,而在「核是不是随数据变」。
3. 背景词表构建:把「要忽略什么」变成可接地、可复用的文本先验
检测协议通常只关心目标类别,这等于白白浪费了 VLM 的开放词表能力:既然模型认识「路」「楼」「植被」,就可以反过来用它描述背景。但直接拿一批词去算相似度是没有意义的——论文的随机词表对照显示,把随机词从 5 个加到 20 个并没有带来一致增益。因此背景词表本身需要被认真构造,作者用一条四阶段流水线完成:先采样代表性航拍图分析背景分布,确定街道、自然地物、大气条件三类主导背景;再提示 GPT-4 生成一批候选关键词;由于并非所有文本概念从鸟瞰视角都可见,用 DINO-X 把候选词在真实航拍图上做接地,筛掉检测不出来的;最后人工复核,剔除检测结果不稳定或指代歧义的词,最终得到 20 个词(如 "road"、"building")。词表确定后其文本嵌入被预先计算好,运行时不再产生额外开销——这也解释了为什么加入 SemanticGate 后总可训练参数几乎没有变化。
4. SemanticGate 门控查询重排:用背景分数、而不是抬高前景分数来选查询
GroundingDINO 的语言引导查询选择本质上类似锚框生成,它决定了模型把注意力放在图像的哪些位置。航拍图里存在一种不对称的图文对齐:前景特征因域差难以与文本提示对齐,而主导性的背景元素反而高度可检测、响应很强,于是原始的前景相似度在背景区域缺乏分辨力。SemanticGate 的做法是不再被动忽略背景,而是主动识别并压制它:计算图像特征与背景词嵌入的最大相似度 \(s_{bg}\),与原始前景最大相似度 \(s_o\) 一起送入三个协同的门,用它们共同决定候选分数怎么调——
其中保护门 PG 看前景置信决定原始分数的保留比例(前景分高的候选 \(g_{pg}\) 趋近 1,把潜在目标「保下来」),抑制门 IG 在「背景分高、前景分低」这种背景主导的候选上趋近 1、开启压制,候选调整模块 CA 给出被 tanh 压界、再由超参 \(\alpha\) 缩放的调整幅度;调整后的分数 \(S_{adj}\) 以前景分数为基础、由 \(g_{ig}\) 与 \(a_{adj}\) 修正(⚠️ 三项在原文公式 (11) 中的具体组合方式,缓存文本损坏,以原文为准),并用它对 top-K 查询重新排序。门控成立的前提是 \(s_{bg}\) 与 \(s_o\) 本身可分,所以论文在用于匹配的文本嵌入上加了一个基于 InfoNCE 的 token 级对比损失,把 "road" 与 "car" 这类不同语义的 token 在嵌入空间里推开。
这套机制的效果被量化得很实在:VisDrone 上,top-20 查询对 GT 框的 IoU 覆盖率在 19.3% 的图像上提升、6.0% 上下降,[email protected] 在 6.8% 的图像上提升、2.0% 上下降;尤其重要的是有 23.9% 的图像前景相似度反而略微下降——说明增益不是来自「把前景分数抬高」,而是用背景分数做了一次有效的重排;单门版本会掉 0.7 mAP50,支持多门协同的必要性。
损失函数 / 训练策略¶
训练目标由两部分组成:其一是 GroundingDINO 原有的检测损失,其二是新增的 token 级对比损失 \(\mathcal{L}_{con}\)——它把所有用于图文匹配的文本 token(前景提示词与背景词)拼在一起做 token 级 InfoNCE,把不同语义的 token 推开,保证上面那套背景压制建立在可分的高质量特征之上。实现上基于 MMDetection 的 GroundingDINO,所有微调策略统一使用 dim = 64 的低秩空间以保证公平比较;文本主干与视觉主干冻结,只训练解码器、检测头以及插入的适配模块,DroneFINE-T 相对 baseline 的可训练增量为 1.54M(全量微调为 27.5M)。原文正文未给出学习率、训练轮数等优化细节(可能在补充材料),此处不臆测。
实验关键数据¶
主实验¶
在 VisDrone 与 UAVDT 上,把 DroneFINE-T 与各类 PEFT 方法在同等设置下对比(下表节选自原文 Tab. 1;"可训练参数"为相对 baseline 的增量):
| 方法 | 可训练参数 | VisDrone mAP | VisDrone mAP50 | UAVDT mAP | UAVDT mAP50 |
|---|---|---|---|---|---|
| Zero-shot | – | 16.5 | 26.9 | 9.5 | 18.5 |
| Baseline(仅解码器+检测头) | 0 | 37.1 | 59.6 | 24.7 | 40.9 |
| Full Fine-tuning | 27.5M | 38.4 | 61.3 | 22.4 | 38.6 |
| Adapter | 1.14M | 37.4 | 60.1 | 22.5 | 39.3 |
| LoRA | 1.13M | 36.7 | 59.3 | 25.0 | 40.8 |
| NormTuning | 0.025M | 37.1 | 59.6 | 22.7 | 40.1 |
| Mona | 1.4M | 37.9 | 60.5 | 22.2 | 37.6 |
| VPT | 0.08M | 37.1 | 59.6 | 22.3 | 37.8 |
| CoOp | 0.012M | 37.3 | 60.0 | 24.9 | 41.4 |
| Shine | 0.02M | 37.0 | 60.1 | 24.3 | 42.4 |
| DroneFINE-T (Ours) | 1.54M | 38.4 | 61.2 | 26.5 | 43.6 |
与 UAV 检测器 / 其他 VLM 检测器的横向对比(节选自原文 Tab. 2;其他 VLM 预训练于 LAE-1M,本文没有):
| 类别 | 方法 | 主干 | VisDrone mAP / mAP50 | UAVDT mAP / mAP50 |
|---|---|---|---|---|
| 传统 UAV 模型 | ClusDet (ICCV'19) | ResNet-50 | 26.7 / 50.6 | 13.7 / 26.5 |
| 传统 UAV 模型 | UFPMP-Det (AAAI'22) | ResNet-50 | 36.6 / 62.4 | 24.6 / 38.7 |
| 传统 UAV 模型 | QueryDet (CVPR'22) | ResNet-50 | 28.3 / 48.1 | – |
| 传统 UAV 模型 | CEASC (CVPR'23) | ResNet-50 | 28.7 / 50.7 | 17.1 / 30.9 |
| 近期 SOTA | RemDet-X / RemDet-L (AAAI'25) | YOLOv8X | 40.0 / 61.9 | 20.6 / 34.5 |
| 近期 SOTA | ESOD (TIP'24) | YOLOv5 | 37.9 / 62.3 | 23.6 / 47.6 |
| 近期 SOTA | Dome-DETR (ACM MM'25) | HGNetv2L | 39.0 / 61.1 | – |
| VLM | YOLO-World (CVPR'24) | YOLOv8L | – / 55.3 | – / 35.8 |
| VLM | RT-OVAD (arXiv'25) | ResNet-50 | – / 64.6 | – / 40.5 |
| VLM | LAE-DINO (AAAI'25) | Swin-T | – / 56.4 | – / 36.5 |
| 本文 | DroneFINE-T | Swin-T | 38.4 / 61.2 | 26.5 / 43.6 |
| 本文 | DroneFINE-B | Swin-B | 38.8 / 61.9 | – |
| 本文 | DroneFINE-L | Swin-L | 42.3 / 65.8 | – |
消融实验¶
| 配置 | VisDrone mAP / mAP50 | UAVDT mAP / mAP50 | 说明 |
|---|---|---|---|
| Baseline | 37.1 / 59.6 | 24.7 / 40.9 | 只调解码器与检测头 |
| HyperAdapter(完整) | 38.1 / 61.1 | 26.1 / 41.9 | 单独加入,mAP50 较 baseline +1.5 / +1.0 |
| HyperAdapter w/o 前景感知 | 37.8 / 60.2 | 24.9 / 41.0 | 去掉前景聚合,mAP50 掉 0.9(两个数据集一致) |
| SemanticGate(完整) | 37.9 / 60.8 | 26.0 / 42.0 | 单独加入,mAP50 较 baseline +1.2 / +1.1 |
| SemanticGate w/o 对比损失 | 37.5 / 60.4 | 25.2 / 42.1 | VisDrone 上 mAP 与 mAP50 双降;UAVDT 上 mAP50 反升 0.1 |
| Mona + CoOp | 37.5 / 60.3 | 24.5 / 41.7 | 视觉侧 + 文本侧的简单叠加,明显不如两模块协同 |
| DroneFINE-T(完整模型) | 38.4 / 61.2 | 26.5 / 43.6 | 两模块叠加,较 baseline +1.3 / +2.7 mAP |
关键发现¶
- 背景语义本身在起作用,而不是词表规模:完整 20 词达到 37.9/60.8,比最好的单类词表(自然地物,8 词,37.8/60.3)高 0.1/0.5,比同规模的随机 20 词(36.9/59.4)高 1.0/1.4;而随机词从 5 个加到 20 个并没有一致增益。单类词表里大气条件最差(37.2/59.6),说明三类背景的互补性才是增益来源。
- 秩不是瓶颈,动态性才是:秩 64 最优(38.4/61.2),降到 32(37.3/60.0)或升到 96(37.9/60.9)都变差;把 LoRA 提到 r=128(2.26M)、Mona 提到 r=128(2.97M)仍分别只有 37.1/59.6 与 37.9/60.6,都低于仅 1.54M 的 HyperAdapter(38.1/61.1)。这直接支撑了作者「低秩结构限制表达」的诊断。
- 域内过拟合是 PEFT 的真实风险,本文两边都稳:UAVDT 上全量微调 22.4/38.6 反而低于 baseline 的 24.7/40.9(视频帧高度相似导致过拟合),文本侧 PEFT 因参数少、正则强表现更好(CoOp 24.9/41.4、Shine 24.3/42.4);本文在 VisDrone 上与全量微调持平(38.4 vs 38.4),在 UAVDT 上以 26.5 反超全量微调 4.1 mAP。
- 强泛化与抗遗忘:在 COCO 上本文达到 44.9 mAP,高于全量微调的 42.5 与 Mona 的 41.9,说明域内适配没有牺牲预训练知识;推理代价很小,单张 2080 Ti 上从原模型的 3.22 FPS 降到 2.79 FPS,仅慢 0.43 FPS。
- 定性结果:baseline 会把 dumpster 误判为 car(航拍外观与预训练「car」概念的错误关联),本文能检出远处的 truck 与稀有类 bicycle,注意力图也显示前景感知模块确实聚焦在车辆、行人等前景上。
- SOTA 对比的边界:DroneFINE-L(Swin-L)42.3 mAP 超过此前 UAV 检测器最高 40.0 mAP(RemDet-X)2.3 个点,mAP50 比 UFPMP-Det 的 62.4 高 3.4 个点;不过表中 RT-OVAD 的 mAP50 已达 64.6,与 65.8 只差 1.2,且它用了 LAE-1M 大规模航拍预训练,两者的数据条件并不对等。UAVDT 上本文 26.5 mAP 超 ESOD 2.9,mAP50 略低,作者解释为 ESOD 会重裁前景区域、更偏前景检出而非高 IoU 下的精确定位。
亮点与洞察¶
- 把背景当成可利用的监督信号,而不是噪声:多数域适配工作把背景视为要滤除的干扰,本文反过来用 20 个可接地的背景词显式描述它、再用门控重排注意力。这个视角的好处是省参数(词嵌入预计算、几乎零可训练增量)且可复用——任何背景分布稳定的域都可以照此造一张词表。
- 增益来源被验证得很干净:23.9% 的图像上前景相似度反而下降,却仍有 19.3% 的图像 GT 覆盖率提升,这一对统计量排除了「只是把前景分抬高」的平庸解释,证明门控做的是重排,是很扎实的证据式分析。
- 超网络的省钱组合拳:跨层共享一个生成器 + 隐层压缩 + 深度可分离 + 分组共享 + 多路分支补梯度,把「每层一个生成器」的常见做法换成全局一个,同时用多分支保住尺度覆盖与梯度反馈,这套组合可直接迁移到任何想在低秩适配里补空间归纳偏置的场合。
- 先诊断后设计:用 SVD 秩-能量曲线说明低秩不够、用特征相似度曲线说明 LoRA 与全量微调的表示差距,再据此设计模块——这种「先量出瓶颈再动手」的写法本身值得借鉴。
- 隐式前景聚合反而更强:不用密度图预测头、不加辅助损失,仅靠前景查询与特征图的交叉注意力就学到了前景提示,对照实验里显式密度图方案(ObjSeeker)表现更差,说明对「聚合全局前景语义」这类任务,注意力已经够用。
局限与展望¶
- 背景词表的构建重人工且不可自动化:从 GPT-4 生成候选词、DINO-X 接地验证到人工复核,整个流程依赖人工判断,换到夜航、红外、高楼密集城区等新域需要重做,论文没有给出自动构造或跨域迁移词表的方案。
- 词表规模与覆盖面未充分探索:最终只保留 20 个词、覆盖三类背景;论文证明增加随机词无用,但没有回答「覆盖更多背景类型(如车辆以外的移动物体、阴影、水面反光)是否继续提升」。
- 门控的逐项贡献不清晰:只做了单门 vs 多门的对比(单门掉 0.7 mAP50),没有分别去掉 PG / IG / CA 的消融;\(S_{adj}\) 的具体组合形式与 \(\alpha\) 的取值影响也未展开(⚠️ 原文该处公式在缓存中损坏,需回原文核对)。
- 底座与数据集单一:全部实验都在 GroundingDINO + VisDrone/UAVDT 上,未验证在 YOLO-World 等其他 VLM 检测器或其他航拍数据集上的可迁移性;补充材料中的对比细节也无法从正文判断。
- 参数量口径需注意:表中的 1.54M 是相对 baseline 的增量,而 baseline 本身已经训练了解码器与检测头;「5.6% 全量微调参数」是与 27.5M 的 Full FT 相比,两个口径的覆盖范围不同,引用时不宜混用。
- 实时性仍受限:2.79 FPS(单张 2080 Ti)距离无人机机载部署尚远,论文没有讨论量化、蒸馏等部署侧优化。
相关工作与启发¶
- vs LoRA / Adapter:它们更新的是固定低秩、固定结构的参数增量,缺乏样本自适应能力;在 VisDrone 这类空间复杂、小目标密集的数据上 LoRA 甚至低于 baseline(36.7 vs 37.1),在 UAVDT 上也未能建立优势。本文保持低秩投影的省参数优点,但把「核」交给数据生成。
- vs Mona:Mona 同样引入卷积补空间归纳偏置,但核是静态且全图共享的;本文把核变成数据依赖,并在放大秩的对照中证明 Mona 即使把参数量提到 2.97M 仍不敌 1.54M 的 HyperAdapter,差距来自动态路由而非容量。
- vs SPAR / LAE-DINO:它们走全量重训练路线,需要大规模航拍数据与算力,在域内小数据上有灾难性遗忘风险(本文全量微调在 UAVDT 上即掉到 22.4 mAP,低于 baseline);本文以 1.54M 可训练参数在 VisDrone 上追平全量微调,在 COCO 上还高出 2.4 mAP。
- vs ObjSeeker (ESOD):都以「找前景」为目标,ESOD 用密度图预测头显式定位,本文用查询注意力隐式聚合,不需要为每层适配器挂辅助任务头,兼顾了精度与算力。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把「前景驱动的动态核生成」与「背景词表门控」组合进 PEFT 是新的,但两个部件分别可在 hypernetwork adapter 与提示学习中追溯到原型。
- 实验充分度: ⭐⭐⭐⭐ 覆盖两个数据集、五类消融(模块、秩、词表、查询统计、抗遗忘与速度),但缺逐门消融与跨底座验证。
- 写作质量: ⭐⭐⭐⭐ 动机有 SVD 秩分析、特征相似度与查询统计支撑,结构清楚;缺点是门控公式在正文中表达不够干净,部分细节需回原文核对。
- 价值: ⭐⭐⭐⭐ 5.6% 参数达到全量微调水平且更抗遗忘,对想把 VLM 落到无人机检测的工程实践有直接参考价值。