Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift¶
会议: ECCV 2026
论文: ECCV 原文
领域: 目标检测
关键词: 后门检测、目标检测、NMS前分布偏移、JS散度、场景级攻击
一句话总结¶
本文提出 DistScan,首次揭示后门注入会系统性扭曲目标检测器在干净输入下的 NMS 前预测类别分布,通过度量该经验分布与训练集类别先验的 JS 散度实现无须触发器先验、无须模型权重、无须二次训练的黑盒后门检测。
研究背景与动机¶
目标检测模型在自动驾驶、智能安防监控及医学影像分析等高安全攸关场景中扮演着关键感知角色,其输出直接决定系统的下游决策。然而,通过在训练集注入少量中毒样本建立触发器与恶意行为的隐蔽关联,后门攻击能够在干净输入上保持正常检测性能,而在特定触发器呈现时引发目标漏检、误检或误分类,这给第三方模型托管与部署引入了极大的安全隐患。
现有的目标检测后门防御主要借鉴图像分类范式或依赖特定架构特性,在面对新型复杂攻击时暴露出严重瓶颈。一方面,以 ODSCAN 为代表的触发器逆向重构方法受限于巨大的搜索空间,强依赖局部单色 Patch 假设以及预设的受害者-目标类别映射;另一方面,基于模块一致性分析的 MIA 仅适用于两阶段检测器且假设后门仅侵入单一子分支。更致命的是,面对破坏性更强的“场景级攻击”(如 Detector Collapse 导致的场景过载 SPONGE 或盲化 BLINDING),全图大范围的假阳性或目标消失使得模块间差异完全抹除,现有防御全部失效。
在无法预知触发器样式、无法假设特定网络拓扑且需要防御场景级攻击的三重约束下,有效的防御信号必须内生于检测器的通用推理过程,且在干净样本上便具备充分的可观测性。本文发现,无论是一阶段还是两阶段检测器,其在 NMS 抑制前的原始预测类别分布均隐式编码了训练集的类别先验统计;而后门注入过程不可避免地破坏了该先验对齐,哪怕在无触发器的干净图像输入下也会产生显著且持久的类别分布偏移。本文的核心 idea 是:将检测器在干净验证集上的 NMS 前预测类别分布与训练集标注类别频率进行对比,通过 Jensen-Shannon (JS) 散度量化分布偏移程度,以此作为跨架构、无需触发器知识判别后门模型的强判据。
方法详解¶
整体框架¶
DistScan 整体流程包含三个核心阶段:针对一阶段与两阶段架构特性的验证集定制构建、NMS 前预测类别分布提取与置信度过滤、基于 JS 散度的分布偏移判据判定。系统仅需待检模型黑盒推理输出的 NMS 前候选预测、少量干净样本以及训练集的真实类别标注频数统计即可完成审计。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入: 待检检测器与干净样本"] --> B["架构感知的验证集构建<br/>一阶段全图采样 / 两阶段前景裁剪"]
B --> C["置信度过滤与分布提取<br/>过滤低置信噪声并累计 NMS 前预测类别频数"]
C --> D["分布归一化与基准对齐<br/>模型经验分布与训练标注频率归一化"]
D --> E["基于 JS 散度的偏移检测<br/>计算 D(f) 并与阈值判定后门"]
关键设计¶
1. 架构感知的验证集构建:对齐分类头输入分布消除混杂因素
目标检测中天然存在类别不平衡与前景-背景比例悬殊的问题,这可能在验证集采样不当时引入与后门无关的分布伪影。由于一阶段与两阶段检测器分类头的训练数据暴露机制存在本质差异,统一的数据采样会破坏特征分布的保真度。针对 YOLO 等一阶段模型,其分类头直接通过密集的预设锚框在全图尺度上进行联合优化,因此 DistScan 直接使用随机采样的完整干净图像构建验证集;而针对 Faster R-CNN 等两阶段模型,第二阶段分类头作用于 RPN 提议并经 RoI 池化后的前景特征,因此 DistScan 采用单目标前景边界框裁剪图像(Equal Size),统一缩放到中位数尺寸并控制每类实例数,以此作为分类头输入的等效代理。这种针对性设计排除了背景上下文干扰,确保观察到的分布变化真实源于分类头学习到的类别先验扭曲。
2. 置信度过滤与 NMS 前类别分布提取:剥离无效底噪并聚合类别先验
检测器在未执行 NMS 前输出海量的候选框集合 \(P_i = \{(\hat{c}_j, \hat{b}_j, \hat{s}_j)\}_{j=1}^{K_i}\)。若不加筛选地保留全部候选,两阶段模型中预分配的大量低分候选会趋近于均匀分布,彻底掩盖有效的类别偏置信号;反之,若置信度截断过于激进,又会丢失关键的目标响应。DistScan 引入轻量级置信度阈值 \(\delta\)(默认设为 0.0005),仅保留 \(\hat{s}_j \ge \delta\) 的高相关候选,并统计保留预测在各类别 \(c\) 上的频数向量:
将验证集全量图像的计数累加至向量 \(\mathbf{S}(f_\theta) = \sum_{i=1}^{|\mathcal{X}|} \mathbf{b}_i(f_\theta)\),并通过 \(L_1\) 范数归一化得到模型在干净输入下的经验预测类别分布 \(\hat{\mathbf{B}}(f_\theta) = \mathbf{S}(f_\theta) / \|\mathbf{S}(f_\theta)\|_1\)。
3. 基于 JS 散度的偏移度量与判决:无界分布距离平滑与阈值判定
为了获得稳定且不依赖模型参数的检测基线,DistScan 将原始训练数据集中各类别的真实标注实例频数 \(\mathbf{R} = [r_1, r_2, \dots, r_C]\) 归一化为参考分布 \(\hat{\mathbf{R}} = \mathbf{R} / \|\mathbf{R}\|_1\)。为避免长尾罕见类别在零概率或极小值时导致 KL 散度数值未定义或无穷大,DistScan 采用具备对称性与有界性的 Jensen-Shannon (JS) 散度量化分布偏移:
若偏移量 \(D(f_\theta) > \tau\),则判定模型 \(f_\theta\) 存在后门植入。由于良性模型在正常收敛后紧密吸附在训练数据类别分布周围,而中毒训练对分类超平面的扭曲会迫使经验分布大幅外移,两者在 JS 散度空间中具备极宽的判别裕量。
实验关键数据¶
主实验¶
实验在 PASCAL VOC 与 MS-COCO 数据集上开展,覆盖 YOLOv5(一阶段)与 Faster R-CNN(两阶段)架构,评估三种极具威胁的场景级攻击场景:SPONGE(大面积插入虚假目标)、BLINDING(全场景目标消失致盲)和 GMA(目标误分类)。模型评估池共包含 288 个检测模型(每种配置 18 个后门模型与 18 个良性模型)。
| 攻击场景 | 数据集 | 架构模型 | DistScan Acc.(%) | DistScan TPR(%) | DistScan FPR(%) | MIA Acc.(%) | ODSCAN Acc.(%) |
|---|---|---|---|---|---|---|---|
| SPONGE | VOC | YOLOv5 | 100.00 | 100.00 | 0.00 | - | 50.00 |
| SPONGE | VOC | Faster R-CNN | 97.22 | 94.44 | 0.00 | 50.00 | 50.00 |
| SPONGE | COCO | YOLOv5 | 100.00 | 100.00 | 0.00 | - | 50.00 |
| SPONGE | COCO | Faster R-CNN | 91.67 | 83.33 | 0.00 | 50.00 | 50.00 |
| BLINDING | VOC | YOLOv5 | 100.00 | 100.00 | 0.00 | - | 50.00 |
| BLINDING | VOC | Faster R-CNN | 100.00 | 100.00 | 0.00 | 88.89 | 50.00 |
| BLINDING | COCO | YOLOv5 | 97.22 | 100.00 | 5.56 | - | 50.00 |
| BLINDING | COCO | Faster R-CNN | 94.44 | 88.89 | 0.00 | 77.78 | 50.00 |
| GMA | VOC | YOLOv5 | 100.00 | 100.00 | 0.00 | - | 50.00 |
| GMA | VOC | Faster R-CNN | 91.67 | 83.33 | 0.00 | 86.11 | 50.00 |
| GMA | COCO | YOLOv5 | 91.67 | 83.33 | 0.00 | - | 50.00 |
| GMA | COCO | Faster R-CNN | 100.00 | 100.00 | 0.00 | 58.33 | 50.00 |
消融实验¶
1. 验证集构建策略对检测准确率的影响(%)
| 数据集 | 验证集构建策略 | YOLOv5 平均 Acc. | Faster R-CNN 平均 Acc. |
|---|---|---|---|
| PASCAL VOC | Equal Number (类别实例等额采样) | 100.00 | 67.59 |
| PASCAL VOC | Equal Size (单目标裁剪并对齐尺寸) | 88.89 | 96.30 |
| PASCAL VOC | Random (全图随机无约束采样) | 100.00 | 67.59 |
| MS-COCO | Equal Number (类别实例等额采样) | 93.52 | 77.78 |
| MS-COCO | Equal Size (单目标裁剪并对齐尺寸) | 95.37 | 95.37 |
| MS-COCO | Random (全图随机无约束采样) | 96.30 | 68.52 |
2. 置信度截断阈值 \(\delta\) 敏感性分析(平均检测准确率 %)
| 阈值 \(\delta\) | VOC YOLOv5 | VOC Faster R-CNN | COCO YOLOv5 | COCO Faster R-CNN |
|---|---|---|---|---|
| 0.0000 (不截断) | 100.00 | 50.00 | 96.30 | 50.00 |
| 0.0005 (默认推荐) | 100.00 | 96.30 | 96.30 | 95.37 |
| 0.0010 | 96.30 | 96.30 | 96.30 | 67.59 |
| 0.0100 | 91.67 | 75.93 | 97.22 | 75.93 |
| 0.0500 | 90.74 | 71.30 | 95.37 | 78.70 |
关键发现¶
- 传统触发器逆向基线 ODSCAN 在场景级攻击下完全失效(准确率恒定为 50.00%)。原因在于其假设局部触发器诱导特定的类间转移,而场景级攻击无特定受害者类别且触发器模式超越了纯色块假设,梯度反演陷入停滞。
- 架构依赖基线 MIA 仅能在 Faster R-CNN 上的局部类别攻击中部分生效,在破坏双分支的场景级攻击(SPONGE)下 AUROC 彻底跌落为 0.00。
- DistScan 展现出极高鲁棒性与跨架构泛化力,在全部 288 个模型上平均检测准确率达到 96.99%,相比基线提升达 27.32 个百分点,且 AUROC 几乎全面逼近 1.00。
- 一阶段模型在全图随机采样下表现最优,验证了密集预测头与全图输入的一致性;两阶段模型必须采用单前景裁剪输入,若不加置信度过滤(\(\delta=0\)),Faster R-CNN 的未加权候选因类别均分彻底丧失区分能力(跌至 50%)。
亮点与洞察¶
- 切入视角独特:首次将后门防御视角聚焦于检测模型未经 NMS 抑制的原始中间类别预测分布,避开了复杂的触发器反演优化与不可迁移的模块级假设。
- 开箱即用且算力极其低廉:审计无需访问网络权重,无须反向传播求导或重训练,仅靠少量干净样本的前向推理与频数统计即可完成高置信度判定。
- 深刻揭示了后门诱发的先验偏移本质:PCA 降维可视化证实良性模型的经验预测分布高度聚类在训练集统计邻近空间,而后门注入无论是有定向篡改(如 GMA 强化目标类)还是全局破坏(如 SPONGE/BLINDING),均会在多类别维度上造成不可逆的全局分布外移。
局限与展望¶
- 依赖训练集类别频数先验:方法假设审计方已知悉原训练数据的类别统计分布;在极端匿名化或私有闭源预训练场景下,若缺乏参考频数可能需要构建替代参照分布。
- 细粒度多类别数据集上的轻微衰减:在类别极多且语义相近的 MS-COCO 上(如 GMA-YOLOv5 与 SPONGE-Faster R-CNN),极少数样本的分布偏移裕量受到压缩,未来可进一步融入特征层嵌入分布进行多级联检。
- 对自适应后门攻击的防御潜能:未来攻击者若设计正则化损失强制约束干净样本上的 NMS 前预测分布与真实类别频率对齐,可能构成对抗博弈新挑战。
相关工作与启发¶
- vs ODSCAN (IEEE S&P 2024): ODSCAN 依赖多边形区域反演与单色 Patch 假设,面对无特定转移目标或全图瘫痪的场景级攻击陷入维度灾难;DistScan 直接在干净样本上提取全局统计指纹,完全摆脱对触发器形态与优化过程的依赖。
- vs MIA (ICPR 2024): MIA 依赖 RPN 与第二阶段分类头的行为不一致性信号,仅限于两阶段架构且被破坏双分支的攻击轻易规避;DistScan 作用于一阶段/两阶段共有的 NMS 前预测结果,具有完全通用的跨架构防护能力。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次揭示并系统利用检测器 NMS 前预测类别分布在干净样本下的后门偏移现象,视角极具创新。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 288 个模型、跨 YOLOv5/Faster R-CNN 架构与 MS-COCO/VOC 数据集,针对场景级攻击验证详实全面。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑闭环紧密,从直觉观察、理论形式化到实验消融层层推进,表述精准流畅。
- 价值: ⭐⭐⭐⭐⭐ 为黑盒第三方目标检测模型供应链安全审计提供了一种极具实用价值与工业落地前景的轻量级工具。