跳转至

DETR is Secretly a Multispectral Detector: Zero-Parameter Adaptation via Semantic Alignment

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/UserXiangYang/ZPA-MDETR
领域: 目标检测
关键词: 多光谱目标检测, DETR, 零参数自适应, 语义对齐, 非对称跨模态交互

一句话总结

本文打破了多光谱检测依赖额外融合参数的传统范式,提出 ZPA-MDETR,直接复用单模态 DETR 架构与预训练权重,通过非对称查询-记忆角色分配与免参数空间-通道语义对齐正则项,以零新增参数实现高精度多光谱目标检测。

研究背景与动机

多光谱目标检测(MOD)通过联合可见光(RGB)与红外(IR)模态,在全天候自动驾驶和智能监控等复杂光照场景下展现出强大鲁棒性。RGB 图像富含精细的纹理与色彩语义,但在弱光、雨雾或眩光环境下性能断崖式下跌;红外热成像依据物体热辐射成像,免疫光照变化,却普遍缺失边缘细节且背景对比度低。为了融合互补线索,现有基于 CNN 或 DETR 的多光谱检测方案普遍遵循“参数膨胀”范式——通过引入专门的双分支交互模块、跨尺度融合编码器或多模态注意力网络来实现特征融合。

然而,这种依靠堆叠定制化融合模块的设计存在两个致命痛点:其一,新引入的融合模块打破了检测器原有的单模态网络拓扑,无法直接利用海量单模态预训练权重进行初始化,限制了底层通用表征能力的发挥;其二,新增的特征交互层和编码分支不可避免地膨胀了参数量与显存占用,成为资源受限边缘设备上实时部署的严峻瓶颈。

面对这一困境,本文重新审视了 DETR 系列架构的本质,指出其解码过程天然建立在“查询-记忆”(Query-Memory)交互机制之上:物体查询通过交叉注意力在同一表征空间中从特征记忆(Memory)中检索并聚合目标级线索。这一内在机制揭示出,跨模态融合并不一定需要外挂实体融合层。本文的核心 idea 是:完全保留单模态 DETR 的网络拓扑与参数量,将多模态协同抽象为“非对称角色分配”与“表征空间对齐”——通过共享编码器提取特征,把更可靠模态作为 Memory、互补模态用于生成 Query,并配合训练期免参数的空间-通道语义对齐约束,实现零新增参数的高性能多光谱检测(ZPA-MDETR)。

方法详解

整体框架

ZPA-MDETR 完全保留了单模态 DETR(以实时检测器 RT-DETR 为代表)的骨干网络、编码器与解码器架构,不添加任何可学习的融合参数。整体数据流首先将 RGB 和 3 通道化的 IR 图像沿 Batch 维度拼接,送入权重共享的单一编码器并行提取多尺度特征;随后在解码阶段实施非对称输入组织,分别指定一种模态作为特征记忆(Memory),另一模态通过密集预测挑选出目标查询(Query)及其参考点;最后在标准 DETR 解码层中完成跨模态可变形交叉注意力交互。在训练阶段,算法施加免参数的空间语义对齐与通道语义对齐正则项,将跨模态特征拉齐到统一语义空间中,而在推理阶段则零开销移除。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["RGB-IR 成对输入<br/>IR单通道复制扩展为3通道"] --> AIO["非对称输入组织<br/>沿 Batch 拼接送入共享编码器"]
    AIO --> MemorySplit["多尺度模态特征分割<br/>生成 RGB 记忆 Mrgb 与 IR 记忆 Mir"]
    MemorySplit --> SA["免参数语义对齐约束<br/>训练期空间余弦一致 + 通道解耦正交"]
    MemorySplit --> QuerySelect["非对称查询选择<br/>从查询源模态筛选 Top-K 查询与参考点"]
    QuerySelect --> DCA["非对称可变形交叉注意力<br/>以查询源动态偏移采样检索记忆源全局上下文"]
    SA -.->|正则化统一语义空间| DCA
    DCA --> DecOut["6层级联 DETR 解码输出<br/>边界框回归与分类预测"]

关键设计

1. 非对称输入组织:无缝复用单模态计算拓扑与解码交互 针对传统方法定制双分支与额外交互模块破坏拓扑、无法无缝继承单模态预训练权重的痛点,本文提出非对称输入组织策略。对于 RGB 输入 \(I_{rgb} \in \mathbb{R}^{3 \times H \times W}\) 与单通道红外输入 \(I_{ir} \in \mathbb{R}^{1 \times H \times W}\),首先沿通道复制将红外拓展为 \(I'_{ir} \in \mathbb{R}^{3 \times H \times W}\),然后沿 Batch 维度拼接构建统一张量 \(I_{unified} \in \mathbb{R}^{2 \times 3 \times H \times W}\)。该张量直接通过单模态预训练共享编码器进行前向传播,避免设计任何新分支。特征图在 Batch 维拆分并展平为序列记忆 \(M_{rgb}, M_{ir} \in \mathbb{R}^{T \times C}\)(其中 \(C=256\))。随后系统显式打破对称性:选定一种模态作为查询源输入标准查询选择器,基于置信度打分筛选出初始目标查询 \(Q \in \mathbb{R}^{K \times C}\) 和 2D 参考点 \(P \in \mathbb{R}^{K \times 4}\)(\(K=500\),含 300 个候选与 200 个去噪查询);选定另一模态作为记忆源提供全局上下文。这种组织方式将“跨模态融合”转化为 DETR 解码器内在的键值检索,使单模态检测器能够零结构修改地执行多模态协同。

2. 非对称可变形交叉注意力:跨模态引导的稀疏动态采样 为实现精准高效的信息聚合,模型复用标准可变形交叉注意力(Deformable Cross-Attention)完成两模态交互。以 RGB 作为查询源、IR 作为记忆源为例,在 6 层级联解码器的每一层中,自注意力增强后的查询 \(\tilde{Q}_{rgb}\) 通过线性层动态预测针对 IR 记忆的采样位置偏移量 \(\Delta p_{rgb}^{(hns)}\) 与注意力权重 \(A_{rgb}^{(hns)}\)。偏移量根据参考框 \(P_{rgb}\) 的宽高缩放以适配目标尺度变化,继而在多尺度红外特征图 \(M_{ir}^{(n)}\) 上定位采样点并加权聚合: $$ Q_{fus} = \sum_{h=1}^{N_h} W_h \left( \sum_{n=1}^{N_l} \sum_{s=1}^{N_s} A_{rgb}^{(hns)} \cdot W'h M}^{(n)} \left( \Phi_n(\hat{p{rgb}) + \Delta p \right) \right) $$ 其中 }^{(hns)\(N_h=8, N_l=5, N_s=3\),\(\Phi_n(\hat{p}_{rgb})\) 为参考点向第 \(n\) 层特征图的坐标映射投影。该机制赋予查询自适应跨模态探针属性:由一种模态定位潜在目标的几何中心与边界先验,主动在互补模态特征空间中抓取关键支撑语义,兼具计算稀疏性与多模态线索互补性。

3. 免参数语义对齐约束:弥合空间异质性并抑制通道冗余 尽管 DETR 解码器在结构上是模态不可知的,但若 RGB 与 IR 在潜空间分布严重失准,交叉注意力交互将出现语义混淆。本文构建了一组免参数的正则化项,仅在训练阶段约束共享编码器,推理时零开销。空间语义对齐通过在全部 \(T\) 个空间位置上最大化 RGB 与 IR 特征向量的余弦相似度,拉齐空间一致语义: $$ \mathcal{L}{spatial} = \frac{1}{T} \sum|}^{T} \left( 1 - \frac{M_{rgb}^{(t)} \cdot M_{ir}^{(t)}}{|M_{rgb}^{(t)2 |M|}^{(t)2} \right) $$ 为了避免特征空间塌陷(即两模态演化成无差异复制)并保留模态特有细节,算法引入通道语义对齐。通过对特征沿通道做 Batch Normalization 后计算互相关矩阵 \(C \in \mathbb{R}^{C \times C}\),要求对角线趋近于 1,而非对角线趋近于 0: $$ \mathcal{L}^2 $$ 其中 } = \sum_{i} (C_{ii} - 1)^2 + \lambda_{off} \sum_{i} \sum_{j \neq i} C_{ij\(\lambda_{off}=0.005\)。对角项保证对应通道承载一致语义概念,非对角项强制各通道特征解耦并剥离冗余信息,促使模型在紧凑对齐的统一语义空间中学习互补特征。

4. 基于模态可靠度的查询-记忆角色分配准则 针对双模态环境质量失衡问题,本文分析了非对称角色选择对性能的影响。在交叉注意力体系中,Memory 扮演提供特征证据的 Key/Value 角色,而 Query 负责提供位置先验与采样引导。因此,在光照严重缺失或恶劣天气的模态失衡场景(如 FLIR、LLVIP、RGBTDronePerson),红外模态更清晰稳定,选用“RGB 提供 Query、IR 作为 Memory”可使检测头立足于高质量红外特征,借助 RGB 纹理进行局部辅助引导;而在两模态质量均衡且白昼丰富的场景(如 M3FD),单模态 RGB 表现占优,选用“IR 提供 Query、RGB 作为 Memory”能发挥可见光丰富细节的支撑作用。

损失函数 / 训练策略

网络整体训练目标由标准单模态检测损失与免参数对齐正则项组成: $$ \mathcal{L}{total} = \mathcal{L}} + \mathcal{L{spatial} + \mathcal{L} $$ 其中 \(\mathcal{L}_{det}\) 完全沿用 RT-DETR 原生的分类与边界框回归损失(包含 Focal Loss、L1 Loss 及 GIoU Loss)。所有实验采用 COCO 预训练的 ResNet50 作为 Backbone,使用单张 RTX 3090 GPU 端到端微调,输入尺寸 FLIR/M3FD/RGBTDronePerson 为 \(640 \times 640\),LLVIP 为 \(1024 \times 1024\)。

实验关键数据

主实验

在四大公开多光谱检测基准(FLIR、M3FD、LLVIP、RGBTDronePerson)上全面评测,ZPA-MDETR 在参数量与单模态 RT-DETR 严格一致(40.88M)的前提下,全面超越现有基于 CNN 和 DETR 的先进多光谱方法。

数据集 模态 骨干网络 / 方法 mAP (%) mAP75 (%) mAP50 (%) 参数量 (M) FPS (RTX 3090)
FLIR RGB-IR DeformCAT [TMM'25] 46.93 43.65 86.48 120.11 27.86
FLIR RGB-IR GM-DETR [CVPRW'24] 45.80 42.60 83.90 76.77 23.51
FLIR RGB-IR DAMSDet [ECCV'24] 49.29 48.10 86.65 78.91 8.55
FLIR RGB-IR ZPA-MDETR (本文) 49.82 48.32 87.05 40.88 30.20
M3FD RGB-IR DeformCAT [TMM'25] 46.49 49.78 73.28 120.11 -
M3FD RGB-IR GM-DETR [CVPRW'24] 45.72 47.15 71.25 76.77 -
M3FD RGB-IR MM-DETR [arXiv'25] - - 73.39 - -
M3FD RGB-IR ZPA-MDETR† (本文) 50.58 53.18 77.26 40.88 -
LLVIP RGB-IR DeformCAT [TMM'25] 66.13 77.07 97.82 120.11 -
LLVIP RGB-IR MS-DETR [TITS'24] 66.10 76.30 97.90 40.88+ -
LLVIP RGB-IR ZPA-MDETR (本文) 69.14 78.79 98.11 40.88 -
RGBTDronePerson RGB-IR COXNet [TCSVT'26] - - 50.04 - -
RGBTDronePerson RGB-IR GM-DETR [CVPRW'24] 20.63 9.37 54.97 76.77 -
RGBTDronePerson RGB-IR ZPA-MDETR (本文) 21.01 10.75 57.13 40.88 -

(注:† 表示采用 IR 提取 Query、RGB 作为 Memory 的配置。)

消融实验

在 FLIR 数据集上对非对称输入组织(AIO)以及空间(Spa.)和通道(Cha.)语义对齐(SA)进行系统消融:

配置 / 模块组成 AIO 空间对齐 (Spa.) 通道对齐 (Cha.) mAP (%) mAP75 (%) mAP50 (%) 参数量 (M)
单模态基线 (RGB-only) - - - 33.88 27.61 69.47 40.88
IR-Query / RGB-Memory + AIO ✓ - - 47.62 44.70 85.82 40.88
IR-Query / RGB-Memory + AIO + Spa. ✓ ✓ - 47.95 44.86 86.51 40.88
IR-Query / RGB-Memory + AIO + Cha. ✓ - ✓ 47.80 44.77 86.53 40.88
IR-Query / RGB-Memory 完整版 ✓ ✓ ✓ 48.16 44.89 86.65 40.88
单模态基线 (IR-only) - - - 45.19 41.84 81.71 40.88
RGB-Query / IR-Memory + AIO ✓ - - 49.21 47.53 86.58 40.88
RGB-Query / IR-Memory + AIO + Spa. ✓ ✓ - 49.48 47.77 86.66 40.88
RGB-Query / IR-Memory + AIO + Cha. ✓ - ✓ 49.58 47.94 86.52 40.88
RGB-Query / IR-Memory 完整版 ✓ ✓ ✓ 49.82 48.32 87.05 40.88

关键发现

  • AIO 是性能跃升的根基:在 IR-only 单模态基线(45.19% mAP)上仅引入非对称输入组织(AIO),便直接带来 +4.02% 的 mAP 提升;而在单模态 RGB 基线上更暴增 +13.74% mAP,充分证明 DETR 解码器的查询-记忆交叉注意力天然具备跨模态信息整合能力。
  • 双重语义对齐相互增益:单独引入空间对齐提升 +0.27% mAP,单独引入通道对齐提升 +0.37% mAP,两者结合带来 +0.61% mAP(49.21% \(\to\) 49.82%)。t-SNE 可视化证实,对齐前两模态特征存在显著鸿沟,对齐后两模态在潜在空间中形成紧凑重叠簇。
  • 角色分配契合模态信息可靠度:在夜间弱光或传感器失真占主导的场景(FLIR, LLVIP, RGBTDronePerson),红外成像更稳定,由 IR 担当 Memory、RGB 充当 Query 探针表现最佳;而在白昼占比高、视觉纹理更具判别力的 M3FD 数据集上,由 RGB 提供丰富 Memory、IR 提供 Query 则取得更优的 50.58% mAP。

亮点与洞察

  • 反直觉的极简范式创新:打破了“多模态必堆融合模块、必加参数”的思维定式,揭示出 DETR 解码器的 Query-Memory 交互机制正是天然的跨模态融合器,实现了拓扑完全不变的“零参数自适应”。
  • 低成本训练期对齐正则项:巧妙融合空间余弦相似与类 Barlow Twins 的通道交叉对角化约束,在不增加任何前向推理可学习参数的前提下,将异质特征拉齐至统一空间,推理期实现“纯免费”性能增益。
  • 极致的工业部署性价比:相比 SOTA 方法 DAMSDet(78.91M 参数,8.55 FPS),ZPA-MDETR 参数量砍半(40.88M),推理速度达到 30.20 FPS(提升约 3.5 倍),并在未对齐红外数据集 DVTOD 上维持 56.66% mAP 的高鲁棒性。

局限与展望

  • 输入吞吐量增加导致的算力开销:尽管参数量保持与单模态完全一致,但由于 RGB 与 IR 沿 Batch 维度并发前向传播,计算量(FLOPs)从单模态的 67.84G 增至 129.03G,导致推理帧率(30.20 FPS)低于单流单模态检测器(50.37 FPS)。
  • 静态角色分配难以适应动态极端条件:当前方法依赖先验指定整张图像采用统一的 Query-Memory 角色,无法针对单张图片中“局部强光曝光而局部极度黑暗”的复合场景动态自适应互换角色。
  • 未来方向:探索免参数的实例级动态角色自适应机制,或在骨干网络中引入轻量级令牌剪枝以降低双流拼接引入的额外 FLOPs。

相关工作与启发

  • vs DAMSDet [ECCV 2024]: DAMSDet 引入了竞争性查询选择机制与专门的多光谱可变形交叉注意力融合模块,参数量达 78.91M 且推理速度仅 8.55 FPS;ZPA-MDETR 则完全复用标准 RT-DETR 架构,无需参数扩展,以 30.20 FPS 高速实现更优精度。
  • vs GM-DETR [CVPRW 2024]: GM-DETR 设计了模态特异性交互模块和复杂的跨尺度编码器(76.77M 参数);ZPA-MDETR 证明通过合理的非对称输入流组织与免参数语义对齐,标准单模态检测器即可隐式完成跨模态协同。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 概念清晰而颠覆,首次揭示单模态 DETR 无需扩充参数即天然是多光谱检测器。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 大基准及未对齐数据集,主客观消融、时延分析和特征可视化极其详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图表清晰,问题意识与叙事闭环极强。
  • 价值: ⭐⭐⭐⭐⭐ 兼顾学术启发性与工业落地价值,为资源受限边缘设备的多模态部署指明了新范式。