跳转至

DA-F2F: Domain-Adaptive Object Detection with Feature-to-Feature Modulation and Alignment

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/ohhotaek/DA-F2F
领域: 目标检测
关键词: 域自适应目标检测、特征调制、对抗学习、软加权对齐、Mean Teacher

一句话总结

针对传统图像级风格迁移在域自适应目标检测(DAOD)中计算开销大、易引入伪影及伪标签不稳定等缺陷,本文提出 DA-F2F,在潜空间中利用目标域风格统计量动态调制源域特征(SFM),并结合前景/背景软加权提议对抗对齐(SPA),实现了高效稳定的特征级跨域对齐与 SOTA 检测精度。

研究背景与动机

目标检测作为自动驾驶、智能监控与具身智能等下游系统的核心感知模块,在封闭数据集监督训练下已取得卓越表现。然而,当检测器部署至未见场景时,光照变化、恶劣天气(如浓雾、阴天)或传感器规格差异引起的领域漂移(Domain Shift),会导致深度模型泛化能力严重劣化。由于在每个新部署场景中采集并标注大规模数据集耗时费力且成本高昂,无监督域自适应目标检测(Domain Adaptive Object Detection, DAOD)成为了极具实用价值的研究方向,旨在将标注充分的源域先验有效迁移至无标注的目标域。

在当前 DAOD 研究中,基于 Mean Teacher 的自训练框架占据了主流地位。该范式利用 EMA 教师网络为弱增强的目标域样本生成伪标签,并指导强增强下的学生网络优化。然而,在源域监督损失的驱动下,学生模型参数必然残留对源域分布的强烈偏置;通过 EMA 缓慢累积更新的教师网络难以完全摆脱该偏置,在跨域视觉差异显著时极易产生严重失真的伪标签,进而造成误差累积与确认偏误。为打破这一瓶颈,部分方法引入基于 CycleGAN 或 CUT 的图像到图像(I2I)转换技术,将源域图像渲染为目标域外观以提供额外带真值伪图像。但像素级生成模型计算负担极其庞大,且在无配对街景转换中极易引入结构性形变与像素伪影,反而破坏了检测所依赖的细粒度几何与纹理信息。另一方面,传统对抗学习方法虽然尝试对齐全局或区域特征,但在无标注目标域上依赖硬判别阈值进行前景与背景硬划分时,极易受到噪声伪标签的误导,造成对抗梯度的振荡。

要彻底消除生成伪影并稳定对抗对齐,关键在于摆脱高维像素空间的直接重构,转而在表征空间内完成可控的轻量级样式注入与平滑的区域解耦。核心 idea:跳过像素级图像翻译,提出特征到特征调制(DA-F2F)框架,通过风格感知特征调制(SFM)利用目标域统计量在隐空间自适应重塑源域表征,并辅以连续平滑的软加权提议对齐(SPA)消除伪标签硬切分误差,实现高效低噪的前后景对抗域自适应。

方法详解

整体框架

DA-F2F 整体构建于 Mean Teacher 自训练架构之上,包含共享骨干网络与检测头结构的学生模型和教师模型。训练期间,每轮输入配对的有标注源域图像与无标注目标域图像,由骨干网络提取多尺度深层特征。针对跨域表征差异与伪标签噪声,框架设计了两个互补的核心模块:风格感知特征调制(SFM)直接在潜空间中提取目标域通道级风格统计量,通过轻量级仿射变换将源域特征调制为与目标域分布贴合的对齐特征,同时保留源域真实物体的几何上下文与语义结构;软加权提议对齐(SPA)则构建了一个能够区分前景与背景的判别器结构,利用连续平滑的软置信度权重代替离散硬切分,稳健消除目标域背景噪声并强化前景对齐。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入:有标注源域图像 Xs + 无标注目标域图像 Xt"] --> Ext["骨干网络与 FPN 特征提取<br/>得到源特征 Fs 与目标特征 Ft"]
    Ext --> SFM["风格感知特征调制<br/>通道统计量 [μ, σ] → 仿射参数 (γ, β) 注入 Fs"]
    Ext --> SPA["软加权提议对齐<br/>连续软权重图 W 平滑前景与背景对抗"]
    SFM --> Det["检测头预测与 Mean Teacher 互学习<br/>真值监督 Lsup + 教师伪标签一致性 Lunsup"]
    SPA --> Det
    Det --> Out["输出:具备域不变性与判别性的鲁棒检测器"]

关键设计

1. 风格感知特征调制:潜空间统计量驱动的低开销特征级迁移 像素级图像迁移的主要症结在于高维像素流形重构不仅带来成倍的计算开销,还极易丢失边界清晰度甚至破坏小目标结构。本文依据深度网络中通道统计量天然表征光照、天气与质感等风格属性的特性,提出风格感知特征调制(SFM)。模块首先在目标域特征 \(F_t \in \mathbb{R}^{H \times W \times C}\) 的各通道上计算空间均值 \(\mu_c\) 与标准差 \(\sigma_c\): $\(\mu_c = \frac{1}{HW}\sum_{h=1}^H\sum_{w=1}^W F_{t, h, w, c}, \quad \sigma_c = \sqrt{\frac{1}{HW}\sum_{h=1}^H\sum_{w=1}^W (F_{t, h, w, c} - \mu_c)^2 + \epsilon}\)$ 将拼接后的风格描述向量 \([\mu, \sigma] \in \mathbb{R}^{2C}\) 输入两层带有 ReLU 的轻量 MLP,自适应预测通道缩放偏移 \(\Delta \gamma \in \mathbb{R}^C\) 与平移参数 \(\beta \in \mathbb{R}^C\),并令最终缩放系数 \(\gamma = 1 + \Delta \gamma\)。随后,模块使用仿射参数动态缩放源域特征 \(F_s\),生成目标样式化的源特征 \(\tilde{F}_{s \to t, c} = \gamma_c F_{s, c} + \beta_c\)。为了防止激进的风格偏移损伤源域固有语义并维持训练稳定性,引入加权平衡因子 \(w\) 混合原始表征与调制表征: $\(F_{s \to t, c} = (1 - w) F_{s, c} + w \tilde{F}_{s \to t, c}\)$ 这种隐式特征级样式迁移完全避免了像素重构带来的伪影缺陷,以极小计算代价为学生检测器赋予了逼真的目标域特征感知能力。

2. 标签引导的源域区域解耦对抗:边界明确的前后景非均衡对抗 在特征对齐阶段,全局对抗对齐容易使背景纹理的 domain shift 主导梯度更新,反而稀释了核心目标前景的判别特征。为此,SPA 模块首先在源域上实施基于真实标注引导的精细对抗。源域特征 \(F_s\) 传入空间域判别器 \(D\) 生成空间判别图 \(D^s \in [0, 1]^{H \times W}\)。利用真实的标注边界框生成二值空间掩码 \(M \in \{0, 1\}^{H \times W}\)(落入目标标注框内为 1,其余为 0),将空间损失严格划分为前景对抗与背景对抗: $\(\mathcal{L}_{\text{fg}} = -\frac{1}{\|M\|_1} \sum_{h=1}^H \sum_{w=1}^W M_{h, w} \log D^s_{h, w}\)$ $\(\mathcal{L}_{\text{bg}} = -\frac{1}{\|1_{HW} - M\|_1} \sum_{h=1}^H \sum_{w=1}^W (1 - M_{h, w}) \log (1 - D^s_{h, w})\)$ 通过赋予前景项更高的平衡权重 \(\lambda_{\text{fg}} = 0.8\) 与背景项较低的权重 \(\lambda_{\text{bg}} = 0.05\)\(\mathcal{L}_{\text{src}} = \lambda_{\text{fg}}\mathcal{L}_{\text{fg}} + \lambda_{\text{bg}}\mathcal{L}_{\text{bg}}\)),促使模型将对抗对齐的算力与容量高度聚焦于前景目标,抑制大面积背景对检测表征的干扰。

3. 连续软加权目标域提议对齐:避免伪标签离散误差的平滑对抗约束 目标域缺乏人工真实标注,若简单套用教师网络预测的高置信度伪标签做二值阈值硬切分,由于跨域初始阶段的伪标签漏检与误检率极高,会导致错误的区域类别强加给判别器,引发对抗训练崩塌。针对这一痛点,SPA 为目标域提出了连续软加权对齐机制(STA)。模块利用卷积层从目标特征 \(F_t\) 中生成连续空间提议概率图 \(P \in [0, 1]^{H \times W}\),并结合伪标签由区域提议损失 \(\mathcal{L}_{\text{rpn}}\) 进行弱监督优化。为避免前景与背景权重差距过大造成极端梯度,提议图被线性映射到严格受限的平滑权重区间 \([\tau_{\min}, \tau_{\max}]\)(分别设定为 0.05 与 0.8): $\(W = \tau_{\min} 1_{HW} + (\tau_{\max} - \tau_{\min}) P\)$ 随后将目标域判别概率图 \(D^t = D(F_t)\) 与权重图 \(W\) 按点位相乘,计算目标域对抗损失: $\(\mathcal{L}_{\text{tgt}} = -\frac{1}{HW} \sum_{h=1}^H \sum_{w=1}^W W_{h, w} \log (1 - D^t_{h, w})\)$ 连续权重图 \(W\) 在空间上平滑放大了高可信目标提议区的对抗梯度,同时对杂乱的远景与背景进行渐进衰减,彻底避免了硬二值划分在目标域引入的离散决策噪声。

损失函数 / 训练策略

DA-F2F 遵循两阶段训练流程。前 10k 次迭代为预热(burn-in)阶段,仅使用标注源域数据对检测器进行监督预训练;后 30k 次迭代进入学生-教师互学习阶段,学生与教师网络的结构完全相同,教师网络参数通过 EMA 更新(动量 \(\alpha = 0.9996\))。 整个网络联合优化的总损失函数为: $\(\mathcal{L}_{\text{total}} = \lambda_{\text{sup}} \mathcal{L}_{\text{sup}} + \lambda_{\text{unsup}} \mathcal{L}_{\text{unsup}} + \lambda_{\text{rpn}} \mathcal{L}_{\text{rpn}} + \lambda_{\text{spa}} \mathcal{L}_{\text{spa}}\)$ 其中 \(\mathcal{L}_{\text{sup}}\) 为源域样本在调制特征上的监督检测损失,\(\mathcal{L}_{\text{unsup}}\) 为目标域样本与教师伪标签之间的无监督一致性损失,\(\mathcal{L}_{\text{rpn}}\) 约束目标域提议热力图生成,\(\mathcal{L}_{\text{spa}} = \min_F \max_D (\mathcal{L}_{\text{src}} + \mathcal{L}_{\text{tgt}})\) 为对抗对齐损失。各损失项缩放权重分别配置为 \(\lambda_{\text{sup}}=1.0\)\(\lambda_{\text{unsup}}=1.0\)\(\lambda_{\text{rpn}}=1.0\)\(\lambda_{\text{spa}}=0.01\)。采用带动量的 SGD 优化器,基础学习率设为 0.01 并余弦衰减,在 4 张 RTX A6000 上完成端到端训练。

实验关键数据

主实验

论文在恶劣天气(Cityscapes \(\to\) Foggy Cityscapes,最高雾浓度 0.02)、小规模到大规模数据集(Cityscapes \(\to\) BDD100K-daytime)以及合成到真实(Sim10K \(\to\) Cityscapes,单类别 car)三种经典主流评测基准上进行了全面对比,评价指标统一采用 [email protected]

表 1:跨天气域自适应检测性能对比(Cityscapes \(\to\) Foggy Cityscapes, [email protected], %)

方法 检测器架构 行人 (person) 骑车人 (rider) 汽车 (car) 卡车 (truck) 巴士 (bus) 火车 (train) 摩托车 (mcycle) 自行车 (bicycle) 平均 mAP
DA-Faster Faster R-CNN 29.2 40.4 43.4 19.7 38.3 28.5 23.7 32.7 32.0
UMT Faster R-CNN 33.0 46.7 48.6 34.1 56.5 46.8 30.4 37.3 41.7
PT Faster R-CNN 43.2 52.4 63.4 33.4 56.6 37.8 41.3 48.7 47.1
DDT Faster R-CNN 60.9 64.9 75.6 36.3 60.6 53.7 42.3 59.3 56.7
DADAOD Faster R-CNN 59.8 62.8 73.7 40.3 59.4 56.1 47.8 58.3 57.3
DA-Ada RegionCLIP 57.8 65.1 71.3 43.1 64.0 58.6 48.8 58.7 58.5
DA-F2F (本文) Faster R-CNN 60.9 63.0 76.3 46.2 62.8 64.3 52.8 58.2 60.5

表 2:小规模到大规模跨数据集自适应检测性能对比(Cityscapes \(\to\) BDD100k-daytime, [email protected], %)

方法 检测器架构 行人 骑车人 汽车 卡车 巴士 摩托车 自行车 平均 mAP
DA-Faster Faster R-CNN 28.9 27.4 44.2 19.1 18.0 14.2 22.4 24.9
PT Faster R-CNN 40.5 39.9 52.7 25.8 33.8 23.0 28.8 34.9
CAT Faster R-CNN 44.6 41.5 61.2 31.4 34.6 24.4 31.7 38.5
HMT Transformer 52.6 42.5 67.8 33.7 36.3 28.6 33.7 42.2
DATR Transformer 58.5 42.8 73.4 26.9 39.9 24.2 37.3 43.3
DADAOD Faster R-CNN 61.4 45.4 75.4 33.0 36.2 29.5 36.7 45.8
DA-F2F (本文) Faster R-CNN 64.9 50.0 78.6 33.9 38.4 35.2 39.2 48.6

表 3:合成到真实跨域检测性能(Sim10k \(\to\) Cityscapes, 仅评估 car 类别, [email protected], %)

方法 检测架构 car mAP 方法 检测架构 car mAP
DA-Faster Faster R-CNN 38.2 DATR Transformer 64.3
PT Faster R-CNN 55.1 HMT Transformer 66.4
REACT Faster R-CNN 58.6 DA-Ada RegionCLIP 67.3
HT FCOS 65.5 DADAOD Faster R-CNN 69.7
DA-F2F (本文) Faster R-CNN 69.9 - - -

消融实验

消融实验均在 Cityscapes \(\to\) Foggy Cityscapes 基准上展开,重点评估核心组件的独立贡献与协同效应。

表 4:核心模块消融实验结果(SFM 与 SPA 的组合效果)

配置 SFM (风格感知特征调制) SPA (软加权提议对齐) STA (软加权目标对齐) mAP (%) 说明
Baseline - - - 57.3 无任何特征调制与区域对抗的基础 Mean Teacher
w/ SPA (w/o STA) - - 57.4 仅引入区域对抗,但在目标域使用硬伪标签划分,提升极其微弱 (+0.1%)
w/ SPA (full) - 58.1 引入带连续软权重的目标对齐,对抗学习涨点显著 (+0.8%)
w/ SFM only - - 59.4 仅引入特征到特征调制,性能直接大幅跃升 (+2.1%)
Full DA-F2F 60.5 两模块协同作用,达到全局最优表现 (+3.2%)

表 5:特征调制混合权重 \(w\) 的超参数敏感性分析

调制权重 \(w\) (Eq. 4) mAP (%) 特征混合状态说明
0.2 60.0 源域原始特征占主导,目标风格注入略显不足
0.3 60.5 最佳权衡点:既充分赋予目标风格,又严格保留物体空间几何语义
0.4 60.2 风格偏向加大,检测精度维持在较高水平
0.5 60.0 过度混合开始对源域固有的精细边缘纹理带来微小扰动

关键发现

  1. SFM 特征调制对增益贡献最大:从表 4 可见,单独引入 SFM 即可让基础模型从 57.3% 暴涨至 59.4%(净增 +2.1% mAP),证明在特征潜空间调整一二阶统计量能够高保真地对齐视觉表观分布,且完全规避了像素级扩散或 GAN 重构引起的形变破坏。
  2. 目标域软加权是区域对抗的关键使能因素:若在目标域使用硬伪标签做区域分离(w/o STA),对抗模块仅带来 +0.1% 的边际增益(57.4%);而换用连续有界的软权重图(STA)后,mAP 跃升至 58.1%,充分证实了平滑权重对滤除伪标签误检与压制背景噪声的关键效用。
  3. 超参数鲁棒性优异:特征调制因子 \(w\) 在 0.2 到 0.5 宽广区间内均能稳定取得 \(\ge 60.0\%\) 的优秀表现,并在 \(w=0.3\) 处达到最佳均衡,表明特征仿射变换与骨干卷积表征具有极高的相容性。
  4. 小目标与稀有类别识别能力显著改善:在浓雾场景下,卡车(truck: 46.2% vs 40.3%)、火车(train: 64.3% vs 56.1%)和摩托车(mcycle: 52.8% vs 47.8%)等结构特征易受雾霾遮挡的大中型与细长类物体上,DA-F2F 相对最强 baseline 均取得了 5~8 个百分点的跨越式提升。

亮点与洞察

  • 跳过图像重构的特征级风格投射:直接从目标域特征抽取均值与方差,通过轻量 MLP 动态生成仿射参数重塑源域特征,既消除了 CycleGAN 类模型几百兆参数的推理开销,又彻底杜绝了伪影生成。
  • 软加权机制平滑消解伪标签噪声:用 RPN 引导生成的连续区间 \([0.05, 0.8]\) 软权重取代离散二值掩码,使对抗判别器自然聚焦高可信前景区域,从根本上解决了目标域对抗训练的梯度振荡难题。
  • 即插即用且架构解耦:SFM 与 SPA 均设计为外挂式的特征增强与对抗头组件,完全无需修改检测网络骨干与检测头内部架构,极易迁移到其他检测器或半监督范式。

局限与展望

  • 统计量表达的表观上限:均值与方差主要捕获全局光照、雾气与颜色色调等一二阶风格,对于结构性较强的域差异(如不同城市的建筑构造或相机镜头视场畸变)缺乏显式的建模能力。
  • 两阶段超参数依赖:特征调制权重 \(w\) 以及软权重边界 \([\tau_{\min}, \tau_{\max}]\) 目前仍采用经验固定常数,未来可探索根据训练阶段动态自适应调整衰减的自调节机制。
  • 向单阶段与端到端 DETR 的拓展:本文实验主要聚焦于两阶段 Faster R-CNN 骨干,后续可进一步验证将其无缝迁移至 DINO、RT-DETR 等现代 Transformer 检测器上的有效性。

相关工作与启发

  • vs DDT (Dual-Domain Teacher, TMM 2025): DDT 依赖 CycleGAN 生成源域与目标域互相风格化后的图像以扩充监督数据,存在巨大的训练时间与显存消耗,且生成的像素伪影会导致误检;本文的 DA-F2F 仅在骨干网络特征层进行仿射统计变换,耗时几乎可忽略且保留了完美的标注几何边界。
  • vs DADAOD (Differential Alignment, AAAI 2025): DADAOD 采用差分对齐来区分区域特征,但在目标域仍高度依赖伪标签置信度筛选;本文的 SPA 模块引入基于连续提议概率的平滑软加权机制,有效避免了阈值过高导致漏检、过低引入噪声的离散困境。
  • vs DA-Ada (Domain-Aware Adapter, NeurIPS 2024): DA-Ada 依赖冻结的大规模视觉语言模型(RegionCLIP)骨干插入 Adapter 进行适配;本文 DA-F2F 证明了即使基于经典 ResNet-50 骨干,通过纯粹的特征空间调制与软对抗,亦能在更轻量的参数量下超越基于预训练大模型的对齐性能(60.5% vs 58.5%)。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 摆脱像素级 I2I 局限,提出特征级风格调制与目标域连续软权重对抗,思路清晰且直击痛点。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖恶劣天气、跨数据集与合成到真实三大场景,消融实验详实且配备直观的 t-SNE 分布可视化。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然流畅,公式符号精炼收敛,模块功能与数学机制交代严谨。
  • 价值: ⭐⭐⭐⭐⭐ 为轻量化、鲁棒且低成本的无监督域自适应目标检测提供了极具实用价值的落地范式。