跳转至

D-GAP: Improving Out-of-Domain Robustness via Dataset-Agnostic and Gradient-Guided Augmentation in Amplitude and Pixel Spaces

会议: NeurIPS2026
arXiv: 2511.11286
代码: https://github.com/RapidsAtHKUST/D-GAP
领域: 其他(域外鲁棒性 / 域适应)
关键词: 域外鲁棒性、梯度引导、振幅混合、双空间增强、无监督域适应

版本说明:本笔记依据 2026-09-30 的 arXiv v4。旧清单标题使用 “Frequency and Pixel Spaces”,v4 改为 “Amplitude and Pixel Spaces”;这是同一 arXiv ID 的标题更新,保留原有文件路径。

一句话总结

D-GAP 用任务损失对傅里叶振幅的梯度决定逐频率跨域混合强度,再融合像素混合结果,在四个真实数据集上相对各自最佳通用方法平均提升 5.3 个百分点,但无目标标签不等于训练时不访问目标数据。

研究背景与动机

相机地点、病理染色、录音设备和望远镜都可能改变输入的外观统计,而不改变模型需要识别的类别。 训练域中的背景或成像特征一旦与类别相关,模型就可能利用这些容易学习的线索,在换域后失效。 RandAugment、MixUp 等通用增强没有明确针对这类偏移;Copy-Paste 或 Stain Color Jitter 更有针对性,却依赖前景分割、染色知识或预先分析。 问题不是单纯缺少训练样本,而是增强究竟扰动了域相关线索,还是破坏了识别所需的信息。

傅里叶增强提供了一种替代接口:改变振幅谱,保留承载空间结构的源图相位,以改变外观而尽量保留内容。 FACT、FDA 等方法已经使用这条思路,但固定频段或随机混合比例并不知道当前模型真正依赖哪些频率。 同一频率在不同任务、数据和训练阶段中可能具有不同作用,因此统一扰动并不一定能有效打断当前模型的频谱依赖。 此外,只混合振幅可能使重建图像模糊或出现伪影,损失局部识别细节。

D-GAP 因而把模型自身的任务梯度作为增强反馈,而不是依赖人工判断哪些频段代表背景或风格。 这里的 dataset-agnostic 指不需要为每个数据集手工设计增强规则,并不意味着无需跨域样本、超参数或验证集。 其主要语境是域适应;具体实验是否使用目标图像必须逐数据集说明。 核心 idea:以振幅梯度敏感性调节跨域振幅插值,再用像素分支补充空间信息,使增强随当前模型响应变化,而不是始终遵循固定频谱规则。

方法详解

整体框架

训练输入是一张带标签的源图像和另一张跨域图像;后者只提供输入信息,不需要提供混合目标的类别标签。 D-GAP 先通过源样本的监督任务计算振幅敏感性,再把它转换成有界混合图。 振幅分支依据混合图插值两张图的振幅,并保留源图相位重建;像素分支直接混合原始图像。 随后两种增强结果再次融合,用于训练分类器。

“跨域图像”不必总是最终部署域:iWildCam、Camelyon17 和 BirdCalls 从其他训练域取样,而 Galaxy10 与三个常用基准允许使用无标签目标域图像。 因此图中的跨域输入是协议决定的数据入口,不是一个暗含测试标签的监督分支。 敏感性计算和增强发生在训练时;推理时直接使用训练好的分类器,不需要执行该双分支增强流程。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    S["源图像 + 源标签"] --> G["振幅敏感性引导"]
    G --> A["保相位振幅混合"]
    S --> P["像素补偿与双空间融合"]
    T["跨域图像<br/>混合时不用其标签"] --> A
    T --> P
    A --> P
    P --> L["源标签任务训练"]
    L --> M["训练后的分类器<br/>推理时直接预测"]

关键设计

1. 振幅敏感性引导:让当前任务响应决定扰动强度

方法对 RGB 图像逐通道做傅里叶变换,区分振幅与相位。 振幅描述频率成分的强弱,相位用于保留源图的空间结构;这里采用的是增强设计上的经验分工,不是严格的“振幅只有风格、相位只有类别”分解。 在用于振幅混合的方形窗口 \(\Omega_r\) 内,计算源样本任务损失对各振幅位置的梯度绝对值。 梯度大的位置表示当前模型的损失对该位置的局部扰动更敏感,并不直接证明该频率是虚假相关。

\[ G(u,v)=\left|\frac{\partial\mathcal{L}_{\mathrm{task}}(f(x_1),y)}{\partial A(x_1)(u,v)}\right|,\qquad (u,v)\in\Omega_r. \]

随后将敏感性图按其均值和标准差标准化,通过 sigmoid 映射,再裁剪到预设区间。 由此得到连续的逐频率混合图,而不是对整个窗口使用一个随机标量。 这里的裁剪是混合比例的区间约束,不是对输入执行多步对抗式投影梯度优化。 论文没有在所读正文中给出 \(d_{\min}\)、\(d_{\max}\) 的具体数值,本笔记不补造默认值。

\[ \widetilde G=\frac{G-\mu(G)}{\sigma(G)+\varepsilon},\qquad D=\operatorname{clip}\bigl(\operatorname{Sigmoid}(\widetilde G),d_{\min},d_{\max}\bigr). \]

这个映射使相对高敏感的位置注入更多跨域振幅,低敏感位置更多保留源振幅。 其动机是主动扰动模型当前强依赖的频谱成分,迫使模型在训练中适应跨域变化。 但高敏感成分也可能承载任务所需信息;因此这是一条有实验支持的敏感性启发式,而不是自动识别域偏差的因果判据。

2. 保相位振幅混合:变化外观统计,同时尽量维持源样本结构

有了混合图后,窗口内每个频率都在源振幅和跨域振幅之间插值。 这与直接替换整个低频区不同:替换强度是连续的、位置相关的,并随模型的任务梯度变化。 窗口限定干预范围;本文用 \(r\) 表示窗口边长相对图像尺寸的比例,而不是面积比例。

\[ A_{\mathrm{mix}}(u,v)=\bigl(1-D(u,v)\bigr)A(x_1)(u,v)+D(u,v)A(x_2)(u,v),\qquad (u,v)\in\Omega_r. \]

将混合振幅与源图相位组合,再经逆傅里叶变换得到频域增强图 \(\hat x_f\)。 源相位不与目标相位混合,这是该分支维持源标签语义的主要约束。 跨域图像也无需属于同一类别:它提供外观统计,方法没有使用其标签进行同类配对。 这使方法能够利用无标签目标图像,但同时保留了混合异类内容可能改变语义的风险。

相位保留只能提高结构保真的可能性,不能保证重建图与源图在所有任务上标签一致。 论文展示了频域混合产生模糊和伪影的例子,因此没有把该分支单独当作完整方案。 这也是下一步仍需要像素信息的原因,而不是简单增加一个与频谱无关的正则项。

3. 像素补偿与双空间融合:避免把频谱重建作为唯一训练视图

像素分支用第一组权重混合两张原图,再用第二组权重与频域增强图融合。 第一组权重控制跨域图像对像素分支的影响;第二组权重控制最终图像对像素分支的依赖。 二者含义不同,不应把它们合并解释为“目标域注入比例”。

\[ \hat x_p=(1-\lambda_1)x_1+\lambda_1x_2,\qquad \hat x=(1-\lambda_2)\hat x_f+\lambda_2\hat x_p. \]

像素分支提供原始像素层面的互补信息,让最终视图不完全依赖傅里叶重建。 它不是分割驱动的前景粘贴,也没有显式检测或恢复被模糊的边缘;“补偿细节”是设计动机和经验解释。 像素混合本身也会带入另一张图的内容,所以其效果取决于混合强度,而非天然保证语义不变。 消融中纯像素混合在 Camelyon17 上反而明显弱于不增强,说明双空间融合不能理解成任意增强的简单叠加。

一个完整示例

以 Galaxy10 为例,源输入是一张有标签的 DECaLS 图像,跨域输入是从 SDSS 无标签测试集合中随机取得的图像。 先用 DECaLS 图像及其源标签求振幅梯度;SDSS 的类别标签不参与敏感性计算。 默认 \(r=0.5\) 限定混合窗口,再由敏感性图为窗口中不同频率分配不同插值强度。

接着保留 DECaLS 相位重建频域增强图,同时生成 DECaLS 与 SDSS 的像素混合图。 最后按 \(\lambda_2\) 合成用于源标签训练的视图。 该示例是论文采样协议的流程说明,不是作者提供的某一张图像的数值轨迹。 它体现的是无监督域适应的目标输入访问,而不是完全看不到 SDSS 数据的纯域泛化。

损失函数 / 训练策略

方法以监督任务损失生成敏感性反馈,增强本身不依赖目标标签,也未要求一个显式识别虚假特征的额外损失。 真实数据集采用线性探测后微调(LP-FT):先冻结预训练编码器训练分类头,再联合微调编码器与分类头。 这样先稳定分类头,再让表示适应增强视图,避免一开始就强烈改变预训练表示。

附录给出的线性探测均为 10 个 epoch;iWildCam、Camelyon17 的微调为 20 个 epoch,BirdCalls 为 30 个 epoch,Galaxy10 为 15 个 epoch。 Galaxy10 的微调采用 Adam,学习率 \(10^{-4}\)、批大小 8、增强概率 0.5。 PACS、Office-Home、Digits-DG 不使用 LP-FT 阶段,而按照比较方法的设置直接训练。 附录 B 推荐 \(r=0.5\),以及 \(\lambda_1\in[0.2,0.6]\)、\(\lambda_2\in[0.2,0.6]\);这些是建议区间,不是所有实验都使用同一个已披露的精确权重对。

实验关键数据

主实验

下表真实数据集数值来自正文 4.2 对图 5 的文字说明;基准均值来自表 2、3。 数值单位为百分比,提升为百分点;不同数据集的 F1 和准确率不能视为同一个统一指标。 “比较方法”是该数据集表述中的最佳通用方法或所列基准方法,不等于所有领域中的全局最优。

数据集 指标 比较方法 比较方法数值 D-GAP 提升(百分点)
iWildCam OOD Macro F1 FACT 34.7 36.8 +2.1
Camelyon17 OOD 准确率 SAM 92.2 96.4 +4.2
BirdCalls OOD Macro F1 FACT 35.1 40.7 +5.6
Galaxy10 OOD 准确率 SAM 74.1 83.4 +9.3
PACS 平均准确率 FACT 87.88 89.03 +1.15
Office-Home 平均准确率 Su et al. 67.71 70.22 +2.51
Digits-DG 平均准确率 Su et al. 82.6 84.5 +1.9

四个真实数据集的提升平均为 5.3 个百分点;三个基准的提升平均约为 1.9 个百分点。 PACS、Office-Home 使用 ResNet18,Digits-DG 使用 ConvNet;真实数据集分别使用 ResNet50、DenseNet121、EfficientNet-B0、ResNet18。

协议边界必须与数值一起阅读:附录 E.1 明确 iWildCam、Camelyon17、BirdCalls 的混合目标来自其他训练域。 Galaxy10 的混合目标来自无标签测试集;三个常用基准的训练允许从留出的目标域选择无标签图像。 因此,即使表名使用 leave-one-domain-out,也不能将后三个基准的结果直接解释为训练时完全不见目标输入的纯 DG。

正文及附录说明部分 FACT、SAM 等基线数值沿用来源论文;附录 A 的 DeepAll、FACT、SAM 未提供标准差,其他相关结果报告五个随机种子。 这不是所有方法都在完全统一重运行和相同目标访问条件下得到的显著性检验。

消融实验

下表节选原文表 4 的 OOD 列;所有数值为百分比。 Frequency-only 是仅使用频域分支,Mask-low、Mask-high、Mask-ring 是以固定掩码替换梯度引导的变体。

配置 iWildCam F1 Camelyon17 准确率 BirdCalls F1 Galaxy10 准确率
不增强 31.2 91.4 30.1 54.3
Pixel-only 29.1 69.8 32.4 68.2
Frequency-only 35.6 95.7 37.6 77.9
Mask-low 36.0 96.1 38.4 80.5
Mask-high 35.4 95.4 36.4 79.5
Mask-ring 34.3 94.0 36.5 77.1
完整 D-GAP 36.8 96.4 40.7 83.4

完整方法相对 Frequency-only 的提升依次为 1.2、0.7、3.1、5.5 个百分点。 相对 Mask-low 的提升依次为 0.8、0.3、2.3、2.9 个百分点,支持自适应混合优于该固定低频变体。 但这是整条训练流程的结果差异,不能据此证明像素分支真的恢复了某个具体边缘或梯度已准确找出虚假特征。

原文表 6 还比较高梯度位置集合的 Jaccard 相似度,即两个集合交集大小除以并集大小。 SC-CD 表示同类别跨域,DC-SD 表示异类别同域;下表保留三个阈值的数值。

高梯度位置比例 Galaxy10 SC-CD Galaxy10 DC-SD Office-Home SC-CD Office-Home DC-SD
Top 10% 0.5449 0.5551 0.2774 0.3035
Top 20% 0.5485 0.5734 0.3332 0.3554
Top 30% 0.5497 0.5847 0.4372 0.4558

关键发现

  • 表 6 中同域异类的重叠始终更高,提示高梯度位置包含域相关信息;差距较小且未给出对应显著性检验,不能升级为域因果特征识别的证明。
  • 连通性分析训练二分类器区分两个“类别—域”组合,以测试错误率估计连通性。\(\alpha\) 对应同类跨域,\(\beta\) 对应异类同域,\(\gamma\) 对应异类跨域;iWildCam 的 \(\alpha/\gamma\) 从 0.33 变为 4.16,Camelyon17 从 7.50 变为 40.0。
  • 这些比值表示经验上的跨域样本可连接程度,不是实际删除虚假特征的直接测量;Camelyon17 的 \(\beta/\gamma\) 同时从 94.5 降至 24.3,也提示类别相关信息可能受到扰动。
  • 表 5 的 ConvNeXt 和 ViT 实验支持方法不局限于原始 CNN 骨干,但不意味着对任意架构或任意分布偏移有效。
  • 表 8 报告 D-GAP 每次迭代 \(90.46\pm2.38\) ms、吞吐 \(353.9\pm9.2\) img/s、峰值显存 0.86 GB;ERM 对应 \(24.46\pm0.17\) ms、\(1308.3\pm9.1\) img/s、0.86 GB。相同显存不等于相同计算成本。

亮点与洞察

  • 把模型响应变成增强参数。 梯度不是用来寻找逐像素最坏攻击,而是生成频率位置相关的插值图;它把当前任务依赖接入传统傅里叶增强。
  • 两组混合权重具有不同职责。 \(\lambda_1\) 控制像素图中的跨域混合,\(\lambda_2\) 控制最终频域与像素视图的组合,因而能够分别调节域信息注入和对重建结果的依赖。
  • 保留相位是软语义约束。 它避免同时改变振幅与相位,但并非标签不变的数学保证;这一理解更符合像素分支和消融的必要性。

局限与展望

  • 额外梯度计算是实际代价。 作者建议周期性更新敏感性图、使用低分辨率频谱代理或轻量敏感性预测器;这些尚不是本文验证的优化结果。
  • 目标输入访问限制结果外推。 Galaxy10 和常用基准利用无标签目标数据,不能仅因目标标签未参与训练就宣称适用于完全目标未知的部署。
  • 验证协议有文字疑点。 Galaxy10 附录先说 DECaLS 用于训练和验证,又说按最佳 OOD 验证表现选择线性探测检查点;该处没有清晰说明独立 OOD 验证集来自哪里,复现时需确认,不能推断使用或未使用 SDSS 标签调参。
  • 敏感性与虚假相关之间仍缺识别保证。 可进一步用受控背景或成像干预区分“有用但敏感”和“域特定且敏感”的频率,检验梯度启发式的失败条件。
  • 细节补偿依然是经验机制。 增强可视化、精度和连通性不能单独证明因果解耦;需要细节保持指标、标签保持评估和严格匹配目标访问权限的对照。

相关工作与启发

  • vs FACT / FDA:同样利用振幅改变外观并保留源相位;D-GAP 的区别是由任务梯度决定逐频率混合强度,并增加像素补偿,而不是仅使用固定低频替换或预定义插值。
  • vs SAM:此处 SAM 是 Semantic-aware Mixup,不是 Sharpness-Aware Minimization。论文将其作为语义感知傅里叶混合基线,而 D-GAP 强调当前模型响应驱动的敏感性图。
  • vs Connect Later:沿用预训练和 LP-FT 的训练思路,但以跨数据集的梯度增强替代 Copy-Paste、染色扰动等人工规则;仍需要合适的采样协议和验证选择。
  • 后续研究线索:在相同预算下分别比较仅源域混合、独立无标签目标集混合和无标签测试集混合,可分离增强设计收益与目标分布访问收益;这是本笔记提出的实验建议,不是原文结论。

评分

  • 新颖性: 4/5 — 任务梯度驱动的振幅插值与双空间融合形成明确的组合贡献,但建立在已有傅里叶增强之上。
  • 实验充分度: 4/5 — 覆盖七个数据集、分支与掩码消融及多骨干;目标访问协议与部分基线来源限制严格横向结论。
  • 写作质量: 3/5 — v4 增补了敏感性证据和成本分析,但 Galaxy10 验证描述及 DG 命名需要更明确。
  • 价值: 4/5 — 为减少任务专用增强设计提供了实用接口,适用价值取决于目标数据可用性和训练预算。