跳转至

Dual Masked Generative Adversarial Transformer for Unsupervised Domain Adaptation

会议: ECCV 2026
论文: ECCV 官方
领域: 其他
关键词: 无监督域自适应 / 掩码图像建模 / 视觉Transformer / 生成对抗对齐 / 特征空间重构

一句话总结

针对大域间隙下掩码图像建模仅在样本级正则化而忽略分布级域差距的瓶颈,提出双向掩码生成对抗 Transformer(Dual-MGAT),在全局 [CLS] 特征空间解耦并消除信息空缺与域分布差异,构建源域与目标域的双向生成对抗对齐通道。

研究背景与动机

无监督域自适应(Unsupervised Domain Adaptation, UDA)旨在将有标签源域学到的判别知识迁移至无标签的目标域,降低标注开销。近年来,基于视觉 Transformer(ViT)的模型因其卓越的自注意力全局建模与泛化能力,在 UDA 领域取得了显著进展。前沿工作如 PMTrans 尝试在 patch 级别引入 mixup 构建中间域,然而在跨域风格极端剧烈、类别繁多的基准(如包含 345 类的 DomainNet)上,平均准确率仍停留在 52.4% 左右,表明面对大域间隙(large domain gap)时现有跨域对齐机制依然存在明显瓶颈。

为了增强目标域表征的鲁棒性,近期部分方法(如 MIC、PACMAC)将自监督学习中的掩码图像建模(Masked Image Modeling, MIM)引入域自适应,通过施加掩码样本与完整样本之间的预测一致性正则化来提升模型在破损视角下的泛化性能。然而,这些现有方法本质上仅将掩码操作视为一种局部数据增强手段,在单个样本实例级别强加一致性约束,完全忽略了分布层面的宏观视角——即所有被掩码处理的样本在特征空间中实际聚合为一个全新的「掩码域(masked domain)」。掩码域与原始域之间存在的显著域分布漂移被以往方法视而不见,当源域与目标域固有差异较大时,这种未能消除的复合间隙严重阻碍了知识迁移的深层效能。

深入剖析掩码域与原始域的差异可以发现,两者交织着两类异构间隙:其一是掩码丢弃大比例 patch 所引发的「信息空缺(information gap)」,其二是源域与目标域数据生成机制不同所导致的「域分布差异(domain distribution discrepancy)」。如果简单套用传统判别器对掩码特征进行暴力拉近,不仅无法修复因掩码破坏的判别语义,反而会退化表征质量。核心 idea:将掩码图像建模升维至分布级域学习,提出解耦消除信息空缺与分布漂移的掩码生成对抗机制——以轻量 Transformer 解码器在语义高度浓缩的 [CLS] Token 特征级进行对抗重构,并构建「掩码目标域→源域」与「掩码源域→目标域」的双向循环生成对抗对齐链路。

方法详解

整体框架

Dual-MGAT 的整体架构由一个共享的 Transformer 编码器 \(E\)、分类头 \(C\)、两个轻量级 Transformer 解码器(\(G^s\)\(G^t\))以及两个类别条件域判别器(\(D^s\)\(D^t\))协同构成。系统并行处理源域与目标域的完整图像及掩码图像。源域有监督学习提供基线判别力,目标域通过置信度筛选的高质量伪标签驱动掩码目标域学习(MTDL)。为了消除掩码域与原始域之间的域漂移,框架部署了双路掩码生成对抗自适应通道:\(G^s\)\(D^s\) 负责将掩码目标域对齐至源域,而 \(G^t\)\(D^t\) 负责将掩码源域对齐至目标域,实现双向互补的域对齐闭环。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入数据<br/>源域 (x^s, y^s) 与 无标签目标域 x^t"] --> MTDL["1. 掩码目标域学习<br/>高置信度伪标签驱动 + 目标熵正则"]
    MTDL --> Enc["Transformer 编码器 E<br/>提取可见 Patch 隐特征与 [CLS] Token"]
    Enc --> DecRec["2. [CLS] 特征级对抗重构<br/>Transformer 解码器补全掩码信息空缺"]
    DecRec --> CondAdv["3. 类别条件对抗分布对齐<br/>类别预测与域标签拼接,消除域间分布漂移"]
    CondAdv --> DualAlign["4. 双向对抗对齐闭环<br/>掩码目标→源域 与 掩码源→目标域 双向互补"]
    DualAlign --> Out["下游自适应推理<br/>纯编码器推理,零额外解码器计算开销"]

关键设计

1. 掩码目标域学习:置信度筛选与目标熵双重约束

为了让模型在无真实标签的目标域上激活自适应表征,模型对完整目标图像 \(x^t\) 计算预测概率 \(F(x^t)\) 并生成伪标签 \(\hat{y}^t = \arg\max F(x^t)\)。针对掩码率 \(\rho\) 处理后的残缺目标图像 \(\mathcal{M}[x^t, \rho]\),仅当完整图像的最大预测置信度超过阈值 \(\eta\) 时,才将其作为可靠伪监督信号优化交叉熵损失。由于过度拟合有标签源域与部分伪标签容易导致表征在未标记目标域上坍缩,方法进一步引入无监督熵正则项:一方面最小化每个样本的预测熵以促使决策边界远离高密度区域,另一方面最大化目标域全局平均预测的香农熵以防止所有样本退化预测至单一类别。

2. [CLS] 特征级对抗重构:摆脱像素冗余的高维语义补全

掩码机制造成的大量视觉信息丢失是导致掩码特征与原始特征存在「信息空缺」的根因。不同于传统 MAE 等在像素空间对 RGB 像素做均方误差(\(L_2\))重构的做法,本文指出像素级重构会强迫网络耗费大量容量去记忆高频纹理、光照等无助于迁移的底层细节;相比之下,全局 \([CLS]\) Token 凝聚了图像的高阶判别语义。方法利用 4 层 Transformer 解码器 \(G^s\),将编码后的可见 patch 特征与包含位置编码的共享可学习掩码向量拼接,重构出完整图像的 \([CLS]\) Token。并且,放弃严苛的逐元素 \(L_2\) 约束,改用对抗训练损失,使解码器在语义隐空间中更加灵活地还原判别性表征,避免过强重构惩罚对迁移表征学习带来的负面干扰。

3. 类别条件对抗分布对齐:联合建模类别结构与域判别

单纯修补信息空缺并不能消除源域与目标域因采集条件不同而固有的分布漂移。当解码器 \(G^s\) 具备将掩码源域 \([CLS]\) 重构成原始源域 \([CLS]\) 的能力后,若目标域与源域已完成对齐,则通过 \(G^s\) 解码出的掩码目标域 \([CLS]\) 特征也应与原始源域特征无法区分。方法构建了一个三方 Min-Max 博弈结构:采用类别条件判别器 \(D^s\),将网络输出的类别软预测向量 \(p\) 与域标识向量拼接作为判别标签。判别器不仅要区分特征来自原始域还是重构掩码域,还要对齐细粒度的类间几何结构;编码器与解码器联合对抗判别器,迫使掩码目标域特征分布在隐空间向源域紧密聚合。

4. 双向对抗对齐闭环:补齐掩码目标与原始目标的信息短板

单向的「掩码目标域→源域」映射虽然建立了迁移路径,但它遗漏了掩码目标域与原始目标域之间的自洽性约束。为此,方法拓展出对偶分支「掩码源域→目标域」,引入第二对解码器 \(G^t\) 与类别条件判别器 \(D^t\)。通过将加掩码的源域图像送入 \(G^t\) 并对抗对齐到目标域的 \([CLS]\) 特征分布,两组对抗分支在源域与目标域之间架起了对称互逆的桥梁。对偶结构不仅在理论上严格闭合了目标期望泛化误差的上界,更在实践中极大缓解了大间隙迁移下的单向过拟合问题。

损失函数 / 训练策略

Dual-MGAT 的端到端联合训练目标由三部分融合而成:

\[\min_{E,C,G^s,D^s,G^t,D^t} \mathcal{L}_{total} = \mathcal{L}_{mtdl} + \mathcal{L}_{mgaa}^s + \mathcal{L}_{mgaa}^t\]

其中掩码目标域学习损失 \(\mathcal{L}_{mtdl}\) 包含源域监督分类、高置信度掩码目标交叉熵及无监督熵正则:

\[\mathcal{L}_{mtdl} = \mathcal{L}_{cls}(C, E) + \mathcal{L}_{mdl}(C, E) + \lambda_{unsup} \mathcal{L}_{unsup}(C, E)\]

对于掩码生成对抗自适应损失 \(\mathcal{L}_{mgaa}^s\),以源域分支为例,判别器 \(D^s\) 的交叉熵目标函数为:

\[\mathcal{L}_{d}^s(D^s) = \mathbb{E}\left[\mathcal{L}_{ce}\left(D^s(E(x^s)[0]), [p^s; \mathbf{0}]\right)\right] + \mathbb{E}\left[\mathcal{L}_{ce}\left(D^s(G^s(f^s)[0]), [\mathbf{0}; p^s]\right)\right] + \mathbb{E}\left[\mathcal{L}_{ce}\left(D^s(G^s(f^t)[0]), [\mathbf{0}; p^t]\right)\right]\]

编码器 \(E\) 与解码器 \(G^s\) 则通过反转标签最小化 \(\mathcal{L}_{g}^s\)。对偶分支 \(\mathcal{L}_{mgaa}^t\) 采用完全对称的架构与损失形式。训练超参数中,掩码率 \(\rho=0.7\),置信度阈值 \(\eta=0.7\),对抗平衡权重 \(\lambda_{adv}=0.1\),无监督熵权重 \(\lambda_{unsup}=0.01\);使用 AdamW 优化器训练 50 个 epoch,分类器学习率设为骨干网络(base lr \(1\times 10^{-5}\))的 10 倍。

实验关键数据

主实验

在三个标准基准数据集(Office-Home、Office-31、DomainNet)及真实临床眼科白内障诊断(Cataract:裂隙灯 Slit-Lamp \(\to\) 普通相机 Camera)上进行了全面评估。骨干网络统一采用 ViT-B。

数据集 任务/设置 Dual-MGAT (本文) 前序最强 SOTA 涨幅
Office-Home (65类) 4 域 12 任务平均 89.1% 86.2% (MIC) +2.9%
Office-31 (31类) 3 域 6 任务平均 95.1% 93.5% (SSRT) +1.6%
DomainNet (345类) 6 域 30 任务平均 58.2% 52.4% (PMTrans) +5.8%
DomainNet 极端任务 Quickdraw \(\to\) Infograph 27.7% 17.4% (PMTrans) +10.3%
DomainNet 极端任务 Quickdraw \(\to\) Painting 50.9% 38.9% (PMTrans) +12.0%
Cataract 白内障诊断 Slit-Lamp \(\to\) Camera (AUC) 94.8% 85.9% (PMTrans) +8.9%
Cataract 白内障诊断 Slit-Lamp \(\to\) Camera (特异度) 97.1% 85.7% (PMTrans) +11.4%

消融实验

消融实验深入验证了各核心模块的独立与协同作用,以及特征级与对抗损失设计的合理性(以 DomainNet 的 clp \(\to\) inf 与 inf \(\to\) clp 任务为例):

实验组别 / 配置 clp \(\to\) inf inf \(\to\) clp 平均准确率 (%) 说明
基础组件消融
\(\mathcal{L}_{cls}\) (源域监督 Baseline) 29.5 61.3 45.4 仅在有标签源域训练
\(\mathcal{L}_{cls} + \mathcal{L}_{mtdl}\) 33.0 68.4 50.7 引入掩码目标域学习 (+5.3%)
\(\mathcal{L}_{cls} + \mathcal{L}_{mgaa}^s\) 33.7 69.6 51.7 引入掩码目标\(\to\)源域对抗自适应
\(\mathcal{L}_{cls} + \mathcal{L}_{mtdl} + \mathcal{L}_{mgaa}^s\) 35.8 74.8 55.3 结合单向对抗与掩码学习
完整模型 (Dual-MGAT) 36.4 75.6 56.0 纳入对偶对齐分支 \(\mathcal{L}_{mgaa}^t\) 达最优
重构空间与重构损失消融
像素空间重构 + \(L_2\) Loss 27.2 61.0 44.1 像素级硬约束导致负迁移,低于 baseline
像素空间重构 + 对抗 Loss 32.4 62.7 47.6 对抗损失略微缓解像素级退化
[CLS] 特征空间 + \(L_2\) Loss 32.7 66.7 49.7 语义特征级重构显著优于像素级
[CLS] 特征空间 + 对抗 Loss (本文设计) 33.7 69.6 51.7 语义级对抗重构取得最佳性能

关键发现

  • 信息空缺与分布漂移必须解耦消除:对比直接应用细粒度域判别器(FADA)将掩码目标拉向源域(54.5%),仅修复信息空缺可提升至 54.7%,而联合完成信息补全与分布对齐(MGAA)跃升至 55.3%。暴力对齐因未解决残缺特征的信息缺失而陷入次优。
  • 特征级重构超越像素重构:像素级 \(L_2\) 重构使均值准确率从基线的 45.4% 跌落至 44.1%,证明迫使模型重建底层像素不仅浪费容量,还会破坏用于域迁移的高维语义;[CLS] 特征级对抗重构则能无损迁移关键判别结构。
  • 极端跨域表现卓越:在草图(Quickdraw)到信息图(Infograph)这种几何结构与风格分布断裂最悬殊的任务上,Dual-MGAT 相对 PMTrans 取得了超过 10 个百分点的断层式领先,验证了双向掩码对齐机制在应对极大多模态间隙时的鲁棒性。

亮点与洞察

  • 从样本增广升维至分布级域构建:跳出了「将掩码图像作为局部一致性正则化数据增强」的传统狭隘视角,首次在理论与方法上将掩码样本建模为独立的「掩码域」,完整构建了掩码域自适应的理论边界与优化路径。
  • [CLS] 特征级对抗生成的巧妙设计:巧妙绕开了 MAE 在 UDA 中重构像素的沉重负担与负迁移弊端,只针对决策核心的全局 [CLS] Token 实施松弛度更高的对抗重构,以极小的计算开销兼顾了语义补全与域自适应。
  • 非对称到对称的双向对齐闭环:通过引入反向「掩码源域→目标域」生成对抗路径,不仅补齐了掩码目标域与原始目标域之间的自洽性间隙,还使源域与目标域特征形成双向映射互验,泛化界更为紧致。

局限与展望

  • 解码器带来的额外训练成本:虽然测试推理阶段无需解码器参与、不产生任何额外计算耗时,但在训练过程中需要同时维持两个 4 层的 Transformer 解码器与两个判别器,带来了一定的显存占用与反向传播计算量。
  • 强依赖伪标签质量:掩码目标域学习与类别条件判别器均直接依赖于目标域的预测伪标签;在极度困难的冷启动初期,若伪标签噪声比例过高,置信度阈值机制仍可能过滤掉过多有用样本或引入噪声累积。
  • 未来方向:探索无需双解码器的参数共享自回归生成机制,或将该框架推广至基于连续掩码扩散模型(Diffusion)的高维域自适应表征学习中。

相关工作与启发

  • vs MIC (CVPR 2023): MIC 仅在目标域样本级别约束完整图像与掩码图像的预测一致性,忽略了掩码破坏带来的宏观域漂移;本文将掩码处理显式形式化为「掩码域」,并在全局特征空间设计了解耦消除信息差与分布差的生成对抗路径,跨域性能显著更优。
  • vs PMTrans (CVPR 2023): PMTrans 依赖 Patch 级别的源-目标图像强行线性插值(Mixup)来人工拼接中间域,面对风格差异极大的异构域容易生成非自然混合噪声;本文利用自身掩码生成的内在空间构建天然过渡桥梁,无需跨样本硬性拼接,在 DomainNet 上实现 5.8% 的全面反超。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次从「掩码域」视角系统解耦信息空缺与分布漂移,并提出 [CLS] 级对抗重构与双向闭环。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 3 个学术基准、1 个真实临床医学迁移任务、细致的组件与损失函数消融及 t-SNE 可视化。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论界定严谨(推导了掩码域适应定理),框架动机清晰,行文流畅充实。
  • 价值: ⭐⭐⭐⭐⭐ 为掩码图像建模与视觉 Transformer 在迁移学习与自适应任务中的深层结合指明了新范式。