跳转至

Revisiting Diffusion Fine-Tuning for Unsupervised Domain Adaptation

会议: NeurIPS2026
arXiv: 2609.33716
论文: 项目页面
领域: 无监督域适应 / 扩散模型
关键词: 多目标域适应、共享私有适配器、梯度解耦、桥接数据、参数高效微调

一句话总结

MUSE 将扩散生成器的适应拆成仅由源域标签训练的共享语义分支和目标域条件化风格分支,一次源域参与的微调支持多个目标域生成桥接数据,在三个闭集分类基准上提升下游 UDA 平均准确率,并相对 Terra 将生成器微调时间缩短至原来的约一半至四成。

研究背景与动机

无监督域适应(UDA)有源域图像及标签,也有目标域图像,但没有目标域训练标签。传统方法通过特征分布对齐、对抗训练或伪标签来帮助分类器跨域迁移;扩散方法则先把数据变得更接近目标域,再把带标签的合成图像交给下游适应算法。困难不只是“生成好看的目标风格图像”,而是生成结果还必须保留类别,否则用于训练的合成标签会变成噪声。

Terra 和 DCDM 等方法主要针对一个源域与一个目标域建立生成过程。若同一个有标签源域需要服务多个目标域,逐对适应就会反复学习相同的源域类别知识,同时为每个目标重新维护生成器适应参数。把所有目标简单混在一起也不理想:不同目标的外观更新可能相互干扰,而无类别提示的目标重建损失还可能改写共享类别信息。本文因此研究的是多目标域的数据生成,而不是直接提出一个同时分类所有目标的统一分类器。

源域监督可复用,但目标外观仍须分别适应;本文用参数共享和梯度路由表达这一分工,而不假定语义与风格在真实图像中严格独立。核心 idea:把源域类别知识写入只接受源域梯度的共享语义分支,让多个目标共享风格投影、各自维护小型私有核心,再用目标专属分支生成有标签桥接数据,复用源域学习而保留目标差异。

方法详解

整体框架

输入是一个有标签源域和多个无标签目标域,所有域共享类别集合,这是闭集假设,不是无需目标数据的域泛化。MUSE 冻结 SDXL 的原始 U-Net、VAE 和两个文本编码器,只在 U-Net 注意力的 query、key、value、output 投影中加入共享私有适配器。每个源域执行一次联合多目标微调;训练完成后,选择目标索引即可生成该目标的桥接数据。

整个流程有四项关联设计:共享私有适配器决定哪些参数复用;双遍梯度解耦保护源域类别信息;自适应目标采样分配目标更新预算;双路桥接生成把适应后的生成器转化为下游分类监督。每个目标最终仍使用自己的无标签图像与桥接集合训练 MCC、ELS 或 SSRT,而不是直接用扩散去噪器预测分类标签。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["有标签源域<br/>多个无标签目标域"] --> B["共享私有适配器"]
    B --> C["双遍梯度解耦"]
    C -->|训练:目标损失 EMA| D["自适应目标采样"]
    D -.->|训练:选择下一目标| C
    C -->|微调完成;推理选目标核心| E["双路桥接生成"]
    E -->|源图反演或噪声生成;继承标签| F["目标专属桥接集合"]
    A -.->|下游训练:无标签目标图像| G["MCC / ELS / SSRT"]
    F -->|下游训练:合成标签监督| G

关键设计

1. 共享私有适配器:大投影共享,小核心区分目标

每个注意力投影在冻结权重之上叠加两个分支。语义分支是普通低秩更新,所有目标复用同一套参数;风格分支不是每个目标都拥有完整 LoRA,而是所有目标共享输入和输出投影,只在两者中间插入目标自己的小方阵。目标 \(m\) 的适应权重为:

\[ \widetilde W_{\ell}^{(m)}=W_{0,\ell}+U_{\ell,\mathrm{sem}}V_{\ell,\mathrm{sem}}+U_{\ell,\mathrm{sty}}\Omega_{\ell}^{(m)}V_{\ell,\mathrm{sty}}. \]

这里语义秩为 32,风格秩为 64,因此每个目标每层新增的是一个 \(64\times64\) 私有核心,而不是重新保存所有低秩投影。源域条件关闭整个风格项;目标条件只激活对应核心,其余目标核心不参与该样本的去噪前向。这样既避免完全混合目标,又让多个目标能在共同风格子空间中复用参数。

附录 A 的参数结论有明确参照:对同一适配器形式的独立逐目标版本,若 \(L\) 为适配层数、\(S=\sum_\ell(d_\ell^{\mathrm{in}}+d_\ell^{\mathrm{out}})\),独立版本需要 \(M[(r_{\mathrm{sem}}+r_{\mathrm{sty}})S+Lr_{\mathrm{sty}}^2]\) 个训练参数,MUSE 需要 \((r_{\mathrm{sem}}+r_{\mathrm{sty}})S+MLr_{\mathrm{sty}}^2\)。每增加一个目标只增加 \(Lr_{\mathrm{sty}}^2\) 个核心参数;这是适配器参数计数,不是整个 SDXL、优化器状态、激活显存或全流程存储的计数,也不是对所有 PEFT 方法的普遍优势证明。

2. 双遍梯度解耦:目标前向借用语义,目标反向不能修改语义

每个优化迭代包含一次源域去噪和一次目标域去噪。源图用类别提示 a y,关闭目标私有核心,去噪损失只更新共享语义因子。目标图没有标签,使用通用提示 an image,开启所选目标核心;共享语义分支仍参加前向预测,但被 stop-gradient,因此目标重建不能直接改写源域学到的类别参数。

目标反向更新共享风格投影和私有核心,两个分支的梯度在互不重叠的参数集合上累积,随后只进行一次优化器更新。它不是先用源域、再用目标域轮流覆盖同一套参数;语义分支也不是整个训练过程都冻结,而是持续接受源域监督。共享风格投影仍会受到不同目标的共同更新,因此这种路由消除了语义参数上的直接源目标梯度干扰,并不消除所有跨目标耦合。

目标侧还对全部私有核心施加多样性与幅度正则,即便某个目标本轮没有被选中,其核心仍可能收到正则梯度:

\[ \mathcal L_{\mathrm{orth}}=\sum_{\ell}\sum_{i<j}\left\|(\Omega_{\ell}^{(i)})^\top\Omega_{\ell}^{(j)}\right\|_F^2,\qquad \mathcal L_{\mathrm{core}}=\sum_{\ell}\sum_m\|\Omega_{\ell}^{(m)}\|_F^2. \]

第一项惩罚目标核心系数的相关性,第二项抑制核心幅度。由于共享风格投影没有正交归一约束,核心系数空间中的正交惩罚不等于实际完整权重更新严格正交;同样,小核心范数也不是完整风格更新范数的硬约束。

3. 自适应目标采样:提高难拟合目标的有效损失权重

一个目标遍历只读取一个目标域的小批次,不同时运行所有目标分支。采样从均匀分布开始,每次仅更新被抽中目标的去噪损失指数移动平均,未抽中目标的统计保持不变;较大的近期损失意味着该域更难被当前生成器重建,因此后续获得更多目标侧更新。采样概率为:

\[ p_m=\frac{(\bar\ell_m+\tau)^\alpha}{\sum_{k=1}^M(\bar\ell_k+\tau)^\alpha}. \]

实现使用 EMA 系数 0.9、\(\tau=10^{-6}\)、\(\alpha=1\),每 20 个优化步骤重算概率。这里的“难”指去噪重建难度,不是目标分类错误率,作者没有目标标签来直接测分类困难。

关键边界在于没有 \(1/p_m\) 重要性校正。给定当前采样分布,目标去噪项的期望是 \(\sum_m p_m\lambda_m\mathcal L_{\mathrm{sty}}^{(m)}\),而不是正文式 (6) 的固定 \(\sum_m\lambda_m\mathcal L_{\mathrm{sty}}^{(m)}\);实现所有 \(\lambda_m=1\)。所以自适应采样不仅改变训练访问频率,也动态改变有效域权重。附录 C 明确说明这一差别,不能把它描述成固定均匀目标的无偏加速估计;核心正则仍在每轮覆盖全部目标。

4. 双路桥接生成:结构继承与类别多样性分别提供监督

微调完成后,共享语义和风格投影不变,只切换目标核心。第一路对带标签源图执行 DDIM 反演,再在目标分支下去噪,得到目标风格图像,标签继承源图;这一路利用具体实例结构来降低类别漂移。第二路从高斯噪声出发,用 a y 类别提示和同一目标分支生成图像,标签来自提示类别,每个目标每类生成 50 张,补充源实例之外的类内变化。

两路集合通过数据集拼接形成桥接集合,论文中的集合并符号不是图像混合、潜变量相加或去重操作。下游 UDA 学习器同时接收有标签合成桥接数据和真实无标签目标数据;合成标签由源标签或提示自动赋予,不代表每张生成图的语义均经过人工验证。源图反演和噪声生成互补,但是否保持标签仍受扩散先验与域差异影响。

一个完整示例

以 miniDomainNet 的 Real 为源域,Clipart、Painting、Sketch 为三个目标。源域一张带有 lion 标签的照片用 a lion 做源遍历,只更新语义分支;若当前抽中 Sketch,一批无标签 Sketch 图像用 an image 做目标遍历,语义前向可见但停止梯度,Sketch 核心及共享风格投影接受去噪梯度,全部核心接受正则梯度。

训练后,为 Sketch 对这张 lion 源图做 DDIM 反演并用 Sketch 核心去噪,生成的桥接图继承 lion 标签;再从噪声生成每类 50 张 Sketch 风格样本,把两路样本拼接,与真实 Sketch 无标签图像一起训练下游分类器。切换到 Clipart 或 Painting 时复用生成器共享部分、换对应核心,仍要分别生成目标数据和训练下游学习器;省去的是重复源域参与的生成器微调,不是这些后续步骤。

损失函数 / 训练策略

两次去噪都在冻结 VAE 的潜空间中进行,使用加噪潜变量与时间步相关权重的平方预测误差;去噪监督由预训练 scheduler 决定,标准噪声预测情形下就是所加噪声。源侧只有语义去噪损失;目标侧为被抽中目标的去噪损失,加权加入上述核心正则,权重分别为 \(\lambda_{\mathrm{orth}}=10^{-4}\) 和 \(\lambda_{\mathrm{core}}=10^{-5}\)。

图像分辨率为 \(1024\times1024\),训练 10,000 步,每设备批量 8、梯度累积 1,每步包含一个源批次和一个目标批次。使用 8-bit AdamW、无 warmup 的恒定学习率;语义因子和共享风格投影学习率为 \(5\times10^{-5}\),私有核心为 \(5\times10^{-3}\),高 100 倍。权重衰减为 \(10^{-4}\),梯度裁剪最大范数为 1.0。

VAE 使用 fp32,U-Net 使用 fp16 混合精度并开启梯度检查点。附录 D 指定单张 A100 80GB 与 16 个 CPU 核,验证及最终采样采用 DPMSolver multistep scheduler,定性样本默认去噪 25 步;不要把这个定性设置自动当成所有反演环节的完整步数规范。

实验关键数据

主实验

Office-31 有 3 个域、6 个有向迁移任务;Office-Home 和 miniDomainNet 均使用 4 个域、12 个任务。指标为真实目标图像的 top-1 准确率(%),下表保留原表的任务平均值。MCC、ELS 为 CNN 方法,SSRT 为 transformer 方法;比较同一下游学习器才能较好隔离生成策略的影响,不能把不同骨干的差距归功于 MUSE。

数据集 下游学习器 不加扩散 Terra 逐对生成 DCDM 逐对生成 MUSE 多目标生成
Office-31 MCC 89.61 91.34 91.01 91.77
Office-31 ELS 90.21 91.28 91.80 92.36
Office-31 SSRT 93.50 93.73 95.29 95.53
Office-Home MCC 72.24 75.45 73.71 76.53
Office-Home ELS 71.84 76.26 73.64 77.57
Office-Home SSRT 85.43 85.58 86.54 88.15
miniDomainNet MCC 61.35 61.57 62.98 64.02
miniDomainNet ELS 60.09 61.16 63.60 65.04
miniDomainNet SSRT 80.78 81.31 81.26 84.37

来源:正文 Tables 1–3。扩散方法统一使用每类 50 张条件生成图及源到目标反演图的拼接作为合成监督。MUSE 在九个“数据集 × 学习器”组合的平均值均最高,但并非每个迁移任务都胜出。例如 Office-Home 的 SSRT 下,Ar→Cl 为 MUSE 79.09、DCDM 79.34。

微调效率只比较同属预训练扩散基础模型适应的 Terra 和 MUSE;DCDM 不微调 SDXL 这类预训练基础模型,因此不纳入这组时间与适配器参数比较。

数据集 每个源域的目标数 Terra 微调时间(h) MUSE 微调时间(h) 加速 Terra / MUSE 单进程峰值显存(GiB)
Office-31 2 96.78 51.74 1.87× 32.433 / 27.849
Office-Home 3 196.36 80.79 2.43× 32.433 / 27.835
miniDomainNet 3 197.68 81.04 2.44× 32.433 / 27.835

来源:正文 Table 4、附录 A Table 5。时间是完整基准协议的累计生成器微调时间,不是一次源域训练的时间,也不包含桥接生成与下游训练。显存是每个训练进程 PyTorch 分配张量的峰值;独立任务并发时的显存求和不能当作 Terra 单进程显存,串行 Terra 的峰值仍是 32.433 GiB。

消融实验

以下均为 Office-Home 的 12 任务平均准确率(%),不混入其他数据集的消融结果。

配置 MCC ELS SSRT 对照含义
完整 MUSE 76.53 77.57 88.15 两路桥接、梯度解耦、自适应采样及核心正则
去除核心正交正则 75.22 75.58 87.04 仍保留幅度正则
目标遍历也更新语义分支 74.56 74.98 87.12 取消目标侧 stop-gradient
均匀目标采样 75.74 76.78 86.94 其他设置不变
仅反演桥接图 73.20 74.14 85.73 不加噪声条件生成图
仅条件生成图 73.16 73.97 85.16 不加反演桥接图

来源:附录 F Tables 9–11、13。去掉一类桥接数据的降幅最大:ELS 只用反演或条件生成时分别下降 3.43、3.60 个百分点;让目标也更新语义分支下降 2.59 个百分点,去掉正交正则下降 1.99 个百分点,均匀采样下降 0.79 个百分点。两路拼接也增加了样本量,因此这一消融不能单独证明收益全部来自样本类型互补,而非数据规模。

关键发现

  • SSRT+MUSE 相对 SSRT+Terra 的平均收益依次为 1.80、2.57、3.06 个百分点。miniDomainNet 的这一比较更强,但不能泛化成每种学习器、每种参照都在该数据集收益最大。
  • 附录 F 的 prompt-only 分析中,ELS+SDXL 类别提示平均值为 69.92%,详细目标风格提示为 73.23%,再经置信度筛选为 73.99%,仍低于 ELS+MUSE 的 77.57%。这些是生成器未做源目标微调的对照,不意味着其下游不使用目标数据。
  • 反演生成每图 4.23 秒,纯噪声类别生成每图 2.08 秒(Table 12)。参数与微调时间节省没有消除生成延迟,也不能据此宣称端到端训练加速 2.44×。
  • 附录 E 报告三个独立运行的逐任务标准差,未提供平均准确率的置信区间。原文存在待核实的跨表一致性问题:Office-31 的 SSRT+MUSE 在 D→W、W→D 均写 100.00%,对应标准差却为 0.29、0.62;SSRT+DCDM 的部分 100.00% 项也伴随非零标准差。这里保留原数,不擅自修正;若均值严格为 100%,这种标准差不能同时成立,具体是舍入还是报告问题需作者说明。

亮点与洞察

  • 共享边界建立在监督来源上,而不只是参数矩阵形状上。源域有类别提示、目标域只有通用提示,只有前者能改写语义分支,这让“可复用类别知识”具有明确的训练操作含义。
  • 风格分支共享大投影、私有小核心,使新增目标的参数斜率较小。可迁移的思路是先找跨域共同变化子空间,再用低维域系数调制,但共同子空间是否足够仍需要任务验证。
  • 自适应采样是动态重加权而非中性的加速技巧。复用这一设计时应同时报告目标采样概率、目标质量与正则相对尺度,避免把去噪困难误当作分类困难。

局限与展望

  • 只验证闭集图像分类;未知类别、缺失类别和类别先验变化可能使源标签生成的监督有偏。开放集或部分集扩展需要识别可迁移类别,而非原样沿用所有类别提示。
  • 源监督语义与目标外观的操作解耦不是严格语义风格解耦证明。大视角变化、遮挡、强抽象或类别相关风格会让风格分支改变判别结构,生成结果仍可能出现伪影与语义漂移。
  • 多目标联合生成器仅在每个源域支持 2 或 3 个目标的协议上评估;新增目标的参数公式不证明无需联合重训,也不证明大量目标、顺序加入目标时质量与时间保持稳定。
  • SDXL 高分辨率适应、反演和逐目标下游训练仍然昂贵。后续宜分别审计微调、生成、存储和分类器训练成本,而非只用适配器参数规模衡量部署代价。
  • 定性图片和 t-SNE 有辅助解释价值,但本任务缓存只有图注与文字,不能从中确认实际图像质量。桥接组件的等样本量对照、生成标签错误率和更多统计检验仍有价值。

相关工作与启发

  • vs Terra:Terra 为源目标对使用时变低秩适应;MUSE 的关键是跨目标共享源监督语义及风格投影。优势落在多目标复用,而不是证明每个单目标都必须使用 MUSE。
  • vs DCDM:两者都用目标相关合成监督改善下游 UDA,但生成器适应形式不同。准确率可在相同下游协议下比较,SDXL PEFT 微调时间不能机械套用到 DCDM。
  • vs MCC / ELS / SSRT:这些方法负责判别式下游适应,MUSE 改变的是它们使用的合成监督数据,属于可组合的数据侧补充而非替代分类器。
  • 研究启发:可进一步让共享风格秩按目标结构差异自适应,并用标签保持质量而不仅是去噪损失控制采样预算。这是笔记提出的后续方向,不是论文已验证结果。

评分

  • 新颖性: 4/5 — 将多目标复用落实到共享投影、私有核心和监督来源明确的梯度路由。
  • 实验充分度: 4/5 — 三个基准、三类学习器及主要组件消融较完整,但目标数量较少,成本和数据量控制仍有限。
  • 写作质量: 4/5 — 附录清楚交代有效采样权重与正交边界,跨表满分准确率与标准差需澄清。
  • 价值: 4/5 — 为多目标扩散 UDA 提供可复用生成器方案,但不属于低成本或无需目标数据的适应方法。