Source-Agnostic Image Translation Based on Latent Aware Adaptive Masking¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/dtoma95/PM-Edit
领域: 图像生成
关键词: 图像到图像翻译、扩散模型、自适应掩码、源域无关、渐进式修复
一句话总结¶
PM-Edit 提出了一种源域无关的无监督图像到图像翻译框架,通过离线统计目标域在各时间步的去噪预测差异来建立动态时间阈值,在反向扩散中迭代累积最小必要掩码并结合渐进式修复,在仅依赖目标域预训练模型且无需额外训练的前提下实现了高保真度与强真实感的局部自适应图像编辑。
研究背景与动机¶
无监督图像到图像翻译(I2I)旨在缺少成对训练样本的条件下实现跨域属性转换。传统的无监督翻译方法早期普遍建立在生成对抗网络(GAN)之上,例如 CycleGAN 引入循环一致性损失、CUT 利用对比学习最大化跨域斑块互信息。然而,对抗训练本身固有的模式崩塌风险与生成分布容量瓶颈,使得 GAN 模型在处理多模态高分辨率复杂几何形变时往往表现欠佳,容易产生不自然的伪影或内容扭曲。
随着去噪扩散概率模型(DDPM/DDIM)的崛起,生成质量与分布覆盖度得到了质的飞跃。近期的扩散翻译工作大多致力于设计跨域引导机制,例如 EGSDE 预训练能量函数、CycleDiffusion 依赖双向扩散反转、BBDM 与 UNSB 学习跨域布朗桥或薛定谔桥映射。但是,这些方法严重依赖源域和目标域两套数据的联合建模与专门训练;而在实际落地场景中,源域分布往往完全未知或频繁切换。少数现存的源域无关(Source-Agnostic)方案如 SDEdit 和 ILVR,虽可仅基于目标域模型工作,却只能对全图施加无差别的噪声注入与低频约束,无法区分源图像中的“域特异特征”(需替换)与“领域共享特征”(需保留),最终在真实感(Realism)与内容忠实度(Faithfulness)之间顾此失彼。
掩码引导扩散(如 DiffEdit)虽然尝试通过模型在潜空间中的预测差异生成二值掩码以保护未编辑区域,但现有方案均在单时间步下基于静态硬阈值计算掩码,且整个逆扩散过程保持不变。事实上,扩散模型在不同噪声尺度下的预测置信度与语义粒度差异极大——早期时间步主导全局语义与大尺度几何轮廓,后期时间步才聚焦高频纹理细节,静态单一掩码必然造成早期欠编辑或晚期过度覆盖。核心 idea:通过离线统计目标域在各时间步的预测差异经验分布,构建随噪声层级自适应调整的时间依赖统计阈值,在反向扩散过程中动态累积最小必要掩码,并驱动渐进式修复网络仅修改跨域不一致区域,实现免训练、源域无关的高保真图像翻译。
方法详解¶
整体框架¶
PM-Edit 围绕“预先统计目标域预测误差分布 → 逆扩散中动态累积二值掩码 → 掩码引导渐进式修复生成”三阶段流水线展开。整个方法完全免微调,仅需一个在目标域 \(X\) 上预训练好的 DDPM/DDIM 降噪骨干网络 \(\epsilon_\theta\)。
输入源域参考图像 \(y\),系统首先在离线阶段对目标域样本执行单步预测,提取各时间步 \(t\) 下预测差异的经验均值 \(\mu_{D_t}\) 与标准差 \(\sigma_{D_t}\),合成时间自适应动态阈值 \(\delta_t\)。在推理生成阶段,系统自 \(T\) 步至 \(1\) 步倒序遍历反向扩散轨迹:在每一个时间步 \(t\),对比当前生成潜变量 \(x_t\) 与经掩码混合的加噪源图 \(\tilde{y}_t\) 在模型一步重建投影上的局部差异 \(D_t\);超过阈值 \(\delta_t\) 的区域判定为该时间步新增的域不一致区域 \(\Delta M_t\),并与历史掩码取并集累积更新为 \(M_t\)。最后,将序列掩码 \([M_T, \dots, M_1]\) 经微弱膨胀与高斯平滑后,输入定制的 RePaint 渐进式修复算法中,协同引导最终高保真翻译图像 \(x_0\) 的生成。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入源域图像 y 与目标域预训练扩散模型"] --> B["离线时间依赖统计阈值<br/>目标域单步去噪差异统计 -> 动态阈值序列"]
B --> C["潜空间感知掩码动态累积<br/>反向轨迹逐层计算差异 -> 累集更新最小掩码"]
C --> D["多批次平均与动态渐进修复<br/>多随机种子消除漂移 -> 随步动态掩码 RePaint 修复"]
D --> E["输出源域无关翻译图像 x0"]
关键设计¶
1. 离线时间依赖统计阈值:消除固定阈值的层级偏差
由于反向扩散过程覆盖从高方差纯高斯噪声到低方差干净图像的巨大跨度,扩散骨干网络在不同噪声尺度下的预测方差有着本质区别(中间时间步负责解耦全局粗粒度结构,误差方差最大;首尾阶段方差相对收敛)。若采用单一固定的绝对阈值对预测差异进行二值化,极易导致高噪声阶段全图被误判为异常、或低噪声阶段无法捕获微小结构差异。为此,本文直接在目标域训练集 \(z \sim \mathcal{X}\) 上进行先验校准:对任意目标样本加噪至 \(z_t\) 与 \(z_{t+1}\),通过单步 DDIM 采样求取预测潜变量 \(\hat{z}_t\),进而统计单步预测差异 \(D_t(z_t, \hat{z}_t)\) 的像素级期望均值 \(\mu_{D_t}\) 与标准差 \(\sigma_{D_t}\)。由此,在任意时间步 \(t\) 构造由单一超参数 \(\lambda\) 控制的自适应统计阈值:
该统计特性只需对目标域模型计算一次,即可通用适配任何未知的源域参考输入。实际测算表明,差异统计量在去噪过程的中段达到峰值,与扩散网络在语义构建关键期的动态特性完全契合。
2. 潜空间感知掩码动态累积:随去噪进程自适应定位跨域差异
传统方法在静态单步计算掩码时,由于无法预知后续细节演化,必须设置较宽的掩码容限。本文提出随反向扩散逐步放大的“最小必要掩码”机制。在时间步 \(t\),当前生成的潜状态 \(x_t\) 是从上一阶段的混合潜变量 \(\tilde{x}_{t+1} = M_{t+1} x_{t+1} + (1 - M_{t+1}) y_{t+1}\) 经确定性 DDIM 去噪推导而来。此时,\(x_t\) 与加噪源图 \(y_t\) 仅在 \(M_{t+1}\) 所限定的区域存在显著分歧。为了检测从步长 \(t+1\) 到 \(t\) 期间新涌现的跨域特征冲突,算法将加噪源图像与生成样本根据 \(M_{t+1}\) 拼接出 \(\tilde{y}_t = M_{t+1} y_t + (1 - M_{t+1}) x_t\),并通过网络单步预测算子 \(f_\theta\) 计算两者的逐像素预测差异:
(在实际实现中亦可采用 \(1 - \text{SSIM}\) 作为结构差异度量)。若某像素点的差异超过当前步的动态阈值 \(\delta_t\),则标记为新增掩码区域 \(\Delta M_t = \mathbb{I}(D_t(x_t, \tilde{y}_t) > \delta_t)\)。最终当前时间步的累积掩码更新为:
这种递推增量机制不仅自动屏蔽了前序已经判定为异常的区域,更保证了掩码随着图像结构逐步清晰而由粗到细动态生长,绝不覆盖能够安全复用的源域背景与共享骨架。
3. 多批次平均与动态渐进修复:抑制单步噪声漂移并保障边界融合
即便在确定性 DDIM 轨迹中,由于高噪声阶段高斯扰动的随机波动,单次预测误差仍可能夹杂局部离群极值,导致掩码边缘支离破碎。为构建干净连贯的边界,PM-Edit 在反向生成掩码序列时,引入 \(N\) 个随机初始噪声批次并行前向推导,对得到的预测差异图 \(D_t\) 取算术平均后再进行二值化截断,显著消除了随机噪声斑点伪影。
在获得掩码序列 \([M_T, \dots, M_1]\) 后,直接执行单次线性合成往往会在掩码分界线处留下拼缝或纹理跳跃。为此,方法拓展了 RePaint 算法:在完整的反向去噪修复阶段,每前进 20 步便倒退 10 步重新加噪去噪,重复迭代 2 次以增强生成上下文与已知区域的双向信息流动;更为关键的是,传统 RePaint 全程使用静态掩码,而本文在第 \(t\) 步严格施加对应的时间步掩码 \(M_t\)(预先施加核大小 11、标准差 5.0 的形态学膨胀与高斯平滑),使修复网络在前期拥有大尺度结构重构自由度、在后期精准收敛到精细边界融合,确保了全局结构协调与过渡平滑。
一个完整示例¶
以野生动物(Wild)向家犬(Dog)的面部翻译任务为例,流程具象展开如下: 1. 初始化:输入一只狐狸面部图像 \(y\),将其缩放至 \(256 \times 256\)。预先加载 Dog 域预训练扩散模型 \(f_\theta\) 及其对应的离线统计阈值曲线 \(\delta_t\)(\(\lambda = 1.2\))。初始掩码 \(M_T\) 置为全 0。 2. 反向掩码演进:设定 100 步 DDIM 反向调度。在 \(t=80\) 早期阶段,图像高度模糊,差异度量仅在狐狸特有的修长吻部和直立耳尖轮廓处突破 \(\delta_{80}\),掩码 \(\Delta M_{80}\) 仅覆盖面部粗几何区域;进入 \(t=50\) 中期阶段,眼睛周围毛发及面颊轮廓细节浮现,差异累积使掩码 \(M_{50}\) 扩展至五官主体;至 \(t=20\) 后期阶段,毛发微观斑纹差异促成局部微调,最终 \(M_0\) 紧密包裹狐狸头部特有特征,而外部背景环境与躯干姿态区域的掩码严格保持为 0。 3. 渐进修复合成:将序列掩码按比例映射至 1000 步 RePaint 流程中。在 \(t \in [1000, 500]\) 阶段,被掩盖的狐狸吻部在 Dog 模型的强先验下重塑为圆润的犬类吻部,背景则无缝锚定原图;在 \(t \in [500, 0]\) 阶段,结合反复回退重采样与高斯羽化边缘,犬类毛皮光泽与源图背景光照完全同调,最终无缝输出逼真的家犬肖像。
实验关键数据¶
主实验¶
在 AFHQ(Wild \(\to\) Dog, Cat \(\to\) Dog)和 Celeba-HQ(Male \(\to\) Female)基准上,PM-Edit 与当前主流无监督 I2I 方法进行了严格的定量对比。在与共享相同骨干网络架构的扩散基线(ILVR、SDEdit、EGSDE、CycleDiffusion)对比中,PM-Edit 展现出全方位的性能优势;特别是在对人类视觉感知更具代表性的 KID 与 LPIPS 指标上,PM-Edit 显著超越了此前需要源域监督训练的方法。
| 任务 | 方法 | 源域训练 | FID \(\downarrow\) | KID \(\times 10^3 \downarrow\) | SSIM \(\uparrow\) | LPIPS \(\downarrow\) |
|---|---|---|---|---|---|---|
| Wild \(\to\) Dog | CUT | 是 | 92.94 | 48.0 | 0.592 | - |
| Santa | 是 | 74.93 | 31.6 | 0.453 | - | |
| UNSB | 是 | 86.72 | 40.2 | 0.524 | - | |
| SDDM | 是 | 57.38 | - | 0.328 | - | |
| ILVR | 否 | 81.34 \(\pm\) 1.44 | 36.6 \(\pm\) 1.56 | 0.289 \(\pm\) 0.001 | 0.530 \(\pm\) 0.001 | |
| SDEdit | 否 | 69.38 \(\pm\) 1.10 | 27.6 \(\pm\) 1.10 | 0.343 \(\pm\) 0.001 | 0.515 \(\pm\) 0.001 | |
| EGSDE | 是 | 57.89 \(\pm\) 0.62 | 19.2 \(\pm\) 0.98 | 0.363 \(\pm\) 0.001 | 0.504 \(\pm\) 0.001 | |
| CycleDiffusion | 是 | 56.10 \(\pm\) 0.59 | 19.5 \(\pm\) 1.02 | 0.479 \(\pm\) 0.001 | 0.465 \(\pm\) 0.001 | |
| PM-Edit (本文) | 否 | 55.64 \(\pm\) 0.61 | 17.2 \(\pm\) 0.92 | 0.479 \(\pm\) 0.001 | 0.445 \(\pm\) 0.001 | |
| Cat \(\to\) Dog | ILVR | 否 | 75.38 \(\pm\) 1.49 | 31.5 \(\pm\) 1.95 | 0.359 \(\pm\) 0.001 | 0.507 \(\pm\) 0.001 |
| SDEdit | 否 | 73.72 \(\pm\) 1.01 | 28.1 \(\pm\) 1.13 | 0.418 \(\pm\) 0.001 | 0.495 \(\pm\) 0.001 | |
| EGSDE | 是 | 63.37 \(\pm\) 0.71 | 21.4 \(\pm\) 1.21 | 0.437 \(\pm\) 0.001 | 0.471 \(\pm\) 0.001 | |
| CycleDiffusion | 是 | 58.87 \(\pm\) 0.69 | 20.4 \(\pm\) 1.10 | 0.557 \(\pm\) 0.001 | 0.426 \(\pm\) 0.001 | |
| PM-Edit (本文) | 否 | 61.31 \(\pm\) 0.73 | 18.3 \(\pm\) 1.80 | 0.551 \(\pm\) 0.001 | 0.415 \(\pm\) 0.001 | |
| Male \(\to\) Female | ILVR | 否 | 60.17 \(\pm\) 0.33 | 47.30 \(\pm\) 1.22 | 0.510 \(\pm\) 0.001 | 0.390 \(\pm\) 0.001 |
| SDEdit | 否 | 54.91 \(\pm\) 0.47 | 47.70 \(\pm\) 1.34 | 0.577 \(\pm\) 0.001 | 0.361 \(\pm\) 0.001 | |
| EGSDE | 是 | 48.50 \(\pm\) 0.24 | 45.96 \(\pm\) 0.96 | 0.579 \(\pm\) 0.001 | 0.357 \(\pm\) 0.001 | |
| CycleDiffusion | 是 | 45.04 \(\pm\) 0.23 | 45.11 \(\pm\) 0.98 | 0.564 \(\pm\) 0.001 | 0.369 \(\pm\) 0.001 | |
| PM-Edit (本文) | 否 | 50.99 \(\pm\) 0.25 | 42.10 \(\pm\) 0.91 | 0.586 \(\pm\) 0.001 | 0.356 \(\pm\) 0.001 |
消融实验¶
为了验证 PM-Edit 各模块的必要性,作者在 AFHQ Wild \(\to\) Dog 任务上实施了系统性消融。下表分别展示了核心架构改动(表左)以及阈值系数超参数 \(\lambda\) 的敏感性评估(表右)。
| 模块消融配置 | KID \(\times 10^3 \downarrow\) | LPIPS \(\downarrow\) | 说明 | 阈值系数 \(\lambda\) | FID \(\downarrow\) | KID \(\times 10^3 \downarrow\) | SSIM \(\uparrow\) | LPIPS \(\downarrow\) |
|---|---|---|---|---|---|---|---|---|
| 默认完整模型 (PM-Edit) | 17.2 | 0.445 | 动态累积掩码 + 统计自适应阈值 | 1.0 | 54.12 | 17.1 | 0.453 | 0.459 |
| 静态掩码 \(M_{0.5T}\) | 33.3 | 0.309 | 仅用中间时间步计算的固定掩码 | 1.2 (默认) | 55.64 | 17.2 | 0.479 | 0.445 |
| 静态最终掩码 \(M_0\) | 13.1 | 0.533 | 修复全过程固定使用终态掩码 | 1.4 | 58.34 | 19.4 | 0.497 | 0.442 |
| 固定常数阈值 (constant \(\delta_t\)) | 10.5 | 0.698 | 取消动态阈值,固定为 \(t=0.5T\) 对应值 | 1.6 | 61.35 | 21.4 | 0.521 | 0.413 |
| 无批次去噪平滑 (\(N=1\)) | 16.2 | 0.617 | 掩码计算仅使用单批随机噪声 | 1.8 | 62.89 | 22.6 | 0.531 | 0.406 |
| 去除 RePaint 循环回退 | 28.0 | 0.437 | 仅进行标准的单向逆扩散替换 | - | - | - | - | - |
关键发现¶
- 动态时变掩码的不可替代性:若退化为类似 DiffEdit 的静态掩码策略(如固定使用中间步掩码 \(M_{0.5T}\)),KID 急剧恶化至 33.3,说明前期过度约束导致目标域特征无法充分生成;反之若全程施加最终的大掩码 \(M_0\),虽然目标域自由度大使得 KID 较低,但 LPIPS 恶化至 0.533,造成源图大量无辜结构被连带摧毁。动态渐进掩码是同时保全低 KID 与低 LPIPS 的唯一解。
- 时间依赖统计阈值的作用:固定绝对阈值 \(\delta_t\) 会导致早期高噪声阶段整图因预测方差大而全盘被遮蔽,直接导致 LPIPS 飙升至 0.698,彻底丧失与原图的内容对应关系。
- 超参数 \(\lambda\) 呈现平滑的帕累托前沿权衡:\(\lambda\) 越小,判别标准越宽松,掩码覆盖面积越大,模型获得更高的生成自由度,从而获得更优的真实感得分(\(\lambda=1.0\) 时 FID 达 54.12,KID 达 17.1);反之,\(\lambda\) 越大,掩码判定越严格保守,保留的原图内容越多,从而显著提升保真度(\(\lambda=1.8\) 时 SSIM 提升至 0.531,LPIPS 降至 0.406)。单一超参数提供了精准调节保真度与变换幅度的控制杆。
亮点与洞察¶
- 源域完全盲验(Source-Agnostic)的优雅范式:传统无监督 I2I 往往耗费巨资联合训练跨域流模型或对齐网络,而 PM-Edit 证明只要目标域单域生成先验足够强,通过逆扩散反向投影的“认知失调”(Prediction Discrepancy)就能无监督地高精度定位跨域语义差异。
- 统计阈值校准机制:避开了人工在数百个扩散时间步精调超参数的噩梦,以目标域自身的经验误差均值和方差作为“标尺”,用统计置信区间 \(\mu + \lambda \sigma\) 统一了整个逆扩散噪声尺度的判定基准,极具工程通用性。
- 可复用的架构思路:该方法已成功泛化至 Stable Diffusion 潜空间并集成至 PIE-Bench 文本引导图像编辑任务中,无需 RePaint 回退即可直接在 VAE 潜空间完成低延迟高质量定向局部修改。
局限与展望¶
- 模态一致性前提:当前框架假设源域与目标域具有大致相同的空间模态和结构尺度(例如猫脸到狗脸、男脸到女脸),当源域和目标域存在跨模态鸿沟或拓扑剧烈突变时(如素描到实景照片、斑马到轿车),基于单步去噪差异的度量可能会全图崩溃。
- 推理时间开销较大:像素空间生成需执行 100 步掩码推导与 1000 步带 RePaint 回退的修复扩散,加之掩码推导时需平均 \(N=10\) 个随机种子批次,单图推理速度明显慢于单步对抗翻译模型。
- 未来改进方向:可探索将时间依赖统计掩码迁移至极速少步数采样器(如 Consistency Models 或 Flow Matching),并引入更具高阶语义不变性的差异度量算子以支持跨模态跨几何尺度的开放域编辑。
相关工作与启发¶
- vs SDEdit / ILVR: SDEdit 与 ILVR 同属源域无关方法,但它们缺乏空间选择性,要么全局加噪摧毁局部细节,要么粗暴锁定低频空间分量导致形变能力受限。PM-Edit 引入时空双维度的自适应最小掩码,实现了真正的局部精准变迁。
- vs DiffEdit: DiffEdit 采用固定的单一时间步与静态硬阈值计算掩码,无法适应逆扩散全流程中噪声尺度的动态演进;PM-Edit 引入时变统计阈值与递推并集累积,使得掩码随语义细节逐步显化而自适应生长。
- vs EGSDE / CycleDiffusion: 后两者必须利用源域和目标域联合训练引导模块或双向反演,流程复杂且无法迁移至新源域;PM-Edit 摆脱了源域依赖,在新数据集和新任务间展现了即插即用的优越泛化性。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [将扩散模型内部单步预测差异与时变统计置信区间结合,构建了免训练的自适应动态掩码增长范式]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 AFHQ、Celeba-HQ 与 PIE-Bench 三大基准,包含了完整的真实感、忠实度双向评估与详尽的组件及参数消融]
- 写作质量: ⭐⭐⭐⭐⭐ [数学推导简洁清晰,统计阈值机理阐释透彻,实验数据与消融对照条理明晰]
- 价值: ⭐⭐⭐⭐☆ [为即插即用的零样本跨域图像迁移提供了实用工具,代码开源且易于向通用潜空间扩散模型拓展]