EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/drkkgy/EMAG
领域: 图像生成
关键词: 扩散模型, 自矫正采样, 分类器无关引导, 指数移动平均, 负样本难度, 人类偏好评分
一句话总结¶
EMAG 是一种无需额外训练的扩散模型推理引导方法,通过对自注意力图进行指数移动平均平滑与动态层选择构造语义保真且具挑战性的“难负样本”,引导去噪器精准剔除细粒度伪影,在 SD3 上将人类偏好评分提升 +0.54 且能与 APG、CADS 等引导策略无缝正交组合。
研究背景与动机¶
去噪扩散模型与流匹配(Flow Matching)模型在跨模态内容生成领域取得了里程碑式的进展。在条件图像生成任务中,分类器无关引导(CFG)通过对齐条件与无条件预测的外推对比,极大地提升了文本到图像的对齐度与感知质量,成为了现代生成系统事实上的标准。然而,高强度的 CFG 会不可避免地导致图像过饱和、多样性降低以及局部高频伪影。近期以自动引导(Auto-guidance)为代表的一系列自矫正采样方法,尝试通过对比强模型与弱模型的预测分数来消除错误模式。这些方法通过弱化网络容量、自注意力掩码(SAG)、能量平滑(SEG)、扰动自注意力(PAG)或随机丢层(S2-Guidance)来合成负样本信号。
然而,现有方法在生成负样本时存在一个关键认知局限:它们主要关注于“如何构建一个劣质模型”,却缺乏对负样本退化颗粒度与退化难度的定量可控性。以往方法所施加的扰动往往过于粗糙剧烈,直接破坏了图像的全局几何结构与核心语义。这种粗糙退化本质上属于现代强大扩散骨干网络本身就能轻松规避的“容易负样本(Easy Negatives)”,无法促使去噪器针对细微的高频瑕疵(如按钮变形、边缘锯齿、纹理伪影)进行有效自校正。同时,现有方法对扰动目标层的选择通常是经验性静态固定的,忽视了不同网络层在扩散轨迹各时间步上动态注入高频特征的不均衡性。
本文的核心切入点在于:负样本的退化程度应当维持在“破坏细微细节而不损坏全局语义结构”的高难度边界上。扩散模型生成图像的过程遵循由粗至细的频率演化规律,早中期步骤确定全局骨架,随后逐步注入高频局部细节。如果能在推理阶段对自注意力施加平滑滞后,即可在保留语义轮廓的前提下精准抑制高频精炼信号,暴露模型最容易忽略的细微失效模式。核心 idea:提出指数移动平均引导(EMAG),在推理阶段对扩散 Transformer 选定中间层维护注意力的时间维 EMA,并根据统计差异动态选取高频更新最活跃的层进行平滑替换,构造语义保真且高度贴近正样本的“难负样本”,实现细粒度伪影的自校正增强。
方法详解¶
整体框架¶
EMAG 完全工作在推理采样阶段,不需要任何额外的模型训练或参数微调。在去噪反向采样的每个时间步,EMAG 维护候选特征层的自注意力指数移动平均缓存;通过衡量当前瞬时注意力与 EMA 缓存之间的绝对平均误差(MAE),自适应选出当前时间步中高频信息变化最剧烈的一层;将该层的自注意力矩阵用其 EMA 结果进行替换,经过前向计算得到具有高频细节衰减但全局语义完全一致的“难负样本”预测;最后通过外推公式将原始预测远离该弱预测,并与标准 CFG 进行级联更新。针对 MMDiT 双路注意力架构,EMAG 还进一步衍生出仅扰动图像内注意力的 EMAG-I,以及直接对 Query 向量做 EMA 从而无缝支持 FlashAttention 融合算子的高效变体 EMAG-Q。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入潜变量 $x_t$ 与条件 $c$"] --> B["注意力时序平滑<br/>维护注意力 EMA 缓存 $E_t$"]
B --> C["自适应层选择<br/>动态选取最大差值层 $l_n^{*t}$"]
C --> D["双阶段引导更新<br/>远离难负样本并结合 CFG"]
D --> E["高效变体 EMAG-Q / EMAG-I<br/>兼容 SDPA 加速与双路解耦"]
E --> F["输出校正去噪预测 $\bar{z}_t$"]
关键设计¶
1. 注意力时序平滑:抑制高频细节构建语义保真的难负样本
现有自引导方法破坏注意力结构的方式(如置零掩码或加高斯噪声)会导致负样本出现大面积结构崩塌,使得模型只能获得全局级、易规避的粗糙反向反馈。EMAG 针对该痛点,利用注意力图随时间演化的低频继承性,在扩散 Transformer 的中间层维护注意力矩阵 \(A_t \in [0, 1]^{B \times H \times Q \times K}\) 的指数移动平均 \(E_t\)。在初始步 \(t_1\) 设 \(E_1 := A_1\),后续步按如下规则递归更新: $$ E_t = \beta E_{t-1} + (1 - \beta) A_t $$ 其中衰减因子 \(\beta \in [0, 1)\) 直接调控负样本的难度与退化颗粒度。在采样过程中,自注意力机制在宏观时间步上逐步注入细粒度高频纹理,而 EMA 本质上是一个时间维度的低通滤波器。将 \(A_t\) 用凸组合 \(\widetilde{A}_t = (1-\lambda)A_t + \lambda E_t\)(默认采用硬替换 \(\lambda=1\))替换后,前向传播得到的弱模型预测 \(\epsilon'_\theta(x_t, c)\) 严格保留了图像的语义构图,但高频细节被适度平滑。作者通过 CLIP-I 和 DINOv2 余弦相似度定量证明,EMAG 生成的负样本与最终正样本的特征余弦相似度显著高于 SAG、PAG 和 ERG,形成了最贴近正样本的“难负样本”,迫使去噪器专注修正不易察觉的微观瑕疵。
2. 基于统计差异的自适应层选择:动态锁定高频注入层
以往工作通常将注意力扰动静态绑定在固定的网络层(如仅作用于第 7 层或中间某单层),然而在深层 Transformer 架构中,不同网络层在去噪轨迹各阶段的分工存在显著时序异构性。如果选取的层在当前步并不负责细节生成,则 EMA 替换带来的负样本指导意义会大打折扣。EMAG 引入了一种基于注意力张量均值差异的自适应层选择机制。首先将候选扰动范围约束在最具代表性的语义中间层 \([l_{\min}, l_{\max}]\)(在 DiT-XL/2 中设置为 12 至 15 层,在 SD3-Medium 中设置为 6 至 8 层)。在当前时间步 \(t\),针对候选范围内的每一个候选层 \(n\),计算当前注意力图与历史 EMA 缓存之间的平均绝对误差(MAE): $$ \Delta_t^{(n)} = \operatorname{MAE}(E_t^{(n)}, A_t^{(n)}) = \frac{1}{|A_t|} \sum_{i} \left| E_t^{(i)} - A_t^{(i)} \right| $$ 随后贪心选择差异值最大的层作为当前步的扰动目标:\(l_n^{*t} = \arg\max_{n \in \{l_{\min}, \dots, l_{\max}\}} \Delta_t^{(n)}\)。该指标能够精确捕获当前正在积极注入高频更新的 Transformer 块,从而在该层施加 EMA 抑制以引发最直接且针对性的局部缺陷,避免了全局全层扰动引发的累积退化与计算浪费。
3. 双阶段引导更新与高效变体(EMAG-Q / EMAG-I):兼顾采样效率与正交兼容
得到扰动去噪预测 \(\epsilon'_\theta(x_t, c)\) 后,EMAG 将引导过程解耦为双阶段更新。第一阶段基于自动引导范式,利用原始条件预测 \(z_{c,t} = \epsilon_\theta(x_t, c)\) 减去退化负预测 \(\hat{z}_{c,t} = \epsilon'_\theta(x_t, c)\) 并乘以 EMAG 引导系数 \(w_e\) 进行修正: $$ \bar{z}{c,t} = \hat{z}} + w_e \cdot (z_{c,t} - \hat{z{c,t}) = z} + (w_e - 1) \cdot (z_{c,t} - \hat{z{c,t}) $$ 第二阶段将经过难负样本修正的条件向量 \(\bar{z}_{c,t}\) 代入标准 CFG 框架,与无条件向量 \(z_t = \epsilon_\theta(x_t, \varnothing)\) 进行组合: $$ \bar{z}_t = z_t + w - z_t) $$ 针对无条件生成任务,直接执行单阶段外推 }} \cdot (\bar{z}_{c,t\(\tilde{\epsilon}(x_t) = \epsilon'_\theta(x_t, \varnothing) + w_e \cdot (\epsilon_\theta(x_t) - \epsilon'_\theta(x_t, \varnothing))\)。在 MMDiT 架构中,图像与文本通过 Joint Attention 交互,EMAG-I 仅对 Image\(\to\)Image 注意力做时序平滑以保持图文交叉引导不受扰动。此外,由于全注意力矩阵 EMA 显式展开破坏了 FlashAttention 等底层优化内核,作者提出了 EMAG-Q:直接对 Query 向量 \(Q_t\) 进行时序 EMA 更新,完全支持融合缩放点积注意力(SDPA),将端到端额外时延从 +213.2% 大幅压降至 +94.5%,显存占用从 29.58 GB 降至 16.96 GB,几乎抹平了工程部署开销。
实验关键数据¶
主实验¶
在 SD3-Medium 骨干(1024×1024 分辨率,28 步采样)上,基于 MS-COCO 2014 验证集(40K 样本,固定随机种子 8)评测图像生成感知质量(FID)与人类偏好评分(HPS v2,汇报值放大 100 倍)。对比标准无引导、CFG 以及各类前沿自注意力与自动引导基线,并验证与 APG 及 CADS 的正交兼容性(如表 1 与原论文 Table 2 所示)。
| 引导方法 (Guidance) | FID ↓ | HPS v2 ↑ | 相对 CFG 的 HPS 变化 |
|---|---|---|---|
| 无引导 (No CFG) | 23.859 | 21.61 ± 0.11 | -7.61 |
| CFG (基线) | 22.877 | 29.22 ± 0.05 | 基准 |
| SAG + CFG | 23.039 | 29.28 ± 0.04 | +0.06 |
| PAG + CFG | 24.066 | 28.73 ± 0.04 | -0.49 |
| SEG + CFG | 23.453 | 29.25 ± 0.04 | +0.03 |
| S2-Guidance | 20.821 | 29.15 ± 0.00 | -0.07 |
| ERG | 23.989 | 29.35 ± 0.03 | +0.13 |
| APG | 21.816 | 29.45 ± 0.02 | +0.23 |
| CADS | 18.320 | 28.36 | -0.86 |
| EMAG-I (Ours) | 22.154 | 29.56 | +0.34 |
| EMAG (Ours) | 22.890 | 29.76 ± 0.03 | +0.54 |
| EMAG-Q (Ours) | 23.530 | 29.64 | +0.42 |
| EMAG + APG | 21.819 | 29.79 ± 0.04 | +0.57 |
| EMAG + CADS | 19.950 | 28.86 ± 0.02 | -0.36 (多样性提升) |
| EMAG-Q + APG | 22.480 | 29.77 | +0.55 |
消融实验¶
自适应层选择机制的消融实验(原论文 Table 5,SD3 模型在 COCO 2014 验证集采样 5K 图):
| 层选择配置 (Layer Selection Config) | FID ↓ | HPS v2 ↑ | 说明 |
|---|---|---|---|
| 固定单层 EMAG (Layer 6) | 27.47 | 29.54 | 偏向保真度但人类偏好改善有限 |
| 固定单层 EMAG (Layer 7) | 28.94 | 29.51 | 中间层固定扰动,两项均非最优 |
| 固定单层 EMAG (Layer 8) | 28.23 | 29.66 | 偏向偏好分数但 FID 恶化 |
| 全候选层同时扰动 (Layer All) | 35.60 | 28.80 | 负样本过度恶化导致生成质量崩塌 |
| 动态自适应层选择 (EMAG Adaptive) | 28.52 | 29.60 | 综合平衡最优,帕累托前沿占优 |
此外,针对推理效率与显存开销,原论文 Table 4 报告了在单张 NVIDIA A100-SXM4-40GB 上运行 SD3-Medium(1024×1024,28 步,Batch Size 1)的实测数据: - CFG 基线:单图耗时 4.04s,显存峰值 16.89 GB,FID 22.88 / HPS 29.22。 - 标准 EMAG:单图耗时 12.66s(开销 +213.2%),显存峰值 29.58 GB,FID 22.89 / HPS 29.76。 - 高效版 EMAG-Q:单图耗时 7.86s(开销大幅降至 +94.5%),显存峰值 16.96 GB(仅微增 0.07 GB),FID 23.53 / HPS 29.64。
关键发现¶
- 难负样本驱动高感知质量:在所有 CFG 增强型方法中,EMAG 取得了最高的 HPS 偏好得分(29.76),相比纯 CFG 显著高出 +0.54,表明由注意力和时序低通滤波诱发的语义连贯弱预测能够精准靶向细粒度伪影。
- 全层扰动的灾难性后果:消融实验显示,如果对候选范围内的全部层同时施加 EMA 扰动,FID 会急剧恶化至 35.60,HPS 骤降至 28.80。这证实了负样本并非“越弱越好”,过强的扰动退化回了无价值的“容易负样本”。
- 自适应选择锁定最佳折元:基于 MAE 动态挑选活跃层的策略在避免全层扰动崩溃的同时,克服了单一固定层对特定指标的偏向性,维持了最佳的质量-偏好平衡。
- 与正交引导技术强强联合:EMAG 针对的是负样本的语义保真度,而 APG 针对的是投影解耦过饱和,CADS 针对的是条件退火扩充多样性。将 EMAG 与 APG 叠加后,在保持出色 FID(21.819)的同时将 HPS 进一步拉升至 29.79。
亮点与洞察¶
- 将 EMA 降阶为负样本发生器:传统 EMA 常用于模型权重的平滑平均以稳定训练,本文别出心裁地在推理时间轴上对注意力实施 EMA,将其作为滤除高频细节、构造“同义弱化版本”的自监督发生器,概念极其巧妙。
- 首次严格论证负样本的“难度门槛”:通过 CLIP 和 DINOv2 余弦相似度形式化定义了负样本难度,指出粗暴削弱(如置零或强噪声)形成的易负样本对模型提升有限,唯有“语义极其接近但细节有缺失”的难负样本才能真正逼出去噪器的修正潜力。
- 软硬件协同的 EMAG-Q 近似:没有止步于学术界常用的显存换质量方案,敏锐捕捉到完整注意力矩阵对 FlashAttention 的阻碍,提出 Query 空间时序平滑等价方案,使该方法真正具备了低开销落地的可行性。
局限与展望¶
- 计算时间增加:虽然无需训练,但由于每步需要计算退化模型的额外前向分支,标准 EMAG 的耗时相比朴素 CFG 增加超过 2 倍;即使是高效变体 EMAG-Q,推理时间仍有 +94.5% 的额外开销。
- 超参数空间敏感:EMA 衰减系数 \(\beta\)、起始结束时间步 \(\tau_s, \tau_e\) 以及预热步长 \(\delta_t\) 均需要针对具体扩散骨干(DiT vs MMDiT)进行搜索调整,尚缺乏完全自适应的免调参公式。
- 未来方向:探索通过强化学习或轻量预测头自适应预测注意力衰减系数;将时序平滑思想推广到视频扩散模型的时间自注意力中,利用帧间相关性进行跨帧细粒度瑕疵修正。
相关工作与启发¶
- vs CFG [Ho & Salimans, 2022]:CFG 依赖空提示词的无条件分支作为参考,容易引发过度曝光与细节失真;EMAG 在条件分支内部直接构造细节劣化的同模态难负样本,指导模型专注微观自纠错。
- vs SAG [Hong et al., ICCV 2023] 与 PAG [Ahn et al., ECCV 2024]:SAG 依赖高频区域的高斯模糊潜变量,PAG 依赖单位矩阵替换注意力;两者均打破了局部的连续平滑性。EMAG 采用时序 EMA 保持了注意力的连续性与全局拓扑,生成的负样本语义相似度更高。
- vs SEG [Hong, NeurIPS 2024] 与 ERG [Ifriqi et al., 2025]:SEG 对空间注意力做高斯模糊,ERG 扰动注意力熵与文本编码;EMAG 从时序演化角度建模频率衰减,并引入基于 MAE 的跨层自适应调度,避免了手工指定单层的次优性。
评分¶
- 新颖性: ⭐⭐⭐⭐ [从时序低通滤波视角定义扩散难负样本,提出注意力 EMA 引导与自适应选层]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 DiT 与 MMDiT,细致对比 8 类基线并给出了详尽的显存、耗时与消融分析]
- 写作质量: ⭐⭐⭐⭐⭐ [动机叙述清晰有力,数学定义规范,图表排版美观且洞察深刻]
- 价值: ⭐⭐⭐⭐ [即插即用且完全免训练,对高质量文生图模型的推理精细化调优具有显著实用价值]