跳转至

Momentum Guidance: Plug-and-Play Guidance for Flow Models

会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 流模型引导、无分类器引导、Rectified Flow、推理时引导、速度动量

一句话总结

本文提出 Momentum Guidance(MG):把采样轨迹上过去若干步模型速度的指数滑动平均当作一条“更平滑的参考分支”,每一步把当前速度向远离它的方向外推,从而在不增加任何网络评估次数、不需要辅助模型或无条件分支的前提下,为流模型带来与 CFG 同类的锐化效果,并且可以与 CFG 直接叠加。

研究背景与动机

基于连续时间的生成模型(扩散模型与 Rectified Flow 一类流模型)已经能高质量地合成图像、音频和视频,但预训练的流模型几乎不会以「原始条件形式」直接使用——不加引导采样出来的图往往是发散的、纹理发糊、缺少高频细节。这不是流模型独有的毛病,本质上和回归任务里的「向均值回归」是同一件事:当同一条件下存在许多合理输出时,用均方误差训练出来的预测器会把这些输出平均掉。在图像复原领域,这种平均早就被认识到会产生过度平滑、高频纹理弱的结果;语言生成里的温度缩放、nucleus 采样也是在对预测分布做类似的整形。论文把这种过度平滑归到两个具体来源:一是网络的回归目标(速度 / 干净数据 / 噪声)在 MSE 下就是条件均值,天然把多种可能结果平均;二是训练时广泛使用的参数 EMA,它在优化轨迹上平均模型状态,进一步把学到的速度场抹平。两者叠加,使预训练模型偏向模糊、低细节的输出。

既然模糊来自「平均」,那推理时引导就是在做反向操作——把预测从更平滑的参考估计上推开。CFG 拿条件速度当主预测、拿无条件速度当参考(无条件分支对条件变量求期望,所以更平滑),Autoguidance 则把无条件分支换成一个更弱的模型(早期 checkpoint 或小容量网络)。这两种方法其实都可以理解成对模型预测做「去平滑」。矛盾就出在参考分支的来源上:为了拿到那条更平滑的参考,CFG 要求每一步额外跑一次无条件前向(等于把 NFE 翻倍),Autoguidance 则要求一个辅助 checkpoint 并额外占用显存——而像 FLUX.1-dev、Qwen-Image 这类大规模开源模型基本不会放出这类弱版本 checkpoint,使得 Autoguidance 在真实场景里经常不可用。

本文的切入角度是:既然要的只是一条「更平滑的参考」,而 Rectified Flow 的边际保持性质保证了轨迹上更早(噪声更大)的位置天然对应更平滑的边际分布,那么采样器自己走过的历史就已经提供了这条参考,根本不必外求。核心 idea:在采样过程中维护一个「速度动量」——过往模型速度的指数滑动平均(EMA)——并让当前速度向远离该动量的方向外推,用轨迹历史充当 CFG 的无条件分支 / Autoguidance 的辅助模型,实现零额外网络评估、免训练的即插即用引导。

方法详解

整体框架

MG 完全作用在推理阶段:输入是一个预训练好的 Rectified Flow 速度网络和一个标准采样器(论文默认用均匀离散时间网格上的 Euler 采样器),输出是最终的样本。除了原有的流状态 \(Z_t\) 之外,它只多维护一个速度动量 \(m_t\)——与 \(Z_t\) 同形状的 EMA 缓冲区,初始化时直接取第一步的模型速度。此后每一步:先按常规方式查询一次模型得到当前速度 \(v_{t_i}\),然后做两件互不干扰的事——(1) 用「当前速度 + α 倍(当前速度 − 动量)」这个外推后的速度去推进流状态;(2) 用当前速度按 EMA 更新动量,供后续步骤使用。整个流程没有任何训练、没有辅助网络、没有额外的函数评估,超参数只有两个:外推强度 \(\alpha\) 和动量衰减 \(\beta\)

它之所以成立,根子在 Rectified Flow 的边际保持性质。以高斯为源分布时,时间 \(t\) 的边际分布可以看成真实数据分布被标准差随 \(t\) 变化的高斯核卷积平滑后的结果,因此越小的时间对应越强的平滑;而速度场与边际得分函数之间又有确定的换算关系(\(\nabla \log \pi_t\) 可由 \(v_t^\*\)\(x_t\) 表示)。于是速度估计继承了和边际同样的平滑度排序:轨迹早期的速度对应更平滑的分布,越靠后的速度越接近锐利、越像数据。CFG 要从无条件分支拿的那条「平滑参考」,其实早就在采样器自己走过的路径上;MG 只是把它用 EMA 的形式存了下来。

需要强调的是,MG 并不打算替代 CFG,而是与之正交:与 CFG 一起用时,经过 CFG 外推后的速度直接当作 MG 的「基础速度」,MG 在这个基础上再向外推一次,且 CFG 在每一步都保持开启。两者推动的方向不同——CFG 是沿着「对条件变量求平均」的方向离开,MG 是沿着「轨迹历史」的方向离开——所以可以叠加使用。(引导项是纯更新式的设计,用文字与公式已能讲清,这里不强行画流程图。)

关键设计

1. 速度动量:用采样器自己的历史充当「更平滑的参考分支」

这条设计针对的痛点非常具体:现有的所有去平滑式引导都必须先有一条更平滑的参考预测,而拿到它的两条路(CFG 的额外无条件前向、Autoguidance 的弱 checkpoint)分别代价是多一倍 NFE 和依赖不存在的辅助权重。MG 的观察是,参考不必来自另一个模型或另一条分支,它可以来自同一轨迹的过去。依据就是上一节说的平滑度排序:第 \(i\) 步之前那些在高噪声时刻算出来的速度,本来就是在更平滑的边际上求出的条件均值,把它们聚起来就是一条天然平滑的参考。

聚合方式用的是指数滑动平均,与优化里的动量一脉相承:

\[m_{t_{i+1}} = (1-\beta)\,v_\theta(Z_{t_i}, t_i) + \beta\, m_{t_i}\]

其中 \(\beta \in [0,1)\) 控制速度历史的衰减速度。\(\beta\) 越大,参考越偏向更早、更平滑的估计,动量越稳也越「陈旧」;\(\beta\) 越小则参考更贴近当前步。用 EMA 而不是「直接拿上一步的速度」,是因为单步速度既带噪又只反映一个时刻的平滑程度,而 EMA 把多个不同噪声水平下的估计揉在一起,得到一条更稳定、更明确平滑的参考——这与优化中一阶动量抑制梯度噪声的作用是同一个道理。论文用「隐式干净数据预测」\(\hat{X}_{1|t}\)(即在当前速度场下、由 \(x_t\) 推得的条件数据均值,见下节)把这条参考的效应可视化了:在 FLUX.1-dev 上用 \(\alpha=0.6\)\(\beta=0.8\) 做 MG,相比 CFG=1.5 的基线,MG 的估计在轨迹早期就出现更清晰的对象结构和更稳定的色彩;而外推方向 \((v_t - m_t)\) 的形态也很有意思——它先对准物体的粗略几何轮廓,随着流程接近数据分布才逐渐集中到花瓣边缘、露珠这类高频细节。这说明动量吸收掉的正是「已有的、平滑的部分」,外推项携带的是「新冒出来的信息」。

2. 外推更新:把锐化压进一次向量加法里,换取零额外 NFE

得到参考之后,锐化的做法与 CFG 在形式上完全一致——只不过被推开的对象换成了动量 \(m_{t_i}\)

\[Z_{t_{i+1}} = Z_{t_i} + \Delta t\,\Big[\, v_\theta(Z_{t_i},t_i) + \alpha\big(v_\theta(Z_{t_i},t_i) - m_{t_i}\big)\Big]\]

\(\Delta t = t_{i+1}-t_i\)\(\alpha \ge 0\) 控制向更锐利分布外推的强度,\(\alpha=0\) 时公式退化为标准 Euler 更新。这里最关键的工程性质是:\(v_\theta(Z_{t_i},t_i)\)基础采样器本来就要算的那一次前向,MG 只是多算一次同形状向量的减法与加法,因此每一步的函数评估次数、显存里的中间激活、以及与批大小相关的开销都完全不变。额外状态只有一个和流状态同形状的动量缓冲:ImageNet-256 上(SD 编码器、DiT-XL 主干)隐变量是 \(32\times32\times4\),1024² 的 FLUX.1-dev 量级约为 \(128\times128\times16\),相对于模型参数和激活可以忽略。这一点是 MG 与 CFG 的分水岭:CFG 每步要两次评估,MG 只需要一次。

实现上还有两个细节:论文说明 MG 采用了无偏 EMA 修正(Adam 式的偏差修正,用于抵消动量初始化前若干步的偏差)与动量归一化(避免动量模长与当前速度量级不匹配时外推项尺度失控);⚠️ 二者的确切形式论文正文未展开,以原文附录为准。此外,外推不是越猛越好:\(\alpha\) 过大或者动量记忆过长(\(\beta\) 过大)都会把速度「过校正」,反而使质量下降——这也解释了为什么需要动量归一化。

3. 与 CFG 正交的可插拔组合与引导区间

MG 从设计上就不与 CFG 竞争,而是把自己嵌到既有管线里。与 CFG 同用时,基础速度换成 CFG 外推后的速度,CFG 全程保持激活,MG 在其上再做一次同方向的外推;这也意味着 MG 可以非常轻地插到任何使用条件速度的采样流程中,不需要重训模型、不需要改网络、不需要额外的条件输入。有用性在 ImageNet-256 上得到了系统验证:在 CFG = 1.0(即不加 CFG)到 2.0 的每一个引导强度、以及 16/32/64 三档采样预算下,MG 都降低了 FID,而且不只是把最优 CFG 平移过去——它把整条 FID 曲线压低;在 precision–recall 平面上则表现为同时提高 precision 又更好地保住 recall,把帕累托前沿向外推,这是单纯调大 CFG(用 recall 换 precision)做不到的。它还能叠在已经在做「坏模型引导」的方法上:论文把 MG 加到 RAE(一种借助额外视觉基础模型的引导式基线)之上仍然带来改进。

论文还沿用了 Guidance Interval 的思路,把 MG 的施加区间也做成超参扫描(\([0.1,0.6]\)\([0.1,0.7]\)\([0.2,0.6]\)\([0.0,1.0]\)),说明「在哪些时间步上引导」与「引导多强」是两个可独立调节的维度。值得注意的是,这个区间限制只在 ImageNet 上使用;在 SD3 / FLUX.1-dev 的文本到图像实验里,MG 是在所有时间步上施加且不做区间裁剪的,只调 \(\alpha\)\(\beta\)——这从侧面说明 MG 的默认配置已经足够稳,不需要针对每个模型重新设计调度。

损失函数 / 训练策略

MG 是纯推理时方法,不引入任何新的训练目标、不微调任何参数。被引导的基础模型仍然按 Rectified Flow 的标准均方误差目标训练:让网络预测从噪声到数据的位移 \(X_1-X_0\)(等价于在 \(X_t = tX_1+(1-t)X_0\) 的插值路径上的条件期望速度)。因此 MG 的全部「调参」都发生在推理阶段,具体是三个量:

  • \(\alpha\)(外推强度)与 \(\beta\)(EMA 衰减):在 ImageNet-256 上,论文对每一组 (CFG 尺度, NFE 预算) 用 FID-10K 做网格搜索选出 \((\alpha,\beta)\),再在 FID-50K 上报告;在 SD3 / FLUX.1-dev 上只调这两个量;在 HunyuanVideo 上则固定 \(\alpha=0.6,\ \beta=0.2\),不做穷举搜索。
  • 施加区间(可选):ImageNet 上扫描了上述四组时间区间。

基础采样器统一使用标准 Euler 采样器 + 均匀离散时间网格(文本到图像则沿用各模型自带的默认调度)。论文明确说明 MG 的额外显存只是一个与流状态同形状的 EMA 缓冲,计算上只是逐元素加减,不改变 NFE。

实验关键数据

主实验

评测覆盖三类设定:ImageNet-256(官方 Rectified Flow 代码库 + 改进的 DiT-XL,隐空间用 SD 编码器)上的系统性消融;大规模文本到图像(SD3、FLUX.1-dev),用 HPSv2 基准的 3200 条 prompt、1024² 分辨率,指标为 HPSv2.1 与 ImageReward;以及文本到视频(HunyuanVideo,VBench 协议,540p / 65 帧,所有方法共用随机种子 42)。

表 1:ImageNet-256 上 FID-50K 随引导强度与采样预算的变化\(w=1\) 即 MG 不加 CFG,其余为 MG 叠在 CFG 之上)

引导设置 方法 NFE=16 NFE=32 NFE=64
\(w=1.0\)(不加 CFG) 基线 7.76 5.57 4.75
+ MG 4.46 3.58 3.26
\(w=1.2\) CFG 3.26 2.20 1.89
CFG + MG 2.00 1.71 1.60
\(w=1.4\) CFG 2.38 2.04 2.03
CFG + MG 1.85 1.90 1.99
\(w=1.6\) CFG 3.13 3.17 3.34
CFG + MG 2.62 2.89 3.17
\(w=1.8\) CFG 4.48 4.76 4.99
CFG + MG 3.49 3.96 4.62
\(w=2.0\) CFG 5.94 6.36 6.62
CFG + MG 4.62 5.27 6.08

论文报告的平均改善幅度为:不加 CFG 时 FID 相对下降 36.54%,在 CFG = 1.2 上叠加时平均下降 25.42%(均为跨采样设定的平均,原始数值见表中各行,可自行核对)。表 1 中最强的是 CFG = 1.2 + 64 NFE 的配置,这也是全表最优 FID。

表 2:与引导类基线的对比(ImageNet-256,FID/IS/Precision/Recall,50K 样本)

NFE 方法 FID-50K ↓ IS ↑ Precision ↑ Recall ↑
16 CFG-int (\(\omega\)=1.4) 2.352 249.85 0.791 0.612
16 CFG-int + MG (\(\omega\)=1.4) 1.553 268.03 0.799 0.636
16 ADG (\(\omega\)=1.4) 2.324 275.28 0.827 0.570
16 CFG++ (\(\omega\)=0.6) 2.620 368.80 0.842 0.572
32 CFG-int (\(\omega\)=1.4) 1.642 264.75 0.800 0.626
32 CFG-int + MG (\(\omega\)=1.4) 1.408 274.99 0.801 0.633
64 CFG-int (\(\omega\)=1.4) 1.462 271.34 0.803 0.625
64 CFG-int + MG (\(\omega\)=1.4) 1.380 277.73 0.802 0.630
50/2 RAE† (\(\omega\)=1.0) 1.535 241.56 0.791 0.644
50/2 RAE† + MG (\(\omega\)=1.0) 1.376 242.83 0.790 0.642

其中 CFG-int 是把 CFG 限制在 \(t\in[0.125,1]\) 上的区间调度基线,MG 则全区间 \([0,1]\) 施加;† 表示该基线额外用了基础流模型之外的视觉基础模型(RAE)。论文按各自建议超参搜索后报告了 ADG 与 CFG++ 的最优 FID。可以看到 MG 在同等 NFE 下都把 CFG-int 的 FID 进一步压低,而且 16 步就能达到 1.553,比 32 步的基线(1.642)还好。

表 3:文生图与文生视频迁移(SD3 28 步 / FLUX.1-dev 50 步 / HunyuanVideo)

模型 指标 基线 + MG
SD3 HPSv2.1 @ CFG=1 / @ CFG=5 22.87 / 30.22 27.37 / 30.62
SD3 ImageReward @ CFG=1 / @ CFG=5 −0.093 / 1.099 0.395 / 1.111
FLUX.1-dev HPSv2.1 @ CFG=1 / @ CFG=3 24.40 / 31.28 24.80 / 31.29
FLUX.1-dev ImageReward @ CFG=1 / @ CFG=3 0.345 / 1.094 0.391 / 1.096
HunyuanVideo VBench quality / semantic / total 0.842 / 0.716 / 0.816 0.845 / 0.717 / 0.819

两个文生图模型上,MG 在所有 CFG 尺度上都提升了 HPSv2.1(SD3 在 CFG=2~5 上稳定提升约 0.2~0.4,FLUX.1-dev 提升幅度较小、约 0.02~0.07);ImageReward 在多数配置下也提升,CFG 较大时有极轻微回落。视频侧 MG 用固定的 \(\alpha=0.6,\beta=0.2\)、不做任何 prompt 级调参,VBench 总分从 0.816 提到 0.819。

消融实验

表 4:超参与采样预算的行为分析(ImageNet-256,FID-10K 用于选参,FID-50K 报告)

配置 / 变量 观察 说明
\(\alpha = 0\) 退化为原采样器(或原 CFG) 对应图 4 中 landscape 的边界
\(\alpha\) 从 0 适度增大 FID 在很宽区间内下降 外推确实在做去平滑
\(\alpha\) 过大 FID 回升 速度被过校正,质量反而变差
\(\beta\) 过大(动量记忆过长) FID 回升 参考过于陈旧,锐化方向偏离
最优区域 中等 \(\alpha\) + 小到中等 \(\beta\) 强外推偏好较短的动量记忆
NFE = 16 大多数 \((\alpha,\beta)\) 配置已优于基线 小采样预算下收益最大
MG 施加区间(4 组扫描) 取 FID 最优的一组 受 Guidance Interval 启发

表 5:VBench 逐维度对比(HunyuanVideo,\(\alpha=0.6,\beta=0.2\),540p)

维度 基线 + MG 维度 基线 + MG
Subject Consistency 0.962 0.962 Multiple Objects 0.679 0.708
Motion Smoothness 0.992 0.991 Object Class 0.731 0.765
Dynamic Degree 0.639 0.653 Spatial Relation 0.871 0.885
Background Consistency 0.974 0.975 Temporal Flicker 0.695 0.681
Scene 0.387 0.356 Appearance Style 0.991 0.991
Overall Consistency 0.266 0.265 Temporal Style 0.241 0.240
Aesthetic Quality 0.623 0.624 Human Action 0.930 0.920
Imaging Quality 0.653 0.668

关键发现

  • MG 不是把最优 CFG 平移,而是压低整条曲线。图 3 的消融显示,在 16/32/64 三档预算下,MG 的最优配置曲线整体位于 vanilla CFG 曲线下方,而且阴影视带(其余 \((\alpha,\beta)\) 组合的范围)表明多数配置都能赢基线,说明方法对超参并不敏感。收益随采样步数减少而放大,NFE=16 时收益最大——这对少步生成的实用价值最高。
  • 它改变的是 precision–recall 的取舍方式。单独调大 CFG 必然用 recall 换 precision;MG 在提高 precision 的同时把 recall 也保住甚至抬高(表 2 中 MG 的 Precision 基本持平、Recall 普遍更高),因此帕累托前沿是向外扩张而不是沿曲线滑动。这也是论文最核心的实证主张。
  • 参考来源可替换、可叠加。把 MG 加到 RAE 这类本身就用了额外视觉基础模型的引导方法上仍然有效(1.535 → 1.376),说明「轨迹历史」这条参考与「弱模型 / 额外模型」这条参考携带的信息是互补的。
  • 超参最优区在「中等外推 + 较短记忆」\(\alpha\) 从 0 增大普遍有益,但过大或 \(\beta\) 过大都会过校正;这一模式在 16/32/64 三档预算上保持一致,暗示强外推需要的是「刚刚过去的平滑信息」而不是「很久以前的」。
  • 收益随模型规模与任务变化:ImageNet-256 上的 FID 提升幅度很大(数十个百分点),而 SD3 / FLUX.1-dev 上的 HPSv2.1 提升只有零点几(FLUX.1-dev 上尤其小);视频侧总分只提升 0.003,且在 Scene、Temporal Flicker、Human Action 三个维度上小幅下降。也就是说 MG 在小模型 + 少步 + 类别条件的设定下最有效,在大模型 + 默认调度上更多是「稳定不亏」的增量改善。

亮点与洞察

  • 把「引导必须有一条外部参考分支」这个隐含前提打掉了。CFG 用无条件分支、Autoguidance 用弱 checkpoint、SAG/PAG 用扰动后的注意力,共同假设都是参考要来自模型之外的某处;MG 指出采样轨迹自身的历史(因为 RF 边际保持的平滑度排序)就已经是同一条参考,这个观察很干净,且直接换来「零额外 NFE」这一硬性优势。
  • 与优化中动量的类比被用到了正确的位置。这里的动量不是用来加速收敛,而是用来构造一条低方差、明确更平滑的参考——EMA 在这里的作用是「时间上的低通滤波」,这个技巧可以迁移到任何迭代式采样器的分析里。
  • \(\hat{X}_{1|t}\) 诊断可视化是可复用的分析工具。用「隐式干净数据预测」在图像空间观察引导如何逐步重塑轨迹,比只看最终样本更能说明引导到底在哪一段起了作用;论文也据此给出了一个反直觉的发现:外推方向先承载粗轮廓、后承载高频细节,即动量吸收的是「已确定的平滑成分」,外推项携带的是「新出现的细节」。
  • 可迁移的改造点很明确:(1) 任何有 ODE/SDE 采样器的生成模型(视频、3D、音频、TTS)都可以把这条 EMA 动量直接挂上去,因为它只要求「有一个逐步查询的速度/得分网络」;(2) 少步蒸馏与一致性模型同样在多步迭代,收益最大的恰好也是小 NFE 区间,值得一试;(3) 由于 \(m_t\) 携带粗结构、\((v_t-m_t)\) 携带细节,二者可以分开放大,这给「只加细节不改构图」的可控生成留了口子。

局限与展望

  • 论文没有单独的 Limitation 章节,作者在结论里更多强调方法的简单与通用;以下部分为阅读后的观察。
  • \(\alpha\)\(\beta\) 仍是需要网格搜索的手工超参。论文在 ImageNet 上对每组 (CFG, NFE) 做 FID-10K 网格搜索,在 HunyuanVideo 上则直接固定了一组值。缺一个「随轨迹自适应」的调度:从机制上看,早期步骤更应该往平滑参考上靠(\(\beta\) 大一些以获得稳定的粗结构)、后期应该收紧(\(\beta\) 小一些以便锐化细节),而当前实现是用一组常数走完全程。
  • 在 16 步这一档,动量假设可能变弱。MG 依赖「更早的速度更平滑」,但少步采样时相邻时间点间隔很大、轨迹上可用于 EMA 的样本点很少,此时动量的平均效果与多步时必须不同;论文虽然显示 NFE=16 收益最大,但没有对「步数与最优 \(\beta\) 的关系」给出解释性分析。
  • 大模型上的收益偏小,个别指标有回退。SD3/FLUX.1-dev 上 HPSv2.1 的提升在 0.02~0.07 量级,VBench 的 Scene(0.387→0.356)与 Temporal Flicker、Human Action 也小幅下降;论文报告的是「多数配置提升」,但没有讨论这些回退的来源,也没有给出与人类偏好评测之外的真实用户研究。
  • 理论刻画缺失。MG 与 CFG 被描述为「正交」,但这只在经验上被验证:论文没有给出 MG 等价于对哪个修改后的分布 / 得分函数做锐化的推导,也没有说明 \(\alpha\) 与「采样温度」之间的对应关系。若有这层分析,\(\alpha\)\(\beta\) 的选取就不用靠网格搜索。
  • 改进思路:把 \(\alpha, \beta\) 写成流时间 \(t\) 的函数并做轻量自适应(例如按当前速度与动量的夹角决定外推强度,夹角小说明方向一致、可以推得更狠);把单步 EMA 换成对轨迹的显式低通滤波或多项式外推;与 ADG / CFG++ 这类改动引导更新方向的方法组合验证;在少步蒸馏模型与一致性模型上系统验证收益是否依然存在。

相关工作与启发

  • vs CFG:CFG 用「条件速度 − 无条件速度」的差做外推,参考来自额外一次前向;MG 用「当前速度 − 轨迹速度动量」的差做外推,参考来自已经算过的历史。代价上 MG 每步只要一次评估(CFG 要两次),且不需要模型具备无条件分支能力;代价是 MG 多了一个需要调的超参 \(\beta\),并且参考的「平滑程度」是隐式由 \(\beta\) 与步长决定的,不像 CFG 那样有明确的语义。
  • vs Autoguidance:两者都把参考换成「更差/更平滑的预测」,但 Autoguidance 的参考是一个独立训练的弱模型,需要额外 checkpoint(开源大模型通常不提供)和额外显存;MG 的参考是采样过程自己产生的,完全不需要外部依赖,所以更贴合「即插即用」的定位。相对的,Autoguidance 的参考质量更可控,而 MG 的参考质量取决于 \(\beta\) 与轨迹本身的离散化。
  • vs Guidance Interval / CFG++ / ADG:这些方法改的是引导更新的调度、约束或方向(在哪些时间步施加、把更新约束到流形上、把外推改成角度域的旋转),参考分支仍然是 CFG 的无条件分支。MG 改的是参考分支的来源,因此与它们是正交的两条改进路线,论文也实测了叠加效果(MG 加到 CFG-int 与 RAE 之上都继续提升)。反过来说,ADG 关于「隐空间引导应该旋转而不是外推」的论证提示 MG 的线性外推在高维隐空间里可能同样面临方向问题,这值得进一步检验。
  • vs SAG / PAG / SEG 这类自注意力引导:它们从同一网络内部构造退化/平滑预测(扰动注意力、平滑注意力能量),确实也不需要辅助模型,但需要改动网络内部、多一次带扰动的评估;MG 只接触采样循环、不碰网络内部,兼容性更强,且完全没有额外评估。

评分

  • 新颖性: ⭐⭐⭐⭐ 把「更平滑参考」的来源从模型外部搬到采样轨迹自身,思路简洁但有实质洞察,且直接带来零额外 NFE 的工程优势
  • 实验充分度: ⭐⭐⭐⭐ 覆盖 ImageNet-256、SD3、FLUX.1-dev、HunyuanVideo 四类模型与图像/视频两域,消融系统(CFG×NFE 网格、\(\alpha\)/\(\beta\) 景观、区间扫描),并给出 precision–recall 前沿这一有说服力的分析;但缺少与最新几类引导方法的全面同预算对比,大模型上的增益也偏小
  • 写作质量: ⭐⭐⭐⭐ 动机链条(过度平滑的两个来源 → 引导即去平滑 → 轨迹历史可作为参考)讲得清楚,算法伪代码只有 9 行;部分公式在缓存文本中损坏、若干实现细节(无偏 EMA 修正、动量归一化)留在附录
  • 价值: ⭐⭐⭐⭐ 免训练、免重训、零额外评估、可与 CFG 叠加,实用门槛极低,任何用流模型采样的人都可以直接插上;主要限制是超参仍需按模型网格搜索