Momentum Guidance: Plug-and-Play Guidance for Flow Models¶
会议: ECCV 2026
论文: ECCV 原文
领域: 图像生成
关键词: 流模型引导、无分类器引导、Rectified Flow、推理时引导、速度动量
一句话总结¶
本文提出 Momentum Guidance(MG):把采样轨迹上过去若干步模型速度的指数滑动平均当作一条“更平滑的参考分支”,每一步把当前速度向远离它的方向外推,从而在不增加任何网络评估次数、不需要辅助模型或无条件分支的前提下,为流模型带来与 CFG 同类的锐化效果,并且可以与 CFG 直接叠加。
研究背景与动机¶
基于连续时间的生成模型(扩散模型与 Rectified Flow 一类流模型)已经能高质量地合成图像、音频和视频,但预训练的流模型几乎不会以「原始条件形式」直接使用——不加引导采样出来的图往往是发散的、纹理发糊、缺少高频细节。这不是流模型独有的毛病,本质上和回归任务里的「向均值回归」是同一件事:当同一条件下存在许多合理输出时,用均方误差训练出来的预测器会把这些输出平均掉。在图像复原领域,这种平均早就被认识到会产生过度平滑、高频纹理弱的结果;语言生成里的温度缩放、nucleus 采样也是在对预测分布做类似的整形。论文把这种过度平滑归到两个具体来源:一是网络的回归目标(速度 / 干净数据 / 噪声)在 MSE 下就是条件均值,天然把多种可能结果平均;二是训练时广泛使用的参数 EMA,它在优化轨迹上平均模型状态,进一步把学到的速度场抹平。两者叠加,使预训练模型偏向模糊、低细节的输出。
既然模糊来自「平均」,那推理时引导就是在做反向操作——把预测从更平滑的参考估计上推开。CFG 拿条件速度当主预测、拿无条件速度当参考(无条件分支对条件变量求期望,所以更平滑),Autoguidance 则把无条件分支换成一个更弱的模型(早期 checkpoint 或小容量网络)。这两种方法其实都可以理解成对模型预测做「去平滑」。矛盾就出在参考分支的来源上:为了拿到那条更平滑的参考,CFG 要求每一步额外跑一次无条件前向(等于把 NFE 翻倍),Autoguidance 则要求一个辅助 checkpoint 并额外占用显存——而像 FLUX.1-dev、Qwen-Image 这类大规模开源模型基本不会放出这类弱版本 checkpoint,使得 Autoguidance 在真实场景里经常不可用。
本文的切入角度是:既然要的只是一条「更平滑的参考」,而 Rectified Flow 的边际保持性质保证了轨迹上更早(噪声更大)的位置天然对应更平滑的边际分布,那么采样器自己走过的历史就已经提供了这条参考,根本不必外求。核心 idea:在采样过程中维护一个「速度动量」——过往模型速度的指数滑动平均(EMA)——并让当前速度向远离该动量的方向外推,用轨迹历史充当 CFG 的无条件分支 / Autoguidance 的辅助模型,实现零额外网络评估、免训练的即插即用引导。
方法详解¶
整体框架¶
MG 完全作用在推理阶段:输入是一个预训练好的 Rectified Flow 速度网络和一个标准采样器(论文默认用均匀离散时间网格上的 Euler 采样器),输出是最终的样本。除了原有的流状态 \(Z_t\) 之外,它只多维护一个速度动量 \(m_t\)——与 \(Z_t\) 同形状的 EMA 缓冲区,初始化时直接取第一步的模型速度。此后每一步:先按常规方式查询一次模型得到当前速度 \(v_{t_i}\),然后做两件互不干扰的事——(1) 用「当前速度 + α 倍(当前速度 − 动量)」这个外推后的速度去推进流状态;(2) 用当前速度按 EMA 更新动量,供后续步骤使用。整个流程没有任何训练、没有辅助网络、没有额外的函数评估,超参数只有两个:外推强度 \(\alpha\) 和动量衰减 \(\beta\)。
它之所以成立,根子在 Rectified Flow 的边际保持性质。以高斯为源分布时,时间 \(t\) 的边际分布可以看成真实数据分布被标准差随 \(t\) 变化的高斯核卷积平滑后的结果,因此越小的时间对应越强的平滑;而速度场与边际得分函数之间又有确定的换算关系(\(\nabla \log \pi_t\) 可由 \(v_t^\*\) 与 \(x_t\) 表示)。于是速度估计继承了和边际同样的平滑度排序:轨迹早期的速度对应更平滑的分布,越靠后的速度越接近锐利、越像数据。CFG 要从无条件分支拿的那条「平滑参考」,其实早就在采样器自己走过的路径上;MG 只是把它用 EMA 的形式存了下来。
需要强调的是,MG 并不打算替代 CFG,而是与之正交:与 CFG 一起用时,经过 CFG 外推后的速度直接当作 MG 的「基础速度」,MG 在这个基础上再向外推一次,且 CFG 在每一步都保持开启。两者推动的方向不同——CFG 是沿着「对条件变量求平均」的方向离开,MG 是沿着「轨迹历史」的方向离开——所以可以叠加使用。(引导项是纯更新式的设计,用文字与公式已能讲清,这里不强行画流程图。)
关键设计¶
1. 速度动量:用采样器自己的历史充当「更平滑的参考分支」
这条设计针对的痛点非常具体:现有的所有去平滑式引导都必须先有一条更平滑的参考预测,而拿到它的两条路(CFG 的额外无条件前向、Autoguidance 的弱 checkpoint)分别代价是多一倍 NFE 和依赖不存在的辅助权重。MG 的观察是,参考不必来自另一个模型或另一条分支,它可以来自同一轨迹的过去。依据就是上一节说的平滑度排序:第 \(i\) 步之前那些在高噪声时刻算出来的速度,本来就是在更平滑的边际上求出的条件均值,把它们聚起来就是一条天然平滑的参考。
聚合方式用的是指数滑动平均,与优化里的动量一脉相承:
其中 \(\beta \in [0,1)\) 控制速度历史的衰减速度。\(\beta\) 越大,参考越偏向更早、更平滑的估计,动量越稳也越「陈旧」;\(\beta\) 越小则参考更贴近当前步。用 EMA 而不是「直接拿上一步的速度」,是因为单步速度既带噪又只反映一个时刻的平滑程度,而 EMA 把多个不同噪声水平下的估计揉在一起,得到一条更稳定、更明确平滑的参考——这与优化中一阶动量抑制梯度噪声的作用是同一个道理。论文用「隐式干净数据预测」\(\hat{X}_{1|t}\)(即在当前速度场下、由 \(x_t\) 推得的条件数据均值,见下节)把这条参考的效应可视化了:在 FLUX.1-dev 上用 \(\alpha=0.6\)、\(\beta=0.8\) 做 MG,相比 CFG=1.5 的基线,MG 的估计在轨迹早期就出现更清晰的对象结构和更稳定的色彩;而外推方向 \((v_t - m_t)\) 的形态也很有意思——它先对准物体的粗略几何轮廓,随着流程接近数据分布才逐渐集中到花瓣边缘、露珠这类高频细节。这说明动量吸收掉的正是「已有的、平滑的部分」,外推项携带的是「新冒出来的信息」。
2. 外推更新:把锐化压进一次向量加法里,换取零额外 NFE
得到参考之后,锐化的做法与 CFG 在形式上完全一致——只不过被推开的对象换成了动量 \(m_{t_i}\):
\(\Delta t = t_{i+1}-t_i\),\(\alpha \ge 0\) 控制向更锐利分布外推的强度,\(\alpha=0\) 时公式退化为标准 Euler 更新。这里最关键的工程性质是:\(v_\theta(Z_{t_i},t_i)\) 是基础采样器本来就要算的那一次前向,MG 只是多算一次同形状向量的减法与加法,因此每一步的函数评估次数、显存里的中间激活、以及与批大小相关的开销都完全不变。额外状态只有一个和流状态同形状的动量缓冲:ImageNet-256 上(SD 编码器、DiT-XL 主干)隐变量是 \(32\times32\times4\),1024² 的 FLUX.1-dev 量级约为 \(128\times128\times16\),相对于模型参数和激活可以忽略。这一点是 MG 与 CFG 的分水岭:CFG 每步要两次评估,MG 只需要一次。
实现上还有两个细节:论文说明 MG 采用了无偏 EMA 修正(Adam 式的偏差修正,用于抵消动量初始化前若干步的偏差)与动量归一化(避免动量模长与当前速度量级不匹配时外推项尺度失控);⚠️ 二者的确切形式论文正文未展开,以原文附录为准。此外,外推不是越猛越好:\(\alpha\) 过大或者动量记忆过长(\(\beta\) 过大)都会把速度「过校正」,反而使质量下降——这也解释了为什么需要动量归一化。
3. 与 CFG 正交的可插拔组合与引导区间
MG 从设计上就不与 CFG 竞争,而是把自己嵌到既有管线里。与 CFG 同用时,基础速度换成 CFG 外推后的速度,CFG 全程保持激活,MG 在其上再做一次同方向的外推;这也意味着 MG 可以非常轻地插到任何使用条件速度的采样流程中,不需要重训模型、不需要改网络、不需要额外的条件输入。有用性在 ImageNet-256 上得到了系统验证:在 CFG = 1.0(即不加 CFG)到 2.0 的每一个引导强度、以及 16/32/64 三档采样预算下,MG 都降低了 FID,而且不只是把最优 CFG 平移过去——它把整条 FID 曲线压低;在 precision–recall 平面上则表现为同时提高 precision 又更好地保住 recall,把帕累托前沿向外推,这是单纯调大 CFG(用 recall 换 precision)做不到的。它还能叠在已经在做「坏模型引导」的方法上:论文把 MG 加到 RAE(一种借助额外视觉基础模型的引导式基线)之上仍然带来改进。
论文还沿用了 Guidance Interval 的思路,把 MG 的施加区间也做成超参扫描(\([0.1,0.6]\)、\([0.1,0.7]\)、\([0.2,0.6]\)、\([0.0,1.0]\)),说明「在哪些时间步上引导」与「引导多强」是两个可独立调节的维度。值得注意的是,这个区间限制只在 ImageNet 上使用;在 SD3 / FLUX.1-dev 的文本到图像实验里,MG 是在所有时间步上施加且不做区间裁剪的,只调 \(\alpha\) 与 \(\beta\)——这从侧面说明 MG 的默认配置已经足够稳,不需要针对每个模型重新设计调度。
损失函数 / 训练策略¶
MG 是纯推理时方法,不引入任何新的训练目标、不微调任何参数。被引导的基础模型仍然按 Rectified Flow 的标准均方误差目标训练:让网络预测从噪声到数据的位移 \(X_1-X_0\)(等价于在 \(X_t = tX_1+(1-t)X_0\) 的插值路径上的条件期望速度)。因此 MG 的全部「调参」都发生在推理阶段,具体是三个量:
- \(\alpha\)(外推强度)与 \(\beta\)(EMA 衰减):在 ImageNet-256 上,论文对每一组 (CFG 尺度, NFE 预算) 用 FID-10K 做网格搜索选出 \((\alpha,\beta)\),再在 FID-50K 上报告;在 SD3 / FLUX.1-dev 上只调这两个量;在 HunyuanVideo 上则固定 \(\alpha=0.6,\ \beta=0.2\),不做穷举搜索。
- 施加区间(可选):ImageNet 上扫描了上述四组时间区间。
基础采样器统一使用标准 Euler 采样器 + 均匀离散时间网格(文本到图像则沿用各模型自带的默认调度)。论文明确说明 MG 的额外显存只是一个与流状态同形状的 EMA 缓冲,计算上只是逐元素加减,不改变 NFE。
实验关键数据¶
主实验¶
评测覆盖三类设定:ImageNet-256(官方 Rectified Flow 代码库 + 改进的 DiT-XL,隐空间用 SD 编码器)上的系统性消融;大规模文本到图像(SD3、FLUX.1-dev),用 HPSv2 基准的 3200 条 prompt、1024² 分辨率,指标为 HPSv2.1 与 ImageReward;以及文本到视频(HunyuanVideo,VBench 协议,540p / 65 帧,所有方法共用随机种子 42)。
表 1:ImageNet-256 上 FID-50K 随引导强度与采样预算的变化(\(w=1\) 即 MG 不加 CFG,其余为 MG 叠在 CFG 之上)
| 引导设置 | 方法 | NFE=16 | NFE=32 | NFE=64 |
|---|---|---|---|---|
| \(w=1.0\)(不加 CFG) | 基线 | 7.76 | 5.57 | 4.75 |
| + MG | 4.46 | 3.58 | 3.26 | |
| \(w=1.2\) | CFG | 3.26 | 2.20 | 1.89 |
| CFG + MG | 2.00 | 1.71 | 1.60 | |
| \(w=1.4\) | CFG | 2.38 | 2.04 | 2.03 |
| CFG + MG | 1.85 | 1.90 | 1.99 | |
| \(w=1.6\) | CFG | 3.13 | 3.17 | 3.34 |
| CFG + MG | 2.62 | 2.89 | 3.17 | |
| \(w=1.8\) | CFG | 4.48 | 4.76 | 4.99 |
| CFG + MG | 3.49 | 3.96 | 4.62 | |
| \(w=2.0\) | CFG | 5.94 | 6.36 | 6.62 |
| CFG + MG | 4.62 | 5.27 | 6.08 |
论文报告的平均改善幅度为:不加 CFG 时 FID 相对下降 36.54%,在 CFG = 1.2 上叠加时平均下降 25.42%(均为跨采样设定的平均,原始数值见表中各行,可自行核对)。表 1 中最强的是 CFG = 1.2 + 64 NFE 的配置,这也是全表最优 FID。
表 2:与引导类基线的对比(ImageNet-256,FID/IS/Precision/Recall,50K 样本)
| NFE | 方法 | FID-50K ↓ | IS ↑ | Precision ↑ | Recall ↑ |
|---|---|---|---|---|---|
| 16 | CFG-int (\(\omega\)=1.4) | 2.352 | 249.85 | 0.791 | 0.612 |
| 16 | CFG-int + MG (\(\omega\)=1.4) | 1.553 | 268.03 | 0.799 | 0.636 |
| 16 | ADG (\(\omega\)=1.4) | 2.324 | 275.28 | 0.827 | 0.570 |
| 16 | CFG++ (\(\omega\)=0.6) | 2.620 | 368.80 | 0.842 | 0.572 |
| 32 | CFG-int (\(\omega\)=1.4) | 1.642 | 264.75 | 0.800 | 0.626 |
| 32 | CFG-int + MG (\(\omega\)=1.4) | 1.408 | 274.99 | 0.801 | 0.633 |
| 64 | CFG-int (\(\omega\)=1.4) | 1.462 | 271.34 | 0.803 | 0.625 |
| 64 | CFG-int + MG (\(\omega\)=1.4) | 1.380 | 277.73 | 0.802 | 0.630 |
| 50/2 | RAE† (\(\omega\)=1.0) | 1.535 | 241.56 | 0.791 | 0.644 |
| 50/2 | RAE† + MG (\(\omega\)=1.0) | 1.376 | 242.83 | 0.790 | 0.642 |
其中 CFG-int 是把 CFG 限制在 \(t\in[0.125,1]\) 上的区间调度基线,MG 则全区间 \([0,1]\) 施加;† 表示该基线额外用了基础流模型之外的视觉基础模型(RAE)。论文按各自建议超参搜索后报告了 ADG 与 CFG++ 的最优 FID。可以看到 MG 在同等 NFE 下都把 CFG-int 的 FID 进一步压低,而且 16 步就能达到 1.553,比 32 步的基线(1.642)还好。
表 3:文生图与文生视频迁移(SD3 28 步 / FLUX.1-dev 50 步 / HunyuanVideo)
| 模型 | 指标 | 基线 | + MG |
|---|---|---|---|
| SD3 | HPSv2.1 @ CFG=1 / @ CFG=5 | 22.87 / 30.22 | 27.37 / 30.62 |
| SD3 | ImageReward @ CFG=1 / @ CFG=5 | −0.093 / 1.099 | 0.395 / 1.111 |
| FLUX.1-dev | HPSv2.1 @ CFG=1 / @ CFG=3 | 24.40 / 31.28 | 24.80 / 31.29 |
| FLUX.1-dev | ImageReward @ CFG=1 / @ CFG=3 | 0.345 / 1.094 | 0.391 / 1.096 |
| HunyuanVideo | VBench quality / semantic / total | 0.842 / 0.716 / 0.816 | 0.845 / 0.717 / 0.819 |
两个文生图模型上,MG 在所有 CFG 尺度上都提升了 HPSv2.1(SD3 在 CFG=2~5 上稳定提升约 0.2~0.4,FLUX.1-dev 提升幅度较小、约 0.02~0.07);ImageReward 在多数配置下也提升,CFG 较大时有极轻微回落。视频侧 MG 用固定的 \(\alpha=0.6,\beta=0.2\)、不做任何 prompt 级调参,VBench 总分从 0.816 提到 0.819。
消融实验¶
表 4:超参与采样预算的行为分析(ImageNet-256,FID-10K 用于选参,FID-50K 报告)
| 配置 / 变量 | 观察 | 说明 |
|---|---|---|
| \(\alpha = 0\) | 退化为原采样器(或原 CFG) | 对应图 4 中 landscape 的边界 |
| \(\alpha\) 从 0 适度增大 | FID 在很宽区间内下降 | 外推确实在做去平滑 |
| \(\alpha\) 过大 | FID 回升 | 速度被过校正,质量反而变差 |
| \(\beta\) 过大(动量记忆过长) | FID 回升 | 参考过于陈旧,锐化方向偏离 |
| 最优区域 | 中等 \(\alpha\) + 小到中等 \(\beta\) | 强外推偏好较短的动量记忆 |
| NFE = 16 | 大多数 \((\alpha,\beta)\) 配置已优于基线 | 小采样预算下收益最大 |
| MG 施加区间(4 组扫描) | 取 FID 最优的一组 | 受 Guidance Interval 启发 |
表 5:VBench 逐维度对比(HunyuanVideo,\(\alpha=0.6,\beta=0.2\),540p)
| 维度 | 基线 | + MG | 维度 | 基线 | + MG |
|---|---|---|---|---|---|
| Subject Consistency | 0.962 | 0.962 | Multiple Objects | 0.679 | 0.708 |
| Motion Smoothness | 0.992 | 0.991 | Object Class | 0.731 | 0.765 |
| Dynamic Degree | 0.639 | 0.653 | Spatial Relation | 0.871 | 0.885 |
| Background Consistency | 0.974 | 0.975 | Temporal Flicker | 0.695 | 0.681 |
| Scene | 0.387 | 0.356 | Appearance Style | 0.991 | 0.991 |
| Overall Consistency | 0.266 | 0.265 | Temporal Style | 0.241 | 0.240 |
| Aesthetic Quality | 0.623 | 0.624 | Human Action | 0.930 | 0.920 |
| Imaging Quality | 0.653 | 0.668 |
关键发现¶
- MG 不是把最优 CFG 平移,而是压低整条曲线。图 3 的消融显示,在 16/32/64 三档预算下,MG 的最优配置曲线整体位于 vanilla CFG 曲线下方,而且阴影视带(其余 \((\alpha,\beta)\) 组合的范围)表明多数配置都能赢基线,说明方法对超参并不敏感。收益随采样步数减少而放大,NFE=16 时收益最大——这对少步生成的实用价值最高。
- 它改变的是 precision–recall 的取舍方式。单独调大 CFG 必然用 recall 换 precision;MG 在提高 precision 的同时把 recall 也保住甚至抬高(表 2 中 MG 的 Precision 基本持平、Recall 普遍更高),因此帕累托前沿是向外扩张而不是沿曲线滑动。这也是论文最核心的实证主张。
- 参考来源可替换、可叠加。把 MG 加到 RAE 这类本身就用了额外视觉基础模型的引导方法上仍然有效(1.535 → 1.376),说明「轨迹历史」这条参考与「弱模型 / 额外模型」这条参考携带的信息是互补的。
- 超参最优区在「中等外推 + 较短记忆」。\(\alpha\) 从 0 增大普遍有益,但过大或 \(\beta\) 过大都会过校正;这一模式在 16/32/64 三档预算上保持一致,暗示强外推需要的是「刚刚过去的平滑信息」而不是「很久以前的」。
- 收益随模型规模与任务变化:ImageNet-256 上的 FID 提升幅度很大(数十个百分点),而 SD3 / FLUX.1-dev 上的 HPSv2.1 提升只有零点几(FLUX.1-dev 上尤其小);视频侧总分只提升 0.003,且在 Scene、Temporal Flicker、Human Action 三个维度上小幅下降。也就是说 MG 在小模型 + 少步 + 类别条件的设定下最有效,在大模型 + 默认调度上更多是「稳定不亏」的增量改善。
亮点与洞察¶
- 把「引导必须有一条外部参考分支」这个隐含前提打掉了。CFG 用无条件分支、Autoguidance 用弱 checkpoint、SAG/PAG 用扰动后的注意力,共同假设都是参考要来自模型之外的某处;MG 指出采样轨迹自身的历史(因为 RF 边际保持的平滑度排序)就已经是同一条参考,这个观察很干净,且直接换来「零额外 NFE」这一硬性优势。
- 与优化中动量的类比被用到了正确的位置。这里的动量不是用来加速收敛,而是用来构造一条低方差、明确更平滑的参考——EMA 在这里的作用是「时间上的低通滤波」,这个技巧可以迁移到任何迭代式采样器的分析里。
- \(\hat{X}_{1|t}\) 诊断可视化是可复用的分析工具。用「隐式干净数据预测」在图像空间观察引导如何逐步重塑轨迹,比只看最终样本更能说明引导到底在哪一段起了作用;论文也据此给出了一个反直觉的发现:外推方向先承载粗轮廓、后承载高频细节,即动量吸收的是「已确定的平滑成分」,外推项携带的是「新出现的细节」。
- 可迁移的改造点很明确:(1) 任何有 ODE/SDE 采样器的生成模型(视频、3D、音频、TTS)都可以把这条 EMA 动量直接挂上去,因为它只要求「有一个逐步查询的速度/得分网络」;(2) 少步蒸馏与一致性模型同样在多步迭代,收益最大的恰好也是小 NFE 区间,值得一试;(3) 由于 \(m_t\) 携带粗结构、\((v_t-m_t)\) 携带细节,二者可以分开放大,这给「只加细节不改构图」的可控生成留了口子。
局限与展望¶
- 论文没有单独的 Limitation 章节,作者在结论里更多强调方法的简单与通用;以下部分为阅读后的观察。
- \(\alpha\) 与 \(\beta\) 仍是需要网格搜索的手工超参。论文在 ImageNet 上对每组 (CFG, NFE) 做 FID-10K 网格搜索,在 HunyuanVideo 上则直接固定了一组值。缺一个「随轨迹自适应」的调度:从机制上看,早期步骤更应该往平滑参考上靠(\(\beta\) 大一些以获得稳定的粗结构)、后期应该收紧(\(\beta\) 小一些以便锐化细节),而当前实现是用一组常数走完全程。
- 在 16 步这一档,动量假设可能变弱。MG 依赖「更早的速度更平滑」,但少步采样时相邻时间点间隔很大、轨迹上可用于 EMA 的样本点很少,此时动量的平均效果与多步时必须不同;论文虽然显示 NFE=16 收益最大,但没有对「步数与最优 \(\beta\) 的关系」给出解释性分析。
- 大模型上的收益偏小,个别指标有回退。SD3/FLUX.1-dev 上 HPSv2.1 的提升在 0.02~0.07 量级,VBench 的 Scene(0.387→0.356)与 Temporal Flicker、Human Action 也小幅下降;论文报告的是「多数配置提升」,但没有讨论这些回退的来源,也没有给出与人类偏好评测之外的真实用户研究。
- 理论刻画缺失。MG 与 CFG 被描述为「正交」,但这只在经验上被验证:论文没有给出 MG 等价于对哪个修改后的分布 / 得分函数做锐化的推导,也没有说明 \(\alpha\) 与「采样温度」之间的对应关系。若有这层分析,\(\alpha\)、\(\beta\) 的选取就不用靠网格搜索。
- 改进思路:把 \(\alpha, \beta\) 写成流时间 \(t\) 的函数并做轻量自适应(例如按当前速度与动量的夹角决定外推强度,夹角小说明方向一致、可以推得更狠);把单步 EMA 换成对轨迹的显式低通滤波或多项式外推;与 ADG / CFG++ 这类改动引导更新方向的方法组合验证;在少步蒸馏模型与一致性模型上系统验证收益是否依然存在。
相关工作与启发¶
- vs CFG:CFG 用「条件速度 − 无条件速度」的差做外推,参考来自额外一次前向;MG 用「当前速度 − 轨迹速度动量」的差做外推,参考来自已经算过的历史。代价上 MG 每步只要一次评估(CFG 要两次),且不需要模型具备无条件分支能力;代价是 MG 多了一个需要调的超参 \(\beta\),并且参考的「平滑程度」是隐式由 \(\beta\) 与步长决定的,不像 CFG 那样有明确的语义。
- vs Autoguidance:两者都把参考换成「更差/更平滑的预测」,但 Autoguidance 的参考是一个独立训练的弱模型,需要额外 checkpoint(开源大模型通常不提供)和额外显存;MG 的参考是采样过程自己产生的,完全不需要外部依赖,所以更贴合「即插即用」的定位。相对的,Autoguidance 的参考质量更可控,而 MG 的参考质量取决于 \(\beta\) 与轨迹本身的离散化。
- vs Guidance Interval / CFG++ / ADG:这些方法改的是引导更新的调度、约束或方向(在哪些时间步施加、把更新约束到流形上、把外推改成角度域的旋转),参考分支仍然是 CFG 的无条件分支。MG 改的是参考分支的来源,因此与它们是正交的两条改进路线,论文也实测了叠加效果(MG 加到 CFG-int 与 RAE 之上都继续提升)。反过来说,ADG 关于「隐空间引导应该旋转而不是外推」的论证提示 MG 的线性外推在高维隐空间里可能同样面临方向问题,这值得进一步检验。
- vs SAG / PAG / SEG 这类自注意力引导:它们从同一网络内部构造退化/平滑预测(扰动注意力、平滑注意力能量),确实也不需要辅助模型,但需要改动网络内部、多一次带扰动的评估;MG 只接触采样循环、不碰网络内部,兼容性更强,且完全没有额外评估。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把「更平滑参考」的来源从模型外部搬到采样轨迹自身,思路简洁但有实质洞察,且直接带来零额外 NFE 的工程优势
- 实验充分度: ⭐⭐⭐⭐ 覆盖 ImageNet-256、SD3、FLUX.1-dev、HunyuanVideo 四类模型与图像/视频两域,消融系统(CFG×NFE 网格、\(\alpha\)/\(\beta\) 景观、区间扫描),并给出 precision–recall 前沿这一有说服力的分析;但缺少与最新几类引导方法的全面同预算对比,大模型上的增益也偏小
- 写作质量: ⭐⭐⭐⭐ 动机链条(过度平滑的两个来源 → 引导即去平滑 → 轨迹历史可作为参考)讲得清楚,算法伪代码只有 9 行;部分公式在缓存文本中损坏、若干实现细节(无偏 EMA 修正、动量归一化)留在附录
- 价值: ⭐⭐⭐⭐ 免训练、免重训、零额外评估、可与 CFG 叠加,实用门槛极低,任何用流模型采样的人都可以直接插上;主要限制是超参仍需按模型网格搜索