跳转至

Glance: Accelerating Diffusion Models with 1 Sample

会议: ECCV2026
论文: ECCV 原文
代码: https://zhuobaidong.github.io/Glance/
领域: 图像生成
关键词: 扩散模型、阶段感知加速、低秩适配、流匹配、单样本训练

一句话总结

Glance 冻结预训练图像生成器,仅用一个图文样本训练负责早期语义与后期细节的两个 LoRA,以非均匀减步实现论文所称的五倍加速,但文字渲染并未无损保留。

研究背景与动机

扩散模型和流匹配模型需要反复调用大型去噪网络,生成成本不只来自参数量,也来自同一网络要沿噪声轨迹运行许多次。 FLUX.1 与 Qwen-Image 已经具备丰富的视觉知识,直接把采样步骤从 50 次压到少数几次,却可能破坏原有生成轨迹。 现有少步蒸馏通过轨迹、一致性或分布匹配训练学生,但额外数据与计算成本可能远高于一次普通的定制微调。 如果每次定制基座后都要重新进行昂贵蒸馏,推理侧节省的成本就被开发侧的反复训练部分抵消。

Glance 的切入点是去噪过程内部的不均匀性:高噪声早期先决定主体、布局和整体语义,低噪声后期更多调整纹理与细节。 均匀跳步给两类阶段施加相同的压缩压力,却忽略了早期结构错误可能沿后续轨迹持续传播。 论文因此不是重新设计一个更小的生成网络,而是保留原模型,把有限的采样预算更多分配给对语义敏感的阶段。 这里的“慢”与“快”描述沿原始轨迹推进的幅度,不是两个不同尺寸或不同硬件速度的网络。

单样本训练也不意味着从一张图中学会开放域生成:开放域知识已经存在于冻结的预训练参数中。 新增参数要学习的是适应更稀疏的时间步,而不是重新学习物体类别、构图和文字语义。 这一解释让极低数据量成为合理的实验问题,但本身还不是单样本必然泛化的理论保证。 核心 idea:用阶段专用的低秩更新修正少步去噪行为,早期保守推进、后期大幅跨步,从而以很少的训练数据复用基座已有的生成能力。

方法详解

整体框架

训练输入是一个图文样本、预训练生成器和去噪时间步;推理输入仍然是新提示词与初始噪声。 Glance 先做阶段感知分步,再让 Slow-LoRA 与 Fast-LoRA 分别适应各自负责的噪声区域,最后按同一阶段划分执行少步推理。 两个适配器共享冻结的基座,不串接成两个完整生成器,也没有每一步都同时调用两个专家。 训练时的图像提供流匹配监督;测试时不需要把那张训练图像作为额外条件输入。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        Input["训练:一个图文样本<br/>冻结基座与时间步"] --> Phase["阶段感知分步"]
        Phase --> Experts["双专家低秩适配"]
        Experts --> Supervision["分阶段流匹配监督"]
        Supervision -->|训练得到两个适配器| Sampling["推理:先 Slow-LoRA<br/>再 Fast-LoRA"]
        Prompt["新提示词与初始噪声"] --> Sampling
        Sampling --> Output["生成图像"]

图中的监督阶段只发生在训练中,推理不会把生成结果送回训练损失。 专家选择由当前阶段决定,而不是另训一个根据图像内容打分的路由器。 因此,推理成本下降主要来自网络求值次数减少,低秩适配则负责降低训练开销并恢复减步后的质量。

关键设计

1. 阶段感知分步:给早期语义形成保留更密的采样

论文将高噪声区域视为语义形成阶段,将低噪声区域视为细节细化阶段,并尝试用信噪比 SNR 指示二者的过渡边界。 这一区分的意义是让时间步分配对应生成过程中的不同职责,而不是机械地把全部时间索引均分成两段。 Slow-LoRA 对应前一阶段,以较小的跨步幅度稳住全局结构;Fast-LoRA 对应后一阶段,用更大的跨步幅度跳过部分重复细化。 这种设计不是认定所有后期步骤都没有价值,而是在有限求值预算下优先保护早期容易产生连锁影响的决定。

图 3 给出一个具体的 50 步到 10 步配置:原轨迹前 10 个时间步每隔 2 步取一次,得到 5 个慢阶段采样点。 剩余 40 个时间步均匀选择 5 个快阶段采样点,推理时先执行前一组,再执行后一组。 这样,同样保留 10 次采样,前段的保留密度明显高于后段,而不是在全轨迹上等间隔抽取。 但第 3.2 节同时声称 SNR 随去噪下降、又说从低 SNR 走向高 SNR;第 3.1 节的插值端点也与后续时间方向描述不一致。 因此本笔记保留可读的阶段原则和图示采样分配,不把“初始 SNR 的一半”等文字补成可直接运行的精确阈值算法。

2. 双专家低秩适配:共享知识,只分开修正阶段误差

若让同一组 LoRA 参数兼顾语义形成与纹理修复,更新方向可能同时受到两种不同噪声区域的牵制。 Glance 使用两组独立低秩矩阵,当前处于哪个阶段,就将对应更新加到冻结权重上。 对某个被适配的权重矩阵,其结构关系为:

\[ \Theta_i'=\Theta+B_iA_i,\qquad i\in\{1,2\}. \]

这里 \(\Theta\) 是原始权重,\(A_i\)\(B_i\) 是第 \(i\) 个专家的可训练矩阵;中间低秩维度远小于原矩阵的输入输出维度。 不同专家并不保存两份完整基座,阶段专用容量主要来自两套增量参数。 这也解释了“学生”一词的边界:它是基座加适配器构成的少步生成器,而不是参数量大幅缩小的独立学生网络。 原文没有给出足以据此计算完整可训练参数量的明确 rank 配置,不应自行补上常见默认值。

第 4.1 节明确说明适配位置超出了标准注意力的 query、key、value 和 output 投影。 额外覆盖辅助投影层,以及视觉分支和文本分支中的模态专用 MLP,以便少步更新仍能保留跨模态依赖。 这些位置都服务于同一个双专家低秩适配设计,不是新增的第三类专家。 它的代价是推理仍需运行大型 FLUX.1 或 Qwen-Image 基座,训练参数少不能等同于模型驻留显存小。

3. 分阶段流匹配监督:学习去噪方向,而非记住最终训练图

训练根据图像、噪声、时间与文本条件构造中间潜变量,让激活的专家预测该状态下的速度场。 原文将目标描述为预测速度与目标流向量之间的均方误差,并允许使用随时间变化的权重 \(w(t)\)。 每个专家只在自己的阶段内接受监督,冻结基座负责提供已有表示,低秩参数负责吸收适应该阶段的更新。 该目标没有要求另训判别器,也没有把两个专家之间的输出差当成新的对抗目标。

正文的流匹配损失在缓存提取中缺失了部分运算符,目标流向量的具体构造流程也未充分展开。 因此这里只解释明确写出的速度回归机制,不把修复后的数学表达冒充作者可逐项复现的原始公式。 尤其不能据“蒸馏”一词自动推断存在额外教师轨迹缓存、逐步教师回归或未写出的分布匹配损失。 论文把数据效率归因于流匹配对去噪方向的直接监督,但这属于作者解释,并未通过独立理论证明完全确立。

一个完整示例

以论文图 3 的 10 步配置为例,先用选定的一个图文样本训练两套适配器,再换成未见过的提示词开始生成。 新提示词经过基座原有的文本处理,初始噪声作为图像潜变量进入去噪轨迹。 前 5 个保留采样点使用 Slow-LoRA,重点是在原轨迹前 10 步所对应的区域保持较细的推进。 进入其余区域后切换 Fast-LoRA,在原先后 40 步的跨度内只执行另外 5 个采样点。 最后由原生成流水线产生图像,而不是检索或复制训练图像的局部内容。 如果后期细化预算不够,小字笔画可能模糊;这与论文的文字渲染失败案例一致,但不是对每个提示词的确定性预测。

损失函数 / 训练策略

主表 1、表 2 的结果统一使用图 6 中的 Fox 图文样本训练,基座参数始终冻结。 论文实验覆盖 FLUX.1-12B 与 Qwen-Image-20B;教师采样器采用 FlowMatchEulerDiscreteScheduler。 表 2 列出 8 步模型的训练成本为 0.6 GPU 小时、10 步为 0.8 GPU 小时,摘要称可在单张 V100 上于一小时内训练。 图 1 又以 A100 GPU 小时标示横轴,表 2 未逐项注明硬件,因而这些数字不宜直接当成统一硬件的严格成本对照。 单样本仍可以对应多个噪声状态和时间步的监督,并不等于只做一次参数更新。 缓存正文未充分提供学习率、优化器、训练轮数和精确阶段阈值,不能只凭本文叙述恢复完整训练配方。

实验关键数据

主实验

评测覆盖 COCO-10k、HPSv2、OneIG-Bench、GenEval、DPG-Bench 与 LongText-Bench,主生成分辨率写作 \(1024^2\)。 下表摘自原文表 2(第 6 页):OneIG-Bench 五项分数均越高越好,Data 为训练样本数。 NFE 是网络函数求值次数;保留 Qwen 的 \(\times2\) 记法,不能将其 10 步设置与其他方法的 4 NFE 当成同一预算。

模型 / 配置 Data NFE Alignment Text Diversity Style Reasoning
FLUX.1 dev 不适用 50 0.790 0.556 0.238 0.370 0.257
Glance (FLUX) 1 10 0.788 0.328 0.204 0.358 0.231
Qwen-Image 不适用 50×2 0.880 0.888 0.194 0.427 0.306
Qwen-Image,直接减步 不适用 10×2 0.802 0.693 0.156 0.410 0.290
Qwen-Image-Lightning 0.4M 4 0.885 0.923 0.116 0.417 0.311
单 LoRA,均匀时间步 1 10×2 0.621 0.332 0.097 0.298 0.193
Glance (Qwen) 1 10×2 0.868 0.734 0.160 0.421 0.303

Qwen 的 Alignment 从直接减步的 0.802 恢复到 0.868,接近教师的 0.880;Text 仍由教师的 0.888 降为 0.734。 FLUX 的 Text 从 0.556 降至 0.328,所以“接近教师”主要不能泛化成所有能力都保持不变。 表 1(第 6 页)还报告 Qwen 的 COCO FID 从教师 34.1 变为 Glance 37.8,而直接 10 步是 39.1;FID 越低越好。 同表 HPSv2 提示集的 HPSv2.1 从教师 0.309 变为 0.308,说明偏好分数接近并不排除其他指标受损。 50 步减为 10 步对应五倍步数缩减,但正文未给出足够的同硬件端到端延迟统计来将它无条件等同于实测五倍吞吐提升。

消融实验

原文表 3(第 12 页):Qwen-Image 基座,OneIG-Bench,比较两个专家、单阶段适配和单专家配置。 其中 Base 表示对应阶段不使用已训练的阶段适配器;本表按原表报告,不与表 5 的同名配置合并。

配置 Alignment Text Diversity Style Reasoning
Slow3–Fast5 0.849 0.614 0.152 0.396 0.284
Slow3 + Base5 0.805 0.567 0.123 0.368 0.255
Base3 + Fast5 0.747 0.521 0.125 0.372 0.243
Single (identical) 0.702 0.453 0.110 0.342 0.218
Single (uniform) 0.621 0.332 0.097 0.298 0.193

移除早期适配后 Alignment 为 0.747,移除后期适配为 0.805,支持早期阶段对最终结果更敏感。 相同时间步下,双专家为 0.849、单专家为 0.702,说明收益不仅来自重新分配采样点。 原文表 5(第 12 页)另在固定一个图文样本的条件下改变慢快步数,数据如下。

时间步配置 Alignment Text Diversity Style Reasoning
Slow3 + Fast5 0.863 0.692 0.162 0.414 0.286
Slow5 + Fast5 0.868 0.734 0.160 0.421 0.303
Slow5 + Fast10 0.874 0.813 0.175 0.422 0.305

表 3 与表 5 的 Slow3–Fast5 指标不同,前者 Alignment/Text 为 0.849/0.614,后者为 0.863/0.692;正文未清楚解释差异来源。 表 3 的 Single (uniform) 又与表 2 的 10×2 NFE 均匀 LoRA 行完全相同,而第 4.3 节描述八步对照,预算对应关系也需核实。

关键发现

  • 表 5 将 Fast5 增至 Fast10 后,Text 从 0.734 升到 0.813;后期并非完全冗余,细节保真仍需要采样预算。
  • 表 4(第 12 页)从 1 个样本扩至 100 个样本,Alignment 从 0.868 到 0.876,Text 从 0.734 到 0.753,增益有限且各指标不单调。
  • 该数据量实验固定训练 epoch,样本增多也改变更新总量,因此它不是严格固定计算预算的数据规模对照。
  • 表 6(第 14 页)Fox 与 Bookstore 的 Alignment 为 0.868 与 0.797,但后者 Text 为 0.751,高于 Fox 的 0.734;Fox 并非每项都最好。
  • 高斯噪声训练的失败是第 4.4 节的定性结论,没有相应数值行,不应为它补造 benchmark 分数。

亮点与洞察

  • 单样本的价值在于复用预训练知识完成采样适配,而非从极少数据中凭空获得生成能力。这一定位比孤立强调数据量更有解释力。
  • 时间步分配与参数专门化是两个相互配合的杠杆。相同时间步的单专家对照帮助区分二者的贡献。
  • 后期细节失败为“快阶段”划出了边界。文字笔画同样属于重要内容,不能仅因其出现得晚就视为可无损跳过。

局限与展望

  • 作者明确展示密集小字渲染失败;第 14 页报告 Qwen 与 FLUX 的 LongText-Bench 分别落后教师 14.7 与 13.0 分。
  • 样本选择仍有影响,Bookstore 的部分指标明显低于 Fox;现有少数样本对照不足以证明任意自然图像都同样有效。
  • SNR 方向、时间参数约定、表格配置对应及 GPU 成本口径存在不清楚之处,复现时应先核实,而不是依据惯例补齐。
  • 第 4.2 节提及图像编辑 Appendix A,但当前缓存止于参考文献,不能据此确认编辑实验的方法或效果。
  • 笔记作者的后续建议是对文字密集提示词增加后期预算,并在固定计算量、多随机种子的设置下检验数据量和阶段分配;这些不是本文已完成的实验。

相关工作与启发

  • 与 Timestep Master 相比:二者都使用时间相关 LoRA,Glance 强调语义到细节的不均匀减步以及极少样本适配,不能把其贡献简单概括为首次使用多个 LoRA。
  • 与一致性或分布匹配蒸馏相比:Glance 保留完整基座、训练阶段专用增量,以低训练成本为主要优势;其他方法的更低 NFE 和部分更优指标仍有实际价值。
  • 与直接减步相比:同一 Qwen 基座的主表显示适配可恢复部分质量,说明减少求值次数和学习如何少步生成不是同一件事。
  • 可迁移启发:对生成轨迹分阶段分配计算值得探索到其他生成任务,但本文的文本到图像证据不直接证明视频或任意定制模型上也有效。

评分

  • 新颖性: 4/5。阶段感知双 LoRA 与单样本结果组合有吸引力,但时间专家和低秩适配已有前作。
  • 实验充分度: 3/5。跨基座、跨基准及多类消融较完整,配置不一致与成本口径限制了结论强度。
  • 写作质量: 3/5。主线直观,但 SNR 描述矛盾、细节缺失及过强的无损表述需要谨慎阅读。
  • 价值: 4/5。为低成本少步适配提供实用方向,适合能够接受文字细节损失的生成场景。