Accelerating Diffusion Transformers with Gaussian Process Rectified Feature Cache¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5921
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/14290.pdf
代码: https://github.com/Aredstone/GP-Refiner
领域: 图像生成
关键词: 扩散 Transformer、特征缓存、高斯过程回归、在线校正、不确定性调度
一句话总结¶
GP-Refiner 把加速轨迹上的完整计算特征视为带噪观测,用在线高斯过程校正缓存预测,并按后验不确定性决定是否重新计算;在 Qwen-Image 上,相比 TaylorSeer 的固定间隔配置,在降低计算量的同时将 PSNR 从 28.58 提高到 29.48。
研究背景与动机¶
扩散 Transformer 的昂贵之处不仅是单次网络前向很重,还在于采样需要连续重复许多次。 特征缓存利用相邻去噪步之间的相似性,在部分时刻计算真实中间特征,其他时刻直接复用或预测这些特征。 TaylorSeer 已经从“保存上一帧特征”推进到“根据历史有限差分外推未来特征”,因此能承受比直接复用更长的跳算间隔。 但局部外推不等于轨迹正确:预测误差会改变后续输入状态,随后即便再跑一次完整网络,得到的也是偏移轨迹上的特征,而不是未加速运行的对应特征。
这使在线校正面临一个容易被忽视的监督问题。 若为了训练校正器而并行运行完整参考轨迹,加速所节省的计算会被抵消;若直接把加速过程中的完整前向结果当作无偏真值,又忽略了前面已经累积的误差。 本文的切入点是统计建模:比较这两种完整计算特征后,作者发现局部残差呈近似零均值高斯特征,因此不要求在线获得完全正确的标签,而是把可获得的特征作为带噪观测。 核心 idea:保留原有缓存预测器,用高斯过程从少量在线带噪观测中校正其输出,再把同一回归模型的后验方差用作重新计算的触发信号。
方法详解¶
整体框架¶
输入仍是文本条件与当前扩散潜变量,输出仍是生成图像;GP-Refiner 修改的是中间特征的获得方式,而不是文本编码器或生成目标。 在需要完整计算的步上,系统更新基础缓存预测器,并通过“带噪观测构建”积累局部预测与实际计算特征的配对。 在候选跳算步上,基础预测器先给出特征估计,“高斯过程校正”再输出校正均值与后验方差。 最后,“不确定性重计算”接受可信的校正特征,或执行完整前向,并将新观测反馈给校正器。 这样,特征校正与计算调度不是互不相干的两套规则,而是共享一套在线观测与概率模型。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["文本条件与潜变量<br/>基础缓存预测器"] --> B["带噪观测构建"]
B --> C["高斯过程校正"]
C --> D["不确定性重计算"]
D -->|"低方差:接受校正特征"| E["继续去噪并生成图像"]
D -->|"高方差:完整前向并更新观测"| B
关键设计¶
1. 带噪观测构建:不把偏移轨迹上的完整计算误当作参考真值
需要区分三个对象:从未跳算的参考轨迹特征、加速轨迹上执行完整前向得到的特征,以及基础缓存方法外推得到的特征。 前两者即使对应相同时间步,也会因为输入潜变量不同而出现偏差;第三者还叠加了缓存预测的近似误差。 作者首先研究前两者之间的残差,既看单个残差向量各维度的直方图,也对多个残差向量做随机投影并检查 Q–Q 图。 第 3.2 节报告,100 个随机投影的平均相关系数超过 0.98,最低为 0.9424,支持“局部近似高斯”的建模选择,但不是对所有输入与所有时间步的分布证明。
在真正加速时,参考轨迹不可获得,系统只收集完整计算步上的可见特征。 每次完整前向后,先更新基础预测器的内部状态,再由更新后的预测器产生相邻步预测,并与当前完整计算特征配成观测对。 原文第 3.3 节把该配对写为相邻的预测索引与观测索引,而非简单的同一步“预测—真值”监督。 其目标是共同学习一步演化与校正,把回归范围限制在局部变化,避免直接拟合一段长跳算区间所积累的所有非线性误差。 缓存文本的部分公式排版不完整,因此这里保留原文支持的相邻配对机制,不补写具体索引实现。
2. 高斯过程校正:在预测特征空间中利用短历史回归
高斯过程的输入是基础预测器给出的特征,而不是单独的时间步编号;目标观测是上述完整计算特征。 这一区别意味着它不是再叠加一个沿时间轴拟合的高阶多项式,而是根据当前预测与历史预测在特征空间中的相似性,估计应当输出什么特征。 基础方法仍然负责产生便宜的预测候选,GP-Refiner 负责利用这些候选附近已经观察到的数据进行校正。 因此 TaylorSeer、HiCache、ClusCa 的内部预测方式可以不同,而外接校正框架保持一致。
实现采用 angular RBF 核,并以先进先出窗口保留最近 10 个特征观测。 核矩阵描述历史预测之间的相似性,观测噪声项进入回归计算,使模型不必严格穿过每一个已经带偏的观测点。 给定当前候选特征,回归输出一个均值作为校正结果,同时输出后验方差作为不确定性度量。 窗口限制了在线历史规模,也使模型聚焦当前去噪阶段;它并不意味着高维特征存储、核计算和数据搬运完全免费。 论文的固定间隔消融能较干净地检验这一步:不改变跳算频率时,加入校正仍然改善图像与完整参考结果的一致性。
3. 不确定性重计算:让模型在缺少可信历史支持时退回完整前向
只靠校正均值仍可能在历史样本覆盖不足的位置持续外推,因此系统还要决定何时停止信任校正。 第 3.4 节以预设阈值 \(l\) 判断后验方差:当 \(\sigma_t^2 > l\) 时执行完整计算,否则直接使用高斯过程均值。 触发的完整计算一方面给当前步提供不再经过缓存近似的特征,另一方面更新基础预测器与在线观测集,为后续跳算提供新的局部支持。 这里的“校准”不代表恢复到了从未偏移的参考轨迹;新特征依然是在当前潜变量上计算出来的带噪观测。
与固定每隔若干步重算相比,这种策略尝试把计算放在当前回归模型最不确定的区域,而不是机械遵循同一个周期。 后验方差反映的是给定核、噪声假设和观测集后的模型不确定性,不是可直接读取的真实图像误差,也不是严格的质量保证。 论文称阈值在一定范围内较稳定,但将选择细节指向附录;当前本地主文未包含该附录,不能给出阈值数值、搜索范围或其消融结论。
一个完整示例¶
考虑使用 TaylorSeer 生成一张文本条件图像的中间过程。 某个完整计算步得到新特征后,TaylorSeer 更新历史特征及有限差分,GP-Refiner 同步加入一个局部配对观测。 到下一个候选跳算步,TaylorSeer 先外推出特征,高斯过程再查询最近窗口,给出校正特征和不确定性。 若不确定性低,直接用校正特征继续去噪;若高,则放弃这个近似,执行完整前向并更新窗口。 这个例子描述的是状态更新顺序,不假定某个具体提示词必然触发多少次重计算。
损失函数 / 训练策略¶
本文是推理时插件,没有报告重新训练扩散 Transformer,也不需要离线收集完整参考轨迹来训练一个校正网络。 “无需训练”应理解为无需对生成模型做离线微调,并非推理过程中没有回归拟合或矩阵运算。 实验明确给出 angular RBF 核与长度为 10 的先进先出窗口,但主文未充分展开核超参数、噪声参数及初始化策略。 这些实现细节不能仅凭高斯过程的一般知识替作者补全。
实验关键数据¶
主实验¶
以下节选原文表 1、表 2,使用 DrawBench 的 200 个提示词,质量指标是生成结果相对未加速参考图像的平均一致性。 FLUX.1-dev 与 Qwen-Image 的参考运行均为 50 步;这不是对真实图像的重建测试,也不是人工偏好或文本对齐评估。 PSNR 越高越好,LPIPS 越低越好,延迟与 FLOPs 越低越好;不同模型的绝对延迟不能直接横向比较。
| 模型 / 配置 | 延迟(秒)↓ | FLOPs(T)↓ | PSNR ↑ | LPIPS ↓ |
|---|---|---|---|---|
| FLUX:TaylorSeer,\(O=2,N=7\) | 3.60 | 670.44 | 28.671 | 0.4542 |
| FLUX:TaylorSeer + GP-Refiner,动态间隔 | 3.42 | 643.13 | 29.550 | 0.3497 |
| Qwen-Image:TaylorSeer,\(N=6\) | 9.71 | 2583.97 | 28.58 | 0.46 |
| Qwen-Image:TaylorSeer,\(N=7\) | 8.99 | 2323.30 | 28.20 | 0.65 |
| Qwen-Image:TaylorSeer + GP-Refiner,动态间隔 | 8.37 | 2085.26 | 29.48 | 0.29 |
表中 \(N\) 表示固定缓存间隔,\(O\) 表示 Taylor 外推阶数;完整插件行采用动态调度,并非严格相同计算预算。 相对 Qwen-Image 的 \(N=6\) 行,计算量下降约 19.3%,PSNR 增加 0.90,LPIPS 从 0.46 降至 0.29;若改与 \(N=7\) 比,PSNR 增益为 1.28,不能混用两个基线。 表 2 还报告 8 步 Qwen-Image-Lightning:固定 \(N=3\) 时 PSNR 从 30.064 提高到 31.204,LPIPS 从 0.2962 降到 0.1922,但延迟从 4.56 秒增加到 4.69 秒。 这个低步数设置说明校正可以提高一致性,却不能据此宣称所有配置都同时更快。
消融实验¶
下表节选原文表 3,沿用 FLUX.1-dev、DrawBench 200 提示词和 50 步参考设置。 固定 \(N=7\) 的两行隔离了 GP 校正效果;后两行比较仅动态调度与完整插件,不应视为同预算实验。
| 配置 | FLOPs(T)↓ | PSNR ↑ | SSIM ↑ | LPIPS ↓ |
|---|---|---|---|---|
| TaylorSeer,\(O=2,N=7\) | 670.44 | 28.671 | 0.6237 | 0.4542 |
| 固定 \(N=7\) + GP 校正 | 670.45 | 29.266 | 0.6622 | 0.4151 |
| TaylorSeer + Only Dynamic | 650.21 | 28.930 | 0.6604 | 0.3819 |
| 完整 GP-Refiner | 643.13 | 29.550 | 0.6972 | 0.3497 |
关键发现¶
- 固定间隔时,PSNR 提升 0.595,而 FLOPs 仅从 670.44T 变为 670.45T,支持“校正本身有效”,而非只是多做了网络前向。
- 完整插件相对 Only Dynamic 又提升 0.620 PSNR,说明只调整计算时机不能替代特征校正;但该对比同时涉及不同调度信号,不是完美的单变量拆解。
- FLOPs 加速不等于实际延迟加速。表 1 的 FLUX 完整插件分别报告 5.78 倍 FLOPs 加速与 3.38 倍延迟加速。
亮点与洞察¶
- 将不可获得的理想监督替换为可获得的带噪观测,是比“再设计一个预测器”更关键的切入点。它承认加速轨迹已经偏移,而不是把一次重算当作完全复原。
- 回归均值负责给出特征,后验方差负责判断是否值得继续近似。同一模型同时承担校正与计算调度,使两者围绕同一观测历史协同。
- 固定缓存频率下仍有增益,是比单一速度—质量结果更有解释力的证据。它帮助区分预测质量改善和额外计算带来的收益。
局限与展望¶
- 作者明确讨论的问题:完整前向也不能在线提供参考轨迹真值,方法仍依赖带噪观测假设;长跳算的误差问题是被缓解,而不是被证明消除。
- 读者判断:随机投影的近似高斯形状不等于证明独立同分布、各向同性噪声,也不保证所有提示词和去噪阶段都满足同一模型。
- 证据范围:实验主要衡量对未加速图像的忠实程度。较高 PSNR、SSIM 不自动等于更好的美学质量、文本遵循或视频时序一致性。
- 实现信息缺口:当前主文未给出所引用附录中的阈值选择细节,也未完整说明硬件、分辨率等延迟复现实验条件;不宜把秒数当作普适部署指标。
- 原文一致性问题:第 4.3 节 NFE 统计将 77 张和 119 张都标为 8 次评估,图 5 与后续段落的步数描述也不一致,因此不据此转述精确分布或平均 NFE。
- 可验证的后续方向:应先补充阈值敏感性、方差与实际误差的校准检验,以及固定硬件下的额外延迟和内存开销,再讨论更广泛的部署泛化。
相关工作与启发¶
- 与 TaylorSeer 相比:TaylorSeer 用局部有限差分做时间外推;GP-Refiner 不替代这个预测器,而是利用在线特征观测对其结果再校正。
- 与 HiCache、ClusCa 相比:二者提供不同的缓存预测基础,本文将其视为可插接的底座。原文表 1 的 HiCache 部分并非所有指标都优于每个固定间隔基线,不能概括为全指标支配。
- 与 SpeCa、DiCache 相比:它们通过验证或探测信号抑制漂移;本文强调从带噪观测中做非线性回归,并通过后验不确定性触发重计算,但没有证明该信号在所有场景下更可靠。
- 与减少采样步数相比:缓存仍保留去噪过程中的近似更新,只减少部分昂贵网络计算;步数缩减则直接改变采样离散化,两者的计算路径和误差来源不同。
评分¶
- 新颖性:4/5。将带噪观测、GP 校正和不确定性调度组合成缓存插件,问题切入明确,但基本回归工具成熟。
- 实验充分度:3/5。包含多底座、低步数模型和固定间隔消融,仍缺少充分的复现参数与更广泛质量评估。
- 写作质量:3/5。监督不可得的问题解释清楚,部分索引、统计描述及公式排版影响精确复现。
- 价值:4/5。对已有扩散模型的推理时缓存加速有直接参考价值,实际收益需要结合部署条件验证。