LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/QHR69/LinCa
领域: 扩散模型 / 模型压缩 / VLM效率
关键词: 扩散模型加速、特征缓存、可逆神经网络、差异化多项式外推、Diffusion Transformer
一句话总结¶
针对传统特征缓存方法在时间步与特征维度上动力学不匹配导致的累积误差,LinCa 利用轻量级可逆神经网络将缓存特征分解为不同连续性的子分量并进行差异化阶数多项式外推,以不足 0.2% 的额外参数量在 FLUX、Qwen-Image 和 HunyuanVideo 上实现了 5-7 倍近乎无损的高倍率推理加速。
研究背景与动机¶
基于 Diffusion Transformer (DiT) 的大规模扩散模型在文生图、图像编辑以及视频生成领域展现出前所未有的表现力,但其多步迭代去噪的采样机制带来了极高的时间开销与显存消耗,使得实际部署面临严峻的吞吐量瓶颈。为了降低单步前向传播的计算负担,特征缓存(Feature Caching)技术作为一种无需修改主体模型结构的范式逐渐受到广泛关注。该范式通常每隔 \(N\) 步完整执行一次前向计算并缓存隐藏特征,在中间的 \(N-1\) 步则利用历史缓存直接复用或通过多项式外推估计特征,以此跳过昂贵的层级计算。
然而,现有特征缓存方法普遍存在「跨时间步与跨模型动力学失配」和「跨维度动力学失配」两大核心局限。一方面,主流方案(如 FORA、ToCa、TaylorSeer 等)隐式假设隐藏表征在整个去噪轨迹中服从均匀的演化模式,对所有时间步甚至不同骨干网络套用固定的预测策略;但去噪轨迹在前期、中期和后期呈现截然不同的变化幅度,部分阶段平滑连续,部分阶段则伴随突变剧震,统一缓存规则必然在非平稳阶段引发累积漂移。另一方面,从微观特征维度来看,同一特征张量内的不同维度具有高度异质的连续性特征——部分通道稳定平滑适合高阶多项式预测,而部分通道剧烈振荡只能粗粒度复用;更关键的是,这些异质维度在原始特征空间中深度交织,无法通过简单的规则硬切片进行有效解耦。
现有方法在处理多维度特征时采取一刀切的单一阶数外推,导致高倍加速比下生成质量雪崩式下滑。核心 idea:利用轻量级可逆神经网络构建可学习分解映射,将交织的特征解耦为连续性各异的子分量并匹配差异化阶数的多项式外推,借助可逆架构的严格无损重构与分时间步段独立适配,实现高加速比下的无损去噪特征预测。
方法详解¶
整体框架¶
LinCa 提出了统一的「分解-预测-重构」(Decompose-Predict-Reconstruct)特征缓存流水线。在每个去噪区间的计算步,模型执行完整前向计算并提取最终层的累积残差特征予以缓存;在随后的跳步预测阶段,系统首先通过可学习可逆网络将历史特征映射并沿通道切分为 \(M\) 个具有不同连续性的子分量,接着根据各子分量的动力学特性匹配对应阶数的 Hermite 多项式外推或直接复用,最后将各预测子分量拼接并通过可逆网络的逆映射无损还原到原始特征空间。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入历史累积残差特征 x_t"] --> B["可逆分解映射"]
B --> C["差异化阶数多项式预测"]
C --> D["无损逆重构与分段独立适配"]
D --> E["输出目标步预测特征 x_hat"]
关键设计¶
1. 可逆分解映射:基于加性耦合与正交卷积的特征解耦 为了从原始特征空间中将连续性差异极大的交织维度归类分离,LinCa 设计了轻量级可逆神经网络(Learnable Invertible Network) \(\mathcal{E}_\theta\)。该网络由 \(L\) 个级联的可逆残差块组成,每个块内部包含两个严格可逆的子层:首先通过正交矩阵 \(W\) 参数化的可逆 \(1 \times 1\) 卷积实现全局通道混合;随后利用加性耦合层(Additive Coupling Layer)将通道均分为 \(u_1, u_2\),通过轻量 MLP 模块 \(F, G\) 完成非线性交互变换: $\(v_1 = u_1 + F(u_2), \quad v_2 = u_2 + G(v_1)\)$ 在逆向重构时,解析逆运算仅需执行减法操作 \(u_2 = v_2 - G(v_1)\) 与 \(u_1 = v_1 - F(u_2)\),再乘以逆正交矩阵 \(W^{-1}\)。整个变换严格满足 \(\mathcal{E}_\theta^{-1} \circ \mathcal{E}_\theta = I\),彻底避免了普通前馈网络(如自编码器或 MLP)在映射压缩中引入的不可逆信息损失。
2. 差异化阶数多项式预测:子空间动力学匹配 经过可逆网络 \(\mathcal{E}_\theta\) 映射后的潜特征 \(z_t\) 被沿维度拆分为 \(M\) 个子空间分量(实践中取 \(M=3\)):\(z_t = [z_t^{(0)} \mid z_t^{(1)} \mid \dots \mid z_t^{(M-1)}]\)。针对由可逆网络自动聚类出的不同动态子分量,采用逐级匹配的预测策略: - 对最低阶子空间分量 \(z_t^{(0)}\)(时序连续性较差、存在突变波动的特征维度),采用 0 阶外推,即直接复用最近缓存步的特征 \(\hat{z}_t^{(0)} = z_{t_{\text{prev}}}^{(0)}\),避免高阶多项式剧烈振荡; - 对高阶子空间分量 \(z_t^{(m)}\) (\(m \ge 1\)),特征演化高度平滑,采用基于历史离散差分的 \(m\) 阶 Hermite 多项式进行解析外推:\(\hat{z}_{t-k}^{(m)} = z_t^{(m)} + \sum_{i=1}^m \alpha_i(k) \Delta^i z_t^{(m)}\),以极低的封闭解计算开销精准恢复高频细节。
3. 无损逆重构与分段独立适配:多阶段去噪解耦优化 在所有子空间分量完成预测后,将各分量重新拼接并通过可逆映射的精确逆向分支恢复到原始维度:\(\hat{x}_t = \mathcal{E}_\theta^{-1}([\hat{z}_t^{(0)} \mid \hat{z}_t^{(1)} \mid \dots \mid \hat{z}_t^{(M-1)}])\)。由于去噪轨迹跨越数十步时宏观动力学具有显著分段特性,LinCa 将整个时间步轴离散切分为 \(S\) 个区间(实验表明 \(S=3\) 即可获得近饱和增益),在每个区间内训练同构但独立参数化的预测网络 \(\mathcal{E}_\theta^{(s)}\)。这种设计解耦了去噪不同阶段的全局动态漂移,确保各段内的特征聚类始终贴合该阶段的动力学几何。
损失函数 / 训练策略¶
LinCa 的训练完全与主干扩散模型的前向权重解耦,仅需在离线阶段预先采集 100-200 张图像去噪过程中的特征缓存切片。单卡(12GB 显存即可)1 小时内即可完成全部训练,总增量参数量小于原主干模型的 0.2%。针对第 \(s\) 个时间步段,优化目标结合了原始特征空间的端到端重构损失与潜在子空间的分量对齐损失: $\(\mathcal{L}^{(s)} = \mathcal{L}_{\text{feat}}^{(s)} + \mathcal{L}_{\text{comp}}^{(s)}\)$ 其中端到端损失约束逆重构后的特征保真度: $\(\mathcal{L}_{\text{feat}}^{(s)} = \|\hat{x}_{t-k} - x_{t-k}\|_2^2\)$ 子分量预测损失直接惩罚各子空间的预测误差: $\(\mathcal{L}_{\text{comp}}^{(s)} = \sum_{m=0}^{M-1} \|\hat{z}_{t-k}^{(m)} - z_{t-k}^{(m)}\|_2^2\)$ 子空间损失驱动 \(\mathcal{E}_\theta^{(s)}\) 自动将适合 \(m\) 阶多项式预测的特征维度聚类到对应的第 \(m\) 个切片中,形成了无需人工规则干预的纯数据驱动解耦机制。
实验关键数据¶
主实验¶
在文生图主力模型 FLUX.1-dev(50 步去噪)上,LinCa 在多个采样间隔 \(N\) 下与主流特征缓存及剪枝算法进行了全面对比。测试在 NVIDIA A100 GPU 上展开,使用 DrawBench 协议进行 200 个 Prompt 评估。
| 方法 | 缓存步长 \(N\) | 延迟 (s) | 延迟加速比 | FLOPs (T) | 计算加速比 | ImageReward ↑ | CLIP Score ↑ |
|---|---|---|---|---|---|---|---|
| 原始基线 (50步) | - | 23.10 | 1.00× | 3719.50 | 1.00× | 0.9930 | 32.61 |
| 60% 步数直接采样 | - | 14.87 | 1.55× | 2231.70 | 1.67× | 0.9693 | 32.50 |
| \(\Delta\)-DiT | 2 | 15.96 | 1.45× | 2480.01 | 1.50× | 0.9471 | 32.46 |
| FORA | 3 | 9.08 | 2.54× | 1320.07 | 2.82× | 0.9802 | 32.45 |
| DBCache | F=8, B=8 | 15.05 | 1.53× | 2384.29 | 1.56× | 1.0097 | 32.72 |
| TaylorSeer | N=3, O=2 | 8.83 | 2.61× | 1320.07 | 2.82× | 1.0018 | 32.58 |
| FoCa | 3 | 8.35 | 2.78× | 1327.21 | 2.80× | 0.9917 | 32.75 |
| LinCa (本文) | 4 | 7.51 | 3.08× | 1120.68 | 3.32× | 1.0175 | 32.88 |
| ToCa | N=6, R=75% | 11.76 | 1.96× | 924.30 | 4.02× | 0.9830 | 32.25 |
| DuCa | 5 | 7.32 | 3.15× | 978.76 | 3.80× | 0.9982 | 32.41 |
| TeaCache | l=0.8 | 6.42 | 3.58× | 892.35 | 4.17× | 0.8710 | 31.89 |
| HyCa | 5 | 6.83 | 3.38× | 893.54 | 4.16× | 1.0096 | 32.87 |
| LinCa (本文) | 6 | 5.27 | 4.38× | 823.21 | 4.52× | 1.0228 | 32.97 |
| TeaCache | l=1.0 | 7.24 | 3.19× | 743.63 | 5.01× | 0.8421 | 32.01 |
| TaylorSeer | N=5, O=2 | 6.71 | 3.46× | 893.54 | 4.16× | 0.9793 | 32.63 |
| FoCa | 6 | 6.76 | 3.42× | 745.39 | 4.99× | 0.9741 | 33.10 |
| Speca | Nmax=8, Nmin=2 | 6.61 | 3.48× | 791.38 | 4.70× | 1.0012 | 32.45 |
| HyCa | 6 | 6.09 | 3.79× | 744.81 | 5.00× | 1.0043 | 32.64 |
| LinCa (本文) | 8 | 4.40 | 5.25× | 674.64 | 5.51× | 1.0162 | 32.72 |
在 Qwen-Image(50 步,初始延迟 126.60s)上的加速表现同样显著: - 在 \(N=3\) 时,LinCa 耗时 58.88s(2.75× 计算加速),ImageReward 达到 1.2329,PSNR 为 31.86,SSIM 为 0.83,LPIPS 仅 0.18; - 在高加速区 \(N=10\) 时,LinCa 耗时压缩至 23.19s(6.95× 计算加速),ImageReward 维持在 1.0524,PSNR 仍有 29.10;而同等加速比下的 TaylorSeer、FORA 与 DuCa 的 ImageReward 均发生剧烈退化(分别暴跌至 0.7318、0.4812、0.4104)。
在视频生成模型 HunyuanVideo(50 步基线延迟 185.00s,VBench 80.66%)上: - LinCa 在 \(N=6\) 时将耗时降至 38.21s(计算加速 5.50×),VBench 得分达 80.16%,仅有 0.6% 的微弱降幅,显著优于 TaylorSeer(79.93%)、TeaCache(79.36%)与 DuCa(78.72%)。
在图像编辑模型 Qwen-Image-Edit 上,LinCa 在 \(N=10\) 下获得 7.08× 加速,在 GEdit-CN/EN 上的综合评分达到 7.27/7.40,远超基线方法。
消融实验¶
为验证可逆架构与分阶预测策略的独立贡献,论文在 FLUX.1-dev 与 Qwen-Image 上设计了详细的组件消融实验:
| 消融维度 | 具体配置 | 核心机理差异 | FLUX.1-dev (N=6) 质量表现 | 特性与退化原因 |
|---|---|---|---|---|
| 分解网络结构 | 普通前馈 MLP | 非可逆前向映射,存在信息压缩损失 | 随 \(N\) 增加质量明显下滑 | 无法严格满足逆变换恒等律,累积重构误差 |
| 分解网络结构 | 未训练随机映射 | 缺乏针对动力学聚类的监督 | 高倍率下特征发散 | 无法聚类具有相似平滑度的特征维度 |
| 分解网络结构 | 可逆网络 (LinCa) | 双向精确无损变换 \(\mathcal{E}_\theta^{-1} \circ \mathcal{E}_\theta = I\) | 质量最佳 (ImageReward 1.0228) | 无损空间重构保证高保真 |
| 预测阶数配置 | 纯 0 阶复用 (Reuse) | 忽略任何时序变化趋势 | 运动与细节纹理模糊 | 无法预测连续维度的演变趋势 |
| 预测阶数配置 | 纯 1 阶线性外推 | 无法捕捉曲率特征且对噪声敏感 | 高倍率下图像退化 | 突变维度线性外推导致数值剧烈漂移 |
| 预测阶数配置 | 纯 2 阶多项式外推 | 对不稳定维度极度过拟合 | \(N \ge 6\) 时数值爆炸崩塌 | 强行对突变震荡通道二次外推引发发散 |
| 预测阶数配置 | 0阶+1阶+2阶差异化匹配 | 平稳维度高阶外推,突变维度 0 阶复用 | 综合指标最优且极端稳健 | 各通道按需匹配最优预测阶数 |
在量化与蒸馏兼容性方面: - FLUX.1-lite-8B (28步蒸馏): LinCa (N=3) 提速 2.32× (3.34s vs 8.21s),ImageReward 提升至 0.9070; - FLUX.1-schnell (4步极速采样): LinCa (N=3) 提速 1.99× (1.38s vs 2.48s),ImageReward 达 0.9843; - FLUX.1-dev-int8 (INT8量化): LinCa (N=3) 提速 2.63× (4.61s vs 12.55s),ImageReward 提升至 1.0036。
关键发现¶
- 可逆架构是高倍缓存加速的前提:传统自编码器或非可逆 MLP 引入的重构偏差会在多步级联预测中迅速发散,而可逆网络的解析逆分支消除了重构损耗。
- 多阶分解彻底克服高阶外推崩塌问题:高阶多项式拟合对噪声与非平稳特征极度敏感,LinCa 驱动不稳定通道沉降到 0 阶直接复用,而将其余平稳通道交由 1/2 阶拟合,兼顾了稳定性与细节保真。
- 极低开销与高泛化性:仅需单卡 1 小时训练与百余条特征样本,便可在各类 DiT 骨干(图像生成、视频生成、图像编辑)乃至量化/蒸馏模型上即插即用。
亮点与洞察¶
- 动力学解耦视角的范式革新:以往特征缓存研究多聚焦于时间步跳步策略(何时缓存)或空间 Token 稀疏化(哪些位置缓存),LinCa 首次从「通道特征动力学异质性」切入,揭示了交织特征维度的连续性差异,开拓了解耦预测的新方向。
- 极简工程代价换取极致理论保证:引入可逆网络不仅从数学层面确保了 \(\mathcal{E}_\theta^{-1}\mathcal{E}_\theta = I\) 的无损逆映射,更巧妙借助通道切片与分量损失实现了无需人工先验的无监督特征聚类。
- 广泛的横向兼容性:不仅适配图像文生图模型,还能无缝迁移至计算开销更大的文生视频(HunyuanVideo)及高敏感度的图像指令编辑(Qwen-Image-Edit),甚至与 INT8 量化和少步蒸馏策略叠加加速。
局限与展望¶
- 离线数据采集与轻量训练需求:尽管相比端到端微调开销微乎其微(单卡 <1 小时),LinCa 仍属于弱数据驱动方法(Data-driven),无法像纯 Training-free 算法那样零训练即插即用,切换新架构模型时需提前提取百余批特征。
- 固定分段与分量超参数设计:当前时间步分段数(\(S=3\))与多项式切片数(\(M=3\))为固定预设,未来可探索自适应时间步分割机制或通道动态切片机制。
- 更大规模长视频多模态验证:在超长时长视频生成或超大规模多模态统一生成底座中,特征维度在时空维度的连续性演变更为复杂,未来可结合时空联合可逆算子进一步挖掘压缩上限。
相关工作与启发¶
- 从启发式复用转向分析动力学预测:FORA、ToCa 开启了 DiT 结构跳步复用的先河,TaylorSeer 与 FoCa 引入了泰勒展开与 ODE 外推,LinCa 则从数学本质上解决了外推策略在不同特征维度与时间步的失配问题,证明了「先解耦特征流形再分别外推」的必要性。
- 对大模型中间层表示压缩的启发:不仅在扩散模型去噪循环中,在自回归多模态大模型的 KV Cache 压缩、长上下文隐藏层状态剪枝等领域,同样存在通道维度连续性与重要性深度交织的问题,可逆分解与差异化外推的思路具备跨领域迁移潜力。
评分¶
- 新颖性: 4.5 / 5.0(首次提出基于可逆神经网络的特征连续性解耦与差异化多项式缓存外推框架)
- 实验充分度: 4.8 / 5.0(覆盖 FLUX、Qwen-Image、HunyuanVideo、Qwen-Image-Edit 及量化蒸馏模型,对比基线全面且包含详尽消融)
- 写作质量: 4.6 / 5.0(逻辑链条清晰,图文结构严密,数学推导与实验数据严谨翔实)
- 价值: 4.7 / 5.0(以不到 0.2% 参数量和极低训练成本实现 5-7 倍近无损推理加速,工程实用价值极高)