Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption¶
会议: ECCV 2026
论文: ECCV 原文
领域: 模型压缩 / 视频生成
关键词: KV 缓存压缩、实例特定参数吸收、自回归视频生成、测试时适应、局部注意力
一句话总结¶
ISPA 在视频生成的短暂预热阶段拟合局部注意力与完整注意力的差异,将可压缩层的历史影响吸收到输出投影权重中,使 LongLive 的 ISPA-0.5 在 30 秒测试中仅保留 54.2% 的 KV 缓存、主体一致性由 96.10 变为 95.61,但这并不意味着所有模型和指标都严格无损。
研究背景与动机¶
自回归视频生成把长视频拆成依次生成的片段,每个片段仍通过扩散或流模型去噪。 当前片段的查询会访问历史片段的键值缓存,因此可以持续利用先前的场景、主体和运动信息,而不必每次重新处理全部历史画面。 问题也随之转移:避免了整段视频联合生成的巨大注意力开销,却留下逐步积累的外部记忆。 缓存不仅占显存,还增加后续注意力读写与计算的负担,因此减少历史缓存是流式部署中的独立问题。
直接删除历史 token 并不等于只删除重复信息。 在视频中,看似不再出现的旧画面可能仍提供主体形态、背景布局或时间连续性的约束;删掉它们会改变注意力输出,误差又会传入后续层和生成片段。 保留初始帧作为注意力锚点可以稳定局部推理,却不能自动恢复中间历史提供的上下文。 本文因此关注一个更具体的可能性:对于某个正在生成的视频,部分层中的历史贡献是否已经足够稳定,能够由固定的线性投影修正近似表达?
这个假设不要求全部历史都可线性压缩,也不要求不同视频共享同一组可压缩层。 它只要求在当前实例的预热数据上,某些层的局部输出能够较准确地重建完整输出,再由其余层继续保存难以吸收的动态依赖。 这里的“记住”是保存历史对后续计算的影响,不是把旧帧编码成可精确取回的图像数据库。 核心 idea:先用当前视频测量哪些层的历史影响能够被输出投影吸收,再删除这些层的历史 KV,将外部 token 记忆部分改写为实例特定的参数记忆。
方法详解¶
整体框架¶
输入是已有自回归视频生成器、生成条件和当前生成实例;输出仍是连续生成的视频,不需要换成新的生成任务。 文本到视频实验使用文本条件,LiveAvatar 扩展则使用参考图像与持续语音。 ISPA 修改的是自注意力的缓存使用方式及其后的线性输出投影,而不是重新训练整套视频生成器。 原文图 1(第 5 页)把流程分成预热、层吸收和节省内存的后续推理。
预热时,各层维持完整上下文生成,同时取得局部和完整注意力输出。 局部上下文不是任意长度的滑动窗口:这里具体包含初始 sink 帧与当前帧,中间历史单独成组。 到达切换点后,为每层求一个候选权重修正,再依据重建误差决定哪些层真正切换。 被选中的 L-Layers 保留初始与当前上下文,未选中的 F-Layers 继续沿用完整上下文路径。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["生成条件与当前视频"] --> B["可分解双流预热"]
B --> C["闭式参数吸收"]
C --> D["实例特定层选择"]
D -->|低重建误差层| E["局部注意力<br/>更新投影并移除历史"]
D -->|其余层| F["完整注意力<br/>继续保留历史"]
E --> G["后续视频片段"]
F --> G
图中的分支发生在同一个网络的不同层,并非独立生成两段视频后做画面融合。 参数修正也属于当前视频实例,不能直接视为一个可跨所有提示词复用的压缩模型。 选层数量由预算决定,具体选中哪些层则由当前实例的校准信号决定。 因此,ISPA 同时包含数值适应和按实例改变注意力结构两部分。
关键设计¶
1. 可分解双流预热:在同一组 KV 计算中获得完整与局部信号
若完整注意力和局部注意力各运行一次,重复计算会削弱压缩收益。 ISPA 先把键值集合分成互不重叠的局部组与历史组,让同一个当前查询分别访问两组。 局部组包括初始 sink 帧和当前帧;历史组是两者之间的帧。 每一组不仅返回加权后的值向量,还返回 softmax 归一化相关的 Log-Sum-Exp(LSE)状态。 局部分支输出就是待校准的局部激活,而完整激活可以通过两组 LSE 加权合并恢复。 关键不在于对两个输出取普通平均,因为每组获得的总注意力质量一般不同。
两组注意力的归一化常数决定了它们在完整 softmax 中的权重。 这利用了 FlashAttention 一类内核已有的在线 softmax 信息,不需要显式存放完整注意力矩阵。 原文第 7–8 页、式(9)–(12)解释了这一分解;点积覆盖的 KV 总量与完整注意力相同。 不过,“几乎免费”针对的是这种信号收集方式,不能推出投影统计和切换时的线性求解没有成本。 作者报告融合操作占执行时间不到 1%,但全文没有据此给出所有硬件上的统一切换延迟保证。 sink 帧还会继续留在压缩后的局部路径中,它不是预热结束就被删去的临时辅助输入。
2. 闭式参数吸收:拟合被删除历史造成的输出差异
令 \(A_{loc}\) 与 \(A_{full}\) 分别表示预热期间收集的局部和完整注意力激活,二者都位于最终输出投影 \(W\) 之前。 目标不是逐 token 重建过去的键和值,而是让局部激活通过修正后的投影后,尽量接近完整激活通过原投影的结果。 选择注意力之后紧邻的投影层,是为了在上下文丢失的起点补偿误差,减少其向后续层传播。 因而需要拟合的是投影输出残差,不是单纯比较两张注意力概率图。 下式按第 6 页的文字定义整理残差与重建误差;缓存中式(4)–(6)的排版存在字符缺失,这里不转录损坏的求逆表达式。
其中 \(\Delta W\) 是当前实例的输出投影修正,\(\epsilon\) 是吸收后剩余的平方 Frobenius 重建误差。 求解过程用局部激活回归目标残差,原文采用带正则化的闭式回归,而不是梯度下降。 实现时可以在前向过程中累积激活外积和激活与残差的交叉统计,不必保留反向传播计算图。 原文以 \(D\) 表示激活维度,把切换点的主要求解描述为一次 \(D\times D\) 矩阵求逆。 这种统计压缩解释了为何适应不需要在全部预热样本上反复迭代,但统计矩阵仍占空间,求解仍有计算量。
吸收完成后,实际使用的权重变成 \(W+\Delta W\),局部注意力仍只访问留下的 KV。 这意味着历史不再以逐帧可检索的状态存在,而是体现在当前激活到输出的映射中。 它适合表达在本实例中相对稳定、可由线性变换补偿的历史贡献。 如果未来出现预热中没有见过的新动态,固定修正不保证仍能代替真实历史。 因此,良好的预热拟合是选择依据,而不是对任意未来帧的误差上界。
3. 实例特定层选择:只吸收当前视频中容易线性补偿的层
每层都有候选修正和对应重建误差,但 ISPA 不把所有候选都应用到模型上。 设网络共有 \(N\) 层,预算允许转换 \(K\) 层,就按 \(\epsilon\) 从小到大排序,选择误差最小的 \(K\) 层。 这些层变成 L-Layers,应用投影修正,并移除中间历史 KV。 其余 \(N-K\) 层仍是 F-Layers,承担不能被当前线性拟合充分替代的长程依赖。 这比固定按层号删除缓存更贴近论文假设:不同视频把时序关系分布在不同层中。
论文用 ISPA-x 表示 \(K=xN\),其中 x 是转成局部注意力的层比例,不是整模型显存减少比例。 即使一半层被转换,这些层仍保留 sink 与当前帧,因此表中的剩余 KV 比例不恰好等于一半。 而未转换的层仍需要其原有历史缓存,所以不能把 L-Layers 的固定历史表示推广成整模型恒定显存。 原文也提出在大幅场景变化后重新触发预热,更新选层和参数修正。 但默认实验采用单次切换,没有给出完整的场景变化检测器或反复校准的独立基准结果。 重校准应理解为作者提出的扩展路径,而非已证明可以解决任意场景切换的能力。
一个完整示例¶
以原文 LongLive 的 ISPA-0.5 配置为例,生成开始时所有层仍用完整上下文。 前 12 个潜在帧形成预热信号,这里的潜在帧不能直接当成 12 个最终显示帧或 12 秒。 在切换点,每层用累积的局部与完整激活计算候选投影修正及重建误差。 系统挑出误差最小的一半层,给它们写入修正,并删除这些层的中间历史 KV。 下一片段生成时,这些层只通过初始帧和当前帧获得局部输入,历史影响则通过改过的投影间接发挥作用。 另外一半层继续直接访问历史,两类层共同构成后续去噪网络。 表 2 中该配置剩余 KV 为 54.2%,主体一致性为 95.61;这只是对应实验结果,不是对每个新提示词的质量承诺。
损失函数 / 训练策略¶
ISPA 不重新优化原生成模型的扩散或流匹配训练目标,也不引入新的离线训练数据集。 用于适应的监督来自同一实例在预热期间的完整注意力输出,可视为在线生成的教师信号。 默认预热长度为 \(T_{warm}=12\) 个潜在帧,回归的正则化参数为 \(\lambda=0.001\)(第 9–10 页)。 闭式求解替代反向传播,因此“无需梯度训练”不等于“权重保持不变”。 原文主要说明了统计累积和切换方式,未在该全文中完整列出各骨干的批处理、数值精度与求解器细节。 这些细节会影响峰值显存和切换抖动,复现时应与稳态注意力加速分开测量。
实验关键数据¶
主实验¶
以下摘自原文第 9 页表 2:MovieGen 提示词、30 秒视频的 VBench 评估。 分数越高越好;KV 表示相对各自 Vanilla 的剩余缓存比例,不是总 GPU 显存。 LongLive 和 Reward 为 1.3B,Krea 为 14B;不同骨干之间的分数不用于归因 ISPA 的效果。
| 骨干与配置 | 剩余 KV | 美学质量 | 背景一致性 | 成像质量 | 主体一致性 | 时间闪烁分数 |
|---|---|---|---|---|---|---|
| LongLive Vanilla | 100% | 63.59 | 96.65 | 70.15 | 96.10 | 97.92 |
| LongLive ISPA-0.5 | 54.2% | 62.98 | 96.28 | 69.05 | 95.61 | 97.89 |
| Reward Vanilla | 100% | 60.82 | 94.97 | 66.79 | 93.43 | 96.49 |
| Reward ISPA-0.5 | 55.6% | 60.45 | 94.95 | 66.55 | 93.36 | 96.64 |
| Krea Vanilla | 100% | 62.15 | 94.64 | 71.20 | 94.85 | 96.85 |
| Krea ISPA-0.5 | 58.3% | 63.93 | 94.63 | 70.12 | 93.81 | 97.12 |
LongLive 的主体一致性下降 0.49 个分数点,成像质量下降 1.10 个分数点,不能统一概括为每项变化都小于 1。 Krea 的美学质量提高 1.78 个分数点,同时主体一致性下降 1.04 个分数点,表现为指标之间的取舍。 时间闪烁一列沿用原表的高分更好约定,不是“闪烁量越大越好”。 作者将部分提高解释为参数吸收过滤长期注意力噪声,但表中相关变化本身不能证明这一因果解释。
消融实验¶
下表同样来自第 9 页表 2,只比较 LongLive 在相同 30 秒设定下转换层比例的变化。 它是有精确数值的压缩预算分析;更高比例的长期变化另见第 12 页图 4,不从曲线臆测精确数值。
| 配置 | 转换层比例 | 剩余 KV | 美学质量 | 成像质量 | 主体一致性 |
|---|---|---|---|---|---|
| Vanilla | 0% | 100% | 63.59 | 70.15 | 96.10 |
| ISPA-0.3 | 30% | 72.5% | 63.32 | 69.38 | 95.77 |
| ISPA-0.4 | 40% | 63.3% | 63.05 | 69.05 | 95.52 |
| ISPA-0.5 | 50% | 54.2% | 62.98 | 69.05 | 95.61 |
主体一致性并不随压缩比例严格单调下降,因此不宜把单个分数的微小起伏解释为稳定优势。 图 3(第 12 页)提供组件移除的定性消融:不做参数吸收会出现主体形态偏移,移除 sink 帧则出现过度平滑。 这些是展示样例中的现象,论文没有为该图提供可以填进数值表的逐项分数。 图 4 显示将局部层比例提高到 \(K=0.7N\) 时质量明显恶化,说明仍需保留充分的完整注意力层。 图 5(第 13 页)对比预热 6、12、18、24 帧:6 帧表现较差,达到 12 帧后较稳定,24 帧则推迟缓存回收。 该趋势支持默认预热选择,但不是对所有视频内容和时间尺度的普适阈值证明。
关键发现¶
- 第 9 页表 1 的 5 秒 LongLive ISPA-0.5 成像质量为 70.70,Vanilla 为 70.74,短视频差异较小;不能直接用此代替 30 秒结论。
- 第 13–14 页、图 7 报告 ISPA 总体加速 1.35 倍,注意力算子加速 1.89 倍,结合 W8A8 后总体加速 1.86 倍;三者不是同一测量口径。
- 第 13 页图 6 展示 LiveAvatar 的身份与口型保持,但没有在这里提供独立的定量口型同步结果。
亮点与洞察¶
- 压缩目标从“哪些历史 token 重要”变成“哪些历史影响可以被局部计算重建”。这让层级输出误差成为压缩决策依据,而不仅是 token 注意力分数。
- 保留 sink 帧和修正投影承担不同职责。前者提供稳定的局部注意力锚点,后者补偿历史缺失,不能相互替代。
- 全局信号用于校准、局部路径用于部署,是本文容易复用的思路。迁移到其他流式模型时仍需检验预热分布能否覆盖后续动态,本文没有证明跨任务普适性。
局限与展望¶
- 原文承认预热不足和过度转换层数会使质量下降。静态权重修正的容量有限,难以表示持续变化的全部长程依赖。
- 主要数值表覆盖 5 秒与 30 秒,不能据此声称小时级连续生成已得到验证。场景突变后的重校准也主要停留在方法描述。
- 所选层的历史表示可以固定,但其余层仍使用历史缓存。本文降低缓存负担,并没有单独证明整个系统具有无界时长下的恒定显存。
- 消融包含有价值的视觉对比,却缺少 No Absorb、No Sink 的配套数值与误差条。选层误差能否预测未来质量,也值得增加独立验证。
- 全文未完整报告统一硬件、切换峰值开销和重复测量方差。量化兼容与“几乎无损”的结论应限定在所展示的设置内。
相关工作与启发¶
- 对比 StreamingLLM:原文第 15 页介绍其保留初始 sink 与近期 token 的机制;ISPA 同样保留锚点,但额外拟合投影来补偿被删历史。这是机制比较,不是本文给出的直接数值对照。
- 对比 H2O 与 SnapKV:两者按注意力统计挑选保留的 token;ISPA 按吸收后的输出重建误差挑选层。其代价是引入实例校准与权重更新,收益是部分历史不必继续显式存储。
- 对比 LongLive、Reward-Forcing 与 Krea-Realtime:它们是被压缩的生成骨干,不是 ISPA 新训练出来的模型。不同骨干的响应差异提醒读者按模型和时长评估,而非只引用单一平均结论。
评分¶
- 新颖性: 4/5。将视频 KV 历史吸收到实例特定投影并动态选层,提供了不同于 token 淘汰的思路。
- 实验充分度: 3/5。跨骨干和时长评估较完整,但组件消融的数值、重校准实验与系统开销细节不足。
- 写作质量: 3/5。主流程清楚,但预热讨论重复,部分近乎无损与恒定内存措辞比表格证据更强。
- 价值: 4/5。适合研究流式视频的质量与内存取舍,部署前仍需补测峰值开销和长时分布变化。