跳转至

Linear Scaling Video VLMs for Long Video Understanding

会议: ECCV 2026
论文: ECCV 2026
代码: https://ceyzaguirre4.github.io/StateKV
领域: 多模态VLM
关键词: 长视频理解, 视频语言模型, KV缓存压缩, 线性复杂度, 流式预填充

一句话总结

针对长视频 VLM 预填充时空自注意力引发的二次方计算复杂度与延迟膨胀,StateKV 提出在冻结模型上解耦预填充与解码,利用固定容量的动态重要性时间状态传递跨帧上下文,实现单帧常数开销与全局 \(O(N)\) 线性缩放。

研究背景与动机

随着多模态大模型在自动驾驶、具身机器人与长周期监控等领域的深入应用,模型必须在数分钟乃至数小时的时间跨度内持续整合视觉线索。然而,当前主流视频大语言模型(Video-LLM)均基于密集时空自注意力机制构建,每一新到达的帧均需与历史所有帧的视觉 token 进行全注意力交互。这种设计导致每帧的增量计算成本随视频长度线性递增,使整个视频序列的预填充计算复杂度呈二次方 \(O(N^2)\) 爆炸。对于需要长期在线运行的流式系统而言,这意味着车辆行驶一小时后的查询延迟将远超初始阶段,彻底阻碍了实时流式落地。

现有针对长视频的效率优化方案大多聚焦于输入尺度的缩减,例如均匀抽帧、输入层图像 token 剪枝或固定预算的 KV 缓存压缩。然而,长视频理解往往依赖细粒度时空线索与偶发关键事件,激进的 token 丢弃(如削减 40% 以上的 token)会导致模型严重丧失多帧时序推理能力;更关键的是,单纯减少输入 token 数量并未改变二次方增长的渐近复杂度。另一类方案如 ReKV 等流式预填充方法虽然将视频预填充与文本生成解耦,但普遍依赖刚性的滑动窗口(Sliding-Window)启发式策略。这种策略本质上假设近期帧具有绝对先验,强行截断全局历史,在实际部署中频繁引发跨帧语义断裂与注意力模式崩溃。

本文的核心切入点在于深入探究预训练视频 VLM 的长视频注意力微观机制:模型内部的注意力权重在空间上高度集中于帧内局部交互,而在长程跨帧维度上,则主要汇聚在极少数随时间缓慢漂移的“时间汇元(Temporal Sink)”token 上。核心 idea:将流式视频预填充形式化为利用极小容量跨帧状态逼近全自注意力的过程,设计双状态 KV 缓存机制——在预填充阶段仅维护一个基于注意力累积重要性动态更新的固定容量压缩状态(\(O(1)\) 跨帧交互),同时完整累积逐帧键值用于最终文本解码,在零微调下实现严格线性 \(O(N)\) 的长视频推理。

方法详解

整体框架

StateKV 面向冻结的预训练多模态大模型,将长视频推理划分为两个完全解耦的执行阶段:逐帧增量推进的“流式视频预填充(Video Prefill)”阶段与最终回答问题的“文本自回归解码(Text Decoding)”阶段。在视频预填充阶段,模型逐帧接收 \(N\) 帧视频输入(每帧含 \(T\) 个视觉 token),在每个 Transformer 层同时维护两种职责分明的 KV 状态:一个是用于承载历史跨帧信息的固定容量压缩状态(Compressed State, \(\mathcal{C}^\ell_n\)),容量上限固定为 \(B\);另一个是忠实累积所有已处理帧 token 的详细状态(Detailed State, \(\mathcal{D}^\ell_n\))。

在处理第 \(n\) 帧时,当前帧 token 仅与当前层的压缩状态 \(\mathcal{C}^\ell_{n-1}\) 以及当前帧自身进行自注意力交互,输出更新后的隐层特征并写入下一层。在此过程中,每增加一帧的边际计算量恒定为 \(O(T^2 + BT)\),全局预填充复杂度从基线的 \(O(N^2 T^2)\) 骤降至 \(O(N(T^2 + BT))\)。当视频所有帧处理完成后,模型进入文本生成阶段,此时直接挂载完整的详细状态 \(\mathcal{D}^\ell_N\) 作为上下文 KV 缓存进行自回归生成,保留全部局部空间细节。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入第 n 帧视觉特征 X_n"] --> B["双状态解耦架构<br/>当前帧与 C_{n-1} 拼接执行注意力计算"]
    B --> C["注意力驱动动态时间汇元更新<br/>计算候选池重要性分数并保留 Top-B"]
    C --> D["虚拟序列长度与全局一致 RoPE 缩放<br/>按真实流式位置校准相对位置编码"]
    D --> E["双状态分流落盘<br/>C_n 传递给下帧,详细键值追加至 D_n"]

关键设计

1. 双状态解耦架构:将视频预填充计算瓶颈与解码信息完整性解构

传统长视频推理将预填充与生成绑定在同一套不断膨胀的 KV 缓存上,导致后序帧前向计算严重拖慢。针对这一矛盾,双状态解耦架构将“帧间特征演化所需的跨帧交互”与“最终文本回答所需的视觉细节”剥离开来。对于每一层 \(\ell\),模型维护详细缓存 \(\mathcal{D}^\ell_n = \{ (K^\ell_{1:n}, V^\ell_{1:n}) \}\) 与压缩缓存 \(\mathcal{C}^\ell_n = \{ (\bar{K}^\ell_n, \bar{V}^\ell_n) \}\)(容量满足 \(|\bar{K}^\ell_n| = B\))。在处理第 \(n\) 帧时,键值投影得到当前帧的 \((K^\ell_n, V^\ell_n)\),当前帧查询矩阵 \(Q^\ell_n\) 仅对拼接后的 \([\bar{K}^\ell_{n-1}; K^\ell_n]\) 执行注意力计算:

\[\text{Attn}\left(Q^\ell_n, [\bar{K}^\ell_{n-1}; K^\ell_n], [\bar{V}^\ell_{n-1}; V^\ell_n]\right) = \text{softmax}\left(\frac{Q^\ell_n [\bar{K}^\ell_{n-1}; K^\ell_n]^\top}{\sqrt{d_h}} + M_n\right) [\bar{V}^\ell_{n-1}; V^\ell_n]\]

该机制确保了历史详细缓存 \(\mathcal{D}^\ell_{n-1}\) 在预填充阶段绝不被再次检索或参与矩阵乘法,从而阻断了二次方复杂度的计算扩散;而在生成阶段挂载 \(\mathcal{D}^\ell_N\) 又避免了传统定长压缩模型在问答时因不可逆信息丢失而导致的细粒度定位失败。

2. 注意力驱动的动态时间汇元更新:基于慢演化假设的 Top-K 状态维护

现有滑动窗口方法强行舍弃远期帧,容易丢失视频开头的关键背景或长程依赖信息。本文利用“时间汇元(Temporal Sinks)集中分布且随时间缓慢演化”的经验规律,设计了基于自注意力权重的动态更新准则。在每层完成第 \(n\) 帧的前向计算后,将当前压缩状态中的已有索引 \(\bar{S}^\ell_{n-1}\) 与当前帧的 \(T\) 个新 token 构成联合候选池 \(U^\ell_n = \bar{S}^\ell_{n-1} \cup \{1, \dots, T\}\)。对于候选池中的任意键 token \(j \in U^\ell_n\),其重要性分数由当前帧所有查询 token 对其注意力的平均值确定:

\[s^\ell_{n,j} = \frac{1}{T} \sum_{i=1}^T A^\ell_{n,i,j}\]

随后通过 Top-\(K\) 筛选保留得分最高的 \(B\) 个 token:\(\bar{S}^\ell_n = \text{TopK}(\{s^\ell_{n,j} : j \in U^\ell_n\}, B)\),并据此构造下一时刻的压缩缓存 \(\mathcal{C}^\ell_n\)。这种设计使得模型无需重新扫描历史序列,即可在常数时间内自适应驱逐低效记忆,保留具备长期汇聚价值的历史锚点与当前帧的高显著性 token,彻底克服了滑动窗口导致的跨帧信息截断。

3. 虚拟序列长度与全局一致 RoPE 缩放:保障长程相对位置编码自洽

在动态压缩状态下,压缩缓存物理长度始终限制在 \(B\),而视频流在逻辑上已历经数千 token,这会导致旋转位置编码(RoPE)出现物理长度与绝对时序位置脱节的问题;此外,若在超长视频后半段临时启动位置缩放,会导致新生成的 K/V 与早先计算的 K/V 处于不同的相对几何空间中。为此,StateKV 引入虚拟序列长度 \(L_n\) 与静态 RoPE 缩放策略。虚拟序列长度 \(L_n = nT\) 严格按视频流累积 token 总量计数,在计算当前帧及其与历史压缩 token 的注意力时,所有 RoPE 旋转角度均基于逻辑时间戳分配。同时,在进入预填充前预估全流程最大长度(视频总帧数 + 文本 Prompt + 最大解码步数),提前激活对应的全局 RoPE 缩放因子 \(\alpha\)(如 YaRN 方案),并在预填充与自回归生成的全程保持 \(\alpha\) 恒定不变,确保了旋转变换在跨时间步、跨两套缓存之间的严格数学对齐。

实验关键数据

主实验

实验统一在 1 FPS 采样率、最高 512 帧的长视频场景下展开,涵盖 VideoMME(无字幕评测集)、MLVU 多任务基准以及 OVOBench 实时视觉感知子集。对比基线包括未经修改的完整自注意力模型(Full SA)与同样实现线性预填充的滑动窗口基线 ReKV(检索窗口 \(R=16\) 帧,与 StateKV 的缓存预算 \(B=4096\) 严格计算量匹配)。

模型 方法 VideoMME (%) MLVU (%) OVOBench (Real-Time, %)
InternVL3-1B Full SA 46.19 47.05 55.79
InternVL3-1B ReKV (R=16) 37.11 33.44 37.75
InternVL3-1B StateKV (B=4096) 45.80 46.35 55.44
InternVL3-2B Full SA 55.81 56.61 60.22
InternVL3-2B ReKV (R=16) 31.78 5.49 33.33
InternVL3-2B StateKV (B=4096) 54.15 57.31 61.05
Qwen3-VL-2B Full SA 58.67 58.83 60.45
Qwen3-VL-2B ReKV (R=16) 49.44 45.60 46.71
Qwen3-VL-2B StateKV (B=4096) 58.00 57.72 60.93
Qwen3-VL-4B Full SA 66.59 68.98 64.76
Qwen3-VL-4B ReKV (R=16) 52.63 49.91 49.22
Qwen3-VL-4B StateKV (B=4096) 65.89 67.80 64.87
InternVL3-8B Full SA 64.19 61.14 71.45
InternVL3-8B ReKV (R=16) 54.56 31.11 56.03
InternVL3-8B StateKV (B=4096) 62.52 62.85 70.25
Eagle2.5-8B Full SA 69.81 73.85 69.30
Eagle2.5-8B ReKV (R=16) 58.70 55.01 55.44
Eagle2.5-8B StateKV (B=4096) 67.96 70.52 68.70
Qwen3-VL-8B Full SA 70.52 75.82 67.86
Qwen3-VL-8B ReKV (R=16) 55.52 50.91 53.88
Qwen3-VL-8B StateKV (B=4096) 68.11 71.38 64.99

消融实验

消融实验重点考察压缩状态预算 \(B\) 对性能与计算量的连续控制能力(以 InternVL3-8B 在 512 帧 VideoMME 上的表现为例),以及在同等算力预算下“以小模型换全注意力”与“以大模型换 StateKV 线性逼近”的效率帕累托前沿对比。

配置 / 缓存容量 \(B\) VideoMME (%) 相对预填充计算量 (vs Full SA-8B) 说明
Full SA (8B) 64.19 1.00× (基准) 精确二次方完整自注意力
StateKV (\(B=16384\)) 63.85 ~0.65× 极大容量,性能近乎无损逼近全注意力
StateKV (\(B=4096\)) 62.52 ~0.33× (1/3rd) 推荐平衡点,仅掉点 1.67%,计算量削减 67%
StateKV (\(B=1024\)) 59.80 ~0.20× 中等容量,仍显著领先同计算预算的 ReKV
StateKV (\(B=256\)) 54.30 ~0.12× 紧凑内存配置,适合极端端侧设备
ReKV (\(R=16\), compute-matched) 54.56 ~0.33× 滑动窗口策略,掉点达 9.63%,且表现剧烈波动
Full SA (1B) 46.19 ~0.30× 同等计算预算下的 1B 全参数全注意力模型

关键发现

  • 显著抹平全注意力差距:在 7 种跨架构、跨尺度的模型上,StateKV 平均性能与二次方复杂度的 Full SA 仅相差约 1 个百分点,且全面超越滑动窗口基线 ReKV(平均超越幅度达 10% 以上)。
  • 杜绝滑动窗口的崩溃退化:ReKV 在特定架构(如 InternVL3-2B)上发生了灾难性性能衰减(MLVU 从 56.61% 崩塌至 5.49%),暴露出近期偏置对全局语义流向的致命破坏;而 StateKV 凭借注意力动态重筛选,在 InternVL3-2B 上的 MLVU 达到 57.31%,甚至轻微超越了 Full SA。
  • 算力再投资红利(Compute Reinvestment):StateKV 降低的预填充 FLOPs 可以反哺模型规模。如图 3 与消融数据所示,在同等 FLOPs 预算下,运行 8B 规模的 StateKV(62.52%)相比运行 1B 规模的 Full SA(46.19%),绝对精度暴增 16.33 个百分点。

亮点与洞察

  • 注意力时间汇元的理论机制转化:将语言模型中关于 attention sink 的静态发现迁移至长视频时序演化中,以极其轻量的注意力矩阵聚合统计量引导动态筛选,零参数微调即可维持长程上下文。
  • 预填充与解码的非对称状态分离:敏锐地捕捉到“中间特征计算仅需轻量上下文拓扑,而最终文本回答依赖全局细节证据”的不对称性,通过双缓存彻底打破了 \(O(N)\) 状态与精准推理不可兼得的思维定势。
  • 流式实时感知与端到端延迟破局:在长视频与长周期机器人流式处理中,单帧处理延迟被压低至常数时间,使边缘设备面对长达数小时的不间断视频流仍能保持恒定响应速度。

局限与展望

  • 依赖预训练模型的原生汇元先验:本文方法基于经验观测成立的假设前提;如果某些新型多模态架构(如采用全局部窗口或无锚点注意力训练的模型)未能自发形成集中的时间汇元,筛选机制的逼近精度可能会受损。
  • 解码阶段仍受详细缓存显存线性增长约束:虽然预填充阶段实现了 \(O(N)\) 算力与常数边际开销,但详细缓存 \(\mathcal{D}_N\) 的显存占用随视频长度线性递增,在超长视频(如数万帧)极限下可能面临宿主显存容量压力。未来可探索与选择性解码压缩或层级稀疏化方案的进一步融合。

相关工作与启发

  • vs ReKV: ReKV 同样采用解耦思想,但使用固定的前向滑动窗口截断历史。StateKV 将滑动窗口替换为动态重要性维护的时间状态,不仅修复了跨帧注意力断裂导致的精度崩塌,还在同等 FLOPs 下大幅提升长程多任务推理精度。
  • vs H2O / SnapKV: 文本维度的 Heavy-Hitter 方法通常在解码阶段淘汰无用 KV。StateKV 则聚焦于长视频预填充阶段的跨帧计算瓶颈,并利用帧内/帧间注意力的拓扑差异构造跨帧流动通道。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次将流式视频预填充系统性形式化为时间汇元状态逼近,双状态设计清晰巧妙。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 3 大主流长视频基准、7 种模型跨规模横跨对比,算力对齐与渐近复杂度剖析极为扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 假设明确、数学表述严谨、逻辑层层递进,消融与对比实验详实。
  • 价值: ⭐⭐⭐⭐⭐ 为解决长视频大模型落地中的二次方算力瓶颈提供了免训练即插即用的通用标准化方案。