H2SVC: Head-aware Heterogeneous Streaming Video Cache for Online Video Understanding¶
会议: ECCV 2026
论文: ECCV 官方
PDF: ECCV PDF
领域: 视频理解
关键词: 流式视频理解, KV Cache压缩, 注意力头异质性, 语义轨迹曲率淘汰, 多模态大模型
一句话总结¶
揭示多模态大模型注意力头固有的时间感受野异质性,提出无须训练的头感知异质流式视频缓存框架 H2SVC,通过离线静态路由与几何轨迹曲率淘汰算法,在显存大幅降低 50% 以上的同时实现长视频流式理解 SOTA。
研究背景与动机¶
在实时监控、具身智能交互与在线直播等真实世界流式视频场景中部署多模态大模型(MLLM)正面临严峻的显存瓶颈。自回归生成机制依赖键值缓存(KV Cache)避免冗余计算,但随着视频流无限延长,线性累积的历史视听视觉 token 会瞬间挤爆 GPU 显存。以 1 FPS 的采样率输入一段仅十分钟的常规视频,所产生的庞大视觉上下文便已超出绝大多数单张现代 GPU 的显存承载上限,使模型根本无法胜任长程在线处理。
为打破这一显存壁垒,现有方案主要分为架构改造与免训练压缩两类路线。架构类方法(如 TimeChat-Online、StreamForest)通常依赖专门的 token 丢弃模块或可持久化事件树结构,但它们必须在规模庞大的流式视频数据上进行昂贵的微调,不仅打破了现有冻结模型的通用性,也无法直接复用现成开源权重。另一方面,免训练的 KV Cache 压缩方法(如 FIFO 滑动窗口、跨帧相似度聚类或基于 Query 的检索)则普遍存在一个核心缺陷:它们在单一 Transformer 层内无差别地对所有注意力头施加完全一致的压缩策略,默认所有头在时序特征建模中扮演着相同角色。此外,许多启发式检索依赖于运行时的全量注意力权重回溯,破坏了硬件高效算子(如 FlashAttention)的流式执行流水线。
通过跨模态时空注意力画像(Spatio-temporal Attention Profiling),可以发现注意力头在时间跨度感知上呈现出高度稳定且输入无关的异质分工——同一层内的不同注意力头天然分化为聚焦瞬时空间细节的即时头、关注局部时序动态的短期头,以及统揽全局历史的长程事件头。本文的核心 idea 是:利用注意力头天然的时空异质性,在离线阶段对各头建立静态类别映射并路由至差异化的分级记忆库,并针对长程全局记忆库构建基于值状态(Value states)几何语义轨迹曲率的在线淘汰机制,在完全兼容 FlashAttention 的前提下实现无限流式视频的高效高保真理解。
方法详解¶
整体框架¶
H2SVC 是一套面向无限长度视频流理解的免训练 KV Cache 压缩框架。系统整体分为两个核心执行阶段:第一阶段是在部署前通过对少量样本视频进行时空注意力画像(SAP),量化各 KV 头的时序感受野距离并离线分类,得到固定的头分类映射表;第二阶段是在在线推理时,根据该静态映射将各头的输入 KV 特征实时路由到对应时间尺度的异质记忆库中进行缓存与维护。对于负责捕捉全局事件的记忆库,进一步引入基于几何度量的值向量轨迹曲率分析,在缓存满载时自适应剔除位于平滑路径上的可预测冗余帧,而精确保留剧烈语义转折处的关键事件帧。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入连续流式视频帧<br/>逐帧视觉编码预填充"] --> B["时空注意力画像与离线异质路由<br/>TAD 分数排序与三分类"]
B --> C["异质分级记忆库设计<br/>专用缓存与差异化窗口"]
C -->|底层瞬时头 10%| D1["超短滑动窗口缓存<br/>固定保留 Ws=4 帧空间细节"]
C -->|中层短期头 40%| D2["流式滑动窗口缓存<br/>保留 Ww=16 帧局部时序动态"]
C -->|顶层长程头 50%| D3["语义轨迹曲率淘汰 STCE<br/>全局容量 Ne=64 帧几何分析"]
D1 & D2 & D3 --> E["多头注意力特征拼接<br/>兼容 FlashAttention 硬件加速解码"]
E --> F["输出长程时序理解与文本生成"]
关键设计¶
1. 时空注意力画像与离线异质路由:突破同层统一压缩假设 以往方法在设计压缩预算时,要么全层统一切分,要么仅按网络层深度(Layer-wise)分配非均匀预算,忽视了同一 Transformer 层内不同注意力头的功能分工。为了对各注意力头的时间感受野进行客观量化,H2SVC 提出了跨预填充与生成两个阶段的时空注意力画像(SAP),定义了两个核心指标:视觉到视觉时序注意力距离 \(\text{TAD}_{\text{V2V}}^{(h)}\) 与文本到视觉时序注意力距离 \(\text{TAD}_{\text{T2V}}^{(h)}\)。对于第 \(h\) 个 KV 头,\(\text{TAD}_{\text{V2V}}^{(h)}\) 衡量最新到达帧在视觉预填充阶段向历史关键帧回溯的平均时间跨度: $\(\text{TAD}_{\text{V2V}}^{(h)} = \mathbb{E}_{v \in \mathcal{V}} \left[ \frac{1}{N_v} \sum_{i=1}^{N_v} \mathbb{E}_{q \in F_i} \sum_{j=1}^{i} (i - j) \cdot A_{q, F_j}^{(h)} \right]\)$ 其中 \(F_i\) 与 \(F_j\) 分别代表当前查询帧和历史键帧,\(A_{q, F_j}^{(h)}\) 为归一化注意力权重。类似地,\(\text{TAD}_{\text{T2V}}^{(h)}\) 衡量文本查询生成时向全视频历史帧的跨模态时间检索深度。实证分析表明,两项指标高度正相关,且跨视频输入的方差极小,证明注意力头的时序特异性是预训练权重固有的内在属性。因此,H2SVC 将两指标经 Min-Max 归一化后取均值得到综合时序感受野得分 \(S(h) = \frac{1}{2}(\mathcal{N}(\text{TAD}_{\text{V2V}}^{(h)}) + \mathcal{N}(\text{TAD}_{\text{T2V}}^{(h)}))\),并在离线阶段将全体注意力头划分为三大类别:得分最低的前 10% 为即时头(Instantaneous)、中间 40% 为短期头(Short-term)、得分最高的前 50% 为长程事件头(Episodic)。该分类仅需离线统计一次,在实际推理中完全无动态判断开销。
2. 异质分级记忆库架构:按需匹配各头时序感受野 由于各注意力头的注意力跨度大相径庭,若为全部头分配同等大小的缓存,既会浪费显存存储无用背景,又会过早丢弃关键的长程依赖。H2SVC 为三类注意力头定制了专用的分级记忆库,实现精细化显存分配: - 瞬时记忆库(Ultra-Short Cache):专为即时头设计。画像显示此类头 90% 以上的注意力全部分配给当前帧的帧内空间 token,几乎不进行任何跨帧时间检索。因此仅为其分配极小的 FIFO 滑动窗口(默认仅保留 \(W_s = 4\) 帧),极大削减了显存开销; - 流式短期记忆库(Streaming Cache):专为短期头设计。此类头负责跟踪局部运动变化与短时动作连续性,为其配置标准大小的 FIFO 滑动窗口(默认 \(W_w = 16\) 帧),确保动作动态流畅感知; - 全局长程记忆库(Global Cache):专为长程事件头设计。此类头负责通篇事件的上下文因果关联,赋予其较大的受限容量(默认 \(N_e = 64\) 帧)。为了在严格受限的固定帧数内维持长时间跨度语义多样性,该记忆库不采用粗暴的 FIFO 遗忘,而是接入下述专用的几何曲率淘汰机制。各头在注意力计算时各自读取对应长度的 KV 缓存,并在特征输出端沿头维度拼接,完全不侵入原始多头注意力计算结构。
3. 语义轨迹曲率淘汰:基于值空间几何转折的关键帧优选 在全局长程记忆库中,若简单采用均匀时间抽样(Uniform Eviction),无法兼顾动态剧烈与平缓静态片段;而基于单步余弦相似度的贪心剔除(Similarity Eviction)在遇到连续匀速平滑运动时极易失效,因为平滑过渡帧即使与前后帧存在位移差异,其语义走向依然完全可由两端插值预测。H2SVC 将缓存中的帧级特征建模为隐空间中的连续几何轨迹。位于平缓直线路径上的帧属于可线性预测的信息冗余点,而轨迹发生剧烈转折处则精准标志着场景切换或新动作发生的语义拐点。 尤为关键的是,该几何轨迹必须严格在值向量(Value states)空间中构建,而不能使用键向量(Key states)。这是因为现代多模态模型广泛采用旋转位置编码(RoPE),RoPE 会将绝对时序位置注入 Key 向量中,导致位置编码的相位偏置直接扭曲隐空间的相对几何距离与夹角,使语义曲率彻底失真。设全局记忆库当前缓存帧在 Value 空间的特征向量序列为 \(\{V_j\}_{j=1}^{N_e}\),定义输入速度向量 \(\vec{v}_{\text{in}} = V_j - V_{j-1}\) 与输出速度向量 \(\vec{v}_{\text{out}} = V_{j+1} - V_j\),则帧 \(F_j\) 的重要性综合评分 \(I(j)\) 定义为: $\(I(j) = \underbrace{\left[1 - \text{CosSim}(\vec{v}_{\text{in}}, \vec{v}_{\text{out}})\right]}_{\text{角曲率项}} \cdot \underbrace{\min\left(\|\vec{v}_{\text{in}}\|_2, \|\vec{v}_{\text{out}}\|_2\right)}_{\text{运动幅度门控}} \cdot \underbrace{\log(t_{j+1} - t_{j-1})}_{\text{时序跨度权重}}\)$ 式中,角曲率项直接度量轨迹方向偏转程度,偏转越大说明出现关键语义转折;运动幅度门控项用于抑制纯静态或低运动场景中微小噪声引起的虚假高曲率波动;时序跨度权重项(\(t_j\) 为帧在原视频流中的真实时序索引)则倾向于惩罚密集扎堆采样的连续近邻帧,鼓励时间轴上的广度覆盖。每当新帧推入导致缓存满载时,算法仅需驱逐得分最低的帧,且该操作仅影响其左右相邻两帧的评分,局部增量更新时间复杂度为严格的 \(O(1)\),保证了算法对超长甚至无限视频流的极高运行效率。
一个完整示例¶
假设系统以默认预算配置(\(N_e=64, W_w=16, W_s=4\))处理一段长达 1000 帧的在线监控视频: 1. 逐帧输入与分流:新输入第 65 帧时,底层 10% 的即时头仅在包含最新 4 帧(第 62 至 65 帧)的超短窗口内维护 KV Cache;中间 40% 的短期头在包含最新 16 帧(第 50 至 65 帧)的滑动窗口内维护 KV Cache; 2. 全局库容量超限:顶层 50% 的长程头此时已存满 64 帧,第 65 帧被推入待评估队列; 3. 曲率计算与局部淘汰:在 Value 空间中计算中间各帧的重要性得分。假设监控画面中第 20 至 35 帧记录了一辆汽车匀速在直道行驶,其前后语义速度夹角接近 0 度,角曲率项极小;而第 40 帧汽车突然急刹并发生碰撞,该处 Value 轨迹产生显著锐角折角,曲率得分激增。算法精准定位出直道平滑段中得分最低的第 28 帧进行淘汰出库; 4. 增量更新:系统仅对第 27 帧与第 29 帧重新计算局部的 \(\vec{v}_{\text{in}}\)、\(\vec{v}_{\text{out}}\) 及时间跨度,其余 60 余帧的重要度打分完全复用,耗时不到 0.1 ms,随即与即时头、短期头的 KV 特征并行送入 FlashAttention 算子完成流式生成。
实验关键数据¶
主实验¶
在涵盖实时视频问答、长程因果推理及倒序检索的在线主流基准(StreamingBench、OVO-Bench、ODV-bench)上,H2SVC 在各大主干模型(LLaVA-OneVision-7B、LLaVA-Video-7B、Qwen2.5-VL-7B)下均取得了领先成绩,显著超越包括 LiveVLM、StreamKV、ReKV 在内的免训练流式方法,甚至在长程推理指标上优于全量缓存离线模型。
| 主干模型与配置 | 方法类型 | 采样率/帧数 | StreamingBench (Real-Time) | OVO-Bench (Real-Time) | OVO-Bench (Backward) | OVO-Bench (Avg.) | ODV-Bench (Avg.) |
|---|---|---|---|---|---|---|---|
| LLaVA-OV-7B (Full Context) | 离线基线 | 32 frames | 71.1 | 61.5 | 43.4 | 52.5 | 51.3 |
| + ReKV | 免训练流式 | 0.5 fps | 69.1 | 64.4 | 46.7 | 55.6 | 50.9 |
| + LiveVLM | 免训练流式 | 0.5 fps | 72.9 | - | - | 53.5 | 50.8 |
| + StreamKV | 免训练流式 | 0.5 fps | 68.8 | - | - | - | - |
| + H2SVC (本文) | 免训练流式 | 0.5 fps | 73.9 | 65.7 | 56.3 | 61.0 | 52.4 |
| LLaVA-Video-7B (Full Context) | 离线基线 | 64 frames | 75.4 | 63.0 | 52.7 | 57.8 | 52.6 |
| + ReKV | 免训练流式 | 1 fps | 72.9 | - | - | 57.1 | 52.1 |
| + LiveVLM | 免训练流式 | 1 fps | 76.9 | - | - | 59.0 | 51.9 |
| + H2SVC (本文) | 免训练流式 | 1 fps | 77.5 | 67.2 | 58.0 | 62.6 | 53.1 |
| Qwen2.5-VL-7B (Full Context) | 离线基线 | 1 fps | 72.6 | 64.7 | 48.3 | 56.5 | 57.4 |
| + LiveVLM | 免训练流式 | 1 fps | 73.2 | - | - | 56.3 | 57.3 |
| + InfiniPot-V | 免训练流式 | 1 fps | 76.4 | 65.9 | 47.6 | 56.8 | - |
| + H2SVC (本文) | 免训练流式 | 1 fps | 77.0 | 67.7 | 52.8 | 60.3 | 58.7 |
消融实验¶
在 LLaVA-Video-7B 骨干网络下,对分类粒度、头分配比例、记忆库容量配置及曲率淘汰的各核心组件在 Video-MME 与 OVO-Bench 上进行严格消融对比:
| 消融维度 / 设置选项 | 每层视觉 KV 大小 | Video-MME (Medium) | Video-MME (Long) | Video-MME (All) | OVO-Bench (Real-Time) | OVO-Bench (Backward) | OVO-Bench (Avg.) |
|---|---|---|---|---|---|---|---|
| 分类粒度:层级均值路由 (Layer-wise) | 7K | 58.8 | 52.0 | 60.5 | 66.1 | 57.7 | 61.9 |
| 分类粒度:细粒度头感知路由 (Head-wise, 本文) | 7K | 60.7 | 53.4 | 63.0 | 67.2 | 58.0 | 62.6 |
| 头比例:全即时头 (1.00 : 0.00 : 0.00) | 0.7K | 49.0 | 45.7 | 49.1 | 70.1 | 54.5 | 62.3 |
| 头比例:全短期头 (0.00 : 1.00 : 0.00) | 3K | 51.6 | 48.7 | 54.0 | 68.0 | 57.1 | 62.6 |
| 头比例:全长程头 (0.00 : 0.00 : 1.00) | 12K | 61.8 | 53.9 | 64.0 | 63.6 | 55.5 | 59.5 |
| 头比例:本文默认 (0.10 : 0.40 : 0.50) | 7K | 60.7 | 53.4 | 63.0 | 67.2 | 58.0 | 62.6 |
| 淘汰策略:均匀间隔淘汰 (Uniform Eviction) | 7K | 60.9 | 51.7 | 61.7 | 65.7 | 57.5 | 61.6 |
| 淘汰策略:相似度贪心淘汰 (Semantic Eviction) | 7K | 60.5 | 52.6 | 62.0 | 66.1 | 56.3 | 61.2 |
| 淘汰策略:STCE 基于 Key 轨迹 | 7K | 60.4 | 53.1 | 62.7 | 66.5 | 56.7 | 62.1 |
| 淘汰策略:STCE 移除运动幅度门控 | 7K | 60.2 | 52.7 | 62.6 | 65.5 | 57.3 | 61.4 |
| 淘汰策略:STCE 移除时序跨度权重 | 7K | 60.3 | 52.8 | 62.7 | 68.0 | 57.0 | 62.5 |
| 淘汰策略:STCE 完整设计 (本文) | 7K | 60.7 | 53.4 | 63.0 | 67.2 | 58.0 | 62.6 |
| 全量上下文离线基线 (Full Context) | 12K | 61.6 | 52.3 | 63.3 | 63.0 | 52.7 | 57.8 |
关键发现¶
- 头感知细粒度路由显著优于层级路由:若采用以往将整层注意力头平均归为同一种策略的层级方案,Video-MME 全量准确率大幅下跌 2.5(60.5 vs. 63.0),充分印证了同层内注意力头高度分化事实,粗粒度层级压缩会严重模糊注意力特异性。
- 三类功能头的协同互补性:若只保留长程头,虽然长程依赖略有保持,但 OVO-Bench 暴跌至 59.5,说明瞬时与短期滑动窗口对快速运动线索至关重要;而仅保留瞬时或短期头则会导致长程推理彻底瘫痪(Video-MME 跌落至 49.1 / 54.0)。10%:40%:50% 的配比在显存压降与精度保持上达成最佳平衡。
- 值空间几何轨迹建模的必要性:改用 Key 向量计算轨迹会使 OVO-Bench 掉点 0.5(62.1 vs. 62.6),证实 RoPE 绝对位置偏移对语义拓扑的破坏;去掉幅度门控后掉点 1.2,说明静止背景微小扰动带来的假高曲率噪声不可忽视。
- 显存与吞吐的极致扩展性:在单卡 H800 运行 512 秒超长视频测试时,全量 KV Cache 显存暴涨至 76.2 GB 且吞吐骤降,而 H2SVC 显存恒定在 19.0 GB(降低 75.1%),解码吞吐量提升 59.3%(42.7 tok/sec vs. 26.8 tok/sec),彻底解决了显存爆炸难题。
亮点与洞察¶
- 注意力头固有异质性的实证发现:首次通过系统化的时空注意力画像(SAP),证实了注意力头在时序跨度上的功能分工是预训练权重内生的且与输入视频内容无关,打破了长期以来“同层所有头需统一压缩”的设计惯性。
- 纯值向量空间的几何度量巧思:敏锐指出了旋转位置编码(RoPE)对 Key 向量语义空间几何特性的干扰,巧妙在纯 Value 向量空间中定义角曲率、运动门控与跨度加权,兼具数学优雅与极高物理可解释性。
- 完全解耦的推理高效率:分类策略离线一次性完成,在线淘汰算法具备严格的 \(O(1)\) 局部更新复杂度,同时完全不依赖动态注意力矩阵回传,原生适配 FlashAttention 硬件算子。
局限与展望¶
- 作者指出的局限:目前三类头的比例阈值(10%:40%:50%)及记忆库容量参数(64, 16, 4)仍依赖经验网格搜索选取,尚缺乏自适应学习机制动态匹配输入流的时序信息密度。
- 潜在的研究盲区:在极端复杂、视角高速乱序剧烈晃动的具身视频流中,Value 向量之间的连续平滑假设可能被破坏,从而导致误将高频抖动判定为关键语义折点。
- 未来改进方向:可进一步探索结合强化学习或轻量级控制器,实现多模态模型内部记忆库容量随视频流动态复杂度自适应伸缩的动态路由架构。
相关工作与启发¶
- vs LiveVLM / ReKV:现有免训练流式工作大多依赖 Query 引导的动态注意力检索或相似度聚类,需要实时物化或回传注意力矩阵,无法利用 FlashAttention 的 IO 加速;H2SVC 仅在纯 KV 向量上进行静态路由与值空间几何运算,软硬件协同效率极高。
- vs StreamingLLM / H2O:文本领域的滑动窗口加 Attention Sink 策略直接迁移到视频领域会遭遇严重的语义冗余困境;H2SVC 针对视频连续平滑与离散事件转折的特性,通过几何轨迹曲率精准滤除可预测过渡帧,保留真正高信息熵转折点。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统揭示并利用注意力头在流式视频下的固有感受野异质性,几何轨迹淘汰构思精巧。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖在线/离线七大主流基准、三大模型骨干,深入的显存/吞吐分析与极详尽消融。
- 写作质量: ⭐⭐⭐⭐⭐ 动机清晰明确,数学形式化严谨自洽,实验分析层层递进。
- 价值: ⭐⭐⭐⭐⭐ 免训练、即插即用且完全适配 FlashAttention,为真实边缘或端侧无限流式视频落地提供了极具实用价值的范式。