STVFocus: Query-guided Spatio-Temporal Visual Focusing for Video LLMs¶
会议: ECCV 2026
论文: ECCV 2026
领域: 可解释性
关键词: 视频大语言模型, 时空显著性, 层次化时序聚焦, 空间聚焦, 免训练
一句话总结¶
针对视频中任务相关信息时空密度极低且冗余严重的问题,STVFocus 提出了一种免训练的时空联合视觉聚焦框架,通过由粗到细的层次化时序抽帧与查询引导的帧内空间显著性筛选,将节省的空间显存预算动态重分配给额外关键帧,显著提升了视频大语言模型的跨任务理解精度与可解释性。
研究背景与动机¶
视频大语言模型(Video LLMs)在理解动态视觉内容方面取得了长足进展,但视频数据天然具有极低的任务相关信息密度。在时间维度上,连续帧之间存在高度的内容重叠与时序冗余,真正承载关键事件的时刻往往极其短暂;在空间维度上,静态背景与环境纹理占据了单帧画面的大部分区域,对回答特定查询毫无帮助。受限于上下文窗口与计算显存预算,模型若无差别地摄入全部时空特征,关键语义信号必然被大量低价值的背景噪音淹没。
为了过滤时空冗余,现有研究探索了一系列免训练的聚焦手段,但时序与空间两个维度的探索处于割裂状态。时序过滤方法(如 BOLT、AKS)通过多模态预训练模型评估文本与视频帧的相关度来抽取关键帧,但这类方法一方面将昂贵的多模态骨干网络仅用作单次采样打分器,后续推理便将其丢弃,未能充分利用其表征潜能;另一方面过度偏向查询相似度,容易丢失全局叙事线索,在短视频与全局任务中出现严重的上下文偏差。空间过滤方法则主要沿用针对 ViT 或图像 MLLM 的视觉 token 剪枝或合并策略,其目标几乎完全由计算加速主导,缺乏细粒度的文本查询引导,无法区分任务相关的微小前景目标与静态背景。更重要的是,现存方案从未建立时空之间的动态资源互通机制,使得空间压缩节省的宝贵预算无法反哺时序上下文覆盖。
本文的核心切入点在于:人类观看视频时遵循“先全局轮廓、后细粒度焦点”的认知习惯,且单帧内被压缩的冗余空间容量完全可以置换为更密集的时间线采样。核心 idea:STVFocus 构建了一套免训练且模型通用的时空联合聚焦框架,通过层次化粗细渐进时序采样消除查询偏置并捕获全局骨架,基于特征内在激活与查询敏感图融合实现帧内空间 token 筛选,并将压缩节省的空间 token 预算动态置换为额外高价值帧的时序扩充。
方法详解¶
整体框架¶
STVFocus 作为一个端到端免训练的即插即用前端处理框架,输入包含文本查询 \(Q\) 与视频候选帧集合 \(\mathcal{F} = \{I_1, \dots, I_N\}\),输出为高度信息密集且符合固定 token 预算的时空视觉 token 序列,直接送入下游 Video LLM 进行自回归解码。整体流程分为时空显著性提取、层次化时序聚焦、查询引导的空间聚焦以及动态时序重分配四个协同阶段。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入:文本查询 Q 与视频帧集合 F"] --> Saliency["时空显著性提取<br/>CLIP 提取全局时序分数与空间梯度敏感图"]
Saliency --> HTF["层次化时序聚焦<br/>粗阶段特征多样性覆盖 + 细阶段查询相关性聚焦"]
HTF --> QSF["查询引导的空间聚焦<br/>内在激活图 AAM 融合文本引导空间显著图 Top-K 裁剪"]
QSF --> TR["动态时序重分配<br/>依据空间节省预算自适应追加候选高价值时序帧"]
TR --> Out["输出:高信息密度视觉 Token 序列送入 Video LLM"]
关键设计¶
1. 层次化时序聚焦:兼顾全局故事线覆盖与查询相关时刻细化
纯基于查询相似度的采样极易导致“隧道视野”,即抽取的帧全集中在包含查询关键词的局部片段,破坏了视频的全局因果关系与宏观背景。层次化时序聚焦(Hierarchical Temporal Focus, HTF)借鉴了最远点采样(FPS)思想,引入由粗到细的两阶段采样流程。首先利用 CLIP 视觉与文本编码器计算每帧与查询的余弦相似度 \(s_i\),并通过锐化缩放得到归一化时序显著性分数: $\(\tilde{s}_i = \left( \frac{s_i - \min(s)}{\max(s) - \min(s)} \right)^\alpha\)$ 其中 \(\alpha=2\)。在迭代抽帧时,当前帧集合 \(\mathcal{S}\) 从初始帧迭代扩充,下一帧的选取由特征距离(表征多样性)与显著性分数(查询相关性)共同决定: $\(I_{\text{next}} = \arg\max_{I_j \in \mathcal{F} \setminus \mathcal{S}} \Big[ \beta \min_{I_m \in \mathcal{S}} D(\mathbf{v}_j, \mathbf{v}_m) + (1-\beta) \tilde{s}_j \Big]\)$ 其中 \(D(\mathbf{v}_j, \mathbf{v}_m) = 1 - \cos(\mathbf{v}_j, \mathbf{v}_m)\)。HTF 将固定帧预算 \(k\) 等分为两部分:在粗粒度阶段令 \(\beta=1\),完全依据视觉多样性抽取基础帧集 \(F_{\text{coarse}}\),勾勒出视频的主干题材与场景变迁;在细粒度阶段降低 \(\beta\)(取 0.5),在多样性正则约束下重点抓取与问题高度匹配的关键帧集 \(F_{\text{fine}}\)。两者合并 \(F_{\text{down}} = F_{\text{coarse}} \cup F_{\text{fine}}\),有效消除了单一查询驱动带来的上下文偏差。
2. 查询引导的空间聚焦:融合内在特征激活与梯度显著图的帧内修剪
在完成关键帧选取后,单帧内部仍然存在大面积与问题无关的背景像素。为了在空间维度去芜存菁,查询引导的空间聚焦(Query-informed Spatial Focus, QSF)提出双路重要性评估准则。第一路是基于内在特征激活的注意力图(Activation-based Attention Map, AAM),计算每个 patch token 特征向量在通道维度上的 \(L_1\) 范数并归一化: $\(\mathcal{F}(\mathbf{X}_{t,p}) = \sum_{d=1}^D |\mathbf{X}_{t,p,d}|, \quad \text{AAM}(t,p) = \frac{\mathcal{F}(\mathbf{X}_{t,p}) - \min(\mathcal{F})}{\max(\mathcal{F}) - \min(\mathcal{F})}\)$ AAM 反映了视觉编码器认为自身信息量丰富的高频区域(如边缘和显著前景)。第二路则是利用基于梯度的视觉可解释性算法(LeGrad),提取文本查询关于帧特征的空间敏感图 \(M_i \in \mathbb{R}^{H \times W}\),经高斯平滑滤波(\(\sigma=8\))后通过自适应平均池化对齐到 patch token 网格分辨率 \(\tilde{\mathbf{M}}_i \in \mathbb{R}^{H_p \times W_p}\)。最终的综合空间聚焦得分由两者线性加权融合: $\(\mathbf{s}_{\text{focus}} = \gamma \tilde{\mathbf{M}}_i + (1-\gamma) \text{AAM}_i\)$ 设 \(\gamma=0.5\),并保留 top-\(\tau\)(设定 \(\tau=80\%\))比例的最显著 token。这种双重融合机制既避免了纯 AAM 忽略查询指引而误删微小提问对象的缺陷,又避免了纯梯度图对高频图像细节的模糊,使保留的空间 patch 兼具语义相关性与视觉结构完整性。
3. 动态时序重分配:空间压缩容量置换为高价值时序覆盖
传统视觉 token 压缩通常将稀疏化带来的收益仅仅视为吞吐加速,但在固定上下文预算的推理场景下,空余出来的 token 容量构成了宝贵的信息带宽。动态时序重分配(Temporal Reallocation, TR)设计了“以空间换时序”的闭环机制。在总 token 预算 \(B_{\text{total}}\) 固定前提下,单帧经过 QSF 保留 \(\tau\) 比例 token 后,系统将释放剩余预算 \(B_{\text{remain}} = B_{\text{total}}(1 - \tau)\)。根据每帧修剪后的目标 token 数 \(b_{\text{frame}}\),计算出可容纳的额外扩充帧数量: $\(k_{\text{add}} = \left\lfloor \frac{B_{\text{remain}}}{b_{\text{frame}}} \right\rfloor\)$ 随后,模型直接沿着 HTF 阶段输出的时序候选优先级队列,无缝按序补入排名紧随其后的前 \(k_{\text{add}}\) 帧。例如在 32 帧基线设定下,\(\tau=0.8\) 使得每帧精简 20% token,累积节省的预算恰好支持额外追加 8 帧处理后的关键帧(总计 40 帧以 80% 空间保留率进入 LLM,总 token 严格维持在 100% 原始预算)。这在保证整体计算量不超标的前提下,显著填补了复杂长时序动作中的事件断层。
损失函数 / 训练策略¶
STVFocus 属于完全免训练(Training-free)与模型不可知(Model-agnostic)的推理时处理方案,无需对视觉编码器、多模态投影层或语言模型进行任何梯度更新或后训练。全套流程超参数在所有测试基准与骨干模型上均采用单套通用配置:时序显著性控制因子 \(\alpha=2\)、高斯滤波核方差 \(\sigma=8\)、HTF 粗细阶段帧数各占 50%、细阶段权衡参数 \(\beta=0.5\)、空间融合权重 \(\gamma=0.5\) 以及空间保留率 \(\tau=80\%\)。
实验关键数据¶
主实验¶
在 VideoMME、LongVideoBench(LVB)以及 MLVU 三大代表性视频理解基准上,评估了集成 STVFocus 对主流开源 Video LLM(LLaVA-OneVision-7B、VILA1.5-8B、InternVL3-8B)带来的性能增益,并与同类免训练及前沿训练方法进行了对比。
| 基座模型 | 方法类型 | VideoMME Overall | VideoMME Short | VideoMME Medium | VideoMME Long | LVB | MLVU |
|---|---|---|---|---|---|---|---|
| LLaVA-OneVision-7B | 基线无插件 | 58.5 | 70.3 | 56.6 | 48.8 | 56.4 | 63.2 |
| + AKS (CVPR 2025) | 免训练时序采样 | 59.6 | 71.1 | 57.4 | 50.1 | 59.3 | - |
| + BOLT (CVPR 2025) | 免训练时序采样 | 59.9 | 70.1 | 60.0 | 49.6 | 59.6 | 66.8 |
| + STVFocus (本文) | 免训练时空聚焦 | 61.1 | 71.9 | 61.0 | 50.4 | 61.2 | 68.7 |
| VILA1.5-8B | 基线无插件 | 47.5 | 57.8 | 44.3 | 40.3 | 47.1 | 46.3 |
| + Frame-Voyager (ICLR 2025) | 依赖训练微调 | 50.5 | 60.3 | 47.3 | 43.9 | - | 49.8 |
| + Q-Frame (2025) | 免训练多分辨率 | 50.7 | 59.8 | 48.0 | 44.2 | 51.6 | 54.4 |
| + STVFocus (本文) | 免训练时空聚焦 | 52.6 | 61.8 | 50.8 | 45.2 | 52.5 | 50.9 |
| InternVL3-8B | 基线无插件 | 64.5 | 75.7 | 64.1 | 53.8 | 58.5 | 67.8 |
| + STVFocus (本文) | 免训练时空聚焦 | 67.0 | 77.6 | 68.2 | 55.3 | 61.5 | 74.8 |
消融实验¶
基于 LLaVA-OneVision-7B 模型,在 VideoMME 和 LongVideoBench 上对 HTF(粗/细阶段)、QSF(空间聚焦)以及 TR(时序重分配)各组件进行逐层剥离分析。
| HTF 粗阶段 | HTF 细阶段 | QSF 空间聚焦 | TR 时序重分配 | 输入总帧数 | Token 总预算 | VideoMME | LVB | 说明 |
|---|---|---|---|---|---|---|---|---|
| - | - | - | - | 32 | 100% | 58.5 | 56.4 | 均匀采样基准线 |
| ✓ | - | - | - | 32 | 100% | 59.2 | 56.8 | 仅粗阶段特征多样性抽帧 (+0.7 / +0.4) |
| - | ✓ | - | - | 32 | 100% | 60.2 | 60.5 | 仅细阶段相关性抽帧 (+1.7 / +4.1) |
| ✓ | ✓ | - | - | 32 | 100% | 60.8 | 60.6 | 层次化两阶段完整 HTF (+2.3 / +4.2) |
| ✓ | ✓ | ✓ | - | 32 | 80% | 60.8 | 60.7 | 引入 QSF 空间剪枝,预算仅需 80% 维持相当性能 |
| ✓ | ✓ | ✓ | ✓ | 32 + 8 | 100% | 61.1 | 61.2 | 完整模型:空间预算回填 8 帧,全面达最优 |
此外,针对 QSF 模块内部的消融表明:在 50% 空间压缩率下,仅使用 AAM 得到 59.1 分,仅使用 Spatial Saliency 得到 58.4 分,而两者在 \(\gamma=0.5\) 均衡融合下达到 59.4 分(相比未聚焦基线提升 0.9 分),证明内在特征重要性与文本梯度敏感图具有强互补性。对于时序预算缩放,在 InternVL3-8B 设定下,无论是 8 帧(59.8 → 63.3)、16 帧(61.6 → 64.5)还是 32 帧(64.5 → 67.0),STVFocus 均稳定带来 2.5~3.5 个百分点的绝对增益。
关键发现¶
- 层次化时序采样的粗阶段对短视频帮助显著,而细阶段对长视频增益更大,两者结合有效避免了在复杂长视频中因过度偏置丢失宏观线索的缺陷。
- QSF 将空间 token 精简至 80% 时,模型在不追加额外帧的情况下精度不仅未发生劣化,反而略微剔除了背景干扰;而动态时序重分配将多出来的 20% 预算再转化为 8 帧有效上下文,实现了“空间净度与时序连续性”的双赢。
- 空间聚焦阈值 \(\tau\) 固定在 80% 效果最优;若尝试自适应动态阈值裁剪,反而会破坏 Video LLM 对时空序列的稳定注意力分布,导致长上下文推理退化。
亮点与洞察¶
- 多模态外挂模型价值最大化:不同于以往方法仅将 CLIP 用作一次性抽帧打分器,STVFocus 巧妙借助基于梯度的可解释性算法(LeGrad)从同一外挂模型中进一步提取细粒度空间显著图,将外挂模型的计算价值在空间维度进行了深度复用。
- 空间预算向时序维度的正向迁移:破除了传统 token 剪枝“只为压速度”的单一维度思维,把单帧内冗余背景压缩出的计算资源无缝注入到长时序关键动作的帧数扩充中,在严密控制总 token 上限的同时提升了视频信息密度。
- 由粗到细模拟人类感知机制:利用两阶段 FPS 机制模拟“先看全景体裁、再抓细节动作”的认知逻辑,系统性解决了现有免训练抽帧方案过度向 query 靠拢导致的上下文坍缩问题。
局限与展望¶
- 作者承认的局限:对每帧计算基于梯度的空间显著图(LeGrad)需要反向传播经过外挂 CLIP 的视觉主干,虽然无需对 Video LLM 本身反传,但在离线抽帧阶段仍会引入不可忽视的前置计算耗时。
- 自行审视的局限:方法目前依赖固定的全局超参数(如统一保留 80% 空间 token、等比拆分粗细帧数),对于不同动态程度的视频(例如高动态体育场景对比静态录播课件),静态的配比可能并非最优选择;此外空间 token 剪枝在遇到大面积细小文字排版的 OCR 类视频时可能偶发文字笔画断裂。
- 改进思路:后续可探索利用无参数的浅层自注意力跨层分布替代梯度反传,以微秒级耗时近似空间显著性;同时设计根据视频光流方差自适应调节时空预算置换比率的弹性机制。
相关工作与启发¶
- vs BOLT / AKS (时序自适应采样): 传统时序采样仅在帧级别对视频做非均匀筛选,且倾向于在整个视频中追逐文本相似度最高的帧簇,导致丢失全局结构;STVFocus 引入粗到细的层次化采样保留全局骨架,并且更进一步将聚焦粒度下沉到了帧内空间 patch,最后通过时空预算互换反哺时序。
- vs Q-Frame (多分辨率自适应): Q-Frame 依据时序重要性动态改变帧分辨率(整帧缩放),但本质上依旧是帧级操作,帧内背景冗余依旧按比例存在;STVFocus 实现了针对语义前景的 token 级不规则几何高亮,并在 token 粒度实现了真正的预算闭环重分配。
评分¶
- 新颖性: ⭐⭐⭐⭐ [首次打通免训练时序抽帧与帧内空间显著性剪枝,并提出空间向时序反哺的预算重分配机制]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3 个主流基座模型和 3 大权威评测集,消融实验涵盖组件、超参和多尺度帧预算]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,三阶段框架设计清晰自然,动机与实验互相印证]
- 价值: ⭐⭐⭐⭐ [作为完全免训练的推理增强方案,能零成本适配各种开源 Video LLM,实用价值极高]