跳转至

GTR: Guide-Then-Refine Token Compression for Training-Free Acceleration of Video-LLMs

会议: ECCV 2026
论文: CVF Open Access
领域: 模型压缩
关键词: 视频大语言模型, Token剪枝, 免训练加速, 动态预算分配, 多模态效率

一句话总结

提出无需重训练的两阶段视觉 Token 压缩框架 GTR(Guide-Then-Refine),先利用全局跨帧独特性与文本查询相似度动态分配帧级预算,再结合帧内局部邻域相似度精细筛选关键 Token,仅保留 15% 视觉 Token 即可保留 95.8% 的原模型性能。

研究背景与动机

视频大语言模型(Video-LLMs)在视频问答、长时序动作识别和具身智能等场景展现出强大理解能力。然而,随着输入视频分辨率和帧数的增加,视觉 Token 的数量呈爆炸式增长。Transformer 自注意力机制的二次方计算复杂度导致推理延迟急剧攀升,严重制约了 Video-LLMs 在计算资源受限环境下的部署与落地。

面对这一计算瓶颈,现有的 Token 压缩方案主要存在三大痛点:其一,多数高效剪枝方法(如 STTM、DynTok、FLOC)仅依据跨帧相似度或空间方差等纯视觉线索筛选 Token,完全忽视了下游文本查询指引;而在长视频问答中,局部微弱却与查询紧密相关的物体极易被无差别丢弃。其二,部分引入文本指引的方法(如 HICom、CrossLMM、HoliTom)要么依赖高昂的对比预训练,要么需要修改 LLM 内部架构引入跨注意力层或侵入式注意力过滤,破坏了 FlashAttention 等高性能推理算子的兼容性。其三,静态统一的压缩策略无法适应视频内容信息密度的动态变化,对静态背景帧与高动态动作帧施加相同剪枝率,造成信息分配失衡。

本文的切入角度是:在进入 LLM 之前以纯前置预处理方式注入轻量级文本与全局引导,实现动态且结构感知的帧级与 Token 级分层压缩。核心 idea:提出 Guide-Then-Refine(GTR)两阶段免训练压缩范式,在引导阶段结合跨帧独特性与文本指令相似度动态计算每帧的保留预算,在细化阶段利用空间局部邻域差异性保留细粒度前景关键 Token,实现完全兼容标准 LLM 架构与 FlashAttention 的即插即用加速。

方法详解

整体框架

GTR 专为解耦视觉编码与 LLM 推理设计,在视觉特征投影之后、进入 LLM 前置层之前完成端到端压缩。对于包含 \(I\) 个视频帧、每帧包含 \(N\) 个空间 Patch 特征的输入序列,GTR 包含两大核心阶段:第一阶段“引导(Guide)”,通过全局跨帧特征均值的反差计算视觉独特性,并融合文本指令嵌入计算相关性,加权聚合得到各帧的信息价值并动态分配保留率;第二阶段“细化(Refine)”,在各帧分配的预算约束下,通过 2D 空间局部邻域余弦相似度捕捉前景边界与微小物体,融合成综合重要性分数并执行 Top-\(K\) 筛选,最终按时序拼接送入冻结的 LLM 进行文本生成。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入视频帧与文本指令<br/>视觉编码器提取 Patch 特征"] --> B["全局与文本引导评分<br/>跨帧均值反差与文本指令相似度"]
    B --> C["动态帧级预算分配<br/>按帧级综合得分线性映射保留率"]
    C --> D["局部空间结构评分<br/>自适应切比雪夫邻域差异度"]
    D --> E["多分数融合与帧内剪枝<br/>保留 Top-Ki 关键视觉 Token"]
    E --> F["拼接保留序列送入 LLM<br/>保持标准注意力与高效算子兼容"]

关键设计

1. 全局与文本引导评分:解耦静态背景与查询相关目标

针对纯视觉压缩丢弃查询目标、以及静态背景在连续帧中反复堆叠的问题,引导阶段为每个位置 \((i, j)\)(第 \(i\) 帧第 \(j\) 个空间 Token \(\mathcal{F}_{i,j}\))同时计算跨帧全局独特性 \(S_{\text{glob}}(i, j)\) 与文本相关性 \(S_{\text{text}}(i, j)\)。对于全局独特性,先计算所有帧同一空间位置的平均特征 \(\bar{\mathcal{F}}_j = \frac{1}{I} \sum_{i=1}^I \mathcal{F}_{i,j}\),以其作为静态背景与全局均值的基准,将与均值的余弦相似度取反作为独特性得分:

\[S_{\text{glob}}(i, j) = 1 - \frac{\mathcal{F}_{i,j} \cdot \bar{\mathcal{F}}_j}{\|\mathcal{F}_{i,j}\|_2 \|\bar{\mathcal{F}}_j\|_2}\]

动态变化或前景运动区域与平均特征偏离较大,因而获得较高得分;静态背景特征跨帧稳定,相似度接近 1,得分受到抑制。对于文本相关性,利用与视觉编码器语义对齐的轻量文本编码器(如 SigLIP)将输入问题 \(Q\) 编码为全局文本向量 \(T \in \mathbb{R}^D\),计算每个 Token 与指令的余弦相似度 \(S_{\text{text}}(i, j) = \frac{\mathcal{F}_{i,j} \cdot T}{\|\mathcal{F}_{i,j}\|_2 \|T\|_2}\)。综合引导得分为二者的加权和:\(S_{\text{guide}}(i, j) = \alpha S_{\text{glob}}(i, j) + \beta S_{\text{text}}(i, j)\)(实验中固定 \(\alpha = 0.375, \beta = 0.625\))。

2. 动态帧级预算分配:按信息密度分配 Token 容量

针对固定帧率剪枝忽视时序内容密度的弊端,该设计通过单帧内所有 Token 引导分数的总和衡量该帧的信息蕴含量:\(S_{\text{guide}}(i) = \sum_{j=1}^N S_{\text{guide}}(i, j)\)。信息量大、动作密集或与文本强匹配的帧获得更高的总分。随后在整个视频的所有帧间进行极差归一化,动态映射为该帧的 Token 保留率 \(r_i\):

\[r_i = r_{\text{base}} + (r_{\text{max}} - r_{\text{base}}) \times \frac{S_{\text{guide}}(i) - S_{\text{min}}}{S_{\text{max}} - S_{\text{min}}}\]

其中 \(S_{\text{min}}\) 和 \(S_{\text{max}}\) 分别为全视频帧总分的极小值和极大值,\(r_{\text{base}}\)(设为 10%)设定最低保留下限以防止低信息量帧完全丢失上下文,\(r_{\text{max}}\)(设为 40%)设定上限保证整体压缩加速比。第 \(i\) 帧分配到的具体保留数量为 \(K_i = \lceil N \cdot r_i \rceil\)。

3. 局部空间结构评分:自适应网格邻域保留细粒度细节

仅仅依赖全局均值反差容易误杀局部关键信息(例如在静止画面中进行精细动作的微小工具或细小物体,其全局偏离并不显著)。为补偿空间高频信息,细化阶段引入基于 2D 特征网格的局部上下文评分。根据特征图网格坐标,基于切比雪夫距离定义每个 Token 的空间邻域 \(\mathcal{N}_{i,j} = \{ \mathcal{F}_{i,k} \mid \max(|u - u'|, |v - v'|) \le 1, (u', v') \in [1, H] \times [1, W] \}\)。这种定义直接适应图像边界和角落,边界 Token 拥有较小的邻域基数,无需人工填充,且完全独立于后续层使用的位置编码方式。局部评分定义为该 Token 与所有邻近 Token 的余弦相似度的补集均值:

\[S_{\text{local}}(i, j) = 1 - \frac{1}{|\mathcal{N}_{i,j}|} \sum_{\mathcal{F}_{i,k} \in \mathcal{N}_{i,j}} \frac{\mathcal{F}_{i,j} \cdot \mathcal{F}_{i,k}}{\|\mathcal{F}_{i,j}\|_2 \|\mathcal{F}_{i,k}\|_2}\]

处于平坦单色背景(如白墙、天空)的 Token 与周围极度相似,\(S_{\text{local}}\) 趋近于 0;而处于物体边缘、纹理交界和微小前景的 Token 与周围差异显著,获得较高局部保留权重。

4. 多分数融合与帧内剪枝:三重视角加权抉择

在最终筛选时,综合多模态指导、时序独特性和空间结构感知,计算每个 Token 的最终得分:

\[S_{\text{final}}(i, j) = \lambda_g S_{\text{glob}}(i, j) + \lambda_t S_{\text{text}}(i, j) + \lambda_l S_{\text{local}}(i, j)\]

权重设置为 \(\lambda_g = 0.3, \lambda_t = 0.5, \lambda_l = 0.2\)。以文本对齐为主导保留任务关键线索,以全局跨帧为辅助抑制静态冗余,以局部空间为补充挽救精细结构。在第 \(i\) 帧内按 \(S_{\text{final}}\) 降序排序,选取前 \(K_i\) 个 Token,按时间顺序拼接各帧保留的子集,无缝送入下游 LLM。

实验关键数据

主实验

在 LLaVA-OneVision-7B(LLaVA-OV-7B)和 LLaVA-Video-7B 上评测 MVBench、LongVideoBench、MLVU 以及 VideoMME(包含整体、短、中、长视频子集)。

模型 / 方法 保留率 MVBench LongVideoBench MLVU VideoMME (Overall) VideoMME (Long) 相对保留率 Avg (%)
LLaVA-OV-7B (Full) 100% 56.9 56.4 63.0 58.6 48.8 100.0
FastV 25% 55.5 53.3 59.6 55.3 47.0 94.9
SparseVLM 25% 56.4 53.9 60.7 57.3 48.1 97.5
VidCom2 25% 57.2 54.9 62.5 58.6 49.4 99.6
GTR (Ours) 25% 57.9 55.1 61.9 58.7 49.9 99.8
FastV 15% 51.6 48.3 55.0 48.1 43.3 85.0
SparseVLM 15% 52.9 49.7 57.4 53.4 47.0 91.2
VidCom2 15% 54.3 52.0 58.9 56.2 48.1 95.1
GTR (Ours) 15% 55.7 52.6 59.3 56.4 48.7 95.8

在 25% 保留率下,GTR 在 MVBench 上甚至超出 Full Tokens 1.0 个百分点(57.9% vs 56.9%),在 VideoMME-Long 上达到 49.9%,显著优于纯视觉基线;在极限 15% 保留率下,平均性能依然保持 95.8%,比 FastV 高出 10.8 个百分点。

消融实验

在 LLaVA-OV-7B 上验证各评分组件对 MLVU 和长视频理解(VideoMME-Long)的贡献:

配置 MLVU 得分 长视频得分 相对基线性能 (%) 说明
Full Model (Ours) 61.9 49.6 99.7 \(S_{\text{text}} + S_{\text{glob}} + S_{\text{local}}\) 完整融合
\(S_{\text{text}} + S_{\text{glob}}\) 61.7 49.3 99.4 移除局部空间细化,微小物体丢失导致掉点
\(S_{\text{text}} + S_{\text{local}}\) 61.2 48.6 98.6 缺少跨帧去冗余,静态背景分配过多 Token
\(S_{\text{glob}} + S_{\text{local}}\) 60.5 48.2 97.5 缺少文本引导,无法聚焦问题相关的关键信息
仅 \(S_{\text{text}}\) 61.5 49.0 98.3 仅依靠文本匹配,单模态噪声和背景残留较大
仅 \(S_{\text{glob}}\) 60.8 48.7 97.1 仅依赖跨帧均值,丢失查询特异性
仅 \(S_{\text{local}}\) 60.0 47.5 96.0 纯局部空间差异,完全无法感知时序和多模态语义

此外,在端到端效率评测中,LLaVA-OV-7B 全量 Token 推理需 26分03秒(显存占用 17.7 GB);在 25% 保留率下,GTR 将推理时间缩短至 18分44秒(加速约 1.4 倍,吞吐由 0.64 增至 0.88 sample/s),显存降至 16.1 GB。GTR 前置引导与细化模块开销仅为 8.5ms + 2.3ms,远快于需在 LLM 前几层前向的 FastV(LLM Latency 179.8ms vs 260.9ms,且 FastV 显存膨胀至 24.7 GB)。

关键发现

  • 文本指引不可或缺:消融显示 \(S_{\text{text}}\) 在单项中贡献最大,去掉后长视频得分从 49.6% 跌至 48.2%,证明长视频由于冗余帧海量存在,没有查询信号介入极易剪掉关键帧。
  • 全局与局部互补显著:全局得分 \(S_{\text{glob}}\) 解决“哪一帧、哪个大区域在变化”,局部得分 \(S_{\text{local}}\) 解决“前景物体与背景的细粒度边缘区分”,两者叠加实现了多尺度空间时序互补。
  • 即插即用正交增强:将 GTR 叠加至已有压缩方法 FastV 和 SparseVLM 之上,各基准平均仍可取得 +0.7% 到 +0.9% 的绝对提升,证明其在预处理层提供的语义预算分配与已有机制完全正交。

亮点与洞察

  • 跨帧均值反差设计极简且高效:通过对全部帧同一位置 Patch 取算术平均构造静态基准,只需一次简单的余弦相似度取反即可有效压制重复出现的背景,避开了复杂的时空图构建或昂贵的聚类。
  • 纯前置解耦保持内核加速友好:剪枝完全在视觉投影层与 LLM 输入端之间完成,不侵入 LLM 内部自注意力计算,完全兼容 FlashAttention 和标准 KV Cache 机制,规避了传统 in-LLM 剪枝导致的内存碎片与算子不兼容。
  • 分层决策“When to keep”与“Where to keep”:引导阶段通过帧级总分极差归一化决定在哪个时刻保留更多 Token(时间维度分配),细化阶段在帧内根据空间局部差异决定保留哪些具体 Token(空间维度分配),架构层次清晰。

局限与展望

  • 流式视频与极长视频支持有限:全局跨帧均值 \(\bar{\mathcal{F}}_j\) 需要预先获知完整视频序列的所有帧,对于无限流式输入(Streaming Video)或数万帧的超长实时视频,无法直接一次性计算全局均值。
  • 复杂文本推理的跨模态投影漂移:针对无原生配对文本编码器的多模态模型(如 Qwen2-VL),需要引入外置 SigLIP 进行文本引导,复杂的复合条件指令可能存在视觉-语言嵌入不对齐的潜在风险。
  • 未来方向:作者指出可探索面向流式视频的滑动窗口自适应均值更新机制,并将 Token 压缩与延迟感知调度器联合优化,在动态计算预算下实现自适应实时推理。

相关工作与启发

  • vs VidCom2: VidCom2 同样通过独特性量化实现帧间动态分配,但其完全基于纯视觉信号驱动;GTR 证明了引入文本指令嵌入 \(S_{\text{text}}\) 能在极端压缩率(15%)下大幅拉开与纯视觉方案的准确率差距(55.7% vs 54.3%)。
  • vs FastV / PDrop: FastV 等方法需要在 LLM 浅层前向计算自注意力注意力图来识别冗余 Token,破坏了 FlashAttention 算子优化且显存消耗高达 24.7GB;GTR 将压缩全部前置在 LLM 之前,显存保持在 16.1GB,吞吐更高且无需改动 LLM 权重。
  • vs HoliTom / CrossLMM: HoliTom 涉及复杂的混合前置合并与 LLM 内部注意力过滤,CrossLMM 则修改 LLM 骨干引入双交叉注意力层;GTR 保持完全的免训练与架构无关性,即插即用支持各类主流开源 Video-LLM。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [将跨帧全局反差、文本指令先验与局部切比雪夫邻域差异融合成两阶段剪枝,思路简洁优雅]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 个长短视频核心基准、2 种架构对比、详细的效率显存测算及消融实验]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑链路清晰,公式与符号表达克制自洽,图表与实验支撑严密]
  • 价值: ⭐⭐⭐⭐⭐ [完全免训练且兼容 FlashAttention 的前置压缩方案,对工业界低延迟 Video-LLM 部署有极高实用价值]