跳转至

S3-Prune: Stability-Aware Token Budgeting for Long-Form Video-Language Models

会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
领域: 视频理解
关键词: 视频多模态大模型、Token剪枝、长视频推理、自适应预算、卡尔曼滤波

一句话总结

针对长视频语言模型中局部启发式剪枝带来的瞬时噪声敏感与累积预算失衡问题,S3-Prune 提出结合时空动态表征与卡尔曼滤波平滑的稳定性感知 Token 预算机制,在保持极低推理开销与高达 90% 剪枝率的同时无损保留关键语义。

研究背景与动机

长时程视频多模态大模型(Video-VLMs)在复杂因果推理、细粒度事件理解和长视频问答中展现出强大的多模态理解能力。然而,为了捕捉精细时空细节,长视频输入通常包含数十乃至数百帧高分辨率图像,导致总视觉 Token 数量剧烈膨胀。由于大语言模型(LLM)的自注意力计算复杂度随序列长度呈二次方 \(O((F \cdot N)^2)\) 增长,海量 Token 不仅迅速撑满上下文窗口,更造成了灾难性的预填充计算延迟与显存 KV-Cache 暴涨。

现有针对 Video-VLM 的高效推理方法多聚焦于视觉编码器后或 LLM 前的 Token 剪枝与合并,试图利用连续帧之间的高度时空冗余降低计算负担。然而,这些方法大多依赖单帧或局部相邻帧的静态启发式统计指标(如局部熵、帧间余弦相似度等),在长时程视频流中暴露出三大致命控制缺陷:其一是观测随机性(Observational Stochasticity),镜头晃动、遮挡或瞬时亮度突变引入的局部测量噪声极易导致误判,将关键动态误当作冗余剔除;其二是决策偏差累积(Accumulated Decision Bias),短视的贪心分配策略在瞬时高噪帧上过度消耗预算,导致后续关键帧面临不可逆的算力枯竭;其三是信息密度非平稳性(Non-stationarity of Information Density),固定剪枝率机制无法自适应跟踪场景切换或关键动作爆发时的信息涌入。

面对长序列中局部统计量的剧烈波动与预算不可逆消耗的深层矛盾,本文没有继续在单一局部的静态启发式度量上修修补补,而是将长视频的 Token 预算分配抽象为一个带有观测噪声的动态系统控制问题。核心 idea:将长视频信息需求建模为包含局部空间不确定性与宏观分段跃迁的潜在状态,利用卡尔曼滤波与稳定性累积过滤瞬态观测噪声并自适应平滑算力预算,通过双阶段分层筛选实现长时程稳健的 Token 压缩。

方法详解

整体框架

S3-Prune 整体架构包含三个核心协同阶段:多尺度时空需求建模、卡尔曼稳定性累积控制,以及两阶段自适应 Token 分层筛选。整个流程在无需对多模态模型进行额外微调或参数重训的前提下,以完全训练无关(training-free)的方式内嵌于长视频推理流水线中。

首先,输入视频帧序列送入视觉编码器,系统提取 Patch 级表征并计算相邻帧特征偏移,获得空间不确定性度量,同时提取宏观分段的特征质心并计算余弦距离,量化分段语义跃迁幅度;接着,这两路多尺度测量信号经在线标准化融合后,输入基于卡尔曼滤波的状态空间估计器,剥离高频瞬态噪声并估算潜在需求与其置信区间;最后,控制器依据平滑后的需求与不确定性安全边际动态分派当帧 Token 预算,先在 LLM 前粗筛出候选 Patch 集合,再在 LLM 中间层借助文本查询自注意力权重精炼出最终保留的视觉 Token。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入长视频序列<br/>F 帧高分辨率图像"] --> B["多尺度时空需求建模<br/>局部空间不确定性 + 宏观分段跃迁"]
    B --> C["卡尔曼稳定性累积<br/>递归滤波抑制高频噪声与决策漂移"]
    C --> D["不确定性感知动态预算<br/>动态安全边际分配单帧预算 Bt"]
    D --> E["双阶段分层剪枝筛选<br/>Pre-LLM视觉粗筛 + Intra-LLM查询精炼"]
    E --> F["压缩后高质量视觉序列<br/>输入 LLM 深度推理层与生成"]

关键设计

1. 多尺度时空需求建模:细粒度 Patch 扰动与宏观场景跃迁联合表征

长视频流的信息密度具有强烈的时空非平稳性,单一尺度特征极易顾此失彼:仅看全局帧差会忽略局部微小关键动作,而仅看局部特征差又容易被高频成像噪声误导。为此,S3-Prune 联合构建了局部空间不确定性(Spatial Uncertainty, SU)与宏观分段跃迁(Segment Transition, ST)双重信号。针对第 \(t\) 帧中第 \(i\) 个 Patch 编码向量 \(\mathbf{x}_{t,i}\),定义其相对于前一帧对应位置的归一化相对变动量: $\(\mathrm{SU}_{t,i} = \frac{\|\mathbf{x}_{t,i} - \mathbf{x}_{t-1,i}\|_2}{\|\mathbf{x}_{t,i}\|_2 + \epsilon}\)$ 分母的模长归一化消除了深层特征尺度漂移对变动敏感度的干扰。随后,利用单帧内所有 Patch 的均值 \(\mu_t\) 与标准差 \(\sigma_t\) 构建综合统计量 \(m_t = \mu_t + \sigma_t\),既反映帧内整体变动幅度,又表征空间语义分布的异质程度。与此同时,针对视频划分的时间段 \(s\),提取帧级 CLS 表征计算段内均值质心 \(\mathbf{c}_s = \frac{1}{T_s}\sum_{t\in\mathcal{F}_s}\mathbf{v}_t\),通过相邻段质心的余弦距离定义宏观跃迁 \(\mathrm{ST}_s = 1 - \frac{\mathbf{c}_s^\top\mathbf{c}_{s-1}}{\|\mathbf{c}_s\|_2 \|\mathbf{c}_{s-1}\|_2 + \epsilon}\)。高 ST 表明场景发生剧烈剪辑或全局视角突变,系统需为该阶段保留更高容量。

2. 卡尔曼稳定性累积:平抑观测抖动与避免决策偏差级联

直接基于瞬时观测信号分配 Token 会使剪枝预算对抖动极度敏感:某一帧遭遇短暂遮挡或闪烁,启发式算法会瞬间误分配超额预算,进而挤占长序列后续关键事件的算力配额。S3-Prune 引入稳定性累积(Stability Accumulation, SA),将融合测量值 \(z_t = \tilde{m}_t + \widetilde{\mathrm{ST}}_t\)(经在线滑动均值与方差标准化)视为真实信息需求 \(d_t\) 叠加观测噪声的结果,建立线性状态空间方程: $\(d_t = d_{t-1} + w_t, \quad w_t \sim \mathcal{N}(0, Q)\)$ $\(z_t = d_t + n_t, \quad n_t \sim \mathcal{N}(0, R)\)$ 在此框架下,先验估计 \(\hat{d}_t^- = \hat{d}_{t-1}\) 与先验协方差 \(P_t^- = P_{t-1} + Q\) 在接收到新观测 \(z_t\) 后,通过卡尔曼增益 \(K_t = \frac{P_t^-}{P_t^- + R}\) 动态平衡预测信任度与观测反馈。当观测方差过大时,较小的 \(K_t\) 强力衰减瞬时高频尖峰;当信息量持续稳定涌入时,\(K_t\) 迅速拉升跟踪速度。卡尔曼后验更新给出平滑需求 \(\hat{d}_t = \hat{d}_t^- + K_t(z_t - \hat{d}_t^-)\) 和更新后不确定度 \(P_t = (1 - K_t)P_t^-\),从控制论底层阻断了单步误差在时间维度的恶性放大。

3. 不确定性感知动态预算:自适应安全裕度与时序因果配额分派

经过滤波平滑的状态估计如果仅仅按均值线性映射为离散 Token 数量,依然可能在高度易变区间因过于保守而漏掉稀疏关键帧。为此,S3-Prune 构造了融入方差补偿的不确定性感知需求指标 \(\phi_t = \hat{d}_t \cdot (1 + \sqrt{P_t})\)。这里标准差 \(\sqrt{P_t}\) 构成了数学意义上的安全冗余裕度(Safety Margin):当系统对当前时段的认知不确定性升高时,自适应扩大预算分配以兜底潜在的关键信息。为了严格保持在线流式推理的因果性(Causality),第 \(t\) 帧的最终预算 \(B_t\) 采用滑动历史峰值 \(\Phi_t = \max(\Phi_{t-1}, \phi_t)\) 作为动态归一化基准: $\(B_t = \left\lceil \rho \cdot \frac{\phi_t}{\Phi_t} \cdot N \right\rceil\)$ 其中 \(\rho\) 为全局基准保留比例,\(N\) 为单帧原始 Token 数。该设计使模型能根据视频当前时段的相对重要度动态伸缩各帧分配比例,兼顾因果流式约束与全局自适应性。

4. 双阶段分层剪枝筛选:视觉前置粗筛与跨模态查询精选

为了在极大压缩比下兼顾计算吞吐量与问答相关性,S3-Prune 采用两阶段分层漏斗式选择策略。第一阶段发生在进入 LLM 之前:依据各 Patch 的空间不确定性 \(\mathrm{SU}_{t,i}\),直接在视觉侧选出 Top-\(B_t\) 个候选 Token 集合 \(\mathcal{C}_t\)。这一步以几乎忽略不计的计算代价剔除长视频背景中海量的静态低熵冗余,极大降低了后续进入 LLM 预填充时的自注意力开销。第二阶段在 LLM 浅层中间层 \(M\) 处执行:利用文本 Query Token 对视觉候选 Token 的交叉注意力权重,计算每个候选 Token \(j \in \mathcal{C}_t\) 的最大关联度得分 \(a_{t,j} = \max_{1 \le i \le N_q} \mathbf{A}^{(M)}_{q,t}(i, j)\),再按该得分取 Top-\(\lfloor \alpha \cdot B_t \rfloor\) 得到最终进入深层 LLM 的精炼视觉集合 \(\mathcal{R}_t\)。视觉层与任务层的分工协作,使得最终留存的 Token 兼备强时空动态与高任务相关性。

实验关键数据

主实验

论文在 LLaVA-OV-7B、LLaVA-VID-7B、Qwen-2.5-VL-7B 以及 Qwen-3-VL-8B 等多个主流架构上,跨越 MVBench、EgoSchema、LongVideoBench、VideoMME 等 7 大权威基准进行了全面评测。在 10% 乃至 25% 极低保留率下均大幅超越前沿 SOTA 剪枝算法。

模型与方法 保留比例 MVBench EgoSchema LongVideoB VideoMME (w/ sub) 平均性能 (Avg %)
LLaVA-OV-7B (Vanilla) 100% 58.28 60.34 42.18 61.81 60.7 (100.0%)
FastVid (NeurIPS'25) 25% 58.23 59.23 42.92 61.11 60.1 (98.9%)
HoliTom (NeurIPS'25) 25% 58.25 60.94 42.55 61.96 60.8 (100.1%)
S3-Prune (本文) 25% 58.50 61.11 43.12 62.34 61.1 (100.6%)
FastVid (NeurIPS'25) 10% 57.50 58.61 42.35 60.15 59.2 (97.5%)
HoliTom (NeurIPS'25) 10% 57.40 59.96 42.63 60.33 59.6 (98.0%)
S3-Prune (本文) 10% 57.63 60.25 42.44 62.03 59.7 (98.3%)
LLaVA-VID-7B (Vanilla) 100% 60.43 57.18 57.58 70.14 65.9 (100.0%)
HoliTom (NeurIPS'25) 10% 56.63 53.78 57.51 69.96 63.1 (95.8%)
S3-Prune (本文) 10% 59.95 54.09 57.65 70.04 63.9 (96.9%)

此外,在 Qwen 系列模型上分析推理延迟与显存开销:在 10% Token 保留率下,S3-Prune 使 Qwen-2.5-VL-7B 的 LLM 推理耗时压缩至原始的 26.0%,端到端总时间缩短至 71.7%,峰值显存降低至 95.9%,而在 VideoMME 保持 61.47 分(达基线满血精度的 95.5%),在兼顾加速比与推理精度上显著领先 FastVid 与 HoliTom。

消融实验

论文针对观测特征组合(SU、ST)、卡尔曼滤波(KF)的有效性以及不同阶段筛选策略进行了严格的消融对比。

模块配置 SU ST 卡尔曼滤波 (KF) MVBench VideoMME 平均分 (Avg %) 说明
仅全局分段跃迁 - ✓ ✓ 60.83 58.53 59.7 仅捕捉宏观场景变动,丢失细粒度动态
仅局部空间不确定性 ✓ - ✓ 61.00 58.75 59.9 识别局部动作但缺乏宏观剪辑感知
完整双信号需求 ✓ ✓ ✓ 61.33 59.10 60.2 多尺度联合表征达到最佳平衡
去除卡尔曼滤波 (LLaVA-OV) ✓ ✓ ✗ 56.40 55.90 53.6 瞬态噪声导致预算剧烈抖动与累积漂移
引入卡尔曼滤波 (LLaVA-OV) ✓ ✓ ✓ 57.60 57.30 54.4 平滑需求曲线并提供方差冗余,提升 +0.8%
去除卡尔曼滤波 (Qwen-2.5) ✓ ✓ ✗ 67.10 60.80 59.6 无法抵御观测噪声
引入卡尔曼滤波 (Qwen-2.5) ✓ ✓ ✓ 68.40 61.50 60.2 跨模型稳健增益 +0.6%

关键发现

  • 卡尔曼平滑与方差边际是长程鲁棒性的核心支撑:在所有测试模型中,加入卡尔曼滤波稳定带来 +0.6% 至 +0.8% 的全面增益。可视化表明,未经滤波的信号在镜头转换处频繁出现错误尖峰,造成剧烈的局部过度分配,而卡尔曼滤波成功滤除假阳性瞬态变动,并在高不确定性区域提供自适应安全容限。
  • 超长帧可扩展性呈现剪刀差优势:在 32 帧到 768 帧的连续扩展评测中,随着帧数增加,常规贪心/启发式剪枝方法的累积误差加速恶化,而 S3-Prune 随帧数增加表现出单调上升的性能,并在 512 至 768 帧的超长区间与现有方法拉开最大差距。
  • 即插即用且广泛兼容主流分割器:在仅保留 Pre-LLM 阶段且不加 LLM 内部重排的纯前置剪枝设定下,S3-Prune 依然比此前最强的前置算法 FastVid 提升 0.5%;将其直接嵌入 FastVid 或 HoliTom 的分段策略中,均能带来持续性能收益。

亮点与洞察

  • 将控制理论系统性引入长视频 Token 调度:不同于常规单纯堆砌启发式规则的做法,本文创新性地将 Token 预算分配看作噪声环境下的连续状态最优估计问题,利用卡尔曼滤波的闭式递归更新,以极低数学开销解决了长时序误差累积问题。
  • 双尺度动态互补与方差冗余机制:通过空间 Patch 不确定性与时段质心余弦跃迁的分层度量,不仅能灵敏感知细小动作,还能捕捉镜头切换,再用协方差项提供安全边际,设计构思精巧且严密自洽。
  • 超长时程架构解耦潜力:该稳定性感知预算分配逻辑完全独立于特定 VLM 架构与显式视频切片算法,可无缝迁移至端侧实时流媒体理解、长视频实时监控以及超长上下文具身智能体感知系统中。

局限与展望

  • 卡尔曼超参数预设依赖经验:状态转移协方差 \(Q\) 与观测噪声协方差 \(R\) 目前基于经验启发式预设,面对不同节奏或镜头切换频率剧烈的视频(如快节奏短视频 vs 平缓纪录片)时,无法实现完全自适应的噪声动态调优。
  • 极端快切镜头下的状态滞后风险:基于一阶马尔可夫连续性假设的卡尔曼系统在遭遇连续密集无规律蒙太奇剪辑时,可能产生轻微的状态响应滞后,导致极端转场瞬态的预算分配响应延迟。
  • 未来方向:探索基于视频元数据或多模态上下文的自适应噪声方差在线估计(如扩展卡尔曼滤波或无迹卡尔曼滤波),并将稳定性感知预算机制拓展至多模态生成或时序动作定位场景中。

相关工作与启发

  • vs FastVid (NeurIPS 2025):FastVid 通过动态帧间距离做分段与局部密度剪枝,但在面临局部瞬态噪声时缺乏时间维度的抗抖动机制,长时程下极易预算耗尽;S3-Prune 引入连续状态空间建模与卡尔曼增益,有效平抑噪声,且无需依赖复杂的全局离线分段索引。
  • vs HoliTom (NeurIPS 2025):HoliTom 依赖全局动态规划进行全局时序收缩与段内合并,预处理开销显著且难以用于在线因果流;S3-Prune 采用因果滑动最大值归一化,支持真正的前向在线流式预算决策,吞吐与时延优势显著。
  • vs VidCom2 (EMNLP 2025):VidCom2 仅基于单帧独特性进行离散单阶段自适应压缩,缺乏与文本查询的深度语义交互;S3-Prune 采用视觉粗筛结合 LLM 中间层注意力交互的两阶段策略,保留的 Token 语义密度与问答相关性大幅提升。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (巧妙将卡尔曼滤波控制论引入长视频 Token 自适应预算,角度新颖且机制完备)
  • 实验充分度: ⭐⭐⭐⭐⭐ (跨 4 个主流多模态骨干模型、7 大长视频理解基准,涵盖 32-768 帧长程扩展与详尽消融)
  • 写作质量: ⭐⭐⭐⭐⭐ (问题定义清晰锐利,数学推导与控制论动机自洽,实验分析层层递进)
  • 价值: ⭐⭐⭐⭐⭐ (为长视频大模型的端侧部署与超长序列推理提供了无需训练、即插即用的通用低开销解决方案)