跳转至

Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/cvsp-lab/SFPruner
领域: 多模态VLM / 模型压缩
关键词: 视觉词元剪枝, 高分辨率多模态大模型, 岭杠杆分数, 有向掩码, 单次前向推理

一句话总结

针对高分辨率 MLLM 中子集优化剪枝算法依赖迭代搜索导致严重时延瓶颈的问题,本文提出单次前向剪枝器 SFPruner,通过语义引导岭杠杆分数衰减全局协方差冗余,并结合排序有向掩码并行消除局部重叠,在保持高达 99.0% 相对精度的同时将词元选择耗时从 112.4 ms 压缩至 2.5 ms。

研究背景与动机

随着多模态大语言模型(MLLMs,如 LLaVA-NeXT 和 Qwen2.5-VL)向超高分辨率和长视频理解演进,动态分辨率切片和时空采样会导致单次前向产生数千乃至上万个视觉词元。由于 Transformer 自注意力机制的计算与内存复杂度随词元长度呈二次方增长,海量视觉词元带来了严重的端到端推理时延与显存开销。视觉词元剪枝(Visual Token Pruning)成为在进入大语言模型骨干前降低计算复杂度的关键无训练加速手段。

然而,现有视觉词元剪枝方法面临着鲜明的“速度与性能割裂”困境。一类是基于局部注意力和相似度排名的启发式方法(Heuristic Methods),这类方法推理开销虽小,但在复杂场景或激进压缩比下,无法显式建模词元之间的信息重叠,极易过度保留集中在局部显著区域的冗余词元,导致推理精度剧烈崩溃。另一类则是当前主流的子集优化方法(Subset-Optimization Methods,如基于行列式点过程 DPP、多样性最大化或最大权重独立集 MWIS 的算法),它们虽然能兼顾任务相关性与视觉多样性,但本质上都属于 NP-hard 组合优化问题,普遍依赖贪心迭代搜索(Greedy Search)完成逐个词元的状态更新与选择。当视觉词元规模从数百扩展至数千甚至上万时,迭代循环所引入的 CPU/GPU 序列依赖和内核启动开销呈线性甚至超线性激增,导致理论上的 FLOPs 计算量削减完全被繁重的词元选择自身耗时所吞噬。

本文的切入视角是:消除词元冗余不必依赖串行的组合子集搜索,而是可以通过代数重构将冗余抑制机制直接内嵌到单次并行打分空间中。核心 idea:将词元冗余建模解耦为协方差级的全局能量平抑与排序驱动的成对非对称抑制,利用语义引导岭杠杆分数消除全局主导方向偏置,并通过全并行张量有向掩码剔除局部相似重叠,实现单次前向(Single-Forward)无迭代的极速高效剪枝。

方法详解

整体框架

SFPruner 的整体流程输入为视觉编码器输出的视觉词元矩阵与文本指令嵌入,输出为剪枝后保留给大语言模型的高价值多样化词元子集。整个流水线无需任何多轮贪心迭代,全部由规整的并行矩阵运算组成,分为三个核心阶段:首先融合文本相关性与视觉全局注意力生成初始语义引导(Semantic Guidance);随后在特征空间构建特征协方差矩阵,结合岭正则化杠杆分数(SG-RLS)抑制高能量冗余子空间;最后基于协方差得分构建非对称有向掩码矩阵,使高分词元单向抑制相似低分词元,经过单次 Top-K 选出最终保留子集。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["视觉词元 $V$ 与指令文本 $q$"] --> B["语义引导融合<br/>文本相关度 + 视觉显著性"]
    B --> C["语义引导岭杠杆分数 SG-RLS<br/>特征协方差逆矩阵衰减全局能量"]
    C --> D["排序驱动有向掩码<br/>高优先级单向惩罚低分重叠词元"]
    D --> E["单次 Top-K 剪枝子集<br/>直接送入 LLM 解码推理"]

关键设计

1. 语义引导融合:结合指令对齐与固有视觉显著性 针对纯视觉压缩容易丢失任务相关细节、而纯指令驱动容易放大主导物体偏置的问题,该模块为每个视觉词元建立综合的基础重要性先验。设已进行 \(L_2\) 归一化的视觉词元矩阵为 \(V \in \mathbb{R}^{N \times D}\),文本投影嵌入为 \(q \in \mathbb{R}^{1 \times D}\)。文本相关度得分 \(S_{\mathrm{rel},i}\) 通过带温度系数 \(\tau\) 的余弦相似度 Softmax 计算: $\(S_{\mathrm{rel},i} = \frac{\exp(v_i q^\top / \tau)}{\sum_{j=1}^N \exp(v_j q^\top / \tau)}\)$ 同时从视觉编码器自注意力层提取固有视觉显著性 \(S_{\mathrm{attn},i}\)(若模型包含 CLS 词元则直接取其到各词元的注意力分布;若如 Qwen2.5-VL 无 CLS 则聚合全图词元间的自注意力作为代理)。将二者通过平衡权重 \(\alpha\) 进行线性融合并进行 Min-Max 归一化,得到数值稳定的基础语义引导得分 \(\tilde{S}_{\mathrm{guide},i}\)。

2. 语义引导岭杠杆分数:协方差级全局冗余衰减 传统子集方法通过逐步从残差子空间扣除已选特征来抑制冗余,引入了严重的逐步依赖。本文引入随机数值线性代数(RandNLA)中的岭杠杆分数(Ridge Leverage Score, RLS),全局度量词元在特征空间的独立性。定义特征协方差矩阵 \(C = V^\top V \in \mathbb{R}^{D \times D}\),词元 \(i\) 的岭杠杆分数为: $\(\ell_i = v_i (C + \lambda I_D)^{-1} v_i^\top\)$ 其中 \(\lambda\) 为微小岭正则化参数。\((C + \lambda I_D)^{-1}\) 能够显式衰减特征空间中高能量特征主特征方向。若大面积背景或常见图元在协方差空间高度重叠,其对应的投影方向特征值极大,逆矩阵运算会使其杠杆分数显著降低;相反,结构独特、表征稀疏的词元则获得较高得分。进一步地,本文将该结构得分与语义先验相乘:\(S_{\mathrm{SG\text{-}RLS},i} = \ell_i \tilde{S}_{\mathrm{guide},i}\)。这一乘积形式构成了软逻辑“与”门(soft-AND gate),唯有同时兼具特征结构独特性与任务相关性的词元才能获得高分,直接排除了结构独特但与任务无关的孤立噪声,以及语义相关但极度重复的冗余词元。更关键的是,借助 Woodbury 矩阵恒等式,当序列长度 \(N\) 远大于特征维度 \(D\) 时,求逆操作在 \(D \times D\) 矩阵上以 Cholesky 分解稳定求解(复杂度 \(O(ND^2)\)),彻底规避了高分辨率下对 \(N \times N\) 相似度矩阵求逆的瓶颈。

3. 排序驱动有向掩码:全并行非对称成对抑制 虽然 SG-RLS 解决了协方差级别的全局冗余,但仍可能存在局部空间语义高度重叠的双胞胎词元。常规贪心做法选出一个词元后在矩阵中手动屏蔽其邻域,本文提出 ranking-based directional masking,利用张量并行操作模拟竞争排他过程。计算所有词元对的余弦相似度矩阵 \(C_{\mathrm{sim}} = V V^\top \in \mathbb{R}^{N \times N}\)。基于 SG-RLS 阶段的初始重要性得分,构造严格上三角拓扑的有向掩码矩阵 \(M\): $\(M_{ij} = \mathbb{I}(S_{\mathrm{SG\text{-}RLS},j} > S_{\mathrm{SG\text{-}RLS},i})\)$ 该掩码保证了非对称竞争关系:只有得分更高的词元 \(j\) 才有资格对其下属的低分词元 \(i\) 施加抑制,反之绝不受罚。词元 \(i\) 遭受的有向抑制惩罚因子 \(P_i\) 定义为其与所有更高分竞争者之间的最大相似度衰减: $\(P_i = 1 - \max_j (M_{ij} C_{\mathrm{sim},ij})\)$ 因为对角线 \(M_{ii} = 0\),保证了 \(P_i \le 1\)。若低分词元与某个已占据生态位的高分词元高度重合,其惩罚项激增,最终得分 \(S_{\mathrm{final},i} = S_{\mathrm{SG\text{-}RLS},i} \cdot P_i\) 被大幅打压。整个过程仅由规整的矩阵乘法、逐元素逻辑比对和行最大值归约构成,无任何循环,最终直接通过单次 Top-K 选出词元。

实验关键数据

主实验

评估在 LLaVA-NeXT-7B、Qwen2.5-VL-7B 和 LLaVA-Video-7B 上展开。针对 Qwen2.5-VL-7B 的单序列密集分辨率场景,各主流剪枝方法的性能与选择时延如下表所示(在 RTX 4090 GPU 上同步 CUDA 测得):

模型配置 / 剪枝方法 TextVQA AI2D MME POPE MMStar Rel. (%) 词元选择耗时 (ms) ↓
Qwen2.5-VL-7B (Vanilla 100%) 85.3 80.8 2316.0 86.4 56.7 100.0 -
保留 40% (约 512 词元)
PruMerge (ICCV'25) 82.1 79.8 2287.0 86.0 55.6 98.1 1.2
VisionZip (CVPR'25) 82.6 79.5 2306.5 86.1 55.2 98.0 1.1
DivPrune (CVPR'25) 82.3 78.6 2230.6 84.5 54.7 97.0 23.1
CDPruner (NeurIPS'25) 83.7 79.6 2302.2 86.1 55.9 98.8 112.4
D2Pruner (AAAI'26) 83.2 82.9 2305.3 85.3 54.9 98.7 31.2
SFPruner (本文) 84.0 79.9 2319.3 86.5 55.9 99.0 2.5
保留 20% (约 256 词元)
PruMerge (ICCV'25) 74.7 77.2 2280.1 84.5 52.8 94.6 1.1
VisionZip (CVPR'25) 75.9 77.6 2276.5 84.5 53.5 95.1 1.1
DivPrune (CVPR'25) 76.5 76.6 2203.7 83.6 51.8 93.7 11.8
CDPruner (NeurIPS'25) 79.1 78.4 2264.5 84.9 53.4 96.2 56.7
D2Pruner (AAAI'26) 78.6 79.4 2280.5 83.0 52.1 95.3 18.9
SFPruner (本文) 79.8 78.3 2295.7 85.7 53.7 96.5 2.5

在极限分辨率压力测试中(Qwen2.5-VL,输入词元数 \(N = 9216\),\(D = 3584\),保留 30% 即约 2770 个词元),SFPruner 的剪枝耗时仅为 28 ms(Prefill 时延 1114 ms,显存 18432 MB);而 CDPruner 耗时 576 ms(Prefill 时延 1658 ms),DivPrune 耗时 458 ms(Prefill 时延 1547 ms)。SFPruner 真正将端到端整个 MME 数据集推理时间从 Vanilla 的 6101 秒大幅削减至 3601 秒。

消融实验

在 LLaVA-NeXT-7B 上(每张图保留 320 个词元)对打分指标与选择策略进行系统解构:

打分指标 (Scoring Metric) 选择策略 (Selection Strategy) GQA TextVQA POPE Rel. (%) 词元选择耗时 (ms) ↓
SG (\(S_{\mathrm{guide}}\)) Naive Top-K 60.3 57.8 85.5 96.9 0.7
SG-RLS (本文) Naive Top-K 60.5 58.1 86.1 97.6 2.2
SG (\(S_{\mathrm{guide}}\)) 顺序贪心搜索 (Sequential Search) 61.2 58.2 86.3 98.0 18.6
SG (\(S_{\mathrm{guide}}\)) 有向掩码 (Directional Masking) 61.2 58.3 86.4 97.9 0.8
SG-RLS (本文) 有向掩码 (Directional Masking) 61.5 58.3 86.7 98.3 2.3

关键发现

  • 消除循环是突破时延瓶颈的核心:CDPruner 等算法在保留 512 词元时耗时高达 112.4 ms,而保留 256 词元时耗时降为 56.7 ms,表现出强烈的词元数迭代线性依赖;而 SFPruner 在不同预算(512/256 词元)下选择时延恒定维持在 2.5 ms,完全摆脱了保留预算 \(K\) 的约束。
  • 协方差与成对抑制形成双重互补:单纯使用 SG-RLS 代替基础 SG 可使 Top-K 性能从 96.9% 提升至 97.6%;单纯引入有向掩码可将时延从贪心搜索的 18.6 ms 降至 0.8 ms 且精度不降(97.9% vs 98.0%);两者联合达到最佳的 98.3%,证明了全局能量平抑与局部空间排他的互补增益。
  • 激进压缩与极端尺度下优势更突出:在多帧视频场景(LLaVA-Video)和 9216 词元的超高分辨率测试中,随着词元基数扩大,迭代式优化方法的选择耗时迅速放大到秒级,反噬计算收益;SFPruner 在超长序列下仅需 28 ms 剪枝,端到端加速比显著。

亮点与洞察

  • 将组合搜索代数化重构:巧妙利用 RandNLA 领域的岭杠杆分数(RLS)通过特征协方差逆矩阵直接平抑主导冗余特征,将原本需要多次贪心迭代更新的子空间去相关操作一步完成。
  • 非对称有向掩码打破贪心循环:设计严格依赖先验排名的上三角有向掩码矩阵,使信息重叠的抑制变成纯张量单向并行最大值削减,保留了子集优化的多样性优势却消除了内核循环依赖。
  • Dual Woodbury 恒等式优化工程复杂度:在面对高分辨率 \(N > D\) 时,在 \(D \times D\) 协方差空间以 Cholesky 分解求解逆矩阵,使计算复杂度收敛在 \(O(ND^2)\),确保了超大规模输入下的显存友好性与数值稳定性。

局限与展望

  • 作者承认的局限:在无独立文本编码器或无统一全局 CLS 词元的模型(如 Qwen2.5-VL)中,语义引导完全退化为纯视觉全图注意力代理,缺少指令引导可能导致对细粒度纯文本提问的敏感度略微减弱。
  • 深入洞察的局限:特征协方差矩阵 \(C = V^\top V\) 假设词元间冗余主要由线性相关性主导,对于高度复杂的非线性流形冗余可能建模不够完备;此外超参数 \(\alpha\) 与 \(\lambda\) 仍需在经验区间内调整。
  • 未来改进思路:探索结合局部空间网格拓扑的稀疏有向掩码计算,将 \(O(N^2)\) 的成对相似度矩阵进一步压缩至局部窗口或线性复杂度,适配百万级输入词元的超长视频流模型。

相关工作与启发

  • vs CDPruner (NeurIPS 2025):CDPruner 采用条件多样性最大化,在挑选词元时依赖多轮贪心迭代,在 Qwen2.5-VL 512 词元时耗时 112.4 ms;SFPruner 采用单次前向的 SG-RLS 与有向掩码,在相同精度下将耗时削减至 2.5 ms(45倍加速)。
  • vs DivPrune (CVPR 2025):DivPrune 使用基于距离的多样性最大化贪心构建子集;SFPruner 通过协方差逆矩阵抑制全局特征能量并并行施加局部惩罚,有效避免了长视频推理中的百毫秒级搜索开销。
  • vs VisionZip (CVPR 2025) / PruMerge+ (ICCV 2025):启发式合并与剪枝方法虽然速度极快(约 1 ms),但在 20% 甚至更低留存率的激进压缩下精度出现明显滑坡;SFPruner 保持极低时延的同时显著缩小了与全量模型的精度差距。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 创造性地将随机数值线性代数的岭杠杆分数与非对称有向掩码引入视觉词元剪枝,成功免除迭代优化。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖图像多 patch、单序列连续超长图像、多帧视频以及 9K 极限序列压力测试,主实验、消融与硬件底层剖析扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机清晰,数学形式化表达严密,图表对比直观明确。
  • 价值: ⭐⭐⭐⭐⭐ 直击高分辨率视觉语言模型端到端推理时延的隐形瓶颈,极具工程落地与学术借鉴价值。