跳转至

SWIFT: Spatial-Window Integrated Frequency-aware Token Pruning for Efficient MLLMs on Edge Devices

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/damo-lgl/SWIFT
领域: 模型压缩
关键词: 多模态大模型、Token剪枝、频域残差、空间窗口、端侧高效推理

一句话总结

针对传统注意力驱动 Token 剪枝导致高频细节丢失与空间坍缩的问题,SWIFT 通过矩阵分解提取高频残差指标并结合局部空间窗口正则化,在边缘设备上实现高达 75% 压缩率下的近无损多模态推理与 2.66 倍解码加速。

研究背景与动机

多模态大语言模型(MLLMs)在图像细粒度理解与视觉推理任务中表现出色,但高分辨率图像带来的成千上万个视觉 token 导致自注意力计算量呈二次方膨胀,在端侧边缘设备(如边缘计算模组、嵌入式机器人系统)上引发严重的显存带宽瓶颈与首次 Token 生成延迟(TTFT)。为了降低视觉 token 的冗余度,现有剪枝方案主要分为基于训练与免微调两大阵营。基于训练的方法(如引入重采样器或微调对齐模块)不仅需要高昂的重训练开销,而且一旦确定结构便难以动态调整压缩率;而现有免训练方法(如 FastV、SparseVLM)普遍依赖“注意力权重即重要性”的先验假设,直接依据 Softmax 注意力分值进行全局自上而下的稀疏化。

然而,从信号处理与频域视角重新审视自注意力机制,可以发现深层网络中的自注意力本质上扮演了强烈的“低通滤波器”角色。随着网络层数加深,注意力矩阵逐渐趋向于行均值归一化矩阵,主导特征空间的是平滑的低频直流(DC)分量(如大面积背景),而表征边缘、纹理等关键细节的高频交流(AC)分量被严重压制。更糟糕的是,注意力机制中普遍存在的“注意力汇聚”(Attention Sinks)使得大量注意力权重被分配给信息量贫乏的背景或特殊 token。依赖传统注意力分数进行剪枝,会误删携带关键高频几何细节的视觉 token,导致特征过度平滑;同时全局无序剪枝打破了图像固有的二维空间拓扑结构,造成局部感知视野的空洞与盲区,进而诱发严重的物体幻觉。

因此,在端侧受限的计算算力下,打破传统注意力评分的局限,显式引入频域高频成分保护与局部空间连续性约束,成为实现高效且高保真视觉压缩的核心突破口。核心 idea:将多模态视觉 Token 压缩重构为“频域显著性提取 + 局部空间正则”双流机制,利用无须 FFT 的注意力矩阵低秩分解剥离低频基底以锚定高频残差,并映射回 2D 空间窗口独立 Top-K 采样,在消除特征过度平滑的同时杜绝空间结构坍缩。

方法详解

整体框架

SWIFT 是一个即插即用、无需训练的多模态大模型推理加速框架,通常在 LLM 解码器预填充(prefill)阶段的浅层(例如第 2 层与第 3 层之间)介入生效。其整体流程分为三个主要步骤:首先,利用当前层的注意力矩阵进行快速分解,滤除均匀低频基底,计算每个视觉 token 的频域高频贡献度(Frequency-Aware Indicator, FAI);其次,将原始 1D 视觉序列重排恢复为二维网格空间窗口,并将频域指标与语义注意力引导(Attention Guidance, AG)结合构建双流混合评分;最后,在各个局部空间窗口内执行独立的局部 Top-K 筛选(Spatial-Window Integration, SWI),确保关键语义/纹理保留的同时维持全局视场均匀性,输出压缩后的视觉 token 序列送入后续 Transformer 层。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入视觉 Token 序列 X_v 与注意力矩阵 A"] --> B["频域感知指标(FAI):矩阵低秩分解剥离低频"]
    B --> C["混合评分融合:频域残差与注意力排名加权"]
    C --> D["空间窗口集成(SWI):2D 网格划分与局部 Top-K 保留"]
    D --> E["输出压缩后的精简视觉 Token 序列"]

关键设计

1. 频域感知指标(FAI):利用矩阵低秩分解显式剥离低频平滑基底 传统的频域变换(如二维快速傅里叶变换 FFT)在推理期计算代价较高,难以嵌入毫秒级推理流。为以极低开销捕获高频分量,SWIFT 采用基于注意力矩阵分解的代数逼近方案。自注意力的极端低通特性表现为完全均匀的均值矩阵,因此将原始注意力矩阵 \(A\) 拆解为完全均匀的低频直流基底 \(A^{LP}\) 与高频交互残差 \(A^{HP}\): $\(A^{LP} = \frac{1}{n} \mathbf{1}\mathbf{1}^T, \quad A^{HP} = A - A^{LP}\)$ 其中 \(n\) 为序列总长度,\(\mathbf{1}\mathbf{1}^T\) 为全 1 矩阵。对于第 \(k\) 个视觉 token,其对全图高频分量的全局贡献指标 \(I_{freq}(k)\) 定义为高频残差矩阵第 \(k\) 列的均值: $\(I_{freq}(k) = \frac{1}{n} \sum_{q=1}^{n} A_{q,k}^{HP}\)$ \(I_{freq}(k)\) 直观反映了该 token 偏离全图均匀分布的程度:若 \(I_{freq}(k) > 0\),说明该 token 获得了显著高于平均水平的交互聚焦,对应于图像中的主要轮廓、细密纹理或主体前景(高频 token);若 \(I_{freq}(k) < 0\),说明其受关注度低于均匀背景,对应于大面积单调平滑区域(低频冗余 token)。该计算仅涉及列求和与标量减法,在 GPU 上单次延迟仅约 0.5 ms,以极低代价充当了深层特征过度平滑的“细节锚点”。

2. 混合评分机制:语义聚焦点与高频纹理细节的互补协同 纯频域指标虽能保住边缘与纹理,但容易对图像中无文本相关性但纹理丰富的复杂背景产生误判;而纯注意力分数则受困于“注意力汇聚”现象,偏向低频主体而丢弃关键细粒度支撑点。为了使保留的 token 兼顾大模型的语义偏好与底层视觉的几何完整性,SWIFT 引入基于秩次归一化的混合评分函数: $\(\mathrm{Score}(x) = (1 - \lambda) \cdot \mathrm{Rank}(I_{freq}(x)) + \lambda \cdot \mathrm{Rank}(I_{attn}(x))\)$ 其中 \(I_{attn}(x)\) 来自模型浅层(如第 2 层)生成的自注意力权重,\(Rank(\cdot)\) 将绝对数值转化为相对排序名次以消除数值尺度的不平衡,\(\lambda\) 为平衡因子。注意力分数回答了“看哪里(语义定位)”,而频域分数确保了“看清楚什么(高频细节)”。实验证实当 \(\lambda \approx 0.5\) 时达到最优平衡,表明语义指引与高频结构在多模态视觉表达中具有天然的对等互补性。

3. 空间窗口集成(SWI):局部窗口约束杜绝全图空间结构坍缩 直接使用全局排序剪枝会在特征图上造成灾难性的“空间盲区”:模型倾向于将保留配额全部集中于某一局部高响应目标,导致图像其他区域被整片剔除,从而严重破坏了空间连续性,并在多目标问答与目标存在性判断中诱发严重的幻觉。SWIFT 引入空间窗口正则策略:首先将 1D 展平的视觉 token 序列依据其位置编码重新映射回 2D 物理空间网格;随后将全图划分为多个互不重叠的局部空间窗口(例如 \(2 \times 2\)\(4 \times 4\) 网格),并在每个局部窗口内根据混合评分独立执行局部 Top-K 截断与保留。这种强制性的局部保底机制确保了采样点在全图视场内的空间均匀分布,有效维持了整体上下文拓扑,从几何结构层面彻底抑制了因局部感受野缺失引发的物体幻觉。

实验关键数据

主实验

论文在 LLaVA-1.5 (7B/13B) 与 Qwen2.5VL-3B 模型上,跨越 8 个主流多模态基准(MMB、MMStar、MME、OKVQA、POPE、MMMU、Nocaps、Flickr30k)进行了全面评测。在 50% 压缩率下性能几乎无损;在 75% 极高压缩率下依然大幅超越传统 SOTA 剪枝方案。

模型与方法 压缩率 (Tokens) MMB MMStar MME POPE MMMU Nocaps Flickr30k
LLaVA-1.5-7B
Vanilla (上限) 0% (576) 64.1 33.8 1610 86.4 36.3 105.6 84.4
FastV 50% (288) 64.2 33.3 1599 83.7 35.3 104.4 84.3
SWIFT (Ours) 50% (288) 64.5 34.0 1607 85.2 35.5 105.4 84.5
FastV 75% (144) 57.9 32.1 1588 75.3 35.2 99.2 79.1
SWIFT (Ours) 75% (144) 62.6 33.0 1607 81.4 34.7 102.7 83.3
FastV 90% (58) 50.6 30.6 1448 66.3 35.1 74.7 55.1
SWIFT (Ours) 90% (58) 57.4 31.1 1540 75.3 35.4 89.1 65.0
Qwen2.5VL-3B
Vanilla (上限) 0% (900) 77.8 56.4 1918 87.0 47.6 105.8 85.7
FastV 50% (450) 76.3 54.4 1848 87.3 46.5 103.8 83.4
SWIFT (Ours) 50% (450) 77.3 55.4 1913 86.8 46.9 104.7 84.3
FastV 75% (225) 71.4 48.6 1809 84.3 46.3 97.0 77.0
SWIFT (Ours) 75% (225) 74.0 53.4 1843 84.7 45.3 100.4 80.0

在部署与端侧效率方面,以 RTX 2080 测试 Qwen2.5VL-3B(输入分辨率 \(840 \times 840\)): - 50% 压缩:首字时间(TTFT)降低 14.9%,KV Cache 显存缩减 46.05%,单步解码延迟从 7.74 ms 降至 3.69 ms,获得 2.10× 加速比。 - 75% 压缩:TTFT 从 2.61 s 降至 2.01 s(降低 23.0%),KV Cache 缩减 69.07%,单步解码延迟降至 2.91 ms,获得 2.66× 加速比,且模块额外引入的预填充延迟仅占整体 TTFT 的 1.72%,峰值显存增量为 0 MB。

消融实验

基于 Qwen2.5VL-3B 评估核心模块(空间窗口集成 SWI、频域感知指标 FAI、语义注意力引导 AG)在不同剪枝率下的贡献(以 MME、POPE 幻觉指标、Nocaps 细粒度描述为例):

剪枝率 配置 SWI FAI AG MME POPE Nocaps Flickr30k
0% 基线原始模型 - - - 1918 87.0 105.8 85.7
50% w/o SWI (全局排序) 1836 83.3 103.7 83.2
w/o FAI (去除频域) 1890 83.8 105.1 83.5
w/o AG (去除注意力) 1900 84.2 104.5 83.6
SWIFT 完整模型 1913 86.8 104.7 84.3
75% w/o SWI (全局排序) 1708 70.9 68.6 63.3
w/o FAI (去除频域) 1795 77.6 94.8 74.1
w/o AG (去除注意力) 1817 73.7 98.1 73.9
SWIFT 完整模型 1843 84.7 100.4 80.0

关键发现

  • SWI 是高压缩率下的防崩溃核心:在 75% 甚至 90% 极端压缩时,移除 SWI 导致 POPE 幻觉分数从 84.7 暴跌至 70.9,Nocaps 从 100.4 断崖式跌落至 68.6。这证明全局无约束剪枝会彻底破坏图像局部感受野,使得模型丢失周围上下文,引发灾难性幻觉。
  • FAI 有效缓解深层特征平滑:频谱分析显示 FastV 在深层(如第 31 层)高频成分急剧衰减,而 SWIFT 在大于 \(0.25\pi\) 的中高频带具有高得多的能量保真度。在细粒度图像描述任务(Nocaps、Flickr30k)中,缺少 FAI 会使性能显著下降,证明高频残差指标对于细长目标(如绳索、文字边缘、材质纹理)的保留至关重要。
  • 参数稳健性:平衡权重 \(\lambda\) 在不同架构(LLaVA vs Qwen2.5-VL)和不同图像分辨率(840 vs 1120)下均在 \(\lambda \approx 0.5\) 处稳定取得峰值性能,呈现出稳固的对等互补性。

亮点与洞察

  • 将注意力机制重构为频域滤波器:打破了传统的启发式注意力重要性认知,从信号处理的滤波视角解释了自注意力天然会导致特征过度平滑并抹杀高频细节,立论深刻且具理论说服力。
  • 免 FFT 的极简高频残差逼近:通过直接从注意力矩阵中减去全 1 均值矩阵构造低频基底,巧妙利用初等矩阵列均值计算高频偏离度,不仅无额外参数,而且耗时仅 0.5 ms,极具端侧工程复用价值。
  • 空间窗口硬约束抗幻觉:敏锐指出了单纯分数剪枝带来的“空间盲区”是 MLLM 产生幻觉的重要诱因,采用规整的局部窗口保留兜底,结构简单却显著稳定了物体存在性评估。

局限与展望

  • 窗口大小为静态超参数:当前空间窗口的划分网格(如固定大小划分)为人工设定,对于极端非均匀分辨率(如极端宽幅图像或包含大量密集微小物体的图表)可能无法自适应调整窗口尺度。
  • 未结合跨层动态剪枝:SWIFT 目前主要在固定的第 2-3 层单次介入压缩,未来可探索在多层解码器中依据任务难度实现渐进式、动态分层的自适应 Token 稀疏化。
  • 多图与视频维度的扩展:当前重点针对单图 MLLM,在时序视频或超长多图对话中,如何在三维时空窗口中同步保留时序高频运动与静态纹理,仍待进一步验证。

相关工作与启发

  • vs FastV [Chen et al., 2024]: FastV 依赖注意力权重进行全局贪心剔除;本文揭示了注意力权重的低通滤波与注意力汇聚弊端,通过 FAI 提取高频残差并配合 SWI 局部窗口采样,在 75% 剪枝下全面领先 FastV 3-6 个百分点。
  • vs SparseVLM [Zhang et al., 2024]: SparseVLM 依赖文本作为查询引导视觉筛选;本文证明在无需额外文本交互与繁琐对齐的情况下,纯利用图像自注意力频域残差与空间规则即可获得更稳健的端侧泛化性能。
  • vs ToMe [Bolya et al., 2022]: ToMe 依赖特征相似度进行两两合并,其均值聚类过程进一步加剧了低通滤波效应;SWIFT 采用显式保留高频残差的硬采样,从机制上避免了纹理模糊。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [从频域低通滤波视角重新审视自注意力剪枝,提出极简低秩残差提取方法,视角新颖且动机扎实]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3 大模型、8 个代表性基准、深入的消融实验、频谱能量图与真机端侧测速]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,三段式散文论述流畅,图表与符号设计极为规范]
  • 价值: ⭐⭐⭐⭐⭐ [端侧边缘计算部署实用性极强,计算开销接近于 0,带来高达 2.66 倍推理加速与近 70% 显存节省]