Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models¶
会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/cau-hai-lab/PORTA.git
领域: 多模态 VLM / 模型压缩
关键词: 视觉语言模型剪枝 / 免重训练 / 任务不可知 / 激活方差 / 自适应稀疏度分配
一句话总结¶
针对视觉语言模型剪枝中现有方法依赖 LLM 激活幅度离群值导致模态偏置与校准敏感的缺陷,本文提出 PORTA 框架,利用跨模态稳定的特征激活方差度量表示效用,并结合基于输出特征空间变异性的自适应分层稀疏度分配,实现仅凭通用数据剪枝一次即可免微调零样本泛化至分类、检索和问答等异构下游任务。
研究背景与动机¶
视觉语言模型(VLMs,如 CLIP、BLIP、Qwen2-VL)通过在海量图文对上的大规模多模态预训练,建立了统一的跨模态表示空间,在零样本图像分类、跨模态检索和视觉问答中展现了卓越的泛化能力。然而,模型参数量与计算开销的爆发式增长使得 VLM 部署于边缘设备或实时系统面临严峻瓶颈。后训练单次剪枝(One-Shot Pruning)能够在不改变模型架构的前提下大幅削减冗余权重,因而成为轻量化部署的关键路径。但在多模态场景下,理想的剪枝策略应当是“任务不可知(Task-Agnostic)”的——即仅利用少量通用校准样本单次完成剪枝,模型即可即插即用部署于未知的多种下游任务,无需针对每个新任务重新采集特定数据再次剪枝或微调重训练。
现有多模态剪枝方法主要面临两大核心矛盾与技术瓶颈:其一,主流剪枝准则(如 Wanda、SparseGPT)普遍沿袭大语言模型的假设,以激活幅度的范数或极值(Outliers)来衡量权重重要性。然而,文本 Transformer 中显著的极端离群值在视觉 Transformer(ViT)中并不存在或表现形态迥异,导致幅度统计量在层间与模态间呈现巨大的离散度差异(例如文本层幅度极差高达 7.11 而视觉层仅 3.73)。这种对模态特定激活分布特性的强依赖引入了严重的模态偏置,使剪枝过程不均衡地向视觉或语言单侧分支倾斜。其二,现有重要性估计极度敏感于校准数据的选取,若缺失特定下游任务的数据对齐,剪枝模型在跨模态泛化时会出现剧烈的性能悬崖;而少数 VLM 专用方案(如 Multiflow)仍需下游微调,无法做到免重训练即插即用。
本文的切入角度是重新审视表征效用与激活统计特性的内在关联。实验表明,相较于数值范围剧烈波动的激活幅度,特征维度的激活方差在不同模态与网络层间展现出极其稳健的分布一致性,能够无偏地量化特征在更宽泛输入下的全局参与度与表示容量贡献。核心 idea:本文提出免重训练任务不可知剪枝框架 PORTA,构建以激活方差与权重幅度乘积为基础的无偏特征重要性度量,并推导基于输出特征协方差空间的层自适应稀疏度分配准则,仅需通用数据单次剪枝即可稳健迁移至异构多模态任务。
方法详解¶
整体框架¶
PORTA 针对视觉语言模型多模态异构、跨任务泛化的特性,构建了“统计量估计 \(\to\) 模态不可知权重评分 \(\to\) 输出变异性分层稀疏度分配 \(\to\) 一次性掩码剪枝”的完整闭环。整体流程无需下游标签与重训练,仅以通用图文样本为输入,首先在前向传播中统计各层输入特征沿 token/patch 维度的激活方差,随后通过方差加权绝对权重建立无偏重要性矩阵;同时利用协方差迹推导每层输出特征空间的表征容量得分,自适应计算各层稀疏度配额,最终一次性剪枝生成可泛化模型。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["通用图文校准输入"] --> B["激活方差特征效用度量<br/>跨 token/patch 统计无偏方差"]
B --> C["模态不可知权重评分<br/>方差广播与权重绝对值相乘"]
B --> D["输出空间变异性评估<br/>输入协方差投影与迹归一化"]
D --> E["自适应分层稀疏度分配<br/>全局目标约束下重加权配额"]
C --> F["单次免重训练掩码剪枝"]
E --> F
F --> G["多下游任务零样本即插即用部署"]
关键设计¶
1. 激活方差特征效用度量:消除模态激活极值带来的跨模态偏置 传统基于 Wanda 等幅度范数的重要性度量高度依赖输入激活值的大小。但在 VLM 中,文本分支存在因注意力收敛形成的极大离群激活值,而视觉分支的特征分布相对平缓,盲目套用幅度准则会导致视觉分支被错误地赋予更低重要性而遭到过度剪裁。针对这一痛点,PORTA 引入输入特征的激活方差来量化其表示效用。对于某一层输入激活张量 \(X \in \mathbb{R}^{B \times T \times D_{\text{in}}}\)(其中 \(B\) 为 batch 维度,\(T\) 为 token/patch 序列长度,\(D_{\text{in}}\) 为输入通道数),第 \(j\) 个输入特征的变异性定义为: $\(v_j = \mathrm{Var}_{b,t}\left(X_{b,t,j}\right), \quad j = 1, \dots, D_{\text{in}}\)$ 该设计的核心机理在于:低方差特征仅在极狭窄的局部输入或特定上下文产生恒定响应,表征冗余度高;而高方差特征能够在不同上下文、多样化图文输入下呈现出广阔的动态波动,体现出强烈的全局表征参与度和泛化价值。实证分析证实,方差统计在视觉与语言层间展现出均匀的极差波动范围,从而天然排除了模态量纲与离群值的干扰。
2. 模态不可知权重评分:融合表征动态波动与静态连接强度 获得各输入维度的表示效用向量后,需要将其与神经网络原本的参数拓扑相融合,以保留重要连接。PORTA 避免了复杂二阶 Hessian 矩阵求逆的高昂开销,将特征方差向量 \(v \in \mathbb{R}^{D_{\text{in}}}\) 沿输出维度进行广播,并与权重矩阵 \(W \in \mathbb{R}^{D_{\text{out}} \times D_{\text{in}}}\) 的绝对值进行逐元素相乘,得到最终的权重重要性评分矩阵 \(S\): $\(S_{i, j} = v_j \cdot \left| W_{i, j} \right|, \quad i = 1, \dots, D_{\text{out}}, \; j = 1, \dots, D_{\text{in}}\)$ 公式中 \(\left| W_{i, j} \right|\) 表征静态参数规模,而 \(v_j\) 则表征对应输入维度的动态表征贡献容量。两者的乘积同时兼顾了连接本身的绝对强度与其所承载特征的信息丰度。这一设计无需复杂的反向传播或梯度计算,在保持单次快速前向统计效率的同时,消除了对特定下游任务校准集的过拟合隐患。
3. 输出空间变异性评估:量化不同网络层的表征信息容量 深层网络中各层所处深度与模态融合角色差异显著,采用均匀层稀疏度(Uniform Sparsity)极易过剪语义关键层而欠剪低层浅层,引发性能断崖。PORTA 从理论上建立输出特征空间变异性模型。对于线性层 \(Y = X W^\top\),设输入 token \(x_t\) 满足零均值分布且具有输入协方差 \(\Sigma_X = \mathbb{E}[x_t^\top x_t]\)。对于第 \(o\) 个输出通道 \(y_{:, o} = X w_o^\top\),其在序列维度的方差展开为 \(w_o \Sigma_X w_o^\top\)。为消除输入量纲差异并在各层之间实现公平比较,PORTA 对协方差进行迹归一化 \(\widehat{\Sigma}_X = \frac{\Sigma_X}{\operatorname{Tr}(\Sigma_X)}\),并定义网络层的表征容量评分: $\(s_{\text{layer}} = \frac{1}{D_{\text{out}}} \sum_{o=1}^{D_{\text{out}}} w_o \widehat{\Sigma}_X w_o^\top = \frac{1}{D_{\text{out}}} \operatorname{Tr}\left(W^\top W \widehat{\Sigma}_X\right)\)$ 为降低直接维护全协方差矩阵的高内存与高计算复杂度,PORTA 采用对角协方差近似 \(\Sigma_X \approx \operatorname{diag}(v_1, \dots, v_{D_{\text{in}}})\)。此时无需额外计算,可直接复用第一步中已求得的特征方差 \(v_j\),将公式化简为: $\(s_{\text{layer}} = \frac{\sum_{j=1}^{D_{\text{in}}} v_j \| W_{:, j} \|_2^2}{D_{\text{out}} \sum_{k=1}^{D_{\text{in}}} v_k}\)$ 该式本质上是按特征表征效用 \(v_j\) 加权的权重列向量二范数平均,直观反映了高价值输入维度映射到输出空间的总能量。
4. 自适应分层稀疏度分配:全局约束下的非均匀平滑配额调节 在获得所有候选网络层 \(\mathcal{L}\) 的重要性得分 \(\{s_i\}_{i \in \mathcal{L}}\) 后,PORTA 执行全局稀疏度动态配额算法。首先计算各层的重要性占比 \(p_i = s_i / \sum_{k \in \mathcal{L}} s_k\);其次定义各层原始剪枝倾向得分为 \(u_i = (1 - p_i)^\alpha\),其中超参数 \(\alpha > 0\) 用于控制层间稀疏度分配的陡峭程度;接着根据各层实际参数量 \(w_i\) 计算加权平均剪枝得分 \(\bar{u} = (\sum_i w_i u_i) / \sum_i w_i\);最终令尺度系数 \(C = S / \bar{u}\)(\(S\) 为预设的目标全局稀疏度),输出各层精确剪枝比例 \(r_i = C \cdot u_i\)。此算法严格保证了全局修剪参数量精准契合总体压缩比,同时使表征容量大、输出变异性高的深层模块分配更低的稀疏度,保留关键语义抽象能力。
实验关键数据¶
主实验¶
在 OpenAI CLIP-ViT-bigG 架构上,将 PORTA 与 Wanda、SparseGPT、ECoFLaP、Multiflow 四种主流剪枝基线在图文检索(MSCOCO)和图像分类(CIFAR-10、CIFAR-100、ImageNet-1K、Flowers-102)基准上进行零样本性能评测。
| 稀疏度 | 方法 | MSCOCO TR@1 | MSCOCO TR@5 | MSCOCO IR@1 | MSCOCO IR@5 | CIFAR-10 Acc | CIFAR-100 Acc | ImageNet Acc | Flowers102 Acc |
|---|---|---|---|---|---|---|---|---|---|
| 0% | Dense 原模型 | 68.56 | 87.70 | 52.28 | 76.09 | 97.04 | 87.50 | 78.45 | 80.19 |
| 55% | Wanda | 66.30 | 86.44 | 48.62 | 73.05 | 96.12 | 79.92 | 69.50 | 67.72 |
| 55% | SparseGPT | 65.78 | 86.44 | 48.57 | 73.29 | 95.07 | 79.95 | 68.61 | 65.16 |
| 55% | ECoFLaP | 51.14 | 76.04 | 33.14 | 58.44 | 80.69 | 51.79 | 43.11 | 30.00 |
| 55% | Multiflow (零样本) | 0.02 | 0.12 | 0.02 | 0.12 | 9.25 | 1.23 | 0.16 | 1.50 |
| 55% | PORTA (本文) | 66.28 | 87.00 | 48.70 | 73.02 | 95.58 | 80.27 | 70.29 | 68.73 |
| 60% | Wanda | 59.78 | 82.82 | 42.55 | 68.01 | 93.20 | 70.28 | 57.35 | 51.48 |
| 60% | SparseGPT | 57.52 | 81.88 | 41.77 | 66.97 | 95.16 | 74.23 | 55.26 | 41.37 |
| 60% | ECoFLaP | 35.44 | 60.56 | 19.12 | 39.46 | 57.98 | 32.60 | 25.73 | 14.21 |
| 60% | Multiflow (零样本) | 0.04 | 0.16 | 0.01 | 0.08 | 9.79 | 1.10 | 0.08 | 0.49 |
| 60% | PORTA (本文) | 60.14 | 83.04 | 43.11 | 68.18 | 95.06 | 75.59 | 59.66 | 55.50 |
| 65% | Wanda | 27.30 | 51.04 | 16.96 | 35.61 | 69.81 | 28.86 | 30.06 | 17.30 |
| 65% | SparseGPT | 25.10 | 49.10 | 15.93 | 35.00 | 86.35 | 49.23 | 25.96 | 12.09 |
| 65% | ECoFLaP | 13.60 | 29.62 | 7.22 | 18.32 | 33.18 | 16.70 | 10.20 | 6.66 |
| 65% | Multiflow (零样本) | 0.02 | 0.12 | 0.02 | 0.10 | 8.90 | 0.96 | 0.12 | 0.81 |
| 65% | PORTA (本文) | 28.14 | 51.26 | 17.31 | 37.32 | 90.49 | 62.29 | 31.38 | 18.27 |
在生成式与对话型多模态模型上,以 Qwen2-VL 为底座在 ScienceQA 基准(50% 稀疏度)下测试零样本视觉问答能力:
| 稀疏度 | 方法 | 自然科学 (NAT) | 社会科学 (SOC) | 语言理解 (LAN) | 纯文本题 (TXT) | 图像图表题 (IMG) | 无上下文题 (NO) | G1-6 低年级 | G7-12 高年级 | 平均准确率 |
|---|---|---|---|---|---|---|---|---|---|---|
| 0% | Dense 原模型 | 60.66 | 67.27 | 60.00 | 62.37 | 60.98 | 73.77 | 65.57 | 55.24 | 61.87 |
| 50% | Wanda | 55.01 | 47.35 | 55.09 | 56.03 | 49.97 | 75.40 | 55.80 | 49.17 | 53.43 |
| 50% | SparseGPT | 49.42 | 49.04 | 55.00 | 53.16 | 47.74 | 67.21 | 53.56 | 45.74 | 50.78 |
| 50% | ECoFLaP | 51.33 | 50.95 | 52.19 | 52.61 | 49.88 | 63.93 | 54.52 | 46.01 | 51.47 |
| 50% | Multiflow | 51.95 | 47.80 | 54.18 | 54.55 | 47.89 | 73.77 | 53.92 | 47.59 | 51.66 |
| 50% | PORTA (本文) | 55.23 | 50.05 | 55.81 | 56.50 | 51.46 | 72.13 | 56.82 | 49.76 | 54.30 |
消融实验¶
为解耦重要性评分指标与稀疏度分配策略的各自贡献,在 CLIP 60% 稀疏度下进行交叉组合消融分析:
| 稀疏度 | 重要性评分 (Score) | 稀疏度分配策略 (Ratio) | CIFAR-10 Acc (%) | CIFAR-100 Acc (%) | ImageNet-1K Acc (%) | 说明 |
|---|---|---|---|---|---|---|
| 60% | Wanda (幅度) | Uniform (均匀) | 93.20 | 70.28 | 57.35 | 传统幅度基线 |
| 60% | PORTA (方差) | Uniform (均匀) | 94.91 | 74.45 | 59.35 | 替换为方差评分,各数据集全面增益 |
| 60% | Wanda (幅度) | Multiflow | 10.03 | 1.58 | 0.11 | Multiflow 分配未微调下失效 |
| 60% | PORTA (方差) | Multiflow | 10.07 | 1.40 | 0.11 | 同上 |
| 60% | Wanda (幅度) | ECoFLaP | 93.52 | 71.16 | 61.14 | 零阶梯度自适应分配 |
| 60% | PORTA (方差) | ECoFLaP | 93.57 | 71.19 | 61.33 | 搭配方差评分略有微增 |
| 60% | Wanda (幅度) | PORTA (输出方差) | 94.62 | 74.29 | 59.04 | 保持幅度评分下引入 PORTA 分配,显著改善 |
| 60% | PORTA (方差) | PORTA (输出方差) | 95.06 | 75.59 | 59.66 | 完整组合,取得最高综合性能 |
针对输出协方差中零均值假设与对角协方差近似的消融检验(CLIP 60% 稀疏度检索评测):
| 配置 | MSCOCO TR@1 | MSCOCO TR@5 | MSCOCO IR@1 | MSCOCO IR@5 | 平均召回 (Avg) |
|---|---|---|---|---|---|
| PORTA 完整方案(对角近似 + 零均值) | 60.14 | 83.04 | 43.11 | 68.18 | 63.62 |
| 去掉零均值假设(减去均值中心化) | 60.20 | 83.12 | 43.11 | 68.12 | 63.64 |
| 去掉对角化近似(完整全协方差矩阵) | 60.70 | 82.80 | 43.13 | 68.27 | 63.73 |
关键发现¶
- 高稀疏度优势显著:在 65% 极高稀疏度下,PORTA 相比 Wanda 和 SparseGPT 分别带来 21.5% 与 12.6% 的综合指标相对提升;例如 ImageNet 准确率达到 31.38%,大幅领先 SparseGPT(25.96%)和 Wanda(30.06%),有效阻止了常规剪枝方法的崩溃式下滑。
- 校准数据鲁棒性极高:在更换校准集来源(Flickr30K、MSCOCO、Visual Genome)时,Wanda 与 SparseGPT 的下游准确率波动幅度高达 5%,而 PORTA 性能波动稳定在 1% 以内;校准样本数量从 24 增加到 211 时,PORTA 在极小样本规模下即可快速饱和并维持平坦的高性能曲线。
- 计算开销极低:在 CLIP 完整剪枝耗时评测中,PORTA 耗时仅 195.34 秒,比 SparseGPT(773.35 秒)快 3.96 倍,比 ECoFLaP(402.28 秒)快 2.06 倍。这完全得益于对角协方差假设直接复用了重要性评分阶段已计算的激活方差,使得自适应配额分配无需繁重的二阶求逆或额外反向传播。
亮点与洞察¶
- 激活方差替代绝对幅度的跨模态洞察:敏锐地揭示了 LLM 激活离群值假说在多模态视觉分支中的水土不服,创新地采用统计方差反映动态表征参与度,以极简形式构建了真正的模态对称重要性度量。
- 统计量复用的极速协方差映射设计:将层输出方差推导与输入对角协方差相联立,使复杂的层级自适应配额计算退化为无需额外特征采样的快速矩阵乘,实现了准确性与工程效率的双赢。
- 可复用的通用压缩泛化模式:证明了任务不可知多模态压缩无需在每个下游场景反复校准或微调,该“方差效用度量 + 输出能量层分配”范式能够无缝推广至扩散模型及其他任意异构多分支深度架构。
局限与展望¶
- 作者承认的局限:极端高压缩比(如 \(\ge 70\%\))下未结合重训练时模型的零样本精度仍会发生明显损失;且研究重点聚焦于结构化/非结构化权重剪枝,尚未与量化(Quantization)或低秩分解等互补压缩手段形成联合端到端管线。
- 挖掘的潜在局限:对角协方差虽然计算高效且在实验中仅产生 \(<0.2\%\) 的指标偏离,但在跨通道相关性极强的高度稠密特征层中,忽略非对角协方差项可能在极端微调敏感场景下略微低估通道间协同效应。
- 未来改进方向:可进一步探索结合轻量级免重训练自适应缩放补偿,以及将方差效用准则延伸至动态 token 稀疏化(Token Pruning)与注意力头剪枝的统一压缩体系。
相关工作与启发¶
- vs Wanda: Wanda 依靠权重绝对值与输入特征 \(\ell_2\) 范数乘积,根植于 LLM 的单向极值离群假说;PORTA 则采用跨 token 激活方差,成功消除了视觉与文本模态间的激活幅度尺度偏差。
- vs SparseGPT: SparseGPT 依赖逐层求解逆 Hessian 矩阵的重构更新,在多模态大模型下耗时极长且对校准集域漂移敏感;PORTA 属轻量闭式统计度量,剪枝速度提升近 4 倍且校准泛化性更强。
- vs ECoFLaP: ECoFLaP 虽探索了层间自适应配额,但依赖零阶梯度且底层权重度量仍退回 Wanda;PORTA 在评分与配额分配双阶段均实现了自洽的方差统计表征,在高稀疏度下性能大幅领先。
- vs Multiflow: Multiflow 提出多模态任务不可知概念但仍需针对下游任务微调恢复精度;PORTA 真正做到了单次剪枝即用,全程完全免除重训练。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 突破性地从激活方差角度重塑了多模态不可知剪枝与层分配准则,构思精巧。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖分类、检索与问答三大场景,涵盖 CLIP、BLIP、Qwen2-VL 等多类异构架构及充分的鲁棒性分析。
- 写作质量: ⭐⭐⭐⭐⭐ 动机清晰,数学推导简洁,实验设计对比扎实。
- 价值: ⭐⭐⭐⭐⭐ 彻底解决了 VLM 部署阶段频繁重剪枝与模态不均衡难题,对多模态轻量化工程实用价值极高。