跳转至

EffiDINO: Task-Specific Model Pruning via Gram Anchoring Subspace Consistency

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/NUST-Machine-Intelligence-Laboratory/Cut-ViT
领域: 模型压缩
关键词: 模型剪枝、视觉基础模型、Gram矩阵、子空间一致性、谱熵自适应

一句话总结

针对现有无训练一次性结构化剪枝(OSP)强行对齐局部 Token 导致流形崩溃和通用剪枝缺乏任务专属性的痛点,论文提出 Cut-ViT(EffiDINO),通过空间与通道 Gram 锚定解耦语义拓扑,施加基底无关与残差子空间约束,并结合谱熵动态适配下游任务信息密度,仅耗时约 1 分钟即可在单卡 A100 上实现 SOTA 剪枝性能。

研究背景与动机

以 DINOv3 为代表的视觉基础模型(VFMs)在语义分割、目标检测和深度估计等视觉任务中展现出卓越的表征能力,但其数以亿计的参数量和庞大的计算开销严重阻碍了在资源受限边缘设备上的部署。在知识蒸馏、权重量化与结构化剪枝等轻量化方案中,无需重新训练的一次性结构化剪枝(One-Shot Structured Pruning, OSP)凭借仅需单次前向/反向传播即可根据梯度动态评估参数重要性的优势,成为大模型快速压缩最具潜力的范式。

然而,现存 OSP 方法面临两大严峻瓶颈。其一是表征鲁棒性退化:现有方法(如 SNIP、SNOWS、SnapViT 等)普遍依赖学生子网与原生教师模型之间刚性的点对点 Token 数值对齐,这种局部对齐强迫子网络机械记忆特定数值特征,极易过拟合于高频噪声与冗余相关性,破坏了基础模型内在全局语义流形拓扑结构。其二是任务专属性匮乏:传统剪枝方案习惯在单一通用数据集(如 ImageNet)上统一搜索通用子网络,忽视了模型容量在边缘侧被大幅裁剪后,通用子网络无法兼顾不同下游任务对特征粒度(如分类偏好全局不变语义、分割依赖密集空间高频细节)的差异化需求,导致下游任务精度大幅折损。

本文针对上述矛盾反思了特征对齐的数学本质。DINOv3 的强泛化力源自其 Gram 锚定所蕴含的高阶拓扑结构,因此不应限制局部数值相等,而应保持子空间的几何一致性。核心 idea:从空间与通道双重视角构建 Gram 矩阵并分解出正交子空间基底,设计基底旋转不变的子空间投影与残差消除机制,同时引入谱熵量化流形信息密度以动态调配剪枝目标,实现极速且鲁棒的任务特定模型剪枝。

方法详解

整体框架

Cut-ViT 针对冻结的原生模型(DINOv3 Native)与待剪枝引导网络(DINOv3 Pruned),建立了一套从数据分布适配、双域 Gram 子空间分解到动态目标优化的剪枝流程。给定目标下游任务未标注的极小校准集,成对的原始图像与扰动加噪图像分别送入原生模型与待剪枝网络。系统从特征中抽取空间和通道维度的 Gram 矩阵,通过截断奇异值分解(SVD)提取正交基底;随后,利用基底无关重叠损失与正交残差过滤损失约束子网流形贴合教师网络;最后通过谱熵测算空间与语义的信息复杂性自适应加权,反向传播计算参数显著性梯度以单次生成多稀疏度子网。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["目标任务校准图像<br/>原始图与加噪扰动图"] --> B["Gram 锚定子空间分解<br/>提取空间与通道 Gram 正交基底"]
    B --> C["基底无关子空间约束<br/>最大化正交基底投影亲和矩阵能量"]
    B --> D["正交残差能量消除<br/>抑制正交补流形外部冗余噪声"]
    C --> E["谱熵任务自适应加权<br/>基于奇异谱衰减平衡空间与通道"]
    D --> E
    E --> F["单次反向传播与参数排序<br/>生成多稀疏度轻量化子网络"]

关键设计

1. Gram 锚定子空间分解:解耦空间拓扑与语义概念的高阶流形基底

为了摆脱对单个 Token 数值的敏感过拟合并传承 DINOv3 的全局结构先验,方法放弃逐点特征对齐,转而构建二阶相关性矩阵并提取流形子空间。设层特征嵌入为 \(F \in \mathbb{R}^{L \times D}\)\(L\) 为 Token 数量,\(D\) 为通道维度)。空间 Gram 矩阵 \(S = \frac{1}{D} F F^\top \in \mathbb{R}^{L \times L}\) 沿通道聚合特征,刻画 Patch 之间的空间几何拓扑(回答“在哪里”的问题);通道 Gram 矩阵 \(C = \frac{1}{L} F^\top F \in \mathbb{R}^{D \times D}\) 将 Token 视为样本,刻画特征通道间的语义属性关联(回答“是什么”的问题)。对 \(S\)\(C\) 分别执行低秩奇异值分解(SVD),得到截断 Top-\(K\) 的标准正交基底矩阵 \(U^S\)\(U^C\)

\[S \approx U^S \Sigma_S (U^S)^\top, \quad C \approx U^C \Sigma_C (U^C)^\top\]

通过在输入端注入噪声图像进行扰动,引导分解得到的正交基底聚焦于表征中抗噪的主成分方向,将流形拓扑与局部高频扰动彻底解耦。

2. 基底无关子空间一致性约束:克服 SVD 符号与旋转不确定性的流形几何对齐

直接通过均方误差(MSE)对齐剪枝子网络正交基底 \(U_p \in \mathbb{R}^{L \times K}\) 与教师基底 \(U_t \in \mathbb{R}^{L \times K}\) 存在本质缺陷,因为 SVD 分解产生的基向量存在旋转与正负号非唯一性,强行约束向量元素数值相等会导致优化目标病态震荡。为此,论文构造两组基底的跨模型亲和度矩阵 \(M = U_p^\top U_t \in \mathbb{R}^{K \times K}\),并以 Frobenius 范数形式最大化子空间之间的相关能量:

\[\mathcal{L}_{\text{basis}} = - \| U_p^\top U_t \|_F^2 = - \sum_{i=1}^K \sum_{j=1}^K M_{ij}^2\]

理论证明,对于任意正交旋转矩阵 \(Q_p \in \mathbb{R}^{K \times K}\),根据 Frobenius 范数的酉不变性,\(\| (U_p Q_p)^\top U_t \|_F^2 = \| Q_p^\top M \|_F^2 = \| M \|_F^2\)。这意味着 \(\mathcal{L}_{\text{basis}}\) 仅取决于两组基底所张成子空间的几何重叠度,对子网络基底在优化过程中的任意等距旋转完全不变,使剪枝过程稳定收敛到与教师模型一致的特征流形。

3. 正交残差能量消除:显式滤除脱离主干拓扑的流形外噪声

基底约束 \(\mathcal{L}_{\text{basis}}\) 保证了子网络在主导方向上对齐,但剪枝过程中的扰动仍可能使子网络特征 \(F_p\) 产生垂直于教师目标子空间的冗余分量。为净化特征纯度,论文构建教师子空间的正交投影矩阵 \(P_t = U_t U_t^\top\)。依据投影分解定理,\(F_p\) 被精确正交拆分为投影分量与残差误差分量:\(F_p = P_t F_p + (I - P_t) F_p\)。通过施加残差最小化损失:

\[\mathcal{L}_{\text{residual}} = \| (I - U_t U_t^\top) F_p \|_F^2\]

显式惩罚并消除未对齐到教师 Gram 锚定流形上的杂乱能量,迫使子网络剔除结构冗余特征。

4. 谱熵任务自适应加权:基于流形信息密度的剪枝目标重塑

为消除通用剪枝对特定下游任务的精度削弱,方法将剪枝校准集转移至目标任务数据集(仅需 \(N=1000\) 张无标注样本),并设计基于谱熵的动态加权机制。利用原生特征空间 Gram 矩阵 \(S_t\) 与通道 Gram 矩阵 \(C_t\) 的归一化奇异值计算能量分布概率 \(p_i^S\)\(p_j^C\),其表征复杂性由香农谱熵度量:

\[\mathbb{H}(S_t) = - \sum_{i=1}^K p_i^S \log p_i^S, \quad \mathbb{H}(C_t) = - \sum_{j=1}^K p_j^C \log p_j^C\]

分类任务侧重位移不变的全局语义,空间 Token 趋向同质,其能量集中在少数主成分中(\(\mathbb{H}(S_t)\) 较低);而语义分割、稠密匹配等密集预测任务依赖复杂的拓扑边界,空间谱分布平坦(\(\mathbb{H}(S_t)\) 较高)。据此自适应计算权重 \(w^{\text{spatial}} = \frac{\mathbb{H}(S_t)}{\mathbb{H}(S_t) + \mathbb{H}(C_t)}\)\(w^{\text{channel}} = \frac{\mathbb{H}(C_t)}{\mathbb{H}(S_t) + \mathbb{H}(C_t)}\),重构总子空间损失为 \(\mathcal{L}_{\text{basis}}^{\text{all}} = w^{\text{spatial}} \mathcal{L}_{\text{basis}}^{\text{spatial}} + w^{\text{channel}} \mathcal{L}_{\text{basis}}^{\text{channel}}\),使剪枝权重动态贴合具体任务的信息表征诉求。

实验关键数据

主实验

论文以 DINOv3 (ViT-B/16) 为主干,在视频目标分割(DAVIS-2017)、语义匹配(FG3DCar/JODS/SBD)、目标检测(COCO)、语义分割(ADE20K)、深度估计(NYUv2)和图像分类(ImageNet)六大任务上进行了广泛测试。在 10% 到 30% 剪枝稀疏度下与现有训练依赖方法(HydraViT、EA-ViT)及无训练 OSP 方法(LAMP、NVIT、SNIP、SNOWS、SnapViT)进行了全面对比。

任务 / 数据集 评估指标 稀疏度 原生 DINOv3 SnapViT (前 SOTA OSP) Cut-ViT (本文) 相比 OSP 提升 EA-ViT (训练依赖)
视频分割 DAVIS-2017 \((J\&F)_m\) 30% 69.7 56.0 59.4 +3.4 60.3
视频分割 DAVIS-2017 \((J\&F)_m\) 20% 69.7 60.8 65.0 +4.2 65.4
视频分割 DAVIS-2017 \((J\&F)_m\) 10% 69.7 65.0 68.7 +3.7 69.3
目标检测 COCO mAP 30% 57.8 45.8 48.6 +2.8 49.4
目标检测 COCO mAP 20% 57.8 51.0 53.0 +2.0 54.1
语义分割 ADE20K mIoU 30% 51.8 46.0 47.2 +1.2 48.2
语义分割 ADE20K mIoU 20% 51.8 48.3 50.0 +1.7 50.9
深度估计 NYUv2 ARel \(\downarrow\) / \(\delta_1 \uparrow\) 30% 3.0 / 99.9 7.7 / 97.6 4.6 / 98.7 -3.1 / +1.1 3.9 / 99.3
语义匹配 FG3DCar [email protected] 30% 92.0 65.7 70.8 +5.1 72.0
图像分类 ImageNet Top-1 Acc 20% 89.3 78.2 79.4 +1.2 81.7

消融实验

在 ADE20K 语义分割任务(20% 稀疏度)下,针对各个模块与设计变量开展了系统消融。

实验配置 基底无关约束 残差消除约束 任务自适应 (目标数据+谱熵) 空间 Gram 通道 Gram mIoU (%) 说明
Baseline (\(L_{ba}\) 局部特征对齐) - - - - - 48.4 传统点对点 Token 对齐基线
+ 基底无关约束 \(\checkmark\) - - \(\checkmark\) \(\checkmark\) 49.1 消除基底旋转模糊度 (+0.7%)
+ 残差约束 - \(\checkmark\) - \(\checkmark\) \(\checkmark\) 49.3 抑制正交补流形外杂波 (+0.9%)
仅双约束无任务自适应 \(\checkmark\) \(\checkmark\) - \(\checkmark\) \(\checkmark\) 49.7 空间与通道静态等权组合
完整模型 (Cut-ViT) \(\checkmark\) \(\checkmark\) \(\checkmark\) \(\checkmark\) \(\checkmark\) 50.0 完整模型相对基线大幅提升 +1.6%
单独空间 Gram \(\checkmark\) \(\checkmark\) \(\checkmark\) \(\checkmark\) - 49.7 仅保留“Where”空间拓扑
单独通道 Gram \(\checkmark\) \(\checkmark\) \(\checkmark\) - \(\checkmark\) 49.5 仅保留“What”通道语义

在算法开销方面,单张 A100 GPU 上的统计显示: - 剪枝用时:EA-ViT 需要 13,920 秒,SnapViT 需要 292 秒,而 Cut-ViT 仅需 61 秒(仅为 SnapViT 的 20.9%,EA-ViT 的 0.44%)。 - 显存占用:EA-ViT 占用 37.9 GB,SnapViT 占用 23.5 GB,而 Cut-ViT 仅需 10.7 GB(约为 SnapViT 的 45.5%)。

关键发现

  • 子空间基底不变性是结构化剪枝的核心基石:直接使用 MSE 强行约束奇异向量导致优化目标病态,消融分析显示基底不变约束(BI)比单纯 MSE 带来了显著提升,在特征可视化上保留了清晰锐利的物体轮廓边界,避免了表示模糊与弥散。
  • 目标域数据适配与谱熵加权的强协同效应:将基线模型直接搬到目标域数据集剪枝仅能带来微弱增益(SnapViT 提升小于 0.4%),而配合谱熵动态加权后性能跃升显著,证实谱熵有效捕捉了稠密预测任务对空间高频细节与分类任务对语义不变性的需求差异。
  • 跨架构鲁棒性极佳:除 DINOv3 之外,将 Cut-ViT 拓展至 SAM(SA-1B 分割提升 +2.7%)、DeiT(视频目标分割提升 +4.0%)和 CLIP(开放词汇分割提升 +3.2%),均显著领先现有 OSP 方法,展现出极强的通用压缩潜力。

亮点与洞察

  • 将 Gram 矩阵降维分解引入剪枝对齐:跳出了传统 OSP 执着于单个 Token 数值逼近的局部狭隘视角,用空间和通道 Gram 的正交基底抓住了大模型的深层流形拓扑,既抗噪又规避了过拟合。
  • 数学证明赋予的基底旋转不变性:巧妙运用 Frobenius 范数的酉不变性构造相关能量目标,从理论上化解了 SVD 分解基向量旋转与符号不唯一的经典病态对齐难题,设计简洁优美。
  • 谱熵作为特征信息密度的量化温度计:利用奇异值谱的能量分布熵自适应表征任务对空间细节 vs 全局语义的偏好,为多任务模型压缩提供了一个无监督且直观的自动化调权指标。

局限与展望

  • SVD 分解的算力瓶颈与近似性:在极高分辨率图像或大 Patch 数量下,空间 Gram 矩阵维度达到 \(L \times L\)(例如高分辨率下 \(L>4000\)),全矩阵 SVD 计算及求导开销将急剧增加,需要探索更轻量的随机化 SVD 或低秩近似。
  • 截断主成分数 \(K\) 的经验预设:实验中固定截断维度 \(K=192\),虽然累积解释方差比(CEVR)达到 98.9%,但对不同规模模型或异构架构(如小规模 DeiT)可能不是最优点,未来可探索基于方差阈值的自适应动态秩选择。
  • 任务定义依赖未标注数据的代表性:任务专属性完全建立在抽取的无标注校准集分布上,如果目标场景出现极端的域内多样性或长尾偏离,流形可能被局部样本偏差误导。

相关工作与启发

  • vs SnapViT / SNOWS: 后者采用二阶 Hessian 逼近或遗传算法在全局通用数据集上做刚性 Token 对齐,剪枝时间长(近 5 分钟至 1.7 小时)且破坏鲁棒性;本文采用流形子空间对齐与谱熵动态赋权,用时骤降至 1 分钟且在密集预测任务上大幅领跑。
  • vs HydraViT / EA-ViT: 基于训练的动态结构化剪枝虽然精度较高,但往往需要数小时的多阶段繁重微调;Cut-ViT 以 0.44% 的时间消耗和 28.2% 的显存消耗达到了与 EA-ViT 极度接近的性能(差距通常在 0.5%~0.9% 之间),极大降低了工业落地门槛。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙将 Gram 矩阵二阶流形分解与基底旋转不变性引入无训练剪枝,切入视角极具启发性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 6 大视觉任务、9 个主流数据集、3 个外源模型架构及完备的理论推导与消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 数学证明严密自洽,问题痛点剖析深入透彻,图表呈现清晰有说服力。
  • 价值: ⭐⭐⭐⭐⭐ 将视觉大模型在下游任务的剪枝时间缩短至 1 分钟,兼顾超低显存与高鲁棒性,具备突出的工程落地与学术价值。