Going Deep: Deep Visual Prompting with LoTeP¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM
关键词: 视觉提示学习、低秩张量分解、深层特征适配、容量-完整性悖论、参数高效微调
一句话总结¶
针对视觉提示向深层特征扩展时引发的参数爆炸与预训练语义破坏难题,提出低秩张量视觉提示方法 LoTeP,利用 Tucker 与 CP 张量分解协同建模跨通道与空间相关性,配合层级余弦秩衰减策略,在仅引入极小参数量的前提下实现深层特征的无损平滑调优。
研究背景与动机¶
参数高效微调(PEFT)在视觉基础模型适配中占据核心地位,而视觉提示(Visual Prompting, VP)作为代表性方案,传统上主要通过在输入像素空间叠加微调扰动(如加边框、贴图或低秩整图相加)来实现下游任务迁移。这种纯输入层的提示范式虽然对骨干网络完全黑盒且架构无关,但在深层特征传递过程中面临着不可避免的信号衰减问题。Centered Kernel Alignment(CKA)表征相似度分析表明,输入级 VP 诱导的深层激活高度贴合未经微调的预训练初始状态,而无法充分对齐全量微调(FT)所学到的下游判别性表征,这极大地限制了深层特征的自适应能力与最终迁移精度。
直接将可学习提示注入深层激活层却面临着严峻的“容量-完整性悖论”(Capacity-Integrity Paradox)。一方面,深层特征图的通道维度迅速膨胀,若为每个通道分配独立提示参数,参数量将随着特征尺寸激增,违背参数高效初衷且容易过拟合;另一方面,无约束的深层提示自由度过高,会强行覆盖预训练模型原本在通用大规模数据上建立的稳定语义流形,破坏中间特征的语义完整性,导致表征漂移。
通过对深层通道分组提示的初步实证探究,可以观察到特征通道之间存在极强的结构冗余度与协同相关性;同时,基于梯度反向传播的理论证明揭示出深层提示本征具有随网络深度递减的低秩属性。本文的核心 idea 是:将深层激活提示显式建模为低秩张量(LoTeP),统一解耦并压缩通道与空间维度,同时引入层级余弦秩衰减调度机制,在浅层赋予充足适配容量、在深层收紧自由度以保护语义完整性。
方法详解¶
整体框架¶
LoTeP 的核心在于将视觉提示从传统的输入像素空间拓展至深层特征激活层,同时借助张量分解与秩衰减机制精准控制每一层的调优容量。给定预训练视觉骨干网络的前 \(d\) 个特征处理块,对于第 \(l\) 层的中间特征图 \(\mathcal{X}_l \in \mathbb{R}^{C \times H \times W}\),LoTeP 将可学习的提示张量 \(\mathcal{P}_l \in \mathbb{R}^{C \times H \times W}\) 与输入特征进行逐元素相加,然后输入给该层原本冻结的前向块 \(f_l\):
为了在不引发参数爆炸的同时捕捉多维协同特征,LoTeP 提供了两种基于低秩张量分解的提示构建范式:Tucker 形式(LoTeP-TK)与 CP 形式(LoTeP-CP)。此外,针对特征向深层传播时预训练语义愈发脆弱的特性,LoTeP 采用深度截断比率 \(\rho\) 与平滑的余弦秩衰减曲线,使提示张量的秩随网络深度动态衰减,最终在深层平滑归零,兼顾任务适配容量与表征完整性。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入图像 / 底层特征"] --> P1["多维低秩提示张量分解<br/>Tucker / CP 分解解耦通道与空间"]
P1 --> P2["零张量初始化<br/>通道侧置零保障初态无损输出"]
P2 --> P3["层级余弦秩衰减调度<br/>秩随深度光滑递减收束深层容量"]
P3 --> P4["深层特征残差注入<br/>在前 d 个 block 中逐元素融合"]
P4 --> Out["冻结深层 Blocks 与分类输出"]
关键设计¶
1. 多维低秩提示张量分解:解耦通道膨胀与空间冗余
直接在深层特征图上叠加提示会导致参数量达到 \(\mathcal{O}(C \cdot H \cdot W)\),而单纯复用输入空间低秩矩阵的方法(如 Deep LoR-VP)需要为每个通道独立构建低秩矩阵,参数量依旧高达 \(\mathcal{O}(C \cdot r \cdot (H + W))\),随通道数 \(C\) 线性激增。LoTeP 将提示张量 \(\mathcal{P}_l\) 视为三阶张量,将通道维度与空间高宽维度纳入统一的低秩分解框架中。
在 LoTeP-TK 变体中,提示采用 Tucker 分解,定义核心张量 \(\mathcal{C}^{(l)} \in \mathbb{R}^{r_l \times r_l \times r_l}\) 以及通道因子矩阵 \(U^{(l)} \in \mathbb{R}^{r_l \times C}\)、高因子矩阵 \(V^{(l)} \in \mathbb{R}^{r_l \times H}\)、宽因子矩阵 \(W^{(l)} \in \mathbb{R}^{r_l \times W}\),通过各模态张量积重构提示:
在 LoTeP-CP 变体中,提示进一步被分解为 \(r_l\) 个秩一外积张量之和,即由通道向量 \(\mathbf{a}_t^{(l)} \in \mathbb{R}^C\)、高向量 \(\mathbf{b}_t^{(l)} \in \mathbb{R}^H\)、宽向量 \(\mathbf{c}_t^{(l)} \in \mathbb{R}^W\) 的外积叠加而成:
此时参数复杂度被压缩至 \(\mathcal{O}(r_l(C + H + W))\)。当秩 \(r_l \ll C\) 时,通道维度与空间维度实现完全解耦,打破了离散分组提示中各组间的孤立状态,在极度压缩参数量的同时维持了跨通道的表征交互。
2. 零张量初始化:消除训练初始阶段的表征扰动
在微调初始时刻,随机初始化的深层提示会给原本经过充分预训练的特征激活引入剧烈噪声,破坏脆弱的前向表征并导致训练不稳定。为了让模型在微调第 0 步严格等价于原始冻结骨干网络,LoTeP 设计了非对称初始化策略:将对应于通道维度的参数(LoTeP-TK 中的 \(U^{(l)}\) 或 LoTeP-CP 中的 \(\mathbf{a}_t^{(l)}\))严格初始化为全零,而空间维度因子矩阵采用标准高斯随机初始化。由于张量乘积或外积中包含全零通道因子,重构出的提示张量 \(\mathcal{P}_l\) 在初始状态严格为零张量,从而实现了对预训练权重的恒等初始映射,保障了训练早期梯度的平稳回传。
3. 层级余弦秩衰减调度:以平滑收窄容量化解语义破坏
尽管张量分解限制了每层的瞬时自由度,但若在所有深层特征块均施加恒定秩的提示,越靠后的层级其所累积的预训练高阶语义越容易受到不可逆的结构冲刷。为了解决这一矛盾,LoTeP 将提示注入截断在前 \(d = \lfloor L \cdot \rho \rceil\) 层,并提出动态余弦秩衰减调度机制,使得各层的提示秩 \(r_l\) 随着层索引 \(l\) 平滑减退:
其中 \(r_0\) 为浅层起始秩。余弦调度在网络浅层保持缓慢衰减,赋予浅层网络充足的任务特定适配容量;而在特征临近深层语义抽取阶段时加速收缩,平滑将提示容量过渡为零。理论分析进一步证实,在反向传播链式法则与瓶颈结构约束下,深层卷积特征的梯度秩上界严格满足随层数增加而单调收敛,余弦衰减调度在数学逻辑与物理直觉上实现了高度自洽。
损失函数 / 训练策略¶
整个调优过程中,视觉骨干网络的全部卷积与注意力权重均保持冻结,仅更新每层的张量因子参数以及下游任务的线性分类头。优化目标采用标准的交叉熵损失函数:
其中 \(K\) 为下游类别数,\(\hat{y} = \text{Softmax}(\text{Head}(\mathcal{X}_L))\)。在超参数配置上,起始秩默认设为 \(r_0 = 6\),截断深度比率 \(\rho\) 依据骨干网络规模在 0.5 到 1.0 之间选取,无需依赖额外的数据增强手段,仅需常规图像尺寸归一化即可完成快速收敛。
实验关键数据¶
主实验¶
论文在涵盖 ResNet、ViT、Swin 与 ConvNeXt 等 9 类代表性骨干网络,以及 CIFAR-100、Tiny-ImageNet 等 10 个下游基准上展开评估。如下表所示,LoTeP 显著超越了此前最强的输入级视觉提示方法 LoR-VP,甚至在 ViT 大模型上超越了全量微调(FT)与 LoRA。
| 模型架构 | 适配方法 | CIFAR-100 Acc (%) | Tiny-ImageNet Acc (%) | 可调参数量 (M) |
|---|---|---|---|---|
| ViT-B/16 | Full Fine-Tuning (FT) | 92.15 | 91.24 | 575.39 |
| ViT-B/16 | Linear Probing (LP) | 87.12 | 89.25 | 1.00 |
| ViT-B/16 | LoRA (rank=8) | 91.38 | 91.19 | 11.05 |
| ViT-B/16 | AutoVP | 88.84 | 89.53 | 9.97 / 18.39 |
| ViT-B/16 | LoR-VP | 89.01 | 90.53 | 1.05 / 2.05 |
| ViT-B/16 | LoTeP-CP (本文) | 91.59 | 91.90 | 1.13 / 2.13 |
| ViT-B/16 | LoTeP-TK (本文) | 91.82 | 91.93 | 1.13 / 2.14 |
| ResNet-50 | Full Fine-Tuning (FT) | 83.46 | 81.56 | 575.39 |
| ResNet-50 | LoR-VP | 74.86 | 77.55 | 1.05 / 2.05 |
| ResNet-50 | LoTeP-CP (本文) | 80.39 | 80.41 | 1.13 / 2.13 |
| ResNet-50 | LoTeP-TK (本文) | 80.82 | 80.63 | 1.13 / 2.14 |
在更广泛的 10 个数据集(EuroSAT, Pets, Food, DTD, Flowers, CIFAR-10/100, SVHN, GTSRB 等)平均准确率评测中,以 ViT-B/32 为骨干网络时,LoTeP-TK 取得了 91.44% 的平均识别率,超越 LoR-VP(88.94%)达 +2.50%,并胜过 FT(91.11%)与 LoRA(91.22%)。
消融实验¶
论文在 CoAtNet-2 与 ViT-B/16 上深入探讨了秩衰减调度策略以及训练推理效率对比:
| 评估维度 / 配置项 | 采用方案 / 调度曲线 | CIFAR-100 Acc (%) / 显存占用 | 训练用时 (h) / 延迟 (ms) | 说明 |
|---|---|---|---|---|
| 衰减调度 (CoAtNet-2) | Constant Schedule (恒定秩) | 89.65 | - | 缺乏深层语义正则化约束 |
| 衰减调度 (CoAtNet-2) | Linear Schedule (线性递减) | 90.15 | - | 浅层容量衰减过急,表征不足 |
| 衰减调度 (CoAtNet-2) | Cosine Schedule (余弦递减) | 90.45 | - | 浅层保容量、深层保语义最佳平衡 |
| 运行效率 (ViT-B/16) | LoRA | 91.19 (22.08 GB) | 2.89h / 5.26ms | 梯度回传涉及全权重矩阵低秩改变量 |
| 运行效率 (ViT-B/16) | VPT-Deep | 91.10 (12.60 GB) | 3.48h / 6.33ms | 额外引入前向 token 序列计算开销 |
| 运行效率 (ViT-B/16) | LoR-VP | 90.53 (14.34 GB) | 1.65h / 5.74ms | 仅优化输入像素空间低秩矩阵 |
| 运行效率 (ViT-B/16) | LoTeP-TK (本文) | 91.93 (14.34 GB) | 1.59h / 5.77ms | 极低显存与耗时下取得最高准确率 |
关键发现¶
- 容量衰减不可或缺:若采用恒定秩进行深层提示(Constant),模型性能较余弦调度掉点明显,证实未施加深层收缩的提示确实会侵蚀预训练表征;而线性衰减(Linear)由于过早削弱浅层表达能力同样不如余弦调度。
- 不同体量模型的深度敏感度异质:消融表明,参数量较小的 ResNet-50 偏好较大的截断深度比率 \(\rho\)(接近 1.0),说明浅薄骨干急需深层注入容量补充;相反,表征能力极强的 Swin-B 在 \(\rho\) 偏大时发生性能恶化,印证了大型视觉模型后半段表征极为珍贵、过度干预反而破坏语义的假说。
- 极端参数效率与 OOD 泛化:在 ConvNeXt-B 上面向 ImageNet-A 等自然对抗样本测试时,LoTeP-TK 取得了 44.41% 的精度,相比 LoR-VP 的 39.36% 大幅提升 +5.05%,表明深层张量正则化有助于过滤虚假像素相关性,显著增强域外泛化稳定性。
亮点与洞察¶
- 从离散分组走向连续张量:论文敏锐地通过初步实验捕捉到了通道间的冗余性,进而将离散的通道共享泛化为优雅的低秩张量分解,用 \(\mathcal{O}(r(C+H+W))\) 的代价彻底攻克了深层提示通道爆炸的技术瓶颈。
- 理论推导指导工程调度:从反向传播梯度的本征低秩性推导出了提示秩随深度递减的数学上界,使余弦衰减调度不再是拍脑袋的启发式试凑,而是兼具理论依据与工程实效的双重保障。
- 打破视觉提示不及微调的传统认知:在过去的研究中,输入级 VP 往往被视为性能次于 LoRA 和全微调的“廉价妥协方案”。LoTeP 在保持几乎同等微调显存与参数开销的前提下,在多项大模型基准上反超 LoRA 与 FT,重新确立了提示微调在深层表征适配中的竞争力。
局限与展望¶
- 小模型容量局限性:在 ResNet-18 等本身体量很小的网络上,LoTeP 虽然大幅领先其他 VP 方法,但依然明显落后于全量微调(FT 82.51% vs LoTeP 75.31%)。这说明当预训练网络自身特征提取能力严重不足时,外挂提示难以弥补骨干知识的欠缺。
- 秩与截断超参数依赖人工设定:目前的起始秩 \(r_0\) 与深度比率 \(\rho\) 针对不同网络架构仍需依据模型规模做粗粒度选择,未来若能引入基于梯度幅值或奇异值谱的自适应秩分配机制,将进一步提升通用性。
相关工作与启发¶
- vs LoR-VP: LoR-VP 开创性地将低秩矩阵用于输入像素空间提示,极具参数效率;然而其受困于深层信号衰减,且若暴力拓展至深层会面临参数随通道线性暴增与语义破坏。LoTeP 则引入三阶张量建模与余弦秩衰减,成功打通了提示向深层延伸的道路。
- vs VPT (Visual Prompt Tuning): VPT-Deep 专为 Transformer 架构设计,在每个自注意力层拼接额外可学习的前缀 token,不仅难以直接迁移至标准 CNN 等非注意力网络,而且会拉长自注意力序列长度、增加显存与延迟开销。LoTeP 采用特征图逐元素残差叠加,对 CNN、ViT 及混合架构具备统一的通用性与零推理额外延迟。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次从张量低秩分解与容量-完整性悖论视角攻克深层视觉提示难题,构思精巧。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 9 大模型家族、10 个迁移数据集、4 类 OOD 测试与多角度消融,对比详实。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述自然流畅,理论推导与经验实验互相印证,逻辑闭环完整。
- 价值: ⭐⭐⭐⭐⭐ 为通用视觉模型的深层高效参数微调提供了全新范式,兼具理论深度与落地实用性。