Mitigate Modality-Asymmetric Forgetting via Stabilizing Visual Representations in CLIP-Based Class-Incremental Learning¶
会议: ECCV 2026
论文: ECCV 2026
领域: 模型压缩
关键词: 类增量学习 / 视觉语言模型 / CLIP / 模态不对称遗忘 / 结构蒸馏
一句话总结¶
针对基于 CLIP 的类增量学习中视觉分支遗忘远比文本分支严重的模态不对称遗忘问题,本文提出视觉锚点结构迁移框架(VAST),通过跨层自相似增强构建稳定的几何视觉锚点,并结合矩阵 Rényi 熵结构蒸馏跨任务对齐特征分布,在无回放数据条件下显著降低表征漂移并取得 SOTA 性能。
研究背景与动机¶
类增量学习(Class-Incremental Learning, CIL)旨在使深度模型在无任务标识的前提下,持续学习顺序到来的新类别并保持对旧类别的识别能力。随着预训练多模态大模型的兴起,学术界广泛采用预训练视觉语言模型 CLIP 作为基础架构,并结合参数高效微调(PEFT,如 LoRA、Adapter)来平衡模型在新任务上的可塑性与原有零样本能力的稳定性。然而,传统增量学习往往默认各模态受到对称的遗忘压力,忽视了双分支双塔架构在持续微调过程中跨模态表征空间的非对称动态演变。
深入探究 CLIP 在连续任务下的参数敏感度可以发现一个关键不对称现象:文本编码器由于以固定概念级的自然语言词表为支撑,其深层参数的 Fisher 信息(Fisher Information, FI)始终保持在极低水平,天然充当了稳定的语义锚点(Semantic Anchor);与之形成鲜明对比的是,视觉编码器缺乏相应的先验结构保护,其高层网络在适应新任务时表现出异常剧烈的 Fisher 信息激增,承受了极高梯度的参数重构压力。这种深层视觉特征对当前任务的过度适配(Over-adaptation),直接诱发了旧类别 CLS 视觉表征的拓扑扭曲与聚类离散,引发严重的模态不对称遗忘。更为严峻的是,传统的点对点特征蒸馏(如 MSE、KL 散度)仅要求新模型拟合旧模型输出,一旦旧特征本身因缺乏锚点而发生漂移,传统蒸馏不仅无法纠偏,反而在多轮任务累积下进一步放大了表征崩溃。
针对视觉分支缺失结构参考基准的瓶颈,本文切入的角度是:利用视觉编码器中间层对新任务扰动不敏感、富含稳定空间拓扑结构的特性,在视觉分支内部显式构建具有几何约束能力的表征基准。本文的核心 idea 是:提出视觉锚点结构迁移框架(VAST),利用中间层二阶自相似注意力与文本感知的高层特征加权融合构建稳定的视觉结构锚点,并引入基于矩阵 Rényi 熵的信息论结构蒸馏跨任务传递流形几何关系,彻底阻断模态不对称遗忘。
方法详解¶
整体框架¶
VAST 整体流程围绕“构建视觉锚点”与“跨任务结构对齐”两条主线展开,整体由视觉表征增强模块(VRRM)与分布感知结构蒸馏目标构成。输入图像首先经过 CLIP 视觉编码器,在中间层提取抗扰动的局部拓扑结构,并在深层结合当前文本语义进行特征层级精炼,随后通过注意力残差连接将密集拓扑注入全局 CLS Token 中,形成具备几何稳定性的视觉锚点 \(V^t\)。在模型跨任务更新时,VAST 放弃脆弱的单点特征对齐,转而基于矩阵 Rényi 熵计算新旧任务特征 Gram 矩阵之间的联合熵,并结合随机置换正则化,跨任务约束表征分布的流形结构一致性。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
IN["输入图像 / 文本输入"] --> ENC["双塔编码器微调<br/>Visual ViT & Text Transformer"]
ENC --> SSA["结构保持自相似注意力<br/>中间层 Key-Key 二阶关联构建拓扑"]
SSA --> REFV["文本引导的特征层级精炼<br/>高层 Value 依文本余弦相似度加权"]
REFV --> GSR["全局语义增强与视觉锚点构建<br/>局部密集特征注意力残差注入 CLS"]
GSR --> DASD["基于矩阵熵的分布感知结构蒸馏<br/>矩阵 Rényi 联合熵与置换正则化"]
DASD --> OUT["分类预测与无回放跨任务更新"]
关键设计¶
1. 结构保持自相似注意力:基于中间层几何拓扑构建抗漂移空间基准 传统 ViT 的自注意力依赖 Query-Key(QK)点积,而在类增量学习中,Query 投影矩阵极易受新任务目标函数驱动而剧烈漂移,破坏注意力图的稳定拓扑。为摆脱任务相关 Query 偏移的负面影响,VAST 在视觉编码器对增量更新相对迟钝的中层(如第 \(M=7\) 层)构建 Query 无关的对称自相似矩阵。首先利用 Key-Key 关联计算一阶自相似关联 \(A_{self} = \text{softmax}(K_M K_M^\top / \sqrt{d})\),以此捕捉纯粹基于图像局部内容的几何依赖;为了进一步增强相邻 patch 簇的局部连通性,引入二阶关系传递 \(A_{rel} = A_{self} \times A_{self}\),最终形成结构保持注意力矩阵: $\(A_M = \text{softmax}\left(\frac{A_{self} A_{rel}}{\sqrt{d}}\right)\)$ 这一设计使注意力权重完全扎根于底层视觉模式的自然关联,排除了新任务分类头反传带来的剧烈扰动,为视觉锚点奠定了稳定的空间骨架。
2. 文本引导的特征层级精炼:跨模态语义引导的高层视觉特征自适应重加权 尽管中层拓扑能够抵抗漂移,但构建视觉锚点仍需融合深层网络的高阶语义。若简单使用最后一层输出,容易直接引入过拟合噪声。VAST 选择提取高层(第 9、10、11 层)的 patch 特征 \(V_l\),统一通过最终层冻结的投影矩阵 \(W_v^{(L)}\) 变换到统一度量空间。为了筛选出最契合真实语义概念的视觉成分,模块计算各层 patch 特征与当前任务文本提示嵌入 \(E_t\) 的平均余弦相似度 \(s_l = \mathbb{E}_{v \sim V_l}[\cos(v, E_t)]\),以此生成层级归一化权重 \(\alpha_l = \frac{\exp(s_l)}{\sum_{l'} \exp(s_{l'})}\)。最终汇聚的多层精炼视觉表征为: $\(V_{refine} = \sum_{l \in \{9, 10, 11\}} \alpha_l V_l\)$ 这一策略确保融入视觉锚点的特征既保留高层语义抽象能力,又受到文本分支语义锚点的校准引导。
3. 全局语义增强与视觉锚点构建:密集拓扑特征向全局 CLS Token 的残差注入 为了将空间拓扑 \(A_M\) 与语义特征 \(V_{refine}\) 无缝结合进分类决策核心,VAST 首先将其聚合为密集表征并通过 CLIP 原始视觉投影头投射:\(Z_v = \text{Proj}(A_M \cdot V_{refine})\)。随后,设计轻量级融合网络 \(f_\phi\)(两层 MLP),根据全局 CLS Token \(V_{cls}\) 与每个密集局部 Token \(z_i \in Z_v\) 的拼接向量计算自适应注意力权重,以残差形式强化 CLS Token: $\(V'_{cls} = V_{cls} + \beta \sum_{i} \text{softmax}\big(f_\phi([V_{cls}; z_i])\big) z_i\)$ 其中超参数 \(\beta\) 控制空间拓扑信息的注入强度。经过强化后的全局特征记作 \(V^t\),兼备了中层的 task-invariant 几何拓扑与高层的跨模态语义对齐,正式作为后续增量任务的视觉结构锚点。
4. 基于矩阵熵的分布感知结构蒸馏:流形几何约束与置换正则化 在顺序任务学习时,传统的特征向量点对点蒸馏(MSE 或余弦距离)在面对不可避免的微小表征漂移时极为脆弱,无法衡量特征空间的流形形变。VAST 引入基于数据 Gram 矩阵的 \(\alpha\) 阶 Rényi 联合熵来衡量新旧模型表征的分布发散度。设当前任务样本在任务 \(t\) 与上一任务 \(t-1\) 模型下提取的特征分别为 \(V^t\) 与 \(V^{t-1}\),构建归一化核 Gram 矩阵 \(G_V^t\) 和 \(G_V^{t-1}\)。视觉分布联合熵损失定义为: $\(\mathcal{L}_{vis}^{joint} = S_\alpha(G_V^t, G_V^{t-1}) = \frac{1}{1-\alpha} \log_2 \left( \text{tr}\left( \left[ \frac{G_V^t \circ G_V^{t-1}}{\text{tr}(G_V^t \circ G_V^{t-1})} \right]^\alpha \right) \right)\)$ 其中 \(\circ\) 为哈达玛积,\(\alpha = 1.01\)。更低的联合熵意味着两个任务的特征空间拓扑具有更高的结构契合度。为防止模型过拟合于样本间的偶然虚假相关性,VAST 进一步引入随机置换矩阵 \(\Pi\) 构建置换正则项:\(\mathcal{L}_{vis}^{reg} = S_\alpha(G_V^t, \Pi G_V^{t-1} \Pi^\top)\)。最终视觉蒸馏损失为 \(\mathcal{L}_{vis} = \mathcal{L}_{vis}^{joint} \mathcal{L}_{vis}^{reg}\)。文本分支同样计算对称的 \(\mathcal{L}_{text}\),两者相乘构成整体结构蒸馏项 \(\mathcal{L}_{distill} = \mathcal{L}_{vis} \mathcal{L}_{text}\)。
损失函数 / 训练策略¶
VAST 的总体优化目标由当前任务的交叉熵分类损失 \(\mathcal{L}_{ce}\) 与跨任务分布一致性蒸馏损失 \(\mathcal{L}_{distill}\) 加权构成: $\(\mathcal{L} = \mathcal{L}_{ce} + \lambda \mathcal{L}_{distill}\)$ 在全部实验中,损失权重固定设为 \(\lambda = 0.5\);视觉锚点注入强度固定设为 \(\beta = 0.1\);自相似注意力抽取层指定为第 \(M=7\) 层;Rényi 熵阶数设为 \(\alpha = 1.01\)。主干网络采用 OpenAI 预训练的 CLIP ViT-B/16,在视觉和文本双分支均插入秩为 8 的 LoRA 模块进行参数微调,冻结骨干网络绝大部分参数。每个阶段仅训练 5 个 epoch,batch size 为 128,采用 Adam 优化器配合初始学习率 0.001 的余弦退火策略,全流程无需任何历史任务旧样本回放。
实验关键数据¶
主实验¶
在 CIFAR100、TinyImageNet、ImageNet-R、Food101 以及大规模 ImageNet-1K 五个基准上,VAST 与代表性 SOTA 方法的对比涵盖了平均准确率(Avg)与最终轮准确率(Last)。
| 数据集 | 阶段切分 | 指标 | Continual-CLIP | L2P++ | DualPrompt | CODA-Prompt | PROOF (Replay) | MG-CLIP | DMNSP | VAST (本文) | 相对基线提升 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| CIFAR100 | B10_Inc10 | Last / Avg | 66.66 / 75.15 | 73.08 / 81.90 | 72.51 / 81.45 | 79.01 / 85.94 | 79.11 / 86.77 | 79.56 / 86.99 | 79.57 / 87.23 | 80.40 / 87.40 | +0.83 / +0.17 |
| CIFAR100 | B50_Inc10 | Last / Avg | 66.66 / 69.66 | 73.27 / 74.41 | 76.63 / 77.83 | 77.83 / 79.63 | 79.73 / 83.32 | 79.72 / 83.61 | 82.39 / 86.43 | 82.48 / 86.62 | +0.09 / +0.19 |
| ImageNet-R | B20_Inc20 | Last / Avg | 71.73 / 78.67 | 64.32 / 65.55 | 67.98 / 68.76 | 71.83 / 73.14 | 78.50 / 84.11 | 82.62 / 87.65 | 81.58 / 87.05 | 82.83 / 87.61 | +0.21 / -0.04 |
| ImageNet-R | B100_Inc20 | Last / Avg | 71.73 / 75.20 | 58.73 / 60.23 | 62.87 / 64.39 | 66.55 / 68.09 | 78.03 / 81.06 | 82.78 / 84.88 | 83.20 / 85.39 | 83.85 / 85.54 | +0.65 / +0.15 |
| TinyImageNet | B20_Inc20 | Last / Avg | 65.92 / 74.64 | 70.98 / 75.38 | 72.53 / 76.72 | 75.14 / 79.05 | 58.76 / 72.03 | 75.87 / 83.56 | 75.81 / 82.54 | 76.05 / 83.98 | +0.18 / +0.42 |
| TinyImageNet | B100_Inc20 | Last / Avg | 65.92 / 69.99 | 68.52 / 72.02 | 70.98 / 74.18 | 72.38 / 76.33 | 57.21 / 66.52 | 77.09 / 81.41 | 78.05 / 81.62 | 78.72 / 82.19 | +0.67 / +0.57 |
| Food101 | B10_Inc10 | Last / Avg | 86.19 / 90.73 | 78.13 / 85.77 | 78.49 / 85.95 | 78.77 / 86.11 | 84.73 / 90.04 | 88.19 / 93.30 | 87.75 / 92.74 | 88.71 / 93.42 | +0.52 / +0.12 |
| Food101 | B50_Inc10 | Last / Avg | 86.19 / 88.14 | 73.13 / 80.42 | 72.75 / 80.00 | 74.13 / 80.98 | 84.74 / 87.52 | 87.43 / 91.26 | 89.31 / 91.78 | 89.81 / 91.86 | +0.50 / +0.08 |
| ImageNet-1K | B100_Inc100 | Last / Avg | 67.69 / 75.55 | 69.60 / 79.30 | 69.79 / 79.39 | 66.96 / 76.99 | 63.01 / 73.66 | 73.33 / 81.71 | 72.87 / 81.57 | 73.85 / 81.92 | +0.52 / +0.21 |
| ImageNet-1K | B200_Inc200 | Last / Avg | 67.69 / 74.53 | 69.24 / 72.84 | 69.44 / 72.90 | 69.78 / 73.29 | 69.12 / 71.40 | 74.25 / 81.77 | 74.55 / 82.22 | 74.87 / 82.43 | +0.32 / +0.21 |
消融实验¶
表 3 针对视觉表征增强模块(VRRM)与信息论结构蒸馏损失(\(\mathcal{L}_{distill}\))的独立贡献与协同效应进行了系统消融(基准为 CLIP + LoRA 微调):
| 配置项 | VRRM 锚点模块 | \(\mathcal{L}_{distill}\) 结构蒸馏 | CIFAR100 (B10_Inc10) Avg (%) | CIFAR100 (B10_Inc10) Last (%) | ImageNet-R (B20_Inc20) Avg (%) | ImageNet-R (B20_Inc20) Last (%) | 说明 |
|---|---|---|---|---|---|---|---|
| Baseline | ✗ | ✗ | 84.81 ± 0.21 | 77.33 ± 0.18 | 84.01 ± 0.19 | 79.15 ± 0.22 | 纯 LoRA 微调,严重表征漂移 |
| Only VRRM | ✓ | ✗ | 86.90 ± 0.08 | 79.35 ± 0.10 | 87.24 ± 0.07 | 81.95 ± 0.10 | 单独加视觉锚点增强,Avg 提升 2.09% / 3.23% |
| Only Distill | ✗ | ✓ | 86.96 ± 0.07 | 78.93 ± 0.11 | 87.32 ± 0.09 | 82.32 ± 0.09 | 单独加矩阵熵蒸馏,Avg 提升 2.15% / 3.31% |
| Full VAST | ✓ | ✓ | 87.40 ± 0.06 | 80.40 ± 0.08 | 87.61 ± 0.07 | 82.83 ± 0.07 | 两者互补协同,达到最佳稳定性和分类精度 |
表 4 给出了从 Task 0 学习到 Task 1 后表征几何稳定性的定量度量(Fisher Discriminant Ratio, FDR,定义为类间方差与类内方差之比,FDR 越高表示聚类越紧凑可分):
| 数据集 | 算法方法 | \(\text{FDR} \uparrow (0 \to 1)\) | \(\text{inter-class} \uparrow (0 \to 1)\) | \(\text{intra-class} \downarrow (0 \to 1)\) | 拓扑演化判定 |
|---|---|---|---|---|---|
| CIFAR100 | CLIP + LoRA 基线 | \(2.19 \to 2.08 \ (\downarrow)\) | \(0.19 \to 0.18 \ (\downarrow)\) | \(0.09 \to 0.08 \ (\downarrow)\) | 类间分离度下降,表征退化混淆 |
| CIFAR100 | VAST (本文) | \(2.48 \to 2.97 \ (\uparrow)\) | \(0.24 \to 0.29 \ (\uparrow)\) | \(0.10 \to 0.10 \ (\to)\) | 类间方差显著增强,聚类高度紧凑 |
| TinyImageNet | CLIP + LoRA 基线 | \(1.75 \to 1.74 \ (\downarrow)\) | \(0.19 \to 0.18 \ (\downarrow)\) | \(0.11 \to 0.10 \ (\downarrow)\) | 旧类别判别边界出现侵蚀漂移 |
| TinyImageNet | VAST (本文) | \(2.00 \to 2.35 \ (\uparrow)\) | \(0.23 \to 0.28 \ (\uparrow)\) | \(0.12 \to 0.12 \ (\to)\) | FDR 逆势上升,有效抑制遗忘 |
关键发现¶
- 两模块协同弥补了传统蒸馏失效缺陷:单纯依赖蒸馏(Only Distill)虽然能提升指标,但由于缺乏稳定的结构锚点,蒸馏的目标本身就在漂移;引入 VRRM 稳固视觉底层几何后,两者结合使 CIFAR100 的最终准确率相比纯 LoRA 跃升了 3.07%(77.33% \(\to\) 80.40%),且标准差从 0.18 压低至 0.08,训练稳定性极大增强。
- 跨数据集泛化与零样本能力保持极佳:在 CIFAR100 训练完成后直接在未见数据集(Food101、ImageNet-100、ImageNet-1K)上测试 zero-shot 性能(表 2),基于回放的方法如 PROOF 和 RAPF 因严重过拟合下游任务,平均零样本精度分别暴跌至 52.49% 和 69.69%;而 VAST 达到了 74.28%,仅比原始冻结 CLIP 的 75.35% 微降 1.07%,显著优于同类非回放方法 ZSCL(70.77%)和 DMNSP(71.10%)。
- 层级选择敏感性验证:在自相似层选择实验中(图 7b),第 7 层(中间层)取得了 87.40% 的最高 Avg Accuracy,相比浅层(第 5 层 87.03%)和深层(第 9 层 86.76%)具备更优的平衡点——既避开了深层的过拟合敏感性,又包含了充足的高维抽象拓扑。
亮点与洞察¶
- 敏锐揭示模态不对称遗忘机理:通过 Fisher 信息定量分析,首次系统性指出双塔视觉语言模型在增量学习中存在视觉端剧烈动荡、文本端高度稳定的严重失衡,打破了以往将两模态对称微调或简单对齐的惯性思维。
- 中间层二阶自相似拓扑作为物理锚点:跳出常规在最后一层 CLS Token 上死磕特征模仿的套路,巧妙借助不受任务目标扰动的视觉中间层 Key-Key 自相关及其二阶矩阵乘积提取几何先验,构建了鲁棒的内在空间拓扑。
- 信息论矩阵 Rényi 熵代替点对点距离蒸馏:将连续学习中的知识保留升维到流形分布对齐层面,利用核 Gram 矩阵的 Rényi 联合熵度量结构散度,并配合随机置换正则化剔除噪声,在理论完备性与实证抗漂移上展现出双重优势。
局限与展望¶
- 计算复杂度随 Batch Size 呈二次方增长:矩阵 Rényi 联合熵的计算依赖于样本间的 Gram 矩阵求迹与乘积运算,复杂度与当前批次大小 \(N\) 呈 \(\mathcal{O}(N^2)\) 或更高关联,当 batch size 很大时显存开销与计算延迟增加明显。
- 自适应中间层选取的灵活性仍有不足:当前框架将自相似提取层硬性设定为 ViT 的第 7 层,对于不同深度(如 ViT-L、ViT-H)或分层卷积-Transformer 混合架构,缺乏数据驱动的动态层级自适应路由机制。
- 后续改进方向:可进一步探索随机投影或 Nyström 矩阵低秩近似以降低核 Gram 矩阵的计算开销,并将结构锚点思路迁移至多模态视频大模型与时空具身智能体策略的连续学习中。
相关工作与启发¶
- vs PROOF / RAPF: 这类方法依赖回放历史样本或伪样本缓存来缓解遗忘,但在真实隐私受限或存储极度受限的场景下不可行,且极易对训练集过拟合导致零样本通用表征急剧退化;VAST 坚持严格的 Exemplar-free(无回放)设置,零样本平均精度达到 74.28%,大幅领先 PROOF 的 52.49%。
- vs ZSCL / C-CLIP: 传统的无回放增量学习主要使用特征空间 MSE、余弦相似度或原型对比损失进行知识蒸馏;VAST 指出这些方法在视觉深层发生剧烈 Fisher 漂移时会盲目拟合不稳定特征,而 VAST 先以 VRRM 锚定空间几何,再用矩阵 Rényi 熵进行流形级对齐,从根本上阻断了漂移扩散。
- vs DMNSP: DMNSP 采用动态零空间投影(Null Space Projection)来限制参数梯度的更新方向;VAST 则从表征空间的内在几何结构与模态不对称性入手,在保持简洁的 LoRA 插入的同时,以显式构造视觉锚点的方法获得了更为优越的类间判别力(CIFAR100 FDR 提升至 2.97 vs 基线 2.08)。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次从 Fisher 信息与空间几何视角揭示双塔 VLM 的模态不对称遗忘机理,提出利用中间层二阶自相似构建视觉锚点及信息论矩阵熵蒸馏,理论视角深刻且机制精妙。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 个标准数据集、多种增量切分设置,包含详尽的模块消融、层级与超参敏感性分析、t-SNE 可视化、FDR 定量判别比以及跨任务 zero-shot 迁移评测。
- 写作质量: ⭐⭐⭐⭐⭐ 问题阐述引人入胜,从动机分析到数学建模环环相扣,逻辑推演严密,图表信息表达清晰直观。
- 价值: ⭐⭐⭐⭐⭐ 为多模态模型类增量学习提供了全新维度的基准范式,在模型轻量微调与长程记忆保持之间实现了极佳平衡。