跳转至

COLA: Continual Orthogonal Low-Rank Adaptation for Class-Incremental Learning

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/autovisionproject/COLA
领域: AI安全 / 持续学习
关键词: 持续学习、类增量学习、低秩自适应、正交投影、灾难性遗忘

一句话总结

针对类增量学习中参数线性膨胀与回放缓冲区开销过大的双重痛点,提出免回放的持续正交低秩自适应框架 COLA,利用奥贾规则在线估计并整合全局特征协方差主特征结构,通过软正交投影算子将新任务特征对齐到互补子空间,在固定模型容量与零样本回放条件下显著抑制灾难性遗忘。

研究背景与动机

类增量学习(Class-Incremental Learning, CIL)旨在赋予深度模型在不断涌现的新类别数据流中持续学习的能力,但其核心面临着严峻的稳定-可塑性权衡与灾难性遗忘挑战。近年来,基于预训练大模型(PTMs)的微调策略成为 CIL 的主流方向,其强大的泛化先验显著减轻了表征漂移。然而,现有的提示微调(Prompt Tuning,如 L2P、DualPrompt、CODA-Prompt)和低秩自适应(LoRA,如 SD-LoRA)方案通常需要维护动态膨胀的提示池或按任务累积专有适配器,导致推理复杂度与模型参数量随任务数目线性暴增;另一方面,重放机制(如 HiDe-Prompt、InfLoRA)依赖存储大量旧任务代表性样本或历史特征嵌入,不仅带来昂贵的内存与显存开销,还在实际落地中面临严重的数据隐私合规风险。

现有的梯度投影法(如 OGD、GPM、InfLoRA 及 CoSO)尝试在正交梯度子空间中施加硬正交约束,但这类方法普遍高度依赖任务切换节点的奇异值分解(SVD),随着任务序列不断拉长,累积的基向量容易受到噪声污染与分布漂移影响,导致硬性约束破坏模型学习新任务的可塑性。

面对上述两难,本文跳出硬正交分解与样本回放的传统定势,提出将低秩自适应与协方差引导的流式特征子空间对齐相融合。核心 idea:在预训练 Vision Transformer 的注意力投影中植入固定容量的共享 LoRA 模块,并基于奥贾(Oja)流式学习规则增量估计特征协方差的主导特征结构,利用全局协方差矩阵构建软正交投影算子,将新任务更新动态导向历史子空间的互补正交方向,实现零回放、零参数膨胀且端到端可优化的类增量学习。

方法详解

整体框架

COLA 的整体架构在冻结的 Vision Transformer(如 ViT-B/16)骨干网络上构建,保持预训练骨干参数 \(\theta_0\) 完全冻结,仅在各注意力层的查询(Query)与数值(Value)投影矩阵上插入低秩适配器(秩 \(r=10\))。在增量数据流通过网络时,COLA 并不存储历史样本或旧任务模型副本,而是通过在线二阶统计量追踪任务表征的几何演化:

首先,输入样本映射到低维低秩空间后,先经由全局协方差矩阵诱导的软正交投影矩阵进行重构,将特征偏转至与旧任务互补的正交子空间;其次,在小批量前向传播中,利用类奥贾规则(Oja-inspired rule)在无梯度介入的情况下实时更新当前任务的特征协方差矩阵,并在固定批次间隔与任务切换点将其整合至全局协方差矩阵中;最后,将正交引导特征与原低秩表征通过自适应可学习残差系数进行融合,计算最终的注意力输出并计算标准分类损失。在推理阶段,所有任务共享同一套紧凑适配器与统一分类头,无需任何任务标识符(Task ID)路由或提示匹配,推理计算代价始终保持恒定。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入序列样本 x<br/>冻结 ViT 骨干网络 θ0"] --> B["低秩特征提取<br/>共享 LoRA 投影 z = A x"]
    B --> C["软正交投影算子<br/>基于全局协方差 Σ_global 构造 P 矩阵"]
    C --> D["奥贾规则在线协方差累积与整合<br/>流式更新任务协方差 Σ_task 并融入 Σ_global"]
    C --> E["自适应残差缩放与低秩特征融合<br/>结合可学习标量 γ 权衡可塑性与稳定性"]
    D -.->|增量统计支撑| C
    E --> F["集成注意力 QKV 计算与增量分类<br/>跨已见类别统一端到端无回放推理"]

关键设计

1. 协方差引导的软正交投影算子:抑制跨任务特征表征重叠

为了从根本上消除不同任务在共享低秩空间内的参数与表征干扰,传统方法通常采用显式 SVD 求解零空间(Null Space)并实施硬投影,这不仅计算代价高昂,而且在流式复杂数据下对微小估计偏差极其敏感。COLA 在每个注意力层维护一个维度仅为 \(r \times r\) 的全局协方差矩阵 \(\boldsymbol{\Sigma}_{\text{global}}^{(i)}\),其聚合了此前所有已学任务在低秩流形上的二阶主导统计量。基于该矩阵的 Frobenius 范数归一化,COLA 解析地构造软正交投影算子:

\[ \mathbf{P}^{(i,t)} = \mathbf{I}_r - \alpha \frac{\boldsymbol{\Sigma}_{\text{global}}^{(i)}}{\|\boldsymbol{\Sigma}_{\text{global}}^{(i)}\|_F} \]

其中 \(\alpha > 0\) 为正交缩放超参数。通过将低秩特征 \(\mathbf{z}^{(i,t)}\) 变换为 \(\tilde{\mathbf{z}}^{(i,t)} = \mathbf{P}^{(i,t)} \mathbf{z}^{(i,t)}\),算子沿全局主特征向量方向施加柔性衰减,从而将新任务的更新梯度与激活响应自然导引至未被先前任务充分占用的互补子空间。相较于截断式的硬正交投影,软投影机制容忍了流式统计估计过程中的细微噪声,保留了新概念所必需的学习可塑性。

2. 基于奥贾规则的在线特征协方差累积与整合:无参数爆炸的流式知识巩固

若要避免数据回放带来的内存占用与隐私泄露,系统必须能够以在线(Streaming)方式稳健沉淀历史任务的几何特征结构。COLA 借鉴经典的奥贾(Oja)主成分学习规则,在当前任务 \(t\) 的每个批次内计算投影后特征的局部二阶协方差:

\[ \mathbf{C}_{\text{batch}}^{(i,t)} = \frac{1}{B} \sum_{j=1}^B (\tilde{\mathbf{z}}_{q,j}^{(i,t)} - \bar{\mathbf{z}}_q^{(i,t)})(\tilde{\mathbf{z}}_{q,j}^{(i,t)} - \bar{\mathbf{z}}_q^{(i,t)})^\top \]

随后利用带有衰减项的在线微分增量规则持续修正当前任务协方差:

\[ \boldsymbol{\Sigma}_{\text{task}}^{(i,t)} \leftarrow \boldsymbol{\Sigma}_{\text{task}}^{(i,t)} + \eta (\mathbf{C}_{\text{batch}}^{(i,t)} - \beta \boldsymbol{\Sigma}_{\text{task}}^{(i,t)}) \]

其中 \(\eta\) 为统计学习率,\(\beta\) 为衰减因子。该机制使得 \(\boldsymbol{\Sigma}_{\text{task}}\) 能在数据流中以恒定空间渐进逼近当前任务特征流形的主特征空间,并有效抑制批次随机扰动。每隔 \(K\) 个训练批次,算法以动量系数 \(\lambda\) 将局部知识累积进全局协方差 \(\boldsymbol{\Sigma}_{\text{global}}^{(i)} \leftarrow (1-\lambda)\boldsymbol{\Sigma}_{\text{global}}^{(i)} + \lambda \boldsymbol{\Sigma}_{\text{task}}^{(i,t)}\);当任务结束进入下一任务时,将当前全部任务特征整合并重置局部统计量 \(\boldsymbol{\Sigma}_{\text{task}} \leftarrow \epsilon \mathbf{I}_r\)。整个过程全程无反向传播计算图保留,内存复杂度与任务数目完全解耦。

3. 自适应残差缩放与共享低秩适配器重用:动态平衡可塑性与稳定性

纯粹的正交投影虽然能极大保护旧知识免受覆盖,但过度约束会削弱模型拟合新任务判别性特征的能力。为了灵活调控稳定-可塑性权衡,COLA 设计了动态特征重组机制:

\[ \hat{\mathbf{z}}^{(i,t)} = \tilde{\mathbf{z}}^{(i,t)} + \gamma \mathbf{z}^{(i,t)} = (\mathbf{P}^{(i,t)} + \gamma \mathbf{I}_r)\mathbf{z}^{(i,t)} \]

其中 \(\gamma\) 为可学习的标量残差缩放因子。正交投影分支 \(\tilde{\mathbf{z}}\) 提供抗遗忘的结构性几何约束,而残差直通分支 \(\gamma \mathbf{z}\) 赋予模型保留任务特异性表征的自由度。融合后的适配向量随后作用于注意力参数生成,全模型在增量序列中仅训练一组维度固定的 LoRA 权重与统一线性分类头,实现了真正意义上的端到端参数高效持续适配。

损失函数 / 训练策略

在任务 \(t\) 训练阶段,骨干网络完全冻结,模型仅针对当前任务所含样本计算跨越所有已见类别的标准交叉熵损失:

\[ \mathcal{L}_t = -\frac{1}{n_t} \sum_{j=1}^{n_t} \log p(y_{t,j} \mid x_{t,j}; \theta_0, \{\mathbf{A}^{(i,t)}, \mathbf{B}^{(i,t)}\}_{i=1}^L, \gamma) \]

优化采用 Adam 优化器,学习率为 0.008,批大小为 128;投影超参设置为 \(\alpha=0.02\)、\(\eta=10^{-4}\)、\(\beta=0.01\)、\(\lambda=0.3\)、整合间隔 \(K=10\)。协方差矩阵的统计更新独立于反向传播图,在任务交替阶段仅执行加法合并与重置,无需繁琐的多阶段训练或蒸馏损失计算。

实验关键数据

主实验

在代表艺术风格域移的 ImageNet-R 基准上,COLA 在 10 任务、20 任务与 25 任务设置下均显著刷新 SOTA 水平。下表为与当前最具代表性的持续学习方法的系统对比(ViT-B/16 骨干,LoRA 秩固定为 10,测试指标均基于 4 次独立运行均值与标准差):

方法 ImageNet-R (10 Task) Acc (%) ImageNet-R (10 Task) AAA (%) ImageNet-R (20 Task) Acc (%) ImageNet-R (20 Task) AAA (%) ImageNet-R (25 Task) Acc (%) ImageNet-R (25 Task) AAA (%)
Full Fine-Tuning 60.57 ± 1.30 72.31 ± 1.23 49.95 ± 1.31 65.32 ± 0.92 40.12 ± 1.43 46.11 ± 0.98
L2P (CVPR 2022) 71.26 ± 0.65 76.13 ± 0.86 68.97 ± 0.57 74.16 ± 0.16 60.11 ± 1.09 65.12 ± 0.94
DualPrompt (ECCV 2022) 68.22 ± 0.30 73.81 ± 0.39 65.23 ± 0.45 71.30 ± 0.15 58.00 ± 0.66 64.32 ± 0.76
CODA-Prompt (CVPR 2023) 74.05 ± 0.41 78.14 ± 0.39 69.38 ± 0.34 73.95 ± 0.76 62.92 ± 0.34 67.11 ± 0.49
HiDe-Prompt (WACV 2024) 74.65 ± 0.14 78.46 ± 0.28 73.59 ± 0.21 77.93 ± 0.38 67.11 ± 0.43 70.56 ± 0.56
RanPAC (NeurIPS 2023) 74.58 ± 0.77 81.67 ± 0.48 72.40 ± 0.60 79.27 ± 0.40 71.17 ± 1.56 74.11 ± 0.32
InfLoRA (CVPR 2024) 74.75 ± 0.65 80.67 ± 0.56 69.89 ± 0.66 76.68 ± 0.76 68.01 ± 0.44 75.12 ± 0.16
VPT-NSP2 (2024) 78.25 ± 0.56 79.45 ± 0.76 74.68 ± 0.82 79.85 ± 0.61 67.12 ± 0.34 75.31 ± 0.46
PLAN (ICCV 2025) 75.25 ± 0.56 80.41 ± 0.33 73.25 ± 0.42 78.41 ± 0.26 71.43 ± 0.54 75.23 ± 0.45
CoSO (NeurIPS 2025) 76.52 ± 0.87 83.12 ± 0.76 72.52 ± 0.34 79.67 ± 0.65 67.35 ± 0.45 77.24 ± 0.43
SD-LoRA (ICLR 2025) 77.04 ± 0.51 82.55 ± 1.50 74.96 ± 0.40 80.02 ± 0.69 70.78 ± 0.43 74.71 ± 0.54
COLA (本文) 77.56 ± 0.35 83.40 ± 0.38 76.12 ± 0.44 82.27 ± 0.28 76.01 ± 0.38 82.11 ± 0.47

在对抗样本域移数据集 ImageNet-A 与细粒度分类数据集 CUB200(10 任务)上,COLA 同样全面超越现有最优方法:

方法 ImageNet-A (10 Task) Acc (%) ImageNet-A (10 Task) AAA (%) CUB200 (10 Task) Acc (%) CUB200 (10 Task) AAA (%)
L2P 42.94 ± 1.22 51.40 ± 1.96 65.18 ± 2.46 76.12 ± 1.29
DualPrompt 45.49 ± 0.90 54.68 ± 1.29 68.00 ± 1.20 79.40 ± 0.96
CODA-Prompt 45.36 ± 0.78 57.06 ± 0.96 71.92 ± 0.45 78.76 ± 0.77
HiDe-Prompt 42.70 ± 0.67 56.32 ± 0.48 69.12 ± 1.14 77.46 ± 1.01
InfLoRA 49.20 ± 1.12 60.92 ± 0.76 70.82 ± 0.44 81.39 ± 0.16
PLAN 54.12 ± 0.15 61.45 ± 0.76 67.14 ± 0.54 76.26 ± 1.17
CoSO 56.43 ± 0.16 65.54 ± 1.20 72.23 ± 0.87 81.62 ± 1.67
SD-LoRA 57.76 ± 0.51 66.56 ± 1.50 72.90 ± 0.79 82.07 ± 1.12
COLA (本文) 59.20 ± 0.87 67.46 ± 0.58 74.51 ± 0.88 84.38 ± 0.97

同时在计算复杂度与显存占用方面,COLA 单次前向仅需 32.22 GFLOPs(对比 InfLoRA/SD-LoRA 的 35.12 GFLOPs 与 Prompt 类的 70+ GFLOPs),可学习参数量仅 0.37M,且免存历史样本与特征(0.00M 存储特征)。

消融实验

针对残差缩放因子 \(\gamma\) 初始化权重的敏感性消融实验(均值基于 4 次独立运行):

初始 \(\gamma\) ImageNet-A Acc (%) ImageNet-A AAA (%) ImageNet-R Acc (%) ImageNet-R AAA (%) CUB200 Acc (%) CUB200 AAA (%) 说明
0.08 56.55 ± 2.15 65.95 ± 0.65 76.87 ± 0.24 81.44 ± 0.27 73.75 ± 0.86 82.10 ± 0.57 过分偏向正交投影,新任务可塑性受限
0.10 57.93 ± 1.35 66.06 ± 0.78 76.98 ± 0.44 82.12 ± 0.32 74.02 ± 0.84 83.10 ± 0.97 性能稳步上升
0.20 (默认) 59.20 ± 0.87 67.46 ± 0.58 77.56 ± 0.35 83.40 ± 0.38 74.51 ± 0.88 84.38 ± 0.97 最佳平衡点,兼具优异稳定性与可塑性
0.40 58.45 ± 1.87 65.43 ± 0.55 77.04 ± 0.52 82.10 ± 0.26 74.10 ± 0.81 83.03 ± 0.95 残差直通比例偏高,正交引导减弱
0.60 55.43 ± 1.34 62.88 ± 0.68 73.23 ± 0.54 78.87 ± 0.98 69.45 ± 1.08 80.12 ± 1.02 约束失效,退化为普通 LoRA,遗忘剧烈

针对投影位置的选择(Q/V vs K/V),在 10 任务与 20 任务下 Q/V 均全面超越 K/V(例如 ImageNet-R 10 任务 Q/V 达 77.56% Acc / 83.40% AAA,而 K/V 为 77.13% Acc / 83.09% AAA);在骨干泛化性上,ViT-B/16 在 ImageNet-R 上遗忘率仅 9.02%,即便在轻量级 DeiT-S/16 下也能维持 53.92% Acc 与 62.93% AAA,峰值显存仅需 5.28GB。

关键发现

  • 软正交投影是抗遗忘的核心引擎:消融显示移去软投影矩阵 \(\mathbf{P}\) 仅保留普通 LoRA 时,ImageNet-A、ImageNet-R 和 CUB200 的最终 Acc 分别急剧下跌 2.6%、2.7% 和 3.2%,证实单纯的参数低秩化不足以抵抗灾难性遗忘,几何子空间解耦才是决定性机制。
  • 长任务序列优势尤为突出:在 ImageNet-R 任务序列扩展至 25 任务时,先前最强基线 CoSO 与 SD-LoRA 的 Acc 分别跌至 67.35% 与 70.78%(AAA 分别为 77.24% 与 74.71%),而 COLA 依然保持了 76.01% Acc 与 82.11% AAA,不仅领先 SD-LoRA 达 5.23% Acc / 7.40% AAA,且相比 CoSO 取得 4.87% 的 AAA 优势,展现了长时程流式累积下极佳的抗衰退鲁棒性。
  • 残差缩放因子 \(\gamma\) 的极化效应明显:\(\gamma\) 偏小则模型因约束过硬产生欠拟合,\(\gamma\) 过大(如 0.60)则正交引导形同虚设,遗忘率大幅反弹,0.20 的设定精确地锁定了表征保真与正交迁移的最佳工作点。

亮点与洞察

  • 将 Oja 规则引入持续学习的低秩统计累积:传统正交方法需要在每个任务边界对全量特征运行 SVD,计算复杂度高且易发散;COLA 巧妙借用自适应信号处理中的 Oja 流式更新公式,在微小计算开销下无梯度沉淀协方差主成分,极具工程优雅性。
  • 软正交算子替代硬性投影:以全局协方差归一化矩阵构造柔性滤波项,既阻断了对历史重要特征空间的梯度写入,又避免了硬投影引起的零空间收缩困境,有效规避了传统投影法在新任务增多时可塑性窒息的问题。
  • 推理零开销与完全端到端:由于无需存储多套 LoRA 参数矩阵,也没有测试期的提示选择或近邻检索开销,所有低秩矩阵在推理时保持单通路运算,极为适合边缘计算与长序列流式部署。

局限与展望

  • 类别增量分类头的潜在偏置:虽然特征提取器在共享 LoRA 下获得了正交保护,但最后统一线性分类头依然可能受到任务间样本不平衡或新类别 logits 尺度的影响,未来可探索结合温度缩放或余弦分类头进一步固化决策边界。
  • 低秩维度固定的容量上界:目前所有任务共享秩为 10 的单一适配器,当增量任务扩展到数百个极度异质的领域时,极低秩空间的正交子空间容量可能会趋于饱和,引入动态自适应秩或稀疏正交基将是值得探索的方向。

相关工作与启发

  • vs InfLoRA (CVPR 2024):InfLoRA 采用严格的梯度正交投影,但依然需要在任务切换时缓存旧样本进行回放以校正特征偏移;COLA 做到完全零回放,且将正交约束转化为特征级软投影,大幅降低存储开销与计算复杂度。
  • vs CoSO (NeurIPS 2025):CoSO 在任务边界显式应用 SVD 计算正交子空间,随着任务增加,基向量积累使得优化空间受到过度压缩,导致 25 任务 ImageNet-R 性能显著退化;COLA 通过单一直显的全局协方差统计整合,实现了平滑渐进的软约束,在长序列任务上展现出压倒性韧性。
  • vs SD-LoRA (ICLR 2025):SD-LoRA 虽然也追求免回放,但其将幅值与方向解耦后仍需要顺序累积各任务的专用 LoRA 参数,内存随任务数量线性增长;COLA 在全部任务中复用单一 LoRA 适配器,维持完全恒定的参数量(0.37M)。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [将 Oja 流式主成分规则与 LoRA 软正交子空间对齐有机统一,彻底摆脱了 SVD 与样本重放的桎梏]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖 ImageNet-R 10/20/25 任务、ImageNet-A 及 CUB200,详细比对了 GFLOPs、显存、多骨干网络及参数敏感性]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述紧凑清晰,数学推导与算法流程逻辑连贯,图表呈现扎实]
  • 价值: ⭐⭐⭐⭐⭐ [为大规模预训练模型在边缘端与严格数据隐私保护场景下的持续学习提供了极具工程价值的高效范式]