Online Versatile Incremental Learning: Towards Class and Domain-Agnostic Adaptation at Any Time¶
会议: ECCV 2026
论文: ECCV 官方页面
代码: https://github.com/KU-VGI/Online-VIL
领域: 持续学习 / 在线增量学习
关键词: 在线持续学习、多能增量学习、测地流核、拓扑保持、即时推理
一句话总结¶
针对真实感知流中类别概念与视觉域并发、连续且无边界转移的在线多能增量学习(Online VIL)设定,论文提出 TopFlow 框架,通过域无关流匹配(DFM)将中间层表示拉向语义几何并推离域敏感偏置,结合全局拓扑保持(GTP)维护无回放下的特征空间相对关系,显著刷新各基准的即时与最终识别精度。
研究背景与动机¶
持续学习旨在使视觉系统在面对不断变化的数据分布时,既能吸收新知识又能克服灾难性遗忘。然而,传统持续学习研究大多严格隔离了演化维度,要么假设视觉域固定、类别不断增加的类增量学习(CIL),要么假设类别固定、图像风格或采集环境变化的域增量学习(DIL)。即使是近期提出的多能增量学习(VIL),也仍然依赖人为设定的离散任务划分与显式任务边界,模型能够在每个阶段完整访问该阶段的静态数据集。这种人为抽象与现实场景脱节:在自动驾驶或移动机器人部署中,数据以单趟流式(Online)方式到达,光照、天气或城市等视觉域的转移与未知障碍物类别的涌现往往是同时、平滑且毫无预兆发生的,系统根本无法获知当前分布转移究竟源自类别还是视觉域。
在缺乏全局上下文和任务边界的在线流式学习中,模型不仅受限于极小的批次和单趟遍历(Single-pass)约束,更面临严重的局部可见性与表征漂移矛盾。当每个输入批次仅包含少部分类别与偶发的域组合时,模型极易过度拟合当前批次的瞬时域特征,导致已有类别表征被灾难性扭曲。作者通过对冻结预训练 Vision Transformer(ViT)做逐层特征分析发现,中间浅层特征高度聚集于域风格与光照模式,而深层特征则展现出清晰的语义类别聚类。这表明若直接端到端微调或简单对齐,浅层的域偏置将直接污染跨任务泛化;同时,局部批次类别的缺失会导致特征协方差矩阵产生严重的秩亏损(Rank Deficiency),使特征空间盲目收缩并挤压未见类别的生存空间。
基于上述深层表征的分层解耦特性与流式拓扑退化本质,本文致力于构建无需回放缓存且对类和域均无关的在线自适应范式。核心 idea:将在线增量表征学习解耦为几何引导的特征流重构与全局关系保持,提出 TopFlow 框架,利用域无关流匹配(DFM)消除中间层的瞬时域敏感偏置,并通过非参数聚类驱动的全局拓扑保持(GTP)在无回放条件下锚定特征空间的相对几何结构。
方法详解¶
整体框架¶
TopFlow 专注于在无显式任务边界、单趟遍历且无回放缓存(Replay-free)的在线数据流中持续优化预训练 ViT 的微调参数(如轻量级视觉提示 Prompt)。整个学习管线围绕流式特征的几何约束展开:输入图像批次输入冻结的 ViT 主干网络,获取中间层表征与末层语义锚点;随后通过域无关流匹配(DFM)对提取的跨层公共子空间做投影对比,迫使可自适应中间特征朝末层类别语义流向靠拢;与此同时,全局拓扑保持(GTP)在末层利用参数无关聚类生成批次原型,与 EMA 滑动维护的全局原型做匈牙利匹配,并通过紧凑的关系向量约束全局拓扑几何不变性。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["流式输入批次 $x_t$<br/>(类别与视觉域无边界交织)"] --> B["冻结预训练 ViT 编码器<br/>提取多层级表征"]
B --> C["域无关流匹配 DFM<br/>提取跨层共享子空间 $U$ 归一化对比"]
B --> D["全局拓扑保持 GTP<br/>FINCH 聚类提取批次原型 $p^b$"]
C --> E["语义拉近与域偏置推离<br/>消除中间层瞬态域特征污染"]
D --> F["匈牙利匹配与 EMA 原型更新<br/>关系向量 $\phi$ 约束原型相对位置"]
E --> G["综合优化目标 $L_{\text{total}}$<br/>更新视觉提示与分类头参数"]
F --> G
关键设计¶
1. 域无关流匹配(DFM):跨层公共子空间投影与方向解耦 在缺乏标注的多变流式环境中,直接估计域间 Grassmann 流形极为困难。DFM 另辟蹊径,将网络层级作为几何演化维度,利用浅层偏域特征、深层偏类特征的先验,重构测地流核(GFK)的投影机制。对于批次中第 \(n\) 层的中间特征 \(h_n\) 与第 \(l\) 层的末层特征 \(h_l\),将其拼接构建联合特征矩阵 \(H = [h_n^T, h_l^T]^T\) 并进行奇异值分解 \(H = U \Sigma V^T\),提取表征跨层共享相关方向的正交正规基 \(U\)。为消除幅值波动与批次特异噪声,模型在正交子空间 \(U\) 上对特征做投影归一化,并将末层对应样本特征 \(h_l^{(i)}\) 作为正样本锚点,将中间层未消除域偏置的特征以及批次内其他样本的末层特征作为负样本集合 \(H^-(i)\),构建流匹配对比损失: $\(L_{\text{DFM}} = -\frac{1}{M} \sum_{m=1}^M \log \frac{\exp(\cos(h_n'^{(m)} U, h_+^{(m)} U) / \tau)}{\sum_{z \in \{h_+^{(m)}\} \cup H^-(m)} \exp(\cos(h_n'^{(m)} U, z U) / \tau)}\)$ 该设计通过显式推开代表局部瞬态变化的浅层域特征基,迫使中间可学习参数(提示向量)仅沿通向最终语义的传输方向优化,从而在不增加复杂流形微积分计算开销的前提下,从机制上剥离域敏感干扰。
2. 全局拓扑保持(GTP):基于原型关系的无回放流形自稳定 在线持续学习中,由于单个批次仅能观测到极少数类别 \(k < C\),其经验协方差矩阵严重秩亏损,常规梯度更新会不可逆地压缩未见类别的特征空间。GTP 放弃了显式缓存历史样本的高昂代价,转而维护一组动态演化的粗粒度全局原型 \(\{\bar{p}_j^g\}_{j=1}^k\)。在每个输入批次到达时,首先利用无参数的 FINCH 层次聚类从末层特征中提取批次原型 \(\{p_i^b\}_{i=1}^k\);随后借助匈牙利算法求解批次原型与历史全局原型的最小欧氏距离二分图匹配 \(\varsigma^*\),并以衰减率 \(\varrho = 0.99\) 执行指数移动平均(EMA)平滑更新: $\(\bar{p}_{\varsigma^*(i),\text{new}}^g = (1 - \varrho)\bar{p}_{\varsigma^*(i),\text{old}}^g + \varrho p_i^b\)$ 为了超越单点原型距离、更完整地刻画高维特征流形的几何排布,GTP 引入轻量级双层感知机映射函数 \(\phi: \mathbb{R}^{2d} \to \mathbb{R}^m\),对拼接的原型对生成关系向量 \(r_{i,j}^b = \phi([p_i^b; p_j^b])\)。GTP 损失函数直接约束批次相对拓扑与全局相对拓扑的一致性: $\(L_{\text{GTP}} = \sum_{i=1}^k \sum_{j \neq i}^k D\left(r_{i,j}^b, \bar{r}_{\varsigma^*(i), \varsigma^*(j)}^g\right)\)$ 其中 \(D\) 为余弦距离。该设计允许模型在仅有局部样本可见时,依然通过非对角关系约束将特征空间维持在全局稳定的构型上,避免已学类别簇发生空间塌缩。
损失函数 / 训练策略¶
TopFlow 的端到端训练目标融合了分类交叉熵损失与两项几何正则化项: $\(L_{\text{total}} = L_{\text{CE}} + \lambda_{\text{DFM}} L_{\text{DFM}} + \lambda_{\text{GTP}} L_{\text{GTP}}\)$ 其中 \(L_{\text{CE}}\) 配合 Logit Mask 使用,防止未出现在当前观测窗口中的分类头被错误负采样抑制。主干 ViT 权重全程保持冻结,仅微调插入的视觉提示(Visual Prompts)和轻量分类投影头。优化器采用 Adam,学习率设为 \(5 \times 10^{-3}\),训练批次大小为 64,原型关系映射网络 \(\phi\) 隐层维度在 CORe50 和 CLEAR100 上分别配置为 64 与 32,输出关系向量维度 \(m=10\)。
实验关键数据¶
主实验¶
实验在 iDigits(5 个增量任务)、CORe50(10 个增量任务)以及 CLEAR100(10 个增量任务)三个多维平滑演化基准上展开。评测采用即时推理全过程曲线下面积(AAUC)与最终测试精度(ALast)两个核心指标。下表总结了无回放缓存(Replay-free)设定下的主要方法对比数据(原论文 Table 1):
| 数据集 / 指标 | iDigits AAUC (%) | iDigits ALast (%) | CORe50 AAUC (%) | CORe50 ALast (%) | CLEAR100 AAUC (%) | CLEAR100 ALast (%) |
|---|---|---|---|---|---|---|
| 理论下界(Sequential FT) | 13.45 ± 0.62 | 12.71 ± 3.34 | 3.39 ± 0.10 | 3.24 ± 1.09 | 2.38 ± 0.32 | 2.66 ± 0.55 |
| EWC [21] | 20.07 ± 2.84 | 14.67 ± 3.61 | 18.60 ± 4.64 | 16.07 ± 1.56 | 23.61 ± 3.11 | 19.93 ± 1.33 |
| LwF [30] | 19.61 ± 3.50 | 15.38 ± 1.04 | 25.27 ± 3.77 | 21.97 ± 4.22 | 23.80 ± 2.24 | 21.70 ± 4.19 |
| CODA-P [46] | 23.96 ± 4.74 | 20.62 ± 3.47 | 54.06 ± 5.32 | 48.88 ± 2.92 | 28.82 ± 5.77 | 25.61 ± 3.52 |
| SLCA [61] | 35.81 ± 3.98 | 24.88 ± 2.82 | 33.49 ± 4.47 | 27.36 ± 2.06 | 32.16 ± 2.28 | 31.70 ± 1.13 |
| PEC [60] | 34.77 ± 3.02 | 28.01 ± 2.69 | 51.35 ± 4.39 | 46.95 ± 2.28 | 53.93 ± 3.20 | 51.66 ± 2.09 |
| ICON [42] | 33.60 ± 2.16 | 30.63 ± 2.77 | 49.42 ± 3.29 | 45.15 ± 2.94 | 59.38 ± 2.46 | 58.60 ± 2.57 |
| S6MOD [32] | 31.18 ± 1.62 | 30.42 ± 2.55 | 52.33 ± 2.74 | 47.20 ± 3.15 | 59.60 ± 2.79 | 57.47 ± 2.48 |
| DUCT [63] | 36.46 ± 3.48 | 30.94 ± 2.41 | 53.66 ± 4.37 | 47.24 ± 1.28 | 66.79 ± 2.94 | 65.46 ± 3.40 |
| MVP [38] (最强基线) | 38.29 ± 5.74 | 31.05 ± 3.15 | 58.30 ± 4.48 | 52.84 ± 1.17 | 79.73 ± 3.59 | 77.11 ± 2.33 |
| TopFlow(本文) | 48.52 ± 1.25 | 32.18 ± 1.01 | 64.51 ± 2.50 | 66.20 ± 4.18 | 87.12 ± 0.01 | 80.64 ± 2.67 |
| 理论联合训练上限(Joint) | - | 87.18 ± 0.13 | - | 91.66 ± 0.25 | - | 94.36 ± 0.28 |
在引入经验回放(Buffer 500 / 2000)的进阶设定中(原论文 Table 2),TopFlow 在 CORe50(Buffer 500)下达到 85.16% AAUC / 91.14% ALast,相比 MVP-R(83.26% / 80.16%)最终精度超出 10.98 个百分点,且逼近全量联合训练上限。
消融实验¶
针对 DFM 与 GTP 各自独立性及其协同效应,论文在 CORe50 数据集上开展了系统性消融评测(原论文 Table 3):
| 模型配置 | DFM 模块 | GTP 模块 | AAUC (%) | ALast (%) | 说明与增益分析 |
|---|---|---|---|---|---|
| MVP Baseline | - | - | 58.30 | 52.84 | 原始提示微调基线 |
| + DFM | ✓ | - | 64.13 | 64.57 | 剥离域偏置,ALast 提升 +11.73% |
| + GTP | - | ✓ | 63.95 | 65.28 | 稳定全局特征拓扑,ALast 提升 +12.44% |
| TopFlow(完整模型) | ✓ | ✓ | 64.51 | 66.20 | 两者互补协同,ALast 累计提升 +13.36% |
此外,在对 DFM 选取的网络层对 \((n, l)\) 的消融实验中(原论文 Table 5,无 GTP 条件): - 选择浅层配对 \((0, 5)\) 时,ALast 下跌至 49.92%(相比基线 52.84% 发生严重负迁移); - 选取中后层 \((5, 10)\) 与 \((6, 11)\) 分别取得 52.98% 与 54.82% 的优异表现; - 证明浅层特征因语义过度贫乏无法与末层语义几何对齐,而深层特征能够在抽象性与兼容性之间达到最优折中。
关键发现¶
- 双模块互补性显著:单独加入 DFM 或 GTP 均可为 CORe50 带来超过 11% 的绝对增益,两项机制分别针对流式表征中的“域特征污染”与“局部类采样导致的流形扭曲”,协同使用时性能最佳。
- 即时自适应能力突破:在反映任意时间点推理能力的 AAUC 指标上,TopFlow 在 iDigits 和 CLEAR100 上较原 SOTA 分别大幅提高 10.23% 和 7.39%,证明其特征几何演化平滑稳定,无突发崩塌。
- 即插即用迁移性:将 DFM 和 GTP 独立插入到 CODA-P 和 PEC 等主流架构中(原论文 Table 6),CODA-P 最终准确率从 49.13% 跃升至 54.62%,验证了模块的高通用性。
亮点与洞察¶
- ViT 层级表征机理的新发现:作者通过量化探针与 t-SNE 验证了预训练 ViT 在动态流中的层级表征分工——浅层偏向纹理与光照等域属性,深层偏向抽象类别语义。这一洞察打破了盲目全网络流形对齐的惯性思维,为跨层流匹配提供了坚实的理论立足点。
- 低成本全局拓扑重构:GTP 摒弃了计算昂贵的谱流形度量,将拓扑保持巧妙拆解为“无参数聚类提取原型 + 匈牙利二分图匹配追踪 + 紧凑 MLP 关系向量相似度约束”,在严格单趟流与无回放限制下成功维系了全局流形稳定性。
- 从离散到连续现实的范式跨越:首次系统化定义了在线多能增量学习(Online VIL),揭示了已有 CIL/DIL 以及离散 VIL 方法在面对平滑、动态且无边界的双重转移时的脆性,为学术界贴近真实物理部署提供了更真实的基准场景。
局限与展望¶
- 随机任务构建引入的方差:Online VIL 采用随机种子驱动类别与域的动态消长,尽管增强了现实模拟度,但不同序列下的性能方差依然存在,在大规模数据集上评估时计算成本较高。
- 原型簇数的预设先验:GTP 目前依赖 FINCH 聚类生成的固定上限原型数量,当流式输入中类别数量发生极端暴增或剧烈震荡时,固定的拓扑表达粒度可能面临表征容量瓶颈。
- 改进方向:可进一步探索自适应动态调整原型容量的贝叶斯非参数机制,并将 DFM 扩展至多模态大模型(VLM)在具身智能交互场景下的实时无遗忘自适应。
相关工作与启发¶
- vs MVP [38]: MVP 侧重于利用随机模糊边界下的掩码和视觉提示调整,但在处理并发连续的域转移时缺乏显式的域解耦机制;TopFlow 在此基础上引入 DFM 与 GTP,直接攻克了跨层域偏置与未见类拓扑塌陷难题,无回放场景下 ALast 提升超过 13 个百分点。
- vs ICON [42]: ICON 是离散离线 VIL 场景下的代表方法,依赖明确的阶段划分与离线批次迭代,在进入单趟极度受限的 Online VIL 场景后表现剧烈下滑(CORe50 ALast 仅 45.15%);而 TopFlow 展现出对离线与在线双重场景的全面鲁棒性。
- vs 传统 GFK [12]: 传统测地流核需要完全静态且全量可访问的源域与目标域数据以构建 Grassmann 流形;本文的 DFM 摆脱了离线多域假设,创新性地以神经网络深浅层为几何端点,实现了流式动态环境下的即时流匹配。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次提出真实的 Online VIL 问题设定,并创新提出层级流匹配与关系向量拓扑保持机制]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3 个基准,兼顾无回放与有回放设定,提供详尽的逐层消融、可插拔验证及 t-SNE 几何演化追踪]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑链严密,从 ViT 层级实验发现自然引出方法设计,数学推导与示意清晰]
- 价值: ⭐⭐⭐⭐⭐ [有力推进了持续学习从理想化任务切分向真实连续无边界环境的落地进程,具备很强的工程借鉴意义]