跳转至

Dual-Generalization-aware Minimization for Continual Fine-Tuning of Vision-Language Models

会议: ECCV 2026
论文: ECCV 原文
领域: 多模态VLM
关键词: 持续学习、视觉语言模型、锐度感知最小化、零样本泛化、损失曲面几何

一句话总结

针对视觉语言模型在持续微调中因单任务局部平坦性难以抵御跨任务分布偏移而导致灾难性遗忘与零样本能力崩塌的问题,本文提出双重泛化感知最小化(DGM),通过在扰动生成中显式耦合预训练零样本对齐与任务内视觉不确定性,引导模型收敛至兼顾泛化与鲁棒性的联合平坦极小值。

研究背景与动机

大规模预训练视觉语言模型(如 CLIP)凭借强大的跨模态对齐表征与开放词表零样本迁移能力,正在成为连续学习与下游适应的重要基石。然而,当将这类基础模型部署在现实世界的连续任务流(Class-Incremental Learning, CIL)中进行序列微调时,模型不仅面临经典分类能力上的灾难性遗忘,还会遭受预训练通用表征受损、零样本泛化能力断崖式下跌的严重挑战。现有解决思路多聚焦于参数隔离(如动态路由、任务专属 Adapter 或 MoE)或特征层面的对齐正则约束,却普遍忽略了深层优化动力学与损失曲面几何形态对模型持续泛化特性的主导作用。

最近的优化理论与经验分析表明,损失曲面越平坦的极小值区域对数据分布偏移往往具备更强的鲁棒性与跨域泛化能力,尖锐极小值则是过拟合与遗忘的温床。然而,直接将单任务平坦度感知优化方法(如标准 SAM)迁移到 VLM 持续微调中存在根本性缺陷:当模型依次适应狭窄的下游任务时,优化过程同时受到参数敏感性与多重分布漂移的拉扯——既有广阔预训练分布与特定下游分布之间的固有鸿沟,又有先后任务之间的数据漂移。标准 SAM 仅基于当前任务训练损失构建最坏扰动,只能感知局部单一任务曲率;实验表明,在单任务上寻得的平坦盆地会在后续任务学习中迅速偏离漂移,且模型在未见分布(如 ImageNet-100 代理)上的零样本损失曲面持续剧烈恶化。

由此可见,单纯追求当前任务参数空间的局部平坦性,无法在持续学习的动态演进中充当跨任务稳定性的安全防线。模型亟需一种能够同时感知基础模型通用先验与当前任务扰动方向的优化机制。核心 idea:将持续微调的对抗扰动生成从单一任务损失扩展为预训练知识保持与任务内视觉鲁棒性的双重泛化探测(DGM),在内层最大化步骤中联合生成扰动向量,引导参数收敛至预训练通用空间与下游任务空间共同平坦的联合极小值。

方法详解

整体框架

Dual-Generalization-aware Minimization(DGM)是一种即插即用的优化器层级框架,无需引入额外的网络参数或改动模型结构,可无缝嵌入全参数微调、Adapter、LoRA 以及 MoE 等任意微调范式。其核心在于打破标准 SAM 仅用当前批次训练损失计算对抗扰动的惯例,构建包含零样本通用性探测与下游任务特异性鲁棒性探测的复合扰动损失 \(\mathcal{L}_{perturb}\)。在每次迭代中,模型首先在两路泛化探针引导下感知参数邻域内使通用表征崩塌或使任务拟合失效的最具破坏性扰动 \(\epsilon\),随后在扰动后的参数位置评估基础训练梯度并更新原始权重,使得优化步稳健地迈向多任务与零样本环境下的平坦盆地。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["当前任务批次样本 (x, y)"] --> B["双重泛化扰动目标构建<br/>聚合任务损失与复合扰动损失"]
    B --> C["零样本泛化探针<br/>对齐演进模型与冻结预训练模型概率分布"]
    B --> D["任务特异性鲁棒性探针<br/>基于视觉潜在特征统计矩注入高斯扰动"]
    C --> E["对抗扰动向量计算<br/>沿联合损失梯度上升方向生成邻域扰动 ε"]
    D --> E
    E --> F["扰动点梯度评估与参数更新<br/>在 θ+ε 处计算基础梯度更新主干/适配层"]

关键设计

1. 双重泛化扰动目标构建:将单任务梯度上升扩展为双分布联合曲率感知

传统锐度感知最小化(SAM)仅根据当前任务损失 \(\mathcal{L}_{train}\) 的梯度方向计算对抗扰动 \(\epsilon = \rho \frac{\nabla_\theta \mathcal{L}}{\|\nabla_\theta \mathcal{L}\|_2}\),这一机制在持续学习中极易导致优化轨迹落入狭隘的局部平坦区,该区域相对于未见类别和历史知识仍极其尖锐脆弱。为了强制优化过程探索同时威胁预训练通用性与任务鲁棒性的参数方向,DGM 构建了一个复合扰动损失 \(\mathcal{L}_{perturb}(\theta; \mathcal{D}_t) = \lambda_1 \mathcal{L}_{ZS}(\theta, \theta_0; \mathcal{D}_t) + \lambda_2 \mathcal{L}_{NV}(\theta; \hat{\mathcal{D}}_t)\)。最终的对抗极大极小优化问题被重塑为在参数 \(\ell_2\) 球邻域内同时最大化任务训练损失与双重扰动损失:

\[\min_{\theta} \max_{\|\epsilon\|_2 \le \rho} \left[ \mathcal{L}_{train}(\theta + \epsilon; \mathcal{D}_t) + \mathcal{L}_{perturb}(\theta + \epsilon; \mathcal{D}_t) \right]\]

通过一阶泰勒展开,对抗扰动向量 \(\epsilon\) 综合了训练分类损失梯度与复合扰动损失梯度之和的方向,从而在内层最大化搜索时兼顾了当前任务拟合与多分布稳定性。

2. 零样本泛化探针:以冻结模型先验锚定参数敏感方向

为防止微调过程中基础模型的开放词表通用语义对齐能力遭到不可逆侵蚀,该探针利用未受微调破坏的原始预训练模型 \(f_0\)(参数 \(\theta_0\) 保持冻结)作为通用知识基准。对于输入样本 \(x\),演进中的模型 \(f_t\) 计算当前类别的预测概率分布 \(P_t(x)\),而冻结参考模型 \(f_0\) 提供无偏的零样本预测分布 \(P_{ZS}(x)\)。探针采用 KL 散度衡量两者之间的分布差异:

\[\mathcal{L}_{ZS} = \text{KL}\big(P_t(x) \parallel P_{ZS}(x)\big)\]

\(\nabla_\theta \mathcal{L}_{ZS}\) 融入扰动计算的精髓在于:若某个参数移动方向会导致当前模型与原始零样本先验发生剧烈偏离,扰动生成阶段就会优先沿着该脆弱方向施加偏移,进而在外层最小化时迫使模型拉平对该方向的敏感度,实质上将模型收敛点锚定在预训练表征高鲁棒性的平坦峡谷内。

3. 任务特异性鲁棒性探针:通过潜在特征矩扰动模拟任务内分布漂移

为了防止模型对有限的当前任务训练样本产生表层特征过拟合、增强对同任务潜在视觉变化的抵御能力,该探针引入基于视觉不确定性的随机扰动机制。对于样本在潜在空间提取的视觉特征向量,该设计统计其特征维度的均值 \(\mu\) 与方差 \(\sigma^2\) 以近似样本内部的分布不确定性,并按噪声比例 \(\delta\) 合成带噪变体 \(\tilde{x}_i\)

\[\tilde{x}_i = \delta \mathcal{N}(\mu, \sigma^2) + (1 - \delta) x_i\]

构造出的含噪数据集 \(\hat{\mathcal{D}}_t = \{(\tilde{x}_i, y_i)\}_{i=1}^{N_t}\) 被代入基础分类目标中计算鲁棒性损失 \(\mathcal{L}_{NV} = \mathcal{L}_{train}(\theta; \hat{\mathcal{D}}_t)\)。借助该梯度 \(\nabla_\theta \mathcal{L}_{NV}\) 引导的扰动,模型在梯度回传时被动探索了邻近视觉流形上的最差误差,迫使参数解对局部视觉扰动展现出一阶平坦特性。

损失函数 / 训练策略

在算法实现上,DGM 维持了标准 SAM 优雅的计算闭环: 1. 扰动估计:对于当前批次数据,依次前向计算原始训练损失 \(\mathcal{L}_{train}\)、零样本 KL 损失 \(\mathcal{L}_{ZS}\) 及含噪样本损失 \(\mathcal{L}_{NV}\),反向传播获取联合梯度 \(G = \nabla_\theta [\mathcal{L}_{train} + \lambda_1 \mathcal{L}_{ZS} + \lambda_2 \mathcal{L}_{NV}]\); 2. 邻域极值:根据欧氏范数归一化生成对抗扰动步长 \(\epsilon = \rho \frac{G}{\|G\|_2}\); 3. 参数更新:在虚拟扰动点 \(\theta + \epsilon\) 处重新计算基础任务梯度 \(g = \nabla_\theta \mathcal{L}_{train}(\theta)|_{\theta+\epsilon}\),并调用基础优化器(如 Adam)完成实际参数更新 \(\theta \leftarrow \theta - \eta g\)。 该机制每迭代仅需 2 次前向与 2 次反向传播,由于原始分支与扰动分支共享基础特征提取计算,实际训练耗时仅温和增加,且不增加显存峰值。

实验关键数据

主实验

论文在 CIFAR-100、ImageNet-R、CUB-200、Tiny-ImageNet、ImageNet-100 以及 ImageNet-1K 共 6 个经典持续学习基准上进行了全面评测,骨干网络采用 CLIP ViT-B/16。对比范式涵盖全参数微调(ZSCL)、Adapter 类方法(RAPF, DMNSP, MoE4CL)以及 LoRA 体系(Finetune, MG-CLIP)。下表节选主流配置下的最终任务准确率(Last)与平均准确率(Avg.):

数据集 协议配置 基线方法 基线 Last / Avg. (%) 本文 (w/ DGM) Last / Avg. (%) 绝对增益 (Last / Avg.)
CIFAR-100 B0_Inc10 Finetune (LoRA) 79.30 / 86.88 81.12 / 87.69 +1.82 / +0.81
CIFAR-100 B0_Inc10 ZSCL (Full-FT) 78.33 / 85.34 80.45 / 86.81 +2.12 / +1.47
CIFAR-100 B0_Inc10 MoE4CL (Adapter) 78.95 / 86.05 80.62 / 87.12 +1.67 / +1.07
ImageNet-R B0_Inc20 Finetune (LoRA) 81.63 / 87.15 82.47 / 87.54 +0.84 / +0.39
ImageNet-R B0_Inc20 MoE4CL (Adapter) 81.88 / 87.32 83.07 / 88.03 +1.19 / +0.71
CUB-200 B0_Inc20 Finetune (LoRA) 58.97 / 70.31 60.75 / 71.24 +1.78 / +0.93
CUB-200 B0_Inc20 MG-CLIP 65.72 / 73.48 67.05 / 74.75 +1.33 / +1.27
Tiny-ImageNet B0_Inc20 ZSCL (Full-FT) 72.78 / 81.48 75.46 / 83.06 +2.68 / +1.58
ImageNet-100 B0_Inc10 ZSCL (Full-FT) 64.32 / 78.51 66.60 / 80.26 +2.28 / +1.75
ImageNet-1K B0_Inc100 Finetune (LoRA) 71.83 / 80.97 73.40 / 82.08 +1.57 / +1.11

此外,在持续学习完成后的未见数据集零样本泛化测试(在 CIFAR-100 训练后评估 Food101、ImageNet-100、ImageNet-1K)中,ZSCL 搭配 DGM 后零样本平均准确率达到 75.90%,相比原始 ZSCL(70.77%)提升了 +5.13%,甚至反超未微调的 CLIP 零样本基线(75.35%)。

消融实验

在 CIFAR-100、CUB-200 与 Tiny-ImageNet 上,以标准 LoRA Finetune 为基座对扰动目标中各分量的有效性进行严谨消融:

扰动目标配置 (\(\mathcal{L}_{train}\) / \(\mathcal{L}_{NV}\) / \(\mathcal{L}_{ZS}\)) CIFAR-100 Last / Avg. (%) CUB-200 Last / Avg. (%) Tiny-ImageNet Last / Avg. (%) 说明
\(\mathcal{L}_{train}\)(标准 SAM) 80.42 / 87.38 60.40 / 71.18 76.20 / 84.20 仅单任务平坦性,缺乏跨分布约束
\(\mathcal{L}_{train} + \mathcal{L}_{NV}\) 80.92 / 87.66 61.43 / 71.28 76.91 / 84.30 引入视觉扰动,提升当前任务鲁棒性
\(\mathcal{L}_{train} + \mathcal{L}_{ZS}\) 81.20 / 87.90 61.35 / 71.27 76.85 / 84.22 引入零样本对齐,抑制通用表征崩塌
Full DGM (\(\mathcal{L}_{train} + \mathcal{L}_{NV} + \mathcal{L}_{ZS}\)) 81.48 / 87.99 61.80 / 71.32 77.05 / 84.32 双重泛化协同,取得最优持续学习性能

关键发现

  • 双重探针的互补性机制:消融数据显示,单独使用 \(\mathcal{L}_{ZS}\)\(\mathcal{L}_{NV}\) 均优于单纯应用标准 SAM,而两者的融合带来了持续的累加增益。\(\mathcal{L}_{ZS}\) 侧重于保护预训练模型的全局对齐先验,大幅拉低向尖锐下游漂移的倾向;\(\mathcal{L}_{NV}\) 则通过注入样本特征矩统计噪声平滑了局部特征流形,提升了抗过拟合能力。
  • 损失曲面曲率显著平坦化:Hessian 矩阵谱分析证实,引入 DGM 后最大特征值 \(\lambda_{max}\) 与 Hessian 迹(Trace)相较于标准微调大幅缩减,Forward Transfer(正向迁移 FWT)提高,Backward Transfer(反向遗忘 BWT)显著减缓。
  • 训练收敛加速与计算开销优势:虽然每次迭代增加了扰动计算,但 DGM 优化的模型仅需 1 个 epoch 即可达到甚至超越基线训练 3-4 个 epoch 的准确率水平,使得整体收敛更为平稳且计算资源利用率高。

亮点与洞察

  • 从优化几何视角切入 VLM 持续微调:打破了过去纯靠“加模块、冻参数、存样本”的被动防御思路,首次指出标准 SAM 在单任务上的平坦解在持续学习多分布漂移下会迅速“脱轨”,确立了寻找“联合平坦解”的新方向。
  • 扰动空间的双目标协同设计:巧妙地将教师-学生分布蒸馏(KL 散度)与特征矩扰动转换成梯度上升阶段的探针,使得对抗扰动不是盲目地在当前任务上“找难样本”,而是精准朝着“最容易破坏预训练知识和最容易破坏视觉表征”的危险方向探测。
  • 即插即用且通吃多种范式:无论是全参数微调、参数高效微调(PEFT / LoRA / Adapter)还是 MoE 架构,只需替换内层扰动逻辑即可直接生效,具备极高的工程复用价值。

局限与展望

  • 作者指出的潜在局限:尽管共享特征抽取减轻了开销,但相比最朴素的 SGD/Adam 单次梯度反向传播,SAM 架构依然不可避免地多消耗一次前向与反向时间,对大规模大批次预训练仍有计算成本考量。
  • 实际应用层面的思考:特征扰动 \(\mathcal{L}_{NV}\) 目前采用全局均值与方差的高斯扰动形式,对于细粒度或空间结构高度敏感的任务(如密集预测、局部目标识别),纯统计矩噪声可能打乱语义一致性;未来可探索结构感知的空间特征扰动。
  • 未来改进方向:可进一步将双重泛化感知机制推广到多模态大语言模型(MLLM / VLM 生成式对话)的指令持续微调中,抑制语言理解与推理能力的灾难性遗忘。

相关工作与启发

  • vs SAM / GAM / C-Flat: 传统平坦度感知方法针对静态单任务或从零训练网络设计,仅以单任务损失为驱动;DGM 明确揭示了在预训练大模型持续适应场景下单任务平坦性面临的多分布漂移脆弱性,建立了结合基座先验的双重扰动生成范式。
  • vs ZSCL / RAPF: ZSCL 与 RAPF 主要依靠在外层损失中显式添加特征相似度惩罚或参数融合来保住旧知识;DGM 则是从几何优化层面重塑梯度探索方向,且能够作为底层优化引擎叠加在 ZSCL、RAPF 等方法之上,带来持续叠加的性能增益。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [从损失曲面多分布漂移几何视角解释 VLM 持续微调衰退,提出双重扰动探针设计巧妙]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 6 大 CIL 基准、6 种代表性架构范式,包含曲面可视化、Hessian 谱分析及未见集零样本泛化测试]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,从经验性几何失效反思直接引出针对性优化框架,论据扎实]
  • 价值: ⭐⭐⭐⭐⭐ [无需额外参数与架构改动的即插即用优化器,能普遍提升各类 VLM 持续微调的抗遗忘与零样本能力]