跳转至

DiscoVL: Unveiling Disentangled Cross-Modal Representation Learning via Orthogonal Adversarial Regularization for Vision-Language Models

会议: ECCV 2026
论文: ECCV 官方
领域: 多模态 VLM
关键词: 视觉语言模型、跨模态解耦、正交对抗正则化、提示学习、小样本泛化

一句话总结

DiscoVL 提出跨模态解耦表征学习框架,通过多分支低秩残差对齐器显式解耦共享语义与下游任务特征,并引入正交对抗三元组正则化抑制表征向类别质心坍缩,在 15 个基准测试中显著提升了视觉语言模型的基础与新类泛化能力。

研究背景与动机

以 CLIP 为代表的预训练视觉语言模型在海量图像-文本对上学到了强大的跨模态联合表征,展现出极佳的零样本迁移潜力。为将这些大模型高效适配到下游专业领域,参数高效提示学习(Prompt Learning)迅速成为主流范式,如 CoOp、CoCoOp、PromptSRC 和 MMRL 等方案,通过冻结预训练骨干网络并引入少量可微调的提示词向量或跨模态表征 Token,有效避免了全参数微调的高额计算开销和灾难性遗忘风险。然而,现有方法普遍采用单一体表征空间来拟合下游监督信号,忽略了一个关键的表征纠缠难题。

在下游自适应微调过程中,特定类别的判别线索(Class-specific cues)与预训练中继承的通用可迁移知识(Class-agnostic priors)在单一潜在空间中紧密混杂。这种表征纠缠诱发了三重连锁问题:首先,针对目标数据集特定类别的强行适配会持续侵蚀通用的语义子空间,导致模型特征脱离预训练语义锚点,损害对未知新类的零样本迁移能力;其次,现有对齐机制往往采用刚性的跨模态投影,忽视了视觉与文本模态固有的分布鸿沟,跨层传递时误差层层放大,导致跨模态表征失真;第三,常规对比约束或交叉熵目标极易诱导表征 Token 快速向训练类别的质心坍缩,抹杀了未知类别泛化所需的细粒度几何流形结构。

为了从根本上消除这一结构性缺陷,本文提出显式解耦的表征学习思路:将自适应表征空间解耦为保留 CLIP 通用先验的共享子空间,以及专门捕获下游判别特征的任务特定子空间。核心 idea:通过多分支低秩对齐与双向跨模态反馈实现视觉-文本深层特征的显式解耦与动态融合,并结合正交对抗三元组正则化打破特征相关性与质心坍缩,在大幅精简参数的同时兼顾基础类别拟合与未知新类泛化。

方法详解

整体框架

DiscoVL 整体基于冻结的 CLIP 架构构建,由图像编码器与文本编码器双塔组成。从预设的高层层级 \(Q\)(实验中设为第 6 层)开始,模型在 Transformer 的前向计算流中引入一组可学习的表征 Token。整个自适应流由两大协同组件驱动:解耦跨模态表征对齐器(DCRA)负责在多层间将表征分解到多个低秩子空间并进行视觉-文本双向信息注入;正交对抗表征学习(OARL)模块则对最终输出的图像类别特征与自适应表征特征施加正交解耦与对抗三元组正则化,防止特征退化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与文本 Prompt"] --> B["多分支低秩残差对齐<br/>门控加权分解为 E 个低秩子空间"]
    B --> C["双向跨模态交互反馈<br/>底层文本注视/高层视觉反馈"]
    C --> D["特征投影与分类预测<br/>冻结路径提取 fk / 适配路径提取 fa"]
    D --> E["对抗三元组表征约束<br/>拉近同类表征/推开异类图像特征"]
    D --> F["正交特征去冗余正则化<br/>Frobenius 范数正交惩罚,抑制质心坍缩"]
    E --> G["综合损失联合优化反向传播"]
    F --> G

关键设计

1. 多分支低秩残差对齐:动态捕获跨层多子空间细粒度信息 现有交互表征方法(如 MMRL++)通常只将投影核简单分解为全局共享矩阵与单路低秩残差,缺乏根据输入内容动态挑选表征子空间的能力。针对这一局限,DCRA 将残差适配项扩展为包含 \(E\) 个分支的多低秩子空间集合。对于模态 \(m \in \{i, l\}\),第 \(\ell\) 层的权重投影矩阵定义为全局共享分量与动态加权残差之和:

\[F_\ell^m = F_{\text{shared}}^m + \sum_{e=1}^{E} o_e^\ell J_e^\ell D_e^\ell\]

其中 \(J_e^\ell \in \mathbb{R}^{d_a \times a_1}\)\(D_e^\ell \in \mathbb{R}^{a_1 \times d_m}\) 是分支专属的低秩分解矩阵(低秩维度 \(a_1=4\)),而标量权重 \(o_e^\ell\) 由轻量门控函数结合 Softmax 自适应预测:\(o^\ell = \text{Softmax}(g(F_\ell^m))\)。该门控机制让网络在不同网络深度根据当前输入动态激活最相关的几何子空间,从而在保持极致轻量化的同时,有效拟合复杂多样的数据分布。

2. 双向跨模态交互反馈:消解模态分布鸿沟并自适应信息重构 为打破单向特征传递造成的模态分布不对齐与跨层累积漂移,DCRA 建立了层次化的双向信息循环反馈。在较低的浅层 Transformer 区间,模型通过变换矩阵 \(Z_{T2I}\) 将文本流的高阶语义先验映射并注入到视觉表征 Token 中;而在高层深层区间,模型逆转信息流向,通过投影矩阵 \(Z_{I2T}\) 将视觉特征摘要回注到文本表征序列中。交互过程受可学习门控标量 \(\rho(\ell)\) 动态调控:

\[A_\ell^{i'} = (1 - \rho(\ell)) F_\ell^i(A_\ell^i) + \rho(\ell) Z_{T2I}(F_\ell^l(A_\ell^l))\]
\[A_\ell^{l'} = (1 - \rho(\ell)) F_\ell^l(A_\ell^l) + \rho(\ell) Z_{I2T}(F_\ell^i(A_\ell^{i'}))\]

门控因子 \(\rho(\ell)\) 使得模型在每个深度自适应权衡保留本模态纯净线索与吸纳互补模态信息的比例,消除了跨模态表征的不一致性,使跨层表征过渡更为平滑稳定。

3. 对抗三元组表征约束:拉近同类表征并分离异类判别特征 针对微调过程中表征 Token 容易在单一目标损失下迷失语义边界的问题,OARL 构建了跨模态类别级对抗三元组机制。以类别 \(k\) 的图像类别特征 \(f_k = Z_{\text{img}}^k(k_L)\) 作为锚点,以同类别聚合表征特征 \(f_a = Z_{\text{img}}^a(a_L)\) 作为正样本,并采样非同类 \(k' \neq k\) 的图像特征 \(f_{k'}\) 作为负样本。三元组损失函数施加如下间隔约束:

\[\mathcal{L}_{\text{atr}}^k = \max\left(0, \|f_k - f_a\|_2^2 - \|f_k - f_{k'}\|_2^2 + m\right)\]

该约束强力驱动自适应表征向同类别视觉流心靠拢,同时排斥非本类视觉嵌入,迫使表征向量在保留类别专属判别力的同时,与通用的图像特征在几何上实现清晰解耦,抑制任务间知识互相污染。

4. 正交特征去冗余正则化:打破相关性以彻底抑制类别质心坍缩 单纯的三元组约束在实际迭代中仍易诱发所有特征 Token 聚集退化到孤立的类别质心上,使嵌入空间缺乏流形支撑。OARL 引入基于 Frobenius 范数的正交正则化项,强制表征矩阵的特征向量相互正交独立,切断维度间的冗余相关性:

\[\mathcal{L}_{\text{ortho}}^k = \zeta \cdot \left\| I - \frac{X^k (X^k)^T}{\|X^k\|_F^2} \right\|_F^2\]

其中 \(X^k \in \mathbb{R}^{M \times d_i}\) 为堆叠的表征特征矩阵,\(I\) 为单位矩阵。通过惩罚非对角线上的内积能量,模型保证了每个特征维度捕获互不重叠的正交信息,彻底避免了对抗扰动利用特征冗余引发的表征崩溃,大幅巩固了未见新类的几何外推边界。

损失函数 / 训练策略

模型端到端总训练目标联合了分类判别损失、预训练特征保持损失以及正交对抗正则项:

\[\mathcal{L}_{\text{total}} = \alpha \mathcal{L}_{\text{ce}}^k + (1 - \alpha)\mathcal{L}_{\text{ce}}^a + \beta(\mathcal{L}_{\text{cos}}^i + \mathcal{L}_{\text{cos}}^l) + \gamma(\mathcal{L}_{\text{atr}}^k + \mathcal{L}_{\text{atr}}^{k'} + \mathcal{L}_{\text{ortho}}^k + \mathcal{L}_{\text{ortho}}^{k'})\]

其中 \(\mathcal{L}_{\text{cos}}^i\)\(\mathcal{L}_{\text{cos}}^l\) 分别测量微调后的图像/文本特征与冻结 CLIP 原生特征的余弦距离,防止骨干知识被灾难性冲刷。超参数设置为 \(\alpha = 0.7, \beta = 0.5, \gamma = 0.3\),表征 Token 数 \(M=5\),注入起始层 \(Q=6\),低秩阶数 \(a_1=4, a_2=64\)。在推理阶段: - 基础类别推断:结合类别特征与适配表征特征的双路概率输出:\(p(y=k \mid x) = \alpha p(y=k \mid f_k) + (1-\alpha) p(y=k \mid f_a)\); - 未知新类推断:仅使用保持原生泛化先验的类别特征单路推断:\(p(y=k \mid x) = p(y=k \mid f_k)\),阻断下游偏置向未见类别的有害渗透。

实验关键数据

主实验

在 11 个标准数据集的 Base-to-Novel 泛化设置下(16-shot),DiscoVL 与当前前沿方案全面对比。DiscoVL 在 7 个数据集上取得最佳调和平均值(HM),整体平均指标均创下新 SOTA。

方法 Base Acc (%) Novel Acc (%) 调和平均值 HM (%) 说明
CoOp (IJCV 2022) 82.69 63.22 71.66 经典单模态提示学习,新类退化严重
CoCoOp (CVPR 2022) 80.47 71.69 75.83 图像条件文本提示,缓解新类过拟合
MaPLe (CVPR 2023) 82.28 75.14 78.55 双模态多层提示分支微调
PromptSRC (ICCV 2023) 84.26 76.10 79.97 自正则提示微调,保持无监督知识
TCP (CVPR 2024) 84.13 75.36 79.51 基于文本知识的类别自适应提示
CoPrompt (ICLR 2024) 84.00 77.23 80.48 一致性引导双头交互提示学习
Skip Tuning (CVPR 2025) 85.04 77.53 81.11 骨干自适应层跳跃调整
MMRL (CVPR 2025) 85.68 77.16 81.20 多模态表征微调 baseline
DiscoVL (本文) 85.98 77.61 81.58 Base +0.30%, Novel +0.45%, HM +0.38%

在跨数据集泛化任务中(在 ImageNet 上 16-shot 训练 1 个 epoch,直接在其余 10 个跨领域数据集上评估),DiscoVL 展现出出色的迁移稳健性:

模型 ImageNet (源域) Caltech101 OxfordPets StanfordCars Flowers102 Food101 Aircraft SUN397 DTD EuroSAT UCF101 跨域平均
CoOp 71.51 93.70 89.14 64.51 68.71 85.30 18.47 64.15 41.90 46.39 66.55 63.88
CoCoOp 71.02 94.43 90.14 65.32 71.88 86.06 22.94 67.36 45.73 45.37 68.21 65.74
MaPLe 70.72 93.53 90.49 65.57 72.23 86.20 24.74 67.01 46.49 48.06 68.69 66.30
PromptSRC 71.27 93.60 90.25 65.70 70.25 86.15 23.90 67.10 46.87 45.50 68.75 65.81
MMRL 72.03 94.67 91.43 66.10 72.77 86.40 26.30 67.57 45.90 53.10 68.27 67.25
DiscoVL (本文) 72.10 94.73 91.90 66.30 72.87 86.70 26.47 67.80 46.13 53.07 68.80 67.48

消融实验

1. 核心架构组件逐级消融(11 个数据集平均 Base/Novel/HM)

配置方案 Base Acc (%) Novel Acc (%) HM (%) 相对 Baseline 增益
Baseline (MMRL) 85.68 77.16 81.20 -
+ 多分支低秩残差对齐 (Multi-branch) 85.70 77.23 81.24 +0.04% HM
+ 双向跨模态交互反馈 (Bidirectional Feedback) 85.77 77.30 81.32 +0.12% HM (DCRA 完整)
+ 对抗三元组表征学习 (Adversarial Triplet) 85.84 77.50 81.46 +0.26% HM
+ 正交特征去冗余正则化 (Orthogonal Reg) 85.98 77.61 81.58 +0.38% HM (DiscoVL 完整版)

2. 损失函数各分项消融实验(StanfordCars 数据集)

实验配置 \(\mathcal{L}_{\text{atr}}^k\) \(\mathcal{L}_{\text{atr}}^{k'}\) \(\mathcal{L}_{\text{ortho}}\) Base (%) Novel (%) HM (%)
Baseline \(\times\) \(\times\) \(\times\) 81.30 75.07 78.06
+ 锚点类别对抗三元组 \(\checkmark\) \(\times\) \(\times\) 81.57 75.20 78.26
+ 双向类别对抗三元组 \(\checkmark\) \(\checkmark\) \(\times\) 81.70 75.23 78.33
+ 正交特征去冗余(完整损失) \(\checkmark\) \(\checkmark\) \(\checkmark\) 81.80 75.30 78.42

关键发现

  • 去冗余正交约束是解决新类泛化瓶颈的核心催化剂:消融数据显示,仅靠对抗三元组提升有限(HM 达到 81.46%),一旦引入正交惩罚 \(\mathcal{L}_{\text{ortho}}\),新类准确率从 77.50% 显著提升至 77.61%,彻底打破了表征向类别质心过度收敛导致的过拟合僵局。
  • 计算效率显著优化,参数量腰斩:在单张 NVIDIA RTX 3060 上的基准测试表明,相比 MMRL 的 4.99M 参数量,DiscoVL 依靠紧凑的多分支低秩分解将可训练参数量压缩至 2.21M(下降 55.7%),单样本推理延迟由 6.31 ms 降至 6.11 ms,ImageNet 训练时间由 156 分钟缩短到 147 分钟,做到了精度与运行效率的双重领先。
  • 极端低样本场景优势显著:在 1-shot 和 2-shot 极端少样本实验中,DiscoVL 分别达到 73.48% 和 76.63% 的平均准确率,较 PromptSRC 和 Skip Tuning 展现出压倒性优势,证实了解耦先验知识在样本极度匮乏时能强力支撑决策面划分。

亮点与洞察

  • 显式解耦取代单空间纠缠:针对主流微调方法将通用先验与任务模式强行混合在单向量的隐患,DiscoVL 创造性地从几何结构上将特征划分为共享和专有子空间,使模型在剧烈微调的同时完美锁死 CLIP 原生 zero-shot 判别流形。
  • 正交正则化与对抗三元组的精妙联姻:常规三元组易受特征冗余扰动影响进而导致质心坍缩;引入正交约束使各特征基底互相独立,迫使对抗学习只能沿着正交流形寻找最纯粹的语义差异,构建了高度稳健的判别空间。
  • 通用解耦范式易于横向迁移:低秩残差分解 + 正交去冗余机制不依赖于特定文本模板,这一范式不仅适用于图像分类,也极易扩展到开集检测、跨模态多轮对话甚至具身智能策略学习等重度依赖预训练表征解耦的场景。

局限与展望

  • 作者承认的局限:目前的双向门控反馈与正交对抗项需要在训练阶段构造批次内的正负类别对,当类别规模超大或批次显存受限时,负样本的采样覆盖度与批次多样性可能会成为限制收敛速度的瓶颈。
  • 本文发现的潜在局限:推理阶段针对基础类与新类采用了二分式分支选择策略(基础类加权,新类纯用类别特征)。在实际开放场景中,样本属于已知类还是未知新类通常事先不可知,缺少一个动态且平滑的测试期类别归属门控。
  • 未来改进方向:可进一步探索动态 Prompt 调度器,将类别解耦与测试时自适应(Test-Time Adaptation, TTA)结合;另外,将正交对抗正则化扩展到序列流式数据与长视频时空建模中亦具有广阔前景。

相关工作与启发

  • vs MMRL / MMRL++ (CVPR 2025 / IJCV 2026):MMRL 引入固定共享核与单通道残差,其表征学习仍处于单一体纠缠空间中;DiscoVL 提出了多分支门控低秩对齐与双向循环反馈,并在表征端施加正交对抗正则化,在参数量锐减 55.7% 的同时全面超越其各项基准精度。
  • vs PromptSRC (ICCV 2023):PromptSRC 依赖复杂的自正则化无监督目标与交叉熵组合来防御遗忘;DiscoVL 则直接从特征空间的代数几何性质出发,以更简洁的正交损失切除冗余,获得了更优的跨数据集与域泛化韧性。
  • vs AAPL (CVPR 2024):AAPL 尝试通过对抗三元组引入属性学习,但未解决特征维度高度相关导致的质心坍缩难题;DiscoVL 证明了正交约束是对抗三元组在基础模型微调中发挥威力的关键拼图。

评分

  • 新颖性: ⭐⭐⭐⭐ [针对 VLM 提示学习中的表征纠缠痛点,提出结构化解耦与正交对抗正则化,切入视角深刻直观]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 11 个跨域数据集 Base-to-Novel、跨数据集迁移、4 个 ImageNet 域偏移变体以及少样本消融,对比详尽完整]
  • 写作质量: ⭐⭐⭐⭐⭐ [数学推导严密规范,图表清晰直观,动机剖析层层递进]
  • 价值: ⭐⭐⭐⭐⭐ [不仅刷新了多项参数高效迁移 SOTA,更为多模态表示学习中的抗退化与结构解耦提供了极富借鉴意义的方法范式]