跳转至

DICE: Disentangled Instance-Class knowlEdge prompt tuning via SAE for Vision-Language Models

会议: ECCV 2026
论文: ECCV 原文
领域: 多模态 VLM
关键词: 提示学习、稀疏自编码器、视觉语言模型、少样本泛化、特征解耦

一句话总结

针对预定义 LLM 类别描述缺乏视觉落地且与具体图像实例失配的问题,DICE 创新性地将稀疏自编码器(SAE)重构为可学习概念词典,提出协同激活评分动态解耦与选择实例特定概念向量并与类嵌入融合,实现了类别先验与实例细节兼备的高泛化即插即用提示调优。

研究背景与动机

以 CLIP 为代表的视觉语言模型(VLM)在零样本迁移上展现出卓越能力,但在低资源少样本(Few-Shot)微调时极易发生过拟合。为缓解该问题,提示学习(Prompt Tuning)应运而生,近年来许多工作进一步引入大语言模型(LLM)预生成的类别文本描述(如通过“What does a [class] look like?”生成的先验知识)来丰富类别的语义表征,辅助分类器在嵌入空间中准确定位新类别。

然而,现存基于 LLM 的提示学习范式存在三个根本性缺陷。首先,现有的 LLM 文本描述在生成时完全脱离了具体的图像视觉证据,并在同一类别的所有测试样本间机械式地静态复用;但同类样本内部常常存在显著的光照、姿态、背景与细粒度子类型差异,导致很多预定义的类别描述与当前图像严重不符(例如包含不存在的场景特征),引发明显的对齐衰减。其次,LLM 与视觉语言模型的表征通常高度纠缠(Polysemantic),缺乏显式的分解机制去定位和抽取与单张图像直接相关的局部视觉属性。最后,现有架构缺乏严密的协同机制将全局类别先验与局部实例视觉证据统一注入到提示表示中,模型往往退化为依赖类别均值语义,在细粒度目标区分(如飞机、汽车型号)上泛化乏力。

本文的核心切入点在于:类别级语义维持了全局几何结构,而实例级线索刻画了精细视觉差异,二者必须有机结合且能够随样本动态解耦。核心 idea:将稀疏自编码器(SAE)作为即插即用的跨模态概念词典,利用图像与类别的协同激活分数(co-activation score)动态筛选出实例特定的单语义概念基底,并与类别嵌入融合注入提示,在保持类别连贯性的同时捕获敏锐的实例辨识线索。

方法详解

整体框架

DICE 包含两个核心阶段:离线预训练阶段与提示调优(Prompt Tuning)阶段。在离线预训练阶段,DICE 联合训练投影自编码器(ProjectAutoencoder,将 3072 维的 LLM 类别名嵌入对齐并投影至 CLIP 文本空间)与 Top-k 稀疏自编码器(SAE,在 CLIP 特征空间中利用单层稀疏自编码结构构建由解耦单语义概念构成的可学习词典)。在在线提示学习阶段,DICE 采用双分支结构,分别通过类别上下文模块(Class Context Module)和实例上下文模块(Instance Context Module)协同处理输入,再经由轻量级元网络(MetaNet)输出统一上下文向量并注入文本编码器的中间层。

整体处理流向与模块协同结构如下所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据<br/>类别名 + 图像"] --> B["阶段一:跨模态自编码器预训练<br/>投影映射与稀疏概念解耦"]
    B --> C["类别上下文模块<br/>投影 LLM 类别嵌入"]
    B --> D["实例上下文模块<br/>SAE 协同激活与概念挑选"]
    C --> E["统一上下文注入<br/>残差融合与 MetaNet 映射"]
    D --> E
    E --> F["下游分类与任务自适应<br/>知识引导约束联合优化"]

关键设计

1. 跨模态自编码器预训练:对齐与构建解耦概念词典 针对预定义文本描述繁复且语义纠缠的缺陷,DICE 摒弃冗长描述,直接对纯类别名提取 OpenAI text-embedding-3-large 嵌入向量 \(l \in \mathbb{R}^{d_{\text{llm}}}\)。投影自编码器由单层编码器 \(E_{\text{proj}}\) 和解码器 \(D_{\text{proj}}\) 构成,通过余弦相似度投影损失 \(\mathcal{L}_{\text{proj}} = 1 - \cos(t_{\text{llm}}, t_{\text{clip}})\) 将 LLM 特征映射至 CLIP 空间,辅以自重构损失 \(\mathcal{L}_{\text{llm\_rec}} = 1 - \cos(l, \hat{l})\) 保障原始语义无损。在此基础上,Top-k 稀疏自编码器(SAE)在居中偏置 \(b_{\text{pre}}\) 下对 CLIP 嵌入进行稀疏激活,其解码器权重矩阵 \(D_{\text{sae}} \in \mathbb{R}^{d_{\text{hid}} \times d}\) 的各行向量天然充当了互不重叠、具有单一物理含义(Monosemantic)的基底概念向量,形成了容量达到 \(d_{\text{hid}} = 32 \times d\) 的显式概念词典。

2. 实例上下文模块:类引导协同激活评分机制 为从包含上万个概念基底的 SAE 词典中精确定位当前图像具备的语义特征,DICE 提出了基于双端协同激活动态索引机制。给定投影后的类别嵌入 \(t_{\text{llm}}\) 与图像编码器抽取的实例表征 \(f\),两者均去除偏置后输入共享的 SAE 编码器,分别输出稀疏激活向量 \(s_{\text{class}}\) 与 \(s_{\text{inst}}\)。通过逐元素加和计算协同激活得分: $\(s_{\text{coact}} = s_{\text{class}} \oplus s_{\text{inst}}\)$ 该机制将图像视觉呈现与类别语义相互印证的维度大幅增强,有效过滤了无关噪声。随后系统截取 \(s_{\text{coact}}\) 中响应最高的 Top-\(k\)(实测最优为 \(k=4\))个概念索引,自 SAE 解码器词典中直接提取对应向量拼接成实例特征矩阵 \(W_{\text{inst}} \in \mathbb{R}^{C \times k \times d}\)。

3. 统一上下文注入:多级提示注入与元网络变换 为防止实例级细节破坏类别语义的全局几何拓扑,DICE 将类别矩阵 \(W_{\text{class}}\)(广播后)与实例矩阵 \(W_{\text{inst}}\) 进行逐元素加和,输入由双层线性层配以 QuickGELU 激活函数构建的轻量级元网络 \(\mathcal{M}\),变换生成最终的统一提示上下文 \(uc = \mathcal{M}(W_{\text{class}} \oplus W_{\text{inst}})\)。该上下文向量被定向注入到 CLIP 文本编码器的中间层(第 8 层,Layer 8),替代原始可学习连续向量,使文本端能够在深层注意力计算中同时兼顾高维全局类别分布与细粒度局部实例线索。

4. 知识引导约束联合优化:抗遗忘正规化训练 在小样本微调阶段,为防止模型在少样本训练集上过度偏离 CLIP 固有的跨模态通用判别边界,DICE 引入了知识引导一致性损失(Knowledge-Guided Consistency Loss)作为正则化项,约束微调后的提示嵌入 \(t_{\text{dice}}\) 与原始零样本 CLIP 嵌入 \(t_{\text{clip}}\) 之间的欧氏距离,联合 LLM 重构损失与标准交叉熵损失进行多任务端到端反向传播: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{ce}} + \lambda_{\text{kg}} \cdot \mathcal{L}_{\text{kg}} + \lambda_{\text{llm}} \cdot \mathcal{L}_{\text{llm\_rec}}\)$ 这种正则化构型在有效学习目标域特有视觉特征的同时,最大程度保留了基础模型的开放词表泛化潜能。

实验关键数据

主实验

在 11 个经典少样本识别基准(涵盖通用目标、细粒度物体、纹理、卫星遥感、视频动作等)上的 16-shot 基类到新类泛化(Base-to-Novel Generalization)对比中,DICE 在单一文本提示(tp)架构下刷新了业界最高水准,并在即插即用集成到现有方法时带来了广泛的增益。

方法 类型 提示架构 Base 平均 Novel 平均 调和均值 H
CoOp tp 单文本提示 82.69% 63.22% 71.66%
CoCoOp tp 条件文本提示 80.47% 71.69% 75.83%
KART tp 知识感知文本提示 78.42% 70.52% 74.26%
TCP tp 类感知文本提示 84.13% 75.36% 79.51%
MaPLe mp 多模态深度提示 81.54% 72.30% 76.65%
PSRC mp 自调节多模态提示 84.26% 76.10% 79.97%
HPT mp 层次化语言提示 84.32% 76.86% 80.23%
CoPrompt mp 一致性多模态提示 84.00% 77.23% 80.48%
DICE (本文) tp 解耦概念文本提示 84.45% 76.77% 80.43%
CoOp w/ DICE tp 即插即用强化 83.09% 72.54% 77.45% (+5.79%)
CoCoOp w/ DICE tp 即插即用强化 82.70% 73.19% 77.65% (+1.82%)
PSRC w/ DICE mp 即插即用强化 85.76% 77.29% 81.31% (+1.34%)

消融实验

为验证各模块的必要性,论文在 11 个数据集平均性能上进行了全方位的拆解测试,涉及模块有效性、SAE 稀疏结构替换以及协同激活的作用机制。

配置 / 变体 评估说明 Base (%) Novel (%) 调和均值 H (%)
完整模型 (DICE Full) 双分支协同 + SAE 解耦 84.45 76.77 80.43
仅保留 Class Context 模块 去除实例上下文分支 84.28 75.78 79.80 (-0.63)
仅保留 Instance Context 模块 去除类别先验分支 82.52 74.34 78.22 (-2.21)
替换 SAE 为同等参数量 MLP 丧失稀疏单语义解耦能力 81.31 73.82 77.38 (-3.05)
采用 CLIP 文本嵌入替代 LLM 验证 LLM 丰富语意增益 83.75 75.77 79.56 (-0.87)
概念激活仅依赖图像 \(s_{\text{inst}}\) 缺乏类别协同指引 82.10 74.60 78.16 (-2.27)
选取概念数 \(k=2\) 概念捕获不足 84.48 75.84 79.93 (-0.50)
选取概念数 \(k=8\) 冗余概念引入噪声 84.57 76.12 80.12 (-0.31)

关键发现

  • SAE 解耦特性的决定性价值:将 SAE 替换为等量参数的常规 MLP 时,调和均值出现 3.05% 的断崖式下跌,且 Base 与 Novel 均显著退化。这确凿地证实了提升并非源于扩增参数容量,而是 SAE 的 Top-k 稀疏机制真正起到了概念解耦与噪声滤除的作用。
  • 细粒度图像提升最显著:在 FGVC-Aircraft 和 StanfordCars 这类同类形态多变且高度依赖细小零件特征的细粒度数据集上,DICE 的表现尤为抢眼(FGVC-Aircraft 的 H 指标从 CoOp 的 28.75% 跃升至 DICE 的 41.56%,PSRC w/ DICE 达到 43.57%)。
  • 协同激活重塑类间/类内距离:对比实验表明,\(s_{\text{coact}}\) 使得同类样本之间的余弦相似度相较单图像激活 \(s_{\text{inst}}\) 显著提升(如 Aircraft 从 0.07 增至 0.14),而类间相似度从 0.62 压降至 0.18,极大增强了判别边界的清晰度。

亮点与洞察

  • 首创将 SAE 重构为即插即用概念词典:不同于以往将 SAE 仅作为可解释性事后分析工具的思路,DICE 大胆将其作为表征提取器植入多模态前向提示学习,在无需人工标注概念的情况下自发涌现出具有物理直觉的原子概念基底。
  • 纯类别名替代冗长不可控的文本描述:直接使用现代 LLM Embedding 模型(如 text-embedding-3-large)对原始单类别词汇编码,借助单层投影自编码器完成跨模型语义对齐,彻底规避了以往利用大模型生成文本描述时固有的幻觉、风格冗余与图像失配问题。
  • 卓越的可迁移性与可解释性统一:DICE 的设计不仅可以无缝嵌合到各类现存提示调优算法(CoOp、CoCoOp、PSRC)中并持续提升基线表现,还能通过反查 SAE 强激活神经元对应的概念词条(如“freckle”、“truck bed”、“dashboard”),让调优得到的视觉提示具备完全白盒化的归因追溯能力。

局限与展望

  • 推理期计算开销较大:由于实例上下文模块需要针对每张输入图像动态生成定制化提示,DICE 在测试阶段需要对每个样本执行独立的文本编码器前向计算,在大批量工业化部署或边缘端设备推理时会带来额外的内存占用与延迟。
  • 跨模态 SAE 的跨域假设局限:模型假设在文本空间训练的 SAE 解码器概念词典能够完美适用于图像编码器特征,虽然 CLIP 的模态对齐提供了理论基础,但在遥感遥测(EuroSAT)等低文本密度的极端域下,词典迁移的精确性仍然受到一定制约。
  • 改进方向:探索基于超网络或高效缓存机制降低图像级文本前向计算负担,以及研究针对特定专业垂直领域的跨模态稀疏联合微调机制。

相关工作与启发

  • vs CoOp / CoCoOp: CoOp 仅学习静态上下文导致严重过拟合;CoCoOp 引入图像条件网络但缺乏显式语义指导且计算昂贵。DICE 引入 SAE 概念词典并以协同激活过滤噪声,兼顾了类别先验与实例自适应。
  • vs KART / HPT / CoPrompt: 此类方法严重依赖预先让 LLM 生成的长篇类别文字描述,导致计算开销大且存在描述幻觉。DICE 仅对类别名提取高质量嵌入并通过 SAE 动态投影,泛化性与对齐鲁棒性显著更优。
  • vs TCP: TCP 将类别嵌入注入文本编码器中间层以强化类内判别,但未考虑实例维度的视觉线索补充。DICE 继承了中间层注入思想,但在提示表征内融合了解耦的实例特定单语义概念。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将稀疏自编码器(SAE)改造为免人工标注的概念词典并应用于 VLM 提示学习,设计立意新颖精妙。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 11 大数据集的 Base-to-Novel、跨数据集、变 shot 数测试,提供完备消融、参数敏感度、可解释性案例与 UMAP 可视化。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑缜密清晰,形式化定义与实验论证严谨,伪代码完备。
  • 价值: ⭐⭐⭐⭐⭐ 为轻量级多模态自适应与可解释提示调优开辟了极具前景的学术与工程新范式。