跳转至

Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/AdhemarDeSenneville/HEC
领域: 多模态 VLM
关键词: 大多模态模型、少样本图像分类、零样本分类、Prompt Conditioning、注意力头选择

一句话总结

提出无需微调的头部集成分类器(HEC),通过将文本提示词与图像共同输入多模态大模型解码器进行条件约束,并基于高斯判别分析和软准确率指标自适应筛选最具判别力的稀疏注意力头,彻底弥合了 LVLM 与 CLIP 之间的少样本及零样本分类性能鸿沟。

研究背景与动机

大型视觉语言模型(LVLM)在图像描述、视觉问答、文档转录与跨模态多跳推理等零样本任务中展现出卓越的泛化能力,能够凭借单套统一权重无缝应对开放式多模态交互。然而令人意外的是,面对最基础且高度结构化的少样本与零样本图像分类任务时,当前主流 LVLM 的原始预测性能却大幅落后于以 CLIP 为代表的双塔对比学习模型。这种性能倒挂极为反常,因为多数顶尖 LVLM 本就直接继承了强大的预训练 CLIP 系列视觉编码器;但在实际分类中,LVLM 自回归生成的预测准确率甚至显著低于其底层搭载的纯视觉骨干。

深入分析这一矛盾的根源,主要在于两者架构范式与推理机制的本质差异。传统 CLIP 架构采用彼此独立的视觉与文本编码器,跨模态交互完全退化为决策终点的余弦相似度点积,这天然使模型偏向基于类名的硬匹配,而无法支持深入的图文联合推理与领域自适应上下文注入;相反,LVLM 具备将视觉 token 与文本 prompt 投射到共享语义空间并通过多层 Transformer 解码器进行跨注意力交互的能力,却由于自回归解码目标未显式对齐分类边界,导致末尾 token 汇总表征时的原始分类效能被严重稀释。此前研究多局限于让 LVLM 为 CLIP 生成辅助属性描述,或依赖计算开销极大的下游全参微调与上下文拼接。

本文的切入视角在于重新审视并挖掘 LVLM 内部表征的信息金字塔。研究发现,虽然 LVLM 最终输出端的分类准确率低下,但其解码器内部隐藏着极具判别力的特征分布——通过在输入端显式引入分层级的提示词条件约束,并借助高斯判别分析自适应解构并挑选出极少数表现卓越的高判别力注意力头,无需任何参数更新即可释放惊人的分类潜能。核心 idea:利用提示词条件化重塑 LVLM 内部特征类可分离度,并在测试时通过高斯判别分析结合软准确率从解码器中自适应筛选顶级视觉头与文本头,构建免微调的头部集成分类器(HEC)。

方法详解

整体框架

HEC 旨在不改变任何预训练权重的前提下,直接将任意 LVLM 转化为高性能的少样本与零样本分类器。整体输入包含待测查询图像、少量标注支持集样本以及可选的类别文本与领域提示词。框架首先将图像序列与多级文本提示词拼接送入共享的 LLM 解码器,提取解码器末尾 summary token 在各层注意力头上的注意力向量特征;随后利用高斯判别分析(GDA)与软准确率评分准则分别评估各头的判别能力,自适应选出最优的视觉头集合 \(\mathcal{H}^V\) 与文本头集合 \(\mathcal{H}^T\);最终将各选定头部输出的类概率进行软平均与凸组合集成,输出最终类别分布。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入数据<br/>支持集图像 / 类别文本 / 查询图像"] --> B["多级提示词条件化<br/>任务/领域/类别层次化约束"]
    B --> C["注意力头特征提取<br/>末尾 token 跨层注意力向量抽样"]
    C --> D["基于 GDA 与软准确率的头部自适应筛选<br/>无偏协方差收缩与鲁棒判别打分"]
    D --> E["双模态头部集成推理<br/>视觉头与文本头概率平均与加权融合"]
    E --> F["输出预测类别分布"]

关键设计

1. 多级提示词条件化:激活解码器隐式判别先验 传统双塔模型在输入端无法注入丰富的先验上下文,导致细粒度跨域迁移困难。针对这一痛点,本文通过重塑输入序列格式,将图像视觉 token 序列与特定文本 prompt \(\pi\) 拼接后共同送入 LLM 解码器:\([\mathbf{f}^v(x_i); \pi]\)。提示词设计被细化为三个渐进层级:首先是任务条件化(Task Conditioning),通过诸如“What is the object in the image? Answer in one word.”等结构化句式,强制模型将全局场景判别信息压缩至末尾 summary token;其次是领域条件化(Domain Conditioning),针对细粒度数据集显式指明分类范畴(例如“What breed is that dog?”),促使注意力机制提前聚焦于物种特定的辨识特征;最后是类别条件化(Class Conditioning),在已知候选类名时将候选列表直接挂载于 prompt 末尾(如“Between: boxer, yorkshire, beagle or havanese.”)。这种机制打破了 CLIP 文本特征脱离图像静态匹配的局限,驱动解码器内部表征朝着高可分性的领域流形演化。

2. 注意力头特征提取:解构末尾 token 的细粒度子空间表征 针对模型最终输出预测严重欠佳但内部隐藏丰富知识的矛盾,本文避开了直接使用最后一层 summary token 的粗暴方式,深入解码器各层内部注意力结构。设解码器共有 \(L\) 层、每层包含 \(H\) 个注意力头,总头数为 \(M = L \times H\)。针对输入序列的最后一个 token,提取其在第 \(m\) 个头上的查询向量 \(\mathbf{q}_m\) 以及对应的键值矩阵 \(\mathbf{K}_m, \mathbf{V}_m\),构建注意力特征向量: $$ \mathbf{h}_m = \operatorname{softmax}\left(\frac{\mathbf{q}_m \mathbf{K}_m^\top}{\sqrt{D}}\right) \mathbf{V}_m $$ 将所有注意力向量进行 \(L_2\) 归一化以保证内积等价于余弦相似度。实证发现,末尾 token 聚合了全图与上下文信息,且不同层级的注意力头展现出高度的功能特化:部分头高度聚焦于纹理、背景等噪声,而极少数稀疏的“超级头”在细粒度聚类准确率上远超模型原始输出达 10% 以上。

3. 基于 GDA 与软准确率的头部自适应筛选:消除少样本过拟合与饱和截断 在仅有极少标注样本(如 4-shot)的情况下,直接通过线性拟合或硬匹配选头极易发生严重过拟合与准确率饱和(许多头部在极小支持集上的硬分类准确率均达到 100%,丧失区分度)。为此,本文引入高斯判别分析(GDA)作为理论基石。假设属于类别 \(c\) 的视觉注意力向量满足高斯分布 \(\mathcal{N}(\boldsymbol{\mu}_{m,c}, \boldsymbol{\Sigma}_m)\),其中各类别共享同一个协方差矩阵 \(\boldsymbol{\Sigma}_m\)。共享协方差不仅有效缓解了小样本下样本协方差矩阵病态欠拟合的难题,更能精确刻画细粒度特征在各向异性流形上的主要延伸方向。通过经验贝叶斯收缩估计器计算精度矩阵逆矩阵 \(\widehat{\boldsymbol{\Sigma}}_m^{-1}\),推导各类的观测对数几率 \(\ell_{i,m,c}\)。为防止硬准确率指标打平饱和,进一步定义基于温度归一化 Softmax 的软准确率评分函数: $$ s_m^{(\text{v})} = \frac{1}{KN} \sum_{i=1}^{KN} p_{i,m,y_i}^{(\text{v})}, \quad \text{其中} \quad p_{i,m,c}^{(\text{v})} = \frac{\exp(\ell_{i,m,c}/\tau)}{\sum_{j=1}^N \exp(\ell_{i,m,j}/\tau)} $$ 温度超参 \(\tau\) 能够拉开头部在置信度分布上的微小判别差距,从而精确捕获综合泛化能力最稳健的前 \(k\) 个视觉注意力头 \(\mathcal{H}^V\)。对于零样本场景下的文本头 \(\mathcal{H}^T\),则利用图文内积对数几率在通用预训练任务(如 ImageNet 支持集)上计算平均支持集概率来完成一次性通用离线选拔。

4. 双模态头部集成推理:免训练的自适应鲁棒融合决策 在确定最优头部子集后,本文抛弃了复杂的特征拼接或带参元学习头,设计了极其稳健且免训练的概率集成范式。纯视觉少样本分类器 HEC-V 通过在 \(\mathcal{H}^V\) 上对样本后验概率进行无偏均值汇总;文本零样本分类器 HEC-T 则对 \(\mathcal{H}^T\) 的零样本跨模态后验概率求均值。当类别先验文本与图像支持集同时具备时,视觉-文本复合分类器 HEC-VT 采用带先验调节的对数概率凸组合: $$ \bar{p}^{(\mathrm{HEC\text{-}VT})}{q,c} = \frac{\alpha \bar{p}^{(\mathrm{HEC\text{-}V})} $$ 简单的后验概率平均相比特征拼接对单个弱头的噪声扰动具备极强天然鲁棒性,无需在测试阶段进行迭代优化或复杂重加权,实现了极致的推理速度与泛化稳定性。} + \bar{p}^{(\mathrm{HEC\text{-}T})}_{q,c}}{\alpha + 1

实验关键数据

主实验

论文在 12 个广泛采纳的标准多模态图像分类基准上展开了全面评测,涵盖细粒度生物分类、自然纹理、场景识别与日常物体(PETS, ESAT, UCF, SUN, CAL, DTD, AIR, FOOD, FLWR, CARS, BIRD, SIGN)。

下表为 12 个数据集上无需类名信息的 4-shot 纯视觉少样本分类主对比结果:

模型骨干 分类方法 PETS ESAT UCF SUN CAL DTD AIR FOOD FLWR CARS BIRD SIGN AVG
DINOv1 Probing 81.9 81.6 71.8 50.8 86.9 49.6 25.5 37.9 88.1 28.3 54.2 46.3 58.6
DINOv2 Probing 78.5 73.6 67.6 63.4 87.0 51.6 29.9 43.0 97.0 35.9 65.5 35.6 60.7
DINOv3 Probing 88.0 77.2 82.8 72.7 95.4 63.6 56.9 74.3 99.5 79.4 77.3 53.1 76.7
OpenAI CLIP Probing 72.9 73.6 81.5 73.2 90.2 55.8 28.2 73.4 89.5 56.9 53.6 56.5 67.1
DFN Probing 84.5 80.8 79.8 73.9 94.4 62.8 40.0 77.5 96.8 85.6 66.9 68.2 75.9
Qwen2-VL (7B) Probing (TC) 84.9 75.6 81.4 77.2 93.4 58.2 40.9 81.1 98.1 79.8 65.1 71.3 75.6
Qwen2-VL (7B) Probing (DC) 92.0 74.0 82.3 79.8 94.2 66.9 60.7 82.7 98.2 89.2 69.5 69.2 79.9
Qwen2-VL (7B) SAVs† (DC) 91.0 72.0 80.5 81.7 94.4 70.5 59.3 84.9 97.8 89.5 69.8 68.1 80.0
Qwen2-VL (7B) HEC-V† (DC) 92.2 78.8 85.0 82.4 95.5 71.8 62.2 85.3 98.5 89.8 72.0 75.5 82.4

在兼具类名与支持集的图文少样本设置(Vision-Text-Few-Shot, 4-shot)下,各主流对齐方法性能对比如下:

骨干底座 分类方法 PETS ESAT UCF SUN CAL DTD AIR FOOD FLWR CARS BIRD SIGN AVG
DFN Zero-Shot† 92.0 51.6 63.4 79.5 95.6 51.1 29.6 87.2 82.0 92.1 78.0 28.1 69.2
DFN TipAdapter 92.3 69.2 77.4 80.5 95.8 64.4 40.2 87.2 97.0 92.7 78.7 50.0 77.1
DFN GDA 92.8 78.0 84.0 83.2 96.5 70.0 46.3 87.2 98.5 93.6 80.3 67.8 81.5
DFN ProKeR 91.2 82.4 83.9 82.2 97.0 66.2 43.1 87.8 98.3 93.6 81.5 64.6 81.0
Qwen2-VL Summary Token 55.0 48.8 30.8 65.5 73.3 32.0 30.1 72.4 8.2 45.5 6.1 30.9 41.5
Qwen2-VL Probing 92.0 74.0 82.3 79.8 94.2 66.9 60.7 82.7 98.2 89.2 69.5 69.2 79.9
Qwen2-VL SAVs† 91.0 72.0 80.5 81.7 94.4 70.5 59.3 84.9 97.8 89.5 69.8 68.1 80.0
Qwen2-VL HEC-V† 92.2 78.8 85.0 82.4 95.5 71.8 62.2 85.3 98.5 89.8 72.0 75.5 82.4
Qwen2-VL HEC-VT 92.8 82.0 85.0 83.3 95.6 72.7 62.3 85.7 98.6 90.1 72.1 76.2 83.0

消融实验

为了严格拆解从现有最强 LVLM 头部提取方法 SAVs 演化至 HEC-VT 的逐项收益,论文在 10-way 基准下对比了各模块在 4-shot 与 16-shot 设置中的递进作用:

方案配置 领域条件化 (DC) 软准确率排序 (SAR) 高斯判别模型 (GDA) 概率平均集成 (PE) 融合文本头 (HEC-T) 4-shot 准确率 (%) 16-shot 准确率 (%) 说明
In-Context Baseline - - - - - 84.98 N/A 上下文示例直接塞入 prompt,16-shot 超出窗口
SAVs 基线 87.03 94.45 最近质心硬选择分类器
+ DC ✓ 88.13 95.23 引入领域引导 prompt (+1.10% / +0.78%)
+ SAR ✓ ✓ 93.28 94.99 引入平滑软准确率解决饱和截断(4-shot 暴涨 +5.15%)
+ GDA ✓ ✓ 83.91 95.06 仅用 GDA 判别而缺少软排序在极小样本时严重过拟合
本文完整排序架构 ✓ ✓ ✓ 93.99 96.03 GDA 协方差建模协同 SAR 排序
本文纯集成架构 ✓ ✓ ✓ 93.28 95.12 引入无偏类概率平均
HEC-V w/o DC ✓ ✓ ✓ 93.23 95.70 剥离领域提示词但保留完整头部选择算法
HEC-V ✓ ✓ ✓ ✓ 94.09 96.17 完整视觉头部集成少样本分类器
HEC-VT (Full) ✓ ✓ ✓ ✓ ✓ 94.42 96.23 融合文本头零样本先验的最终完整模型

关键发现

  • 软准确率排序(SAR)是突破极小样本过拟合的胜负手:在 4-shot 极端低数据量下,从 SAVs 切换到 SAR 带来了高达 5.15% 的绝对跃迁。硬准确率极易在少量样本上饱和至 100%,导致模型无法挑出真正具备泛化力的表征空间;而平滑概率打分保留了精细的置信度梯度。
  • GDA 协方差估计在样本量增长时优势极为显著:在 16-shot 场景下,GDA 共享协方差提供了稳健的各向异性几何先验,直接推动准确率跨越至 96.03%,与 SAR 形成了完美的互补。
  • 提示词层级越丰富,错误削减率越显著:在 10-way 4-shot 评测中,从无条件约束逐步升级至任务、领域、类别条件化,HEC-V 的分类错误削减率(Error Reduction)分别达到了 10.31%、15.85% 和 18.84%;HEC-T 亦呈现出一致的递进增益。
  • 文本先验头呈现出极强的跨领域跨任务迁移性:固定在 ImageNet 上挑出的 20 个文本头后,在与其类别重合度不足 13% 的 12 个异构下游数据集上依然全部取得显著增益,证明 LVLM 解码器中存在稳定负责图文语义对齐的专用功能回路。

亮点与洞察

  • 颠覆了 LVLM 分类能力低下依赖全参微调的刻板印象:揭示了 LVLM 原始文本生成的弱点在于自回归解码头的未对齐,而内部稀疏注意力头本身就蕴含着超越底层 CLIP 骨干的高纯度判别能力,为学术界提供了开箱即用的免训练激活范式。
  • 巧妙将文本提示词工程与特征空间判别分析有机结合:不仅把 prompt 视作生成指令,更将其转化为几何投影方向调节器,促使多模态特征在进入分类器前就完成了领域维度的正交解耦与自适应聚类。
  • 即插即用且天然对长尾稀疏领域具备更强防御力:在细粒度飞机识别(AIR)与交通标志(SIGN)等非自然常见类别上,HEC-VT 大幅超越了以 OpenAI CLIP 与 DFN 为代表的双塔基线,展示了跨模态大模型深层世界知识在长尾辨识中的独特优势。

局限与展望

  • 白盒表征依赖制约了黑盒 API 场景的普及:方法必须获取解码器每一层末尾 token 的 Key/Value 矩阵与内部注意力向量 \(\mathbf{h}_m\),这使其仅适用于开源权重模型,无法直接部署于闭源商业多模态 API。
  • 类别条件化(Class Conditioning)难以扩展至海量类别:当类别数 \(N\) 极大(如 ImageNet 1000 类)时,将所有候选类名拼入文本 prompt 会迅速超出 Transformer 上下文窗口限制并引发严重的注意力分散,导致性能出现衰减。
  • 推理端显存开销高于轻量级双塔架构:尽管无需反向传播更新参数,但每次编码前向都需要调用庞大的 7B 参数级 LLM 解码器,相较于纯视觉 ViT 前向在计算吞吐和延迟上仍存在明显劣势。未来工作可探索离线头部蒸馏与前缀剪枝优化。

相关工作与启发

  • vs SAVs (Mitra et al., ICCV 2025): SAVs 首次探索了从支持集中使用最近质心分类器挑选 LVLM 内部头,但其采用硬准确率匹配极易在低 shot 时发生饱和,且未引入图文双流解耦与提示词条件约束;本文引入 GDA 协方差建模与软准确率温度排序,在 4-shot 下大幅领跑 SAVs 超 2.4%。
  • vs GDA / TipAdapter (Wang et al., ICLR 2024 / Zhang et al., ECCV 2022): 经典免微调 CLIP 适配工作局限于冻结的双塔向量交互,无法随任务语义动态修正底层视觉表征;本文将 GDA 的统计判别思想平移至 LVLM 跨模态生成解码层,结合提示词条件化彻底超越了纯双塔适配算法的理论上限。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次揭示并严密论证了通过提示词条件化与注意力头筛选释放 LVLM 少样本分类潜能的有效性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 12 个多模态基准、2 款代表性主流开源 LVLM(Qwen2-VL 与 LLaVA-OV)及极其严谨细致的逐模块递进消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 架构流程清晰连贯,实验图表排布极具洞察力,问题定义与推导严密。
  • 价值: ⭐⭐⭐⭐⭐ 为免微调的多模态模型高效适配、小样本迁移学习与内部可解释性研究树立了全新基准。