跳转至

Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners

会议: ECCV 2026
论文: ECCV 官方页面
代码: https://github.com/yunhanwang1105/DeCoDe
领域: 多模态 VLM
关键词: 少样本学习、多模态大语言模型、视觉上下文学习、二值分解提示、跨域泛化

一句话总结

提出无需训练的 DeCoDe 推理框架,将少样本分类解耦为独立的“支持-查询”成对二值对比,利用 "Yes" token 的生成 logit 进行排序与决策,彻底攻克 MLLM 在多轮上下文少样本提示中对文本先验过度依赖与长上下文干扰的缺陷。

研究背景与动机

多模态大语言模型(MLLMs,如 Qwen2.5-VL、Qwen3-VL、InternVL3)在开放词表视觉识别与图像理解中取得了瞩目的突破,然而当研究者尝试将这些能力直接迁移到少样本图像分类(Few-Shot Classification)任务时,却遭遇了严重的性能瓶颈。在标准的少样本多选一(In-context Learning)范式下,用户通常将全部支持集图像、类别标签与查询图像打包拼接到同一个长上下文 Prompt 中,期望模型模仿文本 LLM 的上下文示例推理能力。然而实验表明,开箱即用的 MLLM 在此类拼接提示下的 1-shot 表现往往显著差于不给任何视觉支持样本的 0-shot 预测(例如 InternVL3 在标准基准上的平均准确率从 0-shot 的 90.7% 骤降至 1-shot 的 72.2%),多图像之间的上下文注意力和位置偏置反而形成了严重干扰。

这种性能崩溃背后的核心矛盾在于:标准多模态上下文学习高度依赖类标签名所激活的语义先验(Semantic Language Priors),而非真正去细致比对视觉特征。一旦隐去真实的语义标签名、采用匿名占位符(如 Class 1、Class 2),主流 MLLM 的少样本分类准确率直接退化至接近随机猜测的 20%~28%。而现有的解决方案要么依赖繁琐的有监督微调(SFT)打破文本主导,要么退回提取模型中间层表征做 KNN,丢失了语言模型原生生成式推理的灵活性与可扩展性。

本文的切入角度是打破将所有样本堆叠在单次上下文中的传统习惯,将复杂的 \(N\)-way 少样本决策拆解为人类最直观的双图判别逻辑。核心 idea:将多分类任务显式解耦为独立的成对二值比较(Decompose),以大模型输出肯定词 "Yes" 的未归一化 logit 作为视觉相似度置信度进行候选排序(Compare),最后通过聚合支持集得分确定查询样本所属类别(Decide),并在提示中注入宏观领域概念以实现纯推理时的高精度少样本自适应。

方法详解

整体框架

DeCoDe(Decompose, Compare, and Decide)改变了传统多图单 prompt 决策机制,完全无需对模型进行任何参数更新或微调。对于一个标准的 \(N\)-way \(K\)-shot 任务,DeCoDe 将其拆分为 \(N \times K\) 个完全独立的二值判断 Prompt。在每个二值 Prompt 中,模型仅输入单张支持图像与单张查询图像,并回答两者是否属于同一种别。通过提取输出词表上 "Yes" token 的 logit 作为成对匹配分数,并在类别内对 \(K\) 个 shot 的得分取均值,最终选取平均得分最高的类别作为预测结果。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["少样本输入<br/>查询图像 x_q 与支持集 S"] --> B["任务解耦与领域提示构建<br/>拆为 N×K 个独立双图 Prompt"]
    B --> C["成对二值比较<br/>输入单对 (x^s, x^q) 并提取 Yes logit"]
    C --> D["类别决策与得分聚合<br/>按类别对 K 个 shot 取均值并 argmax"]
    D --> E["输出预测类别 y_hat"]

关键设计

1. 任务解耦与成对二值提示:消除多图干扰与语义偏差 传统的单次上下文提示(In-context Prompting)把 \(N \times K\) 张支持样本与查询图一次性拼接,多图像 token 在自注意力层相互纠缠,引发严重的注意力分散与位置偏差(Position Bias)。DeCoDe 彻底规避了这一问题,将支持集 \(\mathcal{S} = \{(x_{n,k}^s, c_n)\}\) 拆解为集合 \(\mathcal{P} = \{p_{n,k} \mid n=1,\dots,N, k=1,\dots,K\}\),每个 prompt \(p_{n,k}\) 仅聚焦于两个视觉实例的对比: $\(p_{n,k} = x_{n,k}^s \oplus x^q \oplus \text{Prompt}(c_n)\)$ 在匿名设定下,更直接使用 "Are the two images depicting the same class? Answer Yes or No."。这种设计迫使多模态 Transformer 的交叉注意力仅在查询图与该参考图之间建立对应关系,摆脱了语义标签对其他类别的先入为主偏见,即使在类别名完全匿名的严苛设定下,模型依然能执行准确的视觉图图比对。

2. 基于肯定 Token Logit 的连续相似度度量:高保真置信度提取 在判别两图是否同类时,若直接依赖模型贪婪解码生成的文本 "Yes" 或 "No",只能得到离散的 0/1 判定,极易因置信度信息丢失导致多个候选类打成平手;若通过生成式提示让模型吐出显式置信度数字,实测又会遭遇严重的语言概率失真。DeCoDe 借鉴生成对齐评测的洞见,直接提取大语言模型输出首个 token 时属于 "Yes" 的未归一化对数概率(Logit)作为连续相似度度量: $\(s_{n,k}^{\mathrm{pair}} = \text{logit}(\text{Yes} \mid p_{n,k})\)$ 对于 \(N\)-way \(K\)-shot 任务,通过对同类别下 \(K\) 个参考样本的二值置信度取算术平均,得到最终判别分数并选出最高者: $\(\hat{y} = \arg\max_{n \in \{1,\dots,N\}} \frac{1}{K} \sum_{k=1}^K s_{n,k}^{\mathrm{pair}}\)$ 这种打分策略具有天然的平滑性与严格单调性,消融实验证明该 logit 分数在排序稳定性上大幅优于文本自报告的置信度。

3. 宏观领域知识引导:强化特定概念空间的视觉对齐 在完全无监督的成对二值判断中,通用词汇 "class" 含义过于宽泛,模型可能会将注意力放在背景、构图、颜色或纹理的相似性上,而非核心分类目标。DeCoDe 引入了轻量级的领域信息文本(Domain Information, \(D_{\mathrm{info}}\)),将 Prompt 中的抽象词汇 "class" 替换为与数据集目标相契合的上位概念描述(例如在瑜伽姿态数据集 Yoga 中替换为 "yoga pose",在古埃及象形文字 Hiero 中替换为 "Egyptian hieroglyph",在工业零件数据集 Industrial 中替换为 "industrial product",在昆虫数据集 Insects 中替换为 "insect species")。领域提示不仅保留了脱离具体类名的泛化能力,更向自注意力机制施加了高维引导,促使视觉编码器将注意力自适应聚焦在特定维度的视觉线索上(如姿势关节分布或笔画拓扑结构),在分布外领域带来高达 3%~8% 的进一步增益。

一个完整示例

以 5-way 1-shot 的古埃及象形文字识别为例:传统 In-context 提示将 5 张象形符号与待测图一次性喂给 Qwen3-VL,模型因无法建立长程对应且缺乏文字名称先验,准确率仅有 30.0%(近乎随机)。而在 DeCoDe 中: 1. 框架自动构造 5 个成对比较会话,每个会话输入单张参考图 \(x_n^s\) 与查询图 \(x^q\); 2. Prompt 提问:"Are the two images depicting the same Egyptian hieroglyph? Answer Yes or No."; 3. 模型并行前向推理,读取各自的首 token logit:Class 1 的 Yes logit 为 12.4,Class 2 为 8.1,Class 3 为 24.8,Class 4 为 5.2,Class 5 为 9.7; 4. 决策模块执行 argmax 判别,以最高置信度 24.8 精确命中真实类别 Class 3。

实验关键数据

主实验

论文在 6 个标准少样本基准(mini-ImageNet, UCF101, CUB, Aircraft, Dogs, DomainNet)和 6 个新构建的高度专业化分布外(Novel OOD)数据集(Lego, Industrial, Yoga, Egyptian Hieroglyphs, Insects, Arabic Sign Language)上进行全方位评估(5-way 1-shot),涵盖了语义标签与匿名标签两种设定。

方法 / 设定 标准集均分 (Std Avg) 新颖OOD集均分 (Nov Avg) 综合全集均分 (Total Avg) 备注说明
CLIP (ViT-B/32, 0-shot) 86.7 35.2 60.9 传统 VLM 零样本表征
ProKeR (1-shot) 89.3 53.5 71.4 基于 CLIP 的核回归微调优化
SAVs (Qwen2.5-VL 特征, 1-shot) 92.9 60.3 76.6 提取 MLLM 隐层特征外接分类器
InternVL3 (In-context 1-shot) 72.2 49.5 60.8 标准多图上下文拼接,严重退化
Qwen3-VL (In-context 1-shot) 84.9 76.9 80.9 单次上下文提示基线
Qwen3-VL (SFT 1-shot 基线) 95.7 80.8 88.2 在 mini-ImageNet 上微调后的表现
Qwen3-VL (DeCoDe 1-shot, 本文) 95.5 79.1 87.3 无需训练,开箱即用成对二值决策
Qwen3-VL (DeCoDe+Dinfo 1-shot, 本文) 96.1 85.2 90.6 结合宏观领域提示,刷新全场最佳
Qwen3-VL (匿名标签 In-context) 28.9 26.6 27.8 隐去类名后标准上下文提示彻底崩溃
Qwen3-VL (匿名 SFT 基线) 56.3 54.6 55.5 微调依然无法完全摆脱类名依赖
Qwen3-VL (匿名 DeCoDe+Dinfo, 本文) 92.5 85.8 89.2 匿名状态下依然保持极高精度 (+33.7 vs SFT)

消融实验

下表针对解耦机制、上下文校准策略以及领域信息的效用展开控制变量消融(基于 5-way 1-shot 任务,测试于标准集与新颖数据集的代表性子集)。

配置 / 变体 标准集子集均分 (mini/CUB/Dogs) 新颖集子集均分 (Lego/Yoga/Hiero) 总平均准确率 (%) 核心机制与分析
In-context 1-shot 基准 (Qwen3-VL) 85.5 74.6 80.0 多图直接拼接,受位置偏置与文本先验干扰
In-context + PMI 校准 (Qwen3-VL) 93.4 78.9 86.2 减去空图像提示偏置 P(y|S),有所缓解
0-shot 成对分解 (Qwen3-VL) 96.0 57.6 76.8 仅二值提问文本,无支持图对比,无本质增益
DeCoDe 1-shot (Qwen3-VL) 97.3 81.2 89.2 引入视觉成对支持对比,准确率大幅飞跃
DeCoDe 1-shot + Dinfo (Qwen3-VL) 97.8 83.8 90.8 结合上位概念引导,取得最佳表现
DeCoDe (显式置信度文本生成) 81.5 62.1 71.8 让模型输出置信度数字,语言失真导致暴跌
DeCoDe (Score(Yes) - Score(No)) 95.3 74.8 85.1 减去 No logit 校准,与直接取 Yes logit 相当
DeCoDe (直接取 Yes Token Logit) 95.3 75.0 85.1 干净简洁且极其鲁棒的打分机制

关键发现

  • 上下文拼接导致严重的负迁移:在标准数据集上,所有开箱即用的 MLLM 在 1-shot 上下文提示下的表现普遍劣于其自身的 0-shot 预测(如 InternVL3 下降 18.5%)。这证实拼接多张支持图像会引入视觉 token 干扰,反而破坏了模型内在的零样本泛化能力。
  • 匿名标签揭示出伪上下文学习假象:一旦将语义类别名替换为 Class 1~5,标准多图 In-context 准确率从 84.9% 骤跌至 27.8%(接近随机)。这表明传统提示法仅仅是在做类名语义匹配,并未实现真正意义上的视觉少样本归纳;而 DeCoDe 在匿名测试中依然斩获 89.2% 的高分,证明其真正激活了跨图像的局部与全局视觉对齐能力。
  • Shot 与 Way 的扩展性反转:在 5-shot 扩展中,传统 In-context 提示因为 prompt 过长导致准确率从 73.9% 暴跌至 50.2%;而 DeCoDe 随着支持样本的增加,平均得分从 80.6% 稳步提升至 85.8%。在 20-way 扩展中,DeCoDe 的准确率降幅显著平缓,抗干扰能力全面碾压 baseline。

亮点与洞察

  • 将多分类决策重构为成对二值验证:将极其复杂的 \(N\)-way 纠缠问题降解为独立的双图比较,利用生成式大模型的自注意力直接对齐两幅图的细节差异,概念简洁且普适性极高。
  • Token Logit 替代离散文本生成的标定价值:跳过 LLM 表面生成的文本字符,直取语义层未归一化的 Yes logit 作为置信度评分,避免了解码采样随机性与文本口语化偏差,提供了高质量的连续度量。
  • 极具启发的领域认知引导(\(D_{\mathrm{info}}\)):不给具体的类别名称(避免泄露先验),仅提供高层领域类型(如“埃及象形文字”或“瑜伽体式”),就能让通用视觉编码器自发调整注意力聚焦维度,为免微调少样本领域迁移提供了崭新思路。

局限与展望

  • 推理复杂度随类别数呈线性增长:对于 \(N\)-way \(K\)-shot 任务,DeCoDe 需要执行 \(N \times K\) 次前向传播(Forward Pass)。虽然每次前向仅包含两张图、计算轻量且完全支持多卡高度并行,但相较于单次上下文前向在吞吐量与计算开销上仍存在权衡(20-way 时单卡延迟大约为单次推理的 1.7 倍)。
  • 需要底层模型暴露 Token Logits 接口:该方法必须直接读取输出层词表中 "Yes" token 的未归一化 logits,对于完全封闭、仅允许纯黑盒文本流式生成的商业 API(或禁用 logprobs 的服务)受限。
  • 未来方向:可进一步探索粗筛加精排的两阶段检索机制(如利用轻量级 CLIP 先将 \(N\) 个候选快速筛选到 Top-\(M\),再使用 DeCoDe 精细打分),兼顾大尺度的计算效率与极致的判别精度。

相关工作与启发

  • vs GFSL [25]: GFSL 注意到了多模态模型对语义标签的依赖并尝试在微调时引入匿名标签,但其仍局限在单次多图长上下文框架内;本文证明无需参数微调,仅靠成对分解推理(DeCoDe)就能在免训练前提下大幅超越微调后的 GFSL 与 SFT 基线。
  • vs SAVs [27]: SAVs 提取 MLLM 隐层特征外接传统分类器(如线性探测或 KNN),本质上依然是特征工程路线;DeCoDe 则坚持使用 MLLM 原生的文本生成决策概率,无需保存特征或训练分类头,保持了端到端多模态交互的纯粹性。
  • vs VQAScore [24]: VQAScore 验证了使用 "Yes" token logit 评估图文匹配质量的优越性;DeCoDe 则将这一机制开创性地扩展至跨图像匹配的少样本分类任务中,验证了 MLLM 具备卓越的隐式少样本学习能力。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 突破传统的上下文拼接范式,将少样本学习巧妙解耦为成对二值验证与 logit 排序,视角独到。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 12 个数据集(含 6 个自建极具挑战的专业 OOD 数据集),对比 3 大开源 MLLM 与经典/微调基线,设立匿名对照组,实验设计极具说服力。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑条理极其清晰,图表完备,论证层层递进,对大模型少样本学习的本质问题剖析透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为免微调条件下的 MLLM 少样本落地应用提供了开箱即用的有效范式,指出了现有评测中利用语言先验“作弊”的盲区。