跳转至

Training-free Discriminative Patch Mining for Robust Few-Shot Recognition with CLIP

会议: ECCV 2026
论文: ECCV 2026 Poster 5508
代码: https://github.com/VICO-UoE/CDPS
领域: 多模态 VLM
关键词: 视觉语言模型, 免训练少样本学习, 判别性局部 Patch 挖掘, CLIP, 细粒度图像识别

一句话总结

针对 CLIP 在类别名称语义模糊或高度专业化时零样本/少样本对齐性能受限的问题,本文提出无需任何参数微调的类判别性 Patch 集合(CDPS)挖掘方法,通过双重准则筛选类内一致且类间互斥的局部视觉特征,并构建结合图像-文本全局相似度与局部 Patch 相似度的自适应混合分类器,大幅提升细粒度少样本分类的鲁棒性。

研究背景与动机

大规模对比视觉-语言预训练模型(如 CLIP、ALIGN 与 SigLIP)通过在海量图文对上对齐跨模态表征,在零样本与少样本图像识别中展现出强大的泛化能力。然而,现有多模态模型对文本提示词(Textual Prompts)的语义质量和具体表述极度敏感。在细粒度分类基准中,许多类别的名称往往是晦涩的拉丁学名、冷僻的代号或高度技术化的型号标识(如航空器数据集 FGVCAircraft 中的“727-200”或汽车数据集 StanfordCars 中的“Audi V8”与“Audi 100”)。在缺乏通俗或丰富语义先验的情况下,文本编码器生成的特征无法有效激活图像中微妙的视觉线索,导致跨模态对齐严重受阻。

为缓解这一提示瓶颈,现有主流路线可分为两类:一是基于提示工程与大语言模型(LLM)扩写,借助 LLM 生成详细的类别描述,但这极易引入幻觉且生成的语言往往缺乏细粒度区分度;二是基于参数化提示学习(如 CoOp、MaPLe)或轻量适配器(Adapter),但在少样本且类别名称本身体系模糊的前提下,受限于预训练文本嵌入空间的固有边界,参数微调难以突破文本语义表达力的天花板。与之相对,经典细粒度视觉分类(FGVC)长期专注于在纯视觉表征中挖掘具有高判别力的局部部件(Part-level Features),完全摆脱了文本名称带来的多义性或模糊性困扰,但传统方法严重依赖全量监督训练和密集的多阶段网络,无法直接在无训练约束的少样本多模态设定下发挥效能。

本文的切入角度是:直接复用预训练 CLIP 图像编码器内部自注意力机制所蕴含的细粒度空间局部表征,无需更新任何模型参数,通过严格的统计准则从少样本图像中沉淀出纯视觉的类判别性局部特征集。核心 idea:提出免训练的类判别性 Patch 集合(CDPS)挖掘准则,同时约束类内高一致性与类间低歧义性,并构建结合自适应平衡因子的图文全局匹配与局部 Patch 集合相似度混合分类器。

方法详解

整体框架

本文方法的流程由两个核心阶段构成:首先是在给定各类极少量标注样本的前提下,直接基于冻结的 CLIP 视觉编码器提取局部 Patch 特征,通过注意力显著性初筛、连通区域去噪以及“类内一致性-类间互斥性”双准则评分,为每个类别构建纯视觉的类判别性 Patch 集合(Class-Discriminative Patch Set, CDPS);随后在推理阶段,针对查询图像提取其对应的过滤 Patch 集合,分别计算其与文本原型的全局相似度 logits 以及与各类别 CDPS 的集合到集合(Set-to-Set)局部相似度 logits,并通过留一交叉验证自适应确定融合权重 \(\lambda\),输出最终预测标签。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["少样本输入图像与文本提示"] --> B["初步过滤:注意力图阈值筛选与连通域去噪"]
    B --> C["双准则 Patch 打分:类内一致性与难负类惩罚"]
    C --> D["构建类判别性 Patch 集合 (CDPS)"]
    D --> E["集合到集合局部相似度匹配"]
    E --> F["自适应混合分类器:动态加权文本与局部视觉 logits"]

关键设计

1. 初步过滤:注意力显著性与连通区域去噪

CLIP 的 Vision Transformer(ViT)最后一层包含针对类别 Token([CLS])的多头自注意力图,该注意力权重直接反映了各网格 Patch 对全局视觉语义的贡献程度。为了消除大量无关的背景冗余,该设计首先选取注意力权重处于前 \(\rho\) 百分位(默认 \(\rho=40\%\))的候选 Patch。由于单纯的数值阈值往往会遗留孤立的点状噪声,本文进一步引入连通区域分析,在候选 Patch 构成的空间二值掩码中仅保留最大的 \(N_{cp}\) 个连通区域(默认 \(N_{cp}=2\)),剔除碎片化噪声。值得注意的是,该掩码仅用于后验特征提取与过滤,整张图像仍以未裁剪的完整上下文输入 ViT 编码,确保保留全局自注意力机制计算得出的上下文感知嵌入。

2. 双准则 Patch 打分:平衡类内一致性与难负类惩罚

初步过滤保留了前景主体,但并非所有前景区域都能作为类别的排他性指纹(例如飞机图片中的机翼造型具有区分度,而通用的背景蓝天或通用机身蒙皮在多个类别中普遍存在)。为此,本文定义 Patch 到类别(Patch-to-Class, P2C)的平均匹配相似度:针对类别 \(c\) 中的图像集合 \(\mathcal{X}_c = \{x_i\}\),Patch 向量 \(v\) 与该类的匹配度为各图像中最大余弦相似度的均值: $\(S_{\text{P2C}}(v, \mathcal{X}_c) = \frac{1}{|\mathcal{X}_c|} \sum_{x \in \mathcal{X}_c} \max_{v_p \in V_M(x)} \cos(v, v_p)\)$ 在此基础上,每个 Patch 的判别力得分由两项联合决定:第一项鼓励该 Patch 在同类图像中具有高度的出现一致性;第二项对该 Patch 在其他类别图像中的频繁出现施加惩罚: $\(\text{Score}(v) = S_{\text{P2C}}(v, \mathcal{X}_c) - \frac{\omega}{N_c} \sum_{c' \in \mathcal{C}_{\text{hard}}} S_{\text{P2C}}(v, \mathcal{X}_{c'})\)$ 其中 \(\omega\) 为平衡超参数(默认 0.1)。针对类别数庞大时的全量遍历计算瓶颈,本文引入了难负类别近似(Hard Negative Approximation):基于图像全局特征与文本原型的零样本预测相似度,仅选取除真值类别外平均 logits 最高的 \(N_c\) 个易混淆类别(默认 \(N_c=5\))作为惩罚集合,使得得分严格聚焦于修剪最易引发误判的边界特征。对类别内每张图像各选取最高得分的 top-\(K\)(默认 \(K=20\))个 Patch,取并集构成该类的类判别性 Patch 集合 \(V_c^D\)。

3. 自适应混合分类器:动态加权全局图文与局部视觉 Logits

在对未见测试图像 \(\tilde{x}\) 进行推断时,先对其提取经过初步过滤的 Patch 集合 \(V_M(\tilde{x})\),通过集合到集合(Set-to-Set, S2S)最大平均余弦相似度计算其与各类别 CDPS 集合 \(V_c^D\) 的局部视觉匹配相似度: $\(S_{\text{S2S}}(V_M(\tilde{x}), V_c^D) = \frac{1}{|V_M(\tilde{x})|} \sum_{v_q \in V_M(\tilde{x})} \max_{v_p \in V_c^D} \cos(v_q, v_p)\)$ 经 Softmax 归一化后得到 Patch 级预测概率分布 \(z_P\)。针对类别名称语义信息丰富程度差异巨大的下游场景,本文构建自适应加权混合分类器: $\(\hat{y} = \arg\max_c \left[ \lambda \cdot z_T(c) + (1 - \lambda) \cdot z_P(c) \right]\)$ 其中 \(z_T\) 为 CLIP 原始文本-图像余弦相似度 logits,\(\lambda \in [0, 1]\) 为模态平衡因子。本文避免手动经验设定,而是直接在给定的少样本支撑集上采用留一交叉验证(Leave-One-Out Cross-Validation)以 0.1 为步长进行网格搜索,自动选出最优验证准确率对应的 \(\lambda\)。当类别名称极度晦涩或每类支撑样本增多时,系统自动降低 \(\lambda\),将判别决策的信任度平滑转移给纯视觉局部 Patch。

实验关键数据

主实验

在涵盖细粒度视觉识别(FGVCAircraft、StanfordCars、Semi-Aves 等)与通用场景分类的 12 个公开基准数据集上,基于统一的 OpenCLIP ViT-B-16 骨干网络评测不同 Shot 设定下的平均 Top-1 准确率(%),基准包含主流免训练方法(Tip-Adapter、GDA、ECALP、TIMO)及微调方法(CLAP、LDC):

方法类型 方法 1-shot 2-shot 4-shot 8-shot 16-shot
微调 (Training-based) CLAP (CVPR 2024) 69.69 72.61 74.73 77.29 79.34
微调 (Training-based) LDC (CVPR 2025) 70.64 72.56 75.34 77.97 80.86
免训练 (Training-free) Tip-Adapter (ECCV 2022) 61.23 63.46 65.26 67.34 69.11
免训练 (Training-free) GDA (arXiv 2024) 60.91 64.90 68.49 71.83 74.59
免训练 (Training-free) ECALP (arXiv 2024) 61.99 62.94 64.94 67.07 69.23
免训练 (Training-free) TIMO (AAAI 2025) 65.29 67.20 70.33 72.84 75.52
免训练 (Training-free) Ours (CDPS) 69.77 73.90 76.21 78.30 80.28

消融实验

在 4-shot 设定下对初步过滤(Fil.)与自适应混合权重机制(Adp.)在四类典型数据集(航空器 FGVCAircraft、汽车 StanfordCars、动作 UCF101、卫星遥感 EuroSAT)上的消融准确率(%):

配置 (Fil. | Adp.) FGVCAircraft StanfordCars UCF101 EuroSAT 核心观察
基线 (- | -) 31.41 86.85 69.23 76.80 全 Patch 均等且固定 \(\lambda=0.5\)
仅初步过滤 (✓ | -) 32.52 86.87 75.95 80.67 实体显著性显著提升 UCF 与 EuroSAT
仅自适应融合 (- | ✓) 38.47 88.08 71.05 77.80 动态 \(\lambda\) 大幅改善型号晦涩的 Aircraft
完整模型 (✓ | ✓) 39.84 88.46 77.24 80.89 两者互补,在所有领域均取得最佳指标

同时,在类别一致性与互斥性准则消融(Table 6)中,若移除类间惩罚(w/o inter),在 4-shot 设定下四类细粒度数据集平均掉点 3.07%;若移除类内一致性(w/o intra),平均掉点达 4.67%,有力证明了双准则联合评分对排除通用背景特征的必要性。

关键发现

  • 细粒度专业数据集收益最显著:在 FGVCAircraft 和 StanfordCars 这类型号名称高度抽象的数据集上,CDPS 较其他免训练方法获得了近 7-10 个百分点的飞跃,甚至超越了需参数更新的微调方法。
  • 自适应权重 \(\lambda\) 具有高度可解释性:在 Food101(菜品名语义本身非常具象)上选择的 \(\lambda\) 维持在 0.6-0.9 的高位,而在 FGVCAircraft 上随着样本数增至 16-shot,\(\lambda\) 迅速降至 0.1,表明系统能自主识别文本缺陷并依靠纯视觉局部线索完成推理。
  • 留一法选取的 \(\lambda\) 与测试集全局穷举最优 \(\lambda\) 相比,平均准确率差距仅有 0.47%,证明了无需额外验证集即可实现近乎最优的超参数自适应。

亮点与洞察

  • 零额外参数与零微调开销:完全在冻结的 CLIP ViT 特征空间中操作,避免了提示微调或适配器带来的过拟合风险与计算开销,兼具推理效率与极强的实用性。
  • 纯视觉局部线索救济跨模态失配:首次系统性论证了当多模态文本提示词退化为非语义符号时代币(Symbolic Tokens)时,直接回归局部 Patch 粒度挖掘类内恒常模式是破除文本瓶颈的最优路径。
  • 自适应留一门控机制:将全局语义先验与局部细粒度特征做柔性软融合,解决了纯 Patch 匹配在通用高层语义分类任务中易受背景干扰的问题。

局限与展望

  • 空间几何拓扑信息的缺失:目前集合到集合的相似度匹配仅依赖 Patch 特征余弦最大值的无序池化,未对 Patch 之间的相对空间排列(Spatial Layout)与形变几何关系进行建模。
  • 对首层注意力的依赖性:若 ViT 最后一层的 [CLS] 注意力图本身严重漂移或无法定位到前景目标,初步过滤可能会错误剔除关键判别区域。
  • 多层特征融合空间待探索:实验指出高层特征偏向形状表征(Shape Bias),在面对分布偏移(如 ImageNet-V2)时细微纹理鲁棒性不足;探索多层浅层与深层特征的自适应融合是后续的重要演进方向。

相关工作与启发

  • vs. Prompt Learning (CoOp, MaPLe):Prompt Learning 试图在文本空间优化前缀向量以适配下游任务,但当类别名称本身语义缺失时,文本空间的表达容量天然受限;本文直接挖掘图像端局部 Patch,完全绕开文本瓶颈。
  • vs. Training-free 适配 (Tip-Adapter, GDA, TIMO):先前的免训练方法大多在全局图像嵌入或类别文本嵌入层面进行后处理缓存检索或图传播;本文深入 ViT 局部 Patch 内部,建立了兼具前景注意力过滤与类间排斥约束的局部特征库。

评分

  • 新颖性: ⭐⭐⭐⭐☆ [敏锐指出文本提示在细粒度型号上的失效,将经典 FGVC 局部挖掘思想免训练地引入 CLIP Patch 表征中]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 12 个数据集、多种 Shot 设定、全面消融、超参敏感度与 OOD 鲁棒性分析]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图文对照直观,动机与消融分析闭环完整]
  • 价值: ⭐⭐⭐⭐☆ [免训练特性使其极易部署落地,为细粒度少样本多模态识别提供了极具实用价值的范式]