跳转至

Variational Patch Gating for Training-Free Few-Shot Classification

会议: ECCV 2026
论文: ECCV 2026
领域: 医学图像
关键词: 少样本分类 / 无需训练 / 跨域泛化 / 变分推断 / Patch门控

一句话总结

针对跨域少样本分类中全局 CLS 特征崩溃及传统局部匹配算法计算开销过大的问题,本文提出基于变分推断的 Patch 门控方法(VPG),通过将局部 Patch 分类建模为前背景判别自由能最小化,解析解导出 Sigmoid 门控与有界 Softplus 证据累积,在无需梯度训练与迭代求解器的前提下大幅刷新 CDFSL 基准。

研究背景与动机

在少样本图像分类(Few-Shot Classification)任务中,主流范式依赖冻结主干网络提取的全局特征向量(如 ViT 的 CLS Token)来构建类原型。当测试样本与预训练数据分布相近时,原型分类器能够取得优秀的表现;然而在严重的跨域分布偏移(Cross-Domain Shift)下,这种全局表征往往发生严重退化甚至崩溃。例如在卫星遥感图像中,公路与河流的全局嵌入在冻结 ViT 下可能映射到近乎重合的 CLS 向量,导致类间边界在全局语义空间中彻底失效。相比之下,局部 Patch 特征具备更强的不变性与鲁棒性——低层次的边缘、纹理渐变与局部结构在自然照片、遥感卫星图乃至医学 X 光片中都能激活高度一致的特征表征。

然而,现有的局部 Patch 匹配方法面临两难困境。一方面,已有尝试(如 DeepEMD、H-OT 与 TF-OCM)大多将局部匹配形式化为最优传输(Optimal Transport)或二分图分配问题,必须依赖线性规划(LP)或 Sinkhorn 迭代求解器,其成本随支持集 Shot 数量和 Patch 数量呈二次方甚至三次方爆炸,在多样本场景下完全不可扩展;另一方面,简单的线性 Patch 平均池化又无法区分前景特征与无意义的背景杂波,海量的背景纹理与成像伪影会凭借绝对数量压制真正具备判别力的前景 Patch。

本文的切入角度是跳出繁重的几何匹配与组合优化求解框架,将 Patch 级别的分类过程重新诠释为贝叶斯变分推断下的证据累积。核心 idea:将每个查询 Patch 的前背景判别建模为伯努利隐变量分配,通过最小化变分自由能,在解析闭式解下导出 Sigmoid 门控与饱和上限为 \(-\log(1-\pi)\) 的 Softplus 证据得分,实现无训练、无迭代求解器且具有严格局部影响上限的轻量判别。

方法详解

整体框架

VPG 输入查询图像与各个类别的少样本支持集,利用冻结的 Vision Transformer(如 DINO ViT-S/16)分别抽取局部 Patch Token 集合与全局 CLS 向量。对于每个类别,VPG 先将支持集所有图像的 Patch 拼接为类别特征字典,计算查询 Patch 与字典内各支持 Patch 的余弦距离;随后通过带温度系数的 Soft-min 操作汇聚为该 Patch 针对该类的匹配代价;接着代入由变分自由能解析推导出的 Sigmoid 门控与有界 Softplus 激活函数,对背景杂波进行非线性抑制并计算正向判别证据;最后在对偶空间下将归一化的局部 Patch 证据与全局 CLS 原型相似度按固定凸组合权重融合,输出最终的类别对数几率。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入查询图像与支持图像<br/>冻结 ViT 提取 Patch 与 CLS 特征"] --> B["1. 类别支持字典与软最小值匹配代价<br/>余弦距离矩阵与 Soft-min 汇聚"]
    B --> C["2. 判别式变分 Patch 门控<br/>伯努利隐变量自由能最小化"]
    C --> D["3. 有界影响局部证据累积<br/>Softplus 证据计算与加权求和"]
    D --> E["4. 局部-全局双支路凸组合判别<br/>专家乘积后验联合打分"]
    E --> F["输出预测类别 arg max"]

关键设计

1. 类别支持字典与软最小值匹配代价:高效度量局部匹配质量 为了摆脱两两 Patch 之间复杂的全矩阵二分图配对优化,本文将类别 \(c\) 的全部支持图像 Patch 拼接为一个联合字典 \(S_c = \{s_{c,j}\}_{j=1}^{N_c}\),各 Token 权重均匀设为 \(b_{c,j} = 1/N_c\)。给定查询 Patch \(x_p\),首先计算其与支持 Token 间的余弦距离基准代价 \(M_{pj}^{(c)} = 1 - \langle x_p, s_{c,j} \rangle \in [0, 2]\)。为平滑度量匹配程度同时兼顾最近邻选择的锐度,引入带温度参数 \(\varepsilon > 0\) 的 Soft-min 匹配代价: $\(s_\varepsilon(x_p, S_c, b_c) = -\varepsilon \log \sum_{j=1}^{N_c} b_{c,j} \exp\left(-\frac{M_{pj}^{(c)}}{\varepsilon}\right)\)$ 当 \(\varepsilon \to 0\) 时,\(s_\varepsilon\) 严格收敛至硬最近邻代价 \(\min_j M_{pj}^{(c)}\);而在实际设定的 \(\varepsilon = 0.01\) 下,代价既保证了数值在 \([0, 2]\) 区间内的严格可比性,又实现了向最近支持原型的连续平滑聚焦。整个计算直接通过一次矩阵乘法完成,避免了任何昂贵的最优传输迭代。

2. 判别式变分 Patch 门控:闭式导出的最优前背景过滤器 面对未经清洗的背景纹理和干扰物,传统无监督匹配极易被无意义背景主导。本文并未构建复杂的生成式似然 \(p(x_p \mid c)\)(这需要估计难以计算的类别相关配分函数),而是为每个查询 Patch \(x_p\) 引入一个二值隐变量 \(z_p \in \{0, 1\}\),指示其属于该类的判别性前景(\(z_p=1\))还是无信息杂波(\(z_p=0\)),设先验前景率为 \(P(z_p=1) = \pi\)。引入变分后验 \(q(z_p) = \text{Bern}(r_p)\),构建 Patch 分配自由能目标: $\(\mathcal{F}_p(r_p; c) = r_p \cdot s_\varepsilon(x_p, S_c, b_c) + \text{KL}_{\text{Bern}}(r_p \parallel \pi)\)$ 由于目标函数在 \((0, 1)\) 上严格凸,令其导数等于零即可通过解析解求得唯一的全局最优门控概率: $\(r_p^\star = \sigma(\text{logit}(\pi) - s_\varepsilon(x_p, S_c, b_c))\)$ 其中 \(\sigma\) 为标准 Sigmoid 函数,\(\text{logit}(\pi) = \log \frac{\pi}{1-\pi}\)。这一推导赋予了门控清晰的物理意义:先验 \(\pi\) 直接在代价空间确立了过滤阈值,代价低的前景 Patch 其门控值趋近于 1,而匹配代价远高于先验阈值的杂波 Patch 则被平滑衰减至接近 0,全程无需反向传播或可学习参数。

3. 有界影响局部证据累积:消除异常背景支配的理论鲁棒性 单纯利用未经约束的距离作为分类得分容易受到少数极端 Patch 的剧烈扰动。将最优变分后验 \(r_p^\star\) 代回自由能目标后,天然导出了单 Patch 的证据函数 \(e(x_p; c) = \text{softplus}(\text{logit}(\pi) - s_\varepsilon(x_p, S_c, b_c))\)。由于 Softplus 函数严格单调递增且下界为 0,当匹配达到完美(\(s_\varepsilon \to 0\))时,证据得分严格达到理论上限: $\(0 \le e(x_p; c) \le -\log(1 - \pi)\)$ 在全局固定参数 \(\pi = 0.7\) 下,任意单个 Patch 的证据上限恒为 \(-\log(0.3) \approx 1.20\)。对所有 Patch 进行均匀权重 \(a_p = 1/P\) 的局部证据聚合得到 \(D(X, c) = \sum_{p=1}^P a_p e(x_p; c)\),使得全图局部证据总量严格受限于 1.20。这一理论有界性提供了坚实的鲁棒性保证,从数学上杜绝了任何背景区域因偶然伪影而对判别决策产生无界破坏。

4. 局部-全局双支路凸组合判别:专家乘积后验的等价重参数化 局部 Patch 擅长捕捉细粒度判别部件,但在整体语义轮廓上全局 CLS 特征仍具有互补价值。本文在贝叶斯框架下将局部证据与全局 CLS 原型匹配统一建模为专家乘积(Product of Experts)后验分布。假设均匀类别先验,两支路的联合未归一化对数得分为 \(S_{\text{raw}}(X, c) = D(X, c) + \kappa \langle g_X, g_c \rangle\)。由于 \(\arg\max_c\) 对正标量缩放严格不变,令 \(\alpha = \kappa / (1 + \kappa) \in (0, 1)\),即可将实数权重 \(\kappa\) 精确双射为对偶空间下的凸组合形式: $\(\text{logit}_c(X) = (1 - \alpha) D(X, c) + \alpha \langle g_X, g_c \rangle\)$ 这种重参数化保持了决策排序的绝对严格性,同时避免了启发式超参搜索。在全篇评测中,VPG 统一采用固定配置 \((\pi, \varepsilon, \alpha) = (0.7, 0.01, 0.6)\),不在任何目标域做微调,真正实现了即插即用的纯无训练推理。

实验关键数据

主实验

在跨域少样本标准基准 CDFSL(包含卫星遥感 EuroSAT、植物病理 CropDiseases、皮肤病变 ISIC2018、胸部 X 光 ChestX)以及医疗细胞分类(HEp、BCCD_WBC)上,采用冻结 DINO ViT-S/16 主干网络进行 5-way 5-shot 评估(1000 个 Episode)。对比包括无训练方法与经 base 类或 episode 微调的方法。

数据集 评测设定 本文 (VPG) 之前最佳无训练基准 (TF-OCM) 最佳微调基准 (REAP+FT) 相对无训练SOTA提升
EuroSAT (遥感) 5-way 5-shot 94.02% 86.02% 91.92% +8.00%
CropDiseases (植物) 5-way 5-shot 96.89% 93.20% 96.74% +3.69%
ISIC2018 (皮肤镜) 5-way 5-shot 51.50% 44.52% 56.07% +6.98%
ChestX (胸片) 5-way 5-shot 27.80% 25.00% 28.80% +2.80%
CDFSL 平均 5-way 5-shot 67.55% 62.20% 68.38% +5.35%
HEp (细胞荧光) 5-way 5-shot 69.26% 62.78% 71.21% (MEM-FS) +6.48%
BCCD_WBC (白细胞) 5-way 5-shot 68.86% 66.26% 66.52% (MEM-FS) +2.60%

注:若启用仅更新最后一层 Transformer Block 且迭代 5 步的轻量级 Episodic 微调(VPG+FT),VPG 在 CDFSL 上的均分进一步攀升至 71.06%(EuroSAT 97.39%,CropDis 98.60%,ISIC 59.97%,ChestX 28.30%),显著领先所有竞争对手。

消融实验

在 CDFSL 基准上对 VPG 各核心组件进行逐项剔除消融(5-way 5-shot,600 个 Episode,基线配置 \(\pi=0.7, \varepsilon=0.01, \alpha=0.6\)):

配置 CDFSL 平均准确率 (%) 相对完整模型变化 说明
VPG 完整模型 67.55 - 完整变分门控 + 有界证据 + 双支路融合
仅局部证据支路 (\(\alpha=0\)) 65.16 -2.39 移除全局 CLS 支路,各域均有下降
仅全局 CLS 支路 (\(\alpha=1\)) 66.21 -1.34 移除局部 Patch 变分分支,无法应对局部形变
无门控与 Softplus (直接用 \(-s_\varepsilon\)) 66.74 -0.81 去除变分门控与有界性,背景噪声无界累积

关键发现

  • 局部变分门控的决定性贡献:在 EuroSAT 和 CropDiseases 等纹理结构明显的领域,无训练的 VPG 分别达到 94.02% 和 96.89%,不仅以 +8.00% 的巨大优势击败了同为局部匹配的 TF-OCM,甚至超越了经过监督训练和复杂微调的 REAP+FT(91.92% 和 96.74%),证明了局部几何线索在大幅跨域场景下的本质优势。
  • 超参鲁棒性极高:在 \(\pi \in [0.1, 0.9]\) 与 \(\varepsilon \in [0.01, 0.1]\) 的宽幅区间内,分类准确率波动均严格小于 1%;融合权重 \(\alpha\) 在 \([0.4, 0.6]\) 区间内呈现宽广平台期,单套参数跨 12 个数据集泛化良好。
  • 推理速度实现指数级跃升:在 5-shot 设定下单 Episode 仅耗时 12 ms,相比基于 Sinkhorn 迭代的 H-OT(453 ms)提速 37 倍,相比基于线性规划 LP 的 DeepEMD(86.5 s)提速 7210 倍,且时间复杂度随 Shot 增加保持纯线性增长。

亮点与洞察

  • 变分推断解析推导:将前背景分配建立在伯努利隐变量自由能之上,无需任何迭代逼近或近似采样,直接解析求导出 Sigmoid 门控与 Softplus 形式,兼具理论严谨性与计算极简性。
  • 有界影响理论保证:证据得分天然饱和于 \(-\log(1-\pi)\),赋予局部特征匹配天然的抗杂波扰动认证,彻底解决了传统 Patch 匹配容易被大面积无用背景掩盖的结构性顽疾。
  • 全流程无训练与真正单一参数通用:不进行源域元训练,不改动 ViT 架构,不为各目标域微调超参数,仅凭一组通用配置即在卫星、医学、农业等四大跨域场景实现 SOTA。

局限与展望

  • 正向单向证据的累加效应:由于 Softplus 证据值恒非负(\(e \ge 0\)),模型只能积累正向支撑证据,无法表达负向排斥证据。当非目标类别恰好与查询样本共享少数假阳性相似 Patch 时,错误类别的得分会被非预期推高。未来可通过引入对比类背景统计量建模显式负证据。
  • 背景各向同性假设:当前推导假定背景能量均匀(\(\beta \equiv 0\)),在复杂高结构化背景(如具有强语义干扰的复合背景)下,自适应估计背景密度分布有望进一步提升信噪比。

相关工作与启发

  • vs DeepEMD / H-OT: DeepEMD 和 H-OT 依赖最优传输求解复杂的全代价分配矩阵,导致推理延迟高达数百毫秒乃至数十秒;VPG 将匹配转化为针对类别词典的 Soft-min 投影,以纯解析矩阵运算实现 12 ms 的极速分类。
  • vs TF-OCM: TF-OCM 依赖模体优化进行 Patch 聚类后再进行二分图匹配,开销较大且容易受图分割误差影响;VPG 建立在严密的变分证据累积理论之上,以闭式门控在 CDFSL 上大幅超出 TF-OCM 5.35 个百分点。
  • vs REAP / CD-CLS / AttnTemp: 这一系列近作聚焦于对全局 CLS Token 的校准或元微调;VPG 揭示了在严重跨域场景下,无需调整主干网络,通过对局部 Patch 施加有界变分门控即可释放自监督预训练的深层泛化潜力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次将变分推断与有界证据闭式解引入少样本 Patch 匹配,摆脱了最优传输求解器沉重枷锁]
  • 实验充分度: ⭐⭐⭐⭐⭐ [横跨 CDFSL、医学、Meta-Dataset 与经典基准共 12 个数据集,兼顾无训练与微调设置]
  • 写作质量: ⭐⭐⭐⭐⭐ [理论推导清晰完备,从变分目标到闭式解逻辑严密,图表对比极具说服力]
  • 价值: ⭐⭐⭐⭐⭐ [为跨域自监督泛化提供了极具落地价值的高效无训练范式,速度与精度兼优]