跳转至

Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models

会议: ECCV 2026
论文: ECCV Official
代码: https://github.com/Evelyn1ywliang/PuRF-MLTTA
领域: 多模态VLM
关键词: 测试时自适应 (TTA), 视觉语言模型, 多标签图像识别, 区域提纯, 缓存机制

一句话总结

针对多模态 VLM 在多标签测试时自适应(MLTTA)中全局特征多对象耦合导致缓存被显著类污染、以及后期缓存饱和僵化的问题,PuRF 提出区域提纯结合情境-时序双重缓存提纯策略,实现了无需微调模型主干的细粒度特征对齐与持久自适应能力。

研究背景与动机

基于视觉语言模型(如 CLIP)的测试时自适应(Test-Time Adaptation, TTA)在单标签图像分类中展现出应对测试阶段分布偏移(Distribution Shifts)的强大能力,主要演化出基于提示学习(Prompt Tuning)与基于记忆缓存(Cache-based)两大流派。然而现实世界图像往往包含多个共存物体,更具实用价值的多标签测试时自适应(MLTTA)受到的关注却极为有限。单标签场景下主流的缓存方法依赖低熵样本驱动的全局特征存取,一旦直接迁移到多标签环境,便会遭遇严重的“一对多表征耦合(One-to-many dilemma)”瓶颈。

由于单张图像的空间池化全局特征强行混合了所有共存物体的信息,显著度高的类别(如大面积的水面、背景)会在全局向量中占据压倒性主导地位。若将该耦合向量直接存入各个伪标签对应的类别缓存槽位中,会导致原本互不相同的类别原型被显著类严重污染,极大地破坏了缓存对类别边界的校准能力。虽然在弱监督与多标签识别中引入局部区域(Region-level)线索被证明能剥离孤立的类别证据,但在完全无监督、流式输入的测试阶段,随机裁剪获取的候选区域包含大量背景噪声与上下文冗余,难以保证选出真正可靠的目标区域。此外,多标签样本每次推断会同时向多个类别的缓存槽插入新项,使得容量有限的缓存极易陷入“缓存饱和(Cache Saturation)”,前序样本形成先验垄断,后续高价值样本因准入门槛过高而无法进入,导致长周期自适应停滞。

为了化解上述区域噪声干扰与缓存多标签污染的矛盾,本文提出了一种提纯驱动的多标签缓存自适应框架 PuRF。核心 idea:通过类别自适应相对激活度筛选高纯度局部区域以解除多标签特征耦合,并构建“单样本情境锚定存取 + 指数时序衰减惩罚”的提纯缓存机制,在细粒度跨模态对齐的同时保持流式测试中的长效适应能力。

方法详解

整体框架

PuRF 针对流式无标注测试样本,首先在局部尺度抽取多尺度随机裁剪区域,通过自适应类间相对置信度筛选出高纯度的局部特征集合,并结合全局多视角数据增强的 Top-κg 候选预测,以双向交集形式推导出高置信度的多标签伪监督信号;接着在缓存更新中,为每个正类伪标签在纯净区域中选出熵最低的局部表征作为专属原型锚点存入对应类别的记忆队列(情境提纯),并在推断检索时以最大区域响应代替全局检索;面对流式输入造成的早期样本霸占缓存问题,设计了基于保留时长的时序指数衰减惩罚(时序刷新),动态提升老旧样本的置信度惩罚以促使缓存平滑更迭。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 x 与流式测试流"] --> B["全局增强预测 Top-κg<br/>构建全局候选标签集 G"]
    A --> C["多尺度随机裁剪候选区域 Q"]
    C --> D["区域提纯:类别自适应相对置信度筛选<br/>获取高纯度局部区域集合 F_V^pur"]
    B & D --> E["全局-局部一致性交集<br/>确定可靠伪标签向量 y~"]
    D & E --> F["情境提纯:按伪标签锚定最低熵区域<br/>更新类别专属原型缓存 M^c"]
    F --> G["时序刷新:引入保留时间指数衰减惩罚<br/>动态提升老旧条目有效熵并更新槽位"]
    E & F --> H["全局-局部混合检索结合 BCE 与对齐损失<br/>微调轻量文本残差并输出多标签预测"]

关键设计

1. 区域提纯:基于相对激活与动态类阈值的局部证据解耦
传统全局特征在多标签场景下存在多物体共存缠绕与显著类主导缺陷,而未加甄别的局部随机裁剪又包含大量背景与混杂语义。PuRF 对输入的 \(Q\) 个候选裁剪特征,计算其在各类别文本原型上的相对类别置信度(通过跨类别 Softmax 归一化 \(\hat{s}_q^c = \text{softmax}_c(\langle \mathbf{f}_{\mathrm{V}}^{(q)}, \mathbf{F}_{\mathrm{T}}^c \rangle)\))。当且仅当某区域的主导类别置信度超越该类别的动态维护阈值 \(\mu_c\) 时,该区域才被接纳为纯净区域 \(\mathcal{F}_{\mathrm{V}}^{\text{pur}}\)

\[\mu_c \leftarrow \mu_c - \frac{1}{T}(\bar{s}_c - \mu_c), \quad \bar{s}_c = \frac{1}{Q}\sum_{q=1}^{Q}\hat{s}_q^c\]

该自适应阈值通过随测试步长 \(T\) 的滑动均值追踪不同类别的置信度尺度,避免了固定阈值在类别不平衡下的偏差。提纯区域的 Top-1 预测汇聚成局部候选标签集 \(\mathcal{R}\),与全局增强多视角的交集标签集 \(\mathcal{G}\) 取交集,形成兼顾全局稳健性与局部高分辨的最终伪标签 \(\tilde{y} = \mathcal{G} \cap \mathcal{R}\)

2. 情境提纯:局部类别专属原型锚定与最大激活检索
传统缓存将单张图像的全局特征整体存入所有预测出的正类槽位,造成不同类别的特征互相污染。情境提纯(Episodic Purification)在获得当前样本的可靠伪标签集合 \(\tilde{y}\) 后,对其中的每一个正类 \(\tilde{y}_i\),专门在已纯净化的局部区域集合 \(\mathcal{F}_{\mathrm{V}}^{\text{pur}}\) 中搜寻预测熵最低的最佳锚定区域 \(r^{\star}\)

\[r^{\star} = \arg\min_{\mathbf{f}_{\mathrm{V}}^{(q)} \in \mathcal{F}_{\mathrm{V}}^{\text{pur}}} \mathcal{H}\left(\langle \mathbf{f}_{\mathrm{V}}^{(q)}, \mathbf{F}_{\mathrm{T}}^{\tilde{y}_i} \rangle\right)\]

将该特定局部特征与对应预测熵打包作为该类别的缓存候选,从而确保每个类别缓存槽位内沉淀的都是该类别孤立、无缠绕的高纯度视觉特征。在测试推断时,缓存检索亦摒弃全局向量,改用当前样本纯净区域集合上的最大相似度检索 \(\max_{\mathbf{f}_{\mathrm{V}}^{(q)} \in \mathcal{F}_{\mathrm{V}}^{\text{pur}}} \langle \mathbf{f}_{\mathrm{V}}^{(q)}, \mathbf{F}_{\text{cache}}^c \rangle\),有效放大了细粒度微弱目标的响应,阻断了显著背景的干扰。

3. 时序刷新:指数时序惩罚破除长尾测试中的缓存僵化
在多标签数据流中,由于每个样本可产出多个局部类别的缓存候选,缓存容量(如 \(L=3\))在很短时间内就会被占满,其熵阈值随之迅速收紧。这导致测试中后期的样本几乎无法进入缓存,缓存完全被早期由于模型尚未充分适应而存入的可能欠佳的原型所垄断(缓存饱和现象)。时序刷新(Temporal Refreshing)记录每个缓存条目入驻以来的相对停留时间步 \(t_i\),以指数惩罚系数放权老旧条目的置信度:

\[w_i^{\text{time}} = \exp\left(\frac{t_i - \delta}{\delta}\right), \quad \mathcal{H}_i^{\prime} = \mathcal{H}_i \cdot w_i^{\text{time}}\]

当停留步数超过保留阈值 \(\delta\)(默认设为 1000 步)后,\(w_i^{\text{time}} > 1\) 会迅速拉大该条目的有效熵值 \(\mathcal{H}_i^{\prime}\),从而在遇到新样本时优先被淘汰。这一机制促使缓存保持新陈代谢,使流式测试后期更成熟、对齐更精准的视觉特征能够顺畅进入记忆库。

损失函数 / 训练策略

PuRF 冻结 CLIP 原始图像与文本编码器主干,仅针对轻量文本残差 \(\Delta \mathbf{F}_{\mathrm{T}}^c\)(参照 ReTA 设计并引入邻近专家提示扩展)实施在线梯度更新。总优化目标由伪标签二值交叉熵、预测边缘熵及跨模态对齐损失构成:

\[\mathcal{L}^* = \mathcal{L}_{\text{ent}} + \lambda_1 \mathcal{L}_{\text{BCE}} + \lambda_2 \mathcal{L}_{\text{align}}\]

其中 \(\mathcal{L}_{\text{BCE}}\) 作用于全局与局部最大激活等权融合后的输出 \(s_{\text{TTA}}^c = \frac{1}{2}\langle \mathbf{F}_{\mathrm{V}}, \mathbf{F}_{\mathrm{T}}^c \rangle + \frac{1}{2}\max_{\mathbf{f}_{\mathrm{V}}^{(q)}}\langle \mathbf{f}_{\mathrm{V}}^{(q)}, \mathbf{F}_{\mathrm{T}}^c \rangle + s_{\text{cache}}^c\),损失平衡超参数设为 \(\lambda_1 = 0.2\)\(\lambda_2 = 0.5\)。更新后的文本嵌入按照滑动平均进行流式归一化聚合。

实验关键数据

主实验

在五大通用多标签基准(PASCAL VOC 2007/2012、MS-COCO 2014/2017 以及大规模 NUS-WIDE)上,PuRF 在不同视觉主干下均大幅刷新单标签和多标签 SOTA 表现。下表展示了 ViT-B/16 与 ViT-B/32 主干下的核心性能对比(指标为 mAP %):

主干网络与方法 VOC 2007 VOC 2012 COCO 2014 COCO 2017 NUS-WIDE 全数据集平均 (Avg.)
ViT-B/16: Zero-shot CLIP 79.58 79.25 54.42 54.13 45.65 62.61
ML-TTA (ICLR'25, 提示优化) 81.28 81.13 57.52 57.49 46.55 64.80
DPE (NeurIPS'24, 原型演化) 84.10 83.62 59.21 59.28 48.90 67.02
ReTA (ACM MM'25, 单标签缓存) 85.09 84.49 60.37 60.30 49.20 67.89
PuRF (本文方法, ViT-B/16) 88.18 87.12 66.05 65.33 50.72 71.48
提升对比 ReTA / 提升对比 ML-TTA +3.09 +2.63 +5.68 +5.03 +1.52 +3.59 / +6.68
ViT-B/32: Zero-shot CLIP 77.18 76.85 50.31 50.15 42.90 59.48
ReTA (ACM MM'25, ViT-B/32) 83.99 83.51 57.02 56.58 48.05 65.83
PuRF (本文方法, ViT-B/32) 87.32 86.04 63.42 63.02 49.61 69.88
提升对比 ReTA (ViT-B/32) +3.33 +2.53 +6.40 +6.44 +1.56 +4.05

消融实验

基于 ViT-B/16 在 VOC 2007 与 COCO 2017 上的关键组件贡献消融(原论文 Table 5)表明,区域提纯(RP)、情境提纯(EP)和时序刷新(TR)缺一不可且具备高度互补性:

配置编号 区域提纯 (RP) 情境提纯 (EP) 时序刷新 (TR) VOC 2007 (mAP %) COCO 2017 (mAP %) 模块效果分析说明
1 (基线模型) 84.83 60.71 仅使用基础全局残差适配与静态缓存
2 (+RP) 86.67 63.35 区域提纯剥离局部独立线索 (+2.64% COCO)
3 (+EP) 85.79 62.59 仅依靠情境提纯清洗缓存原型 (+1.88% COCO)
4 (+RP+EP) 87.50 64.56 局部细粒度解耦与纯净缓存双重增益
5 (+RP+TR) 87.36 64.12 引入时序刷新缓解长期流式饱和
6 (+EP+TR) 86.65 63.37 缓存侧双重提纯组合
7 (Full PuRF) 88.18 65.35 全模块完整协同达最佳性能 (+4.64% COCO)

在提纯细节探索中,对比无提纯全区域(63.46%)或绝对置信度过滤(65.02%),相对激活筛选取得最优 65.35% mAP;而在缓存检索上,相比平均聚合(64.92%),区域最大激活聚合达到了 65.35% mAP,充分保证了显著局部的独立判定。

关键发现

  • 复杂共存场景增益尤为显著:在多物体密集共存的 COCO 2014/2017 数据集上,PuRF 相比 ReTA 取得了超过 5.0% 至 6.4% 的超高 mAP 提升,而在类别较稀疏的 VOC 上提升在 2.5%~3.3% 左右,直接印证了区域解耦在密集多标签场景的核心价值。
  • 计算开销可控但推理显著加速:相比每步都要多轮反向传播且重置提示的 ML-TTA(3.05 FPS, 显存 5.77GB),PuRF 实现了近乎倍增的吞吐量(5.74 FPS)且显存开销仅为 1.04GB,兼具极强的工业落地实用性。
  • 先进基础模型兼容度优异:在 EVA-02、SigLIP2 和 MetaCLIP2 等更新架构上,PuRF 分别较 DPE 和 ReTA 平均高出 3.5%~3.7% mAP(例如在 SigLIP2 上达到 84.76% 平均 mAP),证明其解耦机制具有通用性。

亮点与洞察

  • 空间维度的相对提纯设计:通过类间 Softmax 后的相对支配度替代传统绝对阈值,巧妙规避了多标签在少样本极端分布下各类先验激活量纲不一致的陷阱。
  • 时序维度的指数衰减抗饱和:借鉴学习率时序调度思路,将“驻留时长转化为有效熵惩罚”,以极其精简的一行公式让有限容量缓存具备生命周期与新陈代谢,直击流式自适应后期的“冻结失效”痛点。
  • 跨任务可迁移性:该“区域相对置信度解耦 + 样本生命周期惩罚”范式可直接平移至开放词汇目标检测(OVOD)、弱监督全景分割以及多轮多模态对话流式知识记忆检索中。

局限与展望

  • 区域候选依赖随机裁剪机制:当前局部候选依赖固定的 50 个随机多尺度裁剪框,对极端细长条物体或极端密集小物体可能存在漏检与局部信息割裂,未来可探索轻量无监督对象提议(如 Class-Agnostic Segment Anything 掩码)辅助切片。
  • 超参数 \(\delta\) 针对流长敏感:时序惩罚阈值 \(\delta\) 需预先对数据流的大致长度有所假设(默认 1000),在流速不可预知或流分布突变剧烈的非平稳环境中,缺乏自适应流速感知能力。
  • 后续优化思路:可设计动态评估缓存内容冗余度(如跨样本余弦相似度均值)以自适应调整衰减速率,并在边缘计算设备上引入关键区域早停裁剪机制。

相关工作与启发

  • vs ML-TTA (ICLR 2025):ML-TTA 探索了多标签下的受界熵最小化与提示优化,但每步推断需彻底重置且缺少历史样本经验共享;PuRF 引入缓存体系与区域解耦,不仅 mAP 大幅领先(ViT-B/16 上高出 6.68%),推理速度更是 ML-TTA 的近两倍。
  • vs ReTA / DPE (ACM MM 2025 / NeurIPS 2024):ReTA 与 DPE 等先进单标签缓存方法在多标签场景下因全局特征缠绕导致缓存严重污染;PuRF 在区域级抽取单一强响应特征并锚定至类别槽,辅以时序刷新机制,解决了缓存污染与容量饱和两大难题。

评分

  • 新颖性: ⭐⭐⭐⭐ [针对多标签 TTA 提纯区域与双尺度缓存的机制设计切中痛点,构思精巧]
  • 实验充分度: ⭐⭐⭐⭐⭐ [跨 5 大标准数据集、4 类 CLIP 变体、3 大新型 VLM 以及 3 种提示初始化模式,评测完备]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密清晰,图表直观且问题阐述切中要害]
  • 价值: ⭐⭐⭐⭐⭐ [攻克了多标签领域长期被忽视的 TTA 难题,兼顾高精度与高运行效率,具有重要基准价值]