跳转至

Probe, Anchor, and Amend: Active Test-Time Adaptation of Vision-Language Models

会议: ECCV 2026
论文: ECCV 2026
领域: 多模态VLM
关键词: 主动测试时自适应, 视觉语言模型, 原型对齐, 记忆自优化, 二值验证

一句话总结

提出 PAA 框架,将视觉与文本原型视作动态演化的目标域语义状态,通过“主动探测(Probe)-原型正则锚定(Anchor)-记忆驱动修正(Amend)”三步循环,仅凭极其稀疏的二值验证反馈即可实现稳定且具备高塑性的跨模态测试时自适应。

研究背景与动机

大规模预训练视觉语言模型(如 CLIP)在各类下游视觉任务中展现出卓越的零样本泛化能力。然而,在实际开放场景部署中,测试数据流往往面临剧烈且未知的分布偏移(如光照骤变、风格突变、图像损坏与对抗噪声等),导致模型固有的视觉与文本特征对齐关系遭到破坏,分类决策边界发生严重漂移。现有的无监督测试时自适应(TTA)方法多依赖于高置信度伪标签或启发式熵最小化策略,在分布偏移剧烈时极易因伪标签噪声陷入确认偏差(confirmation bias),且无法获知分类边界在流式数据中究竟应向何处调整。

为了突破无监督信号弱、易崩溃的局限,主动测试时自适应(ATTA)被引入该领域。ATTA 允许模型在推理流中主动查询极少量的监督反馈以校准模型。然而,现有 ATTA 方案大多针对纯视觉卷积或 ViT 分类网络设计,仅将人工标注视作局部的样本级损失惩罚,缺乏将离散稀疏反馈整合进跨模态连续语义流的系统机制。对于视觉语言模型而言,测试分布偏移不仅发生在视觉特征空间,文本原型的相对几何结构以及图文模态间的交互对齐也会联合漂移。直接施加局部梯度微调极易破坏预训练图文对齐的全局拓扑结构,引发灾难性遗忘与边界塌陷。

针对这一核心矛盾,本文提出不能将测试时适应局限在孤立样本的局部微调上,而应将类级别的视觉原型缓存与可学习文本嵌入视作表征目标域分布的“连续演化状态”。核心 idea:构建“探测-锚定-修正”(PAA)三步自适应循环,以类别原型引导中心与边界样本的主动查询,利用轻量二值验证施加三力协同的原型正则化,并借助历史错误记忆的时序置信度翻转进行延迟自修正,将极低成本的人工反馈转化为跨模态决策空间的结构化稳定演化。

方法详解

整体框架

PAA 的核心设计思想是把类别的视觉与文本原型作为目标域表征的动态锚点。测试数据以小批量(mini-batch)形式持续流入。对于每个批次,系统首先利用当前的原型状态进行单次前向推理得到初始预测与预测熵。随后,系统进入 PAA 三步自适应循环: 1. 主动探测(Probe):结合全局历史累积类别统计与局部当前批次分布自适应分配标注预算,基于视觉原型余弦距离分别挑选代表核心语义的中心样本与代表决策边界模糊区域的边界样本,向预言机(Oracle)请求轻量级的二值验证反馈(即当前预测是否正确)。 2. 原型正则化锚定(Anchor):针对二值标注样本计算二值交叉熵损失,并施加三力协同正则化——包含强化图文一致性的跨模态原型对齐、拉近真阳性样本与类原型的类内紧致损失,以及约束文本残差漂移方向的类间分离损失,联合更新视觉 LayerNorm 参数与文本残差向量。 3. 记忆驱动修正(Amend):将二值验证判定为错误的样本存入带生命周期的历史错题记忆库。在后续循环中持续重温这些难例,一旦发现其预测类别发生转变且预测熵显著下降,便将其作为可信的时序反转信号进行自监督蒸馏,修正累积偏差。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["流式测试输入与初次预测<br/>视觉LayerNorm与文本残差原型推理"] --> B["原型引导的主动探测<br/>全局-局部预算分配,采样中心与边界样本"]
    B --> C["三力协同的原型正则化<br/>二值验证引导跨模态对齐、类内紧致与类间分离"]
    C --> D["跨周期记忆自校准<br/>重温历史错误难例,置信反转蒸馏自修正"]
    D --> E["演化原型状态与轻量更新<br/>更新视觉LayerNorm与类别文本残差"]

关键设计

1. 原型引导的主动探测:平衡核心语义强化与决策边界探索

在主动学习与测试时适应结合的过程中,若仅依据预测不确定度或纯随机策略选择样本,极易出现对高频类别的过度采样,或被突发的瞬时噪声样本误导,导致适应过程失衡。为解决这一痛点,PAA 引入了结合长短期分布统计的自适应预算分配机制与双重原型引导采样策略。首先,系统在线统计流式处理至今的全局类别经验分布 \(\mathbf{G} = [g_1, \dots, g_C]\) 与当前批次的局部经验分布 \(\mathbf{L} = [l_1, \dots, l_C]\)。维持周期累计标注预算 \(K\) 与历史已选计数 \(\mathbf{S} = [s_1, \dots, s_C]\),类别 \(c\) 在当前批次的分配预算计算为: $\(k_c = \left\lfloor \max(K \cdot g_c - s_c, \, \kappa \cdot l_c) \right\rfloor\)$ 该公式中的第一项通过全局统计保障长期的类别均衡,抑制类别饥饿现象;第二项则对当前批次的局部突发分布保持灵敏响应。在获得类别预算 \(k_c\) 后,探测机制利用各类别缓存特征均值构成的视觉原型 \(\mathbf{p}_c^v\) 从当前批次中提取两组互补子集:一方面选取与原型余弦相似度最高的前 \(k_c\) 个中心样本 \(\mathcal{S}_c^{\mathrm{center}}\),用于加固已知类的核心分布、防止灾难性遗忘;另一方面计算样本到所有类原型的最近距离 \(d(\mathbf{x}) = \min_{c'} (1 - \cos(\mathcal{E}_v(\mathbf{x}), \mathbf{p}_{c'}^v))\),选取距离最大的前 \(k_c\) 个边界样本 \(\mathcal{S}_c^{\mathrm{boundary}}\),用以捕获漂移严重的歧义分布并指明决策边界的迁移方向。最后,将两部分合并构成主动查询集 \(\mathcal{S}\)。

2. 三力协同的原型正则化:兼顾跨模态对齐、类内紧致与类间分离

获取主动查询样本后,传统的全量多分类标签交互成本高昂且可能在流式交互中形成瓶颈。PAA 仅要求预言机提供“是对还是错”的二值判断 \(v_{\mathbf{x}} \in \{0, 1\}\),并通过二值交叉熵损失校准预测概率 \(p_{\hat{y}}\)。然而,仅靠二值标量梯度很容易导致参数更新过拟合于少量探测样本,破坏跨模态流形。为此,Anchor 阶段设计了由三种几何约束协同组成的原型正则化机制,约束视觉 LayerNorm 参数 \(\theta^v_{\mathrm{LN}}\) 与文本残差向量 \(\mathbf{r}_c^t\) 的更新。其一为跨模态对齐约束,采用对称的 Info-NCE 对比损失,强制同类视觉原型 \(\mathbf{p}_c^v\) 与文本原型 \(\mathbf{p}_c^t = \mathrm{norm}(\mathbf{z}_c^t + \mathbf{r}_c^t)\) 保持最大互信息对齐,同时推开非对应类别原型: $\(\mathcal{L}_{\mathrm{align}} = -\frac{1}{C} \sum_{c=1}^C \left( \log \frac{\exp(\mathbf{p}_c^{t\top} \mathbf{p}_c^v / \tau)}{\sum_{c'} \exp(\mathbf{p}_c^{t\top} \mathbf{p}_{c'}^v / \tau)} + \log \frac{\exp(\mathbf{p}_c^{t\top} \mathbf{p}_c^v / \tau)}{\sum_{c'} \exp(\mathbf{p}_{c'}^{t\top} \mathbf{p}_c^v / \tau)} \right)\)$ 其二为类内紧致约束 \(\mathcal{L}_{\mathrm{intra}}\),对预言机确认为真阳性(\(v_{\mathbf{x}}=1\))的样本,显式拉近其视觉特征与对应视觉原型 \(\mathbf{p}_{\hat{y}}^v\) 的余弦距离;其三为类间分离约束 \(\mathcal{L}_{\mathrm{inter}}\),注意到文本残差 \(\mathbf{r}_c^t\) 本意是捕捉目标域的特有语义偏移,若残差方向与源域中其他类别间的语义差异向量 \((\mathbf{z}_{c'}^t - \mathbf{z}_c^t)\) 产生投影共线,将导致类别辨识度塌陷。因此,该项惩罚残差向量与源域类间差分向量的余弦重合: $\(\mathcal{L}_{\mathrm{inter}} = \frac{1}{C(C-1)} \sum_{c=1}^C \sum_{c' \neq c} \cos(\mathbf{r}_c^t, \, \mathbf{z}_{c'}^t - \mathbf{z}_c^t)\)$ 三者与二值校准损失加权组合构成 \(\mathcal{L}_{\mathrm{anchor}} = \mathcal{L}_{\mathrm{BCE}} + \lambda_{\mathrm{anchor}}(\mathcal{L}_{\mathrm{align}} + \mathcal{L}_{\mathrm{intra}} + \mathcal{L}_{\mathrm{inter}})\),在极弱二值监督下保持了跨模态决策空间“稳定且具高塑性”的优良几何性质。

3. 跨周期记忆自校准:利用时序置信度差异实现延迟纠错

测试时自适应面临的一大隐蔽威胁是难例与伪错误分类的持续毒化。在某一步骤被判定为错误分类的样本,通常处于当前模态流形的严重偏差点或低置信盲区。直接丢弃这些被否定的负样本会造成昂贵主动标注信息的巨大浪费,而盲目利用其负标签进行无方向的排他微调又容易破坏已有分类面。Amend 步骤将其作为“慢控制器”,建立历史难例记忆库 \(\mathcal{M}\)。每个被判定为错误(\(v_{\mathbf{x}}=0\))的样本被封装为四元组 \((\mathbf{x}_i, \hat{y}_i, \mathcal{H}_i, \ell_i)\),其中记录了其初始错误伪标签 \(\hat{y}_i\)、当时的预测熵 \(\mathcal{H}_i\) 以及生命周期初始值 \(\ell_0=3\)。在后续循环中,随着模型在其他样本和批次上的持续演化,系统重新前向推理记忆库内的存留样本。如果某难例当前产生的新预测满足类别翻转(\(\hat{y}' \neq \hat{y}\))且预测熵明显降低(\(\mathcal{H}' < \mathcal{H}\)),即表明演化后的模型已经在没有直接显式强监督的情况下自主“领悟”了正确的潜在类别。此时该样本被收录至纠错集合 \(\Delta\),并计算自修正蒸馏损失: $\(\mathcal{L}_{\mathrm{amend}} = -\frac{1}{|\Delta|} \sum_{(\mathbf{x}, \hat{y}') \in \Delta} \log p'_{\hat{y}'}\)$ 通过将这一滞后但高度可靠的自修正信号回灌给原型,未发生翻转且未超期的样本生命周期递减(\(\ell \leftarrow \ell - 1\)),直至移除。这形成了一个跨周期的负反馈滤波机制,在零人工复查成本下大幅提高了自适应的长期稳健性。

损失函数 / 训练策略

PAA 每个循环批次的总优化目标整合了即时锚定损失与延迟修正损失: $\(\mathcal{L} = \mathcal{L}_{\mathrm{anchor}} + \lambda_{\mathrm{amend}} \mathcal{L}_{\mathrm{amend}}\)$ 其中默认设置平衡超参数 \(\lambda_{\mathrm{anchor}} = 0.1\),\(\lambda_{\mathrm{amend}} = 0.1\)。模型优化过程中仅更新视觉编码器的全部 LayerNorm 层参数 \(\theta^v_{\mathrm{LN}}\) 以及针对每个类别的轻量文本残差向量 \(\{\mathbf{r}_c^t\}_{c=1}^C\),视觉与文本主干网络的密集自注意力权重全程保持冻结。在数据增强层面遵循 TPT 协议,推理时对每个测试样本生成 63 个增强视图并进行置信加权聚合。批次大小固定为 128,中心与边界的主动标注预算均为 \(\kappa = 16\)(即每批次共计 32 个二值验证),视觉原型缓存大小 \(H=3\)。整个流程在单个消费级 RTX 3090 GPU 上即可高效在线运行。

实验关键数据

主实验

论文在自然分布偏移基准(Natural Distribution Shifts)以及跨领域基准(Cross-Domain)两大标准协议上进行了详尽评测。自然分布偏移评测基于 ImageNet 及其四个衍生鲁棒性测试集(ImageNet-A、ImageNet-V2、ImageNet-R、ImageNet-Sketch);跨领域评测涵盖 10 个细粒度数据集。

方法 类型 视觉骨干 ImageNet ImageNet-A ImageNet-V2 ImageNet-R ImageNet-S 平均 OOD 总体平均
CLIP (Zero-shot) 无微调 ResNet-50 58.16 21.83 51.41 56.15 33.37 44.18 40.69
TPT (NeurIPS'22) 非主动 TTA ResNet-50 60.74 26.67 54.70 59.11 35.09 47.26 43.89
TDA (CVPR'24) 非主动 TTA ResNet-50 61.35 30.29 55.54 62.58 38.12 49.58 46.63
DPE (NeurIPS'24) 非主动 TTA ResNet-50 63.41 30.15 56.72 63.72 40.03 50.81 47.66
BoostAdapter (NeurIPS'24) 非主动 TTA ResNet-50 62.14 35.47 56.31 62.61 38.80 51.07 48.30
SimATTA (ICLR'24) 主动 TTA ResNet-50 60.31 35.15 56.34 62.63 39.47 50.78 48.40
EATTA (CVPR'25) 主动 TTA ResNet-50 60.99 35.68 56.29 62.71 39.02 50.94 48.43
PAA (本文) 主动 TTA ResNet-50 63.42 37.27 56.77 67.37 41.03 53.15 50.61
CLIP (Zero-shot) 无微调 ViT-B/16 66.73 47.87 60.86 73.98 46.09 59.11 57.20
TPT (NeurIPS'22) 非主动 TTA ViT-B/16 68.98 54.77 63.45 77.06 47.94 62.44 60.81
TDA (CVPR'24) 非主动 TTA ViT-B/16 69.51 60.11 64.67 80.24 50.54 65.01 63.89
ZERO (NeurIPS'24) 非主动 TTA ViT-B/16 71.17 62.75 65.23 80.75 50.59 66.10 64.83
BoostAdapter (NeurIPS'24) 非主动 TTA ViT-B/16 69.37 64.53 65.51 80.95 51.28 66.33 65.57
BATCLIP (ICCV'25) 非主动 TTA ViT-B/16 70.60 62.03 65.18 80.66 51.49 65.99 64.84
SimATTA (ICLR'24) 主动 TTA ViT-B/16 67.07 63.63 64.42 79.30 50.12 64.91 64.37
EATTA (CVPR'25) 主动 TTA ViT-B/16 67.10 64.85 64.52 79.59 49.79 65.17 64.69
PAA (本文) 主动 TTA ViT-B/16 72.03 66.59 65.51 82.93 53.89 68.19 67.23

在跨领域迁移基准(10 个数据集,ViT-B/16)上,PAA 同样取得了 73.60% 的全场最高平均准确率,显著超越零样本 CLIP(63.58%)、强 TTA 基准 TDA(67.53%)、DPE(69.40%)以及 ATTA 方案 SimATTA(71.34%)与 EATTA(71.49%)。特别是在分布跨度巨大的 EuroSAT(卫星遥感)上,PAA 达到 90.93%(较零样本的 42.01% 暴涨 48.92%)。

消融实验

论文针对目标函数各损失项以及可学习模块的选择在自然分布偏移基准(ViT-B/16)上进行了系统的剥离分析。

变体配置 ImageNet ImageNet-A ImageNet-V2 ImageNet-R ImageNet-S 平均准确率 (%) 相比完整模型下降
完整模型 (Full Model) 72.03 66.59 65.51 82.93 53.89 68.19 -
去掉对齐损失 w/o \(\mathcal{L}_{\mathrm{align}}\) 71.61 66.11 65.08 82.65 53.53 67.80 -0.39%
去掉类内紧致 w/o \(\mathcal{L}_{\mathrm{intra}}\) 71.82 66.16 65.31 82.63 53.69 67.92 -0.27%
去掉类间分离 w/o \(\mathcal{L}_{\mathrm{inter}}\) 71.75 66.48 65.37 82.84 53.70 68.03 -0.16%
去掉记忆修正 w/o \(\mathcal{L}_{\mathrm{amend}}\) 71.79 66.27 65.50 82.68 53.67 67.98 -0.21%
冻结视觉 LayerNorm (Freeze \(\theta^v_{\mathrm{LN}}\)) 71.55 65.24 65.14 81.85 52.61 67.28 -0.91%
冻结文本残差 (Freeze \(\{\mathbf{r}_c^t\}\)) 71.27 65.08 65.12 82.18 53.26 67.38 -0.81%
替换为文本 LayerNorm (\(\{\mathbf{r}_c^t\} \to \theta^t_{\mathrm{LN}}\)) 71.76 65.33 65.22 82.47 53.28 67.61 -0.58%

关键发现

  • 跨模态原型对齐是性能最核心的正则屏障:在所有损失项消融中,去除 \(\mathcal{L}_{\mathrm{align}}\) 导致的跌幅最大(平均准确率下降 0.39%)。这印证了在仅有单侧二值验证信号时,维系视觉与文本原型之间的互信息对齐是防止特征空间坍塌的首要基石。
  • 参数解耦微调不可或缺:若完全冻结视觉 LayerNorm 或文本残差,平均准确率分别大幅下挫 0.91% 与 0.81%。实验证明直接使用文本 LayerNorm 进行调优的效果(67.61%)显著劣于独立类别的文本残差向量(68.19%),表明显式的语义漂移向量在保留通用先验的同时为每个类别提供了更精细的位移自由度。
  • 二值反馈逼近全量多分类监督上限:在监督级别对比实验中,仅依靠二值验证(Yes/No)的 PAA 取得了 68.19% 的平均准确率,与直接获得 1000 类真实多分类标签的强基线(68.84%)差距仅为 0.65%,证明了三力协同正则化对弱二值信号的高效信息放大能力。
  • 推理效率与精度的优越权衡:在 ImageNet-A 上,TPT 耗时超过 2 小时,DiffTPT 超过 4 小时;而 PAA 凭借针对极少量参数的单步快速解析更新,总推理时间仅需 17 分钟,在与前代高效方案(BoostAdapter 17 分钟、SimATTA 18 分钟)耗时持平的前提下,分类准确率从 63.63%~64.53% 显著提升至 66.59%。

亮点与洞察

  • 将离散测试标注升维为连续原型状态的受控演化:改变了以往 ATTA 仅将标注样本视作瞬时局部损失项的狭隘做法,首次在 VLM 领域建立以视觉缓存均值和文本残差为载体的演化几何空间,实现了稀疏微调信号对全局判别界面的有效牵引。
  • 中心与边界双驱的探索-利用权衡:探测策略打破了盲目依赖高熵/低置信度的单一抽样惯性,中心样本保证了已有特征簇的防遗忘稳态,边界样本指明了域偏移前沿,配合全局-局部动态预算分配彻底解决了长尾类别饥饿问题。
  • 基于时序置信度翻转的错题自愈机制:Amend 模块将历史负例变废为宝,不盲目惩罚负样本,而是静待模型演化后产生低熵翻转,将时序上自发涌现的认知纠偏转化为高信噪比的自蒸馏信号,构思极为巧妙。

局限与展望

  • 计算延迟依然高于免训练方法:尽管 PAA 比传统 TPT 等前向反向迭代多次的方法快一个数量级,但相较于纯缓存推理方法(如 ZERO 与 TDA),更新 LayerNorm 与残差仍需反向传播计算图,在线部署存在约十几毫秒的微延迟。
  • 预言机理想化假设:实验中假定人工验证预言机给出 100% 准确的二值判断。但在真实开放环境中,标注员自身也存在认知噪声与疲劳错误,未来需引入抗标注噪声的鲁棒验证损失机制。
  • 更轻量自适应模块的探索:未来可探索免反向传播的超网络(hypernetworks)或轻量参数预测器,使 PAA 的三步闭环能够在更低能耗的边缘设备上实时运行。

相关工作与启发

  • vs TDA / ZERO: TDA 与 ZERO 等纯缓存或零温前向方法速度极快,但在 ImageNet-A 等极端对抗性自然漂移下由于完全缺失真实监督信号,特征库极易被高置信错误伪标签持续污染(TDA 在 ImageNet-A 上为 60.11%);PAA 通过每批次引入少量二值验证和记忆翻转,将准确率推高到 66.59%。
  • vs SimATTA / EATTA: 传统纯视觉 ATTA 方法主要针对闭集 ResNet/ViT,将主动标注直接用于常规交叉熵损失,容易破坏预训练模型的泛化表征;PAA 则针对图文双模态特性,提出文本残差加成与跨模态原型三力正则,解决了多模态测试时自适应中的语义退化问题。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 巧妙提出 Probe-Anchor-Amend 闭环演化机制,将 ATTA 升维至原型连续状态空间。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 个自然分布偏移测试集、10 个细粒度跨域数据集,包含详尽的模块消融、标注成本分析与效率对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 概念清晰,公式推导严谨,三步循环逻辑层层递进。
  • 价值: ⭐⭐⭐⭐⭐ 为大模型在真实动态环境中的弱监督在线可靠部署提供了坚实的理论支撑与实用范式。