跳转至

TecoPrompt: Temporal-Conservative Prompt Learning for Vision-Language Models

会议: ECCV 2026
论文: ECCV 官方主页
领域: 多模态 VLM
关键词: 提示学习, 最优传输, 噪声标签, 视觉语言模型, 时间一致性

一句话总结

针对少样本视觉语言提示学习在带噪标签下易受误导的问题,提出闭环鲁棒学习框架 TecoPrompt,通过全局最优传输生成伪标签候选,结合 K-epoch 时间稳定性窗口与 EMA 置信度门控进行保守的硬标签重写,并配合三元分组目标函数实现高效防过拟合优化。

研究背景与动机

视觉语言预训练模型(如 CLIP)通过提示学习(Prompt Learning,如 CoOp、CoCoOp 等方法)仅需调节少量的连续文本上下文向量,即可在冻结主干网络的前提下高效迁移至下游图像分类任务。然而,在少样本(Few-shot)设定下,每个类别的可用样本极少(如 16-shot),优化过程对监督信号的纯度极为敏感。一旦真实采集或标注流程中引入标签噪声,提示词参数就会迅速对错误标签产生过拟合,破坏预训练跨模态表征的原生对齐结构。

现存处理噪声标签的经典策略(如样本筛选、置信度加权截断或鲁棒损失函数)主要面向大规模监督微调,它们倾向于直接降低可疑样本的权重或将其完全剔除。这种做法在样本充裕时行之有效,但在少样本提示学习中却极度浪费宝贵的监督资源,严重损害类原型的判别边界学习。更积极的途径是标签纠正(Label Correction),然而传统的单步贪心重写极易在训练初期模型尚不稳定时产生误纠,不仅无法净化噪声,反而会篡改原本正确的干净样本,引发灾难性的确认偏差(Confirmation Bias)。

针对这一矛盾,作者从动力学视角重新审视了全局最优传输(Optimal Transport, OT)伪标签的时序演变特性。实证统计表明:在跨 epoch 动态重构全局特征匹配时,噪声样本往往呈现出较长且连续命中真实类别的时序平稳窗口,而干净样本却极少出现持续稳定的错误伪标签分配。核心 idea:将全局最优传输的全局匹配优势与时序动力学稳定性结合,唯有在连续 K 个 epoch 稳定预测且 EMA 置信度达标时才触发硬标签重写,并通过“干净/中间/带噪”三元分组损失实现兼顾判别力与容噪性的闭环提示学习。

方法详解

整体框架

TecoPrompt 构建了一套“全局伪标签生成 \(\to\) 动力学稳定性检验 \(\to\) 保守硬重写 \(\to\) 三元分组损失反向传播”的闭环鲁棒提示优化流程。对于冻结的 CLIP 双塔,视觉编码器抽取图像嵌入,文本编码器以可学习上下文向量拼接类别名称生成文本原型。模型首先在特征空间求解平衡熵正则化最优传输,获得全局对齐的软伪标签分布;随后结合 EMA 平滑置信度与 K-epoch 连续历史窗口,对高置信且时序一致的伪标签执行硬标签重写;最后将全部样本划分为干净集、中间集与带噪集,分别施加标准交叉熵、广义交叉熵与绝对平均误差损失,反向传播更新提示词。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["图像与文本输入<br/>冻结 CLIP 双编码器 + 可学习提示词"] --> B["最优传输全局伪标签生成<br/>类原型与图像特征间的熵正则 Sinkhorn 匹配"]
    B --> C["EMA 平滑与置信度滤波<br/>跨 epoch 滑动平均消除单轮预测抖动"]
    C --> D["时间一致性硬标签重写<br/>K-epoch 稳定性窗口与置信阈值联合门控"]
    D --> E["三元样本分组与分级损失优化<br/>干净集 CE / 中间集 GCE / 带噪集 MAE 组合监督"]
    E -->|梯度反向传播闭环更新提示参数| A

关键设计

1. 最优传输全局伪标签生成:打破单样本贪心匹配

点对点局部预测在早期极易受局部噪声样本误导,而最优传输从全局视角将全部未校正图像特征与文本原型进行双向容量约束匹配。作者在视觉特征矩阵与文本特征矩阵计算相似度矩阵 \(S = TI^{\top} \in \mathbb{R}^{C \times N}\) 后,取负对数作为传输代价矩阵 \(C\),求解带均等先验的熵正则化最优传输问题: $\(\min_{Q \ge 0} \langle C, Q \rangle - \epsilon H(Q) \quad \text{s.t.} \quad Q \mathbf{1}_N = \frac{1}{C}\mathbf{1}_C, \quad Q^{\top}\mathbf{1}_C = \frac{1}{N}\mathbf{1}_N\)$ 通过 Sinkhorn 算法快速迭代求解最优解 \(Q^{\star}\),每一列自然归一化为对应图像样本的全局软伪标签分布,其最大分量即为候选标签 \(\hat{y}_i^{(t)} = \arg\max_c Q^{\star}_{c,i}\),最大值作为瞬时置信度 \(c_i^{(t)}\)。这种等边际约束保证了各类别原型不会因部分类的噪声积聚而坍缩,为下游纠偏提供了全局平衡的候选基底。

2. EMA 平滑与 K-epoch 时间一致性门控:保守硬重写阻断确认偏差

单轮 OT 置信度容易受到个别 epoch 提示词波动的影响,为此设计双重稳定性门禁。首先维护样本级 EMA 平滑置信度 \(\bar{c}_i^{(t)} = \beta \bar{c}_i^{(t-1)} + (1-\beta) c_i^{(t)}\),消除高频噪声干扰;其次定义时间一致性事件 \(\mathcal{E}_K(i) = \{\hat{y}_i^{(t-K+1)} = \cdots = \hat{y}_i^{(t)} \neq \tilde{y}_i\}\) 与高置信事件 \(\mathcal{D}_K(i) = \{c_i^{(t-K+1)} \ge \theta, \dots, c_i^{(t)} \ge \theta\}\)。当且仅当二者交集成立(即候选事件 \(\mathcal{A}_K(i) = \mathcal{E}_K(i) \cap \mathcal{D}_K(i)\))时,才触发硬标签改写 \(\tilde{y}_i \leftarrow \hat{y}_i^{(t)}\)。前 \(K-1\) 个 epoch 设为 warmup 阶段,仅累积轨迹状态不执行重写,以数学严谨的充分条件将不稳定变动的“可遗忘样本”排除在重写之外,彻底避免干净标签被早期误改。

3. 三元样本分组与分级损失优化:按可靠性梯度分配监督强度

重写后的样本并非同等可信,简单施加统一损失必然导致模型在可靠样本上欠拟合或在潜在残余噪声上过拟合。TecoPrompt 依据当前伪标签与观测标签的匹配度及置信度将数据集严格三等分: - 干净子集 \(\mathcal{D}_{\text{cln}}\):伪标签与观测标签一致且 \(\bar{c}_i^{(t)} \ge \tau_{\text{clean}}\),具备极高可信度,采用标准交叉熵损失 \(\mathcal{L}_{\text{cln}} = \sum_{i \in \mathcal{D}_{\text{cln}}} -\log s_{i,\tilde{y}_i}\) 强化类间判别边界; - 中间子集 \(\mathcal{D}_{\text{mid}}\):满足中等置信度(\(\tau_{\text{mid}} \le \bar{c}_i^{(t)} < \tau_{\text{clean}}\) 且一致)或虽被重写纳入候选 \(\mathcal{A}_K(i)\) 但仍需缓冲观察,采用广义交叉熵损失 \(\mathcal{L}_{\text{mid}} = \sum_{i \in \mathcal{D}_{\text{mid}}} \frac{1 - s_{i,\tilde{y}_i}^q}{q}\)(默认 \(q=0.5\)),在保证梯度的同时自动下调低预测分样本的权值; - 带噪子集 \(\mathcal{D}_{\text{nos}}\):剩余的冲突或低置信不可靠样本,采用对称鲁棒的绝对平均误差(MAE)损失 \(\mathcal{L}_{\text{nos}} = \sum_{i \in \mathcal{D}_{\text{nos}}} (1 - s_{i,\tilde{y}_i})\),防止极端错误标签对提示词形成强梯度破坏。

损失函数 / 训练策略

总损失函数由三部分加权构成: $\(\mathcal{L} = \lambda_{\text{c}} \mathcal{L}_{\text{cln}} + \lambda_{\text{m}} \mathcal{L}_{\text{mid}} + \lambda_{\text{n}} \mathcal{L}_{\text{nos}}\)$ 在优化配置上,采用预训练 CLIP(ResNet-50 图像编码器 + 冻结的 Transformer 文本编码器),使用 SGD 优化器以初始学习率 0.002 和余弦退火策略训练 200 个 epoch。提示词设置 16 个可学习的连续上下文 token,类别 token 置于末尾。

实验关键数据

主实验

在 7 个标准基准上评估 16-shot 对称噪声(Sym)与非对称噪声(Asym)下的分类准确率(%)。表 1 汇总了部分典型高难度噪声设定下的性能对比:

数据集 噪声类型与比例 CoOp GCE JoAPR NLPrompt TecoPrompt (本文)
Flowers102 Sym 50.0% 70.1 84.1 70.2 89.9 90.5
Flowers102 Sym 75.0% 37.2 70.4 66.9 76.8 82.3
Flowers102 Asym 50.0% 42.6 69.9 73.8 81.1 89.4
Flowers102 Asym 75.0% 12.6 39.2 13.3 55.3 66.6
DTD Sym 50.0% 34.4 50.7 53.0 55.2 58.1
DTD Asym 75.0% 11.7 18.2 28.3 28.4 38.4
EuroSAT Sym 75.0% 26.7 31.4 27.3 43.8 52.1
OxfordPets Asym 50.0% 38.7 68.1 75.8 77.5 84.3
OxfordPets Asym 75.0% 14.9 32.0 43.6 48.6 75.3
StanfordCars Asym 75.0% 12.8 26.6 23.0 39.5 51.9
UCF101 Asym 75.0% 13.2 36.4 47.5 49.3 58.1
Caltech101 Asym 75.0% 20.3 62.1 81.9 81.1 85.7

在真实世界噪声数据集 Food101N 上,TecoPrompt 达到 78.67% 的测试准确率,显著超越 CoOp(69.50%)、GCE(71.32%)、JoAPR(72.57%)和 NLPrompt(76.46%)。

消融实验

在 OxfordPets 数据集上,针对不同噪声比例(10% 至 70%)对各组件及时间窗口超参数 \(K\) 进行详细消融分析:

配置说明 EMA 重写 窗口 K 分组损失组合 10% 噪声 30% 噪声 50% 噪声 70% 噪声 平均准确率 (%)
(a) 基础基线 (无 EMA/重写) – – – – 87.05 87.03 85.46 78.22 84.44
(b) 仅开启重写 – ✓ – – 87.21 86.77 86.02 85.03 86.26
(c) 仅开启 EMA ✓ – – – 86.05 85.98 85.34 81.30 84.67
(d) 调整带噪损失组合 ✓ ✓ – CE-0.3-0.5 87.58 86.91 85.98 85.36 86.46
(e) 不合理损失组合 (无 MAE) ✓ ✓ – 0.7-0.5-0.3 86.70 85.95 84.35 58.62 78.91
(f) 过小时间窗口 ✓ ✓ 1 默认三元损失 82.23 80.85 78.12 80.15 80.59
(g) 中偏小窗口 ✓ ✓ 4 默认三元损失 86.52 85.75 85.98 86.02 86.07
(h) 完整模型 (默认推荐) ✓ ✓ 8 默认三元损失 87.52 87.19 86.40 86.72 86.96
(i) 过大保守时间窗口 ✓ ✓ 16 默认三元损失 87.70 87.61 85.87 84.74 86.48

关键发现

  • 标签重写是提升高噪声鲁棒性的核心驱动力;但在缺乏 EMA 和适度时间窗口约束时,过早或激进重写(如 \(K=1\) 时均值仅 80.59%)会因频繁瞬态波动引入有害翻转。
  • 时间稳定性窗口 \(K\) 权衡了纠偏精度与覆盖度:\(K=8\) 实现了精度与召回的平衡。在 OxfordPets 50% 噪声实验中,系统触发 234 次重写,其中 222 次成功纠正为真实标签(正确纠偏率高达 94.87%),覆盖全部 296 个噪声样本中的 75.00%,而干净样本被误改率仅 2.56%。
  • 错误的硬重写绝大部分发生在细粒度高混淆类别之间(例如孟加拉猫与埃及猫、兰伯格犬与荷兰毛狮犬),源于强烈的视觉表观共性。

亮点与洞察

  • 将学习动力学引入提示词抗噪:首次系统揭示了最优传输伪标签在训练轨迹上的“稳定性不对称”现象(正确纠偏倾向长程稳定,错误伪标极少持续),将半监督时序一致性思想自然迁移至离散标签硬纠正。
  • 三元动态分组的阶梯式容错:不搞一刀切的纯硬化或纯丢弃,根据置信度与一致性状态将数据动态拆解为 CE、GCE 与 MAE 针对性处理,在充分压榨干净监督信息的同时筑牢抗过拟合底线。
  • 即插即用且开销极低:在 RTX 3080 Ti 单卡上,全套 OT 与时序缓存维护相比 NLPrompt 仅增加约 0.20 秒/epoch 的微弱计算负担,极其适合资源敏感型的下游快速微调。

局限与展望

  • 高频抖动样本的覆盖度有限:出于“宁缺毋滥”的保守原则,频繁在类别间振荡的难样本(OT-forgettable)无法满足 K-epoch 连续稳定准则,导致部分隐蔽噪声始终无法被纠正。
  • 超参数敏感度依然存在:时间窗口大小 \(K\) 与 EMA 动量 \(\beta\) 在极端类别不平衡或极端细粒度数据集上可能需要重新网格搜索。未来可探索基于样本曲率自适应动态调节的窗口机制。
  • 细粒度视觉混淆尚未彻底解决:极度相似物种间的错误重写暴露出单一冻结视觉特征的表征上限,未来可结合局部多尺度提示或交互式辅助提示进一步消除语义歧义。

相关工作与启发

  • vs CoOp / CoCoOp: 原生提示学习完全信任输入监督,面对噪声标签毫无抵抗力并迅速过拟合;TecoPrompt 引入闭环硬纠正机制,使经典文本上下文微调具备了极强的强噪声耐受能力。
  • vs JoAPR: JoAPR 依赖高斯混合模型(GMM)划分样本并重训,需要较为繁琐的多阶段流水线;TecoPrompt 依托端到端最优传输与在线时序一致性,单阶段闭环即可完成提示词更新。
  • vs NLPrompt: NLPrompt 使用基于 OT 的软分配与子集过滤,缺乏跨 epoch 时序稳定性验证机制;TecoPrompt 证明了“时间保守性”是抑制确认偏差的关键,通过 K-epoch 门禁显著优于单纯的软目标或标签平滑。

评分

  • 新颖性: ⭐⭐⭐⭐ [创新地将时序稳定性与全局最优传输相结合构建少样本提示学习的标签闭环纠偏]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 7 个合成噪声基准、1 个真实噪声基准,细致覆盖对称/非对称噪声及不同 shot 数]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑推导连贯严密,动机图、动力学轨迹直方图与定性分析极具说服力]
  • 价值: ⭐⭐⭐⭐⭐ [为多模态模型低成本抗噪自适应提供了兼具高精度与轻量化的新范式]