Debiased Textual Prompt Tuning for Enhancing Unknown Class Discovery¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态 VLM
关键词: 开放世界学习, 未知类别发现, 提示微调, 最优传输, 标签传播
一句话总结¶
针对开放世界半监督学习中文本引导微调偏向已知类和图拓扑稀疏的两大痛点,提出基于最优传输解偏的文本提示微调与双模态图增强标签传播框架,在千类规模未知类识别准确率上取得 20.7% 的相对提升。
研究背景与动机¶
开放世界半监督学习(Open-World Semi-Supervised Learning, OWSSL / GCD)旨在从未标记样本中同时识别已知类别与未知的全新类别,其中已标记数据仅覆盖已知类别。传统半监督学习受限于闭环世界假设,缺乏发现新类的内生机制。近期研究引入基于 CLIP 的视觉-语言预训练框架,利用类别特定的文本描述作为语义先验,并通过可学习文本提示(learnable textual prompts)来对齐视觉特征与文本描述,显著改善了仅依赖独热符号标签带来的语义缺失与表征退化问题。
然而,现存文本引导 OWSSL 方法在面对大规模类别发现时存在两大严重瓶颈。一方面,提示微调阶段由于未知类别缺乏显式标签监督,模型极易产生向已知类倾斜的严重先验偏差,倾向于将未标记样本错误归类为已知类,从而严重抑制了未知类提示向量的判别性表征学习。另一方面,现有方法仅建立极其有限的跨模态连接,在图机器学习视角下,样本视觉特征与类别文本描述构成的二部图存在严重的模态内与模态间连接稀疏性,阻碍了视觉与语义信息在全局样本流形上的有效传播。
为了打破这一困局,本文提出解偏文本提示微调与双模态图增强框架(TPOBGE)。本文的核心 idea 是:通过引入边缘约束熵正则化最优传输对文本提示微调施加均匀类别先验以强制消除已知类模型偏差,同时构建融合图像近邻与图像-提示双模态拓扑图并实施单向投影标签传播,实现大规模开放世界下未知类语义表征与拓扑流形传播的双重强化。
方法详解¶
整体框架¶
TPOBGE 的整体流程分为两阶段流水线:特征提取与文本提示解偏微调,以及双模态图增强与标签传播推断。在输入已标记集 \(D_l\) 与未标记集 \(D_u\) 后,首先冻结 CLIP 视觉与文本编码器提取图像特征与类别候选描述嵌入;随后在第一阶段中,通过引入全局类别分布平衡约束的最优传输算法消除对已知类的预测偏差,生成高质量硬化伪标签并指导可学习文本提示向量的优化;在第二阶段中,提取优化后的文本提示与样本图像特征构建跨模态近邻图,通过屏蔽易受模态鸿沟干扰的文本-文本边、仅保留图像-图像及图像-提示拓扑,运行对称归一化标签传播以推断未标记样本的最终类别归属。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入数据与冻结CLIP特征提取<br/>已标记集Dl + 未标记集Du"] --> B["最优传输解偏提示优化"]
B --> C["高置信度硬化伪标签筛选"]
C --> D["双模态近邻拓扑图构建"]
D --> E["双模态流形标签传播推断"]
E --> F["输出未标记样本类别预测"]
关键设计¶
1. 最优传输解偏提示优化:利用边缘分布约束消除已知类先验倾斜
在无监督探索未知类别时,模型往往倾向于将特征投影到已有充分监督的已知类别描述中。为此,方法将未标记样本与类别文本描述之间的关联建模为最优传输(Optimal Transport, OT)问题。给定样本特征与文本描述的余弦相似度矩阵 \(S\),通过最大化匹配收益并施加香农熵正则化 \(H(Q)\) 求解传输分配矩阵 \(\tilde{Q}\):
其中约束空间 \(\mathcal{U}\) 对传输矩阵的行和列施加双重约束:样本维度的边缘分布约束保证每个样本分配的概率质量和恒定,而类别维度的边缘分布约束强制要求所有类别(包括已知类与未知类)在全局样本上分配的概率总和严格相等为 \(\frac{1}{|C_u|}\)。这一机械式的均匀先验硬约束直接切断了已知类凭借先验优势争夺概率质量的通道,使得未知类获得公平的梯度更新与语义表达空间。优化过程借助高效的 Sinkhorn 算法在 20 次迭代内快速收敛。
2. 高置信度硬化伪标签筛选:抑制模糊语义噪声并指导提示向量微调
连续的软概率分布容易引入低置信度背景噪声与不确定语义漂移。为此,将最优传输求得的分配矩阵按样本总数缩放为 \(\tilde{Q}^{norm} = (|D_u| + |D_l|) \cdot \tilde{Q}\),并设置固定置信度阈值 \(\alpha = 0.5\)。当样本针对某一类别的归一化得分超过 \(\alpha\) 时,将其强制硬化为对应类别的独热伪标签向量;未超过阈值者则维持原始连续分布。最终,利用硬化后的目标分布 \(\hat{Q}\),通过交叉熵损失指导可学习文本提示向量 \(Prompt = \{u_j\}_{j=1}^{|C_u|}\) 的参数更新,使提示向量聚焦于纯净的视觉判别性线索,而不受离群噪声干扰。
3. 双模态近邻拓扑图构建:消除跨模态二部图的模态内与模态间稀疏性
现存文本引导方法仅评估单个图像与自身对应文本的相似度,缺乏图像样本之间以及图像与不同提示之间的拓扑交互。方法将未标记视觉特征节点集 \(Vision = \{v_i\}_{i=1}^{|D_u|}\) 与可学习提示节点集 \(Prompt = \{u_j\}_{j=1}^{|C_u|}\) 共同接入图结构。对于每个图像节点 \(v_i\),分别检索其余图像中相似度最高的 top-\(k\) 个视觉邻居,以及提示节点中相似度最高的 top-\(k\) 个语义邻居(默认 \(k=5\)),将两者拼接形成混合邻接向量。尤为关键的是,考虑到多模态表征中固有的模态鸿沟(Modality Gap)会导致文本之间的几何距离失真,方法显式将提示节点间的互连子矩阵置零,避免了不可靠的文本内部相似度对全局拓扑结构的污染。
4. 双模态流形标签传播推断:沿对称归一化混合图扩散高阶类别置信度
构建完成的双模态近邻图通过转置对称化与度矩阵归一化得到拉普拉斯传播算子 \(\hat{P} = D^{-1/2}(\tilde{P} + \tilde{P}^T)D^{-1/2}\)。初始化伪标签矩阵 \(Y \in \mathbb{R}^{(|D_u| + |C_u|) \times |C_u|}\),其中前 \(|D_u|\) 行未标记图像置零,后 \(|C_u|\) 行文本提示节点设置精确的独热对角单位阵。随后执行带重启动的图扩散更新:
超参数 \(\beta = 0.5\) 平衡了流形拓扑扩散与原始锚点先验的相对强度。这一机制使得提示节点作为具备强语义的标签锚点,沿着密集相连的视觉流形路径将类别置信度平滑扩散至全体未标记样本,从而在测试期直接由最大后验概率 \(\hat{y}_i = \arg\max_c \hat{Y}(i, c)\) 输出高精度的已知与未知类别预测。
实验关键数据¶
主实验¶
在 Hybrid(498类)、ImageNet-500(500类)、ImageNet-1K(1000类)和 Webvision(1000类)四个超大规模类别基准上,与主流无文本 GCD 基线及先进文本引导 OWSSL 方法全面对比(均采用 ViT-B/16 主干),评估全部类别(All, A)、已知类别(Known, K)和未知类别(Unknown, U)的聚类准确率(%)。
| 方法 | 预训练模型 | Hybrid (A/K/U) | ImageNet-500 (A/K/U) | ImageNet-1K (A/K/U) | Webvision (A/K/U) | 平均 (A/K/U) |
|---|---|---|---|---|---|---|
| GCD | DINO | 39.45 / 48.28 / 30.37 | 58.89 / 65.71 / 55.47 | 51.25 / 56.06 / 48.84 | 45.10 / 50.59 / 42.35 | 48.67 / 55.16 / 44.26 |
| SimGCD | DINO | 49.35 / 55.73 / 42.78 | 45.60 / 66.56 / 35.12 | 34.34 / 60.84 / 21.09 | 31.80 / 56.67 / 19.36 | 40.27 / 59.95 / 29.59 |
| LegoGCD | DINO | 48.30 / 52.64 / 43.85 | 46.49 / 69.81 / 34.82 | 34.20 / 61.13 / 20.74 | 31.60 / 56.85 / 18.97 | 40.15 / 60.11 / 29.60 |
| ProtoGCD | DINO | 39.68 / 46.84 / 32.27 | 33.59 / 63.23 / 18.77 | 31.28 / 63.05 / 15.40 | 31.57 / 56.80 / 18.96 | 34.03 / 57.48 / 21.35 |
| GCD | CLIP | 52.95 / 54.30 / 51.56 | 51.26 / 64.22 / 44.78 | 43.82 / 53.55 / 38.95 | 41.41 / 50.13 / 37.05 | 47.36 / 55.55 / 43.08 |
| SimGCD | CLIP | 64.62 / 64.14 / 65.11 | 54.73 / 76.56 / 43.82 | 36.54 / 61.73 / 23.94 | 34.93 / 58.59 / 23.11 | 47.70 / 65.25 / 38.99 |
| LegoGCD | CLIP | 63.45 / 64.40 / 62.46 | 54.82 / 72.75 / 45.85 | 38.00 / 63.17 / 25.41 | 36.00 / 58.50 / 24.75 | 48.06 / 64.70 / 39.61 |
| ProtoGCD | CLIP | 48.19 / 50.39 / 45.93 | 34.58 / 65.15 / 19.30 | 32.22 / 62.53 / 17.07 | 30.15 / 57.29 / 16.58 | 36.28 / 58.84 / 24.72 |
| TP-OWSSL | CLIP | 44.81 / 42.78 / 45.15 | 68.98 / 71.71 / 67.69 | — / — / — | — / — / — | — / — / — |
| CSC-OWSSL | CLIP | 62.91 / 68.35 / 60.19 | 56.74 / 72.13 / 49.04 | 39.03 / 63.05 / 27.02 | 34.94 / 58.22 / 23.29 | 48.41 / 65.44 / 39.89 |
| SSR2-GCD | CLIP | 55.70 / 58.71 / 52.60 | 65.41 / 70.54 / 62.84 | 58.73 / 60.02 / 58.08 | 55.42 / 58.43 / 53.92 | 58.81 / 61.92 / 56.86 |
| SpectralGCD | CLIP | 63.79 / 63.47 / 64.15 | 56.49 / 71.96 / 48.75 | 64.01 / 78.53 / 56.74 | 53.92 / 68.74 / 46.50 | 59.55 / 70.67 / 54.03 |
| TPOBGE (本文) | CLIP | 63.81 / 62.40 / 65.27 | 73.41 / 73.47 / 73.40 | 69.70 / 71.39 / 68.98 | 66.73 / 66.63 / 66.96 | 68.41 / 68.47 / 68.65 |
消融实验¶
为定量拆解解偏提示优化与双模态图拓扑增强的独立作用,下表呈现了未知类错误分类统计、拓扑边连接数以及训练效率开销对比。
| 数据集 | 评估维度 | CSC-OWSSL (前SOTA) | TPOBGE (本文完整方案) | 改善幅度与说明 |
|---|---|---|---|---|
| Hybrid | 未知类误判为已知类样本数 | 2.9k | 1.5k | 误判样本减少 48.3%,有效缓解已知类偏置 |
| ImageNet-1K | 未知类误判为已知类样本数 | 15k | 1.6k | 误判样本骤降 89.3%,根除千类规模下的已知类塌缩 |
| Hybrid | 图拓扑边连接总数 (Edge Count) | 15.1k | 114k | 拓扑连接增加 7.5 倍,打破跨模态稀疏孤岛 |
| ImageNet-1K | 图拓扑边连接总数 (Edge Count) | 50k | 375k | 拓扑连接增加 7.5 倍,支撑高阶语义流形传播 |
| Hybrid | 训练用时 / 显存占用 | 543 分钟 / 18.97 GB | 3 分钟 / 0.95 GB | 速度提升 181 倍,显存降低 95.0% |
| ImageNet-1K | 训练用时 / 显存占用 | 7303 分钟 / 18.93 GB | 10 分钟 / 9.84 GB | 速度提升 730 倍,千类全量训练仅需 10 分钟 |
关键发现¶
- 根治千类极端偏置:在 ImageNet-1K 这一极端困难设定下,CSC-OWSSL 将多达 15,000 个未知类样本误判为已知类,导致未知类准确率仅 27.02%;TPOBGE 通过最优传输的列边缘均匀先验硬约束,将该误判数大幅压低至 1,600 个,未知类准确率直接跃升至 68.98%(绝对提升 +41.96%)。
- 图稠密化赋能流形一致性:引入 \(k\)-NN 视觉邻域与图像-提示双边构建后,ImageNet-1K 的图边数从 50k 猛增至 375k,同时主动切除易受模态鸿沟污染的提示-提示边,使标签传播能够在无噪声干扰的流形上稳健收敛。
- 计算效率实现数量级跃升:由于冻结了图像和文本主干网络、仅提取单次特征后优化轻量级提示向量和标签传播,TPOBGE 在单张 NVIDIA A6000 上将千类 ImageNet-1K 的训练耗时从 120 余小时骤降至 10 分钟,极大提升了 OWSSL 在大规模实际工业场景中的落地可行性。
亮点与洞察¶
- 最优传输均匀先验解偏:传统方法常盲目调整损失权重对抗偏差,本文直接将先验公平性形式化为最优传输的边际分布等式约束,用数学最优解天然防范了无监督新类向监督已知类的特征塌缩。
- 避开模态鸿沟的非对称双模态图设计:深刻洞察到 VLM 文本嵌入在无视觉依托时容易因模态鸿沟产生失真的几何相似度,主动将文本-文本近邻清零,以“视觉稠密近邻 + 跨模态提示锚点”构造拓扑,兼具优雅性与极佳实效。
- 免微调骨干的极致轻量流水线:仅需单次离线特征抽取,后续提示优化与图传播均为轻量矩阵级运算,彻底摆脱了端到端微调在大规模类别下显存爆炸和耗时漫长的枷锁。
局限与展望¶
- 强依赖高质量预训练基模的泛化先验:方法依赖 CLIP 视觉与文本空间中已蕴含的基础对齐能力,若转移至工业缺陷检测、遥感复杂雷达图或细粒度罕见医学影像等 CLIP 预训练分布未充分覆盖的垂直领域,先验语义质量或受局限。
- 预设类别总数已知或依赖估计算法:当前实验遵循标准 OWSSL 评测协议,预设未标记集类别数 \(|C_u|\) 已知;虽可结合无监督聚类轮廓系数估计类别数,但在真实完全开放且类别数高度不定的动态流数据中,动态增量式类别发现机制仍待突破。
- 真实长尾与开放分布探索:未来工作可进一步扩展至类别高度长尾(不平衡最优传输)以及包含域外异常噪声(OOD)的更复杂开集场景中。
相关工作与启发¶
- vs GCD / SimGCD / LegoGCD / ProtoGCD: 传统方法纯粹在视觉表征上施加无监督对比学习或原型聚类,缺乏自然语言语义信息的引导,在未知类上难以区分细粒度概念且极易过拟合已知类;TPOBGE 引入预训练多模态语义先验并消除提示偏差,未知类识别大幅领先。
- vs TP-OWSSL / CSC-OWSSL: 先进文本引导方法虽引入可学习提示或语义关联,但忽略了已知类偏置导致的未知类被动挤压,且其跨模态图结构极为稀疏、端到端训练开销巨大(需耗时数十至上百小时);TPOBGE 兼具最优传输均匀先验约束与稠密双模态标签传播,计算耗时缩短数百倍,准确率显著反超。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [将最优传输均匀边缘约束与非对称双模态图标签传播结合,思路精巧切中要害]
- 实验充分度: ⭐⭐⭐⭐⭐ [跨越 500 至 1000 类的四大规模化数据集,消融、误判样本数、边稀疏度分析与效率对比极其详实]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,数学建模清晰,从问题成因到解偏机制推导一气呵成]
- 价值: ⭐⭐⭐⭐⭐ [攻克大规模开放世界未知类发现的偏差瓶颈,训练耗时降至分钟级,工程落地价值极高]