When Noise Meets Long-Tail: Feature-Threshold Dual Calibration for Robust Pseudo-Labeling¶
会议: NeurIPS2026
arXiv: 2609.33668
代码: https://github.com/pingggg516/FTC-Seg
领域: 语义分割
关键词: 半监督语义分割、长尾学习、伪标签、原型重建、自适应阈值
一句话总结¶
FTC-Seg 在教师—学生半监督分割中同时用原型残差重建改善噪声下的特征、用标注准确率和类别分布偏差调整伪标签阈值,在 2% 标注的四个基准上,DINOv2-S 配置相对 UniMatch V2 提升 2.09–8.54 个 mIoU 百分点,但并非所有配置都最优。
研究背景与动机¶
半监督语义分割通常让教师在未标注图像的弱增强视图上预测,再把高置信度像素标签交给学生的强增强视图学习。FixMatch、UniMatch 等方法依靠阈值挡住不可靠预测,但这一筛选也决定了哪些类别有机会获得额外监督。在声呐、水下光学和恶劣天气图像中,目标特征与背景更难分离,正确预测也可能缺乏足够置信度;因此,“没有通过阈值”不能直接等同于“预测错误”。
长尾分布让这一问题偏向少数类:标注像素少,特征学习不充分,噪声又进一步压低置信度。固定高阈值首先剔除这些类别,剔除后的无标签监督缺口再削弱其表示,形成反复自我强化的循环。只重采样或调整类别分布,无法恢复筛选前已经消失的监督;只做一致性训练,也无法训练那些从未通过阈值的像素。论文用原始/合成扰动与平衡/长尾构成的 \(2\times2\) 实验分析这种相互作用,不过平衡子集通过下采样改变了样本组成,声呐和水下的“原始”图像也不是无噪声图像。
核心 idea:在伪标签产生链条的两个位置同时干预——先用前景门控的原型残差重建改善可分性,再用学习难度与分布偏差共同决定每类的接纳阈值,避免低置信度少数类被永久排除。
方法详解¶
整体框架¶
输入包括带像素标注的图像,以及同一未标注图像的弱增强和强增强视图。学生处理标注图像与强增强视图,教师处理弱增强视图;两者采用相同的编码器—解码器结构,但教师参数通过学生参数的指数移动平均(EMA)更新,而不是独立反向传播。
正交原型重建(Orthogonal Prototype Reconstruction,OPR)插在编码器与解码器之间,教师和学生分支都使用这一特征处理结构。默认放在最深的两个编码阶段:用跨样本共享的可学习原型对局部特征作残差修正,而不是输出一张去噪图像。解码之后,自适应阈值校准(Adaptive Threshold Calibration,ATC)根据标注集学习状态与未标注预测分布,为教师预测选择类别相关阈值。
通过筛选的教师标签监督学生强增强预测,标注图像提供真实标签监督;学生更新后再更新 EMA 教师。推理只需编码器、OPR 和解码器输出类别图,ATC 是训练时筛选监督的机制,不是测试时概率校准器。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
X["标注图像与<br/>未标注双视图"] --> E["学生编码器与<br/>弱视图 EMA 教师"]
E --> O["正交原型重建<br/>OPR"]
O --> D["学生与教师解码<br/>像素类别预测"]
D --> A["自适应阈值校准<br/>ATC"]
G["标注准确率与<br/>标注/未标注分布"] -.-> A
A -->|筛选教师伪标签| L["训练监督<br/>强视图一致性与真实标签"]
L -.->|学生更新后参数 EMA| E
D -->|推理不经过 ATC| Y["输出分割图"]
关键设计¶
1. 正交原型重建:保留原始细节,只加入前景相关的全局特征修正
局部像素特征容易受成像噪声影响,OPR 用一组跨数据共享的可学习向量提供更稳定的参照。默认原型数 \(K=16\),每个原型与编码特征具有相同通道维度;每个像素先与所有原型计算余弦相似度,再用这些相似度决定修正方向。这里的“原型”不是“一类一个中心”:没有预先指定固定类别身份,训练中的主导类别可以变化。
并非所有全局模式都值得加回像素。OPR 把原型送入分割头对应的线性分类权重和偏置,观察其最大响应属于哪个类别;仅当该类别落在预定义前景集合 \(\mathcal C_{fg}\) 中时,门控 \(\gamma_k\) 才为 1,否则为 0。门控来自分割头的类别判别,不是按该原型的相似度大小筛选,也不是直接读取像素的真实前景掩码。若让背景原型一起参与,重建可能把刚要抑制的背景干扰重新注入。
保留像素特征 \(F_{(h,w)}\) 的核心变换是:
余弦相似度有正有负,原式直接作带符号的加权求和,没有 softmax,也不是归一化的凸组合。残差项可以加强或抵消某些方向;因此不能把 OPR 解释成从类别字典中选一个中心来替换像素。保留原始特征使全局修正不必承担全部空间细节,消融中去掉残差后,尾类伪标签准确率虽高,整体分割反而明显变差。
原型若收敛到相似方向,会重复响应而失去多样性。论文用原型两两归一化内积平方之和作为软正交正则,抑制方向坍缩。它鼓励接近正交,不是每一步精确施加正交约束;名称中的“正交”不能理解成严格正交基。教师用 EMA 平滑学生参数,OPR 则改善教师与学生共同依赖的表示,两者解决的不是同一个问题。
前景集合仍需要任务定义。附录中把背景加入门控集合或把 Diver 排除都会损害结果,说明它不是无条件适用于任意标签语义的去噪器。浅层特征也不一定适合这种门控:分割头的权重主要承载深层语义,浅层原型投影到这个头上可能被误判为前景,因此默认没有把 OPR 铺满全部阶段。
2. 自适应阈值校准:用真实标签学习状态与类别先验纠正接纳偏差
仅看未标注数据上的置信度,模型可能把“反复过预测某类”误认为“该类学得很好”。ATC 为每类维护三个 EMA 统计量:标注数据中的类别比例 \(P_c^l\)、标注数据上的分类准确率 \(A_c^l\),以及未标注数据预测中的类别比例 \(P_c^u\)。统计量 EMA 动量为 0.999,用于减轻小批次尤其是少数类计数的波动;这一统计量平滑与教师参数 EMA 是不同的状态更新。
难度信号以标注准确率的缺口衡量:学得越差,就越需要放宽监督入口。偏差信号则比较未标注预测比例与标注先验:相对先验过预测时收紧,欠预测时放宽。两个因素共同改变基本阈值,而不是按类别频率给所有少数类统一降低阈值:
默认 \(\lambda_D=0.1\)、\(\lambda_B=0.05\),\(\epsilon\) 是分母稳定项。对难学但严重过预测的类别,两个修正项可能互相抵消,最终阈值未必降低;对学习不错却欠预测的类别,偏差项仍可能放宽阈值。因此“救回尾类”是预期作用和观察到的结果,不是由 tail 身份触发的硬规则。
教师预测先取最大概率类别,再用该预测类别的阈值判断,只有最大概率严格大于阈值的像素才形成有效 one-hot 伪标签。ATC 不改变预测类别概率,也没有把概率做温度缩放;它改变的是参与一致性损失的像素集合。OPR 提高特征质量,ATC 改变监督入口,二者因而有互补空间。
先验参照也有代价:如果标注样本与未标注样本的真实分布不同,比例差异可能是合理的分布偏移,而不是模型错误。原文未明确给出阈值裁剪规则、\(\epsilon\) 数值以及缺类批次的完整处理细节,不能为公式自行补上 \([0,1]\) 截断或其他实现保护。主文也未明确基本阈值的统一默认值;附录特定 OPR 门控实验使用固定 0.95,不应自动推广到所有 ATC 主实验。
一个完整示例¶
考虑一张包含稀有 Diver 目标的声呐图像。局部像素特征与背景混杂,但与几个前景原型仍有一定相似度:OPR 先通过分割头确定哪些原型可参与,再把带符号的原型修正加回原始特征。解码器随后产生教师的弱视图类别预测;这里没有先生成一张干净声呐图再分割。
为说明 ATC,假设某轮统计中该类标注准确率为 0.60、标注比例为 0.01、未标注预测比例为 0.005,并仅在这个示例中令 \(\tau_0=0.95\)。使用默认两个系数、忽略极小 \(\epsilon\) 的影响,难度项约为 0.40,偏差项约为 −0.50,阈值约为 0.885。若教师对这个像素预测 Diver 的概率为 0.90,它会被固定 0.95 剔除,却可在示例阈值下监督学生强视图。
相反,某类标注准确率为 0.90、预测比例约为先验两倍时,在同一示例设置中阈值约为 0.99,0.97 的预测也会被拒绝。这说明 ATC 同时可救回低置信度预测与限制过预测,并非全面放宽。以上数字只是机制演示,不是论文样本或复现实验。
损失函数 / 训练策略¶
学生使用标注像素交叉熵和筛选后伪标签的无监督交叉熵,另以软正交损失约束可学习原型。无监督损失按整张图的 \(HW\) 归一化,被剔除像素的伪标签向量为零,因此不贡献损失;不能擅自改写成仅按接纳像素数归一化的实现。
软正交项使用归一化原型 \(\hat\mu_k\):
教师不接受反向传播。原文列出监督、无监督和原型正则,但没有提供足够信息确定所有总损失权重,笔记不自行拼接带有假定系数的完整目标函数。
实验训练 240 个 epoch,优化器 AdamW,学习率 \(5\times10^{-6}\)、权重衰减 0.01,采用 power 为 0.9 的多项式学习率衰减,训练硬件为单张 RTX 3090。标注比例为 2%、5%、10%,抽样确保每类至少有一个标注实例,剩余图像作为未标注数据。
实验关键数据¶
主实验¶
四个基准覆盖声呐散斑(FLSMD、FSSG)、水下光学散射(SUIM)与恶劣天气(ACDC)。主表报告三次随机种子的均值 ± 标准差,指标为 mIoU(%);下表差值均为百分点,相同骨干内比较,不把不同骨干混成统一 SOTA。
| 数据集 / 标注比例 | 骨干 | FTC-Seg | 对比方法 | 对比结果 | 差值 |
|---|---|---|---|---|---|
| FLSMD / 2% | DINOv2-S | 62.55 ± 1.22 | UniMatch V2 | 57.24 ± 0.49 | +5.31 |
| FSSG / 2% | DINOv2-S | 63.20 ± 0.98 | UniMatch V2 | 58.78 ± 1.32 | +4.42 |
| SUIM / 2% | DINOv2-S | 66.91 ± 1.35 | UniMatch V2 | 58.37 ± 0.92 | +8.54 |
| ACDC / 2% | DINOv2-S | 61.68 ± 1.42 | UniMatch V2 | 59.59 ± 2.48 | +2.09 |
| SUIM / 2% | RN-101 | 54.71 ± 0.53 | SemiVL | 55.99 ± 0.79 | −1.28 |
| FSSG / 10% | RN-101 | 70.13 ± 1.14 | SemiVL | 65.24 ± 0.97 | +4.89 |
| FSSG / 10% | DINOv2-S | 67.53 ± 0.68 | UniMatch V2 | 64.41 ± 0.75 | +3.12 |
SUIM 的 RN-101、2% 配置不如 SemiVL,FSSG 的 10% 配置中本文 RN-101 结果也高于本文 DINOv2-S。论文结论中的普遍领先措辞比主表实际支持的范围更强,应理解为大多数配置具有竞争力,尤其低标注 DINOv2-S 设置有明显收益。
消融实验¶
下表取自主文表 5(b) 的组件链条;其 35.61 与 63.20 的端点对应 FSSG、DINOv2-S、2% 主结果,附录效率表也明确把这些值作为 FSSG 参考。主文表 3 和表 5 的标题没有逐一重新写明数据集,不能仅凭 62.55 就把所有消融归到 FLSMD——它恰好也出现在 FLSMD 的完整模型主表中。
| 配置 | mIoU(%) | 相对 EMA 基线差值 | 说明 |
|---|---|---|---|
| 仅标注训练 M1 | 35.61 | 不适用 | 尚未使用伪标签框架 |
| EMA 教师—学生 M2 | 58.75 | 0.00 | 半监督基线 |
| EMA + OPR M3 | 62.55 | +3.80 | 仅增加特征校准 |
| EMA + ATC M4 | 61.90 | +3.15 | 仅增加阈值校准 |
| EMA + OPR + ATC M5 | 63.20 | +4.45 | 联合校准,比更强单模块高 0.65 |
表 4 的伪标签诊断显示两类干预作用不同。下表只保留尾类相关列;其准确率与过滤率沿用作者诊断口径,不等同于验证集尾类 mIoU,原文没有在此完整形式化各诊断量的分母。
| 配置 | 尾类伪标签准确率(%) | 尾类过滤率(%) | 正确保留 GT 比率(%,尾类) |
|---|---|---|---|
| 基线 | 56.56 | 17.83 | 46.47 |
| + OPR | 87.80 | 11.24 | 77.93 |
| + ATC | 88.65 | 10.39 | 79.44 |
| FTC-Seg | 89.03 | 8.43 | 80.61 |
关键发现¶
- OPR 内部消融中,完整 OPR 的 62.55 mIoU 去掉残差后降到 56.93,尽管尾类伪标签准确率从 87.80 升到 89.61。局部伪标签指标变好不保证整体分割变好,空间细节仍需要原始特征承载。
- OPR 层数表在两层达到 62.55,三层和四层分别为 61.47、60.98;不能解释为原型模块越多越好。主文解释是浅层原型与深层分割头语义不匹配。
- 附录表 7 用不同于主表、但同设置模块之间匹配的三个种子,联合模块比更强单模块提高 1.96–3.85 个百分点。12 个设置做配对检验与 Holm 校正后,ACDC 2% 的 \(p=0.0769\) 未达到 0.05,不能声称全部设置显著。
- 受控交互量定义为 \(I=CL-OL-CB+OB\),其中四项是相应条件下的尾类过滤率。附录 mild fog 的 ACDC 为 −0.11,SUIM 随扰动增强也不单调;“超加性排除”有实验支持,但不是任意噪声强度下的普遍规律。
- 附录推理效率用 RTX 4090、DINOv2-S + DPT、\(518\times518\) 输入:UniMatch V2 为 122.62 FPS,FTC-Seg 为 120.93 FPS。OPR 增加少量计算,ATC 不增加推理计算;不要混用主文毫秒表与附录 FPS 当同一个测量协议。
亮点与洞察¶
- 特征质量和监督可达性是两个不同瓶颈。提高置信度不能替代合理的入口,降低阈值也不能保证被救回的预测具有可分的表示,联合校准针对的是这条反馈链。
- 可学习原型不必与类别一一绑定。附录同种子比较中,自由原型 OPR 为 62.55 mIoU,固定类别身份的 class-anchored OPR 为 54.87,支持把原型视为共享特征模式而非硬类别中心。
- 标注数据不仅提供交叉熵监督,还可以为伪标签筛选提供外部参照。可迁移的设计是分别监控类别学习状态与相对先验的预测偏差,但跨域时应先验证先验是否可信。
局限与展望¶
- 前景集合需要人工定义且存在敏感性。附录 FSSG 同种子实验中,正确集合为 62.55 mIoU,同时加入背景并遗漏 Diver 后为 53.09;可进一步研究更稳健的软门控,但这是改进建议,不是本文模块。
- 标注先验可能因稀疏抽样或真实域偏移而失真。小类别的比例分母尤其敏感,EMA 能降低批次波动,却不能消除系统性先验偏差。
- 受控平衡列表改变样本数量与组成,声呐/水下原始图像保留固有噪声,合成扰动只控制新增扰动。它们提供机制证据,但没有完全分离自然噪声与样本选择的全部影响。
- 主结果只有三次种子,附录某些门控、原型和 Pascal VOC 实验只有单种子;联合增益也未在所有设置达到统计显著。更充分的种子、自然分布偏移与独立域测试能强化结论。
- 总损失权重、阈值边界保护等实现细节不完整。性能与效率还有表间协议差异,复现时需要对照代码核实,不能从笔记中的机制公式推断未报告设置。
相关工作与启发¶
- vs UniMatch / UniMatch V2:它们以弱到强一致性及强骨干建立半监督基线,FTC-Seg 在这一范式上同时改变特征重建和筛选规则。收益来自特定噪声长尾问题的干预,不是提出新的教师更新范式。
- vs FlexMatch / FreeMatch:同样关注类别相关阈值,ATC 的区别是联合使用标注准确率与标注/未标注分布比值。额外锚点可识别过预测,但也引入先验失配风险。
- vs CReST / DASO:分布再平衡关注类别比例,本文强调在筛选前就改善表示并调整监督入口。后续可检验与再平衡组合是否重复或互补,而不能预先假定叠加必然有效。
评分¶
- 新颖性: 4/5 — 将噪声与长尾导致的筛选循环明确化,并在两个位置给出可解释干预。
- 实验充分度: 4/5 — 四域、三标注比例及多种消融较完整,但三种子与若干单种子实验限制证据强度。
- 写作质量: 3/5 — 机制直观,部分数据集边界、实现设置与普遍领先措辞需要更谨慎交代。
- 价值: 4/5 — 对噪声环境下低标注分割有实用意义,门控与先验假设仍需按任务验证。