Noise-Robust Face Recognition via Non-target Similarity Distribution Guided Sample Selection¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/wfl95/DDLN
领域: 人体理解
关键词: 人脸识别, 标签噪声检测, 样本选择, 鲁棒学习, 余弦相似度
一句话总结¶
发现被丢弃的误标注目标余弦相似度与干净样本的非目标余弦相似度在分布上高度对齐,提出无需噪声率先验的动态样本选择框架 DDLN,在仅引入 0.2%~0.3% 额外计算开销下实现 SOTA 降噪与人脸识别精度。
研究背景与动机¶
大规模人脸识别模型严重依赖网络自动化抓取的百万乃至千万级数据,但网络抓取不可避免地混入大量错误标注。标签噪声会破坏模型训练动态并严重损害在严苛低误识率(如 FAR=\(10^{-5}\))下的特征判别力与泛化性能。为了清洗噪声,已有工作主要沿用两类范式:一是以软重加权或多中心/多模型协同过滤(如 Sub-Center ArcFace、Co-mining),但往往引入高昂的显存与计算开销;二是基于损失或目标余弦相似度的动态阈值截断(如基于 OTSU 的 RVFace),但它们强依赖于损失或相似度分布必须呈清晰双峰的先验假设,一旦处于训练早期或极端高噪声率下,双峰形态完全消失,阈值估算随即发生严重崩溃。
深层网络在反向传播机制中存在一个内在特性:未被拟合的样本-错误标签对,与样本-非目标负类对在本质上都是“样本与不匹配身份”的组合,两者均处于 Softmax 分布的长尾区域。从梯度反向传播的角度看,非目标相似度的梯度幅度正比于其预测概率,绝大多数负类概率几乎为零,梯度耦合极弱;而被判定排除反向传播的噪声样本同样失去了被拉向错误原型原点的吸引力。这就促成了一个关键现象:干净样本的非目标余弦相似度分布,与被丢弃的未拟合噪声目标相似度分布呈现高度一致的统计边界。
本文的切入角度正是利用这一可被直接观测的干净非目标相似度分布作为天然锚点,摆脱对不可靠目标双峰假设与先验噪声率的依赖。核心 idea:利用干净样本非目标余弦相似度的统计上界直接界定噪声边界,并设计早期的渐进式松弛阈值调度策略,在极低计算开销下实现无先验、单模型的高效标签噪声检测与过滤。
方法详解¶
整体框架¶
DDLN 将噪声检测与样本选择直接置于余弦相似度空间,嵌入现有的基于角度裕度(Margin)的标准人脸识别训练流程中。输入为小批量图像特征与对应标签,通过为每个样本引入二值掩码 \(q_i \in \{0, 1\}\),仅允许被判定为可靠干净的样本参与损失计算和梯度回传。每个训练步的判定阈值根据前一步的动态阈值 \(T_{n-1}\) 决定;而在批次内部,系统利用保留集合中的干净样本统计其非目标余弦相似度的上界与下界,经渐进式线性插值与指数移动平均(EMA)更新全局阈值。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入小批量特征与标注类别"] --> B["二值掩码判定与噪声样本丢弃<br/>对比目标相似度与动态阈值 Tn-1"]
B --> C["非目标相似度统计边界估算<br/>统计保留样本 top-k 负类上界与下界"]
C --> D["渐进式调度与平滑更新<br/>线性插值松弛上紧 + EMA 平滑阈值"]
D --> E["前向损失与反向传播更新模型"]
关键设计¶
1. 二值掩码判定与噪声样本丢弃:切断错误监督的梯度回传
针对传统软重加权方法容易积累置信度估计误差的问题,DDLN 采用严格的样本选择机制。对于当前批次中的样本 \(x_i\) 及其标注标签 \(y_i\),首先计算其与对应权重原型的目标余弦相似度 \(\cos \theta_{i, y_i}\)。若该值高于上一轮更新的全局阈值 \(T_{n-1}\),则置掩码 \(q_i = 1\)(保留为干净集合 \(\mathcal{Q}_n\)),否则置 \(q_i = 0\) 排除出损失反向传播: $$ \mathcal{L}{\text{DDLN}} = -\sum $$ 其中 } q_i \log \frac{e^{s f(\theta_{i, y_i})}}{e^{s f(\theta_{i, y_i})} + \sum_{j \neq y_i} e^{s f(\theta_{i, j})}\(f(\theta)\) 为嵌入裕度(Margin)的目标函数(如 CosFace 的 \(\cos \theta - m\) 或 ArcFace 的 \(\cos(\theta + m)\))。一旦噪声样本的目标相似度低于阈值被置零,网络对其错误类别的梯度拉力立即切断,防止特征空间被错误标签强行扭曲。
2. 非目标相似度统计边界估算:无需先验的自适应噪声上界锚定
传统动态阈值方法(如 OTSU)试图从目标相似度分布中强行拟合双峰分割点,在噪声率极大(如 80%)时双峰消失导致崩溃。DDLN 的核心发现是干净样本的非目标余弦相似度统计轮廓与被丢弃噪声的目标相似度分布重合度极高(主分布范围差异仅 0.005 左右)。因此,DDLN 直接从批次保留的干净集合 \(\mathcal{Q}_n\) 中统计非目标相似度:对每个保留样本,将其所有负类相似度降序排列,取第 \(k\) 大的值(默认 \(k=10\))作为局部上界,并加入防过拟合的松弛裕度 \(\alpha\)(默认 0.02),同时计算批次内所有负类相似度的全局极小值作为下界: $$ T'{\max} = \frac{1}{|\mathcal{Q}_n|} \sumn} \cos \theta + \alpha, \quad T'{\min} = \frac{1}{|\mathcal{Q}_n|} \sumn} \min $$ 选取适度的 } \cos \theta_{i, j\(k=10\) 既能准确表征负类分布的上限,又有效避免了最难单个负类可能带来的极端离群值干扰。
3. 渐进式调度与平滑更新:防止早期误杀硬难样本
深度神经网络具有先拟合简单干净模式、后拟合难样本和噪声的记忆特性。若在训练刚开始就施加严苛的 \(T'_{\max}\),许多尚未充分学习但富含判别信息的“难但干净样本”(Hard Clean Pairs)会因为初始相似度较低被误当作噪声永久丢弃。DDLN 设计了从保守下界向统计上界线性过渡的渐进策略: $$ T'n = T' + \beta_n (T'{\max} - T' $$ 其中调度周期 }), \quad \beta_n = \frac{\min(n, n_{\max})}{n_{\max}\(n_{\max}\) 设定在第一次学习率衰减前完成(通常为前 8~10 个 epoch)。在训练起始阶段,阈值紧贴下界 \(T'_{\min}\),模型几乎保留所有样本进行充分的基础表征探索;随着训练推进,特征分布逐渐聚拢稳定,阈值线性收紧至 \(T'_{\max}\),准确剥离噪声。最后,为防止批次间的采样扰动,利用指数移动平均(EMA,平滑系数 \(\lambda=0.01\))进行跨批次平滑:\(T_n = (1 - \lambda) T_{n-1} + \lambda T'_n\)。一旦噪声样本落入该阈值下方,梯度吸引力消失,极少再次跳回界内,训练过程呈现极高的单调纯化稳定性。
实验关键数据¶
主实验¶
论文在模拟合成噪声数据集(基于清洗版 CASIA-WebFace 注入不同比例的离群与错标噪声)及多个大规模真实噪声基准(真实 CASIA-WebFace、MS-Celeb-1M、WebFace2M-Noise)上进行了系统验证。下表展示了 SEResNet50-IR 在不同合成噪声设置下的噪声检测与识别指标对比(BLUFR Avg 为 FAR 在 \(10^{-3}, 10^{-4}, 10^{-5}\) 时的 TAR 与 SLLFW 的平均值):
| 实验设置 (Outlier-Flip %) | 方法 | SLLFW (%) | BLUFR Avg (%) | Precision (%) | Recall (%) | F1-score (%) |
|---|---|---|---|---|---|---|
| 10-5-5 (CosFace) | None (含噪基线) | 96.86 | 92.61 | – | – | – |
| 10-5-5 (CosFace) | Clean (理论上限) | 97.20 | 93.53 | – | – | – |
| 10-5-5 (CosFace) | OTSU (RVFace) | 96.92 | 93.91 | 90.51 | 96.41 | 93.36 |
| 10-5-5 (CosFace) | DDLN (本文) | 97.15 | 93.46 | 97.04 | 99.64 | 98.32 |
| 40-20-20 (CosFace) | None (含噪基线) | 92.62 | 83.42 | – | – | – |
| 40-20-20 (CosFace) | Clean (理论上限) | 96.43 | 92.33 | – | – | – |
| 40-20-20 (CosFace) | OTSU (RVFace) | 95.70 | 91.44 | 94.74 | 98.58 | 96.62 |
| 40-20-20 (CosFace) | DDLN (本文) | 96.45 | 93.38 | 99.14 | 99.70 | 99.42 |
| 60-30-30 (CosFace) | None (含噪基线) | 83.10 | 58.76 | – | – | – |
| 60-30-30 (CosFace) | Clean (理论上限) | 95.33 | 91.81 | – | – | – |
| 60-30-30 (CosFace) | OTSU (RVFace) | 93.35 | 85.12 | 95.05 | 98.00 | 96.50 |
| 60-30-30 (CosFace) | DDLN (本文) | 95.15 | 91.12 | 99.17 | 99.14 | 99.16 |
| 80-40-40 (CosFace) | None (含噪基线) | 70.40 | 30.45 | – | – | – |
| 80-40-40 (CosFace) | Clean (理论上限) | 92.75 | 86.14 | – | – | – |
| 80-40-40 (CosFace) | OTSU (RVFace) | 83.92 | 60.06 | 92.65 | 98.30 | 95.39 |
| 80-40-40 (CosFace) | DDLN (本文) | 91.70 | 78.11 | 95.16 | 98.13 | 96.63 |
在极具挑战的真实极端噪声数据集 WebFace2M-Noise(噪声率约 80%)上,使用 ResNet-50 评测各大骨干网络与降噪策略(包含 5 项通用人脸数据集平均分与低质监控集 TinyFace):
| 骨干损失与降噪方法 | LFW (%) | CALFW (%) | CPLFW (%) | AgeDB (%) | CFP (%) | TinyFace R1 (%) | 8项基准综合 Avg (%) |
|---|---|---|---|---|---|---|---|
| CosFace 基准 | 98.58 | 90.50 | 82.37 | 85.97 | 86.07 | 50.40 | 77.02 |
| CosFace + Sub-center | 97.95 | 89.63 | 80.50 | 84.96 | 82.89 | 50.99 | 75.86 |
| CosFace + SubRe (重训) | 99.05 | 92.52 | 85.07 | 90.43 | 89.21 | 54.29 | 79.57 |
| CosFace + RVFace (OTSU) | 99.46 | 93.83 | 88.32 | 93.90 | 93.49 | 61.72 | 83.52 |
| CosFace + DDLN (本文) | 99.43 | 94.46 | 89.25 | 94.47 | 94.33 | 63.52 | 84.43 |
| ArcFace 基准 | 98.52 | 90.65 | 82.60 | 86.13 | 86.61 | 50.86 | 77.02 |
| ArcFace + RVFace (OTSU) | 99.32 | 93.98 | 88.88 | 93.13 | 93.34 | 61.86 | 83.53 |
| ArcFace + RobustFace | 98.42 | 90.72 | 82.32 | 85.67 | 85.11 | 53.14 | 77.55 |
| ArcFace + DDLN (本文) | 99.53 | 94.57 | 90.18 | 95.10 | 95.10 | 63.25 | 84.70 |
消融实验¶
在 #40-20-20 合成数据集上,使用 ResNet50 + CosFace 验证关键超参数和渐进式调度的作用:
| 模块配置 | 调度周期 \(n_{\max}\) | 松弛参数 \(\alpha\) | EMA 平滑 \(\lambda\) | Precision (%) | Recall (%) | F1-score (%) | 说明 |
|---|---|---|---|---|---|---|---|
| 固定阈值 \(T'_{\max}(k=10)\) | – | – | – | 67.72 | 99.86 | 80.70 | 无渐进式调度,早熟误剔除大量硬难样本 |
| 固定阈值 0.20 | – | – | – | 99.82 | 93.87 | 96.75 | 固定经验阈值,漏检率较高 |
| 固定阈值 0.45 | – | – | – | 96.19 | 99.96 | 98.04 | 召回高但精确率偏低 |
| 渐进调度 (\(k=1\)) | 9 | 0.00 | 0.01 | 97.97 | 99.91 | 98.93 | 极值易受罕见负类离群点干扰 |
| 渐进调度 (\(k=10\)) | 9 | 0.00 | 0.01 | 99.38 | 98.90 | 99.14 | 默认排序阶数,稳定性良好 |
| 渐进调度 (\(k=50\)) | 9 | 0.00 | 0.01 | 99.65 | 97.50 | 98.56 | 过度平滑负类边界,召回率下降 |
| 完整模型 (默认配置) | 9 | 0.02 | 0.01 | 99.14 | 99.70 | 99.42 | 加入松弛裕度 \(\alpha\),达到最优 F1 |
| 周期调整 (\(n_{\max}=8\)) | 8 | 0.02 | 0.01 | 99.05 | 99.72 | 99.38 | 收敛周期微调对性能影响极小 |
| 周期调整 (\(n_{\max}=10\)) | 10 | 0.02 | 0.01 | 99.15 | 99.62 | 99.39 | 调度跨度鲁棒 |
关键发现¶
- 渐进式调度至关重要:若移除线性插值调度而直接采用固定的 \(T'_{\max}\),查准率会暴跌至 67.72%(F1 从 99.42% 跌至 80.70%)。这证明训练初期模型尚未形成稳定的表征,过早施加严苛边界会误删大量有价值的难样本。
- 极端噪声下的压倒性优势:在 80% 极端合成噪声下,OTSU 算法由于双峰分布瓦解导致大量干净样本被错杀(FNR 高达 31.19%),最终识别精度仅 60.06%;而 DDLN 将误杀率控制在 19.96%,识别精度大幅跃升至 78.11%(绝对提升 18.05%)。
- 极佳的计算性价比:由于非目标相似度在常规交叉熵/裕度损失的前向传播中本来就需要计算,DDLN 仅额外执行了批内 top-k 排序与 EMA 统计,实测批次开销仅增加约 1.07 ms(约 0.2%~0.3% 的额外耗时),远优于双网络 Co-mining 或显存占用翻倍的多中心方案。
亮点与洞察¶
- 从反向传播视角揭示本质规律:跳出了在损失曲面或目标相似度上做繁复概率建模的惯性思维,敏锐捕捉到未拟合错误标注与负样本在梯度饱和层面的数学同构性,为噪声检测找到了无需任何假设的物理锚点。
- 零超参重调的极简工程实现:无需先验噪声率估计,无需辅助验证集,仅凭 \(k=10, \alpha=0.02, \lambda=0.01\) 一套全局通用超参即可横跨 10% 到 80% 噪声率以及从百万到千万级规模的数据集。
- 可直接迁移至其他开集度量学习领域:这种利用保留样本非目标相似度统计上界反向约束目标边界的思想,可无缝推广至行人重识别(ReID)、车辆检索、细粒度图像分类等依赖 Margin-based Softmax 的表征学习任务中。
局限与展望¶
- 极端长尾类别样本稀疏时的边界抖动:当某些长尾类别本身仅有极少数样本,且其中混入强噪声时,难以形成稳定的非目标分布支撑,仍可能存在少量边界不确定性。
- 不可恢复的样本排除机制:目前样本一旦在阈值收紧后被剔除,就完全断开了反向传播更新,缺乏对后续表征成熟后潜在“伪噪声”的召回重检机制(如半监督再利用)。
- 未来方向:探索结合动量原型或半监督伪标签学习,将剔除出的高置信度离群噪声作为无标签数据进行对比一致性自监督训练,进一步盘活废弃数据价值。
相关工作与启发¶
- vs RVFace (OTSU):RVFace 依赖目标相似度的直方图双峰分布假设,在极高噪声或训练早期双峰消失时失效;DDLN 转向可观测的非目标相似度分布上界,在 80% 极高噪声下识别率领先超过 18 个百分点。
- vs Sub-Center ArcFace:Sub-Center 为每个类维护多个子中心以容忍噪声,带来了沉重的参数量和显存负担,且需要后续多阶段重训;DDLN 在单网络、端到端训练中一次性完成噪声剔除,性能平均超越其 5% 以上。
- vs Co-mining / Co-teaching:Co-mining 需维护两个独立网络交叉验证,计算与显存开销翻倍;DDLN 采用单网络内生统计指标,以约 0.2% 的微小开销取得了相当甚至更优的抗噪表现。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用负类相似度分布对齐未拟合噪声的机理,摆脱了对目标类双峰分布假设的依赖。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 8 个合成噪声梯队与 3 个千万级真实网络噪声基准,并给出了详尽的 FNR/FPR 与开销分析。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,反向传播数学推导与实验数据严密自洽,图表质量上乘。
- 价值: ⭐⭐⭐⭐⭐ 结构极简且即插即用,为大规模工业级人脸识别和度量学习模型的数据洗练提供了低成本方案。