HEM: a margin-based loss for visual categorisation tasks¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://codeberg.org/mwspratling/HEMLoss
领域: 优化/理论
关键词: 损失函数, 边界损失, 分类鲁棒性, 持续学习, 语义分割
一句话总结¶
针对交叉熵损失(CE)过度自信、持续改写权重及多类别边距损失(MM)梯度不稳定的缺陷,本文提出了高误差边距损失(HEM),通过动态截断低误差和自适应类边距,在未知类拒识、对抗鲁棒性、长尾学习和语义分割等多项任务中全面超越 CE 与专用损失。
研究背景与动机¶
在深度神经网络(DNN)的分类任务中,由于分类准确率是分段常数函数且梯度处处为零,基于随机梯度下降的优化过程必须依赖平滑的代理损失函数。多年来,交叉熵(Cross-Entropy, CE)损失一直是视觉分类事实上的行业标准。然而,CE 存在根深蒂固的病态训练动态:即使网络已经以极高置信度做出了正确预测,其损失值依然显著大于零,导致反向传播持续产生梯度,强行将正确类的 logit 推向正无穷、错误类的 logit 推向负无穷。这种无休止的极化不仅诱导模型在遇到分布外(OOD)或未知类别时产生极度过度自信的错误预测,还会持续改写网络权重,加剧持续学习中的灾难性遗忘,并在长尾不平衡训练中彻底淹没稀有类的表征特征。此外,CE 的优化动力学并不严格与分类决策边界对齐,其损失值甚至可能在预测变差或错误分类时反而更低。
相比之下,统计机器学习中的多分类边距损失(Margin-based Loss,如 Crammer-Singer MM 损失)天然具备停止准则:一旦正确类的 logit 超出其他类别达到设定安全边界,该样本的误差即归零,停止权重改写,因而对缓解过度自信和遗忘具有理论优势。然而,传统的 MM 损失在实际深度学习基准测试中的干净测试准确率往往大幅落后于 CE。深入分析表明,MM 损失在跨样本和多类别聚合时采用简单的算术平均或求和,在训练初期(绝大多数类别均产生误差)梯度巨大,而在训练后期(绝大多数类别误差归零)梯度迅速衰减,极大的梯度动态范围使得网络难以抑制最后残留的少量关键非零误差,在类别数较多时尤为脆弱。
针对传统 MM 损失聚合失效与 CE 过度自信的矛盾,本文重新设计了边距损失的误差聚合机制与边界分配策略。核心 idea:提出高误差边距损失(HEM),在每条样本内部自适应将低于均值的误差置零并仅对非零误差求均值以稳定梯度流,同时引入与类别样本频次逆相关的自适应边距,使通用边距损失在保留零损失鲁棒优势的同时兼具强劲的判别表征能力。
方法详解¶
整体框架¶
HEM 旨在作为通用替代损失直接替换网络训练中的标准交叉熵损失。对于给定的输入样本和真实类别标签,网络输出未经归一化的分类预测 logits。方法首先计算每个错误类别与正确类别之间的边距违背误差;随后在样本维度自适应过滤低于平均水平的微弱误差,仅保留高误差项进行非零均值聚合;最后根据训练集中各类别样本分布施加自适应边距缩放。整个优化流在确保难负例主导梯度的同时,避免了大量易分样本和零误差对梯度的无谓稀释。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["网络前向输出 Logits 与真实标签"] --> B["阶段1:零损失截断与安全边界<br/>计算各非目标类的边距违背误差"]
B --> C["阶段2:高误差自适应筛选与非零均值聚合<br/>阈值过滤低误差,仅对非零高误差平均"]
C --> D["阶段3:样本频次逆平方根动态边距<br/>根据类别样本量自适应调节边距幅度"]
D --> E["反向传播梯度并执行零损失计算图剪枝"]
关键设计¶
1. 零损失截断与安全边界:根治过度自信与无谓权重改写
针对 CE 损失即使在预测完全正确且置信度极高时仍不断产生梯度推高 logits 的痛点,HEM 引入严格的边距断点。设 \(y\) 为网络顶层输出的 logits 向量,\(l\) 为真实类别索引,对任意非目标类别 \(i \neq l\),该类别产生的边距误差定义为: $\(e_i = \max(0, y_i - y_l + \mu_i)\)$ 其中 \(\mu_i\) 为第 \(i\) 类的非负安全边界;当 \(i = l\) 时,定义 \(e_l = 0\)。该机制保证了只要正确类 logit \(y_l\) 超过竞争类别 \(y_i\) 至少 \(\mu_i\),该类别产生的误差便严格为零。这种零损失特性不仅防止网络产生无限膨胀的极化 logits,保留了区分已知类与未知类别的置信度分辨率,而且使已完全拟合的样本在训练后期不再产生权重扰动,在 autograd 中直接促成了计算图剪枝,显著降低计算开销并抑制持续学习中的灾难性遗忘。
2. 高误差自适应筛选与非零均值聚合:稳定全阶段梯度动态
针对传统多分类边距(MM)损失对所有类别误差简单求和/平均导致初期梯度过大、后期因零误差过多而梯度归零的缺陷,HEM 设计了一种两步自适应误差聚合策略。首先,计算该样本在所有类别上的平均误差并将其从计算图中分离(detach);随后,将所有低于该均值的误差强制置零(thres 操作),促使网络在初始阶段集中惩罚最大误差;最后,计算仅在大于零的误差项上的算术平均(maz 操作): $\(\mathcal{L}_{\text{HEM}} = \frac{\sum_{i=1}^{n} \mathbb{I}\left[e_i \ge \frac{1}{n} \sum_{j=1}^{n} e_j\right] \cdot e_i}{\sum_{i=1}^{n} \mathbb{I}\left[e_i \ge \frac{1}{n} \sum_{j=1}^{n} e_j\right]}\)$ 式中 \(\mathbb{I}[\cdot]\) 为指示函数。在训练初期类别误差普遍存在时,阈值截断强迫网络聚焦于最困难的负类;在训练后期多数类别误差归零时,分母仅统计剩余的非零高误差个数,防止损失值因被大量 0 均分而过早消失。在 mini-batch 维度聚合时,HEM 同样仅对批次内非零样本损失求均值,确保梯度幅度在整个训练生命周期内保持稳定。
3. 样本频次逆平方根动态边距:无参数重加权的长尾自适应平衡
针对训练数据类别不平衡时少数类表征容易被多数类主导并遗忘的痛点,HEM 提出了基于类别先验频次的非对称边距设定。在标准均衡设置下所有类别共享统一边距 \(\mu_i = \sqrt{M / \sum_{k=1}^n s_k}\)(记为 HEM-);而在不平衡长尾设置下,将类别 \(i\) 的边距设为与该类样本数 \(s_i\) 成反比: $\(\mu_i = \sqrt{\frac{M}{n \cdot s_i}}\)$ 其中 \(n\) 为类别总数,\(s_i\) 为第 \(i\) 类的训练样本数,\(M\) 为全局缩放超参数(全文统一固定为 2000,且实验证明对该值不敏感)。由于少数类的样本量较小,其对应的要求安全边距 \(\mu_i\) 显著变大,迫使分类器为样本稀缺的尾部类别学习更宽、更保守的判别分离带,而无需改变网络架构或引入额外的重采样策略。
损失函数 / 训练策略¶
HEM 损失内部不引入复杂的调度超参数,全局超参数 \(M = 2000\) 即可通用于各类视觉任务。由于 HEM 允许误差归零,在训练后期达到分类边界的样本不会向反向传播传递梯度,PyTorch 等框架的自动求导引擎能够直接对这部分样本的前向计算图进行动态剪枝。在 TinyImageNet 训练 ResNet-18(200 epoch)时,这一特性直接带来了约 10% 的训练加速;在 Cityscapes 语义分割任务中也获得了约 4% 的显存与计算时间缩减。
实验关键数据¶
主实验¶
论文在标准分类基准(MNIST, CIFAR-10, CIFAR-100, TinyImageNet, ImageNet-1k)、长尾不平衡分类、持续学习(PermutedMNIST, SplitMNIST, SplitCIFAR-10/100)和语义分割(CamVid, Cityscapes, SBD, ADE20k)上开展了广泛评测,覆盖 19 种深度网络架构(从 LeNet 到 ViT-B/16)。
下表总结了标准训练数据下五大分类基准的平均相对性能变化,以及长尾数据和语义分割等任务上 HEM 与基线损失的对比:
| 评估任务 / 指标 | CE(交叉熵) | LogitNorm (LN) | Logit-adjusted (LA) | DICE | MM (经典边距) | HEM (本文) |
|---|---|---|---|---|---|---|
| 标准数据:干净测试准确率 (%) | 基准 (0.00) | -1.25 | 0.00 | -15.42 | -10.85 | -1.19 |
| 标准数据:常见模糊损坏准确率 (%) | 基准 (0.00) | -1.02 | 0.00 | -14.28 | -9.60 | -1.07 |
| 标准数据:未知类拒识 AUROC (%) | 基准 (0.00) | +4.10 | 0.00 | -13.20 | -8.45 | +4.52 |
| 标准数据:AutoAttack 鲁棒性 DAR (%) | 基准 (0.00) | +5.31 | 0.00 | -8.10 | -5.70 | +17.17 |
| 长尾数据:未知类拒识 AUROC (%) | 基准 (0.00) | +2.15 | -0.12 | -18.60 | -7.90 | +9.33 |
| 长尾数据:AutoAttack 鲁棒性 DAR (%) | 基准 (0.00) | +1.80 | -0.45 | -11.20 | -6.15 | +2.77 |
| 持续学习:全任务最终保留准确率 (%) | 基准 (0.00) | -12.40 | 0.00 | -28.30 | -8.10 | +1.27 |
| 语义分割:测试集 mIoU 相对提升 (%) | 基准 (0.00) | -18.50 | -22.10 | -0.30 | -14.20 | +5.31 |
注:表中除 CE 基准外,其余各列数值为相对于 CE 的增量平均值(百分点)。标准数据下的四项指标统计自 71 组实验组合;持续学习涵盖 80 组实验;语义分割涵盖 76 组实验。
消融实验¶
在 CIFAR-10 和 CIFAR-100 上使用 ResNet-18 架构(固定边距 \(\mu = 0.2\)),对 MM 损失到 HEM 损失所引入的两项核心改动进行了严谨的消融实验(五次随机试验均值与标准差):
| 损失配置 | CIFAR-10 干净准确率 (%) | CIFAR-100 干净准确率 (%) | 机制说明 |
|---|---|---|---|
| MM(基线多分类边距) | 93.79 ± 0.11 | 70.13 ± 0.19 | 对所有 logits 误差进行标准算术平均 |
| + maz | 93.81 ± 0.23 | 74.94 ± 0.35 | 仅对非零误差求均值,防止大量 0 稀释梯度 |
| + thres | 93.78 ± 0.22 | 73.13 ± 0.26 | 仅将低于样本均值的误差置零,聚焦难负例 |
| + maz + thres (完整 HEM) | 93.84 ± 0.19 | 74.95 ± 0.46 | 兼顾难负例筛选与梯度量级稳定(比 MM 高出 4.82%) |
关键发现¶
- 类别规模决定聚合机制的收益:在 10 类的 CIFAR-10 上,MM 与 HEM 差异不明显;而在 100 类的 CIFAR-100 上,单纯引入非零均值聚合(maz)就使准确率从 70.13% 暴涨 4.81% 至 74.94%。这强力证实了类别数越多时,传统 MM 损失被大量易分零误差稀释梯度的问题越致命。
- 对抗鲁棒性与未知类拒识的大幅飞跃:在未引入任何对抗训练或 OOD 架构微调的前提下,HEM 在 AutoAttack DAR 鲁棒指标上比 CE 高出 17.17%,未知类拒识 AUROC 提升 4.52%,全面碾压此前专门针对 OOD 设计的 LogitNorm 损失。
- 专用损失跨领域泛化溃败:LogitNorm(专为未知类拒识设计)在持续学习与语义分割中大幅崩塌;Logit-adjusted(专为长尾设计)在未知类和分割上大幅落后;DICE(分割经典专用损失)在所有场景下均弱于 HEM。HEM 在测试的 10 项全方位评测中有 5 项拿下最优,是唯一能横跨分类、分割、长尾和持续学习的通用损失。
亮点与洞察¶
- 将边距概念成功带入通用深度表征学习:传统观点认为边距损失在多分类大模型中难以收敛或准确率偏低,本文揭示其症结并非边距本身,而是多类聚合时被零误差稀释了梯度幅度;通过非零均值与均值截断两行代码级别的改动,使经典边距损失焕发新生。
- 零额外代价的高阶鲁棒性馈赠:无需生成对抗扰动样本、无需双分支对比学习,仅通过改变损失函数便获得了超过 17% 的 AutoAttack 防御提升,证明了 logit 极化是 DNN 脆弱性的根源之一。
- 可复用的训练图剪枝加速机制:利用边距截断带来的自然零损失属性,框架能够在后半段训练中安全跳过部分反向图计算,为大规模视觉模型训练提供了免费的计算加速。
局限与展望¶
- 干净图像分类精度的轻微妥协:在标准平衡数据集上,HEM 的干净测试准确率相较于高度针对 CE 超参调优的基线平均低约 1.19%,对于只追求极限 Top-1 准确率而完全不考虑安全与鲁棒性的场景存在微小权衡。
- 语义分割中长尾边距先验的不适配:实验中共享边距的 HEM- 在语义分割上的表现优于基于像素频次逆缩放的 HEM,表明图像级样本计数的逆平方根启发式规则不能直接无损迁移至像素级稠密预测。
- 跨模态与语言模型泛化待验证:当前验证集中在计算机视觉(分类与分割),后续应进一步拓展至视觉-语言大模型(VLM)及自然语言生成任务的 token 级判别优化中。
相关工作与启发¶
- vs Cross-Entropy (CE): CE 会无休止地拉大 logits 差距并持续改写权重;HEM 采用硬性边距截断,达到阈值后即停止梯度更新,兼顾泛化、未知类识别和计算效率。
- vs Multi-Class Margin (MM / Crammer-Singer): MM 简单平均所有类别的误差导致梯度极不稳定且随类别增多而剧烈衰减;HEM 引入了均值截断(thres)与非零均值(maz),在多类别(如 CIFAR-100、ImageNet)中表现出压倒性优势。
- vs LogitNorm & DICE: LogitNorm 和 DICE 作为特定领域的定制损失,在其专精领域外普遍发生灾难性性能退化;HEM 保持了全能型通用损失的特性,且在分割任务中以超过 5% 的 mIoU 击败 DICE。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 重新剖析了经典边距损失在现代深度神经网络中的梯度退化机理,巧妙给出了自适应高误差筛选解决方案。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 19 种骨干网络、从 MNIST 到 ImageNet 的海量基准,兼顾分类、长尾、对抗、OOD、持续学习与语义分割共 10 维系统性评估。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,对 CE 和 MM 失败模式的数学与实验机理剖析极其透彻。
- 价值: ⭐⭐⭐⭐⭐ 代码即插即用,零架构入侵,为提高真实世界深度模型的泛化性与安全性提供了强有力且易落地的替代方案。