AracNet: Revealing Debiasing Signals across Layers with Shallow Monitors¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4940
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/8119.pdf
代码: https://github.com/Malga-Vision/AracNet
领域: AI 安全
关键词: 视觉去偏、伪相关、浅层监测器、样本重加权、群组鲁棒性
一句话总结¶
AracNet 在冻结的偏置分类器各层训练浅层监测器,按真实类别置信度的分布选出偏置信号最清晰的一层,再据此重加权训练重新初始化的分类器,在 Waterbirds 上达到 \(91.27\pm0.56\%\) 的最差群组准确率,避免把偏置挖掘完全寄托于早停时机。
研究背景与动机¶
图像分类器可能把水面当成水鸟的证据,或者利用图像损坏类型猜测 CIFAR-10 类别。 当这类属性与类别在训练集中高度相关时,经验风险最小化容易学到捷径;一旦测试集打破相关性,少数“偏置冲突”样本就暴露出问题。 这里的偏置对齐样本指遵循训练集常见属性—类别关系的样本,偏置冲突样本则不遵循这种关系。 不少去偏方法会用偏置属性标注识别这些群组,但实际数据往往只有目标类别标签,因此本文研究的是“不使用偏置标签”的去偏,而不是完全没有监督的图像学习。
LfF、JTT 一类方法利用网络先学简单捷径、后记住困难样本的现象,从辅助模型的损失或错误中识别值得增加权重的样本。 关键问题是这个时间窗口并不稳定:训练过短时模型什么都没学会,训练过长时连偏置冲突样本也被记住,两类样本的输出都可能失去辨识度。 依赖人工指定轮数或带偏置标注的验证集会削弱“无需偏置信息”的吸引力;用生成模型制造偏置对齐数据又引入额外计算。 AracNet 转而追问:最终分类头已经记住所有样本,是否意味着内部每一层也都失去了区分能力?
作者认为,最终层的高训练准确率会掩盖内部表示仍然保留的偏置信号,而且不同偏置的有效观察位置不同。 背景捷径可能在较浅层就可读取,语义更细的属性则可能需要更深的表示,固定查看第一层或最后一层都不稳妥。 核心 idea:不再只寻找“何时停止训练”,而是在已训练网络中寻找“哪一层最能暴露偏置”,将该层的浅层监测器变成新分类器的样本加权信号源。
方法详解¶
整体框架¶
输入是带目标类别标签的偏置图像训练集,不包含训练用偏置属性标签;输出是一个用于常规图像分类的去偏模型。 先用普通分类目标训练一个偏置骨干并冻结,再通过“冻结表示监测”读取各块的中间特征,通过“双峰选层”保留一个监测器,最后进行“重加权自去偏”。 这里的“自去偏”指利用同一种骨干自身产生的信号训练重新初始化的模型,不是直接修改已冻结的偏置权重。 整个过程中保留偏置骨干作为信号源,另有一个可训练的目标模型;部署时只需要后者。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图像与类别标签"] --> B["训练偏置骨干"]
B --> C["冻结表示监测"]
C --> D["双峰选层"]
D --> E["重加权自去偏"]
A --> F["重新初始化目标模型"]
F --> E
E --> G["去偏分类预测"]
关键设计¶
1. 冻结表示监测:把内部特征变成可比较的偏置信号
先训练的骨干可以已经具有很高的训练准确率,甚至已经记住偏置冲突样本。 AracNet 不直接利用其最终输出,而是在每个网络块后附加一个监测器:对特征池化,再经过单个全连接层与 softmax,预测原来的目标类别。 监测器依然以真实类别的交叉熵训练;它没有直接预测“背景类型”或“是否偏置冲突”的监督目标。 训练监测器时冻结骨干很重要,否则探针和特征一起适应,原本要观察的表示就会被改写。 相比再训练一个有完整表达能力的辅助网络,线性监测器只能读取该层已经提供的可分信息,较难通过新增深层计算重新记住所有例外。
用于判断的置信度是监测器赋给真实类别的概率,而不是其最大预测概率。 如果某层主要保留捷径,偏置对齐样本的真实类别概率通常高,偏置冲突样本的真实类别概率则可能低,即使监测器对另一个错误类别非常自信。 因此,真正有用的不是监测器整体分类准确率最高,而是其输出能够区分两类训练样本。 论文图 2 的 Waterbirds 与 BFFHQ 对比也表明,浅层并不总是最佳位置:背景偏置在前面的块更明显,细粒度属性的分离信号可能出现在第三块。 这是一种经验观察,不是所有网络都遵循的层级定律。
2. 双峰选层:利用置信度分布自动选择观察位置
如果某个监测器对几乎所有样本都很自信,它很可能无法再提供有用的重加权区分。 如果它对所有样本都缺乏信心,也可能仅仅没有学会分类。 作者希望找到的是“大多数样本具有高真实类别置信度,同时存在低置信度尾部”的层,而不是简单挑选误差最大的一层。 具体做法是对每一层的训练集置信度计算分位数,用置信度跨度乘以中位数,选择分数最高的监测器。 按第 4.2 节的文字定义,记 \(Q_p(c_\ell)\) 为第 \(p\) 百分位数,双峰分数为:
两个极端分位数之差鼓励出现可分离的高低置信度样本,中位数因子则偏向主体已经被高置信度识别的分布。 选层完成后,其余监测器被丢弃,只保留最高分的一层,后续不需要所有探针持续参与去偏训练。 该步骤仅使用训练样本和类别标签,不需要偏置群组标签或无偏验证集来确定偏置挖掘的停止点。 不过,“双峰分数”是作者命名的启发式统计量,不是严格的双峰检验,也不能保证低置信度样本必然代表偏置冲突。 尤其当罕见冲突样本少于所用分位数覆盖的尾部时,这种统计量的可靠性仍需额外验证。
3. 重加权自去偏:让监测器失败的样本获得更强训练信号
保留偏置骨干和选中的监测器作为信号源,同时重新初始化目标分类器,避免从已经严重依赖捷径的参数直接继续微调。 每个训练样本都有普通目标分类交叉熵,AracNet 再乘上两个权重因子,使监测器难以识别的样本更受重视。 第一个因子是置信度的惊讶度幂次;算法 1 明确给出:
这里 \(c_{\ell^*}(x)\) 是选中监测器对真实类别的概率,\(\lambda\) 控制高低置信度样本之间的权重反差。 第二个因子借鉴 LfF,利用监测器损失和目标模型损失提供相对难度信号;正文说明它对偏置对齐样本接近零,对偏置冲突样本趋近一。 两者共同乘在目标模型的交叉熵上,而不是添加一个新的偏置属性预测损失。 本地全文的式(5)和式(6)存在抽取缺损,无法可靠核验第二个因子的完整代数式及数值稳定项,因此这里不凭 LfF 的常见写法补齐公式。 可以核验的是“双因子相乘、再加权目标交叉熵”的机制,以及算法 1 中惊讶度因子的精确定义。
去偏阶段采用交替更新:监测器在冻结骨干的特征上继续学习原分类任务,目标模型则在监测器固定时使用其信号更新。 “继续训练监测器”不意味着解冻信号源骨干,也不意味着两个分类器共享可更新参数。 第 3.4 节正文与算法 1 对每轮中两个更新的先后描述略有差异,但两者均明确要求交替更新并在目标更新时固定监测器。 因此可以复述训练职责,却不应仅凭当前文本断言实现中的精确循环起点。
一个完整示例¶
考虑训练集中一只处在陆地背景上的水鸟:真实标签仍是水鸟,但其背景不符合大多数训练水鸟的模式。 普通偏置骨干的最终层可能已经记住这张训练图,因而其输出不再暴露问题。 冻结表示监测让每个块的浅层监测器分别预测类别;某个主要读取背景的监测器仍可能把它判成陆鸟,导致真实水鸟类别的概率很低。 双峰选层不是为这一张图单独选层,而是先从整个训练集的置信度分布确定统一的信号源。 在目标模型更新时,该图通过低真实类别置信度获得较大的惊讶度权重,推动模型更认真学习不能依赖背景就完成的分类。 相反,符合常见背景关系的图像通常获得更小权重;测试时所有图像都直接进入去偏目标模型,不再执行监测器选层。 这个例子解释信号的预期作用,不保证每个被加权的难例都具有同一种原因。
损失函数 / 训练策略¶
第 4.2 节使用 ResNet50 处理 Waterbirds、UrbanCars,ResNet18 处理 BAR、BFFHQ,前两种骨干配置均采用 ImageNet 预训练初始化偏置骨干。 Corrupted CIFAR-10 使用随机初始化的 ResNet20,并保持 \(32\times32\) 分辨率;其余数据集缩放至 \(224\times224\)。 监测器预热通常为 30 轮,Corrupted CIFAR-10 为 50 轮;这与表 6c 扫描的“偏置骨干预训练轮数”不是同一个变量。 偏置骨干和监测器使用 SGD,去偏目标模型使用 AdamW;Waterbirds、BFFHQ、BAR 的去偏学习率为 \(5\times10^{-5}\)。 Waterbirds 与 UrbanCars 的监测器学习率为 0.005,其余数据集为 0.05;批大小通常为 64,Corrupted CIFAR-10 为 256。 目标模型的随机重初始化是第 3.4 节明确描述的步骤,不能把前面提到的 ImageNet 初始化误读为直接保留偏置骨干参数微调。 训练仍有预热轮数、学习率和 \(\lambda\) 等超参数,因此“不依赖早停选取偏置信号”不等于“完全无需调参”。
实验关键数据¶
主实验¶
下表只选原文表 1、2、3、5 中能说明优势及代价的结果,准确率和差距均以百分数或百分点表示。 AracNet 的误差项是三次独立运行的标准差;对照结果沿用原文各方法所报告的形式,不补造缺失的方差。 Waterbirds 使用测试集最差群组准确率 WGA,即各类别—背景群组准确率中的最小值;BFFHQ 只评估测试集偏置冲突样本。 Corrupted CIFAR-10 是无偏测试集的平均准确率,其中偏置冲突与对齐样本占比为 90:10。 UrbanCars 的差距表示 I.D. 准确率减去相应冲突子群准确率;负值意味着该子群反而更准确,解读时应关心是否接近零,而不是追求任意大的负数。
| 数据集 / 设置 | 指标 | AracNet | 选定对照 | 来源与解释 |
|---|---|---|---|---|
| Waterbirds | WGA ↑ | 91.27 ± 0.56 | DDB:90.81 ± 0.49 | 表 2;高 0.46 个百分点 |
| BFFHQ,相关度 0.995 | 冲突样本准确率 ↑ | 75.93 ± 0.76 | DeNetDM:75.70 | 表 3;高 0.23 个百分点 |
| Corrupted CIFAR-10,相关度 0.995 | 平均准确率 ↑ | 33.23 ± 1.93 | DeNetDM:38.93 ± 1.16 | 表 1;低 5.70 个百分点 |
| Corrupted CIFAR-10,相关度 0.950 | 平均准确率 ↑ | 56.80 ± 0.78 | DeNetDM:56.30 ± 0.42 | 表 1;高 0.50 个百分点 |
| UrbanCars | I.D. 准确率 ↑ | 85.95 ± 1.01 | ERM:97.30 | 表 5;分布内准确率有所牺牲 |
| UrbanCars | 双偏置冲突差距,接近 0 为佳 | 0.35 ± 1.40 | ERM:69.20 | 表 5;子群间差距显著缩小 |
这不是严格控制所有资源的同架构复现表:对照方法可能使用生成模型、外部模型或不同训练流程。 Waterbirds 与 BFFHQ 上的领先幅度较小,尤其不能仅凭均值差异声称统计显著优于相邻方法。 本文更扎实的证据是相对 ERM 的去偏效果、跨数据集的适用性,以及无需生成模型就能取得竞争力,而非“所有条件下第一”。
消融实验¶
下表来自原文表 6,全部在 Waterbirds 上评估 WGA,单位为百分数,越高越好。 “差值”以完整配置为参照,为按原表均值相减得到的百分点变化;改变预训练轮数与改变权重是不同实验,不应拼成一个组合配置。
| 配置 | WGA ↑ | 相对完整配置 | 对应证据 |
|---|---|---|---|
| 完整配置,惊讶度指数为 2 | 91.27 ± 0.56 | 0.00 | 表 6a、6b |
| 去掉惊讶度权重 | 84.94 ± 1.41 | −6.33 | 表 6a |
| 去掉监测器相对损失权重 | 88.78 ± 1.36 | −2.49 | 表 6a |
| 惊讶度指数改为 5 | 84.47 ± 2.58 | −6.80 | 表 6b |
| 偏置骨干预训练 200 轮 | 90.85 ± 0.74 | −0.42 | 表 6c;50 轮参照为 91.27 ± 0.56 |
关键发现¶
- 两个权重有互补作用,去掉惊讶度因子的下降更大;这支持增强困难样本信号,但不等于解释了所有收益来源。
- 预训练从 50 轮延长至 200 轮仅下降 0.42 个百分点,说明在 Waterbirds 上,内部监测器比最终分类输出更耐受训练集记忆;尚不能推广为所有数据集上的证明。
- \(\lambda=5\) 明显弱于 \(\lambda=2\),表明过度强调低置信度样本也可能有害,方法并未消除权重强度选择问题。
- UrbanCars 的 I.D. 准确率与群组差距揭示真实代价:少依赖两种捷径,并不必然提高原分布上占多数样本的准确率。
亮点与洞察¶
- 监测器是“偏置传感器”而不是需要尽量做准的附加分类头。评价一个内部表示是否有用,要看它能否产生分辨样本的训练信号,而不只是分类分数。
- 从训练时间转向表示深度,使偏置挖掘不必与目标模型最后一层的记忆状态绑定。冻结信号源与浅层探针共同承担这一角色,不能只把贡献理解为新增一个线性层。
- 样本级权重与目标模型结构解耦。第 4.5 节还测试了向其他骨干传递监测信号,不要求源模型与目标模型逐层对应。
局限与展望¶
- 作者在结论中提出多模态偏置和动态监测器作为后续方向;当前主要证据仍来自图像分类基准,不是通用公平性保证。
- 读者判断:置信度分布的低值尾部也可能包含标签噪声、稀有类别或普通难例。没有偏置标签的便利同时意味着缺少“被加权样本为什么困难”的语义验证。
- 读者判断:选层分位数依赖偏置对齐样本占多数的形态,而且文中未报告移除选层步骤、固定不同层的完整定量消融,选层收益仍可进一步隔离验证。
- 读者判断:额外线性层虽小,完整训练仍包含偏置骨干训练、监测器预热和新模型训练,不能把探针开销小等同于整体训练免费。
- 来源问题:本地式(5)、(6)不完整,第二权重的精确实现不能从缓存复现;BAR 表 4 的 0.990 设置为 76.22 ± 1.47,而第 4.3 节正文写 76.65 ± 1.47,本文不据此形成定量结论。
相关工作与启发¶
- 对比 JTT:JTT 根据短时训练模型的错误识别需要上采样的样本;AracNet 允许先训练骨干,再选择仍保有偏置区分能力的内部层,主要差异是信号提取位置而非是否训练两次。
- 对比 LfF:两者都把偏置模型的失败转为目标模型的训练重点;AracNet 增加冻结中间表示、自动选层与惊讶度加权,不应把相对损失权重本身视为全新提出。
- 对比 DDB:DDB 通过生成偏置对齐样本减少辅助模型记忆冲突样本的问题;AracNet 不生成图像,而是在现有表示中寻找仍可用的信号,节省了生成管线但保留了选层假设。
- 对比 SIFER 与 OccamNets:前者通过特征筛除影响表示学习,后者借助早退结构偏向简单假设;AracNet 的监测器主要服务于训练样本加权,并非部署时的多出口预测机制。
评分¶
- 新颖性:4/5。内部浅层探针、分布选层与自去偏形成清晰组合,但仍建立在已有重加权思路之上。
- 实验充分度:4/5。覆盖多种偏置、双偏置与不同骨干,核心消融较完整,但集中于 Waterbirds,部分收益差异较小。
- 写作质量:3/5。问题与流程容易理解,缓存公式缺损、正文与伪代码顺序及 BAR 数值不一致影响精确复现。
- 价值:4/5。为视觉伪相关鲁棒性提供无需生成模型的实用方向,适合关注内部表示与训练群组不均衡的研究者。