Robustness Emerges Early in Training Dynamics, but Is Not Preserved¶
会议: ECCV 2026
论文: ECCV 2026 Poster
领域: 预训练
关键词: 训练动态, 自然鲁棒性, 浅层特征, 鲁棒性消退, 轨迹干预
一句话总结¶
本文发现深度神经网络在训练初期浅层子网络会自发形成高鲁棒性表征与平坦损失地形,但在标准经验风险收敛过程中会被侵蚀磨灭,据此提出早期阶段稳定化(EPS)与非对称权重回退(AWR)两种无参数轨迹干预策略,无需修改结构即可显著提升自然扰动鲁棒性。
研究背景与动机¶
深度神经网络在自然图像分类中取得了极高准确率,但面对传感器噪声、雨雾天气、压缩畸变等自然扰动(Natural Corruptions)时性能往往剧烈退化,这成为自动驾驶和医疗成像等安全攸关场景落地的关键瓶颈。以往提升自然鲁棒性的工作主要集中于数据增强(如 AugMix、Mixup)或设计精巧的训练配方(如 TVR-V2),然而通过逐层线性探测分析可以发现,这些前沿方案带来的抗扰动增益几乎全部积聚在深层子网络中,而处理底层纹理与几何轮廓的浅层特征鲁棒性与基线模型几乎无异。这种结构性失衡揭示了现有模型浅层特征对扰动的高度脆弱性,而仿生神经架构(如引入灵长类初级视觉皮层 V1 先验的 VOneNet)通过硬编码浅层滤波器能显著抵御扰动,表明浅层网络本身具备承载极强鲁棒性的潜能,只是常规训练机制未能将其激活或维持。
既然浅层鲁棒结构能够被显式注入,那么在模型优化轨迹的动态演变中,这类鲁棒特性是否曾自发涌现过?通过追踪浅层卷积权重的方向余弦相似度轨迹,研究人员观察到浅层网络在训练初期经历了一段剧烈重组的活跃探索期(Active Exploration Phase)。进一步在表征层面使用中心化核对齐(CKA)和互信息(InfoNCE MI)评估干净与受损样本的特征相似度,发现浅层结构在初期展现出极强的扰动不变性与信息保真度,且因果冻结实验表明早期的浅层参数引导整个模型落入更平坦的损失极小值。然而随着训练在无污染数据上趋于收敛,经验风险最小化(ERM)驱动模型过度挖掘高频非鲁棒统计关联,导致浅层鲁棒表征逐步退化、损失地形急剧锐化,这种现象被定义为“鲁棒性消退(Robustness Fading)”。
本文的切入角度是:无需引入复杂的生物架构或增加额外可学习参数,只需在优化轨迹的特定时间节点对浅层参数施加轻量干预,就能锁定或召回这些转瞬即逝的早期鲁棒先验。核心 idea:将鲁棒性增强形式化为训练轨迹干预问题,提出在优化初期冻结浅层参数的早期阶段稳定化(EPS)以及后期回滚浅层快照并衰减学习率的非对称权重回退(AWR),以零架构与计算开销保全浅层平坦极小值与抗扰动先验。
方法详解¶
整体框架¶
本文提出的训练轨迹干预框架立足于网络参数的功能性分工与动态演变。将模型整体参数 \(\theta\) 解耦为两部分:负责底层几何边缘与局部纹理提取的浅层子网络 \(\theta_s\),以及负责高层语义抽象与类别决策的深层子网络 \(\theta_d\)。在标准的经验风险最小化流程中,两组参数均依照全量损失梯度的反方向连续演变,但该连续轨迹最终会导致 \(\theta_s\) 丧失初期的平坦地形优势。为此,框架在训练动态中引入时间干预算子 \(\mathcal{I}\),在指定时步 \(\tau\) 针对浅层参数施加定制化的动力学约束,而深层子网络 \(\theta_d\) 则全程保持优化自由度以适应目标任务。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入数据与经验风险损失 L"] --> B["解耦轨迹干预框架<br/>网络参数分解为浅层 θs 与深层 θd"]
B --> C{"选择动态干预策略"}
C -->|时域截断机制| D["早期阶段稳定化<br/>在 τeps 冻结浅层参数 θs 并保持平坦极小点"]
C -->|历史回滚机制| E["非对称权重回退<br/>回退至 tearly 快照并衰减学习率至 ηfine"]
D --> F["深层参数 θd 持续更新以完成语义适配"]
E --> F
F --> G["收敛输出高鲁棒性泛化模型"]
关键设计¶
1. 解耦轨迹干预框架:浅层与深层参数时序演化的功能解耦 常规优化范式将模型视为同质参数整体进行端到端更新,忽视了不同深度网络层在训练动态中的异质性演化特征。针对浅层表征在探索期后因拟合干净样本而发生鲁棒性漂移的痛点,该设计显式将参数解耦为 \(\theta = \{\theta_s, \theta_d\}\),并定义时间干预算子 \(\mathcal{I}\): $$ \theta_s^{(t+1)} \leftarrow \mathcal{I}\left(\theta_s^{(t)}, \nabla_{\theta_s} \mathcal{L}, t, \tau\right) $$ 在时间戳 \(t \ge \tau\) 之前,\(\theta_s\) 与 \(\theta_d\) 均接受标准随机梯度下降更新;到达关键干预节点 \(\tau\) 后,算子 \(\mathcal{I}\) 接管 \(\theta_s\) 的更新机制,阻断过度拟合干净数据带来的扰动脆弱性,同时解除浅层与深层的更新同步性,允许深层参数 \(\theta_d\) 依据冻结或回退后的浅层表征重新校准分类边界。
2. 早期阶段稳定化:截断浅层优化轨迹以固化平坦鲁棒先验 针对特征相似度 CKA 与互信息随训练轮数单调下降的退化趋势,早期阶段稳定化(Early-Phase Stabilization, EPS)采取主动截断策略。在训练的最初探索阶段(例如总轮数的初段 \(\tau_{eps}\)),浅层卷积核自发学习到对频域高频噪声不敏感、注重全局边缘轮廓的先验表征,并在参数空间形成了曲率平缓的平坦极小值区域。EPS 在达到阈值轮数 \(\tau_{eps}\) 时,强制将浅层参数的梯度步长归零: $$ \forall t \ge \tau_{eps}, \quad \Delta \theta_s^{(t)} = 0 \implies \theta_s^{(t+1)} = \theta_s^{(\tau_{eps})} $$ 此时 \(\theta_s\) 被永久冻结在鲁棒性峰值状态,深层网络 \(\theta_d\) 则在后续训练周期内继续最小化分类损失。这种截断彻底消除了后期过拟合对浅层优良几何拓扑的破坏,且由于浅层在前向传播中无需计算梯度,还间接缩减了反向传播的计算与内存开销。
3. 非对称权重回退:历史鲁棒快照回滚与非对称学习率调控 若模型在前期未能及时截断或已经历较长周期的联合训练,非对称权重回退(Asymmetric Weight Reversion, AWR)提供了一种后验轨迹修复机制。借鉴彩票假说(LTH)中的参数回滚思想,AWR 在早期活跃探索阶段保存浅层参数的瞬时快照 \(S \leftarrow \theta_s^{(t_{early})}\)。当联合优化进行至干预轮次 \(t = \tau_{awr}\)(此时深层表征已获得相当的语义判别力),AWR 将浅层参数硬重置回历史鲁棒状态: $$ \theta_s^{(\tau_{awr})} \leftarrow \theta_s^{(t_{early})}, \quad \text{其中 } t_{early} < \tau_{awr} $$ 在完成状态回退后,为防止浅层权重重新滑入陡峭且脆弱的极小值,AWR 将浅层学习率非对称地抑制到微弱量级 \(\eta_s \leftarrow \eta_{fine}\)(通常设为 \(10^{-6} \sim 10^{-3}\)),仅允许其在平坦极小值邻域做极小范围微调;与此同时,深层网络维持正常学习率 \(\eta_d\) 快速对齐回滚后的底层特征。这种非对称更新使得网络既继承了深层的判别能力,又挽回了丢失的底层抗扰动拓扑。
损失函数 / 训练策略¶
模型在整个生命周期均以标准交叉熵损失 \(\mathcal{L}_{CE}\) 为基础优化目标,无需构建对比学习对或正则化约束项: $$ \mathcal{L}{CE} = -\sum(F(x_i; \theta_s, \theta_d))\right) $$ 基础训练策略采用带动量(0.9)的标准 SGD 优化器,基础学习率 } y_i \log \left(\text{Softmax\(\eta=0.1\),在特定 epoch(如 30、60)衰减 10 倍。对于 EPS,干预超参数仅为截断轮次 \(\tau_{eps}\);对于 AWR,快照轮次 \(t_{early}\) 设于探索活跃期(如第 5~10 轮),回滚轮次 \(\tau_{awr}\) 设于中期(如第 20 轮),回退后浅层精细调优学习率 \(\eta_{fine}\) 设定在 \(10^{-4}\) 量级。整个流程不依赖任何扰动图像参与训练,保持纯净数据端到端优化。
实验关键数据¶
主实验¶
在 ImageNet-C 自然扰动基准测试中,使用 ResNet-50 作为基础骨干,在不使用复杂数据增强的前提下与前沿优化约束方法和结构先验方法进行对比(评价指标为 Top-1 准确率,越高越好):
| 模型 / 方法 | 类别 | Top-1 Acc (%) | 相对 Baseline 增益 (%) |
|---|---|---|---|
| Standard Baseline | 经验风险基线 | 39.2 | - |
| DST | 动态稀疏演化 | 38.7 | -0.5 |
| AdaSAP* | 动态自适应先验 | 43.3 | +4.1 |
| EWS | 弹性权重显著性 | 40.6 | +1.4 |
| SAM | 锐度感知优化 | 39.8 | +0.6 |
| DAMP | 方向平滑优化 | 41.4 | +2.2 |
| DAT | 动态对抗微调 | 41.1 | +1.9 |
| VOneNet | 仿生初级视觉结构 | 40.3 | +1.1 |
| Gabor Layers | 手工频域滤波层 | 37.5 | -1.7 |
| EPS (本文) | 轨迹时域截断 | 42.5 | +3.3 |
| AWR (本文) | 非对称快照回退 | 43.1 | +3.9 |
| AWR* (本文+强增强) | 结合数据增强 | 46.5 | +7.3 |
在跨网络架构泛化性评估中,EPS 与 AWR 在卷积(MobileNetV2、WideResNet-50)、视觉 Transformer(MobileViT-S、EfficientFormer-L1)以及状态空间模型(MambaOut-femto)上均取得一致的平均扰动误差下降(Avg. mCE,越低越好):
| 网络骨干架构 | 策略 | IN-100 (Clean) | IN-100-C | IN-100-¯C | IN-100-3DCC | IN-100V2-C | Avg. mCE (↓) | 变化值 |
|---|---|---|---|---|---|---|---|---|
| MobileNetV2 | Baseline | 84.6 | 95.8 | 94.4 | 88.8 | 97.6 | 94.2 | 基线 |
| MobileNetV2 | EPS | 84.2 | 92.8 | 93.9 | 87.8 | 96.0 | 92.6 | -1.6 |
| MobileNetV2 | AWR | 84.2 | 93.4 | 94.1 | 87.8 | 95.6 | 92.7 | -1.5 |
| WideResNet-50 | Baseline | 85.6 | 88.3 | 88.4 | 83.3 | 92.1 | 88.0 | 基线 |
| WideResNet-50 | EPS | 84.9 | 72.6 | 83.1 | 72.5 | 80.5 | 77.2 | -10.8 |
| WideResNet-50 | AWR | 85.3 | 71.8 | 82.3 | 71.9 | 80.1 | 76.5 | -11.5 |
| MobileViT-S | Baseline | 85.4 | 88.8 | 92.5 | 84.8 | 92.9 | 89.8 | 基线 |
| MobileViT-S | EPS | 85.8 | 87.8 | 90.5 | 84.8 | 93.6 | 89.2 | -0.6 |
| MobileViT-S | AWR | 85.2 | 87.0 | 91.7 | 84.5 | 90.7 | 88.5 | -1.3 |
| EfficientFormer-L1 | Baseline | 91.6 | 73.7 | 66.3 | 65.2 | 80.4 | 71.4 | 基线 |
| EfficientFormer-L1 | EPS | 92.5 | 68.0 | 62.9 | 60.0 | 75.8 | 66.7 | -4.7 |
| EfficientFormer-L1 | AWR | 92.0 | 72.8 | 64.3 | 64.1 | 79.2 | 70.1 | -1.3 |
| MambaOut-femto | Baseline | 94.1 | 60.0 | 54.7 | 57.7 | 68.2 | 60.2 | 基线 |
| MambaOut-femto | EPS | 93.4 | 57.2 | 50.8 | 52.9 | 66.5 | 56.9 | -3.3 |
| MambaOut-femto | AWR | 93.1 | 58.5 | 52.8 | 55.0 | 67.3 | 58.4 | -1.8 |
消融实验¶
在与主流数据增强和正则化方案的叠加验证中,EPS 与 AWR 展现出良好的正交可叠加性,在 ImageNet-1K 及其变体上的综合表现如下:
| 基础技术配置 | 叠加策略 | Clean IN Acc (%) | IN-C mCE | IN-¯C mCE | IN-3DCC mCE | INV2-C mCE | Avg. mCE (↓) | 相对增益 |
|---|---|---|---|---|---|---|---|---|
| AugMix | None | 76.1 | 71.7 | 74.0 | 69.6 | 78.4 | 73.4 | 基线 |
| AugMix | EPS | 76.2 | 70.8 | 73.6 | 69.1 | 78.2 | 72.9 | -0.5 |
| AugMix | AWR | 74.1 | 68.9 | 75.1 | 69.1 | 76.4 | 72.4 | -1.0 |
| AutoAug | None | 76.4 | 73.2 | 76.9 | 69.6 | 79.8 | 74.9 | 基线 |
| AutoAug | EPS | 74.3 | 70.6 | 78.6 | 69.5 | 77.7 | 74.1 | -0.8 |
| AutoAug | AWR | 74.3 | 69.7 | 76.6 | 68.7 | 76.7 | 73.0 | -1.9 |
| CutMix | None | 76.9 | 76.9 | 76.4 | 72.5 | 82.5 | 77.1 | 基线 |
| CutMix | EPS | 74.3 | 73.4 | 76.9 | 72.4 | 79.9 | 75.7 | -1.4 |
| CutMix | AWR | 74.4 | 74.1 | 76.5 | 73.1 | 80.4 | 76.0 | -1.1 |
| Label Smoothing | None | 76.6 | 75.2 | 77.1 | 72.1 | 81.5 | 76.5 | 基线 |
| Label Smoothing | EPS | 74.5 | 72.7 | 77.7 | 71.8 | 79.3 | 75.4 | -1.1 |
| Label Smoothing | AWR | 74.7 | 72.6 | 77.0 | 71.9 | 79.3 | 75.2 | -1.3 |
| Dropout | None | 76.3 | 76.4 | 78.6 | 72.9 | 82.4 | 77.6 | 基线 |
| Dropout | EPS | 73.9 | 73.0 | 77.7 | 72.4 | 79.8 | 75.7 | -1.9 |
| Dropout | AWR | 74.0 | 74.1 | 78.8 | 73.0 | 80.6 | 76.6 | -1.0 |
下游密集预测任务迁移测试同样证明了鲁棒表征的跨任务通用性: - 目标检测(COCO-C):Faster R-CNN 的 mAP 从 17.5 提升至 17.9(+0.4);YOLOv5 的 mAP 从 19.9 显著跃升至 24.3(+4.4)。 - 语义分割(Cityscapes-C / ADE20K-C):DeepLabV3+ 在 Cityscapes-C 上的 mIoU 从 36.2 升至 39.9(+3.7);GCNet 在 Cityscapes-C 上从 33.1 升至 36.2(+3.1)。 - 动态在线测试时自适应(Online TTA):在 ImageNet-C 最高严重度 5 下,AdaCont 结合 AWR 准确率从 34.9% 提升至 37.5%(+2.6%),ROTTA 结合 EPS 从 32.6% 提升至 34.4%(+1.8%)。
关键发现¶
- 超参数鲁棒性强:EPS 截断轮次 \(\tau_{eps}\) 在 0 至 40 轮宽范围内均保持对 Baseline 的显著优势;AWR 的快照锚点 \(t_{early}\) 在 0 到 30 轮之间性能平稳,触发轮次 \(\tau_{awr}\) 最佳为第 20 轮,学习率 \(\eta_s\) 在 \(10^{-6}\) 到 \(10^{-3}\) 之间皆稳定有效。
- 地形平坦度与几何一致性:在局部最大损失变化量 \(\Delta L_{max}\) 和梯度范数 \(\|\nabla L\|\) 评测中,EPS 与 AWR 均有效抑制了曲率陡增;同时显著降低了受损样本在有效秩(Effective Rank)与内在维度(Intrinsic Dimension)上的表征漂移 \(\Delta\)。
- 形状偏好与频域滤波:Patch 打乱实验表明模型更依赖全局轮廓结构而非局部高频纹理;频域误差分布图证实中高频带的错误率被大幅压制。
亮点与洞察¶
- 颠覆性的动态视角:揭示了自然鲁棒性早在优化初期就已在浅层自然涌现而非不可获得的“鲁棒性消退”现象,打破了以往单纯依赖硬编码仿生先验或暴力数据扩增的思维定式。
- 极度轻量与无感迁移:EPS 和 AWR 均为纯优化调度策略,不需要额外前向分支、网络辅助损失或可学习参数,甚至因梯度反向传播截断节省了显存开销。
- 跨任务与跨机制的普遍兼容性:不仅在 CNN、ViT、SSM 等多种骨干架构上即插即用,还能直接赋能目标检测、语义分割、真实极端天气(ACDC)以及在线测试时自适应(TTA)。
局限与展望¶
- 浅层划分边界的经验性:论文将浅层子网络 \(\theta_s\) 经验性定义为 Stem 或 Stage-1 卷积层,对于非层级架构或深层交错式多尺度网络,最佳干预切分点仍需人工试探。
- 对高阶语义分布偏移的覆盖有限:作者在讨论中坦承,保存早期浅层先验主要抵御的是低级视觉畸变与频谱破坏,对于涉及概念关系、上下文语义变迁的复杂分布偏移(如 DomainBed 式的风格与环境巨变),仍需结合高层表征对齐机制。
- 未来可拓展至端到端自适应调度:可设计基于层间谱范数或梯度曲率自适应触发的动态截断/回退算法,避免固定超参数设定。
相关工作与启发¶
- vs VOneNet / 生物视觉架构: VOneNet 等方法通过在前端硬编码 Gabor 滤波器或 V1 皮层模块实现浅层鲁棒,破坏了端到端可学习性且引入特定算子约束;本文证明标准端到端训练在初期即可自发学习出同等优良的浅层滤波特性,通过简单的动力学干预即可锁定。
- vs SAM / DAMP 锐度感知优化: SAM 等全局平坦度优化方法在全参数空间寻找最坏扰动,计算成本翻倍(需两次前向-反向);本文发现平坦地形的根源主要在于浅层初始态,仅干预浅层轨迹便能实现同等平坦度收益且无计算倍增负担。
- vs 彩票假说 (LTH) / 权重回滚: LTH 通常用于剪枝后重新初始化以搜寻稀疏子网;本文创造性地将参数回滚拓展至浅层单侧动态干预,并配合非对称微小学习率,实现了抗扰动鲁棒性的无损召回。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统揭示浅层鲁棒性在训练初期的自发涌现与后期消退现象,选题与切入视角极具启发性。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖分类、检测、分割、在线 TTA、真实极端天气,消融实验深入到损失地形曲率、有效秩、频域误差及形状偏好。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑论证环环相扣,从经验观察、因果冻结实验到形式化干预设计结构严密清晰。
- 价值: ⭐⭐⭐⭐⭐ 零计算开销、无模型修改的通用训练策略,极易直接集成进工业界与学术界的现有视觉预训练流程中。