Topology-Weighted Effective Rank: A Zero-Cost Proxy for Training Dynamics Stability in Deep Vision Networks¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Thiswycf/TER-Score
领域: 模型压缩
关键词: 神经架构搜索 (NAS), 零成本代理 (ZCP), 训练动态稳定性, 有效秩 (Effective Rank), 拓扑加权
一句话总结¶
针对传统零成本神经架构搜索代理忽视优化动态演化与网络拓扑异构性的痛点,本文提出基于特征相关矩阵有效秩的无训练代理指标 ER-Score,并结合有向无环图结构设计了拓扑加权变体 TER-Score,在多基准上实现了顶尖的架构排序一致性与极低搜索开销。
研究背景与动机¶
神经架构搜索(NAS)旨在摆脱人工设计深度神经网络的繁重试错,但在早期的强化学习或进化算法体系下,评估数以千计的候选网络需要消耗数千 GPU 天的昂贵训练开销。基于权重共享的单发(One-Shot)超网方法虽然缓解了算力瓶颈,却面临子网间梯度耦合与排序不公的固有困扰。近年来涌现的零成本代理(Zero-Cost Proxies, ZCPs)利用单次前向或反向传播提取参数范数、梯度方差或线性区域激活模式等统计量,在完全无需训练的前提下预估网络性能,极大加速了搜索流程。
然而,现有主流零成本代理存在两大根本局限。其一,大多方法仅依赖网络在初始化时刻的静态架构信号(如参数量、FLOPs、GradNorm 或突触流 SynFlow),或仅计算初始化瞬时的局部梯度曲率(如 NTK 条件数),未能真实刻画网络在反向传播与梯度下降过程中的训练动态演化行为。在实践中,深层网络的最终泛化性能深受优化稳定性、损失衰减速率与扰动敏感性的支配,静态度量极易在跨搜索空间或跨任务迁移时出现严重的排序失真。其二,现有代理普遍遵循“节点同质(Node-Homogeneous)”假设,机械地对各层或各算子的局部统计量进行简单求和或平均,忽略了在卷积神经网络(CNN)等有向无环图(DAG)结构中,处于不同深度、连接拓扑与信息汇聚枢纽位置的组件对整体表示能力的异构贡献。
本文从过参数化网络训练动力学理论切入,将无限宽极限下决定损失衰减速率的 Gram 矩阵特征谱理论,离散映射至各算子特征图的通道相关性矩阵上,提出衡量特征维度均衡度的有效秩指标 ER-Score,并进一步融合图论拓扑先验实现边级动态加权。核心 idea:将网络训练动态稳定性形式化为特征相关矩阵的谱熵有效秩度量,并依据计算单元在 DAG 中的拓扑信息流汇聚与扩散角色进行异构加权,构建零开销、数据无关且兼顾拓扑先验的架构评估代理 TER-Score。
方法详解¶
整体框架¶
TER-Score 的评估流程分为三个阶段:随机扰动输入前向传播、算子级特征相关矩阵有效秩计算、以及基于网络 DAG 的拓扑权重合成与聚合。对于给定的候选网络,系统仅需输入单批次无标注的随机高斯噪声,执行一次轻量前向传播即可截取各算子输出的特征图;随后提取特征图通道协方差矩阵并计算谱熵指数化有效秩(ER-Score);最后结合图论指标(PageRank 或度中心性)计算各连接边的拓扑重要性权重,加权求和得到最终的架构适应度分数。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["随机张量输入 (Gaussian / Uniform)"] --> Fwd["无需真实数据的随机微批次轻量化代理协议<br/>单次前向推理截取各边特征图 A_e"]
Fwd --> ER["基于有效秩的训练动态稳定性量化<br/>特征协方差特征谱熵指数化计算 ER(A_e)"]
DAG["CNN 单元 DAG 拓扑分析"] --> TW["面向 CNN 有向无环图的拓扑加权机制<br/>双向 PageRank / 路径加权计算边权重 w_e"]
ER --> TER["拓扑加权有效秩评分 (TER-Score)<br/>归一化加权聚合 ∑ w_e ER(A_e)"]
TW --> TER
TER --> Downstream["下游神经架构搜索与选优 (进化算法 / 性能预测)"]
关键设计¶
1. 基于有效秩的训练动态稳定性量化:从 Gram 矩阵谱分析到局部特征相关性
针对静态参数指标无法反映梯度优化动态的痛点,该设计借鉴了过参数化神经网络动力学理论:在无限宽极限下,网络输出演化遵循微分方程 \(\frac{d\mathbf{u}(t)}{dt} = \mathbf{H}(t)(\mathbf{y} - \mathbf{u}(t))\),且瞬时 Gram 矩阵 \(\mathbf{H}(t)\) 快速收敛于稳态核 \(\mathbf{H}^\infty\)。由于损失函数残差衰减直接由 \(\mathbf{H}^\infty\) 的特征值谱决定,特征值分布越宽且越平坦均衡,网络在各正交梯度方向上的收敛态势越稳定。鉴于全网 \(\mathbf{H}^\infty\) 计算复杂度极高,方法利用卷积层在空间维度展开后等价于多样本通道全连接层的性质,对第 \(l\) 个模块输出的特征图 \(\mathbf{A}_l \in \mathbb{R}^{h_l \times w_l \times c_l}\) 展平为二维矩阵 \(\mathbf{A}'_l \in \mathbb{R}^{(h_l w_l) \times c_l}\),构造通道自相关矩阵: $\(\mathbf{C}_l = \frac{1}{h_l w_l} (\mathbf{A}'_l)^\top \mathbf{A}'_l \in \mathbb{R}^{c_l \times c_l}\)$ 对正半定矩阵 \(\mathbf{C}_l\) 进行特征分解得到特征值序列并归一化为概率分布 \(\tilde{\lambda}_{l, i} = \lambda_{l, i} / \sum_j \lambda_{l, j}\),进而通过谱熵的指数映射定义单模块有效秩: $\(\mathrm{ER}(\mathbf{A}_l) = \exp\left(-\sum_{i=1}^{c_l} \tilde{\lambda}_{l, i} \log \tilde{\lambda}_{l, i}\right)\)$ 该指标具有严格的尺度不变性,度量了特征能量在通道正交基上的利用充分程度。实验表明,初期 ER-Score 较高的架构在后续多步梯度更新中展现出极低的余弦相似度波动,切实保障了训练动态的平稳性。
2. 面向 CNN 有向无环图的拓扑加权机制:打破节点同质性假设
针对传统代理将所有计算节点等同视之、无法区分架构拓扑关键瓶颈的缺陷,设计将 CNN 单元结构显式建模为有向无环图 \(G=(V, E)\)。利用决策树杂质回归分析可证实,不同拓扑位置的算子特征对网络准确率的决定性影响呈现出显著的异质性。为此,设计提出了四种结构感知加权策略,将拓扑先验映射到特征传递边 \(e=(u, v) \in E\) 上: - 度中心性加权(Degree):基于节点入度 \(k^{in}_v\) 与出度 \(k^{out}_u\) 赋予边权重 \(w_e = k^{in}_v + k^{out}_u\),强化高交互节点的连接。 - 连通路径加权(Connectivity):计算源节点 \(s\) 到 \(u\) 的路径数 \(c_{su}\) 与 \(v\) 到汇节点 \(t\) 的路径数 \(c_{vt}\),设 \(w_e = c_{su} \times c_{vt}\),突出信息传输主干。 - 最短路径加权(Shortest-Path):采用 Dijkstra 测定极值端点距离,设 \(w_e = ((1 + d_{su})(1 + d_{vt}))^{-1}\),惩罚处于拓扑边缘的孤立长链。 - 双向 PageRank 加权(PageRank):在原始 DAG 与反向 DAG 上分别迭代求解稳态分布向量 \(\boldsymbol{\pi}^*\) 与 \(\boldsymbol{\pi}'^*\),综合衡量信息聚合与特征扩散能力,赋予边重要性 \(w_e = \pi^*_e \times \pi'^*_e\)。
将各边计算得到的拓扑权重进行归一化(\(\sum_{e \in E} w_e = 1\)),与对应算子特征图的有效秩相乘求和,即构建出拓扑加权评分: $\(\mathrm{TER}\text{-}\mathrm{Score} = \sum_{e \in E} w_e \mathrm{ER}(\mathbf{A}_e)\)$ 该策略尤其在区隔前 \(10\%\) 的顶尖精英架构(Elite Architectures)时展现出极高的折扣累积增益(nDCG)。
3. 无需真实数据的随机微批次轻量化代理协议:解耦语义内容与算力约束
针对传统代理易受训练集特定图像分布干扰且预处理耗时的痛点,设计对输入扰动源与空间分辨率进行了系统性解耦探索。实验发现,向网络馈入真实自然图像反而会削弱代理与最终精度的斯皮尔曼秩相关性,而输入标准高斯分布 \(\mathcal{N}(0, \mathbf{I})\) 或均匀分布 \(\mathcal{U}[-1, 1]\) 的纯随机噪声张量能够产生无偏且高维的拓扑激发响应,最为纯粹地暴露出网络结构本身的动力学平稳性。此外,适度下采样特征图空间分辨率不仅不损害通道相关矩阵的奇异谱分布,还避免了局部空间冗余,使得单个架构的协方差分解与有效秩评估可在毫秒级内完成,极大压低了 NAS 搜索空间遍历的时间成本。
损失函数 / 训练策略¶
作为零成本代理(Training-Free Proxy),TER-Score 本身不引入任何参数微调或梯度更新。在评估任意候选网络架构时,随机初始化模型权重 \(W \sim \mathcal{N}(0, \mathbf{I})\),固定批归一化(BatchNorm)层的运行统计量,输入单批随机张量(默认采用中等分辨率的高斯分布随机噪声,Batch Size 设为 32 或 64),仅执行单次前向传播收集各边缘特征图。在下游搜索阶段,TER-Score 直接接入常规遗传/进化算法(Evolutionary Algorithm),以 TER-Score 作为个体适应度函数驱动变异与交叉迭代。
实验关键数据¶
主实验¶
评估涵盖 NAS-Bench-201、NAS-Bench-301 以及 DARTS 搜索空间,并在 ViT-Bench-101 验证跨模型架构通用性。在 DARTS 空间中结合进化搜索完成发现后,对选出架构进行从头全量训练,对比主流传统 NAS 与顶尖零成本方法。
| 搜索空间 / 任务 | 评估指标 | 本文 (TER-Score) | 最佳对比方法 (AZ-NAS / SWAP) | 提升 / 收益 |
|---|---|---|---|---|
| DARTS / CIFAR-10 全训 | 测试错误率 (%) | 2.41% | 2.48% (SWAP-NAS) | 降低 0.07% |
| DARTS / ImageNet-1k 全训 | Top-1 错误率 (%) | 23.55% | 23.70% (AZ-NAS) | 降低 0.15% |
| DARTS / 搜索开销 | GPU 消耗 (GPU Days) | 0.09 天 | 0.06 天 (AZ-NAS) / 4.0 天 (DARTS) | 相比传统 DARTS 提速 44 倍 |
| ViT-Bench (AutoFormer-C100) | 斯皮尔曼秩相关系数 (%) | 95.36% | 63.87% (Auto-Prox) | 提升 +31.49% |
| ViT-Bench (PiT-Flowers) | 斯皮尔曼秩相关系数 (%) | 96.33% | 92.94% (Auto-Prox) | 提升 +3.39% |
| ViT-Bench (PiT-Chaoyang) | 斯皮尔曼秩相关系数 (%) | 76.14% | 55.09% (Auto-Prox) | 提升 +21.05% |
消融实验¶
消融实验围绕单批次输入张量的分布类型、空间分辨率设置以及不同拓扑加权策略的有效性展开分析。
| 配置维度 | 实验设定 | 斯皮尔曼相关性表现 / 影响 | 核心机制说明 |
|---|---|---|---|
| 输入数据分布 | 高斯噪声 \(\mathcal{N}(0, \mathbf{I})\) | 最佳相关性 (基准) | 无偏随机扰动激发纯粹的网络拓扑表征能力 |
| 输入数据分布 | 均匀噪声 \(\mathcal{U}[-1, 1]\) | 与高斯分布性能持平 | 保持特征谱平坦扰动,不受语义统计量偏置 |
| 输入数据分布 | 真实图像数据集输入 | 相比噪声输入出现明显下滑 | 真实样本语义分布削弱了对底层架构动力学的纯粹性探测 |
| 输入数据分布 | 全 1 常数输入 (All-one) | 性能剧烈退化 | 无法产生通道方差,协方差矩阵秩严重崩溃 |
| 输入空间分辨率 | 中等分辨率 (Medium) | 综合性能最优 | 既保留了充分的通道间结构信息,又排除了局部冗余 |
| 输入空间分辨率 | 低分辨率 (Low) / 高分辨率 (High) | 低分略降 / 高分计算冗余且相关性见顶 | 证实了无需全尺寸图像即可精确捕获谱熵 |
| 拓扑加权策略 | PageRank (P.R.) 加权 | 精英架构辨识度 (nDCG) 最佳 | 兼顾特征聚合与扩散,在进化搜索中收敛最稳 |
| 拓扑加权策略 | 无加权等权重 (ER-Score) | 基础表现稳健,但顶尖筛选偏弱 | 验证了融入网络 DAG 拓扑异构权重的绝对增益 |
关键发现¶
- 拓扑信息流的非对称价值:在四种图加权策略中,PageRank 和度中心性加权在下游任务和精英辨识度上明显优于最短路径加权。这表明网络并非越靠近输入输出越重要,而是具备高度信息汇聚与分发潜力的枢纽节点(Hubs)对训练平稳性起决定作用。
- 消除参数量虚假偏置:现有部分代理(如 GradNorm、SynFlow)在进化搜索中容易陷入偏向庞大参数量架构的陷阱,导致在小规模数据集(如 CIFAR-10)上出现“越搜越差”的负优化退化。TER-Score 依靠通道有效秩的内生归一化属性,在整个搜索轨迹中展现出单调上升的准确率与极小的方差。
- 跨架构模态的普适扩展:虽然拓扑加权策略针对 CNN 单元的 DAG 设计,但基础 ER-Score 展现出强大的模型无关性;当迁移至 ViT-Bench-101 的 Transformer 搜索空间时,其在图像蒸馏精度上的秩相关系数在 AutoFormer 与 PiT 上均突破 \(95\%\),显著超越此前专属设计的 TF-TAS 和 Auto-Prox。
亮点与洞察¶
- 训练动态的低成本可观测化:将抽象的过参数化梯度下降动力学 Gram 矩阵收束为单层特征图协方差矩阵的有效秩,以极低的线性代数分解开销架起了理论动态与无训练评估之间的桥梁。
- 图拓扑理论赋能架构评估:创造性地将有向无环图的 PageRank 稳态概率引入神经架构权重分配,打破了以往 ZCP 无脑全网平均的粗糙逻辑,为网络结构的异质性解析提供了可解释的形式化工具。
- 零成本代理的纯粹性:证实了随机噪声扰动在评估训练动态时优于真实图像,不仅彻底消除了数据加载开销与隐私顾虑,更为打造与训练数据完全解耦的通用超轻量评估器提供了新范式。
局限与展望¶
- 拓扑加权策略具有启发式经验色彩:作者承认,现阶段引入的度中心性与 PageRank 加权属于图论经验启发,尚未给出关于为何特定图指标严格等价于泛化界的最优数学证明。
- Transformer 拓扑建模的缺失:目前的 TER-Score 拓扑加权仅适配于具有清晰显式 DAG 拓扑的 CNN 单元搜索空间,无法直接迁移到无分支或密集全连接的 Vision Transformer 拓扑中;未来可探索基于自注意力交互图或 Token 传输图的拓扑加权推广。
- 极端轻量化量化网络的敏感性:对于涉及极低比特(如 1-bit / 2-bit)量化或剪枝网络的极端压缩场景,激活值的截断可能引起有效秩的伪饱和,该指标的边界表现仍有待进一步压力测试。
相关工作与启发¶
- vs TE-NAS [6]: TE-NAS 依赖初始化时刻神经正切核(NTK)的条件数与线性区域数,但单点 NTK 条件数计算复杂度高且无法反映训练动态演变;TER-Score 绕过昂贵的全网核矩阵,用局部特征有效秩直接逼近动力学谱衰减,速度更快且相关性更稳。
- vs ZiCo [23]: ZiCo 关注初始梯度的逆变异系数(ICV)以表征优化景观平坦度,但其本质仍是粗粒度的标量梯度统计;TER-Score 深入至特征表示空间的通道主成分分布,度量维度更细致。
- vs ParZC [10]: ParZC 注意到了节点同质性的缺陷,但仅采用简单的正弦位置编码进行权重拟合;TER-Score 直接依据网络计算图的真实拓扑连接(如 PageRank 和路径拓扑)进行确定性建模,可解释性与普适性更强。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [从训练动力学 Gram 矩阵谱平坦性导出特征有效秩,并首次系统引入 DAG 图论拓扑加权,理论与启发机制兼备]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 CNN (NB201/NB301/TNB) 与 ViT (ViT-Bench) 跨任务跨模态评测,含完备的全训与进化搜索验证]
- 写作质量: ⭐⭐⭐⭐⭐ [动机叙述层层递进,数学推导与实验论证严谨自洽,图表信息充实]
- 价值: ⭐⭐⭐⭐☆ [代码开源,为轻量化 NAS 与零成本网络架构筛选提供了极具工业实用价值的超低延迟工具]