跳转至

Can Circuit Alignment Predict OOD Generalization?

会议: NeurIPS2026
arXiv: 2609.31996
代码: https://github.com/ayanban011/ACE
领域: 可解释性
关键词: 电路对齐、分布外泛化、图核、类别条件结构、模型排序

一句话总结

本文用同类电路跨域相似度减去异类电路相似度构造电路对齐分数(CAS),在不使用目标域数据的源域模型选择中取得 PACS 平均 Spearman 相关系数 0.88,但其 OOD 排名一致性依赖额外的单调性假设,并非完全无数据的权重诊断。

研究背景与动机

部署前选择一个能适应新域的分类器,往往比报告源域验证准确率更困难:不同模型在照片上都能识别对象,却可能在素描或卡通上失效。ATC、ProjNorm 和 ALine-D 可以利用未标注目标样本估计目标准确率,但目标分布尚未可见时,这类方法无法直接使用。CKA、SVCCA 和 RSA 则提供另一种看似自然的线索:若模型在不同源域的表征几何相近,其计算是否也更可能跨域稳定?

作者认为表征相似并不足以回答这个问题。两个模型可以产生相近的末层特征,却依靠不同的神经元和连接路径实现分类;域偏移改变这些路径时,聚合特征相似度未必能反映变化。同时,仅检查同一类别的路径是否稳定也不够:狗和马的电路若越来越相似,模型可能保留很高的同类相似度,却丢失类别区分能力。因此,需要把同类保持与异类纠缠分开测量,而不是把所有电路对混成一个平均数。

本文把机制可解释性中的类别电路用于模型选择,而非只解释某个预测。其实际输入包含已训练模型和带类别信息的源域样本:先抽取不同源域上的类别电路,再判断模型是否保持同类路径、同时避免不同类别路径混淆。核心 idea:以图结构比较类别电路,把同类跨域保持与异类跨域纠缠的差值作为 OOD 泛化的排序代理,并将估计误差与代理本身是否有效这两个问题分开分析。

方法详解

整体框架

CAS 不是一个新分类网络,也不是通过优化 CAS 直接提高准确率的训练目标。它接收候选分类器及多个源域,经过源域电路抽取、图核比较、类别分解评分和跨域聚合排序,输出模型排序以及类别级的脆弱性信息。目标域准确率只在实验评估中用于检查排序是否可靠,不进入源域 CAS 的计算。

实际电路由 ACE 抽取:冻结预训练骨干,在若干层加入适配器,并训练适配器和分类头;随后在各源域按类别执行激活干预。图核比较的是由干预得到的稀疏有向图,不是单独对最终预测或激活矩阵打分。下面是诊断流程,而不是网络的前向结构。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["候选模型与源域"] --> B["源域电路抽取"]
    Y["源域标签"] -.->|适配器训练与类别干预| B
    B --> C["图核比较"]
    C --> D["类别分解评分"]
    D --> E["跨域聚合排序"]
    E --> F["模型排序与类别诊断"]

关键设计

1. 源域电路抽取:通过干预定位类别相关的节点和连接

ACE 在骨干后部设置至少三个适配器位置,使电路能够包含跨层结构,而不仅是某层重要神经元的名单。适配器是带残差连接的两层瓶颈 MLP;CNN 和 MLP 电路主要包含适配器神经元,ViT 还包含冻结注意力子层的注意力头。由此得到的是所选计算单元的局部电路,不应理解为完整骨干所有计算路径的穷尽恢复。

对一个类别,ACE 先记录原始输出,再逐个将候选单元输出置零,计算该类别输出的平均变化。变化为正表示该单元支持此类别,为负表示抑制;选择按变化绝对值最大的 TopK,因此抑制单元也可能入选。节点重要性定义为:

\[ \Delta_{\ell}^{(u)}(k)=\mathbb{E}_{\mathbf{x}\sim\mathcal{D}_{k}}\!\left[\hat{y}_{k}(\mathbf{x})-\hat{y}_{k}\!\left(\mathbf{x}\mid\mathrm{do}(u=\mathbf{0})\right)\right]. \]

其中 \(\mathcal{D}_{k}\) 是源域中标签为 \(k\) 的样本集合。这一数据依赖非常重要:论文所称的权重导出预测,在当前实现中并不等于只读取参数文件而无需任何样本或标签。

随后,ACE 再干预较早层的入选单元,观察下一电路层入选单元的平均激活变化。绝对变化超过阈值 \(\epsilon\) 才建立有向边,边保留影响的正负号,节点保留重要性。ViT 分别估计注意力头之间和适配器神经元之间的跨层边,并没有在此步骤补出所有注意力—MLP 混合连接。

这种构图比激活相关性更接近“移除一个单元会改变什么”的问题,但仍受抽样、置零干预以及 TopK 离散选择影响。一次源节点干预可同时读取所有下游入选节点的变化,避免每条候选边都额外运行一次前向传播;随机候选子集还能减少大维度层的节点评分成本。

2. 图核比较:保留路径结构,而非只比较表征几何

把两个源域上同一模型的类别电路视作带节点和边属性的图,使用归一化图核 \(\kappa\) 计算相似度,取值范围为 \([0,1]\)。节点属性是干预重要性,边属性是因果影响权重;归一化使用两个图自相似度的几何均值,减少图自身尺度对比较的影响。

本文比较树形子结构核(TK)、随机游走核(RWK)和最优传输核(OT),默认使用 TK。TK 关注共享局部层次子结构,RWK 关注共同路径,OT 关注节点属性与结构的整体匹配。在作者的实验中,TK 更容易拉开同类与异类电路相似度,而不是让所有电路对都获得较高分数。

其理论动机是:仅经由激活嵌入计算的指标可能把源域行为相同、内部路径不同的电路视为相同。图比较为识别这种差异提供了信息,但“采用图核”不自动保证识别所有功能差异;具体核的辨别能力、节点标注及电路抽取质量仍是前提。

3. 类别分解评分:同类保持加分,异类纠缠减分

对于两个域,逐一比较类别电路得到 \(c\times c\) 矩阵,其中 \(c\) 是类别数。矩阵项 \(S_{ij}=\kappa(C_{1}^{(i)},C_{2}^{(j)})\):对角线比较同一类别在不同域的电路,非对角线比较不同类别在不同域的电路。对角线变低是电路漂移,非对角线变高是电路纠缠,这两种失效不应被全矩阵平均掩盖。

\[ \mathrm{CAS}(\mathcal{C}_{1},\mathcal{C}_{2})=\frac{1}{c}\sum_{i=1}^{c}S_{ii}-\frac{1}{c(c-1)}\sum_{i\neq j}S_{ij}. \]

两个项分别取均值而非直接求和,因此非对角项数量多不会仅因类别数量而压倒同类项。类别统一加权,使同时重命名类别不改变结果;适用该定义需要 \(c\geq2\)。分数位于 \([-1,1]\),相同电路族的自比较也未必为 1,因为异类电路可能共享结构。

公式直接确定了方向:同类相似度增加会提高 CAS,异类相似度增加会降低 CAS。正文第 4.3 节把这两个坐标单调方向写反了;这里依照式 (4) 与附录 B.2 的导数解释,保留对原文不一致的说明。对扰动强弱的保证仅覆盖同类相似度降低且异类相似度升高的可比较配置,不能推广成任意图变化都有正确的全序。

保留矩阵还有诊断价值:一个类别的低对角值提示其路径跨域不稳定,特定非对角高值提示哪两个类别的路径容易纠缠。这比一个最终准确率数字更具体,但平均 CAS 高并不意味着每个类别都满足作者定义的逐类鲁棒性阈值。

4. 跨域聚合排序:估计稳定性与 OOD 有效性分开成立

实际实验对所有源域对的 CAS 取平均,再用该分数排列 48 个学习器,与留一域测试的准确率排序比较。因此无需未标注目标样本,也无需目标标签;但需要多个可用源域,而源域间不变性是否覆盖未来目标域,仍依赖任务中的分布关系。

理论另定义域分布下的总体 CAS,用独立同分布抽取的 \(M\) 个域做 Monte Carlo 平均。对总体 CAS 不同的两个学习器,记分数差均值为 \(m_{ij}>0\)、域间差值方差为 \(\sigma_{ij}^{2}\),Chebyshev 不等式给出:

\[ p_{\mathrm{inv}}^{(M)}(\ell_i,\ell_j)\leq\frac{\sigma_{ij}^{2}}{M\,m_{ij}^{2}}=O\!\left(\frac{1}{M}\right). \]

这首先保证经验 CAS 排名趋近总体 CAS 排名,而不是直接保证 OOD 排名正确。分数差越小、域间波动越大,需要的域越多;总体分数相等的模型对也不在此非零间隔保证内。实际源域对共享域,不能不加说明就把它们视为理论中的独立域样本。

要把结果转成真实 OOD 排名,还必须采用 Assumption 1:\(g(\ell_i)>g(\ell_j)\Rightarrow\overline{\mathrm{CAS}}(\ell_i)>\overline{\mathrm{CAS}}(\ell_j)\),其中 \(g\) 是域分布下的期望准确率。作者明确没有从第一性原理证明这一有限准确率假设;观测到较高秩相关只说明近似支持,不能验证所有模型对的严格单调性。完美准确率的端点论证还依赖类别支持重叠与图核性质,也不能代替完整有限误差定理。

损失函数 / 训练策略

候选学习器来自 ERM、IRM、CORAL 和 DANN,分别使用交叉熵、IRM 梯度惩罚、域间协方差对齐及域对抗目标;CAS 自身是训练后诊断分数。主实验组合四种架构、四种目标与三种正则化:无正则、Dropout 0.3、权重衰减 \(10^{-4}\),共 48 个配置。

附录训练骨干冻结,仅更新适配器和分类头;默认瓶颈比 \(r=4\),上投影零初始化。训练 30 epochs,Adam 学习率 \(5\times10^{-5}\),每域 batch size 32;DANN 判别器学习率 \(10^{-4}\)。PACS 默认 \(K=30\)、边阈值 \(\epsilon=10^{-4}\),Office-Home 和 DomainNet 的优选 \(K\) 分别为 60 和 164;实验使用单张 NVIDIA A100 80GB。

这里需要区分两种预算:“CAS 聚合不再训练模型”不意味着整个 ACE 管线不训练或零成本。附录训练配置还列出 VGG19、Mixup,部分后续分析出现 Mixer/ViT-S,与主文四架构四目标清单不完全对应,不能据此扩大主实验的 48 个配置定义。

实验关键数据

主实验

下表依据正文表 2,指标均为模型排序与目标域准确率排序的 Spearman \(\rho_S\),不是分类准确率。PACS 有四个域、七个类别;每次使用三个源域,留第四域评估。

方法 Photo Art Cartoon Sketch 平均
ATC 0.65 0.54 0.62 0.51 0.58
ProjNorm 0.72 0.61 0.68 0.55 0.64
ALine-D 0.79 0.70 0.78 0.61 0.72
CKA 0.81 0.48 0.58 0.45 0.58
SVCCA 0.28 0.21 0.21 0.22 0.23
RSA 0.12 0.14 0.19 0.11 0.14
CAS (TK) 0.91 0.86 0.93 0.83 0.88

CAS 的 0.88 是四目标平均,图 2 的 0.93 是 Cartoon 单目标,不能互换。Sketch 上与下一最佳 ALine-D 的差值为 0.22。ATC、ProjNorm、ALine-D 使用未标注目标数据;ALine-D 使用完整 48 模型池,ProjNorm 每折额外训练两次,信息与计算预算并不相同。

正文表 3 另报告 CAS 的 MAE 为 2.14 个百分点,但 CAS 本身只定义排序代理,该处没有同等清晰地说明如何把分数校准成准确率,因此不将 MAE 当作无需校准的内生性质。附录图 10/J 把 Photo、Art、Sketch 相关值写为 0.93、0.91、0.88,与正文表 2 不一致;此处保留表 2 数值,未擅自合并。

消融实验

下表摘选附录 I 的 PACS 单参数消融;未变动项使用默认设置。OOD Acc 是原文表中报告的百分比,不应把随抽取参数变化的准确率直接解释为 CAS 评分提高了未修改分类器的能力。

配置 平均 CAS OOD Acc (%) \(\rho_S\)
默认:\(K=30,r=4,\epsilon=10^{-4}\) 0.38 77.83 0.88
\(K=5\) 0.12 68.41 0.71
\(K=164\) 0.44 78.19 0.83
\(r=1\) 0.31 78.52 0.80
\(r=16\) 0.48 75.30 0.82
\(\epsilon=10^{-2}\) 0.22 74.61 0.79
\(\epsilon=10^{-6}\) 0.41 78.02 0.82

关键发现

  • 保留更多节点不等于更好的预测:从 \(K=30\) 到 \(K=164\),平均 CAS 从 0.38 增至 0.44,但 \(\rho_S\) 从 0.88 降至 0.83。指标的绝对大小与同一模型池内排序质量不是同一个问题。
  • 窄适配器可人为抬高相似度:\(r=16\) 时 CAS 为 0.48,高于默认 0.38,但准确率和秩相关均更低。表达能力不足会掩盖域差异,所以跨配置比较必须控制抽取器容量。
  • 同域重抽取分析中,PACS 噪声差异均值为 0.096,观测跨域差异为 0.501,信号差异为 0.405,平均 SNR 为 4.22;47/48 个学习器的 SNR 大于 1。它支持信号不全由抽取噪声构成,但不是电路恢复无误的证明。
  • 源域数实验只覆盖 PACS/Office-Home 的 \(M\in\{1,2,3\}\) 与 DomainNet 的 \(M\in\{1,2,3,4,5\}\),每设置重复 10 次;有限区间趋势不能单独证明渐近定律。LoRA 连续域实验也只测试 SDXL 的 ArtPainting/Photo 风格权重 \(w\in[0,2]\),不是所有自然域偏移。

亮点与洞察

  • 类别结构是这个指标的关键,而不是“换一个更强相似度函数”。保留对角线与非对角线身份,才能区分同类漂移和异类纠缠,矩阵本身还提供可定位的诊断信息。
  • 分离估计一致性与代理有效性有助于理解理论。更多源域能够降低估计噪声,却不能修复一个本来就与目标准确率不单调的结构代理。
  • 抽取容量消融揭示了反直觉风险:计算路径无法表达域差异时,看起来也会很稳定。稳定性应与电路的任务充分性、重抽取可靠性联合报告,而非单独最大化 CAS。

局限与展望

  • Assumption 1 尚未证明;高相关并不等于严格单调,更不构成任意未知目标分布上的泛化保证。端点论证也需要支持重叠和核的功能辨别性质,不能从完美分类自动推出任意结构核都有统一分离间隔。
  • 当前实现需要源域样本、标签和适配器训练,且主要针对共享类别空间的分类。不能表述为完全无数据、适用于开放集或直接适用于语言生成的预测器。
  • ACE 局部节点选择、置零干预及边阈值都会影响分数。附录用同域重抽取估计噪声,但从任意图核差异做加性噪声扣除仍需额外统计条件,不应把扣除结果视作真实结构差异的直接观测。
  • 原文存在实验描述不一致:正文基线写为图嵌入,附录 D 写为末层特征;附录架构清单与主文不完全相同;PACS 图注与表 2 数字冲突。复现时需先统一输入对象和模型池,再比较数值。
  • 值得进一步检验同一训练目标内部的细粒度模型排序,并对源域重抽取和域采样共同给出排名置信区间。对分数间隔过小的模型输出“无法区分”,比强行给出严格排序更可靠。

相关工作与启发

  • vs CKA / SVCCA / RSA:这些指标主要衡量表征几何;CAS 比较类别电路图并显式惩罚异类相似。代价是需要额外干预与构图,且收益依赖所抽电路确实包含任务相关结构。
  • vs ATC / ProjNorm / ALine-D:这些方法利用未标注目标数据进行准确率估计;CAS 用源域间结构预测模型排序。前者直接观察目标分布,后者可用于目标尚不可见的选择场景,二者并非同信息预算的替代品。
  • vs ACE 等电路发现方法:抽取器回答哪些节点和边影响行为,CAS 回答这些电路跨域是否保留且保持类别区分。可延伸的研究方向是构造保持准确率但改变冗余路径的对照模型,检验 CAS 是否把无害重路由误判为 OOD 脆弱性;这只是待验证线索。

评分

  • 新颖性: 4/5。类别条件电路分解为 OOD 模型选择提供了不同于表征相似度的结构视角。
  • 实验充分度: 4/5。覆盖多个数据集、图核、抽取参数和噪声分析,但有限模型池及描述冲突限制了结论强度。
  • 写作质量: 3/5。方法定义清楚,但单调方向、输入协议和部分表图数值不一致需要澄清。
  • 价值: 4/5。适合作为目标域不可见时的辅助选择指标,不宜代替目标验证或安全保证。