Spectral Reversal: Counteracting Singular Value Bias for Graph Prompting¶
会议: NeurIPS2026
arXiv: 2609.32143
代码: https://github.com/keris-yang/Spectral-Reversal
领域: 图学习
关键词: 图提示学习、奇异值偏置、谱反转、零空间、少样本适配
一句话总结¶
SRP 在冻结 GNN 的各层用奇异值软掩码优先读取弱方向,并用零空间 PCA 补充被原权重丢弃的特征,再把低秩提示加到聚合后的激活上;在 GraphCL 预训练的 5-shot Cora 上达到 68.11% 准确率,但并非所有数据集都优于最强基线。
研究背景与动机¶
图提示学习希望不重训整个图神经网络(GNN),只增加少量参数就适配下游任务。GPF 主要改变节点特征,EdgePrompt 在边层面加提示,GraphPrompt 调整读出,而这些方案通常没有显式利用冻结权重的内部几何结构。本文把问题转向另一个层面:预训练得到的权重,究竟把哪些输入方向变成了强输出,又让哪些方向几乎无法影响表示?
作者认为,自监督预训练会把容量集中到经常出现的变化方向;图传播进一步改变训练特征的协方差,使这种不均衡更明显。然而,下游类别所需要的特征并不必然沿着大奇异值方向。小奇异值方向仍然可达,只是原变换对它们响应弱;精确零空间则不同,落在其中的输入在该冻结线性变换后完全消失。于是,仅在冻结表示后训练分类头,既可能需要很大的系数来补偿弱方向,也无法恢复真正被抹掉的方向。
本文不把弱方向全部视为噪声,而是给它们一个绕过原变换的读取入口。这里的“谱”首先指权重矩阵的奇异谱,而不是图拉普拉斯的 Fourier 频率;两者通过数据和传播产生联系,但不是同一根坐标轴。核心 idea:依据冻结权重的奇异几何分配提示容量,让弱奇异方向与零空间信息共同形成聚合后注入的提示,而不是继续优先读取预训练最强的方向。
方法详解¶
整体框架¶
输入仍是图结构和节点特征,输出仍是节点或图的分类结果。SRP 保留原 GNN 的消息传递分支,在每层增加依赖当前输入特征的提示分支:先准备冻结谱基,再做谱反转,最后把谱通道与零空间通道映射到共享瓶颈、融合并投影到该层输出维度。
下图中的 Frozen bases 是离线准备,Spectral reversal 和 Prompt fusion 是训练及推理时的提示路径。监督标签只用于下游分类损失,不参与 SVD 或零空间 PCA;训练更新适配器与阈值,而推理使用训练好的参数。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
W["Frozen weights + static features"] -->|offline SVD and null-space PCA| B["Frozen bases"]
H["Current layer features"] --> R["Spectral reversal"]
B -->|singular basis and values| R
B -->|null-space basis| F["Prompt fusion"]
H -->|null coordinates or fallback input| F
R -->|masked spectral coordinates| F
H --> G["Frozen aggregation"]
F --> O["Add prompt and activate<br/>node or graph prediction"]
G --> O
Y["Training labels"] -.-> L["Classification loss"]
O -.-> L
L -.->|train adapters and threshold only| R
L -.-> F
理解 SRP 前,需要区分它的诊断量与实际训练规则。作者用原始特征上的下游线性分类器权重衡量需求,对非零奇异方向定义 \(\mathrm{DPMS}_{j}=\|W_{\mathrm{down}}^{\top}v_j\|_2^2/\sigma_j^2\)。分子是下游分类器在该方向上的权重能量,分母是冻结变换的响应能量;比值大,意味着下游需要这一方向,但预训练提供的响应较弱。
作者还按冻结权重的非零奇异值降序分成五组,定义 \(\Delta_q=\frac{\sum_{j\in Q_q}\|W_{\mathrm{down}}^{\top}v_j\|_2^2}{\sum_j\|W_{\mathrm{down}}^{\top}v_j\|_2^2}-\frac{\sum_{j\in Q_q}\sigma_j^2}{\sum_j\sigma_j^2}\)。正值表示该组的需求占比高于容量占比;第一组是最大奇异值组,第五组是最弱的非零方向组,精确零方向单独处理。这个分组由冻结权重决定,不由下游分类器决定。
DPMS 用于解释失配,不是 SRP 必须先训练一个额外下游分类器才能运行的步骤。实际掩码读取的是奇异值,并通过下游监督学习阈值;小奇异值也不自动意味着高需求,因为 DPMS 的分子同样重要。
关键设计¶
1. Frozen bases:把可达方向与被丢弃方向分开准备
对每层冻结权重做紧凑 SVD,记 \(W=U\Sigma V^{\top}\),右奇异向量给出该层输入特征空间内的可达方向。原特征沿这些方向的坐标可以送入谱通道;其正交补由 \(P_{\mathcal N}=I-VV^{\top}\) 描述,是真正的右零空间投影。不能把“很小但非零”与“精确为零”混为一谈:前者可经线性头恢复,后者在单个冻结线性变换中无法恢复。
SRP 在零空间投影后的数据上做 PCA,只保留其中方差最大的若干方向,再交给独立适配器。这样不是把整个高维零空间全部变成可训练参数,而是在被冻结变换忽略的区域内先提取数据相关的低维基。附录 B.3 的最优性针对保留投影数据方差,不是最大化类别判别力;高方差是否有用,仍需要实验和下游监督验证。
SVD 基和 PCA 基都被冻结。附录 D 描述的具体两层实现是在第一层静态原始特征上离线计算零空间 PCA,后层使用投影回退路径,并不需要每次训练都重新计算 PCA。第一层静态输入的基投影可以缓存,但加入前层提示以后,后层隐藏特征会随训练变化,不能把所有层的特征投影一概宣称为可永久缓存。
原文的零空间基符号存在转置问题:第 5.2 节先把基写成按行存储的矩阵,随后部分乘法却按列基使用;谱适配器也出现行列约定混用。此处保留“先投影到互补子空间,再映射到瓶颈”的机制,不把这些不一致式子当作可直接实现的精确维度说明。
2. Spectral reversal:给弱方向更大的相对读取权重
谱通道先把当前输入投影到右奇异向量基,再用一个可学习标量控制谱切分位置。其核心规则为 \(\tau=\operatorname{sigmoid}(\tau_0),\quad\mu_j=\operatorname{sigmoid}((\tau\sigma_{\max}-\sigma_j)\gamma)\)。当温度系数为正时,小于切分点的奇异值获得较大的掩码,大奇异值获得较小的掩码;温度系数决定边界软硬程度,而阈值决定边界位置。
这里没有逐方向直接乘逆奇异值,也没有把每个弱坐标乘以大于 1 的增益。掩码始终处于 0–1,所以“增强弱方向”的准确含义是相对优先保留它们、让可训练适配器更多地使用它们。最终提示强度还由适配器和输出投影共同决定。掩码的可微性使阈值可以随分类损失优化,而不用事先指定保留哪些非零方向。
这也不同于直接修改冻结权重的奇异值。SRP 只筛选提示分支读入的坐标;原消息传递分支仍保留其原有响应。添加提示后,整体表示可能发生补偿、增强或抵消,但不是仅凭掩码就能断言原 backbone 的强方向必然被削弱。
3. Prompt fusion:用互补输入生成聚合后的低秩提示
两个通道各自将坐标映射到同一个低维瓶颈,再相加、做输出投影,并带一个提示偏置。采用附录 C.6 的行特征记法,整体提示为 \(p(H)=[(HV\odot\mu)A_s+(HN)A_n]Q+b_p,\quad\operatorname{col}(N)\subseteq\ker(W)\)。这里的两个输入子空间互补,但共享瓶颈和输出投影仍然可以压缩信息;不能从输入子空间正交推出融合后对任意输入都无损。
提示加在邻居聚合完成后、非线性激活之前,且当前层不会再次用传播算子过滤该提示。因此,它可以补充原消息传递路径在这一层未保留的节点局部变化。下一层仍然会继续传播,所以这个旁路并不是整网都不受平滑影响的保证,也不能把一个弱权重奇异方向直接称为高图频方向。
当输入维度不大于可达维度加所设 PCA 维度时,零空间已经很小或为空,SRP 改用投影回退。对行向量输入,其重加权表示为 \(h_{\mathrm{weak}}=h-(hV\odot(1-\mu))V^{\top}\),再经单个低秩适配器生成提示。这等价于在原输入空间中保留掩码后的可达部分和完整零空间部分,而不是继续做不必要的 PCA。
附录 B.5 的代数等价需要零空间基覆盖整个零空间,且适配器是相应的线性映射;它说明回退与这种完整双通道参数化具有相同函数空间,不证明经过瓶颈压缩的信息可以全部重建。输入维度很小时,方法的收益更多来自谱选择,而不是额外发现一个大零空间。
一个完整示例¶
以 Cora 的第一层为例:原始特征有 1,433 维,附录给出的隐藏维度是 128,报告的右零空间维度为 1,305。节点的输入既有冻结权重能读取的部分,也有这 1,305 维空间中的分量;直接训练冻结输出上的分类头无法把后者重新找回来。
SRP 先离线在零空间投影后的 Cora 特征上选择 PCA 基。训练时,同一个节点沿右奇异向量的坐标经过反向掩码和谱适配器,沿 PCA 基的坐标经过零空间适配器;两路在共享瓶颈融合,得到 128 维提示,加入冻结聚合结果后再激活。监督梯度只调整提示参数,而不是改变原有 SVD 基或原 GNN 权重。
后层输入已经是隐藏表示,零空间往往更小,于是使用投影回退。这个例子解释了高维节点特征为什么提供较大的补充空间,但不能据此断言所有 1,305 个零空间方向都有标签信息,也不能只用节点数大小解释收益。
损失函数 / 训练策略¶
下游任务使用分类监督优化提示参数,并保持预训练 GNN 冻结。可训练部分包括谱与零空间适配器、共享输出投影、提示偏置及各层阈值;回退层则训练其低秩适配器。没有额外的 DPMS 损失或通过标签训练 PCA 的过程。
主实验使用 GraphCL 和 SimGRACE 两种预训练策略,节点分类为每类 5-shot,图分类为每类 50-shot,结果汇总五个随机种子。附录的跨骨干实验沿用主实验少样本设置并报告五次运行均值与标准差。缓存没有完整列出优化器、学习率和预训练 epoch,不能补成一套未经来源支持的复现配方。
第 6.4 节和附录 C.1 给出的默认瓶颈与 PCA 维度分别是 32 和 16,附录 C.2 表示所有数据集使用温度系数 10;但附录 D.2 又把默认瓶颈与 PCA 维度写成 8 和 64。这是原文配置冲突,不能自行选择一套并宣称全部表格均用该配置。
理论支撑要按条件理解:可达性残差结论针对冻结线性变换加线性分类头;梯度集中结论需要输入集中和跨步项消失等假设,附录的期望版本又增加独立性讨论。PAC-Bayes 推导还依赖先验、后验与参数范数控制,不能直接视为实际非线性、多层 SRP 必然优于全量微调的证明。
实验关键数据¶
主实验¶
下表摘录原文表 1–2。指标是准确率(%),数值为五个种子的均值 ± 标准差;“最强对照”按同一预训练、同一数据集内的最高基线均值选择,差值为百分点,不代表统计显著性。
| 预训练 | 任务与数据集 | SRP | 最强对照 | 均值差 |
|---|---|---|---|---|
| GraphCL | 节点,Cora,5-shot | 68.11 ± 2.29 | GraphLoRA,63.35 ± 4.32 | +4.76 |
| GraphCL | 节点,CiteSeer,5-shot | 49.02 ± 2.26 | EdgePrompt+,46.20 ± 0.99 | +2.82 |
| GraphCL | 节点,ogbn-arxiv,5-shot | 24.75 ± 1.79 | GraphLoRA,23.26 ± 1.89 | +1.49 |
| GraphCL | 节点,Flickr,5-shot | 26.39 ± 2.11 | GraphPrompt,26.08 ± 3.44 | +0.31 |
| SimGRACE | 节点,Cora,5-shot | 67.24 ± 7.31 | GraphLoRA,63.06 ± 3.64 | +4.18 |
| SimGRACE | 节点,Flickr,5-shot | 28.48 ± 3.26 | EdgePrompt,30.12 ± 5.04 | −1.64 |
| GraphCL | 图,ENZYMES,50-shot | 36.32 ± 2.65 | GraphLoRA,36.05 ± 1.89 | +0.27 |
| GraphCL | 图,NCI109,50-shot | 68.18 ± 0.55 | EdgePrompt+,66.52 ± 0.91 | +1.66 |
| SimGRACE | 图,NCI1,50-shot | 66.53 ± 2.94 | EdgePrompt+,67.07 ± 1.96 | −0.54 |
| SimGRACE | 图,Mutagenicity,50-shot | 68.92 ± 2.73 | EdgePrompt+,68.31 ± 1.36 | +0.61 |
GraphCL 下主表十个数据集的 SRP 均值都最高;SimGRACE 下并非如此,Flickr 和 NCI1 是明确例外。原文概括“几乎都最佳或次佳”也不应读成严格排名结论:SimGRACE 的 Flickr 中 EdgePrompt、EdgePrompt+ 都高于 SRP。
消融实验¶
原文表 3 只展示 Cora 和 CiteSeer,不支持把该表结论直接扩大到全部十个数据集。这里沿用其一位小数精度及作者报告的双数据集平均差值。
| 配置 | GraphCL Cora | GraphCL CiteSeer | 平均差 | SimGRACE Cora | SimGRACE CiteSeer | 平均差 |
|---|---|---|---|---|---|---|
| SRP 完整模型 | 68.1 ± 2.3 | 49.0 ± 2.3 | 0.0 | 67.2 ± 7.3 | 51.4 ± 5.2 | 0.0 |
| SRP-NM,去掉零空间通道 | 63.4 ± 2.8 | 41.1 ± 3.8 | −6.3 | 60.3 ± 5.9 | 43.5 ± 2.9 | −7.4 |
| SRP-NS,去掉谱通道 | 64.4 ± 2.1 | 45.6 ± 3.2 | −3.6 | 63.5 ± 6.6 | 47.7 ± 4.3 | −3.7 |
| SRP-NR,全方向掩码为 1 | 64.7 ± 2.7 | 48.0 ± 4.0 | −2.2 | 63.4 ± 4.4 | 49.9 ± 4.9 | −2.7 |
| SRP-Bi,双端加权 | 64.7 ± 3.3 | 47.9 ± 3.3 | −2.3 | 63.0 ± 4.5 | 50.0 ± 4.8 | −2.8 |
去掉零空间通道的损失最大,尤其是 GraphCL 的 CiteSeer,从 49.0 降到 41.1。取消反向选择也有下降,但没有去掉整个零空间通道那么大,说明“选择弱方向”和“补回原变换看不到的信息”是两种互补收益。
附录表 8 进一步固定所选方向数量,排除“只是降维有效”的解释。以下为五种选择策略的准确率均值;这些数值来自额外实验,保留其自身精度,不用它们替换主表。
| 数据集 | 强方向 | 随机方向 | 弱方向 | 硬阈值 STE | 软阈值,温度 10 |
|---|---|---|---|---|---|
| Cora | 64.25 | 64.44 | 67.80 | 67.95 | 68.10 |
| CiteSeer | 47.10 | 47.46 | 48.78 | 48.90 | 48.99 |
| NCI1 | 66.42 | 66.45 | 66.87 | 66.89 | 66.80 |
关键发现¶
- 同数量下弱方向优于强方向和随机方向,支持谱选择确实有作用;但软阈值不是每个数据集都优于硬阈值,NCI1 是反例。
- 温度从 0.001 增到 10 时,Cora 从 64.55 到 68.10,CiteSeer 从 47.64 到 48.99;过软掩码接近统一读取,失去方向区分。
- 附录表 6 的 GraphGPS/Graphormer 共八组中 SRP 有六组均值最高;Graphormer 的 NCI1 和 ENZYMES 分别低于 GraphLoRA 0.82 和 0.75 个百分点,不能宣称跨骨干全部获胜。
- 异配图扩展中,相对 GraphLoRA,Cornell、Squirrel、Chameleon 分别提高 6.11、2.06、2.15 个百分点;这是三个额外数据集的证据,不是普遍异配图保证。
- 附录表 10 中 SRP 在六个数据集的五个上每 epoch 比 GPF 快,但 ENZYMES 是 0.292 秒对 0.221 秒,反而更慢;离线 PCA 初始化不包含在这个吞吐比较里。
亮点与洞察¶
- 提示方向比参数数量本身更值得设计。SRP 不只限制低秩预算,还用冻结权重的几何结构决定提示从哪些输入方向读取信息。
- 零空间不是输出表示中的弱激活维度,而是输入中被某个权重消去的方向。直接旁路读取它,和在已有输出上调整分类头有本质区别。
- 匹配选择数量的实验比单纯“去掉掩码”更能区分机制。它提示可迁移的研究路线是比较相同预算下的强、弱、随机子空间,而不是只报告全量适配与小适配器的差距。
局限与展望¶
- 全局阈值和共享奇异基无法随图区域、实例自适应;同一个特征方向在不同区域或不同图上可能承载不同图频特性。
- 零空间收益依赖输入维度与权重秩。低维、满列秩输入下这一补充通道可能为空,而 PCA 的高方差方向也未必是下游判别方向。
- 原文的“融合无损”表述过强,且正文部分矩阵转置不一致;附录关于 PCA 基唯一性的说法也需要特征值间隔等条件,不能把方差最优误读为无条件唯一或分类最优。
- 默认超参存在 32/16 与 8/64 的冲突,复杂度部分又混用可缓存投影与每次前向重算的成本;复现应核对代码和具体运行配置,而不是照抄单一复杂度口号。
- 五种子结果有较大波动,部分提升小于标准差,没有显著性检验;跨数据集规模、特征维度和图任务类型同时变化,不能把增益差异归因于单一因素。
- 可进一步做区域自适应阈值、标签预算内的零空间选择,以及包含初始化、缓存、峰值内存和训练总时长的端到端成本评测。
相关工作与启发¶
- vs GPF / EdgePrompt:这些方法主要在特征或边上加提示;SRP 根据冻结权重的可达子空间组织输入读取,并在聚合后注入提示,代价是需要离线分解和谱基存储。
- vs GraphLoRA / LoRA:低秩权重更新在消息传递路径内改变有效算子;SRP 保留原算子,用弱奇异方向与零空间构造表示旁路。区别不只是低秩矩阵命名,也包括适配位置是否受到当前层传播过滤。
- vs 普通 PCA:普通 PCA 优先保留总体方差,可能再次偏向原编码器已经擅长的方向;零空间 PCA 先排除可达部分,再在互补空间内压缩。后续可比较同预算的无监督方差选择与监督判别选择。
评分¶
- 新颖性: 4/5。把谱容量失配、零空间读取和聚合后图提示结合起来,比单纯增加低秩分支更有针对性。
- 实验充分度: 4/5。包含十个主数据集、两种预训练和多项附录分析,但消融范围、方差和复现配置仍有限制。
- 写作质量: 3/5。机制线索清楚,但转置、默认超参和无损等表述需要澄清。
- 价值: 4/5。为冻结图编码器提供了可解释的适配方向选择思路,尤其适合高维节点特征的少样本任务。