Understanding and Mitigating Under-Confidence in GNNs from the Final Layer¶
会议: NeurIPS 2026
arXiv: 2505.11335
代码: https://github.com/huangJC0429/SCAR
领域: 图学习
关键词: 置信度校准、欠置信、末层权重衰减、类别原型、节点级校准
一句话总结¶
SCAR 从 GNN 的末层分类器解释欠置信,训练时单独减小末层权重衰减,推理时按节点与训练集的邻接关系将表示拉向预测类别原型,在多种节点分类设置中降低 ECE,但不保证预测标签或准确率始终不变。
研究背景与动机¶
图神经网络(GNN)的分类正确率和置信度并不是一回事:模型可以正确识别许多节点,却只给出偏低的最大类别概率。引用网络上的 GCN、GAT 经常出现这种欠置信,方向与许多深度网络的过置信相反。温度缩放(TS)能整体调整概率的尖锐程度,CaGCN、GATS、GETS 等图校准方法进一步利用图结构或额外模型生成校准参数,但这些外接组件并没有直接回答原模型为什么会产生偏低的置信度。
本文将观察点收缩到最后一次“聚合表示乘分类权重”的运算。末层权重衰减会压缩分类权重;从优化驻点看,分类权重又可以解释为类别原型。因此,校准不一定要另学一个映射,也可以先改变训练中对分类器的约束,再调整测试节点相对于这些原型的位置。问题在于,两种尺度并不等价:扩大总体原型间距无法消除各个节点表示的偏差,而消息传递使训练邻近节点与训练远端节点受到不同强度的训练信息影响。
论文据此提出两级互补的 SCAR,而不是把整套方法当作免训练的后处理。核心 idea:训练时只减弱末层权重衰减以改善类别原型的总体分离,训练后再按结构分组将节点表示插值到预测类别原型附近,直接干预产生置信度的末层几何。
方法详解¶
整体框架¶
输入是图结构、节点特征和训练节点标签,输出是测试节点的类别分布。SCAR 保留 GCN 或 GAT 的主干及交叉熵目标,首先进行“类别级校准”,用比其他层更小的末层权重衰减训练分类器;随后在推理阶段进行“结构分组赋权”和“原型插值校准”。前者决定节点该使用较弱还是较强的插值,后者真正修改末层聚合表示,再用同一个分类器重新计算概率。
这里的“类别中心”不是把同类训练节点简单求平均。论文使用末层权重矩阵的类别列作为原型,其理论解释来自带正则化交叉熵的驻点条件:同类节点表示按预测残差加权累加,再扣除其他类别节点的加权表示。该条件包含依赖权重自身的 softmax 概率,是隐式关系,不是可以一次代入数据算出的闭式最优解。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图、特征与训练标签"] -->|训练:交叉熵监督| B["类别级校准"]
B --> C["冻结 GNN 与末层原型"]
C -->|推理:图结构与训练节点位置| D["结构分组赋权"]
D --> E["原型插值校准"]
E --> F["重算 logits 与类别概率"]
训练标签用于学习 GNN;推理时的原型选择来自初始预测标签,结构分组来自训练节点位置,不读取测试真值。后处理没有新增需梯度训练的校准网络,但末层衰减的选择涉及基础模型训练,插值强度也涉及超参数选择,不能由此推导“完整流程零训练成本”。
关键设计¶
1. 类别级校准:只减弱末层权重衰减,避免同时扰动全部表示层
对所有层统一减小权重衰减,既会改变分类器,又会改变前面的表示学习,可能损害准确率。SCAR 只调整末层系数,其他层保留原有正则化。定理 3.1 将一次梯度更新后的概率拆成权重收缩贡献和交叉熵梯度贡献;前者可以写成作用于相应 logits 项的温度因子:
其中学习率为 \(\eta\),末层衰减系数为 \(\lambda^{(K)}\)。正温度大于 1 的收缩项会使固定 logits 的分布变平,因此减弱末层衰减具有缓解欠置信的机制动机;若系数为零,则该因子等于 1。该推导同时保留了交叉熵梯度产生的类别间修正项,并允许更新后的表示参与计算,不能把整个训练过程说成严格等价于一次 TS,更不能直接套用到 Adam 的全部更新轨迹。
缓存中附录 B.1 的式 (15)–(17) 存在更新前后权重、类别下标和重复指数项的转写疑点;本笔记不猜补完整概率公式,只保留可辨认的温度因子及其适用边界。
定理 3.2 将末层每个类别列解释为判别式原型:预测不充分的同类训练节点贡献正项,其他类节点对该类的错误概率贡献负项。这不是无权重的算术均值,也不是所有有限训练步都已经满足的关系。原型还包含其他类的排斥信息,因而“接近原型”是在训练出的判别空间中发生,而非接近输入特征的类别平均值。
命题 3.3 的保证更窄:固定末层输入表示,比较两个正衰减系数下优化后的分类器,并采用 softmax 权重的中心化表示,较小衰减对应不小于原先的平均两两原型平方距离。证明先比较最优权重的 Frobenius 范数,再借助中心化恒等式连接总体原型距离。它不保证每一对原型都更远,也不保证端到端重新训练时无条件降低 ECE;“类别级分离”是总体几何结论,不是校准误差的普适单调定理。
2. 结构分组赋权:训练节点的一阶邻居少修正,其余节点多修正
消息传递使部分测试节点更容易接收到训练节点信息,统一插值强度可能对训练邻近节点修正过度、对远端节点修正不足。论文将训练节点的一阶邻居归入 \(V_F\),采用较小系数 \(\alpha\);二阶及更高阶节点归入 \(V_S\),采用较大系数 \(\beta\),要求 \(0\leq\alpha<\beta\leq1\)。这是两档结构规则,不是为每个节点另训练一个温度预测器。
命题 3.4 用一个非负、行归一化传播矩阵的线性化 GNN 解释这种动机。它还假设同类训练节点的变换后特征具有更紧的原型偏差界。在这些条件下,同类训练影响越弱,节点到原型距离的上界越松;若与该类训练集的图距离超过传播层数,同类训练影响为零。但更松的上界不等于实际距离必然更大,更不意味着每个远端节点都更欠置信。
还应区分理论与实现:理论讨论的是来自同类训练节点的传播权重总和,实际分组只使用节点是否邻接训练集,是较粗的代理。一般非线性 GNN 或对称归一化 GCN 不能不加说明地直接满足这条行归一化线性模型的全部假设。方法能在异配图上运行,与该命题对任意图都无条件成立,也是两回事。
3. 原型插值校准:用预测类别选择原型,再重算分类分布
训练结束后,先用原 GNN 得到节点的预测类别 \(\hat y_t\),取末层对应的类别权重列作为原型。随后进行一次插值:
插值后的表示再次通过同一个末层分类器和 softmax,不新增校准模型,也不反向更新主干。沿着预测原型方向移动具有提高相应类得分的直觉;结合驻点表达式,测试 logit 可以解释为同类相似性正项与其他类相似性负项共同作用。论文用这一关系将类别级约束和节点级修正联系起来,但不能将内积打分简单等同于无条件的欧氏最近原型分类。
这一步选择的是预测类别,而非真实类别。如果初始类别错误,修正可能强化错误置信度;若不同原型的范数或相互内积不合适,重算后也可能改变 argmax。正温度 TS 保持类别排序的性质并不自动继承到表示插值。附录 E.2 声称节点级处理“不改变预测”,但式 (9)、(10) 本身没有给出一般性的排序保持条件,因此这里将其视为需要额外核实的原文表述,而不当作方法保证。
一个完整示例¶
以下是说明运算的构造示例,不是论文报告的节点数据。设一个二分类节点的末层表示为 \((0.4,0.2)\),两个类别原型分别为 \((1,0)\) 与 \((-1,0)\)。它的 logits 为 \((0.4,-0.4)\),初始预测为第一类;SCAR 选择第一类原型,而不查询测试标签。
若该节点直接邻接训练集,用较弱的 \(\alpha=0.0002\),插值后表示为 \((0.40012,0.19996)\)。若它属于训练远端组,用较强的 \(\beta=0.002\),插值后表示为 \((0.4012,0.1996)\)。两种情况下,重新计算的第一类概率都略有提高,远端修正更大;这两个系数取自表 6 的 GCN/Cora、L/C=20 设置。
这个例子使用了对称原型,因此没有类别变化,不能据此声称一般保持预测。在真实模型中,原型由训练学习得到,范数不一定相等;可靠的评估必须同时观察校准、准确率以及原预测与新预测的翻转情况,而不是只检查平均概率变高。
损失函数 / 训练策略¶
基础训练仍使用带逐层 \(L_2\) 正则化的交叉熵,类别级校准只减小末层正则化系数;节点级校准在训练后运行,不是额外监督损失。实验采用两层 GCN/GAT 和 Adam。其他层衰减为 \(5\times10^{-4}\),学习率从 0.01、0.015、0.02 选择,隐藏维度从 8、16、64 选择,dropout 为 0.5 或 0.6。
例如 GCN/Cora、L/C=20 的末层衰减为 \(10^{-4}\),\(\alpha=2\times10^{-4}\),\(\beta=2\times10^{-3}\)。论文建议用二分策略选择末层衰减,在 \(\beta>\alpha\) 的三角区域内部分网格搜索插值系数。免校准网络训练不代表免调参;复现时应在验证集选择这些值,固定后再评测测试集,但缓存没有清楚交代搜索使用的验证目标及完整预算,不能声称已核实这一选择协议。
原文超参数描述存在冲突:D.3 写出的区间 \((0.0005,0.000005]\) 顺序反向;E.1 描述的扫描范围为 [0,0.001],但表 6/7 出现 0.002、0.005 等更大的 \(\beta\),以及更小的 \(\alpha\)。本笔记保留理论约束和明确表格示例,不将这些文字改造成一个假定一致的搜索范围。
实验关键数据¶
主实验¶
主要任务是半监督节点分类,引用网络包括 Cora、Citeseer、Pubmed、CoraFull,训练标签数为每类 20、40、60 个,验证集 500 个节点、测试集 1000 个节点。校准使用 20 个置信度分箱的 ECE:按各箱样本占比加权,累加箱内准确率与平均最大类别概率的绝对差。ECE 越低越好,但它只描述这一分箱下的最高置信度校准,不等于完整类别分布均已校准。
下表摘录原文表 1/2 的 L/C=20 结果,数值为 ECE(%),\(\pm\) 为 10 次运行的标准差,不是标准误。保留 TS 和 GETS 两个参照,并不将 GETS 预设为每个设置中最强的基线。
| 主干 | 数据集 | 未校准 | TS | GETS | SCAR |
|---|---|---|---|---|---|
| GCN | Cora | 13.47 ± 0.63 | 4.88 ± 0.55 | 3.83 ± 0.41 | 3.35 ± 0.53 |
| GCN | Citeseer | 12.48 ± 0.71 | 6.41 ± 0.87 | 6.72 ± 0.78 | 3.43 ± 0.58 |
| GCN | Pubmed | 5.86 ± 0.77 | 5.41 ± 0.38 | 3.93 ± 0.37 | 3.81 ± 0.47 |
| GCN | CoraFull | 19.86 ± 0.61 | 10.31 ± 0.61 | 7.01 ± 0.85 | 6.96 ± 0.48 |
| GAT | Cora | 15.58 ± 0.89 | 7.17 ± 0.98 | 4.53 ± 0.48 | 3.52 ± 0.74 |
| GAT | Citeseer | 15.34 ± 0.50 | 9.16 ± 0.87 | 5.85 ± 0.33 | 4.37 ± 0.83 |
| GAT | Pubmed | 8.35 ± 0.31 | 6.56 ± 0.46 | 4.16 ± 0.37 | 3.78 ± 0.84 |
| GAT | CoraFull | 21.19 ± 0.36 | 11.01 ± 0.51 | 6.79 ± 0.71 | 6.41 ± 0.63 |
不能照搬正文“总是最优”的措辞:GAT/Pubmed、L/C=20 时,DCGC 为 3.52 ± 0.21,CaGCN 为 3.56 ± 0.63,都低于 SCAR 的 3.78 ± 0.84。GCN/CoraFull 的 SCAR 与 GETS 均值也很接近,不能只凭小幅均值差宣布统计显著。
消融实验¶
下表的 CLC、NLC、完整 SCAR 来自表 3;单系数版本来自表 10,均为 L/C=20 的 ECE(%)。NLC 单独运行是对原训练模型进行后处理;完整方法则同时采用减小末层衰减和节点级修正。
| 配置 | GCN/Cora | GCN/Citeseer | GCN/CoraFull | GAT/Cora | GAT/Citeseer | GAT/CoraFull |
|---|---|---|---|---|---|---|
| 仅 CLC | 3.72 ± 0.53 | 4.92 ± 0.79 | 7.09 ± 0.52 | 3.64 ± 0.63 | 5.98 ± 0.62 | 6.89 ± 0.83 |
| 仅 NLC | 4.08 ± 0.62 | 3.63 ± 0.63 | 9.23 ± 0.55 | 4.18 ± 0.72 | 4.96 ± 0.66 | 7.12 ± 0.45 |
| 完整 SCAR | 3.35 ± 0.65 | 3.43 ± 0.58 | 6.96 ± 0.48 | 3.52 ± 0.74 | 4.37 ± 0.83 | 6.41 ± 0.63 |
| 节点修正仅用一个系数 | 3.81 ± 0.61 | 3.91 ± 0.64 | 7.21 ± 0.52 | 3.94 ± 0.71 | 4.88 ± 0.78 | 6.73 ± 0.57 |
两个机制的贡献依赖数据集:GCN/CoraFull 上仅 CLC 明显优于仅 NLC,GCN/Citeseer 则相反。两个系数版本优于单系数版本,为结构分组提供经验支持,但不是“所有结构偏差都已建模”的证据。
原文数值冲突需保留:GCN/Cora 的完整 SCAR 在表 1 为 3.35 ± 0.53,表 3/10 为 3.35 ± 0.65;GCN/Pubmed 在表 1 为 3.81 ± 0.47,表 3 为 3.78 ± 0.53,表 10 为 3.81 ± 0.53。GCN/CoraFull 的 TS 在表 1 为 10.31 ± 0.61,表 3 为 10.13 ± 0.61。本笔记按各表来源报告,不擅自统一。
关键发现¶
准确率不能只引用“总体有改善”。下面摘录表 8,单位为准确率(%),说明类别级调整有收益,也存在退化设置。
| 主干与数据集 | L/C | 未校准准确率 | SCAR 准确率 | 均值变化(百分点) |
|---|---|---|---|---|
| GCN/Cora | 40 | 83.04 ± 0.24 | 82.70 ± 0.16 | -0.34 |
| GAT/Pubmed | 20 | 78.88 ± 0.31 | 78.62 ± 0.36 | -0.26 |
| GCN/CoraFull | 20 | 62.03 ± 0.27 | 64.17 ± 0.52 | +2.14 |
| GAT/CoraFull | 20 | 58.87 ± 0.35 | 62.91 ± 0.32 | +4.04 |
- 表 4 扩展到 GraphSAGE、FAGCN、GCNII;例如 GCNII/Cora 的 ECE 从 35.51 ± 0.56 降至 9.81 ± 0.48,表明效果不局限于两种基础主干。
- 表 9 覆盖 Chameleon、Squirrel 和较大规模 Arxiv-year;后者 GCN 的 ECE 从 13.34 ± 0.72 降至 6.03 ± 0.38。但这些结果不能替代对真实动态分布漂移的评估。
- 表 11 的 OOD 采用保留标签、按随机块模型重连边的协议;Cora-OOD 上 SCAR 为 4.73 ± 0.58,优于未校准的 7.15 ± 0.32。原文亦指出,OOD 下未校准 ECE 变小可能来自准确率降低,而不是预测更可靠。
- 图 8 支持节点级处理额外运行开销较小;文本没有可复核的逐项时间数值。末层衰减搜索和重复训练预算仍应单独计入,不能把单次推理的轻量开销扩大为整个研究流程无额外成本。
亮点与洞察¶
- 校准问题被定位到末层,而不是笼统地认为整张图或整个主干需要改造。这为“表示学习需要正则化,但分类得分不应被同等压缩”提供了可操作的参数分组视角。
- 判别式类别原型连接了优化驻点与测试节点打分。它解释了为什么权重衰减与表示位置可以是互补控制量,同时提醒读者原型不是简单的类别平均特征。
- 两档插值把图结构影响落实到一个可检查的操作,不必学习额外校准网络。它的价值在于简洁、可消融,而不是获得了任何节点级正确性保证。
局限与展望¶
- 作者承认尚未充分利用同配、异配等结构偏差。一阶邻接分组过于粗糙,可进一步研究与预测类别相关的训练影响,而不是只看是否接触任意训练节点。
- 把表示向预测类原型移动可能放大错误。后续需要结合节点错误风险、原型范数和类别排序约束,分别报告正确节点、错误节点以及预测翻转后的校准情况。
- 理论主要涉及单步梯度分解、固定表示的末层最优化和线性化传播上界,不直接证明实际 Adam 训练或非线性模型的 ECE 单调改善。已经过置信的模型也可能不适合继续增大置信度。
- 20 分箱 ECE 可能掩盖类别、结构子群和低样本分箱中的问题。应补充 NLL、Brier score、类别条件校准及随分箱变化的敏感性,而不是将单一 ECE 当作完整可靠性证书。
- 搜索协议与文表一致性影响复现。除前述结果冲突外,表 5 的 Citeseer、Pubmed 训练计数与“每类 20/40/60 标签”的描述也有不一致,实际划分需以代码核实;离线缓存不足以裁定其来源。
相关工作与启发¶
- vs TS:TS 在固定 logits 上施加正标量温度,保持 argmax;SCAR 的类别级阶段改变训练,节点级阶段改变表示,不具有同样的排序保持保证。两者不能仅按“都是免训练校准”归为一类。
- vs CaGCN / GATS / GETS:这些方法利用额外校准组件生成温度或组合校准结果;SCAR 直接干预基础模型的末层参数约束和节点表示,减少推理组件,但仍需要调参及相应评估预算。
- vs AU-LS / GCL:它们通过训练目标中的置信度相关约束调整模型;SCAR 不另加校准损失,而是改变逐层正则化配置,并补充后处理。准确率和 ECE 必须联合比较。
- vs 图上的不确定性量化与 conformal prediction:后者可能面向不确定性分解或预测集覆盖率,SCAR 面向最大类别概率的经验校准,不能将其理论解释升级为覆盖率保证。
- 研究启发:可在固定表示下比较约束原型范数、原型中心化及排序保持的节点修正,隔离“提高置信度”和“改善校准”的贡献;这属于笔记提出的后续方向,不是论文已验证结论。
评分¶
- 新颖性: 4/5。把末层正则化、判别式原型和节点修正统一起来,机制清晰,但具体操作较简单。
- 实验充分度: 4/5。包含多主干、结构消融、异配图和有限 OOD 设置,仍缺完整校准指标与透明搜索预算。
- 写作质量: 3/5。主线易理解,但部分公式转写、表格数字及普适性表述存在冲突。
- 价值: 4/5。提供轻量且可复用的 GNN 校准基线,适用性应由验证集与联合准确率评估确认。