HoTS: Homophily-Aware Temperature Scaling for Graph Neural Network Calibration¶
会议: NeurIPS2026
arXiv: 2609.32426
代码: https://github.com/inu0104/HoTS
领域: 图学习
关键词: 图神经网络、概率校准、局部同质性、温度缩放、选择性分类
一句话总结¶
HoTS 用预测熵和辅助 GCN 估计的局部同质性生成节点级正温度,以理想化 CSBM 的逆同质性温度规律为结构先验,在不改变预测类别的前提下取得 18 个数据集上的最佳平均 ECE 4.79%,但并非逐数据集或逐覆盖率都最优。
研究背景与动机¶
图节点分类中的置信度不只是展示给用户的概率,还决定哪些节点交给人工审核、哪些预测进入风险决策。全局温度缩放(TS)给全部节点使用同一个温度,能够在不改变类别的情况下修正整体过度自信,却不能区分不同邻域的可靠性。对于通过消息传递得到预测的 GNN,相同的 logits 可能来自同类邻居的支持,也可能来自结构混杂下的偶然强响应;只看置信度大小不一定能判断它们的真实正确率。
CaGCN、GATS、GETS、WATS 已经把图结构加入校准器,但通常通过辅助网络、注意力、专家混合或图小波学习结构修正。本文不只是再增加一个图特征,而是追问局部结构与最优温度之间应有什么关系。它先说明:如果固定 logits 后,同质性仍解释最优温度的变化,任何只依赖 logits 的温度规则都会留下交叉熵风险差距。随后在一个可解析的 contextual stochastic block model(CSBM)中计算后验,把邻域同质性与聚合信号强度连接起来。
理论规律并不能直接部署:真实类别未知,实际 GNN 也不是理论中的模板分类器。本文因此用可观测标签训练同质性预测器,再把局部预测熵与估计结构信号组合成一个受约束的温度函数。核心 idea:用“当前预测有多集中”相对于“邻域结构提供多少支持”来决定节点级温度,并学习结构修正的敏感度,而不是把所有节点压到同一个全局温度。
方法详解¶
整体框架¶
输入是已经训练好的节点分类器、其冻结 logits,以及完整的图结构和节点特征。HoTS 先通过“同质性估计”得到每个节点的结构信号,同时通过“熵浓度代理”概括未校准预测的集中程度,最后由“结构温度映射”输出正标量温度,再计算缩放后的 softmax。
同质性预测器先单独训练并缓存输出,随后只拟合温度函数的三个标量。推理时不需要任何节点的真实标签;测试节点的特征和连边可以参与传导式 GCN 运算,但测试标签不能参与拟合。这里的“三参数”只指温度映射,并不包括辅助 GCN 的权重。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
G["图与节点特征"] --> H["同质性估计"]
L["训练与验证标签"] -.->|仅训练监督| H
Z["冻结分类器 logits"] --> E["熵浓度代理"]
H --> T["结构温度映射"]
E --> T
V["验证标签"] -.->|温度交叉熵拟合| T
R["训练标签"] -.->|检查点选择| T
T --> P["正温度 softmax<br/>类别保持不变"]
Z --> P
实线表示计算数据流,虚线表示拟合或检查点选择时的标签访问;推理移除所有标签监督边。图中的两个输入分支在结构温度映射汇合,关键设计按同质性估计、熵浓度代理、结构温度映射的顺序展开。
关键设计¶
1. 同质性估计:用已观测邻居标签学习测试时可用的结构信号
局部同质性指节点邻居中与其同类的比例,但测试时不能读取节点与邻居的真实类别来计算它。HoTS 使用一个两层辅助 GCN,输入原始特征和完整传导式图,隐藏宽度为 32,经过 ReLU 后输出一个 sigmoid 标量,作为估计同质性。这个网络并不直接预测校准温度,而是学习一个有结构含义的中间量。
监督目标只为训练集与验证集中的已知标签节点构造:收集同样有已知标签的邻居,排除节点自身,然后计算其中同类邻居的比例。没有这样的邻居的已知节点不进入预测器损失。目标构造不使用自环,但 GCN 的消息传递图保留自环;二者不能混为一谈。预测器能够通过特征和图为没有已标注邻居的节点输出估计值,并不需要给这些节点补伪标签作为监督。
这一做法避免了测试标签泄漏,但不是完全独立的留出校准流程:验证标签既参与同质性目标构造,也用于后续温度拟合,还承担基础分类器的模型选择。辅助预测器训练完成后冻结,并为所有节点缓存估计值;温度优化不会反向更新它。因而解释结果时,应同时考虑结构先验和辅助监督的收益,而不能把完整系统描述成只学习三个数。
2. 熵浓度代理:从多分类概率提取一个节点级尺度
温度不能只随同质性变化,因为同一结构组内不同节点的原始预测集中程度仍不同。二分类下,如果正 logit 间隔为 \(\delta_i\),而希望置信度匹配同质性组的正确率 \(q(h_i)\),就得到 \(T_i^{\mathrm{match}}=\delta_i/\operatorname{logit}(q(h_i))\)。这是组级可靠性匹配的替代规则,而非完整 CSBM 后验下的逐节点交叉熵最优解;正温度匹配还要求 \(q(h_i)>1/2\)。
多分类没有唯一的二分类间隔,本文用归一化预测熵构造集中程度代理:
其中 \(H(p)=-\sum_k p_k\log p_k\),\(K\) 为类别数,熵在温度缩放前计算。接近均匀概率时,将 logits 去均值后,熵缺口的二阶展开正比于其平方范数,因此这个平方根能够近似反映 logit 浓度。附录 A.5 明确指出该展开是均匀分布附近的局部结果;在完整熵范围使用 \(c_i\) 是单调代理,而不是全局精确恒等式。
分子随预测集中程度增加,使非常尖锐的原始预测有机会接受更强的温度修正。它并不意味着“预测越自信就一定越不可靠”:最终修正还取决于结构分母与学习参数。均匀预测时该代理接近零,温度回落到基础偏置。
3. 结构温度映射:把有限范围的理论规律变成稳定正温度
理论从均匀类别先验、独立高斯特征、等距类别均值和带自环的一层线性 GCN 出发。进一步采用 population-concentration 近似:给定真实局部同质性后,把度数固定在总体值,并让非同类邻居在其他类别间均衡分配,排除有限度数与类别组成波动。这些条件让聚合特征的类条件分布具有同方差高斯形式。
令 \(m_c=\mu_c-\bar\mu\)、\(\rho_0=\|m_c\|\),理论类模板分数为 \(s_c=\rho_0^{-1}m_c^\top(\bar x_i-\bar\mu)\)。归一化同质性把随机邻居基线移到零,相关信号与精确后验为:
证明的关键不是假定任何训练好的 GCN 都天然校准,而是高斯似然中的类无关项相互抵消。等距中心均值形成正单纯形,各类均值范数相同,剩余似然比正比于模板内积;与模板张成空间正交的特征分量不携带类别信息。于是得到有符号的 Bayes 逆温度 \(\Gamma(h)/v\),只对这些模板分数成立,不适用于任意学习到的线性头。
当 \(\Gamma(h)>0\) 时,正 Bayes 温度是 \(\sigma^2/[\rho_0(1+\bar d\tilde h)]\)。只有在 \(\bar d\tilde h\gg1\) 的同质区域,它才近似与 \(\tilde h^{-1}\) 成正比。随机邻域 \(\tilde h=0\) 仍保留自身特征的正信号,不能用渐近反比关系宣称精确温度在这里发散。若 \(\Gamma(h)<0\),精确 Bayes 规则会反转模板类别顺序,任何正温度缩放都无法实现它。
命题 1 的严格改进同样有条件:固定 logits 后,最优正逆温度必须随同质性保留非零条件方差,并满足唯一内部最优解、非恒定 logits 和局部导数正则性。其证明利用交叉熵对逆温度的严格凸性;局部二次展开将风险差距写成曲率加权的条件方差。附录 A.3 在正信号模板分数组中用不同同质性对应高斯分布的支持重叠说明严格性,不能外推为所有真实图都必然存在同样差距。
实际温度映射以估计同质性代替真实同质性,再加绝对值、稳定常数和正偏置:
绝对值保证弱或负估计信号下也能生成稳定正温度;它会把相同大小的正负结构信号送入相同分母,因此不能解释为异质区域的精确有符号 Bayes 修复。熵代理、基础偏置、学习指数和绝对值共同构成一个启发式稳定扩展,理论提供的是结构先验而非真实网络的精确最优公式。
指数 \(\alpha\) 的可学习性来自测量误差考虑。在正温度反比近似中,将对数同质性记为 \(u\),若观测为 \(\hat u=u+\eta\),且噪声独立、零均值、方差为 \(\tau^2\),对 \(\log T^*=a-u\) 做总体最小二乘回归可得:
证明就是协方差保持为负的真实信号方差,而解释变量方差增加了噪声项。这是对数空间 OLS 的衰减规律,不是 HoTS 实际交叉熵优化的定理;实现只要求 \(\alpha>0\),不设置上界 1。合成实验中的无噪声拟合值 1.009 与最大噪声下的 0.182 是经验结果,不能改写为实现严格遵守 \(\alpha\leq1\)。
最后,每个节点的所有类别 logits 除以同一个正数,类别内顺序保持不变,唯一最大类别不变;节点之间的置信度顺序则可以改变。这正是选择性分类收益的来源,也意味着 HoTS 不可能提高全部节点都保留时的分类准确率。
损失函数 / 训练策略¶
基础 GCN/GAT 是两层网络,先在训练标签上优化交叉熵,通常由验证损失早停;PubMed、ogbn-arxiv、Reddit 使用完整 200 轮。所有数据集按种子重新生成随机 20/10/70 训练、验证、测试划分,包括 ogbn-arxiv,而不是使用其官方时间划分。
辅助同质性预测器优化已知节点上的均方误差,Adam 学习率 \(10^{-2}\)、权重衰减 \(10^{-4}\)、最多 200 轮,监督训练损失早停耐心为 30。训练与验证标签共同组成其目标来源,没有额外独立预测器验证集的描述。
冻结基础分类器和同质性估计后,温度参数在验证集上优化交叉熵;训练集交叉熵负责检查点选择与早停。Adam 学习率为 \(10^{-2}\),无权重衰减,最多 1,000 轮,耐心 50。这里不能把温度训练与早停集合写反,也不能称该流程为完全独立的校准留出。
三个参数通过 softplus 保持正值:基础温度额外加 0.1,尺度与指数分别额外加 0.01;分母稳定常数为 \(\varepsilon=0.02\)。有效初值约为基础温度 1.07、尺度 0.98、指数 0.70。它们允许数据自行降低或增强同质性作用,而不强制真实图遵从理论渐近指数。
实验关键数据¶
主实验¶
主结果为 18 个数据集、GCN 与 GAT 两种骨干、每骨干 10 个种子的合并统计。ECE 使用 15 个等宽置信度区间,计算各区间样本占比乘以平均置信度与经验准确率之差的绝对值,再求和;表中单位为百分比,越低越好。下表摘取原文表 1 的成功和失败案例,最佳对照指该数据集的最低基线均值,并非统一方法。
| 数据集 / 汇总 | HoTS ECE | 最佳对照 ECE | 对照方法 |
|---|---|---|---|
| Cora | 2.50 ± 0.72 | 2.90 ± 0.78 | VS |
| PubMed | 1.26 ± 0.30 | 0.83 ± 0.30 | WATS |
| CoraFull | 2.73 ± 0.81 | 2.20 ± 0.63 | ETS |
| Texas | 15.37 ± 5.90 | 17.69 ± 6.71 | HTS |
| Wisconsin | 14.67 ± 5.38 | 16.81 ± 6.81 | ETS |
| Roman-Empire | 4.36 ± 0.78 | 2.10 ± 0.83 | VS |
| tolokers | 3.25 ± 0.78 | 2.04 ± 0.63 | GETS |
| 全部数据集平均 | 4.79 | 5.37 | HTS |
| 平均排名 | 3.33 | 3.94 | HTS |
结果支持“平均表现最好”,不支持“所有同质或异质图都获胜”。除上述反例外,CiteSeer、Computers、Photo、CS、Physics、Chameleon、Squirrel、Actor、ogbn-arxiv、Reddit 也有更低均值的对照。小型 WebKB 图的标准差很大,不宜仅按均值宣称统计显著。
附录表 3 中,HoTS 平均 NLL 为 0.92,HTS 与 ETS 为 0.94;度分层 ECE 则是 CaGCN 的 5.81 优于 HoTS 的 5.90,因此并非所有指标都最优。GATS 在 Reddit 因 24 GB 显存不足缺失,其平均比较不完全覆盖相同数据集。附录 B.3 的额外骨干实验覆盖 17 个数据集并排除 Reddit,HoTS 在 GCNII 上为第二,而非所有骨干第一。
选择性分类按校准置信度保留排名最高的节点,再宏平均各数据集、骨干与种子的保留节点准确率。原文表 2 只展示严格保持类别的选定对照,单位为百分比:
| 覆盖率 | 未校准 | TS | HTS | HoTS |
|---|---|---|---|---|
| 100% | 67.39 | 67.39 | 67.39 | 67.39 |
| 95% | 68.87 | 68.90 | 68.92 | 68.94 |
| 90% | 70.01 | 70.08 | 70.13 | 70.15 |
| 85% | 71.04 | 71.12 | 71.17 | 71.18 |
| 80% | 71.94 | 72.05 | 72.13 | 72.11 |
| 75% | 72.81 | 72.92 | 72.94 | 72.96 |
| 70% | 73.60 | 73.73 | 73.75 | 73.81 |
HoTS 在多数所列覆盖率上最高,但 80% 时低于 HTS,且 100% 时全部相同。其部分优势只有很小的百分点差距,表中没有给出这些宏平均差距的显著性检验。
消融实验¶
原文表 10 的单位仍为平均 ECE 百分比;完整方法与固定指数版本使用相同检查点、估计同质性、划分和优化设置。
| 配置 | 平均 ECE | 证据边界 |
|---|---|---|
| TS | 6.04 | 单一全局温度 |
| 仅熵 | 4.83 | 去掉同质性分母,独立拟合正参数 |
| 仅同质性 | 5.56 | 历史结果,未用当前仅观测标签预测器重跑 |
| HoTS,固定指数 1 | 5.90 | 与完整方法匹配的对照 |
| HoTS,学习指数 | 4.79 | 完整方法 |
固定指数比完整方法高 1.11 个百分点,按表中四舍五入值计算;正文报告的是 +1.10 个百分点,两种表述保留其精度差异。完整方法相对仅熵的均值差仅为 0.04 个百分点,因此不应把平均改进主要归因于同质性分母;仅同质性行的旧协议更不能当成严格匹配消融。
关键发现¶
- 控制 CSBM 实验在 8 个同质性扫点、每点 20 个种子的均值上,得到温度与同质性的 Pearson 相关系数 −0.846;范围为 \(0.25\leq h\leq0.95\),不能概括整个负信号区域。
- 估计噪声从 0 增至 0.5 时,拟合指数从 1.009 降至 0.182,支持衰减趋势;不证明真实图的最优交叉熵指数满足 OLS 定理。
- 附录 B.8 控制原始置信度与对数度数后的同质性残差相关为 pooled +0.384、macro +0.283,但使用真实标签计算的 oracle 同质性,只是回顾性诊断,不是部署预测器的效果。
- 边扰动实验会在每个扰动图上重新计算 logits、重新拟合校准器,并改用预测标签邻居一致率估计同质性;不能作为固定模型、固定校准器直接应对分布迁移的证明。
亮点与洞察¶
- 温度缩放可以保留每个节点内部的类别顺序,同时改变节点之间的可信度排名。把准确率改进与拒绝低可信预测后的收益分开,有助于正确评估校准方法。
- 理论有三个不同层次:结构信息的必要性、理想化模板后验、实用温度函数。明确各层的条件和替代步骤,比把启发式函数包装成普遍 Bayes 最优更有复用价值。
- 学习指数把结构估计噪声转化为可调节的修正强度。类似思路可用于其他可靠性侧信息,但需要重新验证目标损失、噪声相关性与结构信号方向,不能直接照搬 OLS 上界。
局限与展望¶
- 精确后验依赖均匀先验、等距均值、高斯特征、总体度数与组成集中、一层线性聚合和 oracle 同质性;真实多层非线性 GNN、类别不平衡与低度节点都不满足完整前提。
- 正温度无法修复负信号导致的类别顺序反转,绝对值分母还丢失方向信息。未来可比较带符号结构特征或类别相关校准,但应另行报告由此引入的类别变化。
- 辅助 GCN 使完整管线不再是三参数模型,且验证标签参与多阶段训练与选择。需要独立校准划分或交叉拟合、预测器误差和总运行成本报告,以区分结构形式、监督量和容量的作用。
- 随机划分覆盖面广,但不足以体现时间迁移或新节点归纳泛化。合成验证、重新拟合的边扰动实验和 oracle 回顾性诊断均不能替代这些部署测试。
- 仅熵与 HoTS 的平均差距很小,且仅同质性消融没有按当前协议重跑。应补齐匹配消融、配对不确定性分析及多种 ECE 分箱敏感性。
- 附录 A.8 的邻居 logits 乘积分布近似只控制稀疏重叠下的高斯残差依赖;它依赖谱范数与可积性条件,不是完整有限 CSBM 的条件独立定理,也不能证明其他结构统计没有额外信息。
相关工作与启发¶
- 与 TS / HTS 相比:TS 学一个全局温度,HTS 使用预测熵构造节点温度;HoTS 增加估计同质性分母与可学习指数。其优势是可解释的结构调节,但需要辅助预测器,而且相对仅熵的平均收益有限。
- 与 RBS / SimCalib 相比:RBS 已使用同类邻居比例分组,SimCalib 使用节点相似性,因此“结构辅助校准”并非新概念。本文的区别是显式 CSBM 后验规律和连续温度形式;二者没有进入实验对比,不能宣称全面超越这些近邻工作。
- 与 CaGCN / GATS / WATS 相比:这些方法通过图网络、注意力或小波学习节点温度,HoTS 限制最终温度函数的自由度。对比完整成本时仍须计入其同质性 GCN,且 CaGCN 在度分层 ECE 上表现更好。
- 与 VS / GETS 相比:这些方法可进行类别相关变换并改变预测标签,校准与分类修正会混合。HoTS 主动保留标签,使其选择性分类收益可以解释为排名变化,而非重新分类。
评分¶
- 新颖性:4/5。将理想化结构后验与节点温度形式连接,贡献明确,但同质性辅助校准已有先例。
- 实验充分度:4/5。数据集、骨干与诊断覆盖较广,但独立校准、匹配消融和显著性证据仍不足。
- 写作质量:4/5。理论适用范围交代清楚,少量正文结论和表格精度仍需结合附录阅读。
- 价值:4/5。适合需要保持原分类器标签的图置信度与拒绝机制,不是提高全覆盖准确率的方法。