跳转至

Relation-Aware Graph Foundation Model

会议: NeurIPS 2026
arXiv: 2505.12027
代码: https://github.com/jianxiangyu/REEF/
领域: 图学习
关键词: 图基础模型、关系词元、语义超网络、跨数据集迁移、少样本学习

一句话总结

REEF 把可跨图共享的关系语义作为图基础模型的迁移单元,用语义超网络生成聚合器、分类器及数据集投影,在三个目标图的 1-shot 分类中达到 48.66%、48.65%、47.72% 准确率,但对未见关系、零样本任务和计算成本仍有明确边界。

研究背景与动机

跨图预训练的难点不只是图大小不同:Cora 和 PubMed 都是引用网络,节点特征却对应计算机科学与生物医学,特征维数、类别空间和分布也不相同。直接共享一个 GCN 或 GAT 的全部参数,容易把这些差异混在一起;给每个数据集单独配置专家,又会让迁移依赖数据集身份,而非真正能够复用的机制。本文主实验中,联合训练 GCN 的五图平均准确率只有 54.97%,说明简单合并训练并不自动产生跨域能力。

作者把注意力转向图中的关系。同样是“引用”,它在不同学科图中仍描述论文之间的信息联系;“网页分类”也可以跨学校共享任务语义。这种共享不要求节点内容相同,却要求模型知道当前应该怎样传播信息、怎样判断关系成立。另一方面,仅知道“引用”仍无法区分 PubMed 与 Citeseer 的属性分布,因此关系层共享与数据集层适配必须同时存在,不能把关系 token 当作消除一切域差异的万能表示。

REEF 借用词表的概念,但它的 token 不是离散节点编号,也不是把图转成语言序列。关系名称和任务描述先编码成语义向量,再用于生成小型图预测器的参数,图结构仍由 GNN 处理。核心 idea:共享关系语义到预测器参数的映射,同时用数据集描述修正特征分布,让“同一种关系在不同图上怎样工作”成为可迁移知识。

方法详解

整体框架

模型输入包含节点属性、带关系类型的边、关系描述和数据集描述;预测单位是三元组 \(\langle s_i,r,s_j\rangle\),其中两端是节点中心的局部子图,分类任务的第二端则是标签原型节点。输出不是自由生成的文本,也不是在关系词表上做多类 token 预测,而是给定关系是否成立的二元概率。

数值属性先用 SVD 统一到 128 维;数据集适配产生初始特征偏置和逐层自身状态投影,关系语义生成聚合矩阵以编码局部子图,另一套关系语义生成分类器对两端表示打分。训练时,把不同图的批次混合,并随机遮蔽边;推理时不走标签监督或优化路径。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    X["节点属性与局部图<br/>SVD 对齐"] --> D["数据集适配"]
    T["数据集描述<br/>Sentence-BERT"] --> D
    D --> A["语义关系聚合"]
    R["关系词表<br/>Sentence-BERT"] --> A
    A --> C["关系存在性分类"]
    R --> C
    C --> O["推理:关系概率<br/>类别或链接判断"]
    C -. "训练预测" .-> M["混合多图训练"]
    Y["训练标签与链接监督"] -. "仅训练" .-> M
    M -. "删边增强与参数更新" .-> D
    M -. "参数更新" .-> A
    M -. "参数更新" .-> C

词表来自数据集 schema 和任务语义,而不是逐样本人工标注。主预训练包含 237 个 FB15K237 关系、11 个 WN18RR 关系,以及引用、网页、商品三个领域各一对“聚合关系 / 分类关系”,共 254 个 token。附录 D 说明关系自然语言描述由 LLM 根据背景、官方关系名称和任务语义生成,再由 Sentence-BERT 编码;这属于准备阶段,不意味着每次图预测都调用生成式 LLM。

关键设计

1. 数据集适配:区分维数统一与分布适配

SVD 解决的是输入维数不兼容:把不同图的数值属性变成相同宽度,方便同一预测器接收。它并不保证不同图的第一个坐标具有相同含义,也不是跨域监督语义对齐。文本属性实验则直接用 Sentence-BERT 编码节点文本,属于另一种输入配置,不能把其 3-shot 结果当成主实验 SVD 配置的结果。

随后,Sentence-BERT 初始化数据集描述向量,原文明确该向量会在训练中更新。一个两层 MLP 把它变成数据集级特征偏置,加到每个节点的初始表示上;投影超网络则为每一层生成数据集专属矩阵,作用在目标节点自己的隐藏状态上。因此,这个“投影”并非只在输入端把维数变到 128,而是持续调整逐层自信息通道。同一引用关系的邻居变换可以共享,PubMed 与 Citeseer 的自身状态变换和初始偏置却可以不同。

这两种适配分别处理全图共享的初始分布偏移,以及传播过程中如何保留和变换本节点属性。它们不会直接生成新类别,也不会替代关系聚合。原文式 (10) 的缓存末尾有排版残片,笔记仅保留上述可明确识别的加性偏置机制,不猜补损坏公式。

2. 语义关系聚合:让关系描述决定邻居信息的变换

关系文本用 Sentence-BERT 初始化为 \(h_r\),聚合超网络根据该向量为每层生成关系专属矩阵 \(\Phi_r^{(l)}\)。与 RGCN 直接为关系 ID 学一张矩阵不同,REEF 在关系语义与传播参数之间加入可学习映射,使不同关系的参数具备语义条件,而不是只由互不关联的编号索引。

最终节点更新保留两条通道:数据集投影处理自己的旧状态;邻居按关系分组,分别变换、组内平均,再求和。原文式 (9) 中可明确读出的核心机制为:

\[ h_i^{(l+1)}=\Phi_{\mathcal G}^{(l)}h_i^{(l)}+ \sum_{r\in\mathcal R_{\mathrm{source}}}\frac{1}{|\mathcal N_i^r|} \sum_{j\in\mathcal N_i^r}\Phi_r^{(l)}h_j^{(l)}. \]

这里 \(\mathcal N_i^r\) 是通过关系 \(r\) 相连的邻居,求和只需处理实际存在的关系邻居组。组内平均避免某种关系仅因邻居数量多就无限放大贡献;它不等于不同关系之间有可学习注意力。最后一层的中心节点状态代表该局部子图,不是对所有节点做全图平均池化。

主模型采用轻量线性传播,超网络自身仍是非线性的两层 MLP。附录比较了 ReLU、GELU,并未证明线性传播本身是不可替代的创新。其关键是从语义生成变换矩阵,而不是某一种固定激活。

3. 关系存在性分类:把分类和链接预测统一成配对打分

在节点分类中,每个标签用该类训练样本的质心构造原型,视作只有一个节点的子图。待分类节点的局部子图与每个标签原型配对,询问“论文分类”或“网页分类”关系是否成立。链接预测中,两端都是节点局部子图,询问给定边关系是否成立。因此聚合关系与预测关系并不总是同一个 token:引用边用于传播,“论文分类”用于类别打分。

分类超网络依据预测关系的语义向量生成分类器参数 \(\Psi_r\)。两端表示逐元素相乘后进入 sigmoid 打分;这个机制与词表大小为 254 的 softmax 分类不同,也不要求不同数据集拥有统一的类别编号。原文式 (6)–(7) 给出的关系为:

\[ \Psi_r=\mathcal F_{\mathrm{Cls}}(h_r;\Theta_{r,\mathrm{Cls}}),\qquad P(y=1\mid\langle s_i,r,s_j\rangle)= \operatorname{sigmoid}\!\left(\Psi_r(h_{s_i}\circ h_{s_j})\right). \]

标签原型只应来自可用训练支持样本,不能借用测试标签;1-shot 设置每类只有一个支持样本,原型自然退化到该样本的特征代表。需要注意,逐元素乘积在交换两端时不变,因此仅从这一打分式无法推导出方向敏感的关系预测;方向或端点角色如何额外编码,缓存没有明确展开。

原文将部分超网络参数写成带关系或数据集下标的形式,同时叙述强调语义条件下的参数生成。笔记不据此断言所有关系只共用一个固定规模的生成器,也不声称未见关系只靠文本便能无适配获得可靠性能;附录 E.3 对新关系做的是微调迁移。

4. 混合多图训练:共享参数生成机制,而非混淆所有标签

预训练将七个源数据集的批次统一打乱,每个 epoch 随机删边,遮蔽率为 0.2。这样模型反复在不同图结构和任务关系间切换,减少单图训练的局部偏置;边扰动则要求预测器对拓扑变化保持一定稳定性。批次混合并不意味着每个数据集严格等权,论文没有给出按数据集均匀抽样或逆规模加权的公式。

源数据包括两张知识图、两张引用图、两张 WebKB 图和 Photo。训练与迁移通过关系存在性预测连接起来,但监督来源依任务不同:知识图提供链接关系,节点分类提供训练标签原型。该预训练不是所有源图都无标签的纯自监督训练,不能因为用了数据增强就把它归类为 GraphCL 式对比学习。

一个完整示例

考虑从 PubMed、Citeseer 等源图迁移到 Cora 的 1-shot 节点分类。Cora 有 7 类,每类提供一个带标签节点;这 7 个支持节点构成 7 个标签原型,剩余节点进入验证 / 测试,二者按 1:9 划分。

对于一个待分类论文,先取其局部引用子图,SVD 对齐属性,加入 Cora 描述产生的偏置,再用 Cora 的逐层自身投影与“引用”聚合矩阵编码邻域。最后把中心节点表示分别与 7 个标签原型表示配对,用“论文分类”分类器给出关系分数,形成类别判断。这里复用的是引用与分类关系知识,不是把 PubMed 的三个糖尿病类别直接迁移成 Cora 的七个研究方向。

迁移阶段会微调目标模型并学习目标数据集表示,因此这是 few-shot adaptation,而不是 zero-shot;它也不同于仅把支持样本放进上下文、完全不更新参数的 in-context learning。具体最优类别选择及完整优化细节未在缓存中逐项展开,不额外补写成作者算法。

损失函数 / 训练策略

原文明确了二元关系预测目标,但未在正文和附录中提供完整损失公式、负样本采样比例及分类原型的全部实现细节,因此不把常见二元交叉熵自行写成作者明确给出的损失。

附录 D 的主要配置为:Adam,学习率 0.0002,2 层 GNN,隐藏维度 64,dropout 0.5,batch size 128,训练 100 epochs;三个超网络和特征偏置函数都采用两层 MLP。主预训练只使用源数据集训练划分;PubMed、Citeseer、Photo 按 6:2:2 划分,Wisconsin、Texas 使用官方划分。

主 1-shot 迁移在 Cora、Cornell、Computers 上进行,每类一个训练样本。26 图实验则由附录 F 称为 fully-inductive、沿用 GraphAny 划分,但未完整说明 REEF 在该协议下的源图选择与目标图适配预算;不能将其 70.75% 均值解释成主 1-shot 均值,或自动视为严格零样本结果。

实验关键数据

主实验

下表选取原文表 2 的 1-shot 结果,指标保持 0–1 尺度;误差项按原表保留,checklist 称其为标准差。各基线按原论文协议报告,预训练图集合不完全相同,因此并非统一预训练预算下的严格受控比较。

目标数据集 方法 Accuracy AUC F1
Cora MDGPT 0.4421 ± 0.08 0.7912 ± 0.05 0.4271 ± 0.08
Cora REEF 0.4866 ± 0.04 0.8035 ± 0.03 0.4800 ± 0.05
Cornell GraphCL 0.4175 ± 0.04 0.6350 ± 0.02 0.3500 ± 0.04
Cornell REEF 0.4865 ± 0.08 0.7016 ± 0.03 0.3649 ± 0.07
Computers MDGPT 0.3837 ± 0.09 0.7950 ± 0.04 0.4120 ± 0.08
Computers REEF 0.4772 ± 0.06 0.8480 ± 0.03 0.4403 ± 0.02

Cora 准确率相比 MDGPT 增加 4.45 个百分点,Computers 增加 9.35 个百分点。原文的“+10.07%”“+24.05%”是相对准确率提升,不是百分点。Cornell 的最好基线随指标变化:准确率 / F1 来自 GraphCL,AUC 最好基线为 GCOPE+CL 的 0.6694,因此不能把上表单一基线理解成三项指标都最强。

消融实验

下表整理原文表 6、表 10 的关键均值,均为百分数尺度;横线表示该受控聚合器实验没有单独列出此处的三个目标图数字。保留原文报告值,不用重新计算结果替换有疑问的源表。

配置 Cora Acc Cornell Acc Computers Acc 迁移均值 总均值
REEF 48.66 48.65 47.72 48.34 72.93
随机关系初始化 REEF-LM 46.58 44.72 43.46 44.92 69.43
去特征偏置 REEF-FB 40.07 44.51 42.09 42.22 68.21
去数据集投影 REEF-FP 40.22 43.69 46.50 45.10 68.32
去删边增强 REEF-AGU 40.81 43.69 46.68 43.73 69.98
共享聚合矩阵 Shared — — — 29.80 56.16
关系拼接 Concat — — — 39.39 68.23
独立关系矩阵 Relation-ID — — — 33.51 68.32

去掉特征偏置使迁移均值下降 6.12 个百分点,是表 6 中最大的平均迁移退化;去投影、去删边增强、随机关系初始化分别下降 3.24、4.61、3.42 个百分点。表 10 仅替换聚合器,保持分类器、投影、偏置及训练协议不变,REEF 相比 Concat 的迁移均值高 8.95 个百分点,比只按关系 ID 学矩阵高 14.83 个百分点,较直接支持“语义生成参数”而非单纯关系容量的贡献。

原文表 6 的若干消融均值与逐数据集条目存在算术不一致;正文又把 REEF-LM 称为表现最差,但其报告迁移均值 44.92 高于 REEF-FB 的 42.22。上表保留源值,下降量按报告均值计算,不把这些均值问题解释成统计显著性证据。

关键发现

不同协议回答不同问题,下表用于标清证据边界,不能横向混为同一排行榜。

协议与原表 REEF 结果 对照与解释
五个源图节点分类,表 1 平均 Acc 79.70% RGCN joint 76.83%;REEF 不在每个图都第一,Texas 为 70.27%,RGCN 为 80.95%
26 图跨域,表 3 / 15 平均 Acc 70.75% GraphAny 68.23%;共购域均值 REEF 71.00%,低于 GraphAny 71.58%
分子 zero-shot,表 4 BBBP / HIV AUROC 54.80 / 63.17 GOFA 54.91 / 53.02;GIMLET 59.39 / 66.24,监督规模不同
文本节点 3-shot,表 5 S1:75.95 / 57.40 / 37.20;S2:74.58 / 62.82 / 38.24 顺序为 Cora / History / Ratings;S1 无电商源图,S2 加入 Photo
未见关系微调,表 9 Cornell / Computers Acc 34.58 / 26.40 完整关系覆盖对应 48.65 / 47.72;未见关系适配明显更难
八个异配图,表 13 平均 Acc 66.06% H2GCN 66.41%;并非异配专用方法上的全面超越
  • 关系共享不能消除域差异。去掉 Photo、Wisconsin、Texas 对应的源关系后,Computers 的 F1 从 44.03 降至 6.10,说明“支持新关系”不等于保持原有性能;该实验包含微调,不是新关系零样本。
  • 分子实验没有分子域预训练 / 微调,但缓存未充分描述图级读出、任务表示和无标签原型构造。其结果可以记录为作者的 zero-shot 证据,不能据此补出一套已明确公开的端到端实现。
  • 26 图实验出现对 ogbn-arxiv 的明显退化:REEF 50.42%,GraphAny 57.79%。整体均值领先不代表每个大图、每个领域都适用。
  • 附录 E.10 报告 REEF 有 177.4M 可训练参数,单 A800 80GB 训练 8 小时、峰值 48.21 GiB;GCOPE 为 93.3K、34 分钟、23.40 MiB。资源并非等预算比较,但“无需生成式 LLM 推理”也不能直接等同于低成本训练。

亮点与洞察

  • 把关系语义变成预测器参数,而不只是附加在节点特征后面。它使关系在传播阶段和决策阶段都能改变运算规则,受控聚合器实验比笼统地与 RGCN 比较更有说服力。
  • 聚合关系与任务关系分开,避免将“引用”与“论文属于某类”混成同一种边。这个设计可迁移到同时包含交互预测与实体分类的跨域图任务,但需要明确 schema 和任务描述。
  • 数据集偏置与逐层自身投影解释了共享的正确粒度:共享关系机制,不强迫所有节点属性完全同分布。它也提醒基础模型的“通用”通常意味着条件化适配,而非没有任何域专属状态。

局限与展望

  • 作者提出扩展关系词表、高阶组合关系、动态图与时序图;当前实验尚不能证明这些扩展已经实现。所谓 scaling behavior 来自有限数据组合和隐藏维度比较,不是已拟合并验证的普适幂律。
  • few-shot、26 图 fully-inductive、分子 zero-shot 与源图测试必须分开阅读。训练标签只用于训练并不足以证明整个节点分类流程完全 inductive;图结构可见范围、SVD 拟合范围和目标适配预算仍需代码核实。
  • 原文式 (4)、(6)、(8) 给超网络参数附上关系 / 数据集下标,描述却强调语义条件生成;参数共享边界仍需结合实现确认。177.4M 参数及高显存也说明不能只凭两层 GNN 判断整体模型很小。
  • 统计报告不够完整:表 2 有误差项,但多处扩展表没有方差与重复次数;部分消融均值不一致,难以据此建立严格显著性结论。
  • 缓存存在声明冲突:附录 D 说用 LLM 生成关系描述,附录 J 和 checklist 却称 LLM 仅用于写作润色。另有知识图划分概括、Citeseer / Photo 数据统计跨配置不一致,复现时应按具体实验版本核对,不能自行统一。
  • 可以进一步测试关系描述的同义改写、错误描述及语义空白 token,区分语言先验、参数容量和域标识的贡献;还应在对等训练预算下比较轻量生成器与关系条件化低秩适配。

相关工作与启发

  • vs RGCN:RGCN 用关系专属矩阵建模多关系传播;REEF 用语义超网络生成矩阵,并加入关系分类器与数据集适配。两者总模型和参数预算不同,不能把全部差距都归因于关系文本。
  • vs GCOPE / MDGPT:GCOPE 用协调节点连接多图,MDGPT 用域 token 与 prompt 适配;REEF 以关系作为共享粒度,数据集身份退居特征适配条件。主迁移结果优于这些基线,但其预训练数据协议不同。
  • vs GraphAny / TS-Mean:它们面向可迁移的跨图节点分类;REEF 强调关系语义到参数的映射。26 图均值支持跨域有效性,仍需补齐 REEF 在该协议中的源图与适配细节才能审查严格独立性。
  • vs GOFA / GIMLET:它们利用图语言建模或分子图文预训练,REEF 推理核心是 GNN 与生成参数。分子 zero-shot 表比较了不同监督规模,适合说明可行性,不适合声称在完全相同训练条件下击败所有图文基础模型。
  • 分类判断:保留 graph_learning;核心贡献是关系条件化图预测与跨图迁移,而非提出通用无标签自监督目标,self_supervised 不如当前分类准确。

评分

  • 新颖性: 4/5 — 将关系语义、参数生成与数据集适配组合成统一图迁移框架。
  • 实验充分度: 4/5 — 覆盖多协议及受控聚合器消融,但均值冲突和复现边界降低可信度。
  • 写作质量: 3/5 — 主机制清楚,部分声明、统计与扩展协议说明不一致。
  • 价值: 4/5 — 关系作为迁移单元具有启发性,实际收益应同时衡量目标关系覆盖与训练成本。