跳转至

Neural Structural Reasoner: A Brain-inspired Architecture for Reasoning over Structured Knowledge

会议: NeurIPS2026(清单标注 Accepted)
arXiv: 2609.36620
领域: 图学习
关键词: 知识图谱推理、结构化连接、关系组合、Hebbian 学习、可解释路径

一句话总结

NSR 将实体、关系及关系链绑定到可读的网络单元与连接,通过关系关联检索和显式图路径传播完成链接预测,在 Nations 上取得 MRR 0.8142,但其优势随数据集变化,且静态加速实现的效率不能直接等同于在线脑启发动力学的效率。

研究背景与动机

知识图谱链接预测需要回答给定头实体和关系后,哪个尾实体最合理。难点不仅是识别实体之间的相似性,还包括把关系作为可复用操作:反向遍历父子关系、发现两个关系经常指向同一对象,或者将两段关系链组合成一个更抽象的关系。ConvE、RotatE 等嵌入方法通过连续表示打分,通常不会直接暴露答案所依赖的具体图路径;规则学习和路径方法可以给出链条,却要处理组合搜索与不完整图中的证据不足。

本文选择将关系结构直接放进网络连接,而不是先压成实体向量再要求模型还原。其脑启发来源是稳定的实体表征、海马—内嗅回路的路径积分,以及层级关系组织。不过,论文面对的是已经符号化的离散知识图谱,不是脑活动记录,也不是从视觉或文本中识别实体的模型。它想证明的是一种可解释结构推理计算方案,而非这些机制确实对应人脑实现。

核心 idea:把已观察三元组存为实体—关系绑定单元间的连接,把可复用的关系等价与组合存为关联权重,再让查询沿这些连接产生可检查的候选路径及排序分数。

方法详解

整体框架

输入是训练知识图谱,以及形如 (h, r, ?) 的查询;输出是尾实体的排序和支持它们的具体路径。NSR 包含实体层 L_E、关系推理层 L_Z、关系层 L_R、关系组合层 L_C,物理连接是双向层级 L_E ↔ L_Z ↔ L_R ↔ L_C,不是四层依次执行一次的前馈流水线。

实体层提供稳定身份,关系推理层负责在特定关系下从一个实体移动到另一个实体;关系层提供可替代关系,组合层提供有序关系链。学习时,已编码三元组产生的共同激活或闭环证据更新关联连接。推理时,查询分别检索关系和关系链,再调用同一个实体—关系绑定机制走图,最后汇总到各个尾实体。

下图把实体层与关系推理层合并为“结构化绑定”,双向实线表示结构耦合;虚线边明确区分学习反馈和查询后的遍历调用。因此,关系关联与关系组合不是必须串行通过的两个推理步骤。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    T["训练三元组"] --> A["结构化绑定<br/>实体层与关系推理层"]
    A <-->|结构耦合| B["关系关联<br/>关系层"]
    B <-->|结构耦合| C["关系组合<br/>组合层"]
    A -.->|学习:同端点共现| B
    A -.->|学习:有序链闭环| C
    Q["查询关系与头实体"] --> B
    Q --> C
    B -.->|推理:替代关系遍历| A
    C -.->|推理:有序链遍历| A
    A -->|保留落地路径| D["路径支持聚合"]
    D --> O["尾实体排序与轨迹"]

关键设计

1. 结构化绑定:让连接本身保存关系,而不是只保存相似性

实体层有每个实体对应的单元;关系层为每种关系同时设置正向和逆向单元,因此关系单元数是原始关系数的两倍。关系推理层最多为每个实体与每个扩展关系分配一个绑定单元。它表示“从这个实体出发,在这类关系下进行状态转换”,并不是一个可任意旋转的稠密实体嵌入。

初始化时,实体单元与属于该实体的绑定单元双向连接,权重固定为 1。对训练三元组 (h, r, t),模型把头实体的正向绑定单元与尾实体的逆向绑定单元双向连接,并把两端分别接到正向、逆向关系单元;这些编码连接也设为 1。其余可塑权重从 0 开始。逆关系在这里首先是遍历工具,不意味着模型已经知道另一个语义关系必然与它相同。

查询同时激活头实体与关系。实体输入先提示“在哪里”,关系输入提示“按什么边走”;门控要求两者汇合,避免仅有实体或仅有关系就激活不相关转换。随后,关系推理层的递归连接把激活传到匹配的尾端绑定单元,再读出尾实体。门控还控制学习阶段向关系层和组合层的传播,使共同激活有具体结构含义。

这样,单步推理可以还原为“实体身份—关系条件—已编码边—尾实体”的轨迹。它不是从缺失查询三元组直接取答案:测试答案不在训练编码中,需要下一步检索替代关系或组合链,借助其他已观察边到达候选尾实体。

2. 关系关联:从同端点证据学习可替代的关系操作

如果同一个头实体在两个不同关系下到达同一个尾实体,两组尾端绑定单元会通过共同的实体单元相互增强,使相关关系单元共同激活。模型用带衰减的对称 Oja 风格更新积累这种关联;下面保留承载机制的关系层更新式,关系激活的乘积增强连接,活动平方项对已有连接施加衰减。

\[ \Delta w_{ij}^{RR}=\delta_{RR}(r_i r_j)-\mu_{RR}(r_i^2+r_j^2)w_{ij}^{RR}. \]

同一机制可以联系正向关系、逆向关系以及某个关系自身的逆向形式,分别用于关联、逆关系和对称结构发现。这里的“等价”是论文对可替代关系检索的命名:共享端点支持统计关联,不足以证明两个关系在所有实体上逻辑等价,更不提供因果结论。

查询时先激活原关系,只更新一次关系层,保留激活超过 T_thresh 的替代关系。每个保留关系的激活值作为路径支持分数。之后固定这些关系与原头实体,在已编码图上执行单跳遍历,产生第一组候选尾实体。阈值控制的是检索范围,而不是将关联自动转成严格逻辑规则。

3. 关系组合:用有序链的闭环支持连接抽象关系

同端点的单跳关联不能回答必须跨多条边的查询。NSR 因此检查某条有序两跳链是否与一个直接关系连接同样的头尾实体。具体而言,从已有第一跳的尾实体继续探索第二跳,再检查是否能沿目标关系的逆向回到最初头实体;逆向编码使这个闭环对应于训练图中存在同端点的目标关系。探索时排除立即走第一条边的逆关系,以免把原路返回当作有意义的组合。

组合层用序列选择性单元表示关系的先后顺序,而不是仅记录两个关系同时出现。附录描述了直接输入与经中间单元延迟的输入相汇合,使检测单元只对特定先后激活响应。检测到链与目标关系共同成立后,再以 Oja 风格关联更新加强二者连接。其作用是把已观察到的组合结构复用到其他实体上,而不是为每个查询重新学习一个实体特定规则。

静态图实验采用更便宜的离线实现:为每种正向或逆向关系建立邻接矩阵,两矩阵相乘得到有序两跳链的落地次数,并将对角线清零。随后,目标关系邻接矩阵与链计数矩阵的内积,除以总链次数,得到该链支持目标关系的经验权重。

\[ S_{ij}=A_{\tilde r_i}A_{\tilde r_j},\qquad w_{k-ij}^{CC}=\frac{\langle A_{r_k},S_{ij}\rangle_F}{\sum_{h\neq t}S_{ij}[h,t]}. \]

这里的矩阵乘法保留不同中间实体带来的多次落地,而不是把“能到达”压成一个布尔值;分子和分母都使用已去掉对角线的链计数。tau_s 要求足够的链证据,tau_c 要求足够的关联权重,两者是推理读出门,而非删除训练事实的操作。

原文称这种经验均值是在线更新的精确闭式结果,但该推导使用运行均值学习率,主文的 Oja 式同时包含独立增强和衰减项。笔记不将任意 Oja 参数下的更新与该统计式视为已经证明等价;应区分在线机制目标、附录特定平均化解释和实际静态加速评测。

4. 路径支持聚合:保存具体落地路径,再按尾实体合并证据

组合检索与单跳关联检索分开进行:模型重置网络后,激活查询关系,将活动传到组合层,保留最活跃的 TopK 链。每条选中链按顺序激活关系层单元,当前跳到达的实体成为下一跳起点。各条链分别执行,链内可以有多个落地路径,因此所谓并行候选推理不意味着所有链都在一个不区分状态的轨迹里同时推进。

每条单跳路径继承其替代关系的激活分数,每条组合路径继承组合单元分数。即使来自同一关系链,只要中间实体不同,也作为不同落地路径保留。对到达同一尾实体的路径集合,模型在验证集选择最大值或求和作为最终分数。

\[ \mathrm{Score}_a(t)= \begin{cases} \max_{p\in\mathcal P(t)}s(p), & a=\mathrm{max},\\ \sum_{p\in\mathcal P(t)}s(p), & a=\mathrm{sum}. \end{cases} \]

最大值相信最强的一条证据,可能被高分伪路径主导;求和利用多个落地,但会重复计算相关路径的支持。分数不进行概率校准,求和也可以远大于 1。可解释性在于每一项分数能追溯到执行过的图路径,而不是分数自动成为事实真实性或逻辑有效性的保证。

一个完整示例

附录给出 Kinship 查询 (person80, term16, ?)。目标 person25 没有直接证据,只能通过检索到的关联或组合路径获得支持;竞争实体是 person32。最大值聚合给竞争实体 0.662、目标 0.641,因此目标落后。

保留不同中间实体对应的落地路径后,目标积累 132 条路径,支持总和是 46.23;竞争实体只有 3 条路径,总和 1.55,求和后目标成为唯一首位。这个例子说明改变的是证据合并方法,不是重新编码测试事实,也不是把 46.23 解读为概率。是否普遍应当使用求和仍需要验证集选择,而不能由这个成功例子决定。

损失函数 / 训练策略

NSR 的主机制不是端到端反向传播的链接预测损失。它先编码训练三元组,再通过共同激活与组合闭环学习关联;静态加速版以一次计数替代反复 Oja 更新,附录的 delta_theta 是简化实现的有效学习率,不宜直接当成完整动力学模型全部参数的说明。

六个公开基准使用提供的训练、验证、测试划分;训练图用于编码,阈值与聚合方式在验证数据上选择。自建 Kinship1990_EXTENDED 则为 70%/10%/20%,必要的基础家谱边全部留在训练集,测试主要来自扩展组合关系。这是受控组合复用测试,不是对未见实体或未见完整家族的归纳泛化测试。

附录列出 Nations 的 T_thresh=0.22、tau_s=23、tau_c=0.20、delta_theta=0.52。Countries S3 将关系关联阈值设为无穷,使其重点落在组合路径,而非关系相似性检索。论文声称用 Optuna 选择超参数,但列出的 tau_c 搜索范围为 0.05–0.5,Countries 配置却为 1.00,正文没有解释这个例外。

实验关键数据

主实验

主表使用 filtered tail 链接预测。MRR 是正确尾实体排名倒数的平均,Hits@1/3 是正确实体进入前 1/3 的比例;下表 Hits 均为百分数。仅选最有代表性的基线,不将 NSR 写成所有数据集的最优方法。

数据集 方法 MRR Hits@1 (%) Hits@3 (%) 主表训练时间
Nations NSR 0.8142 71.64 88.16 3 s
Nations AMIE 0.8559 77.11 92.54 0.6 h
Kinship NSR 0.6515 54.21 70.67 11 s
Kinship ConvE 0.7927 68.11 88.45 64 s
YAGO3-10 NSR 0.5893 52.80 64.32 0.3 h
YAGO3-10 ConvE 0.6365 59.03 71.28 10.3 h
FB15k-237 NSR 0.3649 28.45 39.74 0.6 h
FB15k-237 NBFNet 0.5114 41.64 55.95 10.4 h

本地评测采用相同划分和 filtered-tail 协议,但部分 AnyBURL、NCRL 结果来自既有论文或官方发布,NBFNet 的时间使用官方训练 profile。跨硬件、停止标准和实现的时间只能作为效率参考,不能给出严格倍数加速结论。

附录 Table 11 给出 NSR 的训练/全测试集推理时间:YAGO3-10 为 1142 s/107 s,FB15k-237 为 2019 s/55 s。主表按小时粗略表示,不能据此声称推理也总更快;WN18RR 的 NSR 为 3.3 s/32 s,而 NBFNet 的全测试集推理为 12 s。

额外组合测试中,Countries S3 的 NSR MRR 为 1.0000,Hits@1 为 100.00%;Kinship1990_EXTENDED 的 MRR 为 0.9533,Hits@1 为 94.33%,但 Hits@3 的 96.47% 低于 DistMult 的 97.75%。这些结果支持特定组合结构上的优势,不支持普遍取代嵌入方法。

消融实验

以下来自完整动力学模型而非仅静态统计版本。每项使用五个配对种子,报告 MRR 均值与总体标准差;括号是原文 Table 12 的配对差值,不能用已四舍五入的均值自行重算替换。

配置 Nations MRR Kinship MRR Kinship1990_EXTENDED MRR
完整模型 0.81 ± 0.03 0.65 ± 0.01 0.95 ± 0.00
去掉逆关系编码 0.66 ± 0.03 (−0.15) 0.05 ± 0.00 (−0.60) 0.10 ± 0.00 (−0.85)
去掉关系关联检索 0.61 ± 0.01 (−0.20) 0.42 ± 0.00 (−0.24) 0.82 ± 0.00 (−0.12)
去掉组合推理 0.79 ± 0.03 (−0.03) 0.48 ± 0.01 (−0.17) 0.46 ± 0.00 (−0.48)
去掉 Hebbian 学习 0.36 ± 0.01 (−0.45) 0.05 ± 0.00 (−0.60) 0.02 ± 0.00 (−0.93)

去掉逆编码需要从头重训;去掉关联检索或组合推理只关闭查询时分支、复用原训练网络;去掉 Hebbian 学习保留三元组编码但让两类关联权重维持为 0。因此,这些行测试的干预不同,不能解释为四个等价规模的模块删除。

关键发现

  • 组合推理在扩展家谱上损失 0.48 MRR,在 Nations 上仅损失 0.03,符合两种数据的构造差异。
  • 无 Hebbian 学习时候选分数退化,残余 MRR 可来自并列排名随机打破,不代表仍有有效的潜在推理能力。
  • WN18RR 的 NSR MRR 是 0.472,低于 AnyBURL 的 0.5658 和 NBFNet 的 0.5976;其 Hits@1 0.463 只是在报告该指标的条目中领先。
  • Nations 发现 exportbooks + releconomicaid → embassy 的关联权重为 0.93。它是训练图中的路径支持,不应解读成外交因果律。

亮点与洞察

  • 解释来自计算本身:可以定位检索错了哪个关系、走错了哪条边,区别于只展示最终相似度热图。追踪单元与路径不需要另外训练解释器。
  • 分离关系复用与实体遍历:先发现哪些关系链可以替代查询关系,再在实体图中执行。可迁移到结构化检索系统,但需要保留来源边和路径去重信息。
  • 统计加速有明确适用条件:静态图可以批量计数,持续到来的经验则涉及顺序和更新率。将二者分开报告比用统一“脑启发网络训练时间”概括更准确。

局限与展望

  • 模型假定实体和关系已符号化,尚未验证时序、超关系、事件图或从原始输入抽取结构后的表现。规模扩大后,组合枚举需要稀疏激活或近似提议机制。
  • 路径证据依赖训练图完整性;缺失、矛盾和强相关路径可能破坏关联权重及求和排序。后续应报告噪声、缺边和路径相关性控制实验。
  • 在线 Oja 更新与离线经验均值的关系需要更严格推导和对应实验;已有消融支持计算组件有用,不是生物真实性的实验验证。
  • 自建数据说明从 24 人的两家族重建,但最终列出 480 实体、14 关系;原有 12 关系加 sibling 和五类链标签的保留、替换、扩展过程未交代完整,不能由笔记补造生成方案。
  • 消融表的配对差值与显示均值直接相减有差异,可能涉及未显示精度;主文 AMIE/Nations 的 0.6 h 与附录的 2246 s 也没有说明转换口径。应保留各表原值而非自行修成一致。

相关工作与启发

  • vs ConvE / RotatE:前者把兼容性放入向量打分,NSR 在显式连接中执行替代关系和组合链。NSR 轨迹可读,但 Kinship 和部分大图上的精度并不占优。
  • vs AMIE / AnyBURL / RNNLogic:同样利用规则或路径结构,NSR 将关联保存在网络权重并以动力学解释检索与遍历。静态邻接统计与传统规则支持计数接近,需要通过严格匹配实现来隔离架构贡献。
  • vs NBFNet:NBFNet 在图上执行学习的路径聚合,NSR 的中间状态直接对应符号实体和关系。可解释性更直接不意味着精度或推理成本必然更好。
  • vs TEM / Vector–HaSH:借用路径积分与关联记忆思想,但扩展到有类型的离散关系图。这里的状态轨迹是计算类比,不是新的神经记录或人类认知机制证据。

评分

  • 新颖性: 4/5。实体—关系绑定与组合关联形成统一可追踪架构,但静态实现与既有路径统计的区别仍需细化。
  • 实验充分度: 4/5。多类基线与配对消融覆盖较广,但时间口径、数据构造及在线—离线等价性有待澄清。
  • 写作质量: 4/5。机制与推理轨迹清楚,部分算法方向、统计推导和数值表述仍有不一致。
  • 价值: 4/5。适合研究可检查的知识图谱推理,不宜外推为通用逻辑保证或脑机制验证。