跳转至

SciR: A Controllable Benchmark for Scientific Reasoning in LLMs

会议: NeurIPS 2026 — Evaluations & Datasets track(非 main track)
arXiv: 2606.13020
代码: https://github.com/idiap/scir
领域: LLM 评测
关键词: 科学推理、前提抽取、形式化验证、可控基准、神经符号推理
版本依据: arXiv v3,2026-09-25

一句话总结

SciR 先生成可验证的演绎、归纳与因果发现问题,再将前提改写为多篇科学体裁文本,通过分别改变推理复杂度与前提混淆来诊断 LLM;即使使用符号求解器,文档形式化仍是显著瓶颈。

研究背景与动机

科学推理不只是知道某个领域的事实,还要从文档中提取证据、对齐实体、辨别观测与干预,再按正确规则得到结论。现有形式推理基准往往能提供精确答案,却把前提写成干净的规则列表;科学问答或文献核验更接近真实材料,但答案常依赖人工判断,也难以单独调高某种推理负担。因此,一次答错可能是没读到证据,也可能是证据读对了却推错了,排行榜上的单个分数很难解释这种区别。

SciR 把三个任务分别落在发育生物学谱系逻辑、基于 DrugBank 背景事实的关系规则归纳,以及 Sachs 蛋白信号网络上的因果结构恢复。这里的科学性主要来自领域词汇、问题形态和文档体裁,而不是使用真实实验记录作为最终验证对象。作者先固定形式对象与答案,再让 LLM 将其拆分改写为实验记录、数据库条目、论文结果等文本,使同一个问题拥有清洁与混淆两种呈现。

核心 idea:先用形式对象锁定可验证答案,再用可回译检查约束科学文本改写,构造“推理复杂度 × 前提混淆”的双轴评测,把证据抽取与后续推理的弱点分开观察。

方法详解

整体框架

SciR 是基准生成与评测管线,不是新网络,也不训练被测模型。输入是任务族和难度参数,输出是带形式参考答案的多文档问题,以及不同解题架构的成绩。流程依次包含形式任务生成、科学文本渲染和双轴诊断评测;参考答案只参与构建检查与评分,不作为被测模型的额外输入。

下面的图区分离线构建与解题过程。实线表示任务及答案的流向,虚线表示回译验收或评分依据;不存在训练监督分支。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["任务族与难度参数"] --> B["形式任务生成"]
    B --> C["科学文本渲染"]
    B --> G["形式参考答案"]
    C -.->|回译验收后保留| C
    C -->|清洁或混淆文本| D["双轴诊断评测"]
    G -.->|评分依据| D
    D --> E["抽取、推理与联合成绩"]

关键设计

1. 形式任务生成:在写科学文本之前确定答案与推理负担

三个轨道共享“先生成潜在结构、再呈现证据”的原则,但正确性标准并不相同。演绎轨道从包含 2–3 个前提的三段论出发,反复用另一组三段论前提替换已有前提,得到需要恢复中间结论的证明树。替换要避免在已相关变量间引入新的蕴含关系;保留结论得到 True,否定结论得到 False,删除一个前提构造 Unknown。Unknown 不是“没出现就为假”,而是现有前提不足以证明命题或其否定。

为避免只沿着最显眼的一条链走到答案,作者加入结论相同但不完整的 Unknown 干扰树,再从 20 个手工整理的发育生物学语境中选词实例化谓词。深度对应前提展开次数,增加证明链负担;宽度对应干扰树数量,既增加候选推理路径,也稀释有效信息。因此,双轴在生成器参数层面可分别控制,不意味着认知负担能够完全正交分离。

归纳轨道要求找出解释观测关系的规则,而不是判断某一对实体是否存在关系。生成器抽取一个目标规则和若干干扰规则,为每条规则选择正例,再为每条干扰规则加入一个会触发它、但不会触发目标规则的负例。背景事实只保留候选规则涉及的谓词,但每个候选仍须在分散的关系事实与负例之间完成一致性检查。增加干扰规则数量扩大淘汰候选的负担;增加每条规则的正例数量则扩大背景事实集合。

v3 的评分尤其重要:答案不是必须等于生成时抽到的目标规则,也不是必须覆盖全部正例。输出是九种关系类型中带重复的无序二元组合,排序后表示;总搜索空间有 45 对。评测接受同属一个关系类别、至少覆盖一个正例且不覆盖任何负例的所有规则。若用 \(F\) 表示背景事实,\(P,N\) 表示正负例,\(r\) 表示候选规则,其核心验收条件可写为:

\[ \operatorname{valid}(r)=\mathbf{1}\!\left[\exists p\in P:\ F\cup\{r\}\models p\right]\,\mathbf{1}\!\left[\nexists n\in N:\ F\cup\{r\}\models n\right]. \]

该式是对原文文字判据的整理,不是另设的训练损失;同类别约束还需单独满足。作者枚举 45 对构造答案池,并用限制到对应关系对的 Popper 验证:全部 400 个主评测归纳任务的答案池与求解器接受规则一致。Easy 有 131/200 个任务是单答案,Hard 有 105/200 个;其余任务至多四个答案,平均池大小分别为 1.43、1.58。采用答案池能避免把有效替代规则误判为错误,但也意味着此任务测的是受限规则解释,而非唯一机制发现。

因果轨道抽取 Sachs 网络的连通子图,加入虚构蛋白 XYZ 及随机有向连接,再用线性高斯结构因果模型模拟观测与干预浓度。模型看到已有子网络边和不同环境的数据,需要恢复 XYZ 的连接。虚构实体减少靠记忆直接作答的机会;数据是合成的,恢复正确边并不等于验证真实生物机制。附录生成器采用接近 1 的边权,负浓度裁剪为零,并以置零或高值置换模拟抑制与激活。

因果难度由子图规模、XYZ 连接数和每环境样本数决定。更多样本原则上增强统计信号,却同时拉长输入表格、增加抽取压力,这是双轴存在耦合的另一个具体例子。主实验并非无约束开放发现,而是从候选边集合中选择答案,且使用构建时能由参考求解器解决的保留任务。

2. 科学文本渲染:保持可恢复信息,但不把科学包装等同于真实证据

清洁自然语言问题被拆成若干块,每块从该轨道八种科学文档体裁中选择一种改写。演绎可采用单细胞报告、发育生物学结果或数据库条目;归纳采用领域数据库、研究摘要等;因果采用实验记录、蛋白组学报告或补充数据。混淆并不只是末尾加无关句,而是把量词、实体关系、干预条件或数据行藏在体裁惯用的叙述里,并将干扰信息交错插入。

每个改写块必须通过逆变换:逆向模型拿到改写文本及其余原始块作为上下文,恢复原始结构块。匹配失败则重试,预算耗尽就丢弃整个任务;演绎允许用 Prover9 检查一阶逻辑等价,其他情况按规定的结构匹配验收。构建时的上下文锚定帮助恢复名称和跨块指代,但求解时被测模型只看到全部改写后的文档,不会获得原始块,这正是跨文档对齐的难点。

这项检查说明生成流程存在可操作的回译验收,却不是独立证明文本没有歧义。主实验中 renderer 与 inverse 都是 o3-mini;所谓“第二个 LLM”是第二次角色调用,不是另一个独立模型。只保留该模型自己能逆向恢复的块,还可能偏向它熟悉的措辞。作者因此加入不同来源的 deepseek-r1,但这不能完全消除选择偏差或证明所有科学语义都忠实。

不同轨道有不同保真约束。演绎禁用形式符号提示并保留可恢复实体;归纳保留蛋白类别和关系角色,禁止暗示规则的评述;因果逐行保留浓度数值、打乱列顺序、把已知边与干预位置改写进叙事。主实验演绎和因果各两块,归纳三块。这里的 rendering 是文本体裁改写,不是图像渲染、视觉输入或 VLM 任务。

3. 双轴诊断评测:用求解器替换推理,观察形式化瓶颈

每个轨道分别设置 Easy/Hard 与 NL/Obf,前者改变潜在形式对象,后者比较清洁自然语言与科学文本混淆。演绎 Easy/Hard 深度为 4/5、干扰树数为 1/2;归纳为 2/3 条干扰规则,每规则两个正例;因果为 5/6 节点子图、1/2 条 XYZ 连接。不同轨道的答案空间不同,所以不能把原始百分比直接当成等难任务的成绩。

三种解题方式承担不同角色。CoT 从任务文本直接推理;神经符号管线 NS 用 LLM 形式化输入,再交给 Prover9、Popper 或 GIES;SymbCoT 采用与 NS 相同的形式化步骤,但让第二次 LLM 调用从形式文本解答,而不是执行符号求解器。比较 NS 与 SymbCoT 能观察收益是否主要来自求解器,而不只是把文本换成符号形式;不过后者对 Prolog 输入的不熟悉也会影响比较。

NS 仅在语法或解析错误时重试,最多两次重试、合计三次形式化尝试,不接收正确答案反馈。CoT 无重试;SymbCoT* 是单轮形式化后回答,包含两个调用而非迭代纠错。归纳按答案池判分;因果 GIES 输出通过选项匹配转换为答案,若发现图严格包含某选项边集合,还允许子集匹配。因此,主实验 NS 因果成绩不能解读为开放答案的整图精确恢复率。

作者用 NL·CoT 近似探测推理,用 Obf·NS 探测抽取与形式化,用 Obf·CoT 探测二者联合。它们是操作性诊断:清洁文本仍需解析,而形式化本身也需要推理,不能理解为两个心理能力的完全独立测量。跨任务汇总使用随机机会校正准确率,并将低于机会的结果裁剪为零:

\[ A_{\mathrm{norm}}=\max\!\left(0,\frac{A_{\mathrm{raw}}-c}{1-c}\right). \]

其中 \(A_{\mathrm{raw}}\) 与 \(c\) 使用 0–1 比例。演绎机会值为 1/3,归纳 Easy/Hard 为 3.2%/3.5%,因果为 10%/5%。归纳机会值是随机关系对落入答案池的期望比例,不是简单使用 1/45。论文主表是原始准确率,图与诊断汇总是机会校正分数,两者必须分开报告。

实验关键数据

主实验

六个基础模型通过 OpenRouter 评测,每个单元 200 个任务,传入温度 0;推理模型内部仍可能采样。下表摘录原文 Table 1 的 Hard 层,单位为原始准确率百分比;每格是 NL → Obf,不是机会校正成绩。

模型 架构 演绎 Hard 归纳 Hard 因果 Hard
gpt-4o CoT 54.0 → 33.5 28.0 → 25.5 46.0 → 33.0
gpt-4o NS 97.0 → 43.0 73.5 → 40.5 98.0 → 78.5
o3-mini CoT 52.5 → 23.5 45.5 → 39.5 85.5 → 70.5
o3-mini NS 99.0 → 67.0 74.0 → 51.0 92.0 → 97.0
deepseek-r1 CoT 93.0 → 56.5 91.5 → 26.0 88.5 → 85.5
deepseek-r1 NS 98.0 → 73.5 84.5 → 69.0 69.0 → 75.0
llama-3.3-70b CoT 42.5 → 30.0 17.5 → 18.5 33.0 → 23.0
llama-3.3-70b NS 88.5 → 48.0 67.5 → 39.0 97.0 → 80.5
qwen3-30b CoT 80.0 → 39.0 44.0 → 16.0 44.5 → 49.5
qwen3-30b NS 77.5 → 58.5 41.5 → 38.5 91.5 → 70.5
olmo-3.1-32b CoT 49.5 → 30.0 36.0 → 23.5 4.0 → 11.0
olmo-3.1-32b NS 82.0 → 38.5 19.5 → 17.5 44.0 → 24.0

gpt-4o 的演绎 NS 从 97.0% 降至 43.0%,说明正确求解器不会自动弥补错误输入;deepseek-r1 的归纳 CoT 从 91.5% 降至 26.0%,显示强推理也可能被证据呈现击穿。另一方面,因果中若干混淆单元反而上升,所以“混淆伤害每个模型”应理解为整体趋势,不能扩大为每个单元必然下降。

消融实验

这是呈现方式与求解架构分析,不是训练模块消融。下表来自 Table 2,报告 Hard 层每题平均字符数和 gpt-4o NS 抽出的条目数;条目分别是一阶逻辑子句、归纳背景事实、因果数据行。

轨道 输入字符数 NL → Obf 参考条目数 抽取条目数 NL → Obf 可观察的问题
演绎 3.2k → 9.4k 32.8 33.9 → 39.2 数量超过参考,可能混入伪前提
归纳 8.2k → 23k 142.9 122.3 → 48.5 混淆后大量事实没有被形式化
因果 4.1k → 17k 64.0 64.0 → 50.7 表格叙事化后遗漏数据行

条目数不是抽取精确率或召回率:重复、错误实体和错误关系也可能贡献计数。它支持“漏抽与伪前提是实际故障”的解释,但不能仅凭数量判定抽取完全正确。SymbCoT* 的归纳表现也提示形式化不是万能改进:gpt-4o 在 Easy·NL 上只有 10.5%,而直接 CoT 为 46.0%。

v3 另加入 GPT-5.4 前沿模型检查,使用高 reasoning effort、每设置 50 题,不属于六模型主实验的 200 题单元。

GPT-5.4 设置 答对数 实验边界
演绎 Hard·Obf 49/50 直接 CoT,科学文本呈现
归纳 Hard·Obf 25/50 答案池评分
归纳 Hard·NL 50/50 与上一行同一批任务
因果 Hard·Obf 50/50 主实验选择题格式
因果完整 Sachs 图·NL 30/50 11 蛋白、19 已知边、5 条 XYZ 边,开放精确答案

关键发现

  • 双轴影响可叠加:gpt-4o CoT 的跨轨道机会校正均值依次为 NL Easy 42.6、NL Hard 33.2、Obf Easy 30.1、Obf Hard 17.5;不能拿这些均值与上表原始百分比直接比较。
  • 推理模型的优势更偏向推理轴,但 o3-mini 同时担任文本改写和回译模型,其抽取成绩有选择偏差风险;NS 表现还取决于形式化质量和任务接口。
  • 前沿模型并未让全部任务失效:GPT-5.4 归纳混淆版为 25/50,清洁版为 50/50;在 25 个单答案任务中也只有 8/25 对 25/25,不能把差距归因于答案多义性。
  • 因果扩展检查同时改变图规模和答案形式,30/50 不能当成只增加推理复杂度的纯消融。主实验也没有多随机种子误差条。

亮点与洞察

  • 将“能推理”与“能把科学文本形式化”放到同一任务的配对版本中,而不是比较两个无关测试集。这样可以研究多轮抽取、实体一致性检查等改进究竟补在哪个环节。
  • 归纳答案池把有效替代规则纳入评分,同时要求所有负例都不被覆盖。相比只匹配生成目标,这更符合给定证据下的规则解释任务。
  • 发布生成器比发布固定题库更适合模型能力持续变化的场景。难度可以继续提升,但每次变化仍须重新检查答案空间、机会基线与参考求解器可解性。

局限与展望

  • 真实科学文档通常没有如此清洁的潜在形式对象,且每种推理只绑定一个领域表面;目前不能据此推广到真实文献发现,更不能把合成因果恢复当作生物实验验证。
  • 缺少同等复杂度的非科学文本对照,输入长度、跨文档对齐与科学体裁效应没有完全分离。未来可在相同事实、长度和分块条件下比较科学与非科学呈现。
  • 回译者与改写者使用同一模型,且回译得到额外原始上下文。更强验证可引入不同模型、实体关系逐项核验,以及针对改写歧义的人工审查。
  • 主评测是单次运行、每单元 200 题;温度 0 不保证推理模型内部确定性。作者报告约 1,500 美元 API 成本,没有测量跨运行方差。
  • 原文有需保留的边界不一致:正文称联合成绩总低于两个单轴成绩,但 deepseek-r1 因果 Easy 的机会校正联合成绩为 100.0,高于推理 99.4 和抽取 88.9,故该句不是逐单元成立。
  • 失败分析称每轨道选 30 个失败轨迹,但 deepseek-r1 因果表格只列 29 个推理错误、0 个抽取错误,合计 29;本文不补造缺失类别。归纳错误分类还采用清洁版是否成功作为控制,不等同于从轨迹直接识别抽取错误。

相关工作与启发

  • vs ProofWriter / FOLIO / SylloBio-NLI:这些工作提供逻辑答案或生物医学词汇,SciR 的增量是把前提变成多体裁、多文档证据,并把呈现难度做成可调轴;不是首次提出形式逻辑评测。
  • vs SciFact / GPQA / DiscoveryBench:真实科学材料与开放发现更接近实际工作,SciR 则牺牲部分现实复杂性换取可验证答案和参数控制,二者应互补,而非互相替代。
  • vs BABILong / GSM-∞:无关内容与长度干扰已有先例,SciR 的特色在三个推理族与领域定制科学体裁的组合,不能将双轴控制本身宣称为完全没有先例。
  • vs Logic-LM / LINC / SymbCoT:求解器或符号表达可以增强推理,但输入形式化不是免费步骤。可研究在回译检查与 NS 输入之间增加逐条证据出处核验,避免用正确后端掩盖错误证据。

评分

  • 新颖性: 4/5 — 三类科学推理、多文档体裁和双轴生成控制的组合有价值。
  • 实验充分度: 4/5 — 六模型、三架构及前沿检查覆盖较广,但缺少多次运行与非科学对照。
  • 写作质量: 4/5 — 方法与附录较完整,仍有绝对化表述和失败计数边界需澄清。
  • 价值: 4/5 — 适合诊断科学文本形式化瓶颈,不应作为真实科学发现能力的充分证据。