跳转至

AgentHop: A Diagnostic Benchmark for Agentic Multi-Hop Scientific Question Answering

会议: NeurIPS 2026(作者自报 Evaluation and Datasets track accepted;本笔记未独立核验录用状态)
arXiv: 2609.34428
代码: https://github.com/JohnnyNLP/agenthop
数据: https://huggingface.co/datasets/nlpai-lab/agenthop
领域: LLM Agent
关键词: 科学多跳问答、诊断评测、引用图导航、证据综合、资源约束

一句话总结

AgentHop 将 1,011 道科学文献四选题放入七工具、三重预算沙箱,用论文召回、条件转化率、调用模式与资源失败四个轴解释智能体为何答错;论文测试中 Gemini-3 Pro 的准确率为 89.1%,但相近总分也可能掩盖不同的检索与综合瓶颈。

研究背景与动机

科学文献问答不是搜到一段文本后复述:研究者通常从一篇论文出发,沿引用找到相关方法,再读取实验章节,把分散在不同论文里的结论联系起来。语言智能体必须在一次轨迹中完成导航、内容读取、证据综合和作答时机选择。若只记录最终是否答对,就无法区分没有找到目标论文、读到了不相关章节、证据齐全却理解错误,以及一直探索到预算耗尽这些失败。

已有评测覆盖了其中的不同侧面。HotpotQA、2WikiMultiHopQA 重视多跳问答,OpenScholar 重视科学文献综合,BFCL 重视工具调用正确性,AgentBoard 提供轨迹进度诊断;但它们的任务设置与报告方式并不共同提供本文所需的四轴视图。科学语料的章节结构和引用图使这种诊断变得可行:题目可以指定正确论文及证据位置,工具日志可以记录实际交付了哪些章节,资源状态也能在每一步显式告知模型。

AgentHop 因此不是新智能体算法,而是把“找证据—用证据—组织动作—控制消耗”同时测量的评测仪器。受控沙箱牺牲了真实网页的开放性,却减少了环境变化,让不同模型面对同一题目和同一预算。核心 idea:用具有论文与章节级证据标签的科学问答,结合完整工具轨迹,把一个准确率拆成可检查的条件诊断,而不是把所有失败混为能力不足。

方法详解

整体框架

每题输入包含系统提示、一个种子论文 ID、研究问题和 A–D 四个选项;正确论文不直接提供。智能体从种子出发检索、跟随引用、查看章节并读取内容,最后调用 submit_answer 提交一个选项。评测同时保留答案、实际收到的论文文本、工具序列及资源消耗,因此能够在同一运行中计算四类诊断。

数据包含 7,205 篇论文及超过 450K 条引用边。种子来自 2022–2025 年的九个计算机科学会议,包括 NeurIPS、ICML、ICLR、ACL、EMNLP、NAACL、CVPR、ECCV、SIGIR;不能据此推断引用邻域内所有目标论文都来自这些年份与会议,附录示例就使用了 WebGPT 等更早工作。每题两跳邻域平均有 311 篇论文,中位数为 315,范围为 82–667;其中可读章节论文数的中位数为 137,范围为 8–274。

任务按两个维度交叉划分。单目标 ST 只需一篇正确论文,多目标 MT 需要两篇;深度 d1 表示种子直接引用目标,d2 表示路径中有一篇桥接论文。四个单元的题数分别为 ST/d1 90、ST/d2 478、MT/d1 396、MT/d2 47,总计 ST 568、MT 443。这是引用路径深度与目标数量的设计划分,不是模型实际工具调用轮数;ST/d2 也不等于必须把两篇目标论文综合起来。

本文没有可训练网络,故不将章节提纲硬画成网络结构图。下面按题目构建、受限交互、指标定义和轨迹分析解释评测机制。

关键设计

1. 证据约束的题目构建:让错误选项对应不同信息来源

八阶段流程先从 953 篇种子扩展出 17,983 条候选引用链,再生成 1,651 道问答并补齐三个干扰项。链筛选要求相邻论文共享引用的 Jaccard 分数至少 0.08,具有至少 80 字符的实质性方法或结果引用上下文,并由 GPT-5.4 对“值得沿引用追问”的程度给出 1–5 分,只保留至少 4 分的链。生成器看到种子、目标全文及引用元数据,却被要求不在问题中直接点名目标标题或方法,避免答案定位退化为关键词匹配。三个干扰项分别来自仅阅读种子、阅读非正确邻接论文,以及无论文上下文的参数知识作答;生成时让模型真诚地从错误或缺失来源回答,而不是简单写一句显然错误的话。这使选错选项具有一定诊断含义,但不能反向把每次选项错误都唯一归因到对应机制。

随后 GPT-4.1、Claude Sonnet 4.6、deepseek-chat 的集成筛掉种子捷径与提供全文仍难以达成答案共识的题,共去除 502 道;结构检查再去除 71 道,保证保留题的种子、桥接及正确目标具有可解析正文。七名研究组学生对余下 1,078 道作单人全覆盖审核,检查问题、答案支持及证据章节标签;116 道被标记,主作者复核后去除 35 道。再修补可疑证据标签并去除 5 道不可恢复题,最后按单章节 70,015 字符的 p99.9 阈值去除 27 道解析折叠异常,留下 1,011 道。人工审核是单人覆盖而非设计好的双人独立编码,GPT-5.4 的审核指南也可能形成锚定;流程严密并不等于已有审阅者一致性统计。

2. 七工具与三重预算:把选择性阅读和及时提交变成任务的一部分

文献工具中的 get_paper_info 返回标题、摘要等元数据,get_references 返回引用及上下文,list_sections 返回章节名、字母别名及字符数,search_papers 返回最多 10 个匹配论文的标题与摘要,四者每次各耗 1 点。read_section 返回完整章节,每次耗 5 点;章节可以用完整标题、字母别名或唯一的不区分大小写子串指定。只有这个工具交付评测所认定的正文证据,摘要可辅助导航但不算论文召回。think 将思考文字保留在轨迹中而不改变环境,submit_answer 终止作答,二者不耗工具点数;免费不意味着不消耗轮次或 token。主文称关键词工具为 keyword_search,工具目录与消融称 search_papers,本笔记沿用后者并保留这一命名差异。

每题最多 20 个助手轮次、累计 200K 输入加输出 token,以及 30 点工具预算。累计 token 是每轮输入输出相加,不是某个时刻的上下文窗口长度;历史内容反复进入输入也形成开销。读章节按固定 5 点收费,但文本长短不同,因此点数与 token 是两种不同约束。即使只做阅读,30 点理论上最多支持六次;实际导航还要付费。邻域中的元数据节点可用于跟随引用,却可能没有可读正文,先查章节能识别这种状态,避免把宝贵阅读机会浪费在死路上。每个工具结果都告知当前轮次、累计 token 和已用预算,所以评测的是模型在知晓资源状态时能否规划,而非暗中设限。

预算不足的调用不会扣点,也不会交付内容。第一次被拒后,提示要求下一轮根据已有证据提交;若再次连续发生预算拒绝,轨迹按 budget 终止,成功调用会清零连续拒绝计数。因此主文的“一轮重试”不能理解为重新获得预算或多一次免费阅读;零点余额仍可以调用免费的思考或提交。累计 token 在每个助手响应后检查,超限立即终止;20 轮内不提交则按 max_turns 终止。未知工具、缺参数或损坏 JSON 作为工具错误返回,不算一次新的样本重跑;硬 API 错误最多重试两次,瞬时错误原位重试且不消耗轮次。

3. 四轴指标:明确“到过论文”与“读到答案证据”的区别

检索轴的论文召回是逐题二元事件:对于该题每一篇正确论文,都至少有一个章节的文本通过 read_section 成功交付。MT 只读到一篇、仅得到元数据、调用被拒或参数错误,都不满足召回。章节召回更严格:每篇正确论文至少交付一个包含 direct 标签证据位置的章节;supporting 标签仅提供解释背景,不能替代直接证据。人工标签可能是原生子章节,而工具读取顶层章节,故评测把子章节映射到包含它的可读父章节,避免“读到了子章节全文却因标题不同不计分”。在 19 个模型合并的 11,072 条论文召回轨迹中,附录报告 85.7% 收到直接标注证据,另有 14.3% 没有;论文召回显然不是完整证据召回的同义词。

综合轴的 conversion 是满足论文召回的题中答对的比例。工具轴的 calls/turn 是每个助手轮次平均发出的工具调用数:大于 1 表示至少存在同轮批量发出,但高值本身不是质量目标,也不证明服务器真的并行执行。资源轴报告平均 token、轮次、点数,以及触及各限制而未提交的比例;准确率将未提交计为错误。设 \(r_i\) 表示论文召回、\(c_i\) 表示答对,核心条件诊断为:

\[ \mathrm{Conversion}=P(c_i=1\mid r_i=1). \]

这个条件值不是对推理能力的因果隔离。各模型召回的题目子集不同,容易题占比不同就可能改变 conversion;而且召回只要求读过正确论文的任一章节。没有召回仍能靠先验知识、摘要、选项排除或猜测答对,因此不能写成“准确率=召回率×conversion”。按事件分解,正确关系是:

\[ P(c_i=1)=P(r_i=1)P(c_i=1\mid r_i=1)+P(r_i=0)P(c_i=1\mid r_i=0). \]

论文为比较模型综合表现,在共同召回的同一题子集上做精确 McNemar 检验,附录称这些比较经过 cap-corrected 处理。例如 Gemini-3 Pro 对 Sonnet 的 MT 比较有 226 道共同题,分歧对为 20/3,双侧 \(p=0.0005\);Sonnet 对 GPT-5.4 的 193 道共同题得到 \(p=0.27\),不能仅按各自条件比例给出可靠优劣排序。共同题配对缓解了题目难度混杂,但仍不能消除召回选择、接口与推理配置的全部混杂,也不能把结论外推到所有未召回题。

4. 轨迹条件分析:用停止策略和调用转移解释瓶颈

轨迹分析观察智能体第一次读到正确论文、读齐 MT 两篇论文、以及读错论文之后的动作。MT 召回失败进一步分成完全没读到正确论文、读到一篇后过早结束、继续探索但找不到第二篇、只停留在已读正确论文;这比只报告 MT 召回下降更能指出该改导航还是该改停止策略。ST 与读齐 MT 后的动作再区分立即提交、先思考和继续阅读,另有少量只导航的残余。二元调用组分析比较含某个连续工具对与不含该对的轨迹准确率,三元组分析记录连续三次调用的高频模式及其占全部三元组的比例,用于刻画动作习惯而非新的成功率指标。

统计解释必须保守:调用 think 之后表现较好,可能是强模型更常这样做,或较容易的轨迹更有余量,并不证明插入该工具能提升准确率。附录对 49 个候选二元组作 Bonferroni 校正,但这仍然是观察性关联。所谓模型“家族指纹”是本文少数 checkpoint 在原生服务接口下的表现;同轮工具支持、解析器、隐藏思考和参数默认值都不同。不能把两个 checkpoint 的习惯归结为整家厂商永久的训练机制,更不能据此声称已定位某种网络架构的因果缺陷。

损失函数 / 训练策略

本文不训练模型,没有新的损失函数。题目生成与模型集成筛选是数据构建程序,不是对 19 个测试模型进行微调。

论文统一了任务提示、工具和预算,但未统一全部推理配置:Opus 使用 8,192 token 的扩展思考加外部 think,Sonnet 使用外部 think,GPT 模型使用 medium reasoning effort;各服务默认温度与本地解析器也不同。

模型名只表示论文报告的测试 checkpoint,不表示当前官方供给或实时排名。附录表 7 说明测试窗口内 deepseek-chat 与 deepseek-reasoner 都映射到 DeepSeek-V3.2,区别是非思考与思考模式;不能按表 8、15 的旧标签把它们当成 V3 与 R1 两代权重。

实验关键数据

主实验

以下摘录主文表 2;召回与 conversion 是比例,token 单位为 K,最后一列是所有 1,011 题的准确率。ST/MT 的条件分母不同,不应把两列无条件平均成统一综合能力分数。

论文测试的 checkpoint 论文召回 ST / MT Conversion ST / MT 调用/轮 平均 token(K) 准确率
Gemini-3 Pro 0.868 / 0.752 0.957 / 0.970 1.05 92.4 89.1%
GPT-5.3 codex 0.812 / 0.623 0.896 / 0.902 1.44 69.5 82.5%
Claude Opus 4.6 0.873 / 0.777 0.871 / 0.855 1.25 110.5 77.5%
Claude Sonnet 4.6 0.798 / 0.600 0.936 / 0.891 1.32 95.8 76.6%
GLM-5.1 0.768 / 0.673 0.830 / 0.768 1.20 102.0 69.6%
Gemma-4-31B 0.621 / 0.521 0.788 / 0.861 1.01 87.6 64.8%
Kimi-K2.5 0.764 / 0.569 0.613 / 0.504 1.08 115.5 44.1%

Opus 与 Sonnet 仅差 0.9 个准确率百分点,却分别体现较高召回与较高条件转化率。Gemma-4-31B 的 MT conversion 为 0.861,而 MT 召回只有 0.521,提示改善导航值得检验;这不证明其在所有题目上的综合能力接近前沿模型。

消融实验

表 4 的三模型实验保留相同预算。无关键词搜索仍有引用导航、章节读取、思考和提交,不是只给定正确文献;闭卷则无工具、单轮从问题和四个选项作答。

配置对应的 checkpoint 闭卷 去关键词搜索 完整七工具 获得引用导航等工具增益 加回关键词搜索增益
DeepSeek-chat 18.3% 53.3% 56.4% +35.0 pp +3.1 pp
Gemma-4-31B 31.7% 54.8% 64.8% +23.1 pp +10.0 pp
GPT-5.3 codex 48.6% 79.3% 82.5% +30.7 pp +3.2 pp

引用跟随与内容访问提供了三模型的大部分工具增益,但 Gemma 的关键词搜索增益仍有 10.0 pp;“关键词搜索可有可无”不能外推成所有模型或任务上的结论。表 18 还报告 Gemini-3 Flash 从闭卷 57.3% 降至完整工具 54.7%,说明加入智能体循环也可能因非提交等行为损失而减分。

关键发现

  • 资源限制有实际区分力:表 2 的 Gemini-3 Flash token 超限率为 27.7%,Gemma-4-26B-A4B 为 37.0%;低 token 消耗也可能是提前放弃,而非高效率。
  • 三次全量重复的准确率:DeepSeek-chat 为 0.564/0.553/0.542,GPT-5.3 codex 为 0.825/0.818/0.810,Gemma-4-31B 为 0.648/0.585/0.581。表 17 的标准差分别为 0.009/0.006/0.031,不能称所有模型都具有一百分点以内的波动。
  • MT/d2 只有 47 题:表 10 中 DeepSeek-chat 的 48.9% 带 Wilson 95% 区间半宽 13.8 pp。小单元不足以支持细粒度稳定排名。
  • 论文报告 Cronbach’s \(\alpha=0.997\),但仅以 19 个模型作为响应者、1,011 题作条目;高内部一致性不是四轴构念有效性或领域泛化的独立证明。

亮点与洞察

  • 同时记录“收到什么”与“随后怎么做”,让答错诊断可落到具体轨迹。论文级召回与章节级证据接触的区别尤其适合迁移到文献 RAG 评测。
  • 工具点数与累计 token 分开计账,揭示固定调用成本和文本长度成本并非一回事。资源状态全公开,使预算意识本身成为受测行为。
  • 相近总分不等于相近改进方向。对导航、证据综合和停止策略分别做受控干预,比直接选一个较高总分模型更能验证诊断是否有用。

局限与展望

  • 闭卷高分可能来自文献预训练暴露,也可能来自四选题选项线索与猜测。表 19 未发现引用数或年份的单调梯度,不能据此排除数据污染;未召回答对也不能直接证明证据综合成功。
  • GPT-5.4 同时参与问题、干扰项和审核指南生成。更换 Inkling 生成器后的 94 题子集上 GPT-5.4 为 78.7%,95% 区间 69.4–85.8%,原集合为 79.0%;小样本的接近不证明无生成器偏差,也不足以支持四轴比较。
  • 语料集中在计算机科学,输出为四选题,金标准路径有正文保障;真实科研中的不完整证据、开放式论证、错误引用及其他学科未覆盖。单人审核缺少独立双编码一致性检验。
  • 原文有未解决的口径冲突:二元组效应在主文为 +9.8/+10.6/−6.8 pp,表 13 为 +13.6/+12.6/−11.5 pp;表 2 与 cap-corrected 表 15 的部分终止率不同,如 Flash token 为 27.7% 对 30.4%。不混用这些数值,也不自行替作者校正。
  • 附录 G 说 Kimi 的 SayCan 读取被预算拒绝,却又标论文召回为 1,与“必须成功交付每篇正确论文章节”的定义表面冲突;仅凭缓存叙述无法确认是否另有成功读取。该示例不作为已证实的召回案例。
  • 后续应在同题配对基础上随机化工具策略、统一或分层报告服务接口,增加跨域开放式问题,并直接检验诊断建议能否改善目标轴,而非将观察相关当作处方。

相关工作与启发

  • vs AgenticRAGTracer:前者主要沿链几何分析哪一跳出错,AgentHop 另看论文召回后的条件作答和预算终止。两者可以互补,但 conditional conversion 仍不是无混杂的推理隔离。
  • vs OpenScholar / HotpotQA:都涉及证据检索或多文档推理;AgentHop 的特色是从种子导航、章节交付日志及受限工具协议,而不是声称已有问答基准完全不测检索。
  • vs BFCL / AgentBoard / ReAct:工具正确性、进度诊断和行动—观察—思考提供了互补视角。AgentHop 的调用模式统计为这些视角添加行为证据,不构成新的 ReAct 训练方法。

评分

  • 新颖性: 4/5 — 四轴日志诊断与科学引用导航结合,比单总分更具解释性。
  • 实验充分度: 3/5 — 19 模型、配对检验及工具消融较丰富,但接口混杂、审核与小样本限制仍明显。
  • 写作质量: 3/5 — 指标和附录细节充分,部分表格口径、命名与示例存在冲突。
  • 价值: 4/5 — 适合检索型智能体的受控诊断,不应视为跨领域通用能力或厂商排名。