FlyAOC: Evaluating Agentic Ontology Curation of Drosophila Scientific Knowledge Bases¶
会议: NeurIPS2026
arXiv: 2602.09163
代码: https://github.com/xingjian-zhang/flyaoc
领域: 计算生物学 / 知识库整理
关键词: 本体整理、文献检索、智能体评测、高召回候选生成、证据可恢复性
一句话总结¶
FlyAOC 把果蝇基因知识库整理做成从大型全文语料检索到本体化候选输出的端到端评测,显示多智能体的上下文分区能改善已知可恢复注释的召回,但语义得分不等于生物事实的精确验证。
研究背景与动机¶
FlyBase 这样的生物知识库并不是论文摘要的集合,而是把基因功能、表达位置和历史名称整理成可查询的结构化记录。 专家需要找文献、读实验、区分目标基因与相似名称,再把作者的自然语言映射到受控词表。 传统命名实体识别或关系抽取基准往往已经给定相关文章,因而绕过了最费力的部分:哪些论文值得读,以及读到的新名称是否应该改变下一轮检索。
大语言模型能从选定段落提取信息,并不能直接证明它能维护知识库。 一个基因的证据散落在不同年代、不同命名习惯的论文里,检索失败、上下文过长和本体粒度错误都会使最终记录遗漏信息。 与此同时,直接拿全部 FlyBase 注释作为答案也不公平,因为公开语料未必包含原始证据,甚至证据只存在于图像或补充材料中。
本文利用已有专家注释和开放全文,构造一个可复现但有明确证据边界的候选整理任务。 它不是生物发现、湿实验或临床决策系统,而是在固定审阅容量下尽可能找回需要专家核查的结构化候选。 核心 idea:先限定哪些既有专家标签能从发布文本中恢复,再联合评测检索、跨文献提取、本体解析和候选排序,让模型与执行框架的系统性失误体现在同一个最终召回指标中。
方法详解¶
整体框架¶
FlyAOC 是基准与评测协议,不是一套必须串行经过所有基线的网络架构。 构建侧从 FlyBase 专家标签、关联文献和本体文件得到经过证据过滤的评测集合;运行侧给系统基因符号、FlyBase Gene Snapshot、全文语料和本体资源,要求返回按置信度排序的结构化注释。 标签过滤使用的已知答案只服务于评测集构建,不是代理推理时的监督输入;论文没有训练一个新的生物学模型。
运行输出覆盖三个互补任务:Task 1 返回 Gene Ontology(GO)标识符,Task 2 返回解剖结构与发育阶段的元组,Task 3 返回基因同义名称。 Task 2 的规范主指标只评价解剖结构,不评价完整元组的精确正确性;阶段标识符仍保留在输出中。 这一区别决定了“表达召回”应被理解为解剖本体覆盖,而不能解读为完整时空表达记录已正确重建。
检索型系统共享 BM25 文献搜索、全文读取、GO/解剖/阶段本体查询以及输出模式校验工具。 四个执行框架是平行比较对象:无语料检索的 Memorization、固定流程的 Pipeline、自适应的 Single-Agent 和委派阅读的 Multi-Agent。 因此这里不把它们画成串行流程图,避免将对照实验误画成一个系统的模块。
关键设计¶
1. 证据可恢复性过滤:把已知事实与代理可见证据分开
FlyBase release FB2025_04 提供专家目标标签,但语料只包含 16,898 篇 PMC 开放全文,总计超过 140 million words。 对 post-2000 的 FlyBase 引用,其覆盖率为 24%,即 16,665 / 69,404;开放文本并不代表拥有专家所用的全部证据。 因而构建者先检查某条注释的专家引用是否映射到语料文章,再判断发布的结构化文本是否真的支持该标签。 仅有引用对应关系不够:文章可能存在,但支持表达位置的显微图或关键补充材料并没有进入文本。
GO 与表达标签的第二步由 GPT-5 完成。 验证器看到目标基因、一个已知专家标签及其本体标识符/证据元数据,以及一篇专家关联文章的标题、摘要和章节文本;它只判定标签是否可恢复,并给出理由和支持片段。 同一标签若有多篇来源,采用 OR 聚合,只要其中一篇得到 supported 就保留。 允许训练有素的读者可推导出的释义或隐含证据,但不把无关提及、文本之外的证据当作支持。 这不是让 GPT-5 搜索新事实或创造新生物注释,专家的定性抽查也不是独立的正式验证集。
同义名称的支持是词面性的,直接通过文本匹配确认,不经过上述标签验证器。 原始摘要中的 7,397 条专家注释不等于主评测分母;过滤后还要按基因去重,得到 770 个 GO 项、252 个解剖项和 457 个同义名称。 这样能把“语料没有证据”和“系统没有找到证据”分开,但过滤的模型判断仍可能有误,不能称为无噪声真值。
基因选择也限定了评测人群:有 Gene Snapshot 的 3,999 个候选,经至少有 10 篇语料全文的条件缩到 3,446 个,再要求功能与表达都存在可恢复标签,得到 314 个候选,最终选取 100 个。 最终排序偏好跨任务的均衡标注,而不是只在一个任务上极为丰富的基因。 这使每个测试基因都有可评价的证据,却同时偏向研究充分的基因,不能代表所有果蝇基因的开放世界整理难度。
2. 有界候选与语义召回:评价覆盖,不冒充事实准确率
系统必须排序候选,因为专家审阅容量有限。 规范截断分别为 GO@30、解剖@10、同义名称@20,约按每个基因可恢复事实的平均数量留出较宽候选空间。 功能与解剖使用 Wang 本体语义相似度:精确匹配给满分,父项或相近项按本体距离获得部分分数;同义名称则使用忽略大小写的精确字符串匹配。
对每个目标标签,从该基因前若干候选中取最大相似度,再按真实标签数归一化。 下面将单基因定义与规范的微平均合写,符号等价于原文指标,而不是额外的训练损失:
这里 \(\operatorname{sim}(g,p)\in[0,1]\);对同义名称,换成忽略大小写后的相等指示值。 空输出或失败运行的分子为零,分母仍保留,不能删除失败基因后只汇报成功运行。 微平均让标签丰富的基因权重更大;宏平均作为诊断则让每个基因权重相同。
一个预测可以对多个目标获得相关性分数,因此高语义召回不意味着每个目标都被不同且精确的候选恢复。 附录同时报告语义 precision/F1,但参考库不穷尽全部正确注释,库外候选是否成立仍需人工检查原始证据。 这套指标适合高召回候选生成,不适合据此直接自动更新生物数据库。
3. 执行框架对照:比较反馈能力与上下文保真度
Memorization 不访问论文语料,却仍保留本体查询工具与 Single-Agent 类似的反馈机制。 它衡量参数知识能恢复多少标签,不是完全禁止工具的闭卷基线;其证据记录使用空 PMCID 和说明文本。 因此检索型系统超过它的幅度才更接近文献访问的额外价值,而不是简单的“有工具对无工具”。
Pipeline 固定经过搜索、取排名靠前的文章、逐篇提取自然语言描述、批量解析本体标识符、汇总输出这五个阶段。 每篇可并行处理,阅读上下文分开,成本较低;但发现历史名称后不会返回检索,错误映射也缺少自适应纠正回路。 先抽取描述再统一映射有利于机械化执行,却可能累积大量粒度不当或相关性偏弱的候选。
Single-Agent 采用 ReAct 式循环,自主选择工具、改写查询、重查本体和提交结果。 它可以把阅读中发现的别名、互作对象或同源基因名称反馈给搜索,但所有原始文章文本都累积在一个上下文里。 优点是细节保持完整且能直接跨文献推理;代价是上下文膨胀、注意分散以及更高调用成本。
Multi-Agent 由协调器委派文章阅读,子代理返回已经解析本体标识符的抽取结果,而不是把全部原始文本交给协调器。 协调器负责去重、冲突处理、噪声过滤和跨文献证据合并,仍可安排进一步工具调用。 这种分区压低主上下文负担,却会压缩掉限定条件或局部证据;因此平均召回上升与个别注释受损可以同时发生。 论文没有通过单因素干预完全隔离上下文稀释、检索组合和工具失败,所以这些机制解释应视为与观察一致的诊断,而非独立证实的因果结论。
4. 预算与缺失本体项:控制检索机会并检验规范化边界
常规实验每个基因允许阅读 1 / 2 / 4 / 8 / 16 篇文章,预算同时写入提示并在工具调用中强制执行。 Reference coverage 衡量所读文章覆盖了多少保留标签的独特专家引用来源;它不衡量所有相关文献,更不衡量完整生物知识的覆盖。 若检索命中来源但漏抽标签,或以相近本体项代替精确项,这个诊断量与最终得分会分离。
缺失项实验从可恢复 GO 基因—词项对中隐藏只出现在单篇语料文章中的稀有叶项。 本体搜索过滤这些标识符,代理不能输出隐藏 ID,只能给可见替代项或自然语言描述;这一设置是新概念的代理任务,不证明这些事实真实新颖。 事后解析器可以访问完整本体来检查描述与隐藏目标的接近程度,不能把这个事后访问混作代理推理时的能力。
损失函数 / 训练策略¶
本文不提出优化损失,也没有通过微调训练基线;性能来自现有模型与提示、工具、编排和上下文管理的组合。 温度统一设为 1.0,每个基因最多 50 轮,费用上限按模型设为 1–10 美元,其余参数使用提供方默认设置。 精确复现论文表格依靠冻结的规范化预测和固定评测文件;重新调用 API 只能重现流程,不能保证当前服务返回历史同样的输出。
实验关键数据¶
主实验¶
以下主结果为 GPT-5-mini 的微平均可恢复标签召回,单位为百分比;检索型框架使用相同的每基因 16 篇预算,Memorization 使用 0 篇。 数值来自附录 Table 7,GO 与解剖有语义部分分,Syn 为精确匹配;最后一列专门保留 GO precision,防止把候选召回读成事实准确率。
| 执行框架 | GO R@30 | 解剖 R@10 | Syn R@20 | GO precision@30 |
|---|---|---|---|---|
| Memorization | 49.6 | 39.7 | 37.4 | 48.5 |
| Pipeline | 48.9 | 41.9 | 40.5 | 26.4 |
| Single-Agent | 47.6 | 48.9 | 49.2 | 47.4 |
| Multi-Agent | 53.6 | 58.5 | 57.3 | 44.0 |
Multi-Agent 的召回领先并不对应所有维度领先:其 GO precision 低于 Memorization 和 Single-Agent。 Pipeline 在较大的 GO 截断下接近其他框架的召回,但输出较多低质量候选,不能凭召回接近就称其整理质量等价。
固定 Multi-Agent 与每基因 16 篇预算后的模型结果如下,来自正文 Table 4。 召回均为百分比,± 表示 95% 基因 bootstrap 区间的半宽,不是标准差,也不是重复 API 调用的不确定性;费用、token 和候选数均为每基因平均。
| 模型 | 费用 USD | Tokens | 候选数 | GO | 解剖 | Syn | 平均 |
|---|---|---|---|---|---|---|---|
| GPT-5-mini | 0.40 | 1.3M | 23 | 53.6±3.1 | 58.5±4.4 | 57.3±6.6 | 56.5±3.4 |
| GPT-5 | 5.89 | 1.4M | 29 | 57.1±4.6 | 60.9±7.4 | 53.8±8.0 | 57.3±5.8 |
| Claude Sonnet 4.6 | 15.81 | 5.0M | 30 | 59.7±5.7 | 58.4±5.7 | 46.4±6.0 | 54.8±4.2 |
不能由接近且重叠的区间宣布单一模型确定胜出。 GPT-5-mini 的突出之处是成本下的平均表现与同义名称点估计,而不是在所有任务上优于更大模型。 正文 Table 4 与附录 Table 13 部分半宽存在差异;本表保留正文版本,不自行统一原文数字。
消融实验¶
下表汇总附录的设置分析,不把不同设置拼成一个统一的因果消融。 常规预算扩展使用规范主指标;隐藏项诊断保留其独立的 GO@20,不能与常规 GO@30 直接视作同指标比较。
| 分析设置 | GO 指标 | 解剖 R@10 | Syn R@20 | 边界 |
|---|---|---|---|---|
| Multi-Agent,预算 16 | R@30 = 53.6% | 58.5% | 57.3% | 扩展预算实验的对照 |
| Multi-Agent,预算 32 | R@30 = 45.0% | 50.7% | 48.1% | 更多阅读不保证更高召回 |
| 可见 GO 项,646 对 | R@20 = 55.4% | 不评价 | 不评价 | 独立隐藏项设置 |
| 隐藏 GO 项,124 对 | R@20 = 48.4% | 不评价 | 不评价 | 稀有叶项代理任务 |
隐藏项实验产生 49 条自然语言描述,其中 44 条可以解析到某个 GO 项;相对隐藏目标的平均相似度仅为 0.19,精确匹配只有 6/44。 “能映射到本体”不等于“恢复隐藏目标”,更不等于新本体项已经过专家认可。 这一实验使用单独隐藏标签配置,不属于公开常规无 API 表格复现路径。
关键发现¶
- 每基因 16 篇时,Multi-Agent、Single-Agent、Pipeline 的费用约为 0.4、0.85、0.10 美元。分区阅读在该设置下改善性价比,但不是任意规模下的免费扩展。
- 函数、表达和同义名称依赖文献的程度不同,历史名称尤其能够反过来改变检索范围。检索器只测排名而不测最终提取,会漏掉这一反馈价值。
- 正文 Table 3 的胜负诊断与规范分母不同:GO 的 184 + 372 + 389 = 945,表达的 86 + 165 + 83 = 334,对应附录的行级保留数,而非去重后的 770 / 252。
- 同义名称胜负行的 37 + 108 + 745 = 890,也不同于规范去重分母 457;原文未在该表充分解释换口径,不能据此推算主指标或自行修正比例。
- 工具可靠性会决定得分。DeepSeek V3.2 的无检索、单代理、多代理分别在 36/100、94/100、40/100 个基因失败或空输出,失败保留分母并计零分,低分不能只归因于生物知识不足。
亮点与洞察¶
- 可恢复性过滤把“没有可见证据”和“检索提取失败”拆开。迁移到其他专业知识库时,应先做来源可见性与证据形式审计,而不是直接把数据库全量标签当全文任务答案。
- 把历史名称同时当输出目标和检索线索,使检索与提取真正耦合。系统应允许已抽取的可靠名称回流查询,而不是在固定检索后只做一次总结。
- 代理压缩的价值不只是减少 token,还在于改变主代理能够追踪多少文献。更好的中间表示应携带证据片段、限定条件和来源,使协调器能够选择性回读,而不只接收一个 ID。
- 冻结预测与 API 重跑分开,是可迁移的基准发布设计。前者审计评测器与数值,后者研究当前模型行为,两者回答不同的复现问题。
局限与展望¶
- 语料和评测是文本限定的,图像、版面、补充材料及不可开放获取文章中的证据被排除。高分并不表示对果蝇生物学或真实专家证据集的完整覆盖。
- 测试基因偏向已有充分研究与均衡标签,FlyBase 本身也存在整理滞后。面对低资源基因或库外正确候选,现有分母无法完整评估发现能力。
- GPT-5 的标签可恢复性判断配有专家定性抽查,但没有正式验证集、错误率或量化一致性。后续应独立标注恢复性与证据支持,避免把过滤误差藏进真值。
- 语义部分分可能掩盖本体粒度错误,解剖主指标也忽略阶段正确性。应补充精确匹配、完整元组评价和候选—证据忠实度,而不能只提高候选数量。
- 隐藏稀有叶项只是本体支持缺失的模拟,不证明代理发现了新生物事实或创建了有效本体。真正本体扩展还需要专家审阅、概念边界检查与证据验证。
- 基因 bootstrap 不覆盖服务随机性、提供方版本漂移或运行间差异。接近的点估计和描述性附录分析不支持强因果或显著性结论。
- PMC-OA 文章许可异质,并非全部 CC-BY;下游使用应核对逐篇许可与来源记录。开放下载不能自动推导出统一的商业再分发权限。
相关工作与启发¶
- vs BC4GO / CRAFT / GOTA:这些资源评测给定文献中的实体、本体词项或标注能力,FlyAOC 从基因查询出发,让相关文献选择本身成为被测能力。优势是贴近端到端工作流,代价是错误来源更难隔离。
- vs PaSa:PaSa 侧重学术文献检索,FlyAOC 将检索结果继续传给本体化提取与聚合。检索命中但最终粒度错误的系统在后者会暴露,而不能仅凭找到文章获成功评价。
- vs SPIRES / CurateGPT / STRUCTSENSE:这些工作提供结构化提取或辅助整理机制,FlyAOC 提供跨全文语料、统一输出和专家标签支撑的比较平台。它不取代人工整理系统,也不要求新方法使用同一基线框架。
- vs 深度研究问答与报告基准:单答案问答可以找到后停止,报告往往难量化完整性。FlyAOC 用有界结构化候选覆盖测试继续搜集证据的能力,但仍需专家核查才能确认候选的事实有效性。
评分¶
- 新颖性: 较高;把专业知识库整理中的检索、提取与本体化联合成可评价工作流。
- 实验充分度: 较高但有边界;覆盖执行框架、模型、预算和隐藏项,尚缺正式恢复性验证及重复运行。
- 写作质量: 良好;任务与候选用途清楚,但部分附录统计口径和区间半宽不一致需要核实。
- 价值: 较高;适合研究人类审阅前的候选生成,不应据此直接自动写入生物数据库。