EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/RetroDnix/EPIBench
领域: 多模态 VLM
关键词: 多轮研究工作流, 主动检索, 跨论文证据融合, 证据记忆, 智能体评测基准
一句话总结¶
EpiBench 把"做一小段文献调研"实例化成多轮问答情节:任务里不给目标论文、只给图片段或书目线索,智能体必须自己检索出多篇论文、抽取其中的图与表作为证据、把证据按顺序存进记忆池,并在末轮被禁用全部工具的条件下完成跨论文多证据融合;评测除最终对错外,还用「证据正确率 EC」和「最小性差距 MG」把"是否走到正确证据"与"是否走得高效"单独量出来。
研究背景与动机¶
近年科学文献理解类基准已经相当密集,从 SciVQA、CharXiv 到 SPIQA 都在做学术图表问答,LiveXiv 进一步把这类 VQA 任务做成大规模、持续更新。但它们的共同形态是单文档:问题落在某一篇论文的一张图、一张表或一段正文里,答案往往看一眼那张图就能给出来。这意味着两件真实调研中必然会做的事被绕过了——一是把多张图、多张表的信息对齐起来才能得到结论,二是把证据从多篇论文之间凑齐(跨论文推理)。多轮与长程记忆这条线上有 MMDU、MULTIVERSE 这些多图多轮对话基准,Memory-QA、EMP 这类记忆问答也把推理跨度拉长了,可它们的目标是"从已存记忆里检索出某个问题的答案",并不以论文为中心,也很少要求跨论文的多模态证据融合。最接近的是 PaperArena(工具增强的论文多跳导航),但它的任务大多仍不需要把多张图与多张表联立求解。更麻烦的是评测协议这一侧:因为允许智能体反复重新打开、重新解析 PDF,基准几乎无法回答"它是不是复用了早前已经拿到的证据",也很少检查中间步骤的证据是否真的落地正确——于是证据归因错误(答对了但依据的是另一张图)和整合失败(拿到全部证据却拼不起来)这两类关键失败模式只能被最终准确率糊成一团。
这两个错配在论文里被拆成两个明确缺口:其一,没有基准系统地覆盖"主动检索 + 多轮交互 + 跨论文多模态证据随时间累积与融合"这种类人研究流程;其二,缺少过程级指标去度量证据复用与证据正确性。EpiBench 的目标是把两件事一起补上。任务侧,它的题面不提供目标论文,也不提供直接标识符,只给一个图像片段或一句简短的书目线索当种子——这正是真实用户提问的样子,很少有人会带着精确引用过来;答案被设计成客观题,用比较、选择规则和集合式约束来强制对齐跨论文的多图多表,证据必须从视觉图例和曲线读数里取,这就压缩了"靠世界知识或半截视觉上下文蒙对"的空间。协议侧,论文引入一个带访问预算的评测设定:把每个情节所需的证据单元标注到"论文标识 + 图/表标识"的粒度,于是可以从智能体的交互轨迹里自动算出证据复用与工具效率。
本文的核心 idea 是用"情节化多轮 + 末轮记忆受限"把研究流程的可复用性变成可测量的量:每个情节配一份最小工具调用清单与一组必需证据单元,末轮直接禁用全部工具、只允许使用记忆池里已有的多模态证据做融合,再用 EC 与 MG 两个过程指标把笼统的"答对"分解成"是否走到正确证据"和"是否走得高效"。
方法详解¶
整体框架¶
EpiBench 不是一个模型方法,而是一套"任务形式化 + 数据构建管线 + 过程级评测协议"的打包。它要解决的问题是:把一次真实的小型文献调研压缩成可自动判分的情节(episode),并且让"智能体是否真的按研究流程走"这件事可被度量。整条链路是这样的:先定义情节化的多轮任务形式(谁在什么约束下回答什么),再用一条人工策展的管线把真实论文变成 102 个情节,然后给智能体一套文献专用工具与一条按时间顺序追加的记忆池,最后在末轮切断工具、只允许读记忆,用成功率和两个过程指标结算。数据构建、智能体环境、评测协议三块是耦合的——没有逐轮的工具调用清单和证据单元标注,后两个指标就算不出来;没有末轮禁用工具这条约束,证据复用就无法与"再查一次"区分开。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["研究任务<br/>多轮问题链 + 种子线索"] --> B["情景化多轮研究任务<br/>不给目标论文、只给线索"]
B --> C["专家策展的数据构建管线<br/>68 → 485 → 102 情节"]
C --> D["文献工具环境与情节记忆<br/>四类工具 + 时序记忆池"]
D --> E["预算化过程评估协议<br/>末轮断网 + EC / MG 结算"]
关键设计¶
1. 情景化多轮研究任务:不给目标论文,只给线索,强制跨论文多证据融合
多数论文问答基准的题面本身就带着答案的坐标——要么直接点明目标论文,要么给出 arXiv ID,智能体只需"打开并阅读"。EpiBench 去掉了这个坐标:每个情节是一串轮次 \(\{(q_t, I_t)\}_{t=1}^{T}\),\(q_t\) 是一个客观问题,\(I_t\) 只是可选的种子线索(一张图像片段或一句简短书目提示)。目标论文需要智能体自己用引用线索和间接提示去搜出来,并且答案被刻意设计成多篇论文各自贡献一部分必需证据才能拼成:题目通过比较、选择规则、集合式约束这类形式,要求把多张图的图例与曲线读数、多张表的条目以及正文描述对齐起来,还要把不同来源的实验设定校准到同一口径。这样设计的效果是双向的:一方面,"世界知识蒙对"的路径被堵住,因为答案取决于具体论文里具体的图和表;另一方面,"只看一张图就作答"的路径也被堵住,因为正确选项依赖跨来源的联合约束。情节内部后轮依赖前轮,天然形成跨轮一致性要求——比如早轮确认的某个实验设定,后轮如果被记错,结论就会自相矛盾。
2. 专家策展的数据构建管线:模型起草问题链,人工核验证据目标
构建流程是"种子→扩池→起草→人工定稿"四步。种子集来自公开会议与预印本平台(OpenReview、arXiv),覆盖计算机视觉与机器学习的六个大类,共 68 篇代表性论文;然后用 Connected Papers 这个引用图探索工具围绕每篇种子大范围扩展候选,去重加基础质量过滤后得到 485 篇论文的源语料池。第三步用 GPT-5.2 起草情节化的问题链,关键是起草时同步产出一份逐轮的工具调用清单,每个调用指明目标论文以及(在适用时)目标图或表——这份清单在后面既是评估基准,也是"最小可行路径"的来源。最后,五名计算机科学方向的硕士生对生成的情节做 refine/validate/curate:删掉歧义题、订正证据目标、在最后一轮统一消除标注不一致,并确保每篇被要求阅读的论文都对最终答案贡献了不可替代的证据。人工这一关的意义在于,自动起草很容易生成"看似需要三篇论文、其实第一篇就够了"的伪多证据题,必须靠人来压掉。
最终 102 个情节分为 Easy 37 与 Hard 65。难度不是按题目字数拍的,而是同时看三个量:需要的轮数、跨论文与多模态证据整合的量、以及后轮对早前证据复用的要求程度。论文给出的规模统计(各难度的平均论文数、轮数、图像数,以及按学科领域的分布)见图 3——这张图没有展开成文字数字,⚠️ 具体数值以原文图 3 为准。
3. 文献工具环境与情节记忆:四类工具支撑检索与视觉落地,记忆按时序追加
智能体侧不改模型、只给接口,工具一共四个,都是为"从线索找到论文、再从论文找到图/表"这条链路服务的。Web Search 查询搜索后端返回带标题、摘要片段和 URL 的排序结果(论文同时接了 Google 与 DuckDuckGo 两个后端),用来定位候选论文、从间接线索解析出论文身份、顺引用链往下走;PDF Extractor 按论文标识(标题或 arXiv ID 等)下载 PDF 并解析成规范化的 markdown(原文引用的是 MinerU);PDF Extractor RAG 在这份缓存的 markdown 上做检索,给定文本查询返回最相关的片段并附轻量出处(章节上下文、图表引用),让智能体不必整篇重读就能定点取证;Content Extractor 从缓存论文里抽出指定的图或表——图返回图像与标题上下文,表返回结构化表格表示以及可得的周边正文,这是题目要求视觉落地时唯一能拿到像素证据的通道。
记忆被实现成情节级的时序存储:检索到的 PDF、抽取出的图与表、工具返回的观察,全部按被访问的先后顺序追加进去。这个设计看起来朴素,实际是整个过程级评测的前提——状态透明,才能事后从交互轨迹里算出复用与效率。配合记忆的是一条硬约束:对需要复用证据的情节,末轮以 memory-only 模式运行,禁用全部工具,智能体只能靠记忆里已有的证据作答,不能重开、重下文档。这条约束把"记忆利用率"从"检索能力"里隔离开来,使不同模型之间的复用行为可比。运行循环本身是 ReAct 式的:先给出行动计划,再生成可执行的工具调用代码;每轮受步数预算约束(默认 10 步),若在预算内没给出最终答案,允许一次额外机会在单次回复里总结探索过程并给出替代答案。
4. 预算化过程评估协议:末轮记忆受限 + EC / MG 双过程指标 + 错误归因
只报最终准确率会把完全不同的问题混在一起——答错可能是因为根本没找到论文,也可能是找到了却没复用。EpiBench 的协议把这件事拆开。成功率侧,除情节成功率 ESR(只有该情节所有轮全部答对才算对)外,还单独报末轮准确率 \(\mathrm{Acc_{final}}\) 与非末轮平均准确率 \(\mathrm{Acc_{pre}}\),因为末轮被刻意设计成最难、且承担多证据融合与记忆复用的职责。证据正确性侧,每一轮 \(t\) 都标注了一组必需证据单元 \(E_{i,t}\),索引粒度是论文标识 + 图/表标识;把智能体实际访问到的证据集合 \(A_{i,t}\) 从工具轨迹里还原出来,只在答对的轮上比对:
其中 \(y_{i,t}\) 是该轮是否答对。EC 度量的是"答对的轮里,必需证据被真正访问的比例"——它专门用来戳穿"答对了但依据的是别的图/别的论文"这种幸运猜中。工具效率侧,每个情节都带一份最小可行路径清单,记最少需要 \(c_i^{\star}\) 次工具调用;设实际调用次数为 \(c_i\)、情节是否成功为 \(s_i\in\{0,1\}\),则只在成功情节上统计最小性差距:
MG 越大说明相对最小可行解冗余越多。最后一个维度是错误归因:对每个失败情节,按工具轨迹与证据对齐结果中最早出现偏离的位置打一个错误标签,共五类——Retrieve(没能找到目标论文)、Perception(访问到了证据但读错/误解了图或表)、Reasoning(证据都拿到了却整合错误或没满足约束)、Reading Memory(所需证据早前已检索到,但后轮没有被正确复用,包括跨来源混淆与末轮融合时漏选证据)、Others(超出步数上限、运行时错误、PDF 解析错误等)。之所以强调"最早偏离点",是因为同一个失败情节往往在后续还会连锁触发更多错误,只有归到源头才能指导改进。这一套指标组合起来,让"高分低能"(Acc_pre 很高但 ESR 很低)变得可解释。
一个完整示例¶
⚠️ 论文没有给出带具体数值的完整走查(图 2 只示意了流程),因此这里只按原文描述还原一个情节的骨架,不补造数字。一个典型情节的形态是:早几轮智能体从一个图像片段或一句书目线索出发,用 Web Search 搜出若干候选论文,靠 PDF Extractor 打开、用 Content Extractor 抽出其中某张图或某张表,从图的图例与曲线读数里读出某个实验设定;中间几轮转到另一篇论文上抽取对照条件下的表格条目,并把两边的设定对齐;末轮的问题要求把此前累积的多个证据单元联合起来做比较或集合式判断,此时工具被禁用,智能体只能从记忆池里挑出前面存下的图与表来融合。一条 10 步的预算意味着早轮必须高效——冗余的重复浏览会直接压缩后面抽取证据的步数。
实验关键数据¶
主实验¶
评测对象是 6 个开源与 4 个闭源 LMM 作为智能体骨干(模型名按原文写法,⚠️ 以原文为准),另加一个由两名计算机科学方向硕士生在同一工具接口下完成的人类基线。轮级对错由 LLM-as-a-Judge(GPT-5.2)在固定 rubric 下给出二值判定。
| 骨干模型 | Easy (ESR / Acc_final / Acc_pre) | Hard (ESR / Acc_final / Acc_pre) | 平均 (ESR / Acc_final / Acc_pre) |
|---|---|---|---|
| Qwen3.5-9B | 5.26 / 55.26 / 41.11 | 0.00 / 36.07 / 24.07 | 2.02 / 43.43 / 28.33 |
| Qwen3.5-35B-A3B | 32.43 / 77.78 / 57.61 | 10.77 / 46.88 / 52.30 | 18.63 / 58.00 / 53.60 |
| Qwen3-VL-235B-Instr. | 16.98 / 41.51 / 70.67 | 8.16 / 51.02 / 49.77 | 12.75 / 46.08 / 55.17 |
| Qwen3-VL-235B-Think. | 30.00 / 65.00 / 76.09 | 3.23 / 43.55 / 43.84 | 13.73 / 51.96 / 51.90 |
| GLM-4.5V | 8.11 / 51.35 / 38.95 | 0.00 / 30.77 / 29.17 | 2.94 / 38.24 / 31.59 |
| Kimi-K2.5 | 52.94 / 73.53 / 89.77 | 26.15 / 49.23 / 79.51 | 35.35 / 57.58 / 81.91 |
| GPT-5-Mini | 29.73 / 62.16 / 84.21 | 21.54 / 50.77 / 74.65 | 24.51 / 54.90 / 77.02 |
| GPT-5.2 | 58.33 / 77.78 / 91.30 | 29.23 / 49.23 / 86.46 | 39.60 / 59.41 / 87.63 |
| Grok-4.1 | 15.38 / 66.67 / 63.10 | 6.35 / 39.68 / 51.07 | 9.80 / 50.00 / 53.85 |
| Gemini-2.5-Pro | 27.03 / 64.86 / 75.79 | 7.69 / 46.15 / 57.29 | 14.71 / 52.94 / 61.88 |
| Human | 91.43 / 97.14 / 96.67 | 81.36 / 94.42 / 95.79 | 85.11 / 95.74 / 96.01 |
消融实验¶
第一组是过程级诊断(表 3):证据正确率 EC(越高越好)与最小性差距 MG(越低越好),只统计留有完整工具轨迹的模型。
| 模型 | Easy EC / MG | Hard EC / MG | 平均 EC / MG |
|---|---|---|---|
| Qwen3-VL-235B-Instr. | 64.63 / 1.41 | 63.48 / 1.03 | 63.85 / 1.23 |
| Qwen3-VL-235B-Think. | 54.55 / 1.02 | 45.66 / 1.00 | 48.63 / 1.01 |
| GLM-4.5V | 24.49 / 2.60 | 31.20 / 2.60 | 29.31 / 2.60 |
| Kimi-K2.5 | 81.30 / 1.49 | 84.91 / 1.20 | 84.13 / 1.35 |
| GPT-5-Mini | 75.40 / 3.00 | 82.43 / 1.94 | 80.75 / 2.32 |
| GPT-5.2 | 85.93 / 1.34 | 86.15 / 1.27 | 86.10 / 1.30 |
| Grok-4.1 | 85.71 / 3.33 | 78.33 / 2.88 | 80.12 / 3.07 |
| Gemini-2.5-Pro | 71.30 / 2.17 | 68.71 / 1.41 | 69.39 / 1.80 |
| Human | 83.45 / 1.00 | 88.35 / 1.02 | 86.88 / 1.01 |
第二组是协议侧的三项消融。闭卷无工具消融的数值较完整:GPT-5.2 平均 ESR 从 39.6% 掉到 6.9%,Kimi-K2.5 从 35.4% 掉到 6.9%,Qwen3-VL-235B-Thinking 从 13.7% 掉到 2.9%,GLM-4.5V 两种设置下都低;Hard 分片上所有被测模型的无工具 ESR 不超过 3.1%,而工具可用时 GPT-5.2 为 29.2%、Kimi-K2.5 为 26.2%。另外两项消融(末轮放开工具、移除 PDF 文本 RAG)原文以图 5 给出趋势而未列具体数值,故下表只记方向性结论。
| 配置 | 关键指标 | 说明 |
|---|---|---|
| 主协议(末轮禁用工具) | GPT-5.2 平均 ESR 39.60 | 末轮只允许使用记忆池中的证据 |
| 末轮放开工具(上限参考) | ESR 与 Acc_final 大幅回升 | 说明跨轮缓存的多模态证据本身不足以支撑可靠的末轮融合 |
| 移除 PDF 文本 RAG | 影响较小且因模型而异 | 文本检索不是这些情节的主要瓶颈 |
| 闭卷无工具(GPT-5.2) | 39.6 → 6.9 ESR | 掉 32.7 个点,参数化知识无法解出该基准 |
| 闭卷无工具(Kimi-K2.5) | 35.4 → 6.9 ESR | 掉 28.5 个点 |
| 闭卷无工具(Qwen3-VL-235B-Think.) | 13.7 → 2.9 ESR | 掉 10.8 个点 |
| 步数预算 5 → 10 | ESR 一致提升 | 更紧的预算常在证据采集与恢复完成前就截断情节 |
| 步数预算 10 → 15 | ESR 几乎不变,max-steps 错误率降幅很小 | 剩余失败并非步数不足,而是证据落地/对齐/复用问题 |
关键发现¶
- 轮级准确率高不代表情节能跑完。 多个闭源模型的 Acc_pre 已在 84%–91%,但 Acc_final 掉到 50%–59%、ESR 只有 10%–40%。失分集中发生在证据采集之后:组织、回忆、在约束下对齐证据这三步。GPT-5.2 是唯一在 Hard 上 ESR 接近 30% 的模型(29.23%),但相对人类基线 81.36% 仍有巨大差距;人类在 Easy 上 ESR 91.43%、平均 85.11%,且 MG 几乎为 1.01,说明最小可行路径是可达的。
- EC 与 ESR 的排序不完全一致,说明"答对"里混着运气。 GPT-5.2(平均 EC 86.10)与 Kimi-K2.5(84.13)的对错更多建立在充分证据上;GLM-4.5V 平均 EC 只有 29.31,却仍有 2.94 的 ESR,明显偏向先验知识或猜测。Grok-4.1 是一个反例:EC 平均 80.12 不低(Easy 上 85.71 甚至接近 GPT-5.2),但平均 ESR 只有 9.80——证据看对了却没走到最后,错误更多落在后续的整合与复用环节。
- 冗余与难度不成正比。 MG 变化幅度很大(GLM-4.5V 2.60、Grok-4.1 3.07,而 GPT-5.2 1.30、Kimi-K2.5 1.35),且与 EC 只是弱相关;多个模型在 Easy 上的冗余反而高于 Hard(如 GPT-5-Mini 3.00 → 1.94、Grok-4.1 3.33 → 2.88),说明简单题上存在过度探索。人类 MG 1.01 说明这个指标的上限是扎实的。
- 失败发生的位置随模型能力迁移。 弱模型(Gemini-2.5-Pro、Qwen3-VL-Thinking)由 Retrieve 错误主导——它们常常在进入多证据融合之前就已经出局;强的推理型模型把错误质量推向后段,GPT-5.2 与 Kimi-K2.5 的 Perception 与 Reasoning 错误占比更高。GPT-5.2 的 Reading Memory 错误率也偏高,作者的解释是它因为前段采集更强,更多次真正走到了需要记忆复用的轮次——换言之,这不是它更差,而是它更常被考到这一步,也正说明多模态证据从记忆中的复用仍有很大提升空间。
- 工具是必要条件。 全程禁用工具后所有模型的 ESR 崩塌(Hard 上不超过 3.1%),而末轮放开工具能带来大幅回升——两条方向相反的消融共同把瓶颈定位在"跨轮已缓存的多模态证据选择、索引与对齐",而不是检索本身或文本 RAG。
亮点与洞察¶
- 把"记忆复用"做成一条可执行的硬约束,而不是一个事后统计。 末轮禁用全部工具、只允许读记忆,这一步把"复用"从一个模糊的行为概念变成了协议级的、强制触发的测试条件。任何做长程智能体评测的工作都可以借用这一招:与其统计"它有没有用到早前信息",不如直接断掉回头路。
- 证据单元标注到"论文 + 图/表"粒度,让幸运猜中可被识别。 EC 的分母只统计答对的轮,分子统计其中真正被访问的必需证据——它天然地把"答对但依据错"从正确率里剥离出来。这个思路(把正确性拆成结果指标与来源指标)在检索增强问答、代码生成溯源等场景都可以迁移:给每个正确答案标一组必需来源,再看模型的轨迹是否覆盖它。
- 最小可行路径清单同时扮演了三个角色。 起草阶段的工具调用清单既是人工核验的抓手,又是 MG 的基准,还是难度定义的一部分。用一份标注同时支撑质检与效率指标,避免了为每个指标单独造标注,这个复用设计值得学。
- "最早偏离点"的错误归因让失败可诊断。 失败情节只打一个标签、且归到轨迹中最早的偏离处,避免了多条错误链互相污染统计。论文据此给出了"弱模型错在检索、强模型错在感知与推理"的结论——这种随能力迁移的错误分布,是准确率数字完全给不出来的信息。
局限与展望¶
- 规模不大:102 个情节(Easy 37 / Hard 65)来自 485 篇论文的语料池,种子只有 68 篇。作为诊断工具足够,但用它做模型选择或训练信号时,Easy 分片 37 个情节意味着 ESR 的分辨率大致是 2.7 个百分点,小差距不宜过度解读。
- 判分依赖单个 LLM judge(GPT-5.2)在固定 rubric 下给二值标签,论文未报告 judge 与人工判定的一致性、prompt 敏感性或跨 judge 稳健性;而 Acc_final / Acc_pre / ESR 全部建立在这个判定之上。
- 错误标签的归属方式论文只写了"按轨迹中最早的偏离点",没有说明是规则自动判定、人工标注还是模型辅助,也没有报告标注一致性;五类之间的边界(例如 Reasoning 与 Reading Memory 在末轮融合时就容易重叠)存在主观空间。
- 数据构建用了 GPT-5.2 起草问题链。人工策展能压掉明显问题,但起草模型与被评测的 GPT-5.2 同名同源,存在潜在的风格偏置(题目表述、证据选择偏好与被测模型同族),论文未对此做分析或交叉验证。
- 难度只有 Easy / Hard 两档,缺少中间层级与"随轮次递增"的细粒度难度曲线,难以定位性能衰减究竟发生在第几轮。
- 可改进方向:其一,把 EC 从"是否访问"细化到"访问的图/表区域是否正确",让感知错误也能被过程指标捕获;其二,扩展到跨更多学科、更长情节(轮数从个位数拉到十几轮)以测试记忆衰减;其三,把 MG 与实际正确性联合建模,给出"效率—正确"的帕累托分析,而不只是分别报告两个数。
相关工作与启发¶
- vs SPIQA / CharXiv / SciVQA / LiveXiv: 它们做的是单篇论文内的图表问答,问题往往可由一张图回答,且不涉及论文之间的引用网络;EpiBench 要求从线索主动搜出多篇论文、并把多张图与多张表的证据对齐后才可能作答,评测也从"这道题对不对"变成"整条研究流程走没走通"。
- vs MMDU / MULTIVERSE / VisChainBench: 这些是多图多轮对话基准,考察对话内的多图像理解与上下文推理,但开场就给足图片、不要求主动检索,也没有工具调用与证据落地考核;EpiBench 把"找到该看哪张图"本身当作考点,并且要求智能体自己把图从论文里抽出来。
- vs Memory-QA / EMP: 它们关注从已存记忆中回忆出答案,记忆是给定的前提;EpiBench 让记忆由智能体自己的工具调用逐步填充,并用末轮禁用工具的方式强制它使用自己填的记忆,因此记忆质量与检索行为绑定在一起被考核。
- vs PaperArena: 最接近的工作,同样做工具增强的论文多跳导航;差别在于它的任务较少要求把多张图与多张表联立求解,也缺少"证据复用"这条过程级约束与 EC / MG 这类过程指标。EpiBench 的增量主要在任务的多模态耦合度与评测协议的过程可诊断性上。
- vs MMDeepResearch / MMSearch-Plus / SIN-Bench: 前者覆盖跨论文与多模态,但没有证据记忆与多轮对话维度;SIN-Bench 面向长多模态文档中的证据链;EpiBench 是唯一在论文中心场景下同时打开跨论文、多模态、主动检索、证据记忆与多轮对话五个维度的基准。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把"主动检索 + 跨论文多模态证据融合 + 末轮记忆受限"三者绑进同一个情节化任务,并为证据复用设计了可自动计算的过程指标,在论文中心基准里是新的组合。
- 实验充分度: ⭐⭐⭐⭐ 10 个开源/闭源骨干加人类基线,主结果、过程诊断、错误归因、三组消融都做了;但消融多为趋势性报告(图 5、图 7 无具体数值),且缺少 judge 一致性与规模敏感性分析。
- 写作质量: ⭐⭐⭐⭐ 问题定位清晰(表 1 的能力对照很直观),指标定义完整且给了公式;不足是部分图表只以图形式给出统计而正文未展开,可复现细节(错误归因方式、判分 rubric)交待偏薄。
- 价值: ⭐⭐⭐⭐ 基准规模不大,但"末轮断工具 + 证据单元标注 + 最小路径清单"这套协议设计可直接迁移到其他长程智能体评测,诊断价值高于其排行榜价值。