MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models¶
会议: ECCV 2026
论文: ECCV 2026 / Hugging Face 数据集
领域: 多模态VLM(生物医学基准)
关键词: 生物医学视觉语言模型、多模态基准、视觉感知、视觉问答、目标检测
一句话总结¶
MMBU 用 410 个公开数据集、11 种模态(35 个子模态)、7.8 万条样本和每条 13 项结构化元数据,把"生物医学视觉感知"操作化成无锚定分类、两种锚定分类与目标检测四类任务 × 开/闭两种形式的统一评测矩阵;评测 15 个开源与 2 个前沿 VLM 后发现,最好成绩也只有 0.693 F1(闭集、分割锚定分类),闭集到开集平均掉 0.26,目标检测没有任何模型超过随机基线,医学适配带来的增益有限且难以迁移到 MMBU 的分布外数据上。
研究背景与动机¶
生物医学视觉语言模型(VLM)被期待承担从胸片病灶检出到显微细胞特征描述的一线工作,而这些工作共同的前提是扎实的细粒度视觉感知:模型要能看见图像里细微的形态差别,并且这种"看见"要在不同患者群体、不同成像模态、不同生物尺度和不同采集条件下都成立。但当前的评测生态远远跟不上这个要求。以 PathVQA、VQA-RAD、SLAKE 为代表的专科基准各自只覆盖 1-3 个子模态、几千条问答,测不出模型在生物医学领域内的泛化;OmniMedVQA、GMAI-MMBench 这类多域基准虽然把规模做上去了,却仍然以诊断影像(放射、病理、内镜)为主,几乎不涉及荧光显微、电镜这些揭示细胞与分子层面机制的基础生物学模态,而且是纯人在中心(human-centric)、以分类任务为主,几乎没有辅助任务。
更棘手的问题出在数据本身。真实世界里能用的评测数据集本来就只有大约 20 个被反复使用,而这些数据集的训练集又往往已经被直接塞进现代生物医学 VLM 的预训练或指令微调管线,训练与评测之间存在严重的分布重叠。于是出现一个很反直觉的现象:模型在既有基准上的高分可能并不代表它真的"看见"了图像,而是代表它记住了这块数据——已有研究(µ-Bench、OmniMedVQA 系列的后续工作)反复观察到,医学适配后的模型对 prompt 措辞和批次效应(不同扫描仪、采集协议、机构带来的系统性偏移)异常敏感,甚至不能稳定超过自己的通用域基座。换句话说,现有基准缺的不只是规模,更缺归因能力:没有结构化元数据,就无法回答"模型到底是在哪一类模态、哪一类标本、哪个采集机构上崩掉的"。
本文的切入角度是做一次彻底的"重新取数 + 重新定义任务":既然规模化检索与标准化在今天是可行的(公开仓库里有大量许可清晰、带人工标注的生物医学数据集,专家委员会可以定义统一分类法,发现 agent 可以按分类法空缺定向补数据),那就没有必要继续在少数几个被污染的数据集上做排行榜。作者组建了由临床医生、生物信息学家、统计学家与计算机科学家构成的跨学科团队,先定义生物医学视觉感知任务的义类学,再据此收集、质控并迭代出一个统一的评测基准。核心 idea:不再问模型"知不知道某条医学知识",而是把感知能力显式操作化为统一任务义类学下的四类视觉任务(无锚定分类、掩码锚定分类、检测框锚定分类、目标检测)与开/闭两种回答形式,再用 13 类结构化元数据把 410 个异构数据集编织成一张可以按模态、子模态、标本、域、机构分层归因的评测网。
方法详解¶
整体框架¶
MMBU 的输入是 410 个来源各异的公开生物医学数据集(原始图像 + 人工标签 + 零散元数据),输出是一张按任务类型、成像模态、子模态、医学/科学域、标本与采集机构分层的 VLM 感知能力画像。整条管线有四个环节:先用专家定义的分类法驱动三轮数据发现与质量过滤,把候选池从 122 → 约 1.2K → 440 收敛到 410;再把异构数据标准化到统一格式与统一元数据模式,并按"元数据 → 问题原型 → 草稿 → 人工定稿"四步构造问题;然后把同一份标注展开成 4 类任务 × 开/闭 2 种设定 × 3 种模板共 24 套配置;最后用一套不含主观判断的评分协议给 17 个 VLM 打分。整个过程的产物不是一张排行榜,而是一份可切片的诊断报告。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["公开生物医学数据集"] --> B["三轮数据发现<br/>与质量过滤"]
B --> C["元数据标准化<br/>与问题构建"]
C -->|三种模板:无上下文 / 模态 / 完整上下文| D["四类感知任务<br/>与开闭设定"]
D --> E["确定性抽取<br/>与语义等价判定"]
E --> F["VLM 感知能力分层画像"]
关键设计¶
1. 三轮数据发现与质量过滤:把"哪些数据集配得上评测"做成一条可复现的筛选流水线
生物医学数据集散落在 Zenodo、Kaggle、Papers with Code、Hugging Face 等仓库里,格式、许可、标注质量参差不齐,随手混在一起评测,得到的高分或低分都无从归因。MMBU 把"取数"本身当成方法的一部分:先由 2 名临床医生、2 名湿实验专家、2 名生物信息学家组成的委员会用四轮迭代定下一套多粒度分类法,覆盖医学与科学专科、成像模态与子模态、解剖实体以及生物学语境;合作者再按三条准入标准提名数据集——公开且许可清晰、图像本身清晰(不模糊、主体可见、无预处理伪影)、标签必须由人产生(排除 LLM 标注的数据集)。第一轮这样筛出 122 个。第二轮针对分类法里覆盖薄弱的类别,作者专门写了一个发现 agent 在各大公开仓库做定向检索,再由 4 名标注员回溯原始数据集描述逐项交叉核验、不合规直接丢弃,新增约 1.2K 候选。第三轮由 5 名专家清理标注缺失、文件损坏、许可不明或格式错误的条目,收敛到 440 个候选,最终选定 410 个(分类 250、分割 84、检测 76)。
这条管线里有一条容易被忽略但决定成败的准则:污染控制。作者主动排除了那些被广泛用于训练医学 VLM 的文献派生数据集,理由是它们极可能已经进入被测模型的预训练或指令微调管线,留在基准里会把"记住"误读成"看见"。它也解释了为什么 MMBU 上的绝对分数普遍偏低——它测的是分布外感知,不是覆盖过的知识。
2. 元数据标准化与问题构建:让异构数据集的提问既可比又不泄题
原始数据集几乎没有可用的结构化元数据,同一个部位在不同来源里可能叫完全不同的名字。MMBU 先写一条标准化管线把下载、元数据抽取与人工校正、图像格式统一(TIFF、JPEG、DICOM、NIfTI、SVS、NDPI、MRXS、OME-TIFF 一律转 PNG)串起来,由标注员逐项核对抽取结果。问题构造走四步:先从图像与来源语料补齐细粒度元数据(标本、身体部位与子部位、模态、子模态、染色等);再以元数据为条件定义问题原型;然后实例化出一版瞄准临床有意义属性的草稿问题;最后经人工设计与核验定稿。作者对措辞设了硬约束——所有问题必须落在像素级视觉内容上,禁止出现疾病名、临床结局、任何暗示恶性的表述,也不许用缩写。这一条约束是整篇论文的题眼:它把问题从"你知不知道这是什么病"改造成"你能不能看出这个细胞的形态",模型只能靠看回答。
同一份数据还会被套上三种模板,构成一条"给多少上下文"的对照轴:No Context 是所有任务共用的标准模板、不含任何上下文;Modality 保持同样的句式但把成像模态写进问题;Full Context 则由标注员用该数据集收集到的元数据填满预定义模板,写清标本类型(人体组织、体液、涂片)、成像模态(光学显微、CT、MRI)、染色或对比剂(H&E、T1 加权)、制片方式(涂片、切片、活检)以及解剖部位或间室。这三级上下文正好用来回答一个非常实际的问题:模型答错,是因为看不见,还是因为不知道自己在看什么模态。
3. 四类感知任务与开/闭两种设定:把"感知能力"变成可测量的能力维度
MMBU 把感知拆成四个难度递增的维度。无锚定分类只给整张图,让模型预测标签,考察它对全局视觉内容的判读;锚定分类给出感兴趣区域(由分割掩码或检测框标定),让模型只判读该区域内的内容,考察局部分辨力;目标检测给图与目标类别,让模型输出边界框,考察空间定位能力。每类任务都有开、闭两种回答形式:闭集是从候选池里选择答案,开集是直接生成答案。两者的差额被单独记为一个指标 \(\Delta = \text{F1}_{\text{closed}} - \text{F1}_{\text{open}}\),用来量化模型有多依赖选项提示而不是真正的视觉理解。四类任务 × 两种设定 = 8 种配置,再乘三种模板,共 24 套。
之所以说这是"操作化"而不是"罗列任务",在于每一维都对应一个明确的失败模式假设:无锚定分类差说明全局判读不行,锚定分类与无锚定分类的落差说明局部细节分辨不行,检测崩掉说明空间定位不行,\(\Delta\) 大说明模型在借选项猜。最终这些维度被展开到 78K 条样本、458 个 topic 上,每条样本带 13 项结构化元数据(图像来源、数据集名、域、模态、子模态、染色、标本、标本子区域、topic、原始任务描述、上下文、采集机构、URL),使任何一次失败都可以回溯到具体模态或机构。
4. 确定性抽取与语义等价判定:让 7.8 万条答案的评分不依赖评委的主观判断
闭集问答最容易出的问题是"模型其实答对了、只是格式不对"。MMBU 索性放弃 LLM-as-a-judge,改用完全确定性的抽取与打分协议:一个层级解析器扫描模型输出中的显式答案字段、格式标签、有序列表与合法选项标签,把抽出的标签与真值选项集比对;抽不出答案、或抽出的标签不在合法选项集内的,一律计为错误。分类任务的正确性判定采用归一化后的精确字符串匹配,目标检测则要求预测框与真值框的 IoU ≥ 0.5 才算命中。
开集问答没法用精确匹配,因为同义生物医学术语(例如同一结构的拉丁名与常用名)都算对,所以这里换成 Qwen3-32B 充当语义等价裁判,且只把模型回答与标准答案两样东西给它,要求按严格的生物医学等价性判断,显式检查否定、左右侧、严重程度、不确定性与诊断特异性——"pneumonia" 与 "no pneumonia" 判为不等价。整体汇报的指标是微平均 F1:
并给出基于 1,000 次自助重采样(bootstrap)得到的 95% 置信区间。注意微平均 F1 会随候选池大小与类别不平衡变化,因此论文里各任务的随机基线并不相同(闭集下分别为 0.199 / 0.162 / 0.183 / 0.172),跨任务比较绝对值时要格外小心。
一个完整示例¶
以骨髓涂片那道题为例,可以看清"元数据驱动的问题构建"到底是怎么跑的。原始基准问题很泛:"识别显微图像的内容"。四步改造后:第一步从图像与来源语料补齐元数据——标本为人体骨髓、部位为骨髓涂片、模态为光学显微镜、子模态为明场显微、染色为 May-Grünwald-Giemsa(Pappenheim);第二步据此定义问题原型"which {options_name} is the most consistent given the visual characteristics of {sub_modality}?";第三步实例化出一版草稿,选项指向髓系谱系的具体细胞类型——Monocyte、Promyelocyte、Proerythroblast、Band neutrophil、None of the Above;第四步人工定稿为"which myeloid lineage cell type or structure is most consistent with the morphological features observed in this bone marrow smear?"。定稿后的问题不含任何疾病名、只能靠形态特征回答,而且因为写明了涂片与染色,模型的错误可以被归因到"明场骨髓涂片"这个具体子模态上,而不是笼统的"医学问答答错了"。
实验关键数据¶
主实验¶
MMBU 评测了 15 个开源与 2 个前沿自回归 VLM,并为每个医学适配模型配了对应的基座模型。下表汇总各模型在四类任务上的微平均 F1(括号内为闭集 − 开集之差 \(\Delta\);Random 为随机基线):
| 模型 | 无锚定分类 闭 / 开 (∆) | 锚定分类·检测框 闭 / 开 (∆) | 锚定分类·分割 闭 / 开 (∆) | 目标检测 闭 / 开 (∆) |
|---|---|---|---|---|
| GPT-5.4-mini | 0.533 / 0.104 (0.430) | 0.410 / 0.132 (0.278) | 0.472 / 0.126 (0.346) | 0.100 / 0.053 (0.046) |
| GPT-4.1-mini | 0.539 / 0.070 (0.468) | 0.430 / 0.087 (0.344) | 0.501 / 0.065 (0.436) | 0.094 / 0.046 (0.048) |
| Gemma-3-4B | 0.303 / 0.022 (0.281) | 0.283 / 0.026 (0.257) | 0.389 / 0.009 (0.381) | 0.083 / 0.024 (0.058) |
| MedGemma-4B | 0.439 / 0.043 (0.396) | 0.371 / 0.066 (0.305) | 0.310 / 0.042 (0.268) | 0.076 / 0.018 (0.058) |
| MedGemma-1.5-4B | 0.403 / 0.041 (0.362) | 0.335 / 0.045 (0.290) | 0.428 / 0.042 (0.385) | 0.071 / 0.000 (0.071) |
| InternVL3.5-8B | 0.517 / 0.111 (0.406) | 0.439 / 0.122 (0.318) | 0.514 / 0.088 (0.426) | 0.061 / 0.019 (0.042) |
| Lingshu-7B | 0.418 / 0.054 (0.364) | 0.360 / 0.047 (0.313) | 0.258 / 0.049 (0.209) | 0.012 / 0.001 (0.011) |
| Lingshu-32B | 0.469 / 0.073 (0.396) | 0.368 / 0.150 (0.218) | 0.310 / 0.053 (0.257) | 0.067 / 0.004 (0.063) |
| Qwen2.5-VL-3B | 0.381 / 0.029 (0.352) | 0.336 / 0.027 (0.308) | 0.240 / 0.026 (0.214) | 0.014 / 0.016 (-0.002) |
| Qwen2.5-VL-7B | 0.361 / 0.031 (0.330) | 0.320 / 0.030 (0.289) | 0.357 / 0.030 (0.326) | 0.029 / 0.012 (0.017) |
| Qwen2.5-VL-32B | 0.526 / 0.088 (0.437) | 0.401 / 0.079 (0.322) | 0.693 / 0.115 (0.577) | 0.092 / 0.047 (0.045) |
| Qwen3-VL-4B | 0.293 / 0.079 (0.214) | 0.363 / 0.093 (0.270) | 0.540 / 0.065 (0.475) | 0.040 / 0.001 (0.039) |
| Qwen3-VL-8B | 0.472 / 0.086 (0.386) | 0.391 / 0.098 (0.292) | 0.526 / 0.074 (0.452) | 0.006 / 0.001 (0.005) |
| Qwen3-VL-32B | 0.530 / 0.137 (0.393) | 0.433 / 0.145 (0.288) | 0.630 / 0.182 (0.447) | 0.028 / 0.003 (0.024) |
| LLaVA-v1.5-7B | 0.399 / 0.026 (0.374) | 0.310 / 0.020 (0.289) | 0.299 / 0.024 (0.275) | 0.031 / 0.000 (0.031) |
| LLaVA-Med-7B | 0.395 / 0.033 (0.362) | 0.340 / 0.038 (0.302) | 0.080 / 0.035 (0.045) | 0.033 / 0.002 (0.030) |
| OctoMed-7B | 0.494 / 0.070 (0.424) | 0.346 / 0.059 (0.287) | 0.573 / 0.056 (0.517) | 0.033 / 0.009 (0.024) |
| Random | 0.199 | 0.162 | 0.183 | 0.172 |
三点整体趋势:绝对分数普遍偏低,除 Qwen2.5-VL-32B 在分割锚定分类上的 0.693,绝大多数结果都落在 0.5 这条"可用"线以下;闭集到开集的落差稳定且巨大,三类分类任务上各模型的 \(\Delta\) 平均约 0.26(无锚定 0.38、检测框锚定 0.29、分割锚定 0.36),说明模型在很大程度上是靠选项提示在工作;目标检测则是一处系统性崩塌——闭集下没有任何模型超过随机基线 0.172,开集下多数模型接近 0。⚠️ 原文正文称闭集目标检测的最佳者是 Qwen2.5-VL-32B 的约 0.10,而表中最高值为 GPT-5.4-mini 的 0.100、Qwen2.5-VL-32B 为 0.092,两处略有出入,以原文为准。
消融实验¶
MMBU 本身不训练模型,所以这里给出的是两组分析:一是"医学适配 vs 基座"的对照,二是跨基准(旧基准 → MMBU)的迁移分析。
| 基座模型 | 医学适配模型 | 闭集无锚定分类 F1(基座 → 适配) | 变化 |
|---|---|---|---|
| Gemma-3-4B | MedGemma-4B | 0.303 → 0.439 | +0.136 |
| Gemma-3-4B | MedGemma-1.5-4B | 0.303 → 0.403 | +0.100 |
| LLaVA-1.5-7B | LLaVA-Med-7B | 0.399 → 0.395 | −0.004 |
| Qwen2.5-VL-7B | Lingshu-7B | 0.361 → 0.418 | +0.057 |
| Qwen2.5-VL-7B | OctoMed-7B | 0.361 → 0.494 | +0.133 |
| Qwen2.5-VL-32B | Lingshu-32B | 0.526 → 0.469 | −0.057 |
| 模型 | 旧基准(PathVQA / VQA-RAD / SLAKE) | MMBU 对应子集 | 结论 |
|---|---|---|---|
| OctoMed-7B | 提升 | 提升 | 双向泛化,是少数真正迁移成功的适配 |
| MedGemma-4B | 提升 | 基本持平 | 旧基准增益未迁移到 MMBU |
| Lingshu-7B / 32B | 提升 | 下降 | 更像过拟合到旧基准的分布 |
在元数据分层上,医学适配模型总体略占优:按子模态统计,医学模型有 62.28% 的情况下胜过非医学模型,但平均 F1 领先只有 0.08;表现最好的是近红外成像、相差显微与镜面显微这几个子模态。逐题配对比较(Fig. 6a)显示,所有适配方式的模型在至少 70% 的题上与基座打平,只有约一半的适配模型真正优于自己的基座,增益最大的是 MedGemma-4B(18.7% 胜 / 13.4% 负)、OctoMed-7B(15.5% / 9.9%)与 Lingshu-32B(13.8% / 12.4%)。把训练数据规模与胜率回归,得到每个额外 100 万训练样本带来约 +0.20% 胜率(\(y = 0.20x + 9.74\),\(R^2 = 0.41\))——也就是说,决定适配成败的更像是喂了多少数据,而不是模型有多大。
关键发现¶
- 没有任何模型在所有任务上称王。GPT-4.1-mini 拿下无锚定分类(0.539),Qwen2.5-VL-32B 拿下分割锚定分类(0.693),InternVL3.5-8B 拿下检测框锚定分类(0.439)并在开集任务上整体最强,Qwen3-VL-32B 则在开集回答上领先(0.137 / 0.145 / 0.182)。这些数字合在一起说明生物医学领域不存在一个"通才 VLM"。
- 感知与空间定位的断层比知识差距更严重。模型可以在给定框内正确分类,却无法自己把框画出来——能判读框里的东西,不能定位框在哪。这是 MMBU 揭示的最核心的失败模式,也直接指向"空间建模"这个未来方向。
- 医学专精提升的是分类,不是细粒度锚定推理。MedGemma-4B 在无锚定闭集分类上比随机高 0.24(F1 0.439),但在两种锚定分类上都被通用模型 InternVL3.5-8B 反超(检测框锚定 0.371 vs 0.439,分割锚定 0.310 vs 0.514),说明"医学知识注入"与"局部感知能力"不是同一件事。
- 旧基准上的增益不保证迁移。所有医学适配模型在 PathVQA / VQA-RAD / SLAKE 上都有提升,但只有 OctoMed 在 MMBU 对应子集上也提升,MedGemma 持平、Lingshu 反而下降。这强烈提示这些旧基准的训练集已经被广泛用于微调或预训练,模型优化的是那几个数据集,而 MMBU 测的是更广的生物医学感知。
亮点与洞察¶
- 把"看不见"和"不知道"分开测,是这篇论文最漂亮的设计。它靠两条互相配合的机制实现:一是问题措辞被强制约束在像素级视觉内容上(禁疾病名、禁临床结局、禁缩写),二是每个样本带 13 项结构化元数据。前者保证题目只能靠看回答,后者保证答错以后能定位到具体模态与机构。绝大多数基准只做了前者或只做了后者。
- 主动排除高污染数据集,是一种反直觉但正确的取舍。放弃那些最热门、最容易刷分的数据,换来的是分数可以解读为"分布外感知"而不是"记忆检索"。代价是绝对分数难看(最好 0.693、目标检测低于随机),但换来了归因能力。
- 确定性抽取协议值得被直接复用。闭集问答上完全弃用 LLM-as-a-judge,改用一个层级解析器从答案字段、格式标签、有序列表里抠出选项标签,解析失败即判错。这个协议在评测赛道(benchmark-of-benchmark)和任何大规模自动评测里都可以原样搬走,它消掉了评审模型带来的方差。
- \(\Delta\) 这个朴素指标其实很有信息量。闭集和开集只差"有没有候选池",两者的差值却稳定在 0.26 上下——相当于给"模型有多依赖选项提示"提供了一个直接读数,比任何解释性的案例分析都更硬。
局限与展望¶
- MMBU 虽然用分割掩码和检测框来做锚定,但并没有把分割本身作为一项被评分的任务,也没有报告分割指标(如 Dice / mIoU)。对于以分割为日常工作的生物医学场景,这留下了一块明显的空白。
- 开集问答依赖 Qwen3-32B 做语义等价裁判。作者为闭集设计了完全确定性的抽取协议以避开 LLM 评委偏差,但开集这一侧仍然把分数交给了另一个模型,且裁判模型与被评模型同属一个家族(Qwen 系列)时是否存在偏好未被讨论。
- 微平均 F1 会随候选池大小与类别不平衡变化,四个任务的随机基线并不相同(0.199 / 0.162 / 0.183 / 0.172),跨任务直接比 F1 大小是有风险的;论文正文在个别地方(如目标检测最佳者)与表格数值也略有出入。
- 元数据并非所有样本都完整,13 项属性在不同数据集上的可得性不同,因此按元数据分层后的子集大小与统计功效差异较大,62.28% 这类胜率数字应谨慎解读。
- 后续可以做的改进很直白:把分割任务真正纳入评分;为开集评测引入多个异构裁判并报告一致性;补充与人类专家在同一批题目上的对照,给出分数的人类上限。
相关工作与启发¶
- vs GMAI-MMBench: 两者都是多域医学基准,GMAI-MMBench 覆盖 32 个子模态、2.6 万条样本、18 个临床任务,靠词汇树做分类。MMBU 的差异在于把覆盖推到 35 个子模态、7.8 万条样本,并给每条样本最多 13 项结构化属性(含采集参数、染色、机构),同时明确纳入目标检测这类空间任务。前者的分类树只能做粗粒度切片,后者可以做"同一模态不同机构"这种批次效应级别的归因。
- vs OmniMedVQA: OmniMedVQA 把 73 个分类数据集拼成 12.8 万条问答,规模很大,但只有分类任务、无人标注的细粒度元数据,也没有开/闭集对照。MMBU 规模略小,但多了锚定分类、目标检测、三种上下文模板和 \(\Delta\) 分析,评测的维度更宽。
- vs PathVQA / VQA-RAD / SLAKE: 这三者是被 MMBU 明确当作"旧基准"来对照的专科基准(1-3 个子模态、2K-6K 规模)。本文最有价值的结论正来自这组对照:模型在这三个基准上都涨,在 MMBU 上却不涨甚至下降,说明它们更多测的是被训练过的分布,而不是泛化的感知能力。
- vs MicroVQA / µ-Bench: 这两项工作聚焦显微图像,用相对小规模的评测指出了生物医学 VLM 对 prompt 与批次效应的敏感性。MMBU 可以看作把这一观察放大到了 410 个数据集、11 种模态上,并且用元数据把敏感性从"现象"变成了"可定位的失败"。
评分¶
- 新颖性: ⭐⭐⭐⭐ 首个把生物医学感知按统一任务义类学 + 开/闭形式 + 13 项元数据做全面操作化的大规模基准,评测范式的贡献大于单个数据集的贡献。
- 实验充分度: ⭐⭐⭐⭐ 17 个模型(含基座/适配配对)、四类任务、开闭两种设定、元数据分层与跨基准迁移分析齐全,并给出 bootstrap 置信区间;遗憾是没有人类专家对照与分割指标。
- 写作质量: ⭐⭐⭐⭐ 问题构建流程与筛选准则交代得很清楚,图表组织合理;个别数值在正文与表格之间略有出入,元数据分层的统计细节多放在补充材料里。
- 价值: ⭐⭐⭐⭐⭐ 为生物医学 VLM 提供了一个可用于归因的评测基座,并把"旧基准高分掩盖感知缺陷"这一现象用大规模证据钉死,对后续模型设计(空间建模、泛化型适配)有直接的导向意义。