FOCUS: Benchmarking Retinal Model Generalization from Foundation Vision Encoders to Multimodal LLMs¶
会议: NeurIPS2026
arXiv: 2609.33158
领域: 医学图像
关键词: 眼底图像、跨数据集泛化、概率校准、亚群公平性、低秩适配
一句话总结¶
FOCUS 将十个眼底数据集的疾病标签和三类基础模型的预测接口接入同一评测层,发现模型排序能力、校准与亚群表现并不一致,而 MLLM 的监督微调主要改善二元决策和校准,平均 AUROC 增益很小。
研究背景与动机¶
眼底彩照研究已经从单病种分类器扩展到 DINO、RETFound 等视觉编码器,CLIP、FLAIR 等视觉语言模型,以及 Gemma、MedGemma 等生成式多模态大语言模型。模型的输入虽然都包含眼底图像,输出却不同:有的提供图像特征,有的提供图文相似度,有的生成回答并给出词元概率。因此,同一个“分类准确率”可能来自不同的训练监督、提示模板、答案解析和概率转换,无法直接解释为基础模型医学能力的差距。
另一个盲点是数据集之间的差异。设备、地区、人群、图像质量和标注协议会一起变化;一个在本数据集表现好的模型,未必在外部数据上仍然可靠。已有眼底数据集提供了重要的疾病标签,FunBench 和 LMOD 则更关注生成式模型的问答能力或失败模式,但这些资源没有共同覆盖视觉编码器、双编码器与生成式模型的同任务跨数据集比较,也没有系统把排序、校准和亚群差异放在一起解释。
FOCUS 的贡献不是提出一个新的诊断网络,而是建立可扩展的数据、任务与模型接口注册表,把基础模型结果和微调后的外部迁移分开报告。核心 idea:先明确标签和预测接口的含义,再用同一多维评测协议检查模型在不同数据来源上保留了什么能力、改变了什么失败模式,而不是用单个排行榜分数代表可靠性。
方法详解¶
整体框架¶
FOCUS 输入十个数据集的眼底图像、有效疾病标签,以及部分数据集提供的年龄、性别和质量元数据。它先进行“任务与元数据协调”,再通过“接口分离评测”取得分数和硬预测,最后开展“多维可靠性诊断”;另设“匹配基线适配比较”,检查 BRSET 或 mBRSET 上训练的 LoRA 适配器能否迁移到其他支持同一任务的数据集。
这里的统一是统一分析协议,不是把三类模型组成集成网络,也不是让所有模型获得相同的监督信息。基础模型评测中的线性探针已经使用目标数据集训练标签,而零样本图文匹配与 MLLM 提示没有任务专属拟合;真正明确的跨数据集适配迁移实验是另列的 MLLM SFT 部分。
下面仅示意评测过程,实线是评测流程,虚线标出训练监督。三类模型各自独立输出结果。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["十个眼底数据集"] --> B["任务与元数据协调"]
B --> C["接口分离评测<br/>VM:冻结特征探针<br/>VLM:探针或图文匹配<br/>MLLM:二元提示"]
T["各数据集训练标签"] -.->|仅探针训练| C
C --> D["多维可靠性诊断"]
D --> E["匹配基线适配比较<br/>适配器另行推理<br/>同任务 ID 与 OOD"]
S["BRSET 或 mBRSET<br/>任务标签"] -.->|LoRA SFT 监督| E
E --> F["分任务及分接口报告"]
关键设计¶
1. 任务与元数据协调:同名疾病不等于相同标签
注册表包含 BRSET、mBRSET、PAPILA、RFMiD、RFMiD 2.0、IDRiD、Messidor-2、REFUGE、G1020 和 JSIEC1000。三个目标均是二分类,但每个数据集只在协调后具有有效标签的任务上参与评测;不能把十个数据集理解为都完整支持三个任务。
“任意糖尿病视网膜病变(DR)”对应 ICDR 等级至少 1;“可转诊 DR”对应等级至少 2,和/或可疑黄斑水肿。青光眼相关任务更准确的表述是青光眼性视神经病变(GON):采用垂直杯盘比至少 0.6 或专家标注的青光眼性结构损伤,而不是声称单张眼底彩照提供了确诊青光眼的完整依据。
BRSET 和 mBRSET 支持全部三个任务;PAPILA、REFUGE、G1020 支持 GON;其余五个数据集支持两种 DR 任务。这种映射减少了名称不一致造成的比较障碍,却不能消除不同来源的标注噪声、诊断标准和样本构成差异。
元数据的覆盖也不均匀。年龄与性别分析主要依赖 BRSET、mBRSET、PAPILA;质量分析依赖 BRSET 和 mBRSET。论文把可用性作为计算条件,而不是给缺元数据的数据集推断人口属性或质量标签。
2. 接口分离评测:保留三类模型实际不同的监督和分数来源
视觉模型(VM)冻结图像编码器,在各数据集训练集上拟合类别平衡的逻辑回归头,再在该数据集测试集上评测。一般视觉编码器包括 ViT-L/16、DINOv2-L、DINOv3-ViT-L,眼科编码器包括 RETFound 变体与 VisionFM-Fundus。这里评价的是“预训练特征加任务标签训练的轻量分类器”,不是视觉模型未经监督的零样本诊断。
双编码器视觉语言模型(VLM)提供两种接口。线性探针只使用冻结的图像塔,与 VM 的分类头协议相同;零样本模式则把图像分别与负类、正类文本提示匹配,将模型封装器处理后的相似度乘以 100,再做二类 softmax。这个固定缩放会改变分数的尖锐程度,因此 VLM 校准结果不仅取决于视觉表征,也取决于该概率转换约定。
VLM 组包含 CLIP、SigLIP2、MedSigLIP、EyeCLIP、RET-CLIP 和 FLAIR。原文表 2 将 MedSigLIP 列入 Generalist 一行,因此表中的组名不宜理解为经过严格控制的“完全没有医学预训练”;跨组均值不是医学预训练效果的因果实验。
多模态大语言模型(MLLM)采用任务专属二元提示,要求回答 yes 或 no。关键是连续分数与硬预测分开产生:连续分数取首个生成位置完整词表 softmax 中肯定词元变体的最大概率,硬预测则从生成文本中解析第一个独立出现的 yes/no。
其中肯定变体覆盖大小写、前导空格和前导换行,但只保留可编码成单个词元的变体。论文也抽取否定变体的最大概率 \(p_i^-\),不过实际用于 AUROC、AUPRC 和 ECE 的是原始 \(p_i^+\),不是 \(p_i^+/(p_i^++p_i^-)\),也不是把全部肯定变体概率相加。
这一区别很重要:模型即使在 yes/no 两者中更偏向 yes,也可能把大部分词表概率分配给其他回答形式,得到很低的原始肯定分数。硬预测又来自生成文本,所以它不必等于对上述分数采用 0.5 阈值的结果;不能将准确率和 ECE 当作同一个决策过程的两种等价描述。
缺少有效 yes/no 解析或有效肯定分数的行被排除。接口统一使结果可分析,却不保证不同模型保留完全相同的样本分母;解析失败率和分数缺失率应与指标一起解释。
3. 多维可靠性诊断:把排序、概率与组间差距分开计算
排序指标使用 AUROC 和 AUPRC,其中 AUPRC 实现为 scikit-learn 的 average precision;准确率和 F1 则使用硬预测。AUROC 描述正负样本排序,不能保证固定阈值下表现好,AUPRC 还会受各数据集阳性比例影响。
ECE 衡量正类概率校准,而不是“预测是否正确”的置信度校准。实现将正类分数区间划为 10 个等宽分箱,再比较每箱平均正类分数与实际阳性比例:
年龄按当前分析结果行中有效年龄的中位数分成两组,超过中位数为一组,而非对所有数据集固定一个年龄阈值。性别按数据集字段归一化为 male/female,不可识别或缺失的行不参加性别分析。
公平性诊断计算两组间的阳性预测率差、准确率差、真正率差、假正率差和 AUROC 差,均取绝对差。均等机会差对应真正率差;均等化几率差取真正率差与假正率差的最大值,不是两者的平均值。这些是描述性差异,不能直接解释为因果歧视。
质量鲁棒性在整个模型—数据集—任务结果内比较两种质量分层,不继续在每个人口亚群内切分。BRSET 使用足够/不足质量,mBRSET 使用接受/不接受的最终质量标记;对准确率、AUROC、AUPRC、F1 和 ECE 分别计算两质量组的绝对差。
默认人口亚群最小样本量为 10,质量组最小样本量为 5;不足两组或较小组不达阈值的指标跳过。因此,不同模型的可用诊断覆盖可能不同。两组同样表现很差也能得到小差距,差距小不等于安全或具有高绝对性能。
原文表 3 的 Fairness、Quality、Shift 列宣称越高越好,但附录只明确了底层公平性和质量差距,没有充分交代这些高分摘要的具体变换、权重及 Shift 的构造。本文笔记保留原表值及方向,不补造其公式,也不将这些摘要解释为某一种已定义差距的简单补数。
4. 匹配基线适配比较:同一模型、同一测试任务上比较微调前后
适配实验只在 BRSET 和 mBRSET 上对三个任务分别训练,因为它们同时具有任务标签和相关元数据。每个适配器既在训练来源的保留测试集上评价,也在其他支持相同任务的数据集上评价;OOD 在这里表示训练数据集与测试数据集不同,不表示跨病种任务迁移。
总计 228 个适配器评测配置,其中 36 个域内、192 个同任务域外。每个结果与同一基础 MLLM 在相同测试数据集和任务上的结果配对,指标变化是微调后减去基础模型;AUROC、AUPRC、准确率和 F1 增加为好,ECE 减少为好。
适配器与基础模型使用相同提示、答案解析和分数提取,以免把评测代码的改变算成微调收益。统计分析按图像标识对齐配对预测,在每个比较内有放回重采样图像;域级摘要另对适配器—测试比较的配对增量均值做 bootstrap,并在每个指标族内用 Benjamini–Hochberg 校正多重比较。
这一设计比单纯比较两张不匹配的排行榜更有解释力,但配对单位仍是图像,不是明确的患者簇。来自同一患者的双眼或多张图像可能相关;不能把论文未报告的患者级重采样和患者隔离切分视为已经完成。
损失函数 / 训练策略¶
六个适配模型为 Gemma-3-27B、MedGemma-4B、MedGemma-1.5-4B、LLaVA-NeXT-8B、Qwen3-VL-8B、MedGemma-27B。SFT 对助手的二元回答词元优化交叉熵,而不是直接优化 AUROC、公平性差距或校准误差。
LoRA 覆盖所有线性模块,rank 为 16、alpha 为 16、dropout 为 0.05、不训练 bias。训练采用 bf16、梯度检查点与配置中的 16-bit 模式,训练 1 个 epoch,学习率 \(2\times10^{-5}\)。
27B 级模型 batch size 为 1、梯度累积 8;较小模型 batch size 为 4、梯度累积 4。作业申请 4 张 80GB H100 训练,基础评测及适配器推理申请 1 张 H100。
附录 D 中的 18h 训练和 20h 评测是 Slurm 作业时间上限,不是实测运行时间,也不能据此比较模型推理效率。
实验关键数据¶
主实验¶
基础结果覆盖 532 个模型—数据集—任务—方法配置:VM 190、VLM 228、MLLM 114。下表取原文表 3 的 Overall 行;它是组级汇总,不是所有模型在完全相同监督和元数据覆盖下的受控竞赛。
| 模型组 | 方法 | Accuracy | AUROC | AUPRC | ECE ↓ | Fairness ↑ | Quality ↑ | Shift ↑ |
|---|---|---|---|---|---|---|---|---|
| General VM | 线性探针 | 0.803 | 0.828 | 0.617 | 0.209 | 0.899 | 0.885 | 0.654 |
| Ophthalmic VM | 线性探针 | 0.733 | 0.667 | 0.414 | 0.231 | 0.917 | 0.899 | 0.762 |
| General VLM-encoders | 线性探针 | 0.802 | 0.829 | 0.614 | 0.201 | 0.923 | 0.863 | 0.661 |
| General VLM-encoders | 零样本 | 0.552 | 0.549 | 0.303 | 0.275 | 0.934 | 0.891 | 0.800 |
| Ophthalmic VLM-encoders | 线性探针 | 0.763 | 0.773 | 0.592 | 0.182 | 0.915 | 0.911 | 0.732 |
| Ophthalmic VLM-encoders | 零样本 | 0.636 | 0.647 | 0.395 | 0.240 | 0.948 | 0.918 | 0.729 |
| General MLLMs | 零样本提示 | 0.575 | 0.658 | 0.423 | 0.388 | 0.950 | 0.950 | 0.603 |
| Medical MLLMs | 零样本提示 | 0.791 | 0.803 | 0.642 | 0.194 | 0.939 | 0.966 | 0.567 |
一般视觉编码器明显强于眼科 VM,但一般 VLM 的线性探针 AUROC 0.829 也略高于一般 VM 的 0.828,不能将“VM 最强”当作跨所有方法的严格结论。眼科 VLM 在零样本接口下优于一般 VLM,在线性探针接口下却落后,说明接口会改变组间排序。
医学 MLLM 的平均 AUROC 与 ECE 优于一般 MLLM,但其 Shift 摘要 0.567 低于一般 MLLM 的 0.603;即便沿用原表“越高越好”的方向,也不存在所有维度的全面胜者。由于摘要指标定义不足,这一列只支持原报告层面的比较。
原文表 4 的 mBRSET 上一般/眼科 VM 平均 AUROC 为 0.754/0.592,差值 +0.162。mBRSET 是唯一手机眼底数据集,但设备、人群和标签构成同时变化,所以结果提示复合域偏移下的差距,而不单独证明手机设备导致退化。
消融实验¶
论文的核心适配分析不是删除某个网络模块,而是比较匹配基础模型与 SFT 适配器。下表结合表 5 与附录表 11;所有变化均是 SFT 减去基础模型,置信区间为 95%。
| 测试域 | 指标 | 平均变化 | 95% CI | q 值:表 5 / 表 11 |
|---|---|---|---|---|
| 域内 | AUROC | +0.004 | [-0.002, 0.010] | 0.477 / 0.521 |
| 域内 | Accuracy | +0.033 | [0.003, 0.076] | 0.004 / 0.004 |
| 域内 | ECE | -0.040 | [-0.085, -0.008] | 0.004 / 0.004 |
| 域外 | AUROC | +0.002 | [-0.002, 0.006] | 0.521 / 0.521 |
| 域外 | Accuracy | +0.012 | [0.005, 0.021] | 0.005 / 0.005 |
| 域外 | ECE | -0.018 | [-0.026, -0.009] | 0.004 / 0.004 |
SFT 后域内平均 AUROC 为 0.776、ECE 为 0.164,域外分别为 0.724、0.290(附录表 10)。准确率与 ECE 的平均改善通过校正后的显著性检验,而 AUROC 区间跨零;这支持“主要改变回答与分数映射”的解释,但不是对模型内部机制的直接证明,也不能保证每个适配器都受益。
关键发现¶
- 按表 3,医学 MLLM 在任意 DR 上 AUROC 为 0.868,在 GON 上为 0.656;一般 VM 对应为 0.867 和 0.742。GON 明显更难,但标签与图像协议的异质性也可能参与形成差距。
- 原文报告 VLM 线性探针通常提高 AUROC,却在所比较的六个模型上都增大公平性差距。更好的排序和更小的群体误差差距不能互相代替。
- 同为 27B 时,正文报告 MedGemma 相比 Gemma-3 的平均 AUROC 从 0.648 增至 0.797、ECE 从 0.36 降至 0.19;医学系列从 4B 增至 27B 则没有可靠的平均 AUROC 增益。这是所测模型的描述性结果,不是排除所有训练差异后的因果证据。
- 原文存在数字口径冲突:图 4 附近正文的 GON 均值为一般 VM 0.701、一般 VLM 探针 0.714、医学 MLLM 0.642,表 3 则为 0.742、0.745、0.656。本笔记采用方法明确的表 3,不将两套均值混用。
- 表 4 的 JSIEC1000 行列出 0.958、0.851 和差值 +0.106;显示数直接相减为 0.107。RFMiD 行列出 0.914、0.849 和 +0.066,直接相减为 0.065。保留作者报告差值,可能来自未显示精度,但原文未给出足以核实的细节。
亮点与洞察¶
- 评测接口本身是实验变量。 VLM 从图文匹配换成线性探针后,不只改变准确率,也改变排序和亚群差距;“同一个预训练模型”并不对应唯一的医学分类性能。
- 原始肯定词元概率值得单独审计。 MLLM 的 ECE 会同时受疾病信号和输出形式概率质量影响;后续研究可控制其他条件,比较原始分数、二元归一化分数与独立校准,但不能把这些改法冒充本文已做的实验。
- 匹配增量比绝对排行榜更适合分析适配。 用相同基础模型、任务与测试来源配对,能够看到微调是改善排序还是主要移动决策行为;仍需同时报告有效样本交集与失败覆盖。
局限与展望¶
- 不是临床验证。 研究仅做回顾性分类评测,不能据此提出诊断、筛查分诊、患者决策或部署就绪结论;这是正文第 6 节与附录 A、S 明确限定的用途边界。
- 标签协调不能制造统一金标准。 GON 结构标签与确诊青光眼有区别,不同 DR 标注协议也仍有噪声;后续应报告映射敏感性与标注一致性。
- 元数据和输出缺失会改变比较分母。 最小组量过滤、性别缺失和 MLLM 无效答案排除都影响覆盖;应报告每个指标的有效样本数,而非只呈现汇总分数。
- 患者相关性尚需明确。 本文说明图像级配对 bootstrap,但未充分说明患者级聚类统计及所有数据集的患者隔离切分;双眼或重复拍摄可能影响不确定性估计与切分独立性,这是风险而非已证实泄漏。
- 摘要定义与报告一致性有待补齐。 Fairness、Quality、Shift 摘要公式不足,域内 AUROC 的 q 值在正文与附录不同;应给出固定结果版本、聚合权重与完整计算协议。
- 公开图像的再分发受许可约束。 附录 S 建议只在允许的范围发布指标、元数据、清单与代码;不能将公开可访问等同于可自由再分发。
相关工作与启发¶
- vs RETFound / VisionFM: 这些工作侧重眼科基础表征,FOCUS 提供跨数据集、分接口的外部评测视角。其结果提醒后续预训练研究保留 DINO 等一般视觉基线,而非默认领域预训练全面占优。
- vs FLAIR / RET-CLIP / EyeCLIP: 这些模型将眼科图文监督注入双编码器;FOCUS 同时检验图文零样本与冻结图像特征探针,显示两种接口应分别报告。
- vs FunBench / LMOD: 眼底问答能力和生成式失败模式并不等于同任务疾病分类迁移。FOCUS 将生成式模型纳入与非生成式模型共用的分析层,但并未评价自由文本解释是否医学正确。
- 后续研究线索: 将设备、人群与标签标准分别控制,并在患者级切分和固定有效样本集上检查校准方法,才能更精确解释当前观察到的复合域偏移。
评分¶
- 新颖性: 4/5 — 贡献在跨模型接口、多数据来源和可靠性维度的联合评测,而非新网络结构。
- 实验充分度: 4/5 — 基础与适配配置覆盖广,但亚群元数据、患者级统计和严格受控域偏移仍有限。
- 写作质量: 3/5 — 主要协议清楚,摘要指标定义和正文/附录数字一致性仍需改善。
- 价值: 4/5 — 为医学基础模型的回顾性评测提供可复用框架,不构成临床安全证据。