MedRepBench: Benchmarking Structured Understanding of Medical Report Images¶
会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
领域: 医学图像
关键词: 医疗报告理解, 结构化抽取, 视觉语言模型, 基准测试, 强化学习对齐
一句话总结¶
提出了包含 1,925 张真实多源中文医疗报告图像的端到端结构化理解基准 MedRepBench,设计了字段级召回率客观评测与 LLM 裁判主观可解释性评测双重协议,并通过以非可微召回率为奖励的轻量化 GRPO 强化学习将 8B VLM 的端到端字段召回率提升 6.14%。
研究背景与动机¶
医疗检验与检查报告的智能解读是现代智慧医疗与患者自主健康管理的核心基础功能。在真实的互联网问诊、慢病管理与分级诊疗场景中,患者往往直接上传手机翻拍的纸质单据、医院 App 电子报告截图或导出的电子文档。自动化系统不仅需要把专业晦涩的临床指标转化为面向患者的通俗解释,更需要精准抽取结构化指标(项目名称、实测值、单位、参考区间及异常标识),以便实现跨医疗机构的数据标准化汇聚与临床系统对接。
然而,现存的主流方案在实际医疗报告理解任务中面临严重的评估空白与技术瓶颈。传统的 OCR+LLM 级联流水线虽然在通用文本场景成熟,但在医疗报告中依赖脆弱的人工解析工程;OCR 的错行、漏字和结构切分误差会不可逆地级联到下游大模型,且级联流程彻底丢弃了原图的空间排版与几何视觉先验。另一方面,新兴的多模态视觉语言模型(VLM)虽然具备原生图文理解能力,但学术界既有的医疗多模态基准大多集中在放射影像叙述性报告生成或合成模板的 VQA 任务上,缺乏针对真实世界嘈杂多源报告图像进行端到端结构化抽取的系统性基准。
为此,评估多模态大模型直接从原始报告图像中理解细粒度结构化信息的能力变得至关重要。本文的切入点是建立一个覆盖检验科与检查科、多采集来源与多样化排版的真实中文医疗报告基准,并解耦端到端与文本辅助两种范式以明确性能边界。核心 idea:构建包含 1,925 张真实医疗报告图像的 MedRepBench 基准,设立字段级召回率与 LLM 裁判双轨评测机制,并验证以字段召回率为非可微奖励信号的轻量化 GRPO 强化学习可显著激发中等规模 VLM 的端到端结构化抽取能力。
方法详解¶
整体框架¶
MedRepBench 构建了一整套从真实临床数据脱敏治理、多粒度双轨评测到下游强化学习对齐的研究体系。整个框架输入为未经人工排版规范的真实医疗报告图像(涵盖手机拍照、App 截图与电子报告),通过系统化的去标识化、启发式过滤和去重校验构建高质评测集。在评测阶段,框架将检验类报告与叙述性检查类报告解耦,分别执行字段级召回率客观评测和基于参考依据的 LLM 裁判主观评测。此外,MedRepBench 的字段召回率指标被进一步设计为非可微的强化学习奖励,用于指导端到端视觉语言模型的策略优化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["真实医疗报告图像<br/>拍照 / 截图 / 电子文档"] --> B["多源数据脱敏与质控<br/>启发式过滤与ROI打码"]
B --> C["双重评测协议基准"]
C --> D["字段级召回客观评测<br/>名称/数值/单位/参考区间/异常"]
C --> E["LLM裁判主观评测<br/>真实性/可解释性/推理质量"]
D --> F["GRPO强化学习对齐<br/>以平均召回率为奖励优化VLM"]
E --> G["患者端解释与临床报告落地"]
F --> G
关键设计¶
1. 多源数据脱敏与质控:真实场景数据治理与可信金标构建 真实医疗报告具有机构间排版差异极大、图像采集质量良莠不齐以及强烈的患者隐私敏感性。作者从真实在线医疗咨询服务中采样的 8,000 张报告出发,实施多阶段治理。首先执行启发式图像质控,剔除短边不足 800 像素、存在严重运动模糊或残页截断的低质样本,并抽检 500 个样本验证阈值可靠性;接着结合感知哈希(pHash)与 OCR 文本相似度剔除了 12.3% 的近重复图像。针对金标标注,系统采用专有医疗 OCR 系统提取文本后输入 DeepSeek-R1 生成结构化 JSON,经过严格的模式验证、单位标准化与参考区间正则表达式归一化后,由专业人工团队审计 200 份样本,达到 97% 以上的字段级一致性。在公开前,通过 OCR 自动识别姓名、电话、住址及证件号等个人可识别信息(PII)并在对应感兴趣区域(ROI)执行高斯模糊加黑块遮盖,最终全量 1,925 张图像经过纯人工二次核验,确保患者隐私绝对安全。
2. 字段级召回客观评测:五维属性对齐与 Top-K 预算截断机制 传统的自然语言生成指标(如 BLEU、ROUGE 或 CIDEr)仅衡量浅层字符重合度,无法精确评估医学指标的抽取精度。MedRepBench 针对具有明确离散项的检验科报告(血常规、生化、尿检等),定义了包含检测项目(name)、实测数值(value)、计量单位(unit)、参考区间(reference_range)和异常标志(is_abnormal)的五元组结构。其中异常标志是一个强推理导向属性,模型不能仅机械复制文本符号,而需自主将数值与参考区间比对或判定定性阴阳性。在评测匹配时,模型生成的 JSON 项目必须在经过标准化处理的项目名称上与金标实现严格精准匹配,才对后续 4 个字段分别统计召回率。更为关键的是,为了防止模型通过无限过量生成(over-generation)或恶意穷举来刷高召回率,评测协议引入了 Top-K 预算截断机制,其中 \(K\) 严格等于该报告的金标项目总数。幻觉或冗余项会占据有限的 Top-K 槽位并挤出正确项,使得召回率指标内生具备惩罚过生成的精准约束。各字段召回率及全量平均召回率计算如下: $\(Recall_f = \frac{\# \text{ correctly extracted field } f}{\# \text{ ground truth field } f}\)$ $\(\mathrm{AvgRecall} = \frac{1}{|F|} \sum_{f \in F} Recall_f, \quad |F|=5\)$
3. 基于 LLM 裁判的主观评测:三维临床可用性量化与专家一致性校准 对于检查类报告(如超声、心电图、CT 描述),其内容主要是半结构化的叙述性文本,硬性套用字段五元组会导致不可信的伪标签。MedRepBench 设立了面向患者解释的主观评测协议,以 DeepSeek-R1 作为评估裁判,在评估阶段将 OCR 提取的高保真文本作为参考凭据输入裁判模型,对被测 VLM 在纯图像端到端输入下生成的解释文本进行打分。打分维度涵盖三项核心标准:真实性(Factuality,绝不捏造未检项目或颠倒阴阳性)、可解释性(Interpretability,语言平实且结构分明,不滥下未确证的诊断或治疗建议)和推理质量(Reasoning Quality,因果推导符合临床逻辑)。裁判输出 0(严重幻觉或危险临床建议)、1(轻微瑕疵但无害)和 2(准确详实且完全基于报告)三档评分,统计可接受率(\(\ge 1\))和卓越率(\(=2\))。通过对 60 例样本进行 3 位持证临床医生盲审多数表决的校准实验,LLM 裁判与人类专家的一致性准确率达 88.3%,Cohen's \(\kappa\) 系数达 0.82,证实了该主观评测协议具备高可信度。
4. 基于非可微召回率奖励的 GRPO 策略对齐:视觉语言模型端到端直接优化 在无 OCR 辅助的端到端纯图像推断场景下,开源 VLM 与 OCR 级联方案存在 10%–20% 的性能落差。为了探索 MedRepBench 客观评测信号对模型训练的反哺潜力,研究团队设计了基于群体相对策略优化(GRPO)的对齐基线。以在 1.5 万条医疗报告解释指令数据上 SFT 微调后的 InternVL3-8B 为基座策略模型,直接将多模态端到端输出与参考真值间的平均字段召回率 \(\mathrm{AvgRecall}\) 定义为强化学习标量奖励 \(R\): $\(R = \frac{1}{|F|} \sum_{f \in F} Recall_f\)$ 在 GRPO 迭代中,对于相同报告图像采样的一组候选输出序列,根据 \(R\) 计算群体内相对优势,并采用 PPO 风格的截断梯度以及针对 SFT 策略的 KL 散度惩罚进行更新。整个强化学习过程将复杂的全字段匹配逻辑直接作为端到端反馈,指导模型在没有显式标注 token 监督的情况下自主学会对齐表格行列排版与医学术语。
损失函数 / 训练策略¶
GRPO 对齐基线采用参数高效微调策略以保证多模态基础对齐的稳定性。在训练期间,InternVL3-8B 的视觉编码器(Vision Encoder)与图文投影层(Projector)被完全冻结,仅在底层 LLM 的所有注意力层(\(W_q, W_k, W_v\) 投影矩阵)上插入 rank=128 的 LoRA 模块。训练在由 800 份符合 MedRepBench 规范的真实检验报告构成的子集上执行 2 个 epoch。优化目标为包含 KL 散度正则的截断代理损失函数: $\(\mathcal{L}_{GRPO}(\theta) = -\mathbb{E} \left[ \min \left( \frac{\pi_\theta(y|x)}{\pi_{old}(y|x)} \hat{A}_i, \, \text{clip}\left(\frac{\pi_\theta(y|x)}{\pi_{old}(y|x)}, 1-\epsilon, 1+\epsilon\right) \hat{A}_i \right) - \beta \, \mathbb{D}_{KL}(\pi_\theta \parallel \pi_{ref}) \right]\)$ 其中优势 \(\hat{A}_i\) 由单组内多个候选预测的标量奖励 \(R\) 经标准化后计算得出。该轻量对齐策略不需要额外的密集 token 级标注即可直接优化结构化抽取性能。
实验关键数据¶
主实验¶
主实验在 MedRepBench 的检验报告子集上评测了端到端纯图像(no-OCR)与 OCR 文本辅助(OCR-asst.)两种推断配置下的开源主流 VLM 表现,涵盖五大字段独立召回率。
| 模型 | 推断配置 | \(R_{name}\) (%) | \(R_{value}\) (%) | \(R_{unit}\) (%) | \(R_{range}\) (%) | \(R_{abnormal}\) (%) |
|---|---|---|---|---|---|---|
| InternVL2.5-8B | no-OCR | 71.38 | 55.71 | 60.63 | 58.88 | 45.06 |
| InternVL2.5-8B | OCR-asst. | 85.64 | 70.14 | 77.85 | 79.40 | 58.59 |
| InternVL2.5-38B | no-OCR | 84.83 | 68.85 | 74.93 | 72.37 | 66.01 |
| InternVL2.5-38B | OCR-asst. | 95.20 | 85.02 | 89.00 | 89.44 | 81.52 |
| InternVL3-8B | no-OCR | 88.21 | 71.29 | 75.56 | 70.63 | 67.92 |
| InternVL3-8B | OCR-asst. | 95.25 | 84.87 | 88.00 | 88.80 | 77.97 |
| InternVL3-14B | no-OCR | 88.70 | 67.69 | 74.63 | 67.96 | 70.12 |
| InternVL3-14B | OCR-asst. | 95.25 | 86.53 | 89.52 | 88.81 | 83.56 |
| InternVL3-38B | no-OCR | 88.72 | 64.83 | 75.63 | 69.36 | 66.74 |
| InternVL3-38B | OCR-asst. | 94.69 | 85.64 | 88.79 | 89.88 | 77.55 |
| Qwen2.5-VL-7B | no-OCR | 89.90 | 73.17 | 77.31 | 78.33 | 68.36 |
| Qwen2.5-VL-7B | OCR-asst. | 93.94 | 82.46 | 81.61 | 85.07 | 76.39 |
| Qwen2.5-VL-32B | no-OCR | 90.13 | 76.32 | 79.30 | 81.61 | 59.66 |
| Qwen2.5-VL-32B | OCR-asst. | 95.89 | 84.72 | 87.71 | 89.15 | 83.95 |
| LLaMA-4-Scout | no-OCR | 87.90 | 65.69 | 74.29 | 67.87 | 63.24 |
| LLaMA-4-Scout | OCR-asst. | 92.68 | 78.86 | 82.94 | 77.91 | 69.23 |
| LLaMA-4-Maverick | no-OCR | 88.51 | 72.26 | 78.83 | 77.58 | 75.83 |
| LLaMA-4-Maverick | OCR-asst. | 96.68 | 87.35 | 90.23 | 90.74 | 86.56 |
在纯文本 LLM(OCR-assisted)评测中,DeepSeek-V3 达到 96.48% 的 \(R_{name}\) 与 88.83% 的 \(R_{value}\),全字段平均表现最优;Qwen3-235B-A22B-2507 亦表现出极高水准(\(R_{name}\) 96.42%, \(R_{range}\) 92.48%)。
消融实验¶
消融实验对比了经过 SFT 和 GRPO 对齐的 InternVL3-8B(8B 参数量)与各大基础基线在端到端(no-OCR)与 OCR 辅助条件下的整体平均召回率与主观质量得分。
| 模型 | OCR 输入 | 参数量 | 平均召回率 Avg. Recall (%) | 主观可接受率 Accept. (%) | 主观卓越率 Excel. (%) |
|---|---|---|---|---|---|
| InternVL2.5-8B | 否 | 8B | 58.33 | 33.67 | 17.30 |
| Qwen2.5-VL-7B | 否 | 7B | 77.41 | 26.21 | 5.58 |
| InternVL3-8B | 否 | 8B | 74.72 | 48.24 | 31.83 |
| Ours-SFT | 否 | 8B | 73.31 | 56.27 | 38.86 |
| Ours-GRPO | 否 | 8B | 79.45 | 60.64 | 42.45 |
| LLaMA-4-Maverick | 否 | 17B | 78.60 | 60.78 | 42.74 |
| Qwen2.5-VL-32B | 否 | 32B | 77.41 | 67.83 | 51.40 |
| InternVL3-38B | 否 | 38B | 73.06 | 51.15 | 32.70 |
| InternVL2.5-8B | 是 | 8B | 74.32 | - | - |
| Qwen2.5-VL-7B | 是 | 7B | 83.89 | - | - |
| Qwen3-8B | 是 | 8B | 83.90 | - | - |
| InternVL3-8B | 是 | 8B | 86.98 | - | - |
| Ours-SFT | 是 | 8B | 82.37 | - | - |
| Ours-GRPO | 是 | 8B | 87.41 | - | - |
关键发现¶
- 端到端多模态存在显著认知落差:在无 OCR 辅助时,所有开源 VLM 的字段平均召回率普遍比提供 OCR 文本时下降 10%–20%。这一差距在数值(Value)和参考区间(Range)这类密集细粒度文字上尤为突出,说明现阶段通用视觉编码器在复杂密集小字的高保真感知上仍面临挑战。
- 纯图像常见失效模式的三大根源:端到端模型的主要错误集中在:(1)密集微小数字与冷门医学单位的字符级识别失误;(2)复杂嵌套表格或多栏并列排版时的行间串读与空间对齐错位;(3)当报告中的上下箭头等异常符号与数值间距较远或印刷模糊时,模型容易遗漏异常状态判定。
- GRPO 强化学习带来跨量级突破:在仅使用 800 个样本和 LoRA 微调的约束下,以 MedRepBench 的平均召回率为奖励的 Ours-GRPO 在端到端设置下将召回率从 SFT 的 73.31% 跃升至 79.45%(提升 6.14%),一举超越了参数量大一倍以上的 LLaMA-4-Maverick(78.60%)和 32B 的 Qwen2.5-VL-32B(77.41%),证明结构化多模态抽取具备极强的强化学习对齐红利。
亮点与洞察¶
- 评测设计解耦与 Top-K 隐式惩罚:将离散结构清晰的检验报告(客观五元组)与叙述性检查报告(主观解释)严格解耦,并在召回率统计中采用 Top-K 预算截断,既规避了伪标签噪音,又优雅地在单一召回率指标中内嵌了对大模型无节制幻觉和过量生成的惩罚。
- 真实临床数据治理范式:从模糊筛选、pHash 查重、模式校验、人工双盲抽检到自动+人工多道隐私脱敏,沉淀了一套严谨且符合医疗伦理的真实世界非标报告图像数据集构建标准。
- 非可微指标向强化学习奖励的成功转化:将离散的结构化 JSON 匹配召回率直接包装为 GRPO 标量奖励,为不需要密集人工 Token 标注的端到端 VLM 复杂格式信息抽取对齐提供了可复现的轻量化工程样板。
局限与展望¶
- 语言与地域覆盖局限:MedRepBench 当前样本全部来自国内医疗机构的中文医疗报告,其表头排版、参考区间约定与缩写习惯具有特定地域性,尚未跨越到英文及其他多语言跨国界临床系统。
- 闭源前沿模型缺失:为遵守临床数据合规性与评测可复现性要求,论文仅评估了开源模型权重,未包含 GPT-4o、Gemini 1.5 Pro 等商业前沿多模态 API 的对比基准。
- 模型专精化拓展空间:基准目前主要测试了通用领域 VLM,未来将专精化医学大模型(如 MedVLM 系列)接入该基准并拓展到更多放射图文混排报告是自然的演进方向。
相关工作与启发¶
- vs. 影像放射报告生成(Argus, MedVAG):传统工作主要关注由纯医疗影像(如胸片、CT)直接生成医生的放射学描述文本,偏向长文本叙述;MedRepBench 关注的是从患者手持的各类非标化报告图纸中进行细粒度结构化提取与通俗解释,强调精准度和版面空间还原。
- vs. 通用文档理解基准(MMDocBench, BenchX):通用文档评测集中在商业票据、论文或通用表格,缺乏医疗特有的复杂参考范围比较逻辑与严格的患者用药禁忌解释要求;MedRepBench 填补了真实嘈杂医疗报告场景中端到端多模态评测的空白。
- vs. 传统 OCR+LLM 级联架构:虽然高质量 OCR 辅助下的 LLM 准确率高,但系统维护代价大且对版面错乱敏感;MedRepBench 证明了端到端 VLM 在经过合适强化学习后能够迅速逼近并有望取代级联管线。
评分¶
- 新颖性: ⭐⭐⭐⭐ [针对真实多源非标医疗报告图像提出双轨评测协议,开辟了端到端医学结构化抽取新基准]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 9 大开源 VLM 与 12 大 LLM,对比 no-OCR 与 OCR 辅助,并完成医生盲审与 GRPO 验证]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,协议数学定义清晰,实验表格与可视化详实完整]
- 价值: ⭐⭐⭐⭐⭐ [公开 1,925 张严格脱敏的真实医疗报告基准,为推动去 OCR 化的原生端到端医疗大模型落地提供重要支点]