GradingBench: Evaluating End-to-End Compositional Reasoning of MLLMs for Automated Exam Grading¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/ERRORSEMI/GradingBench
领域: LLM 推理
关键词: 多模态大模型, 自动化试卷批改, 组合推理, 视觉定位, 评估基准
一句话总结¶
构建了首个面向真实 K-12 试卷端到端自动化批改的基准 GradingBench(含 300 张整页试卷与 3,284 道带标注子题),系统评估 18 款主流多模态大模型,揭示出视觉定位缺失是主瓶颈,且模型在整合感知与认知推理时存在显著的协同崩塌。
研究背景与动机¶
多模态大模型(MLLM)在孤立的视觉问答、文档 OCR 以及单一数学推理任务中展现出惊人的单项能力,但在要求严密视觉-语言协同推理的复杂真实场景中依然步履维艰。自动化试卷批改是一个极其典型且严苛的垂直应用场景:它天然要求模型在单一工作流中同时完成答题区域检测定位、手写杂乱文本转写识别,以及结合学科领域知识与参考答案的逻辑推理判分。
然而,现有的视觉问答与文档评测基准普遍采用割裂式的单点评估范式——要么直接输入人工裁剪对齐的规整题目切片而跳过定位,要么提供预转写的文本而回避复杂版面与手写体识别,无法反映整页扫描与复杂真实卷面上的串联误差放大效应。这种隔离评估掩盖了多任务复合执行时的能力短板,使得模型在基准榜单上的高分无法转化为真实阅卷系统中的可靠可用。
面对这一断层,研究的核心诉求在于构建一个串联感知、识别与认知推导全流程的端到端真实评测闭环。核心 idea:构建首个面向真实 K-12 试卷端到端全流程批改基准 GradingBench,建立「单题-指定题-整页」三级任务与「有参考答案/无参考答案」双重设定的 6 维评测空间,并采用中心点匹配与逐级条件门控指标精确诊断感知与认知协同瓶颈。
方法详解¶
整体框架¶
GradingBench 的核心目标是评测 MLLM 在单次前向推理中完成全流程批改的综合组合推理能力。输入为真实扫描或手机拍摄的整页试卷图像,模型需自主完成手写答案区域定位、OCR 文本提取、参考解答推导与最终对错二值判定,并以结构化 JSON 列表输出。
评测框架在任务维度上划分了 3 个层级:单题批改(L1)输入裁剪后的单题图像,测定隔离状态下的基础综合能力;指定题批改(L2)输入整页图像与目标题目边界框,考察模型在复杂版面干扰下的空间注意力与局部阅卷能力;整页批改(L3)直接输入未裁剪的整页试卷,考察完全自主端到端批改能力。各层级均覆盖提供官方参考答案的 Answer-Based 设定和要求自主推导答案的 Answer-Free 设定。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入试卷图像<br/>扫描件 / 手机拍摄全页卷面"] --> B["阶段1:多维度真实卷面数据构建<br/>4项严苛筛选 + 4维精细元数据标注"]
B --> C["阶段2:分级任务与双重设定空间<br/>L1单题 / L2指定题 / L3整页 × 无答案/有答案"]
C --> D["阶段3:中心点空间匹配机制<br/>欧氏距离贪心匹配解耦微小坐标漂移"]
D --> E["阶段4:三阶段门控批改精度评判<br/>空间对应 → CER阈值过滤 → 答案推导与判分"]
E --> F["输出评测诊断结果<br/>端到端综合准确率 Acc 与定位 mAP"]
关键设计¶
1. 多维度真实卷面数据构建:覆盖真实教育场景噪声与多样分布
为摆脱合成数据与实验室理想环境的局限,基准从中国中小学(小学、初中、高中)真实期末考、模拟考及教辅资料中采集高分辨率图像,同时保留不均匀光照、纸张褶皱等现实伪影。数据筛选强制遵循 4 条准则:每页至少含 5 个手写答题区保证密集度;错误率 \(\ge 10\%\) 确保负样本充足与类别均衡;严禁包含人工批改红笔红勾痕迹以杜绝视觉泄露;覆盖单栏、双栏、图文混排及工整/草书手写。经严格过滤,数据集最终收录 300 张整页试卷,共 3,284 道标注子题,涵盖科学、数学、语文、英语、文综五大学科,全面涵盖选择题、填空题、判断题与简答解答题。
2. 分级任务与双重设定空间:解耦与探测复合认知负荷
基准构建了 L1(单题)、L2(指定题)、L3(整页)三级由简至繁的空间任务体系,并正交配置 Answer-Based(有答案)与 Answer-Free(无答案)设定。在 Answer-Based 设定中,标准答案写入 Prompt,模型侧重感知、定位、提取与比对校验;在 Answer-Free 设定中,模型必须自行从题干推导出参考解答,再与学生手写比对。实验中发现的显著反直觉现象(L2 异常)表明,在无答案时给模型提供题目金标准边界框反而导致性能显著低于完全自主的 L3 批改,深入揭示出现有模型在同时解析文本提示与对应绝对空间坐标时存在认知干扰与注意力分散。
3. 中心点空间匹配机制:解耦系统性坐标平移误差与语义定位
在评估模型输出的预测边界框与真实答案框的对应关系时,传统固定 IoU 阈值(如 IoU > 0.5)对轻微系统性偏差极其脆弱——模型即便已准确锁定手写答案文字簇,若框范围出现微弱上下平移,IoU 会骤降为 0,导致下游判分直接被全盘误杀。为此,方法采用自上而下的中心点贪心欧氏距离匹配机制,只要预测框中心与真实框中心在合理阈值内最接近即建立对应连接。试验证明该策略成功匹配了超过 97% 的语义正确区域,有效避免了因纯坐标回归细微偏差掩盖模型认知判分能力的问题。
4. 三阶段门控批改精度评判:严防偶合猜对并量化误差级联
为确保端到端批改准确率能够客观反映真实的各环节有效性,设计了严密的逐级条件判定过滤管线: - 空间对应验证:若模型漏检或无法与任何真实手写区域匹配,直接判定该题批改失败; - 文本转写过滤:在匹配框基础上计算学生手写识别字符错误率(CER),若 \(\text{CER} \ge 0.7\)(根据验证集确定的不可辨认严重错误阈值),判定失败; - 答案推导校验:在无答案设定下,采用经与人类专家达成 98.7% 高一致性的 Qwen3-32B 语义校验模型自身推导的参考答案,若推导错误直接判定失败,阻断因双重错误带来的偶合猜对; - 判分一致性评估:仅当上述三项前置门控全部通过,方对比模型最终给出的学生对错二值判断与专家标注标签。整卷最终准确率定义为通过全阶段检验且判分正确题数除以总题数: $\(\text{Acc} = \frac{N_{\text{correct}}}{N_{\text{total}}}\)$ 同时采用在 IoU 阈值 \([0.2, 0.5]\) 范围步长为 0.05 的平均精度均值 \(\text{mAP}@[0.2:0.5]\) 独立评定纯空间定位精度: $\(\text{mAP}@[0.2:0.5] = \frac{1}{7}\sum_{k=1}^{7}\text{AP}(0.2 + 0.05(k-1))\)$
实验关键数据¶
主实验¶
评测了 18 款主流多模态模型在 6 个评测场景(L1~L3 的 Answer-Free 与 Answer-Based)下的表现。下表摘选代表性开源与闭源前沿模型在各层级下的核心结果(原论文 Table 2):
| 模型 | L1 mAP | L1 Acc-F | L1 Acc-B | L2 mAP | L2 Acc-F | L2 Acc-B | L3 mAP | L3 Acc-F | L3 Acc-B | 综合均值 Overall |
|---|---|---|---|---|---|---|---|---|---|---|
| Gemini-3.1-Pro | 63.03 | 79.60 | 89.74 | 47.28 | 72.00 | 83.96 | 35.65 | 70.06 | 81.78 | 69.23 |
| Doubao-seed-2.0-Pro | 81.09 | 75.58 | 85.93 | 30.76 | 46.30 | 71.48 | 64.15 | 68.14 | 79.95 | 67.04 |
| Kimi K2.5 | 20.18 | 63.15 | 74.39 | 16.58 | 32.81 | 58.91 | 25.24 | 59.77 | 67.92 | 46.55 |
| Gemini-2.5-Pro | 29.34 | 67.33 | 78.11 | 16.82 | 38.03 | 67.08 | 14.09 | 50.94 | 56.09 | 46.43 |
| Qwen3.5-Plus | 22.78 | 60.63 | 71.19 | 14.79 | 30.73 | 53.66 | 36.03 | 56.09 | 65.59 | 45.72 |
| Claude-Opus-4.6 | 22.30 | 64.61 | 75.78 | 10.40 | 40.05 | 67.49 | 4.59 | 43.91 | 57.77 | 42.99 |
| Qwen3-VL-235B-A22B | 20.98 | 51.92 | 66.96 | 7.67 | 17.85 | 40.53 | 35.42 | 47.42 | 63.68 | 39.16 |
| GPT-5.2 | 22.53 | 41.23 | 63.64 | 4.21 | 9.54 | 28.24 | 4.00 | 18.10 | 33.05 | 24.95 |
| Qwen2.5-VL-72B | 6.73 | 50.37 | 59.50 | 1.87 | 10.96 | 23.39 | 1.40 | 23.33 | 32.83 | 23.38 |
| Qwen2.5-VL-7B | 0.93 | 32.67 | 36.75 | 1.30 | 5.18 | 10.32 | 0.74 | 8.38 | 11.91 | 12.02 |
消融与诊断分析¶
为探究瓶颈到底是纯单项感知不足还是复合协同失效,论文在 L1 单题上进行了纯单项能力隔离诊断(消除多任务干扰,原论文 Table 3),并在 L3 探索了单轮与多轮交互分解(原论文 Table 4):
能力单项隔离评测(L1 隔离模式)
| 模型 | 纯定位 mAP | 纯识别 (CER < 0.7) | 纯推理准确率 |
|---|---|---|---|
| Gemini-3.1-Pro | 67.72 | 92.87% | 87.56% |
| Gemini-2.5-Pro | 40.74 | 90.16% | 80.48% |
| Qwen3-VL-235B-A22B | 41.49 | 93.11% | 80.60% |
| Doubao-Seed-1.6 | 13.05 | 85.54% | 80.01% |
| Qwen2.5-VL-72B | 7.07 | 84.90% | 77.38% |
| InternVL3-78B | 1.16 | 79.84% | 68.14% |
单轮 vs 多轮交互分解(L3 无答案设定)
| 模型 | 单轮 mAP | 单轮 Acc-F | 多轮 mAP | 多轮 Acc-F |
|---|---|---|---|---|
| Gemini-3.1-Pro | 35.65 | 70.06% | 39.66 | 74.38% |
| Gemini-2.5-Pro | 14.09 | 50.94% | 21.31 | 58.40% |
| Qwen3-VL-235B-A22B | 35.42 | 47.42% | 45.49 | 58.48% |
| Doubao-Seed-1.6 | 15.43 | 50.79% | 22.97 | 58.25% |
关键发现¶
- 定位是最大的硬天花板:单项隔离测试中,各模型文本识别达标率多在 \(85\%\sim 93\%\) 之间,推理准确率在 \(77\%\sim 88\%\) 之间,方差较小;然而定位 mAP 极化严重(最高 67.72% 对比最低 1.16%,差距达 66.56%)。定位漏检与坐标脱节直接切断了后续阅卷流程。
- 复合提示词引发协同干扰:Gemini-2.5-Pro 在纯定位任务中 mAP 达 40.74%,但在端到端 L1 批改任务(需要同时输出坐标、文本与判分)中 mAP 暴跌至 29.34%,说明同时解析多重指令会极大干扰视觉坐标回归稳定性。
- 反直觉的 L2 异常:在 Answer-Free 设定下,提供指定题目边界框的 L2 任务表现普遍低于自主整页批改的 L3(例如 Doubao-seed-2.0-Pro 的 L3 Acc-F 为 68.14%,而 L2 Acc-F 仅 46.30%),印证了模型难以协同理解长文本指令与绝对数值坐标空间。
- SFT 带来感知飞跃但认知提升有限:利用 673 张试卷构造的约 10,000 条样本对 Qwen2.5-VL-7B 进行微调后,平均得分由 8.20% 飙升至 57.47%(L1 mAP 达到 84.81%),显著补齐了开源小模型的感知定位短板,但更深层的多步推理逻辑提升依然面临模型容量瓶颈。
亮点与洞察¶
- 评测闭环机制的真实性设计:摒弃单纯依赖传统 IoU 判定定位成功的刻板设计,提出中心点匹配结合条件式三阶段门控判分,使得评测体系既能容忍像素级轻微偏移,又能严防「猜对判分」的伪阳性干扰。
- 揭示前沿模型「空间-指令」融合盲区:通过 L2 异常明确指出了当前 MLLM 普遍欠缺将精确提示词与图像几何空间坐标绑定理解的能力,为下一步多模态预训练与对齐提供了关键的诊断依据。
- 分解范式与 SFT 具备即插即用修复价值:多轮分阶段推理将感知、推导与比对解耦,能在零额外参数下使各模型 L3 准确率稳定获得 \(4\%\sim 11\%\) 的增益;而针对性 SFT 更能实现小模型在专业视觉感知维度的越级追赶。
局限与展望¶
- 题型与任务范围有限:当前主要局限于中国中小学体系的客观题和具有二值对错标准的浅层主观题(如选词造句、阅读简答),尚未覆盖作文打分、步骤分细致裁量等需要连续加权和主观审美评价的高阶场景。
- 未深入探索多语言与跨文化试卷:当前数据全部来源于中文教育材料,尽管评测逻辑通用,但在阿拉伯数字、拉丁字母与不同国家考试排版格式的跨文化泛化性上仍需进一步拓展。
- 多轮交互尚未实现自主动态反馈:当前多轮评估为固定三阶段(定位识别 → 解题推导 → 最终比对),缺乏类似人类教师在发现疑点时的主动变焦放大、反复验算的动态自适应 Agent 机制。
相关工作与启发¶
- vs TextVQA / DocVQA: 传统 OCR 与文档 VQA 聚焦规整印刷体或简单标牌提取,缺乏复杂试卷手写与领域逻辑链的串联,GradingBench 补齐了端到端全链路诊断。
- vs MathVista / ScienceQA: 现有科学数学评测着重于多步逻辑推理,但通常使用裁剪清晰的图表输入,避开了细粒度视觉定位与多任务执行负荷;GradingBench 揭示了图文并茂整页排版下的复合感知脆弱性。
- vs Exams-v / EDU-CIRCUIT-HW: 既往教育类基准大多仅涵盖特定物理/电路题型或孤立的作文图片,未能构建整页自适应端到端全流程批改闭环。
评分¶
- 新颖性: ⭐⭐⭐⭐ [针对端到端试卷批改构建了业界首个全流程复合基准,诊断切入点极其犀利]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 18 款主流模型、3 个层级、2 类设定,辅以单项隔离、多轮分解与 SFT 诊断实验]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图表信息量极其丰富,L2 异常与协同失效分析入木三分]
- 价值: ⭐⭐⭐⭐⭐ [为教育垂类 AI 落地与 MLLM 感知-认知多任务协同演进提供了标杆性质的评测体系与数据集]