跳转至

HighlightBench: Benchmarking and Diagnosing Markup-Driven Table Reasoning in Scientific Documents

会议: ECCV 2026
论文: ECCV 2026 Poster
项目: HighlightBench
领域: 多模态 VLM / LLM 推理
关键词: 标记驱动表格推理、多模态大模型、诊断评测、结构化推理、反事实分析

一句话总结

针对多模态大模型难以区分“看见视觉标记”与“依标记执行逻辑约束”的评测盲区,HighlightBench 构建了包含 446 张学术表格与 3,283 道问题的细粒度诊断基准,通过五大解耦任务家族、反事实扰动与显式 DSL 参考流水线,系统揭示了视觉显著性劫持模型推理的核心缺陷。

研究背景与动机

在学术论文、技术报告和专业数据分析中,表格常被作者施加高亮背景、下划线、粗体字、箭头或彩色边框等视觉标记(Visual Markups)。这些视觉标记绝非单纯的美学点缀,而是承载着明确的功能性逻辑指令:它们界定了哪些单元格应当被检索、比较、过滤或校验。对于多模态大语言模型(MLLMs)而言,理解这类标记驱动的表格远比传统表格问答(TableQA)复杂。模型不仅需要识读网格文字与行列拓扑,更必须将特定的视觉线索正确绑定到对应的结构单元上,将视觉指示转化为可在表格拓扑上执行的操作约束,并在后续的多步推理过程中严格保持该约束。

然而,现有多模态文档与表格评测基准普遍采用“端到端答案匹配”的评价机制,这导致了严重的评测盲区。实验表明,即便当前最先进的多模态模型给出了表面正确的答案,往往也并非真正遵循了视觉标记约束,而是利用了数据集本身的先验分布、启发式捷径或表格常识;反之,一旦模型回答错误,评测指标也无法区分究竟是视觉感知层“未能识别标记”,还是对齐层“标记与单元格结构错位”,亦或是符号推理层“未能依约束执行过滤与聚合”。这种混淆使得社区长期无法定量评估模型对视觉标记的真正执行能力。

本文的切入角度是打破端到端黑盒评分,建立感知-条件解释-符号执行的概率因子分解机制,并设计显式的反事实干预实验。核心 idea:将标记驱动的表格推理形式化为由结构证据绑定、约束条件生成与拓扑执行构成的三阶段概率链条,通过解耦的五大任务家族与保持表格内容不变仅改变标记位置的反事实扰动,彻底剥离模型对视觉显著性的虚假依赖与捷径行为。

方法详解

整体框架

HighlightBench 形式化地将每个评测样本定义为 \((I, M, Q, A)\) 元组,其中 \(I\) 为表格图像,\(M\) 为附带的视觉标记,\(Q\) 为自然语言提问,\(A\) 为目标答案。为精准定位模型在处理链条上的失效根源,论文引入两个显式中间变量:标记指示的结构化证据 \(z\)(标记所绑定的单元格、表头、行列或邻域),以及该证据在问题约束下诱导出的推理条件 \(c\)(过滤子集、局部拓扑依赖或比较范围)。

系统整体流程包含三大支柱:基准任务的因子分解、包含反事实干预的混合基准构建,以及用于透明归因的显式参考流水线(Reference Pipeline)。参考流水线将输入的表格图像解析为图结构表示,经由两阶段路由确定执行策略,最后通过确定性领域专用语言(DSL)解释器产出结构化结果与全链路追踪信号。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入表格图像与问题<br/>(I, M, Q)"] --> B["文档图构建<br/>文本内容/表格拓扑/标记属性绑定"]
    B --> C["两阶段路由调度<br/>粗粒度算子路由与不确定性约束补全"]
    C --> D["确定性 DSL 执行<br/>过滤/极值/聚合/拓扑一致性校验"]
    D --> E["结构化答案与中间追踪信号<br/>(Answer & Diagnostic Trace)"]

关键设计

1. 诊断因子分解与五大任务家族:解耦感知、约束与执行 传统端到端评测直接度量后验概率 \(P(A \mid I, M, Q)\),无法暴露模型内部决策的脱节。HighlightBench 将其形式化展开为全概率分解:

\[P(A \mid I, M, Q) = \sum_{z, c} P(A \mid I, c, Q) \, P(c \mid z, Q) \, P(z \mid I, M)\]

基于该分解,基准划分为五大互补的任务家族(共派生 21 个子任务): - T1. 标记对齐(Markup Grounding):聚焦 \(P(z \mid I, M)\),评测模型能否将高亮、下划线、粗体及箭头准确绑定至单元格或行列,涵盖标记存在性判断、标记单元格计数及样式驱动的内容提取。 - T2. 约束检索(Constrained Retrieval):聚焦 \(P(c \mid z, Q)\),在已确定标记证据的前提下,评测模型能否严格依照颜色分组、指定增量列或行列交叉限定检索范围,考察模型是否在检索中丢失约束。 - T3. 局部关系(Local Relations):检验局部表格拓扑的保持能力,要求模型定位目标单元格后提取其上/下/左/右相邻邻域,评估从标记证据向邻近拓扑推理的过渡稳定性。 - T4. 聚合与比较(Aggregation & Comparison):聚焦 \(P(A \mid I, c, Q)\),在标记界定的受限候选子集中执行最大值查找、排序、双项对比或数值汇总,检验约束下的符号计算能力。 - T5. 一致性与缺失检测(Consistency & Missingness):评测面对真实表格缺陷(如破折号、N/A、缺失项或非完整网格)时的鲁棒性,验证模型能否在不完整信息下忠实执行标记约束而不发生幻觉式过度补全。

2. 混合数据源构建与反事实干预设计:分离基础读取与标记诱导偏置 基准总计收录 446 张表格图像与 3,283 个问答对,兼顾真实复杂性与受控可溯源性。其中真实子集包含来自计算机视觉与自然语言处理顶会论文的 266 张真实表格与 2,268 道题,保留了合并单元格、多级表头与多样化手绘/打印标记风格,双人标注一致性达到 Cohen's \(\kappa = 0.96\);合成子集则基于模板程序化生成 180 张图像与 1,015 道题,实现难度与干扰项分布的严格可控。

为彻底厘清模型是被视觉标记所指导还是被视觉标记所绑架,论文专门设计了“反事实干预协议”(Counterfactual Protocol):固定底层表格文本内容与自然语言提问完全不变,仅变换视觉标记的位置与类型,生成 7 种衍生变体: - 无标记基线(\(n\)); - 目标一致标记(\(H_c, U_c, B_c\)):分别将高亮、下划线、粗体施加在任务的真值单元格上; - 干扰不一致标记(\(H_i, U_i, B_i\)):将相同标记施加在竞争性干扰项上。 在此协议下,论文提出了可观测的细粒度错误归因三分类:标记劫持(Marker Hijacked)(模型预测值错误但精准落入被标记单元格,证明显著性压倒了符号逻辑)、逻辑失效(Logical Failure)(预测值错误且未命中标记,属于纯计算或推理错误)、坐标错位(Coordinate Error)(预测数值正确但索引或伴随行项绑定错误)。

3. 显式参考流水线:Docgraph 与两阶段路由的确定性 DSL 执行 为了提供一套可完全复现的基线并实现错误在各推理阶段的白盒归因,论文实现了一个分层参考流水线(Reference Pipeline)。该流水线将推理拆解为三个确定性阶段: - 文档图生成(Docgraph Generation):将表格图像解构为由单元格节点、邻接边构成的显式拓扑图结构,并将检测到的视觉标记以键值属性显式挂载在对应单元格节点上,将隐式的视觉显著性转化为显式的图属性。 - 两阶段路由(Two-Stage Routing):第一阶段依据提问形式与上下文信号确定宏观执行路径与操作符类型;第二阶段专门处理不确定性,在标记条件模糊或提取信号微弱时进行条件消歧与补全,避免早期解释错误直接污染下游。 - DSL 确定性执行(DSL Execution):将路由输出编译为结构化 DSL 查询,在文档图上调用原子过滤(filter)、求极值(argmax/argmin)、分组统计和拓扑邻居查询算子,从机制上根除大模型在端到端自由生成中的格式混乱与计算漂移。

损失函数 / 训练策略

HighlightBench 作为评测基准,全量模型评测依托统一的结构化评估协议。所有开闭源多模态模型均采用标准的零样本或少样本提示机制,使用 VLMEvalKit 规范输入格式,要求模型统一输出标准化 JSON 字典。评估端采用后处理解析器提取键值并与真实参考答案进行精确匹配(Exact-Match, EM),杜绝模糊匹配带来的虚高评分。

实验关键数据

主实验

论文对 9 款主流开源多模态模型与 3 款代表性闭源商业模型进行了全基准测试,同时对比了所提出的参考流水线(Ours)。主实验精确匹配准确率(%)汇总如下:

模型分类 模型名称 合成子集 (T1) 合成子集 (T2) 合成子集 (T3) 合成子集 (T4) 合成子集 (T5) 合成总分 (All) 真实子集 (T1) 真实子集 (T2) 真实子集 (T3) 真实子集 (T4) 真实子集 (T5) 真实总分 (All)
开源模型 Gemma 3 4B 4.3 10.2 2.4 20.3 23.3 12.4 22.2 9.9 2.5 10.1 16.5 13.7
开源模型 InternVL3.5-8B 29.0 81.2 17.6 24.7 71.0 40.5 54.2 53.1 23.0 36.6 67.7 46.3
开源模型 Kimi-VL-A3B 7.4 21.0 12.1 31.2 49.7 23.8 33.1 37.5 17.4 25.9 17.0 28.6
开源模型 LLaVA1.5-7B 8.1 0.7 0.0 0.0 1.0 2.7 3.4 1.5 1.2 0.2 0.0 1.4
开源模型 MiniCPM-V 2.6 17.6 59.0 7.9 13.1 14.5 20.4 17.2 29.0 9.9 17.5 3.4 17.5
开源模型 MiniCPM-V 4.5 26.2 74.3 13.3 28.8 59.2 36.9 56.2 50.0 15.5 35.9 35.7 42.8
开源模型 Qwen2.5-VL-3B 14.6 61.1 6.7 13.1 47.1 24.9 39.4 35.6 1.2 31.3 58.9 34.7
开源模型 Qwen3-VL-8B 37.0 74.3 18.8 31.5 74.4 44.2 56.3 57.1 24.2 36.3 78.0 48.4
开源模型 Qwen3.5-9B 27.7 28.5 26.7 45.5 60.5 37.7 55.3 50.4 23.6 42.8 70.1 48.8
闭源模型 Claude Sonnet 4 32.7 81.9 40.0 37.5 67.1 47.6 56.7 59.6 42.2 60.7 68.2 58.7
闭源模型 Gemini 2.5 Flash 51.9 90.3 89.1 67.8 93.9 73.9 81.3 75.3 62.7 72.2 78.5 75.3
闭源模型 GPT-4o mini 13.0 15.1 13.3 30.1 32.3 21.1 21.3 16.3 8.5 9.4 37.7 16.4
诊断基线 本文参考流水线 (Ours) 53.4 88.9 73.3 81.5 78.9 72.3 72.9 74.2 70.8 82.2 79.8 77.1

消融与反事实分析

在 Qwen3-VL-8B 上开展的受控反事实干预实验剖析了视觉标记对模型决策的具体影响机制。下表展示了控制任务(基础单元格读取)与推理任务(极值推理)在不同标记变体下的准确率与错误归因分布:

实验任务 无标记基线 (\(n\)) 一致高亮 (\(H_c\)) 一致下划线 (\(U_c\)) 一致粗体 (\(B_c\)) 干扰高亮 (\(H_i\)) 干扰下划线 (\(U_i\)) 干扰粗体 (\(B_i\)) 核心表现分析
基础单元格读取 (Cell Retrieval, %) 95.2 96.1 95.8 96.5 94.8 94.5 95.0 各变体波动极小 (94.5%–96.5%),证实基础 OCR/读取并非瓶颈
极值推理 (Extremum Reasoning, %) 基准线 显著提升 显著提升 显著提升 大幅骤降 大幅骤降 大幅骤降 一致标记提供强提示,干扰标记直接带偏决策
错误归因:标记劫持 (Marker Hijacked) - - - - 占据主导 (>60%) 占据主导 (>60%) 占据主导 (>60%) 模型未能执行数值比对,直接输出带标记的错误候选项
错误归因:逻辑失效 (Logical Failure) 纯符号计算错误 次要比例 次要比例 次要比例 次要比例 (<30%) 次要比例 (<30%) 次要比例 (<30%) 独立于标记位置的数值/比较算子执行错误
错误归因:坐标错位 (Coordinate Error) 索引未对齐 极少比例 极少比例 极少比例 极少比例 (<10%) 极少比例 (<10%) 极少比例 (<10%) 查对数值但行/列标签关联错误

关键发现

  • 视觉显著性诱发严重的模型劫持:在极值推理反事实实验中,将高亮/粗体标记移到干扰项上会导致端到端模型准确率腰斩,且错误归因表明超过 60% 的错误属于“标记劫持”(模型盲目将注意力投注到视觉显眼处而放弃了大小比较);相比之下,基础单元格读取在所有变体上稳定维持在 95% 左右,直接证明了这种脆弱性源于“推理约束脱节”而非“看错单元格”。
  • 不同标记类型的感知难度差异悬殊:在显式感知任务中,模型对粗体和下划线的存在性判断具备天然的负类偏置(更容易识别未标记项),而高亮背景(Highlight)的识别难度最高且最不稳定,极易与浅色底纹或反光混淆。
  • 任务家族难度严重分化:以 T2(约束检索)为代表的直接检索任务各模型表现相对稳健,而 T1(标记对齐)和 T3(局部拓扑关系)则成为重灾区;T4(聚合与比较)更是上游对齐误差的放大器——一旦第一阶段提取的候选池存在污染,下游符号计算将满盘皆输。
  • 解耦式流水线在结构计算上优势显著:参考流水线(Ours)通过 Docgraph 显式建模与 DSL 符号计算,在 T3(局部关系,70.8% vs Claude Sonnet 4 的 42.2%)和 T4(聚合比较,82.2% vs Gemini 2.5 Flash 的 72.2%)上取得优异表现,展现了结构化中间态在规避视觉诱骗上的有效性。

亮点与洞察

  • 反事实干预确立了表格评测的纯因果范式:在保持表格数据与自然语言提问绝对不动的前提下仅移动视觉标记位置,这一设计巧妙排除了语义先验与捷径作弊,使得视觉标记对模型决策的驱动力被纯净度量。
  • 将连续视觉线索升格为第一类离散逻辑约束:论文没有将高亮简单当成视觉特征,而是形式化为限定搜索空间、定义集合边界的布尔前置条件,指明了多模态模型从“视觉描述”走向“视觉引导规划”的关键落差点。
  • 中间决策外显化实现精准定责:所构建的参考流水线不仅是一个强基线,更是一个白盒诊断探针,通过观察文档图构建、路由分发与 DSL 运行轨迹,能清晰溯源模型究竟在感知、绑定、还是计算环节崩塌。

局限与展望

  • 标记样式多样性仍可拓展:当前基准主要涵盖了学术论文常见的背景高亮、粗体、下划线与常规箭头,尚未广泛覆盖复杂手写批注、手绘圈选波浪线、多色重叠交叉标记等非标准工业级扰动。
  • 两阶段路由对极端嵌套表格仍有局限:参考流水线依赖于清晰的单元格检测与拓扑构建,在面临无边界多级嵌套跨行复杂表格时,Docgraph 初始化阶段仍可能引入对齐偏差。
  • 未来方向:探索端到端 MLLM 的视觉标记指令对齐微调技术,将视觉标记理解作为预训练或 RL 偏好学习中的显式约束惩罚项,抑制视觉显著性对多模态符号推理的负面劫持。

相关工作与启发

  • vs TAPAS / TableBench 等通用 TableQA 基准:现有基准侧重于从纯文字/常规网格表格中提取答案并计算数值,忽略了真实排版中广泛存在的视觉引导标记,无法评估模型在视觉与拓扑双重约束下的协同推理。
  • vs VIP-LLaVA / ControlMLLM 等视觉提示工作:现有视觉提示模型依赖于用户在推理阶段人为注入的外置红色方框、箭头或掩码提示;而 HighlightBench 面向的是文档原生的内置标记,模型必须自主理解标记的语义功能与限定范围,而非机械地遵从外置提示。
  • vs SO-Bench / ExtractBench 等结构化输出评估:两者均主张摆脱自由文本答案匹配以暴露深层失败;HighlightBench 进一步将结构化模式延伸至多模态表格因果推理链条中,实现了全流程可追溯评测。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次系统形式化视觉标记驱动的表格约束推理,反事实设计严密且切中要害]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 12 款主流开闭源大模型,包含真实/合成子集及详尽的错误归因分析]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑框架严整,数学形式化清晰,图表与实验剖析深入透彻]
  • 价值: ⭐⭐⭐⭐⭐ [为多模态文档智能提供了极具诊断价值的基准工具,有力推动符号与感知协同推理]