RobustRDP: Advancing Reaction Diagram Parsing via Synthetic-to-Real Data Scaling and Robustness-Oriented Training¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/jaydetang/RobustRDP
领域: 多模态VLM
关键词: 反应流程图解析、多模态大语言模型、合成到真实数据扩展、前缀扰动、直接偏好优化
一句话总结¶
RobustRDP 针对化学反应流程图解析中专家标注稀缺与自回归序列误差累积的两大核心瓶颈,构建了“样本-渲染-排版”合成到真实数据扩展管线,并提出融合区域引导、前缀扰动及直接偏好优化的三阶段渐进式鲁棒训练策略,在基准测试上大幅超越此前 SOTA。
研究背景与动机¶
化学反应流程图解析旨在将学术文献与专利图像中复杂的化学反应方程式自动转换为机器可读的结构化数据,精确提取各反应的反应物、反应条件和生成物。这一任务是构建大规模化学知识库、驱动计算机辅助合成路线规划以及加速自动化药物发现的基石。然而,传统级联式流程高度依赖目标检测与人工启发式几何规则,在面对文献中多样的排版结构与复杂反应路径时,容易出现跨阶段误差累积与泛化能力匮乏的严重退化;近期基于多模态大模型或序列生成的端到端解析范式虽将目标定位与化学关系建模统一为坐标序列生成,却仍受困于数据稀缺与生成不稳定的双重枷锁。
这一领域目前面临两项关键矛盾:其一,化学反应图同时包含分子骨架、文本注解、反应箭头及空间拓扑关系,标注成本极高,主流模型长期依赖仅含 1,240 张图像的 RxnScribe 数据集,训练样本量严重不足;其二,端到端模型以自回归方式生成结构化坐标序列,相邻反应间存在复杂的时序依赖。因果注意力使得模型倾向于直接借用前序反应的生成物作为当前反应物的捷径信息(捷径学习,Shortcut Learning),而在训练阶段因只接触真实的黄金前缀(Oracle Prefix),一旦在推理时前缀产生轻微偏差,误差便会迅速级联放大,导致整条生成序列崩溃。
本文切入角度是从“数据规模扩展”与“训练鲁棒性解耦”双向发力:一方面通过程序化合成与半自动标注流水线填补数据缺口,另一方面通过显式干预时序依赖与失败模式抑制来打破自回归误差放大链条。核心 idea:构建“样本-渲染-排版”程序化合成器与半自动检测标注平台实现合成到真实数据规模化,并提出包含区域引导多任务解耦、前缀扰动容错与 DPO 负样本抑制的三阶段渐进式鲁棒训练策略。
方法详解¶
整体框架¶
RobustRDP 以 Qwen2.5-VL-3B-Instruct 作为多模态大模型底座,并在词表中引入 <rxn>、<rct>、<cnd>、<prd>、<mol> 和 <txt> 等专用结构标记符,将二维图像端到端映射为标准化的结构化坐标序列。整个系统由两个核心支柱驱动:合成到真实数据扩展体系负责提供海量且排版多样的预训练与微调数据;三阶段渐进式鲁棒训练策略则通过“合成预训练 \(\to\) 多任务 SFT \(\to\) 偏好对齐 DPO”渐进释放模型在复杂拓扑下的结构解析与抗噪纠错能力。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入化学反应图<br/>单行/多行/树状/网状复杂布局"] --> B["合成到真实数据扩展<br/>布局驱动合成器 + 半自动平台标注"]
B --> C["预训练阶段<br/>60k 合成图学习结构标记与视觉定位"]
C --> D["鲁棒导向多任务微调<br/>VRP主任务 + 区域引导RGRP + 前缀扰动PPRP"]
D --> E["失败模式直接偏好优化<br/>DPO显式惩罚低F1错误序列"]
E --> F["输出结构化反应序列<br/>反应物/条件/产物坐标与实体类型"]
关键设计¶
1. 合成到真实数据扩展体系:破解文献图纸标注瓶颈
针对真实化学文献图像专家级标注昂贵导致的数据极度匮乏,该设计提出程序化合成与半自动标注协同的数据扩展方案。首先,布局驱动合成器采用“采样-渲染-排版”流水线:从 PubChem 库中采样化学分子,从试剂/催化剂/温度语料库中采样反应条件文本,利用 Indigo 工具包进行分子节点乱序与坐标缩放渲染,并赋予文本多样的学术字体与尺寸;随后将渲染元素按文献中最典型的四类拓扑(单行 Single-line、折行 Multiple-line、树状分支 Tree、网状图 Graph)在画布上用反应箭头连接排版,自动记录精确的包围框坐标与化学角色,生成 60,000 张高质量合成图。为了弥补合成图像与真实文献图像的风格分布差异,进一步构建集成 YOLO26 的半自动标注平台,将检测模型生成的候选框交由人工复核并标注反应关系,使人工标注耗时降低约 40%,由此扩增出 3,000 张高难度真实图像,与既有数据共同构建起更大规模的训练集与评测基准。
2. 鲁棒导向多任务微调:阻断捷径学习与前缀误差级联
标准自回归生成基于因果掩码预测下一个 token,模型在预测当前反应 \(R_i\) 时极易直接关注前序反应 \(R_{<i}\) 中的真实产物作为捷径,忽视了对当前图像局部视觉特征的深入推理;同时训练时依赖黄金前缀,推理时一旦遇到自生成的预测错误则无法自愈。为此,多任务 SFT 引入两项专门设计的辅助任务:其一是区域引导反应解析(Region-Guided Reaction Parsing, RGRP),在输入图像 \(I\) 的同时额外提供包含单个反应的局部候选框 \(B_{roi}\),强迫模型仅根据框内视觉内容解析孤立反应 \(R_{roi}\),切断其对全局前序序列的捷径依赖;其二是前缀扰动反应解析(Prefix-Perturbed Reaction Parsing, PPRP),在训练前缀中随机选取子集注入坐标缩放、实体漏检或冗余实体插入等典型推理扰动,要求模型基于带噪前缀 \(\tilde{R}_{<i}\) 正确预测后续未扰动的真实反应。
RGRP 任务的优化目标为针对给定区域的负对数似然: $$ \mathcal{L}{RGRP} = -\log P(R, I) $$ 而 PPRP 任务则在扰动集合 } \mid B_{roi\(\mathcal{P}\) 外的正常反应上计算条件概率: $$ \mathcal{L}{PPRP} = -\sum, I) $$ 两项辅助任务与标准全图解析任务(Vanilla Reaction Parsing, VRP)联合训练,既夯实了局部反应的视觉定位精度,又赋予了模型在前缀出错时的纠错与恢复能力。}} \log P(R_i \mid \tilde{R}_{<i
3. 失败模式直接偏好优化:显式抑制高频低质输出
单纯的最大似然监督微调本质上属于模仿学习,模型对未能拟合的局部混淆样本仍保留较高的错误输出概率。为进一步压制模型的固有错误模式,该设计引入直接偏好优化(Direct Preference Optimization, DPO)。在构建偏好数据集时,利用 SFT 阶段训练完毕的模型在训练图集上进行全量推理,筛选出 Hard Match F1 低于 0.8 的失败输出作为拒绝响应 \(y_l\)(包含错配产物、误读箭头方向等),并将对应的标注真值作为偏好响应 \(y_w\)。以冻结的 SFT 模型为参考策略 \(\pi_{ref}\),优化策略 \(\pi_\theta\) 以最大化优质响应与劣质响应之间的隐式奖励边际: $$ \mathcal{L}{DPO} = -\mathbb{E}{DPO}} \left[ \log \sigma \left( \beta \log \frac{\pi\theta(y_w \mid I)}{\pi_{ref}(y_w \mid I)} - \beta \log \frac{\pi_\theta(y_l \mid I)}{\pi_{ref}(y_l \mid I)} \right) \right] $$ 通过该阶段的偏好对齐,模型在易错结构与边界歧义场景下的鲁棒性得到显著增强,有效杜绝了因局部置信度摇摆导致的序列崩塌。
损失函数 / 训练策略¶
训练采用三阶段渐进式优化流程,均配备预热比例为 0.03 的余弦退火学习率调度器: 1. 预训练阶段:在 60,000 张合成图上训练,冻结视觉编码器与投影层,仅对 LLM 骨干进行 1 个 epoch 的参数更新,学习率设为 \(1.0 \times 10^{-6}\),全局批大小为 16。 2. 多任务 SFT 阶段:联合优化主任务与两项辅助任务,总损失为 \(\mathcal{L}_{SFT} = \mathcal{L}_{VRP} + \mathcal{L}_{RGRP} + \mathcal{L}_{PPRP}\)。进行全参数微调 1 个 epoch,学习率为 \(1.0 \times 10^{-5}\),全局批大小为 4。 3. DPO 对齐阶段:基于 14,169 组偏好三元组,仅更新 LLM 骨干参数 1 个 epoch,学习率为 \(3.0 \times 10^{-7}\),全局批大小为 64,正则超参数 \(\beta\) 控制偏好边界敏感度。
实验关键数据¶
主实验¶
评估在两项基准上开展:官方历史基准 RxnScribe-test(138 张图,392 个反应)以及本文构建的更大规模真实文献基准 RobustRDP-test(500 张图,2,634 个反应)。评价指标包括严格匹配(Hard Match,要求反应物、条件和产物所有元素完全匹配)与宽松匹配(Soft Match,仅要求分子实体正确,不区分反应物与试剂),IoU 阈值设为 0.5。
| 数据集 | 模型 | Hard Match Precision (%) | Hard Match Recall (%) | Hard Match F1 (%) | Soft Match Precision (%) | Soft Match Recall (%) | Soft Match F1 (%) |
|---|---|---|---|---|---|---|---|
| RxnScribe-test | RxnDE | 4.1 | 1.3 | 1.9 | 19.4 | 5.9 | 9.0 |
| OChemR | 4.4 | 2.8 | 3.4 | 12.4 | 7.9 | 9.6 | |
| RxnScribe | 72.3 | 66.2 | 69.1 | 83.8 | 76.5 | 80.0 | |
| RxnIM | 74.7 | 69.7 | 72.1 | 86.9 | 82.8 | 84.8 | |
| RxnCaption-VL | 71.6 | 72.7 | 72.2 | 85.3 | 87.1 | 86.2 | |
| RobustRDP (本文) | 81.0 | 82.4 | 81.7 | 90.2 | 91.3 | 90.8 | |
| RobustRDP-test | RxnScribe | 69.7 | 61.7 | 65.5 | 82.7 | 72.3 | 77.2 |
| RxnIM | 57.5 | 50.2 | 53.6 | 76.2 | 65.8 | 70.6 | |
| RobustRDP (本文) | 82.7 | 82.4 | 82.5 | 91.1 | 90.8 | 91.0 |
消融实验¶
为明确各模块对整体系统表现的具体贡献,论文在 RxnScribe-test 上对核心训练阶段与辅助任务进行了递进式剥离消融:
| 配置 | DPO | Pretrain | RGRP | PPRP | RobustRDP-train | Hard Match F1 (%) | Soft Match F1 (%) | 说明 |
|---|---|---|---|---|---|---|---|---|
| 完整模型 | ✓ | ✓ | ✓ | ✓ | ✓ | 81.7 | 90.8 | 完整 RobustRDP 表现最优 |
| 去除 DPO | – | ✓ | ✓ | ✓ | ✓ | 80.9 | 90.0 | 缺乏负样本显式惩罚,Hard F1 掉 0.8% |
| 去除预训练 & DPO | – | – | ✓ | ✓ | ✓ | 78.8 | 88.5 | 缺少合成数据拓扑预适应,Hard F1 掉 2.1% |
| 去除 RGRP | – | – | – | ✓ | ✓ | 77.6 | 87.8 | 捷径学习损害局部解析,Hard F1 再掉 1.2% |
| 去除 PPRP | – | – | ✓ | – | ✓ | 75.7 | 86.8 | 缺乏前缀扰动容错,Hard F1 严重骤降 3.1% |
| 去除两项辅助任务 | – | – | – | – | ✓ | 74.6 | 85.9 | 纯 VRP 训练严重受困于误差级联,掉 4.2% |
| 仅用旧版真实数据 | – | – | – | – | – | 70.4 | 80.8 | 仅使用 RxnScribe-train,Hard F1 崩至 70.4% |
关键发现¶
- 前缀扰动(PPRP)是防止误差累积的关键防线:在两项辅助任务中,移除 PPRP 导致 Hard Match F1 骤降 3.1%(78.8% \(\to\) 75.7%),影响显著大于移除 RGRP(-1.2%)。这证实了自回归大模型在面对自身错误前缀时极度脆弱,强行注入带噪前缀进行容错训练对于维持长序列生成稳定性至关重要。
- 合成预训练有效建立了领域基础定位能力:没有 60k 合成数据预训练时,模型在真实数据上的 Hard F1 下滑 2.1%。合成图虽然存在纹理域差,但精准的符号标记与多样拓扑使 MLLM 快速掌握了坐标与角色联合解码模式。
- 高难度测试集更能体现鲁棒性优势:在更为复杂的 RobustRDP-test 基准上,既有 SOTA 模型 RxnIM 的 Hard Match F1 出现大幅暴跌(从 72.1% 跌至 53.6%,降幅达 18.5%),而 RobustRDP 依然维持在 82.5% 的极高水平,说明传统模型过拟合了简单单行排版,无法应对复杂多分支反应网络。
亮点与洞察¶
- 将自回归误差传播转化为可控扰动训练:针对生成式坐标预测中“一步错、步步错”的因果级联痛点,论文没有转向复杂的两阶段分离架构,而是巧妙地在自回归前缀中注入实体遗漏、错位和冗余噪声,以极低训练代价让通用 MLLM 学会推理纠偏。
- 以“区域引导”打破语言模型的自回归捷径:通过向模型输入局部边界框约束,将大图多反应全局推理强制降维为局域独立反应解析,有效剥离了前序产物对后续反应物判断的虚假语义先验,迫使视觉编码器真正关注分子图像细节。
- 高度实用的数据合成与人机协同标注闭环:结合专业化学绘图规则构建的“单行-多行-树状-网状”合成流水线,加之成熟目标检测模型带来的 40% 人工标注减负,为专业领域跨越小样本困境提供了标准范本。
局限与展望¶
- 复杂化学常识与反应机理先验的缺失:作者指出模型目前仅依赖视觉拓扑和通用语言先验进行连线推理,未显式结合分子官能团转化规则等深度化学机制。在低对比度或箭头模糊的重度遮挡场景中,仍可能预测出违背化学守恒的虚假反应。
- OCR 与分子结构识别尚未完全端到端打通:RobustRDP 当前专注于反应框定位与角色拓扑关联,分子内部 SMILES 解析与条件文字读取仍需后接 OCSR/OCR 模型,未来的终极形态应是全栈多模态统一化学大模型。
相关工作与启发¶
- vs RxnDE / OChemR:传统方法先做物体检测再用启发式几何规则连线,各模块割裂且严重依赖笔直箭头假设,在复杂弯曲或密集排版中文献解析 F1 仅有个位数;RobustRDP 采用端到端序列解码统一定位与关系建模,彻底摆脱手工规则瓶颈。
- vs RxnScribe / RxnIM:RxnScribe 基于小型 Pix2Seq 架构容量有限,RxnIM 简单微调 MLLM 却受制于捷径学习与黄金前缀脆弱性;RobustRDP 通过合成到真实数据大幅扩充,并辅以区域引导与前缀扰动多任务训练,在 RxnScribe-test 上将 Hard Match F1 从 72.1% 推高至 81.7%。
- vs RxnCaption-VL:RxnCaption-VL 需额外在图上打框打标编号以简化关系推理,高度受限于前端检测器漏检;RobustRDP 坚持纯原生图像端到端输出坐标与角色,并在多项指标上建立起 9.0% 的显著领先优势。
评分¶
- 新颖性: ⭐⭐⭐⭐ [针对自回归图表解析的捷径学习与前缀脆弱性,设计了极为切中要害的多任务扰动与偏好学习机制]
- 实验充分度: ⭐⭐⭐⭐⭐ [自建 500 张高质量测试基准,包含详尽的模块剥离实验与两套严格匹配指标评测]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑架构清晰严密,痛点分析透彻,图表呈现信息丰富]
- 价值: ⭐⭐⭐⭐⭐ [显著推高了化学图纸解析的精度天花板,开源权重与代码对科学文献自动化挖掘具有极高落地价值]