RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/PaddlePaddle/PaddleOCR
领域: 目标检测
关键词: 文档版面分析, 阅读顺序预测, 端到端多任务, 像素级掩码, 实时推理
一句话总结¶
RT-DocLayout 在 RT-DETR 上把版面元素的分类、边框回归、像素级掩码和阅读顺序预测统一进同一个查询解码器,用 33M 参数在 OmniDocBench v1.5 与 Real5-OmniDocBench 上取得最好的整文档解析准确率(94.50 / 92.05 Overall),同时在 A100 上以 batch size 32 达到 132.1 FPS。
研究背景与动机¶
文档版面分析(Document Layout Analysis, DLA)是文档智能的第一道工序:只有先把页面切成「标题 / 正文 / 表格 / 公式 / 图注」这些元素并确定它们的先后顺序,下游 OCR 才谈得上把二维页面还原成一维的有结构文本。深度学习已经把版面元素检测做得相当成熟,但在手机拍摄、装订成册的书刊扫描这类真实场景里,页面会被卷曲、折弯、透视压缩、旋转倾斜,解析质量仍然掉得很快。作者把根因归结为两条:结构建模是碎的(fragmented structural modeling),几何表示是粗的(coarse geometric representation)。
现有两条主流路线各自踩中其中一条。第一条是级联流水线:先用一个版面检测器框出元素,再叠一个二级关系模型(GNN 或 XYCut 这类启发式排序)去推阅读顺序。检测器的定位误差会直接传进排序阶段,两段之间不共享特征,版面与拓扑之间的依赖关系根本学不到。第二条是大规模预训练 Transformer 与 VLM 路线(LayoutLMv3、DiT、MinerU、Dolphin),精度上去了,代价是算力——实测里 MinerU2.5 是 2.4 FPS、Dolphin-v2 是 0.9 FPS。更要命的是这两类方法的输出都是轴对齐矩形框:页面一旦非正面拍摄,矩形框就会把背景和相邻元素一起框进来,下游 OCR 拿到的是被污染的区域,后面识别再准也救不回来。
于是核心矛盾落在「几何精度」与「效率」的夹缝里:真实文档的非刚性形变要求像素级的区域表示,而现有系统要么只有粗矩形框,要么必须付出一整个生成式大模型的代价。本文的角度是回到实时检测器上做加法——RT-DETR 本身已经是单阶段、无 NMS 的查询式检测器,如果把「像素掩码」和「阅读顺序」两件事都塞进同一批对象查询,几何精度与结构建模就能在同一套特征上联合优化,而不必多养一个模型。核心 idea:让每个对象查询同时给出类别、边框、像素掩码和两两阅读顺序,用反对称成对打分加投票排序把关系矩阵解码成唯一的全局序列,再用一套模拟纸张形变与相机投影的数据增强,把这种掩码级监督迁移到真实畸变文档上。
方法详解¶
整体框架¶
RT-DocLayout 把 DLA 重写成一个「以掩码为中心」的多任务预测问题。输入是一张文档图像(可能是平整的扫描页,也可能是卷曲、倾斜、屏幕翻拍的手机照片),输出是页面内每个版面元素的四元组:类别、边界框、像素级掩码,以及它在阅读顺序中的绝对位置。整条链路只有一次前向:RT-DETR 编码器抽出多尺度特征,\(N\) 个对象查询在解码器里逐层精炼,精炼后的查询同时喂给并行的预测头——分类、边框回归、掩码生成,以及一个成对阅读顺序打分器;打分器输出的 \(N \times N\) 关系矩阵再经投票式排序解码成唯一的全局序列。没有 NMS,没有自回归解码,也没有外挂的排序模型。
与同样基于 RT-DETR 的 PP-DocLayoutV2 相比,差别集中在两处:一是加了掩码头并把像素掩码当成一等输出(下游 OCR 拿到的不是一个矩形裁片,而是贴合元素真实边界的区域);二是把阅读顺序从「解码器之外的解耦指针网络」挪进了解码器内部,让顺序关系与几何定位共用同一批查询特征。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["文档图像"] --> B["RT-DETR 编码器<br/>多尺度特征"]
B --> C["N 个对象查询<br/>解码器逐层精炼"]
C --> D["掩码中心的多任务统一解码<br/>类别 + 边框 + 像素掩码"]
C --> E["耦合阅读顺序预测<br/>反对称成对打分 + 投票排序"]
D --> F["版面元素 + 阅读顺序"]
E --> F
F --> G["下游 OCR / 文档解析"]
H["物理空间感知数据增强<br/>ISD 曲面形变 + EPT 投影变换"] -.->|训练期注入| B
关键设计¶
1. 掩码中心的多任务统一解码:让每个查询同时回答「是什么、在哪、像素边界在哪」
轴对齐矩形框在畸变页面上的失效是可见的:页面倾斜或卷曲时,一个正文块的矩形框会同时罩住背景和邻块,OCR 裁出来的图里混进别的元素,识别结果自然崩。RT-DocLayout 沿用查询式检测的范式——解码器迭代精炼 \(N\) 个对象查询 \(Q=\{q_i\}_{i=1}^{N}\),每个查询既编码空间语义也编码结构语义——但给每个查询补了一个掩码输出,让同一个查询表征同时驱动分类、边框和像素分割三个头。这样布局元素的边界不再是四条轴对齐的边,而是贴合实际形变的像素级区域,下游 OCR 得到的输入被「净化」过。
掩码监督本身是按 MaskDINO 的做法算的:在一张掩码上采样 \(K=12544\) 个点来近似 BCE + Dice 损失,其中 75% 的点分配在不确定区域(通常是元素边界附近)。这个采样策略是这套设计能留在实时区间的前提——它把逐像素的密集监督换成点采样,掩码头的开销才不至于吃掉 RT-DETR 的速度优势。一个容易被忽略的连带好处是:显式的像素监督会逼着模型去区分紧挨着、甚至像素上重叠的元素(消融中把纯边框换成边框 + 掩码后,OmniDocBench v1.5 的 Overall 从 93.81 升到 94.33),而更细的空间线索恰好也是后面数据增强能起作用的前提(见设计 3)。
2. 耦合阅读顺序预测:把成对顺序判断塞进解码器,用反对称打分加投票排序解码
阅读顺序在级联方案里是个「事后问题」:PP-DocLayoutV2 的做法是在 RT-DETR 之后接一个解耦的指针网络,让排序模块去看检测器输出的冻结框。问题在于,排序模块看到的框已经是定稿的、可能是错的,它没有任何途径回去修正定位。消融结果把这个代价量化得非常清楚:解耦顺序模块在 OmniDocBench v1.5 上的阅读顺序距离是 0.189,不但远差于本文耦合方案的 0.041,甚至比 XYCut 这种纯启发式(0.074)还差——一个单独训练的排序模型作用在带噪的框上,反而会把顺序搞得更乱。
RT-DocLayout 的做法是把顺序判断搬进解码器本身。精炼后的查询被投影到一个共享的关系空间里,任意两个元素之间用一个双线性形式算「谁在前」的相对打分:
其中 \(W_q, W_k\) 是两组可学习投影,\(d_h\) 是头维度。注意这个式子是构造性反对称的:把 \(i, j\) 交换正好得到相反数,所以 \(S_{i,j}=-S_{j,i}\) 恒成立,关系矩阵永远不会出现「\(i\) 在 \(j\) 前、同时 \(j\) 又在 \(i\) 前」这种自相矛盾的状态,也不需要额外的对称化约束去修补。\(S_{i,j}>0\) 就表示元素 \(i\) 排在元素 \(j\) 之前。
推理时,把这些两两关系变成全局序列用的是投票而不是贪心拓扑排序:对第 \(j\) 个元素,把所有指向它的边经 sigmoid 后求和,得到它的「期望前驱数」\(V_j=\sum_{i=1}^{N}\sigma(S_{i,j})\)(对角项置零),再按 \(V_j\) 升序排出最终顺序。这一步是确定性的、非自回归的,复杂度只有 \(O(N^2)\),对一页几十个元素来说开销可以忽略。之所以有效,是因为顺序判断和几何定位共用同一批查询特征:预测歪了框的那个查询,同时也在贡献顺序打分,两者在梯度上是互相牵制的,而不会像级联方案那样一方出错、另一方只能被动接受。
3. 物理空间感知数据增强:用曲面形变加相机投影,把掩码监督迁移到畸变文档
公开文档数据集给的多是轴对齐矩形框或平面多边形标注,页面上根本不存在卷曲和透视——一个只在平整页面上训练的模型,学到的「掩码」其实还是矩形。本文的洞察是把真实拍摄的畸变拆成两个有物理含义的过程,串成一个在线增强流水线:先模拟纸张自身的非刚性形变,再模拟相机视角带来的投影变换。
第一阶段是内在表面形变(Intrinsic Surface Deformation, ISD),针对装订书刊的页面卷曲这类非刚性几何先验。它用一组平滑的周期性位移场做网格式形变,对每个像素 \((x,y)\):
其中 \(f_x, f_y \in \{\sin, \cos\}\) 随机采样,位移幅度 \(A=\alpha\min(H,W)\) 与图像分辨率成正比,空间频率 \(\omega_x=\beta\pi/W\)、\(\omega_y=\beta\pi/H\) 由均匀采样的 \(\beta\) 控制,方向 \(d_x, d_y \in \{-1,1\}\) 随机翻转;它有两种模式,单轴模式只在一个方向位移(模拟单向卷曲),intense 模式两个轴同时位移(模拟复合形变)。图像用双线性插值重采样、掩码用最近邻插值,边框按最大位移幅度动态补边以保住全部内容。第二阶段是外在投影变换(Extrinsic Projective Transformation, EPT),用复合单应 \(M = S\cdot R\cdot P\) 模拟手持拍摄的视角变化:\(P\) 通过投影参数 \(p_{20}, p_{21}\) 引入透视收缩,\(R\)、\(S\) 分别对应面内旋转与错切。最后一步是这套增强能被掩码监督「接住」的关键——变换后实例级标注是从变形后的像素掩码重新反算轴对齐边框的,而不是直接把原来的框也做一次变换,这样框标注和掩码标注始终保持自洽。
这套增强之所以只和掩码配套才有意义:像素级掩码在形变下仍然精确,所以连续形变后监督信号依然有效;纯边框方法想做同样的增强,只能去猜一个「卷曲之后这个块该框在哪」的矩形,标注本身就已经失真了。消融里它的贡献也是最粗暴的——开启后 Warp 子集涨 4.57 个点、Skew 子集涨 14.11 个点。
一个例子:一对判错的相邻元素为什么不会带偏整体顺序¶
假设一页被斜拍的文档里有 8 个版面元素:页眉、标题、正文段一、正文段二、表格、图、图注、页脚。解码器给每个元素得到一个查询向量,两两打分后得到一个 \(8\times 8\) 的反对称矩阵;把每列(指向该元素的边)过 sigmoid 求和,就得到 8 个「期望前驱数」。
真实文档里「图」和「图注」往往紧挨着、视觉线索很弱,假设打分器恰好把这一对判反了。在贪心拓扑排序里,一条反向边就足以让顺序出现歧义甚至死锁;而在投票制里,这一对只改变 \(\pm1\) 的票数差,其余 6 个元素给「图注」投的前驱票数没有变,图注的 \(V\) 值仍然大于图,最终序列不会因为这一对错误而错位。这也解释了为什么耦合式打分比逐对精确更重要:\(O(N^2)\) 个弱判断通过求和聚合后,个别噪声被平均掉了。
同一次前向里,掩码头给出的不是矩形而是贴合倾斜页面的四边形区域,下游 OCR 因此拿不到相邻块的像素;而训练期的 ISD + EPT 增强已经把这类斜拍 + 卷曲页面的形态合成过无数遍,模型见过的形变分布里就有眼前这一种。
损失函数 / 训练策略¶
训练目标是一个多任务加权和,先用匈牙利算法在预测与真值之间做二分匹配,再在匹配结果上算损失:\(\mathcal{L}_{\text{total}}=\sum_{k\in\mathcal{K}}\lambda_k\mathcal{L}_k\),其中 \(\mathcal{K}=\{\text{cls},\text{bbox},\text{giou},\text{mask},\text{dice},\text{order}\}\),权重取 \(\lambda_{\text{cls}}=4\)、\(\lambda_{\text{bbox}}=5\)、\(\lambda_{\text{giou}}=2\)、\(\lambda_{\text{mask}}=5\)、\(\lambda_{\text{dice}}=5\)、\(\lambda_{\text{order}}=50\)。分类用 focal loss(\(\alpha=0.25\),\(\gamma=2.0\))应对类别不平衡,边框回归用 \(\ell_1\) 加 GIoU,掩码用 BCE 加 Dice(点采样见前文)。
顺序损失拿到 50 这个异常高的权重,作者给了两条具体理由:一是梯度稀释,顺序损失作用在 \(O(N^2)\) 个元素对上,单个成对预测拿到的梯度被稀释了约 \(N/2\) 倍,而其他损失都是 \(O(N)\) 级别的对象级监督;二是深监督覆盖不到它,分类/检测/分割都有中间解码器层的辅助损失(\(L\) 层解码器就有 \(L\) 倍梯度更新),而顺序损失只在最后一层计算。两者叠加,不把权重拉高就基本训不动。
顺序损失本身还做了两处针对性的处理。其一是局部性加权:阅读顺序的错误往往发生在相邻元素之间,所以对动态邻域窗口 \(k=\max(5, 0.3N)\) 内的元素对给 \(w_{\text{local}}=2.0\) 的更高权重,窗口之外保持 1;其二是容忍标注噪声,用带标签平滑(\(\epsilon=0.01\))的广义交叉熵(GCE,\(q=0.7\))替代普通 BCE,避免个别标注歧义把梯度带偏:
其中 \(P\) 是有效的上三角元素对集合(不含对角线),目标矩阵 \(T_{i,j}=1\) 当且仅当真值顺序满足 \(o_i<o_j\)。只取上三角是反对称性的直接推论——下三角完全是冗余的。
其余训练设置为:模型用 PP-DocLayout_plus-L 的预训练权重初始化,训练语料是自建的 38k 文档图像(覆盖学术论文、教材、市场分析、财报、幻灯片、报纸、教辅、试卷、发票收据等,人工标注 25 个版面类别及其绝对阅读顺序),优化器 AdamW、权重衰减 0.0001、学习率恒定 \(2\times10^{-4}\)(作者说明恒定学习率是为了让反对称打分器和掩码头稳定收敛),训练 150 个 epoch,总 batch size 32。
实验关键数据¶
主实验¶
评测采用 OmniDocBench v1.5 与面向真实退化的 Real5-OmniDocBench(含 Scanning / Warping / Screen-Photography / Illumination / Skew 五个子集)。因为缺少能同时衡量版面检测与阅读顺序的标准指标,论文直接用下游解析质量来打分(Overall / TextEdit / FormulaCDM / TableTEDS / Reading Order Edit)。下表只列与最强下游识别器 PaddleOCR-VL-1.5-0.9B 组合的那一行,其余识别器的结果见原文表 1。
| 版面分析模块 | 参数量 | FPS | Overall↑ | TextEdit↓ | FormulaCDM↑ | TableTEDS↑ | RO Edit↓ |
|---|---|---|---|---|---|---|---|
| DocLayout-YOLO(+ XYCut 排序) | 20M | 107.4 | 87.29 | 0.127 | 88.74 | 85.83 | 0.169 |
| MinerU2.5 | 1.2B | 2.4 | 91.31 | 0.046 | 87.57 | 90.92 | 0.051 |
| Dolphin-v2 | 3B | 0.9 | 90.36 | 0.049 | 87.60 | 88.36 | 0.060 |
| PP-DocLayoutV2 | 53M | 110.9 | 93.56 | 0.034 | 92.09 | 92.03 | 0.042 |
| RT-DocLayout | 33M | 132.1 | 94.50 | 0.035 | 94.21 | 92.76 | 0.042 |
| 版面分析模块(+ PaddleOCR-VL-1.5-0.9B) | Overall↑ | Scan↑ | Warp↑ | Screen↑ | Illum↑ | Skew↑ |
|---|---|---|---|---|---|---|
| DocLayout-YOLO(+ XYCut 排序) | 74.07 | 85.57 | 74.70 | 77.67 | 83.65 | 48.74 |
| MinerU2.5 | 85.67 | 89.74 | 83.92 | 89.24 | 89.29 | 76.16 |
| Dolphin-v2 | 67.66 | 88.66 | 52.58 | 81.06 | 66.15 | 49.84 |
| PP-DocLayoutV2 | 85.83 | 92.04 | 86.00 | 83.28 | 90.80 | 77.03 |
| RT-DocLayout | 92.05 | 93.43 | 91.25 | 91.76 | 92.16 | 91.66 |
消融实验¶
下表取自原文表 4,为紧凑起见只保留 Warp / Skew 两个子集列(Scan / Screen / Illum 见原文);全部实验都用 PaddleOCR-VL-1.5-0.9B 作为下游识别器。
| 配置 | 定位方式 | 顺序模块 | 数据增强 | OmniDoc O↑ | OmniDoc RO↓ | Warp O↑ | Skew O↑ | Skew RO↓ |
|---|---|---|---|---|---|---|---|---|
| 纯边框 + 启发式排序 | bbox | XYCut | × | 93.81 | 0.082 | 84.44 | 77.18 | 0.662 |
| 加掩码 + 启发式排序 | bbox+mask | XYCut | × | 94.33 | 0.074 | 84.40 | 75.63 | 0.673 |
| 加掩码 + 解耦顺序模型 | bbox+mask | Decoupled | × | 93.87 | 0.189 | 85.91 | 76.24 | 0.325 |
| 加掩码 + 耦合顺序 | bbox+mask | Coupled | × | 94.39 | 0.041 | 86.68 | 77.55 | 0.146 |
| 完整模型 | bbox+mask | Coupled | ✓ | 94.50 | 0.042 | 91.25 | 91.66 | 0.061 |
为把「模型设计」和「训练数据规模」两个因素分开,论文还把 PP-DocLayoutV2 在同一份 38K 自建数据上重训了一遍,用完全相同的协议评测:
| 模型(同样本 38K 训练) | Raw O↑ | Raw RO↓ | Warp O↑ | Warp RO↓ | Skew O↑ | Skew RO↓ |
|---|---|---|---|---|---|---|
| PP-DocLayoutV2 (53M) | 93.56 | 0.174 | 84.67 | 0.236 | 75.28 | 0.320 |
| RT-DocLayout (33M) | 94.50 | 0.042 | 91.25 | 0.063 | 91.66 | 0.061 |
关键发现¶
- 掩码本身只带来温和增益,且单独用救不了畸变。 把纯边框换成边框 + 掩码后,OmniDocBench v1.5 的 Overall 从 93.81 升到 94.33,但 Warp 子集几乎没动(84.44 → 84.40),Skew 子集甚至掉了(77.18 → 75.63)。这说明像素级掩码提供的是「更细的空间线索」,要真正变成畸变鲁棒性,还得靠数据增强把那部分线索用起来。
- 数据增强是 in the wild 场景里最大的杠杆,而且它必须和掩码配套。 开启 DA 后 Warp 从 86.68 涨到 91.25(+4.57),Skew 从 77.55 涨到 91.66(+14.11),是所有消融项里幅度最大的一次跳变;连阅读顺序也一起受益,Skew 的 RO 距离从 0.146 降到 0.061。原因在于掩码在连续形变下依然精确,而矩形框的 GT 在形变后本身就失真了。
- 顺序模块「解耦」不只是收益小,而是负收益。 解耦训练的阅读顺序模型在 OmniDocBench v1.5 上给出 0.189 的 RO 距离,比 XYCut 启发式(0.074)还差一倍多,而改成与检测/分割联合优化后直接降到 0.041,在 Warp 上更是从 0.721(XYCut)降到 0.092。这是本文最有说服力的一处对比:顺序预测不是「多接一个模块」就能解决的,它依赖精准的定位与分类,必须和感知一起训。
- 增益来自设计而非数据规模。 在同样本 38K 重训的控制实验里,PP-DocLayoutV2 在 Raw 上是 93.56 / RO 0.174,在 Skew 上只有 75.28 Overall / 0.320 RO;RT-DocLayout 对应是 94.50 / 0.042 与 91.66 / 0.061。数据规模被对齐之后差距依然存在,说明掩码中心定位与顺序耦合优化确实各自在起作用。
- 效率维度上这是一次跨量级的对比。 RT-DocLayout 的 33M 参数比 PP-DocLayoutV2(53M)更小,FPS 却是最高的 132.1;相比之下 MinerU2.5(1.2B)与 Dolphin-v2(3B)分别是 2.4 FPS 和 0.9 FPS,参数量差 1-2 个数量级、速度差 1-2 个数量级。
- 代价几乎可以忽略但确实存在。 完整模型在 OmniDocBench v1.5 上的 RO 距离是 0.042,比不带 DA 的耦合版本(0.041)略高 0.001,TextEdit 0.035 也略高于 PP-DocLayoutV2 的 0.034——增益是整体性的,但并非每一项都单调变好。
亮点与洞察¶
- 一个查询干四件事,且顺序预测是构造性自洽的。 反对称打分器用「两个双线性形式之差」来保证 \(S_{i,j}=-S_{j,i}\),把一致性做进了参数化本身,而不是靠后处理修补;这比训练一个对称矩阵再取平均要干净得多。任何需要「两两比较得出全局排序」的任务都能直接复用这块。
- 投票式排序对局部错误有天然容错。 相比贪心拓扑排序(一条反向边就能造成歧义甚至死锁),「期望前驱数升序」把所有成对判断聚合成一个标量分数,个别弱线索上的错误被平均掉——这与语言模型里的 Bradley-Terry 式打分排序是同一类思路,但只用了一次前向的 \(O(N^2)\) 矩阵。
- 损失权重 50 不是拍脑袋,而是有梯度层面的解释。 把「\(O(N^2)\) 的成对损失梯度被稀释 \(N/2\) 倍」以及「顺序损失不享受解码器深监督」这两条讲清楚,是一个可以直接搬到其他成对/集合级损失上的配平启发式。
- 数据增强的设计要点在「标注怎么跟着变」。 ISD 用周期性位移场模拟卷曲、EPT 用 \(S\cdot R\cdot P\) 复合单应模拟手持视角,把畸变拆成内在形变与外在投影两段;但真正让整条流水线成立的是最后一步——边框是从形变后的掩码重新反算的。任何「用掩码标注的增强」都应该照抄这个顺序。
- 可迁移的机制:把「顺序预测头内嵌进检测解码器」的做法迁移到其他有内在顺序的检测任务上(如 UI 截图的元素层级与阅读序、流程图的步骤顺序、表格单元格的读取序),理论上只需在 DETR 类模型上加一个反对称打分头和投票排序;ISD + EPT 这套形变增强也可以迁移到场景文字检测、表格结构识别等只有平面多边形标注的任务。
局限与展望¶
- 论文自己没有报告任何几何层面的直接指标。 没有版面检测 mAP、没有掩码 IoU、也没有阅读顺序准确率,全部结论都建立在下游解析指标(Overall / Edit / TEDS)上。作者的理由是「缺少能同时衡量版面检测与阅读顺序的标准指标」,但这让「掩码到底比边框准多少」这类问题无法被直接回答,也让错误归因变得困难(下游分数掉了,是检测错、排序错,还是识别器的锅?)。
- 132.1 FPS 是 batch size 32 下的吞吐,不是单图延迟。 论文没有给单 batch 延迟、也没有端侧/移动端实测,而这篇论文的卖点恰恰是「实时工业部署」。对真实流水线来说,吞吐 132 FPS 与单张延迟 7.6ms 并不是同一回事(尤其当每页要串行送进 OCR 时),这一点最好补上。
- 训练数据不公开。 38k 图像、25 类版面元素的自建数据集没有释放,唯一可复现的入口是 PP-DocLayout_plus-L 的预训练权重和 PaddleOCR 仓库,外部很难严格复现 38K 同样本控制实验那组数字。
- 评测集与训练集分布的耦合没有交代清楚。 训练语料覆盖试卷、发票、幻灯片等,而 OmniDocBench v1.5 的评测维度同样集中在公式/表格/正文,论文没有说明自建数据与评测集之间是否存在同源页面的风险;也没有在 PubLayNet / DocLayNet 这类公开版面数据集上给出直接可比的检测结果。
- 可行改进:一是补上 mAP / mask IoU / 顺序准确率这类几何指标,哪怕作为附录;二是给出单图延迟与量化后的端侧表现;三是在公开数据集上给出一个只需公开数据就能复现的训练配置。
相关工作与启发¶
- vs PP-DocLayoutV2:两者都基于 RT-DETR、都瞄准实时文档解析,区别在两点——本文把阅读顺序从解码器外挂的指针网络搬进解码器内部(消融显示解耦版 RO 0.189 反而不如 XYCut 的 0.074),并新增了像素级掩码头。结果是参数更少(33M vs 53M)、速度更快(132.1 vs 110.9 FPS)、精度更高(94.50 vs 93.56 Overall)。本文的劣势在于没有报告几何检测指标,无法证明掩码在每个类别上都优于框。
- vs DocLayout-YOLO:DocLayout-YOLO 走的是 YOLO 式的速度路线(20M / 107.4 FPS),本身不输出阅读顺序,评测时必须挂 XYCut 后处理。这在平整页面上尚可,但在 Real5 的 Skew 子集上直接掉到 48.74 Overall,暴露了「检测快但没有结构建模」的短板。本文用同一量级的 FPS 换到了端到端的顺序预测。
- vs DLAFormer:同样是在 DETR 框架内用统一标签空间联合预测版面区域与阅读顺序,思路最接近;但 DLAFormer 仍限于轴对齐框,也没有处理卷曲/透视这类几何畸变,本文的差异点在掩码与物理增强这两块。
- vs MinerU2.5 / Dolphin-v2 / dots.ocr 这类 VLM 解析器:它们能输出结构化的整页结果,能力更通用,但成本是 0.9-2.4 FPS 和 1.2B-3B 参数。本文把自己定位成这类系统的前置模块——实验也显示,把 RT-DocLayout 换到它们的管线前面,MonkeyOCR / MinerU2.5 / Dolphin-v2 的 Overall 都有提升,说明版面质量是这些系统的共同瓶颈。
评分¶
- 新颖性: ⭐⭐⭐⭐ 统一查询解码 + 反对称打分排序本身是既有思路的组合,但「掩码中心定位 + 顺序耦合 + 物理增强」三件套串起来并做到实时,是实打实的工程与设计贡献。
- 实验充分度: ⭐⭐⭐⭐ 两个 benchmark、五个退化子集、同样本控制实验与逐组件消融都比较扎实,唯一的缺口是完全没有报告几何检测指标与单图延迟。
- 写作质量: ⭐⭐⭐⭐ 方法与动机交代清楚,损失权重和深监督的取舍有定量解释;公式在 OCR 后有若干处损坏,正文表 1/表 2 的行归属也需要对照原文确认。
- 价值: ⭐⭐⭐⭐⭐ 33M、132.1 FPS、在畸变场景把 Skew 从 75 拉到 91,对工业级文档解析流水线是可以直接替换进去的收益。