跳转至

SupGRPO: Enhancing GRPO with Matching-based Online SFT for Text Spotting

会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/Psycho-9/SupGRPO
领域: 多模态VLM / 目标检测(文本检测与识别)
关键词: 文本检测与识别、GRPO 强化学习、匹配式在线 SFT、多模态大模型、艺术字文本

一句话总结

本文让 GRPO 与一层「只作用于坐标 token 的匹配式在线 SFT」联合微调多模态大模型:SFT 补上 GRPO 缺失的 token 级定位监督,匹配机制则消掉标准 SFT 强加给独立文本实例的顺序先验,在 Total-Text、ICDAR 2015、CTW1500 与自建艺术字数据集 ATS 上同时提升检测与识别。

研究背景与动机

文本检测(text spotting)要在一个模型里同时给出每个文本实例的紧致框和识别内容。这个任务上专门模型已经做得很好:基于分割的 Mask TextSpotter v3 用实例/字符掩码分支处理任意形状,基于回归的 ABCNet v2 用可微 Bezier 曲线参数化文本形状、再用 BezierAlign 采样特征,DETR 式的 TESTR、DeepSolo 则把检测与识别都写成逐点/逐查询的序列预测。但这些方法在艺术字(artistic text)上明显吃力——这类图像有强风格化字体、非常规排版、复杂纹理,文本还常与设计图案融为一体,需要更强的视觉理解与推理能力,而这恰恰不是为普通自然场景文本设计的模型的长项。另一边,多模态大模型(TextMonkey、Vary、InternVL3.5、Qwen2.5-VL 等)在识别与文档理解上突飞猛进,识别能力远强于专门 spotter,但预测细粒度坐标的能力很差:原文 Tab. 3/4 里,未微调的 Qwen2.5-VL-7B 在 ATS 上检测只有 27.4,而专门 spotter DeepSolo 有 86.7。

作者于是分别尝试了 SFT 与 GRPO 两条微调路线,得到一个很有意思的互补结论:SFT 对检测(定位)更有效,但在识别上不如 GRPO;GRPO 对识别更有效,但在检测上不如 SFT(Tab. 6:同一数据下 SFT 63.3/77.1、GRPO 62.0/80.0,前者检测高、后者识别高)。原因也很清楚:GRPO 用规则奖励直接优化不可微的评测指标(IoU、词级 F1),允许模型在模糊、需要推理的艺术字场景里自由探索,但整张图所有框共享一个稀疏的标量奖励,缺少告诉模型「这个框的这条边该往左挪两个像素」的细粒度信号;而 SFT 恰好提供 token 级监督,代价是它对整条输出序列做监督,等于要求模型按 GT 里实例的书写顺序依次输出——可文本实例本身是一个集合,谁先谁后只是标注约定,与定位和内容都无关,这个顺序先验会引入一批无意义的学习目标,干扰检测和识别。

之所以能把两者缝在一起,是因为 SFT 与 GRPO 本来就可以放在同一个视角下看:策略梯度的形式都是「数据来源 × 奖励信号来源 × 梯度系数」,SFT 用 GT 数据、梯度系数取 1,GRPO 用策略自己采样的数据、梯度系数由组内相对优势给出。既然优化的是同一个策略,就可以在 GRPO 的 rollout 上挂一条受控的 SFT 支路,只对「已经能对上 GT」的那部分预测施加监督。核心 idea:用「文本内容 + IoU」双重匹配,把当前策略自己采样出的预测框指派到对应的 GT 框,只对被匹配上的坐标 token 追加一层交叉熵监督并与 GRPO 目标联合优化——既补上坐标的密集监督,又不把 GT 的实例排列顺序强加给模型。

方法详解

整体框架

输入是一张图像加一句任务提示(要求框出图中所有文本、给出坐标与识别内容),策略模型(Qwen2.5-VL-3B/7B 与 Qwen3-VL-8B 经 LoRA 微调,记作 TS-VL)输出一个结构化列表,每项是 {"bbox": [x1, y1, x2, y2], "text": "..."}。每个训练步里有两条并行的梯度通路:一条是标准 GRPO——对同一输入采样 G 条输出,用四项规则奖励计算组内相对优势,做带 KL 约束的策略梯度;另一条是匹配式在线 SFT——把每条 rollout 解析出的预测框与图像的 GT 框按「文本内容完全一致 + IoU > 0」建立指派,只在指派成功的实例上、只对它的坐标 token 计算交叉熵。两路梯度在同一个 batch 内相加,就得到 SupGRPO 的联合目标;匹配不上的预测框不产生坐标损失,但仍会经由 GRPO 侧的精确率/召回率奖励被评价。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["图像 + 任务提示 + GT 标注"] --> B["策略模型采样 G 条输出<br/>解析预测框与识别文本"]
    B --> C["四项规则奖励<br/>格式 / 文本 F1 / IoU 精确率与召回率"]
    B --> D["文本 + IoU 双重匹配<br/>预测框 ↔ GT 框"]
    D --> E["匹配式在线 SFT<br/>只对坐标 token 计算交叉熵"]
    C --> F["联合损失<br/>GRPO 目标 + λ·坐标 SFT 损失"]
    E --> F

关键设计

1. 四项规则奖励:把不可微的检测与识别指标直接变成优化信号

GRPO 需要一个能给整条输出打分的标量信号,本文用四条规则拼出这个信号。格式奖励是 0/1 的二值项(输出能否解析成规定的 list-of-dict 结构),保证后续奖励能算得出来;文本奖励衡量识别内容,做法是把预测文本串与 GT 文本串都切成词、当成两个词袋求交并比,得到词级 F1。这里有个容易被忽略但很关键的细节:交集按多重集计数,某个词 w 的交集数是它在预测侧与 GT 侧出现次数的较小值——所以「Sale」在图中出现两次时,模型必须也预测两次才能拿满召回,而把只出现一次的「Together」幻觉成两次时,多出来的那次只进分母不进分子,精确率会被正确惩罚。

\[R_{\text{text}}(y, GT) = \frac{2\cdot|P_{\text{words}} \cap GT_{\text{words}}|}{|P_{\text{words}}| + |GT_{\text{words}}|}\]

检测侧则拆成两个奖励:把 IoU 超过阈值 τ(默认 0.5)的预测框记为真正例,精确率是真正例占全部预测框之比,召回率是真正例占全部 GT 框之比(也就是把「框准」和「别漏框」分别给分)。之所以不用 ANLS、编辑距离这类软奖励,是因为文本检测基准的评测协议是 exact match:软奖励会诱导模型去学「Applo」这种近似拼写以骗取部分分,而测试时任何一个字符错误都记全错,奖励与评测目标就错位了;之所以不把精确率/召回率合成一个 F1 奖励,原文消融显示谐波平均会让奖励函数复杂化、收敛变差、样本效率下降,拆成两个独立奖励反而更好(Tab. 9:Text & F 69.3/83.5,Text & P & R 71.6/84.4)。

2. 文本 + IoU 双重匹配:决定这条监督信号该挂到哪个预测框上

在线 SFT 的前提是回答「哪个预测框对应哪个 GT 框」。只用 IoU 匹配(每个预测框取 IoU 最大的 GT、且阈值 0.3)会在艺术字这种密集、重叠的场景里漏掉大量有效框,或把框错配到旁边另一个实例上;只用文本匹配则完全依赖识别正确性,虽然 MLLM 的识别强、命中率高,但一张图里出现多个内容相同的实例时就无解。本文要求两个条件同时成立——文本内容完全相同 IoU 大于 0——才建立匹配对 \(M = \{(pb_i, gtb_j)\}\)。IoU 条件把「文本对但落到了另一个同文本实例上」的错配挡掉,文本条件则把「位置接近但内容识别错」的框排除在监督之外,避免用错内容去强化坐标。Tab. 8 的消融正好印证两者互补:IoU 单用 66.5/81.7、文本单用 68.6/82.8,合起来才到 71.6/84.4。

3. 匹配式在线 SFT:只监督坐标 token,让实例顺序彻底不参与优化

这是全文的核心。标准 SFT 的问题不在「监督太细」,而在「监督的范围太宽」:它对整条序列的每个 token 算交叉熵,于是 GT 里实例的书写顺序、JSON 里逗号的位置都变成了学习目标。SupGRPO 把监督面缩到最小——只取匹配成功的实例所对应的坐标 token(每条 bbox 的 4 个数字),只对它们算负对数似然:

\[L_{\text{SFT-coord}}(y, GT(x)) = -\sum_{(pb_i,\,gtb_j) \in M}\ \sum_{t \in GT_{j,\text{coord}}} \log \pi_\theta(t \mid x,\, y_{<t})\]

「在线」体现在这些监督样本不是离线数据集,而是当前策略这一轮 rollout 里采样出来的序列:坐标 token 的上下文 \(y_{<t}\) 就是模型自己生成的前文,因此 SFT 支路的监督与 GRPO 支路共享同一次前向、不需要额外采样,也不存在离线数据与当前策略分布漂移的问题。而「匹配」决定了监督是集合上的指派而非序列上的对齐——模型把「Sugar」写在第一个还是第二个位置都无所谓,只要它和某个 GT 框对得上,坐标就被监督;对不上的预测框则完全不产生坐标梯度,不会因为「顺序写反了」而被惩罚。原文的 token 消融把这条边界画得很清楚(Tab. 7):对全部 token 做在线 SFT 只涨到 64.0/81.2,只监督文本 token 会把识别推到 84.1 但检测掉到 60.8(甚至低于纯 GRPO 的 62.0),只有监督坐标 token 才让检测与识别同时上到 71.6/84.4。

一个完整示例

取原文 Fig. 1 的那张图:图中只有两个实例,GT 的书写顺序是 [{"bbox":[50,303,522,648],"text":"Rush"}, {"bbox":[30,25,557,321],"text":"Sugar"}],即先 Rush 后 Sugar。假设当前策略某条 rollout 输出的是 [{"bbox":[32,25,552,329],"text":"Sugar"}, {"bbox":[46,303,515,644],"text":"Rush"}]——内容全对,顺序与 GT 相反。标准 SFT 会按位置对齐,把第一个输出当成「Rush」的坐标去监督,于是两个框的坐标、甚至内容 token 都被推向错误目标,产生一整段只与「实例该按什么顺序输出」有关的无用梯度。SupGRPO 则先做文本匹配(Sugar↔Sugar、Rush↔Rush),再用 IoU > 0 确认这两个框确实各自落在对应实例上(而不是错配到同名的另一个实例),然后只对这 8 个坐标 token 计算交叉熵,顺序完全不参与。反过来,如果模型幻觉出一个多余的「Sugar」,匹配阶段找不到可配对的 GT,这个框不产生坐标损失,但它会经由 GRPO 侧的精确率奖励被扣分——SFT 支路只管「补精度」,惩罚错误预测的职责仍留在奖励里。

损失函数 / 训练策略

SupGRPO 把 GRPO 的策略梯度目标与坐标 SFT 损失写成同一个最小化目标,λ 是平衡两者权重的超参,默认取 1e-4:

\[\mathcal{L}_{\text{SupGRPO}}(\theta) = -\mathcal{J}_{\text{GRPO}}(\theta) + \lambda \cdot \mathbb{E}_{x \sim \mathcal{D}_{\text{GRPO}},\ y \sim \pi_\theta(\cdot|x)}\big[L_{\text{SFT-coord}}(y, GT(x))\big]\]

其中 GRPO 目标就是标准的组内相对优势形式(同一输入采样 G 条输出、用组内奖励归一化得到每个 token 的优势、乘重要性比并加 KL 正则;⚠️ 原文 Eq. 1 在缓存文本中排版损坏,此处按 GRPO 的标准形式复述,细节以原文为准)。λ 取到 1e-4 这个量级说明坐标 SFT 是辅助项:它负责给定位提供方向性很强的密集梯度,而整体优化方向仍由奖励驱动,避免 SFT 把策略拽回离线数据的分布。

训练实现:基于开源框架 Open-R1 及其多模态版本 VLM-R1,对 Qwen2.5-VL-3B/7B 与 Qwen3-VL-8B 做 LoRA 微调一个 epoch,4 张 NVIDIA A100、每卡 batch size 2,GRPO 每个输入采样 8 条输出、最大输出长度 1024 token,初始学习率 1e-6,KL 正则系数 β = 0.04。训练数据把 ATS、Total-Text、ICDAR 2015、CTW1500、ReCTS 五个数据集的训练集混在一起并统一格式、为每条加上任务描述,约 3 万条样本。

实验关键数据

评测基准有四套:Total-Text、ICDAR 2015、CTW1500 三个标准场景文本基准,以及本文自建的艺术字数据集 ATS(从 TextSeg 与 WAS 两个文本分割数据集中人工筛选艺术字样本、重新标注错误的 OCR 标签,提供词级四边形框与转写文本,6500 张训练图 / 2500 张测试图)。原文强调 ATS 的三类特殊难点:贺卡与广告里文本实例严重重叠;字符排布不规则、阅读顺序多变,模型很难判断哪些字符属于同一个词;艺术字常把多个实例与设计图案融为一体,实例间关系复杂、难与装饰元素区分。评测时按方法族分开报:专门 spotter 与传统协议下的结果用端到端协议(定位与转写都对才算对),只输出文本串、给不出可靠词级框的 MLLM 基线只报识别词级 F1,检测另用标准检测协议。

主实验

端到端文本检测结果(Total-Text / ICDAR 2015 的 S、W、G、None 为四种词表档位;⚠️ 原文表头列与列名在缓存文本中对齐不完整,此处按各档位分数普遍满足 S > W > G > None 的顺序排列,具体列归属以原文表格为准):

方法 TT None TT Full IC15 S IC15 W IC15 G IC15 None CTW1500 ATS
Mask TextSpotter v3 71.2 78.4 83.3 78.1 74.2 56.9
ABCNet v2 70.4 78.1 82.7 78.5 73.0 57.5 77.2 53.4
TESTR 73.3 83.9 85.2 79.4 73.6 56.0 81.5 55.0
SPTS 74.2 82.4 77.5 70.2 65.8 63.6 83.8 65.3
DeepSolo 79.7 87.0 86.8 81.9 76.9 64.2 81.4 64.8
Bridge 83.3 88.3 89.1 84.2 80.4 69.8 83.9 67.2
TS-VL-8B (SupGRPO) 85.6 88.7 89.8 85.6 82.1 72.6 84.9 83.7

MLLM 方法的识别词级 F1(部分基线不提供可靠词级框,故只比识别):

方法 TT None TT Full IC15 S IC15 W IC15 G IC15 None CTW1500 ATS
Qwen2.5-VL-7B 78.1 87.0 89.0 83.5 79.2 73.2 80.4 72.7
InternVL3.5-8B 81.7 86.7 87.8 84.7 81.5 71.5 78.5 72.1
Gemini 3.1-Pro ⚠️ 84.0 90.0 91.2 86.6 83.2 78.4 85.1 81.6
HunyuanOCR 83.8 89.5 91.6 85.8 82.6 79.0 84.3 80.8
Qwen2.5-VL-7B (SFT) 82.6 86.4 86.8 83.6 81.4 79.2 85.6 86.2
Qwen2.5-VL-7B (GRPO) 84.2 88.3 86.9 85.5 84.4 82.4 87.7 87.9
两阶段 (SFT → GRPO) 84.5 86.2 87.1 85.9 82.5 83.0 85.7 87.2
TS-VL-7B (Qwen2.5-VL-7B) 88.2 92.3 94.4 89.9 86.7 86.2 91.7 89.6
TS-VL-8B (Qwen3-VL-8B) 91.0 93.4 95.1 90.2 89.1 89.9 92.5 92.4

⚠️ 原文表 2 与表 3/4 对同一引用 [30] 分别写作 Gemini 3.1-Pro 与 Gemini 1.5-Pro,以原文为准。

纯检测结果(ATS 以及 Total-Text / IC15):

方法 ATS Total-Text IC15
DeepSolo 86.7 87.3 90.0
Bridge 89.2 90.5
Qwen2.5-VL-7B 27.4 23.2 19.2
InternVL3.5-8B 21.2 17.8 16.5
TextMonkey 17.5 11.7 10.2
Qwen2.5-VL-7B (SFT) 72.5 65.2 68.6
Qwen2.5-VL-7B (GRPO) 69.6 60.5 63.6
两阶段 (SFT → GRPO) 70.6 66.1 67.3
TS-VL-3B 71.6 68.4 71.6
TS-VL-7B 77.1 70.1 73.8
TS-VL-8B 88.8 90.1 90.5

注:原文表 3 中 ATS 检测一行的 “ABINet++” 被标注引用 [45](即 TESTR),ABINet++ 通常是识别/纠错模型,此处疑似原文或缓存抽取的标注问题,⚠️ 以原文为准,不影响本文结论。

消融实验

全部消融在 ATS 上、以 Qwen2.5-VL-3B 为基座,指标为检测 / 识别:

配置 Det. Rec. 说明
SFT 63.3 77.1 纯 SFT:检测好、识别弱
SFT + 数据增强 65.1 77.4 加增强只小幅改善,仍远不及联合训练
GRPO 62.0 80.0 纯 GRPO:识别好、检测弱
SupGRPO 71.6 84.4 联合训练,两项同时大幅提升
GRPO + 全 token 在线 SFT 64.0 81.2 顺序先验干扰,检测只微涨
GRPO + 文本 token 在线 SFT 60.8 84.1 识别涨、检测反而低于纯 GRPO
GRPO + 坐标 token 在线 SFT 71.6 84.4 本文方案
匹配:IoU 单条件 66.5 81.7 IoU > 0.3,易漏配 / 错配
匹配:文本单条件 68.6 82.8 同文本多实例无法区分
奖励:仅文本 61.1 83.2 检测掉到 61.1
奖励:文本 + F1 69.3 83.5 合成 F1 奖励收敛更差
奖励:文本 + 精确率 + 召回率 71.6 84.4 拆成两个独立奖励最好
训练集去掉 ATS(Total / IC15 / ATS / CTW) 65.8/67.2/65.3/77.9 83.9/82.8/75.7 四个基准的检测/识别普遍下降
训练集含 ATS(同上顺序) 68.4/71.6/71.6/81.8 86.0/84.7/84.4 ATS 数据对泛化普遍正向

关键发现

  • 互补性有直接证据:同一数据、同一基座下,纯 SFT 检测 63.3 高于纯 GRPO 62.0,纯 GRPO 识别 80.0 高于纯 SFT 77.1,联合后 71.6/84.4,两项都远超任一单路(检测 +8.3、识别 +4.4)。两阶段 SFT→GRPO 在 ATS 上只有 70.6 检测 / 87.2 识别(Tab. 3、Tab. 2),说明这种互补不是「先后做两件事」能拿到的——顺序训练只是各自孤立地优化某一项能力。
  • 监督哪些 token 是成败边界:只监督文本 token 让识别升到 84.1 却把检测压到 60.8(低于纯 GRPO),只监督坐标 token 才出现检测 +9.6 / 识别 +4.4 的同时提升,说明「实例顺序先验」干扰的主要是定位,而非内容。
  • 匹配的两个条件都必要:IoU 单条件 66.5、文本单条件 68.6,联合后才到 71.6,且两者失败模式互补(前者漏配/跨实例错配,后者同文本歧义)。
  • 奖励拆分胜过合成:把精确率与召回率合成 F1(69.3)低于拆成两个独立奖励(71.6),原文解释是合成会显著提高奖励函数的复杂度、拉低收敛与样本效率。
  • 训练更稳:Fig. 4 中 SupGRPO 的各项单项奖励与总奖励曲线都稳定高于 vanilla GRPO,总损失收敛到更低值且波动明显更小。
  • 换更强的基座可以超过专门模型:Qwen3-VL-8B 上 SupGRPO 的检测在 ATS 拿到 88.8(DeepSolo 86.7)、Total-Text 90.1(Bridge 89.2),端到端 ATS 83.7 对 Bridge 67.2。

亮点与洞察

  • 把 SFT 的监督面从「整条序列」缩到「匹配上的坐标 token」,顺序依赖不是被缓解而是被消掉——因为匹配是集合上的指派,输出顺序不再进入损失。这个思路很干净:与其设计排序规则或做顺序增强,不如换个监督对象。
  • 在线 = 复用 GRPO 的 rollout:SFT 支路的样本、上下文都来自当前策略这一次采样,零额外采样成本,也避免了离线数据与当前策略分布漂移;代价是必须解决「rollout 里的框怎么和 GT 对齐」,这才需要匹配机制。
  • 奖励与评测协议对齐的自觉:明确拒绝编辑距离/ANLS 这类软奖励,因为测试协议是 exact match,软奖励会诱导近似拼写;同理把精确率/召回率拆开而不是合成 F1,都是在「奖励函数要简单、可优化」和「要和指标一致」之间的具体取舍,而不是随口说「设计合理的奖励」。
  • 可迁移性:任何「输出是集合」的任务(目标检测、referring expression、多目标 grounding、多区域描述)都同时存在标注顺序先验与稀疏奖励,都可以照搬这套「匹配后只监督定位 token」的补监督范式;训练侧也可直接用于 RLVR 场景里奖励稀疏、需要密集辅助梯度的任务。
  • 数据集本身有价值:ATS 把艺术字从零散的分割数据整理成带词级四边形框与转写的检测基准,并给出专门模型与 MLLM 的对照,填补了「强视觉理解/推理型文本场景」没有标准评测的空档。

局限与展望

  • 作者承认的局限:匹配启发式同时依赖 IoU 与精确文本一致,在「极密集、多个重叠实例文本完全相同」时仍会失效;方法强依赖基座已有的空间 grounding 能力,若换到完全没有空间感知的模型,有效匹配会极度稀缺,坐标优化会卡在冷启动上。
  • 自己的观察:λ 只给了默认值 1e-4,没有做敏感性分析,也就无法判断这套联合训练对 λ 有多敏感;匹配条件 IoU > 0 相当宽松(实际几乎只靠文本加「有一点点重叠」),原文未给出 IoU 阈值的消融,而 Tab. 8 里 IoU 单条件用的是 0.3,两个阈值不可直接比较。
  • 实验边界:全部消融只在 3B 基座、ATS 单数据集上做的,训练策略的结论(哪一项涨、涨多少)能否原样迁移到 7B/8B 与自然场景基准上没有验证;只做 LoRA 一个 epoch,是否受 LoRA 容量与训练轮数限制也未知;原文未报告训练成本细节(4×A100 下一个 epoch 的耗时、单步 rollout 8 条 1024 token 的实际开销),无法评估相对纯 GRPO 的额外开销。
  • 可改进方向:用可微的二分图匹配(如 Hungarian)替代启发式文本+IoU 匹配,可以处理同文本多实例;把 λ 做成随训练进程衰减或按匹配率自适应的系数,可能在冷启动阶段更稳;把 ATS 之外的难例(手写艺术字、低分辨率艺术字)纳入评测能进一步检验泛化。

相关工作与启发

  • vs 专门 spotter(DeepSolo / TESTR / ABCNet v2 / Bridge):它们把定位做到极致(Total-Text 检测 87–89),但识别受限于训练数据的字符分布;本文用 MLLM 做基座,识别能力天生更强(ATS 识别 92.4 对 DeepSolo 的端到端 64.8),并用 GRPO + 匹配式 SFT 把定位补到 88.8–90.5,在 ATS 与 Total-Text 检测上反超专门模型。代价是模型规模与推理成本远高于专门 spotter。
  • vs 纯 SFT / 纯 GRPO 的 MLLM 微调:同一数据、同一基座的严格对照(Tab. 2/3/6)表明两者的优缺点正好互补,本文不是「再训一遍」,而是在 GRPO 框架内补一类监督;两阶段 SFT→GRPO 的失败进一步说明顺序组合无法产生这种互补。
  • vs 标准 SFT 的序列监督:标准 SFT 把独立实例的集合输出强行写成序列对齐,本文只在匹配后的实例内部对齐坐标 token,监督是实例级、顺序无关的,这也是它比「全 token 在线 SFT」高 7.6 检测点的直接原因。
  • vs VLM-R1 / Open-R1 等 RLVR 工作:这些工作把 RLVR 范式推广到视觉语言任务,但主要针对有明确答案的推理/定位问答;本文把 RLVR 落到文本检测这种「输出是密集结构化集合」的任务上,并指出稀疏奖励在密集定位上的共性短板,给出的补法(匹配后对定位 token 做在线 SFT)对其他密集结构化预测任务同样适用。

评分

  • 新颖性: ⭐⭐⭐⭐ 联合 SFT 与 GRPO 不算全新,但「匹配后只监督坐标 token」这一刀切得很准,把顺序依赖问题从根上消掉,且首次系统研究艺术字文本检测。
  • 实验充分度: ⭐⭐⭐⭐ 四个基准 + 四类消融(训练策略 / token 选择 / 匹配机制 / 奖励设计)覆盖到位,但消融只在 3B 与 ATS 上做,λ 与 IoU 阈值缺敏感性分析,训练成本未报告。
  • 写作质量: ⭐⭐⭐⭐ 动机—发现—方法的逻辑链清楚,互补性有对照实验支撑;奖励与匹配的失败模式讲得具体,公式推导基本自洽。
  • 价值: ⭐⭐⭐⭐ 给出「纯 RL 的密集监督短板用匹配式在线 SFT 补」这一可复用范式,并贡献 ATS 艺术字基准与超越专门模型的检测结果。