HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/RL-MIND/HART
领域: 多模态VLM / 视觉推理
关键词: 高分辨率视觉推理、视觉定位、免标注强化学习、闭环自验证、AP-GRPO
一句话总结¶
HART 让模型先在降采样全图上预测关键区域,再故意扣留原图、只把该区域从原始高分辨率图上裁出来交给模型作答,从而让「答案是否正确」反过来成为「定位是否准确」的自验证信号,并用按优势动态加权的 AP-GRPO 做免框标注的定位直接优化,把 Qwen2.5-VL-7B 在 MME-RealWorld-Lite 上从 42.3% 提到 62.4%。
研究背景与动机¶
高分辨率输入一直是大型多模态模型(LMM)的软肋。视觉 token 数量随图像分辨率近似平方增长,而其中真正相关的往往只是很小一块,于是 Qwen2.5-VL、InternVL3 这类主流架构干脆给输入图像设一个最大像素上限——代价是关键细节被压掉,模型在遥感、自动驾驶、文档 OCR 这类"信息藏在局部"的场景上明显退化。一条被广泛采用的补救思路是模仿人眼中央凹的视觉定位式推理:先根据文本问题在降采样图上预测关键区域(ROI),再把该区域从原始高分辨率图上裁出来,连同降采样全图一起送进模型作答,只把算力花在真正承载答案的像素上。
问题出在"怎么训练"上。一条路线用带真值框的标注数据直接监督定位(Visual CoT 系列、VLM-R1、Point-RFT 等),定位确实被优化了,但框标注的采集成本很高,且很难规模化。另一条路线走强化学习:MGPO、DeepEyes、Pixel-Reasoner 只用最终答案的正确性做奖励,完全不需要额外标注,看起来更通用——可是这个奖励根本不反映定位质量。模型即使在错误的位置上答对了,照样拿正奖励,于是策略被推向"随便框一下、靠语言先验蒙答案"的方向。作者把这个现象称为奖励错配(reward misspecification),并在 Visual CoT 上做了先导实验量化它:在过滤掉描述性问题和 yes/no 题之后剩下的 4,042 道题上(每题一个真值框,判定标准是至少一个预测框覆盖真值面积超过 0.3),Qwen2.5-VL-7B 答对了 2,895 题,其中有 1,057 题的框是错的,占 36.5%;InternVL3-8B 更严重,答对的 2,129 题里有 1,359 题框错,占 63.8%。也就是说,这些"免标注"方法发出的正奖励里有相当大一部分其实奖励了错误的定位,而它们又没有任何机制能察觉这件事。
本文的突破口是:既然没有框标注就算不出定位误差,那就把定位质量编码进答案里。如果模型裁出来的区域真的够用,那么即使把原图拿走、只给它这几块子图,它也应该答得出来;反过来,如果框偏了,失去全图上下文后答案自然会掉下去。这样一来,"扣留原图、只凭 ROI 作答"就成了一次由模型自己完成的自验证,答案是模型自己生成的,监督信号不需要任何人工标注。核心 idea:用「原图扣留 + 仅凭 ROI 作答」构造闭环自验证反馈,把最终答案的正确性变成定位质量的代理监督信号,再用按样本优势动态加权的 AP-GRPO 抑制"答对但框错"样本带来的误导梯度,在零框标注的前提下直接优化视觉定位。
方法详解¶
整体框架¶
HART 的输入是一张高分辨率图像 \(I_f\) 和一个文本问题 \(q\),输出是"定位框 + 答案"这样一条可解释的推理路径。整个后训练分两个阶段。阶段 1 是闭环强化学习:模型先在降采样全图上输出与问题相关的关键区域框,系统把这些框映射回原始高分辨率图上裁出子图 \(I_s\),同时刻意扣留全图,只把子图和原问题交给模型作答;答案的对错就是奖励信号,经 AP-GRPO 按样本优势加权后回传,直接更新定位策略。阶段 2 是 SFT:把全图放回去,让模型在完整高分辨率输入下做监督微调,补回因"扣留全图"而损失的答题能力。
这里有两点是理解全文的钥匙。第一,反馈信号的来源不是外部框标注、也不是任何检测或分割模型,而是模型自己在"看不到全图、只能看子图"这个条件下的答案——定位准,子图自足,答得对;定位偏,子图缺料,答不对。第二,高分辨率信息是在"从原图裁剪 ROI"这一步进入流程的:模型始终只吃降采样图,不触碰最大像素限制,真正的高频细节通过裁剪窗口被局部、按需地喂进去,既绕开了分辨率上限,也省掉了全图高分辨率编码的冗余计算。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["高分辨率图 + 问题"] --> B["降采样全图<br/>预测关键区域 ROI"]
B --> C["闭环自验证<br/>扣留原图,仅凭 ROI 作答"]
C -->|答案正确即视为定位可信| D["AP-GRPO<br/>按优势动态加权更新策略"]
D -->|策略更新后重新定位| B
D --> E["RL → SFT 两阶段<br/>全图可见下补高分辨率推理"]
E --> F["输出:定位框 + 答案"]
关键设计¶
1. 闭环自验证:把「答案对不对」变成「定位准不准」的监督信号
这是全文的枢纽,针对的正是前文那个痛点:只看最终答案的奖励无法分辨"框对了答对"和"框错了也答对"。HART 的做法是把一次普通的多模态问答拆成前后两步。第一步,模型在降采样全图和问题 \([I_f, q]\) 下输出关键区域的坐标框,指令是「输出与问题相关的关键图像区域的坐标」;第二步,系统从原始高分辨率图上裁出这些区域,把全图扣掉,并把指令改写成「你本来应该基于完整图像回答问题,但现在看不到完整图像,只能看到与问题相关的一些子区域,请回答以下问题」。模型此时必须仅凭 \(I_s\) 和 \(q\) 作答。于是"答对"这件事第一次隐含了"这块区域确实包含了回答问题所需的信息",奖励函数没有变,仍然是答案正确性的二值判断,但奖励的含义变了。
作者用信息论的语言把这个变化写成了一个命题:记 \(L\in\{0,1\}\) 表示定位是否正确、\(R\in\{0,1\}\) 表示回答是否正确,则 HART 下二者的互信息严格大于基线,即 \(I_{\text{HART}}(L;R) > I_{\text{baseline}}(L;R)\)(证明在原文附录 A,⚠️ 以原文为准)。直觉是:闭环压低了"答对却定位错"这一格的概率,使 \(R\) 的熵变小、\(L\) 与 \(R\) 的因果依赖变强。实测支持了这个判断——同样的两个模型换到 HART 的问答协议下,"答对但定位错"的比例在 Qwen2.5-VL-7B 上从 36.5% 降到 21.5%(降 15.0 个百分点),在 InternVL3-8B 上从 63.8% 降到 55.9%(降 7.9 个百分点)。
闭环还顺带解决了高分辨率的两个实际困难:(a)定位质量可以自证,不再需要人工框;(b)放大到关键区域让模型看到更细的视觉信息,绕过了现有 LMM 的最大像素约束,同时避免了对全图做高分辨率编码的冗余计算。
2. AP-GRPO:按优势动态加权,压掉「答对但框错」的误导梯度
闭环把奖励的语义修好了,但并没有消除奖励错配的另一个来源:在 HART 的问答协议下,回答错的样本 \(r_i=0\) 既可能是定位错了、也可能是定位对了但推理没跟上,定位不确定性明显更高。vanilla GRPO 对组内所有样本一视同仁(优势 \(A_i\) 只做组内归一化),这些高不确定样本会和"定位可信"的样本拿到同样量级的更新。AP-GRPO(Advantage Preference Group Relative Policy Optimization)的做法是用样本自身的优势给它的损失项配一个动态权重:既然在闭环里答对更可能意味着框是对的,那就让答对的样本贡献更大、约束更松。
具体地,候选回答组 \(\{o_i\}\) 拿到二值奖励 \(r_i\in\{0,1\}\),组内奖励均值为 \(\text{mean}(\{r_i\})\),优化目标为
其中两个权重因子只依赖样本相对组内均值的位置:\(\mu_1=1+k\,(r_i-\text{mean}(\{r_i\}))\),\(\mu_2=\big(1-k\,(r_i-\text{mean}(\{r_i\}))\big)^2\),\(k\) 是 HART 里唯一的超参数(正文取 0.6)。答对的样本 \(\mu_1\) 大于 1,优势项被放大;同时 \(\mu_2\) 小于 1,KL 惩罚被削弱,允许它更大程度地偏离参考模型——因为一个"只靠子图就答对"的轨迹本身就是可信的定位证据,不值得被参考模型拉住。⚠️ 原文公式(式 6)的排版信息有限,\(\mu_2\) 的平方项与整体形式为按上下文重建,请以原文为准。
作者进一步用命题 2 给出理论解释:设 \(g_{\text{AP-GRPO}}\) 与 \(g_{\text{baseline}}\) 分别为 AP-GRPO 与基线的梯度,在二值奖励的单步强化学习设定下,存在 \(\alpha\in[0,1]\) 使 \(g_{\text{AP-GRPO}} = g_{\text{baseline}} - \alpha\,P(L{=}0,r{=}1)\,\mathbb{E}_{L=0,r=1}[\nabla\log\cdot]\)。翻译过来就是:AP-GRPO 把"定位错却拿到正奖励"那部分样本对梯度的贡献显式地减掉了,而这正是前文所说的奖励错配的来源。相比等权处理的 vanilla GRPO,它带来三点收益:强化对正确 ROI 的注意力、在没有任何视觉监督的情况下直接优化定位、以及保持推理路径的可解释性。
3. RL → SFT 两阶段:先学会看对地方,再补回高分辨率推理
扣留全图意味着模型真的少看了信息,答题准确率必然受影响——消融表里 AP-GRPO 单独用(\(k=0.6\))在 MME-RealWorld-Lite 上只有 53.3/48.0(感知/推理),而单做 SFT 是 54.0% 的总体准确率。所以 HART 在 RL 之后接一个 SFT 阶段,此时原图对模型完全可见,用常规自回归监督把高分辨率推理能力补回来,两者串起来才达到 62.4% 的总体表现。顺序是硬约束:消融中「先 SFT 再 AP-GRPO」在 \(k=0.6\) 下只有 51.7/48.1,远低于「先 AP-GRPO 再 SFT」的 64.9/58.5。一个自然的解释是,RL 阶段先把"只看局部也能答对"这件事逼出来,模型于是学会从子图里榨取信息,再放到全图下做 SFT 时它同时具备"会挑关键区域"和"会完整推理"两种能力;反过来先 SFT 会把模型固化成既有的答题模式,随后的 RL 定位信号很难再撼动它。数据上沿用 [4] 的干净划分:从 MME-RealWorld 训练集随机抽 10K 样本做 \(\mathcal{D}_{\text{RL}}\),其余划给 \(\mathcal{D}_{\text{SFT}}\),两个阶段的数据不重叠。
一个完整示例¶
以论文 Fig. 4 的 TreeBench 样例为例,题目要求模型先关注画面最右侧的男子、再做推理。假设这张图是 2152×1615:
- 定位:模型只看到降采样全图,输出一个 ROI 框。若它把框画在了中间的人群上,从原图裁出的子图就不包含最右侧那个人。
- 自验证:全图被扣留,模型拿到的只有这张子图和原问题。关键人物不在画面里,作答几乎必然出错,该回答拿到 \(r_i=0\)。
- 加权更新:同一问题采样一组 \(G\) 个回答,其中"框对了那位男子、仅凭子图也答对"的回答拿到 \(r_i=1\),按 AP-GRPO 的 \(\mu_1/\mu_2\) 获得更大的策略更新幅度;而答错的样本被压低权重。
- 迭代:多轮之后,模型学会把框移到真正承载答案的区域。整个过程中没有任何框标注——信号完全来自模型自己在"只看子图"条件下的答案。
作为对照,如果沿用只看最终答案的基线(模型始终能看到全图),同一道题即使框画在中间人群上也可能靠上下文猜对,这个样本就会拿到正奖励、强化一次错误的定位——论文统计里 Qwen2.5-VL-7B 有 36.5% 的正奖励属于这种情况。⚠️ 上述框的具体位置为按论文描述的示意,原文 Fig. 4 未给出确切坐标。
损失函数 / 训练策略¶
优化的主体是上文 AP-GRPO 的目标(式 6):优势项乘 \(\mu_1\)、KL 惩罚项乘 \(\mu_2\),两者都由样本奖励相对组内均值的位置决定,超参数只有 \(k\)(正文取 0.6)。阶段 2 的 SFT 用标准自回归负对数似然,
其中 \(T\) 是文本长度,\((x,y)\) 是 \(\mathcal{D}_{\text{SFT}}\) 里的查询与目标回答。训练用 TRL 框架做分布式强化微调,基座模型为 Qwen2.5-VL-7B;所有对比的强化微调方法都使用同一个二值奖励(只判答案是否正确),并共用同一份 MME-RealWorld 训练集以保证公平。训练细节与开销见原文附录 C(⚠️ 正文未给出算力数字与推理延迟)。
实验关键数据¶
主实验¶
表 1:MME-RealWorld-Lite(分布内)上的答案准确率(%),括号内为子任务样本数;加粗为最优。
| 方法 | 参数 | 感知-自动驾驶 (350) | 感知-遥感 (150) | 推理-监控 (150) | 总体 |
|---|---|---|---|---|---|
| Qwen2.5-VL-7B | 7B | 30.0 | 32.7 | 28.7 | 42.3 |
| LLaVA-OneVision-7B | 7B | 39.4 | 40.0 | 38.0 | 43.7 |
| InternVL3-8B | 8B | 36.9 | 49.3 | 40.0 | 47.9 |
| GRPO + SFT | 7B | 49.7 | 55.3 | 60.0 | 58.1 |
| MGPO + SFT | 7B | 55.4 | 59.3 | 63.3 | 60.5 |
| Pixel-Reasoner-7B | 7B | 30.9 | 52.0 | 46.0 | 49.7 |
| DeepEyes-7B | 7B | 33.4 | 52.7 | 44.0 | 53.2 |
| HART-7B | 7B | 57.7 | 58.7 | 58.7 | 62.4 |
| Qwen2.5-VL-32B | 32B | 40.7 | 40.7 | 27.3 | 45.6 |
| Qwen2.5-VL-72B | 72B | 30.6 | 34.0 | 26.7 | 43.7 |
| GPT-4o | — | 22.4 | 28.9 | 36.5 | 45.2 |
| Claude 3.5 Sonnet | — | 40.8 | 25.7 | 41.8 | 51.6 |
表 2:分布外 TreeBench 与跨分辨率基准上的准确率(%)
| 基准 | 能力 | Qwen2.5-VL-7B | InternVL3-8B | LLaVA-OV-7B | HART-7B |
|---|---|---|---|---|---|
| TreeBench(总体) | 高分辨率推理 | 37.0 | 38.8 | 37.3 | 43.7 |
| BLINK | 多图 VQA | 55.2 | 55.5 | 48.2 | 56.8 |
| Mantis-Eval | 多图 VQA | 70.8 | 70.1 | 64.2 | 72.8 |
| MathVista | 低分辨率 VQA | 68.2 | 71.6 | 58.3 | 71.8 |
| MMStar | 低分辨率 VQA | 59.3 | 53.5 | 56.7 | 62.8 |
| V* Bench | 高分辨率 VQA | 78.5 | 72.3 | 70.7 | 80.6 |
| HR-Bench-4K | 高分辨率 VQA | 70.1 | 70.8 | 64.3 | 71.1 |
| HR-Bench-8K | 高分辨率 VQA | 61.0 | 62.0 | 59.8 | 71.9 |
表 3:定位准确率(覆盖率阈值 0.3,%)
| 方法 | TreeBench 定位正确 ↑ | Visual CoT 定位正确 ↑ |
|---|---|---|
| Qwen2.5-VL-7B | 50.2 | 66.0 |
| LLaVA-OneVision-7B | 38.3 | 67.0 |
| InternVL3-8B | 15.1 | 28.9 |
| GRPO | 51.0 | 66.1 |
| MGPO | 51.3 | 66.3 |
| AP-GRPO(本文) | 75.4 | 77.7 |
消融实验¶
表 4:各组件消融与超参数 \(k\) 敏感性(%)
| 配置 | \(k\) | MME-RW-Lite 感知 / 推理 | TreeBench 感知 / 推理 |
|---|---|---|---|
| Qwen2.5-VL-7B(基线) | — | 46.4 / 35.9 | 43.6 / 33.2 |
| GRPO | — | 52.1 / 49.1 | 52.3 / 32.0 |
| MGPO | — | 58.0 / 50.5 | 53.7 / 31.2 |
| AP-GRPO | 0.15 | 51.2 / 47.5 | 51.0 / 32.4 |
| AP-GRPO + SFT | 0.15 | 67.0 / 56.9 | 56.4 / 31.6 |
| AP-GRPO | 0.30 | 53.6 / 49.9 | 55.0 / 33.6 |
| AP-GRPO + SFT | 0.30 | 64.1 / 56.0 | 57.7 / 34.8 |
| AP-GRPO | 0.60 | 53.3 / 48.0 | 52.3 / 33.6 |
| SFT + AP-GRPO(顺序对调) | 0.60 | 51.7 / 48.1 | 55.0 / 32.4 |
| AP-GRPO + SFT | 0.60 | 64.9 / 58.5 | 57.0 / 35.9 |
关键发现¶
- 闭环带来的最大收益集中在"信息藏在局部"的感知子任务上:相对基座 Qwen2.5-VL-7B,感知-自动驾驶 +27.7、感知-遥感 +26.0、推理-监控 +30.0 个百分点;而在本来就靠全局语义的 OCR 上(87.6 → 89.6)几乎没有变化。跨分辨率基准上同样如此:V* Bench +2.1、HR-Bench-4K +1.0(本就不弱),但 HR-Bench-8K 从 61.0 拉到 71.9(+10.9)——分辨率越高,闭环"按需放大"的价值越明显。
- RL 与 SFT 缺一不可,且顺序不能反:单做 SFT 总体 54.0%,单做 AP-GRPO(\(k=0.6\))感知 53.3,串起来才到 62.4%;把顺序对调成 SFT + AP-GRPO 只有 51.7/48.1。这说明 RL 阶段的作用是把"只看局部也能答对"逼出来,SFT 阶段再把全图推理能力接回去。
- AP-GRPO 的价值主要体现在定位本身,而不是单阶段的答案准确率上:表 3 里它的 TreeBench 定位正确率 75.4%,比 MGPO 的 51.3% 高出 24.1 个百分点,Visual CoT 上 77.7% 对比 66.3%;但表 4 里单用 AP-GRPO(53.3/48.0)反而不如单用 MGPO(58.0/50.5)。换言之,定位能力的提升只有在 SFT 补齐高分辨率推理后才会兑现成答案准确率——这也解释了为什么只看最终答案的方法无法直接优化定位:它们缺少一个把定位质量转成可用信号的环节。
- OOD 上的推理子任务仍然最难:TreeBench 的推理维度上,GRPO(32.0)和 MGPO(31.2)甚至低于不做后训练的基线(33.2),AP-GRPO 的 33.6 也只是小幅提升,真正把推理拉到 35.9 的是 SFT。结合 \(k\) 的敏感性看,\(k=0.6\) 在 TreeBench 上最好、\(k=0.15\) 在 MME-RW-Lite 感知上最好(67.0),说明单一 \(k\) 并不对所有分布通用,只是差距在可接受范围内。
- 可迁移性:把 HART 用到 InternVL3-8B 上,MME-RealWorld-Lite 感知从 46.4 提到 61.8、TreeBench 感知从 46.3 提到 59.1,证明这套闭环并不绑定在某个基座模型上。
亮点与洞察¶
- 把"评估"变成"训练信号":没有框标注时无法计算定位误差,HART 干脆让答案本身携带定位信息——扣掉全图后还能答对,就说明框对了。这是一个几乎零成本的监督信号构造,却把"免标注方法无法优化定位"这个死结解开了,是本篇最"啊哈"的地方。
- 奖励函数一字未改,改的是奖励的语义:仍然是二值答案奖励,但通过改变推理时的观测条件(是否给全图),同一个奖励从"衡量答案"变成了"衡量定位"。这种"不换损失换语境"的思路可以迁移到任何"最终指标可观测、中间质量不可观测"的任务上,比如检索增强生成里用"去掉原始文档后能否答对"来监督检索质量。
- AP-GRPO 的两个权重因子设计得很省:\(\mu_1\) 放大优势项、\(\mu_2\) 放松 KL 约束,都只依赖样本奖励与组内均值之差,不引入任何额外网络或标注,超参数只有 \(k\) 一个。这种"在 GRPO 的等权假设上做一点偏好倾斜"的做法,基本可以直接搬到其他带组内归一化的 RL 微调流程里。
- 两阶段顺序被实验做实:RL 先行、SFT 收尾,且两阶段数据严格不重叠。顺序对调后掉 13 个百分点以上,这个结论对后续做"RL + SFT 混合后训练"的工作有直接参考价值。
局限与展望¶
- 提升高度依赖训练分布:\(\mathcal{D}_{\text{RL}}\) 与 \(\mathcal{D}_{\text{SFT}}\) 都来自 MME-RealWorld 训练集,分布内提升巨大(+20.1),分布外 TreeBench 只有 +6.7;在高分辨率基准上仍是私有模型领先(o3 54.8、Gemini-2.5-Pro 54.1 对 HART-7B 43.7)。作者主要报告了 7B 规模的结果,32B 与 Qwen3-VL-8B 的结论放在附录,正文没有展开。
- 自验证信号本身是有噪声的代理:论文在构造先导实验时主动剔除了 yes/no 题,说明当答案可以靠二选一猜中时,"答对 ⇔ 定位对"的对应关系会明显变弱。对开放式生成、答案可通过语言先验蒙对的任务,这个闭环的可靠性需要重新评估。
- 定位评测用的是自定义指标:判定标准是"至少一个预测框覆盖真值面积超过 0.3",属于 intersection-over-ground-truth 而非标准 IoU,阈值偏宽松;作者在附录里报告了更严格的阈值与 IoU 曲线,但正文结论建立在宽松阈值上,与其他工作的定位数字不完全可比(⚠️ 该指标的具体定义以原文为准)。
- 多轮推理带来额外开销:每道题至少要走"定位 → 裁剪 → 基于子图作答"两轮,缓存里没有报告延迟或 token 成本,实际部署时的性价比尚未评估;ROI 框的数量上限与选择策略正文也没有交代。
- 可改进方向:把二值答案奖励扩展成过程奖励(例如对子图自足性的置信度做连续打分),缓解猜对带来的噪声;设计随分布自适应的 \(k\) 而非固定 0.6;把闭环从单图扩展到视频/多图高分辨率场景,让"扣留上下文"的验证形式更丰富。
相关工作与启发¶
- vs MGPO / DeepEyes / Pixel-Reasoner(免标注定位式 RL):三者都做视觉定位式推理的强化微调,奖励只看最终答案;MGPO 靠多轮 grounding 流程,DeepEyes 把裁剪当工具、Pixel-Reasoner 用好奇心驱动探索。它们的共同短板就是奖励错配——表 3 里 MGPO 在 TreeBench 上的定位正确率仅 51.3%,几乎与基座持平。HART 通过"扣留全图作答"把定位质量塞进答案里,定位正确率做到 75.4%,且不需要额外的工具调用策略。
- vs 用真值框监督的方法(Visual CoT / VLM-R1 / Point-RFT):这些方法用 GT 框的差异直接更新策略,定位优化是显式且干净的,但依赖大规模昂贵标注。HART 完全不用框标注,代价是监督信号是一个间接代理,因此在高分辨率之外的通用能力上提升有限(MMStar +3.5、MathVista +3.6,属于正常增益)。
- vs vanilla GRPO:GRPO 组内等权,在闭环里会把"定位不可信"的样本也同等对待;AP-GRPO 只改了权重因子(\(\mu_1\) 放大、\(\mu_2\) 放松)就拿到 TreeBench 定位 +24.4 个百分点(对 GRPO 的 51.0% → 75.4%),说明在这个场景下"谁该被多学一点"比"换更强的优化器"更重要。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 把"扣留全图、仅凭 ROI 作答"当作免标注的自验证信号,是解决奖励错配的一个干净而少见的切入角度,AP-GRPO 则是这一思路的低成本落地。
- 实验充分度: ⭐⭐⭐⭐☆ 覆盖分布内/分布外与多分辨率共 7 个基准,有定位专测、\(k\) 敏感性、阶段顺序消融与跨基座迁移;但正文只报告 7B,缺少推理开销与更严格阈值下的主表结论。
- 写作质量: ⭐⭐⭐⭐☆ 先导实验把"36.5% 的奖励是错配的"摆出来再给方法,动机链条清楚;部分公式(式 6)排版损毁、若干结论推到附录,阅读时需要来回对照。
- 价值: ⭐⭐⭐⭐☆ 提供了一套不依赖框标注直接优化定位的通用后训练方案,且"改语境而非改损失"的思路可迁移到其他中间质量不可观测的任务。