EGM: Efficient Visual Grounding Language Models¶
会议: ECCV 2026
arXiv: 2601.13633
论文: ECCV 2026
代码: https://github.com/NVLabs/EGM
领域: 多模态 VLM
关键词: 视觉定位, 测试时计算, 多模态推理, GRPO, 推理效率
一句话总结¶
EGM 先用专有 VLM 为每条定位样本蒸馏出一条「怎么找到目标」的推理轨迹做 SFT,再用 IoU 与定位成功率混合奖励的 GRPO 做强化学习,让 8B 小模型在 RefCOCO 上拿到 91.4 平均精度、超过 235B 模型的 90.5,同时把端到端延迟从 4320ms 压到 737ms(5.9×)。
研究背景与动机¶
视觉定位(visual grounding)要求模型按一句自然语言指令在图中找到目标并给出边界框,是自动驾驶、机器人操作等具身场景的基础能力。目前 RefCOCO 系列基准上的最强开放模型——InternVL-3.5、Qwen3-VL——都是百亿到千亿参数级别,它们的小尺寸版本精度掉得很明显:InternVL-3-1B 只有 81.6、2B 86.7,而同族 78B 能到 91.4。结果是「可靠地定位」这件事被绑定在了塞不进 Jetson Thor、DGX Spark 这类边缘设备的大模型上。
作者的切入方式很克制:先做归因,再提方法。他们注意到 Qwen、InternVL 这些模型族里,不同尺寸模型的视觉编码器规模几乎不变,被放大的只有语言模型,于是假设小模型落后源于文本理解能力而非视觉信息处理。为验证,他们把 InternVL-3-8B 在 RefCOCO 上的失败样本(IoU < 0.5)连同真值框交给多个专有模型做归因,得到的主导失败模式被命名为 COMPLEX-PROMPT:提示词语义复杂、图中又存在多个相似候选,模型定位到了「另一个」候选上。比如 "chair empty next to guy",模型正确理解了 "chair",却忽略了 "empty" 和 "next to guy" 两个约束。三家专有模型判定 COMPLEX-PROMPT 的占比分别为 62.8%(GPT-4)、48.8%(GPT-5)、46.8%(Gemini-3-Pro),平均 52.8%;把同一批样本交给更大的模型后成功率随规模上升(InternVL-3-32B 29.9% → 78B 42.6%),说明这类失败确实可以靠更强的语言理解消解。
问题于是被改写成一个效率命题:与其把参数堆到 235B 去买文本理解,不如让小模型在推理时多花一点计算——先写出「怎么找到目标」的过程,再输出框。核心 idea:用专有 VLM 蒸馏定位专属的推理轨迹做 SFT、再用框级奖励的 GRPO 把推理对齐到定位精度,让小模型用很多个「中等质量」的 token 换掉大模型少数几个「高质量但昂贵」的 token,从而在 8B 规模上达到 235B 的精度并把端到端延迟压低约 6 倍。
方法详解¶
整体框架¶
EGM 的输入是图像加一句指代文本,输出是一段推理过程和四个整数坐标写在同一文本序列里的边界框,形如 Answer: <think>…推理…</think><ref>指代文本</ref><box>[x1, y1, x2, y2]</box>。它不修改 InternVL / Qwen3-VL 的 LLaVA 式架构(ViT 编码器 + MLP 投影 + LLM),也不引入检测头或专门的定位 token:定位结果就是普通的文本 token,靠 4 个坐标数字在文本里解码出框——这一点很重要,它意味着 8B 与 235B 的差别从头到尾只在 LLM 一侧。
整套机制围绕「小模型缺的是语言理解,而不是视觉编码」这一判断展开,可以概括为「两套离线数据构造 + 两阶段训练」:离线阶段由专有 VLM 为每条 (图像, 指代文本, 真值框) 生成一条推理轨迹,组成 SFT 数据;在线阶段模型先做冷启动 SFT 学会「先推理再给框」的模式,RL 阶段则不在全量数据上练,而是用「可学习性」筛出学生失败但参考模型成功的样本、再配等量简单样本,用 GRPO 优化以 IoU 与定位成功率加权得到的奖励。vanilla 定位与 amodal 定位使用完全独立的两套数据、分别训练两个模型。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图像 + 指代文本"] --> B["推理轨迹数据构造<br/>专有 VLM 写出定位思维链"]
G["amodal 分割标注<br/>COCO-Amodal / TAO-Amodal"] --> H["amodal 定位任务构造<br/>生成指代文本 + 遮挡推理"]
H --> B
B --> C["SFT 冷启动<br/>学会先推理再给框"]
C --> D["可学习性驱动的样本筛选<br/>学生失败、参考模型成功"]
D --> E["混合奖励的 GRPO<br/>IoU 与成功率加权"]
E --> F["EGM:think → ref → box 坐标"]
关键设计¶
1. 推理轨迹数据构造:把「怎么找到目标」的过程变成监督信号
SFT 需要的是过程监督,而现有定位数据集只提供 (图像, 文本, 真值框) 三元组,没有任何一条数据告诉你「这个框是怎么找到的」。EGM 的做法是把现成的 vanilla 定位训练集 \(D_G=\{d_i\}\)(作者用 RefCOCO 训练集)中每条样本连同真值框一起喂给专有 VLM \(\Phi\),让它输出一条推理轨迹 \(z_i=\Phi(d_i)\),再把原始样本与轨迹配对成 \(D_C=\{(d_i,z_i)\}\)。注意输入里带了真值框:教师是在「已知答案」的前提下倒推理由,因此生成的是可复现的定位逻辑,而不是一次盲猜。例如文本为 vase with handle 的样本,生成的推理是「先关注『有独特把手』这一区分性特征,图中右侧那个花瓶有突出的把手,因此是它」——恰恰是 COMPLEX-PROMPT 失败模式所需要的那种辨析。最终得到 575,208 条样本、24,407 张图,平均每图 2.3±1.3 个框(分辨率 585.7±87.0 × 480.3±93.1)。
这一设计能成立有一个不太显然的前提:教师的价值在于「过程」而不是「答案」。实验里 GPT-5 在 RefCOCO 上只有 40.1 平均精度、Gemini-2.5-Pro 只有 63.8,都远低于学生模型自身;直接蒸馏它们的框只会把学生带坏(论文也明确说「很难从一个更差的模型蒸馏出提升」)。但它们组织语言、拆解空间关系的能力足够强,用这份能力去生产推理轨迹、把最终坐标交给学生自己的视觉编码与学习过程,才是这套数据管线真正的杠杆。
2. amodal 定位任务构造:为被遮挡的物体补出「完整形状」的框
vanilla 定位的推理监督可以靠现成数据倒推,换到 amodal 定位(同时预测可见部分与被遮挡部分)就完全失效了——社区里有 amodal 分割标注,却不存在 (指代文本, amodal 框) 这样的配对。作者于是把分割标注改造成文本指代任务:从 COCO-Amodal、TAO-Amodal 出发,用专有 VLM 为每个目标物体生成一段能唯一指代它的详细描述,并额外做一步校验把噪声描述剔掉,得到数据集 \(D_T\)(23,698 条样本、15,798 张图,分辨率显著高于 vanilla 数据)。有了文本指代,再走第 1 条设计里同一条推理生成管线即可。
真正的差异在推理内容上:amodal 的推理除了定位目标,还必须显式回答三件事——是什么物体造成了遮挡、被挡住的完整形状是什么样、可见部分应该往哪个方向扩多少。论文给的例子是「右边倒木后面的老虎」:推理需要说明「前面的倒木造成了遮挡」「老虎的完整形状包括整个躯干、腿和尾巴,都被倒木挡住」「要恢复完整物体,需从可见部分向下大幅扩展(其他方向不用扩太多)」。这三问本质上把「补全被遮挡区域」从一次隐式的回归拆成了可监督的空间推理步骤,这也是它能迁移到小模型上的原因。此外,作者还用同一条管线(同样的文本生成 + 校验流程)从 COCO-Amodal 的 val/test 切分出 11,261 条样本、2,474 张图的 amodal 评测基准,填补了该任务没有现成 benchmark 的空白。
3. 可学习性驱动的样本筛选:只练「学生不会、参考模型会」的样本
RL 阶段最关键的选择是「用什么数据练」。全量数据里混杂着三类样本:学生已经做对的、学生做错但确实可学的、以及太难或真值标注本身有问题的;后两类对学生而言都表现为「失败」,模型没有能力从信号上区分它们。EGM 借用了可学习性(learnability)指标,先定义定位成功(IoU 超过 0.5 记 1,否则记 0),再让参考模型与学生相减:
其中学生 \(M_\theta\) 就是正在训练的小 VLM,参考模型 \(M_{\mathrm{ref}}\) 是当时的最强定位模型 InternVL-3.5-241B。可学习样本集取 \(D_{\text{learnable}}=\{d_i \mid l_i>0\}\)——学生失败而参考模型成功,说明这些样本「还没有被学会,但确实学得会」;参考模型也失败的样本则被直接丢弃,它们要么超出能力边界,要么真值本身就错了,拿去做 RL 只会奖励噪声。只练难样本的副作用是模型可能在难题上过拟合并损害一般样本,所以作者再从学生已经成功的样本里均匀抽样出与 \(D_{\text{learnable}}\) 等量的简单样本集 \(D_{\text{easy}}\),最终训练集是两者的并集。amodal 任务因为数据本身只有两万多条,则不做这层筛选、直接用全部 \(D_T\) 训练。
这套「按可学习性筛 + 等量简单样本兜底」的配方与具体任务无关,只需要一个比学生强的参考模型就能算,因此可以直接搬到其他 RLVR 场景。
4. 混合奖励的 GRPO:让推理的收益落到框的精度上
RL 的奖励如果只取定位成功(0/1),信号是稀疏的:框从 IoU 0.3 挪到 0.45 完全没有回报,模型在 0.5 阈值附近面对着一段平坦区,很难知道该往哪个方向调整。EGM 因此把奖励定义为 IoU 与成功率的加权和:
IoU 项提供连续、密集的方向性信号(框挪对了就有分),成功率项保留任务本身的目标(IoU > 0.5 才算定位成功),两者等权是实验中的默认设置。这一点也是 EGM 与「直接用通用思维链」的关键分野:Qwen3-VL 自带的 Thinking 版本在定位上反而比 Instruct 低 0.6/0.1/0.5,说明通用推理的目标函数里并没有「框更准」这一项;EGM 通过框级奖励把整段推理对齐到定位精度上,推理才成为有效的手段而不是额外的噪声。
在此基础上,训练用带 KL 惩罚与熵正则的 GRPO 来做,目的是「让模型在推理阶段探索充分,同时避免模式坍缩」。一个有意思的细节是两族模型的最优系数方向相反:QwenVL 系列用 KL 系数 \(\beta=0.005\)、熵系数 \(\gamma=0\)(靠 KL 拉住策略漂移),InternVL 系列用 \(\beta=0\)、\(\gamma=0.01\)(靠熵维持输出多样性)。论文没有给出这一差异的解释,⚠️ 具体原因以原文为准。
一个完整示例¶
数据构造。 RefCOCO 训练集里的一条样本是:图中有多个花瓶,指代文本为 vase with handle,真值框为 [730, 421, 885, 814](⚠️ 坐标数值以原文图 3 为准)。专有 VLM 收到「图像 + 文本 + 真值框」,输出推理「需要关注把手这一区分性特征:图中右侧的花瓶有突出的把手,因此它是正确选择」,这条推理与原始样本配对,成为一条 SFT 数据。训练完之后,模型在推理时只看到图像和文本,必须自己复现这段推理再给出同样格式的框——教师提供的知识只存在于「怎么想」这一步。
RL 样本筛选。 假设某条样本上参考模型 InternVL-3.5-241B 的 IoU 是 0.7(\(S_{\mathrm{ref}}=1\)),当前学生的 IoU 是 0.4(\(S_\theta=0\)),可学习性 \(l_i=1>0\),该样本进入 \(D_{\text{learnable}}\);若另一条样本参考模型也只有 0.3,说明它太难或真值有问题,直接丢弃;再从学生已经做对的样本中均匀抽等量条数进入 \(D_{\text{easy}}\)。两者合并构成 RL 训练集(此处的 IoU 数值是为说明筛选规则构造的假想值)。
amodal 推理。 对「右边倒木后面的老虎」,模型生成的序列大致是:<think> 老虎只在右侧露出头和上半身,前面的倒木造成遮挡、挡住了下半身;老虎的完整形状包括整个躯干、腿和尾巴;要从可见部分向下大幅扩展、其他方向不需要扩太多 </think><ref> 右边倒木后面的老虎 </ref><box>[x1, y1, x2, y2]</box>。与 vanilla 的差别就在于推理里多了「谁挡的 / 完整形状是什么 / 往哪扩」这三段。
损失函数 / 训练策略¶
SFT 阶段直接使用 InternVL-3 与 Qwen3-VL 的官方训练脚本,学习率 \(1\times10^{-5}\)、1 个 epoch、batch size 128,8 张 A100 上完成。
RL 阶段基于 VeRL 框架,rollout 与推理全部用 vLLM 引擎,学习率 \(3\times10^{-6}\)、训练 5 个 epoch、batch size 256,奖励权重 \(\alpha\) 固定为 0.5;QwenVL 系列取 KL 系数 \(\beta=0.005\)、熵系数 \(\gamma=0.0\),InternVL 系列取 \(\beta=0.0\)、\(\gamma=0.01\)。两族共用一个参考模型 InternVL-3.5-241B,学生即各自对应的微调模型,最终 RL 数据集大小随模型而变。
优化目标是 GRPO 配合 token 级平均损失(DAPO 的写法):组内先对同一输入采样的 \(G\) 条输出做标准化得到序列级优势 \(\hat{A}_i\),再除以序列长度 \(|o_i|\) 得到 token 级优势 \(\hat{A}_{i,t}\),在此基础上加上 KL 惩罚与熵正则:
⚠️ 论文正文中完整的 GRPO 目标式在 PDF 抽取时损坏,上面给出的是其结构与可确认的部分,精确形式请以原文为准。
实验关键数据¶
主实验¶
表 1:vanilla 定位(RefCOCO 系列八 split,指标为 [email protected])。Qwen 各行的提升相对同尺寸 -Thinking 版本,InternVL 各行相对官方基线;带 * 的成绩取自官方报告,其余为作者自测。
| 模型 | 参数量 | RefCOCO val | RefCOCO+ val | RefCOCOg val | 八 split 平均 | 提升 |
|---|---|---|---|---|---|---|
| Qwen3-VL-2B-Instruct | 2B | 88.7 | 80.1 | 84.8 | 84.2 | — |
| Qwen3-VL-2B-Thinking | 2B | 87.5 | 80.2 | 84.4 | 83.6 | −0.6 |
| EGM-Qwen3-VL-2B | 2B | 93.0 | 87.8 | 88.6 | 89.6 | +6.0 |
| Qwen3-VL-4B-Thinking | 4B | 90.0 | 85.2 | 87.8 | 87.2 | −0.1 |
| EGM-Qwen3-VL-4B | 4B | 93.5 | 89.7 | 90.4 | 91.0 | +3.8 |
| Qwen3-VL-8B-Thinking | 8B | 91.0 | 86.2 | 87.6 | 87.8 | −0.5 |
| EGM-Qwen3-VL-8B w/o 推理 | 8B | 92.2 | 85.7 | 88.6 | 88.6 | +0.8 |
| EGM-Qwen3-VL-8B | 8B | 93.9 | 90.1 | 90.4 | 91.4 | +3.6 |
| Qwen3-VL-235B-A22B-Instruct | 235B(A22B) | 92.9 | 88.6 | 90.3 | 90.5 | — |
| Qwen3-VL-235B-A22B-Thinking | 235B(A22B) | 92.9 | 89.5 | 90.4 | 90.7 | — |
| InternVL-3-1B | 1B | 85.8 | 76.6 | 82.8 | 81.6* | — |
| EGM-InternVL-3-1B | 1B | 90.2 | 83.8 | 86.4 | 86.8 | +5.2 |
| InternVL-3-2B | 2B | 89.8 | 84.0 | 87.6 | 86.7* | — |
| EGM-InternVL-3-2B | 2B | 92.2 | 85.6 | 88.5 | 88.4 | +1.7 |
| InternVL-3-8B | 8B | 92.5 | 88.2 | 89.6 | 89.6* | — |
| EGM-InternVL-3-8B w/o 推理 | 8B | 91.3 | 85.7 | 87.3 | 87.7 | −1.9 |
| EGM-InternVL-3-8B | 8B | 93.6 | 89.3 | 89.7 | 90.7 | +1.1 |
| InternVL-3-78B | 78B | 93.4 | 90.1 | 91.5 | 91.4* | — |
| Gemini-2.5-Pro | — | 66.8 | 58.2 | 65.0 | 63.8 | — |
| Gemini-3-Pro | — | 87.3 | 80.3 | 89.9 | 85.2 | — |
| GPT-5 | — | 42.6 | 37.4 | 39.1 | 40.1 | — |
表 2:amodal 定位(COCO-Amodal val/test 生成的新基准,11,261 条样本 / 2,474 张图)。⚠️ 原表基线行未标明是 Instruct 还是 Thinking 版本。
| 模型 | 参数量 | 原始 | +EGM | 提升 |
|---|---|---|---|---|
| InternVL-3-1B | 1B | 56.9 | 64.3 | +7.4 |
| InternVL-3-2B | 2B | 63.8 | 70.2 | +6.4 |
| InternVL-3-8B | 8B | 62.0 | 73.5 | +11.5 |
| InternVL-3-78B | 78B | 51.0 | — | — |
| Qwen3-VL-2B | 2B | 66.5 | 73.4 | +6.9 |
| Qwen3-VL-4B | 4B | 71.6 | 73.9 | +2.3 |
| Qwen3-VL-8B | 8B | 71.4 | 73.9 | +2.5 |
| Qwen3-VL-235B | 235B | 74.1 | — | — |
| Gemini-2.5-Pro | — | 52.3 | — | — |
| Gemini-3-Pro | — | 71.9 | — | — |
| GPT-5 | — | 24.7 | — | — |
消融实验¶
表 3:推理过程的必要性。「w/o 推理」指用同一套数据和 RL 流程训练,但训练数据里不含推理轨迹。
| 配置 | 八 split 平均 | 相对基线 | 说明 |
|---|---|---|---|
| Qwen3-VL-8B-Instruct | 88.3 | — | 同尺寸 Instruct 基线 |
| Qwen3-VL-8B-Thinking | 87.8 | −0.5 | 通用思维链没有带来定位增益 |
| EGM-Qwen3-VL-8B w/o 推理 | 88.6 | +0.3(vs Thinking) | 去掉推理,只剩数据与 RL |
| EGM-Qwen3-VL-8B | 91.4 | +3.6(vs Thinking) | 完整方法,推理贡献 +2.8 |
| InternVL-3-8B | 89.6* | — | 官方基线 |
| EGM-InternVL-3-8B w/o 推理 | 87.7 | −1.9(vs 基线) | 去掉推理后反而低于基线 |
| EGM-InternVL-3-8B | 90.7 | +1.1(vs 基线) | 完整方法,推理贡献 +3.0 |
关键发现¶
表 4:难样本子集与效率分析。难样本子集指 InternVL-3-8B 因 COMPLEX-PROMPT 而失败(IoU < 0.5)的 RefCOCO 样本集合,指标是「重新做对的比例」。
| 维度 | 模型 | 指标 | 结果 |
|---|---|---|---|
| 难样本子集 | InternVL-3-32B | Acc | 29.9% |
| 难样本子集 | InternVL-3-78B | Acc | 42.6% |
| 难样本子集 | Gemini-2.5-Flash | Acc | 20.9% |
| 难样本子集 | Gemini-3-Pro | Acc | 57.3% |
| 难样本子集 | EGM-InternVL-3-8B | Acc | 42.7% |
| 效率 | Qwen3-VL-235B-Instruct | Acc / 延迟 | 90.5 / 4320 ms |
| 效率 | EGM-Qwen3-VL-8B | Acc / 延迟 | 91.4 / 737 ms(5.9×) |
- 推理不是装饰,而是承重结构。 去掉推理后,Qwen3-VL-8B 从 91.4 掉到 88.6(−2.8),InternVL-3-8B 从 90.7 掉到 87.7(−3.0)甚至低于官方基线的 89.6(−1.9)。也就是说,用同样的数据和 RL 流程但不让模型写推理,不仅拿不到增益,还可能损害原有的定位能力。
- 通用思维链 ≠ 定位推理。 Qwen3-VL-2B/4B/8B-Thinking 相对同尺寸 Instruct 分别是 −0.6/−0.1/−0.5,自带的 thinking 在定位上毫无收益;而 EGM 相对 Instruct 是 +5.4/+3.7/+3.1,且比 Thinking 版本更快。差别不在「有没有推理」,而在推理是否被框级奖励对齐过。
- 收益集中在难样本上。 在由 InternVL-3-8B 失败样本构成的
COMPLEX-PROMPT子集上,EGM-InternVL-3-8B 达到 42.7%,与 78B 的 42.6% 持平,仍低于 Gemini-3-Pro 的 57.3%;被它解决的案例里有近一半(占该子集 18.9%)初始 IoU < 0.1,属于最难的一档。 - 省的是精度/延迟比,不是绝对延迟。 EGM-Qwen3-VL-8B 以 737ms 达到 91.4,235B-Instruct 要 4320ms 才到 90.5,相对加速 5.9×;对 235B-Thinking 的加速比是 18.9×(该版本的绝对延迟原文未在主文给出,⚠️ 以原文为准)。2B 版本(89.6)也同时超过 32B-Thinking、8B-Instruct 与 8B-Thinking。需要说明的是:与同规模的原始 8B 模型相比,EGM 因为多生成了整段推理 token,延迟是更高的——它换来的是接近 235B 的精度。
- amodal 上出现了反规模效应。 InternVL-3-78B(51.0)反而显著低于同族 8B(62.0),Qwen3-VL-235B 也只有 74.1;EGM-Qwen3-VL-8B 达到 73.9、EGM-InternVL-3-8B 达到 73.5,基本追平 235B。说明在需要「描述性推理」的 amodal 任务上,参数规模与定位能力并不正相关,推理训练的价值反而更突出。
亮点与洞察¶
- 先诊断、后开方,把「小模型为什么差」变成一个可验证的实证问题。 作者没有直接假设「参数量不够」,而是用「同族视觉编码器等大」+「失败案例归因统计」两条证据把差距锁定在语言理解侧,方法的每一步(SFT 教推理、RL 用框级奖励对齐)都直接对应这个诊断。这种「先做失败模式归因,再针对性补能力」的范式可以复用到任何「小模型落后」的场景。
- 蒸馏的是过程,不是答案。 教师模型在目标基准上比学生更差(GPT-5 只有 40.1 平均精度),直接蒸馏输出只会污染学生;但把它用在「生成推理轨迹」这种过程监督上却能带来 +5 到 +6 的提升。这提示了一种在教师弱于目标任务时仍然可用的蒸馏方式:只借它的语言组织与关系拆解能力,结果留给学生自己产生。
- 「很多个中等质量 token」打败「少数几个昂贵 token」。 给 8B 模型多生成一段推理反而让端到端更快,是这篇论文最反直觉的结论——因为它把比较对象选在了 235B 上,而大模型每个 token 的成本高得多。在边缘部署场景下,这个 trade-off 的成立条件(小模型 per-token 成本远低于大模型、且有可用的过程监督)值得单独记住。
- 可学习性筛选 + 等量简单样本的配方。 \(l_i=S_{\mathrm{ref}}-S_\theta\) 一步同时过滤掉了「太难/标注错」和「已学会」两类样本,再配等量易样本防过拟合。这个配方只依赖一个更强的参考模型,可以直接迁移到其他 RLVR(如数学、代码)的数据构造中。
- 用新任务设定验证方法通用性。 作者没有停留在 RefCOCO 上刷点,而是把方法搬到一个此前只有分割标注、没有文本指代配对的任务(amodal grounding)上,顺带给出了一个 11,261 条样本的评测基准。用一个「数据形态完全不同」的新任务来验证方法,比在同一基准上换模型族更有说服力。
局限与展望¶
- 完全没有评测通用能力是否保持。 论文没有独立的局限章节,以下为笔记作者归纳。全文所有实验都是定位精度,没有报告在加长推理链、只做定位 SFT/RL 之后,模型在 VQA、语言理解、通用对话上的表现,也没有讨论灾难性遗忘。论文的核心论点是「小模型缺的是语言理解」,但恰恰没有回过头验证:补上定位推理后,语言理解能力本身有没有变化——这是论证链上缺的一环。
- 监督信号依赖专有 VLM,成本与可复现性受限。 57.5 万条 vanilla 推理轨迹全部由闭源模型生成,论文没有给出生成成本、教师模型的具体版本选择,也没有做教师选择的敏感性分析(换一个教师,轨迹质量与最终精度会怎么变)。相比之下 amodal 部分做了描述校验,vanilla 部分没有类似的轨迹质量校验。
- 只看框对不对,不看推理对不对。 奖励完全由框的 IoU 与成功率构成,没有任何过程奖励;模型完全可能「理由说偏了但框碰对了」。论文提供的定性例子都支持推理与框一致,但缺少对推理正确率的定量评估(例如人工判断推理链是否真的指向目标)。
- 效率评测维度偏单一。 延迟只在 L20 上、以「发出提示到收完答案」的总 GPU 延迟衡量,没有报告吞吐、显存占用、不同并发下的表现;5.9× 的加速比是相对 235B-Instruct,不是相对同规模模型——与原始 8B 相比 EGM 更慢。此外 amodal 基线未标明 Instruct/Thinking,跨行比较需要谨慎。
- 数据规模严重不均衡。 vanilla 有 57.5 万条、amodal 只有 2.4 万条,amodal 因此放弃了 RL 样本筛选(用全量数据),方法在数据充足场景下的优势在 amodal 上并未真正体现,这部分的 +2.3/+2.5 也可能受数据量上限制约。
- 可改进方向:一是把推理长度做成可调预算(难样本多推理、易样本直接出框),进一步压缩平均延迟;二是引入过程奖励或推理质量校验,抑制「框对理由错」;三是补一条通用能力的保持性评测,例如在 SFT/RL 数据中混入通用 VQA 或用 KL 约束锚住基座模型;四是把参考模型替换为同族更强的开源定位模型,去掉对超大规模模型做数据筛选的依赖。
相关工作与启发¶
- vs Qwen3-VL-Thinking / InternVL 的通用 Thinking 模式:同样是「先生成思维链再回答」,但通用 thinking 是在通用数据与通用奖励上练出来的,其目标函数里没有「框更准」这一项,因此在 RefCOCO 上反而比 Instruct 低 0.1~0.6;EGM 用专有 VLM 蒸馏的定位轨迹 + IoU 奖励把推理重新对齐到定位,才拿到 +3.1~+5.4。区别在于推理监督的来源与目标,而不是推理的有无。
- vs LISA / PaliGemma(分割输出)与 Molmo / Gemini Robotics-ER(点输出):这些工作把 grounding 换成了 mask 或点等其他输出形式,本文坚持最常见的边界框格式,把注意力放在「同样的框、更小的模型、更低的延迟」上。因此二者的贡献是正交的——本文的推理蒸馏管线原则上可以套到 mask 或点输出上。
- vs DeepSeek-R1 / GRPO 系列(DAPO、GTPO):本文沿用了「SFT 冷启动 + GRPO」的两阶段范式,但把通用 RLVR 的两个默认设定替换成了任务专属版本——奖励由 IoU 与定位成功率混合而成(而非可验证的 0/1 正确答案),训练样本由可学习性筛选而非全量使用。这提示 RLVR 范式在感知类任务上的落地关键不在算法,而在奖励与数据的选择。
- vs 传统 test-time scaling(多次采样 / 自一致性投票):那些方法在输出空间里采样多条答案再聚合,本文则是让模型生成一段结构化的推理再给唯一答案,用一次前向换精度;同时它把「测试时多算」与「模型规模小」绑定成一组 trade-off,讨论的维度从「精度」扩展到了「精度/延迟」。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 把「先诊断失败模式、再用推理补语言理解」的链路讲得很扎实,方法本身(SFT 蒸馏轨迹 + GRPO 框级奖励)是 R1 式范式在定位上的任务化移植,单看组件不算全新,但 amodal 定位这个新设定与可学习性筛选的配方有实打实的贡献。
- 实验充分度: ⭐⭐⭐⭐☆ 两个模型族 × 三种尺寸 × 两个任务 × 效率评测覆盖得很全,消融(w/o 推理)与难样本子集分析也到位;扣分点是没有通用能力保持的评测,效率维度也比较单一。
- 写作质量: ⭐⭐⭐⭐☆ 归因实验(COMPLEX-PROMPT 的三家模型统计 + 规模趋势)讲得清楚有说服力,公式部分排版混乱、部分式子需要读者自己补,但论证链条完整。
- 价值: ⭐⭐⭐⭐⭐ 用 8B 模型在 RefCOCO 上超过 235B 且端到端快 5.9×,对边缘部署与具身场景是很直接的收益;「小模型多推理、大模型少推理」的效率论证也有普适的参考价值。