Learning from Reliable Negatives: Confidence-Anchored Test-Time Adaptation for GUI Grounding¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4771
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/7395.pdf
领域: 智能体 / GUI定位
关键词: 坐标token置信度、伪标签、测试时训练、负样本学习、GRPO
一句话总结¶
本文先用坐标 token 的置信度从多次预测中选出伪标签,再通过 CANL 只惩罚远离伪标签的预测,在各基准独立进行无标签测试时训练后,使 Qwen-2.5-VL-7B 的 ScreenSpot-V2 准确率从 88.1% 提升到 92.1%,ScreenSpot-Pro 从 24.9% 提升到 33.8%。
研究背景与动机¶
GUI grounding 要把“点击锁定旋转”等自然语言指令变成截图上的点击坐标。困难不只是看懂按钮含义,还要在密集界面中精确落点。监督微调需要目标框标注,依赖可验证奖励的强化学习也需要真实目标框判断点击是否正确。因此,两条路线虽然训练目标不同,却都依赖标注;测试时遇到新软件、新布局,继续提高定位能力仍然受到监督信号成本的限制。
用模型自己的预测代替标签很自然,但 GUI 坐标不像离散答案那样适合直接投票:相邻点可能属于同一个按钮,多个合理候选的平均位置却可能落在空白区域。整段回答的概率也会被容易生成的格式文本抬高,掩盖真正不确定的数字坐标。即便选中了最自信的预测,围绕它构造的“正确区域”仍可能偏离目标,或与细长按钮的几何形状不匹配。把这些邻近预测全部当成正例强化,可能只是让模型越来越确信一个错误位置。
作者的切入点是监督可靠性的不对称:目标在大屏幕中通常只占很小区域,确认某个点必然正确很难,但识别大量错误点相对容易。这是依赖目标稀疏性的经验判断,而不是“远离伪标签必错”的数学保证。核心 idea:用坐标 token 置信度建立相对可靠的空间锚点,再只利用锚点之外的负样本更新策略,避免直接强化可能错误的正伪标签。
方法详解¶
整体框架¶
输入是一张截图和一条指令,模型输出包含点击坐标的文本。训练时先对同一输入采样多个回答,通过坐标置信度锚定选择一个伪标签,再用归一化距离奖励把候选分成邻近和远离两组。CAL 用两组共同训练;CANL 在同一流程上增加负样本优势筛选,只保留负样本的策略学习信号。输出仍是点击点,并未增加一个外部目标检测器或人工奖励模型。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["截图与指令"] --> Sample["采样16个回答"]
Sample --> Anchor["坐标置信度锚定"]
Anchor --> Reward["归一化距离奖励"]
Reward -->|CAL| Mixed["正负样本GRPO"]
Reward -->|CANL| Negative["负样本优势筛选"]
Mixed --> Update["更新策略并输出点击点"]
Negative --> Update
这里的“测试时”包含真实参数更新:每个基准单独适应、训练一个 epoch 后评测,不是仅在一次推理时多采样后挑答案。真实目标框用于评估点击是否正确,不参与本文适应阶段的奖励构造。因此,主表应按无标签目标域适应来理解,不能直接视为完全未见过测试输入的零样本泛化成绩。
关键设计¶
1. 坐标置信度锚定:把确定的输出格式与不确定的定位数字分开
整段回答中,诸如坐标字段名、标点和解释性文本往往很容易预测。将所有 token 概率求平均,会让这些高概率成分稀释真正承载落点选择的信号。作者在 ScreenSpot-V2 观察到,71.5% 的坐标 token 概率低于 0.6,而 78.1% 的非坐标 token 概率高于 0.9。因此,本文只对坐标数字对应的 token 求概率均值;它不是整段序列概率的乘积,也不是坐标之间的几何一致性。
用 \(x_{\mathrm{img}}\) 和 \(x_{\mathrm{ins}}\) 表示截图与指令,\(y\) 表示候选回答,\(\mathcal C(y)\) 表示其中的坐标 token 位置,\(k\) 为这些位置的数量。将原文式 (2) 的排版整理后,其定义为:
模型对同一输入生成候选集合,选择该分数最高的完整回答,再提取其中的点击点作为伪标签。这样保留的是模型实际生成的一个候选,而不是把几个按钮位置平均成一个可能不可点击的点。置信度在这里承担候选排序功能,不应被解释为经过校准的“点击正确概率”;后续分析也表明,错误预测的置信度会随训练上升。
2. 归一化距离奖励:将一个锚点变成无需真实框的组内反馈
只有一个伪标签还不足以进行组内相对优化。CAL 把每个候选点的横坐标除以截图宽度、纵坐标除以高度,再计算它与同样归一化的锚点之间的欧氏距离。阈值 \(\tau\) 内的候选获得奖励 1,阈值外获得奖励 0。这不是沿用原始像素半径:分别归一化两个轴后,同一阈值在不同分辨率上的意义更一致,但映射回原始非方形截图时也不应理解成固定像素圆。
奖励只判断“是否靠近模型自己选择的点”,并不知道真实按钮的形状。若锚点正确但目标很细长,部分真实有效点击仍可能位于奖励区域外;若锚点错误,其邻近区域的正样本甚至可能全部错误。缓存中的式 (4) 已损坏,无法核实恰好等于阈值时的边界约定,因此这里仅按相邻文字解释奖励规则,不补写未能恢复的分段原式。
3. 负样本优势筛选:保留排除错误的信号,不直接奖励可疑正例
CAL 使用 GRPO 的组内奖励标准化:某个候选比同组平均奖励好,就得到正优势;比平均差,就得到负优势。CANL 保持锚点与二值奖励不变,但把奖励为 1 的样本优势设为 0,只保留奖励为 0 的负优势。记同组奖励均值为 \(\mu_R\)、标准差为 \(\sigma_R\),原文式 (5)、(7) 的关系可整理为:
该表达式要求 \(\sigma_R>0\);缓存未交代全组奖励相同时的数值保护策略,不能据此补出实现。另一个关键细节是,CANL 先用完整候选组计算优势,再筛选负样本,不是在只含奖励 0 的集合中重新标准化。否则奖励方差消失,也无法保留相对于原候选组的学习信号。
策略优化仍采用带概率比裁剪和 KL 正则的 GRPO。所谓“仅负样本学习”指任务奖励对应的策略项不再用正优势拉高可疑答案,不表示模型不存在任何正则约束,也不表示被置零的答案概率绝不会因共享参数更新而变化。它更像是在候选空间中逐步降低明显错误预测的相对概率,而不是获得了一个能直接指出正确按钮的监督器。
一个完整示例¶
论文图 2 使用“点击锁定旋转”的指令,展示了多个候选,其中点 [1796, 459] 的坐标置信度为 0.42,高于图中展示的 0.27、0.37 和 0.33,因此被选为锚点。图示将 [1875, 466] 判为邻近正样本,将 [1743, 787] 与 [1953, 656] 判为负样本。这里复述图中的标记;缓存没有给出该截图尺寸,不能仅凭这些像素坐标独立重算归一化距离。
在 CAL 中,图示正样本原本得到约 1.2 的正优势,负样本约为 -0.7。CANL 把前者清零、保留后者。若锚点不幸选错,方法至少不会主动奖励围绕错误锚点聚集的那批候选;不过,若真实目标恰好被归入负区域,错误惩罚仍可能发生。这正是“更可靠”与“绝对可靠”的区别。
损失函数 / 训练策略¶
基座为 Qwen-2.5-VL 的 3B、7B 版本,使用 VLM-R1 框架和 Flash Attention2。每个基准独立训练 1 个 epoch,学习率为 \(10^{-6}\),采样温度为 1.0,top-k 为 50,top-p 为 1.0,KL 系数 \(\beta=0.04\),默认距离阈值 \(\tau=0.05\)。
每个输入先采样 16 个回答构造伪标签。CAL 随机下采样 8 个回答计算优势;CANL 则在 16 个回答上先计算优势,再选择离伪标签最远的 8 个负回答进行策略优化。缓存没有说明不足 8 个负回答时如何处理,不应自行假设补采样或复制样本。这个采样策略差异也意味着,CAL 与 CANL 的结果差距不能全部归因于优势置零这一项。
实验关键数据¶
主实验¶
指标均为点击点落入真实目标框的准确率,单位为 %。下表摘录原文表 1、2、3 的 7B 总体结果;UI-Vision 仅使用 Element Grounding,不包含 Layout Grounding 或 Action Prediction。增益为相对同一基座的绝对百分点,并非相对百分比。
| 基准 | Qwen-2.5-VL-7B | CAL-7B | CANL-7B | CANL 相对基座增益 |
|---|---|---|---|---|
| ScreenSpot-V1 | 84.9 | 88.6 | 89.2 | +4.3 |
| ScreenSpot-V2 | 88.1 | 92.1 | 92.1 | +4.0 |
| ScreenSpot-Pro | 24.9 | 32.7 | 33.8 | +8.9 |
| UI-Vision | 15.0 | 18.6 | 20.1 | +5.1 |
ScreenSpot-Pro 上 CANL 比 CAL 高 1.1 个百分点,UI-Vision 高 1.5 个百分点,支持负样本在困难定位任务中更有价值的判断;但 ScreenSpot-V2 的 7B 结果持平。GUI-RCPO-7B 在 V2、Pro 分别为 88.9%、25.9%,同属在测试集上适应的方法,协议更接近。与使用标注训练的 GUI 专用模型比较主要说明标注效率,不能忽略训练数据与评测暴露方式的差异。
消融与分析¶
下表保留原文表 4 的部分阈值分析结果,全部为准确率 %。缓存未在该表明确注明模型规模,且默认阈值下 Pro 的 33.2/33.7 与主表中的对应结果并不一致,故不把它混入主表,也不擅自指定成某一规模的主实验。
| 方法 | 阈值 | ScreenSpot-V2 | ScreenSpot-Pro |
|---|---|---|---|
| CAL | 0.01 | 87.7 | 33.3 |
| CAL | 0.05 | 88.9 | 33.2 |
| CAL | 0.1 | 86.9 | 30.7 |
| CANL | 0.01 | 87.5 | 30.2 |
| CANL | 0.05 | 88.5 | 33.7 |
| CANL | 0.1 | 88.5 | 33.5 |
这组数据支持“CANL 对较大阈值更稳健”,但不支持“在所有阈值上几乎不变”:其 Pro 准确率从 0.01 时的 30.2% 到 0.05 时的 33.7%,仍相差 3.5 个百分点。CAL 在 V2 从默认阈值的 88.9% 降到 0.1 时的 86.9%,说明伪正例范围扩大确实可能伤害训练。
候选选择的独立分析提供另一条证据:ScreenSpot-V2 上,采样 12 个回答时,坐标置信度选出的伪标签准确率为 83.9%,整段置信度为 78.6%,差 5.3 个百分点;采样 2 个回答时则为 76.7% 与 74.8%。这些是伪标签选择准确率,不是经过 CAL/CANL 训练后的最终准确率。
关键发现¶
- 泛化并非只靠目标测试集适应:表 5 在 GroundCUA 随机抽取 5k 实例训练 3B 一个 epoch,CANL 在 V2、Pro、UI-Vision 分别得到 86.7%、33.4%、16.7%,基座为 82.1%、16.1%、12.0%。它支持外部数据迁移有效,但不等于排除了所有潜在数据重叠。
- 负学习并非处处胜出:AndroidWorld 的 116 个任务中,采用 GPT-4o 规划、SeeAct-V 分离规划与定位,基座成功率为 25.0%,CAL 为 30.2%,CANL 为 29.3%。定位模型来自 V2 训练,结果显示较可靠的正伪标签仍有价值。
- 置信度提升不等于纠错:作者观察到正确和错误伪标签都会越来越自信,部分远离真实目标的错误仍持续存在。因此,预测更集中只能说明分布收缩,不能单独证明准确率提高。
亮点与洞察¶
- 在任务承载 token 上估计不确定性。 论文没有引入复杂奖励网络,而是排除格式 token 对均值的干扰。可迁移的思路是先识别真正决定动作的输出部分,再验证其置信度是否有判别力,而非默认整段生成概率就代表任务正确性。
- 把伪标签从正答案降级为空间参照。 CANL 仍需要锚点,却不要求其邻域能成为可信正例。这个变化降低了对精确正监督的依赖,但效果依然建立在负区域很少覆盖真实目标的条件上。
- 把奖励质量和终局任务结果一起检查。 候选选择分析、阈值分析与 AndroidWorld 评测分别检验锚点、奖励和下游效益。三者共同提供证据,比只报告 grounding 总分更有解释力。
局限与展望¶
- 作者指出的能力上限:缺少准确正反馈。 持续排除错误不保证模型发现正确区域,错误伪标签的置信度也会增长。后续可引入经验证的少量正反馈,但这将改变完全无标签的设定。
- 几何先验并不总成立。 大目标、细长目标、错位锚点都可能使真实点击落入负区域。按元素形状调整奖励区域是值得测试的方向,而不是本文已经实现的组件。
- 评测协议与因果归因仍需谨慎。 主结果是逐基准测试时训练;CAL/CANL 又采用不同下采样方式。更严格的后续实验应固定候选集合与筛选策略,单独切换正优势是否置零,并明确区分目标域适应与未见域泛化。
- 缓存证据存在缺口。 式 (4)、式 (6) 抽取损坏,正文引用的附录 A.5 未包含在缓存中;零奖励方差、不足负样本的处理及表 4 与主表的差异均无法进一步核实。本笔记不补写这些实现细节,也不把阈值分析的波动包装成完全稳定。
相关工作与启发¶
- 与 GUI-RCPO 对比: 两者都使用无标签测试时训练,但 GUI-RCPO 依赖预测框的区域一致性,本文以坐标 token 置信度选锚点。后者避免把预测框的一致性直接当作可靠监督,仍无法彻底消除伪标签误差。
- 与 GUI-R1、UI-R1 对比: 这些 RLVR 路线依靠标注计算奖励,本文用空间距离生成代理奖励。交换条件是减少新增标注需求,同时接受监督精度与能力上限的损失。
- 与 TTRL 和负学习工作对比: 本文继承测试时强化学习与只学负例的思想,具体贡献在于把它们接到 GUI 的坐标置信度和稀疏空间结构上。迁移到其他动作空间时,应先检验“负例比正例更可靠”,不能把它当作普遍成立的规律。
评分¶
- 新颖性: 4/5。坐标级置信度与负优势筛选的结合贴合 GUI 的监督噪声特点,但基本强化学习框架并非新提出。
- 实验充分度: 4/5。涵盖四个定位基准、外部数据迁移和在线任务;阈值表的设置交代及组件隔离仍有改进空间。
- 写作质量: 3/5。核心论证易理解,但“阈值稳定”的文字结论比表格支持的范围更强;缓存公式损坏另影响复核。
- 价值: 4/5。为减少适应阶段 GUI 标注提供了实用路线,但实际部署仍需权衡参数更新成本、错误锚点与可靠正反馈的缺失。