Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets¶
会议: NeurIPS2026
arXiv: 2606.25760
领域: 多模态 VLM
关键词: GUI 定位、不确定性量化、排序迁移、选择性执行、保形预测
一句话总结¶
Argus 用统一的单步 GUI 点击记录比较不同可观测接口下的不确定性方法,发现固定模型时方法排序较易跨数据集迁移,而跨模型与开放权重到 API-only 的迁移明显减弱,且错误识别能力不能代替概率校准或空间覆盖检验。
研究背景与动机¶
视觉语言模型(vision-language model,VLM)能够根据截图和指令输出点击坐标,但坐标预测的用途不是展示一个答案,而是交给操作系统执行。点击是否落进目标框只是第一层问题:部署时还需要知道哪些预测应暂缓执行、错误大概偏得多远,以及围绕预测点画出的不确定区域是否覆盖真正的目标。ScreenSpot-v2、ScreenSpot-Pro、OSWorld-G 和 UI-Vision-EG 的难度与目标几何差异,使单个模型、单个数据集上的置信度结论很难直接推广。
现有方法分别利用 token 概率、重复采样、隐藏状态、注意力或模型自报置信度,但这些信号并非所有部署接口都能获取。开放权重模型允许读取内部张量,闭源接口通常只能返回文本与坐标;把不可用的内部信号换成代理量,又会把“接口差异”与“算法实现差异”混在一起。此前 GUI 不确定性研究更多关注某个专用分数或干预机制,缺少在相同评价协议下比较方法选择是否能够迁移的证据。
本文不提出新的不确定性估计器,而是把模型、数据集和可观测接口组成一个评测环境,分别测量方法的错误排序、拒绝效果、概率校准和空间区域质量。核心 idea:统一记录与校准协议,比较不同环境中的不确定性方法排序,并把“应选哪种分数”与“该分数能否支持具体干预”分开验证。
方法详解¶
整体框架¶
输入是一张截图和一条指令,基础模型只生成一个待执行点击;额外采样或扰动响应用于估计该点击的不确定性,而不是执行多轮任务。Argus 先建立接口一致的逐项记录,再在独立校准集上拟合需要监督的分数与映射,最后在测试集上比较多目标指标、方法排序迁移和保形点击圆盘。
开放权重面板包含 27 种方法、7 个家族、4 个模型和 4 个数据集,共 16 个模型×数据集单元。模型为 Qwen2.5-VL-7B(Q7)、Qwen2.5-VL-72B-AWQ(Q72)、UI-TARS-1.5-7B(UI)和 POINTS-GUI-G-8B(PT)。API-only 面板保留 8 种可忠实计算的方法,在 GPT-5.4、Claude Sonnet 4.6、Gemini 3.1 Pro 与同样 4 个数据集上形成 12 个单元。缓存中的“2727”“44”“88”等是数学文本重复渲染,不表示数千种方法或数十个模型。
下面画的是评测与校准流程,不是新训练出的智能体网络;虚线表示校准监督或拟合结果,实线表示记录和测试数据流。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
I["截图与指令"] --> A["接口一致记录"]
A --> B["校准隔离评分"]
C["校准记录与标签"] -.-> B
B --> D["多目标排序迁移"]
B --> E["保形点击圆盘"]
C -.-> E
T["独立测试记录"] --> D
T --> E
D --> O["方法排序与指标"]
E --> P["中心覆盖与半径"]
关键设计¶
1. 接口一致记录:先保证比较的是同一个点击任务和可实现的公式
每项记录包含一次贪心点击、5 次随机采样、3 个指令改写和3 个图像扰动的响应,坐标聚类采用 50 像素容差。正确性按预测点是否位于目标边界框内判定。随机采样衡量重复生成的一致性,指令改写衡量语义等价表述的稳定性,图像扰动衡量视觉输入变化后的稳定性;这三种来源不能简单合并成 11 次同分布随机采样。
七个家族对应不同的信息入口:logit 方法读取生成 token 的概率或熵;sampling 方法计算坐标簇分歧或输出相似度;hybrid 方法联合置信度与一致性;density/probe 方法利用最后一层隐藏状态;attention 方法跟踪注意力链;verbalised 方法询问模型自身置信度;VLM-native 方法比较改写或图像扰动后的点击。HEDGE 使用改写响应的簇熵,IMGHEDGE 使用饱和度增加 30%、高斯噪声标准差 8 和 JPEG 质量 50 的三种扰动。
跨接口时,不把缺失的 logprob、隐藏状态或注意力换成同名代理量。API-only 只保留 SelfCons、SE、LexSim、CCP、Verb-1S、Verb-2S、HEDGE、IMGHEDGE,要求公式与开放权重侧一致。CCP 利用随机点击与贪心点击在容差内的一致比例;SE 利用坐标簇质量的熵。二者都能只凭响应计算,但 token 概率加权的变体不能据此悄悄保留。
闭源模型采用 single-shot、无工具、无 Python 解释器协议,因此不是裁剪放大后反复定位的榜单设置。接口也并不完全等价:Sonnet 的图像输入需要缩放,坐标格式漂移与置信度缺失被严格解析为缺失值。忠实公式解决的是方法定义一致性,并不能消除输入分辨率、响应合规率和有效样本数量的差异。
2. 校准隔离评分:后处理不等于完全不需要训练或标签
所有不确定性输出统一为数值越大、预测错误风险越高。简单 token 分数或一致性分数可以直接由记录计算,但 density/probe 家族需要校准数据:Mahalanobis 在隐藏表示空间衡量距正确类分布的距离,Mahal-RMD 再减去背景分布距离,SAPLMA 用 MLP 探针,SEP 用逻辑回归探针。RMD 的作用是削弱共享表示尺度带来的干扰,而不是仅换一个分类阈值。
这些估计器只在当前单元的校准划分上拟合,并在同一单元的测试划分上评价。本文主要检验跨单元的方法排序,不是把一个单元训练好的探针直接移到另一个单元。因而“后处理”意为不更新基础 GUI 模型,不能写成所有方法都 training-free,也不能把方法排序稳定当成探针参数已获跨域验证。
将分数解释成错误概率时,作者在校准集拟合保序回归(isotonic regression),重尾分数还先做分位数变换,再在测试集测 ECE 与 Brier。一个分数可以把大多数错误排在前面,却没有合理的概率尺度;这就是必须把判别与校准分开测的原因。正文提到若干 density 方法的 ECE 大于 0.40,但附录 A15 限定:80 个单元×density 方法组合中,没有“家族内 AUROC 第一且 ECE 大于 0.40”的组合,不能概括成所有获胜密度方法都严重失准。
3. 多目标排序迁移:错误、严重程度和方法推荐是三个不同对象
AUROC 以错误点击为正类,测试高分能否把错误排在正确点击前。选择性执行指标 PRR 衡量最多拒绝 50% 时相对 oracle 的拒绝质量;AURC 积分不同接受覆盖率下的错误风险,越低越好。它们不等于基础模型的 point-in-bbox accuracy,也不能直接解释为实际界面动作后果的风险保证。
为了区分近失误和严重偏移,作者只在错误点击上评价 AUSE,严重程度由点击到目标框中心的距离除以目标尺度,再做对数压缩。原文可辨认的定义为:
其中目标中心为 \(\mathbf{c}^{\star}_i\),目标框宽高为 \(w_i,h_i\)。AUSE 比较按不确定性去除高风险错误与按真实严重程度去除错误时的剩余误差曲线,越低越好。该归一化让偏离小按钮与偏离大面板有所区分,但没有建模按钮功能、误操作代价或任务可恢复性。
迁移分析则先在每个单元内按各方法的测试 AUROC 排序,再计算两个排序之间的 Spearman \(\rho\)。相关的是“方法 A 是否仍优于方法 B”,不是同一方法逐项分数的相关性,更不是原始分数或已校准概率可以原封不动搬到新域。论文全部开放权重单元有 120 个两两组合;跨层级结论只比较 Q72-AWQ 与匹配数据集上的 12 个闭源单元,并限制在共享的 8 种方法上。
4. 保形点击圆盘:把误差分数变成区域,但明确区域的覆盖对象
固定圆盘用校准点击到目标中心的欧氏距离作为残差,取相应分位数作为半径。测试时圆盘中心是预测点击,覆盖事件是目标框中心是否进入圆盘。正文展示的分位数关系如下;实现时有限样本的保形分位数约定仍应核对作者代码,不能把简写当作完整细节。
Disk-Normalized 用 plug-in 不确定性提供局部误差尺度,使不同测试点击获得不同半径;Disk-CQR 使用保形化分位数回归构造更保守的区域。缓存没有给出足以逐项复现这两个变体的完整训练目标,因此这里只解释它们怎样改变半径,不补造精确损失或损坏公式。
保形预测的边际覆盖依赖校准与测试记录的可交换性(exchangeability)。API 行为或样本构成变化时,实际覆盖必须重新测量。即使圆盘覆盖目标中心,它仍可能同时包含多个无关控件;圆盘不是“里面任一点都能安全点击”的区域,大半径更不能被解读为高安全性。
一个完整示例¶
以“点击某个按钮”的截图指令为例,模型先给出待执行坐标,额外 5 次随机响应仅用于计算分歧,不代表完成了 5 步轨迹。假设这些点击被 50 像素容差分成两个簇,SE 会反映簇质量的分散程度,CCP 则关注随机点击是否靠近原贪心点击;若错误按钮被稳定选中,一致性仍可能很高。
有隐藏状态的部署可以再用校准集训练 SAPLMA 或 SEP,随后在未参与拟合的记录上比较 AUROC、AUSE 和校准误差。API-only 无法沿用这两个探针,只能重新排序可用的 8 种方法。这里的截图与分簇为机制说明,不是论文额外报告的实例数据。
空间区域的真实例子是 PT×OSWorld-G:在 \(\alpha=0.10\) 下,正文报告固定圆盘半径 743 像素,归一化圆盘平均半径 481 像素,缩小约 35%。这表示同一覆盖目标下区域更紧,并不表示原点击准确率提高了 35%,也不授权执行圆盘内其他控件。
损失函数 / 训练策略¶
基础 GUI 模型保持冻结;训练或拟合发生在后处理端,包括隐藏状态探针、密度估计、保序概率映射及保形阈值。面板选择与扰动选择也应只用校准数据,不能利用测试标签挑选再宣称部署效果。
主协议为测试/校准 = 80/20,重复 50 个分层划分种子;这是对固定逐项推理记录反复划分与拟合,不是重新训练基础模型 50 次。附录的 calibration/test 比例敏感性实验固定 seed 0,只改变切分位置,不能与主表的 50 次均值混为一谈。
作者报告 500 次 bootstrap 和配对比较,但正文描述分层重采样,附录 A29 又明确区间来自 50 个种子值的重采样。区间的统计单位存在表述差异,且这些划分共享原始记录,不应当作 50 个独立数据集。方法纳入的“每单元 30 分钟”仅指生成逐项记录后的评分计算,Q72×OSWorld-G 的记录生成仍约需 6.7 小时。
实验关键数据¶
主实验¶
下表选取主表 4 与附录 A29 的代表性单元。Accuracy 是基础点击命中率;AUROC 与 PRR 是该单元 AUROC 最优方法的均值,三列不能混成同一“准确率”。SP 为 ScreenSpot-Pro,V2 为 ScreenSpot-v2,OSG 为 OSWorld-G。
| 单元 | Accuracy | AUROC 最优方法 | AUROC | PRR |
|---|---|---|---|---|
| Q7×V2 | 0.883 | SAPLMA | 0.817 | 0.599 |
| Q72×SP | 0.447 | SAPLMA | 0.889 | 0.802 |
| UI×V2 | 0.878 | CoCoA-1MCA | 0.842 | 0.630 |
| PT×OSG | 0.659 | Mahal-RMD | 0.820 | 0.568 |
| GPT-5.4×SP | 0.367 | CCP | 0.735 | 0.574 |
| Sonnet 4.6×SP | 0.341 | CCP | 0.731 | 0.679 |
| Gemini 3.1 Pro×V2 | 0.447 | Verb-1S | 0.966 | 0.951 |
| Gemini 3.1 Pro×SP | 0.313 | Verb-2S | 0.856 | 0.721 |
Gemini×V2 的高 AUROC 不表示点击接近完美:基础命中率仅 0.447。附录 A17 在锁定的 300 项子集中分析了 273 项有效置信度记录,显示分数接近两极、两簇正确性明显不同;该结论仍限于有效记录与单次无工具协议,需同时关注缺失响应。
消融实验¶
这里列的是迁移与目标差异分析,不把 benchmark 写成新网络的模块移除消融。Spearman 衡量方法排序迁移,不衡量校准概率迁移。
| 分析范围 | 数量 | 结果 | 解释边界 |
|---|---|---|---|
| 开放权重全部单元两两比较 | 120 对 | 平均 \(\rho=0.705\) | 混合数据集与模型变化 |
| 同模型、跨数据集 | 24 对 | 平均 \(\rho=0.79\) | 固定模型的排序较稳定 |
| 同数据集、跨模型 | 24 对 | 平均 \(\rho=0.69\) | 不分离尺度、量化与微调因素 |
| PT×OSG 对 PT×SP | 1 对 | \(\rho=0.969\) | 最强代表性固定模型迁移 |
| Q72-AWQ 对匹配数据集闭源单元 | 12 对 | 平均 \(\rho=0.08\);95% CI 为 [-0.219, 0.373] | 仅共享 8 方法;区间含零 |
| 闭源单元内部两两比较 | 66 对 | 平均 \(\rho=0.127\) | 厂商与数据集依赖明显 |
| AUROC/AUSE 最优方法一致 | 开放权重 16;闭源 12 单元 | 2/16;9/12 | 面板规模不同,非公平的因果比较 |
保形圆盘的正文例子如下,目标中心覆盖率为 0.90;半径单位为像素,百分比为正文报告的近似值。
| 单元 | Disk-Fixed 半径 | Disk-Normalized 半径 | 缩小幅度 |
|---|---|---|---|
| PT×OSG | 743 | 481 | 35% |
| Q72×OSG | 837 | 620 | 26% |
| UI×SP | 1469 | 1076 | 27% |
| Q72×SP | 1124 | 900 | 20% |
摘要与结论概括归一化圆盘可缩小 40–60%,但第 7 节这些具体例子为 20–35%;不能把前一范围当作表中单元的效果,缓存也未充分解释两种范围的对应口径。闭源 Gemini×SP 的固定圆盘在目标覆盖 0.95/0.90/0.80 下,实际覆盖为 0.926/0.884/0.795,说明必须检查经验覆盖。
关键发现¶
- Density/probe 的优势主要体现为优秀成员经常获胜和模型转换时较稳定,不代表任一 density 方法都好。Mahal-RMD 在所有 16 个单元优于 naive Mahalanobis,但 naive 方法本身常接近随机甚至更差。
- ScreenSpot-Pro 上 Q7→Q72 的 sampling/hybrid 家族 AUROC 变化为 -0.277/-0.257,而 Q7→UI 为 -0.039/-0.010;不能把所有下降归因于 GUI 微调。Q72 同时采用 AWQ,所谓 scale-only 比较也有量化混杂。
- 原文附录存在需保留的冲突:A11 表题称 density 家族均值赢得多数单元,但表内均值不支持该概括;A28 称有变化单元 AUROC 均在基线 ±0.01 内,但 UI×UIV 的 20/80 与 50/50 值分别为 0.840 和 0.891。笔记不据此自改原始数字。
亮点与洞察¶
- 把可观测接口纳入方法适用性,是比单纯增加基线更重要的设计。相同名称但不同代理公式的比较会隐藏部署约束,保留忠实共享交集更利于解释。
- “模型答得更准”与“模型知道哪些答案错了”可以分离。应根据拒绝、严重程度排序或概率解释的需求选择指标,而不是只看最高 AUROC。
- 方法推荐面板可以作为迁移先验,但具体探针、概率映射和空间半径必须在目标环境重新拟合或核验。排序相关性高不等于不用收集目标域标签。
局限与展望¶
- 只研究单步点击定位,没有验证多步轨迹、恢复、状态变化或跨步骤风险累积;不应扩展成多智能体任务成功率结论。
- 5 次纯随机采样限制空间分散估计的可靠性,改写与扰动不能替代 SafeGround 所需的更大纯随机预算。提高预算还会改变方法成本排序。
- 模型类别与接口变化伴随能力、对齐、骨干、尺度、量化、图像缩放及格式合规差异,结果是描述性比较,不是某一个因素的严格因果效应。
- 重复划分的排序稳定性不保证跨单元探针迁移,更不保证每个 UI 子群的条件覆盖。后续可测试目标尺寸分层、场景分层及真正跨域部署。
- 中心距离不能表达误点击删除与误点击空白区域的后果差异。可进一步加入语义动作代价、不可逆操作限制和实际可点击区域约束,而非仅用大圆盘表示可靠性。
相关工作与启发¶
- vs LM-Polygraph / CoCoA:这些工作提供文本生成的 UQ 方法与置信度—一致性结合方式,Argus 将其忠实适配到坐标点击,并检验环境改变后的方法排序,不宣称发明新的通用估计器。
- vs SafeGround:SafeGround 用随机点击分散与 Learn-Then-Test 支持拒绝;Argus 比较多家族方法和可观测接口,主面板的采样预算不足以完整复制前者的纯随机设置。
- vs HyperClick / UI-Zoomer / V2P:它们分别学习空间置信头、用不确定性触发放大重定位或校准视觉注意力;Argus 不增加这些干预模块,而提供选择后处理信号的跨环境依据。
- vs split conformal / CQR:保形方法关注满足假设时的区域覆盖,Argus 用点击圆盘观察半径与经验覆盖。区域覆盖、点击命中和实际操作风险应继续分别审计。
评分¶
- 新颖性: 4/5 — 主要贡献是 GUI 不确定性选择的跨环境基准,而非新估计器。
- 实验充分度: 4/5 — 开放权重与闭源面板、多个指标和敏感性分析较完整,但因果控制与跨域部署仍有限。
- 写作质量: 3/5 — 主问题清晰,但半径改善范围、家族均值概括和部分附录描述存在冲突。
- 价值: 4/5 — 对 GUI 定位中的方法选择有直接参考价值,前提是保留目标校准与覆盖检查。