跳转至

Reward Modeling for Computer-Using Agent from Video Execution

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/limenlp/ExeVRM
领域: 对齐/RLHF
关键词: 计算机使用智能体 (CUA)、执行视频、奖励建模、时空 Token 剪枝、对抗指令翻译

一句话总结

针对计算机使用智能体(CUA)轨迹评估严重依赖手工规则或特定中间动作格式的问题,本文提出了基于无偏界面执行视频的奖励模型 ExeVRM,通过构建 53k 规模数据集 ExeVR-53k、对抗指令翻译合成负样本,以及无损关键微小 UI 变化的时空 Token 剪枝算法(STP+TTP),实现了在 720p 长程视频下超越 GPT-5.2 与 Gemini-3 Pro 的任务完成判定与精准首错时间归因。

研究背景与动机

计算机使用智能体(CUA)正在成为自动化完成跨桌面操作系统(如 Windows、macOS、Ubuntu)及移动端复杂多步任务的核心范式。然而,评判一个 CUA 在真实环境下生成的交互轨迹是否真正满足用户意图,长期以来严重制约着下游强化学习对齐与自动化测试。现存的基准与评测协议大多依赖手工编写的验证脚本、任务专属规则解析器,或是仅检查最终界面状态;前者缺乏通用性且难以迁移至开放新任务,后者则因缺失中间交互过程而极其容易被误判。为了构建普适、与具体智能体实现无关的奖励模型,直接以交互过程中呈现的屏幕界面状态序列——即执行视频(Execution Video)作为评估输入,是最理想且模型无关的表征方式。

然而,基于执行视频进行 CUA 奖励建模面临着两大根本性挑战。一方面,桌面交互视频存在巨大的时空冗余:大量界面区域(如工具栏、侧边栏、壁纸及固定窗口结构)在时间维度上长久保持静止,而决定任务成败的判别证据往往是极度局部、短暂且细微的视觉线索(如光标焦点切换、复选框勾选、弹窗错误提示或细小文本编辑)。若直接输入高分辨率长程全帧视频,有限的显存预算瞬间被耗尽;而粗暴的时空下采样则会直接抹杀关键线索。另一方面,现有的计算机使用开源数据集绝大多数是面向智能体行为克隆的正向成功演示,极其缺乏高质量、带有明确发散时间步和因果归因判据的负样本轨迹,导致奖励模型训练缺乏有效的对比监督信号。

针对上述矛盾,本文提出了一套端到端的执行视频奖励建模范式:以客观界面视频为唯一视觉输入,通过系统性数据整合与基于 VLM 的对抗指令翻译构建起首个大规模多平台三元组基准,并设计了保持细粒度界面变化敏感性的时空 Token 剪枝机制,使得高分辨率长程轨迹的训练与推理变得可行。核心 idea:将 CUA 轨迹评估解耦为纯界面视频到任务目标的通用奖励映射,提出 ExeVR-53k 大规模数据集与对抗指令负样本生成策略,配合保持微小 UI 状态跃迁的时空 Token 剪枝(STP+TTP),训练出兼具高精度二元成功判定与时间步首错归因能力的视频奖励模型 ExeVRM。

方法详解

整体框架

ExeVRM 的核心目标是接收用户自然语言任务指令 \(X\) 与智能体执行过程的关键帧序列视频 \(V\),直接输出轨迹成功与否的二元标量判定 \(\hat{Y} \in \{0, 1\}\),并在失败样本上预测最初发生偏差的时间区间 \(\hat{\mathcal{I}} = [\hat{t}_s, \hat{t}_e]\)。为了在不牺牲关键细微线索的前提下高效摄入长达 100 帧的高分辨率视频,整个流水线解耦为:执行轨迹的统一视频化表征、对抗指令翻译合成负样本与归因标注、以及在冻结视觉编码器特征层执行的空域与时域双重 Token 剪枝。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:用户指令 X + 执行关键帧序列 V"] --> B["阶段1:多源轨迹视频化与对抗指令翻译<br/>统一 1 FPS 序列 / VLM 合成负指令与归因时间戳"]
    B --> C["阶段2:空域 Token 剪枝 (STP)<br/>局部相似图聚类,过滤大面积静止背景"]
    C --> D["阶段3:时域 Token 剪枝 (TTP)<br/>参考帧余弦相似度比对,过滤时间持久冗余"]
    D --> E["阶段4:Token 重组与序列重打包<br/>双掩码逻辑与过滤,投射至 LLM 输入空间"]
    E --> F["输出:任务成功判定与首错时间归因<br/>二元标量奖励 + 判别错误时间步区间"]

关键设计

1. 多源轨迹视频化与对抗指令翻译:解决高质量负监督与细粒度归因数据匮乏 针对开源 CUA 数据集格式异构且多为正向演示的痛点,该设计建立起标准化执行视频表征,并规模化产出硬负样本。首先,算法将来自 AgentNet(人工演示)、ScaleCUA(混合演示)与 OSWorld(30 种不同 CUA 模型的真实 rollout)的日志统一抽象为原子交互步,在每个动作执行后抽取一张最具代表性的高清截图作为关键帧,按时序串联构成 1 FPS 的执行视频,覆盖 Windows、macOS、Ubuntu 和 Android 四大平台。针对负样本缺失问题,受反向翻译启发,提出对抗指令翻译(Adversarial Instruction Translation):给定一段有效的轨迹片段,提示强视觉语言模型(如 GPT-5.2)基于当前界面上下文反向合成一条高度合理但与当前操作存在细微语义偏差的错误目标指令,同时强制模型输出该轨迹偏离新指令的具体文字理由与最初发生偏差的起始时间步索引 \(t_{\text{ref}}\)。经过人工抽样审计,合成负样本的标注有效性达到 100%,从而构建了包含 53k 条高质量指令-视频-奖励三元组的 ExeVR-53k 数据集。

2. 空域 Token 剪枝 (STP):基于图连通分量去除大面积均匀无信息背景 针对单张 GUI 截图中大面积空白背景、固定色块占据巨大 Token 开销的问题,STP 利用相邻视觉 Patch 的特征相似性在单帧内构建连通图,精准剔除大尺度无语义背景而保留细碎组件。视觉编码器将单帧输入处理为特征网格 \(\mathbf{P}^{(t)} \in \mathbb{R}^{H' \times W' \times D}\)。对于网格中任意位置 \((i, j)\),算法计算其与 4-邻域的水平差值 \(d_h^{(t)}(i, j) = \|\mathbf{P}^{(t)}_{i,j} - \mathbf{P}^{(t)}_{i,j+1}\|\) 及垂直差值 \(d_v^{(t)}(i, j) = \|\mathbf{P}^{(t)}_{i,j} - \mathbf{P}^{(t)}_{i+1,j}\|\)。当特征距离低于阈值 \(\tau_s\) 时判定为相邻连通:

\[e_{(i,j) \leftrightarrow (i',j')}^{(t)} = \mathbb{I}\left[(i',j') \in \mathcal{N}(i, j) \;\land\; \|\mathbf{P}_{i,j}^{(t)} - \mathbf{P}_{i',j'}^{(t)}\| < \tau_s\right]\]

通过在全图上运行并查集(Union-Find),算法提取出所有连通分量集合 \(\mathcal{C}^{(t)} = \{C_1^{(t)}, \dots, C_{K_t}^{(t)}\}\)。仅当连通块包含的 Patch 数量超过尺度阈值时,将其归入冗余大分量集合 \(\mathcal{R}^{(t)} = \{C \in \mathcal{C}^{(t)} : |C| > \tau_{\text{large}}\}\),并生成空域过滤掩码 \(\mathbf{M}_s^{(t)}(i, j) = 0\)(属于大分量)或 \(1\)(保留)。该机制以完全免参数的方式高效擦除大面积空白,将计算资源集中在富含细粒度 UI 元件的非连续区域。

3. 时域 Token 剪枝 (TTP):基于动态参考帧余弦比对抑制持久静态布局 由于 GUI 交互的局部性,即使经过空域过滤,窗口边框、侧边导航栏和工具栏等高对比度元素依然会在连续数十帧内反复出现。TTP 旨在剔除跨时间步几乎恒定不变的持久视觉 Token,迫使模型关注发生状态跃迁的活跃区域。对于视频张量 \(\mathbf{V} \in \mathbb{R}^{T \times N \times D}\) 中每一个固定的空间位置 \(i\),算法维护一个动态参考 Token \(\mathbf{v}_i^{(\text{ref})}\),并在首帧初始化为 \(\mathbf{v}_i^{(0)}\)。对于后续的第 \(t\) 帧,计算当前位置 Token 与参考 Token 的余弦相似度:

\[\mathbf{M}_t(t, i) = \mathbb{I}\left[\text{sim}_{\text{cos}}\left(\mathbf{v}_i^{(\text{ref})}, \mathbf{v}_i^{(t)}\right) \le \tau_t\right], \quad t \in \{1, \dots, T-1\}\]

首帧始终无条件保留(\(\mathbf{M}_t(0, i) = 1\))。一旦某帧在该位置发生实质性变化(即相似度不超过严格阈值 \(\tau_t\)),该 Token 被保留,并触发参考状态的重置更新:

\[\mathbf{v}_i^{(\text{ref})} \leftarrow \begin{cases} \mathbf{v}_i^{(t)}, & \text{若 } \mathbf{M}_t(t, i) = 1 \\ \mathbf{v}_i^{(\text{ref})}, & \text{其他} \end{cases}\]

这一动态滑动更新机制确保了每一个空间锚点始终与其最近一次发生的“实质跃迁”进行比对,既完美滤除了长期未动的系统窗口骨架,又能精准捕获如鼠标点击后下拉框展开、文本框光标闪烁、输入内容刷新等极关键但稍纵即逝的事件。

损失函数 / 训练策略

在训练阶段,模型冻结预训练视觉语言模型的视觉编码器 \(\mathcal{V}\) 和多模态投影层 \(\mathcal{P}\),仅对语言骨干网络参数进行全量微调。空域掩码 \(\mathbf{M}_s\) 与时域掩码 \(\mathbf{M}_t\) 通过逐元素逻辑与操作结合 \(\mathbf{M} = \mathbf{M}_s \land \mathbf{M}_t\),仅当两个剪枝模块均认为该 Token 具备信息量时方予保留。过滤后的视觉 Patch 被重新打包并投影至语言模型的 Token 空间 \(\tilde{\mathbf{H}}_V\)。训练损失包含二元分类奖励监督及文本因果理由建模:

\[\mathcal{L}_{\text{rm}} = \ell(\hat{Y}, Y) + \lambda \mathcal{L}_{\text{gen}}\]

实验统一设置超参数 \(\tau_s = 0.3\)\(\tau_t = 0.9999\)\(\tau_{\text{large}} = 40\)。在 8 张 NVIDIA A100-80GB GPU 上基于改进的 LLaMA-Factory 框架,采用学习率 \(5 \times 10^{-6}\) 及余弦退火策略分别对 Qwen3-VL-4B-Instruct 和 Qwen3-VL-8B-Instruct 进行了全量指令微调。

实验关键数据

主实验

评估基准 ExeVR-Bench 包含 789 个经过严格清洗的测试任务(正负样本比例接近 1:1),横跨 Ubuntu (Agent)、Ubuntu (Human)、Mac/Win 和 Android。主实验对比了商业专有前沿大模型与开源视觉语言模型在二元成功判定上的准确率 (Acc)、精确率 (Prec) 和召回率 (Rec)。

模型 类型 Ubuntu(Agent) Acc/Prec/Rec Ubuntu(Human) Acc/Prec/Rec Mac/Win Acc/Prec/Rec Android Acc/Prec/Rec Overall Acc / Prec / Rec
Gemini 2.5 Pro 专有闭源 84.6 / 85.6 / 82.8 64.5 / 82.2 / 37.0 69.0 / 83.9 / 47.0 74.0 / 81.6 / 62.0 72.8 / 83.5 / 56.7
Gemini 3 Pro 专有闭源 80.4 / 75.0 / 90.0 71.2 / 71.7 / 71.0 75.6 / 75.3 / 76.8 73.5 / 74.7 / 71.0 75.1 / 74.2 / 76.7
GPT-5.2 专有闭源 82.5 / 85.1 / 78.7 74.0 / 84.3 / 59.0 74.5 / 88.9 / 68.7 74.5 / 75.5 / 75.8 75.0 / 82.7 / 66.5
Seed-2.0 Pro 专有闭源 85.1 / 85.1 / 85.1 77.2 / 81.7 / 69.1 81.0 / 86.1 / 74.0 78.0 / 82.6 / 71.0 80.3 / 83.9 / 74.7
InternVL-3.5 8B 开源权重 64.6 / 64.8 / 55.9 52.0 / 52.2 / 48.0 59.5 / 58.6 / 65.0 57.5 / 59.3 / 48.0 56.6 / 58.9 / 55.9
Qwen2.5-VL 7B 开源权重 64.6 / 65.5 / 60.6 63.0 / 65.1 / 56.0 68.0 / 74.3 / 55.0 63.5 / 62.7 / 66.0 64.5 / 66.6 / 59.2
Qwen3-VL 8B 开源基础 71.4 / 74.4 / 64.9 69.0 / 86.5 / 45.0 66.5 / 81.1 / 43.0 64.5 / 71.6 / 48.0 67.7 / 77.6 / 49.9
ExeVRM 4B (本文) 开源专用 77.8 / 83.3 / 69.1 81.0 / 82.9 / 78.0 90.0 / 87.7 / 93.0 72.5 / 66.4 / 91.0 80.1 / 79.2 / 82.5
ExeVRM 8B (本文) 开源专用 82.5 / 85.9 / 77.7 84.0 / 84.0 / 84.0 89.0 / 85.5 / 94.0 83.5 / 77.2 / 95.0 84.7 / 82.9 / 87.7

在时间归因评测(tIoU)中,ExeVRM 8B 取得了 0.3332 的平均分,大幅领先 GPT-5.2 (0.0855)、Gemini 3 Pro (0.0245) 以及原始 Qwen3-VL 8B (0.0862),证明其不仅能做出正确的整体判决,还能精准捕捉产生错误的关键交互步。

消融实验

消融实验深入验证了输入分辨率、评估策略以及时空 Token 剪枝模块各个组件对模型性能与计算效率的影响。

表 1:输入分辨率对奖励判定的影响 | 模型基座 | 输入分辨率与剪枝策略 | Accuracy (%) | Precision (%) | Recall (%) | |---|---|---|---|---| | Qwen3-VL 4B | 360p (无剪枝) | 79.3 | 80.6 | 77.8 | | Qwen3-VL 4B | 720p (w/ STP & TTP) | 80.1 | 79.2 | 82.5 | | Qwen3-VL 8B | 360p (无剪枝) | 81.5 | 82.5 | 80.5 | | Qwen3-VL 8B | 720p (w/ STP & TTP) | 84.7 | 82.9 | 87.7 |

表 2:时空 Token 剪枝各模块对 Qwen3-VL 4B 的消融 | 配置 | w/ STP (空域) | w/ TTP (时域) | Accuracy (%) | Precision (%) | Recall (%) | 峰值显存 (50帧) | 单步训练耗时 | |---|---|---|---|---|---|---|---| | 仅空域剪枝 | ✓ | ✗ | 77.6 | 81.7 | 72.6 | ~56 GiB | 6.2 s | | 仅时域剪枝 | ✗ | ✓ | 80.3 | 81.3 | 79.3 | ~68 GiB | 7.8 s | | 完整组合 (STP + TTP) | ✓ | ✓ | 80.1 | 79.2 | 82.5 | ~49.5 GiB | 5.8 s |

关键发现

  • 时域剪枝主导语义判别,空域剪枝突破显存瓶颈:单独使用 TTP 时准确率高达 80.3%,而单独使用 STP 时准确率仅 77.6%。这是因为 GUI 任务判决依赖状态跃迁,TTP 直接消除了跨帧静止干扰;而空域 STP 虽可能偶发性误删细小弱对比线索,但与 TTP 结合后能将 50 帧的峰值显存从 68 GiB 大幅压降至 49.5 GiB(降幅超 27%),并在保持高精度的同时将召回率提升至 82.5%。
  • 密集视频序列对长程因果推理至关重要:与仅查看尾帧截图(AER,准确率仅 55-69%)或首尾双截图(Simplified Judge,准确率 57-78%)相比,接收完整视频上下文的 ExeVRM 实现了全面碾压(84-89%),证明单凭最终静态画面极易受到虚假状态欺骗,必须观察完整执行动作链。
  • 高分辨率是微小状态检测的生命线:将输入从 360p 升级至 720p 带来了巨大的召回率增益(8B 模型上 Recall 从 80.5% 跃升至 87.7%,提升 7.2 个百分点),证明桌面图标、细微代码及弹窗字符需要足够物理分辨率才能被准确解码。

亮点与洞察

  • 将轨迹评测提升为纯界面视频监督问题:打破了传统 CUA 评估对特定 API 格式、内部 CoT 思考或环境断言脚本的过度依赖,将任何黑盒、异构智能体的行为统一转化为屏幕录像评测,具备极高的通用性与可迁移性。
  • 巧妙的对抗指令翻译机制:借助反向思维与强 VLM 生成同界面上下文下的“伪指令”与“首次偏离步戳”,极具创意地解决了桌面智能体正向演示过剩、负样本和步骤归因标签极端匮乏的工业级痛点。
  • 软硬兼施的 GUI 专用时空剪枝技巧:充分利用计算机界面的拓扑特征(大块均质底色 + 大面积跨帧静止窗格),设计了基于并查集和动态参考余弦比对的纯参数无损剪枝算法,让 720p 密集长视频训练在常规 80GB 集群上顺畅运行。

局限与展望

  • 作者承认的局限:当前模型基于预先提取并下采样至 1 FPS 的关键帧序列,对于极高刷新率、快速连续滚屏或动画过渡中的亚秒级瞬态变化可能存在信息丢失;同时在包含超大面积复杂渲染图片或高频视频播放的网页中,STP 的空间均质假设可能退化。
  • 潜在改进方向:探索与强化学习策略联合自适应采样的机制,根据界面变动剧烈程度动态调整帧率;此外可进一步将 ExeVRM 作为密集进程奖励模型(PRM)接入 PPO/GRPO,直接在真实操作系统环境中开展大规模在线 RL 探索。

相关工作与启发

  • vs AER / Simplified Judge:AER 与 Simplified Judge 仅依靠尾帧或首尾截图进行结果验证,对中间隐藏错误或假性完成完全无能为力;ExeVRM 依托全流程视频执行流,彻底消除了静态快照评测带来的盲区。
  • vs GUI-Critic-R1 / VAGEN:此类方案强依赖智能体内部输出的动作指令、代码轨迹或文本推理链,无法评测闭源或跨框架系统;ExeVRM 坚持纯像素级外部观察,实现了对异构智能体的“零入侵”公正仲裁。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性提出面向 CUA 的纯视频执行奖励建模范式,配套对抗指令翻译与专用时空剪枝。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 大操作系统平台、800+ 规模多源基准评测,覆盖主流开源与专有大模型对比及详尽消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 结构清晰紧凑,逻辑严谨,算法定义与图表表达极其扎实。
  • 价值: ⭐⭐⭐⭐⭐ 为计算机使用智能体的自动化无监督评测与强化学习对齐提供了极具工业落地潜力的基石方案。