Self-Evolving MCP-GUI Agents via Automated Environment Generation and Experience Learning¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5852
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/13576.pdf
代码: https://github.com/Tiantian-H/EE-MCP
领域: 智能体 / 计算机使用 / 多模态工具调用
关键词: MCP-GUI 混合策略、自动环境生成、能力画像、轨迹蒸馏、经验库
一句话总结¶
本文用“评估弱点、生成可执行任务、收集轨迹、更新模型或经验”的闭环改进 MCP-GUI 混合智能体,在 Chrome 上将通过率从 60.0% 提高到 77.8%,同时发现 GUI 密集的 VS Code 更适合不微调的经验增强,而不是直接模仿专家轨迹。
研究背景与动机¶
计算机使用智能体可以看截图、点击界面,也可以通过 Model Context Protocol(MCP)调用结构化工具。两条路径各有盲区:API 能直接完成书签、导航或文件操作,却未必覆盖所有弹窗和设置;GUI 覆盖面广,却容易被坐标误差、布局变化和多步探索拖累。MCPWorld、OSWorld-MCP 已说明两者结合有价值,但给模型同时开放两种接口,并不等于它已经学会何时调用工具、何时转向键盘和鼠标。
通常的专家示范微调把正确轨迹交给学生模仿,但专家能成功执行的视觉动作不一定适合较小的学生模型。只针对整体成功率训练,也难以区分错误究竟来自工具名格式、界面定位,还是一连串工具调用之间的依赖。本文关注的是如何把这些不同弱点变成下一轮可执行的练习,以及练习所得应该写进模型参数,还是保存为推理时的策略提示。自动生成自然语言题目还不够,浏览器标签、表格内容、打开的文件都必须被真正初始化,否则无法获得可信的轨迹和评估。
因此,这里的“自进化”不是无外部监督地反复训练自己,而是依赖专家模型、LLM 裁判、工具接口和环境验证的自动化改进流程。核心 idea:用多维能力画像决定补什么任务,用环境生成保证任务可执行,再分别通过轨迹蒸馏学习动作执行方式、通过经验库学习可迁移的行动策略;采用哪种机制必须考虑应用的 MCP-GUI 构成和工具链复杂度。
方法详解¶
整体框架¶
输入是种子任务、可调用工具的基础视觉语言模型,以及能初始化桌面应用的执行环境;输出有两个:经过微调的策略和可单独使用的经验库。智能体的状态包含截图、可用 MCP 工具描述和动作历史,动作则在结构化工具调用与点击、输入、滚动、快捷键之间选择。论文将其表述为统一的混合策略决策问题,但没有额外提出一个独立训练的模态路由网络。
流程先从种子任务收集 Claude 专家轨迹,可选地进行初始微调,并建立初始经验库。随后评估当前智能体,生成能力画像;画像驱动新的任务和环境;新的专家轨迹与可用的学生成功轨迹进入改进流程;经验库再从轨迹差异中提炼规则,供下一轮使用。下图展示完整模式,经验增强模式可以跳过参数更新。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Seed["种子任务与初始策略"] --> Profile["多维能力画像"]
Profile --> Generate["任务与环境生成"]
Generate --> Distill["轨迹筛选与蒸馏"]
Distill --> Bank["经验库增强"]
Bank --> Output["更新策略与经验库"]
Output -->|下一轮评估| Profile
关键设计¶
1. 多维能力画像:把失败定位到可补练的具体能力
只知道“任务失败”不足以指导生成器。本文让 Claude Sonnet 4 读取任务目标、初始和最终截图以及完整轨迹,给出二元通过判断和连续质量分,再按五个维度汇总:模态使用、任务难度、技能类别、格式质量和执行效率。技能划分为数据读取、数据操作、搜索查询、执行自动化、导航浏览、配置设置;格式质量包括工具调用格式、解析和参数问题,效率维度跟踪步数、完成和超时等信息。这样,模型调用格式错误与不会处理困难配置任务会留下不同的画像。
缺口分析把 MCP 使用比例、各难度成功率、各技能成功率与可配置目标阈值比较,再让任务生成偏向未达标部分。Chrome 的第二轮曾发现工具使用不足,特别是 bookmark_page 和 delete_browsing_data,于是生成针对这些功能的任务。其价值是把“继续收集数据”改成“收集能暴露当前弱点的数据”。不过目标阈值并不是通用最优标准,MCP 调用越多也不必然越好;正文没有给出足以复现全部画像计算和任务采样权重的细节。
2. 任务与环境生成:把一道题变成可实际执行的初始状态
生成器根据画像产出任务后,还要让另一个生成过程为该任务编写环境设置脚本。例如,浏览器任务可能要求已有特定标签,表格任务需要先填好数据,编辑器任务则必须准备相应文件。脚本执行之后,系统检查目标应用是否到达预期初始状态;失败时把错误反馈给生成器重试。环境验证因此位于任务生成与轨迹采集之间,避免把“文件根本没准备好”误记为智能体能力不足。
通过验证的环境才成为新一轮专家示范和学生尝试的基础。这个设计把人工配置应用状态的成本纳入闭环,而不只是生成更多文本指令。应注意,正文只描述了生成、检查和失败重试的流程,具体检查器、重试上限、状态重置与隔离实现被放到补充材料;当前本地全文不含该补充材料,因此不能进一步断言其使用了哪一种验证 API 或沙箱机制。
3. 轨迹筛选与蒸馏:积累数据,但每轮从基础权重重新学习
专家 Claude Sonnet 4 在任务上运行多次,系统保留裁判分数最高的轨迹。每一步记录截图、推理文本、MCP 或 GUI 动作及其执行反馈,并转换成学生模型原生的 <tool_call> 格式。训练目标是监督学习专家的推理和动作,而不是在线强化学习奖励。对于 Chrome 一类能映射到明确工具调用的任务,这可以直接教会学生工具名、参数以及调用时机;但像素级动作是否可模仿,仍取决于学生的视觉定位能力。
数据在轮次间累积,旧成功轨迹通过回放与新轨迹混合;重要的是,每轮微调从基础模型权重重新开始,而不是沿着上一轮微调权重继续训练。这让保留下来的知识主要由累积数据承载,意在减少错误逐轮放大。论文还讨论学生自改进变体:每个任务最多尝试 3 次,只接受连续分数超过 0.5 的轨迹,再保留其中最好的一条。这是拒绝采样,用学生自己能完成的动作缓解专家与学生的能力错配,并不意味着所有失败轨迹都成为监督目标。
这里需要区分算法描述和实验结论:主算法突出专家轨迹累积,第 4.5 节与实验叙述还加入学生成功轨迹;正文没有完整列出每种实验配置中两种来源的比例。因而“加入自生成数据可能减轻分布偏移”有方法依据,但不能把某个通过率提升单独归因于拒绝采样。
4. 经验库增强:保留成功与失败之间的策略差异,而非原样塞入长轨迹
参数更新并非唯一学习载体。经验库把 Claude 和 Qwen 的成功轨迹按技能类别组织,再让 LLM 对照失败轨迹,提炼简短、可迁移的规则。正文列出四种知识:任务策略、环境知识、工具使用模式和错误恢复方法;例如先截图确认当前视图、使用可靠快捷键、遵循正确工具命名,以及某个工具只打开设置页后仍需继续 GUI 操作。规则的重点是为什么一条执行路线比另一条稳健,而不是机械复用专家的点击坐标。
为避免提示无限增长,各技能类别设有容量限制,超限时用 LLM 合并总结;同时按应用类型过滤,防止把别的应用的规则混进来。推理时只注入当前任务技能相关的经验。原文式(10)的核心关系是:
其中 \(\oplus\) 表示提示拼接,\(\mathcal{E}_{k-1}\) 是上一轮经验库,\(c_{\mathrm{task}}\) 是任务的技能类别。经验模式不需要更新模型权重,但仍需要生成、整理和读取经验的模型调用成本。正文文字列出四种知识,而形式化存储元组只列策略、环境和工具三项;本笔记保留这一区别,不推定错误恢复在实现中的独立字段。
一个完整示例¶
论文的 Chrome 打印对话框案例说明了两种学习载体的差别。原始策略先调用不存在或命名不正确的 google_chrome.print,之后反复点击;经验提炼发现,目标只是打开打印对话框,直接使用 Ctrl+P 即可。下一轮推理读到相关规则后,通过一步快捷键完成该任务。这里没有必要让学生学会某组脆弱的点击坐标,经验直接改变了选择行动路线的方式。
把该案例放回闭环,错误工具名与无效 GUI 探索会进入能力画像,新任务用于检查相关弱点,成功与失败轨迹的对比则使快捷键成为可复用规则。需要保留一个证据边界:正文把失败案例写为 17 步,但标准评估协议规定每次最多 10 步,未解释两者是否属于不同设置;因此不能把这个案例当成严格同预算的步数对照实验。
损失函数 / 训练策略¶
主学生模型为 Qwen3-VL-8B,采用 LoRA,rank 为 8,学习率为 \(2\times10^{-5}\);进化轮数 \(K\in\{1,3\}\)。服务端使用 vLLM、张量并行度 1、fp16、温度 0.2。每任务最多 3 次尝试,学生轨迹接受阈值为 0.5;二元通过判断由裁判独立给出,不能把连续分数阈值当成通过率定义。
SFT 以累积轨迹为训练数据,最大化给定任务与状态历史时推理和动作的条件似然。缓存中的原文式(3)至式(5)存在符号抽取缺损,因此这里只说明可确认的训练语义,不把补写的条件项当成原式。原文报告训练池由 44 增至 79 条样本,但正文没有完整披露训练轮数、批大小、LoRA 插入层、各来源数据占比及教师调用总成本。
实验关键数据¶
主实验¶
实验覆盖 Chrome 45 个任务、VS Code 30 个任务、LibreOffice Calc 45 个任务,共 120 个种子任务;分别开放 11、9、16 个 MCP 工具,共 36 个。每次任务预算为 10 步,截图分辨率为 \(1024\times768\)。Pass Rate 是裁判的二元成功比例,LLM Score 是 \([0,1]\) 范围的完成质量,MCP Ratio 是 MCP 动作占总动作的比例;以下提升均为百分点。
下表来自原文表 6,三列都使用 Qwen3-VL-8B。它比单报 Chrome 最佳值更能体现论文的主要结论。
| 策略 | Chrome 通过率(%) | VS Code 通过率(%) | Calc 通过率(%) |
|---|---|---|---|
| 基线 | 60.0 | 53.3 | 44.4 |
| 仅经验库增强 | 62.2 | 63.3 | 46.7 |
| 蒸馏 + 经验库 | 77.8 | 43.3 | 42.2 |
Chrome 的蒸馏加经验比基线提高 17.8 个百分点,但 VS Code 反而下降 10.0 个百分点。经验库在三种应用上分别提高 2.2、10.0、2.3 个百分点,提示策略迁移比动作模仿更适合某些应用。Calc 基线 MCP 使用率已有 61.5%,SFT 后降至 47.8%;所以高工具使用比例并不保证专家蒸馏有效,多步工具组合的难度仍然重要。
消融实验¶
原文表 4 在 Chrome 的同一 45 任务协议下比较动作空间与同行模型。这里把模态消融同完整方法区分开,避免把开放更多工具与学习机制的收益混为一谈。
| 配置 / 方法 | 通过率(%) | 成功任务数 |
|---|---|---|
| 混合,蒸馏 + 经验库 | 77.8 | 35/45 |
| 混合,未进化基线 | 60.0 | 27/45 |
| 仅 MCP 消融 | 51.1 | 23/45 |
| 仅 GUI 消融 | 48.9 | 22/45 |
| UI-TARS-1.5-7B | 24.4 | 11/45 |
| Aguvis-7B-720p | 15.6 | 7/45 |
混合基线比仅 MCP 高 8.9 个百分点,比仅 GUI 高 11.1 个百分点,支持动作通道互补。完整方法再比混合基线高 17.8 个百分点,但由于没有单列“只蒸馏、不加经验”的行,这个差值不是蒸馏的完全独立因果效应。正文也未提供移除能力画像、环境验证或经验容量限制的数值消融。
关键发现¶
原文表 7 另构造三套各 12 个任务的 Chrome 留出设计,覆盖相同工具,但更换网站、导航路径和目标,且不参与进化。其结果如下,均值与标准差沿用原文报告。
| 方法 | HO-1 | HO-2 | HO-3 | 平均通过率 ± 标准差(%) |
|---|---|---|---|---|
| Hybrid | 8/12 | 7/12 | 9/12 | 66.7 ± 8.3 |
| MCP-only | 7/12 | 5/12 | 7/12 | 52.8 ± 9.6 |
| GUI-only | 4/12 | 5/12 | 7/12 | 44.4 ± 12.7 |
| Aguvis-7B-720p | 4/12 | 1/12 | 3/12 | 22.2 ± 12.7 |
| UI-TARS-1.5-7B | 2/12 | 2/12 | 3/12 | 19.4 ± 4.8 |
- 混合方法在三套留出设计中均领先,但 MCP-only 与 GUI-only 在 HO-2 和 HO-3 持平;后两者的均值加减标准差区间也重叠。原文“所有相邻方法区间不重叠”的文字结论不受该表支持,标准差本身也不是显著性检验。
- Chrome 蒸馏加经验的最佳通过率 77.8% 出现在第 1 轮;仅经验模式的最佳值 64.4% 出现在第 2 轮。第 3 轮报告的 MCP 比例 55.8% 与动作数 243→163,不能与第 1 轮峰值拼成一个同时达成的结果。
- Chrome 第 1 轮完整方法的 MCP 比例从 43.7% 降到 36.3%,通过率却上升,进一步说明目标是正确切换行动方式,而非最大化工具调用占比。
- Qwen2.5-VL-7B 基线通过率为 48.9%,经验增强反而下降 8.9 个百分点;其 MCP 比例为 6.6%,低于 Qwen3 的 43.7%。这支持基础工具能力是重要前提,但两模型存在多种差异,不能将其视为原生调用格式的单变量消融。
亮点与洞察¶
- 把“怎么执行”和“选哪条路线”分开改进。 参数学习能够纠正工具调用行为,经验规则则能直接提示更可靠的路线;同一套蒸馏在不同应用上的反向收益,使这种区分具有实际部署价值。
- 环境初始状态也是训练数据的一部分。 自动出题只有配套可验证环境才真正扩展交互数据;这一设计可迁移到依赖文件、数据库或应用状态的其他工具智能体。
- 压缩策略比复用坐标更容易迁移。 快捷键和工具链规则保留行为目的,舍弃界面位置偶然性;不过容量控制和应用过滤目前主要有设计说明,缺少独立量化验证。
局限与展望¶
- 作者承认的能力前提。 自动流程依赖具备原生工具调用能力的基础模型,经验并不能凭空补出缺失的动作能力;未来可以结合过程奖励或改进 GUI 蒸馏,但本文没有验证这些方案。
- 小规模且主要衡量固定任务池进化。 主实验只有 120 个任务,并反复利用种子任务画像指导进化;它反映目标任务池上的适应,不等于广泛桌面泛化。留出评估只在 Chrome 上、沿用相同工具覆盖,尚未验证新应用或新工具。
- 教师和裁判共享模型。 Claude Sonnet 4 同时示范与评估,可能存在风格或判断偏差。重复裁判的一致率为 93%,衡量的是稳定性,不是与人类或程序化完成检查的一致性。
- 自动化与开销披露不足。 缓存没有正文引用的补充材料,环境验证实现、经验容量数值、独立拒绝采样收益与端到端成本无法核实;“无需微调”不应表述成“无需计算”。
- 报告口径需谨慎。 留出表的严格排序说法、17 步失败案例与 10 步预算,以及不同轮次最佳指标混用,均限制了强结论;正文效率指标的完整定义也未给出,因此本笔记不将其作为可复现的核心比较。
相关工作与启发¶
- 与 MCPWorld / OSWorld-MCP 相比: 后者主要测量 API、GUI 和混合交互的能力边界,本文进一步把能力画像用于自动补练。它提供改进流程,但尚未给出跨大规模既有基准的全面收益。
- 与 Agent Workflow Memory 相比: 两者都复用历史经验,本文强调按技能组织成功与失败的对比规则,并加入应用过滤、容量合并以及自动环境生成闭环;并不是首次提出智能体记忆。
- 与 STaR / Self-Instruct / ReST 相比: 本文把自举、合成任务和成功样本筛选带入有状态桌面交互,新增的难点是保证环境可执行,而不只是让文本输出看起来合理。
- 与 DigiRL 相比: 本文主要使用离线 SFT 和推理时提示增强,不是以在线强化学习直接优化环境回报。可借鉴的方向是根据错误类型选学习载体,但自动选择最优机制的可靠性仍需单独实验。
评分¶
- 新颖性: 4/5。自动环境生成、画像驱动补练与经验学习的组合有系统价值,但多数单独组件已有相关路线。
- 实验充分度: 3/5。跨应用、模态消融和留出任务覆盖关键问题,但规模小,机制独立消融与成本统计不足。
- 写作质量: 3/5。中心观点明确,负结果有帮助;部分统计结论、步数协议及组件形式化表达不够一致。
- 价值: 4/5。对混合工具智能体提供了有用的部署经验,尤其提醒开发者不要把专家蒸馏视为普遍有效的升级方式。