跳转至

GameWorlds: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents

会议: ECCV 2026
论文: ECCV 原文
项目: https://gameworld-project.github.io/
领域: 机器人 / 具身智能
关键词: 游戏智能体 / 多模态大模型 / 计算机操作智能体 / 可验证评测 / 具身决策

一句话总结

GameWorld 提出了首个面向多模态游戏智能体的标准化、可验证基准,涵盖 34 款浏览器游戏与 170 项任务,通过解耦推理延迟的沙盒环境、双接口动作统一协议以及基于内部游戏状态的确定性评测,系统揭示了前沿大模型与人类玩家在闭环交互上的巨大差距。

研究背景与动机

视频游戏集成了高频视觉感知、层级化战略规划、精细动作时序以及长程闭环交互,构成了评测多模态大模型(MLLM)迈向通用具身决策的理想试验场。相比于静态视觉问答或单轮工具调用,游戏环境要求智能体在持续演化的动态画面中迅速理解状态、承担具有不可逆后果的操作决策,并在数十至数百步的长程探索中持续容错。然而,传统游戏评测通常依赖笨重庞大的专用引擎或模拟器,部署门槛高且难以兼顾环境多样性;而轻量且玩法丰富的浏览器游戏,则为构建大规模、易重置的评测基准提供了极具吸引力的替代路径。

尽管已有部分工作探索了交互式基准构建,但现有评估框架仍深陷三大瓶颈:第一是接口碎片化与抽象层级割裂。不同大模型生态的工具调用协议各异,且现有智能体在操作抽象层级上分化严重——部分模型直接输出底层键鼠坐标与按键(Computer-Use Agents),另一些模型则依赖预设的高级语义工具(Generalist Agents),使得跨模型的统一对比缺乏可控的基准面。第二是物理时钟与推理延迟的混淆。在实时游戏中,大模型的推理耗时直接改变了游戏物理世界的状态,导致模型的思维时间与纯粹的策略水平相互交缠,无法剥离单项能力的瓶颈。第三是评测信号的感知噪声与启发式偏差。绝大多数现有基准严重依赖 OCR 识别、像素级启发式匹配或引入 VLM-as-judge,引入了大量感知误判与不稳定性,评测结果既难以复现也无法严格定责。

为了破除上述限制,评估基础设施本身必须作为核心设计目标。本文的核心 idea 是:构建一套标准化且可验证的浏览器游戏评测基准 GameWorld,通过执行时冻结时钟的沙盒彻底解耦推理延迟,设计兼顾底层原生操作与语义解析的双接口统一控制协议,并借助注入式 JavaScript Bridge 直接读取内部游戏状态,实现完全确定性、零感知噪声的结果级客观评测。

方法详解

整体框架

GameWorld 建立了一个包含四大核心模块的闭环交互评测基础设施:(i) 多模态游戏智能体接口规范,同时支持底层计算机操作与顶层语义操作;(ii) 浏览器沙盒运行环境,提供推理期间物理时钟暂停与确定性随机种子管理;(iii) 结构化游戏与任务库,涵盖 5 大游戏流派的 34 款游戏与 170 项明确目标指令;(iv) 基于内部状态的可验证结果评测器,通过注入式 Bridge 提取内部底层状态计算确定性客观得分。

整个系统运行于严格的“截屏观察 \(\to\) 状态门控 \(\to\) 模型推理 \(\to\) 动作归一化执行 \(\to\) 状态捕获与进度核验”循环中,整体流程如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["游戏环境画面截图"] --> B["双接口动作归一化与解析"]
    B --> C["物理时钟冻结沙盒执行"]
    C --> D["JS Bridge 内部状态提取与评测"]
    D --> E["五级渐进式认知难度体系诊断"]

关键设计

1. 双接口动作归一化与确定性语义动作解析:拉齐异构模型的控制空间

针对各模型家族工具调用格式不一、抽象粒度迥异的痛点,GameWorld 形式化定义了两种异构控制接口,并将其映射到统一的底层人机交互执行空间: - 计算机操作智能体(Computer-Use Agents, CUAs):直接输出底层原子级键鼠指令,如 mouse_move(x, y)left_click(x, y)press_key(key)press_keys(key1, key2),智能体必须独自承担视觉坐标接地与精确按键时序的全部认知负荷。 - 通用多模态智能体(Generalist Multimodal Agents):在高级语义动作空间中运作(如 move_right()jump()weapon_fire())。为了接入统一环境执行器,系统引入了确定性语义动作解析器(Deterministic Semantic Action Parsing),为每款游戏硬编码一套固定的语义动作到底层按键的绑定关系,消除解析阶段的不确定性。

为了消除多动作堆叠带来的不确定性,框架在执行器层对两类接口实施严格的“单步单动作”(One-Action-per-Step Constraint)约束与动作原子性检测,超出合法控制列表的操作会被直接拦截。

2. 物理时钟冻结沙盒执行与状态就绪门控:解耦推理延迟与决策能力

在实时动态游戏中,模型推理的耗时(通常在 2 到 15 秒不等)若直接作用于游戏进程,角色将在模型“思考”期间遭遇不可逆的死亡,使评测退化为单纯的 API 响应延迟测试。 为此,GameWorld 设计了无缝的时钟控制机制:在智能体捕获当前帧截图并进入大模型推理时,沙盒主动暂停(Pause)游戏的物理演算与时钟推进;待模型返回可执行动作后,沙盒恢复游戏并持续执行预设时间(通常每步 200–500 ms)。这种暂停式评测协议(Paused Evaluation Protocol)确保了不同吞吐效率的模型面对完全同质的动态环境,彻底将决策推理质量从网络及硬件推理耗时中剥离。同时,沙盒内置了状态就绪门控(Readiness Gate),在环境初次启动或重置后,自动检测内部状态直至瞬态加载或菜单界面结束,确保模型决策起点绝对处于可操作状态;并提供确定性随机种子配置以保障实验的完全可复现性。

3. 基于 JS Bridge 内部状态的确定性客观评测与失败重置:杜绝感知噪声

现有基准借助 OCR 识别屏幕分数或让 VLM 评判进度,极易受到游戏视觉特效、动态遮挡及字体样式干扰。GameWorld 彻底摈弃像素级启发式估计,在浏览器运行时注入结构化 JavaScript Bridge,直接暴露底层序列化的 gameAPI 内部状态字典(包含玩家坐标、存活状态、当前得分、金币收集数、检查点索引等,全基准共接入 233 个关键状态字段,每款游戏平均 6.85 个)。 评测器依据内部真实状态字段量化两大互补指标:任务成功率(Success Rate, SR)与归一化任务进度(Progress, PG)。设第 \(i\) 次运行中,初始分数为 \(b_i\),目标分数为 \(\tau_i\),运行过程中观测到的最大分数为 \(q_i^{\max} = \max_t q_{i,t}\),则任务进度定义为: $\(\mathrm{progress}_i = \mathrm{clip}_{[0,1]}\!\left(\frac{q_i^{\max} - b_i}{\tau_i - b_i}\right)\)$ 此外,为了防止长程评测中因单次操作失误(如不慎跌落)而使有价值的探索直接清零,框架设计了失败重置机制(Reset-on-Fail):角色死亡后自动重置局部状态,但在设定的单任务预算(最多 100 步动作)内允许持续探索,并保留历史达到的全局最佳进度。

4. 能力对齐的五级渐进式认知难度体系:全景归因智能体缺陷

为了深入探究模型在不同感知与决策维度的具体短板,GameWorld 将评测任务自底向上划分为五级渐进能力课程: - Level-1(基础控制与时序接地):低战略负荷下的精准按键与时机把握(如 Breakout、Core-ball、Stack)。 - Level-2(系统一反应式控制):连续动态世界下的毫秒级高频避障与即时反射(如 Chrome-dino、Flappy-bird、Run-3)。 - Level-3(系统二空间导航):结构化二维/三维地形中的几何感知、路径规划与危险规避(如 Mario-game、Pacman、World's Hardest Game 2)。 - Level-4(符号推理与长期策略):离散状态空间中的逻辑规则推演与深远后效推断(如 2048、Minesweeper、Wordle)。 - Level-5(开放世界协调与管理):高维多目标任务下的资源调配、多角色协作与策略稳定性(如 Minecraft Clone、Monkey Mart)。

一个完整示例:以马里奥(Mario-Game)关卡金币与问号块交互为例

在包含问号砖块与酷霸王士兵(Goomba)的场景中,任务目标为击打悬空砖块获得金币并保持存活: 1. 环境准备与状态门控:沙盒启动 Mario 游戏,状态就绪门控确认 game_state.alive == true 且关卡加载完毕。 2. 观察截屏与时钟暂停:沙盒向智能体发送当前帧截图,同时冻结游戏内部时钟。 3. 接口差异化输出: - CUA 接口:模型识别到右上方的砖块与地面的威胁,在思考后输出原子控制 press_keys(keys=['ArrowUp', 'ArrowRight'])。 - Generalist 接口:模型生成高层语义动作 jump_right(),由确定性语义解析器无损映射为底层事件 press_keys(keys=['ArrowUp', 'ArrowRight'], duration=0.25)。 4. 沙盒执行与状态捕获:游戏解冻并运行 250 ms,马里奥腾空击中砖块,随后沙盒再次暂停。 5. 内部状态验证:JS Bridge 捕获到内部状态变更:game_state.score 由 400 跃升至 1400,game_state.player.x 从 453.09 变为 480.78。评测器自动计算当前步任务进度 \(\mathrm{progress} = 1.00\),且无须任何 OCR 介入即判定子目标达成。

实验关键数据

主实验:18 个模型-接口组合在 5 大流派上的评测全景

GameWorld 评测了包含 13 个主流基座模型的 18 个配置(8 个 CUA 与 10 个 Generalist),并在人类玩家(新手与专家)基准下对比。所有智能体均在相同的暂停式协议和 100 步动作预算下运行。

模型 / 评估对象 接口类型 Arcade (SR / PG) Platformer (SR / PG) Puzzle (SR / PG) Runner (SR / PG) Simulation (SR / PG) 总体 SR (%) 总体 PG (%) 总体排名
新手玩家 (Novice Player) 人类 45.7 / 55.5 60.0 / 65.6 51.4 / 63.1 60.0 / 72.0 60.0 / 62.0 55.3 64.1
专家玩家 (Expert Player) 人类 65.7 / 73.9 85.0 / 88.0 68.6 / 77.1 82.5 / 87.8 85.0 / 86.0 77.1 82.6
Gemini-3-Flash-Preview Generalist 5.7 / 26.3 25.0 / 41.2 25.7 / 54.8 32.5 / 55.4 10.0 / 21.1 21.2 41.9 1
GPT-5.2 Generalist 8.6 / 29.3 22.5 / 36.7 28.6 / 56.2 27.5 / 52.6 10.0 / 16.9 20.6 40.6 2
Seed-1.8 CUA 8.6 / 31.1 25.0 / 40.3 25.7 / 52.0 27.5 / 50.6 5.0 / 11.0 20.0 39.8 3
Claude-Sonnet-4.6 Generalist 5.7 / 28.3 22.5 / 37.0 25.7 / 51.5 30.0 / 51.9 15.0 / 16.6 20.6 39.3 4
Seed-1.8 Generalist 11.4 / 33.5 22.5 / 34.6 22.9 / 48.7 27.5 / 51.2 10.0 / 18.8 20.0 39.0 5
Claude-Sonnet-4.6 CUA 8.6 / 27.2 22.5 / 36.5 20.0 / 43.8 30.0 / 55.6 10.0 / 16.8 19.4 38.3 6
Kimi-K2.5 Generalist 8.6 / 26.4 20.0 / 35.3 25.7 / 51.4 27.5 / 49.7 5.0 / 11.7 18.8 37.4 7
Gemini-2.5-Computer-Use CUA 5.7 / 28.0 20.0 / 35.8 11.4 / 32.2 30.0 / 55.4 10.0 / 19.3 16.5 36.1 8
Grok-4.1-Fast-Reasoning Generalist 8.6 / 23.7 22.5 / 37.3 14.3 / 46.6 25.0 / 49.0 5.0 / 10.4 16.5 36.0 9
OpenAI-Computer-Use CUA 5.7 / 24.7 17.5 / 31.3 20.0 / 45.8 27.5 / 53.0 5.0 / 12.0 16.5 35.8 10
Qwen3-VL-Plus Generalist 8.6 / 25.6 22.5 / 37.8 14.3 / 39.1 27.5 / 51.1 0.0 / 10.0 16.5 35.4 11
Qwen3-VL-Plus CUA 5.7 / 23.5 20.0 / 34.6 14.3 / 35.6 27.5 / 51.0 5.0 / 10.7 15.9 33.6 12
Qwen3-VL-235B-A22B CUA 5.7 / 23.2 22.5 / 35.2 8.6 / 29.7 25.0 / 51.0 0.0 / 1.7 14.1 31.4 13
UI-TARS-1.5-7B CUA 5.7 / 31.4 15.0 / 24.4 5.7 / 29.9 27.5 / 52.4 0.0 / 3.8 12.4 31.1 14
Qwen3-VL-235B-A22B Generalist 5.7 / 23.2 17.5 / 29.5 8.6 / 33.3 27.5 / 50.4 0.0 / 3.6 13.5 30.8 15
GLM-4.6V Generalist 8.6 / 22.8 20.0 / 33.9 5.7 / 29.1 27.5 / 49.1 0.0 / 5.3 14.1 30.8 16
Qwen3-VL-30B-A3B CUA 8.6 / 26.8 20.0 / 31.9 2.9 / 27.6 25.0 / 50.3 0.0 / 2.2 12.9 30.8 17
Qwen3-VL-30B-A3B Generalist 2.9 / 20.3 20.0 / 36.5 2.9 / 26.1 27.5 / 51.1 0.0 / 3.5 12.4 30.6 18

消融与诊断实验:实时交互延迟与上下文记忆轮次敏感性

为了探究延迟耦合与交互历史对智能体的影响,作者设计了未暂停的实时环境(GameWorld-RT)以及不同记忆轮次的消融实验。

表 1:实时未暂停环境(GameWorld-RT)下模型的反应延迟与表现 | 模型 | 接口类型 | 单步实时延迟 (s/step) | 任务成功率 SR (%) | 任务进度 PG (%) | |---|---|---|---|---| | Qwen3-VL-235B-A22B | CUA | 6.2 | 17.1 | 33.2 | | Qwen3-VL-30B-A3B | CUA | 2.4 | 15.6 | 33.0 | | Qwen3-VL-235B-A22B | Generalist | 6.4 | 16.8 | 34.0 | | Qwen3-VL-30B-A3B | Generalist | 3.4 | 15.6 | 32.9 |

表 2:交互上下文记忆轮次对推理开销与进度的影响(Qwen3-VL-235B-A22B) | 记忆轮次 (Round) | 模型接口 | 平均输入 Token 数 | 单步推理延迟 (s/step) | 总体进度 PG (%) | |---|---|---|---|---| | 0 | Generalist | 1,278 | 5.5 | 30.0 | | 0 | CUA | 1,891 | 7.2 | 30.3 | | 1 | Generalist | 2,171 | 6.8 | 30.1 | | 1 | CUA | 3,771 | 10.1 | 29.0 | | 2 | Generalist | 3,052 | 8.6 | 30.6 | | 2 | CUA | 5,627 | 12.8 | 28.7 |

关键发现

  • 大模型远未达到人类基准:当前最佳模型(Gemini-3-Flash-Preview 与 GPT-5.2)的总体成功率仅略超 20%,进度在 40% 左右;即使对比未经练习的人类新手(SR 55.3%, PG 64.1%),仍存在超过 34 个百分点的巨大成功率代差,离人类专家(SR 77.1%)更为遥远。
  • 不同游戏流派呈现显著认知极化:跑酷类(Runner)在反应式控制下整体表现最佳(多款模型 PG 突破 50%),而仿真模拟类(Simulation,如 Minecraft Clone、Monkey Mart)因涉及复杂的空间多目标与长程资源管理,所有大模型几近溃败(成功率骤降至 0%–15%,开源小模型几乎无法取得有效进度)。
  • 长程轨迹记忆具有接口双刃剑效应:对于高层语义 Generalist,增加历史轮次能带来微弱的决策增益(PG 从 30.0% 提升至 30.6%);但对于 CUA 接口,增加历史记忆反而导致性能持续下滑(PG 从 30.3% 跌至 28.7%),原因在于长串的底层键鼠坐标序列急剧放大了上下文冗余,混淆了模型的时空推理。
  • 动作有效性与指令遵循分析:通过对无效动作率(Invalid Action Rate, IAR)细分为无工具调用(NTC)和超出动作空间(OOS)的统计,绝大多数前沿专有模型保持在 0% IAR,但部分开源模型在长程交互多轮上下文后暴露出高格式漂移(如 GLM-4.6V 的 IAR 达 8.3%,UI-TARS 产生 0.4% 的 OOS 越界),说明长程决策中的鲁棒指令遵循仍是关键挑战。

亮点与洞察

  • 解耦物理时钟的沙盒架构:通过在推理期冻结游戏引擎并在执行期精确恢复,排除了各模型因部署算力与生成速度不同导致的延迟干扰,确保了评测的纯粹性与可比性。
  • 注入式 Bridge 的无噪声客观真值:直接从游戏底层序列化内存中读取 233 个量化状态字段,规避了视觉大模型“裁判”自身常有的幻觉与 OCR 漏识,树立了游戏智能体评测的真值规范。
  • 双接口归一化执行协议:巧妙地将底层原生 Computer-Use 与高级语义动作统一映射到统一的人机交互原子事件上,为不同架构模型的公平横向对比提供了切实范例。

局限与展望

  • 作者承认的局限:目前为新游戏扩展环境时,仍需要为每款游戏单独配置任务描述、内部状态读取规则以及对应的确定性动作映射,人工接入成本较高,限制了游戏库的无缝横向扩展。未来计划探索利用 MLLM 智能体自主探索以自动化构建语义动作映射。
  • 自身发现的局限:动作执行时间目前采用经验性的固定时限(200–500 ms),然而在不同物理引擎的游戏中,按键持续时间对跳跃高度或转弯半径具有高度敏感性,固定的时序离散化可能削弱了部分需要极细微微操的任务上限。
  • 改进思路:可以引入自适应时钟步长机制,允许智能体显式输出持续时间(duration)参数并在沙盒中闭环仿真;同时可构建自动化的游戏逆向工程流水线,自动化嗅探游戏内部变量。

相关工作与启发

  • vs OSWorld / WebArena: OSWorld 与 WebArena 开创了真实系统级计算机操作的客观评测范式,但主要面向静态或低速的操作系统与网页办公任务;GameWorld 将其延伸至强实时性、高动态物理演化的游戏领域,并解决了时序延迟混淆与内部状态量化难题。
  • vs BALROG / LMGame-Bench / VideoGameBench: 现有游戏评测或侧重于文本描述与简化环境(如 LMGame-Bench、BALROG),或严重依赖 OCR/VLM-as-judge 的启发式判分(如 VideoGameBench);GameWorld 则是首个完全基于真实多模态视觉输入与底层状态客观验证(State-verifiable Oracle)的大规模双接口基准。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次建立解耦延迟、双接口统一且状态可验证的大规模多模态游戏基准。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 34 款游戏、170 项任务、18 个模型-接口组合,兼顾人类对照、实时延迟与记忆轮次全景剖析。
  • 写作质量: ⭐⭐⭐⭐⭐ 框架设计严整清晰,概念界定精准,评测流程自洽且无感知漏洞。
  • 价值: ⭐⭐⭐⭐⭐ 为通用多模态智能体向具身决策与计算机操作领域的演进奠定了坚实的基础评测设施。