Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain¶
会议: ECCV2026
论文: ECCV 原文
项目: https://robo-bench.github.io
领域: 多模态 VLM / 机器人/具身智能
关键词: 具身认知、长时程规划、可供性预测、失败分析、世界模拟裁判
一句话总结¶
RoboBench 用覆盖五类具身认知的 6092 道问答和基于动作依赖图的 MLLM 世界模拟裁判评估 18 个模型,发现较强的通用问答与规划表述能力仍不能保证隐式需求理解、空间落地和真实执行错误诊断。
研究背景与动机¶
机器人把物体放进抽屉,不只是把末端执行器移到某个坐标。 它还要理解用户究竟要收纳什么,辨认抽屉是否关闭,安排先打开再放入的次序,并在抓取失败后重新判断下一步。 双系统具身架构把这些较慢的推理和决策交给 System 2,把高频控制交给 System 1。 论文把前者称为“具身大脑”,研究的是多模态大语言模型(MLLM)是否具备承担这一角色的认知能力,而不是提出新的控制策略。 只统计整项操作是否成功,会把感知、规划与控制误差混在一起,因此不能直接告诉研究者应当补哪一种能力。
现有具身问答让认知能力变得可测,但不同基准往往分别关注环境理解、下一步预测或失败解释。 人的第一视角视频与机器人数据也不等价:机器人自身的手臂构型、相机视角和可执行技能会改变合理答案。 在规划评估中,文本相似度尤其容易产生错判,因为两条措辞不同或顺序不同的计划可能同样可执行。 反过来,计划即使包含了参考答案中的关键词,也可能跳过打开抽屉这一必要前提。 RoboBench 因而同时扩展能力覆盖、真实场景复杂度与规划评分机制,而不是仅增加问答数量。
这种设计的可行性来自已有的大规模机器人视频,以及 MLLM 辅助结构化标注后再由人工复核的流程。 数据覆盖不同机器人形态、物体属性、多视角遮挡与需要记忆的导航,使问题不只依赖常识补全。 不过,基准本身仍然主要在离线输入上评估回答,必须与闭环机器人部署区分。 核心 idea:沿操作流程拆开“理解意图、感知场景、制定计划、给出空间线索、诊断失败”,并用动作依赖和物体状态变化检验开放式计划,而非仅比较语言表面。
方法详解¶
整体框架¶
RoboBench 是评测数据与评分协议,不是一个需要训练的新网络。 输入随任务变化,包括场景图像、机器人视频观测、指令、候选选项或当前子任务状态。 被测模型输出选择题答案、结构化动作序列、下一步动作,或子任务完成与否。 评测端再依据任务类型使用准确率、动作成分评分或世界模拟评分,而不是把所有输出交给同一种自由文本裁判。 其五个维度分别是指令理解、感知推理、泛化规划、可供性预测和失败分析,共细分为 14 种能力、25 个任务。 这些维度对应同一操作链中的认知职责,但数据集并不要求一个模型在同一条真实机器人轨迹上端到端完成全部环节。
表 2(第 8 页)区分了 4336 个独立条目与 6092 道问题,不能把问题数当成独立场景数。 其中感知、可供性和失败分析的选择题为 1895 道,Q1、Q2、Q3 分别为 1973、842、1192 道,另列导航问题 190 道。 Q1 平均包含 6.75 个步骤,具有 1403 条不同任务指令和 1462 个不同答案。 这些统计说明评测包含多步依赖,但不能单凭平均步数推断每个样本都很长或很难。 理解协议可归纳为四个相互关联的设计:能力拆解与配对问题、真实数据与人工质控、依赖图世界模拟、分任务评分与下游验证。
关键设计¶
1. 能力拆解与配对问题:区分意图推断、视觉理解和动作落地
指令理解采用显式与隐式配对:保持图像和目标答案不变,只改变用户的表达方式。 显式指令直接说明动作与对象;隐式指令由 MLLM 结合场景和明确目标生成,再由人工检查自然性与可推断性。 这样,“知道该怎么执行”与“能否从间接需求识别目标”就可以在相近条件下对照,而不是比较两个完全不同的任务集。 感知推理又拆成机器人中心、物体中心、场景中心和任务中心四类,分别检验构型与视角、静态与功能属性、时空关系与因果、指令相关对象。 其中任务中心问题通过人工标出的目标框把长指令与图中对象关联起来,降低仅凭语言猜测目标的空间。 这些感知问题最终标准化为选择题,所以测得的是候选条件下的辨认能力,而非自由定位精度。
泛化规划考察跨机器人形态、跨物体、跨视角和跨任务,特别包含多视角遮挡与基于视频空间记忆的导航。 可供性(affordance)指一个子目标应如何落实为空间交互线索:静态可供性是接触点,动态可供性是运动轨迹,导航可供性是机器人底座位置。 论文从规划数据池抽取代表性帧并标注这些线索,再让模型从场景相关候选中选择,而不是直接输出连续控制命令。 失败分析进一步区分低层执行错误与高层规划错误,避免把夹爪偏位和遗漏操作步骤视为同一种问题。 这样的拆解可以定位模型短板,但选择正确接触点并不证明它能生成足够精确的轨迹,也不证明低层执行器能可靠执行。
2. 真实数据与人工质控:让问题保留机器人操作的约束
规划数据池来自公开机器人视频与内部采集,Gemini 先生成任务概要、带时间戳的步骤,以及物体、动作、场景和机器人形态元数据。
人工随后修订这些标注,并将动作映射为统一技能模板,例如 pick_up(object) 与 move_to(object, target)。
这种中间表示把自然语言计划变成可以逐项检查的技能、对象与参数组合;操作技能和导航技能分别组织。
感知标注则因任务而异:机器人类型和视角使用元数据,物体功能属性与干扰项使用模型辅助生成,空间关系和关键点变化使用人工标注。
视频步骤分段辅助时间定位,目标框辅助指令指代,两者都需要保持与视觉证据的对应。
因此,模型参与的是标注工作,不能据此把数据视为未经人工核验的自动问答集。
低层失败来自 RoboMIND 的真实 VLA 执行轨迹,由专家标记位置偏差、轨迹偏差、夹爪错误和未完成动作等问题。 高层规划失败则因真实样本稀少,按 REFLECT 风格向正确计划注入错对象、漏步骤、错顺序或错条件,并由人工确认错误可辨且与任务有关。 这两类失败的来源不同,是解释难度差异时必须保留的条件,而非无关的数据处理细节。 质量控制先过滤图像质量、任务有效性与形态不匹配,再检查语言清晰度、可回答性和答案正确性。 每项 MLLM 辅助标注至少经过一次人工交叉复核;论文报告验证子集的残余分歧低于 4%,但这不等于全量标签错误率。 所有被测模型都答对的条目会被移除,全部答错的条目会人工复查,因此最终难度也受到参与筛选的模型集合影响。
3. 依赖图世界模拟:按前提和状态变化评估长计划
Q1 要求模型从第一帧预测完整动作序列;评分端持有首帧图像、参考动作列表与人工标注的有向无环图(DAG)。 DAG 的节点是原子动作,边规定前置关系;这允许不违反依赖的有效重排,而不是强制只有一种答案顺序。 被测模型生成的是计划,DAG 和参考答案用于裁判评分,不应误读成模型在推理时直接获得答案。 NodeCorrectness 通过一对一匹配检查预测动作与参考动作的技能、对象、参数是否一致,并以参考节点覆盖情况评分。 它检查“必要动作有没有出现”,但仅有正确节点集合仍然无法保证这些动作能够按照给定顺序执行。 因此,第二个分量 TaskCompletion 检查计划是否能实现关键物体状态变化,而不是再次统计文字匹配。
裁判先从首帧分析物体、相对关系与物理约束,形成初始世界状态,例如抽屉关闭、苹果在桌面上。 它再从参考动作和 DAG 提取关键状态里程碑,并建立各状态的依赖、允许的并行关系和因果联系。 随后逐步模拟预测动作:检查当前世界是否满足前提,更新状态,并记录哪些里程碑已达成。 状态不仅要曾经为真,还要保持有效直到最后一个依赖它的动作使用完毕,才能计入受保护的已达成状态。 例如,需要保持抽屉打开直到放入操作完成,不能因为计划里曾出现打开动作,就忽略中途提前关闭造成的不可执行性。 这里的“世界模拟”是 MLLM 对符号状态与视觉约束的推演,并不是物理引擎执行,也不是生成视频后验证真实动力学。
长计划得分结合节点正确性与任务完成情况,表中的 Q1 数字采用百分制展示。 第 9–10 页的文本提取损坏了节点评分、任务完成评分及最终合成公式,缺失了部分运算符或尺度信息。 因此这里保留可辨认的定义与操作流程,不把猜测补成作者的精确公式;实现复现仍需核对原版公式。 这种裁判比自由文本打分更受约束,但仍可能错误识别首帧状态,或把语言上可行的动作误当成物理可行。
4. 分任务评分与下游验证:不混淆规划、判别和控制
Q2 给定当前观测并预测下一动作,裁判分别考察技能、对象和参数,而不是要求完整长计划。 技能匹配是二值判断;对象与参数依据视觉合理性取 0、0.5 或 1 分。 第 10 页可辨认的评分定义为:
Q3 判断子任务是否已经完成,使用与标注状态比较的二分类准确率。 感知、可供性和失败分析也采用准确率,但它们是不同问题集合上的选择题,不应与 Q1、Q2 的部分得分直接作难度比较。 主基准通过运行已有模型获得答案,没有提出统一的新损失函数或在该数据上训练一个新模型。 另外,作者遵循 VLM4VLA,以最小化微调将若干开源 VLM 转为 VLA 策略,再在 CALVIN 和 LIBERO-10 上测操作表现。 这部分才涉及策略训练,用来检验认知分数是否与下游能力相关,而非把问答分数当作执行成功率。 裁判稳定性也单独检查:200 个分层 Q1 样本、四个供应商裁判和三种提示变体上的 NodeCorrectness 为 ICC(2,k)=0.948。 该结果支持所测节点评分的稳定性,但不能自动推广为所有任务、全部状态模拟和所有模型均无偏差。
实验关键数据¶
主实验¶
以下为表 3(第 11 页)、表 4(第 12 页)、表 6(第 13 页)的代表性结果,均保留原表 Avg 数字。 感知、可供性与失败分析是准确率(%);泛化规划是 Q1 得分(百分制),不是机器人执行成功率。
| 模型 | 感知推理 Avg | 泛化规划 Q1 Avg | 可供性 Avg | 失败分析 Avg |
|---|---|---|---|---|
| Human Evaluation | 74.30 | 54.50 | 82.63 | 63.99 |
| GPT-5.4-text-only | 27.12 | 73.74 | 25.61 | 22.28 |
| Claude-Sonnet-4.6 | 54.09 | 79.38 | 43.87 | 47.83 |
| Gemini-3.1-Pro | 67.32 | 70.71 | 85.70 | 52.95 |
| Qwen3-VL-8B | 41.49 | 56.71 | 21.24 | 39.04 |
| RoboBrain-2.5-4B | 44.04 | 31.85 | 48.09 | 45.12 |
Gemini-3.1-Pro 的可供性均值为 85.70%,但它的真实执行错误诊断只有 25.17%,规划错误诊断为 80.74%(表 6)。 RoboBrain-2.5-4B 的执行错误诊断为 43.71%,高于表内其他模型,但这没有带来更强的整体 Q1 规划。 纯文本基线的 Q1 泛化规划均值 73.74 高于 GPT-5.4 的 70.91,也高于 Gemini-3.1-Pro 的 70.71。 因此,原文关于纯文本在规划上“始终落后”的概括不能覆盖表 4;这些结果提示语言先验与评分协议仍值得进一步控制。 Human Evaluation 应视为论文的人类参考,而非每列严格上界;现有正文未给出足以完整重建其协议的细节。
消融实验¶
本文是基准研究,下表为表 4(第 12 页)的配对条件分析,不是网络模块消融。 显式与隐式指令保持图像和目标答案一致,得分为 Q1 百分制;差值由原表相减得到。
| 模型 | 显式指令 | 隐式指令 | 显式减隐式(分) |
|---|---|---|---|
| Claude-Sonnet-4.6 | 79.94 | 61.38 | 18.56 |
| Gemini-3.1-Pro | 73.25 | 59.90 | 13.35 |
| Qwen3-VL-8B | 59.46 | 30.80 | 28.66 |
| MiMo-Embodied-7B | 66.87 | 37.30 | 29.57 |
Claude-Sonnet-4.6 在显式目标上较强,但换成间接需求后降低 18.56 分,说明已知目标下的计划生成不等于意图推断。 这个差异也不能简单归因为感知模块,因为配对改变的是指令表达,涉及语言与场景的联合解释。
关键发现¶
- 裁判与人类评分的 Pearson 相关系数从通用 LLM 评分的 0.73 提高到世界模拟评分的 0.83(图 7,第 15 页),但相关性不是逐样本判分完全一致。
- 感知细项中,机器人视角最高为 53.62%,时间定位最高为 52.07%(表 3),说明对象知识强不代表参考系和时序理解同样可靠。
- 规划错误分析中,动作执行类、识别类、常识类、格式类错误占比分别为 45%、24%、25%、6%(第 13 页及图 6);此处是规划案例归因,不是真实机器人事故率。
- CALVIN 表现与物体中心、场景中心感知的相关系数分别为 0.884、0.833;LIBERO-10 与静态、动态可供性的相关系数分别为 0.617、0.517(第 14 页及图 8)。
亮点与洞察¶
- 参考计划被转换成依赖与状态约束后,可以容纳合法的动作重排。这比“越像参考文本越好”更贴近规划正确性的结构。
- 配对指令把隐藏需求这一实际交互难点从已知目标规划中分离出来。它适合作为多模态意图理解的诊断集,而非只看总榜排名。
- 将接触点、轨迹和底座位置统一放在可供性层面,使高层子目标与低层控制之间的接口更清楚。但候选选择仅验证这一接口的一部分。
- 不同下游基准关联不同认知维度,提示骨干选择应参考目标任务的能力画像。不能仅以最大的通用模型或某个平均分作决定。
局限与展望¶
- 世界模拟裁判没有真实物理执行作为逐样本保证;人工 DAG 减少结构歧义,却不能消除模型对碰撞、接触和可达性的误判。
- 高层失败由注入错误构造,低层失败来自真实执行,两者难度差异同时受认知要求和数据来源影响,不能解释为纯粹的能力差距。
- 去除所有模型都答对的题会令评测分布依赖参与筛选的模型集合;后续应报告独立保留集上的稳定性,这是本文阅读后的建议。
- 纯文本 Q1 的强表现说明部分规划分数可以由语言先验支撑;可增加反事实场景或视觉状态互换实验,以隔离真正的视觉依赖,这是阅读后的建议。
- 下游相关分析不能证明因果提升;训练数据、规模和微调设置可能共同影响 VLM 评分与 VLA 成功率,正文把完整实现细节放在未随本缓存提供的补充材料中。
- Q1 精确公式提取受损,正文关于纯文本规划的概括与表 4 存在不一致;本笔记按表格记录数值,不擅自修改原始结果或补全公式。
相关工作与启发¶
- vs RoboVQA:两者都关注机器人长时程认知,RoboBench 扩展了可供性与失败分析,并以动作依赖和状态模拟替代仅基于 BLEU 的规划评价;比较依据为本文表 1。
- vs BEAR / ECBench:本文将它们视为广覆盖具身评测的近邻,但强调自身对五个认知维度的覆盖及开放式规划评分。广度提升并不替代对每个子任务标签与难度的单独审计。
- vs REFLECT:RoboBench 借用其高层失败构造思路,将错误识别纳入基准;它并没有由此提出新的在线自我纠错控制器。
- 研究启发:可在固定控制器和训练预算下,只增强时空感知或可供性能力,验证相关维度是否带来对应下游收益。这是从相关分析导出的实验方向,不是论文已证明的效果。
评分¶
- 新颖性: 4/5。五维认知覆盖与 DAG 约束的世界模拟评分构成清晰贡献,核心不在新的模型架构。
- 实验充分度: 4/5。包含 18 个模型、文本与人类参考、裁判一致性和下游相关分析,但闭环验证与因果消融仍不足。
- 写作质量: 3/5。任务体系清楚,部分总括结论与表格不完全一致;公式复现还受本地文本提取限制。
- 价值: 4/5。适合定位具身模型的能力短板和辅助骨干选择,不宜独立作为真实机器人部署可靠性的证明。