跳转至

EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning

会议: ECCV2026
论文: ECCV 原文
代码: https://github.com/JackYu6/EXPLORE-Bench/
领域: 多模态VLM
关键词: 自我中心视觉、长时程推理、基准测试、场景预测、多模态大模型

一句话总结

论文形式化了一个新任务「长时程推理的自我中心场景预测」——给定一张初始场景图和一段长原子动作序列,让模型想象并描述全部动作执行完后的最终场景;作者据此构建 EXPLORE-Bench(1,157 个实例,动作序列平均 113 步、最长 694 步,含对象/属性/关系三层结构化标注),并用「对象覆盖 + 属性评分 + 关系评分」的统一指标评测 20 余个模型,发现最好的模型仍落后人类 7.39 分,且单纯把动作序列切段做逐步推理会因模型只描述「变化」而丢分。

研究背景与动机

自我中心(第一人称)视角天然把视觉和动作耦合在一起:看到什么决定了要做什么,做了什么又反过来改变接下来会看到什么。正是冲着这个感知—动作闭环,EgoTaskQA、EgoMCQ、EgoSchema、EgoPlan-Bench、ERQA 等自我中心基准近年大量涌现,覆盖识别、记忆、理解、规划等能力。但这些基准的共同形态是「给一段视频、问一个短时程问题」:动作是短程的、场景范围是局部的(regional),而且缺乏对最终场景的结构化刻画。涉及状态预测的部分,往往只问「某个物体在一段视觉线索之后处于什么状态」,既不要求模型对整段动作序列的物理后果做全局推演,也不要求它给出一个完整场景的最终样貌。

这个缺口之所以长期没被补上,一半是认知盲区、一半是工程壁垒。认知上,大家默认「预测未来状态」= 「短程状态跟踪」,没有把它当成一个需要跨几十上百步动作维护「什么变了、什么没变」的全局推理问题。工程上,想做长时程就必须同时具备三样东西:完整覆盖一个任务的原子动作序列、最终场景的对象/属性/关系结构化标注、以及能把自由文本描述变成可量化分数的评测协议。而最后一项恰恰是死结——如果只有一段模型生成的场景描述和一张图,除了粗粒度文本相似度之外,根本说不清模型到底对在哪里、错在哪里;要靠人工把每张最终场景图都标成对象—属性—关系图,成本又高到无法规模化。

本文的设计选择是把这三件事一起解决:借用 Ego4D、Ego-Exo4D 已有的带时间戳原子动作标注和自录视频,用起止帧锚定出「初始场景 → 最终场景」的实例;再用一条「先抽对象标签、再定位、再让 MLLM 生成属性与关系、最后校正」的多步管线,把标注成本从「人标一切」压到「人做校验」;评测则借用 CompreCap 的图像描述度量思路,把描述拆解后分别对齐到对象、属性、关系三个层面。核心 idea:把「长时程自我中心场景预测」形式化为「初始帧 + 完整原子动作序列 → 最终场景」的推理任务,并用对象级软覆盖、属性级与关系级 LLM 打分构成的三层协议,把自由文本的未来场景描述变成可量化、可比较的分数。

方法详解

整体框架

这篇论文交付的是一套评测体系而不是一个模型,它的三块拼图是:实例标注评测协议。EXPLORE-Bench 共 1,157 个实例,来自 1,157 段真实第一人称视频(Ego4D、Ego-Exo4D 以及自录视频),视频平均时长 358.28 秒、最长 1,524.80 秒。每个实例包含三样东西:(i) 一张表示初始场景的图像;(ii) 一段原子动作描述序列,长度从 11 到 694 条不等、平均 113 条;(iii) 最终场景图像的结构化标注,含对象类别、对象的视觉属性、以及对象之间的关系。全库标注了 23,771 个对象、跨 1,612 个类别,平均每个实例 20 个以上对象。

任务的操作化方式值得单独说明。给定初始图和动作序列,模型被要求输出一段自然语言描述,讲清「所有动作执行完之后场景长什么样」——输出格式与 image captioning 完全一致,评测协议再负责把这段文字拆开、对齐到结构化标注上打分。这里有一个刻意的设计:输入是动作描述序列而不是视频本身。这一选择模拟的是智能体「已经规划好动作、但还没执行」的时刻,让评测考察的是对未来物理后果的推理,而不是视频采样和长上下文建模能力。

关键设计

1. 任务定义与实例构造:用真实第一人称视频的主活动起止帧锚定「长时程 + 全局场景」

要问「动作序列执行完之后场景变什么样」,首先得保证这段动作序列真的描述了一个完整任务、而且首尾两帧确实构成一对合法的因果端。作者的做法是从 Ego4D 和 Ego-Exo4D 里按活动类型做筛选:做饭、修自行车这类有明确目标和终止状态的算有效,跳舞、与人聊天这类没有可判定终态的算无效。选定视频后,取主活动的起止帧分别作为初始场景图和最终场景图,再拿这两个帧的时间戳去检索原数据集里带时间戳的原子动作标注,裁出夹在中间的那一段动作描述;自录视频则按同等粒度人工标注同样的格式。这样得到的实例天然满足「动作序列完整覆盖一个任务」,也就是论文对比表里 completeness 那一列——已有的 EgoTaskQA/EgoMCQ/EgoSchema/EgoPlan-Bench/ERQA 全都不满足这一条,它们要么动作短、要么场景局部,而 EXPLORE-Bench 在「动作长度 long、场景类型 global」两栏上都是唯一打勾的。

人工质控贯穿始终:抽取首尾帧时要求画面无运动模糊、两帧之间只发生主活动、相机视角不能发生剧变;动作描述不足以推断最终场景的模糊实例(位置交代不清、遮挡严重)直接剔除。这些约束听起来琐碎,但它们决定了这个基准是否「可解」——如果初始图到最终场景之间相机跑了大半间屋子,那模型再强也不是在推理动作后果,而是在猜一个无法从输入推导出来的新视角。

2. 可扩展的多步场景标注管线:把「让 MLLM 直接出标注」换成五个可控子步骤

直接让一个 MLLM 看最终场景图生成「对象 + 属性 + 关系」的完整标注,在实践中会同时暴露两个问题:对象覆盖率不够(模型倾向于只写显著物体,漏掉边缘的小物件),属性与关系的准确度也不稳定。作者于是把标注拆成一条五步流水线。第一步 对象打标:用 RAM++(Recognize Anything Plus Model)从最终场景图中抽出对象标签,同时用 spaCy 从原子动作描述中抽名词,两者合并取并集来最大化覆盖,再用一个「LLM 过滤 + 规则过滤」的组合方案剔掉同义词、人体部位等无效标签。第二步 对象定位:把最终场景图和过滤后的标签一起喂给 Grounding DINO 得到边界框,每个检测实例用「类别.序号」的形式标识(如 bowl.2),让后续的属性、关系能精确挂到具体实例上,而不是笼统挂到类别上。第三步 属性生成:以最终场景图加框出的对象为输入,提示 Qwen3-VL-235B-A22B-Instruct 为每个对象生成显著视觉属性的描述,覆盖形状、颜色、大小、纹理、状态等维度。第四步 关系生成:同一个模型生成 (object.0, relation, object.1) 形式的关系三元组,既要空间关系(如 under)也要交互关系(如 holding)。第五步 信息整合与校正:把对象与它对应的属性、关系拼成完整标注——这里要注意同一张图里同类别不同实例可以有完全不同的属性和关系,所以实例级索引是关键——最后把图连同标注送进 GPT-5.2 做校正与补全。

这条管线的价值不在任何单步模型有多新,而在于把「开放式生成」变成「受控的检索 + 匹配 + 校验」,从而把人工成本从「从零标注」压到「校验与修正」。与其配套的人机回环也不是摆设:标注 prompt 和过滤规则经过多轮人工验证迭代,最终场景标注由人工标注员逐条修正,标注指南也根据标注员反馈更新过多次。

3. 三层评测协议与统一分数:让「想象出来的场景」可以被打分

模型输出是一段自由文本,要变成可比较的数字,必须先建立对齐结构。协议的第一步是描述分解:按句号等句子分隔符把生成描述切分成子描述,再用 spaCy 抽名词并做词形还原,得到候选对象集合。第二步 对象级评测:用 Sentence-BERT 抽词嵌入,在候选对象与标注对象之间算一个相似度矩阵,匹配的判定方式是取行与列方向上的互为最大值(即双向贪心匹配),再由匹配后的矩阵算出对象级覆盖分 \(S_{\text{obj}}\),它衡量的是标注对象在生成描述中被「软覆盖」的比例。第三步 属性级评测:把指向同一个标注对象的所有子描述拼接起来,用标准化 prompt 让一个 LLM 以 0–5 分制评估属性描述与标注短语的一致程度,对所有已匹配对象取平均得到 \(S_{\text{att}}\)。第四步 关系级评测:复用与属性级完全相同的打分流程,得到关系分 \(S_{\text{rel}}\)

三个分项线性缩放到 0–100 后按权重合成统一分数(\(S_{\text{att}}\)\(S_{\text{rel}}\) 原始是 0–5 分制,乘 20 拉齐量纲;权重沿用 CompreCap 的 w1=0.25、w2=0.35、w3=0.40):

\[S_{\text{uni}} = w_1 S_{\text{obj}} + w_2 (20\,S_{\text{att}}) + w_3 (20\,S_{\text{rel}})\]

值得注意的是权重设计本身就带立场:关系占 0.40、属性占 0.35,加起来 0.75,对象覆盖只占 0.25——即「说对有哪些东西」远不如「说对这些东西是什么样、彼此什么关系」重要,这正好压住了「堆名词刷分」的捷径。指标可信度也被验证过:用 Qwen3-8B 作 LLM 评审,其打分与人类打分的 Spearman 相关为 0.919,而人类评审员两两之间的相关只有 0.912–0.936,说明自动评审基本落在人类一致性区间内。

同一套打分逻辑还被扩展到了异常场景:对 20 段「执行完动作后出现异常状态」的视频(异常分两类——环境破坏,如物品掉落;安全隐患,如水龙头一直开着),除常规标注外额外标注体现异常的关键物体状态,按评属性的同一方式给关键状态打 0–5 分的 \(S_{\text{key}}\),再按

\[S_{\text{abn}} = (1-\lambda)\,S_{\text{uni}} + \lambda\,(20\,S_{\text{key}}),\quad \lambda = 0.9\]

合成异常场景分。⚠️ 以原文为准:论文正文写的是 \(S_{\text{abn}}=(1-\lambda)S_{\text{uni}}+\lambda S_{\text{key}}\),少了 \(S_{\text{key}}\) 的 20 倍量纲缩放;但按表中数字反推(如 GPT-5.2-Chat 的 \(S_{\text{uni}}\)=69.94、\(S_{\text{key}}\)=3.10 对应 \(S_{\text{abn}}\)=62.79),实际计算中施加了 ×20,这里按可实现的形式写出。λ=0.9 意味着异常场景分有九成权重压在关键状态上,常规场景描述只占一成。

4. 面向长时程的逐步推理策略:怎么切段、以及单轮为何会掉分

长动作序列天然适合「拆成子问题、逐步做状态转移」的动态规划式思路,作者据此设计了两组实验。分段有两种方式:一是把每个实例的动作序列均匀切成预先设定的段数 segment_num(简单,但忽略实例间长度差异),二是用大小 window_size滑窗切,每 window_size 条动作成一段(末段可不足),于是长序列自然被切成更多段。

在分段之上有两种推理策略,结果差别很大。单轮推理把所有段放进一次对话里,让模型依次预测每段执行后的场景,每个预测以「上一段后的场景描述 + 初始场景图」为条件。这条路线不但没有收益,反而相对「直接预测最终场景」的默认设定大幅掉分,而且段数越多、窗口越小掉得越狠;case study 给出的解释是:这种提示下模型生成的描述只盯着场景里变了的那些东西,把没变的部分整个丢掉,导致最终描述显著变短,而三层指标里的对象覆盖和不变属性都需要完整重述。多轮推理则把每轮的信息面收窄到一段动作,要求模型输出「执行完这一段之后」的完整场景描述(形式上等同于每一轮都做一次 final-scene prediction)。轮数增加,生成的描述显著变长,分数也随之回升:分解越细(segment_num 越大、window_size 越小)效果越好。这背后的机制很直白——单轮里模型会共享一份隐式的「我只需要讲变化」的先验,而多轮的逐段重述逼它每一轮都维护一份完整的场景状态。

但这个过程有明显的收益递减和成本问题:segment_num=11 与 window_size=10 在全集上得分接近(52.34 vs 52.16),前者在 Short 子集更好(53.26 vs 52.31),后者在 Long 子集明显更强(51.41 vs 48.33);window_size=10 的多轮在 Long 上比默认设定高 3.41 分。可一旦 segment_num 小于 7 或 window_size 超过 25,分数反而掉回默认设定之下;同时多轮推理的推理时间是成倍增长的。作者由此给出的结论是:按序列长度自适应地分段可能才是长时程推理的正确用法,而不是一味地切细。

一个完整示例:一次「瓶子倒下」的异常实例

论文 Fig. 7 给了一个把整条流水线走通的例子。初始场景图是一张铺着浅绿白格桌布的小圆桌,桌上有瓶子叠成的金字塔、午餐盒、零食袋、纸巾包、牛奶盒等物;动作序列共 14 条,从「相机佩戴者用右手抽出纸巾」「用纸巾擦桌布」「把纸巾揉成一团」「拿起午餐盒放到桌布上」「把勺子放在午餐盒上」「把零食袋放在午餐盒和瓶子金字塔之间」「把牛奶盒放在金字塔右侧」「把纸巾包放在金字塔前方」「拿起金字塔右下角的那只瓶子」「把瓶子放到纸巾包旁边」一路下来。最终场景的关键状态标注只有一句:「那只没有标签的瓶子横躺在桌布上」——瓶子金字塔在执行过程中被抽掉一只、剩下的结构失去支撑,这就是典型的环境破坏类异常。

\(S_{\text{uni}}\) 算,两个顶尖模型在这类场景里分数并不低(Qwen3-VL-8B-Thinking 70.71、GPT-5.2-Chat 69.94);但到了 \(S_{\text{key}}\) 就塌了:人类 4.65,GPT-5.2-Chat 3.10、Qwen3-VL-8B-Thinking 2.84。把两段模型生成的描述对照看会更清楚——Qwen3-VL-8B-Thinking 写的是「两只瓶子叠成的结构稳稳立着(a stable base)」,GPT-5.2-Chat 写的是「剩下的那叠瓶子仍然稳稳矗立」,而实际上那只被抽走底座的瓶子是倒下的。两个模型都识别出了「东西被重新摆放过」,也把桌椅、窗帘、桌布花纹描述得相当细致,但在唯一真正承载物理后果的那一步上给出了违反常识的答案。这个例子同时说明了两件事:结构化三级指标能定位到「错在哪个语义层面」,而 LLM 生成的流畅长描述会掩盖物理推理的失败。

实验关键数据

主实验

评测覆盖 20 余个模型:闭源侧的 GPT-5.2-Chat、Gemini-3-Flash、Gemini-3-Pro;开源的 Qwen2-VL-7B、Qwen2.5-VL-3B/7B、Qwen3-VL-2B/8B(非思考与思考)、InternVL3.5-2B/8B、LLaVA-OneVision-1.5-4B/8B、Keye-VL-1.5-8B、Ovis2.5-2B/9B、MiMo-VL-7B-RL-2508、MiniCPM-V-4.5 (8B)、GLM-4.6V-Flash (9B)、Step3-VL-10B;以及两个针对具身/自我中心推理专门训练的 Embodied-Reasoner (7B) 与 EgoThinker (7B)。全部使用同一 prompt 与贪心解码。全部实例按动作序列长度分为 Short(11–99 条,599 个实例)、Medium(100–199 条,430 个)、Long(200–694 条,128 个)三个子集;人类基线在 EXPLORE-Bench (tiny) 上评测,该集从三个子集按 52:37:11 采样 100 个实例。

模型 Short \(S_{\text{uni}}\) Medium \(S_{\text{uni}}\) Long \(S_{\text{uni}}\) Full \(S_{\text{uni}}\) Full \(S_{\text{obj}}\)
Human † 61.56 57.87 51.50 59.08 71.38
Qwen3-VL-8B-Thinking 52.08 50.56 47.07 50.96 62.70
Qwen3-VL-8B-Instruct 51.23 50.64 48.00 50.65 60.63
Gemini-3-Pro 50.11 49.44 48.31 49.66 60.94
Gemini-3-Flash 50.27 48.84 48.18 49.51 59.72
Step3-VL-10B 49.87 48.01 47.09 48.87 60.61
GLM-4.6V-Flash (9B) 49.32 47.67 45.75 48.31 59.22
GPT-5.2-Chat 48.71 47.85 46.91 48.19 59.69
MiniCPM-V-4.5 (8B) 47.67 46.49 44.95 46.93 57.87
InternVL3.5-8B 47.00 45.30 43.99 46.04 56.57
EgoThinker (7B) 39.39 37.89 35.36 38.38 46.71
Qwen2-VL-7B-Instruct 39.14 37.73 36.73 38.35 46.62
Embodied-Reasoner (7B) 32.65 32.56 32.23 32.57 39.44

† 人类一行来自 EXPLORE-Bench (tiny),与其余全量行不严格可比。表中数字取原文表 2;为控制篇幅只保留代表性行,完整榜单还含 Qwen3-VL-2B、Qwen2.5-VL-3B/7B、LLaVA-OneVision-1.5-4B/8B、Ovis2.5-2B/9B、Keye-VL-1.5-8B、MiMo-VL-7B-RL-2508、InternVL3.5-2B、Qwen3-VL-2B-Thinking 等。

消融实验

论文没有模型层面的消融,取而代之的是对测试时策略的系统分析:以 Qwen3-VL-8B-Instruct 为对象,比较默认设定与两种逐步推理策略在三个子集上的表现。

推理配置 Short \(S_{\text{uni}}\) Full \(S_{\text{uni}}\) Long \(S_{\text{uni}}\) 说明
默认设定(直接预测最终场景) 51.23 50.65 48.00 单次输出完整最终场景描述
单轮逐步推理(各 segment_num/window_size 随分段变细持续下降 低于默认设定 低于默认设定 描述只关注「变化」,忽略未变部分,长度显著变短
多轮逐步推理,均匀分段 segment_num=11 53.26 52.34 48.33 Short 子集最优
多轮逐步推理,滑窗 window_size=10 52.31 52.16 51.41 Long 子集最优,比默认高 3.41

关键发现

  • 人类领先但绝对分不高,Long 子集差距收窄:人类在 tiny 全集上拿 59.08,比最好的模型高 7.39。人类在 Short/Medium 上优势明显,到 Long 上差距明显缩小(51.50 对 Gemini-3-Pro 的 47.97),作者推测 MLLM 在处理超长动作序列、尤其是预测对象间关系上有相对优势;但人类自己也只考了 59 分,说明这个基准本身很难。
  • 开源模型能打,闭源不是碾压:Qwen3-VL-8B 系列在全集上反超 Gemini-3-Pro(50.65 / 50.96 对 49.66),而 Gemini-3-Pro 在 Long 子集上更强(48.31);Gemini-3-Flash 与 Pro 整体接近,且略好于 GPT-5.2-Chat。开源侧整体仍远落后人类。
  • 专门为具身/自我中心训练的模型反而更差:Embodied-Reasoner (32.57) 和 EgoThinker (38.38) 都不优于甚至低于它们的底座模型 Qwen2-VL-7B-Instruct (38.35)。这是全文最有冲击力的一个观察:现有具身/自我中心训练并没有覆盖「长时程动作后果推演」这项能力。
  • 描述长度与得分无关:最好的三个模型平均生成长度分别是 545.77、312.46、186.60 词——Gemini-3-Pro 又准又简;Qwen2.5-VL-3B-Instruct 写了 305.58 词但分数远低;Embodied-Reasoner 与 EgoThinker 分别写了 812.00、808.92 词却垫底;Step3-VL-10B 写 747.27 词仍具竞争力;Ovis2.5-9B 思考模式最短,仅 121.69 词。
  • 思考模式不是万能药:Keye-VL-1.5-8B 开思考模式在全集上相对非思考版提升 5.77 分,同族的 Qwen3-VL-8B-Thinking 也是开源最强之一;但 Ovis2.5-2B、Ovis2.5-9B、MiMo-VL-7B-RL-2508 的思考变体反而低于各自的非思考版本。
  • 异常场景:常规描述分虚高,关键状态分崩塌:异常实例的动作序列更短(平均 17 条)、对象更少(平均 9 个),所以 \(S_{\text{uni}}\) 普遍比全集高(GPT-5.2-Chat 69.94、Qwen3-VL-8B-Thinking 70.71),但 \(S_{\text{key}}\) 普遍只有 1.45–3.10,人类是 4.65。按 λ=0.9 合成的 \(S_{\text{abn}}\) 上,最好的模型 GPT-5.2-Chat 只有 62.79,人类 91.64。
方法 \(S_{\text{obj}}\) \(S_{\text{att}}\) \(S_{\text{rel}}\) \(S_{\text{uni}}\) \(S_{\text{key}}\) \(S_{\text{abn}}\)
Human 95.19 3.64 3.88 80.32 4.65 91.64
GPT-5.2-Chat 87.32 2.82 3.55 69.94 3.10 62.79
Qwen3-VL-8B-Thinking 86.03 2.89 3.62 70.71 2.84 58.22
Gemini-3-Pro 80.98 2.70 3.41 66.47 2.74 56.00
Qwen3-VL-8B-Instruct 83.83 2.82 3.51 68.75 2.54 52.63
EgoThinker 72.33 2.21 2.92 56.92 2.38 48.44
Qwen2-VL-7B-Instruct 68.84 2.13 2.98 55.98 2.20 45.20
Embodied-Reasoner 63.75 1.62 2.75 49.28 1.45 30.95

亮点与洞察

  • 把「预测未来场景」做成可量化的分数,而且验证了打分器可信:三层协议把「说对没说到」拆成对象覆盖、属性一致、关系一致三个可解释维度,再用与人类一致性相当的 LLM 评审(ρ=0.919,落在人类评审员 0.912–0.936 的区间内)闭合回路。这套「结构化标注 + LLM 评分 + 人工一致性校验」的范式可以直接搬到任何开放式生成评测上。
  • 输入是动作序列而不是视频,这是一个聪明的 framing:如果输入是视频,长时程评测会同时混入采样策略、长上下文、帧选择等一堆与「物理后果推理」无关的变量;换成规划好的原子动作描述序列,评测就精确锚定在「从动作推演世界状态」这一件事上,而且天然对齐了「智能体规划完、执行前」这一真实决策时刻。
  • 多轮推理的反直觉结论值得记住:单轮里让模型逐段更新场景反而掉分,原因是模型把「描述变化」当成了任务、丢掉不变的部分。也就是说,当评测需要完整状态时,必须在提示层面显式要求完整重述——这是一个可以直接迁移到 agent 长任务记忆维护上的教训。
  • 结构化标注本身就是资产:23,771 个对象、1,612 个类别、带实例级索引的属性与关系三元组,是现成的场景图式监督信号;作者也把「构造专门训练集」列为后续工作,说明这批数据还有为训练所用的空间。
  • 异常场景的 \(S_{\text{key}}\) 思路可迁移到安全评测:把「安全相关的关键状态」单独拎出来打分,能让被流畅长描述掩盖的物理常识错误暴露出来——这套思路对机器人操作、自动驾驶的失败模式评测同样适用。

局限与展望

  • 作者承认的局限有三条:测试时扩展只试了少数几种推理策略,更高效的长时程测试时方法仍是开放问题;虽然覆盖了多样的日常活动,稀有或异常情形(如意外交互)依然欠代表;并且没有专门的训练集,未来数据更充足时可以构建训练集来推进能力本身。
  • 评测协议层面可以挑出几点:对象匹配依赖 Sentence-BERT 词嵌入加互最大值匹配,同义/上下位词(bowl 与 container)可能被误判为不匹配或错配;属性与关系都是让一个 LLM 在 0–5 尺度上打分,而实际分布被压在很窄的区间里(\(S_{\text{att}}\) 多在 1.0–2.9,\(S_{\text{rel}}\) 多在 2.0–3.6),区分度有限,这也是为什么统一分数里 0.25 的对象覆盖项实际上主导了绝大部分方差。
  • 人类基线只在 100 个实例的 tiny 集上评测,与全量排行榜不严格可比;论文用 † 做了标注,但「Gemini-3-Pro 在 Long 上逼近人类」这类结论的证据强度仍受这个采样规模限制。
  • 异常场景的 λ=0.9 让 \(S_{\text{abn}}\) 有九成由 \(S_{\text{key}}\) 决定,\(S_{\text{uni}}\) 的贡献被压到一成,因此该分数更适合作为「关键状态命中」的代理指标,而不宜当作综合场景质量来解读。
  • 可改进方向:给属性/关系标注补充空间坐标或场景图结构,减少纯文本匹配的歧义;把论文自己观察到的「按序列长度自适应分段」真正实现成算法,而不是停在观察层面。

相关工作与启发

  • vs EgoTaskQA / EgoMCQ / EgoSchema / EgoPlan-Bench / ERQA:这几个是当前最常被引用的自我中心/具身基准(见原文表 1),共同点是动作短、场景范围局部,且都不保证原子动作能完整描述一个长时程任务。本文在「动作长度 long、场景类型 global、completeness 满足」三个维度上同时成立,并额外提供对象/属性/关系三维评测与场景级评分,是差异最大的地方。
  • vs CompreCap:本文的评测协议(对象覆盖、属性评分、关系评分以及 0.25/0.35/0.40 的权重)明确借鉴自 CompreCap 的 directed scene graph 描述度量。区别在于 CompreCap 评的是「对一张已存在图像的描述」,本文评的是「模型想象出来的、尚不存在的未来场景」,输入也从图像变成了动作序列——度量形式相同,但被测量的对象从感知变成了推演。
  • vs EOC-Bench:EOC-Bench 同样在自我中心设定下做对象的识别、回忆与预测,但落脚点是对象级;EXPLORE-Bench 要求输出整个场景的最终状态(对象 + 属性 + 关系),并把推理跨度拉到上百步动作。
  • vs 具身/自我中心专训模型(Embodied-Reasoner、EgoThinker):这类工作在各自的训练分布上表现出很强的具身推理能力,但在本文任务上连底座都不如。这提示「具身能力」的评测存在严重的任务依赖——某项基准上的提升不能外推到「推演动作的物理后果」这一能力维。

评分

  • 新颖性: ⭐⭐⭐⭐ 任务 framing(动作序列 → 最终场景)与「对象/属性/关系」三层场景级评测在自我中心基准里是新的,但方法层面属于已有模块(RAM++、Grounding DINO、CompreCap 度量)的系统组合。
  • 实验充分度: ⭐⭐⭐⭐ 评测了 20 余个模型并附人类基线、逐步推理策略分析和异常场景分析,覆盖面很广;扣分点是人类基线只有 100 例、测试时策略探索种类有限。
  • 写作质量: ⭐⭐⭐⭐ 结构与表格清晰,任务动机和协议讲得明白;但公式 (2) 与实现不一致,摘要/正文中若干符号在缓存文本里排版破损。
  • 价值: ⭐⭐⭐⭐ 为长时程自我中心场景预测提供了可复用的标尺,并明确暴露了现有具身/自我中心专训模型在这项能力上的短板,对后续训练集与测试时策略研究都有直接指引。