跳转至

E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes

会议: ECCV 2026
论文: ECCV 2026
代码: https://k0uya.github.io/e3vs-proj/
领域: 机器人/具身智能
关键词: 主动感知、3D 视觉搜索、3D 高斯泼溅、具身问答、视角规划

一句话总结

E3VS-Bench 把「主动感知」落成一个可量化任务:在 99 个 3D 高斯泼溅重建场景里构造 2,014 条必须靠 5-DoF 视角控制才能答对的问答 episode,用「不可答视角当起点、可答视角当终点 + 盲答/起点答对强制过滤」保证题目不可被先验知识或初始视角蒙对,并以 VLM 判分(1–5)、平均步数、碰撞率三项指标评测,结果显示最强模型平均仅 2.79 分(人类 3.53)。

研究背景与动机

视觉搜索在心理学与神经科学里研究了几十年,核心问题是人如何在干扰物中靠目标导向和显著性驱动的注意找到目标。近两年视觉语言模型方向也兴起了一波「2D 视觉搜索」,V*、SEAL、DyFo 这类方法让模型在图像空间里裁剪、放大、迭代聚焦,Mini-O3、H*Bench、O3-Bench 等基准专门考察这种探索式推理。但它们全部停留在静态 2D 图像上:模型的动作是「在原图上框一块出来看」,图像背后的三维结构、遮挡关系和深度歧义从未进入评价范围。具身侧的 EQA(EQA、MP3D-EQA、OpenEQA)把 agent 放进 3D 场景里导航,可动作空间本质上还是「地面平面上的 2D 相机」——平面移动加有限旋转,考的是「去哪儿」,而不是「镜头该怎么摆」。真实环境里更常见的一类困难是:目标从第一步就摆在眼前,但它的身份信息(贴纸上的文字、品牌 logo、盒盖是开是合)在当前角度下根本读不出来,必须凑近、侧移、抬高或低头才能看清。这类视角依赖的证据,现有基准几乎都没有正面评价过。

之所以一直没人做,卡点有两层。一是表示层:主流仿真器建在 mesh 或点云重建上(ScanNet、House3D、Matterport3D),纹理退化、几何过度平滑,塑料袋上的小字或瓶身上的 logo 渲染出来是一团糊,于是「只有某个角度才看得见的证据」在物理上就不可定义,出题只能退化成「房间里有没有 X」「X 在哪儿」这种粗略的空间问答。二是评测口径:场景中心式的 3D-QA(ScanQA、SQA3D)默认可以直接访问完整的场景表示,根本不问 agent 如何获得缺失的证据;而 EQA 的题目常常能从常识先验(「冰箱里通常有牛奶」)或初始视角猜出答案,度量的其实是语言先验而不是探索能力。

现在能做了,关键使能因素是 3D 高斯泼溅。它支持照片级真实的自由视角渲染,保留了 mesh 表示丢掉的细粒度属性——论文的对比图里,ScanNet++ 的 mesh 上塑料罐的红带白字糊成一团,SceneSplat++ 的 3DGS 场景里 "WHEY" 清晰可读;而 SceneSplat++ 恰好提供了 3DGS 版的 ScanNet++ 场景。有了这份保真度,作者就可以把 5-DoF 视角控制、「可答/不可答视角」的显式标注、以及「起点必然答不出」的双重过滤绑成一个整体。核心 idea:以 3DGS 的高保真自由视角渲染为地基,把视角依赖的证据做成一等公民,再用「不可答视角当起点、可答视角当终点」的 episode 定义加上盲答与起点答对的双重过滤,把基准的及格线钉死在「必须真的移动视角才能得分」。

方法详解

整体框架

E3VS 的任务定义很干净:一条 episode 由三元组 \((S, q, v_0)\) 给出,\(S\) 是 3DGS 重建的场景,\(q\) 是自然语言问题,\(v_0\) 是初始相机视角。agent 的状态就是视角本身 \(v_t=(x_t,y_t,z_t,\theta_t,\phi_t)\)——三轴坐标加偏航、俯仰,共 5 个自由度、没有 roll;动作空间是离散的平移、旋转与终止三类,状态转移遵循环境动力学,动作导致碰撞时视角原地不动。每个时间步 \(t\),agent 从当前视角渲染出一张第一人称 RGB 观测 \(O_t\) 送进 VLM,VLM 结合问题选一个动作,如此闭环直到执行 stop,然后用最终观测 \(O_T\) 和问题 \(q\) 给出开放词汇的答案。

评测端不要求精确字符串匹配,而是走 VLM-as-a-judge:裁判模型(GPT-5.1)同时看到 agent 的最终观测 \(O_T\)、问题 \(q\)、预测答案 \(\hat y\)、标准答案 \(y\) 与人类标注的目标图像 \(O_{goal}\),吐出 1–5 分,5 为完全正确、1 为完全错误。这条公式里的 \(O_{goal}\) 是关键——判分不只看答案对不对,还看 agent 停下时的那一帧里到底有没有支撑答案的证据。

整个基准的构建是一条五阶段流水线:3D 场景策展 → 多视角出题 → 人工过滤与视角标注 → 可答性过滤 → 数据清洗,最后按场景级切分成训练/验证/测试三份。规模上,从 SceneSplat++ 人工挑选 105 个高质量重建场景,VLM 阶段产出 27,877 个候选 QA、覆盖 7,578 个物体实例,经人审与过滤后收敛为 1,290 个唯一问答对、99 个场景、2,014 条 episode;训练集 1,406 条(900 对 / 68 场景)、验证集 231 条(132 对 / 10 场景)、测试集 377 条(258 对 / 21 场景)。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400, 'subGraphTitleMargin': {'top': 8, 'bottom': 16}}}}%%
flowchart TD
    A["3DGS 场景策展<br/>筛出 105 个重建场景"] --> Q
    subgraph Q["多视角 QA 生成与视角标注"]
        direction TB
        Q1["球面采样多视角出题<br/>VLM 生成 27,877 个候选"] --> Q2["人工过滤与可答视角标注<br/>约 1,120 小时"]
    end
    Q --> F["可答性过滤<br/>盲答或起点答对即剔除"]
    F --> B["E3VS-Bench<br/>99 场景 / 2,014 episodes"]
    B --> E["VLM 闭环评测<br/>判分 + 步数 + 碰撞率"]

关键设计

1. 3DGS 场景策展:让细粒度视角依赖证据真实存在

这条设计的靶子是仿真器的渲染保真度。在 mesh 或点云重建上,纹理退化与几何过度平滑会把小字、材质纹理、品牌 logo 一并抹掉,于是「换个角度才能读到的证据」这类题目在源头上就造不出来。作者从 SceneSplat++(3DGS 版的 ScanNet++)里人工挑选高质量的室内重建作为场景基座,最终 99 个场景进入基准。选择 3DGS 而不是更常见的 mesh,直接收益是照片级的自由视角渲染:论文给出的对照里,同一个装奶清蛋白粉的黑色罐子,mesh 版本红色包装带上的一行白字完全糊掉(模型只能回答「图像太糊,看不出文字」),3DGS 版本则能读出 "WHEY"。正因为细节被保住,问题才可以从「罐子在不在」升级为「红带上写了什么字」——后者的答案只在对准那个角度的少数视角下可见,天然满足「单视角不可答」的要求。另一个附带好处是 3DGS 允许在重建空间里以任意位姿渲染,为 5-DoF 的连续视角控制提供了渲染侧的支持,而 mesh 仿真器通常只允许 agent 在可行走区域做平面移动加有限旋转。

2. 多视角 QA 生成与视角标注:从球面采样出题到可答视角集合

出题这一步要同时解决「问什么」和「怎么保证答案是视角依赖的」。作者设计了一条以 VLM 为引擎的三段式流程。第一步选物体:优先挑每个场景中实例数量很少的类别,减少同类干扰物带来的歧义(尤其是计数类问题);对选中的实例计算一个观察距离,使得该物体投影出的包围盒在任一轴上大约占画面的五分之三,再以物体为中心在球面上均匀采样视角、渲染对应的多视图。这个「占画面 3/5」的约束是让证据足够大、值得推理;球面采样则保证模型能看到物体各个侧面。第二步过滤视图:用 Gemini 2.5 Flash 丢掉目标被严重遮挡、超出重建范围或视觉上本身就有歧义的画面。第三步出题:用剩下的有效多视图合成候选问答对,覆盖内在属性(颜色、材质、品牌)与外在空间关系两类推理。这一步共产出 27,877 个候选 QA,涉及 7,578 个实例。

接着是人工环节,也是这套基准最贵的部分。标注者按预设标准逐条核对候选问题,剔除歧义、多解、客观无解的条目,并纠正错误答案,整个标注过程约耗 1,120 小时。随后专家为每条保留的问题标注可答视角:哪些视角包含足以回答该问题的信息;与 3D 几何相交等物理上无效的视角直接丢弃,标注结果再由另一位标注者复核以保证一致性。这一轮标注的产物被一鱼两吃:不可答视角用作 episode 的起点,可答视角用作终点,并由后者渲染出裁判用的目标图像 \(O_{goal}\)。作者还顺带披露了问题类别的分布(按唯一问答对计):物体搜索约 397 条、计数约 333 条、物体状态约 159 条、上下文引导搜索约 155 条、物体属性约 149 条、空间推理约 85 条;场景则以公寓、卧室、酒店客房为主,其余覆盖办公室、厨房、浴室、储藏室、教室、会议室、健身房、走廊等。(⚠️ 类别与场景计数按 Fig. 4(a)(b) 读取,合计 1,278 与正文 1,290 个唯一问答对存在少量出入,具体以原文为准。)

3. 可答性过滤:用盲答与起点 VQA 剔掉不必移动的题目

即使出题时盯着「视角依赖」,成批生成的候选里仍会混进大量捷径题:有些靠语言先验就能猜(问「盒子是开着还是关着」,蒙一个也有五成把握),有些则恰好在初始视角下就能看清。这类题目留在基准里,测的就是模型的常识和数据集偏置,而不是探索能力。作者的处置很直接:用 GPT-5.1 在两个条件下各做一次 VQA——盲答(完全不给图像输入,只看问题)和起点观测(只给 \(v_0\) 的渲染图,不允许任何移动),两次都按 1–5 的 VLM 判分协议打分;任一条件下得分 ≥3 的问答对整条剔除。阈值取 1–5 量程的中点,是一个保守的选择:只要有任何迹象表明它不靠主动探索也能答,就宁可错杀。过滤之后的 episode 满足「从先验知识答不出、从初始观测也答不出」这一硬性条件,必须通过 5-DoF 视角转移积累信息才有可能答对。这里也埋下了后面实验分析的一条伏笔——过滤只用 GPT-5.1 这一个模型做过,其他模型(Qwen、Gemini)在起点视角下的表现仍然会残留偏置,这正好解释了 OST 类别上观察到的反常。

4. VLM 闭环评测:判分、步数与碰撞率三维分离

评测部分把 VLM 接进一个闭环的感知–行动框架:每一步把当前观测 \(O_t\) 与问题一起喂给模型,模型输出一个动作,执行后进入下一状态,直到 stop 后生成最终答案。接口靠一套结构化提示词实现,分两部分:系统提示给出世界坐标系约定(Z 轴朝上)和动作空间约束(平移固定 0.25 m、旋转固定 30°);用户提示给出任务输入与动态状态,包括问题、当前观测图像、已走步数、当前 3D 坐标、上一步动作以及碰撞检测等反馈。默认只给单帧观测、不加任何额外推理模块,作为干净基线。评测指标刻意拆成三个正交维度:答案正确性用 VLM-as-a-judge 的 1–5 分(与人工评测的 Spearman 相关系数 \(\rho=0.54\)),探索效率用平均步数,导航安全性用 collision rate(一条 episode 内发生过任何碰撞就记 1,否则记 0)。这种拆法让「答对了但乱撞」和「路走得很稳但答错」可以被区分开。基线则设计成一条从无视觉到特权视角的递进谱系:盲答 VLM → 起点 VQA → 俯视(鸟瞰)VQA → 终点(人类可答视角)VQA → 起点上的 2D 视觉搜索(SEAL、DyFo)→ E3VS 具身 agent,供读者定位每个模型的短板究竟出在感知、探索还是决策上。实现细节上,观测分辨率为 512×512、视场角 90°,每条 episode 上限 25 步,模型最大输出 128 token(关闭推理)或 256 以上(开启推理),若输出不构成合法动作则默认执行 move_forward。

一个完整示例

以 "What text is visible on the front of the plastic sack?"(答案是 "cat litter")为例走一遍这条流水线。出题阶段,VLM 在绕物体采样的多视图里看到塑料袋正面印有 "cat litter",于是合成这条问答;因为这段文字只在塑料袋正面朝向相机时可读,它在多数视角下不可见,具有天然的视角依赖性。人审阶段标注者确认答案无歧义、文字确实印在正面;随后标注可答视角——正对袋子正面的一小簇位姿——并把与几何相交的位姿丢弃。过滤阶段,GPT-5.1 在不给图像时答不出(不知道袋子上写了什么),只给起点图时也答不出(起点取自不可答视角集合),两次都低于 3 分,于是这条 QA 进入基准,并派生出一条或多条 episode(同一条 QA 可以配不同的不可答起点)。评测时 agent 从起点出发,比如袋子侧对相机、正面的字被折角挡住,它需要平移绕过遮挡、可能还要低头对准印刷面,直到某一帧里文字清晰可读才 stop 作答;裁判会同时比对它的最终帧、预测答案与标注者选定的目标帧——如果 agent 在文字尚不可读时就停下(论文的定性结果里这类早停很常见),即使答案碰巧说对,也因为最终观测里没有支撑证据而拿到低分。(⚠️ 该例的具体过滤分数原文未逐一给出,此处按 §3.2 的规则复述;视角标注细节为示意。)

实验关键数据

主实验

六类问题的缩写:OS 物体搜索、OST 物体状态、OA 物体属性、CGS 上下文引导搜索、SR 空间推理、CNT 计数。所有分数均为 VLM 判分(1–5,越高越好),步数与碰撞率为无量纲量。(⚠️ 论文使用的模型版本如 Gemini 3.0 / GPT 5.1 / Qwen3-VL / Step3-VL 等以原文为准。)

E3VS 具身 agent 主结果(Table 2):

模型 OS OST OA CGS SR CNT 平均 平均步数 碰撞率
Random Action 2.38 2.18 2.60 2.20 2.50 2.00 2.28 10.15 0.39
Gemini 2.5 Pro 3.14 2.36 2.45 2.60 2.25 2.04 2.54 7.80 0.31
Gemini 3.0 Flash 3.21 2.82 3.18 3.53 2.75 1.88 2.79 11.29 0.43
Gemini 3.0 Pro 3.07 2.55 3.18 3.40 3.00 1.96 2.75 10.17 0.34
GPT 5.1 2.90 2.18 2.53 2.73 2.25 1.88 2.42 15.04 0.49
Qwen3-VL-8B 2.86 2.36 2.60 3.13 1.88 1.96 2.46 18.73 0.30
Qwen3-VL-30B 2.67 2.09 2.60 2.47 2.25 1.84 2.32 14.18 0.50
InternVL3.5-8B 2.66 2.18 2.24 2.60 2.12 1.60 2.21 10.85 0.65
Step3-VL-10B 2.38 2.27 2.38 3.13 2.50 1.64 2.24 11.16 0.42
Human 3.12 3.59 4.06 4.06 3.35 3.59 3.53 11.21

静态基线对照(Table 3,均不允许移动视角):

设置 模型 OS OST OA CGS SR CNT 平均
盲答 Gemini 2.5 Flash 1.72 2.00 2.09 1.67 1.88 1.72 1.82
盲答 Qwen3-VL-8B 1.38 2.64 1.58 2.20 1.50 1.52 1.67
起点 2D 视觉搜索 SEAL 1.62 2.45 1.44 1.53 2.50 1.32 1.68
起点 2D 视觉搜索 DyFo 1.90 2.45 1.44 1.67 2.00 1.80 1.86
起点 VQA Gemini 2.5 Flash 2.21 2.64 1.73 2.33 2.12 2.00 2.14
起点 VQA Qwen3-VL-8B 2.10 2.82 1.87 2.20 2.12 1.56 2.02
俯视 VQA Gemini 2.5 Flash 1.31 1.64 1.44 1.67 1.75 1.48 1.48
俯视 VQA GPT 5.1 1.48 2.09 1.58 2.20 1.62 1.16 1.55
俯视 VQA Qwen3-VL-8B 1.55 2.18 2.09 1.80 1.38 1.12 1.59
终点 VQA Gemini 2.5 Flash 3.79 3.27 3.84 4.20 3.50 3.16 3.58
终点 VQA GPT 5.1 4.17 3.36 3.91 4.20 3.00 2.88 3.60
终点 VQA Qwen3-VL-8B 3.07 3.55 3.40 4.20 3.00 2.20 3.03
终点 VQA Human 4.25 3.82 4.47 4.25 4.14 3.82 4.12

消融实验

内部推理(thinking)开关的影响(Table 4,"Th." 表示是否开启思考过程):

模型 OS OST OA CGS SR CNT 平均 步数 碰撞率
Gemini 3.0 Flash 3.21 2.82 3.18 3.53 2.75 1.88 2.79 11.29 0.43
Gemini 3.0 Flash + Th. 3.21 2.82 2.96 3.27 3.00 2.00 2.79 19.80 0.41
GPT 5.1 2.90 2.18 2.53 2.73 2.25 1.88 2.42 15.04 0.49
GPT 5.1 + Th. 2.97 2.64 3.25 2.87 2.38 2.16 2.70 13.78 0.38

「起点即终点」消融:把初始视角直接设成人类标注的可答视角,从而免除探索,只考察证据识别 + 停步决策(Table 5):

模型 起点=终点视角 OS OST OA CGS SR CNT 平均 步数 碰撞率
Qwen3-VL-8B 2.86 2.36 2.60 3.13 1.88 1.96 2.46 18.73 0.30
Qwen3-VL-8B 3.90 3.36 3.84 3.93 2.75 2.56 3.38 12.06 0.23
Gemini 3.0 Flash 3.21 2.82 3.18 3.53 2.75 1.88 2.79 11.29 0.43
Gemini 3.0 Flash 4.21 3.55 3.33 3.93 3.25 2.38 3.41 6.60 0.29

关键发现

  • 全体模型离人类很远,离随机动作很近。最好的 Gemini 3.0 Flash 拿到 2.79 分,人类 3.53,而随机动作基线已有 2.28 分;GPT 5.1(2.42)甚至与 Qwen3-VL-8B(2.46)、Step3-VL-10B(2.24)处在同一水平。这说明在需要换视角的 3D 任务上,2D 识图能力几乎不构成优势。
  • 起点与终点之间的落差,是「必须主动探索」最直接的证据。同一批题、同一批模型,只换视角:起点 VQA 只有 2.02–2.14 分,终点 VQA 却有 3.03–3.60 分。信息就在场景里,但不在初始视野里——这正是 5-DoF 视角控制的价值所在。
  • 俯视全局反而最差。所有「俯视 VQA」结果集中在 1.48–1.59,比起点 VQA 还低,说明细粒度证据(文字、开合状态、被遮挡区域)无法被一张鸟瞰图概括,全局概览不能替代走近观察。
  • OS 比 CGS 更难,与直觉相反。模型在上下文引导搜索(如「哪里能整齐存放大量文件夹」)上普遍好于显式的物体搜索(如「带五个轮子的黑色办公椅在哪」):前者只需认出功能区或相关物体就能作答,后者还要求理解目标在场景中的空间位置与摆放关系,多出来的空间推理拉低了成绩。
  • 计数(CNT)是系统性重灾区。Gemini 3.0 Flash 与 GPT 5.1 都只有 1.88 分,比随机动作基线(2.00)还低,而人类在终点视角能拿 3.82 分。计数需要在 5-DoF 轨迹上逐步累积证据(数到第三处时必须记住前两处),单观测式的 EQA 范式天然做不了,模型在 2D 单视图下就已经吃力,进入 E3VS 后进一步退化。
  • 空间推理(SR)出现了「会挑视角」的苗头。SR 要求比较相对位置、距离与尺寸,而这类几何证据的可用性高度依赖视角——比较两个物体的高矮,从侧面看远好于从斜上方看。Gemini 3.0 Pro 在 E3VS 下拿到 3.00 分,已经与终点 VQA 的上界(GPT 5.1 与 Qwen3-VL-8B 在 SR 上均为 3.00)持平,说明它不只是能识别空间关系,还能主动把视角选到让关系更好观测的位置。
  • 物体状态(OST)的收益被偏置吃掉。开/关这类二值判断容易被先验或数据偏置猜中;由于过滤只用 GPT-5.1 做过,其他模型在起点视角仍能靠偏置得分——Qwen3-VL-8B 的起点 VQA 就有 2.82 分,接近 Gemini 3.0 Flash 在完整 E3VS 下的 2.82 分。加上解状态所需的视角本身相对可预测(对着门看开合),OST 被简化成了「选视角 + 路径规划」而非真正的探索,而模型连这一步也做不好。
  • 物体属性(OA)对视角最敏感。OA 的目标物体已被问题指明,但「证据在物体的哪一侧」事先无从知晓,必须逐实例探索。结果除 Gemini 3.0 两个型号表现尚可(3.18)外,其余模型都在随机动作基线(2.60)上下徘徊,说明细粒度证据的获取既需要探索式的视角发现,也需要细粒度的视觉识别,两者缺一不可。
  • 思考过程(thinking)的收益因模型而异。GPT 5.1 开启思考后平均分从 2.42 升到 2.70,同时步数从 15.04 降到 13.78、碰撞率从 0.49 降到 0.38,说明额外的内部计算确实改善了视角规划;Gemini 3.0 Flash 平均分完全不变(2.79),但步数从 11.29 猛增到 19.80。作者坦承这一差异的原因尚不清楚,可能与架构或训练数据有关。
  • 多帧记忆提升的是效率而非正确率。把输入帧数从 1 增到 3、5,判分几乎不动,但步数与碰撞率一致下降。步数下降大概率是因为单帧 agent 会陷入「重复同一动作」的死锁,多帧让它意识到自己没动;碰撞下降则来自更好的动作–观测对应理解,能预判视角变化。
  • 两个模型的强项正好互补。在「起点即终点」的消融里,Gemini 3.0 Flash 平均 3.41、仅用 6.60 步就收工,Qwen3-VL-8B 平均 3.38 却要走 12.06 步;而在 OA 上 Qwen3-VL-8B 反而更高(3.84 vs 3.33)。回到标准 E3VS 设置(起点不可答)后,Gemini 又全面反超。合起来看:Gemini 更擅长主动探索去补齐缺失信息,Qwen3-VL-8B 更擅长在证据已具备时识别细粒度属性,但它识别出来之后并不总能做出正确的停步决策
  • 纯图像空间搜索救不了 3D 视角问题。SEAL(1.68)与 DyFo(1.86)在 E3VS 上几乎与盲答基线(1.67–1.82)没有区别,比起点 VQA 还低——在 2D 图像里反复裁剪放大,无法替代真正把相机挪到新位姿。
  • 定性上,agent 停在的「可答视角」经常不是真的可答。人类选择的终点一般会把目标居中或刻意露出判别性特征;agent 到达的终点则常常目标只露一角、关键特征仍未入画。由于裁判会惩罚「最终观测里没有支撑证据」的答案,这类早停普遍拿低分。

亮点与洞察

  • 把抽象的可答性变成可执行的 episode 生成规则:专家标注「哪些视角能回答问题」这一动作,一鱼两吃地产出了三样东西——不可答视角集合用来当起点、可答视角集合用来当终点、终点渲染出的目标图像充当裁判的参考帧。标注成本被复用到了极致,也让「必须移动」变成了由数据本身保证的性质,而不是靠出题者的自觉。
  • 双重过滤 + 保守阈值是基准有效性的关键:盲答堵住「靠语言先验蒙对」,起点 VQA 堵住「初始视角就够用」,阈值取 1–5 的中点(≥3 即剔除)宁可错杀。更值得玩味的是作者自己指出的漏洞——过滤只用了 GPT-5.1,其他模型在起点仍能吃到偏置红利,这恰好成了解释 OST 类别反常现象的钥匙。这种把评测缺陷摊开当分析素材写的做法很诚实。
  • 用「起点即终点」消融解耦探索与识别:同一套题、同一批答案,只把起点挪到人类可答视角,就能把「找不到证据」和「找到了但看不明白/不会停」分离开。这一步让 Qwen3-VL-8B「会看不会找、会看不会停」的画像浮出水面,是一种很省成本的诊断设计。
  • 指标三维分离:正确性(1–5 判分)、效率(平均步数)、安全性(碰撞率)互不掩盖,能直接读出「答对了但一路乱撞」(GPT 5.1:0.49 碰撞率)和「走得少但答不对」(Qwen3-VL-30B:14.18 步、2.32 分)这类区分信息。可迁移到任何需要评估 embodied agent 的判断场景。
  • 5-DoF 而非 6-DoF 是刻意的取舍:显式去掉 roll,动作空间改为离散、可枚举,既贴近人眼与真实云台的运动方式,也避免了连续控制带来的评测噪声;本实验里 0.25 m 平移与 30° 旋转的固定步长让「步数」成为一个可跨模型比较的公平指标。
  • 可迁移的做法:任何「监督信号只在特定角度可见」的任务都能复用这套「可答视角标注 + 起点不可答过滤」的骨架——工业质检里的字符码读取、机器人操作中的可操作性/抓取位姿判断、手术视频里的器械状态识别、AR 引导式维修,都可以先标出哪些位姿能看清,再把不可看的位姿设为起点。
  • 最让人「啊哈」的一点:论文的定性结果反复显示,模型的失败往往不是「看不懂」,而是「停早了」——它找到了目标所在的大致区域就停下来作答,而没意识到判别性证据还没入画。这提示该方向的关键瓶颈可能不在感知模型,而在「我看到了吗」这种自我评估能力

局限与展望

  • 作者承认的局限集中在评测器:VLM-as-a-judge 与人工评测的相关性偏弱(\(\rho=0.54\)),有些情况下 agent 的最终观测与人类标注的目标视角相差很大却拿到了相近的分数,说明当前的自动评测对「视角是否充分」的刻画不足。这一点也和 1–5 的粗粒度评分有关。
  • 规模与覆盖面有限:99 个场景、2,014 条 episode,且全部来自 ScanNet++ 的室内静态场景,以公寓、卧室、酒店客房为主;缺少室外场景、动态物体与可交互物体,跨场景泛化能力无法被单独考察。
  • 交互被完全排除在动作空间之外。5-DoF 只有平移、旋转与停止,agent 不能开门、不能搬开遮挡物、不能拿起物体,「遮挡」只能靠换角度绕开。这既是任务定义的边界,也是与真实机器人操作任务的落差——现实中很多遮挡必须靠物理交互消除。
  • 每条 episode 上限 25 步、单帧观测(多帧只作为消融),长程、多目标协同的搜索任务没有覆盖;而作者自己在记忆消融里已经证明单帧 agent 会出现动作死锁,说明 25 步预算的一部分被浪费在了无效循环上。
  • 数据构建的成本与偏置:整个人工标注约 1,120 小时,扩展性差;候选 QA 全部由单一模型(Gemini 2.5 Flash)合成,会带入该模型的出题偏好;过滤与判分同样绑定在 GPT-5.1 上,闭源模型的版本漂移会让结果难以严格复现(作者也已把 GPT-5.1 从盲答与起点设置中排除以规避自评偏置)。
  • 本文只做零样本评测,训练/验证集虽已发布却未用于任何优化。作者把「基于学习的方法」留作后续工作,这也意味着「这些模型经过训练后能否补上探索能力」目前仍是空白。
  • 可改进方向:用开源可复现模型替换判分器、或引入多裁判投票以缓解相关性弱的问题;把可答视角标注升级为连续的「可答性分布」(论文作者自己早前的 Answerability Fields 就是这条路),让评测不再只看终点一帧;在动作空间里加入简单的物体交互,把「必须挪开遮挡物」的场景纳入进来;以及用 3DGS 场景本身的可编辑性做数据增强(增删物体、改光照),低成本扩充场景多样性。

相关工作与启发

  • vs EQA / MP3D-EQA / OpenEQA:它们让 agent 在 3D 环境里导航并回答问题,但 agent 本质是平面移动的 2D 相机(2-DoF,图结构或连续平面运动),考的是「去哪儿找」;E3VS 把自由度提到 5-DoF,考的是「镜头怎么摆才能看清证据」。因此 E3VS 与它们不是规模之争,而是动作空间与证据类型之争;代价是场景数远小于 MP3D 系基准。
  • vs ScanQA / SQA3D:这两者是场景中心式的 3D-QA,直接以完整点云/网格表示为输入,默认 agent 能访问全部场景信息,因此不评估「如何获得缺失的视觉证据」。E3VS 与其说更难的版本,不如说是把「取证」这一步显式建模了进去。
  • vs 2D 视觉搜索(V* / SEAL / DyFo / Thyme / Mini-O3 / H*Bench / O3-Bench):它们的动作是图像空间里的裁剪、缩放或全景伪动作(如 turn_left / turn_right),位姿本身不变。本文把它们做成静态基线,实测 SEAL 1.68、DyFo 1.86,几乎与盲答持平——这组数字本身就是对「2D 搜索能否迁移到 3D」这个问题的直接回答。
  • vs Aerial VLN / CityNav:它们同样突破了平面约束进入 3D 空间,但目标是长程的轨迹跟随与远景导航,评价的是路径规划与语言对齐,而不是为看清一个标签所做的精细视角微调。
  • vs Answerability Fields:该工作用扩散模型估计「问题的空间可答性分布」,预测哪里能看到回答所需的证据;E3VS 把同一件事推进一步,用人工标注把可答性固化成显式视角集合,并进一步把它用作 episode 的起终点。两者结合(自动估计 + 标注校验)是把这类基准做大的一条现实路径。
  • vs Habitat / EXPRESS-BENCH 一类仿真平台:它们提供的是物理仿真与导航接口,E3VS 提供的是任务与数据;3DGS 这条渲染路线与 Habitat 的 mesh 路线在保真度与可交互性上各有取舍——想要物体交互就得回到 mesh 或物理引擎,想要照片级保真就得接受静态场景,E3VS 选择了后者。

评分

  • 新颖性: ⭐⭐⭐⭐ 首次把「视角依赖的证据」与 5-DoF 主动感知做成可比、可复现的基准,任务定义与过滤协议都有巧思;不过整体仍是「EQA + 更强渲染 + 更严过滤」的组合式创新。
  • 实验充分度: ⭐⭐⭐⭐ 模型覆盖面广(4 个闭源 + 4 个开源)、基线谱系设计得当、三个消融(思考、记忆、起点即终点)各自切中要害;不足是仅 99 个场景且全为室内静态,判分器与人工的相关性也只有 0.54。
  • 写作质量: ⭐⭐⭐⭐ 任务形式化干净、分析诚实(主动指出过滤遗漏带来的偏置、承认思考收益原因不明);扣分主要在于部分图表信息密度过高、大量构建细节被推给补充材料。
  • 价值: ⭐⭐⭐⭐ 把「主动感知」从一句口号变成可量化的评测协议,起点不可答的过滤思路与可答视角标注可被后续工作直接复用;同时它清楚地把当前 VLM 在 3D 视角规划上的短板摆了出来。