EgoEverything: A Benchmark for Human Behavior–Inspired Long-Context Egocentric Video Understanding in AR Environment¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4529
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/6365.pdf
数据集: EgoEverything 项目页
领域: 视频理解
关键词: 第一人称视频、注视感知、长时记忆、AR 助手、多智能体标注
一句话总结¶
EgoEverything 用真实眼动引导提问对象采样,再通过延迟提问、双智能体取证和人工筛选构建超过 100 小时视频、超过 5,000 道选择题的 AR 记忆基准,显示最佳受测模型 Gemini 1.5 Pro 的 63.1% 准确率仍比人类的 83.5% 低 20.4 个百分点。
研究背景与动机¶
第一人称长视频理解不能只回答“这段视频发生了什么”。持续佩戴 AR 眼镜的用户可能走过一家餐厅,过了一段时间才想起询问店名,也可能收拾完行李后追问某件衣服放在哪里。此时系统不仅要识别对象,还要把用户曾看到的细节、当时的活动和后来的提问关联起来。EgoSchema、LongVideoBench 等基准推动了长上下文评估,但作者关注的是更具体的缺口:问题是否围绕使用者可能注意过的内容,是否像日常交流,以及是否在活动尚未结束时提出。
这里不能简单把“看过”当成“想问”。眼动是可测量的行为信号,却不是用户意图标签;只围绕注视中心生成问题,还会排除周边物品和偶然出现的细节。另一方面,直接人工观看长视频、查证对象、编写自然问题和干扰项十分昂贵,纯模板生成又容易产生“视频里是否……”这类不像真实助手交互的措辞。本文因此把行为约束放进数据生产流程,而不是另外设计一个回答问题的网络。
核心 idea:用真实注视作为提问对象分布的弱先验,同时保留外围目标,再让带取证工具的生成者与验证者围绕随机延迟的日常问题反复核验,构建更接近 AR 记忆查询的评测集。
方法详解¶
整体框架¶
输入来自 Aria Everyday Activities(AEA)和 Nymeria 的第一人称视频及同步眼动;输出是带答案、证据和提问时间的五选一问题。流程先做视频摘要与聚类(VSSC),再做注视引导目标采样(GOTS),最后通过问题生成与人工整理(QGMC)得到可评测条目。下面将 QGMC 拆成迭代取证与质量筛选两个设计,以明确自动交互和最终接纳之间的区别。
注视主要在离线构建问题时决定“问什么”,不是默认附加在最终问题里的提示。评测中的注视裁剪、遮罩和显著图提示是另外的输入处理对照,不能把它们误认为每个受测模型都必需的组件。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["视频与同步眼动"] --> VSSC["视频摘要与聚类"]
VSSC --> GOTS["注视引导目标采样"]
GOTS --> Agents["延迟提问与双智能体取证"]
Agents -->|审核反馈,最多两轮| Agents
Agents --> Filter["多层质量筛选"]
Filter --> Output["五选一问答与证据"]
关键设计¶
1. 视频摘要与聚类:先建立可检索的活动时间线
AEA 含 143 段日常活动视频,覆盖 5 个室内环境,总长约 7.3 小时;Nymeria 原始资源约 300 小时、约 50 个场景。本文从两者取样组成超过 100 小时的基准,不能把 Nymeria 的全部时长算作最终数据量。两者都有真实眼动,但 Nymeria 还提供时间对齐的活动叙述,AEA 缺少这种导航信息。因此,VSSC 的重点是补齐 AEA 的活动时间线,让后续智能体知道应该去哪个时段取证,而非反复读取整段高分辨率视频。
具体做法是用预训练 ResNet-50 提取逐帧特征,再用 k-means 聚类。作者比较 \(K\in\{8,12,16\}\),选择下游问题质量最好的 \(K=12\);这里的 \(K\) 控制摘要的时间粒度,不是预定义的动作类别数。为避免相邻帧标签抖动,每帧采用前后各 5 帧窗口内的众数标签,再把连续同标签片段合并,并施加最短 2 秒的片段时长约束。VLM 据此生成活动摘要,人工检查并删除摘要错误。过小的 \(K\) 容易合并不同活动,过大的 \(K\) 则让摘要细碎冗长,但缓存未给出三个候选值对应的量化质量分数。
2. 注视引导目标采样:偏向看过的对象,而不只保留视线中心
对每个活动片段,VLM 检测对象并输出类别与边界框。连续视频会反复检测同一个物品,若直接从检测列表抽样,长时间停留在镜头里的对象会重复占据问题名额。作者因此先裁剪对象,用预训练 CLIP 视觉编码器得到嵌入,再通过轻量重识别(ReID)合并高度相似的检测,只保留代表实例。这个步骤服务于目标多样性,不等于训练了一个完整、可靠的跨时身份跟踪系统。
随后先随机抽取目标帧,再按对象框中心到该帧真实注视点的欧氏距离,用感知采样器(PS)选一个目标对象。PS 采用以实测注视为中心的二维高斯形式,距离越远,选择概率越低,参数 \(\theta\) 控制衰减范围。缓存中的原式 (1) 已损坏,仅残留公式标签,因此这里不补写指数、归一化常数,也不擅自将 \(\theta\) 解释成标准差或方差。正文明确的设置为 \(\theta=400\) 像素,它表示一个较宽的中心采样先验,而非精确意图定位;远处对象仍可能被选中。
该机制保留了“关注过的对象更可能被询问”这一倾向,同时容纳外围细节。AEA 分辨率为 \(1408\times1408\),Nymeria 为 \(2016\times2208\),所以相同像素参数并不自动意味着一致的视角范围。最终的问句不必暴露注视信息,这使“基准用眼动选题”和“模型用眼动答题”成为两个可以分开研究的问题。
3. 延迟提问与双智能体取证:把对象变成可核验的日常记忆问题
有了目标帧时间 \(t_0\) 后,系统从稍后的合法时间范围均匀采样提问时间 \(t_q\)。原文给出的最小回忆间隔为 3 分钟,视频终点为 \(T\);回忆间隔定义如下:
这让问题与证据在时间上分离,也避免所有问题都固定在片尾。但它只是便于控制的提问时间基线,不是从真实用户查询日志学到的时间分布;缓存也未说明如何处理剩余时长不足最小间隔的目标帧。
合成智能体(SA)获得活动摘要、目标对象、目标框和目标帧,先拟定自然问题,再主动补证据。它不直接吞入整段视频,而是调用 GetFrame 获取指定时间的高分辨率帧,用于读文字、颜色等静态细节;或调用 GetSegment 获取指定区间的降采样视频,用于判断放置、拿起等动态事件。这样把“看清一个瞬间”和“确认一段动作”区分开来,避免静态截图承担它无法证明的事件判断。
验证智能体(VA)接收问题、支持证据及活动摘要,但不直接获得目标对象和目标帧提示,仍可调用相同工具自行检查。它检查事实、歧义与表达清晰度,并至少补充一条证据,再把反馈交回 SA 改写。减少目标提示的用意是让验证者检查读者能否仅靠问题识别所指对象,而不是替含糊的问题自动补全背景。两轮审核后仍不通过的题目被丢弃,而非无限迭代。
4. 多层质量筛选:把视觉可回答性与语言捷径分开检查
智能体通过并不意味着题目可直接发布。距离过远、遮挡、光照不足或视角变形可能造成对象误识别,空间关系也可能随视点变化而写错。规则筛选先排除墙壁、天花板、地板和佩戴者身体部位等不适合提问的目标,并剔除直接引用时间戳或提到“视频”的问题,约束最终表达贴近日常助手使用。
接下来由人工观看对应视频,在不知道预设正确答案的情况下从 5 个选项里作答;轻微问题允许修改,严重缺陷直接判无效,仅保留人工选择与伪答案一致的条目。12 名训练过的标注者累计审核约 21,600 道题,投入超过 400 小时;人工阶段接纳率约 70%,文中另报规则及盲筛接纳率约 50%,但未清楚给出可逐级相乘的完整数量账本。最后,LLM 在完全不看视频的情况下猜答案,答对的题目被删除。这样能削弱显然的文本线索,却不能保证其他模型也无法通过选项偏差或常识作答。
一个完整示例¶
原文流程图以咖啡桌上的一本书为例:目标帧为 32.5 秒,SA 根据对象框定位书,调用工具查看 35 秒的帧以确认书名,再提交问题与两个证据时刻。VA 另查 34 秒的帧,发现“那本书”的指代不够明确,要求改成咖啡桌上的书;SA 据此修改后再送审。这些时间是图中展示的取证时间,不是最终提问时间,不能把几秒内的工具往返误写成满足了 3 分钟回忆间隔。
这个例子揭示了两个不同的质量门槛:读清书名解决答案是否正确,补充“咖啡桌上”解决问题能否唯一定位目标。二者缺一,五选一准确率都可能测到歧义或语言猜测,而非真正的长时视觉记忆。
损失函数 / 训练策略¶
本文没有提出新的回答模型、损失函数或端到端训练目标;贡献是数据构建与诊断评测。正文称 SA 使用经过工具调用微调的预训练 VLM,但缓存未提供其具体训练样本、目标函数、优化器或完整超参数,因此不能将这一描述扩写成已知的训练配方。可确认的流水线参数包括 \(K=12\)、前后各 5 帧平滑、最短片段 2 秒、\(\theta=400\) 像素、最小回忆间隔 3 分钟和最多两轮审核。
实验关键数据¶
主实验¶
指标为五选一准确率(%),均匀随机选择的基线为 20%。FR 保留原分辨率;AD 将整帧均匀降采样到原分辨率的约 10%;GC 保留注视附近、约占原帧大小 10% 的方形区域;GM 保留 GC 的互补区域。这里沿用原文对 10% 的描述,不据此推算精确边长或 token 数。VMP 与 AMEGO 将视频转换成结构化记忆后做文本推理,NA 表示未报告。
| 模型 | FR | AD | GC | GM | VMP | AMEGO |
|---|---|---|---|---|---|---|
| VideoLLaMA3-7B | 49.1 | 46.1 | 42.4 | 35.2 | 20.2 | 19.5 |
| VideoLLaMA3-2B | 46.5 | 44.9 | 40.5 | 34.5 | 21.3 | 19.4 |
| Gemini 1.5 Pro | 63.1 | 58.4 | 52.7 | 37.7 | 33.2 | 18.3 |
| LongVA | 34.6 | 31.6 | 28.9 | 22.2 | NA | NA |
| LLaVA-Video | 42.6 | 36.6 | 32.9 | 26.0 | NA | NA |
数据来自原文表 1;人类平均准确率为 83.5%。Gemini 1.5 Pro 的 FR 最优,但与人类仍差 20.4 个百分点。所有模型均表现为 FR > AD > GC > GM,说明视线附近信息重要,周边上下文同样不能随意删除。该比较并未统一模型实际 token、计算量或硬件预算,不能解释成等算力下的效率排名。
消融实验¶
这是一篇基准论文,以下是原文的输入对照与因素分析,不是删除数据生成模块后重新训练的消融。第一张分析表汇总表 2 与第 4.1 节显著图提示结果;未报告的配置保持 NA。
| 模型 | 仅问题与选项(%) | FR(%) | 显著图注视提示(%) |
|---|---|---|---|
| VideoLLaMA3-7B | 22.9 | 49.1 | 51.19 |
| Gemini 1.5 Pro | 35.9 | 63.1 | NA |
| LongVA | 21.8 | 34.6 | NA |
显著图提示让 VideoLLaMA3-7B 比 FR 提高 2.09 个百分点,说明眼动不一定只能用于裁剪,也可以作为额外提示。不过 Gemini 的纯文本准确率仍达 35.9%,明显高于随机基线;盲筛降低了语言捷径的影响,却没有将它完全消除。
下表摘自原文表 3,展示 VideoLLaMA3-7B 的对象距离与回忆间隔分析。它比较不同样本子集,不能据此单独确认距离或时长的因果效应。
| 分析因素 | 子集或区间 | 准确率(%) |
|---|---|---|
| 对象中心到注视点距离 | 0–100 像素 | 54.2 |
| 对象中心到注视点距离 | 100–200 像素 | 54.8 |
| 对象中心到注视点距离 | 200–300 像素 | 51.8 |
| 对象中心到注视点距离 | 300–400 像素 | 47.2 |
| 对象中心到注视点距离 | 400–500 像素 | 42.6 |
| 对象中心到注视点距离 | 500–600 像素 | 36.1 |
| 对象中心到注视点距离 | 600–700 像素 | 31.4 |
| 回忆间隔 | 最长的 10% | 33.3 |
| 回忆间隔 | 最短的 10% | 49.0 |
关键发现¶
- 外围细节更难:100–200 像素组到 600–700 像素组下降 23.4 个百分点,但 0–100 与 100–200 像素组并非严格单调,不能写成每个距离档位都必然下降。
- 长回忆更难:最长与最短间隔组相差 15.7 个百分点。作者指出输入长度未超过该模型可处理的最大范围,更可能涉及冗余帧、干扰活动和目标片段检索困难,而不只是上下文窗口放不下。
- 小对象更难:原文表 3(b) 的面积阈值 100、500、2k、5k、10k、50k、100k 像素平方分别对应 44.3、44.4、44.5、44.9、49.2、54.8、54.8%。缓存未明确这些阈值的分桶方式,不能改写成已知的互斥面积区间。
- 结构化记忆不是自动保真:作者将 VMP、AMEGO 的低分归因于偏重交互对象、遗漏活动无关对象,以及图像转文本时丢失细节;这提示记忆选择策略失配,不能据此断言所有场景图方法都无效。
亮点与洞察¶
- 把注意分布放在数据侧。 不要求问句显式携带眼动,也能改变基准关注的目标分布。这为分别研究行为导向选题与注视辅助推理提供了清楚的实验边界。
- 验证者少拿提示,多拿证据。 VA 不直接得到目标对象和目标帧,并须自行补充证据,有助于暴露指代不清。可迁移的不是“再问一次模型”,而是有信息差、能取证的交叉检查。
- 全局粗看与局部细看需要共存。 AD 优于 GC,说明只盯注视中心会丢掉对象关系和事件背景。后续记忆系统可以保留全局低分辨率流,并按需检索局部高分辨率证据,但本文没有实现或验证该改进。
局限与展望¶
- 行为真实性仍是近似。 实测眼动不等于真实问题意图,固定高斯范围与均匀延迟也不是用户提问的经验分布。需要真实查询日志验证这种采样到底覆盖了多少自然需求。
- 质量筛选仍有模型依赖。 Gemini 纯文本得分为 35.9%,说明不能把“某个盲筛模型答错”视为“所有模型都必须看视频”的证明。多模型盲测和选项偏差分析会更有说服力。
- 缺少生成组件的直接消融。 缓存没有给出去掉 ReID、VA、人工审核,或改变 \(\theta\) 后的问题质量对照,也未给出置信区间、详细帧预算和硬件代价,尚不能量化每个环节的独立收益。
- 复现信息有缺口。 原式 (1) 的本地文本损坏,面积阈值分桶、聚类候选值的量化质量、短尾目标帧处理和完整筛选数量账本均不足以精确复现;这些缺口不在笔记中自行补齐。
- 流式设定不等于已完成部署评测。 随机提问时刻是有用的任务设计,但主表没有实时延迟、能耗、在线记忆预算,也未完整说明如何屏蔽提问时刻之后的帧。未来应明确因果输入协议,并在可穿戴设备预算下报告性能。
相关工作与启发¶
- 对比 EgoSchema、LongVideoBench、HD-EPIC: 本文强调眼动引导的目标分布、自然措辞和活动过程中的提问时刻;贡献不是单纯延长输入视频,也不意味着此前基准的所有问题都不自然。
- 对比 EgoGazeVQA、GazeVQA、StreamGaze: 原文分别将它们概括为显式注视辅助意图理解、多视角协作问答和流式时间推理。EgoEverything 的主要区别是用眼动离线选题,最终自然问句不强制暴露眼动;显著图提示对照又表明两条路线可以结合。
- 对比 AMEGO 与 VideoMindPalace: 它们把长视频压缩成结构化对象关系,本文揭示只记录被交互对象可能漏掉用户后来才关心的背景细节。可探索保留对象外观证据及未交互对象的低成本索引,但需同时测量召回收益与记忆开销。
评分¶
- 新颖性: 4/5。把真实注视、自然措辞与延迟提问合到同一基准,任务设计有辨识度,但不是新的推理架构。
- 实验充分度: 3/5。模型、输入处理与难度因素覆盖较广,但缺少生成组件消融、统计不确定性和严格部署预算。
- 写作质量: 3/5。流程和失败现象容易理解,参数口径与部分复现细节仍需澄清,本地公式提取也有损坏。
- 价值: 4/5。对 AR 长时记忆、外围细节保留和行为导向评测有实用启发,真实查询代表性仍需进一步验证。