跳转至

HippoCamp: Benchmarking Contextual Agents on Personal Computers

会议: ECCV2026
论文: ECCV 原文
数据集: MMMem-org/HippoCamp
领域: LLM Agent / 多模态 VLM
关键词: 个人文件系统、上下文智能体、用户画像、多模态检索、证据定位

一句话总结

HippoCamp 将个人电脑中的异构文件组织为三个隔离的用户原型环境,用 581 个有文件证据的问题同时评测事实保留与用户画像;最强受测系统的画像回答正确率仅为 48.3%,说明找到相关文件距离可靠理解用户仍有明显差距。

研究背景与动机

一个个人助理要回答“我每周通常怎样安排健康活动”,不能只搜索包含“健康”的文件。 它需要从日历中发现重复事件,从运动记录中确认行为是否发生,再把照片、语音备忘录和邮件中的线索关联起来。 同一个词还可能指向用户本人、家人或宠物,因此检索语义相关并不等于找到了正确主体的证据。 这类工作与网页导航、代码生成或单份文档问答不同:问题的答案隐含在长期累积、结构不规则且跨模态的私人资料中。 现有多模态检索评测已经覆盖图片、表格和文档,但经常提供预先整理的候选集或相对封闭的任务上下文。 这会弱化真实电脑上的目录导航、时间关联、文件版本和跨实体消歧问题。

将上下文窗口扩大也不能直接解决这些困难,因为整个设备中的资料不适合一次性输入,且大量内容与当前问题无关。 平铺的 top-k 语义检索又容易把主题相似的公共报告与真正的个人记录混为一谈。 即使相关文件已经出现,智能体仍需判断哪些片段足以支持结论,哪些只反映偶然事件而不是稳定习惯。 已有记忆系统通常从对话历史、经过整理的经历或较窄的模态建立用户知识,尚不足以检验这种杂乱文件环境。 HippoCamp 因而不是再提出一个记忆网络,而是建立能够暴露这些失效位置的评测任务。 评测既要判断最终回答是否正确,也要检查答案能否追溯到真实文件。

本文保留原生目录和元数据线索,用真实贡献者的材料构造高密度用户原型,再由人工提出可核验的问题。 这样既能测试局部事实查找,也能测试跨时间聚合偏好、规律和约束的能力。 二者共享相同文件环境,却对证据整合提出不同要求,适合诊断“会搜索但不了解用户”的系统。 核心 idea:把个性化能力落实为隔离个人文件系统中的证据关联问答,同时衡量回答正确性与证据文件检索质量,区分搜索、感知和推理的瓶颈。

方法详解

整体框架

HippoCamp 的输入是自然语言问题和该问题所属用户原型的完整文件系统,输出是回答及其支持文件。 基准总计包含 42.4 GB、超过 2000 个异构文件,以及 581 个问答对。 文本、图片、文档、视频和音频共同组成搜索空间,而不是独立成互不相关的模态测试集。 每个问题对应人工核验的答案、证据文件、局部内容指针和带能力标签的推理轨迹。 这些标注用于评分和诊断,不是测试时直接提供给智能体的标准解题路线。 因此,真正受测的是系统能否从问题出发自行发现证据、理解内容并形成可追溯结论。

数据层先构造三个用户原型,标注层再把真实需求变成事实保留和用户画像任务。 执行层允许不同系统用各自的检索或工具机制探索文件,但禁止外部网络检索和侧信道信息。 评分层分别评估回答与证据,再按任务、用户原型和能力标签分析差异。 本文没有训练新的统一模型,也没有提出需要优化的专用损失函数。 RAG 的离线建索引属于基线准备,不应与用评测答案训练模型混淆。 这里的“记忆”主要表现为能否从长期资料恢复用户上下文,而不是已经验证了持续学习或在线记忆更新。

关键设计

1. 用户原型文件系统:保留设备级检索的结构困难

数据源来自对 100+ 名个人设备用户的访谈,作者优先选取存在稳定活动规律、长期痕迹和跨文件证据的材料。 随后按模态与文件类型分布、目录组织、时间跨度和重复工作流,将选定贡献者的文件聚合为三个一致的用户原型。 Bei 偏向学生与内容创作,文件多模态程度较高;Adam 偏向法律职业中的文档工作;Victoria 偏向财务分析、日程与行政资料。 这三个环境不是三位真实用户未经处理的硬盘副本,也不是对电脑用户人口的三类划分。 它们是为了覆盖不同结构性困难而构造的诊断环境,不能用来估计一般人群中的成功率。 这种设计把评测重点放在“文件生态是否足够复杂”,而不是虚构一个可直接读取的用户简介作为答案来源。

原始目录层级、不规则命名、长尾格式、时间元数据和冗余文件被保留下来,使文件结构本身成为可利用但可能误导的线索。 一份日历和一张照片可能互相支持,也可能只是名称相似,智能体必须继续查看内容。 作者报告采用主动同意、隐私过滤、一致化假名和参与者审核后再发布资料。 少量 FinanceBench 与 LegalBench-RAG 材料用于补充专业文档形式,并按虚构身份清理及重新标注。 因此,“源于真实资料”与“完全没有外部补充材料”不能画等号。 相关处理细节被指向补充材料 A,而当前全文缓存只包含主文,不能进一步核验其逐项实现。

2. 人工证据轨迹:从局部事实走向长期用户画像

581 个问题分为 521 个事实保留问题和 60 个用户画像问题,分别占 89.7% 与 10.3%。 事实保留要求恢复可核验信息,例如找到最大流课程笔记,再确认课程来源和持续时间。 它不必是单文件关键词查找,答案也可能需要跨格式理解和关联多个记录。 用户画像则要求从一组事实推出稳定的用户级规律、日程约束、偏好、回顾或工作流。 例如制定一个下午的安排,既要识别已存在的日历承诺,又要结合历史惯例和个人偏好,不能只生成通用建议。 画像任务的关键难点是跨时间证据是否足以支持整体结论,而不只是答案涉及的文件更多。

领域标注者人工撰写问题,并为每条问题建立关联文件、局部证据及逐步理由。 JSON 轨迹可记录页码、表格单元格和文本片段等原子指针,使“引用了文档”进一步细化为“文档哪里支持这个判断”。 搜索标签涉及系统导航和语义检索;感知标签涉及文件结构理解、模态理解与证据定位;推理标签包括推断、计算、总结和验证。 标注遵循尽量简洁且显式关联证据的原则,避免只保留一段无法检查的最终解释。 总计 46.1K 条细粒度标注是这些证据和轨迹字段的规模,不是额外的独立问题数。 LLM 只根据受限元数据和种子示例提出覆盖方向,主文明确称发布的 QA/轨迹记录中直接模型生成或原样采纳的比例为 0%。 最终样本仍须人工定稿、文件核验、去重,并兼顾任务类型、模态组合和证据集合大小。

3. 隔离访问与多类基线:比较系统如何发现证据

每个测试实例只开放其所属原型的文件系统,不能借助其他原型资料、外部检索、网页或辅助侧信道元数据。 在这个边界内,智能体有完整文件访问权限,并可采用自身机制搜索、读取和推理。 这意味着测试不是让模型凭先验知识猜用户身份,而是检查它能否利用被授权的本地资料。 Standard RAG 与 Self-RAG 先按各自需要对全语料进行格式转换与索引,再从检索候选中生成回答。 ReAct 与 Search-R1 则把检索嵌入多轮搜索和推理循环,根据新观察继续调整搜索。 终端智能体在复刻文件系统的 Docker Ubuntu 环境中调用工具,托管产品级智能体则使用自身平台接口。

这些系统代表不同的操作方式,不是只替换基础模型、其余组件完全相同的消融实验。 主表采用 max-budget 协议,各系统运行至预先设定的步骤、token 或平台预算,而不是再施加统一的固定墙钟截止。 因此结果体现“在各自预算与工具条件下的系统表现”,不能直接解释为等计算量下的模型能力排序。 三名非作者人类解题者也遵循回答加证据协议,但没有人为墙钟限制,仅作为可解性参照。 Claude 系统因严重文件系统和长文档处理失败而未进入主表;没有主表分数不代表它已完成同等有效评测。 精确预算、重试处理和接口细节被放在补充材料 D,当前缓存不能确认这些配置。

4. 回答与证据分开评分:区分答对和有依据地答对

回答评测默认使用 GPT-4o,将问题、标准答案和系统回答交给裁判,判断事实一致性、推理合理性及个性化程度。 裁判输出二元正确判断和 0–5 的质量分,主表 Acc 报告的是被判正确的回答比例,而不是质量分的归一化结果。 作者另用 Claude Sonnet 4.5、DeepSeek V3.2 与人工校验做裁判校准,报告主要排序与分组趋势稳定。 主文没有列出完整校准数表,因此这部分只能作为作者报告,不能在笔记中补出一致率或显著性数字。 证据侧则比较系统提交的文件集合与标注文件集合,计算召回和文件级 F1。 精确率表示提交文件中有多少属于标准证据,召回率表示标准证据中有多少被找回,F1 是二者的调和平均。

这套双指标能区分两种常被混淆的失败:检索到相关文件却解释错误,以及回答看似正确但没有提交相应支持文件。 后一种情况提示证据链不完整,也可能涉及参数知识,但不能仅凭 Acc 高于 F1 就证明具体的因果来源。 同样,文件级 F1 不直接证明文件中的关键页、单元格或片段已被正确理解。 原子标注能支持更细的诊断,而主表指标仍应按文件集合层级解释。 表 2 的 Overall 是三个用户原型的均衡平均,不能当作按全部问题数量加权的准确率。 表 3 改按搜索、感知和推理标签聚合;其 Overall 与表 2 不同,不能混用两表数值计算所谓整体提升。

实验关键数据

主实验

下表摘自原文表 2,第 9 页;四列数值均为百分数,Overall 按三个原型均衡平均。 F1 指证据文件集合 F1,Acc 指 LLM 裁判的回答正确率;人类行是无人工时间上限的可解性参照。

方法 画像 F1 画像 Acc 事实保留 F1 事实保留 Acc
Standard RAG 18.4 26.7 30.0 30.2
Self-RAG 15.2 10.0 31.9 27.5
ReAct (Qwen3-30B-A3B) 11.8 13.5 43.1 28.5
ReAct (Gemini-2.5-flash) 18.5 20.0 26.5 38.7
Search-R1 10.8 5.0 41.0 25.3
Terminal Agent (GPT-5.2) 11.1 30.0 24.6 48.2
ChatGPT Agent Mode 21.0 48.3 35.3 62.8
Human Solvers (3 non-author) 88.0 87.0 89.0 82.0

ChatGPT Agent Mode 的画像 Acc 比人类低 38.7 个百分点,事实保留 Acc 低 19.2 个百分点。 不过它并非所有指标最高:事实保留 F1 为 35.3,低于 ReAct (Qwen3) 的 43.1。 因此,原文对“最高整体分数”的概括不能扩展为该系统在所有 F1/Acc 列上均占优。

消融实验

本文没有新模块的移除式消融,以下采用原文表 3,第 12 页的能力分组分析。 仅摘录画像任务的 Acc,各列按能力标签聚合,不是独立模块的成功率,也不与表 2 的原型均衡平均等价。

方法 搜索 Acc 感知 Acc 推理 Acc 能力分组 Overall Acc
Standard RAG 26.2 13.8 25.5 21.8
ReAct (Qwen3-30B-A3B) 26.1 16.7 23.9 22.2
Search-R1 24.9 15.7 25.8 22.1
Terminal Agent (GPT-5.2) 46.3 27.3 44.1 39.2
ChatGPT Agent Mode 56.5 28.5 55.8 46.9

ChatGPT Agent Mode 的画像感知 Acc 为 28.5%,搜索 Acc 为 56.5%,两者相差 28.0 个百分点。 这支持异构内容转化为可靠证据仍很困难,但标签分组对比不能单独确定某个感知组件的因果贡献。

关键发现

  • 表 2 中 ChatGPT Agent Mode 在 Adam 上的事实保留 Acc 为 90.3%,在 Bei 上仅为 31.2%。作者将这种差异联系到文档结构明确程度、实体边界和媒体噪声,而非简单断言法律问题更容易。
  • 表 2 中 ReAct (Qwen3) 的事实保留 F1/Acc 为 43.1/28.5,而 Terminal Agent (GPT-5.2) 为 24.6/48.2。两组相反的差异说明检索质量与答案质量必须分别测量。
  • 第 14–15 页报告,在失败输出中,检索不匹配的占比从单模态的 40.7% 上升到至少三种模态的 87.0%;这些是错误类型构成比例,不是所有问题上的失败率。

亮点与洞察

  • 设备级文件结构被纳入评测对象,而不只是把文件转成一组语义向量。这能暴露目录层级、时间痕迹与附件关系对真实检索的影响。
  • 同时要求答案和证据,能识别仅靠合理措辞掩盖证据缺失的系统。对个人助理而言,这比只看回答是否流畅更接近实际可靠性需求。
  • 图 5,第 14 页展示了“找到了真实材料,但把用户健康问题回答成宠物护理”的实体误归属。它说明检索正确之后仍需要显式绑定问题主体和证据主体。
  • 可迁移的设计启发是先缩小到最小充分证据集,再生成和核验结论。这是作者提出的系统设计方向,不是本文已经训练并验证有效的新组件。

局限与展望

  • 三个聚合原型和仅 60 个画像问题限制了人群、职业与长期行为的覆盖,不能把结果视为个人电脑助理的总体使用成功率。
  • 系统工具、平台预算和接口并不完全相同,人类也仅作可解性参照。主文还报告强托管系统经常每题耗时 10–15 分钟,准确率之外仍有成本和稳定性问题。
  • 裁判与标准证据集都有边界:二元正确性依赖裁判判断,替代但有效的支持文件也可能未被标准集合完整覆盖。后一项是读者对文件级指标的评估风险判断。
  • 当前缓存未含补充材料,无法核验预算、重试、裁判校准及隐私审核的完整细节;图 2 等密集图形的文本抽取也有损坏,笔记不从损坏图中文字恢复未确认数字。
  • 原文第 13 页概括画像感知 Acc 的下界为 13.2%,但表 3 的 Qwen3-VL 终端行列出 5.7%。本笔记不沿用该范围概括,具体分析按清晰的表格行读取。
  • 后续值得检验结构感知搜索、实体关系记忆与最终证据核验能否在统一预算下改善表现,并扩展到文件持续变化和可撤销用户授权的环境。这些是研究方向,不是现有实验结论。

相关工作与启发

  • vs WebQA / MultimodalQA:这些工作强调异构内容中的检索与问答,HippoCamp 进一步把长期个人上下文、文件层级与实体归属纳入同一环境,代价是标准化和覆盖规模更受约束。
  • vs M3DocRAG / MMDocRAG:文档型系统擅长从文档集合定位内容,但个人电脑还包含音视频、日历和用户生成冗余,文档相关性不足以替代用户级证据一致性。
  • vs PersonaAgent / Telemem:它们研究怎样构造与使用用户记忆;HippoCamp 主要提供评测环境,并不声称提出优于这些记忆架构的学习机制。
  • vs ReAct / Search-R1:搜索与推理循环能改善证据发现,但表 2 表明其收益未自动转化为画像能力,值得进一步研究候选证据筛选和实体绑定。
  • 资源与依据:官方论文页与数据集链接见元数据;数据与任务依据主文第 3 节,第 5–8 页,协议依据第 4.1–4.3 节,第 8–10 页,失效分析依据第 5 节,第 11–15 页。

评分

  • 新颖性: 4/5。把长期个人文件生态与可定位证据结合,问题设置比单纯扩大文档问答规模更有辨识度。
  • 实验充分度: 4/5。覆盖多类系统、人类参照及能力分解,但原型数量有限、预算异构且完整复现细节依赖补充材料。
  • 写作质量: 4/5。任务边界与典型失败有解释力,但个别范围和最优指标的文字概括需要与表格对读。
  • 价值: 4/5。为本地个人助理提供具体的可靠性诊断目标,但不能代替真实动态设备上的长期部署评估。