HippoCamp:个人电脑上下文智能体基准测试

HippoCamp: Benchmarking Contextual Agents on Personal Computers

arXiv: 2604.01221v1

论文信息

标题: HippoCamp: Benchmarking Contextual Agents on Personal Computers

作者: Zhe Yang, Shulin Tian, Kairui Hu, et al.

发布日期: 2026-04-01

arXiv ID: 2604.01221v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决如何系统评估多模态智能体在真实个人电脑上管理文件、进行上下文感知的检索与推理的能力,尤其是记忆增强的智能体在个人文件系统上的表现。
  • 核心方法:作者构建了三个原型个人文件系统(共 42.4 GB、超 2K 文件),并在此基础上生成 581 个 QA 对和 46.1K 密集注释的结构化轨迹,用以评估多种 RAG、搜索智能体和自主智能体系统。
  • 关键结果:即便最强的商业模型(ChatGPT Agent Mode)在用户画像(profiling)任务上准确率也只有 48.3%,远未达到可靠水平;失败主要集中在多模态感知和证据接地阶段。
  • 主要局限:基准采用静态文件系统快照,未模拟动态演化的设备环境;当前的评测主要围绕单轮问答,缺乏对持续学习与长期记忆更新的评估。
  • 适合读者:从事多模态大模型、智能体系统、个性化助手、检索增强生成以及用户建模研究的研究者与工程师。

论文背景和研究动机

近年来,大语言模型和多模态模型推动着智能体在感知、推理与行动上的进步,个人数字环境成为一项关键应用。然而,现有的智能体基准大多聚焦于网页导航、工具调用或通用软件自动化,忽略了个人计算中最核心的挑战:如何在海量、异构、长期演化的个人文件中进行上下文感知的搜索与推理。这些文件包含文本、图像、音频、视频等不同模态,并嵌入了用户的行为习惯、社交关系和规划信息,要求智能体像人脑中的海马体一样进行上下文的记忆巩固与回想。

已有的文档检索或任务规划基准(如 WebQA、GAIA、MMDocRAG 等)虽然推动了多模态理解,但它们依赖公开数据或有限的任务范围,并未考虑用户级别的个性化背景与文件系统结构。因此,论文提出了 HippoCamp,一个旨在评估记忆增强智能体在真实个人计算环境中能力的全新基准,明确聚焦于设备规模的文件系统、跨文件长期推理与用户画像推断。

核心方法和技术细节

HippoCamp 的核心设计与实现分为三个层面:真实的个人计算环境构造、任务体系定义,以及精细的注释方案。

个人文件系统构建

作者通过访谈 100+ 名真实用户,筛选出具有稳定行为痕迹和跨文件证据链的参与者,并将其设备中的文件聚合为三个原型用户档案:

  • Bei Weiwei:学生及内容创作者,文件多模态分布广泛(图像 38.5%、视频 18.1%、音频 9.8%),包含课程、剪辑、社交与旅行记录。
  • Adam Turner:法律事务主管,文档占主导(79.9%),含邮件、法律文件、日历等结构化的专业材料。
  • Victoria Anne Clarke:高级财务分析师,同样是文档密集型(83.5%),并包含大量金融报告、录音和表格。

每个档案的文件系统均保留深度文件夹层级、长尾文件格式(超过 20 种扩展名)以及时间跨度数年的元数据,数据总量达 42.4 GB。为保护隐私,原始文件经过脱敏处理,用统一的假名替换敏感标识符,并删除了系统生成的临时文件。

(见论文 3.1 节和附录 A)

任务体系:事实保留与用户画像

基准定义了两种互补的任务类型:

  • 事实保留(Factual Retention):要求智能体检索并推理分布在多模态文件中的确切事实,例如 “找到符合日本签证要求的照片”。该类任务共 521 个 QA,平均每个问题关联 4 个文件和 2 种模态。
  • 用户画像(Profiling):要求智能体跨文件、跨时间地聚合个人事实,推断出用户的习惯、喜好、日程等高层级特征,例如 “我的星期三通常是怎么度过的?”。该类任务共 60 个 QA,平均涉及 15 个文件和 3 种模态。

所有 QA 都凭据真实文件证据可回答,并且答案经过人类验证,确保事实正确且上下文无冲突。

(见论文 3.2 节)

结构化注释体系

HippoCamp 最具特色的是其精细的注释方案。每个 QA 对都被构建为一条 结构化轨迹 JSON,包含:

  • 问题与答案,以及回答所需的最小证据文件集合。
  • 分步推理链(rationale),将任务分解为规划、导航与阅读、整合与验证三个标准化阶段。
  • 局部化证据对象(evidence),带有文件路径、页/时间戳等定位器,支持到具体内容原素的原子单元(AU)级接地。
  • 能力标签(agent capability),标注每一步所需的搜索、感知和推理能力(如图 4c 所示)。

总体提供 46.1K 个这样的密集注释单元,使得评测可以精确诊断智能体在搜索、多模态感知和推理各环节的失败原因。

(见论文 3.1 节和附录 B)

创新点和贡献

HippoCamp 在前人工作基础上做出了多项重要创新:

  1. 首次引入真实的个人文件系统作为智能体评测环境。与以往使用孤立网页或单模态文档的基准不同,该基准再现了多层文件夹、数十种文件类型和跨文件相互引用的复杂生态,更贴近实际个人 AI 助手的工作场景。
  2. 提出事实保留和用户画像的双层任务架构,明确区分单步检索和长期聚合,迫使智能体不仅要找到文件,还要将其综合为连贯的用户模型。
  3. 提供了极细粒度的诊断注释,从文件级证据到原子单元级定位,配合分步推理链和能力标签,支持对搜索、感知、推理各阶段的错误进行定位,为开发下一代文件系统智能体指明了改进方向。

(见论文第 3 节)

实验结果分析

作者评估了多种代表性的 RAG、搜索智能体与自主智能体方法(见表 2)。主要发现:

  • RAG 方法表现整体较差:标准 RAG 在画像任务上的 F1 仅为 18.4%,准确率 26.7%。检索经常返回主题相似却无关的文件,导致证据生成时缺乏跨文件聚合能力,甚至在某些档案上准确率为 0%。
  • 多步搜索智能体有提升但仍不足:基于 ReAct 和 Search‑R1 的方法在事实保留上有所改善(如 ReAct + Gemini‑2.5‑flash 在 Adam 档案上准确率达 55.3%),但画像准确率大幅下降(Search‑R1 仅 5.0%),表明仅靠轮次搜索无法处理长期用户建模。
  • 自主智能体中 ChatGPT Agent Mode 整体最强,画像准确率 48.3%,事实保留准确率 62.8%,但其计算代价极高(单次查询需 10–15 分钟),且仍有严重的混淆实体、错误接地等问题。
  • 能力分解证明感知是最大瓶颈:无论是画像还是事实保留,所有方法的感知准确率都显著低于搜索准确率(如 ChatGPT Agent Mode 画像搜索准确率 56.5%,感知仅 28.5%),说明将 PDF、日历、语音备忘录等异构文件转换为可推理证据的过程是最薄弱的环节。

(表 2 和表 3)

进一步的失败案例分析(图 6)归纳出五类典型错误:检索不匹配、接地回避、硬证据幻觉、实体错配和缺乏验证,说明当前系统在检索后的证据筛选、跨模态绑定和最终答案验证上存在系统性的缺陷。

实践建议

论文第 5.3 节直接给出了设计下一代文件系统智能体的原则,为实际开发提供了行动指南:

  • 结构感知搜索:不应将所有文件压平为一个向量索引,而应利用文件夹层级、附件关系、版本历史等元数据作为搜索的归纳偏置,减少主题相似但语境不相关的检索错误。
  • 证据窄化后回答:在生成最终答案前,智能体应先将候选文件集缩到一个最小、一致的支撑集合,而不是简单地从所有检索结果中泛化,这有助于缓解检索召回率高但答案准确率低的矛盾。
  • 档案内实体建模:个人文件系统中往往同时存在用户本人、家人、宠物、同事等多个实体,智能体需要显式维护和更新这些指代模型,避免将 “我” 的行为错误赋予他人。
  • 验证循环作为必备阶段:智能体架构应增加明确的证据再绑定与矛盾检查阶段,确保最终回答可追溯到具体文件位置,从而抑制硬证据幻觉和实体错配。

这些设计方向已在 HippoCamp 的失败诊断中得到实证,有望推动个人 AI 助手从 “能搜索” 向 “能理解并可靠服务” 的真实用户体验迈进。