用于长周期生产力模拟的大规模合成计算机

Synthetic Computers at Scale for Long-Horizon Productivity Simulation

arXiv: 2604.28181v1

论文信息

标题: Synthetic Computers at Scale for Long-Horizon Productivity Simulation

作者: Tao Ge, Baolin Peng, Hao Cheng, et al.

发布日期: 2026-04-30

arXiv ID: 2604.28181v1

PDF 链接: 下载 PDF

3 分钟速览

研究问题:这篇论文试图解决如何大规模生成逼真的、长期限的生产力模拟数据,从而帮助 AI Agent 在真实工作场景中自我改进。

核心方法:从十亿级人物画像出发,用大语言模型逐步生成包含完整目录结构和内容丰富的文件(文档、表格、演示稿)的合成计算机环境,然后让两个 Agent 在这些环境中进行约一个月工作量的长期模拟。

关键结果:从 900 次模拟中提取的职业特定技能使 Agent 在 100 台新合成计算机上的表现从 61.6% 提升到 68.6%,并且在外部基准测试上也取得显著优势(技能增强版 105 胜 67 负,p=0.002)(见论文第 4.3-4.4 节)。

主要局限:合成文件的视觉风格较为统一,文件系统缺乏真实计算机中常见的临时文件、重复版本等 “噪声”,模拟中的协作者交互是单向被动的,未能体现真实组织中的动态变化。

适合读者:对 AI Agent 长期规划、强化学习环境生成、合成数据规模化、生产力自动化等领域感兴趣的研究者和工程师。

论文背景和研究动机

随着 AI Agent 从对话助手(如 ChatGPT)向代码仓库 Agent(如 Cursor)演进,再到立足整个用户计算机的长期限 Agent(如 Claude Cowork),业界对 Agent 的生产力期望也在持续升级。这类 Agent 需要完成的不再是简单的指令执行,而是包括信息收集、证据分析、多方协调和成果交付在内的复杂工作流。

然而,这一方向面临一个根本性困难:真实的长期工作轨迹高度依赖用户的私有计算机环境,其中包含了个人文件、企业文档、项目状态和交互历史。这些数据因隐私原因难以大规模收集,导致适合训练和评估的 “落地” 环境严重不足。

论文指出了一个关键观察:单纯合成任务而不合成任务所处的上下文,会使数据退化到脱离实际的 “玩具工作流”。因此,真正的挑战在于如何同时大规模创建逼真的计算机环境和工作过程。这正是本文 “Synthetic Computers at Scale” 方法论想要填补的空白。

核心方法和技术细节

论文提出的方法包含两个主要阶段:合成计算机创建(第 2 节)和长期限生产力模拟(第 3 节)。

合成计算机创建:从人物画像到完整计算机环境

整个过程从一个人物画像出发。例如,一个 “专注于评估不同资产类别长期表现的金融顾问” 的简短描述,会先被大模型扩展为详细的用户档案,包含身份、职业、组织、职业阶段、职责、近期工作历史、当前项目、协作者、常用工具、文档习惯等数十个维度的具体信息。

基于这份档案,系统生成一份文件系统策略,规定这台计算机的基本组织原则,包括系统起始时间、驱动器布局、默认路径、存储模式、命名约定和使用模式。例如,某个用户使用 “C 盘管系统,D 盘管数据” 的布局,Office 文件和项目工作分门别类放在 D 盘的三个文件夹中,下载内容可能散落在不同位置。

接下来是文件系统规划阶段:系统根据用户的项目、职责和习惯,推断出一个完整的文件清单,包括每个文件的逻辑路径、工件类型、描述、时间戳、来源和内容模式。这一步的核心创新是构造了一张文件依赖图,显式建模文件之间的关系——后面的文件可能引用、总结、修订或引用前面的文件。当一个 Excel 工作簿被标记为 “派生自某 PDF” 时,生成该工作簿时就必须以那个 PDF 的内容为条件。

在实际创建阶段,论文采用依赖感知的拓扑排序:依赖图中入度为零的文件先生成,每个生成的文件再为下游依赖文件提供上下文。对于公共可下载的文件(如某机构的年度经济展望 PDF),系统优先尝试从网络下载真实文件,失败时才回退到合成。

最终生成的合成计算机平均包含约 112 个文件(见表 1),其中 67.8% 是办公文档(DOCX 占 34.8%、XLSX、PDF、PPTX),其余为代码、文本、图像和结构化数据格式(见图 5)。

长期限生产力模拟:双 Agent 协作

给定一台合成计算机后,系统运行两个不同角色的 Agent。

设定 Agent首先根据用户档案和计算机当前状态,创建该用户未来约一个月(20 个工作日)的生产力目标。这些目标通常包含多个需要交付的专业工作包,每个包明确了具体成果、里程碑和预期文件。例如,前述金融顾问的月度目标包括:刷新三种模型组合、完成一位高净值客户的新入入单、优化再平衡工具体系、提交另类资产研究建议、完成 ESG 覆盖层建议——共五个交付包,涉及数十个中间和最终交付件。

一个关键创新是协作设定:模拟不假设所有信息都已知且 Agent 可独立完成任务。设定 Agent 会创建一组模拟协作者——经理、客户、合规官、外部专家等——每人配有角色、背景、沟通风格、相关知识,以及某些情况下持有的私有参考文件。这些私有文件只有在 Agent 主动与协作者沟通后才可能获得,从而模拟了真实工作中 “信息不对称” 和 “需要主动协调” 的特征。

工作 Agent然后扮演该用户,按周计划和日执行的双循环推进。每周初创建当周计划,指定每天要进行的活动类型(深度工作、审阅、管理清理、外联等),以及每项活动需要创建或修改的文件、参考的源文件和需要联系的人。每天作为一个独立 Agent 会话执行:恢复工作上下文、检查计算机状态、阅读协作者的新回复、按计划执行活动,最后记录新文件、修订内容和交互历史。

平均每次模拟 Agent 运行超过 8 小时,历经 2,272 个对话轮次,涉及约 31 次协作者沟通(见表 3)。

创新点和贡献

从任务合成到环境合成的范式转变。传统合成数据方法关注 “生成更多任务”,而本文的核心洞见是:生产力工作天然落地于丰富的上下文。通过先合成完整的用户计算机环境(包含其文件历史、项目状态、依赖关系),再进行长期模拟,才能产生与现实工作场景接近的体验数据。

文件依赖图的引入。在合成计算机创建中显式建模文件之间的引用、派生、版本关系,使生成的工件更接近真实工作场景中的 “知识积累” 过程,而非相互独立的文件集合。

多层信息不对称的协作模拟。协作者拥有私有参考文件,Agent 需要主动沟通才能获取信息——这模拟了真实生产力工作中的信息获取和协商过程,也使模拟轨迹包含了比单纯文件操作更丰富的学习信号。

技能提炼与经验闭环。论文展示了从模拟轨迹中抽取出职业特定技能,再用于提升 Agent 表现的完整循环。随着训练计算机数量增加至 900 台,技能增强版 Agent 在 100 台新计算机上的胜率从无优势逐步增至 83%(见图 7),证明了规模化训练的效果。

跨领域迁移能力的验证。在外部基准 GDPVal 上(一个与本文模拟差异显著的公开生产力测试集),同模型提取的技能仍带来显著提升(105 胜 67 负,p=0.002),说明提炼出的经验并非对模拟环境的过拟合,而是捕捉到了一定的通用生产力工作模式。

实验结果分析

合成计算机的统计特征

表 1 显示,每台合成计算机在模拟前平均有 111.6 个文件和 30.4 个目录,平均目录深度 3.39 层。模拟一个月后,文件数增长到 197.4 个(增约 77%),但目录深度几乎不变,说明 Agent 主要在现有组织框架内创建和修订文件,而非产生不切实际的目录结构。

表 2 中的文件大小数据值得关注:最终交付的演示文稿平均达 615KB(中位数 576KB,95 分位数 1.2MB),PDF 文件平均 382KB(中位数 83KB,95 分位数 1.1MB)。这些数据表明生成的工件是内容丰富的专业文件,而非轻量占位符。

交付质量评估

论文对 100 台计算机进行了基于评分准则的交付质量评估。准则生成方法很有匠心:针对同一组生产力目标运行五次模拟,每次生成一个评分准则草稿,然后合成为一份更全面的最终准则(示例准则包含 55 个评分项、总分 176 分)。

评分结果(见图 6):大多数模拟的总体评分在 60%-80% 之间。按每个交付物单独评估时,分布也集中在类似区间。论文特别指出,即使最终交付件看起来合格,也可能依赖于薄弱的落地上下文、遗漏了协作者反馈或经历了不必要的返工——因此对完整轨迹的分析同样重要(第 4.2.2 节)。

职业技能的规模化效果

图 7 展示了训练计算机数量如何影响技能的效果。仅用 10 台训练计算机时,技能增强版相比基线无优势。论文分析认为原因在于职业覆盖率不足——很多测试计算机没有匹配的职业技能,使用了无关技能甚至可能损害表现。当训练计算机增至 100、500、900 台时,胜率分别升至 64%、75% 和 83%,呈现出清晰的规模效应。

领域外泛化验证

表 5 对比了本文模拟和 GDPVal 基准的关键差异:本文的任务平均有 13.8 个显式参考文件和 112 个计算机文件,GDPVal 只有 1.18 个参考文件;本文平均 2,272 轮次、8.59 小时,GDPVal 是 31 轮次、17 分钟。在这种明显的领域差异下,技能增强仍带来显著提升(图 8),效果在使用相同模型提取技能时最为明显(105 胜 67 负,p=0.002)。跨模型迁移(将 Sonnet 上提取的技能用于 Haiku 和 Opus)也有正向效果,但幅度减弱——论文认为这是因为 Opus 本身已较强且能自行避免许多 Sonnet 容易犯的错误,而 Haiku 则受到长上下文压力的制约。

实践建议

对于希望将合成计算机方法论应用于自身研究或开发的团队,以下几个方向值得关注:

用大规模合成环境替代稀缺的真实数据。如果研究涉及需要在用户的完整计算机上下文(而不仅仅是单个代码仓库或文档集)中工作的 Agent,直接使用真实的私有环境在数据收集和隐私合规上都存在瓶颈。合成计算机提供了一种从人物画像出发、系统构建多样化环境的方法,且论文已验证其产生的经验信号可迁移到外部基准。

提炼职业特定经验而非通用指令。论文的做法是:先基于人物画像的职业(如 “金融顾问”、“软件工程师”)对经验进行分组,再按频次排序提炼该职业的最高频成功模式和失败模式,最后编写为针对该职业的工作技能。这种职业驱动的分组方法(而非合并所有数据)可能是提升技能相关性和有效性的关键。

引入信息不对称以模拟真实协作。在生产力 Agent 评估中,不应假设所有信息都可直接获取。让评估设定中包含持有隐藏信息的模拟协作者,可更真实地测试 Agent 在信息不完整环境下的主动协调能力——这也更接近人类在处理复杂工作时的实际情境。

关注文件系统中的 “自然噪声”。论文承认当前合成计算机偏 “干净”(第 5.3 节),缺乏真实计算机中常见的临时下载、重复草稿、废弃文件、误下载的视频等痕迹。在工程实践中引入一定比例的随机文件、版本混乱或不完全迁移的数据,可能使模拟环境更接近真实工作条件,从而提高从中提炼的经验的泛化能力。