从计算机使用痕迹中归纳任务模型
Inducing Task Models from Computer-Use Traces
论文信息
标题: Inducing Task Models from Computer-Use Traces
作者: Yucheng Jiang, Zora Zhiruo Wang, Ruishi Chen, et al.
发布日期: 2026-08-20
arXiv ID: 2608.20319v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何从被动记录的计算机使用轨迹中,不预设任务集合与边界,自动发现交织的潜在任务并为每个任务归纳符号化、可审计的任务模型。
- 核心方法:TMI 三阶段流水线——事件接地与活动切分、潜在任务归纳、目标模型与过程模型独立归纳后对账融合。
- 关键结果:在受控人类轨迹的合成交织设置下,潜在任务恢复 ARI 达 0.974(表 1);步骤描述准确率 74.9%,对照工作流摘要基线 30.3%(表 4,gpt-5.5 评判器)。
- 主要局限:原始轨迹可能含个人可识别信息,论文自述部署前需隐私脱敏,但脱敏对归纳质量的影响未被研究。
- 适合读者:GUI / 计算机使用智能体、过程挖掘、用户行为建模、LLM 轨迹理解方向的从业者。
论文背景和研究动机
计算机使用智能体进入真实工作后,需要学习任务实际如何完成,组织也需要审计和复用这些知识。被动记录的使用轨迹(截图 + 键鼠事件)蕴含大量未成文的经验,但论文指出三层挑战:信号层,光标坐标、按键、像素几乎无语义;结构层,真实工作多任务交织,用户频繁切换目标且子目标相互穿插;表示层,轨迹只记录被执行路径,不直接暴露目标层级与控制流。
已有方法各有缺口:LLM 摘要会把并发任务混成自由文本,丢失目标层级和控制流;直接提示 LLM 生成任务模型能恢复模式骨架,但缺执行结构;工作流归纳把整段轨迹当作一条连续流程,任务仍缠结、子目标被压平;轨迹分析方法则预先假设根任务已知。本文要做的,是在无预设任务、无边界标注、无任务描述的前提下,从原始轨迹联合发现任务并归纳模型。
核心方法和技术细节
TMI 分三阶段(图 2)。
接地与切分(§3.1)。视觉-语言模型接收包围每个事件的截图对 与操作 ,输出做了什么、作用于哪个工件、在哪个应用,并做 OCR。接地只能依据可见证据,后续截图只用于消歧,不做事后意图归因。之后分两层:合并连续事件为 “语义动作”,再合成 “活动”,后者是任务归属的原子单位。语义动作沿反向切分(后续事件才能确认工件新状态),活动沿正向切分(前置上下文才表明目标被采纳),这一方向选择依据事件切分理论。
潜在任务归纳(§3.2)。任务档案含目标摘要与工件、实体标识符,活动按时间顺序就近加入已有任务或开新任务;标识符让任务在应用切换、别名变化下不被拆散;轨迹结束后全局合并追求同一目标的任务。该设计明确允许任务占据非连续时间片段,是对多任务现实的关键建模选择。
任务模型构建(§3.3)。对每个任务先独立归纳:目标模型 递归分解 “需要达成什么”;过程模型 用 sequence、for-each、while 三种算子表达 “执行如何组织”,selection 因轨迹不含未选分支而省略(结构化程序定理约束下的可观察子集)。二者随后对账融合为 ,每个节点同时携带目标与控制流算子。对账规则:双方同意的边界保留;过程模型显示循环而目标模型拆分时保留一个迭代阶段并嵌套子目标;过程模型仅平坦 sequence 时采纳目标模型语义边界;两者都无结构时从轨迹直接推断。附录 A 给出形式有效性约束,如完备性、无重叠、for-each 迭代变量必须绑定显式集合、while 必须有客观状态退出条件。
实现统一使用 gpt-5.4(温度 1.0),gpt-5.5 与 claude-sonnet-5 作独立评判器,gpt-5-mini 生成技能并执行下游任务。
创新点和贡献
其一,形式化定义任务模型为 “层级目标分解 × 结构化控制流” 的对偶结构,理论依据来自计算思维与结构化程序定理,区别于此前扁平的工作流摘要。
其二,TMI 首次在该设置下把 “发现潜在任务” 与 “归纳任务模型” 联合建模:任务集合、边界、事件到任务的归属都不预先给定,且任务可占据非连续片段。
其三,目标与过程分离再对账是关键设计。消融显示,无对账的联合单遍归纳节点数更少(均值 8.6 vs 19.5,附录 E),步骤描述准确率 56.0% 低于完整方法 74.9%(表 4,gpt-5.5 评判器,§4.3);论文还报告过程模型纠正 64.5% 的目标节点边界,目标模型纠正 21.9% 的过程节点边界并改变 0.6% 的控制流算子(§4.3)。
实验结果分析
潜在任务归纳鲁棒性(表 1)。用 HumanWork 真实会话构造合成交织轨迹( 个任务各切 段后打乱,,),整体 ARI 0.974、任务数 MAE 0.48; 从 2 增至 4,ARI 从 0.980 降至 0.968,呈有限下降。这是合成受控重构结果,不应直接外推到所有真实会话。
任务身份稳定性(表 2)。HumanWork 全部 38 会话上,诱导任务集与标注任务的匹配率 gpt-5.5 为 94.74%、claude-sonnet-5 为 89.47%;SkillsBench 成功运行上分别为 93.24% 与 98.65%,跨评判器家族一致。
保真度(表 4)。gpt-5.5 评判下,步骤描述准确率 74.9%(工作流摘要 30.3%、直接生成 23.4%),算子正确性 88.5%(直接生成 52.7%);目标覆盖率 4.34,高于直接生成的 4.00。非线性片段中,89% 会话含错误纠正、87% 含探索性搜索(表 3);纠错主导节点步骤描述准确率 66.7%,仍高于工作流摘要基线的 30.3%,但边界落地最弱(纠错 59.6% vs 干净跨度 79.0%)。
下游迁移(表 5)。SkillLearnBench 上,以任务模型为学习来源生成的技能,held-out 准确率 18.57%(原生轨迹 11.43%、工作流摘要 14.29%,相对工作流摘要提升 30.0%),可执行性 67.65%(对比 59.35%)。人工 curated 技能覆盖率最高(93.59%)但准确率仅 10.00%,论文据此指出技能覆盖率与下游准确率在该设置下并不同步。
实践建议
对 GUI / 计算机使用智能体团队,最直接的启示是把 “任务模型” 作为从轨迹到可复用技能的中间表示,而非直接使用原始轨迹或自由摘要。第 5 节评测在 SkillLearnBench 上为这一选择提供了有限但有方向性的证据(表 5)——但该结论受特定基准与 gpt-5-mini 执行环境限制。
可落地做法有三。一,将流水线解耦为接地、任务发现、建模三层,便于独立替换模型与调优;本文整体用 gpt-5.4,但各阶段接口是模块化的。二,采纳 “双视图分别归纳 + 对账” 而非单遍联合生成:在论文设置下,单遍联合生成过程保真度更低、结构更粗(表 4,§4.3,附录 E)。三,处理含屏幕内容的真实轨迹前,先做截图与键盘事件脱敏,并在部署场景中评估脱敏对归纳质量的影响——这是论文明确留待未来工作的部分。对需要可审计决策记录的领域,目标层级 + 可观察控制流的表示可作审计模板参考,但迁移前需先做等价性验证。论文附有开源代码库。