GameHorizon 套件:游戏玩法中的多时间尺度数据与评估
GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
论文信息
标题: GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay
作者: Yiran Wang, Xingyilang Yin, Junfu Pu, et al.
发布日期: 2026-09-21
arXiv ID: 2609.25001v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:现有游戏数据集与评测基准要么只覆盖少数游戏或小游戏,要么缺乏自然语言指令,要么依赖高方差、样本量不足的在线测试,难以统一比较不同模型家族在多个时间尺度上的游戏能力。
- 核心方法:提出 GameHorizon Suite,包含自动多尺度指令标注流水线、5000 小时 AAA 游戏数据集,以及可复现离线评测与分步在线评测相结合的基准。
- 关键结果:在离线基准上,47 个模型的平均准确率为 64.7%,其中 GPT-6-Astra 最高达到 80.2%;单时间尺度动作任务最难,平均仅 57.3%(见论文第 4.2 节)。
- 主要局限:在线轨道因多数 AAA 游戏底层状态不可访问,仅在 Minecraft 中实现;离线 MCQ 虽可复现,但无法完全替代真实操控中的连续决策与执行误差。
- 适合读者:研究游戏智能体、视觉-语言-行动模型、多模态评测、具身智能与强化学习评估的研究者和工程师。
论文背景和研究动机
现代 AAA 游戏为 AI 模型提供了综合测试环境:模型需要同时完成视觉理解、指令分解、目标规划和精细动作控制。这些能力跨越不同时间尺度,从几秒内的操作,例如拾取物品,到数分钟的战斗,再到贯穿整局的长期策略。论文指出,当前模型可分为两类:专用游戏智能体擅长高频动作控制,但牺牲了长时规划与推理能力;通用视觉语言模型擅长规划,却很少在动作执行上被系统测量。现有评测往往依赖定制 agent harness,导致结果难以跨模型比较。
现有数据与基准还有三个突出问题。第一,游戏覆盖狭窄,很多工作只围绕 Minecraft 或简化小游戏。第二,语言指令标注不完整,Nitrogen 和 GameVerse 等数据集完全省略指令,Open-P2P 指令非常稀疏,而 Game-TARS 依赖人工标注、成本高且未公开。第三,在线评测通常只有极少量 rollout,例如 Lumine 每场景仅测 3 次、GameVerse 仅 3–20 个案例,置信度低且难以复现;总成功率还会掩盖 “看错当前动作”“推错未来目标”“无法把目标映射为控制” 等不同失败模式。GameHorizon 正是为了解决这些缺陷而提出的统一标尺。
核心方法和技术细节
GameHorizon Suite 由三部分构成。
GameHorizon-Annotator 是一个自动生成三层指令金字塔的流水线。输入是同步采集的游戏视频与键鼠动作。首先做 “动作感知分割”:与依赖帧间视觉相似度的 PySceneDetect 不同,它使用键鼠轨迹识别关键动作转换,避免快速镜头移动导致过分割;遇到同一输入可能对应多种语义的情况,例如左键既可进攻也可选物品,由 VLM 查看视频帧消歧。然后自底向上合并:相邻的短期片段根据动作连续性和语义一致性,用 VLM 判断是否属于同一中期目标,再继续合并为长期策略;动态规划用于限制各层时长范围,短期 1–5 秒、中期 1–2 分钟、长期 5–8 分钟。最后做多尺度指令标注:短期指令使用视频帧和动作输入,要求包含坐标、物体描述、空间关系等细节;中期指令输入帧、动作和组成该片段的短期指令;长期指令输入帧和中期指令,但不输入动作,以保持策略层的抽象性。
GameHorizon-Data 由 100 名有经验人类玩家录制,最初包含 21 款游戏、5000 小时视频,动作事件总计 4.1103 亿个。过滤低质量内容后,4341 小时用于指令标注,得到 5,947,588 条短期操作、189,158 条中期目标和 47,290 条长期策略。平均每条短期指令覆盖 2.63 秒,每条中期指令覆盖 82.6 秒,每条长期指令覆盖 330.4 秒。论文对比已有数据集后认为,这是首个同时具备大规模 AAA 游戏覆盖、直接人类动作和密集多尺度指令的公开语料(见表 2)。
GameHorizon-Bench 包含两条评测轨道。离线轨道把任务形式化为四选一 MCQ,共 5000 题。三个主任务分别是:T1 单时间尺度动作,给定帧和短期指令,选择正确的动作序列;T2 多尺度分解,给定中期目标,选择正确的短期操作序列;T3 跨尺度一致性,选择与视频、指令、动作整体对齐的选项。另有十个变体任务用于诊断,例如比较当前动作感知与未来动作规划、比较自顶向下分解与自底向上抽象、比较是否包含动作序列。在线轨道通过 10 个因果任务和 10 个主题任务、共 62 个可验证的短期子任务来评估长时游戏能力。因果任务要求固定执行顺序,例如先挤牛奶、再做蛋糕、最后放到餐桌;主题任务的子任务可按任意顺序完成。子任务失败后环境会重置到该步骤成功状态,从而把失败定位到具体环节。
创新点和贡献
论文的核心创新在于第一次把 “多时间尺度指令” 与 “直接人类动作” 在大型 AAA 游戏数据中系统对齐。此前的数据集要么没有指令,要么指令稀疏、时域单一;GameHorizon-Annotator 以自底向上方式生成密集的三层指令金字塔,并设计了配套的离线/在线双轨评测。另一个值得注意的设计是 “自底向上标注、自顶向下评测” 的互补逻辑:实验表明,自底向上抽象平均准确率为 98.4%,而自顶向下分解仅 69.5%(表 13),因此前者的低错误率适合生成标签,后者的高难度适合测试模型,两个方向各司其职。
在评测协议上,离线 MCQ 通过标准化输入和选项实现可复现比较,在线分步协议则用于验证离线分数是否真的能预测实际游戏能力,并避免此前总成功率的诊断盲区。论文还覆盖了 47 个模型、超过一百万次模型调用,包含通用 VLM、统一多模态模型、GUI 智能体、编码智能体和专用游戏智能体五类,模型多样性明显高于以往工作。
实验结果分析
离线主任务呈现稳定的难度梯度:T1 平均 57.3%,T2 平均 65.1%,T3 平均 71.6%,所有模型总平均 64.7%,随机基线为 25%(见表 4)。T1 最难,因为要严格匹配真实键鼠动作轨迹;T3 因选项包含更多跨尺度语义信息,准确率最高。模型间差距明显,总准确率从 44.6% 到 80.2% 不等。GPT-6-Astra、Gemini 3.8 Flash、Gemini 3.7 Flash 位居前三。专用游戏智能体在未见过的 AAA 游戏上接近随机水平:Nitrogen 22.0%、Open-P2P 24.4%、JARVIS-VLA 28.1%(表 7),但在其域内微调后的 Minecraft 数据上,JARVIS-VLA 可达到 54.2%,与零样本 Gemma 4 31B-IT 的 54.1% 相当,说明这类模型存在强域依赖。
变体实验给出几项有限但有用的结论。在四个测试模型上,加入短期指令使当前动作感知平均准确率提高 14.1 个百分点,而加入多时间尺度指令又使未来动作规划平均提高 7.0 个百分点(表 11)。这说明短期指令对即时操作更重要,中长期指令对未来规划更有帮助。思维链并非总有益:GLM-5V-Turbo 和 Doubao-Seed-2.1-Pro 开启思考后总准确率分别提高 5.6 和 9.3 个百分点,但 UI-TARS-1.5-7B 和 Qwen2.5-VL-7B 分别下降 8.2 和 5.9 个百分点(表 8–10),作者推测原因是轻量模型产生幻觉式推理,反而误导动作预测。
在线轨道上,离线四档模型基本对应在线排名,GPT-6-Astra 的长程任务成功率为 45.0%,其余 10 个模型不超过 10.0%(表 15)。这一正相关表明离线 MCQ 可作为在线游戏能力的有用代理,但长程任务总体上仍然困难。
实践建议
对游戏智能体研发团队,GameHorizon-Data 可作为视频-动作-语言对齐的训练语料,尤其适合为 VLA 模型补充多层目标信号:短期指令用于动作监督,中期目标用于子任务规划,长期策略用于课程式训练。对于使用专用游戏智能体的团队,论文结果提醒:在未见过的 AAA 游戏上不要直接期望零样本泛化,应优先考虑在相近域数据上微调,或结合通用 VLM 做高层规划、专用策略做低层控制。
对评测与 MLOps 团队,建议把离线 MCQ 作为低成本的回归测试,每次模型发版先跑 T1–T3 主任务,再选择性跑变体任务,定位具体退化维度;在条件允许时,用 Minecraft 式分步在线轨道做最终把关,重点看长程任务中的失败步骤。论文表 8–10 关于思维链的差异说明,开启思考不应作为默认选项,最好按模型能力分档测试,观察在 T2 分解任务上的增益是否大于总体波动。
对多模态模型开发者,表 11 的结果提供了一个可操作输入设计方向:在需要即时动作判断时,提供短期指令即可明显改进;在需要预测未来操作时,应额外提供中期目标或长期策略。若后续希望在 GameHorizon-Bench 上提交结果,应使用项目页 GameHorizon Suite 和代码库 GitHub 提供的统一协议,避免自定义 harness 破坏可比性。