VISTA:一种用于交互式世界中推理的视觉框架

VISTA: A Visual Harness for Reasoning in an Interactive World

arXiv: 2610.02200v1

论文信息

标题: VISTA: A Visual Harness for Reasoning in an Interactive World

作者: Qiushi Han, Keya Hu, Linlu Qiu, et al.

发布日期: 2026-10-01

arXiv ID: 2610.02200v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:如何让通用多模态模型在交互式视觉环境中进行长时程推理与行动,而不是依赖文本网格或程序合成。
  • 核心方法:提出 VISTA 视觉 harness,提供视觉观测、无损视觉记忆和模型主动的视觉检查三组件。
  • 关键结果:在 ARC-AGI-3 的 25 个公开游戏中,VISTA 把 Claude Opus 5.0 的 RHAE 从官方实现的 40.68 提升到 100.00,并比首次人类少用 57.4% 的动作(见表 1、摘要)。
  • 主要局限:作者承认不能排除公开基准游戏出现在模型训练数据中;性能仍高度依赖后端模型已有能力。
  • 适合读者:多模态智能体、视觉推理、computer-use agent、交互式环境评测的研究与工程人员。

论文背景和研究动机

ARC-AGI-3 是一组交互式视觉游戏,要求智能体通过与陌生环境互动发现规则和目标任务。此前多数方法把它当作语言问题:LLM 接收文本网格或结构化状态,常见策略是构建可执行的程序化世界模型,再进行搜索、验证和规划。与之不同,VISTA 把 ARC-AGI-3 重新定义为视觉问题。

传统 VLM 智能体通常只对每张图像编码一次,得到可能被压缩、有损的表示;随着上下文增长,早期观测还可能被删除或替换为文本摘要。论文指出,模型在编码时未必知道未来推理需要哪些视觉细节,因此一次性编码可能不足以支持后续长程推理。这一观察直接驱动了 VISTA 的设计:保留原始观测,并让模型在需要时主动回到视觉历史中检查证据。代码已公开于 VISTA 代码库。

核心方法和技术细节

VISTA 的核心是三个视觉组件。第一,视觉观测:模型直接接收环境渲染图像,而不是文本网格或符号状态。第二,无损视觉记忆:每个环境返回的帧,包括动作产生的中间动画帧,都按回合和帧号存储,且不因模型上下文变化而被丢弃。第三,视觉检查:模型可以调用 inspect 在任意历史帧中裁剪并放大矩形区域,也可以调用 read_pixels 读取指定区域的像素值;前者支持跨时空比较和回放动作过程,后者支持需要精确颜色或数值判断的场景。

交互流程上,每个游戏回合可包含多次与 harness 的交换,但只执行一个游戏动作。模型使用自然语言推理和规划,预测动作结果后调用 play。它还维护两个笔记文件:GUIDE.md 保存跨关卡可复用的游戏理解,WORKING.md 作为当前关卡临时状态草稿。当模型上下文接近上限时,会写入交接摘要,在新上下文中继续;视觉记忆、动作历史与笔记则继续保留。论文强调,harness 本身是机械的,不含额外训练模型或学习组件。

创新点和贡献

VISTA 的主要贡献不是提出新的模型架构,而是把 “视觉 harness” 作为提升多模态智能体的关键设计。与把图像一次编码进上下文的做法不同,VISTA 让模型拥有一种显式的重注意力机制:它可以选择何时、看哪些历史帧、看哪些局部区域。图 10 的定性示例显示,模型会在棋盘重置后检索过去多帧以重建地图,也会放大局部区域来辨认方块朝向。

另一项贡献是证明不依赖程序合成也能在 ARC-AGI-3 上达到满分或接近满分。论文称之为首个不进行程序合成的视觉系统达到这一水平(见表 1)。此外,VISTA 的统一 harness 只需极少量适配就扩展到 GameWorld、AI GameStore 和 BabyVision,显示出跨环境的设计复用性。

实验结果分析

在 ARC-AGI-3 的 25 个公开游戏中,VISTA 配合 Claude Opus 5.0 xhigh 得到 RHAE 100.00,总动作数为 7,302,相较人类参考动作数 17,135 减少了 57.4%;GPT-5.6 Sol max 得到 RHAE 99.00(见表 1、图 5)。需要注意,这是系统级比较:官方实现的 Opus 5.0 使用 high 推理强度,VISTA 使用 xhigh 推理强度,因此不能把增益完全归因于 harness 本身。

消融实验给出了更直接的证据。在 GPT-5.6 Sol 上,从官方文本网格实现开始,替换为 PNG 图像观测后 RHAE 从 13.33 升至 47.32;增加动作与时间限制后达 51.66;引入连续对话和原生上下文压缩后达 65.82;加入两个笔记文件后达 70.05;再加入无损视觉记忆和 inspect 后升至 94.10;最后加入 read_pixels 形成完整 VISTA,RHAE 达 99.00(见图 5)。该结果显示,在 ARC-AGI-3 这一评测设置下,无损记忆与主动视觉检查带来最大增益。

视觉观测还显著降低了 token 消耗:文本网格每帧约 4,000 tokens,而默认 512×512 图像约 308 image tokens;平均每游戏 token 使用从文本网格的 71.9M 降至图像观测的 30.7M(见图 6)。在泛化测试中,同一个 VISTA harness 在 GameWorld 和 AI GameStore 上均超过新手人类基线或人类中位数基线,在 BabyVision 上把准确率从官方实现的一次性问答 41.0% 提高到 63.2%(见图 11、第 5.2 节)。此外,开放权重模型 GLM-5.3 Flash 320B 配合 VISTA 获得 RHAE 66.93,明显优于其官方实现基线(见图 8);ARC-AGI-3 的 3D 渲染版本仍得到 RHAE 84.12(见图 9)。

实践建议

基于论文在多个视觉环境中的评测结果,构建交互式视觉智能体时可考虑以下做法。

第一,保留无损视觉记忆,避免过早压缩或摘要化。VISTA 的消融显示,加入可检索的历史帧后性能提升明显(图 5)。如果实际系统需要控制上下文成本,可把长行程视觉历史移到外部存储中,只通过检索按需载入。

第二,优先使用图像观测而不是完整文本网格。在 ARC-AGI-3 上,图像观测在性能接近或更优的同时大幅降低 token 使用(图 6)。对于像素级或空间关系密集的任务,这一权衡尤其值得测试。

第三,分离跨任务持久知识与当前任务草稿。GUIDE.md 与 WORKING.md 的组合在消融中从 65.82 提升到 70.05(图 5)。在跨关卡或多任务交互场景中,这种轻量笔记机制能以较低成本保存和修正世界理解。

第四,提供像素读取能力以支持需要精确判断的任务。read_pixels 使模型不再只凭缩放后的图像猜测颜色或结构,在 BabyVision 的静态视觉任务中尤其有效(第 5.2 节)。

第五,根据模型能力和预算调整上下文长度与图像分辨率。论文显示,把上下文从 200K 降到 100K 在 ARC-AGI-3 上仅导致 RHAE 下降 0.4,但 token 使用约减半;图像从 8× 上采样降到 4× 亦可保持接近性能(图 7)。这提示实际部署时需要在精度与成本之间做实验,而非默认使用最高分辨率或最长上下文。