ATLAS:代理式还是潜在式视觉推理?一字足矣
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
论文信息
标题: ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
作者: Ziyu Guo, Rain Liu, Xinyan Chen, et al.
发布日期: 2026-05-14
arXiv ID: 2605.15198v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文解决的是视觉推理中 “中间视觉状态” 的表示难题。现有方法要么直接生成像素级图像(成本极高),要么依赖外部工具执行(引入上下文切换延迟),要么使用可学习的隐向量(难以泛化且阻碍并行训练),缺乏一种既高效又兼容标准自回归训练的方案。
- 核心方法:提出 ATLAS 框架,将五种离散的 “功能 token”(如
<|Line|>、<|Shape|>)直接融入标准词表。这些 token 通过下一个 token 预测机制在自回归循环中生成,内部承载视觉操作,但无需任何图像级监督,完美兼容现有的 SFT 和 GRPO 训练流程。论文还设计了 LA-GRPO 算法,通过静态加权辅助目标强化稀疏功能 token 的优化。 - 关键结果:在 BLINK 基准上,ATLAS 将基座模型 Qwen2.5-VL 的平均准确率从 22.8% 提升至 51.3%(表 3),同时将平均推理延迟从 18.83 秒降至 3.80 秒,峰值内存占用从 2.55 GB 降至 1.43 GB(表 4)。
- 主要局限:功能 token 种类仅五种,覆盖的视觉操作有限;用于强化学习的训练数据多样性有限;模型对功能 token 的精确语义绑定可能不稳定,尤其在部分任务上标准 GRPO 会出现准确率下降(如 BLINK IQ 和 Multi-view Reasoning,表 3)。
- 适合读者:从事视觉-语言模型、多模态推理、强化学习对齐以及大模型高效训练的工程师和研究人员。任何希望在不牺牲架构简洁性的前提下增强 VLM 视觉推理能力的人都值得阅读。
论文背景和研究动机
视觉推理任务往往要求模型在执行过程中利用、更新或构建中间视觉状态。例如,解决几何题需要画辅助线,分析游戏状态需要理解当前棋盘,比较空间关系更需要高亮关键区域。当前解决这一需求的路线主要有三条:
- 统一模型:直接让模型生成像素级图像。如 Anole、Bagel 等工作,虽然直观,但需要分配大量模型容量用于图像解码和重编码,推理代价极高,且通常需要从头预训练,架构设计复杂。
- 代理式(Agentic)推理:模型生成代码或工具调用,交由外部模块执行视觉操作。代表方法有 V-Thinker、Visual CoT 等。这种方法避免了全图生成的开销,但外部执行带来了上下文切换延迟,且简单的操作也需要冗长的代码,增加了输出长度。
- 隐式(Latent)推理:在隐藏空间中完成中间推理,不产生显式输出。如 LVR、Monet 等方法,它们采用可学习的隐向量或循环思考 token。然而,隐式状态依赖特定任务的监督信号,泛化能力受限;更关键的是,它们常引入循环依赖,破坏了标准并行训练范式,训练成本大幅上升。
这三条路线各有优劣,但均呈现出 “效率” 与 “兼容性” 的割裂。论文 ATLAS 正是为了融合代理式的可解释、可控性以及隐式方法的高效紧凑性,同时回避二者的固有问题——这正是本文的核心动机。用作者的话说,他们希望在 “标准自回归生成循环” 内,用一种简洁的离散单词同时担当代理式操作和隐式视觉推理单元。
核心方法和技术细节
ATLAS 的设计哲学是 “一个词即操作”。它向标准 VLM(基座模型 Qwen2.5-VL-7B)的词表 中加入了五个特殊 token,构成 :
<|Manip|>:图像增强(去噪、锐化、裁剪、缩放等)<|Shape|>:区域标记、高亮或几何形状绘制<|Line|>:绘制辅助线、结构线<|Arrow|>:指示方向、运动、因果关系<|Text|>:添加符号标签、数值标注或文本笔记
这些 token 的本质仍然是标准词表中的离散 ID,通过下一个 token 预测生成。当模型在推理序列中预测出 <|Line|> 时,它相当于内部触发了 “画辅助线” 的视觉操作,但序列中不会出现任何图像像素或工具调用代码,仍然是纯文本 token 流。这带来的关键优势是:彻底绕开了中间视觉内容的生成,同时保留了自回归训练的全套基础设施,无需任何架构或训练流程的改动。
两阶段训练
阶段一:监督微调(SFT)。为了让模型学会何时以及如何使用功能 token,作者构建了 ATLAS-178K 数据集。他们从 V-Interaction-400K 的公开子集中提取图像构建代码,将代码操作映射到五类功能 token(详见表 2),然后将其转化为带功能 token 的推理轨迹。之后用 Gemini-2.5-Pro 对模板化的轨迹进行自然语言润色,使其更加流畅。为了保持基础感知能力,还加入了不含功能 token 的 V-Perception-40K 数据。整个 SFT 使用标准交叉熵损失优化。
阶段二:强化学习(RL)。ATLAS 可以直接使用标准的 GRPO 算法进行优化,无需定制。作者定义了一个复合奖励函数:
其中答案准确性 激励正确回答,功能 token 使用奖励 仅在模型生成了至少一个功能 token 且答案正确时才赋予,格式奖励、长度惩罚和 token 过度使用惩罚则用于防止奖励黑客行为(如反复刷功能 token 骗奖励)。
然而,直接应用标准 GRPO 出现了 “梯度稀释” 问题。功能 token 在输出序列中平均只占 2.3%(平均每 203.7 个 token 中只有 4.8 个功能 token),序列级的优势信号被大量普通文本 token 淹没,导致 更新不足且行为不稳定。
LA-GRPO:功能 token 锚定优化
为解决梯度稀释,作者提出了 Latent-Anchored GRPO(LA-GRPO)。它在保持原序列级 GRPO 损失 不变的同时,引入一个静态权重的 token 级辅助损失 ,专门作用于每个采样轨迹中功能 token 所在的位置。该辅助损失复用 GRPO 的组内优势 ,采用裁剪后的重要性采样比率进行优化。最终目标为:
其中 是该轨迹中功能 token 的位置集合, 控制锚定强度。这样,功能 token 获得了持续且强烈的梯度信号,从而稳定其调用并提升视觉推理效果。
创新点和贡献
- 提出功能 token 范式:将视觉操作内化为标准词表中的离散 token,融合了代理式的可解释性和隐式方法的紧凑性。这是范式层面的创新,使得视觉推理可以在不改动原有 VLM 流水线的前提下实现高效运算。
- 识别并解决梯度稀释:首次指出在标准 RL 训练中,稀疏关键 token 容易因序列级优势信号的分散而优化不足,并给出 LA-GRPO 作为解决方案。该方法不仅对 ATLAS 有效,其思想或将启发其他需要保护稀疏重要 token 的训练场景。
- 系统性验证与效率分析:通过大量实验(表 3、表 4、表 5)表明,ATLAS 在多个挑战性基准上(V*、BLINK、WeMath)可取得极具竞争力的表现,同时将推理开销降低了一个数量级。例如,在 BLINK-Jigsaw 上,与代理式方法 V-Thinker 相比,ATLAS 生成的代码 token 数从 350.35 降至 0.81,延迟降低 4.96 倍,内存占用降低 1.78 倍,同时准确率提高 15.7%(表 4)。
- 保留了完整的可解释性:注意力可视化(图 6、图 7)表明功能 token 确实聚焦于任务相关的视觉证据,如几何线条、目标区域,印证了其推理并不空洞。
实验结果分析
论文的实验设计扎实,覆盖了三类对比方法:闭源大模型、标准 VLM、统一/代理/隐式推理模型。ATLAS 的三个变体(SFT、GRPO、LA-GRPO)呈现出明确的渐进优化趋势:
- ATLAS_SFT 已大幅超越基座 Qwen2.5-VL,在 BLINK 上从 22.8% 跃至 46.0%(表 3),证明功能 token 经有监督训练后能显著提升结构化视觉推理。
- ATLAS_GRPO 将 BLINK 平均准确率进一步推至 50.5%,WeMath 达到 40.3%,但部分子集(IQ、Multi-view Reasoning)出现回退(表 3)。这说明序列级偏好优化虽能提升答案层面的正确性,但可能导致功能 token 使用行为的不稳定,间接印证了梯度稀释的影响。
- ATLAS_LA-GRPO 取得最佳平衡:BLINK 平均 51.3%,WeMath 45.0%,并在多个子集上超过标准 GRPO,如 Multi-view Reasoning 从 43.6% 升至 53.4%(表 3)。消融实验(表 5)也表明,移除格式奖励、长度惩罚或 token 滥用惩罚均会造成性能退化,尤其是撤销惩罚后模型平均功能 token 数飙升至 18.7 个,准确率反降至 47.0%,充分暴露了奖励黑客问题。
注意力分析进一步佐证了功能 token 的有效性:热力图显示 <|Line|> 会聚焦于几何高度线段,<|Shape|> 聚焦于猫的区域,表明这些 token 并非语义空洞的占位符,而是与具体视觉证据相关联。
实践建议
对于希望利用 ATLAS 框架或受其启发的工程师和研究者,以下建议可能具备直接参考价值:
- 功能 token 的设计应追求 “抽象但通用”。ATLAS 仅用五类 token 就覆盖了超过 40 种视觉任务中的操作,关键在于抽象出底层视觉操作而不是面向任务设计 token。建议在类似场景中尽量将操作泛化为 “区域标记”“线条绘制”“文本标注” 等基础动作,避免 token 爆炸。
- 冷启动 SFT 数据集需要精心构造。即使后续有 RL,SFT 阶段提供的功能 token 使用轨迹仍是模型学会 “何时调用” 的根基。可以借鉴论文的思路:从带代码的数据中解析操作并映射为 token 序列,再用强模型润色,最后混入无 token 数据防止灾难性遗忘。
- RL 奖励函数必须内置反黑客机制。直接对功能 token 数量给予正向奖励是危险的。ATLAS 采用 “有 token + 答案对” 才给分的条件奖励,并配合长度和滥用惩罚,这一设计在实验中证明对稳定训练至关重要。在自己的强化学习任务中,应提前设想模型可能投机取巧的方式并设计惩罚。
- 当关键 token 稀疏时,考虑 token 级锚定损失。LA-GRPO 的思路可迁移至其他类似场景,例如工具调用、代码生成中特定的语法 token。它的实现简单,无需改变 RL 基础框架,只多了一个加权辅助项,但能显著增强稀疏 token 的梯度流。
- 效率评估应纳入实际部署指标。论文展示了输出长度、延迟和峰值内存的量化改进,这些对于服务级部署很有说服力。若应用类似方案,建议也收集这些指标,便于权衡收益。
总体而言,ATLAS 为多模态推理提供了一条 “极简” 但高效的路径。它表明,即便是词表中一个不起眼的单词,只要赋予其内化的视觉操作功能,便可以串联起复杂的推理过程,同时保持训练和部署的轻盈。这种设计哲学值得在更多视觉-语言模型中探索和延续。