凝视头:视觉语言模型如何注视其所描述的内容
论文信息
标题: Gaze Heads: How VLMs Look at What They Describe
作者: Rohit Gandikota, David Bau
发布日期: 2026-06-12
arXiv ID: 2606.14703v1
PDF 链接: 下载 PDF
论文背景与研究动机
现代视觉语言模型(VLMs)能够同时处理图像和文本,描述图像内容,但它们在内部如何完成这一任务却远非一目了然。当模型生成对图像的描述时,其注意力机制是否像人类一样,随着描述的推进而注视图像的不同区域?这篇论文给出了肯定的回答,并发现这一机制仅集中在模型中极为狭窄的一组注意力头中——作者称之为 “凝视头”(Gaze Heads)。
这项研究的核心动机源于对 VLM 内部工作机制的好奇。虽然已有的可解释性研究识别出了一些图像相关的注意力头,例如 “图像头”(Image Heads)用于对比解码抑制幻觉,或 “定位头”(Localization Heads)用于无训练的视觉定位,但这些工作都将注意力头视为信号源,考察其静态属性。本文提出的问题则更为精细和时序化:哪些注意力头会在逐词生成的过程中,将注意力动态地转而聚焦于模型当前所描述的图像区域?更重要的是,这组头是否足以因果地操控模型的输出?
核心方法:从漫画到凝视头
论文采用了一个巧妙且受控的测试平台——漫画条。漫画的叙事顺序被空间化地编码在从左到右的面板布局中,模型需要按次序关注每个面板才能正确描述故事。这使得研究者能够精确追踪模型的注意力转移轨迹。
凝视分数的定义与计算
为了发现凝视头,作者定义了一个简洁的 “凝视分数”。对于包含六个面板的漫画条,针对每个面板索引 ,都会用自然语言提问 “从左数第 个面板发生了什么?”。在每次前向传播中,提取最后一个提示词对所有图像令牌的后置 softmax 注意力权重,并按面板分组。
对于每个注意力头 ,横跨六次查询,可以得到一个 的注意力矩阵:行是被查询的面板,列是实际被注意的面板。凝视分数直接衡量这个矩阵对角线上的注意力质量:
其中 是当询问第 个面板时,头 放在第 个面板图像令牌上的原始注意力质量。作者特意使用原始注意力分数而非归一化后的分数,目的是同时奖励那些既关注图像、又将注意力集中到指定面板的头。
凝视头的定位
在 Qwen3-VL-8B 模型上,这个方法只需几次简单的前向传播就完成了所有 1152 个注意力头的评分。结果呈现出一个尖锐的分布:大多数头的凝视分数接近于零,因为它们将注意力预算主要分配给了文本令牌或分散在图像上。然而,一个长长的右尾延伸至分数高于 0.5 的区域。前 100 个凝视头(占总头数的 8.7%)清晰地从这个背景中分离出来,并且这些头高度集中在模型的中间层(第 20-28 层),与先前通过残差流操控分析定位到的层带完全一致。
因果操控:从跟踪到重定向
凝视头的发现本身是相关性证据,但论文的突出贡献在于证明了其因果性。作者设计了一个简洁的注意力掩码干预方法:对于选定的目标面板,在其图像令牌的 pre-softmax 注意力上施加 偏置,同时对其他所有面板施加 偏置(实验中使用 ,即硬重分配),文本令牌的注意力保持不变。
视觉问答与静态叙述
实验在两项互补任务上评估重定向效果。在视觉问答(VQA)任务中,模型被问及整个漫画条的内容,但凝视头被导向特定面板。重定向前 100 个凝视头使回答的准确性达到 83.1%,而随机非凝视头的同样操作完全无法重定向回答(仅 14.6%),对所有 1152 个头进行操作则完全破坏了生成过程。
在静态叙述任务中,模型被问及 “这个漫画面板中发生了什么?” 且不指定面板索引。此时,凝视头被锁定在某个目标面板上。重定向前 100 个头达到了 79.4% 的准确率,这意味着模型对同一问题会根据凝视头被导向的面板不同而给出六个不同的答案。
动态凝视切换:生成中的实时控制
论文更进一步展示了连续控制能力。在生成长达 300 个词的叙述过程中,每 50 个解码步骤就将凝视头的目标切换到新面板。这些切换序列是完全打乱的排列,不遵循左到右的自然顺序。结果显示,凝视头的注意力轨迹形成了清晰的阶梯状结构,在每个切换点迅速转移到新面板。生成的文本保持了流畅的叙述,自然地结束当前面板的描述并开始新面板的介绍。Spearman 相关系数达到 ,表明模型描述的面板顺序强烈地跟踪着操控时间表。
一个有趣的观察是,模型在文本中仍维持其默认的 “面板 1, 2, 3...” 编号,但描述的实际视觉内容却跟随凝视头指向的面板。这暗示编号的文本结构与视觉内容跟踪是两个功能上分离的机制。
超越漫画:自然图像与跨模型泛化
凝视头并非漫画任务的特化产物。在 COCO 自然图像上,当模型描述图像时,同样的凝视头注意力会转移到被描述对象的空间区域:画架在左上角、植物在中央、地球仪在右上角。更重要的是,定量重定向实验表明,将凝视头引导至特定对象的边界框,使模型在大型对象上达到 80.3% 的识别准确率,而随机对比组仅为 36.6%。
该机制还在多个视觉语言模型架构和不同规模(2B 到 32B 参数)上复现。Qwen3-VL、Qwen2-VL、Ovis1.5 和 InternVL3.5 等模型都表现出 60-83% 的重定向准确率。一个启发性但非确定性的发现是,成功形成凝视头的模型都对视觉编码器进行了微调,而保持视觉编码器冻结的模型(如两个 LLaVA 变体和 Bunny-3B)则未表现出同等机制。这一模式暗示训练编码器与语言模型共同可能是形成凝视头的必要条件。
实践应用与未来方向
这项研究的发现为多模态模型的推理时操控提供了一个轻量级且无需重新训练的杠杆。在实际应用中,凝视头干预可以用于提升视觉问题回答的可控性、实现无需训练的图像区域描述切换、辅助开发更可解释的 AI 系统,并为幻觉抑制提供新的因果机制视角。对于那些存在冻结视觉编码器的模型系列,研究建议在需要此类空间精细化控制的任务中,可优先考虑视觉编码器经过共同训练的模型,并在系统设计时纳入凝视头干预作为可控模块。
总结
《Gaze Heads》论文揭示了一个重要发现:现代视觉语言模型内部自发形成了一套类似人类凝视的机制,高度集中在不到 9% 的注意力头中,用于将语言生成动态地接地到图像的特定区域。作者不仅清晰定位了这一机制,更证明了只需对这些头进行简单的注意力掩码编辑,就能在推理时几乎无损地重定向模型的描述。这项工作超越了先前的头选择方法,因为其核心标准——主动的时序重路由——是先前基于单次前传的静态准则所无法捕获的,最终赋予了视觉语言模型以精巧的因果控制手段。这项研究既是对模型内部机理的深刻洞察,也为多模态 AI 的精确操控提供了实用的新工具。