凝视头:视觉语言模型如何注视它们所描述的内容
Gaze Heads: How VLMs Look at What They Describe
论文信息
标题: Gaze Heads: How VLMs Look at What They Describe
作者: Rohit Gandikota, David Bau
发布日期: 2026-06-12
arXiv ID: 2606.14703v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:视觉-语言模型(VLM)在描述图像时,内部是如何将当前正被描述的图像区域与语言生成对应起来的?具体而言,哪些注意力头在实时跟踪正在被叙述的视觉位置?
- 核心方法:利用漫画条带(comic strips)作为空间叙事顺序已知的受控测试平台,通过一个简单的相关性分数(Gaze Score)从少量前向传递中定位出 “凝视头”(Gaze Heads),再通过仅修改这些头注意力偏置的干预(不重新训练)来重定向模型的描述内容。
- 关键结果:在 Qwen3-VL-8B 上,仅重定向前 100 个凝视头(不到总头数的 9%),就能以 83.1% 的准确率将 VQA 答案强制转移到任意指定的漫画面板上(随机基线为 16.7%);相同干预在随机非凝视头上则完全失效(见论文第 6.1 节,图 3)。
- 主要局限:在冻结了视觉编码器的模型(如 LLaVA 系列、Bunny-3B)上没有发现同等的凝视头集合,泛化能力受限;对自然图像的定量控制在小物体上表现下降(见论文表 1);仅探讨了针对特定区域的重定向,未覆盖更复杂的空间推理或幻觉抑制任务。
- 适合读者:对视觉-语言模型内部机理感兴趣的研究者、进行模型可解释性工作的从业者、希望在不微调的条件下精确控制多模态模型输出方向的工程师。
论文背景和研究动机
现代视觉-语言模型(VLM)的核心是一个原本只处理文本的语言模型(LM)骨干,经过多模态微调后能同时接收图像和文本令牌。然而,这个预训练骨干内部是如何适应多模态输入的,数以千计的注意力头中哪些承担了视觉角色,始终是一个开放问题。一个很自然的切入点是:当人类描述所见之物时,视线会随着说出的话语移动,依次注视每一个被提及的对象;而注意力机制正是建立在这一直觉之上。本文作者尝试回答:模型内部是否也存在类似的 “凝视” 行为?如果有,它又集中在哪些注意力头中?
此前的工作已经识别出某些专门 “看图像” 的注意力头,但往往是从静态、单次前向传递的角度(例如 Image Heads 用于对比解码以抑制幻觉,Localization Heads 用于预测边界框),而并未考察描述内容随时间变化的动态视觉路由过程。本文希望填补这一空白,即寻找那些 “当前模型正在描述什么区域,其注意力就跟踪到那个区域” 的头——作者称之为凝视头(gaze heads)。
为了进行高度受控的探索,论文选择了漫画条带作为测试平台。漫画的叙事顺序被空间编码为从左到右的面板序列,这提供了明确无误的 “地面真值”:模型在某个时刻应当关注哪个面板。值得注意的是,作者并非旨在解决漫画阅读顺序问题,而是把漫画当作一种工具来剖析通用 VLM 的视觉信息路由机制。
核心方法和技术细节
凝视头发现
对于每张六面板的漫画条带,作者对每一个面板索引 (1 到 6)执行一次前向传递,每次都使用相同的自然语言查询,如 “仔细观察这张六格漫画,左边第 格发生了什么?简要回答”。通过这种方式,对于每个注意力头 ,可以从终端提示符到图像令牌的注意力权重中构建一个 的矩阵 ,其中行 表示查询第 面板时该头分配到第 列面板图像令牌上的注意力质量(总和)。如果某个头完美跟踪了被查询的面板,其注意力质量应集中在矩阵的对角线 上。据此定义 Gaze Score:
这个分数直接使用原始的未经归一化的注意力权重,既要求头确实在看图像,又要求它能够根据查询位置重新路由。在 Qwen3-VL-8B(共 1152 个头)上,这一过程完全无需标注数据或训练,只需少量前向传递。按照 Gaze Score 排序,自然形成了约前 100 个(占总头数 8.7%)高得分的凝视头,它们密集地集中在语言模型骨干网络的中间偏后层(层 20–28,见论文图 16),与后续的因果干预实验结果高度吻合。
注意力重定向与因果控制
为了验证这些头的因果作用,作者设计了一种极轻量的推理时干预手段:仅对选中的前 100 个凝视头,在其预 softmax 注意力掩码中,对目标面板的图像令牌加正偏置 ,对其他面板加负偏置 (实际操作取 实现硬重分配),而所有文本令牌的注意力保持不变。模型的其他部分不受任何改动。
在两个任务上测试了重定向效果:
- VQA 重定向:提问 “这幅漫画中正在发生什么主要动作?”,通过干预强迫模型描述指定的某个面板而非整个条带的总结。
- 静态叙述重定向:提问 “这幅漫画格中发生了什么?” 但不指定面板,通过干预让模型自然聚焦到目标面板进行描述。
此外,还测试了动态切换:在生成长度 300 个符元的叙事过程中,每 50 步将目标面板切换到另一面板(按打乱计划)。这检验了凝视头能否在生成过程中连续、顺滑地改变注意力焦点。
创新点和贡献
本文的主要创新在于将注意力头从以往研究中孤立的 “信号源” 提升到了因果控制表面。前人工作(如 MaskCD 的 “Image Heads” 和定位工作中的 “Localization Heads”)仅利用这些头的静态性质来读取信息或相减 logits,而本文首次证明,通过改变一个极小子集的注意力目的地,就能直接决定模型把哪个视觉区域的语言绑定输出,实现灵活的推理时行为操控。
其贡献可归纳为:
- 揭示了 VLM 内部的 “凝视” 机制:存在一个约 100 个头的小集合,其注意力能够根据当前正在被描述的图像区域动态重路由,这一性质在自由形式的叙述中表现为清晰的阶梯状注意力轨迹(见论文图 2b)。
- 提供了廉价且无需训练的推断时控制方法:发现凝视头仅需几次前向传递和简单的相关性排序,随后通过一个仅修改注意力偏置的干预,就能以高准确率改变模型输出,完全不需要重新训练或微调。
- 建立了漫画条带作为 VLM 内部视觉路由研究的受控测试平台,为后续探索多模态模型的空间推理和注意力分配提供了新工具。
- 揭示了跨模型泛化的模式:凝视头机制在多个训练了视觉编码器的 VLM(Qwen 系列、Ovis1.5、InternVL3.5)中均能够复现,但在冻结编码器的模型(LLaVA、Bunny-3B)上则表现不佳(见论文表 2),这为理解 VLM 架构设计选择(如编码器是否需要与 LM 联合训练)提供了强有力的证据。
实验结果分析
主要定量结果
在 500 条人工绘制的六格漫画验证集上(每靶 3000 对),对前 100 个凝视头进行重定向,得到了:
- VQA 准确率 83.1%(随机基线 16.7%),静态叙述准确率 79.4%(见论文图 3)。
- 作为对比,使用相同干预的 “Image Heads” 为 69.0%,“Localization Heads” 为 60.2%,均低于凝视头(见论文表 5)。这表明基于单次前向传递的静态标准(图像参与度或空间集中度)无法像本文的动态重路由标准那样精准地识别出真正控制视觉-语言绑定的头。
- 动态切换中,凝视头的实际描述顺序与目标切换计划之间的斯皮尔曼相关系数达到 (见论文图 6),而随机非凝视头则略微反相关。
干预的 “剂量-效应” 关系也很有趣:随着重定向头数 的增加,准确率先急剧上升,在 时达到峰值,随后开始下降(见论文图 8)。这是因为干预过多的头会覆盖掉模型产生流畅输出所需的头,导致生成崩溃为垃圾文本。这进一步说明视觉接地功能高度集中于那一小批头中。
自然图像的泛化及跨模型扩展
将漫画面板框换成 COCO 的真实物体边界框,将重定向目标设为某个物体区域,并询问 “图像这一部分的主要物体是什么”。结果按物体大小分类(见论文表 1):
- 大型物体(面积>96²像素):准确率 80.3% 对非凝视的 36.6%。
- 中型物体:准确率 76.2% 对 19.4%。
- 小型物体:准确率下降到 61.7%(但仍显著高出基线 18.6%)。这与小型物体在模型输入中令牌数量少、干预难以持续施加影响的直觉一致。
跨模型研究显示,不仅 Qwen3-VL 的四个尺寸(2B 至 32B)都表现出凝视头效应,Qwen2-VL-7B、Ovis1.5-8B 和 InternVL3.5-8B 也能达到 60% 以上的峰值重定向准确率。而 LLaVA-1.5-13B(39.0%)和 LLaVA-NeXT-7B(35.3%)尽管有一定效果,但远低于前者。Bunny-3B(仅 8.3%)几乎不存在凝视头控制。作者指出,成功的模型均以某种形式将视觉编码器与 LM 联合训练,而失败的模型多采用冻结的 CLIP/SigLIP 编码器。这为理解 VLM 中视觉-语言融合深度提供了重要线索。
实践建议
基于论文的发现,可以在实际应用中直接利用凝视头来构建可控的 VLM 推理管道,无需重新训练:
-
选择支持凝视控制的模型:优先选用经视觉编码器微调的模型(如 Qwen3-VL、Qwen2-VL、InternVL3.5、Ovis1.5),并确认其凝视头层段。可以根据论文提供的代码(gaze.baulab.info)对目标数据集进行快速 Gaze Score 计算,定位出本模型的凝视头集。
-
实施轻量级注意力掩码干预:在推理时注入偏置掩码,将少量(通常占总头数的 5%–10%)凝视头的图像注意力强制转移到希望模型描述的区域(例如,通过给定区域坐标或面板索引)。此掩码可直接叠加在预 softmax 注意力上,实现零开销的区域定向描述。推荐使用硬重分配 (),但实验表明 即可达到接近峰值的精度(见论文附录 D.1),可根据需要调整以平衡流畅性。
-
应用于空间定向问答或描述:若希望模型忽略图像中的某些区域,或只专注于特定物体回答问题,可以通过将凝视头注意力全部引向该区域来实现。对于多物体场景,可在生成过程中动态切换注意力目标,使模型依次描述多个区域(如论文图 5 所示),这为构建交互式图像说明系统提供了灵活的基础组件。
-
注意分辨率和物体大小的影响:在自然图像中,所针对的物体区域应覆盖足够数量的图像令牌(例如 COCO 中的 “大型” 或 “中型” 物体),以保证干预生效。对于小物体,可考虑使用更高分辨率的输入或局部裁剪后再进行重定向。
-
避免在冻结编码器的模型上硬抄参数:如果必须使用 LLaVA 或 Bunny 等模型,请勿盲目移植头索引,因为这类模型中的 “图像参与头” 并不能提供同等力度的控制。可尝试转用 Ovis 或 InternVL 等已证实有效的架构。
凝视头作为一种因果控制表面,为多模态模型的行为操控提供了新的途径,有望在需要精确视觉基础的应用中(如医疗影像报告、机器人环境描述、辅助视觉问答)发挥直接作用。