ReToken:一个词元改进视觉检索的视觉-语言模型
ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
论文信息
标题: ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
作者: Yao Xiao, Reuben Tan, Zhen Zhu, et al.
发布日期: 2026-07-30
arXiv ID: 2607.28627v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:视觉语言模型在应对长视觉上下文(如图集、小时级视频)时性能急剧下降,注意力信号无法准确区分相关与无关画面,且全量处理受 GPU 显存限制。
- 核心方法:提出 ReToken,一个可学习的嵌入令牌,冻结原模型,仅训练该令牌和最终层投影矩阵,从预填充的视觉键值缓存中根据余弦相似度检索与查询相关的稀疏帧子集。
- 关键结果:在 Visual Haystacks 基准上,ReToken 将 Qwen3VL‑8B 提升 13.4 个点,InternVL3.5‑8B 提升 12.4 个点(相对增益 >20%);在 LVBench 长视频任务上零样本迁移带来 8.0 点提升(见第 4.3 节)。
- 主要局限:需要两次前向传播,检索过程额外消耗显存和推理时间;训练数据仅限多图问答,缺乏对视频时序结构的建模;在需要全视频上下文综合的任务(如摘要)中可能反而降低精度(见第 4.4 节)。
- 适合读者:多模态模型研究者、视频理解工程师、检索增强生成系统开发者,以及关注高效长上下文推理的从业者。
论文背景和研究动机
长视觉上下文——从数百张图片的集合到超过一小时的视频——已经进入主流视觉语言模型(VLM)的输入范围。然而,当查询只依赖其中少量帧或图像时,VLM 的答案质量会急剧下降,因为模型很难从大量干扰内容中定位出关键证据。更棘手的是,直接处理所有视觉令牌往往会超出 GPU 显存上限,计算代价高到不可接受。因此,长视觉上下文本质上变成一个检索问题:只需选出最相关的一小部分帧或令牌,就能让模型产出正确答案。
在纯文本领域,大语言模型通过海量长上下文训练,其注意力信号已经能够有效区分不同部分的文本。但论文发现,VLM 中的注意力信号对视觉内容的指向性极差:在 QAEgo4D 测试集上,基于问题‑图像注意力分数的检索方法,各层的平均 Recall@1 只有 5.1%,注意力几乎无法把问题令牌和真正相关的帧联系起来(图 1(b))。这说明 “照搬” 文本域的注意力检索方案在 VLM 中行不通。
一个关键的诊断性实验揭示了方向:如果把检索匹配从传统的查询‑键(Query‑Key)空间转移到值(Value)空间,并且提供一个精确的目标短语,检索效果会大幅跃升。例如,在简单的双图像选择任务中,Qwen3VL‑8B 使用问题完整句子在键空间做检索,Recall@1 仅 63.3%,换成目标短语(如 “a cow”)后在值空间计算相似度,Recall@1 升至 78.0%(表 1)。这是因为值向量承载的是实际传播到后续层级的内容,而查询‑键的内积仅控制聚合权重,值空间天然包含更丰富的文本‑视觉语义对齐信号。然而,直接用整个问题的平均令牌做值空间匹配会引入大量噪声,反而抵消了这一优势。因此,需要一种能 “自动提炼出精确检索目标” 的机制——这正是 ReToken 的出发点。
核心方法和技术细节
ReToken 的设计围绕三个简洁却关键的要素:单令牌检索目标、值空间评分和冻结 VLM 的信号精炼。具体来说,方法如下:
检索令牌的引入与训练 在模型输入序列末尾追加一个可学习的嵌入 ,称作 ReToken。该令牌与问题令牌一起输入冻结的 VLM 解码器。仅在最终层,ReToken 的输出经一个轻量投影矩阵 映射为 。对每一帧(或图像),先计算其所有视觉令牌在第 层的均值值向量 ,然后按余弦相似度得到该帧的检索分数 。训练时,VLM 完全冻结,只优化 和 ,是一个极端轻量的设计(仅增加约 个参数)。
检索损失与类别平衡 训练数据来自多图问答集合 MIRAGE,每个样本标注了每一帧是否与问题相关。设相关帧集合为 ,不相关帧为 ,为避免大量负样本淹没信号,采用类别平衡的二元交叉熵:
其中 为可学习的温度参数。该损失直接以检索排位为目标,完全不依赖生成任务。
推理:一次编码,两次前向 推理采用两阶段流水线(图 4)。第一阶段:将整个视频(或图集)一次性编码并存储所有层的键值缓存(长视频可分段滑动窗口编码)。对于每个问题,第一次前向传播在已缓存的视觉键值上执行,ReToken 在最终层计算出各帧分数,选取 Top‑ 帧作为相关子集。早期层为了控制内存,可将 ReToken 的注意力限制在当前层值空间相似度最高的 帧上(默认 ),最后层再从该精简集合中进一步精排。第二阶段:仅加载所选 帧的键值缓存,与问题一起进行标准自回归生成,得到答案。这种 “一次编码‑多次问答” 的模式尤其适合需要反复查询同一长视频的场景。
部分微调的变体 默认冻结 VLM,但论文也探索了微调早期 1–3 层,同时加入生成损失 以防止顶层语言能力退化。这一设置能在图像任务上小幅度提升准确率,但会在视频任务上引入域迁移损失(见 4.4 节消融实验)。
创新点和贡献
-
揭示值空间的检索优势:论文通过系统的诊断实验明确指出,在预训练 VLM 中,视觉令牌的值向量比查询‑键注意力分数更适合作为文本驱动的检索依据。这一发现将视觉检索的底层机制从 “注意力权重” 重新定位到 “语义传播” 上,具有普适启示意义。
-
极简且通用的检索令牌:ReToken 仅用一个嵌入令牌 + 一个投影矩阵,冻结庞大基座模型,却能在图像和视频两种模态上带来显著增益。与需要 32–64 个可学习查询的 Q‑Former 或 Perceiver Resampler 相比,参数量和训练成本极低,更易于部署。
-
图像到视频的零样本迁移:仅用多图问答数据训练,ReToken 直接泛化到小时级长视频基准(LVBench +8.0,Video‑MME 长分割 +2.1),证明其检索能力不依赖时序先验,而是捕捉到跨模态的通用相关性模式。
-
让冻结 VLM 的缓存更 “干净”:当部分微调早期层时,存储在键值缓存中的视觉表征会减少无关上下文带来的干扰(表 3 中 差距缩小),从而在不改变模型权重的前提下间接改善了缓存质量。
实验结果分析
在 Visual Haystacks 单针任务中,ReToken 的检索精度和最终答案准确率随上下文大小 增加而优势放大。当 时,Qwen3VL‑8B 准确率从 58.6% 提升至 72.0%(+13.4),InternVL3.5‑8B 从 57.3% 提升至 69.7%(+12.4)(表 4)。即使仅微调早期三层,准确率也能从 64.2% 上升到 75.0%(+10.8)。相比之下,外部检索器 SigLIP2 只能达到 58.7% 的准确率,且其在 时的 Recall@1 仅 20.8%,大幅低于 ReToken 的 64.7%(表 2)。
视频基准上的零样本迁移令人瞩目。在 QAEgo4D 长视频问答中,每视频平均约 240 帧,ReToken 在 帧检索下比均匀采样高出 6.0 点,比 ReKV 注意力检索高出 2.2 点(表 5)。LVBench 上, 帧时 ReToken 达到 48.6% 准确率,较同等帧数的均匀采样(40.6%)提升 8.0 点,接近部分专有模型(如 Gemini 2.5 Pro 的 69.0% 使用 512 帧),但仅消耗 100 帧(表 6(b))。分析显示 ReToken 在需要定位具体实体或关键信息的任务上增益尤为突出(关键信息检索 +15.4,实体识别 +10.5),而在需要全局理解的摘要任务上有害(‑5.2),表明方法对稀疏证据任务更适配。
消融实验进一步确认设计选择:值空间检索显著优于键空间(Recall 64.7 vs. 59.4,准确率 72.0 vs. 70.6,表 7);双阶段推理(先检索后生成)是必须的,单阶段直接用各层检索结果会从 72.0% 跌至 50.4%(表 9);即便完全不让 ReToken 关注视觉令牌(仅总结问题),性能仍大幅优于随机基线,但允许其观看图像能带来更大提升(表 14),说明 ReToken 同时起到了视觉内容总结与查询精炼的作用。
实践建议
若要在现有 VLM 管线中集成 ReToken,可以按以下步骤展开:
-
数据准备与过滤 使用类似于 MIRAGE 的多图问答数据,并为每张图片标注是否相关。为提升训练效率,过滤掉涉及大量文本识别或可能被模型 “背诵” 的样本,保留需要真正视觉辨别能力的题目。可参考论文的过滤策略:去除生成损失在目标图像上反而更高的样本,按注意力分数保留更容易的检索样例。
-
训练策略选择 默认冻结 VLM,仅训练 ReToken 和投影矩阵,使用类别平衡的 BCE 损失。硬件要求极低:在单张 H100 上训练 Qwen3VL‑8B 仅需约 3 个 epoch(有效 batch size 64),InternVL3.5 由于图像令牌更多,训练一个 epoch 也可收敛。若需在图像任务上再提升 1–2 点,可考虑轻微微调早期 1–3 层并搭配生成损失,但需注意这可能损害视频任务的零样本泛化能力。
-
推理部署的工程要点
- 长视频一次性编码存储键值缓存,后续多问题共享。编码时分块使用滑动窗口注意力(论文窗口设为约 153 帧),并将超出显存的旧缓存 offload 到 CPU。
- 对每个问题,阶段一的检索过程可在早期层用 (如 256)帧限制注意范围以控制显存和延迟,最终层再从此子集中选出 帧。阶段二直接加载已缓存的选帧键值,生成答案。
- 若响应延迟敏感,可权衡 的大小: 时单次问答额外仅增约 0.4 秒延迟,但准确率显著提升;若 太小则准确性下降(图 5 显示 ReToken 在 时表现最佳)。建议按应用场景的精度/延迟要求调整。
-
适用边界与风险控制 ReToken 在需要定位离散证据的场景下表现卓越,但对于依赖全片脉络的摘要任务或需要跨帧对比时间关系的问题,可能不如均匀采样。可通过提前对问题类型分类,对 “实体检索”“关键信息定位” 类问题启用 ReToken,对 “事件理解”“摘要” 类任务回退到均匀帧采样或更大的检索预算,实现混合部署。
整个方案的计算开支主要集中在一次性的视频编码上(约 14.7 秒每段视频),而后续每个问题的检索和回答延迟增加很小,因此特别适合需要对长视频进行大量交互式问答的生产环境。