改道,而非移除:面向视觉语言模型的可恢复视觉令牌路由

arXiv: 2606.12412v1

论文信息

标题: Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

作者: Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

发布日期: 2026-06-10

arXiv ID: 2606.12412v1

PDF 链接: 下载 PDF

背景与研究动机

近年来,视觉语言模型(VLM)在图像理解、视觉问答和指代表达定位等任务上取得了巨大成功。然而,这类模型通常将图像投影成数百乃至上千个视觉令牌送入大语言模型解码器,导致注意力计算与 KV 缓存开销急剧增加。推理效率成为 VLM 部署的关键瓶颈。

为缓解这一问题,研究者提出了多种视觉令牌压缩方法。解码器侧的主流方案遵循 “评分–移除”(rank-and-remove)范式:在解码器某个或某几个层,利用文本到视觉的注意力分数对视觉令牌进行排序,保留得分最高的一个紧凑子集,并将其余令牌永久删除。FastV、PDrop、Nüwa 等代表性方法虽然能在一定程度上降低计算量,但它们都隐含地假设令牌的重要性在解码器深度上保持稳定。然而,大量分析表明,视觉令牌的重要性会随着层深发生显著漂移:浅层关注区域分散,真正与目标相关的区域往往要到中深层才逐步浮现。图 2 中的一个具体例子显示,某个 “绿衣男子” 的视觉令牌在早期层注意力百分位仅有 0.11 或 0.25,却在第 25 层飙升到 0.97,但剪枝策略已在前面阶段将其永久移除,导致定位崩溃。这种不可逆性在激进令牌缩减(如 88.9%)下尤为脆弱,定位 IoU 可能跌至 0.4 以下。

正是在这一观察下,本文作者提出核心洞察:问题不在于评分器本身,而在于评分之后所采取的动作。因此,他们提出了 Reroute——一种训练免费的即插即用方法,将不可逆的移除替换为可恢复的路由。

核心方法:可恢复的视觉令牌路由

Reroute 将解码器内部的视觉令牌缩减重新定义为一系列分段的路由决策。其整体思想借鉴了混合深度(Mixture-of-Depth)的 conditional computation 范式,但无需训练任何额外参数:它直接复用解码器现有的文本到视觉注意力分数作为路由信号。

具体来说,将解码器划分为 SS 个阶段,每个阶段 ii 从某个路由层 i\ell_i 开始。在该路由层,利用当前层的文本-视觉注意力对所有候选视觉令牌 Ci\mathcal{C}_i 进行打分,根据保留比例 rir_i 选出得分最高的前 Ki=riVK_i = \lfloor r_i \cdot |\mathcal{V}| \rfloor 个令牌作为选中令牌 Visel\mathcal{V}_i^{sel},其余标记为延期令牌 Videf\mathcal{V}_i^{def}。关键区别在于:传统剪枝会直接将 Videf\mathcal{V}_i^{def} 从序列中彻底删除,而 Reroute 则让这些延期令牌绕过当前阶段的注意力+FFN 计算(通过残差路径保留原隐藏状态),但仍然保留在序列中,并在下一个路由阶段重新进入候选池。这使得一个在第一阶段被延期的令牌,只要后期重要性上升,仍有机会被重新选中并参与深层计算。

路由操作的数学描述非常简洁:

hj+1={Block(HAi)j,jAi,hj,jVidef.h_j^{\ell+1} = \begin{cases} \operatorname{Block}_{\ell}(H_{\mathcal{A}_i}^{\ell})_j, & j \in \mathcal{A}_i, \\ h_j^{\ell}, & j \in \mathcal{V}_i^{def}. \end{cases}

其中活跃集 Ai=TVisel\mathcal{A}_i = \mathcal{T} \cup \mathcal{V}_i^{sel},文本令牌始终参与计算。下一个阶段的候选池恢复为全量 Ci+1reroute=V\mathcal{C}_{i+1}^{reroute} = \mathcal{V},而剪枝的候选池则收缩为 Ci+1prune=Visel\mathcal{C}_{i+1}^{prune} = \mathcal{V}_i^{sel}。由此可见,传统剪枝本质上是 Reroute 的一个特例:它为延期令牌赋予零重新进入概率,而 Reroute 始终保持了恢复的可能性。

这种设计保证了理论效率的严格匹配:因为每个阶段只有 Ai\mathcal{A}_i 中的令牌真正进入注意力计算和前馈网络,所以 Reroute 的 FLOPs 和 KV 缓存与对应的剪枝基线处于同一量级。唯一的代价是延期令牌的状态保留和后续重新路由的逻辑,这在实际延迟上依赖于优化的 gather/scatter 内核。

创新点与贡献

本文的主要贡献可以归纳为三点:

  1. 可恢复路由范式:首次将解码器侧视觉令牌缩减从 “评分–移除” 重新塑造为 “评分–路由”,通过延期令牌的再入机制打破不可逆剪枝的约束。从条件计算的角度看,这给出了针对 VLM 视觉令牌的训练免费 Mixture-of-Depth 实例。

  2. 即插即用、成本匹配:Reroute 完全复用现有的评分器和阶段预算表,不引入任何可训练参数。它作为插件形式增强 FastV、PDrop、Nüwa 等既有方法,维持理论的 FLOPs 和 KV 缓存节省,无需重新训练模型。

  3. 跨架构、跨预算的一致增益:在 LLaVA-1.5、Qwen2.5-VL、Qwen3.5-Hybrid 等多种骨干模型上,Reroute 在指代定位基准(RefCOCO 系列)上稳定提升匹配预算的剪枝基线,尤其在激进令牌缩减下提升最为显著,同时保持通用 VQA 性能不退化。

实验结果分析

论文在上述多个模型和多个令牌预算下进行了系统评估。

在 LLaVA-1.5-7B 的 HuggingFace 格式实验中,Reroute 带来的定位平均准确性比率提升明显。例如,在平均令牌数为 64(88.9% 缩减)的极端设置下,FastV 的定位平均比率仅剩 0.6%,而 FastV+Reroute 也仅 0.6%(单阶段路由无明显恢复空间);但 PDrop 的比率从 22.2% 提升到 34.0%,说明多次路由机会对恢复性能至关重要。在 192 令牌时,PDrop+Reroute 的比率从 71.3% 提高到 82.3%。即便结合强大的 Nüwa 基线,Reroute 在 64 令牌下仍将定位比率从 54.6% 提高至 55.8%,证明可恢复延期即使在强基线之上依然有益。

在 Qwen 系列模型上的结果进一步展示了优势。Qwen2.5-VL 在 88.9% 缩减下,PDrop+Reroute 将比率从 11.1% 提升到 18.6%;Qwen3.5-9B-Hybrid 混合架构下,增益更为显著:同样 66.7% 缩减下,FastV+Reroute 直接将定位比率从 31.1% 拉升至 77.5%。这暗示在混合注意力架构中,保持序列布局对后续线性注意力状态更新可能更为重要。

通用 VQA 基准(包括 GQA、MMBench、TextVQA 等)显示,Reroute 不仅没有损害通用性能,甚至经常带来轻微改善。消融实验表明,路由阶段的频率和位置均影响最终效果:适度增加路由次数可进一步提升定位,但存在饱和趋势;将路由层放置在解码器早期到中期效果最佳。效率上,在 64 令牌预算下,FastV+Reroute 的 TFLOPs 降低了约 80%,KV 缓存降低约 86%,与剪枝基线基本持平。

实践应用建议

对于关注 VLM 推理效率和定位能力的工程师和研究者,Reroute 提供了极具实用价值的思路:

  • 即插即用集成:如果你的系统中已采用 FastV、PDrop 等剪枝方案,可以直接将移除操作替换为可恢复路由。代码量小,无需重新训练或调整评分规则,几乎零成本复用现有调度表。

  • 路由调度调优:尽管 Reroute 可以沿用基线调度,但根据任务特性和模型深度,适当增加路由阶段并将它们安排在解码器中早期,往往能获得更好的定位保留效果。建议先在目标数据上做一个小规模频率和位置扫描。

  • 结合编码器侧压缩和 KV 缓存回收:Reroute 聚焦于解码器内部视觉令牌的计算分配,可以与编码器端的令牌合并(如 VisionZip)或 KV 缓存驱逐策略(如 SnapKV)正交组合,进一步压缩端到端成本。

  • 对混合架构的启发:在 Mamba-Transformer 混合模型中,保持视觉令牌的完整序列布局对线性注意力状态演化有益。这一发现为设计新型高效 VLM 提供了思路:可以利用可恢复路由替代硬剪枝,更好地支撑混合注意力范式。

  • 在量化交易和金融多模态场景中,VLM 正被用于财报图表分析、研报图文理解等任务,对关键数字区域的定位精度要求极高。可恢复路由能够避免永久丢失后期解码所需的细粒度视觉证据,在限制计算预算的同时提升关键信息的提取准确性。随着多模态金融模型部署需求的增长,此类方法可帮助在延迟和准确性间取得更优平衡。

总结与展望

Reroute 从一个新的视角审视了 VLM 视觉令牌缩减问题:与其在评分后执行不可逆的移除,不如采用可恢复的延期路由。这种方法巧妙地利用了跨层注意力动态,将局限性从评分器的准确度转移到了决策的可逆性上,本质上是在不增加理论计算开销的前提下为视觉证据保留了第二次机会。

当然,Reroute 也继承了基于注意力排名路由的固有问题:如果评分本身质量较差或预算过于激进,延期令牌可能长期得不到重新入选;实际延迟优化依赖于高效的 scatter/gather 实现,在缺乏专用内核时难以达到理论加速;在 Qwen3-VL 等深层视觉特征注入架构下,调度尚需进一步适配。未来,引入轻量级可学习路由器、自适应预算分配以及与线性注意力状态更新的深度协同设计,将使这一范式更加鲁棒和实用。

总体而言,这篇工作传递出一条清晰的信息:视觉令牌缩减不应被简单视为一次性的裁剪,而应被看作一系列可恢复的路由决策。这一思想简洁、有效,为大规模 VLM 的高效推理开辟了新的设计空间。