重路由,而非移除:面向视觉语言模型的可恢复视觉词元路由

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

arXiv: 2606.12412v1

论文信息

标题: Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

作者: Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

发布日期: 2026-06-10

arXiv ID: 2606.12412v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:现有视觉语言模型(VLM)的视觉 token 缩减方法(如 FastV、PDrop)采用 “排序后删除” 的不可逆策略,在激进缩减下会永久丢弃后期解码层可能需要的关键视觉证据,导致视觉定位(grounding)能力崩溃。
  • 核心方法:提出 Reroute,一个无需训练的即插即用模块,将不可逆的删除替换为可恢复的路由:在每个路由阶段,低分 token 不参与当前层的注意力计算,但保留在序列中以备后续阶段重新评估和重新选择进入计算。
  • 关键结果:在 LLaVA-1.5-7B 上将平均视觉 token 从 576 削减至 64(减少 88.9%)时,PDrop+Reroute 将 RefCOCO 系列定位任务的平均准确率从 22.2% 提升至 34.0%,相对提升超过 53%(见表 1(b))。
  • 主要局限:性能依赖现有的注意力分数排序规则,若原始评分器失效则路由策略受限制;实际延迟收益受限于自定义 gather/scatter 算子的优化程度;路由调度(层位置和数量)需手动指定,未实现自适应。
  • 适合读者:从事视觉语言模型推理加速、token 压缩、条件计算(如 Mixture-of-Depth)研究,以及关注多模态模型定位能力与效率平衡的研究者和工程师。

论文背景和研究动机

视觉语言模型(VLM)如 LLaVA、Qwen-VL 等将图像投影为数百乃至上千个视觉 token,送入大语言模型(LLM)解码器进行联合推理。这使得解码器的注意力计算复杂度随 token 数呈二次增长,KV-cache 内存占用随 token 数线性增长,成为 VLM 规模化部署的主要瓶颈。

当前主流的视觉 token 缩减方法遵循一套共同的 “排序后删除”(rank-and-remove)范式:在解码器的某一层或多层,利用文本对视觉 token 的注意力分数对视觉 token 进行重要性排序,保留分数最高的一部分,然后永久丢弃其余 token。FastV[12]在早期层做一次性剪枝,PDrop[71]在多个阶段逐步缩减,FEATHER 和 Nüwa 等改进评分规则以更好地保留空间证据。尽管评分策略不断演进,但动作本质从未改变——被删除的 token 永远消失。

论文通过实验揭示了这个范式的一个根本性缺陷。图 2(a)展示了在 RefCOCO 图像上,查询词(如 “boy”“blue jacket”)对视觉 token 的注意力分布随解码器深度显著漂移:浅层注意力弥散,而目标关联区域仅在中深层才逐渐浮现。图 2(b)追踪了 “穿绿衬衫的男子” 对应的真实边界框内某个关键 token:在第 3 层(FastV 的决策层)其注意力百分位仅为 0.11,在第 8 层(PDrop 的决策层)也仅升至 0.25,两种方法都会将其视为低重要性 token 而永久删除——但它在第 25 层飙升到 0.97。一旦删除,这个后期至关重要的视觉证据便无法恢复,导致激进取缩下的定位能力彻底崩溃(图 1,IoU<0.4)。

这个观察直指问题核心:限制不在评分器质量,而在评分后采取的不可逆动作。论文据此提出了一个自然的替代方案:将删除改为暂缓。

核心方法和技术细节

Reroute 的核心思想是将视觉 token 缩减从 “不可逆剪枝” 重新定义为 “可恢复的阶段式路由”。

路由机制的形式化:设解码器被划分为 SS 个路由阶段,阶段 ii 在层 ℓi\ell_i 做路由决策,保持比例 rir_i。在每个路由层,使用与对应剪枝基线完全相同的文本到视觉注意力评分规则,从当前候选集 Ci\mathcal{C}_i 中选出 top-KiK_i 个 token(Ki=⌊ri⋅∣V∣⌋K_i = \lfloor r_i \cdot |\mathcal{V}| \rfloor)构成选中集 Visel\mathcal{V}_i^{\mathrm{sel}},其余为延迟集 Videf\mathcal{V}_i^{\mathrm{def}}。关键区别在于后续动作:

  • 剪枝方法执行 Ci+1prune=Visel\mathcal{C}_{i+1}^{\mathrm{prune}} = \mathcal{V}_i^{\mathrm{sel}},候选集不断收缩
  • Reroute 执行 Ci+1reroute=V\mathcal{C}_{i+1}^{\mathrm{reroute}} = \mathcal{V},候选集完全恢复

在一个阶段内部,只有 Visel\mathcal{V}_i^{\mathrm{sel}} 中的 token 通过完整的 Attn+FFN 计算,延迟 token 通过残差路径绕过该阶段但保留在序列状态中:

hjℓ+1={Block⁡ℓ(HAiℓ)j,j∈Ai,hjℓ,j∈Videf.h_j^{\ell+1} = \begin{cases} \operatorname{Block}_\ell(H_{\mathcal{A}_i}^\ell)_j, & j \in \mathcal{A}_i, \\ h_j^\ell, & j \in \mathcal{V}_i^{\mathrm{def}}. \end{cases}

效率匹配:由于每个阶段只有 Ai=T∪Visel\mathcal{A}_i = \mathcal{T} \cup \mathcal{V}_i^{\mathrm{sel}} 参与计算,Reroute 保持与被增强剪枝方法相同的理论计算量和 KV-cache 预算(见表 4,64 token 设置下 FastV+Reroute 与 FastV 的 KV-cache 分别为 41.5MB,PDrop+Reroute 为 51.6MB vs PDrop 为 49.7MB)。

与条件计算的关系:论文将 Reroute 定位为 Mixture-of-Depth(MoD)原理在 VLM 视觉 token 剪枝场景下的无需训练实例化。标准 MoD 学习一个路由器决定哪些 token 执行计算,而 Reroute 直接复用已有的文本到视觉注意力信号作为路由依据,无需任何额外训练参数。

创新点和贡献

论文的核心贡献在于视角转换而非全新的评分机制。

从不可逆删除到可恢复路由的范式转变:这是论文最重要的概念贡献。传统方法将视觉 token 缩减建模为一个排序后永久丢弃的问题;Reroute 将其重铸为阶段式条件计算问题——在每个决策点,低分 token 只是暂缓计算,而不是永久删除。这从模型层面承认了视觉 token 重要性跨深度的动态变化特性。论文明确指出了传统剪枝是 Reroute 的特例——当延迟 token 的重入概率为零时的退化情况(见论文第 4.2 节)。

基于混合深度架构的即插即用设计:Reroute 无需训练任何额外参数,完全复用现有剪枝方法的评分规则、路由层位置和保持比例调度。这种设计使得它可以作为 FastV、PDrop、Nüwa 等多种剪枝方法的直接增强插件,保持了原有的理论效率特性(表 4)。

跨方法和跨骨干网络的一致性验证:论文在 LLaVA-1.5、Qwen2.5-VL、Qwen3.5 三种架构上,针对 FastV、PDrop、Nüwa 三种剪枝策略,均验证了 Reroute 的有效性。尤其在激进缩减和定位密集型任务上增益最大——这直接支持了核心论点:定位任务更容易因不可逆删除而丢失后期才显示出重要性的视觉证据。

实验结果分析

论文在视觉定位和通用视觉问答两个维度上对 Reroute 进行了系统评估。

视觉定位:这是评测的核心领域。在 LLaVA-1.5-7B 的 HuggingFace 格式复现中(表 1(b)),Reroute 在各个 token 预算下均一致提升匹配的剪枝基线。在平均 192 token(减少 66.7%)下,FastV+Reroute 将平均准确率比重从 45.5% 提升至 59.2%,PDrop+Reroute 从 71.3% 提升至 82.3%。在最极端的 64 token(减少 88.9%)下,PDrop+Reroute 从 22.2% 提升至 34.0%,效果显著。在 Qwen 系列模型上,Reroute 同样有效(表 2)。Qwen2.5-VL-7B 在 88.9% 缩减下,PDrop+Reroute 从 11.1% 提升至 18.6%。Qwen3.5-9B(混合 Mamba-Transformer 架构)上增益格外突出:66.7% 缩减下 FastV+Reroute 从 31.1% 跃升至 77.5%,PDrop+Reroute 从 40.0% 跃升至 77.7%(表 2(b)),论文推测这与混合架构下保留序列布局对线性注意力状态更新的重要性有关。

通用 VQA:在 GQA、MME、TextVQA、POPE 等任务上(表 3),Reroute 保持与剪枝基线持平或略有提升的能力,说明定位增益并非以牺牲通用多模态理解为代价。在 192 token 下,FastV+Reroute 的平均 VQA 得分比重从 93.9% 升至 96.5%,PDrop+Reroute 从 96.6% 升至 98.6%。

路由调度消融:论文通过频率扫描和位置扫描分析了路由调度的影响(图 5)。增加重路由层数普遍改善性能,在 GQA 和 RefCOCO 测试集上呈上升趋势;路由层位置宜安排在解码器早到中期,过晚插入收益递减。

实践建议

Reroute 的设计使其特别适合实际 VLM 推理系统的优化,尤其当场景对视觉定位精度有较高要求时。

直接即插即用的集成方案:如果你已经在使用 FastV、PDrop 或 Nüwa 等剪枝方法,Reroute 可以直接替换其中的删除动作为延迟路由,无需重新训练模型、调整评分规则或修改 token 预算。论文公开的代码基于标准 HuggingFace transformers 接口实现,gather/scatter 操作在现有框架下即可完成。

在定位密集型任务中优先采用:若应用场景涉及指代表达理解、视觉定位、目标检测等需要精确空间对应关系的任务,当前的永久剪枝策略(哪怕使用了空间保留的评分规则)在激进缩减下仍可能丢弃关键证据。Reroute 的可恢复机制在两阶段以上的调度下,能显著缓解这一问题——实验显示 PDrop+Reroute 在极低 token 预算(64)下的定位准确率几乎翻倍。

路由层配置的策略参考:论文的频率和位置消融提示了两个调度原则:(1) 安排至少 34 个路由层以提供足够的重评估机会;(2) 首层路由安排在解码器早期(如层 23),后续路由分布在早期到中期区域(如层 7~15,具体需按模型总深度归一化)。过晚的路由虽保留更多 token,但可能已经错失了语义理解的关键窗口。

混合架构下的额外收益:对于采用门控线性注意力或混合注意力机制的模型(如 Qwen3.5),论文观察到保留序列布局对后续线性注意力层的状态更新可能有积极影响。如果你的系统使用了类似架构,Reroute 的延迟路由(token 不离开序列)而非物理删除,可能带来超出预期的性能保持。