持续视觉记忆:在 LVLMs 的深度生成中维持感知

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

arXiv: 2605.00814v1

论文信息

标题: Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

作者: Siyuan Huang, Xiaoye Qu, Yafu Li, et al.

发布日期: 2026-05-01

arXiv ID: 2605.00814v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:大视觉语言模型在长文本生成时,视觉信号会因注意力机制的归一化特性而逐渐衰减,导致模型脱离图像事实产生幻觉。
  • 核心方法:提出 “持久视觉记忆”(PVM),以一个轻量级并行分支独立执行视觉检索,与主推理路径解耦,从而规避序列长度增长带来的信号稀释。
  • 关键结果:在 8B 模型上,PVM 在 8 个基准上平均提升 4.8%,且长文本生成时相对提升可达 27.3%(图 5)。
  • 主要局限:仅基于 Qwen3-VL 系列验证,未在更多架构上测试;理论分析采用局部固定查询假设,未模拟全局查询漂移(附录 B)。
  • 适合读者:从事多模态大模型、注意力机制优化、视觉语言推理及长序列生成研究的技术人员。

论文背景和研究动机

大视觉语言模型(LVLMs)通过将视觉编码器与大型语言模型结合,已能在多种视觉任务中展现卓越能力。当前主流框架将视觉 token 作为前缀置于文本序列之前,以统一自回归生成。然而,当生成逐步深入,对话或推理链大幅延长时,一个结构性矛盾逐渐暴露:文本不断自我补充,而视觉 token 一旦注入便无法再生。论文将这一现象概括为 “视觉信号稀释”——随着文本历史累积,注意力归一化分母中文本侧质量不断增加,视觉侧权重被渐进式压缩,最终陷入低注意力均衡状态,语言先验以数量级优势压倒视觉线索。

为精确刻画该过程,论文在第 3.1 节给出数学建模。定义视觉注意力质量 ΩV(t)\Omega_{\mathcal{V}}(t) 为 Softmax 后所有视觉 token 的聚合权重,其中 tt 是当前文本序列长度。由于视觉 token 数量 MM 固定,相关求和项存在上界 β\beta;而文本侧注意力的平均质量存在下界 μ>0\mu > 0,所以文本总质量 ZTZ_{\mathcal{T}} 随 tt 线性增长。因此,ΩV(t)≤ββ+μt=O(t−1)\Omega_{\mathcal{V}}(t) \leq \frac{\beta}{\beta + \mu t} = \mathcal{O}(t^{-1}),这意味着视觉信号随生成长度按幂律衰减(定理 3.1)。当文本窗口远大于视觉上下文时,衰减虽趋于饱和,但此时视觉信号已被文本主导的结构性偏差淹没。

此前的一些研究尝试通过重新注入视觉信息来补救,但这往往直接介入串行的自回归路径,虽可暂时强化短期视觉召回,却会扰动原本应稳定推进的语义状态,破坏推理的逻辑连贯。基于上述分析,作者提炼出两条指导原则:一是建立与主推理骨架解耦的平行记忆通道,二是使用独立的注意力归一化机制,将检索约束在视觉域内,以彻底排除文本长度竞争。

核心方法和技术细节

基于上述洞察,论文提出了持久视觉记忆(PVM)。PVM 并非外部知识库或复杂层次结构,而是直接嵌入 Transformer 解码器块中,与 FFN 并列构成平行分支(图 4)。这种设计在保留原始 FFN 用于静态知识访问和逻辑推理的同时,为视觉感知开辟了一个结构独立、随需应变的检索通路。

具体计算分为三个阶段。首先,输入隐藏状态 x\mathbf{x} 和原始视觉特征 Vimg\mathbf{V}_{\mathrm{img}} 分别通过两个独立的下投影矩阵 Wdowntxt\mathbf{W}_{\text{down}}^{\mathrm{txt}} 和 Wdownvis\mathbf{W}_{\text{down}}^{\mathrm{vis}} 压缩到低维潜在空间(维度 d′<dd' < d)。这一瓶颈设计既控制参数量,又能在低维空间内实现高效的特征交互。其次,以投影后文本特征为查询,投影后视觉特征为键和值,执行交叉注意力,得到一个视觉强化表征,再经一个轻量 FFN 进一步提炼。最后,通过上投影矩阵 Wup\mathbf{W}_{\text{up}} 恢复到原始维度,得到输出 hpvm\mathbf{h}_{\mathrm{pvm}}。

在融合阶段,PVM 通过一个可学习的标量门 λ\lambda 以残差方式注入主干。为保留预训练能力,λ\lambda 初始化为 0。为防止视觉 token 自身产生冗余的自引用,引入视觉沉默掩码 Mtxt\mathcal{M}_{\text{txt}},仅在文本 token 处激活视觉注入。

从理论层面,PVM 实现了独立注意力归一化。其输出 hpvm\mathbf{h}_{\mathrm{pvm}} 的定义中(式 5),注意力分母 ZpvmZ_{\mathrm{pvm}} 仅对固定的视觉集合 V\mathcal{V} 求和,文本长度 tt 不在该封闭集的任何构成项中出现。在局部固定查询的假设下,∂∣hpvm∣∂t=0\frac{\partial |\mathbf{h}_{\mathrm{pvm}}|}{\partial t} = 0(定理 4.1),实现了结构性的信号稀释规避。

训练采用两阶段策略。第一阶段仅优化 PVM 模块和门控标量,以冻结主干的方式完成视觉记忆对齐,数据为 526k 条监督微调样本;第二阶段使用 GRPO 进行策略精炼,同时解冻语言骨干和 PVM 模块,基于 3.6k 高难度推理查询激发主动视觉检索。PVM 模块按间隔策略部署在第 8、16、24 层(8B 模型),仅引入约 27.92M 额外参数,约占模型总量的 0.32%。

创新点和贡献

论文的主要贡献可以归纳为三个层面。第一层是系统性的现象刻画。通过数学推导,论文首次给出视觉信号稀释的严格数学形式,并区分了 “幂律稀释阶段” 和 “高幅度饱和陷进” 两种动力机制,为问题提供了清晰的理论框架。

第二层是架构层面的创新。PVM 设计将视觉感知提升为一条与推理并行的独立处理流,同时用独立 Softmax 域隔离文本竞争。这一设计规避了串行注入方法中 “强化视觉” 与 “保持推理连贯” 之间的权衡。

第三层是实证层面的充分验证。在 8 个多样化基准上,PVM 在 8B 模型上实现 4.8% 的平均提升,4B 模型上为 4.4%(表 1)。与多个外部基线(如 ICoT、CoMemo)和同期 RL 推理器(如 Euclid-8B、PEARL-8B)相比,PVM 均取得最高平均分或显著优势。更细致的分析表明,性能增益与生成长度正相关(“长” 组相对提升 27.3%,图 5),印证了 PVM 从机制层面缓解信号稀释的能力。LogitLens 分析进一步揭示,PVM 加速了预测量从中间层到最终输出的收敛,而不仅仅是扩充模型容量。

实验结果分析

主实验结果(表 1)表明,PVM 在通用理解和数学科学推理两类任务上均带来一致的改进。在 8B 设定下,SFT 阶段 PVM 已取得 70.6% 的总平均分,优于同等训练条件下的 LoRA-SFT 以及多类视觉注入方法;叠加 GRPO 后,均值升至 71.5%,超过专为推理优化的 Euclid-8B(69.5%)与 PEARL-8B(69.3%)。4B 设定下趋势相似,PVM 两阶段训练的均值(68.4%)同样领先所有内部基线及 LoRA 变体。

在针对长序列生成的能力分析中,研究将 MathVerse 样本按输出长度分组。PVM 在极短组有 6.1% 的提升,而在长组该值跃升至 27.3%(图 5),直接展示了持久视觉记忆在深度生成时不可替代的信号稳定作用。LogitLens 中 KL 散度的比较显示,PVM 模型的预测分布在中间层距最终输出的距离始终低于基线,且自首次注入层(第 8 层)后差距持续扩大,这意味着 PVM 帮助主干更早地确定输出方向,加速了从感知到推理的转换。

消融研究进一步验证了关键设计的有效性。将检索源从原始视觉嵌入替换为当前隐藏状态,推理基准得分大幅坍塌(表 2),表明了独立于文本特征的跨模态检索的重要性。注入层选择上,与根据注意力峰值或最大衰减点聚类的两种策略相比,论文采用的跨深度等间隔布置取得最优平均精度(表 3),证明全深度覆盖能保证不同处理阶段的一致视觉校对。在潜在维度分析(附录 F)中,论文指出增大维度因数据不足以饱和更大参数空间而导致性能轻微回落。等参对照实验(附录 G)证明性能提升来源于检索机制本身,并非单纯参数扩充。推理开销方面,PVM 仅增加约 1.18 ms 的单步延迟,吞吐下降 4.6%(附录 H,表 7),在保持高效的同时显著改善视觉保真度。

实践建议

PVM 的设计可作为视觉语言模型架构优化的一种直接参考。首先,对于需要处理多轮对话、长文档理解或复杂推理的系统,可在现有 Transformer 解码器中引入类似 PVM 的并行检索分支,以维持长序列下的视觉一致性。建议优先在中间层(通常在总层数的 20% 至 70% 区间)按均匀间隔部署,以获得全深度覆盖。

其次,部署时应充分利用两阶段训练策略。第一阶段仅训练 PVM 相关参数并冻结骨干,这可以快速建立文本查询与视觉键值的语义对齐,降低对大容量训练数据的需求。第二阶段再结合强化学习(如 GRPO)解冻骨干,以强化模型在复杂上下文中的主动检索倾向。

最后,若需要权衡推理效率与视觉保真度,可将瓶颈维度设在 512 左右,训练数据量增大时可适度提升至 1024。建议在所有微调数据中保留一定比例的高视觉依赖长序列样本,以促进模型在真实场景中充分利用 PVM 提供的视觉记忆能力。