尖峰、稀疏与汇点:大规模激活与注意力汇的剖析
The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks
论文信息
标题: The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks
作者: Shangwen Sun, Alfredo Canziani, Yann LeCun, et al.
发布日期: 2026-03-05
arXiv ID: 2603.05498v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题: 本文要厘清大语言模型(LLM)中 “大规模激活”(极少数 token 在特定通道上出现极端数值)与 “注意力沉降”(特定 token 吸引远超语义所需的注意力)这两个现象的因果关系与功能分工。
- 核心方法: 论文通过正向机理追踪(从归一化、残差流、前馈块入手)和反向消融实验(修改归一化配置、注意力头维度、训练上下文长度等),系统解剖两个现象的生成与耦合机制。
- 关键结果: 大规模激活与注意力沉降的频繁共现是 pre-norm 架构的人为产物,二者功能独立;通过更换归一化配置(如 Sandwich Norm 或 DynamicTanh)可以几乎消除大规模激活(峰值从数千降至数十),而注意力沉降可以继续存在(表 5)。
- 主要局限: 实验主要基于 Llama 与 Qwen 系列 7B–14B 级别模型在百 B token 规模的从头训练,更大模型或不同训练配方下的行为未被完全覆盖。
- 适合读者: 从事 LLM 训练、推理优化(量化/剪枝/长上下文)、架构设计的工程师与研究者,以及对 Transformer 内部表征感兴趣的读者。
论文背景和研究动机
近年来,研究者反复在 decoder-only、pre-norm Transformer 中观察到两个奇特现象:“大规模激活”(massive activations)与 “注意力沉降”(attention sinks)。前者指极少数 token 在少数几个通道上产生比其他 token 大几个数量级的数值;后者指某些 token(往往是第一个 token 或分隔符)在大量注意力头中占据绝对主导的注意力质量,与语义几乎无关。由于这两个现象经常出现在相同 token 上,先前工作多将其视为一体或认为存在直接因果。然而,它们的真正功能角色与因果方向一直缺乏系统性的机制解释。
这一问题的应用价值明显:大规模激活是低精度量化的主要障碍,注意力沉降又深刻影响 KV 缓存管理与长上下文推理效率。若能厘清二者的关系,不仅可以在架构设计上做出针对性改进,也有望降低推理成本。本文的目标正是从 “描述” 走到 “机制”:回答 “为何它们会共同出现”、“能否独立控制”、“各自承载何种功能” 这三个核心追问。
核心方法和技术细节
大规模激活的生成:前馈块作为 “方向性二次放大器”
作者首先揭示,大规模激活的根源是特定前馈块(SwiGLU)在 “步进块”(step-up block)中充当了方向性二次放大器。具体而言,对于 spike token 的归一化后表示 ,当 SiLU 门控处于近恒等区间时,该块的输出在第 通道可近似为:
其中 的谱呈单一大特征值结构(图 4)。当一个共享的触发方向 与输入对齐时,该二次型给出极端值,导致多个通道同步 spike。论文称此为 “方向性二次放大器” 效应,并证明该机制解释了 spike 的五个已知特征:仅出现在中间层、少数通道、通道协同触发、几乎固定的通道间数值比、以及仅在极少数 token 上出现(见第 3.1.2 节)。
注意力沉降的生成:归一化将 spike token 压缩为近常向量
大规模激活在残差流中持续积累后,每一层的 RMSNorm 会将 spike token 映射为一种 “稀疏、有界、近乎常数” 的表示:
- 有界性: 每个坐标的绝对值不超过 (定理 B.3);
- 稀疏性: 数值集中在极少数 spike 通道上;
- 近常性: 不同 spike token 经过归一化后几乎收敛到同一方向(图 5)。
由此,spike token 的键向量 被限制在 少数几行的张成空间内(通常仅一至二维),而普通 token 的查询向量与键向量则分布在一个宽得多的子空间中。当某注意力头的查询子空间更靠近 spike 键子空间而非普通键子空间时,logit 间隙持续存在,便形成注意力沉降(图 6)。
创新点和贡献
-
将两个 “灵异现象” 彻底解耦。 此前多数文献将二者视为伴生:文献指出 spike token 常与 sink token 重叠,但未给出因果。本文通过严格的正向推导和反向消融,明确指出共现只是 pre-norm 架构的副产品,并非功能必然。这一结论为后续技术工作(例如 “去 spike 不去 sink” 的量化或缓存方案)提供了关键依据。
-
提出 “注意力沉降即隐式门控” 的功能假设。 当将动态条件门控(conditional gating)引入注意力时,沉降几乎消失(sink ratio 从 46% 降至 4.5%–6.4%,见表 7),而模型质量不降。这说明沉降在标准架构中充当了一种 “学会的绕过方案”——将多余的注意力倾斜到第一个 token 上,以实现短距离依赖主导的信息路由。
-
给出系统化、可复现的设计准则。 在从头训练的 7B 模型中,作者通过剪除 spike(Sandwich Norm 或 DynamicTanh)而不丢失 sink,或通过移除短序列训练分布以完全消除 sink(sink ratio 降至 1.2%–8.0%,表 8),证明每个现象都可以在不牺牲语言建模困惑度的情况下独立抑制。
实验结果分析
优化超参数的影响
论文首先建立基线 Llama 风格 7B 模型(100B token 训练),再现了大规模激活与注意力沉降。优化超参数消融(表 3)显示:
- sink ratio 与优化健康正相关: 极端的基学习率、关闭权重衰减或错误设置 均降低了 sink ratio;增加训练 token 数则提高 sink ratio。
- spike 幅度与优化健康平行变化: 例如,关闭权重衰减使 spike 数值飙升至 12,275,而困惑度与 sink ratio 无对应提升。
架构消融中的关键发现
- 前馈块设计非必要条件: GeLU、线性、甚至纯注意力替代方案均可产生 sink 与 spike,但 SwiGLU 和 GeLU 的效率更高(表 4)。
- 注意力头维度是 sink 的主导杠杆: 保持总容量不变时,增大单头维度( 从 32 升至 128)使 sink ratio 从 27.9% 升至 46.0%;且将容量集中在更少、更大的头上持续增强沉降行为(表 6)。
- 条件门控可消除沉降: 仅需基于当前表示的门控变量,模型便不再需要将第一个 token 作为信息倾卸场(表 7)。
- 沉降是短上下文训练的产物: 当训练损失仅在长序列位置上计算(剔除短于 1024 或 2048 的位置),sink ratio 急剧下降,证实沉降主要用于支持短距离依赖(表 8)。
两个现象的独立可控性
综合这些消融,paper 得出的核心图景是:spike 可以被归一化配置单独消除(不破坏 sink),而 sink 可以被长上下文训练或条件门控消除(不消除 spike 也未必损害训练困惑度)。这一独立性将给后续推理优化带来更多灵活性。
实践建议
量化部署路径
大规模激活是 LLM 低精度量化的最大障碍。根据本文结论,若不想改动太多模型结构,最简单的干预是引入 Sandwich Norm 或 QK-Norm:在注意力块的输出端加一道 RMSNorm 即可将残差流中的极端值锁在安全范围内(spike 幅度从千级降至几十,表 5),且现有模型权重可在微调后适配。对于已经预训练好的大模型,可以考虑后训练时插入 DynamicTanh 替代标准 RMSNorm,该方法同样能消除 spike 而不要求改变注意力模式。
KV 缓存策略设计
在长上下文场景去掉注意力沉降并非总是好事。文章指出,沉降本质上是让某些头聚焦于短距离依赖的机制。因此,在设计 KV 缓存驱逐策略时,不应简单删掉第一个 token,而应对沉降头和非沉降头分别处理:前者保留第一个 token 即可保证短距离模式不被破坏,后者则可按其他语义重要性指标进行缓存剔除。对于意图完全消除沉降以改善中段信息提取的场景,训练时仅覆盖长序列位置是有效手段,但需权衡可能带来的短距离建模精度损失。
架构选型建议
若从零设计模型,可以考虑直接引入基于当前表示的通道级条件门控(per-channel conditional gating),以替代沉降的隐式路由功能。这既消除了第一个 token 的注意力倾卸,也避免了后续昂贵的 KV 缓存维护。同时,在满足训练算力预算的前提下,适度增大注意力头维度、减少头数,可以提升头内表征的几何分离度,从而增强模型自身对注意力分布的控制力,降低对架构 tricks 的依赖。