从数据统计到特征几何:相关性如何塑造叠加

From Data Statistics to Feature Geometry: How Correlations Shape Superposition

arXiv: 2603.09972v1

论文信息

标题: From Data Statistics to Feature Geometry: How Correlations Shape Superposition

作者: Lucas Prieto, Edward Stevinson, Melih Barsbey, et al.

发布日期: 2026-03-10

arXiv ID: 2603.09972v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:为什么真实语言模型中的特征几何结构(如语义簇、循环排列)与理想化叠加态的理论预测(规则多面体、干扰最小化)之间存在差异?
  • 核心方法:提出 Bag‑of‑Words Superposition(BOWS)受控实验框架,用词袋自编码器模拟在真实文本相关性下的特征叠加,并区分线性叠加与非线性叠加,分析权重几何。
  • 关键结果:当特征之间存在相关性时,自编码器会利用 建设性干扰(constructive interference) 来高效重构,从而自然产生语义聚类和月度循环等结构;这一现象在紧瓶颈或有权重衰减时尤为显著(见图 3、图 4)。
  • 主要局限:BOWS 框架高度简化,尚未刻画何时建设性干扰与 ReLU 过滤各自占主导的完整数学条件;实验仅覆盖词袋自编码器,未推广到更大规模的语言模型残余流。
  • 适合读者:从事机械论可解释性、表示学习、语言模型内部表征分析,以及稀疏自编码器训练的研究者。

论文背景和研究动机

机械论可解释性的核心假设之一是 叠加态(superposition):神经网络用少于特征数的维度表示更多的特征,从而形成过完备基,但代价是特征之间产生干扰。在这幅标准图景中,特征通常被假定为稀疏且互不相关,干扰被视为必须由非线性(如 ReLU)滤除的纯噪声,于是特征方向倾向于排列成正多面体等局部结构,以最小化两两点积(Elhage 等,《Toy Models of Superposition》)。

然而,近年对真实语言模型激活的解释却呈现出截然不同的画面:先后发现语义相关的特征会聚集成簇(Bricken 等,2023;Templeton 等,2024),以及诸如月份、星期等概念形成有序的循环结构(Engels 等,2025)。这些现象无法用 “干扰最小化” 和规则多面体的解释来涵盖。本文的出发点正是这一矛盾:现有的叠加态理论忽略了一个关键因素——真实数据的特征往往高度相关,而这可能从根本上改变几何排列和干扰的作用方式。

核心方法和技术细节

线性叠加与非线性叠加的形式定义

论文首先给出了操作化定义。对于 dd 个特征,编码器 W∈Rm×d\mathbf{W}\in\mathbb{R}^{m\times d}(m<dm<d)将特征映射到 mm 维空间。给定解码器 ψ\psi 及特征重建的决定系数 Ri2R_i^2,若存在线性解码器使得所有特征的 Ri2≥1−εR_i^2\ge 1-\varepsilon,则称这些特征处于 线性叠加(linear superposition);反之,若必须依赖非线性解码器才能达到该阈值,则属于 非线性叠加。这一区分是后续所有几何分析的基础。

BOWS:受控的真实数据叠加实验台

为了在已知真实特征的前提下研究相关性如何塑造几何,作者设计了 BOWS(Bag-of-Words Superposition)。选取 WikiText‑103 语料,构建 V=10 000V=10\,000 个最常见非停用词的词表,将每 c=20c=20 个连续文本记录合并成一个二元词袋向量作为样本。如此得到的样本具有现实的多词共现模式,且每个词就是一个可追踪的 “特征”。

然后训练两种自编码器来重构这些二值词袋向量:

  • 线性 AE:L=∣∣f−(W⊤Wf+b)∣∣2\mathcal{L}=||\mathbf{f}-(\mathbf{W}^\top\mathbf{W}\mathbf{f}+\mathbf{b})||^2,
  • ReLU AE:L=∣∣f−ReLU(W⊤Wf+b)∣∣2\mathcal{L}=||\mathbf{f}-\mathrm{ReLU}(\mathbf{W}^\top\mathbf{W}\mathbf{f}+\mathbf{b})||^2,

其中 W∈Rm×V\mathbf{W}\in\mathbb{R}^{m\times V} 是编码矩阵,同时也是解码器转置的权重(绑重)。通过改变瓶颈维度 mm 和增加权重衰减,可以系统研究解空间如何受优化偏置的影响。

干扰项分解与建设性干扰的条件

对于绑重 AE,特征 ii 的重建可以分解为 f^i=σ(∥wi∥2fi+∑j≠i⟨wi,wj⟩fj+bi),\hat f_i = \sigma(\|\mathbf{w}_i\|^2 f_i + \sum_{j\neq i}\langle\mathbf{w}_i,\mathbf{w}_j\rangle f_j + b_i), 第二项即为干扰 Ii\mathcal{I}_i。标准观点将其视为噪声,并通过负偏置和 ReLU 抑制。但文章指出,当数据协方差 Σ\mathbf{\Sigma} 的秩小于等于 mm 时,线性 AE 的最优解等价于对 Σ\mathbf{\Sigma} 前 mm 个主成分的投影,此时 Ii=(1−Pii)fi\mathcal{I}_i = (1-P_{ii})f_i,干扰与信号本身成比例而非对立,因此是 建设性的。对于真实文本这种近似低秩的数据,残差很小,建设性干扰依然能大幅降低重构所需的权重范数:一个秩-mm 投影满足 ∥W∥F2=m\|\mathbf{W}\|_F^2=m,远小于稀疏特征滤除干扰方案所需的 ∥W∥F2≈d\|\mathbf{W}\|_F^2\approx d。因此,在瓶颈极紧(m≪dm\ll d)或施加权重衰减时,模型会倾向于学习这种低秩投影,从而反映数据协方差结构。

创新点和贡献

  1. 提出建设性干扰概念:推翻 “干扰必定有害” 的固有认知,揭示当特征相关时,叠加态可以主动利用协方差结构,使干扰增强信号。这为机械论可解释性中的特征几何提供了全新解释框架。

  2. BOWS 实验框架:在受控条件下引入真实文本统计特性,并保留所有特征的真实标签,弥补了理想化玩具模型与大规模语言模型之间的空白,为后续叠加态研究提供了标准化基准。

  3. 形式化线性/非线性叠加与值编码特征:不仅定义了叠加态的可线性恢复条件,还区分了 存在编码特征(二元分类)与 值编码特征(连续变量如坐标、正弦值),指出后者可以在完全没有相关性的数据中形成有序结构,但其本质与叠加无关(如模加法中的圆、城市坐标地图)。这种区分避免了对特征几何成因的错误归因。

  4. 统一解释多项已有观测:用一套机制同时解释了语义簇与月份/星期循环,并指出权重衰减会放大这种现象(图 3d),这与语言模型通常使用权重衰减的实践相吻合。

实验结果分析

合成循环数据上两种解并存

用 12 维循环相关数据训练 AE,改变 mm(图 2)。当 m<6m<6 时,ReLU AE 的权重内积矩阵复现了线性 PCA 的圆形结构,呈现线性叠加;当 6≤m<126\le m<12 时,转为反足对(antipodal pairs)排列,对应典型的非线性叠加(过滤干扰)。这说明同一模型可以同时包含两种机制,具体选择取决于压缩程度。

真实文本中的语义簇受权重衰减强化

在 WikiText-BOWS 上训练的不同 mm 的 ReLU AE(图 3),当 m=200m=200 时 UMAP 投影显示清晰的语义簇;m=800m=800 时簇结构弱化;但在 m=800m=800 并施加权重衰减(wd=4)后,语义簇重新出现。这证明权重衰减确实会推动模型去利用低秩共享结构,使反映数据相关性的几何得以浮现。

循环结构源于数据,而非模型发明

对 12 个月份的词向量,论文展示了数据中的相关性矩阵本身就呈现循环模式(图 4a),PCA 直接将其投影为平面上的圆(图 4b)。训练后的编码器权重 W\mathbf{W} 的对应列在经过 PCA 后形成相同的圆(图 4c),并且 “Christmas” 等季节性词与相应月份在几何上对齐,表明 “December” 等词的干扰直接有利于重建 “Christmas”(图 4d)。对月份特征单独训练一个线性解码器,达到 R2=0.98R^2=0.98,确认它们处于线性叠加态。

建设性干扰与过滤干扰共存

低频词如 “Beatles” 及其成员名在一次性出现(one-hot)时重建几乎为零,但在含有相关词的上下文中验证 R2R^2 超过 0.5,且 81% 的样本中上下文重建优于独热(图 5)。同时,当类似上下文出现但不含目标词时,负偏置和 ReLU 会压制误报。这具体展示了建设性干扰与典型过滤是如何在同一特征上互补的。

不同特征组退化为正交的时机不同

比较月份词和早期罗马数字(I‑X)的权重内积,发现在 mm 增大过程中,月份较早趋近正交,而罗马数字在更大 mm 下仍保留有序结构(图 6)。这源于词语频率和相关性强度的差异:高频、强相关组在较松的瓶颈下仍可利用低秩结构,而更稀疏的组则更快转向独立表示。

值编码特征带来的几何假象

在模加法及美国城市相对位置预测的实验中,即便训练样本中任意两座城市从未在同一批次重复出现(无相关性),模型依然学会了将城市嵌入投射到坐标平面上,形成美国地图(图 7)。保留下标坐标方向的子空间(VC⁺)几乎不损失性能,而消融掉该子空间(VC⁻)则彻底失效,表明这些结构源自功能驱动的值编码特征,与数据统计相关性驱动的几何属于不同类别。

局限与待解决问题

BOWS 的简化使得其结论距离直接应用到真实 Transformer 的残余流仍有鸿沟:文本记录被压缩为二值词袋,丢失了词序和更复杂的语义组合。同时,论文虽展示了建设性干扰和 ReLU 过滤可以共存,但尚未提炼出一个判断 “何时从一种机制切换到另一种” 的定量准则(例如基于特征频率、相关性强度和有效秩的相图)。

此外,实验主要集中在绑重自编码器上,未来需验证在非绑重解码器以及 SAE 训练场景下,相关性驱动的几何是否同样显著。作者也指出,BOWS 可以充当 SAE 评估的基准,但本身并未提供新的训练技巧或体系改进方案;这套工具作为诊断框架的潜力仍待后续工作挖掘。最后,论文中以 R2=0.5R^2=0.5 为界划分线性/非线性叠加本身带有一定主观性,更精确自动化划分的方法也是开放问题。