语言统计中的对称性塑造模型表示的几何结构
Symmetry in language statistics shapes the geometry of model representations
论文信息
标题: Symmetry in language statistics shapes the geometry of model representations
作者: Dhruva Karkada, Daniel J. Korchinski, Andres Nava, et al.
发布日期: 2026-02-16
arXiv ID: 2602.15029v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:大语言模型(LLM)的内部表示中,为什么会出现规则几何结构(如月份排成圆圈、年份形成一维流形、地理位置可被线性解码)?这篇论文试图给出统一的理论解释。
-
核心方法:作者发现,语言统计数据中存在平移对称性——两个词共现的概率只取决于它们在潜在语义连续体(如时间、空间)上的距离。基于此,他们从词嵌入模型的解析解出发,推导出表示几何形状的显式表达式。
-
关键结果:即使将月份之间所有的共现句子从训练语料中删除,模型依然能学到月份的圆圈结构(图 4)。这种鲁棒性源于 “季节性” 等连续潜变量在整个词汇表中引起的集体效应。
-
主要局限:理论推导主要在浅层词嵌入模型上严格完成,用于解释深层 LLM 时,仅得到定性一致。作者在 Discussion 中明确承认 LLM 有 “根据上下文消除歧义” 的能力,而当前理论尚无法覆盖这类现象。
-
适合读者:关注语言模型可解释性、表示学习理论、词嵌入原理的研究者,以及对对称性与深度学习几何结构关系感兴趣的读者。
论文背景和研究动机
近年来,一系列实证研究发现,大语言模型的内部表征展现出规律惊人的几何结构:一周七天排成圆环,一年十二个月形成一维流形,城市经纬度可被线性分类器准确解码(engels2024not, gurnee2023language, gurnee2025when)。这些现象在不同模型架构上一致出现,但缺乏一个统一的组织原则来解释它们为何产生。
本文提出的核心观点是:表征几何形状反映了词对之间的共现统计量,尤其是这些统计量中的对称性,集体驱动了表征流形的形成。
作者将目光投向最简单的语言模型——词嵌入算法(word2vec、GloVe 等),这些算法仅从词对共现统计量中学习表示。如果几何结构能在这些浅层模型中复现,那么它们很可能直接源于数据中的低阶统计特性,而非深层 Transformer 特有的复杂机制。
核心方法和技术细节
词嵌入的解析解
论文的数学起点是词嵌入算法的闭式解。近期研究 (karkada2025closedform) 表明,word2vec 等算法实际学习的是一个规范化共现矩阵 的最大特征模式。 的元素近似于点互信息(PMI):
其中 是词对共现概率, 是单现概率。词嵌入向量由该矩阵的特征向量和特征值的平方根组合而成。
平移对称性假设
核心假设(3.1)可表述为:对于属于同一语义连续体的词(如十二个月份、历史年份),它们的共现概率仅依赖于它们在连续体上的距离。
数学上,这等价于假设 ,其中 是词 在语义空间中的坐标, 是某个仅依赖于距离的函数。此假设经实证检验,与维基百科中的月份、年份统计量符合良好(图 6、图 7)。
此假设的直接推论是:共现矩阵具有循环(周期边界)或托普利兹(开放边界)结构,其本征模恰好是离散傅里叶模。
傅里叶表示几何
基于上述对称性,作者导出了词嵌入向量在 PCA 坐标下的显式表达式。以周期性概念(如月份)为例,嵌入向量可由主成分展开为:
其中 是波数, 是共现核的傅里叶系数。当核取指数衰减形式 时(与真实统计良好吻合),可得闭式波数和振幅(第 3.2 节):
由于 随 单调递减,前两个主成分编码了最慢的傅里叶模(即余弦/正弦基础谐波),投影到这两个方向上自然给出圆形流形。更高次谐波构成 “涟漪”,对应已被文献报道的三维可视化中观察到的外蕴曲率。
开放边界与二维空间
对于开放边界的一维连续体(如历史年份),作者同样导出了精确的本征函数和边界条件(第 3.2 节)。地理位置的二维情形虽不能在一般情况下解析对角化,但数值结果(图 3)显示理论预测的慢变傅里叶模态与词嵌入、文本嵌入和 LLM 内部表征均定性一致。
创新点和贡献
1. 统一的几何起源理论
论文将多个看似无关的现象——圆形表示、涟漪流形、经纬度线性解码——统一到同一个数学框架下。它们都是平移对称共现矩阵的傅里叶本征模的自然表现。
2. 集体效应的发现与证明
最令人印象深刻的实验(图 4)是:完全删除所有月份之间的共现句子后,模型仍能从仅包含非月份词的语料中学到月份的圆形嵌入。作者在 4.1 节提供了一个连续潜变量模型对此进行解释:季节 作为潜变量影响大量 “季节词”(如滑雪、海滩),导致 PMI 矩阵产生大特征值,这些特征向量对局部扰动具有初等鲁棒性(可用 Weyl 定理量化)。
3. 线性解码误差尺度律
基于傅里叶表示结构,作者给出了坐标线性解码误差与探头维度 的标度关系:误差随嵌入维数的 次方衰减( 是语义维度),即 (第 3.3 节),并在历史年份嵌入上做出实证验证(图 2 右)。
实验结果分析
论文在三类模型上验证了理论:在维基百科上训练的词嵌入模型、EmbeddingGemma 文本嵌入模型、Gemma 2 2B 大语言模型。核心对比是理论预测的 Gram 矩阵与表征几何(通过 PCA 可视化)与实际模型输出的符合程度。
- 日历时间(图 1 左列):理论预测、词嵌入、LLM 内隐表征均呈现规则的圆环,Gram 矩阵为典型的循环矩阵结构。
- 历史年份(图 1 右列):三类模型均呈现开放的一维流形。Lissajous 曲线结构(图 2 左)与理论预测一致,涟漪源于高次谐波。
- 美国各州地理(图 3):虽然二维非均匀点阵无法解析对角化,但数值测算的本征函数展现了慢变的平面波结构,证实平移对称性即使在此复杂情形下仍占主导。
- 鲁棒性实验(图 4):月份间的共现被人工设为独立,从剩余词汇中学到的嵌入仍近似完美地恢复了原始 Gram 矩阵和圆形嵌入。
局限与待解决问题
尽管理论框架在词嵌入层面做出很强预测,论文作者在 Discussion 中坦诚了以下瓶颈:
- LLM 的上下文敏感能力未纳入:LLM 可以基于上下文消除同形异义词的歧义(图 13 展示,“May” 在加入前文提示后,其嵌入逐渐趋于正规圆形)。当前理论未能形式化 Transformer 前向传播过程中歧义消解的能力。
- 严格数学推导范围有限:傅里叶本征模的闭式解主要针对 的指数核和完美的点阵均匀性(第 3.2、3.2 节)。对二维非均匀点阵,只能借助数值对角化与定性讨论(图 3)。
- 假设的正定性:论文为简洁假设 ,但实证频谱显示约一半特征值为负(图 5)。影响预测精度,如振幅绝对值通常无法准确复现(仅相对比和波数可),虽然作者在附录 B.3 提供了放宽此假设的更弱版本。
- 层次属性、类比结构未整合:本文与同期工作 (korchinski2025emergence) 分别处理了连续感知属性和二元类比属性引起的几何结构,但 “为所有这些属性提供一个总体框架将是可取的”(Discussion)。
总体来看,该工作为近年来 LLM 表示空间中的几何结构发现提供了亟需的第一性原理解释,揭示了语言统计中深层对称性对表示学习的基础性塑造作用,同时为挖掘此类结构在模型可解释性中的应用敞开了大门。