黎曼与统计流形上神经表征的几何感知相似性度量
Geometry-aware similarity metrics for neural representations on Riemannian and statistical manifolds
论文信息
标题: Geometry-aware similarity metrics for neural representations on Riemannian and statistical manifolds
作者: N Alex Cayco-Gajic, Arthur Pellegrino
发布日期: 2026-03-30
arXiv ID: 2603.28764v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:神经网络内部表征的相似性测量通常依赖外蕴几何(嵌入位置),但外观相似的嵌入可能隐藏根本不同的计算策略。这篇论文要解决:如何从内蕴几何(流形上的距离、角度)出发,严格区分那些外在高度相似、实则机理迥异的神经网络解?
- 核心方法:引入度量相似性分析(MSA)。它将每个网络看作对输入流形的一种变形,用黎曼几何中的拉回度量刻画该变形在每一点的内蕴几何,然后在流形上逐点用新提出的谱比率距离比较两个拉回度量矩阵,再积分得到全局不相似度。
- 关键结果:在二维 “富学习/惰性学习” 网络上,传统普氏分析法报告接近 1 的相似度,而 MSA 将其清晰分离并准确反映学习机制差异(图 5d);在分层超参数变化实验中,MSA 能捕捉到网络间细粒度的层次结构,而 CCA、RSA 无法区分训练与未训练模型(图 6a)。
- 主要局限:需要预先知道或显式建模输入数据流形,对于缺乏显式流形结构的真实高维数据,必须先学习流形参数化;方法不捕获表征如何被下游解码层使用(论文第 5 节)。
- 适合读者:从事神经表征几何分析、深度学习可解释性、非线性动力系统比较、扩散模型研究的学者,以及对黎曼几何在机器学习中的应用感兴趣的研究人员。
论文背景和研究动机
传统上,比较神经网络表征的主流方法(如 CKA、CCA、RSA、Procrustes)都是在状态空间中直接对齐激活值向量或相关矩阵,本质上是比较表征的外蕴几何。然而,外蕴几何强依赖于具体的嵌入方式。论文给出了一个直观的反例:二维平面与 “瑞士卷” 的嵌入在 Procrustes 或 RSA 下相似度极低,但它们沿着流形测出的所有角度和距离完全相同——亦即内蕴几何完全相同(图 1)。这意味着,仅依靠外蕴对比可能漏掉那些真正决定网络泛化性质和计算机制的内蕴差异。
该问题在近期关于 “富学习(rich learning)” 与 “惰性学习(lazy learning)” 的研究中尤为突出:两种机制产生截然不同的决策边界和特征学习行为,但其隐藏层激活在 PCA 投影下却看起来非常相似。因此,能否通过比较内蕴几何,揭示这些细微但关键的结构差异,成为论文的核心动机。
基于 “流形假设”——真实数据往往分布在低维流形上,神经网络可以被看作是对该输入流形逐层变形的映射——论文提出用黎曼几何工具来定义一种内蕴几何的相似性度量。在黎曼视角下,网络的每一隐藏层诱导出一个拉回度量,它完全刻画了流形在该点附近被拉伸、旋转和扭曲的方式。通过比较两个网络在每一输入点处的拉回度量,就能剥离嵌入的具体形态,直接比较它们对流形几何的影响。
核心方法和技术细节
神经网络的流形变形与拉回度量
考虑一个输入流形 经过嵌入 进入输入空间 ,再被网络前 层 映射到隐藏层空间 。在流形上任意一点 的切空间 ,两个切向量 通过雅可比矩阵 被推前到隐藏层的切空间,其内积为:
其中 ()就是拉回度量矩阵。只要推前映射是浸入(injective), 就是对称正定的。这个矩阵完整编码了 在点 附近如何变形输入流形的内蕴几何。
谱比率:一种新的 SPD 矩阵距离
要比较两个网络 在某一点的内蕴几何,就需要度量两个 SPD 矩阵 和 的差异。论文为此提出 谱比率(Spectral Ratio, SR) 距离。
对于 ,求解广义特征值问题 ,并按降序排列特征值 。定义
直观上,如果 与 完全相同,所有广义特征值等于 1,距离为 0;如果两个矩阵秩不同(如一个满秩一个退化),最小特征值 ,距离为 1。谱比率满足对称性和三角不等式,从而构成一个伪距离(命题 2.2)。与经典的仿射不变黎曼度量相比,谱比率的有界性直接给出 上的相似度 ,更便于构建可解释的相似性分析。
度量相似性分析(MSA)
MSA 就是将逐点的谱比率积分到整个流形上:
其中积分测度由流形自身的内蕴体积形式决定。MSA 自然地继承了 SR 的距离性质,并满足对状态空间旋转的不变性(命题 4.1)和对流形坐标选择的不变性(命题 4.2)。这些性质保证了它作为表征比较度量的合理性。
扩展到动态和统计流形
对于动力学系统,输入流形可扩展为包含时间坐标的 “输入-时间流形”,拉回度量因此同时捕获几何变形和时间演化。对于扩散模型等生成模型,论文将拉回度量与费雪信息矩阵关联:一个统计流形上,概率分布 的费雪-拉奥度量 正是对数似然映射的拉回度量的期望。这样,MSA 可以直接用于比较不同控制参数(如文本提示、引导强度)下的生成分布的信息几何。
创新点和贡献
-
首次提出内蕴几何相似性度量:传统方法比较的是表征的嵌入,MSA 则是比较表征所诱导的流形上的黎曼度量,剥离了不反映计算本质的嵌入细节。这是对表征比较方法体系的根本性拓展。
-
谱比率距离的设计:一个有界、对称且满足三角不等式的 SPD 矩阵距离。它直接基于广义特征值之比,计算代价低,天然的相似度映射到 ,有利于阈值判断和可视化。
-
严格的数学基础:论文证明了 MSA 是定义在黎曼度量空间上的伪距离,并给出了坐标不变性和旋转不变性(附录证明)。这使得 MSA 具备可靠的理论支撑。
-
跨模型类别的通用性:实验从静态深层网络、递归动态模型到大规模扩散模型,展示了 MSA 在不改动框架的情况下均能有效工作。特别是在扩散模型中,利用费雪信息度量比较统计流形,为生成模型分析提供了新工具。
实验结果分析
论文通过三个层次递进的实验验证 MSA 的有效性。
富学习 vs. 惰性学习(图 5、6)
在二维输入的分类任务中,小权重初始化产生富学习(提取任务结构),大权重初始化产生惰性学习(记忆数据点)。尽管隐藏层激活的二维 PCA 投影几乎重合,MSA 却将两者清晰区分为不同的聚类,而 Procrustes 给出接近 1 的相似度,完全未能区分(图 5d)。在改变任务类别数、学习机制、初始种子的分层实验中,MSA 的相似度矩阵准确反映了超参数的共享层次(图 6a),而 CCA 和 RSA 不仅无法区分训练与未训练模型,甚至对截然不同的计算(2 类 vs. 5 类任务)仅报告中等相似度。这表明 MSA 能够捕捉到与任务结构直接相关的细粒度几何差异。
非线性动力系统比较(图 7)
在序列角度记忆任务中,RNN 和结构化状态空间模型(SSM)均能被训练完成任务,但内部计算机制可能不同。通过将时间坐标纳入流形,MSA 成功地将不同架构聚类,并清晰分离训练与未训练模型(图 7c-d)。相比之下,仅使用外蕴几何的 RSA 无法区分训练阶段,仅比较动力学的 DSA 则对所有模型几乎一视同仁(图 7e)。此外,MSA 还能揭示同一模型在不同时间步的内蕴几何演变:RNN 在保持记忆期间几何高度稳定,而 SSM 出现显著变化,暗示后者可能依赖非正定旋转动态(图 7f)。
扩散模型的统计流形分析(图 8)
在 StableDiffusionXL 上,通过四个文本嵌入的插值构造文本流形,MSA 计算不同时间步和不同引导强度 下的费雪信息度量相似性。结果显示:扩散早期和晚期的信息几何差异显著,而不同引导强度的比较揭示了一种非单调关系——在某个 附近,信息几何与无引导模型差别最大,之后反而趋近(图 8f)。这为理解引导参数如何调节生成多样性与文本对齐提供了几何视角。
实践建议
如果你在量化交易、人工智能模型开发或神经科学建模等领域需要比较神经网络的内部表征,以下几点实践建议可供参考:
-
数据流形构建 MSA 要求一个显式参数化的输入流形。对于结构化任务(如金融时间序列的相位、状态变量),可直接构造参数化;对于图像或文本数据,可采用自编码器或流形学习(如 UMAP)先将数据嵌入低维流形,再在该流形上部署 MSA。注意,必须保证流形的光滑性和测地线计算,以确保拉回度量的计算有效。
-
计算效率和近似 在实际应用中,流形积分通常通过蒙特卡罗采样近似。确保采样点足够密集,以覆盖流形上曲率变化较大的区域。对于高维隐藏层,直接计算雅可比矩阵可能开销较大,可使用自动微分批量计算,或利用随机投影减少计算。
-
与现有方法结合 MSA 可以与 CCA、CKA 等方法结合形成多层对比流程。先用 MSA 定位内蕴几何差异最大的输入区域,再在该区域用外蕴方法分析神经元级别的卷入度,可能揭示新的可解释性线索。
-
模型选择和超参数调优 MSA 提供的 相似度可直接用于模型筛选:在相同任务上,较小的 MSA 距离暗示模型可能采用了不同的计算策略,这可能意味着更好的集成多样性或对分布偏移的不同鲁棒性。在扩散模型的示例中,通过扫描引导强度 并观察 MSA 的变化,可以辅助选择生成质量和多样性平衡的最佳超参数。
-
警惕解码层的忽略 由于 MSA 仅看隐藏层内蕴几何,未考虑下游读出的对齐方式,若该层信息被后续层选择性地丢弃,MSA 距离可能夸大两个网络的功能差异。在实践中,建议同时结合线性探测或解码性能来交叉验证。