神经元群体随规模增长呈现选择性分化
Neuron Populations Exhibit Divergent Selectivity with Scale
论文信息
标题: Neuron Populations Exhibit Divergent Selectivity with Scale
作者: Amil Dravid, Yasaman Bahri, Alexei A. Efros, et al.
发布日期: 2026-06-02
arXiv ID: 2606.03990v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文研究神经网络内部的神经元群体是否随着模型规模的增大而呈现出可预测的演变规律,特别是在神经元的通用性、选择性和专业化程度上是否存在系统性的缩放定律。
- 核心方法:作者以 “Rosetta 神经元”(可在不同独立训练的模型中匹配到的、功能相似的神经元)作为可观测对象,对数十亿参数规模的语言模型和视觉模型进行跨模型神经元匹配,并分析这些匹配神经元的数量、选择性和领域专业化程度随模型规模的变化趋势。
- 关键结果:Rosetta 神经元的数量遵循次线性幂律增长,其绝对数量在增加,但在总神经元中的占比却在缩小。同时,出现 “神经元极化效应”——Rosetta 神经元随着规模增大而变得更具选择性和单义性,与非 Rosetta 神经元群体的差距不断扩大。
- 主要局限:Rosetta 神经元仅代表神经网络内部结构的一个子集,无法捕捉到那些以分布式电路、注意力头或子空间形式存在的共享计算。此外,对单义性的测量依赖于模态特定的代理指标。
- 适合读者:对大语言模型和视觉模型的可解释性机制、缩放定律的内部表征研究、以及神经元级结构演变规律感兴趣的深度学习研究者和从业者。
论文背景和研究动机
在深度学习和神经科学中,一个核心问题始终引人深思:神经元如何编码世界中的结构信息?在生物系统中,这个问题引发了关于表征是局部化在单个单元中还是分布在整个群体中的长期争论。类似地,在人工神经网络中,尽管有研究揭示了神经元可以编码特定概念(如语言模型中的情感、视觉模型中的物体片段),但在今天的大规模模型中,多数神经元仍然难以被直观理解。
造成这种困境的一个原因是,神经元级的表征在 “干净程度” 上存在巨大差异。有些神经元表现出相对的单义性,选择性地对连贯的语义概念作出反应,而另外一些神经元则可能以叠加的形式编码多个不相关的特征。随着模型规模的增大,这个问题变得更加突出:模型的表征能力发生变化,但内部结构如何随之演变,目前仍知之甚少。
传统缩放定律关注的是损失等宏观行为量,通过幂律关系描述了性能与计算量、数据量、模型规模之间的规律。然而,这些规律很少触及模型内部的表征组织。本篇论文试图将缩放分析延伸到神经元层面,问一个探索性问题:跨模型反复出现的神经元群体是否随着规模呈可预测的演变?具体来说,作者聚焦在三个属性上——通用性、选择性和专业化。
研究这些问题的切入点是一个关键的观察对象:Rosetta 神经元。这类神经元由之前的论文识别出来,它们的激活模式在不同训练得到的模型中表现出高度的一致性,意味着它们可能反映了数据分布中的稳定特征,而非某个特定模型训练过程的偶然产物。
核心方法和技术细节
为了将神经元级分析纳入缩放研究框架,作者设计了一套完整的实验流程。整个流程的核心环节包括三个部分:神经元匹配、缩放曲线生成和神经元属性分析。
在神经元匹配阶段,作者首先确定模型对和输入数据。对于语言模型,每对模型使用约 1000 万个来自 The Pile 的共享 token 进行激活计算;对于视觉模型,直接从扩散模型生成 5 万张类别平衡的图像,然后喂给判别式模型。为了在不同 tokenizer 或 patch 划分方案之间对齐激活,语言模型采用字节级对齐,视觉模型则将激活图双线性插值到统一的网格尺寸。
随后,作者计算每对神经元之间的皮尔逊相关系数,并将这种相似性度量转化为一个大规模的相似度表。接着,采用互近邻匹配来筛选出可靠的神经元对——只有两个神经元互相在对方的 top-k 最相似神经元中时,才被视为真正的匹配对。这些经过筛选的匹配神经元就是所谓的 Rosetta 神经元,它们被认为是在不同模型中编码相同或相近特征的基本单元。
在获得 Rosetta 神经元后,作者将其数量与具体的模型规模建立关系。模型的规模以平均神经元总数来衡量,然后通过普通最小二乘法在对数-对数空间中拟合幂律函数。值得注意的是,将多个模型家族共享的 Rosetta 神经元取交集后形成了折叠曲线,这样可以验证在更严格的通用性定义下,缩放趋势是否依旧成立。
神经元属性的分析则专门为语言和视觉模态分别设计了相应方案。对于语言模型,作者利用词汇空间投影——将每个神经元的输出权重与各个 token 的反嵌入向量计算余弦相似度,并利用其峰度来衡量该神经元在输出端的集中程度,从而指示其选择性强弱。对于视觉模型,论文采用 VLM 当评审的代理方法,将每个神经元的前 20 张最高激活图像及激活热力图传给一个多模态大模型,由模型判断这些响应是否反映了单一连贯的视觉特征。
此外,作者还构建了一个分析性容量分配模型来为实验观察提供理论支撑。该模型假定有限数量的神经元坐标必须表达一个更庞大的潜在特征集合,而这些特征按幂律重要性频谱排列。通过优化特征的隔离度,模型推导出 Rosetta 神经元的次线性缩放定律,并预测了神经元极化效应——即 Rosetta 神经元的选择性随着规模增大而增强,而非 Rosetta 神经元则保持嘈杂。
创新点和贡献
这篇论文的核心贡献在于将可解释性和缩放定律这两个领域进行了深度的桥接。传统缩放定律主要关注损失和性能等外在指标,而这项研究打开了 “内部表征如何随规模变化” 这扇门,用 Rosetta 神经元作为可观测的内部探针,揭示出神经元群体的演变更深层、更系统的规律。
首次系统证明 Rosetta 神经元遵循幂律缩放是本文的一个重要发现。研究显示,无论是在语言模型(参数规模从 1 亿到 300 亿)还是在视觉模型(从 8000 万到 50 亿)中,匹配到的 Rosetta 神经元数量都遵循 值在 0.5-0.7 范围内的次线性幂律( 见图 3)。这意味着,虽然绝对数量在增加,但共享神经元在总神经元中的占比在不断缩小。
提出并验证了神经元极化效应是另一个关键贡献。论文的实验结果表明,随着模型扩大,Rosetta 神经元在词汇空间中的投影峰度不断增加,表明其功能越来越集中于少数 token 上(如图 6a 所示);在视觉模型中,被 VLM 判定为单义的 Rosetta 神经元比例也随着模型规模增大而上升(如图 6b 所示)。与此同时,非 Rosetta 神经元的选择性保持在低位或持续下降,呈现出明显的两极分化趋势。
此外,作者还通过一个针对性的数据筛选案例进一步验证了 Rosetta 神经元的实用价值。具体来说,一个在 Pythia-6.9B 中发现的、专门响应 JavaScript 代码的 Rosetta 神经元,在 CodeSearchNet 数据集上筛选目标域数据的 F1 得分达到 0.98,与 Oracle 的完美筛选仅差 0.02(见表 1)。继续预训练的结果也接近使用真实目标域数据进行训练的表现。
在理论层面,作者构建的分析模型不仅解释了 Rosetta 神经元为何呈次线性增长,还精确预测了神经元极化现象,为理解深度学习模型内部结构的缩放提供了理论框架,而不仅仅停留在现象描述层面。
实践建议
对于从事大语言模型和视觉模型可解释性工作的研究者,这篇论文提供了一套可直接操作的神经元匹配框架。实际应用时,可以从以下几个方面进行参考:
首先,如果想要在自己训练的模型中发现 Rosetta 神经元,需要选择合适的共享输入数据集。论文使用 The Pile 的子集(约 1000 万 token)或生成的图像(5 万张)就获得了可靠的结果(见附录 G 的消融实验),这说明不需要过于庞大的数据量即可进行有效的跨模型神经元匹配。
其次,Rosetta 神经元可以作为模型可解释性的高效切入点。由于这些神经元在不同模型中都有一致的行为,研究它们可以更可靠地理解模型内部的通用计算模式,而非局限于某个特定模型的偶然结构。当需要理解新模型时,可以优先分析与已有模型中 Rosetta 神经元匹配成功的那些单元,从而更快速地获得关键洞察。
在数据工程方面,Rosetta 神经元的领域专业化特性可用于构建目标领域的高效数据筛选器。论文中以 JavaScript 代码筛选为例展示的方法表明,一个精心选择的 Rosetta 神经元可以接近完美地筛选目标领域数据,并且筛选出的数据在下游任务中与使用真实标签数据的效果接近。这种方法的优势在于:不需要额外的标注、不需要训练专用分类器,只需利用现有模型中的单个神经元即可。
对于 AI 安全和对齐领域的工作者,神经元极化效应提供了一种识别 “可信任” 神经元的方法。随着模型扩大,Rosetta 神经元变得更加单义和可理解,而其他神经元保持嘈杂。在模型解释或监控中,可以优先关注 Rosetta 神经元作为可靠的解释基础,降低由于神经元功能模糊而引入的不确定性。
最后,对于架构设计者而言,论文揭示的次线性缩放规律暗示了一种机会成本:如果要让更多特征获得专用神经元,需要不成比例地增加模型容量(因为共享神经元的增长速度和总神经元的增长速度之比呈次线性关系)。理解这一点有助于在设计模型规模和特征分配时做出更有信息量考量的决定。