学习大语言模型激活的生成式元模型
Learning a Generative Meta-Model of LLM Activations
论文信息
标题: Learning a Generative Meta-Model of LLM Activations
作者: Grace Luo, Jiahai Feng, Trevor Darrell, et al.
发布日期: 2026-02-06
arXiv ID: 2602.06964v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何不依赖线性或稀疏等强结构假设,学习大语言模型(LLM)中间激活的分布,并利用所学分布提升激活引导的流畅性和概念分离能力?
- 核心方法:在十亿量级残差流激活上训练基于流匹配的扩散模型(名为 “生成潜在先验”GLP),将其作为先验对引导后的激活进行去噪投影,同时将其内部表示用作单变量概念探针的特征编码器。
- 关键结果:扩散损失随计算量平稳服从幂律衰减,且下游的引导流畅性与稀疏探针 AUC 均随损失同步提升——这表明扩散损失是下游效用的可靠预测指标(图 2)。
- 主要局限:模型仅对单 token 的独立激活建模,且是无条件生成;只针对单一中间层,尚未处理多层交互或多时间步联合分布。
- 适合读者:从事可解释性、模型编辑、表示学习以及想用生成式先验改进激活干预的 AI 研究者与工程师。
论文背景和研究动机
神经网络中间层的激活编码了模型处理数据时的丰富信息,它们不仅是 “黑箱” 内部的投影,也是执行知识探测、行为引导和特征提取的关键界面。然而,主流的激活分析方法——如主成分分析(PCA)和稀疏自编码器(SAE)——通常依赖线性分解或稀疏性等结构归纳偏置。这种硬性假设容易导致激活远离自然流形,使得被修改后的激活注入语言模型时,模型输出流畅度急剧下降。
生成模型提供了另一种路径:通过学习激活的经验分布,它们能自然地刻画流形结构,而不必事先声明线性或稀疏约束。在计算机视觉中,图像扩散模型已能将有噪或编辑后的图像投影回自然图像流形,同时保留语义内容。本文希望将类似的思路引入 LLM 激活空间,打造一种 “激活扩散模型”,即生成式元模型。
然而,激活是不可直接检查的高维向量,这给训练和评估带来挑战。为此,作者提出 生成潜在先验(Generative Latent Prior, GLP)——一种在相同激活数据上训练、可直接生成激活或用作先验正则的扩散模型。他们特别关注两个核心应用:1)将 “脱离流形” 的引导后激活拉回自然流形,从而在保持语义方向的同时提升输出流畅度;2)将其 “元神经元” 作为单维概念探针,比较其与 SAE 特征、原始 LLM 神经元的可解释概念分离能力。
核心方法和技术细节
GLP 的做法可以分为训练架构、数据管线、生成质量评估以及下游应用四个模块。
训练目标与架构 作者采用流匹配(flow matching)的扩散框架,将真实激活与高斯噪声的线性插值作为前向过程:
反向过程则从纯噪声 出发,用预测的速度场 一步步还原干净激活。训练目标即最小化预测速度与真实速度的均方误差。
网络结构是一个堆叠的前馈 MLP(类似 Llama3 的 SwiGLU 块),没有注意力层,因为它建模的是单 token 激活(与 SAE 做法一致)。时间步 通过 FiLM 调制融入每一层。与图像生成不同,这里的扩散模型是无条件的,不依赖类别或提示词。
数据与生成质量检查 训练数据来自 FineWeb 语料库,通过源 LLM 提取中间层(Llama1B 第 7 层,Llama8B 第 15 层)的残差流激活,总计约十亿 token。为提高效率,作者构建了生产者-消费者数据管线,利用 vLLM 和 nnsight 缓存激活,并采用混合精度训练。
由于生成样本无法肉眼检视,作者采用三项指标评估质量:
- Fréchet 距离(FD):计算生成激活与真实激活分布的距离。与 SAE 重构相比,GLP 达到更低的 FD(Llama8B 上 5.93 vs SAE 的 6.91,见表 1),且 FD 随参数规模扩大而下降。
- PCA 可视化:将生成和真实激活投影到前两个主成分。当扩散步数 ≥20 时,两者几乎无法区分(图 3)。
- Delta LM Loss:将加噪激活经 GLP 去噪后重新注入 LLM,测量语言模型困惑度上升幅度。GLP 仅让困惑度上升 0.051(Llama8B-Base),远低于 SAE 的 0.198(表 2),显示出强烈的流形保持能力。
下游任务适配
- 流形保持引导:在向量引导后,对激活执行类似 SDEdit 的操作:先加噪声到时间步 ,再用 20 步扩散采样去噪,从而将激活拉回流形。超参数 控制修正强度。
- 元神经元探针:将输入激活轻微加噪()后送入 GLP,提取每个 SwiGLU 块的标量神经激活(元神经元),用这些 1 维特征预测 113 个二元概念(来自 Kantamneni 等)。通过两阶段筛选(预选前 512 候选,再以验证集 AUC 选择最优),得到单个元神经元的探针性能。
创新点和贡献
本文的贡献集中在三个层面:
-
首次系统训练并评估了 LLM 激活的扩散模型。 以往元模型多针对网络权重,但权重对排列对称性敏感且生成成本高昂。直接对激活建模绕开了这些难题,并且可以利用扩散模型强大的分布学习能力。
-
提出 “生成先验” 作为可解释性工具。 不依赖生成的激活本身,而是将训练好的扩散模型用作流形约束(投影器)和特征提取器(元神经元)。这一设计将扩散模型从 “生成器” 转变为 “流形模型”,开拓了元模型的新用途。
-
发现扩散损失与下游效用之间存在可预测的幂律标度律。 扩散损失 ,其中不可约误差 ,(见 3.2 节)。随着计算量增加,损失平稳下降,而引导的平均概念-流畅度得分和单维探针 AUC 都随之改善,且改善趋势与损失曲线高度吻合。这暗示只需优化扩散损失,就能预测更大规模模型在下游任务上的表现。
实验结果分析
标度律与生成质量 在 Llama1B 激活上训练不同规模的 GLP(0.5B~3.3B 参数),扩散损失遵循平滑的幂律,每 60 倍计算量将损失与不可约误差的差距缩小一半(图 2a)。同时,Fréchet 距离从 0.68 降到 0.53(表 1),且仅需 20 步采样就能生成与真实激活无法区分的样本(图 3c)。在 Delta LM Loss 上,GLP 甚至优于有真实激活作为起点的 SAE 重构,说明其生成能力并未过度扭曲原始语义。
流形保持引导
- SAE 引导改进:在 LlamaScope SAE 的随机 500 个方向上,经过 GLP 后处理的激活在概念匹配度与流畅度上形成更优的帕累托前沿(图 5)。定性示例显示,GLP 帮助 SAE 的输出更贴合特征描述词(如 “数据统计变化” 类特征不再输出无意义的数字串,见表 7)。
- 角色人格引出:对 Llama8B-Instruct 施加邪恶、谄媚等 Persona Vector,GLP 大幅扩大概念-流畅度前沿(图 6),同等流畅度下概念一致性更高(表 3 和表 8)。
- 情感控制缩放:以 DiffMean 向量作正向情感引导,随着 GLP 计算量增加,各检查点在 的强引导区间的概念与流畅度平均得分逐步提升(图 2b),且提升幅度直接追踪扩散损失(图 11a)。这表明更好的激活先验能更有效地保留语义。
元神经元探针 单维探针下,GLP 元神经元在所有方法中取得最高 AUC(Llama1B 上 0.84,Llama8B 上 0.87),优于原始 MLP 神经元(0.79/0.82)和 SAE 特征(0.70/0.76)。重要的是,Llama1B 的 GLP 元神经元甚至超过了 Llama8B 的原始 MLP 神经元,这意味着通过扩展激活模型可以获得超越扩展源 LLM 的局部可解释性。
探针性能同样随计算量提升,且噪音较大的输入()能更好地分离不同能力模型的差异,因为需要更多去噪工作来提取语义(图 15a,c)。对选出的元神经元做最大激活例子的可视化发现,它们确实与二元概念一致(如棒球术语或转折词,见表 5),且中间层出现频率最高,符合视觉扩散模型中间层语义最丰富的规律。
实践建议
GLP 的思路为可解释性工具箱补充了一种无偏编码器与流形投影器。以下是几个可直接落地的实践方向:
-
将扩散先验作为激活鲁棒性正则 在部署激活引导的模型编辑系统时,可在每次干预后运行 20 步扩散采样(),成本增加可控,却能大幅度抑制流畅退化。对于强引导(如系数 ),这一步尤为关键。实现时可参考论文中的伪代码(图 4),将标准化的编辑向量与平均范数缩放后加噪,然后利用已训练好 GLP 去噪。
-
用扩散损失监控激活分布偏移 借鉴扩散模型用于衡量图像典型性的思路,可将 GLP 对单个激活的单步去噪损失作为 “异常分数”。若某 token 位置的损失显著偏高,可能表示该激活远离训练流形,存在错误累积或对抗扰动。可结合这一信号做提前退出或降级处理。
-
用元神经元构建轻量级概念探针 在需要快速检测大量概念(如安全、偏见、上下文一致性)的场景,不必重新训练整个 SAE 或线性探针,可直接使用已训练 GLP 的元神经元。具体做法:将目标层激活轻微加噪(),提取选定层的 SwiGLU 门值,然后通过单变量逻辑回归筛选最优神经元。因为 GLP 的尺寸可比源 LLM 小(如 3.4B 对应 8B 激活),且元神经元数量极多,可覆盖更广概念空间。
-
利用标度律规划计算预算 若计划训练自己的 GLP 或类似激活扩散模型,可参考论文拟合的幂律规律:扩散损失 。这意味着每将损失向不可约误差靠近一半,需增加约 60 倍计算。可以据此估算达到目标流形保持强度(如引导改善起始点)所需的最小 GPUs 时数。
-
注意当前限制及适应性调整 因为本文的 GLP 无条件且建模单 token,对于需要跨位置依赖的政策(如代词一致性、长程情感),其效果可能递减。实践中可尝试将位置编码纳入条件,或收集多 token 序列的联合激活训练扩散变换器。此外,GLP 仅对基座模型激活训练,但在指令微调模型上仍表现出可迁移性(表 2),可复用已有基座 GLP 进行安全引导,无需重新训练。