利用未标记数据实现可泛化的神经群体解码

arXiv: 2607.14086v1

论文信息

标题: Leveraging unlabelled data for generalizable neural population decoding

作者: Ximeng Mao, Nanda H. Krishna, Avery Hee-Woon Ryoo, et al.

发布日期: 2026-07-15

arXiv ID: 2607.14086v1

PDF 链接: 下载 PDF

背景与研究动机

神经解码技术是脑机接口(BCI)和闭环神经调控实验的核心引擎,其任务是从高维神经活动中映射出行为变量。近年来,基于 Transformer 和状态空间模型(SSM)的深度学习解码器取得了突破性进展,尤其在处理侵入式神经尖峰信号时,涌现出 POYO 这类以单脉冲为最小建模单元的灵活框架。POYO 通过将每个脉冲标记为 “时间戳 + 神经元 ID” 的独立 Token,天然支持多会话、跨任务的预训练与高效微调,显著提升了解码精度与泛化性。

然而,一个根本性缺陷限制了这类脉冲级别模型的潜力:它们仅能使用监督学习(SL),需要成对的行为标签(如灵长类到达任务中的速度轨迹)。神经科学实验中存在着海量的未标注脉冲数据,这些数据仅包含原始的神经活动而不具有同步行为记录。能否像自然语言处理领域通过 BERT、GPT 那样利用大量无标签数据,对脉冲解码模型进行自监督预训练,成为一个亟待解决的问题。现有的自监督方法大多面向连续信号(如钙成像)或基于分箱的脉冲表示,对离散稀疏的脉冲 Token 序列缺乏有效的设计。为此,论文提出了 MOJO(Masked AutOencoder-based JOint training),一种联合自监督(SSL)和监督学习的训练框架,让脉冲 Token 模型能够吞噬未标注数据,共同优化神经元表征与行为解码。

核心方法与技术细节

MOJO 的核心思路是在脉冲 Token 的潜在空间上实施掩码自编码器(Masked Autoencoder, MAE),而非直接对输入脉冲序列进行掩膜。这种设计避免了在稀疏脉冲序列中区分 “缺失脉冲” 和 “被掩蔽脉冲” 的难题,并能无缝嵌入到 POYO 家族的双通路架构中。

脉冲 Token 化与输入交叉注意力

模型将每个脉冲抽象为一个 Tuple (UnitEmb(Ispike),Tspike)(UnitEmb(I_{\text{spike}}), T_{\text{spike}}),包含神经元 ID 的可学习嵌入和旋转位置编码(RoPE)的时间标记。与 POYO 的全序列交叉注意力不同,MOJO 采用了 POSSM 风格的局部交叉注意力:将时间轴切分为若干个连续的时间块(Chunk),每个 Chunk 内独立计算稀疏脉冲 Token 到固定数量潜在查询(Latent Queries)的注意力映射。这样每个时间步 tt 都会生成一组潜在向量 zi(t)z^{(t)}_i,构成压缩的隐序列。

双通路架构与联合优化

MOJO 维护两条并行但共享核心通路:

  • 自监督通路(SSL):对潜在序列进行时间维度的随机掩码(掩码率 50%),被掩码的位置替换为可学习的掩码 Token。随后通过一个重量级骨干网络(Transformer 或 SSM)进行上下文建模。解码端采用特别设计的单元查询(Unit Queries),只允许当前时间块内的单元关注到相应区域的潜在表征,以泊松负对数似然作为损失重建脉冲发放率。这一过程迫使模型学习神经群体活动的内在动态结构。

  • 监督通路(SL):同样使用骨干网络的输出,通过输出交叉注意力与任务查询交互,再经过线性读出头预测行为变量(如速度、类别)。多任务场景下可并行预测多个目标。

最终的训练损失为两通路损失的加权和:

LMOJO=αSSLLSSL+αSLLSL\mathcal{L}_{\text{MOJO}} = \alpha_{\text{SSL}} \mathcal{L}_{\text{SSL}} + \alpha_{\text{SL}} \mathcal{L}_{\text{SL}}

实践中 α\alpha 均设为 1 即可稳定收敛。最重要的是,两通路共享所述输入交叉注意力及骨干网络的参数。这种 “通路集成” 只引入约 2%~10% 的额外参数(主要体现在 SSL 通路的额外输出交叉注意力),却让模型能够同时从无标签和有标签数据中吸收信息,实现表征的协同进化。

骨干架构

MOJO 兼容两种主流骨干:注意力型(POYO 式 Transformer)和循环型(Mamba、GRU 等 SSM)。前者在非因果建模和 SSL 表现上更强,后者具备实时推理速度优势,论文充分展示了二者在 MOJO 框架下的性能爆发。

创新点与主要贡献

  1. 专为稀疏脉冲设计的自监督学习:提出在潜在空间上执行时间掩码自编码器,规避输入层操作的稀疏性陷阱,完美桥接脉冲 Token 化模型与 SSL 范式。
  2. 联合 SSL-SL 训练范式:不同于先 SSL 再微调的两阶段模式,MOJO 端到端同时优化两类目标,互促互进,使学习到的表征既捕捉神经动力学又保持任务相关性。
  3. 可解释的神经元嵌入:在无任何脑区、电极位置元数据的条件下,MOJO 自动产生的单元嵌入能够高精度线性分类出脑区、个体甚至单神经元的发放统计特性,展现出强烈的内在生物学可解释性。
  4. 跨物种、跨模态泛化:通过联合训练猕猴伸手任务与小鼠视觉任务,MOJO 实现了正向的知识迁移;在人类皮层电图(ECoG)语音解码中同样超越监督基线,逼近专用连续信号基础模型,表现出通用神经解码器的潜质。

实验结果分析

论文在四个不同维度上验证了 MOJO 的优势:

标签贫乏环境的性能飞跃 在猕猴到达任务中,当预训练时仅 10%50% 的数据有标签,MOJO 仍能利用全部无标签数据显著提升解码 R2R^2。在少样本微调场景(新动物、新日期仅 232 次试验)中,MOJO 相比纯监督模型提升幅度超过 20%,加入无标签试验后甚至能以 2 条标注数据达到全监督 60% 的性能。

多大脑区域、多任务下的优越解码 在小鼠视觉编码数据集中,MOJO 在自然场景分类、光栅朝向/频率分类上均显著优于纯监督 POYO 及 NEDS 等通用解码器,漂移光栅任务接近完美(>99.7%)。在小鼠决策任务 4 项指标上平均提升约 4 个百分点。人类 ECoG 语音任务中,对复杂音节的分类准确率提升 47%,达到了专为连续信号设计的 Du-IN 模型的同等水平。

单元嵌入的生物学可解释性 通过对 5 万多个神经元嵌入的线性探针分析,MOJO 能准确分类脑区(如 7 类脑区准确率最高达 55%,远高于监督模型的 28%)。更精细的分析揭示,这些嵌入预测了发放率均值(R2=0.88R^2=0.88)、变异系数(R2=0.18R^2=0.18,而纯监督模型为 0)等 18 种单神经元特性。此外,嵌入的余弦相似度与电极距离的负相关比纯监督模型强 2 倍以上,且能揭示远隔功能相关脑区(如视觉皮层-丘脑)的聚集结构,这在纯监督模型中完全缺失。

跨物种联合训练的正向迁移 先在猕猴数据后联合小鼠视觉数据进行的课程式预训练,使小鼠自然场景解码提前收敛,同时保持了猕猴解码性能不退化,模型越大迁移效果越明显,验证了跨物种共享神经表征的可能性。

实践应用建议与未来方向

对于构建大规模神经基础模型(Neuro-Foundation Models)的实践者,MOJO 提供了直接可操作的路径:

  • 最大化未标注数据的价值:在收集有标签行为数据的昂贵实验中,可并入大量同构或异构的未标注脉冲记录,利用 MOJO 的 SSL 增强模型对神经群体动态的理解,尤其适合样本稀缺的罕见任务或少样本校准阶段。
  • 跨模态、跨物种数据整合:MOJO 已证明可处理尖峰和 ECoG 连续信号,且跨物种联合训练不会损害原始任务性能。未来可统一采用带有值嵌入的 POYO 变体,将钙成像、局部场电位等纳入同一个巨型模型。
  • 实时解码器的部署:Mamba、GRU 等轻量级循环骨干配合 MOJO 模式,可在不牺牲过多解码精度的情况下,将推理延迟降至毫秒级,满足在线闭环 BCI 的需求。
  • 为神经科学提供分析工具:无需额外训练即可从单元嵌入中提取脑区身份、放电规律和空间拓扑关系,为神经群体分析与数据校验提供了新工具。

展望未来,MOJO 的改进方向包括:突破纯时间掩码,引入空间掩码(如屏蔽部分脑区的神经元)以学习更丰富的群体编码关系;开发模块化的单元嵌入方法,使已学习的嵌入在微调时无需从零重训;将多模态数据(如视频、声音)纳入自监督预测范围,朝向更全面的感官-运动统一模型发展。

总结与展望

MOJO 架起了一座自监督学习通向脉冲级神经解码的桥梁,以精巧的潜在掩码自编码器和联合优化策略,打破了 POYO 家族对标签数据的单一依赖。其不仅在各种解码基准上稳定超越纯监督方法,更揭开了无标签数据驱动下神经元嵌入编码丰富生物学信息的黑箱。这项研究标志着神经基础模型从 “更多标签” 向 “更多数据” 的范式转移,为未来集成全脑、全模态、全物种的普适性神经 AI 系统奠定了坚实的技术基础。随着开源脉冲数据的不断涌现,MOJO 有望加速脑科学发现与神经技术临床应用的进程。