利用无标签数据实现可泛化的神经群体解码
Leveraging unlabelled data for generalizable neural population decoding
论文信息
标题: Leveraging unlabelled data for generalizable neural population decoding
作者: Ximeng Mao, Nanda H. Krishna, Avery Hee-Woon Ryoo, et al.
发布日期: 2026-07-15
arXiv ID: 2607.14086v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:这篇论文要解决什么 当前基于脉冲令牌化的神经解码模型(如 POYO 系列)在预训练时仅依赖监督学习,无法利用大量无标签神经数据,限制了模型规模和泛化能力。
-
核心方法:用什么办法解决 提出 MOJO(Masked autOencoder-based JOint training)框架,在脉冲令牌化模型基础上引入掩码自编码器(MAE)自监督学习,与有监督行为解码联合训练,共享编码器和主干网络参数。
-
关键结果:最重要的一个结论或数字 在猴子运动皮层、小鼠视觉与决策任务、人类 ECoG 语音解码等多个数据集上,MOJO 一致优于纯监督基线;在仅使用 10% 标签数据预训练时仍保留强解码性能(见论文第 3.1 节图 2b)。
-
主要局限:作者自己承认的、或方法本身固有的限制 联合 SSL-SL 训练对数据量要求高,弱学习的 SSL 可能损害 SL 性能;掩码方案仅限时间维度,缺乏显式的空间(跨神经元/脑区)推理;微调到新会话时需从头学习单元嵌入(见论文第 5 节)。
-
适合读者:什么背景的人值得读 从事神经解码、脑机接口、自监督表征学习的计算神经科学和机器学习研究者;关注跨物种/跨模态神经基础模型训练的工程人员;对脉冲数据处理和时序建模感兴趣的从业者。
论文背景和研究动机
脑机接口和闭环神经实验依赖鲁棒且准确的神经解码器——将神经活动映射到行为变量的模型。近年来,Transformer 和状态空间模型在该领域取得显著进展,其中 POYO 模型家族通过将每个神经脉冲单独编码为令牌(spike token),实现了跨会话的大规模预训练和高效微调,性能超越传统分箱方法。
然而,POYO 类模型存在一个根本性限制:它们完全依赖监督学习,只能在配对行为标签的数据集上训练。这与语言领域基础模型(如 BERT、GPT)利用海量无标签文本通过自监督学习(SSL)提取丰富表征的范式形成鲜明对比。神经科学实验室积累了大量未标注的多脑区、多物种神经记录,这意味着通过 SSL 利用这些数据可以大幅扩展预训练数据规模和多样性。
此前虽有工作探索了 POYO 架构上的预测或输入掩码 SSL 目标,但这些方法设计用于连续钙信号,稀疏非规则的脉冲序列如何设计有效 SSL 方案仍是开放问题。MOJO 正是应运而生:它通过掩码自编码器直接在编码后的潜在令牌上操作,规避了在原始脉冲层面区分"不存在"和"被掩码"令牌的难题。
核心方法和技术细节
脉冲令牌化与输入交叉注意力
每个脉冲被表示为一个元组:,其中 是可学习的单元嵌入查表, 为时间戳的旋转位置编码。MOJO 采用 POSSM 风格的编码器——在每个连续时间块内分别计算交叉注意力,将可变长输入序列压缩为固定数量的潜在令牌 。这一设计使得掩码操作可以在潜在空间而非原始输入空间执行。
掩码自编码器的潜在空间设计
MOJO 的核心创新在于在潜在表征层面而非输入层面进行掩码。具体而言,对输入交叉注意力输出的潜在序列施加时间掩码(伯努利采样,):
其中 是可学习的掩码令牌。时间掩码配合每个时间块内的局部交叉注意力,确保被掩码区间内所有脉冲信息被完全移除。
被掩码的潜在序列通过可学习的位置编码后送入与主路径共享的主干网络,随后 SSL 路径的单元查询令牌通过输出交叉注意力仅在各自时间块内聚合上下文,最终预测该时间块内随机采样的神经元(最多 10 个)的脉冲发放率。损失函数为泊松负对数似然。
路径整合与联合训练
MOJO 同时维护 SSL 和 SL 路径,但通过两级共享实现参数高效:1)共享输入交叉注意力的输出;2)共享主干网络参数。SSL 路径仅引入一个额外的输出交叉注意力模块,占 POSSM 和 POYO 总参数分别约 10% 和 2%。
总训练目标为加权和:
其中 为泊松负对数似然, 为多任务监督损失的加权和。论文发现设置 在各实验中效果稳健,即使标签数据和未标签数据量差异显著。
微调策略
模型迁移到新会话时支持两种策略:1)单元识别(UI):仅更新单元嵌入和会话嵌入,冻结其余参数;2)全微调(FT):先进行固定轮次的 UI,再解冻所有参数。
创新点和贡献
理论创新:脉冲序列的潜在空间 SSL
MOJO 首次证明了在脉冲令牌化模型上通过潜在空间掩码自编码实现联合 SSL-SL 训练的可行性。这一方案优雅地避开了脉冲稀疏性带来的输入层掩码歧义问题,同时确保了 SSL 和 SL 路径的梯度有效协同。
工程创新:参数高效的双路径整合
通过共享编码器和主干网络,MOJO 以约 2%-10% 的额外参数实现了 SSL-SL 联合训练,且不影响推理速度。论文特别验证了共享编码器(相对于分离编码器的)在 FT 场景下更优(见表 13),归因于统一的输入交叉注意力计算避免了潜在时间分辨率(SSL 的 20ms vs SL 的 125ms)不匹配。
可解释性创新:自发涌现的神经元元数据表征
尽管训练时未提供任何脑区、电极位置等元信息,MOJO 学到的单元嵌入通过线性分类器即可高准确度识别神经元来源脑区(猴子上 M1 vs PMd 分类准确率 81-98%,小鼠上 7 脑区分类 54.78% 准确率,见表 12 和表 22)。更细粒度分析表明,MOJO 嵌入可预测神经元发放统计特性(如发放率 R²达 0.88,POYO 仅 0.54)且编码了探针拓扑结构——嵌入相似性与电极距离呈负相关(Spearman r 介于-0.25 至-0.29,POYO 仅-0.12)(见论文第 3.2 节图 6)。
跨物种迁移与多模态泛化
MOJO 展现出正向跨物种迁移能力:在猴子运动数据上预训练后再联合训练小鼠视觉数据,小鼠自然场景分类收敛加速(见表 23)。此外,MOJO 成功应用于人类 ECoG 语音解码,通过仅增加线性值嵌入层适配连续信号,在音节分类任务上达 42% 准确率,显著优于纯监督 POYO,与专门设计的神经基础模型 Du-IN 性能相当(见论文第 3.4 节图 3c)。
实验结果分析
主实验:猴运动皮层解码
在 17 个评估会话上(跨三天、跨动物),MOJO 三种主干网(POGRU、POMAMBA、POYO)均一致优于对应纯监督基线。以 MOJO-POGRU 为例,FT 后在新动物 T-RT 任务达 0.7776 R² vs 基线 0.7575(见表 1)。在极少样本微调场景下,仅用 2 个标记试验,MOJO 即可达到全监督性能的 60% 以上(见论文第 3.1 节图 2a)。更极端地,当仅在 CO 会话的 RANDOM 阶段(自发运动,不到总数据 1%)标签可用的条件下,MOJO 仍能推断出从未见过的 REACH 阶段行为,跨动物平均达 0.5237 R²(见表 17)。
小鼠视觉任务与时序分析
在 Allen 视觉编码数据集上,MOJO-POYO-L(J)在自然场景分类达 94.18% UI 准确率、95.48% FT 准确率(见表 21)。联合猴-鼠预训练不仅提升了分类性能,更显著增强了嵌入可解释性:7 脑区分类从仅用小鼠标签数据的 43.17% 提升至 54.78%(见表 22)。论文还观察到嵌入空间中的功能性聚类——视觉皮层与视觉丘脑(LGd、LP)在约 4mm 探针距离处出现高相似性峰值,这在纯监督 POYO 中完全不存在(见图 6d)。
有限标签鲁棒性与缩放行为
在仅使用 10% 标签数据的预训练实验中(Perich 数据集),MOJO 通过利用全部无标签数据保持了与 50% 标签数据场景近似的解码性能(见图 2b),而微调性能随无标签数据增加呈单调提升(脑区分类准确率从约 75% 改善至 82%,见图 4)。这证实了 SSL 对标签稀缺场景的独特价值。
人类 ECoG 跨模态泛化
在 Bouchard 语音数据集 30 个会话上,MOJO 在音节/辅音/元音分类三项任务均超越纯监督 POYO,其中音节分类相对提升 47%(见论文第 3.4 节图 3c)。尽管 MOJO 为脉冲数据设计,其性能与 Du-IN 可比,证明了该框架在连续神经信号模态上的强适应能力。论文通过引入每通道每毫秒补丁的线性值嵌入实现连续信号令牌化,继而共享 POYO 主干。
实践建议
系统部署考量
MOJO 在实时神经解码场景展现出实用价值。基于 POSSM 循环主干的变体(如 MOJO-POGRU)在推理速度上优于 Transformer 版本(见表 20),适合低延迟 BCI 系统。在微调阶段,UI 策略仅需更新少量参数(MOJO-POSSM UI 下可训练参数<18K),可在极短时间内完成新会话校准。
数据策略建议
根据实验结果,建议在实践中:
- 预训练阶段纳入尽可能多的无标签数据,即使标签占比低至 10%,仍可维持强性能;
- 面对新动物/新会话时,若标签数据稀缺,优先采用 MOJO 的少样本微调策略,并结合额外的无标签会话数据可进一步提升(见图 2a);
- 跨物种/跨脑区联合预训练时,采用课程学习策略(先在源域预训练再联合微调)可获得正向迁移,且应适当增大模型容量(如 MOJO-POYO-L)以充分利用异构数据。
混合精度训练的考虑
论文在训练中使用 AdamW 或 Lamb 优化器(取决于主干网类型),且观察到不同优化器对不同架构和数据集组合的影响差异(如 Lamb 在 POYO 上对跨物种迁移效果更好)。在实际部署中,建议进行小规模超参数网格搜索,尤其是 SSL 损失系数(默认 1.0,但在 ECoG 实验中最优值为 0.5)和骨干网层数对具体数据集的适配。
局限与待解决问题
MOJO 虽然在多实验中表现优异,但作者在讨论部分坦诚了若干限制。首先,作为联合 SSL-SL 模型,MOJO 对数据量要求较高——预训练数据不足时,弱学习的 SSL 目标可能反而损害 SL 性能。其次,潜在掩码方案虽在整合 SL 路径时具有灵活性,但本质上局限于时间维度掩码;引入显式的空间(如掩蔽特定神经元或脑区)推理目标可能进一步提升 SSL 效果。
第三个关键局限来自 POYO 架构的继承问题:尽管预训练阶段学到的单元嵌入高度结构化且可解释,微调到新会话时仍需从头学习单元嵌入。当 SSL 已从大量数据中提炼丰富统计规律后,从头学习新嵌入意味着丢弃了可复用信息,这是一类"灾难性遗忘"的表征层面表现。论文指出,摊销方法和离散编码是解决该问题的潜在方向。
此外,MOJO 在 ECoG 上的应用仍需模态特定的线性值嵌入层,这限制了多模态(如脉冲、钙信号、ECoG)在统一管道中的联合预训练。对于神经科学实际场景中常见的异构模态融合需求,这一局限性值得后续研究关注。