思想原子:基于微状态的通用脑电表征学习
Atoms of Thought: Universal EEG Representation Learning with Microstates
论文信息
标题: Atoms of Thought: Universal EEG Representation Learning with Microstates
作者: Xinyang Tian, Ruitao Liu, Ziyi Ye, et al.
发布日期: 2026-05-19
arXiv ID: 2605.20182v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:这篇论文要解决如何从脑电图(EEG)信号中学习通用表征的问题。传统时域和频域特征存在易受噪声干扰、跨任务泛化能力差、无法捕捉瞬态脑活动等局限。
-
核心方法:作者引入 EEG 微状态(microstates)作为通用脑电表征。通过在大规模睡眠数据集上训练无监督流式 K-means 聚类模型,将连续 EEG 信号离散化为微状态序列,再应用于睡眠分期、情绪识别和运动想象三个下游任务。
-
关键结果:微状态表征在三个不同任务和多种模型架构下均优于传统方法。在睡眠分期任务中,使用 Sleep Transformer 模型时微状态达到 0.810 的准确率,超过时域的 0.786 和频域的 0.790(表 1)。
-
主要局限:作者承认仅在有限的任务和数据集上进行了实验,微状态分词器只在睡眠数据上训练,且仅使用 6 个 EEG 通道。论文未说明在更多通道或不同认知任务下的泛化表现。
-
适合读者:从事脑机接口、神经信息学、EEG 信号处理的研究者和工程师,以及对离散表征学习在生理信号中应用感兴趣的人工智能从业者。
论文背景和研究动机
脑电图通过头皮电极记录大脑电活动,在临床诊断、认知神经科学和脑机接口领域具有重要价值。随着深度学习技术的成熟,将人工智能与 EEG 分析相结合已成为提升分类性能的新范式。
然而,EEG 信号具有高度非线性和非平稳特性,传统处理方法存在两个主要缺陷。第一,时域和频域特征容易受到眼动、肌电和环境伪迹的影响,且在不同受试者和任务间差异显著,导致单一任务上性能欠佳,跨任务泛化能力弱。更严重的是,这类方法需要大量任务特定数据,而这些数据通常难以获取。第二,传统方法难以捕捉高分辨率的瞬态动态信息。时域特征直接使用原始 EEG 信号,信噪比低;频域特征使用固定窗口长度,导致时间分辨率下降和信息损失。
论文提出的核心洞见是:EEG 微状态可以作为大脑活动的离散、内在表征,更贴合底层神经机制。微状态是持续 60-120 毫秒的准稳定头皮电位模式,被认为对应基本且稳定的认知状态。先前研究已揭示微状态与思维、认知的关联,但将其用于深度学习分类任务尚属空白。
核心方法和技术细节
论文的方法可分解为两个阶段:微状态分词器的构建和下游任务验证。
第一阶段:通用微状态分词器训练
作者选择 Human Sleep Project (HSP)数据集来训练聚类模型,该数据集包含超过 2 万例受试者的多导睡眠图数据。选择睡眠数据的原因有三:睡眠数据量充足、可反映认知水平、希望验证在睡眠数据上训练的分词器能否泛化到清醒状态任务。
数据处理流程为:从原始 EEG 中提取 F3、F4、C3、C4、O1、O2 六个在所有样本中通用的通道;应用 1-40Hz 带通滤波器;重采样到 100Hz;计算全局场功率(GFP)并提取峰值点,因为 GFP 峰值具有最高信噪比。
聚类采用流式 K-means 算法,设置 1000 个聚类中心,每批 50 个数据点进行增量更新。流式处理使得模型无需将所有数据存入内存,只需存储一批数据和聚类中心。
第二阶段:下游任务设计
使用训练好的分词器将连续 EEG 信号转换为微状态序列,每个时间点对应一个离散标签(0-999)。论文在三个任务上验证:
睡眠分期使用 HSP 数据集,模型架构包括 CNN+LSTM、Sleep Transformer 和 Sleep Net Zero 三种,分别对应不同的时空特征提取方式。微状态序列先经过嵌入层映射为高维向量,再输入模型。
情绪识别使用 SEED 数据集,15 名受试者观看不同情绪片段,标签为积极、中性、消极。运动想象分类使用 Motor Movement/Imagery 数据集,109 名受试者执行实际或想象的手部、足部运动。
所有任务中,微状态的输入长度和模型参数与基线方法保持可比,确保对比公平。
创新点和贡献
本研究有三大创新:
首先,论文首次将 EEG 微状态作为深度学习模型的通用表征,弥合了深度学习方法与神经活动模式之间的鸿沟。不同于传统方法将 EEG 视为多变量时间序列,微状态表征将信号离散化为 “思想原子”,提供了一种更贴近生理机制的编码方式。
其次,实验证明微状态具备跨任务和跨模型的通用性。在睡眠数据上初始化的分词器可应用于情绪识别和运动想象等不同任务,并在 CNN+LSTM、Transformer、ResNet 等多种架构下均表现优异。这种迁移能力显著缓解了 EEG 任务特定数据稀缺的问题。
第三,微状态展现出更强的可扩展性和可解释性。随着训练数据量增加,微状态方法比时域和频域方法获得更大的性能增益(图 3)。在可解释性方面,论文分析发现相同睡眠阶段下不同受试者间高频微状态高度一致,且清醒期和快速眼动期共享大量微状态模式,而深度睡眠期则呈现出不同的分布特征(图 5),这些现象与已知的神经活动规律相符:微状态 419、421 在所有清醒受试者中占据前三位,其电位均低于 2.2μV,对应α波的低振幅特征;而深度睡眠期高频微状态 378、452 的电位范围在 10-24μV 和-5 至-21μV 之间,对应δ波的高振幅特征。
实验结果分析
论文从多个维度验证了微状态的有效性。
跨任务性能对比:在睡眠分期任务中,微状态在三种模型下均取得最高准确率,其中 Sleep Transformer 和 Sleep Net Zero 均达到 0.810(表 1),相比之下时域特征为 0.786 和 0.793,频域特征为 0.790 和 0.794。情绪识别任务中,微状态达到 0.862 准确率,超过时域的 0.846 和频域的 0.797(表 2)。运动想象分类中,微状态以 0.437 准确率显著优于时域的 0.362 和频域的 0.323(表 3)。这些结果一致表明,频域特征在睡眠分期(与频率高度相关)中表现尚可,但在其他任务中出现性能下降,说明信息丢失问题严重;时域特征则因噪声干扰未能最佳发挥。
通道数影响分析:由于分词器仅在 6 通道数据上训练,论文在 SEED 数据集上对比了 6 通道和全 62 通道的性能(表 4)。结果显示时域特征从 0.846 提升至 0.854,频域从 0.797 大幅提升至 0.854,而微状态使用 6 通道仍达到 0.862。这说明即使通道数受限,微状态仍具有竞争力,且 6 通道的限制并不严重。
可扩展性验证:随着训练样本数从 2000 增加到 10000 以上,微状态准确率增长曲线更陡峭(图 3),说明该方法在大数据场景下潜力更大。同时,增加微状态聚类数也能提升性能(图 4),从较小的 k 值到 k=1000 时准确率和 Kappa 系数持续上升。
实践建议
对于希望在 EEG 分析中应用微状态的研究者和工程师,以下几点值得关注:
数据准备策略:如果目标任务的 EEG 数据量有限,可考虑先在大规模公开睡眠数据集(如 HSP)上训练微状态分词器,再迁移到目标任务。关键是要确保目标数据和训练数据的通道配置一致,至少覆盖 F3、F4、C3、C4、O1、O2 等基本电极位。
模型架构适配:微状态序列是离散的,必须使用嵌入层将离散标签映射为连续向量后再输入后续模型。嵌入维度可根据任务复杂度调整,论文中使用了 128 到 1024 不等。对于 CNN 架构,可以先嵌入再卷积;对于 Transformer 架构,嵌入后配合位置编码使用。
聚类参数选择:微状态数量 k 是重要超参数。论文实验表明 k=1000 时性能达到饱和,更大的 k 值可能进一步提升性能,但也会增加计算开销和序列长度。建议根据数据规模和任务复杂度在 100 到 1000 之间进行搜索。
可解释性应用:微状态的离散特性使其天然适合认知分析。在开发诊断工具时,可通过分析特定疾病或认知状态下微状态的分布变化,为临床决策提供可解释的参考。例如,论文发现清醒期和快速眼动期共享微状态 419 和 421,深度睡眠期则呈现微状态 378 和 452 的高频出现,这种模式可作为睡眠分期的生理学证据。
计算资源考量:流式 K-means 使得在有限内存下处理超大规模数据集成为可能。如果数据量超过内存限制,可采用更小的批尺寸,但需注意批尺寸过小可能导致聚类中心更新不稳定。论文使用 n=50 的批尺寸在 HSP 数据集上取得了良好效果。