LLM 作为临床图结构精炼器:增强脑电图癫痫诊断中的表示学习

LLM as Clinical Graph Structure Refiner: Enhancing Representation Learning in EEG Seizure Diagnosis

arXiv: 2604.28178v1

论文信息

标题: LLM as Clinical Graph Structure Refiner: Enhancing Representation Learning in EEG Seizure Diagnosis

作者: Lincan Li, Zheng Chen, Yushun Dong

发布日期: 2026-04-30

arXiv ID: 2604.28178v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:EEG 癫痫检测中,传统图构建方法易受噪声干扰,产生冗余或虚假连接,导致图表示学习性能下降。本文尝试利用大语言模型(LLM)的推理能力来精炼图结构,提升下游分类效果。
  • 核心方法:提出两阶段框架:先用 Transformer 边预测器生成初始概率图,再通过 LLM 结合文本化描述与统计特征对每条边进行 “保留/删除” 的二值判断,最终得到稀疏、更具生理意义的脑网络图。
  • 关键结果:在 TUSZ 数据集上,GPT‑5 作为精炼器使癫痫检测 F1 分数达到 0.7907,优于所有非 LLM 基线(最高 0.7351)以及其他被测 LLM(见表 1)。
  • 主要局限:实验仅在单一数据集上进行,LLM 推理开销大,未在实时在线场景中验证;论文未讨论 LLM 可能产生幻觉对精炼决策的影响,泛化能力有待进一步检验。
  • 适合读者:从事图神经网络、生物医学信号处理、大语言模型在垂直领域应用研究的科研人员,以及关注 EEG 临床决策支持系统的工程师。

论文背景和研究动机

癫痫影响全球数千万人,EEG 是监测脑电活动、诊断癫痫的核心工具。然而 EEG 信号常被噪声、伪迹和患者间差异污染,且癫痫发作的模式在时长、频率和空间分布上高度异质。传统手工分析或基础信号处理方法耗时且易出错,近年来的深度学习方法在建模 EEG 通道间高阶关系时仍存在不足(见论文第 1 节)。

现有基于图学习的 EEG 癫痫检测方法主要分为两类:一类利用通道间的统计相关性(如皮尔逊相关系数)预定义固定图;另一类通过注意力机制或可学习模块动态构建图结构。但无论哪种方式,都因 EEG 数据固有的噪声和变异性,生成的图中常常包含冗余、虚假甚至错误的边,从而误导图神经网络(GNN),降低表示学习和检测性能(见论文第 1 节、第 2.1 节)。

论文指出,已有研究缺乏明确的、有原则的机制来精炼图连接,过滤与任务无关的边,而 LLM 的强大推理和上下文理解能力恰好可以弥补这一短板。LLM 能基于统计证据和语义信息智能地区分有意义和无意义的连接,促使研究者探索将 LLM 用作图边精炼器,以提升 EEG 癫痫检测的图质量和可解释性。

核心方法和技术细节

论文提出一个两阶段 LLM 临床图结构精炼框架(图 1 左)。整体工作流程:EEG 多通道时间片段先送入 Transformer 边预测器生成初始边集,再交由 LLM 进行上下文感知的精炼,最后将精炼后的图输入统一的下游图学习模型(GraphS4mer)进行癫痫发作分类(图 1 右)。

第一阶段:基于 Transformer 的边预测

将 NN 个通道的 EEG 片段 Xτ\mathbf{X}_{\tau} 逐一输入 Transformer 编码器,获得每个通道的嵌入向量 hτih_{\tau}^i:

hτi=Transformer(xτi),hτi∈Rdh_{\tau}^i = \text{Transformer}(x_{\tau}^i), \quad h_{\tau}^i \in \mathbb{R}^d

对任意两个通道 (i,j)(i,j),拼接其嵌入 zτij=[hτi;hτj]z_{\tau}^{ij}=[h_{\tau}^i; h_{\tau}^j] 并送入两层 MLP,通过 sigmoid 激活输出边存在概率 pτijp_{\tau}^{ij}:

pτij=σ(w2⊤ ϕ(w1zτij+b1)+b2)p_{\tau}^{ij} = \sigma\left(\mathbf{w}_2^\top \,\phi(\mathbf{w}_1 z_{\tau}^{ij} + \mathbf{b}_1) + b_2\right)

其中 ϕ\phi 为 ReLU 激活函数。设定阈值 φ\varphi,保留概率大于 φ\varphi 的边,得到初始邻接矩阵 Eτini\mathbf{E}^{ini}_\tau(详细公式见第 3.2 节)。

第二阶段:LLM 驱动的图边精炼

对于 Eτini\mathbf{E}^{ini}_\tau 中每一条候选边 (i,j)(i,j),论文设计专有提示模板来让 LLM 判断该连接是否应保留。提示包含两部分信息:文本化 EEG 特征和统计特征。

  • 文本化特征构造:利用 GPT‑4o 将每个通道的信号特征转化为自然语言描述,包括通道标签(如 “F3”)、解剖位置(如 “额叶”)以及信号高层次的观察(如 “出现间歇性尖棘波”)和变化趋势。
  • 统计特征构造:提取 12 个常用的 EEG 统计量,包括平均幅值、标准差、主导频率、最小值、最大值、中位数、四分位数、偏度、峰度、能量和过零率等(见第 3.3 节),并以标准化文本格式呈现。

典型的精炼提示格式如下(示例为通道 F3 和 T4):

text
Node i: Channel F3, located in the frontal lobe, shows moderate amplitude with intermittent sharp spikes. [...] Mean amplitude: 12.3 μV, Std: 4.5 μV, Dominant frequency: 8.5 Hz, Min: -6.2 μV, Max: 22.7 μV, Median: 10.1 μV, Q25: 7.8 μV, Q75: 14.5 μV, Skewness: 0.32, Kurtosis: 2.1, Energy: 1532.6, Zero-crossing rate: 42.
Node j: Channel T4, located in the temporal lobe, shows high amplitude with pronounced rhythmic slowing. [...] Mean amplitude: 18.2 μV, Std: 5.1 μV, Dominant frequency: 4.2 Hz, Min: -3.1 μV, Max: 25.8 μV, [...] Zero-crossing rate: 33.
Question: Does a meaningful functional connection exist between Node i and Node j in this EEG segment? Answer yes or no, based on the context above.

LLM 对每条边返回二元答案(“yes” 或 “no”),仅保留回答 “yes” 的边,从而获得精炼后的邻接矩阵 Eτ∗\mathbf{E}^{*}_\tau(算法 1)。整个流程中,LLM 作为图结构精炼器,不参与下游模型训练,仅提供连接决策。

创新点和贡献

  1. 首次将 LLM 引入图结构精炼用于临床 EEG 分析。与现有纯数据驱动的构图方法不同,该方法利用 LLM 的推理和上下文整合能力,显式地判断边是否具有生理意义,这一思路为图学习带来了新的范式。
  2. 构建了标准化的 LLM 临床图精炼基准。论文系统评估了从 Mistral 7B 到 GPT‑5 等 10 款通用 LLM 在图推理中的表现,为比较不同模型的推理一致性、鲁棒性和下游任务性能提供了统一平台(表 2,图 2–4)。
  3. 兼顾性能与可解释性。在 TUSZ 数据集上的实验表明,LLM 精炼不仅提升了癫痫检测准确率,还生成了更稀疏、更符合神经生理学知识的脑网络结构,有利于临床解读(图 2 展示发作从额叶向颞叶传播的动态变化;图 4 显示 GPT‑5 生成的图在时间窗上保持了清晰的空间传播路径)。

实验结果分析

论文统一使用 GraphS4mer 作为下游主干,仅替换输入图的结构,公平比较了 5 种传统图构建方法和 10 种 LLM 精炼方案。

下游任务性能(RQ1) 表 1 显示,所有 LLM 精炼方法均优于最好传统方法(生成图学习器 F1=0.7351)。其中,GPT‑5 精炼图取得了最高性能:F1=0.7907,准确率=0.9315,召回=0.8058,较最先进传统方法相对提升约 7.6%。从 Mistral 7B 到 GPT‑5,性能随模型规模增大而递增,说明更强的 LLM 具备更出色的图推理能力。

LLM 图推理基准(RQ2 & RQ3) 表 2 从图稀疏度和 Jensen-Shannon 散度(JSD)两个角度量化了不同 LLM 的推理一致性。结果显示,GPT‑5 的精炼图最稀疏(0.3741)且 JSD 最小(0.0265),意味着它不仅去除了大量冗余边,且不同样本间的决策高度一致。与之对比,Mistral 7B 的 JSD 达到 0.0576,图结构波动较大。图 3 的热力图进一步证实 GPT 系列内部边集合高度相似,而不同系列模型间差异明显。

可解释性分析 图 2 展示了癫痫发作过程中节点重要性的动态演变:从 t+1 到 t+6,活动从额区(Fp1/Fp2、F3/F4)向颞区(T3/T4)扩散,与临床已知的癫痫传播模式相符。GPT 系列模型捕捉到的激活区域更集中、稳定,Mistral 和 Llama 则出现分散或不连贯的激活。图 4 的时空图可视化同样表明,GPT‑5 生成的图在保持稀疏性的同时,能够清晰地刻画发作从前额到颞叶再到中央和顶枕区的传播路径,生理合理性更高。

整体上,实验结果强有力地支持了 LLM 在图结构精炼中的价值,并揭示出更大的模型通常能带来更稳定、更具解释性的脑连接图。

实践建议

该框架若要在工程或临床场景中落地,可关注以下几点:

  1. 选择合适的 LLM 推理模式 论文中 LLM 对每条边都需要一次 API 调用,对包含 19 个通道的 EEG 片段,初始图约 171 条候选边,若需实时检测,推理延迟和成本较高。实践中可考虑采用本地部署的轻量级 LLM(如 Mistral 7B)进行初步筛选,再用大模型精炼;或利用批量提示、边并行请求来提升吞吐量。同时,可探索将精炼过程以知识蒸馏的方式固化到轻量的判别模型中,降低在线推理的依赖。

  2. EEG 特征工程与提示模板优化 当前提示中融合了 GPT‑4o 生成的文本化描述和 12 个统计特征。对于临床部署,文本化描述可由固定规则替代(如信号幅值超过阈值则标记 “高幅值尖波”),以减少额外 API 开销。继续优化统计特征集合,并结合领域知识(如电极导联的空间关系)作为额外上下文,有望进一步提升精炼的鲁棒性。

  3. 与下游模型协同训练 论文中 LLM 精炼与下游 GNN 训练是解耦的。未来可尝试将 LLM 精炼作为一个弱监督信号,与 GNN 交替训练或联合微调,使精炼策略更贴合目标任务,同时减少迭代过程中过于激进删除边带来的信息损失。

  4. 多源数据与跨人群泛化 目前仅在 TUSZ 数据集上评估,实际应用中需考虑不同脑电设备、导联配置以及人群差异。建议在多个公开 EEG 癫痫数据集上验证精炼效果,并引入数据增强(如通道随机丢失、噪声注入)来提升方法的泛化能力。此外,结合患者的临床文本记录进行多模态精炼,是论文未来工作指出的方向,可能进一步提升诊断的准确性和可解释性。

通过以上实践优化,LLM 图精炼有望成为 EEG 癫痫检测流程中的一个有效且可信的预处理环节,既提升模型性能,又为临床医生提供更加透明、符合生理认知的脑连通模式。