迈向基础时间序列模型分类量子微调的可扩展性

Towards Scaling Quantum Fine-Tuning of Foundational Time Series Models for Classification

arXiv: 2609.05408v1

论文信息

标题: Towards Scaling Quantum Fine-Tuning of Foundational Time Series Models for Classification

作者: Sang Hyub Kim, Julien Baglio, Rajiv Krishnakumar, et al.

发布日期: 2026-09-04

arXiv ID: 2609.05408v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决量子微调能否从文本迁移到时间序列基础模型,以及混合经典-量子架构在固定深度下如何通过更多量子比特有效扩展分类能力。
  • 核心方法:冻结 Chronos 时间序列基础模型提取嵌入,用量子头(sPQC 编码器 + 数据重上传 PQC)做五分类;引入 “wing”(翼)模块,把新特征流通过稀疏单向 CNOT 耦合进固定 12 量子比特核心电路,以增加输入带宽而非电路深度。
  • 关键结果:在 PSML-5 电网事件分类中,量子头在相同输入上比更大的经典 MLP 高出 1.7–2.0 个百分点平衡准确率;加入两个 wing 后,19 量子比特配置的平衡准确率从 0 wing 的 83.63% 提升到 85.23%(见论文图 3、表 4)。
  • 主要局限:所有结果来自无噪声状态向量模拟、单一数据集、五折交叉验证;归因消融只在两翼配置运行;尚未在真实量子硬件上执行,也未做梯度幅度研究。
  • 适合读者:从事量子机器学习、时间序列分类、基础模型微调、能源电网监控的算法研究者与工程团队。

论文背景和研究动机

基础模型通过微调把大规模预训练能力迁移到下游任务,已在大语言模型和时间序列预测中普遍使用。此前,作者在量子语言模型微调中展示了用量子头处理文本嵌入的可行性,但尚未回答该方法能否迁移到时间序列领域,以及如何扩展量子比特数而不增加电路深度。

时间序列分类比文本情感分类更难:输入通常是多变量、多类、短时瞬态叠加在大幅干扰上。为体现这三点,作者选择 PSML-5 电网事件分类基准,包含发电机跳闸、支路跳闸、支路故障、母线跳闸、母线故障五类,共 549 个样本,输入形状为 91 通道 × 960 时间步。该数据集的难点在于同一事件类型发生在电网不同位置,产生高类内变化但仍存在类级可分信号。

作者的目标不是训练一个全新的量子模型,而是将时间序列基础模型 Chronos 的嵌入作为冻结特征,用小型量子头进行分类,并与更大的经典 MLP 以及该数据集已发表的最强专用模型对比。这为量子模型在真实多类、多变量序列任务中的竞争力和扩展路径提供了检验场景。

核心方法和技术细节

整体流程为:Chronos-base 编码器独立处理 91 个 PMU 通道,输出每时间步隐藏状态,再做窗口均值池化,得到每通道 768 维嵌入。原始拼接向量高达 69,888 维,直接进量子电路不现实。作者先按物理测量类型(电压、有功功率、无功功率)分组,计算每组均值与标准差,得到 4,608 维特征,称为 type-group mean/std pooling。这一步比基准提升最明显:平衡准确率从约 74.43% 提升到约 82%(见表 5,E0 到 E1)。

然后引入 sketch fingerprints:对每个 768 维块,用基于 SHA-256 的确定性 Rademacher 投影压缩,并附加 top-k 能量、范数统计等辅助信息,形成紧凑摘要。这些摘要被送入量子头的 sPQC 编码器,该编码器模拟幅度编码到一个小参数化电路,再通过 Pauli-Z 读出压缩特征。核心 PQC 是 12 量子比特、两层数据重上传模块,测量 5 条线路后接线性分类头。后选择量子比特以低初始权重耦合进核心,训练中要求接收率不低于 0.25。

为了在固定深度下增加输入带宽,作者提出 wing 架构:每个 wing 是一个 3 量子比特寄存器,有自己的 sPQC 编码器,接收一组与核心不同的特征流,并通过少量固定 CNOT 单向耦合到核心。wing 之间不耦合,核心深度保持固定。从 0 wing 到 2 wing,总量子比特数为 13、16、19。

创新点和贡献

本研究把量子微调范式从文本扩展到时间序列基础模型,并在 PSML-5 数据集上超过已发表最强专用模型 MLSTM-FCN(交叉验证均值 74.2% 的基准,见论文第 4.2 节)。另一个贡献是在固定宽度量子头的输入上做消融,发现仅增加 sketch 指纹预算并不能持续提升准确率:从 8、16、96 到 160 个指纹,量子头平衡准确率稳定在 84.21%–84.39%(见论文表 5),表明瓶颈在数据入口带宽,而非特征供给。

wing 模块是本论文最突出的方法创新。它把扩展问题从 “加深电路或扩大全连接寄存器” 重构为 “增加稀疏单向输入端口”。两个 wing 在恒定核心深度下带来单调提升,且消融实验显示,仅扩大电路容量而不注入新信息准确率反而下降 1.38 个百分点;把 wing 载荷跨样本打乱后,准确率降至 81.59%,低于无 wing 配置的 83.63%(见论文第 4.3 节)。这表明增益来自信息载荷本身,而非参数数量。

实验结果分析

分类结果部分(论文第 4.2 节)显示,量子头在相同输入上稳定领先经典 MLP。在 sketch 指纹预算 8、16、96、160 时,量子头与经典 MLP 的平衡准确率差值分别为 +1.97、+1.86、+1.73、+1.96 个百分点(见表 5),作者将此解读为该设置下量子头把相同信息转化为更高分类精度的证据。因为论文未进行多次独立数据划分的统计显著性检验,这些差距应理解为所选交叉验证协议下的有限观测。

量子比特扩展实验(论文第 4.3 节)使用四种子、五折交叉验证,0 wing 均值 83.63%,1 wing 均值 84.62%,2 wing 均值 85.23%。这与论文图 3 显示趋势一致。一个不调学习率的共享设置(0.008)仍保持排序:12 量子比特参考 83.01%、13 量子比特 83.63%、16 量子比特 84.08%、19 量子比特 84.87%。

消融实验进一步支撑解释:不共享数据重上传参数的容量增长变体,在起始时功能等价于基线,但最终均值为 83.85%,低于完整 19 量子比特基线的 85.23%;打乱翼载荷的变体在 15 个共享折中 13 个表现更差,配对平均下降 4.20 个百分点(见论文第 4.3.1 节)。作者推测,由于单翼载荷信息错误,模型表现出比无翼基线更低的准确率。

实践建议

对于打算在时间序列基础模型上试用量子头的工程团队,可优先采用论文中的分阶段特征工程:先按物理测量类型分组池化,再在此基础上用小预算 sketch 指纹压缩,避免直接用原始高维拼接向量。此配置在 PSML-5 上已经能达到约 82% 的平衡准确率,远高于低维固定输入。

当量子头饱和时,不应一味增加电路深度或训练更多全连接参数。wing 结构提供一种实际可复用的扩展方式:保持核心电路不变,新增独立编码器和稀疏量子比特耦合,使扩展路径更稳定。在部署到真实量子硬件前,需要把 sPQC 编码器替换为可在硬件上执行的幅度编码或数据重上传方案,并处理有限采样噪声。论文中所有结果均在无噪声模拟下获得,硬件推理可能带来额外精度衰减,因此建议先在可用 QPU 上做小规模验证,再决定是否投入完整训练流程。

最后,若用于电网事件分类等安全敏感场景,必须重视训练与测试划分的泛化差距。论文报告交叉验证均值比同一检查点的测试均值高约 4–5 个百分点(见附录 F),这部分来自 110 个测试样本的有限规模和训练/测试分布差异。生产部署应使用更大的独立测试集和更严格的校准评估,而不是直接引用五折交叉验证数字。