实用化量子拓扑数据分析及其在高维特征提取与时间序列分析中的应用

Practical Quantum Topological Data Analysis with Applications to High-Dimensional Feature Extraction and Time Series Analysis

arXiv: 2607.27206v1

论文信息

标题: Practical Quantum Topological Data Analysis with Applications to High-Dimensional Feature Extraction and Time Series Analysis

作者: Jason Iaconis, Sayonee Ray, Samwel Sekwao, et al.

发布日期: 2026-07-29

arXiv ID: 2607.27206v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决的是如何利用量子计算高效提取高维拓扑特征,以用于时间序列数据的分析和预测。传统拓扑数据分析(TDA)在计算高维 Betti 数时面临组合爆炸瓶颈。
  • 核心方法:论文将量子 TDA 重新定位为特征提取方法,提出基于测量组合拉普拉斯算子(Combinatorial Laplacian)低阶矩的量子算法,特别是用相对迹(Relative Trace)作为高维拓扑信息的代理指标。
  • 关键结果:实验证明,低阶拉普拉斯矩与高维 Betti 数之间存在强相关性,即使相对 Betti 数很小。在量子硬件上成功区分了具有不同拓扑特征的图实例(见论文第 4.5 节)。
  • 主要局限:作者明确表示,这不是一个完全公平的比较,因为经典方法能给出完整的 persistent homology,而量子算法目前只估计与 Betti 数相关的可观测量。量子-经典交叉点估计需要乐观的硬件假设(双量子门速度 10μs)。
  • 适合读者:对量子机器学习应用感兴趣的量子计算研究者、希望了解 TDA 在金融和神经影像学中实践的分析师、以及关注量子优势实现路径的算法设计者。

论文背景和研究动机

拓扑数据分析(TDA)为理解复杂非结构化数据的 “形状” 提供了强大框架。它不局限于单个点或成对关系,而是通过代数拓扑工具计算拓扑不变量(如 Betti 数 βd\beta_d),定量描述图、网络或点云的全局形状。这些特征已被成功应用于神经科学、金融建模等多个领域。

然而,一个根本性的瓶颈限制着 TDA 的潜力:大多数实际应用仍集中在最低维的拓扑特征(β0\beta_0 连通分量和 β1\beta_1 环)。这部分是因为高维特征更难可视化和解释,更关键的原因在于计算成本。对于包含 NN 个顶点的复形,可能的 dd-simplex 数量按 (Nd+1)\binom{N}{d+1} 增长,当 dd 变大时出现组合爆炸。现代软件如 giotto-ph 虽然能通过并行化和边坍缩等技术优化,但时间-解(TTS)仍然按 (Nd)/d\binom{N}{d}/d 缩放,而内存需求按 (Nd)\binom{N}{d} 缩放(见论文第 2.2.2 节),对 80 个节点的图计算 d=8d=8 以上的 Betti 数已经非常困难。

Lloyd 等人提出的量子 TDA 算法为绕过这一瓶颈提供了路径,它只需要每个图节点一个量子比特,且能避免量子机器学习中常见的数据加载和读出问题。但现有方法集中在精确估计 Betti 数,使得量子优势的窗口看起来比较狭窄。本文作者采取了一种根本性的视角转换:将量子 TDA 视为下游数据分析的特征提取方法,而非用于计算抽象拓扑不变量的精确工具。关键问题是:高维拓扑特征是否真的对数据科学任务有价值?以及近期的量子设备能否提取这些特征?

核心方法和技术细节

将时序数据转化为拓扑特征

论文在两个实际应用场景中展示了高阶拓扑特征的价值:

fMRI 脑功能分析:利用 Takens 嵌入将每个脑区(ROI)的时间序列转化为 10 维点云(约 150 个点),通过 Vietoris-Rips 滤流生成持久同调图(Persistence Diagrams),然后计算不同 ROI 的 PD 之间的距离矩阵。这个 48×4848\times48 的矩阵编码了脑区间功能连接的拓扑信息。分类器分别使用神经网络和 SVM,对 OASIS 数据集的 32 名 AD 患者和 79 名健康个体进行分类。

金融时间序列分析:将 17 个不同股票指数在 100 天窗口内的收盘价,通过时间延迟嵌入(τ=2\tau=2 天,嵌入维数 D=10D=10)构建点云。对每个时间窗口计算 H1H_1 到 H4H_4 同调的持久性,取 L2L_2 范数作为拓扑信号。通过时移的 Pearson 相关系数,量化 TDA 信号对市场价格的预测能力。

量子算法:矩方法的创新

本文的核心算法创新在于不直接估计 Betti 数(即计算 ΔkΓ\Delta_k^\Gamma 的零特征值数量),而是测量组合拉普拉斯算子的低阶矩,特别是第一矩的相对迹:

tr[ΔkΓ]=1NkTr[ΔkΓ]\text{tr}[\Delta_k^\Gamma] = \frac{1}{N_k}\text{Tr}[\Delta_k^\Gamma]

电路构造包含三个关键模块:

  1. Dicke 态制备:使用量子相位估计(QPE)将初始乘积态投影到固定 Hamming 权重的子空间,生成 ∣DkN⟩|D_k^N\rangle 态。这需要 2⌈log⁡2(k)⌉N2\lceil\log_2(k)\rceil N 个 CX 门。

  2. 复形投影:对补图中的每条缺失边施加 Toffoli 门,将 Dicke 态投影到实际图的 k-clique 空间。对于边密度 ζ2>0.5\zeta_2>0.5 的情况,所需的 Toffoli 门数为 (1−ζ2)(N2)(1-\zeta_2)\binom{N}{2}。

  3. 边界算子作用:利用 fermion 算符表示 B=∑i(ai+ai†)B=\sum_i(a_i+a_i^\dagger),通过 Jordan-Wigner 变换实现 B=∑i[∏j<iZj]XiB=\sum_i[\prod_{j<i}Z_j]X_i。使用 Trotter 分解 U=eiθBU=e^{i\theta B},每个 Trotter 步需要 4N−24N-2 个 CX 门。注意 B/NB/\sqrt{N} 本身是酉算子。

总 CNOT 门数缩放为:

O(N+(1−ζ2)(N2)+T⋅N)\mathcal{O}\left(N + (1-\zeta_2)\binom{N}{2} + T\cdot N\right)

其中 TT 是 Trotter 步数,在 N=16N=16、k=4k=4、ζ2=0.7\zeta_2=0.7 的硬件实验中约需 700-737 个 CX 门(见论文图 22)。

创新点和贡献

第一个贡献:高阶拓扑特征的实际价值验证

在 fMRI 分析中,加入 H0H_0 到 H4H_4 所有同调特征时,神经网络达到约 74% 的平衡准确率,优于仅使用 H0H_0(69%)或 H0+H1H_0+H_1(70.5%)(见图 9-10)。SVM 模型同样显示,使用更高维同调特征在所有压缩尺寸下都有更好的表现(见图 11)。

在金融分析中,H4H_4 同调的持久性曲线明显显示了 H1H_1 曲线中较小或缺失的峰值,特别是在 2008 年金融危机前夕、2015 年股市抛售和 2018 年加密货币崩盘附近(见图 13)。通过时移的 Pearson 相关系数,高阶同调显示出预测性指标的典型特征:在 τ=0\tau=0 附近出现初始衰减,随后在 τ≈100\tau\approx 100 天达到最大的反相关性,而传统的 MACD 指标并未显示这种引导性(见图 15)。

第二个贡献:矩方法与 Betti 数的强相关性

论文最令人惊讶的发现是:对于 Erdős-Rényi 随机图,当按照相同的 k-clique 密度 NkN_k 分组后,相对迹 Tr[ΔkΓ]/Nk\text{Tr}[\Delta_k^\Gamma]/N_k 与 Betti 数 βk−1\beta_{k-1} 之间存在强相关性,即使相对 Betti 数 βk−1/Nk\beta_{k-1}/N_k 非常小,这种相关性也几乎不衰减(见图 17-18)。以 N=36N=36、k=5k=5 为例,在边密度 ζ2≈0.4\zeta_2\approx 0.4 时,相关系数峰值的衰减仅是对数级别的(图 18 右侧)。这意味着量子 TDA 不需要在相对 Betti 数大的图上才能工作,大大扩展了有用范围。

第三个贡献:量子硬件实验验证

在类似 IonQ Tempo 线的钡基囚禁离子发展系统上,对 16 个节点、边密度 ζ2=0.7\zeta_2=0.7 的图成功测量了 k=4k=4(对应 β3\beta_3)相对迹,使用的量子比特为 32 个,包含 4 轮中间电路测量(MCM)。实验能够区分具有不同 Betti 数值的图实例(见图 24),这是首次基于矩的量子 TDA 演示,其中测量的拉普拉斯可观测量与精确 Betti 信息进行了定量比较。

实验结果分析

量子-经典交叉点

使用 10μs 每门的双量子门速度(比当前囚禁离子硬件快约一个数量级,但已在专用实验中演示),在固定边密度 ζ2=0.90\zeta_2=0.90 时,量子与经典 TTS 的交叉点出现在 N≈70−1200N\approx 70-1200 个节点的范围,计算时间从几小时到 10 天不等(见图 20)。当 ζ2\zeta_2 提高到 0.95 时,量子 TTS 进一步降低,因为投影步骤中缺失的边更少。

在相位空间参数化中,论文显示对于 d=5,7,9d=5,7,9 的 Betti 数计算,最容易实现量子优势的路径是将边密度推向接近 1,并选择非常高的 Betti 维度(见图 21)。但要实现实际有用性,需要将边密度和 Betti 维度往下推,同时保持量子优势。图中标记了 1 天、1 周、1 个月和 1 年的 TTS 等高线。

算法的噪声鲁棒性

硬件实验揭示了清晰的噪声特征:在理想情况下,eiBθ∣Γ⟩e^{iB\theta}| \Gamma\rangle 的输出分布只在 Hamming 权重 k−1k-1、kk 和 k+1k+1 的基态上有支持。因此,任何具有其他 Hamming 权重的比特串都是由硬件噪声产生的,可直接丢弃。对于 k=2k=2、8 节点的图,最终分布非常接近理想情况,说明噪声水平很低;对于 k=4k=4、16 节点的图,在 k=3k=3 和 k=4k=4 子空间中出现了更多不属于输入单纯复形的比特串(见图 23),这体现了复杂度增加时的噪声影响。

实践建议

对于希望在金融或生物医学领域应用量子 TDA 的从业者,以下策略可以从本论文中提取:

  1. 特征工程层面:利用 Takens 嵌入定理时,嵌入维数 DD 必须足够大才能重构原始动力学吸引子。论文采用 D=10D=10,但对于不同应用需要根据虚假最近邻居法或互信息法确定最优延迟 τ\tau 和维数 DD。对于 fMRI 数据,时间序列长度需要足够保证所有个体的点云大小相似。

  2. 图构建策略:使用 Vietoris-Rips 复形时,边密度 ζ2≈0.6−0.95\zeta_2\approx 0.6-0.95 是量子算法有效的窗口。对于 fMRI 点云,论文在边密度 p=0.6p=0.6 处提取图(图 19),这里相对迹与 Betti 数的相关性最强。对于交易策略开发,可以利用不同时间窗口的 TDA 特征构建多时间尺度信号。

  3. 量子资源优化:中间电路测量(MCM)是减少量子比特需求的关键,使得 32-40 量子比特的设备可以处理 16 个节点的问题。在实际部署时,可以将振幅放大(x=1−3x=1-3 次 Grover 迭代)与 k=8−12k=8-12、ζ2=0.8\zeta_2=0.8 配合使用,平衡成功概率和电路深度。

  4. 分类器集成:fMRI 分类实验表明,简单地将所有同调特征展平并馈入小型神经网络(12×1212\times12 压缩矩阵)就已有效。避免使用过大模型以防过拟合,特别是当数据集较小时(论文使用了 80%-20% 划分)。对于金融时间序列,关注 τ≈100\tau\approx 100 天的时移相关性,这可能是 TDA 信号的最佳预测窗口。