基于强化学习的持久图空间随机动力学

Stochastic Dynamics on Persistence Diagram Space via Reinforcement Learning

arXiv: 2608.06276v1

论文信息

标题: Stochastic Dynamics on Persistence Diagram Space via Reinforcement Learning

作者: Farzana Nasrin

发布日期: 2026-08-06

arXiv ID: 2608.06276v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:持久化图是拓扑数据分析中稳定且可解释的多尺度结构摘要,但现有统计方法多将其视为静态对象,缺乏在可变基数持久化图空间上进行概率建模与随机演化的框架。
  • 核心方法:作者将拓扑感知的局部编辑操作嵌入强化学习,定义持久化图空间上的受控马尔可夫过程,通过奖励函数同时驱动分布匹配、任务相关拓扑统计与结构保真压缩。
  • 关键结果:在适当的奖励与动作设计下,诱导的马尔可夫链被证明是不可约、非周期且几何遍历的,从而保证存在唯一的平稳分布(见定理 4.2、4.3),且实验表明框架能在显著降低图复杂度的同时保留主导拓扑结构。
  • 主要局限:奖励权重的设定目前仍依赖人工调试;高基数持久化图下状态–动作空间可能面临维数挑战;实验仅覆盖合成数据与神经影像数据,泛化性待进一步验证。
  • 适合读者:从事拓扑数据分析、随机几何、强化学习应用的研究者,以及对概率建模与多尺度结构演化感兴趣的机器学习与数据科学从业者。

论文背景和研究动机

持久化同调是计算拓扑的核心工具,它通过记录数据在不同尺度下拓扑特征(如连通分量、环、空腔)的 “出生” 与 “死亡” 时刻,生成持久化图(Persistence Diagram, PD)。PD 中的每一个点 (b,d)(b,d) 表示一个拓扑特征在尺度 bb 出生、在 dd 死亡,点越远离对角线,特征越持久、越具有结构显著性。由于 PD 在扰动下具有理论上的稳定性,它已被广泛应用于材料科学、神经影像、蛋白质结构分析等领域。

然而,PD 的统计推断与概率建模仍面临两大障碍。首先,PD 的基数(即点的个数)会随数据变化而不同,样本之间无法直接对齐,传统向量空间中的概率模型难以直接搬移。其次,尽管已有工作提出 PD 上的度量、Frechet 均值以及部分生成模型,它们大多将 PD 视为固定不变的观测量,未能提供一种机制让 PD 本身在某个动力学的驱动下发生演化,以适应目标任务(如去噪、压缩、分布对齐)。换言之,缺乏一个能够刻画 PD 随机演化的统一框架,使得我们无法像处理时间序列或点过程那样对拓扑摘要进行概率推断和在线调整。

该论文正试图填补这一空白:构建一个持久化图空间上的随机动力学框架。作者借鉴强化学习中控制马尔可夫过程的思想,将 PD 的每一步演化定义为一个拓扑感知的局部编辑操作,通过精心设计的奖励函数来引导演化方向,从而实现概率建模与任务驱动的拓扑简化。这一思路将 PD 从被动的特征描述提升为可主动演化的概率对象,为后续的拓扑感知生成模型、自适应压缩和在线拓扑监控提供了理论基础。

核心方法和技术细节

论文的核心是将 PD 的演化建模为一个受控马尔可夫过程,其要点包括状态空间定义、动作设计、转移机制与奖励塑造。

状态空间 状态空间是所有有限 PD 构成的集合,每个 PD 由平面上多个点(及可能存在的对角线)组成。由于 PD 的基数可变,状态空间既非欧氏空间也非固定维数流形,但可被赋予度量结构(如 Wasserstein 距离)。作者在状态上定义强化学习环境,每个状态 ss 就是当前的一张持久化图。

动作:拓扑感知的局部编辑 动作集合由三类基本编辑操作构成:点出生(在接近对角线的位置添加一个寿命极短的特征)、点死亡(移除某个寿命较短的点)以及点移动(轻微改变某点的坐标)。所有操作均以软性方式保留拓扑一致性:出生点受对角线附近先验限制,死亡点优先针对低持久化特征,移动步长和方向受局部拓扑结构(如周围点密度、到对角线的距离)约束。这种设计保证了每次迭代仅对 PD 的小邻域进行微小调整,使得动力学具有局部平滑性,同时保留了 PD 的多尺度表达能力。

转移概率 在状态 ss 下选择动作 aa 后,状态依概率转移到新 PD s′s'。转移概率由动作的随机性(例如点移动时添加高斯噪声)和编辑操作的定义共同决定。由于每一步只做微小修改,该过程形成一个在 PD 空间上演化的马尔可夫链。

奖励函数:三重目标的融合 奖励信号的设计是该框架的关键,它融合了三个层面的期望:

  1. 分布匹配:若目标是使 PD 的平稳分布接近某个目标分布(例如从正常样本中估计的经验分布),则计算当前 PD 与目标分布之间的某种统计距离(如最大均值差异 MMD 在 PD 核上的近似),并将其负值作为奖励的一部分。
  2. 任务特定拓扑统计:用户可以指定某些拓扑概要函数(如总持久化、不同维度的 Betti 序列、分位持久化曲线等),要求演化的 PD 在这些统计量上逼近预设值。奖励项将鼓励 PD 的输出统计量靠近目标,从而实现对演化方向的精细调控。
  3. 结构保持压缩:为在简化 PD 的同时不丢失主要拓扑信息,引入复杂度惩罚项。常用做法是奖励具有较少点数的 PD,同时惩罚过度删除高持久化特征导致的拓扑失真。一项经典奖励项基于 “与原始重要 PD 的最优匹配距离”,使得压缩后的 PD 在 Wasserstein 距离上尽可能接近原始 PD 的主要分量。

最终奖励是这些项的加权和,权重系数允许用户根据任务调节简化程度与保真度之间的权衡。

强化学习与理论保证 作者采用策略梯度方法(如 REINFORCE 或 PPO)训练一个随机策略 πθ\pi_\theta,该策略在给定当前 PD 状态 ss 时输出动作的概率分布。通过反复采样动力学轨迹并计算累积奖励,策略参数 θ\theta 被迭代更新,使得整个马尔可夫过程的稳态分布逼近目标分布,同时满足复杂度和拓扑统计约束。

理论部分重点分析了该受控马尔可夫链的遍历性质。论文证明,在动作空间满足温和连通性条件且所有状态在充分多步后可达的前提下,所诱导的马尔可夫链是不可约的、非周期的,进一步在适当的漂移条件下具有几何遍历性(见定理 4.2、4.3)。几何遍历性意味着分布收敛速度呈指数快,且存在唯一的平稳概率测度——这为用强化学习训练出收敛到目标分布的动力学提供了严格保证。证明主要依赖于构建一个合适的 Lyapunov 函数(常与图中点的总持久化有关),并利用漂移条件证实几何遍历性。

创新点和贡献

该论文的主要创新可以归纳为以下三点:

  • 首次在 PD 空间上定义受控随机动力学。不同于依赖固定 PD 的统计方法,该框架赋予 PD 主动演化的能力,使其能够向满足特定分布与统计目标的方向动态调整。
  • 提出拓扑感知动作与多目标奖励的融合范式。局部编辑操作保证了演化的平滑性和可解释性,而结合分布匹配、任务统计和压缩惩罚的奖励使框架能够灵活应对多种任务,如拓扑去噪、分布生成和关键结构提取。
  • 提供几何遍历性的严格证明,为框架的概率收敛性提供了理论依据。这一结果确保了无论从何种初始 PD 出发,演化的 PD 分布最终都会指数级收敛到唯一的稳态,从而保证了训练过程的合理性与可复现性。

此外,论文将强化学习与拓扑数据分析深度融合,扩展了强化学习在非欧氏结构空间上的应用场景,对随机几何和统计拓扑的交叉领域具有启发意义。

实验结果分析

论文在合成数据和脑皮层厚度数据的神经影像 PD 上进行了验证实验。

合成数据 作者生成了具有两种不同拓扑结构簇的合成 PD(例如一类包含一个显著环,另一类包含两个较弱环),并将两类的混合分布作为目标分布。实验显示,训练后的动力学能以较高概率生成符合目标分布混合比例的 PD 样本,同时有效去除了原始图中大量靠近对角线的噪声点。相比静态的 PD 降噪方法,该框架在保留主导拓扑特征(如持久环)方面表现稳健,且能将平均图基数降低约 40%~60% 而不显著改变持续性较高的点的分布(具体降幅见第 5.1 节图 3)。奖励函数中压缩惩罚项的引入直接导致最终 PD 的复杂性大幅下降,而分布匹配项防止了关键拓扑的丢失。

神经影像数据 实验使用阿尔茨海默病神经影像(ADNI)中提取的脑皮层厚度持续化图。在该任务中,目标分布是由认知正常组样本的 PD 经验分布定义的,旨在捕获正常脑皮层拓扑的统计规律。训练后的动力学能够将任意的 PD 逐渐 “吸引” 到正常组的分布附近,同时显著减少由噪声引起的小持久化特征。在单个体级别的拓扑压缩测试中,压缩后的 PD 与原始重要特征的 Wasserstein 距离明显小于直接丢弃低持久化点的方法(见第 5.2 节)。这表明所提方法不仅完成分布匹配任务,还自然实现了高质量的自适应拓扑简化。

这些实验结果共同验证了框架在平衡分布保真与结构压缩方面的有效性,也初步展示了其在生物医学数据分析中的潜在价值。

实践建议

对于希望将该框架应用于自身任务的读者,以下几点实践建议或可参考:

  • 任务定义与奖励权重调节:框架高度依赖奖励函数中各分量的权重。建议首先明确任务是侧重于分布生成、拓扑特征匹配还是结构压缩,然后通过小规模网格搜索调整权重比。例如,当压缩为首要目标时,可增大复杂度惩罚项权重并降低分布匹配权重,同时监控重要拓扑特征的保留率,避免过度裁剪丢失结构信息。
  • 动作空间设计:局部编辑的定义会影响动力学效率。在低噪声场景中,点移动的步长方差宜设较小值,以保证收敛稳定性;在高基数场景,可引入批量删除低持久化点的动作,以加速简化过程。论文未深入讨论动作空间的自动调优,实践中可结合持久化阈值的先验知识进行设置。
  • 状态表征与核函数选取:若任务依赖精确的分布匹配,需要选择合适的 PD 核(如持久化尺度核或切片 Wasserstein 核)来估计 MMD 或计算奖励。不同核对长持久化特征的敏感性不同,应根据应用数据的持久化尺度分布特性进行选择,以确保奖励信号能有效区分重要拓扑变化。
  • 扩展到在线或交互式场景:由于该框架提供马尔可夫动力学,它天然适合在线逐步调整 PD 的场景,例如实时监控工业过程拓扑变化或交互式拓扑编辑。实践中可将模型部署为持续运行的策略,每一步接收新到达的数据并更新 PD,同时用策略决定下一步编辑,这需要将奖励设计为在线可计算的增量形式。
  • 计算资源考虑:PD 演化过程的每一步都需要计算拓扑统计或分布匹配项,这在持久化图规模较大时可能成为瓶颈。建议预先通过 bootstrap 采样或向量化实现加速,或仅在高持久化点的邻域内执行动作搜索,减少冗余计算。

总体而言,该框架为拓扑数据分析提供了一个兼具理论深度与工程灵活性的概率演化工具,尤其适合需要自适应简化、分布对齐或动态拓扑监控的应用场景。在具体落地时,使用者需结合领域知识精细调控奖励与动作设定,以充分发挥其拓扑感知演进的优势。