FTPrimitiveBench:面向硬件驱动和有偏噪声模型的逻辑计算基准测试套件

FTPrimitiveBench: A Benchmark Suite For Logical Computation Under Hardware-Motivated and Biased Noise Models

arXiv: 2605.04049v1

论文信息

标题: FTPrimitiveBench: A Benchmark Suite For Logical Computation Under Hardware-Motivated and Biased Noise Models

作者: Shuwen Kan, Adrian Harkness, Zefan Du, et al.

发布日期: 2026-05-05

arXiv ID: 2605.04049v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决什么? 现有量子纠错(QEC)基准测试普遍采用均匀去极化噪声模型,无法反映真实硬件中普遍存在的有偏、非均匀噪声特性。论文旨在建立一个系统化的基准测试框架,研究不同硬件噪声结构如何差异化影响各类逻辑原语的性能。

  • 核心方法:用什么办法解决? 论文提出了 FTPrimitiveBench,这是一个将灵活的硬件驱动噪声模型与表面码逻辑原语生成器相结合的基准测试套件。噪声模型支持 Pauli 偏置、测量偏置、空间/时空非均匀性三种结构化噪声族,逻辑原语覆盖量子内存、晶格手术、横向 Hadamard 门和逻辑 S 门。

  • 关键结果:最重要的一个结论或数字。 在 Z 偏置噪声下,非对称码片(dZ>dXd_Z > d_X)可显著降低量子内存和晶格手术的逻辑错误率(在 η=100\eta = 100 时降低约一个数量级),但这种优势在横向 Hadamard 门上被削弱,因为该操作在中途交换 X 和 Z 通道、不保留偏置(见图 8)。

  • 主要局限:作者自己承认的、或方法本身固有的限制。 当前实现仅覆盖表面码和 Clifford 逻辑原语;非均匀噪声实验仅采用单一扰动抽取样本,未对多次独立扰动抽取取平均,可能引入采样随机性导致的波动(论文第 5.1.4 节)。

  • 适合读者:什么背景的人值得读? 适合从事量子纠错、容错量子计算架构设计、量子硬件—软件协同设计的研究人员和工程师,特别是关注表面码实现和噪声建模的从业者。

论文背景和研究动机

容错量子计算的实现离不开对量子纠错码及其逻辑操作的深入理解。传统研究中,均匀去极化噪声模型被广泛用作比较基准——每个故障位置被分配相同的错误率 pp(Fowler, 2012)。然而,实际量子硬件中的噪声本质上是不均匀的:错误率因量子比特、门类型、测量操作、空间位置以及时间而异(Klimov et al., 2018; McEwen et al., 2022)。

这种异质性和非对称性对逻辑性能的影响并非简单的线性缩放。在某些情况下,结构化噪声特征甚至可以为量子纠错协议与硬件的联合优化提供重要机会。例如,偏置噪声下,使用非对称码距或偏置感知的 XZZX 码可获得更高的错误阈值(Tuckett et al., 2018, 2019)。这促使研究者需要更贴近目标硬件的噪声模型,同时保持仿真的可处理性。

FTPrimitiveBench 正是在此背景下提出的。该框架旨在标准化噪声模型规范与逻辑原语构建之间的关系,使研究者能够在受控条件下系统探索噪声结构如何影响不同类型的逻辑计算,而不仅是逻辑内存。这对于从 “证明可行性” 向 “在真实条件下优化性能” 转变的容错量子计算研究尤为重要。

核心方法和技术细节

噪声模型接口的四层粒度

FTPrimitiveBench 的核心设计是将噪声规范与电路生成解耦。噪声参数可在四个层级上赋值:

  1. 全局赋值:单一参数集应用于所有量子比特、所有相互作用和所有轮次,恢复均匀去极化基线。
  2. 空间赋值:参数随量子比特和相互作用变化,但时间上固定,捕捉静态器件异质性。
  3. 时间赋值:参数逐轮变化,但在同一轮内所有组件共享,模拟漂移和瞬态退化。
  4. 时空赋值:空间和时间变化可组合,每个组件遵循自己的时间相关噪声剖面。

三类物理噪声通道

FTPrimitiveBench 区分三种物理噪声:

  • 门错误:单量子比特门和双量子比特门后分别施加 Pauli 误差通道。默认采用去极化模型,但用户可指定完整的 Pauli 概率分量以捕捉偏置。例如单量子比特门的一般形式为 Pi(1)(ρ)=(1−pΣ(1))ρ+px(1)XiρXi+py(1)YiρYi+pz(1)ZiρZi\mathcal{P}^{(1)}_i(\rho) = (1-p^{(1)}_{\Sigma})\rho + p^{(1)}_x X_i \rho X_i + p^{(1)}_y Y_i \rho Y_i + p^{(1)}_z Z_i \rho Z_i,用户可独立设置 px,py,pzp_x, p_y, p_z。
  • SPAM 错误:状态制备和测量错误使用基依赖的标量速率建模,Pi,b(SPAM)(ρ)=(1−pb)ρ+pbσbρσb\mathcal{P}^{(\mathrm{SPAM})}_{i,b}(\rho) = (1-p_b)\rho + p_b \sigma_b \rho \sigma_b。
  • 空闲错误:基于量子比特的 T1T_1、T2T_2 相干参数,通过 Pauli twirling 近似从振幅阻尼和退相位推导空闲通道概率(公式 4–6)。

内置噪声族

框架提供四种内置噪声族:

  1. 均匀去极化噪声:所有位置统一的错误率 pp,作为同质参考基线。
  2. Pauli 偏置噪声:参数化为偏置轴 A∈{X,Z}A \in \{X, Z\} 和偏置因子 η=pA/pA⊥≥1\eta = p_A/p_{A^{\perp}} \geq 1。单量子比特通道中 pA⊥=pY=p/(η+2)p_{A^{\perp}} = p_Y = p/(\eta+2),pA=ηp/(η+2)p_A = \eta p/(\eta+2);双量子比特通道权重集中在 {AI,IA,AA}\{AI, IA, AA\} 上。当 η=1\eta = 1 时恢复均匀去极化。
  3. 测量偏置噪声:仅对测量和重置操作的翻转概率缩放为 ηp\eta p,门和空闲通道保持基线不变。
  4. 非均匀噪声:在均匀基线基础上,每个组件的错误率乘以 (1+δc)(1 + \delta_c),其中 δc∼N(0,σ2)\delta_c \sim \mathcal{N}(0, \sigma^2),截断至 [0,0.5][0, 0.5]。支持仅空间或时空相结合的扰动模式。

表面码逻辑原语

FTPrimitiveBench 自动生成四种 Clifford 逻辑原语的 Stim 电路,包含探测器注释和逻辑可观测量:

  • 逻辑内存:在 dX×dZd_X \times d_Z 码片上横向初始化、执行 tt 轮症状提取、横向测量。时空体积 Vmem=dXdZtV_{\mathrm{mem}} = d_X d_Z t。
  • 横向 Hadamard:在所有数据量子比特上施加物理 Hadamard 门,自动交换 X 和 Z 型稳定器。
  • 晶格手术:通过临时扩展稳定器集合并入一个长度为 LL 的 ancilla 桥,实现联合逻辑奇偶测量(MXXM_{XX} 或 MZZM_{ZZ})。
  • 逻辑 S 门:基于晶格手术和 ∣Yˉ⟩|\bar{Y}\rangle 测量实现的非横向相位门,采用 Gidney (2024) 的就地 Y 基测量协议。

创新点和贡献

1. 多粒度噪声模型的标准化接口

FTPrimitiveBench 将噪声规范从 “全局均匀” 扩展至 “每组件、每轮次” 的粒度,使同一组逻辑原语电路可以在不同噪声假设下复现。这为跨研究组的公平比较提供了基础设施。论文将均匀去极化模型和 SI1000 模型作为该接口的特例回收,同时开放了自定义硬件校准剖面的接入路径。

2. 揭示逻辑原语对结构化噪声的差异化响应

论文通过系统性评估发现,同一噪声结构对不同逻辑原语产生质性不同的影响(第 5 节)。这纠正了仅依赖逻辑内存基准来推断整体容错架构性能的局限性。关键发现包括:

  • Z 偏置下非对称码片的优势在内存和晶格手术中显著,但在 Hadamard 门中被消解(因为 Hadamard 交换 X/Z 通道,不保留偏置)。
  • 测量偏置下,晶格手术的 LER 最小化所需轮数随偏置因子向上漂移,揭示时间冗余作为架构旋钮的重要性。
  • 非均匀噪声下,只要解码器先验与实际每组件错误率匹配,表面码对空间和时空异质性具有较强鲁棒性。

3. 解码器性能与噪声结构的耦合关系

在 Z 偏置噪声下的解码器比较(第 5.1.2 节)表明,关联匹配(correlated MWPM)相对非关联匹配的优势在去极化噪声(η=1\eta=1)下最大,随着偏置增强(η=100\eta = 100)而缩小。这是因为关联匹配利用的 YY 类型错误(同时触发 X 和 Z 型探测器)的概率 pY∝1/ηp_Y \propto 1/\eta 随偏置增加而减小(图 5)。

4. 促进硬件–软件协同设计

FTPrimitiveBench 的输出格式直接兼容 Stim 仿真器和现有解码器生态,其噪声接口可驱动外部电路生成工具的输出。这使框架可用作协同设计的基础设施:同一设备校准剖面可驱动跨原语、跨码字、跨解码器的评估。

实验结果分析

逻辑内存:偏置噪声下的码距非对称策略

在 Z 偏置噪声(η∈{10,100}\eta \in \{10, 100\})下,矩形码片(dZ>dXd_Z > d_X)的选择对 X 基和 Z 基内存产生显著非对称影响(图 4)。X 基内存受 Z 型故障链限制,增大 dZd_Z 直接抑制主导故障通道;Z 基内存则受益于 pX=pY=O(p/η)p_X = p_Y = O(p/\eta) 的抑制。然而,即使调整长宽比,也无法完全恢复均匀去极化下的基对称性。

Hadamard:偏置优势的中和效应

横向 Hadamard 在 Z 偏置噪声下的表现与内存截然不同(图 8):X 基和 Z 基实验的 LER 曲线保持接近对称,即使 η=100\eta = 100。增大 dZd_Z 的收益被显著减弱,因为 Hadamard 层在中途交换了错误基。这使 Hadamard 成为一个关键的反例——偏置噪声的优势不仅取决于码几何,还取决于逻辑操作的结构。

晶格手术:多重噪声维度的叠加

晶格手术暴露了合并边界处的额外故障位置,这些位置也受偏置和测量噪声影响。在测量偏置下,晶格手术 LER 最小化的轮数随偏置因子增大而向上漂移——从 η=1\eta=1 时的 t⋆≈dt^{\star} \approx d 到 η=5,10\eta=5, 10 时明显更大的值(图 13)。这意味着测量主导的硬件不仅缩放逻辑错误率,还改变了逻辑原语最优调度策略。

非均匀噪声:表面码的鲁棒性边界

无论空间扰动还是时空扰动,在 σ∈{0.1,0.5,1}\sigma \in \{0.1, 0.5, 1\} 范围内,相对 LER 始终保持在均匀去极化基线的约 ±20%\pm 20\% 以内(图 7、10、15、18)。只要解码器先验与每组件实际错误率匹配,表面码对中等强度的校准异质性具有明显鲁棒性。论文指出,较小码距下观察到的低于基线的波动可能是单次扰动抽取的采样随机性所致,取平均后有望平滑。

实践建议

1. 根据硬件偏置特征调整码片几何

如果目标硬件的噪声呈现明显的 Z 偏置(如超导量子比特中的退相位主导),应将表面码片设计为非对称的 dZ>dXd_Z > d_X。这可将更多保护分配至主导的 Z 型故障通道。但如果逻辑电路中包含大量横向 Hadamard 操作,这种几何优势会被部分中和,需在编译阶段考虑偏置保留的调度策略,或考虑使用 XZZX 码等偏置感知替代方案。

2. 测量噪声主导平台需调整症状提取轮数

在读取错误率远高于门错误率的硬件上(如当前某些超导平台中测量操作错误率可达门错误的 5 倍以上),不应机械地使用 t=dt = d 的轮数惯例。应通过仿真扫描确定使 LER 最小化的最优轮数——论文表明该最优值会随测量偏置因子的增大而向上漂移,额外的轮数可补偿不可靠读取带来的症状信息损失。

3. 解码器选择应与噪声结构匹配

在接近去极化的噪声环境中(η≈1\eta \approx 1),关联匹配解码器相对非关联匹配的优势明显,应优先采用。然而,当噪声强烈偏置(η≫10\eta \gg 10)时,YY 型错误极少,两者的性能差距缩小,此时使用计算成本更低的非关联解码器可能更具性价比。建议在实际部署前通过 FTPrimitiveBench 在目标噪声剖面下对比两种解码器的相对 LER。

4. 利用 idling 噪声建模优化电路调度

FTPrimitiveBench 的空闲噪声通道基于实际门持续时间和 T1/T2T_1/T_2 参数计算,而非采用名义门错误率。这意味着不同的症状提取调度方案(如 CNOT 顺序、门并行度)会产生不同的空闲暴露时间,进而影响逻辑错误率。在硬件—软件协同设计中,应利用这一特性评估调度方案对 idling 累积错误的影响,选择使总空闲时间最小化的电路调度。

5. 校准异质性不必过度优化

论文结果表明,在解码器先验与每组件错误率匹配的条件下,表面码对每量子比特级别的校准异质性(σ≤1\sigma \leq 1)具有较强鲁棒性。这为硬件团队提供了实用指导:追求极致的量子比特间均匀性改进的边际收益可能有限,资源可优先配置至降低整体平均错误率或改善最差几个量子比特的性能。