超越 10,000 光子的芯片级时空复用高斯玻色采样处理器
A Chip-scale Space-time Multiplexed Gaussian Boson Sampling Processor Beyond 10,000 Photons
论文信息
标题: A Chip-scale Space-time Multiplexed Gaussian Boson Sampling Processor Beyond 10,000 Photons
作者: Yu-Xuan Fu, He-Yu Shen, Ke-Ming Hu, et al.
发布日期: 2026-09-10
arXiv ID: 2609.11922v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何让高斯玻色采样从自由空间/光纤原理验证走向可工程部署,解决光学对准、相位稳定性和可编程性等规模化瓶颈。
- 核心方法:在薄膜铌酸锂芯片上单片集成高速电光调制器、片上延迟线和时空复用干涉网络,以 4 GHz 时钟运行高斯玻色采样。
- 关键结果:在最高泵浦功率下,单次采样最大点击数为 11,059;同一芯片还被重构为 GBS 驱动的世界模型,在 Kármán 涡街数据集上一步预测 MSE 低于 320 节点 ESN 均值。
- 主要局限:大规模输出主要通过小规模统计验证与损耗模型下的模拟复杂度估算支撑;光源与探测器尚未片上集成;世界模型仅在单一数据集上比较。
- 适合读者:量子光计算、集成光子学、量子优势基准和量子机器学习方向的研究者与工程人员。
论文背景和研究动机
高斯玻色采样是光子系统中展示量子计算优势的代表性范式之一,因为一般情况下精确评估其输出概率是 #P-hard 问题。近年已有多个自由空间或光纤实现,例如 Zhiyuan 和 Borealis 等时间域复用方案,在较小物理资源下构造了大规模等效干涉网络。然而,自由空间方案对光学对准和稳定性要求苛刻,光纤方案也受相位稳定性和空间资源利用限制。
更关键的是,经典模拟能力持续提升。Oh 等人的工作指出,高损耗会破坏 GBS 的经典不可模拟性,这使系统损耗成为更严格的约束。作者因此提出:必须走向芯片级集成,通过片上多层 Mach-Zehnder 干涉仪、热光和高速电光移相器,以及延迟环路的空时混合,从根本上解决可扩展性与可编程性。但芯片方案也要求同时满足低损耗、高精度和高速调制条件。
核心方法和技术细节
该系统名为 Zhiyuan 3.0,核心是一块薄膜铌酸锂芯片。片上集成多层 MZI 空间网络、热光移相器、高速电光调制器阵列和两个不同长度的延迟环路。多层 MZI 让光子在空间模式间演化,延迟环路连接不同时间 bin;借助热光和电光调制,网络可在空间和时间两个维度上被灵活重构。
压缩真空态注入芯片后,经过级联空时干涉结构生成大规模 GBS 态,最后进入超导纳米线单光子探测器进行采样。系统时钟率为 4 GHz,对应 250 ps 时间 bin 窗口;全套系统温度稳定在 0.01°C 以内。
制造上,该芯片基于 6 英寸 TFLN 晶圆:400 nm x-cut 铌酸锂层、4.7 μm 埋氧层,DUV 光刻和 Ar+ 刻蚀形成波导;SiO₂ 包层、TiN 加热器和金电极构成调制与移相结构。作者提到建立闭环工艺迭代周期约三周,以持续优化器件性能。关键器件指标包括:端面耦合器平均损耗 0.9 dB/facet(1550 nm 处)、MZI 消光比高于 35 dB、电光调制器半波电压 3.18 V、3 dB 带宽超过 67 GHz。
验证方法分成三层:小规模光子符合分布比较、二阶光子关联函数比较、以及贝叶斯模型置信度和贝叶斯计数器分析。世界模型部分则使用五路时间域复用 GBS 通道作为动力学引擎,结合线性读出预测 Kármán 涡街压力场五维区域均值。
创新点和贡献
该论文的主要贡献是首次在芯片尺度上实现时空复用高斯玻色采样,并且将高速电光调制器、片上延迟线和空时复用干涉网络单片集成在 TFLN 平台上。与此前自由空间和光纤方案相比,这一路线同时追求低损耗、高速调制和可重构性。
另一个贡献是把同一芯片重构为 GBS 驱动的世界模型。该模型利用光延迟线提供的 “光子原生时间记忆”,在 Kármán 涡街动力学预测任务中与经典回声状态网络对比。论文报告,在其评估段上,该量子模型一步 MSE 为 ,低于 320 节点 ESN 的均值 ,且可训练读出参数为 255 个,比 320 节点 ESN 的 1605 个减少 84.1%(见论文 Results 与图 4e)。这显示了该类硬件在采样基准之外的可编程应用潜力。
实验结果分析
实验在不同泵浦功率下得到总点击数的归一化概率分布。随着泵浦功率提高,分布整体向大光子数方向移动;在最高 300 mW 泵浦功率下,单次采样最大点击数为 11,059(见论文图 3a)。
小规模验证中,实验比较了 GBS、热光、相干光和 squashed spoofer 四种假设下的二阶关联函数。论文报告只有 GBS 假设对应的实验-理论点落在对角线上,其他三种模型明显偏离;单光子、双光子 bunching 和双光子 non-bunching 的保真度分别为 0.9978、0.9962 和 0.9911(见论文图 3b-c)。贝叶斯置信度分析显示,在 30 光子子系统上所有置信度分数均为正,且随子系统规模增加;贝叶斯计数器表明,随着样本累积,GBS 假设与 squashed spoofer 的可区分性持续增强。这些结果支持该实验输出在统计和模型层面与 GBS 一致。
关于经典模拟复杂度,论文在给定损耗假设下进行 MPS 数值评估:假设片上延迟线损耗为 、光纤延迟线损耗为 、空间损耗为 ,并取 10,000 时间步(即 模式)时,有效光子数 达到 117.9。在该组假设下,模拟一个 的 GBS 采样任务至少需要 年(见论文 Methods 的 Quantum advantage benchmark)。需要注意,这是基于数值假设和 A100 GPU FLOPS 基准的估算,而非实际完成的经典计算。
世界模型方面,在 Kármán 涡街测试段上,GBS 世界模型一步 MSE 为 ,低于 320 节点 ESN 均值;其误差也低于每个测试网络大小下 100 个 ESN 随机初始化中的最低误差。不过论文没有在更多数据集或更复杂动力学场景上验证,因此该结论目前限定于这一数据集和评估设置。
实践建议
对工程集成团队来说,下一步优先事项是压缩光源与探测器的片上集成,以及继续降低波导和耦合损耗。论文讨论中也提到,共封装光学、高速电读出和控制电路可能对规模化光子 QPU 有利。
对量子优势评估,建议采用多层级验证流程:小规模符合分布和光子关联函数用于统计一致性检查;贝叶斯置信度和计数器用于模型级鉴别;MPS 或更优经典算法用于模拟复杂度边界估算。单独的采样规模数字不足以支撑量子优势主张。
对应用探索,GBS 世界模型在参数效率上显示出有限但正面的信号。值得在低维物理场预测、小样本时序建模和物理储备池计算等任务上做更多受控比较。但应避免把单一数据集上的优势推广为通用 AI 优势,仍需在更多任务、更长预测时域和更强经典基线下验证。
对该芯片作为可编程平台,实践上可优先利用其光子原生时间记忆和高速重构能力,开发图问题、物理动力学建模和量子储备池计算等短中期应用,而不是把所有资源都投入更大规模采样竞赛。