基于平衡态的可微分连续变量热力学计算蓝图
A Blueprint for Equilibrium-Based Differentiable Continuous-Variable Thermodynamic Computing
论文信息
标题: A Blueprint for Equilibrium-Based Differentiable Continuous-Variable Thermodynamic Computing
作者: Owen Lockwood, Jérémy Béjanin, Joost Bus, et al.
发布日期: 2026-07-17
arXiv ID: 2607.16183v1
PDF 链接: 下载 PDF
3 分钟速览
-
研究问题:这篇论文要解决什么 传统数字计算机在机器学习任务中能耗高、延迟大,且硬件与概率计算的需求不匹配。作者提出一种通过物理器件中的热噪声直接实现能量模型采样的热力学计算范式,以期从根本上升级计算能效。
-
核心方法:用什么办法解决 以朗之万动力学描述的物理系统为基础,设计可参数化的能量函数(如双阱、高斯势),将热平衡态自然地表达为吉布斯分布。通过在超导电路上构造 “热力学神经元” 并组合成概率图模型,实现采样、条件推断与可微训练。
-
关键结果:最重要的一个结论或数字 实验实现了超导可调双阱热力学神经元,并测量到低温下的量子隧穿逃离能量恒为 (约对应 193 mK),而理论预期的交叉温度仅 46–76 mK,表明器件的实际损失特性与简化模型存在约 3 倍的偏差(见论文第 VIII 节图 13(c) 及相关讨论)。
-
主要局限:作者自己承认的、或方法本身固有的限制 超导硬件仍面临大规模校准、控制串扰与连续读出困难等工程挑战;实验测得的逃离能量与理论预测之间差距较大;目前仅展示了单元级验证,距离完整的热力学计算系统尚有距离(见论文第 IX 节)。
-
适合读者:什么背景的人值得读 对概率机器学习、神经形态计算、超导电路或物理计算感兴趣的研究者、硬件工程师,以及关注后摩尔时代计算能效突破的从业者。
论文背景和研究动机
当前机器学习负载对算力的需求急剧膨胀,数字计算机的可逆操作需要将随机涨落排出系统外,这一过程消耗大量能量。与此同时,现代算法(如蒙特卡洛采样、扩散模型、对比散度训练)又必须在软件层面重新注入随机性——“先由硬件消除噪声,再在算法里人工制造噪声” 的悖论被作者称为算法锁定(algorithmic lock-in)。随着摩尔定律放缓,继续压制物理熵而不是利用熵的思路难以持续。
热力学计算(thermodynamic computing)正是为了解开这一矛盾:利用物理系统固有的热涨落作为计算资源,使概率推断和基于采样的学习能被硬件原生实现。该范式特别适合能量模型(energy‑based models, EBMs),因为 EBMs 的吉布斯分布与热平衡态数学形式完全一致。如果能在物理衬底上直接构造可控的能量势能并让它自然热化,就可能大幅提升采样和训练的速度与能效。
论文希望为这一方向提供一个完整蓝图,从基本原理、元素势能设计、图形模型构建到超导硬件实现,给出自下而上的方法论。
核心方法和技术细节
物理朗之万动力学的计算原理
热力学计算的核心是一个物理系统在热浴中演化到底态的过程。作者以欠阻尼朗之万方程描述每个自由度的位置 和动量 :
其中 是可调控的势能, 是阻尼系数。在热平衡下, 的联合分布为吉布斯分布 ,而对位置边际分布即得到 ,这正是 EBM 的基本形式。因此,只要在物理硬件上精确搭建 ,就可以等价地实现 EBM 采样。
元素势能与可微计算
论文将计算操作转化为势能的设计,提出几类基础模块:
- 高斯势 ,用于实现变量的定位与钳位。
- 双阱势 ,通过调节倾角 控制粒子出现在左或右阱的概率,实现类似 sigmoid 的非线性。当 时,期望值 ,其中 来自与其他自由度的耦合。
- 耦合势 ,允许两个振荡器以可控强度相互作用,达到样本保持或均衡功能。
- 多体势,例如标为 的势,在硬约束极限下其期望收敛到 softmax。
利用这些势能,可以将矩阵乘法、向量加法、softmax、层归一化等操作表达为硬件可执行的平衡采样。更重要的是,作者推导了基于协方差的梯度规则:
使得反向传播也能靠硬件采样完成,而不依赖数字仿真(见论文第 IV A 节)。
概率图模型与 “热力转换器”
单模块势能进一步组合成因子图(factor graph),可表示有向或无向概率图模型,例如高斯图模型、高斯混合模型、隐马尔可夫模型和连续伊辛模型。论文以 “Thermoformer” 为例,将变换器解码器中的自注意力、残差连接和前馈结构全部映射为热力学计算图,从理论上论证了在超导参数下 tokens per joule 有望显著优于 H100(见论文第 VII E 节图 9)。
创新点和贡献
- 完整的热力学计算蓝图:从朗之万动力学出发,将概率机器学习中常见的采样、推断、训练操作统一到物理能量势能的设计与组合上,同时给出热化时间和功的估计方法。
- 可微性与端到端训练:提出基于协方差的梯度估计器,使得在模拟‑数字混合系统或全物理片上都能实现可微学习,并探讨了 Born‑Oppenheimer 近似下片上自然梯度下降的可能。
- 超导硬件验证:在铝基超导芯片上实现了可调双阱热力学神经元,通过测量逃离能量随温度的变化,首次观察到从量子隧穿到热激活行为的过渡(见图 13(c)),为后续耦合系统打下基础。
- 广泛的模型覆盖:展示了一系列连续变量概率图模型(包括高斯图模型、伊辛模型、HMM、Transformer)如何由基本势能构建,表明该框架的表达能力足以支撑现代机器学习架构。
实验结果分析
实验部分聚焦于超导热力学神经元的动态特性。器件由并联的约瑟夫森结、电感和电容构成,等效为一个在双阱势能中运动的 “流量粒子”。作者通过脉冲控制瞬间降低势垒高度并倾斜阱,使粒子初始化到单侧阱中,然后恢复势垒,再测量粒子在不同势垒高度和温度下从一侧阱到另一侧阱的逃逸速率。
对于每一个温度,逃逸率 随势垒高度 对数下降,符合 Arrhenius 直线(见论文第 VIII 节图 13(b))。由斜率提取的逃离能量 在 9–60 mK 区间几乎恒定,平均 ,表明量子隧穿主导;温度高于 100 mK 后 近似线性增加,但斜率仅为 ,低于理论热噪声的 ,并且在 165 mK 以上出现饱和。作者认为,这可能是准粒子密度上升导致电阻减小、阻尼变化所致,同时参数拟合的大不确定性也会影响定量解释(论文第 VIII C 节)。
尽管存在偏差,数据清晰地区分了量子与热激活区间,成功证明了基于热噪声的物理计算是可控且可测量的。
实践建议
对于有志于将热力学计算引入实际系统的工程团队,本工作给出以下指导:
- 优先采用因子图架构:硬件连接性可能受限时,可以通过增加隐变量来补偿稀疏连接,并采用分块训练策略,先独立训练局部因子,再联合做全局微调。
- 梯度计算的硬件‑软件协同:在早期阶段,可采用混合模式:硬件负责采样与协方差统计,外部处理器完成矩阵求逆或参数更新。当估算振荡器技术成熟后,可逐步将 Fisher 信息矩阵的构建与自然梯度下降片上化。
- 超导器件的设计要点:控制串扰和准粒子损失是确保势能精确可控的关键。建议在电路仿真中纳入实测的 依赖关系,并设计多路复用方案以降低控制线数量。
- 评估实际能效时需包含冷却开销:本文给出的 tokens per joule 预测仅考虑芯片上的能量消耗。团队在规划系统级能效时,需要将稀释制冷机或脉冲管制冷机的功率纳入整体热预算,并考虑使用高 材料(如铌)来提高工作温度。
- 从边缘应用切入:先以低精度概率推理、贝叶斯优化等对噪声容忍度高的任务作为试点,逐步积累硬件调试经验,再扩展至大型语言模型等高性能场景。
通过上述策略,研发者可以稳步将热力学计算从单元验证推进到系统原型,验证其在实际机器学习流水线中的能效优势。