基于平衡的可微连续变量热力学计算蓝图

arXiv: 2607.16183v1

论文信息

标题: A Blueprint for Equilibrium-Based Differentiable Continuous-Variable Thermodynamic Computing

作者: Owen Lockwood, Jérémy Béjanin, Joost Bus, et al.

发布日期: 2026-07-17

arXiv ID: 2607.16183v1

PDF 链接: 下载 PDF

研究背景:突破数字计算的 “热力学枷锁”

当前,机器学习模型的训练与推理严重依赖数字计算芯片,其能耗和延迟问题日益突出。传统数字计算机的设计哲学是 “对抗物理”——通过精密工程消除随机热涨落,确保逻辑操作的确定性。然而,现代算法却在软件层面大量 “重新引入” 随机性:蒙特卡洛采样、噪声梯度、基于采样的推理等。这种硬件与算法之间的根本性错配,被本文作者称为 “算法锁定”,它导致巨大的效率损失,尤其是在处理概率模型时。为此,论文提出了一套全新的热力学计算框架,主张不再对抗自然,而是主动利用物理系统中的热涨落作为计算资源,从而实现更自然、更高效的概率计算。

核心方法:从朗之万方程到能量基热力学计算

该计算范式的物理基础是朗之万动力学。考虑一个包含 DD 个自由度的物理系统,其运动方程可描述为欠阻尼朗之万方程:

dxi=pimidt,dpi=(Uθ(x)xi+γimipi)dt+2γiβdWt(i),d x_i = \frac{p_i}{m_i} dt,\qquad dp_i = -\left(\frac{\partial U_\theta(\mathbf{x})}{\partial x_i} + \frac{\gamma_i}{m_i}p_i\right)dt + \sqrt{\frac{2\gamma_i}{\beta}}\,dW_t^{(i)},

其中 Uθ(x)U_\theta(\mathbf{x}) 是可调的能量势,γi\gamma_i 为阻尼系数,2γi/β\sqrt{2\gamma_i/\beta} 确保满足涨落-耗散定理。该方程对应的稳态分布恰为吉布斯分布

πθ(x)=eβUθ(x)Zθ.\pi_\theta(\mathbf{x}) = \frac{e^{-\beta U_\theta(\mathbf{x})}}{Z_\theta}.

这正是能量基模型(EBM)的定义。因此,若能设计物理硬件使其具有可控的能量景观 UθU_\theta,并让系统在热涨落下自然热化至平衡,则硬件的平衡态采样可直接用来执行概率推理与学习。这种 “物理采样” 有望在时间和能耗上远超数字模拟的朗之万采样。

构筑计算基元:从单粒子势到可微程序

论文将热力学计算分解为若干基元势能的组合,包括:

  • 高斯势(单势阱):Uθsw(x)=12σ(xμ)2U_\theta^{\text{sw}}(x) = \frac{1}{2\sigma}(x-\mu)^2,可用于 “夹持” 变量和线性操作。
  • 双势阱势Uθdw(x)=λ1x2(x1)2λ2xU_\theta^{\text{dw}}(x) = \lambda_1 x^2(x-1)^2 - \lambda_2 x,通过调节倾角实现类似 sigmoid 的非线性响应,其期望值可逼近逻辑激活函数。
  • 耦合势:如 Uθc(x,y)=λ(t)(xy)2U_\theta^{\text{c}}(x,y) = \lambda(t)(x-y)^2,可实现振荡器间的信息传递和 “采样保持”。

通过这些基本模块,可以构建矩阵-向量乘、向量加、softmax 等运算的期望值等效形式。例如,利用多体势能

Uθsoft(x,z)=λ1ixi2(xi1)2ixizi+λ2(ixi1)2,U_\theta^{\text{soft}}(\mathbf{x},\mathbf{z}) = \lambda_1\sum_{i}x_i^2(x_i-1)^2 - \sum_i x_i z_i + \lambda_2\Big(\sum_i x_i - 1\Big)^2,

λ1,λ2\lambda_1,\lambda_2\to\infty 极限下,E[x]\mathbb{E}[\mathbf{x}] 逼近 softmax 函数。由此,可堆叠形成热力学深度神经网络甚至 Transformer 架构(称为 “Thermoformer”)。

梯度计算方面,论文推导了基于协方差的规则。对于参数 θj\theta_j,期望 E[y]\mathbb{E}[\mathbf{y}] 的导数为:

E[y]θj=Cov ⁣(y,Eθ(yx)θj),\frac{\partial \mathbb{E}[\mathbf{y}]}{\partial \theta_j} = -\text{Cov}\!\left(\mathbf{y}, \frac{\partial E_\theta(\mathbf{y}|\mathbf{x})}{\partial \theta_j}\right),

这使得反向传播仅依赖硬件采样即可估计,无需外部数字模拟,为片上学习提供了基础。

创新贡献:热涨落作为资源,平衡态作为计算

本工作的核心创新体现在以下几个层面:

  1. 完全拥抱随机性:传统方案(如某些 Ising 机或神经形态芯片)往往需要主动注入高斯噪声,而本文的硬件直接利用自然热涨落,理论上可使单次操作能耗接近兰道尔极限(kBTln2k_BT\ln 2)。
  2. 基于平衡态的通用计算框架:通过构建概率图模型(因子图),将复杂分布分解为局部能量函数的乘积,使得采样、条件推理、训练可在统一的图结构下进行。这种方法既适合单芯片的端到端采样,也支持多芯片的 Gibbs 采样协作。
  3. 可微性与片上自学习:论文提出尺度分离的 Born-Oppenheimer 近似,将模型参数视为慢变量,其受到的 “有效力” 恰为能量梯度的负期望——这恰好是 EBM 的对比散度学习信号。进一步,通过测量动量振荡器的协方差,甚至可以估计费舍尔信息矩阵,实现自然梯度下降,为全模拟自学习热力学芯片指明道路。
  4. 超导硬件验证:作者展示了基于铝超导电路的热力学神经元原型。该神经元由共面波导、dc-SQUID 和约瑟夫森结构成,可呈现可调双势阱。实验测量了不同温度下的弛豫速率,并提取逃逸能量 EescE_{\text{esc}}。结果表明,低温下 EescE_{\text{esc}} 恒定,对应量子隧穿;高于 100mK100\,\text{mK}EescE_{\text{esc}} 随温度线性增加,逐步进入热激活区,与理论预期一致。尽管受限于准粒子效应和参数校准,实验初步证实了利用热涨落进行可控弛豫的可行性。

实验分析与性能权衡

弛豫测量显示,势垒高度 ΔU\Delta U 与弛豫速率 Γ\Gamma 满足 Arrhenius 关系 Γexp(ΔU/Eesc)\Gamma \propto \exp(-\Delta U/E_{\text{esc}})。在热区域,Eesc=kBTE_{\text{esc}} = k_BT,表明热涨落是跃迁的主因。但论文指出,热化时间 τtherm\tau_{\text{therm}}ΔU\Delta U 指数增长,从而体现了计算速度与精度之间的基本权衡:高位垒使非线性函数更逼近理想形式(如 sigmoid),但大幅降低采样速度。通过增加并行采样的数目或利用期望值平均,可以灵活调节精度,而这是浮点运算做不到的。这种连续的精度调节能力是热力学计算的重要优势。

在能耗方面,论文估算在超导参数假设下,热力学计算的每焦耳可处理的 token 数量可能远超现有 GPU,但该预测未计入冷却和测量电路开销,需审慎看待。

应用建议与未来方向

基于文中给出的蓝图,热力学计算有望在以下方向发挥影响:

  • 概率生成模型:高斯混合模型、隐马尔科夫模型、Ising 模型等可在热力学硬件上得到高效训练和采样,特别适合异常检测、序列建模和组合优化。
  • 加速混合架构:将热力学芯片作为量子计算机或经典 GPU 的协处理器,例如用于量子纠错解码中的图形模型推理,或为扩散模型提供快速采样器。
  • 新型架构探索:热力学 Transformer 的模拟提示我们,可以设计完全基于物理的注意力机制,避免数字注意力中 O(n2)O(n^2) 的能量开销。未来工作需重点解决连续变量精确读取、多节点耦合的校准复杂度,以及提升工作温度(如采用铌基超导体)以简化制冷。

总结与展望

本文系统性地提出了基于平衡态可微连续变量热力学计算的理论与实践路线图。它将能量基模型、概率图模型、朗之万动力学和超导电路紧密结合,不仅给出了从基本势能到复杂模型的全栈设计,还初步验证了硬件基元的功能。其核心理念——变物理约束为计算资源——为后摩尔时代的高效能概率计算提供了富有远见的选择。若能在工艺扩展、室温操作或光学等替代物理平台上取得突破,热力学计算或将真正重塑人工智能的算力基础。