量子 Rényi 熵与 Tsallis 熵的近似样本最优估计器

Nearly Sample-Optimal Estimators for Quantum Rényi and Tsallis Entropies

arXiv: 2608.18070v1

论文信息

标题: Nearly Sample-Optimal Estimators for Quantum Rényi and Tsallis Entropies

作者: Kean Chen, Qisheng Wang

发布日期: 2026-08-18

arXiv ID: 2608.18070v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决量子 Rényi 熵和 Tsallis 熵估计的样本复杂度缺口,即在给定维数 dd 和加性误差 ε\varepsilon 时,构造更接近理论下界的估计器。
  • 核心方法:对 0<α<10<\alpha<1,用 Bures χ2\chi^2-散度层析和新的矩阵不等式估计 tr⁡(ρα)\operatorname{tr}(\rho^\alpha);对非整数 α>1\alpha>1,用随机纯化、Hayashi POVM 和多个批量大小的线性组合消除偏差。
  • 关键结果:在 0<α<10<\alpha<1 时,Rényi 熵估计器达到 O(d1+1/α/ε1/α+d1/α−1/ε2)O(d^{1+1/\alpha}/\varepsilon^{1/\alpha}+d^{1/\alpha-1}/\varepsilon^2) 样本数;非整数 α>1\alpha>1 时,Rényi 熵估计器达到 O(d2/ε1/α+d1−1/α/ε2)O(d^2/\varepsilon^{1/\alpha}+d^{1-1/\alpha}/\varepsilon^2),均与已知下界在多对数因子内匹配(见定理 1.1 与表 1)。
  • 主要局限:所有上界只在多对数因子内最优,未消除 polylog⁡(d,1/ε)\operatorname{polylog}(d,1/\varepsilon) 差距;非整数 α>1\alpha>1 的 Tsallis 熵不在本文处理范围内。
  • 适合读者:从事量子信息论、量子统计推断、理论计算机科学,特别是量子态熵估计与样本复杂度分析的研究者。

论文背景和研究动机

经典信息论中,Shannon 熵、Rényi 熵和 Tsallis 熵的估计已经形成了较完整的样本复杂度图景。但在量子情形下,给定未知 dd 维量子态 ρ\rho 的独立副本,估计

SαR(ρ)=11−αlog⁡tr⁡(ρα),SαT(ρ)=11−α(tr⁡(ρα)−1)S_\alpha^R(\rho)=\frac{1}{1-\alpha}\log \operatorname{tr}(\rho^\alpha), \qquad S_\alpha^T(\rho)=\frac{1}{1-\alpha}\bigl(\operatorname{tr}(\rho^\alpha)-1\bigr)

时,核心量都是 Fα(ρ)=tr⁡(ρα)F_\alpha(\rho)=\operatorname{tr}(\rho^\alpha)。

论文指出,此前对 0<α<10<\alpha<1,Rényi 熵的上界为 O(d2/α/ε2/α)O(d^{2/\alpha}/\varepsilon^{2/\alpha}),Tsallis 熵也类似;而 Wang (2026) 给出的下界为 Ω~(d1+1/α/ε1/α+d1/α−1/ε2)\widetilde{\Omega}(d^{1+1/\alpha}/\varepsilon^{1/\alpha}+d^{1/\alpha-1}/\varepsilon^2)(Rényi)和 Ω~(d1+1/α/ε1/α+d2−2α/ε2)\widetilde{\Omega}(d^{1+1/\alpha}/\varepsilon^{1/\alpha}+d^{2-2\alpha}/\varepsilon^2)(Tsallis)。上下界之间存在明显缺口。对非整数 α>1\alpha>1,Rényi 熵的前人上界为 O(d2/ε2)O(d^2/\varepsilon^2),下界为 Ω~(d2/ε1/α+d1−1/α/ε2)\widetilde{\Omega}(d^2/\varepsilon^{1/\alpha}+d^{1-1/\alpha}/\varepsilon^2),精度高时差距也很大。该论文的目标就是闭合这些缺口,至少在多对数因子意义上达到最优。

核心方法和技术细节

1. 对 0<α<10<\alpha<1:Bures χ2\chi^2-散度与层析

该部分核心是一个新的偏差不等式(论文第 2.2.2 节 Lemma 2.6):若 0<α<10<\alpha<1,且 σ⪰dnI\sigma \succeq \frac{d}{n}I,则

0≤(1−α)tr⁡(σα)+αtr⁡(ρσα−1)−tr⁡(ρα)≤(dn)α−1Dχ2(ρ∥σ).0 \le (1-\alpha)\operatorname{tr}(\sigma^\alpha) +\alpha\operatorname{tr}(\rho\sigma^{\alpha-1}) -\operatorname{tr}(\rho^\alpha) \le \left(\frac{d}{n}\right)^{\alpha-1}D_{\chi^2}(\rho\|\sigma).

这里 Dχ2(ρ∥σ)D_{\chi^2}(\rho\|\sigma) 是 Bures χ2\chi^2-散度。这个不等式提示:如果把 (1−α)tr⁡(σα)+αtr⁡(ρσα−1)(1-\alpha)\operatorname{tr}(\sigma^\alpha)+\alpha\operatorname{tr}(\rho\sigma^{\alpha-1}) 作为 tr⁡(ρα)\operatorname{tr}(\rho^\alpha) 的估计,偏差由 Dχ2(ρ∥σ)D_{\chi^2}(\rho\|\sigma) 控制。

为了获得小的 Bures χ2\chi^2-散度,论文使用 Pelecanos 等 2026 年提出的 Bures χ2\chi^2-散度层析算法 TomoBuresχ2\mathsf{TomoBures\chi^2}(论文 Lemma 2.2)。给定 nn 个 ρ\rho 样本,它输出 ρ^\hat\rho,并构造

σ=ρ^+2dnI.\sigma=\hat\rho+\frac{2d}{n}I.

论文 Lemma 2.5 证明在层析成功事件 EE 下,σ⪰dnI\sigma\succeq \frac{d}{n}I,且

Dχ2(ρ∥σ)=O(d2n).D_{\chi^2}(\rho\|\sigma)=O\left(\frac{d^2}{n}\right).

于是估计器(Algorithm 1)分两部分:(1−α)tr⁡(σα)(1-\alpha)\operatorname{tr}(\sigma^\alpha) 可直接从已知 σ\sigma 计算;αtr⁡(ρσα−1)\alpha\operatorname{tr}(\rho\sigma^{\alpha-1}) 则在 σ\sigma 的本征基下测量 ρ\rho,得到随机变量 X=sJα−1X=s_J^{\alpha-1},用 mm 个样本取平均。论文详细分析了 XX 的二阶矩(Lemma 2.9),并据此选择 nn 和 mm。对于 Rényi 熵,需要相对误差,因此通过 Fact 1.2 把加性误差 δ=1−e−(1−α)ε\delta=1-e^{-(1-\alpha)\varepsilon} 转换为熵误差 ε\varepsilon。

2. 对非整数 α>1\alpha>1:随机纯化、Hayashi POVM 与偏差消除

这一侧采用完全不同的构造。论文先通过随机纯化信道 Λpur(s)\Lambda_{\mathrm{pur}}^{(s)}(Lemma 3.2)把 ρ⊗s\rho^{\otimes s} 变成其随机纯态 ∣ψρ⟩⊗s\lvert\psi_\rho\rangle^{\otimes s} 的期望。然后对纯态批量运行 Hayashi 的协变 POVM(Definition 3.3),得到输出 ∣v⟩\lvert v\rangle。论文 Lemma 3.6 表明,在选定相位后,输出可以写作

∣v⟩=1−T ∣ψ⟩+T ∣G⟩,\lvert v\rangle =\sqrt{1-T}\,\lvert\psi\rangle+\sqrt{T}\,\lvert G\rangle,

其中 T∼Beta⁡(d2−1,s+1)T\sim \operatorname{Beta}(d^2-1,s+1),GG 在 ψ⊥\psi^\perp 的单位球上均匀分布,且 TT 与 GG 独立。设 ρ^=tr⁡anc∣v⟩⟨v∣\hat\rho=\operatorname{tr}_{\mathrm{anc}}\lvert v\rangle\langle v\rvert,批量估计为 Ys=tr⁡(ρ^α)Y_s=\operatorname{tr}(\hat\rho^\alpha)。

利用 Schatten 范数的多线性展开(Lemma 3.8)和随机方向 GG 的矩估计(Lemma 3.9),论文 Lemma 3.4 证明

E[Ys]=F+∑j=1kcj(ρ) μj(s)+Rs,\mathbb{E}[Y_s] = F+\sum_{j=1}^{k}c_j(\rho)\,\mu_j(s)+R_s,

其中 k=⌈α⌉−1k=\lceil\alpha\rceil-1,μj(s)\mu_j(s) 是 Beta 分布的 jj 阶矩,Rs=O(F(d2/s)α)R_s=O(F(d^2/s)^\alpha),且系数 cj(ρ)c_j(\rho) 均满足 ∣cj(ρ)∣=O(F)|c_j(\rho)|=O(F)。

Algorithm 4 使用 k+1k+1 个不同批量大小 sℓ=2ℓms_\ell=2^\ell m,构造线性组合

F~=∑ℓ=0kaℓYsℓ,\widetilde{F}=\sum_{\ell=0}^{k}a_\ell Y_{s_\ell},

并选择系数 aℓa_\ell 使得

∑ℓ=0kaℓ=1,∑ℓ=0kaℓ μj(sℓ)=0(1≤j≤k).\sum_{\ell=0}^{k}a_\ell=1,\qquad \sum_{\ell=0}^{k}a_\ell\,\mu_j(s_\ell)=0\quad (1\le j\le k).

这样,偏差中的低阶 Beta 矩项全部抵消,只剩 O(F(d2/m)α)O(F(d^2/m)^\alpha) 的余项。论文 Lemma 3.5 同时控制方差,最终通过选取

m=Θ ⁣(Kα(d2θ1/α+d1−1/αθ2)),θ=1−e−(α−1)ε,m=\Theta\!\left(K_\alpha\left(\frac{d^2}{\theta^{1/\alpha}} +\frac{d^{1-1/\alpha}}{\theta^2}\right)\right), \qquad \theta=1-e^{-(\alpha-1)\varepsilon},

得到 Rényi 熵的定理 3.1。

创新点和贡献

论文的主要贡献不是简单改进常数,而是给出了与下界几乎匹配的样本复杂度。表 1 的对比可以清楚看到:对 0<α<10<\alpha<1,前人的单项上界 O(d2/α/ε2/α)O(d^{2/\alpha}/\varepsilon^{2/\alpha}) 被替换为两项形式,其中 ε\varepsilon 的指数从 2/α2/\alpha 降到 1/α1/\alpha 或 22,具体取决于误差项;尤其对 0<α≤1/20<\alpha\le 1/2,样本复杂度直接成为 O(d1+1/α/ε1/α)O(d^{1+1/\alpha}/\varepsilon^{1/\alpha})。对非整数 α>1\alpha>1,Rényi 熵的样本复杂度从 O(d2/ε2)O(d^2/\varepsilon^2) 改善到 O(d2/ε1/α+d1−1/α/ε2)O(d^2/\varepsilon^{1/\alpha}+d^{1-1/\alpha}/\varepsilon^2),在高精度下 ε\varepsilon 的指数从 2 降至 1/α1/\alpha。

技术上,论文第 1.1 节强调,先前工作多基于 weak Schur sampling,而本文的估计器建立在新的 Bures χ2\chi^2-散度不等式和特定量子态层析上。对 α>1\alpha>1,论文给出了 Hayashi 纯态估计算法结合随机纯化技术的偏差消除分析。论文还将新上界与 Wang (2026) 的下界对照,指出所有结果在 dd 和 1/ε1/\varepsilon 的多对数因子内匹配。这是本领域较完整的样本复杂度刻画之一。

局限与待解决问题

首先,本文的上界是 O~(⋅)\widetilde{O}(\cdot) 意义下的,仍有 polylog⁡(d,1/ε)\operatorname{polylog}(d,1/\varepsilon) 因子未被消除。因此不能写成严格的 Θ\Theta 或最优常数。

其次,论文只对 0<α<10<\alpha<1 给出了 Tsallis 熵的新上界;对非整数 α>1\alpha>1 的 Tsallis 熵,论文没有提供新结果。表 1 显示该区域已有 Chen 和 Wang 的 Θ~(1/ε2/(α−1))\widetilde{\Theta}(1/\varepsilon^{2/(\alpha-1)}) 或 Θ~(1/ε2)\widetilde{\Theta}(1/\varepsilon^2) 结果,因此不在本文闭合缺口的目标范围内。类似地,整数 α≥2\alpha\ge 2 的 Rényi 熵和 Tsallis 熵已有最优复杂度,论文未覆盖。

第三,算法涉及 Bures χ2\chi^2-散度层析、Hayashi POVM 和随机纯化信道。这些原语在理论上可行,但论文只讨论样本复杂度,未分析电路深度、门复杂性或物理实现细节。对于实际量子设备,常数因子和实现成本可能会显著影响适用性。

最后,层析成功概率设为至少 0.990.99,最终置信度通过联合成功事件给出。论文中的常数依赖 α\alpha 和通用常数 CC,但未给出显式数值。实际算法调参时需要根据具体 α\alpha、dd 和 ε\varepsilon 重新确定这些常数。若要进一步推进到严格最优或给出实用估计器,这是需要继续处理的问题。