通过归一化流进行含冗余参数的无似然推断

Likelihood-free inference with nuisance parameters through normalizing flows

arXiv: 2609.10534v1

论文信息

标题: Likelihood-free inference with nuisance parameters through normalizing flows

作者: Phil Assheton

发布日期: 2026-09-09

arXiv ID: 2609.10534v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:在存在讨厌参数时,如何只依赖样本生成器或模拟器,自动学习一个近似枢轴统计量,用于频率学派 pp 值推断。
  • 核心方法:把条件 normalizing flow 分解为 “枢轴网络 zpz_p” 和 “讨厌网络 zn\mathbf{z}_n”,其中 zpz_p 只接受兴趣参数,zn\mathbf{z}_n 吸收剩余讨厌方向;训练使联合输出接近标准正态,并惩罚不可逆雅可比。
  • 关键结果:在 Behrens-Fisher 实验中,NeuralCIs 比 Welch 检验有更好的最坏情况误报率,功效差异不到 0.1 个百分点(论文图 2);在偏双列相关实验中,其 size-adjusted 功效平均比 profile LR 方法高约 1.2 个百分点(论文图 3、图 4)。
  • 主要局限:当前要求统计量维度等于参数维度 nx=nθn_{\mathbf{x}}=n_{\boldsymbol{\theta}},且只支持标量兴趣参数;只鼓励局部可逆,不保证全局微分同胚;参数采样边界问题仍待修复。
  • 适合读者:关注模拟器推断、频率学派统计、normalizing flows,以及机器学习与统计推断交叉方向的研究者和工程人员。

论文背景和研究动机

在存在讨厌参数时,频率学派推断的理想目标是构造相似检验:检验的 size 不随讨厌参数变化。经典例子是单样本 tt 检验,它通过枢轴量消去方差 σ2\sigma^2 的影响。但对一般参数模型,寻找严格枢轴量往往很困难。

现有通用方法各有代价。Profile likelihood ratio 依赖大样本下的 χ2\chi^2 近似,有限样本可能偏离名义水平。参数 bootstrap 更灵活,但计算成本高,且其分布来自 MLE 而非真实参数。近年来,基于深度神经网络的似然无关推断受到关注。例如,Louppe 等人在《Learning to pivot with adversarial networks》中通过对抗训练同时追求对兴趣标签的预测力和对讨厌参数的不变性。Dalmasso 等人的 LF2I 框架则把学习到的统计量进一步映射为 pp 值或置信区域。

本文提出的 NeuralCIs 属于 “摊销推断” 路线:训练一次网络后,可快速为同一问题族中的新样本生成 pp 值。该工作尤其想解决的核心问题是:能否不显式构造似然,直接从一个被分解的 normalizing flow 中自然涌现近似枢轴量。

核心方法和技术细节

本文的关键结构是把条件 normalizing flow 分解为两个网络(论文第 3 节):

zp(x;ψ(θ)):Rnx+1→R,zn(x;θ):Rnx+nθ→Rnx−1.z_p(\mathbf{x};\psi(\boldsymbol{\theta})):\mathbb{R}^{n_{\mathbf{x}}+1}\to\mathbb{R}, \qquad \mathbf{z}_n(\mathbf{x};\boldsymbol{\theta}):\mathbb{R}^{n_{\mathbf{x}}+n_{\boldsymbol{\theta}}}\to\mathbb{R}^{n_{\mathbf{x}}-1}.

zpz_p 只知道兴趣参数 ψ(θ)\psi(\boldsymbol{\theta}),不知道全部讨厌参数;zn\mathbf{z}_n 则接收完整参数 θ\boldsymbol{\theta}。两者输出拼接为 z=(zp,zn)\mathbf{z}=(z_p,\mathbf{z}_n),训练目标是把 z\mathbf{z} 推向标准正态分布,同时最大化原样本空间的对数密度。由于 zpz_p 不能直接依赖讨厌参数,因此为了让整个映射在参数变化下仍把 z\mathbf{z} 标准化,zpz_p 被迫吸收掉讨厌参数的影响,从而近似枢轴化。

为保证 zpz_p 与 ψ\psi 的方向一致,作者还加入约束 ∂zp/∂ψ<0\partial z_p/\partial \psi<0,避免网络在训练中翻转或折叠兴趣参数方向(论文第 3.1 节)。推理时,将 zpz_p 通过标准正态 CDF 转成单尾 pp 值 v=Φ(zp)v=\Phi(z_p),再用 2min⁡(v,1−v)2\min(v,1-v) 得到双尾 pp 值。

该方法还支持先验不变性信息(论文第 5.1 节)。如果模型在群 GG 作用下保持不变,可以先做 canonicalization,把 x\mathbf{x} 和 θ\boldsymbol{\theta} 变换到同一轨道代表点,再输入网络。这降低输入维度,同时扩展适用域。单样本 tt 检验是典型示例:通过位置和尺度不变性,网络输入可降至零维,雅可比仍然通过参数侧流入。该工作还支持把样本量等 “已知值” 作为额外条件输入(论文第 5.2 节)。

网络设计上,隐藏层采用带 Hadamard 乘积和 layer-norm 的形式:

fϕ(i)(i)(x)=σ(x⊙(W(i)x+b(i)))+x,f^{(i)}_{\phi^{(i)}}(\mathbf{x})=\sigma\left(\mathbf{x}\odot(\mathbf{W}^{(i)}\mathbf{x}+\mathbf{b}^{(i)})\right)+\mathbf{x},

其中 σ\sigma 为 layer-norm。相比普通全连接层,乘法项可以更直接地建模输入之间的交互(论文第 5.4 节)。

创新点和贡献

本文的主要贡献不是提出完整的新推断框架,而是给出了一种简单但有效的流分解方式。与 Louppe 等人的对抗式枢轴学习不同,NeuralCIs 不显式加入保留 ψ\psi 信息的损失,而是依靠维度匹配和全秩传输假设,让 zn\mathbf{z}_n 吸收讨厌方向后,剩下的 zpz_p 自然携带纯 ψ\psi 信息(论文第 4.3 节)。

论文第 4.2 节通过 KL 链式法则说明,在 zn\mathbf{z}_n 足够灵活、能高斯化条件分布后,训练目标近似最小化 EθDKL(Zp∥N1)\mathbb{E}_{\boldsymbol{\theta}}D_{\mathrm{KL}}(Z_p\|\mathcal{N}_1)。由于 KL 对双射变换不变,等价于最小化 pp 值对均匀分布的平均 KL 散度。这不是逐点最坏情况控制,而是一种平均意义下的校准。

另一个有价值的贡献是把群不变性直接嵌入 normalizing flow 的 canonicalization 中。对变换模型,作者在附录 C 中论证 profile LR 是极大不变量函数,而 zpz_p 的自然目标正是同一极大不变量。因此 NeuralCIs 在变换模型中与 profile LR 有内在联系。对于非变换模型,作者延伸出 “近变换模型” 的启发式论证,并在 LAN 极限下展示三者趋于一致。

实验结果分析

在单样本 tt 检验中,非 canonicalized 模型与经典 tt 检验的单尾 pp 值差异在 99.5% 样本中小于 0.0020;canonicalized 模型则小于 0.0012(论文图 1)。这表明网络几乎重新发现了 tt 检验枢轴量。

在 Behrens-Fisher 问题中,NeuralCIs 的 pp 值误报率更集中,最坏情况误差低于 Welch 检验;功效差异不到 0.1 个百分点,略偏 NeuralCIs(论文图 2)。需要强调,该结论来自论文设定的方差比受限范围,并非所有参数空间。

在偏双列相关实验中,样本量范围为 n=20n=20 到 100。与 χ2\chi^2 profile LR 相比,NeuralCIs 的误报率更接近名义水平,且平均 size-adjusted 功效高约 1.2 个百分点(论文图 3)。与 bootstrap LR 相比,两者 size 都集中在名义值附近,但 NeuralCIs 平均功效仍高 1.2 个百分点(论文图 4)。按样本量拆分后,优势集中在中小样本,尤其是 n=30n=30 至 5050 时,平均功效优势约 3 个百分点(论文图 5)。

计算成本差异明显:在论文第 7.3 节的比较中,profile LR 相关流程生成约 50 万个 pp 值耗时 39 小时,而 NeuralCIs 独立模拟生成 100 亿个 pp 值仅需 15 分钟(论文第 7.3 节)。

在玩具模型上,250 次随机初始化中,243 次最终 smoothing 后 UU-proportion 低于 10−510^{-5};7 次稍高,但继续训练后也收敛(论文第 7.4 节与附录 D.3)。这支持 “zpz_p 倾向于只依赖极大不变量” 的隐式偏置观点。

实践建议

如果要在工程中复现或使用 NeuralCIs,首先应优先利用可用的群不变性。论文中的 tt 检验和 Behrens-Fisher 案例表明,canonicalization 后不仅能提升 pp 值精度,还能极大扩展参数可行域,减少训练所需覆盖范围。

其次,当前版本最适合统计量维度等于参数维度的低维问题。若你的模拟器输出高维统计量,需要先降维或等待作者扩展至 nx>nθn_{\mathbf{x}}>n_{\boldsymbol{\theta}} 的版本。只支持标量兴趣参数,如果需要置信区域或向量兴趣参数,现阶段只能多次训练或自行扩展。

第三,训练阶段需要特别关注参数采样范围。论文附录 D.1 承认边界处采样仍有不足,因此实际部署时不要直接信任训练范围之外的 pp 值。建议先在目标参数区域做独立校准模拟,尤其是尾部误报率。

第四,该方法强调摊销收益:初期训练可能需数小时,但推理极快。适合需要大量重复推断的场景,例如批量模拟器实验、在线诊断或实时分析。同时,训练完成后应以标准化基准问题(如 tt 检验)验证网络是否收敛到可用状态。

最后,如果计划在资源受限环境下使用,可关注作者后续计划中提到的 free-form flows 方法,以降低雅可比计算带来的 O(nx3)\mathcal{O}(n_{\mathbf{x}}^3) 成本(论文第 8.2 节)。项目代码可在 GitHub 仓库 查看。