干预下有效选择性共形推断的部分因果结构学习

Partial Causal Structure Learning for Valid Selective Conformal Inference under Interventions

arXiv: 2603.02204v1

论文信息

标题: Partial Causal Structure Learning for Valid Selective Conformal Inference under Interventions

作者: Amir Asiaee, Kavey Aryan, James P. Long

发布日期: 2026-03-02

arXiv ID: 2603.02204v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:在干预实验(如基因扰动筛选)中,利用选择性共形预测可以获得更紧的不确定性区间,但需要识别哪些校准干预与测试干预交换同类。真实的因果结构通常未知,如何在不学习完整因果图的前提下保证预测覆盖的有效性?
  • 核心方法:作者提出δ-鲁棒选择性共形覆盖定理,量化了校准集污染对覆盖的影响,并将因果结构学习转化为仅估计干预-目标间 “是否受影响” 的二元标签任务,以减少复杂性。此外,设计了基于差异受影响集合交集的子孙发现算法和局部不变因果预测的距离估计方法。
  • 关键结果:定理给出显式边界 g(δ,n)=δn(1−δ)n+1g(\delta,n)=\frac{\delta n}{(1-\delta)n+1};在合成实验中,注入污染后,校正选择性 CP 在所有非零污染水平上保持了≥0.95 的覆盖,而未校正的覆盖从 0.905 降至 0.867(图 2)。
  • 主要局限:定理是最坏情况界,真实数据中代理 “受影类” 无法完美捕获交换性(代理 oracle 覆盖仅 0.864),校正方法在 60% 以下的评估中可行,且需要更大的校准集以提高适用性。
  • 适合读者:从事共形推断、因果发现、单细胞扰动数据分析,或希望在不完整因果知识下进行可靠不确定性量化的研究者。

论文背景和研究动机

干预性预测普遍存在于生物、医学等领域,例如基因扰动筛选中需预测某个基因在干预下的表达水平。共形预测能以分布无关的方式构建有限样本覆盖保证的预测区间,而选择性(或 Mondrian)共形预测通过限制校准集至与测试样本可交换的子集,进一步收紧区间。在因果框架下,若目标基因不是干预的因果后代,则干预与对照组可看作可交换,这样就能利用选择性校准。

问题在于因果图(尤其是子孙关系)通常未知。全图学习在高维下代价巨大且误差传播方式不明确。本文作者提出一个 “任务驱动” 的折衷:只需学习一种部分因果结构——对每一对 (a,i)(a,i) 判断干预 aa 是否影响目标 ii(即 Za,i=1Z_{a,i}=1),而不恢复整个网络。核心动机在于:选择性共形预测的覆盖损失直接由错误纳入非交换校准干预(假阴性)的比例 δ\delta 决定,因此校准的可靠性可以转化为二元分类任务中控制假阳性率。

核心方法和技术细节

δ-鲁棒选择性共形覆盖(定理 1)。假设有一组 “好” 校准干预(真正不受影响)与测试分数交换可交换,而选出的校准集中有部分误判为不受影响的 “坏” 干预。令 A^\widehat{\mathcal{A}} 为所选校准集,大小为 nn,其中真正好校准的数量为 mm,污染分数 δ=(n−m)/n\delta = (n-m)/n。定理 1 证明,使用所有 nn 个分数计算共形分位数时,覆盖概率下界为

P(Yi(a⋆)∈Ci,1−α)≥1−α−g(δ,n),g(δ,n)=δn(1−δ)n+1.\mathbb{P}(Y_{i}^{(a^{\star})}\in C_{i,1-\alpha}) \geq 1-\alpha - g(\delta,n),\quad g(\delta,n)=\frac{\delta n}{(1-\delta)n+1}.

这个下界不依赖污染分数的分布,对任意污染过程成立。当 δ=0\delta=0 时恢复精确的 1−α1-\alpha 覆盖。由此衍生出校正方法(推论 1):如果知道污染上界 δ^\hat{\delta},以 α′=α−g(δ^,n)\alpha' = \alpha - g(\hat{\delta},n) 为目标误覆盖率运行选择性 CP,就能保证 1−α1-\alpha 覆盖。当 α′≤0\alpha'\leq0 时区间退化为实直线,覆盖为 1。

任务驱动的部分因果学习。将因果学习转化为估计二元标签 Za,i=1{i∈desc(a)}Z_{a,i}= \mathbf{1}\{i\in \mathrm{desc}(a)\}。给定干预 aa 和目标 ii,只需错误判断 ii 不受影响(Za,i=0Z_{a,i}=0)却真实受影响的假阳性率,其直接影响 δ\delta。作者展示了 δ\delta、真阴性占比 π0\pi_0、假阳性率 FPRi_i 及假阴性率 FNRi_i 的关系,突出了保守策略的重要性:宁可错过一些真正不受影响的校准干预(增加 FNR),也应严格控制 FPR。

算法一:基于差异受影响集交集的子孙发现。输入为每个干预 aa 的差异受影响集 Sa\mathcal{S}_a(基因表达中即差异表达基因集)。识别 aa 的上游干预集合 U(a)={b:a∈Sb}\mathcal{U}(a)=\{b:a\in\mathcal{S}_b\},然后通过交集 Sa∩⋂b∈U(a)Sb\mathcal{S}_a \cap \bigcap_{b\in\mathcal{U}(a)}\mathcal{S}_b 估计后代集。其直觉是:如果 bb 是 aa 的上游,则 aa 的所有后代必然是 bb 的后代,所以真正的后代应出现在所有上游受影响集中,而虚假的后代则会被交集剔除。算法复杂度为 O(∣A∣2⋅p)O(|\mathcal{A}|^2\cdot p),但实际受稀疏性推动更为廉价。

算法二:局部 ICP 距离估计。利用不变因果预测(ICP)从目标基因 ii 回溯估计父节点集,通过逐层扩展生成近似路径长度 d^(a,i)\hat{d}(a,i)。这一距离可用于加权共形校准,实现硬阈值选择与池化方法之间的平滑过渡。

恢复条件。在因果忠实性和可检测性假设下,作者证明了交集候选集是真正后代集的超集(命题 1),且通过上游多样性假设可以控制假阳性率(命题 2),从而给出期望污染的上界(推论 2)。这些条件直接将因果结构学习的准确性与覆盖保证连接。

创新点和贡献

  1. δ-鲁棒覆盖定理首次将因果结构中的误分类错误有界地转化为选择性 CP 的覆盖损失,提供有限样本的显式下界,且不依赖于污染分布。
  2. 任务驱动的部分因果学习范式,将对完整图的学习降维至预测子孙二元标签,直接将分类性能(FPR)与覆盖损失挂钩,避免了全图学习的昂贵开销。
  3. 两种互补算法及对应的恢复条件,为高维干预数据提供了可扩展的求解方案,并证明了在适当条件下能有效控制污染。
  4. 从合成到真实数据的实证验证,清晰展示了定理预测的覆盖退化规律以及校正方法在真实 CRISPRi 扰动数据上唯一超越名义覆盖的表现。

实验结果分析

合成线性 SEM 实验(p=200p=200,A=150\mathcal{A}=150)中,使用差异表达检验产生 Sa\mathcal{S}_a 并应用交集算法后,估计的污染 δ^=0.018\hat{\delta}=0.018 极低,此时估计方法和池化方法表现接近(覆盖约 0.90)。然而,通过直接注入受影响的分数模拟污染(δ\delta 从 0 到 0.30),选择性 CP 覆盖从 0.905 单调降至 0.867,而校正方法在所有非零 δ\delta 下均达到≥0.95 覆盖(表 3,图 2),代价是区间宽度增大 1.2–1.8 倍。这一表现严格满足理论下界(图 3,补充材料)。

在真实的 Replogle K562 CRISPRi 数据中,采用 top 10% LFC 作为代理 “受影响” 集,代理 oracle 覆盖仅 0.864,低于名义值,反映出实际数据中非基因后代的影响和批次效应偏离交换性假设。校正方法覆盖 0.906,唯一超过 0.9,但因 α′\alpha' 严格,仅在 59.8% 的评估中可行区间(未退化为无穷)。假阴性控制的保守特性在此处体现明显:为了稳妥,更多检验目标被判为 “受影响”,导致可供校准的样本减少。

实践建议

  1. 保守的子孙分类策略。在面向选择性 CP 的分类器中,应更倾向于把不确定性案例标记为 “受影响”(增加 FNR),以严格控制 FPR。如公式所示,在稀疏网络中 π0\pi_0 较大时,简单的 “全部当作不受影响” 策略也可达到低 δ\delta,而配合交集算法可以进一步减少 δ\delta 并保持足够校准量。
  2. 利用污染上界手动校正。若通过恢复条件或交叉验证获得了污染上界 δ^\hat{\delta},可直接应用推论 1,将共形目标误覆盖设为 α′=α−g(δ^,n)\alpha'=\alpha-g(\hat{\delta},n),从而确保保守覆盖。当校准集较大(nn 大)或污染很低时,g(δ^,n)g(\hat{\delta},n) 小,区间宽度代价可控。
  3. 主动实验设计。结合基于距离的加权校准和交集算法,可以设计怎样的干预组合能更好地控制假阳性率和提高校准集质量?可以在小规模预实验中评估受影响集的重叠,优先选择那些具有高度上游多样性的干预,从而增强交集在消除虚假连接方面的能力(呼应恢复条件中的假设 3)。
  4. 真实数据场景下的谨慎应用。CRISPRi 真实数据表明,即使代理 oracle 也达不到名义覆盖,提示间接效应和批次效应的普遍存在。实践中可先通过代理进行鲁棒校正,若校正后的区间过于宽松或不可行,应考虑更灵活的加权共形策略(如核加权),将距离估计融入校准权重,避免硬阈值损失的校准样本。

通过将因果学习误差转化为预测覆盖的明确代价,论文为高维扰动数据分析中不确定性量化提供了一条可操作的路线:不必追求完美的图还原,只需在分类精度上达到对假阳性的严格控制,即可实现可靠的预测区间。