用于生成模型输出正确性与错误性评估的 E 值分数

E-Scores for (In)Correctness Assessment of Generative Model Outputs

arXiv: 2510.25770v1

论文信息

标题: E-Scores for (In)Correctness Assessment of Generative Model Outputs

作者: Guneet S. Dhillon, Javier González, Teodora Pandeva, et al.

发布日期: 2025-10-29

arXiv ID: 2510.25770v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决如何为生成模型(特别是大语言模型)的输出提供一种灵活、统计上可靠的不正确性(incorrectness)评估机制,避免传统 p 值方法在事后选择容忍度时产生 “p 值操纵” 问题。
  • 核心方法:利用 e 值(e-values)生成 “e 分数”(e-scores),为每个模型输出附上一个衡量其可能不正确的评分,用户可以在观察 e 分数之后再自由调整容忍度,同时仍能通过一个叫 “尺寸扭曲”(size distortion)的概念来严格控制错误率。
  • 关键结果:作者证明,e 分数能够为事后任意选择的容忍度提供错误概率的上界(即控制尺寸扭曲),从而在数学事实正确性和属性约束满足两类任务上有效评估大语言模型输出(见论文理论证明和实验部分)。
  • 主要局限:论文未详细讨论 e 分数构造的计算代价,且实验仅覆盖了两种特定类型的正确性判断;其统计保证依赖于合适的 e 变量构造,普适性仍有待更多场景验证。
  • 适合读者:从事生成模型可信度评估、统计假设检验、共形预测(conformal prediction)以及电子值(e-value)理论的研究人员与工程师。

论文背景和研究动机

生成式模型,尤其是大语言模型(LLM),在内容生成、对话、代码编写等任务中应用广泛,但其输出常包含事实性错误、逻辑矛盾或违反特定约束。如何量化并保证输出 “不正确” 的概率不超过用户可接受的水平,是可靠部署这些模型的关键。此前,基于共形预测框架的方法通过构造一组响应的集合,使得集合中包含错误响应的概率被控制在预设的容忍度 α\alpha 之下。这类方法的核心是 p 值:如果一个候选输出经检验得到的 p 值小于 α\alpha,则它被视为错误响应被排除在集合外,从而使最终集合的错误率得到保证。

然而,p 值方法存在一个致命弱点:容忍度 α\alpha 必须在观测数据之前固定,否则会导致 “p 值操纵”(p‑hacking)。在实践中,用户往往希望在看到模型的输出或 p 值之后,再根据实际需求调整 α\alpha(例如,对于一些高风险场景选择更严格的容忍度,而对低风险场景放宽要求)。这种事后选择会破坏 p 值方法的统计保证,使理论上承诺的错误率控制失效。

针对这一痛点,论文提出了用 e 值替代 p 值来度量生成模型输出的不正确性。e 值是近年统计假设检验和 “随时有效”(anytime-valid)推断中兴起的概念,具有天然的抗操纵性质。通过将 e 值与生成模型的输出绑定,作者定义了 e 分数(e‑score),它允许用户在观察到所有 e 分数之后,再动态地选择容忍度,并且错误率的上界依然可以通过一个称为 “尺寸扭曲” 的量得到保证。这一方案为生成模型输出的不正确性评估提供了前所未有的灵活性与严谨性。

核心方法和技术细节

要理解 e 分数的运作方式,首先需要回顾 p 值和 e 值的基本区别。对于检验某个输出是否错误的原假设,p 值是在原假设成立时,观察到当前统计量或更极端情况的概率。其有效使用要求事先设定显著性水平 α\alpha。一旦事后挑选 α\alpha,真实错误率可能远高于名义水平。

e 值则是非负随机变量,且在原假设下其期望值不超过 1。形式上,对于输出 yy 的错误性原假设 H0H_0,定义一个 e 变量 EE,满足 EH0[E]≤1\mathbb{E}_{H_0}[E] \le 1。e 变量可以看作是反对原假设的证据权重——EE 越大,反对 H0H_0 的证据越强。重要的是,多个 e 值可以经过自愿停止、组合等操作后,仍然保持对错误率的控制,这天然支持事后灵活分析。

论文从生成模型评估的角度,为每一个可能的输出 yy 构造一个 e 分数 E(y)E(y)。这些 e 分数由某种基础检验统计量转化而来,例如,利用模型自身的概率分布或外部知识库可以定义一个非负鞅过程,在输出正确时其期望被约束,而在输出不正确时倾向于给出较大的 e 值。作者将这一过程封装为一个 “e 分数函数”,它可以在不预设容忍度的情况下,赋予每个输出一个连续的错误程度评分。

当用户得到一组输出以及对应的 e 分数后,可以任意选择一个容忍度阈值 τ\tau,然后对所有 e 分数大于 1/τ1/\tau 的输出打上 “可能错误” 的标签。这个决策规则的统计性质由 “尺寸扭曲” 刻画:尺寸扭曲定义为事后选择的阈值所对应的真实错误发现率与名义水平 α\alpha 之间的最大可能差距。论文从理论上证明,无论用户如何根据观察到的 e 分数选择 τ\tau,错误发现率的上界总能被一个只依赖于 e 分数和 τ\tau 的函数所控制(即尺寸扭曲有界),从而避免了 p 值的事后操纵问题。

更具体地,设用户最终决定将 e 分数超过 cc 的输出判定为错误,则单次检验的错误概率不超过 1/c1/c。这是因为由 Markov 不等式,PH0(E≥c)≤E[E]/c≤1/cP_{H_0}(E \ge c) \le \mathbb{E}[E]/c \le 1/c。于是,如果将 cc 看作 1/α1/\alpha,那么相当于控制了水平 α\alpha。用户可以查看所有 e 分数后再设定 cc,这一定律仍然成立,因为 Markov 不等式对任何非负变量和阈值都成立,且不要求预先固定 cc。这正是 e 分数能够在事后提供灵活保证的数学基础。为了处理多次比较,论文进一步将 e 分数通过某种合并策略(如平均)控制家庭错误率(FWER)或错误发现率(FDR),详细的合并方法和理论分析在论文的方法论部分给出。

创新点和贡献

该工作的核心创新在于,将 e 值及其抗操纵的统计性质引入生成模型输出的不正确性评估,提出了 e 分数这一全新度量工具。相较于传统基于 p 值的共形预测,其贡献体现在三个层面:

  1. 事后容忍度选择的灵活性:e 分数解除了容忍度必须预先固定的限制,允许用户在全面观察评估结果后,再根据应用场景的风险偏好选择阈值。这种灵活性在工程系统中尤为重要,因为模型的输出质量和错误后果会随上下文动态变化。

  2. 严格的尺寸扭曲控制:论文不仅给出了 e 分数保证错误发现率上界的直观解释,还通过 “尺寸扭曲” 量化了事后选择容忍度可能带来的最大误差放大程度,从理论上证明了方法的可靠性。这是 p 值方法无法实现的。

  3. 面向生成模型的统一评估框架:e 分数可与任意能生成非负鞅序列的检验方法结合,从而适配不同类型的正确性评价,如事实一致性、语法规则遵守、安全性约束等。论文在数学事实正确性和属性约束满足两种任务上进行了实验验证,展示了框架的通用性。

实验结果分析

实验部分旨在验证 e 分数方法在真实大语言模型输出评估中的可行性和灵活性。作者选择了两种具有代表性的正确性类型:

  • 数学事实正确性:要求 LLM 生成的数学陈述(如算术表达式、定理叙述)内容无误。评估中,e 分数的构造可能基于外部数学知识库或一致性检验,将输出的可信度转化为 e 分数。
  • 属性约束满足:给定某些输出必须遵守的约束(例如,生成的商品描述必须包含特定关键词,或代码片段必须通过类型检查),通过判断约束是否被满足来生成 e 分数。

实验结果表明,e 分数能够有效地区分正确与错误输出,并且在用户根据需要调整容忍度后,实际的错误发现比例始终被理论边界所约束。论文未给出具体的数值对比表格,但通过不同阈值下的错误控制曲线,直观展示了尺寸扭曲的有界性。这说明,即使采用最悲观的事后阈值选取策略,所引入的额外错误率也在可接受范围内。实验还定性地比较了 e 分数和 p 值方法在事后灵活性上的差异,突显了 e 分数在需要人工介入或动态风险控制的场景中的优势。

实践建议

对于需要在工程系统中落地该方法的团队,以下建议可供参考:

  1. 将 e 分数集成到 LLM 输出后处理管线中:在不改变模型本身的情况下,可以构造一个独立的 e 分数计算模块。该模块接收模型原始输出,并基于业务需要的正确性标准,输出每个候选结果的 e 分数(或 e 分数向量)。用户界面或下游决策逻辑可以根据这些分数实时决定是否采纳、人工复核或丢弃输出,而无需担心事后选择阈值导致的统计保底失效。

  2. 活用事后调整阈值的特性实现动态风险控制:在部署阶段,不同业务场景或不同用户对错误的容忍度可能不同。应用 e 分数后,系统可以暴露一个可调的风险滑块,背后对应不同的 e 分数阈值 cc。用户移动滑块时,系统立即筛选出 e 分数低于 cc 的 “相对可靠” 输出,同时保持对总体错误率的控制。这种设计已在论文中以尺寸扭曲有界的形式得到保障。

  3. 合理构造 e 变量以获得高功效:Markov 不等式给出的上界 1/c1/c 在某些情况下可能较为保守。为了使 e 分数在实践中具有高判别力,应精心设计基础检验统计量,使 e 变量在错误输出上的取值尽量大,同时严格满足原假设下期望不大于 1 的约束。可以结合领域知识(如知识图谱校验、逻辑约束证明)或利用模型的置信度、集成不确定性等信号来构造更灵敏的 e 分数。

  4. 注意计算开销与可扩展性:虽然论文没有深入讨论,但 e 分数的产生可能涉及额外的推理或验证步骤(例如调用外部求解器进行数学证明)。对于高吞吐量的在线服务,应考虑异步计算或缓存策略,避免显著增加延迟。同时,对于多约束场景,可以采用多个 e 分数的合并策略,平衡统计保证与计算效率。