测量大语言模型评估中的所有噪声

Measuring all the noises of LLM Evals

arXiv: 2512.21326v1

论文信息

标题: Measuring all the noises of LLM Evals

作者: Sida Wang

发布日期: 2025-12-24

arXiv ID: 2512.21326v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:这篇论文要解决大语言模型(LLM)评测中如何有效分离信号与噪声的问题,尤其关注多种噪声来源的精准定义与测量。
  • 核心方法:他们将噪声分解为预测噪声(同一问题上的回答波动)、数据噪声(题目抽样波动)和总噪声,利用全方差定律,并提出 “全对配对”(all-pairs paired)方法,在所有模型对上测量这三种噪声成分。
  • 关键结果:每个评测基准都具有高度可预测的总噪声水平,且配对预测噪声通常大于配对数据噪声(例如 MATH500 上预测噪声大约是数据噪声的 2 倍)。
  • 主要局限:实验仅覆盖正确性评测,尚未在其他类型评测上验证;小样本情况下的估计可能存在偏差;未考虑可能影响较大的聚类校正。
  • 适合读者:LLM 研发人员、评测基准设计者、需要为实验结果提供统计学严谨性的工程师和研究者。

论文背景和研究动机

在实验科学中,把信号从噪声里剥离出来是核心任务。可是在 LLM 评测这个新兴领域,常规统计方法往往被忽略,或者被误用。许多研究只是简单地报告模型在某套固定题目上的平均准确率,并配上基础的置信区间,但这些区间通常很宽,无法可靠地区分相近的模型,也掩盖了噪声的真实结构。

论文作者指出,LLM 的评测噪声有三个不同面向。第一是 “预测噪声”:同一个模型对同一个问题多次生成答案时,结果会有波动,尤其在推理、代码生成等任务上,这种波动相当可观。第二是 “数据噪声”:如果换一组等价的题目,哪怕模型能力没有变化,平均分数也会上下起伏。然后是两者的总噪声。在这些噪声中,预测噪声可以被多次采样并平均来降低,但数据噪声无法靠增加答题次数削减,只能通过扩大题量来减轻。可惜在常规实验中,研究人员往往只用一次预测,且忽略了配对比较带来的方差缩减。

因此,这篇工作的动机很明确:把噪声来源拆清楚,给出实用的测量方法,并基于大规模实验找到可泛化的规律,从而让实践者在不需要定制测试的情况下,就能评估显著性,并在可控实验中检测远更小的效应。

核心方法和技术细节

噪声的形式化分解

设模型 AA 在问题 xx 上的评测结果为 A(x,ϵ)A(x,\epsilon),其中 ϵ\epsilon 是控制生成随机性的种子。全方差定律(law of total variance)给出了下面的分解:

Varx,ϵ[A(x,ϵ)]=Varx[Eϵ[A]]⏟数据方差+Ex[Varϵ[A]]⏟预测方差\mathrm{Var}_{x,\epsilon}[A(x,\epsilon)] = \underbrace{\mathrm{Var}_{x}[\mathrm{E}_{\epsilon}[A]]}_{\text{数据方差}} + \underbrace{\mathrm{E}_{x}[\mathrm{Var}_{\epsilon}[A]]}_{\text{预测方差}}
  • 总方差 Varx,ϵ[A]\mathrm{Var}_{x,\epsilon}[A] 反映先随机抽一道题、再随机生成一个答案的整体波动。
  • 数据方差 Varx[Eϵ[A]]\mathrm{Var}_{x}[\mathrm{E}_{\epsilon}[A]] 是题目本身难度差异带来的波动,它不能通过在一道题上生成更多次回答来减少。
  • 预测方差 Ex[Varϵ[A]]\mathrm{E}_{x}[\mathrm{Var}_{\epsilon}[A]] 则完全由模型在固定题目上的答案多样性造成,可以通过多次采样求平均来降低。

在比较两个模型 AA 和 BB 时,同样可以对差值 A−BA-B 应用全方差定律,得到配对数据的三种方差成分。这正是论文分析方法的核心。

全对配对方法

为了有效估计这些分量,作者提出了 “全对配对” 策略:在所有模型对 (A,B)(A,B) 上计算配对的总方差、数据方差和预测方差,而不是仅与某个固定基线比较。这样做既能避免 “用单一基线错误地代表所有模型对” 的陷阱(见论文例 4),又能从大量比较中提炼出评测基准本身的噪声特征。

论文给出了基于多次预测的样本估计公式(见表 1 和表 2)。特别地,当每个问题只有少量样本 KK(如 K=5K=5)时,直接估计会引入不可忽视的偏差,他们使用了小 KK 校正项,使得即使在 KK 很小时也能得到较准确的数据方差估计(见图 3)。具体来说,需要从平均预测的方差中减去 1K−1E^xVar^ϵ[AˉK]\frac{1}{K-1}\hat{\mathrm{E}}_x\hat{\mathrm{Var}}_\epsilon[\bar{A}_K],否则数据方差的相对误差会高得无法接受。

与其他经典方法的等价性

论文还证明,他们基于样本直接估计方差的方法,与经典的 bootstrap 和符号检验(sign test)在实质上是一致的,都归结于计算胜率差异的方差。不同之处在于,直接估计法能进一步拆出预测噪声和数据噪声,这对判断是否可以通过平均来显著提高统计功效至关重要。

创新点和贡献

本工作的创新不仅在于提出了清晰的噪声分类,更重要的是通过大规模实证揭示了两个具有实操价值的规律。

可预测的总噪声:对于某个正确率评测基准,所有模型对的总噪声(标准误差)都可以由一个仅依赖于模型准确率 pAp_A 的 Beta 理论模型很好地预测:SE⁡[A−B]≈N−1/2pA(1−pA)\operatorname{SE}[A-B] \approx N^{-1/2}\sqrt{p_A(1-p_A)}(图 1 左)。这意味着,实践者只要知道模型准确率和题目数 NN,就能对显著性有一个可信的初步判断,无需每次都做定制的统计测试。

预测噪声通常大于数据噪声:在多个评测和温度设置下,配对预测标准误通常比数据标准误大得多。比如在 MATH500 上,预测标准误是数据标准误的约 2 倍(见图 1 右)。这带来的直接好处是:通过对同一道题做多次预测并取平均,可以把预测噪声大幅压低,从而检测出原来被淹没的小效应。在控制实验中(例如同一个检查点出发的训练曲线比较),预测噪声可以进一步用连续多个训练步骤的预测平均来降低,将数据标准误压缩到预测标准误的 1/6 左右,从而使可检测的最小效应尺寸缩小数倍(见例 2)。

论文还有几个重要贡献:给出了 numpy 风格的实现指南,使得方法可以直接被集成到评测流程中;在评估噪声成分时验证了与 bootstrap 和符号检验的一致性;公开了涵盖多个评测、多种温度下数百万次题目级预测的分析网站,让其他研究者可以查询噪声曲线并自行验证。

实验结果分析

论文基于 SWEbench-Verified、MATH500、CRUXEval 等多个评测数据集,通过收集公开发布排行榜的详细预测结果,以及专门的控制实验,对全对配对噪声进行了系统测量。

在图 4 的热力图中,可以看到:虽然不同模型的整体准确率差异明显,但相似准确率的模型在单个题目上的表现也高度相关,这正是配对方法能显著减少数据噪声的直观原因。

在图 1 的散点图中,总标准误与准确率的关系在多个评测上都吻合 Beta 理论预测。例如在 SWEbench-Verified 上,每个模型只用一次预测,总标准误基本落在预测曲线上;在 MATH500 上,即使区分出数据噪声和预测噪声,总噪声也依旧由 Beta 模型解释,且预测噪声占据主导。

图 5 进一步展示了温度对噪声成分的影响:在 CRUXEval 上,温度为 0.8 时预测噪声远大于数据噪声,而温度为 0.2 时数据噪声反而更大,但总噪声基本不变。这提示我们,降低温度虽然可能减少干扰,但不会改变总噪声水平,因而对增加统计功效帮助有限,关键还是要用平均来压制预测噪声。

作者也诚实指出了少数例外:在可猜测性高的评测(如 MMLU)上,当模型表现接近随机水平时,总噪声偏离 Beta 预测;一些使用确定性过滤器而非真实采样的模型会形成离群点;以及分布式推理框架的某些设置可能使预测过于确定性。

实践建议

基于以上发现,论文给出了一套分层建议,供评测构建者、模型开发者和社区参考。

1. 评测构建者:可以利用全对配对方法预先测量并公布自己评测的噪声曲线(总噪声、数据噪声、预测噪声)。这样一来,提交模型的团队就可以直接根据准确率反查对应的标准误,而在大多数实验中甚至不需要自己再做复现式的统计推断。网站 all-the-noises.github.io 已经提供了可交互的噪声查询。

2. 模型开发者:如果发现在自己关心的评测上预测噪声显著大于数据噪声,那么强烈建议使用 “期望准确率” 指标——即对每个题目做多次预测取平均,而不是只猜一次。在缺乏多份预测数据时,可以使用作者给出的启发式公式 SE⁡[A−B]≈SE⁡[A]\operatorname{SE}[A-B] \approx \operatorname{SE}[A] 来预估显著性。若要进行更严格的受控实验,可以直接采用论文中的 numpy 估计代码测量自身场景中的噪声分量,以便更精确地确定所需的平均次数。

3. 多评测元分析:面对日益增多的评测排行榜,论文提出将每个评测上的 zz 分数 zi=(Aˉ−Bˉ)/SE⁡[A−B]z_i = (\bar{A} - \bar{B}) / \operatorname{SE}[A-B] 进行加权合并,比如用 wi=1w_i = 1 表示每个评测等权重,或用 wi=Ni1/2w_i = N_i^{1/2} 表示每个题目等权,从而得到一个综合的元 zz 分数 zˉ\bar{z}。这种方式比简单平均准确率更严谨,也能更直观地呈现跨评测的一致性。

4. 注意适用边界:如果目标是追求最终的最优单次表现(如多数投票、验证器重排等),则应使用最佳预测(best-of-K)或 pass@K 指标,而不是期望准确率。但即便在这种情况下,了解预测噪声的大小仍然有助于判断哪种策略的提升是统计上可靠的。当模型差异极小时,就算用期望准确率也会检测出显著差异,此时还需结合独立的效果量标准来判定实用性。

总体而言,这篇论文为 LLM 评测的噪声分析提供了完整的工具包和可复用的经验规律,让研究人员可以把更多精力放在改善模型本身上,而不必每次都被无法量化的随机波动所困扰。