何时"可能的答案"是正确的?——论大语言模型中的序列概率与正确性
When are likely answers right? On Sequence Probability and Correctness in LLMs
论文信息
标题: When are likely answers right? On Sequence Probability and Correctness in LLMs
作者: Johannes Zenn, Jonas Geiping
发布日期: 2026-06-25
arXiv ID: 2606.27359v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:大语言模型生成的序列概率与其正确性之间是否存在可靠的对齐关系?何时可以从高概率中推断出高正确性?
- 核心方法:在 4 个分析层级(跨解码方法、方法内超参数、数据集内样本、同提示词重复采样)上,对 14 个模型、6 个数据集、8 种解码方法进行大规模定量分析。
- 关键结果:数据集内的高概率样本往往更正确(正相关),但通过调整超参数或更换解码方法来提升序列概率,并不能可靠地提升正确性。
- 主要局限:实验受限于计算预算,全局解码方法采用近似实现,且仅覆盖特定模型家族;理论层面未能给出 “何时产生正相关” 的充分必要条件。
- 适合读者:从事解码策略设计、自信度聚合、无验证器自我提升的研究者与工程师,以及对 LLM 解码基本原理感兴趣的技术人员。
论文背景和研究动机
大语言模型本质上是自回归序列生成器,在推理时,解码方法的作用是从模型输出的概率分布中选择最终输出的文本。近年来,大量解码方法的设计思路可以归纳为 “将概率质量向模型认为更可能的输出倾斜”——无论是局部层面的低温采样、截断采样,还是全局层面的 Best-of-、束搜索、幂次分布采样。这一观察引出了一个根本性问题:模型赋予序列的高概率,是否意味着该序列更可能是正确的?
这个问题的答案具有双重意义。首先,它可以帮助解释在什么条件下特定的解码方法能真正提升模型性能,从而指导新方法的设计。其次,如果高概率确实预示高正确性,那么序列概率本身就可以成为 “无验证器样本筛选” 的内建信号,直接用于自一致性集成和自蒸馏等自我改进技术。
然而,先前的经验表明,这一关系并非想当然。束搜索作为接近全局最可能序列的方法,在诸多任务中反而会降低输出质量,这一现象已得到广泛记录。因此,问题的关键不在于是否存在一个笼统的概率-正确性关系,而在于在什么条件下两者能够对齐,以及哪些解码方法能够有效地利用这种对齐。
本文正是从这一视角出发,系统性地量化序列概率与正确性的关系。
核心方法和技术细节
论文将解码方法分为两个主要类别。局部解码方法在每个时间步独立地操作下一词元的分布,如低温采样通过引入温度参数 对条件概率进行锐化,截断方法通过 Top-、Top- 或 -采样限定采样范围。论文给出形式化推导,指出这类方法由于引入了路径依赖的局部归一化常数,通常无法等价于对全局序列概率的最大化。
全局解码方法则直接瞄准高概率序列。束搜索近似地寻找最大概率序列;Best-of- 从 个样本中选出序列概率最高的一个,当 时收敛到分布的众数;幂次分布 ()将采样概率按序列概率的 次方重新加权,从变分角度看它最大化 “期望对数概率 + 倍熵” 这一目标,因此可被视为一种与束搜索互补的软模式寻求机制。论文对 SPS 和 power-SMC 两种幂次采样近似算法的分析,被纳入了更一般的扭曲序列蒙特卡洛框架中。
分析框架的核心是四层相关度量:
- 数据集内相关:固定模型、数据集和解码方法,计算所有样本的对数概率与其二元正确性标签之间的 Pearson 相关及 Spearman 秩相关。
- 方法内相关:对给定方法,改变其核心超参数,观察对数概率与正确率的联动轨迹。
- 跨方法相关:以低温采样为基准,衡量不同方法(在其最佳超参数下)产生样本的概率与正确率相对基准的位移方向。
- 样本内相关:对同一条提示词进行多次独立采样,计算该组响应对数概率与正确性的样本级相关。
创新点和贡献
本文的首要创新在于其系统化的分解视角。它将过去散见于各论文的零散观察,统一到同一个分析框架下,并明确指出概率-正确性的对齐关系严重依赖于测量粒度。这一发现本身构成了一个元层面的贡献,为后续研究如何评估解码方法提供了新的评价维度。
第二个贡献是对全局和局部解码方法的统一形式化。通过提出幂次分布的变分目标和分析局部方法的非全局性,论文为理解各类方法的行为差异提供了理论支点,尤其是清晰阐述了为何低温采样并不等价于序列级幂次采样。
第三个贡献是对无验证器自我改进的现实约束给出了定量证据。论文发现数据集内相关性与模型在该任务上的平均准确率近似正相关,这意味着基于概率的自我提升循环可能需要模型本身具备一定程度的任务能力才能启动正向循环,这对自蒸馏等技术的应用边界具有啟示意义。
实验结果分析
数据集内相关性呈现出较为一致的模式。以 Qwen3-8B-Base 为例,在 SPS 采样下 MATH500 上的概率-正确性相关近乎完美(见图 2),GPQA、HumanEval、MedQA、MMLU 上也显示出正向但较弱的关联。值得注意的是,后训练模型与基座模型在 IFEval 上表现分化:后训练模型呈现弱正相关,而基座模型则出现大范围的负相关(见图 3),暗示预训练数据分布对 “概率即正确” 这一信号的塑造具有决定性影响。
方法内和方法间的结果则相当消极。方法内相关分析显示,改变超参数几乎总是能提升序列概率,但正确率却无规律可循:正相关与逆相关的个案数量大致相当(见图 4),不存在跨数据集、跨模型一致的收益模式。跨方法分析同样表明,即便由预言机选择各方法的最优超参数,也没有一种方法能够可靠地超越低温采样基准(见图 5)。许多全局方法确实能找到概率更高的序列,但这些序列的正确率却未必更高。
样本内相关进一步揭示了个体层面的高度不可靠性。对同一条提示词的多次采样中,对数概率与正确性的相关性呈对称分布,均值接近零(见图 8)。这解释了为何在自一致性加权时,使用序列概率作为投票权重反而往往劣于均匀多数投票(Finding 6)。唯一的例外是 MATH500,其样本内相关性平均为正。
幂次自一致性作为连接概率与聚合策略的直接尝试,在 MATH500 上带来增益,但在其他数据集上表现分化甚至退化(见图 10)。这一结果与数据集内、样本内的相关性强度恰好吻合,印证了前文的结论。
实践建议
对于解码方法的设计者和使用者,本研究的核心启示是放弃寻找 “通用最优解码器” 的幻想。不存在一种方法或一组超参数值能够一劳永逸地压过其他所有配置。实际部署中,解码策略与超参数的调优必须针对特定的模型、任务数据集,甚至具体到目标的输出格式。
对于希望利用序列概率进行无验证器自我提升的场景,本文给出了一条重要的安全准则:在模型对任务的平均准确率本身已经足够高的前提下,概率信号才更可能发挥正面作用。在模型能力较弱的任务上直接依赖概率加权的样本进行自我蒸馏或自我改进,可能会强化错误的模式。
最后,对于自一致性等答案聚合方法,论文建议优先考虑均匀投票而非概率加权投票,尤其是在任务本身尚不具备强正样本内相关性的情况下。对于数学推理这类概率-正确性对齐较好的特定领域,幂次分布采样的聚合策略仍有探索价值。