可能的答案何时正确?论大语言模型中的序列概率与正确性

arXiv: 2606.27359v1

论文信息

标题: When are likely answers right? On Sequence Probability and Correctness in LLMs

作者: Johannes Zenn, Jonas Geiping

发布日期: 2026-06-25

arXiv ID: 2606.27359v1

PDF 链接: 下载 PDF

论文背景与研究动机

大型语言模型在推理时的解码策略选择直接影响生成质量,但学术界对 “序列概率与正确性何时对齐” 这一根本问题一直缺乏系统性的量化分析。现有的解码方法——无论是低温度采样、Top-k 采样等局部方法,还是 Best-of-N、束搜索等全局方法——本质上都在将概率质量向模型认为更可能的输出方向倾斜。然而,实践中的矛盾现象让这一假设受到挑战:束搜索虽然近似找到最可能的序列,却经常导致性能下降和重复生成。

本文作者将上述问题系统化,提出了一个多层级分析框架,从跨方法、方法内超参数调节、数据集内样本间、以及同提示词重复采样这四个粒度层面,量化序列概率与正确性之间的关系。这一研究不仅有助于理解何时解码方法能真正提升性能,还为无验证器的自我改进方法提供了理论基础。

核心研究方法与技术框架

解码方法的概率最大化视角

论文从理论上区分了两类解码方法。局部方法(如低温度采样、Top-k、Top-p、ε-采样)在每个前缀位置独立修改下一个词元的分布,由于存在路径相关的局部归一化常数,它们一般不采样全局最优序列。全局方法则直接或间接地逼近序列级的概率最大化目标。

作者给出了一个优雅的变分解释:功率分布 pα(ssˉ)p(ssˉ)αp_{\alpha}(\mathbf{s} \mid \bar{\mathbf{s}}) \propto p(\mathbf{s} \mid \bar{\mathbf{s}})^{\alpha} 是变分目标 Jα(q)=Eq[logp(ssˉ)]+1αH(q)\mathcal{J}_{\alpha}(q) = \mathbb{E}_q[\log p(\mathbf{s} \mid \bar{\mathbf{s}})] + \frac{1}{\alpha} \mathcal{H}(q) 的最大化解,在期望序列对数概率与熵之间通过 α\alpha 参数进行权衡。当 α\alpha \to \infty 时,功率分布退化为序列分布的众数。

值得一提的是,局部低温度采样虽然形式上引入了类似的 α\alpha 锐化参数,但由于归一化常数 Z~α(sˉ,s<t)\tilde{Z}_{\alpha}(\bar{\mathbf{s}}, \mathbf{s}_{<t}) 随前缀变化,它通常不等价于全局功率采样。这一理论区分对理解不同方法的实际行为至关重要。

多层级相关性分析框架

论文的创新之处在于构建了四个层级的分析框架:

  • 数据集内相关性:固定方法,考察不同提示词-答案对之间序列概率与正确性的关系
  • 方法内相关性:固定方法,考察调节超参数时概率与正确性的变化趋势
  • 跨方法相关性:固定数据集和模型,比较不同方法及其最优超参数的表现
  • 样本内相关性:对同一提示词多次采样,考察响应间概率与正确性的关系

实验覆盖了 Qwen3、Qwen2.5、Olmo3 三个模型家族的 14 个模型变体(含基础版与后训练版),在 MATH500、GPQA、HumanEval、MedQA、MMLU、IFEval 六个基准上评估了八种解码方法。

关键实验发现

数据集内相关性:模型 “知道” 正确答案

研究发现,在固定数据集内,序列对数概率与正确性之间存在一致的关联,且这种关联主要由数据集和模型变体决定,而非解码方法。MATH500 展现了最强的正相关性,GPQA、HumanEval、MedQA 和 MMLU 也呈现正向但较弱的关联。唯一的例外是 IFEval,基础模型在此任务上呈现负相关,这或许反映了指令遵循任务在训练数据中占比有限。

更重要的是,后训练模型在多数任务上呈现一致的正相关,而基础模型的表现则更为参差。这表明后训练过程可能强化了模型对正确性的概率校准能力。

方法内与跨方法相关性:概率提升不保证正确性提升

当调节解码方法的超参数时,序列的对数概率几乎总是增加,但正确性却未必同步提升。在所有方法中,正向和负向相关的比例大致相当。局部方法出现逆向关系(概率更高但正确性更低)的情况更为频繁,这可以用局部归一化常数的存在来解释。

跨方法比较同样揭示了这一困境:许多方法确实能生成比低温度采样基线更高概率的序列,但这些序列并不必然更正确。没有一个方法能在所有数据集上稳定地超越基线。功率采样方法(SPS 和 power-SMC)虽然可靠地找到了更可能的序列,但其准确性优势主要集中在 MATH500 上。

样本内相关性:自一致性的启示

对同一提示词重复采样时,响应间的对数概率与正确性的相关性几乎对称地分布在零附近。只有 MATH500 显示出正向均值。这意味着基于概率加权的多数投票方法可能不如简单的均匀加权有效。然而,当提示词的多数响应本身已经正确时,样本内相关性会增强,这为 “模型能力越强,概率信号越可靠” 的现象提供了又一佐证。

实践应用建议

基于上述发现,可以提炼出以下实践指导:

解码器选择的务实原则:不存在一种放之四海皆准的最优解码方法。低温度局部采样虽然简单,但在多数任务上表现稳健,值得作为默认基线。对数学推理等特定任务,可考虑全局功率采样方法(如 SPS、power-SMC 与 Best-of-N)以获得额外收益。

超参数调优的策略:为特定方法调节超参数以获得更高概率的序列,并不足以保证正确性提升。超参数需要配合具体的模型、数据集和任务进行联合优化,概率本身不应作为唯一的调优准则。

无验证器自我改进的适用条件:基于概率的自蒸馏或自一致性循环更可能在模型本身已有较高任务准确率的场景下有效。在低准确率任务上,高概率样本可能反而包含错误信息,导致改进循环走入歧途。

自一致性的加权策略:在低温度采样下,均匀加权的多数投票通常优于概率加权。这一现象可直接追溯到样本内相关性对称分布在零点附近的实证发现。

总结与展望

本研究深刻地揭示了 “序列概率与正确性在什么条件下对齐” 不仅取决于 “是否对齐”,更关键的是 “在哪个粒度上对齐”。在数据集层面,概率信号确实包含可用信息;但在方法选择、超参数调节和同提示采样等实际解码场景中,这种信息往往无法稳定地转化为正确性提升。

这一发现促使我们重新审视当前依赖解码策略优化输出质量的范式。未来的工作可以朝着两个方向深入:其一是探索更复杂的前景估计技术(如学习型的扭曲函数)以改善全局功率采样在不同任务上的泛化性能;其二是在概率信号之外融入更丰富的正确性指示器,例如结合过程验证或不确定性估计,构建更鲁棒的生成策略。

对于量化交易和人工智能工程领域的实践者而言,本研究的启示在于:将统计信号转化为可靠决策需要明确其有效边界。概率是一个强大的工具,但它的适用条件——无论是模型能力门槛还是数据分布特征——都需要被仔细界定。