推理型大语言模型的测试时扩展:推理机制、评估与可复现性

Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

arXiv: 2608.04001v1

论文信息

标题: Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

作者: Mohsen Hariri, Weicong Chen, Nahal Shahini, et al.

发布日期: 2026-08-04

arXiv ID: 2608.04001v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:测试时计算扩展(test-time scaling)是让大语言模型在推理时花费更多计算资源来提升性能,但当前研究将不同的推理算法混为一谈,缺乏统一的评估标准和可复现性要求。论文要解决的是如何系统地区分这些算法、如何正确评估完整推理系统、以及如何保证研究的可复现性。

  • 核心方法:将测试时扩展形式化为对自回归模型隐含前缀树上的预算约束推理,区分了三种结构模式:单轨迹序列扩展、叶子级扩展(采样后约简)、前缀级扩展(搜索未完成状态)。建立了从完整推理系统(而非仅模型权重)出发的评估原则,并提出了发现-稳定性剖面来统一刻画重复采样行为。

  • 关键结果:在 120 道竞赛数学题上,正确候选答案的可用性随采样数量增长(Pass@80 最高达 94.62%),但实际使用的选择器(如点选验证器)无法选出所有正确候选,存在 5–16 个百分点的显著差距(见图 6)。这表明现有约简方法远未达到候选池的上界。

  • 主要局限:论文不提供能使现有选择器达到理论上界的新算法;实验仅覆盖有限数量的模型和基准;发现的候选可用性与选择器精度之间的差距未在全部配置上量化;前缀级搜索方法在实验中未作为完整系统与叶子级方法对比。

  • 适合读者:从事大语言模型推理、模型评估或推理系统设计的 AI 研究者和工程师,尤其是需要理解不同推理扩展策略的本质差异、建立标准化评估流程、或使用大规模推理轨迹数据集的人。

论文背景和研究动机

过去几年,让大语言模型在推理时生成多步中间步骤并聚合多个样本,显著提升了它们在算术、符号推理和常识推理上的表现。早期的工作如思维链提示和自一致性解码奠定了这一范式的基础。近期的系统,如 DeepSeek-R1、Phi-4-reasoning、Qwen3 等,更将 “思考” 作为显式设计目标,通过强化学习和有监督微调来激发长程推理行为。

然而,“测试时扩展” 这个术语在文献中被用来指代几类迥异的推理算法。有的方法在一段演化轨迹上分配额外计算(如 s1 的预算强制),有的从多个完整候选答案中采样并通过投票或验证器选择最优解(如 Best-of-N),还有的搜索未完成的推理状态(如树形思维搜索)。这些模式在统计结构、候选分布、计算预算和失效模式上都不同,但现有研究常将它们视为可互换的同一过程,仅用一个标量 “预算” 来度量。这使得跨论文的比较难以解释,也掩盖了实际推理系统的复杂性。

此外,评估变得比 “孤立模型评测” 更加微妙。评测表现依赖于完整推理协议:提示模板、解码器、搜索控制器、约简器、验证器或判断器、停止规则和数值设定。LLM 判断器虽能灵活评估开放式输出,但有位置偏误和冗长偏误等固有问题,且在测试时扩展条件下,判断质量高度依赖任务和具体流程。即便固定了提示和方法,随机解码和实现细节也会引入不确定性,因此需要区间估计和显式的可复现性控制。

最后,开源推理模型的生态正快速膨胀,不同模型在监督信号、推理风格、计算预算和聚合协议上差异巨大,使得在模型权重层面进行比较变得极易混淆。这进一步强化了从完整推理系统出发进行对比的需求。

核心方法和技术细节

自回归前缀树与三种扩展模式

论文的核心形式化工具是自回归模型在给定提示 xx 下诱导的隐含前缀树 T(x)\mathcal{T}(x)。在这个树上,有限前缀 zz 位于根到完整生成 yy 的路径上。测试时扩展算法 AB\mathcal{A}_B 在此树上以不受超预算 BB 的约束自适应地执行一系列原始操作(令牌生成、验证器调用、前缀扩展等),并返回一个完整叶子或答案。基于此,论文区分了三种互不排斥的结构模式(图 2)。

  • 单轨迹序列扩展:任意时刻最多保留一个活跃前缀。额外计算改变该轨迹如何延伸、修改或终止,但不产生竞争前沿。预算强制方法属于此类。

  • 叶子级扩展:生成一个由 NN 个独立完整候选组成的集合 YN(x)\mathcal{Y}_N(x)(通常从同一提案分布 qπq_\pi 中抽取),然后通过终端约简器 RN\mathcal{R}_N 选择最终输出。提案分布由解码协议(温度、截断规则等)诱导。关键点在于:交叉候选的交互仅在所有候选完成后发生。约简规则包括验证器约束选择、答案边际化(自一致性)、学习重排序(Best-of-N)和经验期望效用选择(MBR 解码)。论文将自一致性视为经验 MBR 的特殊情形。

  • 前缀级扩展:在轨迹完成前分配计算资源。搜索维护活跃前沿 Ft\mathcal{F}_t 和已完成叶子库 Yt\mathcal{Y}_t,通过选择、扩展、评分和更新的循环迭代推进。前缀评分可源于似然、结果监督价值模型、过程奖励模型(PRM)、蒙特卡洛展开或局部校验。前缀搜索的有效提案分布 qsearch,Bq_{\mathrm{search},B} 依赖于评分函数、控制器和停止规则,其返回的候选一般不是独立同分布的。

提案分布与解码协议

论文建立了一个描述解码协议如何诱导提案分布的通用框架。给定局部解码器 DλD_\lambda,令牌级输出可统一为 “能量-门” 形式:

qt~(i)=ut(i)1{i∈St}∑j∈Stut(j)q_{\tilde{t}}(i) = \frac{u_t(i) \mathbf{1}\{i \in S_t\}}{\sum_{j \in S_t} u_t(j)}

其中 utu_t 是令牌度量,StS_t 是允许的支撑集。通过组合门控(水平门、头部预算门、目标门),衍生出各类截断规则。论文指出多种常见截断(top-k、核采样等)在并行头部预算门下有共同的简化形式,仅由最严格的保留前缀决定,但有序组合不可交换,且温度施加顺序也会改变支撑集。

提案分布的精确细节决定了候选库的统计性质,因此解码协议必须被视为推理系统的一部分,而非实现琐碎。

聚合、证据映射与因果停止

论文进一步将约简器拆解为证据映射 EηE_\eta 和固定库决策规则 Gδ\mathcal{G}_\delta。证据映射从每个候选和元数据中提取推理时信号(如对数概率、验证器分数、PRM 输出),决策规则据此选择输出。分数语义在约简设计中至关重要:基于硬最大化(如 Best-of-N)的经验约简对分数的保序变换不敏感,但对错误评估分数过度优化;基于软加权或对数几率的方法则对分数的尺度敏感。

为与事后约简区分,论文引入了因果停止控制器的概念。跨轨迹停止时间 τroll\tau_{roll} 只能在已完成的轨迹历史上自适应决策,这确定性地减少了总生成成本;轨迹内停止则可进一步截断当前轨迹。论文强调成本核算必须包含温启动样本、丢弃样本以及停止条件从未触发的运行。

发现-稳定性剖面与评估

评估层面,论文确立了端到端系统性能和候选库质量之间的分离。前者是部署推理系统下的期望正确性 MBM_B,后者通过发现-稳定性剖面 SkS_k 来刻画。对于 kk 次独立尝试,定义:

Sk,t=1Q∑q=1Qκk,t(pq)S_{k, t} = \frac{1}{Q} \sum_{q=1}^{Q} \kappa_{k, t}(p_q)

其中 κk,t(p)\kappa_{k, t}(p) 是成功概率为 pp 的提示在 kk 次尝试中产生至少 tt 个正确候选的概率。低阈值(t=1t=1)度量发现能力,高阈值(t=kt=k)度量可重复性。常见指标如 Pass@k 和 pass^k 分别是该剖面的边界坐标。论文给出了基于观测库的无放回对角线估计 S^k,tbank\widehat{S}^{\text{bank}}_{k, t},以及基于 Beta-Binomial 共轭先验的贝叶斯后验均值估计。剖面是一个结构丰富的对象,任何标量度量都是其预定义的泛函,且不能替代剖面本身。

可复现性

论文区分了精确重放(逐位还原相同输出)和分布可复现性(独立重新执行产生统计兼容的估计)。后者必须包含协议匹配的不确定性估计,并通过自助法、分层聚类等方式传播到最终指标。数值执行方面也需明确:推理库、数值格式、量化方案和批处理可能改变令牌决策,因而属于评估过程的一部分。

创新点和贡献

论文的第一个贡献是对测试时扩展的系统性形式化。通过前缀树上的预算约束推理这一抽象,首次将单轨迹、叶子采样和前缀搜索统一到同一概念框架下。这使得每种方法的统计结构、计算预算和失效模式之间的差异变得透明。

第二个贡献是为测试时扩展建立了完整的评估方法学。这包括明确被评估对象是 “完整推理系统” 而非孤立模型,分离共享库评估和端到端评估,以及引入发现-稳定性剖面作为比标量指标(如 Pass@k)更丰富的候选库诊断工具。该剖面能够同时刻画推理系统中候选发现的提升与候选稳定性的衰减,而这是任何单一标量指标无法提供的。

第三个贡献是对开源推理模型的生态进行了系统梳理,按照模型端和接口端机制(如验证式 SFT、RL 或偏好优化、推理时控制、参数空间融合)组织比较。这使得跨模型比较有了方法学的可归因性。

第四个主要贡献是大规模推理轨迹语料库的构建与发布。该语料包含超过 190 万条完整推理轨迹,横跨科学、符号推理和竞赛数学三个领域,在富含信号的子集中还包含令牌级候选日志概率和两种验证器输出(CompassVerifier 和基于 Qwen3.6 的逐点参考无关验证器)。这直接回应了可复现性的需求:其他人可以在相同的已完成候选库上评估新的约简器,而无需重新生成响应。

实验结果分析

实验主要分为三个模块。

广谱知识与符号推理

在 14 个 MMLU-Pro 域和 23 个 BIG-Bench Hard 任务上对 27 个模型进行了单响应评测。MMLU-Pro 的精确匹配率从 3.13% 到 70.47% 不等,BBH 的灵活提取匹配率从 25.97% 到 82.20%(见论文第 4.1 节)。实验主要意义是建立基线和释放 500,661 条响应,而非直接比较测试时扩展技术。

候选发现远超答案选择

在 20 个模型配置和 120 道竞赛数学题(AIME 24/25、HMMT 25、BrUMO 25)上,每道题生成 80 个响应。关键观察:Pass@k 随 k 增长显著提升,中位数从 k=1 的 56.49% 升至 k=80 的 82.08%,但所有 k 个响应都正确的概率(pass^k 的中位数)降至 15.00%(图 5,左)。这表明采样确实揭示了更多潜在的正确轨迹,但联合正确性(稳定性)不够。

对最强单响应配置(Qwen3-30B-A3B-Thinking-2507),单样本准确率为 75.56%,Pass@80 达 91.67%,但 pass^80 仅 43.33%(图 5,左)。在实际使用的选择器上:字面答案投票法在 k=80 时达 78.33%;序列对数概率选择为 77.50%;平均令牌对数概率选择反而从 k=1 的 75.56% 下降到 k=80 的 65.83%(图 5,右)。这意味着选择得分与正确性之间的失配可以导致更多的计算反而降低最终准确率。参考辅助验证器(CompassVerifier)达到 89.17%,接近候选可用性的上界,但它需要接触正确答案,不可用于实际推理。

信号丰富的 2025–2026 竞赛数学

在 186 道近期竞赛题(AIME 26、HMMT 2 月和 11 月、CMIMC 25、SMT 25)上,对 Qwen3.6 和三种推理努力程度(低、中、高)的 gpt-oss-20b 进行评估。核心发现:Pass@80 对四个配置分别是 94.62%、72.58%、91.94% 和 93.55%;但使用参考无关的逐点验证器进行点选后,正确率分别降至 86.56%、58.06%、75.81% 和 81.72%(图 6)。即便将点选和投票取优,每个配置距 Pass@80 仍有 5.38–14.52 个百分点的差距。这说明有大量正确候选在候选库中未被现有的选择机制选出。

在高努力程度下,gpt-oss 有 16.12% 的响应触及 81,920 令牌长度上限,而低努力程度下为 0%,提示长度预算本身也是测试时扩展的一个重要资源约束。

实践建议

这篇论文为部署推理系统的团队提供了如下方向性指导:

第一,组件化解耦是系统设计的起点。生产环境应将推理系统明确拆分为提案分布(提示模板 + 解码器)、证据映射、约简规则和因果停止控制器。这使改进可以局部化。例如,更换决策规则可通过在固定的已完成候选库上重放离线评估来低成本迭代(论文第 3.3 节共享库比较),而改进证据映射则需要重新注入推理流以收集新信号,这增加了成本。在一套系统里混合使用跨任务、跨温度的策略可能引入难以诊断的交互效应。

第二,关注评估-选择的裂谷。论文展现了候选可用性与实际选择精度之间的巨大差距(图 6)。这一差距是系统可获取收益的上限,也是当前系统的主要优化空间所在。从系统角度看,候选库中存在大量正确轨迹但选不出来,说明当前证据信号(原始对数概率、简易投票、通用逐点评分器)的信息量不足。构建面向特定任务分布、信号密度更高的证据映射(例如,利用候选间的结构一致性而非仅逐点打分)是当前的一个工程突破口。

第三,将不确定性纳入生产评估。测试时扩展是随机过程,有限候选库上的点估计有相当波动。论文建议使用协议一致的 bootstrap 来为 Pass@k 和约简后准确率生成区间估计(论文第 3.5 节),且必须传播聚合规则的复杂性。生产化的评估流水线应该在被评估推理协议的层次上进行不确定性传播,而不是简化为单点比较。这对面向用户的模型选择决策有实质影响:两个模型在纸面上 1 个百分点的差距,可能在传播完整协议的不确定性后变得不统计显著。

第四,计算预算的多维会计。叶子级扩展的总成本不仅等于生成令牌数,还要计入验证器调用、成对比较和控制器评估成本。当使用成对 MBR 或复杂验证器时,评估成本 CevalC_{\text{eval}} 可能占主导。系统设计者应采用论文建议的成本分解(Cgen+CevalC_{\text{gen}} + C_{\text{eval}}),在固定总成本下优化分配策略,避免仅以样本数 NN 为代理的次优配置。

第五,利用大规模候选库进行离线优化。论文已发布包含 190 万以上条轨迹的语料(见表 1),这允许在不访问模型的情况下进行约简算法的离线搜索和调优。对于资源有限的团队,可以在这些固定的已完成候选上训练轻量级验证器或设计特征工程化的约简器,再回推到实际推理系统。这类工作需注意:离线库的提案分布必须与实际部署分布一致,否则会有严重的数据集偏倚。