基于置信度动态的大型推理模型早停方法
Early Stopping for Large Reasoning Models via Confidence Dynamics
论文信息
标题: Early Stopping for Large Reasoning Models via Confidence Dynamics
作者: Parsa Hosseini, Sumit Nawathe, Mahdi Salmani, et al.
发布日期: 2026-04-06
arXiv ID: 2604.04930v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:大型推理模型生成冗长的思维链会带来巨大的计算开销,而过度推理甚至可能导致性能下降。论文要解决的核心问题是:如何在推理过程中判断何时可以停止思考、输出最终答案。
- 核心方法:提出 CoDE-Stop(Confidence Dynamics Early Stop),一种无需额外训练的早停方法。它通过监测中间答案的置信度时间动态,结合一个渐变阈值和一个累积退化分数来终止推理。
- 关键结果:在多个模型和基准上,CoDE-Stop 在保持准确性相当的条件下,将推理 token 用量减少 25–50%,实现了显著更优的准确率–计算量权衡(图 5,表 1)。
- 主要局限:方法依赖启发式设计的退化分数和手工阈值,置信度信号在后期对不正确轨迹也可能变得不可靠(图 4),且论文未探讨更复杂的模型内部状态。
- 适合读者:从事大模型推理加速、工程优化或想了解如何通过简单信号提升效率的机器学习工程师与研究人员。
论文背景和研究动机
大型语言模型通过生成 “思维链” 来解决复杂问题,但长链推理消耗大量计算资源。比如一次典型推理可能产生上万个 token,其中很大一部分是无效的反复验证或循环。更微妙的是,过度思考(overthinking)不仅浪费算力,甚至可能使模型在冗长的思维链中迷失方向,损害最终答案的正确性。因此,确定推理何时应该终止,是使这些系统实用可扩展的关键挑战。
已有的改进方法大致分两类:一类在训练阶段压缩思维链或训练辅助模型,需要额外的训练成本;另一类在推理时通过监测中间答案或信号来早停,例如 DEER、EAT 等方法依赖固定的置信度阈值,或者基于答案收敛来触发停止。但这些方法在处理 “不产生可靠最终答案” 的不正确推理轨迹时效果不佳——它们要么过早止损错误地打断可能恢复的推理,要么对已经陷入停滞甚至退化的长轨迹无计可施,导致大量无效计算。
论文作者通过观察推理过程中的置信度动态,发现了两个关键模式:正确的推理轨迹通常在早期就达到高置信度,即便后续还生成大量 token,模型实际已经掌握了答案;不正确的轨迹则表现出置信度剧烈波动、持续反复的特点,且长度呈重尾分布(图 3),均值远长于正确轨迹。这些观察促使他们提出:早停不应只看单点置信度高低,而应利用置信度随时间演变的趋势。由此,设计出 CoDE-Stop,用退化分数捕捉持续的不稳定信号,并在早期给予更大权重,从而有效区分可早停的正确轨迹与应被提前终止的低效轨迹。
核心方法和技术细节
CoDE-Stop 在推理生成过程中,每隔若干个步骤(例如模型输出 “Wait” 时)强制模型回答一次,并计算当前步骤的置信度 (定义为模型分配给答案 token 的平均概率)。由此获得时间序列 ,进而基于两个信号判断是否停止:
1. 渐变置信度阈值 推理越到后期,模型越应该有较确定的答案,因此阈值应逐步提高。论文定义线性增长阈值:
其中 和 是预设的最小/最大阈值,steps 控制增长速度(如 )。若当前置信度 ,则认为模型已达到可靠答案,立刻终止推理。
2. 退化分数 这是方法的核心创新。退化分数 定义为加权累积的不稳定信号:
不稳定指示子 采用 “趋势感知” 的判据:
即当前置信度不仅低,而且相较于前一步没有明显提升( 固定为 0.55)。这比单纯的低置信度更能捕捉持续摆动、没有进展的步骤。 权重函数 采用对数形式:
这里 是第 步对应的 token 位置,较早的步骤得到更大权重,因为观察发现早期置信度信号对区分正确与否更具信息量(图 4 左)。 当 ( 为可调阈值)时,判定推理进入无产出的退化状态,强制终止。最终输出答案的 prompt 与中间答案生成时相同。
这种设计使得 CoDE‑Stop 能够同时处理两种情形:对早早就很确信的正确轨迹,在置信度达到时迅速停止;对陷入摇摆、不断反复的不正确长轨迹,在累积足够的不稳定证据后切断。整个方法完全在推理时运行,不依赖任何额外训练,且能够灵活控制准确率与 token 量的权衡(通过调整 、 等参数)。
创新点和贡献
CoDE‑Stop 的主要贡献可以归纳为三点:
1. 显式建模置信度的时间动态 以往方法多依赖单点置信度(如 DEER)或答案收敛(如 Answer Convergence)。论文首次从时序角度系统分析正确与不正确轨迹在置信度演变上的差异,并据此设计早停判据。退化分数和趋势感知的不稳定指标让模型能够在尚未产生最终正确结果之前就探测到推理质量的恶化,避免了无谓的长链生成。相较之下,DEER 仅当置信度超过高阈值时才停止,对低置信度的错误长轨迹无能为力;而 DEER+Fixed-Step 虽然结合了长度限制,但不如退化分数来得精细(图 7)。
2. 简单有效且零训练成本 整个方法仅需在中间步骤调用模型生成答案并计算概率,无需修改模型结构,也无需训练任何辅助预测器。超参数控制平滑的准确率–计算量权衡(图 9),在实际部署中易于调优。实验表明 CoDE‑Stop 可叠加到不同的提示策略(如 Chain‑of‑Draft)上,进一步降低开销(图 6),显示出良好的兼容性。
3. 深入剖析置信度信号的可靠性 论文揭示了置信度动态的一个重要性质:早期步骤的置信度区分能力更强,而后期因模型在错误轨迹上也变得 “盲目自信”,单点置信度不再可靠。这一洞察不仅支撑了加权退化分数的设计,也为未来利用模型内部状态进行早停提供了思路。
实验结果分析
实验涉及四种开源推理模型(Qwen3‑4B/14B、DeepSeek‑R1‑Distill‑Llama‑8B、Llama‑3.1‑Nemotron‑8B)和四个基准(AIME、MATH500、GSM8K、GPQA‑Diamond)。主要发现:
- 准确率–计算量权衡:在所有测试中,CoDE‑Stop 在坐标图上均位于近乎 “帕累托最优” 区域,即在相同 token 量下准确率最高,或在相同准确率下 token 消耗最少(图 5)。例如在 Qwen3‑4B 的 AIME 上,CoDE‑Stop 将推理长度压缩 22.9%(从 16326 降至 12588 个 token,表 1),准确率仅从 69.1% 微降至 67.7%;总 token 开销(含中间答案生成)同样大幅降低。
- 处理长尾巴错误轨迹的优势:CoDE‑Stop 特别擅长节省不正确轨迹的计算量。图 7 显示,在匹配的准确率下,它比 DEER 大幅减少错误轨迹的长度,而纯粹基于长度的 DEER+Fixed‑Step 在这点上不如退化分数精细。
- 消融实验:对退化函数的消融显示,趋势感知的 和对数加权 组合获得最佳的准确率–压缩率权衡(图 8)。加权方式若过于均匀(如均一权重)或倒置(强调后期),性能明显下降,印证了早期信号更重要的发现。对退化阈值 的敏感性曲线(图 9)十分平滑,表明方法容易适配不同计算预算。
- 通用性:当切换到不同的推理步骤分隔符(如 “Alternatively”)时,CoDE‑Stop 仍然保持优势(表 7),显示出对分隔符选择不敏感。
因此,实验结果强有力地证明了置信度动力学信息的价值,以及 CoDE‑Stop 作为通用、易用的早停方法的有效性。
实践建议
如果你正在部署推理密集型 LLM 服务,或者希望在自己的应用中以小成本压缩推理开销,以下几条来自论文的实践指南值得参考:
-
从置信度动态中提取早停信号 不必重新训练模型,只需在推理时每隔若干步调用模型生成中间答案,记录置信度序列。实现时注意选择自然的分隔点(如 “Wait” 或换行符),这些点往往是模型自我修正的 “呼吸点”。
-
组合高置信度与不稳定检测 单纯用固定阈值停止(如置信度 > 0.95)会错过很多能早停的正确轨迹,且无法识别低效的不正确轨迹。实践上可以用论文提供的渐变阈值和退化分数双条件。退化分数中的 和阈值 可在少量验证集上快速扫描,通常 、 在 2~20 之间(按模型和任务调整)即可获得良好权衡。
-
注意早期信号并赋予更大权重 当监控置信度时,更要重视推理前期的变动:前期置信度的上升趋势远比后期的高绝对值可靠。加权累积退化分数的对数权重设计值得直接借鉴。实现上可以缓存每个步骤的时间戳和置信度,避免过长的滑动窗口。
-
结合提示工程进一步提效 CoDE‑Stop 与 Chain‑of‑Draft 等简洁推理提示兼容,可以叠加使用。在成本敏感的场景(如大规模数学题批处理),可以先引入简洁提示压缩基础 token 长度,再用 CoDE‑Stop 剪除剩余冗余,两者协同能获得 40% 以上的总 token 节省。
-
关注计算开销与准确率的平滑调控 退化阈值 是一个易于理解的 “旋钮”:值越小,停止得越果断,token 消耗越低,但可能略降准确率;值越大则更保守。部署时可根据业务 SLA(例如可承受的精度下降)快速调校,不必像某些基线方法那样进行粗粒度的尝试。
论文提出的方法已开源,示例代码和配置文件均已发布(https://github.com/sudoparsa/CoDE-Stop)。对于希望在实际系统中实现推理动态停机的团队,可以直接将其作为即插即用的推理后处理模块集成,无需改动模型本身。