AdaFuse:面向大语言模型的测试时缩放自适应集成解码方法
AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
论文信息
标题: AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
作者: Chengming Cui, Tianxin Wei, Ziyi Chen, et al.
发布日期: 2026-01-09
arXiv ID: 2601.06022v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何让多个大语言模型在推理时动态地协同生成文本,而不是使用固定的融合粒度,以适应不同任务和生成阶段的语义变化。
- 核心方法:以单词为基本融合单元,利用模型的首词置信度自适应决定是否扩展生成跨度,在低置信度时触发多样性感知的候选项探索,并通过跨模型的归一化负对数似然评分选择最佳片段。
- 关键结果:在六个基准测试上,AdaFuse 平均相对提升 6.88%,在知识密集型问答和机器翻译中表现尤为突出(见表 1)。
- 主要局限:方法依赖令牌级概率和分词器输出,无法直接用于黑盒 API 模型;适应性解码可能增加 GPU 能耗(见论文 Limitations)。
- 适合读者:从事大模型推理优化、模型集成、自然语言生成以及多模型协同的研究者和工程师。
论文背景和研究动机
大语言模型(LLM)在开放域问答、数学推理、机器翻译等任务中展现出强大能力,但单一模型在不同任务上的表现并不均衡。不同预训练数据、模型架构和译码策略导致各模型具备互补的强项。例如,某些模型擅长结构化推理,却在常识问答中表现不稳。推理时模型集成(inference-time ensembling)作为一种无需重新训练即可结合多样模型优势的手段,近期受到重视。
现存的推理时集成方法主要有三种颗粒度:样本级、片段级和令牌级。样本级方法在完整响应生成后进行重排序或融合,无法在生成中途纠错。片段级方法合并多令牌段,但依赖于固定或预定义的段边界,缺乏灵活性。令牌级方法在每一步聚合下一个令牌的分布,但需要令牌对齐,异构分词器下适用性差,且计算开销巨大。这些方法的共同缺陷是使用了固定的融合分辨率,不能根据语义上下文、任务需求和推理不确定性动态调整融合范围。这成为本文提出的核心挑战:如何设计一种自适应的推理时集成框架,打破固定粒度的限制?
AdaFuse 正是在这一动机下提出的:以单词为自然对齐的基本构建块,通过置信度驱动的自适应解码和多样性感知的候选扩展,实现灵活的、可随解码语境演变的集成行为。
核心方法和技术细节
AdaFuse 的整体设计包含四个相互衔接的模块:候选词生成、自适应词提交、多样性感知的集成扩展,以及跨模型评分与整合。
候选词生成:每个模型从当前解码前缀 开始,按照自己的下一令牌分布自回归生成令牌,直到形成一个完整的单词(即遇到词边界)。生成的单词序列作为候选片段 ,它避免了半词截断,为后续对齐和评分提供了一致的基本单元。
自适应词提交:判断是否要继续扩展当前单词或立即进行集成重评的关键信号是词首置信度。在生成一个新词的第一个令牌时,模型给出 top-1 和 top-2 概率 和 。定义置信度边缘 。当该值大于等于阈值 (实验中设为 0.7)时,模型认为当前状态足够确信,可以贪心地继续生成当前词的下一个令牌,甚至连续扩展多个单词——论文限制每个解码轮次最多提交 个单词,以避免错误累积。否则,生成在完成当前单词后暂停,触发集成重评。这个机制使解码器在自信时积累更长的语义单元,在不确定时停止并等待跨模型校正。
多样性感知的集成扩展:如果在词首置信度不满足条件时才启用多样性搜索。搜索分为探索与利用两阶段。首先,根据当前前缀的令牌分布选取 top- 个不同的初始令牌(分支因子 决定探索路径数)。然后,每个初始令牌被贪婪地扩展直到生成一个完整单词。由此得到 个多样化的词候选,而不是单一高概率候选,增强了集成评分时可选择的空间。这一设计与自适应触发相结合,仅在需要时增加计算,避免了对所有状态盲目扩展。
跨模型评分与整合:在所有参与模型中,将每个模型在本轮提交的一个或多个候选片段(若触发多样性搜索则有 个)汇总成候选池。对每个候选片段,计算每个模型在其自身令牌序列上的归一化负对数似然(NLL)作为模型对其的置信度度量:
再对所有模型取平均得到融合分数 。最终选择使该分数最小的候选片段作为输出 ,并附加到解码前缀。整个过程形成一个闭环反馈:不确定性引导探索,多样性反过来增强集成质量。
创新点和贡献
论文提出的 AdaFuse 框架有三大核心贡献:
-
置信度引导的自适应解码:摆脱了固定长度片段或固定步骤的集成控制。使用词首置信度边缘作为切换信号,实现了编码器可以在语义完整的 “词” 粒度上进行递交和校正,兼顾效率与准确性。这是首次在集成解码中引入这种与解码状态紧密耦合的即时决策机制。
-
多样性感知的缩放策略:不同于传统集束搜索或者单纯增加候选数量的做法,AdaFuse 只在不确信时激活 “先探索、再利用” 的两阶段搜索,从而以较低的计算代价提升候选词的多样性。实验表明,这种条件式多样性比不加选择的扩展更有效(见论文第 4.4 节图 4)。
-
统一的词级集成范式:以单词作为对齐基准,避开了令牌级方法中繁琐的词汇表映射和高额开销,同时保留了比片段级方法更细粒度的控制。跨模型评分使用归一化 NLL,能公平比较不同长度的候选序列。
这些创新使 AdaFuse 在多个基准上显著超越了最强的基线方法(包括样本级、片段级和令牌级集成),且有着与 UniTE 等轻量级方法相近的端到端速度(图 5 的运行时分析),展现出良好的实际可用性。
实验结果分析
论文在三个任务类别的六个基准上评估了 AdaFuse:知识密集型问答(NaturalQuestions、SQuAD、TriviaQA)、算术推理(GSM8K)和机器翻译(Flores En↔De)。以 LLaMA-3.1-8B-Instruct 与 Mistral-7B-Instruct-v0.3 为基本配对进行两模型集成,基线包括 LLM-Blender(样本级)、DeepEn(令牌级)、SweetSpan(片段级)和 UniTE(令牌级)。主要发现如下:
-
整体提升明显:AdaFuse 在固定基模型设置下平均得分 63.23,比最强基线 SweetSpan 的 59.16 高出 4.07 分,相对提升 6.88%(表 1)。在 NaturalQuestions 上,AdaFuse 的准确率达到 42.85,而最佳基模型 LLaMA-3.1-8B-Instruct 仅为 34.24,提升幅度超过 8.6 个点。
-
任务适应性:在 SQuAD 上,AdaFuse 比 SweetSpan 进一步提高了约 3.6 个百分点(90.15 vs. 86.58),在翻译任务上表现同样突出。而在 GSM8K 上,由于 Mistral 与 LLaMA-3.1 在该任务上的性能差距较大,AdaFuse 未能超越单模型最强成绩,但更换为更匹配的 Qwen3-8B + LLaMA-3.1-8B 基模型后,准确率跃升至 90.25,远超所有基线,印证了基模型兼容性对集成效果的重要性。
-
自适应词提交消融实验:在 NaturalQuestions 上,固定长度词数(1/2/3)的解码效果均低于自适应的 AdaFuse(图 2)。案例显示,固定长度会将正确的多词实体 “Kelly Reno” 错误分割,而自适应提交能保留完整实体并由跨模型评分选中。各数据集每轮次提交词数的分布表明,AdaFuse 能根据不同任务动态调整:在 NaturalQuestions 上超过 80% 的轮次只提交 1 个词,而在 De→En 翻译中近半轮次提交 3 个词,说明其确实适应了任务特性。
-
多样性缩放分析:在 NaturalQuestions、TriviaQA 和 GSM8K 上,将分支因子 从 1 提升到 5 时精度总体上升(图 4 右)。以 固定,大多数基准上启用多样性缩放均带来一致提升(图 4 左)。对比集束搜索式缩放,AdaFuse 的多样性设计更有效地提升了候选质量(附录 F 图 7)。
-
效率分析:在图 5 的端到端延迟比较中,AdaFuse 的推理速度与 UniTE 相当,明显快于 DeepEn 和 SweetSpan,体现出计算额外成本的可控性。这也是因为自适应提交在高置信状态时减少了评分轮次。
实践建议
AdaFuse 为希望在不重新训练的情况下融合多个大模型的团队提供了可操作的工程方案。在部署时可参考以下建议:
-
适用于多模型部署的场景:如果你已经维护了多个擅长不同任务的基模型(如 LLaMA 3.1 和 Mistral),AdaFuse 可以直接作为推理层集成到你的服务中,无需额外训练,即可提升输出质量,尤其适合对响应准确性要求高的问答和翻译系统。
-
超参数设置:论文提供了鲁棒的超参数默认值:置信度阈值 ,最大连续词数 ,分支因子 。在实际系统启动时,可以先沿用这些值,再根据目标任务的输出长度和复杂性微调 和 。针对能耗敏感场景,可以适当降低 或仅在关键推理阶段启用多样性缩放。
-
硬件和模型要求:AdaFuse 需要访问模型的令牌级概率分布,适用于开源模型(如 HuggingFace 生态中的模型)或能提供 logprobs 的私有部署。对于完全黑盒的 API(如 ChatGPT 仅返回完整文本),无法直接使用本方法。此时可考虑使用代理模型估计,但这会引入额外不确定性,论文未涉及。
-
集成规模管理:两模型集成已经能带来明显增益,加入更多模型可能进一步提高(如附录 E 显示 3 模型在 NaturalQuestions 上提升到 42.63),但需注意计算成本线性增长。建议从互补性最强的两个模型开始测试,根据综合收益决定是否扩增。
-
风险与监控:自适应解码可能导致某些异常样本消耗过多计算,或引入不可预期的生成停顿。上线后可监控解码轮次分布和平局延迟,若偏离预期,可动态调整 或 控制最大开销。
综合来看,AdaFuse 是当前推理时模型集成方法中为数不多在效率与效果间取得良好平衡的框架,适合作为生产环境中提升生成质量的第一跳解决方案。