少花钱,效果好:通过主动实验选择实现预算高效的缩放定律拟合
Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection
论文信息
标题: Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection
作者: Sijie Li, Shanda Li, Haowei Lin, et al.
发布日期: 2026-04-24
arXiv ID: 2604.22753v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决百万级预算下如何用最少的实验投入,精准拟合外推区域的缩放定律(Scaling Laws),将拟合问题转化为预算感知的序列实验设计问题。
- 核心方法:提出一种不确定性感知的主动实验选择方法,通过建模缩放定律参数的多盆式后验分布(mixture of Gaussians),用 “盆内” 和 “盆间” 预测不确定性来评估每个候选实验的价值。
- 关键结果:在涵盖 8 类任务、65 组缩放定律实例的基准测试上,该方法仅用总训练预算的约 10%,就接近完整数据集的拟合效果(见图 2,表 2)。
- 主要局限:方法依赖多模态参数不确定性的混合高斯近似,在局部最优解识别不佳或模型设定严重错误时可能不准确;采集规则是单步的,不显式优化长区间预算分配(见论文附录 E)。
- 适合读者:从事大规模语言模型训练规划、实验设计、自动机器学习(AutoML)或对预算约束下缩放定律外推感兴趣的研究员与工程师。
论文背景和研究动机
缩放定律已成为分析和规划大语言模型训练的支柱工具——从业者用少量小规模试探实验(pilot runs)来预测模型在更大规模或更高投入下的性能,进而决定是否投入数百万美元的最终训练(Kaplan et al., 2020; Hoffmann et al., 2022)。然而,这条路径本身也变得昂贵:为了拟合出足够精确的缩放定律,单是试探实验就可能烧掉数百万预算(Porian et al., 2025; Hägele et al., 2024),预算分配本身已成为一个独立难题。
传统的缩放定律拟合流程高度依赖人工经验:研究人员手动选择实验配置,执行大量试探训练,然后对观察结果进行参数化拟合。随着缩放定律分析扩展到词汇设计、数据混合、稀疏性、专家混合架构(Mixture-of-Experts)乃至推理阶段行为等多样化场景(Muennighoff et al., 2023; Caballero et al., 2023; Ludziejewski et al., 2024),手动选择实验点的效率越来越低。一个自然的问题是:给定一组可运行的实验池和有限预算,如何系统性地选择实验,才能保证拟合的缩放定律在昂贵的目标区域内拥有最高的外推精度?
本文正是围绕这个核心问题展开。作者将缩放定律拟合明确形式化为一个预算感知的序列实验设计问题:不再假定拟合数据预先给定,而是把每个候选实验视为一次有成本的查询,目标是在有限预算下最大化目标区域(高成本、大规模区间)内的预测准确性。这一形式化更贴近实际场景——缩放定律的最终价值在于帮助决策者选择少数昂贵的大尺度配置,而不是均匀地拟合所有试探数据点。
核心方法和技术细节
该方法的核心是一个分两步的序列决策循环:在每一轮中,先根据当前观察数据更新缩放定律参数的不确定性描述(盆式后验分布),再根据 “候选实验对降低目标区域不确定性的预期贡献 / 实验成本” 的比率来选择下一个要执行的实验。
后验建模:多盆式高斯混合。 缩放定律参数的非线性使得后验空间常常呈现多模态结构(图 3):从不同初始化点拟合会收敛到不同的局部最优点,这些点在小尺度观测数据上的表现可能相近,但在外推到高成本区域时给出的预测却差异巨大。为捕捉这一特性,作者采用混合高斯分布来近似参数后验:
每个分量对应一个 “盆”(basin),含代表参数 、局部协方差 和盆权重 。这些参数通过多起点拟合、局部高斯近似与预测空间中的层次聚类联合估计(见论文 4.1 节与附录 C):先是利用 Jacobian 与 Fisher 式矩阵构建局部协方差,然后基于候选盆在目标区域的预测分布差异,合并行为相似的盆,以减少冗余。
不确定性分解:盆内 + 盆间。 给定后验混合,将目标区域的均值平方预测误差(MSPE)按总方差律分解为两项:
- :盆内预测方差。反映在已选定某个盆的前提下,该盆内部参数变化带来的预测扩散。该值大意味着即使选对了盆,参数估计的局部不确定性仍然高。
- :盆间预测分歧。反映不同盆对目标区域预测的差异程度。该值大意味着当前存在多种大相径庭的外推行为,亟需更多信息来明确哪一种是正确的。
采集函数:期望不确定性降低。 对于每个未观察的候选实验 ,定义其效用为查询 后期望的目标区域 MSPE 减少量(见论文 4.2 节与附录 D):
-
盆内效用 :基于局部线性化,在新观测点 上的信息增益(通过卡尔曼式更新)会引起整个目标区域上盆内预测方差的降低。其闭式解为(见论文 4.3 节与附录 D.3):
其中 是目标区域 Jacobian, 是候选点 Jacobian。该项在实验点与目标区域预测的线性相关性较大的时候得分高。
-
盆间效用 :在考虑新观测值 的分布(由当前盆混合给出的高斯混合预测分布)下,经过贝叶斯更新后,不同盆之间预测不一致的预期减少程度。该期望可由一维数值积分有效求解(见附录 D.4 与 D.5)。
最终的成本感知采集分数为:
其中 是实验的计算成本(如 FLOPs), 控制成本惩罚强度。算法在每个时序步选择分数最高的仍负担得起的实验(算法 1)。
创新点和贡献
问题形式化的转变。 本文首次将缩放定律拟合明确转化为预算感知的序列实验设计问题,并为此构建了覆盖不同缩放场景与成本模型的系统化基准。这和传统上把试探实验视为先验固定步骤、拟合为纯建模任务的视角完全不同。
多盆式不确定性建模。 与经典的 D-最优、V-最优设计仅依赖当前的局部最优参数而忽略后验多模态性不同,该方法同时维护多个可能外推方向,通过 “盆内淬炼和盆间澄清” 的双重驱动来指导实验选择。这一机制在模型设置和预算极度有限时尤为关键:当局部最优不能代表全局外推行为时,它能主动选择那些具有区分力的实验点。
实用高效的指标与验证。
在涵盖预训练超参数调节、数据分配、架构设计、稀疏性等领域基的 8 类任务共 65 个缩放定律实例上,该方法持续优于随机选择、贪心便宜选择、成本优先采样、D-最优和 V-最优等基线,且多在预算仅占完整池 10% 以内时逼近甚至超越全量数据的表现(表 2)。例如在极具挑战的 lr&bsz(Step Law)任务上,它用 1% 的预算就触及了低损失区域(图 1);在 domain、data_con、sparsity 等任务中也展现出明显的低预算优势。消融实验进一步表明,盆内效用项是大多数任务上的主导信号,但盆间效用项在预算极紧或任务异质性强时能提供补充增益(表 3)。
实验结果分析
整体趋势。 图 2 和表 2 展示了 8 类任务上的平均表现,核心结论如下:
- 模型感知设计远优于简单启发式:
Random、Cheapest和Cost Rand在各种预算水平下均显著落后,特别是在 1% 极低预算时,多数任务的 甚至为负。 - 本方法在低预算区间优势最大:在 1% 预算时在
domain、data_con、sparsity上表现最佳,在vocab上匹配最好成绩;在 5% 预算时,取得 8 项任务中 5 项的最佳;到 10% 预算时,在所有任务上匹配或超越最强基线(表 2)。 - 相比经典设计方法,其在多模态场景下更稳健:V-最优虽然也以预测精度为导向,但只依赖当前最优单一点展开,当缩放定律的多盆结构明显时(如
lr&bsz的 sl_5 样本),本方法通过同时监控多个盆,能取得显著更好的外推 (图 3)。
为何以部分预算超越全量数据?
某些预算约束方法的外推 偶尔会超过在全量训练数据上的拟合表现。这并不矛盾,因为全量数据拟合不是 oracle 上界:当目标区域集中在高成本端且训练集中小规模实验点密度远高于大规模点时,盲目拟合所有数据可能使外推向大尺度时的趋势偏移。这在 lr&bsz 上尤其明显:仅使用较便宜的那一半训练点得到的 ,而使用较贵的一半却能得到 (论文 5.2 节)。这说明在大模型中,外推目标决定数据价值,“越多越好” 未必成立。
实践建议
-
将缩放定律拟合作为预算分配问题来规划。 在大规模预训练项目中,不要一次性提交所有试探实验,而是将预算分批次。先执行极端便宜但信息量大的点,收集首批观察后重新评估实验选择策略。
-
维护参数不确定性池。 多起点拟合和盆式后验是关键。实践者可通过多个随机初始化或引导重采样来获得一组有意义的局部解,再将其聚类、合并,得到候选外推模式。即使不确定哪个模式正确,也能基于这些模式选择最有助于分辨正确外推的实验。
-
重视候选点的 “成本-信息比” 度量。 对每个可选实验点,不仅看它离目标区域的距离或本身的 FLOPs 成本,还要看它能带来多少针对目标区域的预测变异性降低。该方法提供的分解(盆内淬炼/盆间澄清)可以指导设计预算分配:早起多选择盆间分辨力高的实验,后期多选择对典型盆内有精炼作用的实验。
-
注意模型误设时的修复。 若预测区域的预算分布极端不均,直接用所有数据拟合可能有害。实践中可对训练点加权,或优先选择与目标条件分布相似的实验点,而非一味增加远端低质点的数量。