大语言模型问题求解中的泛化能力:以最短路径为例

Generalization in LLM Problem Solving: The Case of the Shortest Path

arXiv: 2604.15306v1

论文信息

标题: Generalization in LLM Problem Solving: The Case of the Shortest Path

作者: Yao Tong, Jiayuan Ye, Anastasia Borovykh, et al.

发布日期: 2026-04-16

arXiv ID: 2604.15306v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:本文要回答大语言模型在组合式序列优化问题(如最短路径规划)上能否系统性地泛化,并系统剖析训练数据、训练范式和推理时策略如何分别影响模型的泛化行为。
  • 核心方法:构建一个可控的合成路径规划环境,将最短路径求解视为可组合序列优化任务,通过空间迁移(新地图)和长度扩展(更长路径)两个维度,独立控制训练数据构成、监督微调(SFT)与强化学习(RL)训练范式,以及推理时采样策略。
  • 关键结果:模型在完全未见的地图上能实现超过 90% 的成功率(见论文图 1),但在路径长度超出训练范围时性能急剧下降;长度扩展失败的主要原因是递归组合不稳定,而非子问题累积失败(见表 1)。
  • 主要局限:所有结论均来自一个受控合成场景和相对较小的模型,作者承认这牺牲了现实复杂度以换取控制性和可解释性,实际大规模通用任务中的适用性有待验证(见附录 A)。
  • 适合读者:对语言模型的组合泛化、训练数据构建、强化学习在推理任务中的作用,以及推理扩展性感兴趣的机器学习研究者和工程师。

论文背景和研究动机

大语言模型(LLM)能否进行系统性泛化,即能否将学到的规则重新组合并应用于未见过的情境,是目前争议的焦点。实际模型在推理基准上的表现受训练数据、训练范式(SFT 或 RL)以及推理时策略(如自洽性采样)等多重因素共同影响,这使得对泛化失败的归因变得极为困难。自然语言基准通常无法清晰控制训练与测试分布之间的差异,例如我们很难判断测试任务是需要全新技能,还是仍能通过训练中见过的模式解决。

为克服上述挑战,本文引入了一个基于最短路径规划的受控合成环境。最短路径是一个典型的可组合序列优化问题(Composable Sequential Optimization Problem):某个中间节点的最优路径可以表示为两个子路径的最优拼接。该设定天然支持两种泛化维度:空间迁移(在完全不相交的地图上求解)和长度扩展(求解比训练样本更长的路径)。通过该环境,作者可以独立变化训练数据属性、训练范式和推理时策略,从而分离各因素的影响,并直观分析失败模式。

核心方法和技术细节

问题形式化与测试指标

将地图建模为图 G=(V,A)G=(V,A),路径由运动方向序列(东 E、西 W、南 S、北 N)表示。模型的训练数据由提示前缀 <s> i j : 和答案(方向序列)组成。评估时,模型仅接收提示前缀,需生成完整的最短路径。泛化度量使用路径是否属于有效最短路径集合的成功率(SR)。

空间迁移测试要求训练集与测试集的起点-终点对完全不相交,且测试图与训练图在节点、边、稀疏性或大小上均不重叠。长度扩展则额外要求所有测试对的路径长度严格大于训练集中出现的最大长度。对于长度扩展失败的分解分析,将长路径拆分为两个训练长度内的子路径,计算联合条件概率,以区分 “困难累积” 和 “组合不稳定”。

训练设置

实验训练 8 层 8 头的 LLaMA 架构 Transformer,经过大量随机游走预训练以注入地图语义。预训练阶段完全避免最短路径信息,仅让模型学习邻接关系。随后通过两种范式进行最短路径微调:

  • SFT:使用标准交叉熵损失,并排除提示部分的损失。
  • RL:采用无偏 GRPO 变体 Dr.GRPO,奖励信号为生成路径是否是有效最短路径(二值奖励),在 SFT 热身基础上进行训练,变化每次提示的采样数(4, 8, 16)。

数据属性控制

为研究训练数据预算的分配,定义了覆盖率(Coverage) 和多样性(Diversity):

  • 覆盖率 cc:训练地图中出现过的节点比例(c=∣Vtrain∣/∣V∣c = |V_{\text{train}}| / |V|),衡量接触到的原语广度。
  • 多样性 dd:每个起点平均配对的不同终点数(d=∣supp(Dtrain)∣/∣Vtrain∣d = |\text{supp}(\mathcal{D}_{\text{train}})| / |V_{\text{train}}|),衡量原语组合的丰富程度。

通过固定训练总记录数,变化不同的问题数量(唯一起点-终点对)与每个问题的答案数量(有效路径数),可以独立考察这两者的影响。

创新点和贡献

  1. 构建了可组合序列优化问题的严格测试床,能够独立且定量地评估空间迁移和长度扩展两种泛化能力,解决了自然基准中混淆因素的难题。
  2. 首次量化揭示了训练数据的影响边界:模型的空间迁移天花板由覆盖率决定,一旦超过最低多样性阈值,额外多样性几乎不带来收益,且低覆盖率无法通过高多样性弥补(见图 3、图 12)。
  3. 明确了长度扩展失败的本质:不是子路径错误累积,而是模型的递归组合不稳定,即即使子路径各自可解,模型也无法稳定拼接成长路径(表 1)。
  4. 系统对比了 SFT 和 RL 的作用:RL 能稳定训练、防止过度拟合,但无法超越最佳 SFT 的上限;推理时采样策略(如最短路径选择)可以提高性能,但同样不能挽救长度扩展失败(图 5–7)。
  5. 将合成环境的结论迁移至数学推理领域,在 MathQA 数据集上验证了 “更多问题优于更多答案”“覆盖率比多样性更重要” 的实际有效性(表 2)。

实验结果分析

空间迁移的成功与数据驱动因素

模型能够稳健地空间迁移,即使在仅接触训练地图 20% 节点的情况下,平均 SR 仍可达 94%。固定训练预算下,将数据分配给更多不同的问题,比给同一问题提供更多解的价值高得多。当预算从仅 5% 提升到 80% 时,优先增加问题数量的曲线始终优于增加答案数量(图 2)。

覆盖率-多样性联合分析进一步显示:

  • 覆盖率 c≥32%c \ge 32\% 时,中等多样性(d=8d = 8–3232)即可使 SR 接近 0.90;而低覆盖率(c=4%c=4\%)下,即使 dd 指数增长,SR 也仅从 0.08 升至 0.29。
  • 过高的多样性在低覆盖率时反而不利,可能是因为组合的有限原语促使模型记忆而非抽象出规则(图 12)。

长度扩展的失败与补救

在最佳空间迁移配置下,长度扩展依然急剧恶化。如表 1 所示,当路径长度分组从 (20,30] 扩大到 (30,40] 时,全路径成功率从 0.774 降至 0.530,其中条件概率 Pr(Long∣Sub1∧Sub2)Pr(\text{Long} | \text{Sub}_1 \land \text{Sub}_2) 从 0.811 降至 0.589,贡献了主要的下降,而子路径联合成功率仅从 0.846 降至 0.796。这意味着组合不稳定性是主因。

有趣的是,在训练集中混入极少量稍长于目标长度的路径(如长度 32 和 34)可将目标长度 30 上的 SR 提升至近 90%,而加入更短或过于长的路径则无显著帮助甚至有害(图 4)。这表明 SFT 需要 “临近长度” 的课程式曝光来获得递归适应能力。

SFT 与 RL 的攻守之争

RL 在所有长度组上都未能超越 SFT 的峰值性能(图 5、图 6)。SFT 随着训练步数增多会过拟合,性能先升后降;而 RL 在长期训练中保持稳定,但始终无法突破最佳 SFT 设定的上限。推理时,通过 shortest‑of‑10 等策略可以提升 SR,但并不能扭转长度扩展的下降趋势,且 RL 模型的提升幅度始终低于 SFT(图 7)。这表明 RL 可能限制了模型的有效解空间,而非解锁新的泛化能力。

数学领域验证

在 MathQA 的三个难度类别上,将训练样本分配给更多问题(高覆盖率或高多样性)均优于多个答案,且高覆盖率(即覆盖更多不同的操作集合)效果明显好于高多样性。例如在中等难度的 “增益” 类别上,高覆盖率将准确率从 0.70 提升至 0.82,而高多样性仅提升至 0.74(表 5)。这呼应了合成环境中的关键结论:在有限预算下,广覆盖优先于深组合。

实践建议

基于上述发现,为涉及序列优化或组合推理任务的 LLM 训练和部署提供以下实践建议:

  1. 数据预算优先分配给不同问题,而非同一问题的多个解。尤其在解生成成本较高时(如数学、编程),每个问题一个高质量解即可,将资源投入扩展问题多样性(图 2、表 2)。
  2. 构建训练集时,优先保证概念单元(原语)的高覆盖率。覆盖率决定了系统泛化的天花板;应在合理范围内尽可能纳入多样化的基础元素或技能集合(图 11)。
  3. 多样化只需达到必要的最低水平。对于每个概念,提供少量不同的组合模式(如 4–32 种)就足以解锁泛化潜力,过度丰富在数据稀缺时反而有害(图 12)。
  4. 若需模型处理更复杂的任务(更长推理链),应在训练数据中加入少量 “稍长于当前训练长度” 的实例,而非不加选择地加入极端长样本或大量短样本(图 4)。
  5. RL 通常不能替代良好的数据构建。若已有高质量多样化数据,SFT 往往能达到更高的性能上限;RL 可作为稳定训练和防止过拟合的备选手段,但不应寄望于其带来全新的泛化突破(图 5–7)。
  6. 推理时策略(如自洽性或最短路径选择)可作为性能增强器,但不能依赖它们挽救根本性的模型缺陷,尤其是需要递归组合的长链推理场景(图 7)。

这些原则在数学推理等真实任务中已初步得到验证,可指导训练数据的设计和训练范式的选择。