基于无真实解强化学习提升大语言模型

arXiv: 2606.27369v1

论文信息

标题: Reinforcement Learning without Ground-Truth Solutions can Improve LLMs

作者: Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, et al.

发布日期: 2026-06-25

arXiv ID: 2606.27369v1

PDF 链接: 下载 PDF

背景与研究动机

大型语言模型的后训练阶段,强化学习与可验证奖励(RLVR)已成为提升推理能力的关键范式。传统 RLVR 依赖标准答案的匹配:若模型输出与已知答案一致或通过单元测试,则赋予二元奖励。这种模式在数学和编程任务中效果显著,却将可验证性狭隘地限定为 “是否存在唯一标准解”。许多重要的工程问题,如算法设计、组合优化和规划,通常没有单一正确答案,存在大量可行解,且最优解往往未知或难以计算。这些任务虽不具备标准答案,却依然可通过执行环境进行验证:候选解能被运行,检查可行性,并通过目标函数进行相对优劣比较。

本文研究的问题是:能否利用这类无标准答案的可验证环境,产生有效的训练信号,提升 LLM 的通用编码与推理能力?作者聚焦于开放的、基于得分的算法工程竞赛,如 AtCoder 启发式竞赛。在这些任务中,模型需编写程序来生成高分的近似解,环境仅提供约束检查和目标函数评价,不提供任何参考程序、黄金输出或已认证最优解。这一设定将优化任务转化为可扩展的监督来源:模型无需知道最优解,只需在采样组中比较哪一个解更好。

将原始的连续型得分直接用作强化学习的奖励并不充分。作者识别出两个关键挑战。其一,尺度主导(scale dominance):不同测试实例上的原始得分量级差异巨大,若直接聚合,量级大的实例会主导策略更新,与解的相对质量无关。其二,频率主导(frequency dominance):在群体相对学习中,反复出现的次优解模式(如常见启发式模板的多种变体)会累积更多的梯度贡献,而稀有但更强的解反而得不到足够的强化。这些问题导致原始得分奖励即便能提升基于得分的评测,也无法迁移到精确答案基准上。

核心方法:RiVER 框架

RiVER(Ranking-induced VERifiable reinforcement learning)将得分型优化任务转化为稳定的策略梯度信号,其核心包含三个步骤。

实例内排序。 对于每个隐藏测试实例,对同一组内的候选求解器按得分排序,无效解被单独处理并赋最低奖励。有效解采用平均并列排名:若多个解得分相同,它们占据并列位置的中位数排名。由于排序在每个实例内独立进行,任意对得分值的单调变换都不会改变排名,这彻底消除了实例间得分量级差异的影响,从而克服尺度主导问题。

胜者加权奖励塑性。 单纯将排名线性映射为奖励,仍然使相邻排名获得同等差异,未突出最优解。RiVER 采用如下非对称塑造:

si,m={1,若无效1,若有效且排名第一clip ⁣(G1ri,mG3,0,1)0.5,其他有效解s_{i,m} = \begin{cases} -1, & \text{若无效} \\ 1, & \text{若有效且排名第一} \\ \operatorname{clip}\!\left(\frac{G-1-r_{i,m}}{G-3},\,0,\,1\right) - 0.5, & \text{其他有效解} \end{cases}

其中 GG 为组大小,ri,mr_{i,m} 为实例 mm 上求解器 ii 的排名。该设计将最优解明确分离,给予最高奖励 11,无效解给予 1-1,其余有效非胜者获得有界的渐变反馈(介于 [0.5,0.5][-0.5, 0.5])。这一策略保留了有效解间的相对信息,却制造了 “胜者” 与 “其他” 之间的显著间隔,有效缓解了频率主导:即便某个次优模式被频繁采样,其累积奖励也难以超过稀有但最强解的优势贡献。

聚合与 GRPO 更新。 将每个求解器在所有隐藏实例上的塑性奖励平均,得到 sˉi\bar{s}_i,并将其直接作为 GRPO 中的优势值 A^i\hat{A}_i。由于 sˉi\bar{s}_i 本身已被约束在合理范围,无需额外标准化。GRPO 原本的裁剪目标和 KL 正则化保持不变,只是二元或原始得分的奖励被替换为上述基于排名且胜者加权的优势。

整个框架的关键在于:它不需要标准答案,不关心得分绝对大小,重点比较同一组内样本的相对质量;它通过实例内排序实现尺度不变性,通过胜者侧重减少频繁模式的影响,从而产生平稳且可迁移的学习信号。

创新点与贡献

RiVER 的主要贡献在于突破了 RLVR 对标准答案的依赖,将可验证性扩展至 “相对可验证” 的广义设定。具体创新包括:

  1. 无标准答案的可验证强化学习环境设计:首次系统研究如何利用纯得分优化任务(无需任何参考解)为 LLM 提供有效训练信号。证明该类任务不仅是评测基准,也是改善通用编码能力的训练环境。

  2. 识别并解决原始得分的两大失效模式:形式化描述了尺度主导和频率主导现象,揭示了为何直接用原始执行得分进行强化学习会导致性能迁移失败。

  3. 维度归一化与组合优势塑造:提出实例内排序消除尺度差异,结合胜者加权奖励策略平衡探索与利用,既保留非胜者行为的信息,又突出强化最强解。

  4. 理论与实验结合的信息论视角:引入群组反馈分辨率(GFR)的概念,基于 Rényi 熵度量环境区分样本的能力,为构建有用训练环境提供了定量准则。实验表明,RiVER 不仅提升了基于得分的算法工程评测,还在 LiveCodeBench 和 USACO 等精确解基准上取得了平均 2.4% 和 3.5% 的绝对提升,而所有使用原始得分的基线无法实现这种迁移。

实验结果分析

实验选用 Qwen3-8B 和 GLM-Z1-9B-0414 作为基础模型,在 12 个 AtCoder 启发式竞赛任务上训练,然后在 ALE-Bench(基于得分的算法工程评测)、LiveCodeBench v5/v6 和 USACO(精确解基准)上评估。

得分型基准:RiVER 将 Qwen3-8B 的 ALE 评分提升 142 分,GLM-Z1-9B 提升 157 分,排名百分位分别下降 8.9 和 9.4 个百分点(越低越好)。相比之下,Raw-GRPO 等直接优化原始得分的基线也能提升评分,但幅度较小,且无法在精确解基准上保持正迁移。

精确解基准:RiVER 使两个模型在 LiveCodeBench 和 USACO 上的平均准确率分别提高 2.4 和 3.5 个百分点。值得注意的是,这些提升集中在中等和困难问题上,基础模型已基本饱和的简单问题变化甚微。这表明训练使模型获得了处理复杂推理的能力,而非简单巩固已有技能。

消融研究:仅做实例内归一化或均匀排名奖励的方法虽能提高 ALE 评分,但在精确解基准上收益甚微甚至退化。增加胜者加权后,ALE 评分进一步上升,且实现了向精确解任务的稳定迁移。这验证了奖励校准的重要性:丰富的得分反馈必须经过恰当的维度归一化和塑性才能转化为可迁移的编码行为。

案例分析:通过代码检查发现,RiVER 学到的求解器在启发式分组时更适应实例几何,采用动态最近邻聚集而非固定种子挑选,从而降低了组内连接成本。这说明了好的奖励塑性能引导模型发展出更强的算法设计策略。

实践应用建议与未来发展方向

对强化学习训练的启示

  1. 拓宽训练数据来源:对于难以获取标准答案的领域(如工程设计、资源调度、程序合成),可以利用可执行的环境和相对比较生成训练信号,降低人工标注成本。

  2. 奖励设计原则:避免直接使用原始度量值。应采用实例内相对排序,并结合 “胜者强化” 策略,防止高频次优模式淹没稀有高质量解。可参照 RiVER 的三步流程进行校准。

  3. 探索与利用平衡:群组相对学习天然鼓励多样性,但需通过奖励形状控制更新方向。RiVER 的 bounded non-binary 反馈保留了对所有有效行为的温和引导,有助于防止策略过早坍缩。

未来研究展望

  • 更丰富的反馈形式:当前方法仅使用标量得分,未来可引入向量型反馈(如多目标优化中的帕累托前沿信息),提升群组反馈分辨率。
  • 动态难度调节:结合自适应环境,根据模型当前能力调整任务难度,使学习信号始终保持信息量。
  • 跨任务迁移机制:研究在多任务优化环境中共享表示,进一步提高通用推理能力。
  • 与过程奖励结合:将排名信号分解到推理步骤,实现更细粒度的信用分配,从而提升长链推理的效率。

总结与展望

RiVER 工作重新定义了 LLM 强化学习中的 “可验证性” 边界,证明了即便没有标准答案,通过精巧的奖励校准,基于得分的优化任务也能成为提升通用编码能力的有效训练环境。该方法不仅在目标领域内获得显著性能提升,更令人振奋地迁移到了传统的精确解基准上。这一发现预示着,未来 RLVR 将不再局限于数学证明和单元测试,而能拓展至广阔的现实世界决策与设计问题,推动机器学习从 “寻找唯一正确答案” 迈向 “在开放空间中追求更优解” 的新阶段。随着环境设计、奖励塑造和跨任务泛化技术的不断进步,我们有望构建出更自主、更具创造性的智能系统。