无需真实答案的强化学习能够提升大语言模型
Reinforcement Learning without Ground-Truth Solutions can Improve LLMs
论文信息
标题: Reinforcement Learning without Ground-Truth Solutions can Improve LLMs
作者: Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, et al.
发布日期: 2026-06-25
arXiv ID: 2606.27369v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决的是,如何在没有标准答案(ground-truth solutions)的优化任务(如算法设计竞赛)中,通过强化学习有效训练大语言模型(LLMs),并让这种能力泛化到有标准答案的编程任务上。
- 核心方法:提出 RiVER(Ranking-induced VERifiable)框架,通过将模型生成的多个候选解在同一测试实例上执行并比较得分,得到实例内排名,然后使用 “胜者重奖”(winner-heavy)的奖励塑造机制,来为策略梯度优化提供稳定、无偏的反馈信号。
- 关键结果:在仅使用无标准答案的优化任务训练下,RiVER 在两个基座模型(Qwen3-8B 和 GLM-Z1-9B-0414)上,不仅将算法竞赛基准 ALE-Bench 的评分分别提高了 142 分和 157 分,还让模型在需要精确解的编程基准(LiveCodeBench 和 USACO)上的平均准确率分别提升了 2.4 和 3.5 个百分点(见表 1)。
- 主要局限:论文的局限在于,训练仅基于 12 个 AtCoder 启发式竞赛任务,其结论在更大规模或完全不同类型的优化任务上的普适性尚未得到验证。此外,方法本身要求任务必须有可执行的、能提供客观值反馈的评估器,这限制了其应用范围。
- 适合读者:对大型语言模型强化学习、代码生成、算法设计以及如何利用无标签数据进行模型训练感兴趣的研究者和工程师都值得阅读。
论文背景和研究动机
当前,强化学习与可验证奖励(RLVR)是提升大语言模型(LLM)推理能力的核心技术范式。它通过在数学题或编程题中比对模型输出与已知标准答案来进行奖励,通常是一个二元的 “对/错” 信号。然而,这种范式在面对算法设计、组合优化等没有单一标准答案、只有相对好坏的任务时便束手无策。例如,在规划城市交通或设计芯片布局时,可以存在一个或多个可行解,但很难找到 “唯一正确” 的解,最优解甚至是未知的。
这篇论文的核心洞察在于,许多这类 “无标准答案” 的优化问题其实仍然是可验证的:我们可以通过一个确定性执行环境来运行模型生成的方案,检查其是否满足约束条件(可行性),并获取一个反映其质量的客观值(objective value)。这为训练提供了一个丰富且无需人工标注的反馈来源。然而,直接使用这些原始客观值(raw objective scores)作为强化学习的奖励信号是不稳定的,因为它存在两个关键挑战。
- 尺度主导(Scale Dominance):不同测试实例的得分范围差异巨大(例如,一个实例的得分在几千分波动,而另一个只在几十分波动),直接取平均值会让大尺度实例的噪声主导整个梯度更新。
- 频率主导(Frequency Dominance):在群体相对策略优化(GRPO)中,一个常见的次优策略(比如一个带有微小参数变化的常用算法模板)可能被反复采样,其累积梯度贡献甚至会超过一个只被采样到一次的、真正更优的策略。
为了解决这些问题,这篇论文提出了 RiVER (Ranking-induced VERifiable) 框架,旨在将未经校准的执行反馈转化为稳定、可迁移的强化学习信号。
核心方法和技术细节
RiVER 框架的核心思想不是让模型去拟合一个未知的最优解,而是通过 “比较” 当前采样的多个候选解的相对优劣来生成学习信号。它通过以下三个关键步骤构建奖励。
1. 基于实例的排名(Instance-wise Ranking)
对于每个提示词(prompt),模型会采样 个候选解(可执行程序),并在 个隐藏的测试实例上运行它们。在同一个测试实例内部,我们根据所有 个候选解的客观得分(objective score)对它们进行排序。这样一来,奖励信号(排名)就彻底摆脱了跨实例的绝对尺度差异。无论一个实例的得分范围是多宽,模型学到的永远是 “在当前这个实例上,哪个解的表现相对更好”。
2. 胜者重奖的奖励塑造(Winner-heavy Reward Shaping)
为了防止 “频率主导” 问题,即反复出现的次优解法获得过多奖励,RiVER 采用了非均匀的奖励映射(公式 5)。具体来说,对于一个实例:
- 无效解(程序崩溃、超时等):获得 -1 的奖励。
- 最佳有效解(排名第一):获得 1 的奖励。
- 其他有效解:根据其排名,获得一个被压缩在 区间的系数化奖励。
这种设计清晰地剥离了最佳解,并弱化了其他非获胜解的奖励密度。它保留了非获胜解之间的相对质量信息,但确保了多次采样到的次优行为体不会在总体更新中压倒那个稀有的、更优的策略(见论文第 4.2 节公式 4 的分析)。
3. 聚合与 GRPO 更新
最后,对于每个候选解 ,将其在 个实例上得到的塑造奖励()进行平均,得到最终的优势估计 。这个值随后被送入标准的 GRPO 算法(公式 3)中进行策略梯度更新。由于奖励本身是有界的,RiVER 不再需要额外的奖励标准化步骤。
隐藏测试实例的作用
需要强调的是,RiVER 利用的隐藏测试实例不同于最终评测基准。在训练时,模型会基于这些实例的执行反馈来学习如何生成更好的解,但它从未见过这些实例的 “标准解法” 或 “最优值”。这正是 “无需标准答案” 训练的核心。
创新点和贡献
- 拓展了 LLM 的强化学习疆界:RiVER 首次系统性地证明,不依赖任何标准答案,仅仅通过算法竞赛风格的、可执行、可评分的优化任务进行训练,就能稳定提升 LLM 的通用编程能力。这意味着优化问题本身可以作为极佳的训练环境。
- 识别并解决了连续奖励的两大难题:论文提炼出 “尺度主导” 和 “频率主导” 这两个在无标准答案的强化学习中特有的挑战,并通过 “实例内排名” 和 “胜者重奖” 这两个简洁的设计机制加以化解。这为后续的研究提供了明确的指引和理论基础。
- 揭示了 “正确校准” 重于 “密集反馈”:实验结果明确显示,直接使用原始执行得分(Raw-GRPO)的基线方法尽管能提升在评分制基准(ALE-Bench)上的表现,但这些增益无法迁移到精确匹配的编程基准(LiveCodeBench, USACO)上(见表 1)。只有当奖励信号经过 RiVER 的排名和重奖校准后,模型才获得了可迁移的编程能力。这证明了奖励信号的质量比密度更关键。
- 提供了信息论视角的理论支撑:论文从反馈分辨率(group-relative feedback resolution)的角度,利用 Rényi 熵,解释了为何评分制环境能比二元验证器提供更丰富的学习信号,并有效降低了在采样组内所有反馈都一样的 “反馈坍塌” 概率(见命题 6.2)。
实验结果分析
论文使用从 AtCoder 启发式竞赛(AHC)中选取的 12 个无标准答案的优化任务,对 Qwen3-8B 和 GLM-Z1-9B-0414 两个先进推理模型进行了后期训练。
评分制基准上的表现
在算法工程基准 ALE-Bench 上,RiVER 展现出了统治级性能。
- 在 Qwen3-8B 基座上,RiVER 将 ALE 评级从 845 提升到 987(+142 分),排名百分位从 86.4% 显著降低到 77.5%(越低越好)。
- 在 GLM-Z1-9B-0414 基座上,评级从 805 提升到 962(+157 分),排名百分位从 88.2% 降低到 78.8%。
相比之下,直接优化原始分数的 Raw-GRPO 基线虽然也有提升(例如 Qwen3-8B 上提升到 903 分),但幅度远不及 RiVER。
泛化到精确解基准上的表现
这是论文结果中最令人兴奋的一点。尽管训练时从未见过任何标准答案,RiVER 训练出的模型在需要输出完全正确代码的 LiveCodeBench(LCB)和 USACO 基准上,均取得了一致性的提升。
- 在 Qwen3-8B 上,RiVER 在 LCB v5、LCB v6 和 USACO 上的平均 pass@1 准确率相比基座模型绝对提升了 2.4 个百分点(见表 1)。
- 在 GLM-Z1-9B-0414 上,平均准确率绝对提升了 3.5 个百分点。
而所有基于原始分数或未使用 “胜者重奖” 的基线方法(如 Raw-GRPO, Rank-uniform),在这些精确解基准上的表现与基座模型持平,甚至出现了下降。例如,Qwen3-8B 在训练 Raw-GRPO 后,USACO 的准确率从基座的 40.4% 降至 40.2%,几乎没有变化。这强有力地证明了 RiVER 的奖励校准机制是实现可迁移能力的关键。
难度分析
对 LiveCodeBench 的难度细分分析显示,RiVER 带来的增益主要集中在中、难题上,而不是模型已经掌握得非常好的简单题(准确率已超 93%)。这表明,在无标准答案的优化任务上的训练,实质性地提升了模型处理复杂推理问题的能力。
实践建议
RiVER 框架为工业界和学术界提供了一个极具成本效益的 LLM 能力提升路径。
- 构建无标注训练环境:对于拥有复杂系统(如编译器优化、数据库查询优化、物流规划)的企业,可以根据 RiVER 的理念,构建一个不依赖最优解的、基于确定性反馈(如延迟、成本、吞吐量)和执行约束检查的 可验证训练沙盒。这能将昂贵的专家标注成本降为零。
- 实施 “胜者重奖” 策略:在基于群体反馈(如 GRPO)的模型训练中,工程师应避免简单地平均原始性能指标。更推荐的做法是:
- 样本内归一化:永远只在同一次实验/实例的条件下去比较生成的多个候选方案。
- 压平非赢家奖励:缩小非最优方案的奖励差距,创建 “二进制 + 分级” 结合的奖励结构。这可以有效避免模型陷入局部最优和模式坍塌。
- 谨慎对待原始指标:直接优化系统性能的原始指标(如绝对 QPS、绝对延迟)可能引入巨大的尺度噪声,导致模型学习到迎合特定量级输入而非掌握通用技能的捷径。我们的实践表明,经过排名变换的相对指标,是比原始绝对指标更优秀的学习目标。
- 评估训练信号的迁移性:在部署此类方案前,应建立一套覆盖不同性质任务的评估集。用评分制任务进行训练,不但要监控其在同类任务上的提升,更要关注其在精确解任务上的表现,以确认模型学到的是真正的通用能力,而非 “刷榜” 技巧。