探索智能体的推理奖励模型

Exploring Reasoning Reward Model for Agents

arXiv: 2601.22154v1

论文信息

标题: Exploring Reasoning Reward Model for Agents

作者: Kaixuan Fan, Kaituo Feng, Manyuan Zhang, et al.

发布日期: 2026-01-29

arXiv ID: 2601.22154v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:智能体强化学习虽有进展,但主流方法仍依赖仅看最终答案正确与否的稀疏奖励,无法区分中间推理步骤的质量高低,导致训练效果不佳。
  • 核心方法:论文提出了名为 Agent-RRM 的多维奖励模型,能生成包括分析性的 “思考过程”、精准的 “改进批评” 和一个 “整体分数” 的结构化反馈。基于此,作者探索了文本修正、奖励指导和统一融合三种策略来训练名为 Reagent 的智能体模型。
  • 关键结果:统一融合策略(Reagent-U)表现最佳,在 GAIA 测试集文本子集上达到 43.7%,在 WebWalkerQA 上达到 46.2%,在多个基准上超越了同等规模的开源模型(见表 1)。
  • 主要局限:实验主要集中在 80 亿参数规模的模型上,其在更大规模模型上的扩展性尚待探索。此外,当前任务环境仍为标准化的基准测试,在更开放、工具更复杂的现实世界应用中的适应性需要进一步验证(见论文第 6 节)。
  • 适合读者:对如何训练能使用工具、执行多步推理的 AI 智能体感兴趣,特别是在强化学习中设计更好奖励函数的研究者和工程师。

论文背景和研究动机

强化学习虽在提升大语言模型推理能力上成果斐然,如 DeepSeek-R1 等,但当应用到需要与外部环境、工具进行多轮复杂交互的智能体时,其局限性便暴露出来。传统的智能体强化学习方法,极度依赖基于最终结果的稀疏奖励:任务完全做对给正反馈,做错就全盘否定。这种 “非黑即白” 的二元评价方式,对于包含多个步骤、使用多种工具的长期任务而言,是一种糟糕的教学策略。它将一个仅在最后一步失败的优秀轨迹与一个完全胡言乱语的轨迹等同视之,完全忽视了中间高质量推理步骤的价值,导致智能体难以准确学习,容易在错误路径上迷失。

为了解决奖励信号的稀疏问题,研究者们开始尝试引入过程奖励模型。然而,现有方法仍面临两大瓶颈:一是细粒度的步骤级奖励标注成本高昂,且容易被智能体通过 “奖励黑客” 行为钻空子;二是许多基于推理的奖励模型只关注成对偏好比较,不仅可能引入偏差,也无法提供足以指导智能体改进的具体、可操作的文本批评。论文正是在此背景下,试图构建一个能提供多维度、结构化反馈的奖励模型,并系统性地探索如何将这些丰富信号有效地融入智能体的强化学习训练中。

核心方法和技术细节

论文的核心贡献在于构建了一个名为 Agent-RRM 的多维奖励模型,并设计了一套名为 Reagent 的训练方案来利用其反馈。

多维奖励模型 (Agent-RRM):与仅输出一个分数的传统奖励模型不同,Agent-RRM 为智能体生成的整个行动轨迹提供包含三个部分的结构化反馈:

  1. <think> (思维过程):模型首先进行显式推理,剖析轨迹中的逻辑一致性、工具调用是否恰当等,相当于展示它的 “评分依据”。
  2. <critique> (改进批评):精准指出轨迹中具体的推理缺陷或执行错误,如 “第 3 步调用了错误的搜索 API” 或 “忽略了上一步获得的关键信息”,为智能体提供明确的改进方向。
  3. <score> (整体分数):基于上述分析,给出一个在 [0,1][0, 1] 区间内的整体质量评分,量化该轨迹的好坏。

Agent-RRM 的训练采用两阶段法:首先在一个包含 28,000 条人工标注结构化判断的数据集上进行监督微调,使其掌握输出格式和基础评价能力;随后在一个 90,000 条的强化学习数据集上使用 GRPO 算法进一步优化,使其评价理由更准、分数校准得更好。

Reagent 的三种整合策略:基于 Agent-RRM 提供的多维反馈,论文系统性地研究了三种策略来训练名为 Reagent 的智能体模型,基础模型均为 Qwen3-8B:

  1. Reagent-C (文本增强修正):这是一种即插即用、无需训练的推理时优化方法。当智能体首次回答失败时,Agent-RRM 给出文本批评,智能体再根据这个批评重新作答。这直接测试了文本批评的有效性。
  2. Reagent-R (奖励增强引导):此策略将有模型的奖励分数 RmodelR_{model} 与传统的规则奖励 RruleR_{rule} 相结合,构成新的奖励信号:Ri=Rrule(q,oi)+λ⋅Rmodel(q,oi)R_{i}=R_{rule}(q,o_{i})+\lambda \cdot R_{model}(q,o_{i}),其中 λ\lambda 是平衡因子(论文设为 0.3)。它缓解了纯粹结果奖励的稀疏性,为推理过程本身提供信号。
  3. Reagent-U (统一反馈整合):这是效果最佳的深度融合策略。在每次强化学习迭代中,智能体先生成一个初次回答,接着得到 Agent-RRM 的批评,然后基于该批评再生成一个修正后的回答。两个回答被放入同一个竞争池,通过合并规则奖励和模型奖励计算各自的优势 Ai(k)A_{i}^{(k)},并统一在 GRPO 框架下进行优化。这使智能体在训练中同时学习 “一次答对” 和 “根据反馈修正错误” 的能力。

创新点和贡献

论文的主要贡献体现在以下几个方面:

  1. 提出结构化奖励模型:Agent-RRM 不单单是一个 “打分器”,更是一个能给出 “诊断报告和修改建议” 的评估者,它将标量奖励与文本批评结合,提供更透明、更细致的监督信号。
  2. 系统性整合探索:论文清晰地提出并验证了 Reagent-C、Reagent-R 和 Reagent-U 三种整合路径,为如何有效利用多维反馈训练智能体提供了一份完整的 “路线图”,这在先前研究中是缺乏的。
  3. 数据集贡献:作者整理并公开了四个高质量数据集,覆盖数学、多模态、网络搜索和复杂工具使用场景,总计包括 55,600 条监督微调轨迹和 709,000 个用于强化学习的问题-答案对,以及 118,000 条用于奖励模型训练的标注数据,为社区提供了宝贵资源。

实验结果分析

论文在 12 个多样化基准上进行了详尽评估,结果验证了其方法的一致优越性。

文本批评的有效性:Reagent-C 在未修改任何模型参数的情况下,通过 Agent-RRM 的文本批评进行二次作答,在多个任务上取得了稳定提升。特别是在数学推理任务中效果显著,这证明了 Agent-RRM 的诊断能力能够精准捕捉到逻辑谬误和工具执行错误,并给予有效修正指导。

模型奖励的补充作用:Reagent-R 在所有基准上一致超越了仅使用稀疏结果奖励的基线模型(Reagent w/o Agent-RRM)。例如在 Bamboogle 上,Reagent-R 达到了 72.8%,比基线(61.6%)高出 11.2 个百分点(表 2),这有力证明了密集的模型奖励能为复杂推理场景提供更丰富的信息。

统一整合的协同效应:Reagent-U 取得了最高性能,在通用智能体任务 GAIA 文本子集上录得 43.7%,WebWalkerQA 上录得 46.2%,且在与更大型号模型(如基于 Qwen3-14B 的 ARPO)的比较中也毫不逊色(表 1)。尤其是在 GAIA 包含多模态任务的完整集上,Reagent-U 的表现(pass@1 为 38.8%)也明显优于仅用文本训练的基线,证明了其跨模态和异构工具使用的泛化能力(表 3)。

参数敏感性分析:对于式(6)中的权重因子 λ\lambda,实验表明当其在 [0.2,0.4][0.2, 0.4] 区间内时性能达到平台期,λ=0.5\lambda=0.5 时则略有下降。这说明适度的过程奖励至关重要,权重过高会过度强调中间步骤而损害最终任务完成的目标(图 3)。

实践建议

对于希望将本研究成果应用于工程实践的团队,以下建议可供参考:

  1. 奖励模型可作为 “诊断器” 直接提升推理质量:即使不进行昂贵的 RL 训练,也可以效仿 Reagent-C 的模式,将 Agent-RRM 作为在线推理流程中的一道反思工序。当智能体的初始行动轨迹被判为低分时,将其生成的 <critique> 作为附加提示词,让智能体进行二次修正,这能以极小成本带来性能提升。
  2. 设计迭代式的统一训练闭环:Reagent-U 的成功(表 1, 表 2)表明,将 “首次执行” 和 “基于反馈修正” 两个阶段联合训练,能促使模型内化强大的自我纠错能力。在开发智能体产品时,应考虑设计类似的双阶段训练数据采集和强化学习循环,这不仅能提升正确率,还能让模型学会更稳健的推理模式。
  3. 奖励信号的平衡是关键:从 λ\lambda 参数的分析(图 3)中可以看到,过程性奖励和结果性奖励的平衡至关重要。在实践中,不应迷信过程奖励,需根据具体任务对最终结果和中间过程逻辑性的侧重,谨慎地调整二者权重。若任务对最终答案容错率极低(如金融计算),可适当增加结果奖励权重(减小 λ\lambda);若任务更看重推理过程的合理与可解释性(如法律文书辅助),则可适当增加过程奖励权重。