生成式对抗推理器:利用对抗强化学习增强大语言模型推理
Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
论文信息
标题: Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
作者: Qihao Liu, Luoxin Ye, Wufei Ma, et al.
发布日期: 2025-12-18
arXiv ID: 2512.16917v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:本文旨在解决大语言模型在数学推理中仍频繁出现过程性错误(计算失误、逻辑缺陷、看似合理但无效的步骤)的难题,同时绕过昂贵且易出错的人工步骤标注。
- 核心方法:提出 GAR(Generative Adversarial Reasoner),通过对抗强化学习同时训练一个 LLM 推理器和另一个 LLM 判别器;推理链被切分为逻辑完整且长度相近的切片,判别器对每个切片给出 0/1 评分与简短理由。
- 关键结果:在 AIME24 测试中,将 DeepSeek‑R1‑Distill‑Qwen‑7B 的准确率从 54.0 % 提升至 61.3 %(+7.3),DeepSeek‑R1‑Distill‑Llama‑8B 从 43.7 % 提升至 53.7 %(+10.0),且训练时间未明显增加(表 1、表 3)。
- 主要局限:判别器的推理深度与训练效率之间的平衡仍有改进空间;切片级奖励最终被平均为轨迹级信号,可能稀释局部贡献、增大方差(附录 F)。
- 适合读者:对 LLM 推理强化学习、过程监督、对抗训练感兴趣的研究者与工程师,以及从事数学推理或代码生成落地开发的从业者。
论文背景和研究动机
大语言模型在数学推理任务上已展现出接近专家的能力,但即使经过大规模数据训练,它们在解题过程中仍然会犯各种 “过程错误”——包括计算失误、逻辑不够稳固、产生表面合理但实际无效的论证,甚至出现重复或不连贯的推理步骤。 近年来,研究者尝试引入过程奖励模型,通过逐步骤的人工标注来提供细粒度监督信号,从而抑制这些错误。然而,精细的步骤级标注成本极高,且标注一致性难以保证,导致奖励模型容易出现过奖励或欠奖励的偏差。另一类方法使用 LLM 本身作为步骤评判器,成本较低,但判断结果往往带有噪声、不一致且区分力不足。 本文试图保留步骤级别的评判(称为判别器),但让它与推理器在统一框架下协同进化,从而以更低的标注成本生成有效的步骤级奖励,同时降低标签噪声与奖励误设的风险。
核心方法和技术细节
GAR 框架包含两个核心组件:一个负责产生推理过程的 “推理器” ,以及一个评估推理质量的 “判别器” ,二者通过对抗强化学习联合训练。
推理器:使用任意具备逐步推理能力的大语言模型,论文中以 DeepSeek‑R1‑Distill 系列的 7 B/8 B 模型作为骨干网络。
判别器:通常由一个较小的预训练模型(如 Qwen‑1.5B)构成。为了减轻判别器评估完整长推理链的困难,论文提出了一种计算高效的评审方案:将每个推理轨迹按换行符等天然分隔符切分,再合并相邻片段直到形成语义上完整且长度不超过约 320 个 token 的切片。判别器对每个切片输出一个二值评分 ,表示该切片逻辑是否严密。整个响应的切片级奖励 被定义为所有切片评分的平均。
奖励设计:
- 推理器的奖励由两部分线性组合:最终答案的精确匹配奖励 与切片级连续奖励 :(论文中 )。
- 判别器的奖励则包含两个互补项:
- 判别奖励 遵循 GAN 的经典目标,鼓励判别器区分参考切片和生成切片;
- 对齐奖励 衡量判别器对各切片判断与最终答案正确性之间的一致性,鼓励 “若答案正确则多数切片应被判为合理”。 判别器总奖励为 (,)。
训练流程:
- 先用少量数据对判别器进行监督微调,使其适应 “分析‑评分‑理由” 的格式(由 GPT‑o4‑mini 生成标注)。
- 然后使用 GRPO(Group Relative Policy Optimization)联合优化推理器和判别器。每批问题中,混合等量的生成切片与参考切片供判别器训练;推理器和判别器分别按各自的奖励目标更新。
- 为了节省计算,判别器的输出被限制在 128 个 token 以内:先简要分析,再给出 YES / NO 评分,最后附上简短解释。实验表明,这种截断几乎不影响最终效果,却显著提高了训练速度(表 3:截断后的训练时间与传统 RL 接近,而未截断的训练时间增加一倍以上)。
创新点和贡献
- 切片级评估机制:通过将长推理链在逻辑边界处切分为等长密集切片,把判别器的工作从 “整体判定” 简化为 “片段验证”,既降低了评估难度,又提供了可定位、可解释的反馈(表 2 中的例子可清晰看到判别器如何指出具体错误)。
- 同策略联合对抗训练:推理器与判别器在每次更新后都基于对方的最新状态重新采样,使奖励信号始终与当前策略对齐。随着推理器变强,判别器也学会捕捉更细微的逻辑漏洞,从而持续提供有区分度的步骤级奖励。这避免了静态奖励模型因策略漂移而失效的问题。
- 密集步骤级奖励补充稀疏结果信号:连续切片奖励 与仅依赖答案匹配的 相结合,让模型在最终答案错误时仍然能够区分推理质量的好坏路径,大幅改善了信用分配与样本效率。实验表明,仅使用切片判别器奖励对部分轨迹进行训练,就能以更少的训练时间超越标准 RL(表 5)。
- 灵活奖励塑形与迁移能力:模块化的判别器除了配合推理器,还可用于蒸馏教师模型的推理风格(表 6:将学生模型的推理风格向 Gemini 对齐,人类专家区分成功率从 82.3 % 降至 55.9 %)、偏好对齐以及数学证明等无需可验证最终答案的任务。
实验结果分析
论文在七个数学推理基准上进行了全面评估(AIME 2024/2025、MATH500、GSM8K、AMC23、LiveMathBench 等),并以 Pass@1 准确率(30 次平均)作为主要指标。
- 一致且显著的提升:无论基于 Qwen 还是 Llama 骨干,GAR 在所有基准上都取得了正增益,尤其在困难任务上表现突出。例如,在 AIME24 上,Qwen‑7B 的准确率从 54.0 → 61.3(+7.3),Llama‑8B 从 43.7 → 53.7(+10.0);在 LiveMathBench‑Hard 上,Qwen‑7B 提高了 6.5 个百分点。训练时间并未明显增加:标准 RL 训练 16 小时,GAR(带截断)约 19 小时(表 3)。
- 选择性熵而不坍塌:近期工作指出 RL 后训练的模型容易出现策略熵坍塌。但 GAR 训练后的模型全局平均熵仅从 5.27 % 微降至 5.20 %(图 3‑a),并且错误样本的熵分布更紧凑,极端低熵的错误更少(图 3‑b)。去除零熵 token 后,正确样本的平均熵反而更高(图 3‑c),说明 GAR 鼓励模型在确定性片段保持果断,而在决策关键片段保留探索,从而实现了更精准的校准。
- 消融实验:逐步验证了判别器设计、奖励项和联合训练的必要性(表 4)。单独的答案匹配 RL 已有一定提升(56.3),加入固定的判别器(经过指令微调为切片评判格式)提升至 58.6,进一步让判别器与推理器联合训练则达到 61.3。判别器自身的两种奖励(判别损失与对齐损失)各自有效,组合后效果最佳,表明二者互补。
- 部分轨迹训练效率:只生成三个推理切片后用判别器评估,禁止使用最终答案奖励,模型反而以更少的训练时间超越标准 RL(57.7 vs 56.3,训练时间 6 h vs 16 h,表 5)。这展示了 GAR 在无法获得可验证最终答案的任务(如开放域证明)上的潜力。
- 代码生成:在 LiveCodeBench、HumanEval 等代码基准上,GAR 同样带来了显著提升(表 7,附录 C),说明切片级过程监督的优势不限于数学。
实践建议
对于希望在实际系统中落地 GAR 框架的研发团队,以下几点值得参考:
-
从轻量判别器开始:推荐使用与推理器同系列但参数量较小的模型(例如 Qwen‑1.5B 配合 Qwen‑7B),并通过指令微调定制为 “分析‑评分‑理由” 格式。在微调数据构造时,可利用低成本 API(如 GPT‑o4‑mini)对小批量样本进行标注,然后平衡正负类以避免偏差。实验表明,这种流水线能以较低成本获得可靠的切片级评判器。
-
控制推理成本:将判别器输出截断在 128 个 token 以内是被验证有效的策略。可进一步引入自适应截断或基于置信度的早停机制,在不损失判断质量的前提下压缩计算开销(附录 F 中提及未来方向)。
-
灵活配置奖励权重:当目标任务有明确的可验证答案时,建议保留答案匹配项 ,以获得稳定的终端信号;若答案难以自动判断(如证明题),可完全放弃 ,仅用切片奖励 进行训练,并利用部分轨迹提前终止训练来提升效率(表 5)。
-
利用对抗耦合进行领域适应:判别器不仅可以检测错误,还能识别特定的推理风格。若希望模型模仿某位专家或特定系统的推理习惯,可先训练一个区分风格差异的判别器,然后将其嵌入 GAR 联合训练流程进行推理模式蒸馏(表 6 示例)。这一技术可用于偏好对齐、代码规范迁移等场景。
-
监控熵分布以避免过拟合:训练时可以分别统计全局熵和非零 token 区域的熵,确保模型没有出现全局性的熵坍塌。GAR 的选择性熵特征可作为判断训练健康的指标:如果去除零熵后的平均熵显著下降,可能意味着探索不足,可考虑调整奖励权重或增加正则化。