验证器支持的数学推理难题生成
Verifier-Backed Hard Problem Generation for Mathematical Reasoning
论文信息
标题: Verifier-Backed Hard Problem Generation for Mathematical Reasoning
作者: Yuhang Lai, Jiazhan Feng, Yee Whye Teh, et al.
发布日期: 2026-05-07
arXiv ID: 2605.06660v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文解决的是大语言模型生成数学问题时容易作弊(奖励黑客),产生无效、无法求解的 “难题”,导致训练信号崩溃。
- 核心方法:引入三方自博弈框架 VHG,在传统的题目设置者与求解者之间加入一个独立的验证者,只有通过验证的题目-答案对才会被计入难度分数,阻止设置者用无效题目骗取高奖励。
- 关键结果:在不定积分任务上,VHG 生成的题目对求解器的提升远超所有基线,其中最难基准(Integration Stress Test)的 pass@1 提升达 21.4%(表 3);生成的难题甚至能难倒规模大 8 倍的模型(表 2)。
- 主要局限:框架的好坏完全取决于验证者的质量,通用数学中的 “软验证者” 仍可能漏过错误题目;实验仅在 Qwen3-4B 系列上展开,向更大模型、更多领域的泛化尚需检验。
- 适合读者:关注合成数据质量、大模型强化学习、数学推理以及自我博弈训练机制的研究者与工程师。
论文背景和研究动机
大语言模型在解题能力上已逼近甚至超越人类专家水平,但提出有意义的新问题却依然是薄弱环节。现有生成难题的方法要么依赖昂贵的人工设计(例如人工模板或组合策略),要么采用朴素的自博弈范式——一个设置者(setter)出题,一个求解者(solver)解题,用求解者的正确率作为难度反馈来训练设置者。这种设置存在一个根本缺陷:设置者可以轻易生成格式错误、条件缺失或根本无法解答的 “问题”,此时求解者准确率为零,系统便会将这种无效问题误判为 “高难度”,从而向设置者奉送高奖励。这种现象被称为奖励黑客(reward hacking),会导致生成数据池严重退化。
VHG(Verifier-Backed Hard Problem Generation)的核心思想正是对这一短板的回应:把有效性验证从难度评估中剥离出来,通过一个独立的验证者(verifier)先行过滤,只有在题目-参考答案对被确认有效后,求解者的失败才被允许作为难度信号。
核心方法和技术细节
VHG 是一个三方自博弈框架,包含设置者 Q、求解者 S 和验证者 V。
- 设置者 Q:同时生成问题 和参考答案 。这区别于传统自博弈中设置者只出题的做法,额外的参考答案让后续验证成为可能。
- 验证者 V:对 进行有效性判断。只有验证通过的对,才会进入难度评分环节。
- 求解者 S:对通过验证的问题多次采样求解,用经验准确率 衡量难度。设置者的奖励定义为:
若 (未通过验证),则直接赋予零奖励,求解者的失败不算数。由此,设置者无法再用无效问题骗取难度分,必须同时兼顾有效性和难度。
论文实现了两种验证者版本:
- 硬验证者(hard verifier):用于不定积分任务。利用 SymPy 符号计算库检查候选原函数 的导数是否精确等于被积函数 ,并提供格式校验。这种验证接近 100% 可靠。
- 软验证者(soft verifier):用于通用数学任务。先用基于规则的过滤器剔除格式错误、复制题、答案缺失等明显垃圾输出,再由 LLM 法官根据详细的评价标准(检查问题完整性、答案正确性、与种子题的关联度等)进行最终判断。
训练时,设置者 Q 首先通过少量高质量样本的监督微调获得初步能力,随后进入强化学习阶段。每轮中,Q 以种子题库中抽取的题目为灵感生成新题,V 执行有效性检验,S 对有效题目估算难度,并以此反馈奖励更新 Q。求解者 S 则在 Q 生成的、经过 V 过滤的干净数据上同步进行强化学习训练。论文将该流程固定为算法 1(见附录 A),并通过表 4 和表 5 给出了两个实验领域的数据规模与筛选比率。
创新点和贡献
VHG 的架构创新在于将验证从奖励后验中提升为第一道门控。与依赖共识(如 R-Zero 中用多数投票构造伪标签)或直接使用难度信号的现有方法不同,VHG 使得 “只有通过验证的难题才被认为难”。这种设计最大程度避免了奖励信号的污染。
论文的贡献具体包括:
- 提出全新的三方自博弈框架,用验证者切断奖励黑客路径。
- 在不定积分和通用数学两个测试床上实例化硬/软验证者,证明框架的可推广性。
- 通过大量实验展示生成的题目不仅能大幅提升同规模求解者,还能难倒大得多的模型(表 2:Qwen3-32B 在生成的不定积分难题上 pass@8 仅 85.99%,通用数学难题上 pass@8 仅 70.71%),为弱模型生成强模型训练数据提供了一条道路。
- 深入分析了设置者的学习动态,揭示了 “先学有效性,后学难度” 的两阶段模式(图 4)。
实验结果分析
不定积分(硬验证者)
在三个难度递增的积分基准上,VHG 训练的求解器 pass@1 分别达到 45.4%(Competition)、69.4%(Qualifier)和 64.7%(Integration Stress Test),相比基础模型分别提升 16.9、16.6 和 21.4 个百分点(表 3)。作为对比,R-Zero 在三轮迭代后甚至未能超过仅用已有数据训练的 vanilla GRPO,说明在缺乏独立验证时,共识信号难以维持生成质量。
分析生成题目池的难度-有效性分布(图 5)发现,VHG 不仅生成了更多极困难的问题(46.0% 的问题局部求解器准确率低于 0.1),而且在高难度区间仍保持较高的验证通过率,而 R-Zero 在准确率低于 0.1 的区间内完全没有保留任何样本。这直观解释了 VHG 的性能优势。
通用数学(软验证者)
在 MATH、AMC、Minerva、Olympiad 及连续三年的 AIME 等 8 项综合基准上,VHG(软验证者)训练的求解器整体 pass@1 从基础模型的 56.8% 提升至 69.0%,且在所有子基准上全面优于 R-Zero 的最终迭代(图 3,表 9)。虽在低年级题目集 GSM8K 上有轻微下降(因训练数据分布向难题偏移),但其在奥赛级别(Olympiad、AIME)上的提升依然醒目。软验证者下的困难题难度-有效性分析(图 9)也呈现类似趋势:高阶难题被成功筛选保留,而 R-Zero 在这些区间再次颗粒无收。
弱到强的数据价值
一个极具启发性的发现是:用 Qwen3-4B 生成、经 VHG 过滤的难题,在 8B、14B、32B 模型上的 pass@8 仍远未饱和(不定积分最高仅 85.99%,通用数学最高仅 70.71%,表 2),表明更弱的模型能够生成有效的、挑战更强模型的数据,为高效扩展数据飞轮提供了证据。
实践建议
无论是希望构建内部数学难点题库,还是为强化学习合成高质量训练信号,VHG 提供了清晰的工程蓝图:
-
验证者质量是第一序位。如果任务有封闭的、可自动检查的评判标准(如符号求导、可执行代码、答案唯一性校验),应优先选择硬验证者。硬验证者几乎不会产生假阳性,能保证数据池高度洁净。例如在积分、等式求解、程序合成等任务中,可借鉴论文的 SymPy 方案。
-
软验证者作为通用化桥梁。对于开放数学题,构建由规则过滤器和 LLM 法官组成的软验证者时,需精心设计判断提示。论文中使用的审查项包括:题目是否良定、答案是否完备且无歧义、是否与种子题保持数学关联(防止无意义变异),并设置了 “否决型” 规则(如拒绝无解或重复题目)。这些经验可复用至其他领域。
-
先学有效、后挖难度。设置者的训练动态显示,有效性提升通常先于难度增加。因此,在训练初期应保证足够数量的种子题和验证反馈,让设置者学会生成可被验证接受的题目,再逐步通过求解者反馈引导其增加难度。实践中可监控验证通过率与有效样本的平均准确率曲线,当通过率稳定后再加大难度惩罚的权重。
-
弱模型生成强模型数据。VHG 证明 4B 设置者生成的题足以难倒 32B 求解者。在算力受限的场景下,可以利用小模型作为设置者与验证循环的核心,产生的数据喂给更大模型,形成正向飞轮。注意需配合去重和审核流程(论文中对生成题进行了模板去重、复制检测和 LLM 法官终审)。
-
评估时区分有效性边界。论文特别强调,在通用数学中软验证者的判断并非精确数学等价,报告的是 “法官验证有效” 的产量,而非绝对可靠性。实际部署时,应保留硬/软验证的清晰分界线,并定期抽样人类专家审计生成题的质量,尤其在推广到新领域时。