MathNet:一个面向数学推理和检索的全球多模态基准

MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

arXiv: 2604.18584v1

论文信息

标题: MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval

作者: Shaden Alshammari, Kevin Wen, Abrar Zainal, et al.

发布日期: 2026-04-20

arXiv ID: 2604.18584v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:该论文针对当前数学推理基准在规模、语言覆盖和任务多样性上的不足,构建了一个多模态、多语言的奥林匹克级数学问题基准,并首次系统评估了数学问题检索能力。
  • 核心方法:通过收集 47 个国家近 40 年的官方竞赛题册,利用 OCR 与大语言模型流水线提取问题‑解答对,并构建了问题求解、数学感知检索和检索增强问题求解三个评测任务。
  • 关键结果:在问题求解任务上,最强的 Gemini‑3.1‑Pro 准确率为 78.4%,而在数学感知检索任务中,当前嵌入模型的 Recall@1 最高仅约 5%(见表 3 和表 4),检索质量严重制约 RAG 性能。
  • 主要局限:检索评测使用合成等价问题和对抗负样本,真实的等价问题覆盖度有限;多模态信息利用仍然不足;作者指出当前嵌入模型未能捕捉深层数学结构。
  • 适合读者:从事大模型数学推理、信息检索、检索增强生成(RAG)以及数学 AI 基准设计的研究者与工程师。

论文背景和研究动机

近年来,大型语言模型(LLM)和多模态大模型(LMM)在数学推理基准上快速进步,从小学算术到竞赛数学均有不俗表现。部分系统在公开报告中甚至声称在国际数学奥林匹克(IMO)达到金牌水平。然而,现有奥林匹克级数据集多来自 AoPS 等社区平台,涵盖的国家和语种十分有限,且缺乏专家编写的官方解答,这阻碍了对模型数学泛化能力的系统评估。

与此并行的是,数学问题检索这一基础能力长期被忽视。当数学家或竞赛选手想查找与某个问题结构相似的问题时,现有检索系统往往只匹配表面词汇(如变量名或关键词),无法识别像 “x2+y2=1x^2+y^2=1” 与 “a2+b2=1\sqrt{a^2+b^2}=1” 这种完全等价但表述不同的数学对象。这种缺陷不仅影响学术检索,还直接限制检索增强生成(RAG)在数学领域的应用。

为此,作者提出了 MathNet:一个从 47 个国家官方题册中收集、包含超过 3 万个奥林匹克级问题的大规模、多模态、多语言数据集。该数据集配备专家解答、精细的数学相似性分类,并围绕三个任务——问题求解、数学感知检索和检索增强问题求解——构建了完整的评测体系。

核心方法和技术细节

数据集构建

MathNet 的数据全部来自 1985–2025 年间各 IMO 参赛国公开发行的官方竞赛题册,涵盖 47 个国家、17 种语言、143 项赛事,共约 25,000 页 PDF。研究者首先使用多语言文档解析框架 dots-ocr 将所有题册转换为 Markdown,再通过一个三阶段的 LLM 流水线提取问题‑解答对:

  1. 文档分割:将页面按节切分后,用 Gemini‑2.5‑Flash 标注问题与解答对应的行号区间,同时记录作者、提示及源页码。
  2. 内容提取:按标注区间提取文本并附加缓冲区,然后由 GPT‑4.1 输出适合 LaTeX 格式的问题与解答内容。
  3. 三重校验:先由规则引擎计算提取内容与原始 OCR 的相似度,再由 GPT‑4.1 对比截图与提取结果,最后人工复核低置信度样本,确保无误。

最终得到 30,676 个问题‑解答对,构成 MathNet‑Solve,并划分为训练集(23,776)、测试集(6,400)和困难测试集(500)。

数学相似性的分类

论文定义了三层数学相似性:不变性(Invariance)(表述变换下严格等价)、共振(Resonance)(部分相似,可用相同思路或引理)和亲和性(Affinity)(宽泛的主题关联)。依据这一分类,作者构建了两个检索与 RAG 专用数据集:

  • MathNet‑Retrieve:从 10,000 道锚问题出发,用 GPT‑5 为每道题生成 1 个等价正样本和 3 个对抗性硬负样本(改变底层数学但保持表面形式),共 40,000 个合成问题,用于评估嵌入模型的数学检索能力。
  • MathNet‑RAG:35 对人工专家选取的真实奥林匹克问题,均属于 “共振” 层次,用于评测检索增强的问题求解。

评测体系

围绕三个任务设计了明确的评测协议:

  • 问题求解:模型生成解答,由 GPT‑5 裁判模型对照官方解答给出 0–7 分,得分 ≥6\ge 6 视为正确。同时按代数、数论、几何和离散数学四个领域分别报告准确率。
  • 数学感知检索:用余弦相似度对嵌入向量进行排序,采用 Recall@k 衡量能否在前 k 个结果中命中等价问题。
  • 检索增强问题求解:设置零样本、嵌入检索 RAG(使用 Gemini‑embedding‑001 检索一个相关问题及其解答)和专家 RAG(直接给出手选相关题及其解答)三种配置,引入人类专家评分和 LLM 评分双重评判。

创新点和贡献

  1. 迄今最大、最多样化的奥林匹克级数学数据集。对比现有的 OlympiadBench、Omni‑MATH 等基准(表 1),MathNet 在规模(30K+)、语言数(17 种)以及覆盖的竞赛数量和年份上均显著超越,所有题目均配有官方专家解答。
  2. 首个系统评估数学问题检索的基准。此前的信息检索工作或者停留在公式级匹配,或者缺失对结构化等价关系的感知。MathNet‑Retrieve 通过等价正样本和对抗负样本,专门衡量嵌入模型理解深层数学结构的能力。
  3. 精细的数学相似性分类体系。不变性、共振、亲和性的三层框架,使得检索和 RAG 实验能够在不同粒度上分析模型的类比推理能力,而不仅停留在 “对或错” 的粗粒度判断。
  4. 展示检索质量对 RAG 的决定性影响。实验表明,只有提供结构对齐的专家选取问题(Expert‑RAG)时,推理模型才能稳定获益;基于嵌入检索的 RAG 收益有限甚至有害,直接揭示了当前嵌入模型的数学感知短板。

实验结果分析

问题求解(表 3)

在 MathNet‑Solve 测试集上,LMM 配合推理能力显著优于纯文本模型。Gemini‑3.1‑Pro 以 78.4% 的整体准确率居首,其次为 Gemini‑2.5‑Pro(71.9%)和 GPT‑5(69.3%)。按领域看,代数是所有模型最容易的领域(最强模型达 82.9%),而几何和离散数学则是最困难的——GPT‑5 在几何上仅 56.3%,在离散数学上为 64.1%。次强模型如 Claude Opus 4.6(45.7%)和 DeepSeek‑R1(36.3%)与之差距巨大,说明顶级奥林匹克推理仍高度依赖前沿模型。

数学感知检索(表 4)

当前嵌入模型在数学等价检索上的表现非常薄弱。即使最强的 Gemini‑embedding‑001 和 Qwen3‑Embedding‑4B,在 Recall@1 上也仅约 5%,Recall@5 升至 68.9% 和 64.9%。相比之下,早期模型如 text‑embedding‑ada‑002 Recall@1 仅约 2%。论文进一步通过余弦相似度分布图(见原文附录)说明,非等价对常常比等价对获得更高的相似度分数,表明嵌入向量更多地捕获了词面共现而非数学结构。

检索增强问题求解(表 5)

在 35 个困难问题的 MathNet‑RAG 上,Expert‑RAG 普遍优于零样本,但嵌入 RAG 收益不稳定。人类评分下,DeepSeek‑V3.2‑Speciale 在 Expert‑RAG 中达到 97.3%,较零样本(84.8%)提升超过 12 个百分点;GPT‑5 也从 76.8% 升至 86.6%。然而,Gemini‑3‑Pro 在 Expert‑RAG 下反而从 89.1% 略降至 87.5%,而嵌入 RAG 对 Grok‑4.1‑Fast 在 LLM 评分下甚至出现性能倒退(73.1% → 67.7%)。这些现象一致说明,检索带来的上下文只有当其与目标问题真正数学同构时才能提供有效帮助,噪声检索反而干扰推理。

实践建议

本工作为数学 AI 系统的开发者提供了直接可用的资源和明确的改进方向:

  • 接入 MathNet 进行能力摸底。对于正在构建数学推理产品或竞赛辅导工具(如解题助手、自动批改系统)的团队,可以直接使用 MathNet‑Solve 测试集中文/英文/多语种子集,评估模型在不同数学领域和题型上的真实水平,尤其注意几何和离散数学的短板。
  • 将数学感知检索作为独立模块优化。若系统依赖知识库检索(如题目推荐、相似题查找),应清醒认识现有通用嵌入模型的不足。建议在 MathNet‑Retrieve 上微调或评测自有嵌入模型,重点关注 Recall@1 的提升。可以尝试引入公式结构编码、符号推理图或对比学习以加强数学结构感知。
  • 在 RAG 流水线中设计检索质量门控。实验表明,检索到非结构对齐的例题非但无益,还可能降低准确率。因此,在部署检索增强解题时,可以设置相似度阈值,或训练一个重排序器过滤仅表面相似的问题,确保送入上下文的示例真正具有数学共鸣性。
  • 多模态处理需谨慎。MathNet 中包含图像题目,但实验显示视觉增强带来的增益有限(见表 3 中 LMM 与纯文本 LLM 的对比),提示纯粹的视觉理解尚未实质提升符号推理。现阶段可优先投入文本理解与符号操纵能力,同时持续跟踪多模态技术的发展。

总之,MathNet 不仅揭示了顶级模型在数学检索上的显著短板,也为构建更智能的数学搜索引擎和检索增强推理系统提供了难得的测试平台与指导。