awesome-AI-Math-Datasets
收藏资源简介:
该仓库是一个AI数学数据集合集,专门收集和整理用于训练和评估数学大语言模型(Math LLMs)的近期开源数学数据集。合集覆盖预训练、监督微调、强化学习和基准测试等领域,收录了包括Open-Web-Math、AMPS、NaturalProofs、MathPile、AlgebraicStack等多个数据集,涵盖数学网页、问题与解决方案、定理证明、代码相关数据等多样化的数学内容,主要面向研究人员和开发者。
This repository is an AI mathematics dataset collection that specializes in collecting and curating recent open-source mathematical datasets for training and evaluating mathematical large language models (Math LLMs). This collection covers multiple domains including pre-training, supervised fine-tuning, reinforcement learning, and benchmark testing, and includes various datasets such as Open-Web-Math, AMPS, NaturalProofs, MathPile, and AlgebraicStack. It encompasses diverse mathematical content including mathematical webpages, problems and solutions, theorem proving materials, and code-related mathematical data, and is mainly targeted at researchers and developers.
AI Math Datasets 数据集详情
该仓库汇集了近年来开源的数学数据集(主要为英文),用于训练和评估数学大语言模型(Math LLMs)。数据集按应用阶段分为预训练、监督微调、强化学习和基准测试四大类,更新日期为2026年4月26日。
预训练数据集
纯文本模态
| 数据集 | 描述 | 参考链接 |
|---|---|---|
| Open-Web-Math | 从Common Crawl中提取的数学网页数据集,包含147亿tokens。 | 论文、仓库、数据集 |
| Open-Web-Math-Pro | 基于Open-Web-Math经ProX框架精炼,约50亿高质量数学tokens。 | 论文、仓库、数据集 |
| AMPS | 包含超过10万道Khan Academy题目和约500万道Mathematica脚本生成的题目及答案。 | 仓库 |
| NaturalProofs | 约32,000个定理陈述与证明、14,000个定义及2,000个附加页面,覆盖多种数学领域。 | 论文、仓库 |
| MathPile | 以数学为中心的语料库,约95亿tokens。 | 论文、仓库、数据集 |
| AlgebraicStack | 与数学相关的代码数据集,包含110亿tokens。 | 论文、仓库、数据集 |
| MathCode-Pile | 192亿tokens,涵盖网页、教科书、模型合成文本及数学相关代码。 | 论文、仓库、数据集 |
| FineMath | 包含340亿tokens(FineMath-3+)和540亿tokens(含InfiMM-WebMath-3+),从CommonCrawl中过滤的数学教育内容。 | 论文、数据集 |
| Proof-Pile-2 | 550亿tokens数据集,包含来自arXiv、Open-Web-Math和AlgebraicStack的数学与科学文档。 | 论文、仓库、数据集 |
| AutoMathText | 约200GB数学文本,汇集自多个网站、arXiv及GitHub(OpenWebMath、RedPajama、Algebraic Stack)。 | 论文、仓库、数据集 |
| MegaMath | 来自多样化数学来源的开放预训练数据集,超过3000亿tokens。 | 论文、仓库、数据集 |
| Nemotron-CC-Math | 从Common Crawl提取的1330亿tokens大规模数学语料库。 | 论文、博客、数据集 |
| SwallowMath | 约23亿tokens,基于FineMath-4+经LLM(Llama-3.3-70B-Instruct)改写,去除模板、恢复缺失上下文并格式化为逐步解答。 | 论文、仓库、数据集 |
图文混合模态
| 数据集 | 描述 | 参考链接 |
|---|---|---|
| InfiMM-WebMath-40B | 交错图像-文本文档数据集,包含2400万网页、8500万图像URL及400亿文本tokens,从CommonCrawl提取过滤。 | 论文、数据集 |
监督微调数据集
纯文本模态
| 数据集 | 描述 | 参考链接 |
|---|---|---|
| SVAMP | 1,000道基础数学应用题。 | 论文、仓库 |
| GSM8K | 8,500道高质量小学数学应用题,每个问题需2-8步基本算术运算。 | 论文、项目、仓库 |
| MathQA | 37,000道英文数学选择题,覆盖多领域,包含操作程序注释。 | 项目 |
| MATH | 超高中水平的挑战性数据集,涵盖代数、微积分前、数论等,配有完整逐步解答。 | 项目 |
| NuminaMath | 860,000对问答,从高中到高级竞赛水平,包含思维链和工具集成推理格式。 | 论文、仓库、数据集 |
| MetaMath | 395,000样本,通过对MATH和GSM8K中的问题进行自举生成。 | 论文、项目、仓库、数据集 |
| MathInstruct | 整合13个数学推理数据集的指令微调数据,混合使用思维链和程序思维。 | 论文、项目、仓库、数据集 |
| CoinMath | 通过多样化编码风格的代码推理来增强数学推理,包含带注释的代码解决方案。 | 论文、仓库、数据集 |
| OpenMathInstruct-2 | 1400万对问题-解决方案,使用Llama3.1-405B-Instruct模型生成。 | 论文、数据集 |
| CAMEL Math | 50,000对问题-解决方案,使用GPT-4从25个数学主题生成。 | 论文、数据集 |
| AoPS-Instruct | 超过65万对竞赛级别问答,来自AoPS论坛,附带抗污染基准LiveAoPSBench。 | 论文、项目、数据集 |
| OpenMathReasoning | 306,000道独特数学题目(来源AoPS论坛),DeepSeek-R1和QwQ-32B生成的CoT/TIR格式解答,构成AIMO-2竞赛获胜方案基础。 | 论文、数据集 |
图文混合模态
| 数据集 | 描述 | 参考链接 |
|---|---|---|
| GeoQA | 4,998道中文几何选择题,包含领域特定的编程注释。 | 论文、仓库 |
| UniGeo | 4,998道计算题和9,543道证明题。 | 论文、仓库 |
| Geo170K | 约6万对几何图像-标题对及超过11万对问答。 | 论文、仓库、数据集 |
| MAVIS | 包括MAVIS-Caption(58.8万对高质量标题-图表对)和MAVIS-Instruct(83.4万指令微调数据,含思维链推理)。 | 论文、仓库 |
| Geometry3K | 3,002道几何问题,配有形式化语言的密集标注。 | 论文、项目、仓库 |
| MathV360K | 来自24个数据集的4万张图像及36万对问答。 | 项目、数据集 |
| MultiMath300K | 多模态、多语言、多级别、多步骤的K-12数学推理数据集。 | 项目 |
| MathCoder-VL | 多模态数学指令微调套件,含ImgCode-8.6M(图像到代码数据集)和MM-MathInstruct-3M(287万样本多模态数学指令)。 | 论文、仓库、ImgCode-8.6M、MM-MathInstruct |
强化学习数据集
纯文本模态
| 数据集 | 描述 | 参考链接 |
|---|---|---|
| PRM800K | 过程监督数据集,包含80万条对MATH数据集模型生成解答的步骤级正确性标签。 | 论文、项目、仓库 |
| Big-Math | 超过25万道高质量数学题,包含可验证答案,专为强化学习设计,满足唯一可验证、开放式、闭式解三个条件。 | 仓库、数据集 |
| Math-Shepherd | 问题及逐步解答,附带自动标签。 | 论文、项目、数据集 |
| OpenR1-Math-220k | 22万道数学题,每道题附有2到4条DeepSeek R1生成的推理轨迹(基于NuminaMath 1.5)。 | 数据集 |
| DeepMath-103K | 约10.3万道高难度数学题(难度等级5-9),经严格去污染处理,每题包含可验证答案及三条R1生成的解答。 | 论文、仓库、数据集 |
基准测试数据集
纯文本模态
| 数据集 | 描述 | 参考链接 |
|---|---|---|
| Lila | 包含超过14万道自然语言问题,来自23个多样化任务的数学推理基准。 | 项目、数据集 |
| MathBench | 测试大语言模型数学能力的基准,覆盖五个难度等级,评估理论与解题能力,支持中英文。 | 论文、仓库 |
| MathOdyssey | 387道数学题,涵盖竞赛级问题、高阶高中课程和大学数学,用于评估LLM数学能力。 | 论文、项目、仓库 |
| Omni-MATH | 专为评估LLM奥林匹克级别数学推理设计的挑战性基准。 | 论文、项目、仓库、数据集 |
| HARP | 4,780道来自美国全国数学竞赛的简答题数学推理数据集。 | 论文、仓库 |
| PolyMath | 多语言数学推理基准,覆盖18种语言和4个易到难等级。 | 论文、仓库、数据集 |
| MathMist | 并行多语言数学解题与推理基准,约3万对齐问答对,覆盖13种语言,支持零样本、思维链等多种评估设置。 | 论文、仓库 |
| U-MATH | 1,100道开放式大学数学题,来自真实课程,涵盖6个科目(20%为多模态问题),另附μ-MATH元评估数据集。 | 论文、仓库、数据集 |
| FrontierMath | 350道原创且经专家审阅的研究级数学题,分4个难度层级,通过Python提交答案自动验证,前沿模型初期得分<2%。 | 论文、项目 |
| OlymMATH | 双语(英/中)奥林匹克级基准,200道题,分EASY(AIME级)和HARD(远超AIME级),来自印刷出版物防泄露。 | 论文、仓库、数据集 |
| Open Proof Corpus (OPC) | 大规模人工验证数据集,含5000+个LLM生成的证明(来自IMO等20+竞赛),由专家标注正确/错误,附8B评判模型。 | 论文、项目、仓库、数据集 |
| MathArena | 持续更新的基准,评估LLM在新发布数学竞赛(AIME、HMMT等)上的表现,消除污染,共162+题目、7+竞赛、50+模型,首次包含证明写作评估。 | 论文、项目、仓库、数据集 |
图文混合模态
| 数据集 | 描述 | 参考链接 |
|---|---|---|
| MathVerse | 2,612道高质量多学科数学问题,包含图表,来自公开来源。 | 项目 |




