遇见数据集

awesome-AI-Math-Datasets

收藏
github2026-05-19 更新2026-06-04 收录
官方服务:

资源简介:

该仓库是一个AI数学数据集合集,专门收集和整理用于训练和评估数学大语言模型(Math LLMs)的近期开源数学数据集。合集覆盖预训练、监督微调、强化学习和基准测试等领域,收录了包括Open-Web-Math、AMPS、NaturalProofs、MathPile、AlgebraicStack等多个数据集,涵盖数学网页、问题与解决方案、定理证明、代码相关数据等多样化的数学内容,主要面向研究人员和开发者。

This repository is an AI mathematics dataset collection that specializes in collecting and curating recent open-source mathematical datasets for training and evaluating mathematical large language models (Math LLMs). This collection covers multiple domains including pre-training, supervised fine-tuning, reinforcement learning, and benchmark testing, and includes various datasets such as Open-Web-Math, AMPS, NaturalProofs, MathPile, and AlgebraicStack. It encompasses diverse mathematical content including mathematical webpages, problems and solutions, theorem proving materials, and code-related mathematical data, and is mainly targeted at researchers and developers.

创建时间:
2025-03-19
原始信息汇总

AI Math Datasets 数据集详情

该仓库汇集了近年来开源的数学数据集(主要为英文),用于训练和评估数学大语言模型(Math LLMs)。数据集按应用阶段分为预训练、监督微调、强化学习和基准测试四大类,更新日期为2026年4月26日。

预训练数据集

纯文本模态

数据集 描述 参考链接
Open-Web-Math 从Common Crawl中提取的数学网页数据集,包含147亿tokens。 论文仓库数据集
Open-Web-Math-Pro 基于Open-Web-Math经ProX框架精炼,约50亿高质量数学tokens。 论文仓库数据集
AMPS 包含超过10万道Khan Academy题目和约500万道Mathematica脚本生成的题目及答案。 仓库
NaturalProofs 约32,000个定理陈述与证明、14,000个定义及2,000个附加页面,覆盖多种数学领域。 论文仓库
MathPile 以数学为中心的语料库,约95亿tokens。 论文仓库数据集
AlgebraicStack 与数学相关的代码数据集,包含110亿tokens。 论文仓库数据集
MathCode-Pile 192亿tokens,涵盖网页、教科书、模型合成文本及数学相关代码。 论文仓库数据集
FineMath 包含340亿tokens(FineMath-3+)和540亿tokens(含InfiMM-WebMath-3+),从CommonCrawl中过滤的数学教育内容。 论文数据集
Proof-Pile-2 550亿tokens数据集,包含来自arXiv、Open-Web-Math和AlgebraicStack的数学与科学文档。 论文仓库数据集
AutoMathText 约200GB数学文本,汇集自多个网站、arXiv及GitHub(OpenWebMath、RedPajama、Algebraic Stack)。 论文仓库数据集
MegaMath 来自多样化数学来源的开放预训练数据集,超过3000亿tokens。 论文仓库数据集
Nemotron-CC-Math 从Common Crawl提取的1330亿tokens大规模数学语料库。 论文博客数据集
SwallowMath 约23亿tokens,基于FineMath-4+经LLM(Llama-3.3-70B-Instruct)改写,去除模板、恢复缺失上下文并格式化为逐步解答。 论文仓库数据集

图文混合模态

数据集 描述 参考链接
InfiMM-WebMath-40B 交错图像-文本文档数据集,包含2400万网页、8500万图像URL及400亿文本tokens,从CommonCrawl提取过滤。 论文数据集

监督微调数据集

纯文本模态

数据集 描述 参考链接
SVAMP 1,000道基础数学应用题。 论文仓库
GSM8K 8,500道高质量小学数学应用题,每个问题需2-8步基本算术运算。 论文项目仓库
MathQA 37,000道英文数学选择题,覆盖多领域,包含操作程序注释。 项目
MATH 超高中水平的挑战性数据集,涵盖代数、微积分前、数论等,配有完整逐步解答。 项目
NuminaMath 860,000对问答,从高中到高级竞赛水平,包含思维链和工具集成推理格式。 论文仓库数据集
MetaMath 395,000样本,通过对MATH和GSM8K中的问题进行自举生成。 论文项目仓库数据集
MathInstruct 整合13个数学推理数据集的指令微调数据,混合使用思维链和程序思维。 论文项目仓库数据集
CoinMath 通过多样化编码风格的代码推理来增强数学推理,包含带注释的代码解决方案。 论文仓库数据集
OpenMathInstruct-2 1400万对问题-解决方案,使用Llama3.1-405B-Instruct模型生成。 论文数据集
CAMEL Math 50,000对问题-解决方案,使用GPT-4从25个数学主题生成。 论文数据集
AoPS-Instruct 超过65万对竞赛级别问答,来自AoPS论坛,附带抗污染基准LiveAoPSBench。 论文项目数据集
OpenMathReasoning 306,000道独特数学题目(来源AoPS论坛),DeepSeek-R1和QwQ-32B生成的CoT/TIR格式解答,构成AIMO-2竞赛获胜方案基础。 论文数据集

图文混合模态

数据集 描述 参考链接
GeoQA 4,998道中文几何选择题,包含领域特定的编程注释。 论文仓库
UniGeo 4,998道计算题和9,543道证明题。 论文仓库
Geo170K 约6万对几何图像-标题对及超过11万对问答。 论文仓库数据集
MAVIS 包括MAVIS-Caption(58.8万对高质量标题-图表对)和MAVIS-Instruct(83.4万指令微调数据,含思维链推理)。 论文仓库
Geometry3K 3,002道几何问题,配有形式化语言的密集标注。 论文项目仓库
MathV360K 来自24个数据集的4万张图像及36万对问答。 项目数据集
MultiMath300K 多模态、多语言、多级别、多步骤的K-12数学推理数据集。 项目
MathCoder-VL 多模态数学指令微调套件,含ImgCode-8.6M(图像到代码数据集)和MM-MathInstruct-3M(287万样本多模态数学指令)。 论文仓库ImgCode-8.6MMM-MathInstruct

强化学习数据集

纯文本模态

数据集 描述 参考链接
PRM800K 过程监督数据集,包含80万条对MATH数据集模型生成解答的步骤级正确性标签。 论文项目仓库
Big-Math 超过25万道高质量数学题,包含可验证答案,专为强化学习设计,满足唯一可验证、开放式、闭式解三个条件。 仓库数据集
Math-Shepherd 问题及逐步解答,附带自动标签。 论文项目数据集
OpenR1-Math-220k 22万道数学题,每道题附有2到4条DeepSeek R1生成的推理轨迹(基于NuminaMath 1.5)。 数据集
DeepMath-103K 约10.3万道高难度数学题(难度等级5-9),经严格去污染处理,每题包含可验证答案及三条R1生成的解答。 论文仓库数据集

基准测试数据集

纯文本模态

数据集 描述 参考链接
Lila 包含超过14万道自然语言问题,来自23个多样化任务的数学推理基准。 项目数据集
MathBench 测试大语言模型数学能力的基准,覆盖五个难度等级,评估理论与解题能力,支持中英文。 论文仓库
MathOdyssey 387道数学题,涵盖竞赛级问题、高阶高中课程和大学数学,用于评估LLM数学能力。 论文项目仓库
Omni-MATH 专为评估LLM奥林匹克级别数学推理设计的挑战性基准。 论文项目仓库数据集
HARP 4,780道来自美国全国数学竞赛的简答题数学推理数据集。 论文仓库
PolyMath 多语言数学推理基准,覆盖18种语言和4个易到难等级。 论文仓库数据集
MathMist 并行多语言数学解题与推理基准,约3万对齐问答对,覆盖13种语言,支持零样本、思维链等多种评估设置。 论文仓库
U-MATH 1,100道开放式大学数学题,来自真实课程,涵盖6个科目(20%为多模态问题),另附μ-MATH元评估数据集。 论文仓库数据集
FrontierMath 350道原创且经专家审阅的研究级数学题,分4个难度层级,通过Python提交答案自动验证,前沿模型初期得分<2%。 论文项目
OlymMATH 双语(英/中)奥林匹克级基准,200道题,分EASY(AIME级)和HARD(远超AIME级),来自印刷出版物防泄露。 论文仓库数据集
Open Proof Corpus (OPC) 大规模人工验证数据集,含5000+个LLM生成的证明(来自IMO等20+竞赛),由专家标注正确/错误,附8B评判模型。 论文项目仓库数据集
MathArena 持续更新的基准,评估LLM在新发布数学竞赛(AIME、HMMT等)上的表现,消除污染,共162+题目、7+竞赛、50+模型,首次包含证明写作评估。 论文项目仓库数据集

图文混合模态

数据集 描述 参考链接
MathVerse 2,612道高质量多学科数学问题,包含图表,来自公开来源。 项目
搜集汇总
数据集介绍
awesome-AI-Math-Datasets 数据集图片
构建方式
在数学大语言模型研究蓬勃发展的背景下,awesome-AI-Math-Datasets 数据集应运而生。该数据集并非传统意义上的单一数据集,而是一个精心汇总的数学领域开源数据资源索引库。其构建方式遵循系统化的分类框架,依据数据在模型训练流程中的不同用途,将海量资源划分为预训练、监督微调、强化学习及基准测试四大核心板块。每个板块下,又根据数据模态细分为纯文本与视觉-文本两种类型,并辅以清晰的表格,为每个数据集标注了名称、描述及对应的论文、项目仓库和数据集链接,从而构建起一个结构清晰、便于检索的数学数据生态图谱。
特点
该数据集的核心特色在于其全面性与动态性。它广泛涵盖了从基础算术到奥林匹克竞赛级别的数学问题,并囊括了如Open-Web-Math、MegaMath等大规模预训练语料,以及GSM8K、MATH等经典微调基准,资源总量横跨数十亿至数百亿token。尤为值得一提的是,该索引持续更新,紧跟领域前沿,收录了如SwallowMath、DeepMath-103K等最新发布的优质数据集,并特别关注了多模态(如InfiMM-WebMath-40B)和用于强化学习的奖励模型数据(如PRM800K),为研究社区提供了一个一站式的资源发现与获取平台。
使用方法
使用此数据集索引时,研究者可根据自身需求,直接通过表格中的链接访问对应数据集的Hugging Face页面或GitHub仓库进行下载。对于预训练任务,可选用FineMath或Proof-Pile-2等大规模语料;进行指令微调时,则可参考NuminaMath或OpenMathInstruct-2等高质量问答对;若涉及强化学习,Big-Math或OpenR1-Math-220k等专为RL设计的数据集提供了丰富的可验证问题。此外,每个数据集条目均附带了相关研究论文,为深入理解数据构建方法和应用场景提供了宝贵的文献线索。
背景与挑战
背景概述
在人工智能领域,数学推理能力被视为衡量大型语言模型(LLMs)智能水平的核心标尺。自2020年以来,随着Transformer架构的演进与预训练范式的成熟,如何赋予模型严谨的符号操作与逻辑演绎能力成为研究焦点。该数据集(awesome-AI-Math-Datasets)由社区维护,持续追踪并整合了2023年至2026年间涌现的开放数学数据集,涵盖预训练、监督微调、强化学习及基准测试四大阶段。其核心研究问题在于系统梳理数学专用语料库的构建路径,以应对LLMs在形式化证明、多步推理及跨模态数学理解中的根本性瓶颈。该资源库已收录超过30个代表性数据集,如OpenWebMath、MegaMath及FrontierMath,深刻影响了从基础算术到奥林匹克竞赛级推理的模型训练与评估范式,成为数学AI领域不可或缺的索引工具。
当前挑战
该领域面临的挑战首先体现在数据质量与多样性的平衡上:预训练语料如OpenWebMath虽规模庞大,但混入了大量噪声与非数学文本,而FineMath等精细化过滤方案又可能引入学科覆盖偏差。构建过程中,监督微调数据集如MetaMath通过自举法扩充样本,却易导致问题模式同质化,削弱模型泛化能力;强化学习阶段所需的可验证答案标签(如Big-Math)要求问题具备封闭解,这严重限制了数据来源的广度。此外,视觉数学数据集的构建尤为棘手,例如Geo170K需同步生成几何图解与推理链,但现有合成技术难以保证跨模态语义对齐,而基准测试如Omni-MATH虽设计了防污染机制,却仍面临题目难度分级主观性强的困境。
常用场景
经典使用场景
在人工智能与数学推理的交叉领域,该数据集集合为研究人员提供了从预训练到微调、强化学习及基准测试的全链条资源。其经典使用场景在于训练和评估大型语言模型(LLMs)的数学推理能力,涵盖从基础算术到奥林匹克竞赛级问题的多层次挑战。通过整合如GSM8K、MATH等高质量问题集,研究者能够系统性地提升模型在符号运算、逻辑推导及多步解题上的表现,从而推动数学AI从简单计算向复杂推理的范式跃迁。
衍生相关工作
该数据集生态催生了大量经典衍生工作,深刻重塑了数学AI的研究版图。在预训练阶段,MegaMath和FineMath的提出推动了大规模数学语料的精细化清洗与组织;在微调层面,MathInstruct开创了链式思维与程序思维混合推理的训练范式,而OpenMathInstruct-2则验证了合成数据在规模扩展上的有效性。强化学习领域,DeepMath-103K和Big-Math的出现使得模型能够通过可验证奖励进行自我改进。这些工作相互交织,共同构成了从数据构建、模型训练到评估验证的完整闭环,为后续研究奠定了坚实的理论与实践基础。
数据集最近研究
最新研究方向
在大型语言模型(LLM)数学推理能力飞速跃迁的背景下,该数据集仓库精准捕捉了当前领域内最前沿的研究脉搏。研究焦点已从单纯的预训练语料规模扩张,转向对数据质量、推理范式与评估体系的多维精耕。预训练方向上,MegaMath与Nemotron-CC-Math等超大规模语料库的涌现,标志着从海量文本中提炼高质量数学知识的工业化进程;而SwallowMath通过LLM驱动重写以去芜存菁,则体现了对数据纯净度与结构化的极致追求。指令微调领域,OpenMathInstruct-2与AoPS-Instruct等数据集不仅规模空前,更深入触及奥林匹克竞赛等尖端数学问题,极大拓展了模型的推理边界。尤为引人注目的是,强化学习范式正成为新的研究高地,Big-Math与DeepMath-103K等数据集专为RL训练设计,通过可验证答案与严格去污染机制,为模型在复杂推理任务中实现自我迭代与突破提供了坚实土壤。与此同时,以FrontierMath、MathArena为代表的动态、抗污染基准的兴起,标志着评估体系正从静态题库向与前沿竞赛同步演进的活水模式转变,确保了对模型真实能力的客观度量。这一系列研究动向深刻揭示了该领域的发展脉络:在数据驱动的智能演进中,数学推理正从基础能力训练迈向对顶尖智能的终极考验。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务