遇见数据集

math-vault

收藏
github2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

math-vault是一个经过整理、可追溯的公共数学推理数据集快照集合,所有数据集都规范化为id/problem/answer的JSONL格式,并包含每个数据源的来源记录。它旨在直接为math-eval提供数据支持。

Math-Vault is a curated, traceable collection of public mathematical reasoning dataset snapshots. All datasets are standardized into the JSONL format with the structure id/problem/answer, and include provenance records for each respective data source. It is designed to directly provide data support for math-eval.

创建时间:
2026-07-14
原始信息汇总

数据集概述:math-vault

math-vault 是一个经过整理、可追溯的公开数学推理数据集快照集合,所有数据集被统一规范化为 id/problem/answer 格式的 JSONL 文件,并附带每条数据的来源追溯记录。该仓库设计用于直接供给 math-eval 评估工具使用。

数据集构成

仓库共包含 14 个数据集,总计 32,228 行(含 17 个问题行),具体如下:

数据集名称 本地文件 行数 上游许可证
AIME 2024 source/aime_2024/train.jsonl 30 未声明
AIME 2025 source/aime_2025/train.jsonl 30 CC BY-NC-SA 4.0
AIME 2026 source/aime_2026/train.jsonl 30 CC BY-NC-SA 4.0
AIMO validation AIME source/aimo_validation_aime/train.jsonl 90 Apache-2.0
AIMO validation AMC source/aimo_validation_amc/train.jsonl 83 Apache-2.0
AMC 2023 source/amc_2023/test.jsonl 40 未声明
BrUMO 2025 source/brumo_2025/train.jsonl 30 CC BY-NC-SA 4.0
CMIMC 2025 source/cmimc_2025/train.jsonl 40 CC BY-NC-SA 4.0
GSM8K source/gsm8k/{train,test}.jsonl 7,473 / 1,319 MIT
HMMT February 2025 source/hmmt_feb_2025/train.jsonl 30 CC BY-NC-SA 4.0
MATH-500 source/math_500/test.jsonl 500 未声明
Minerva-Math source/minerva_math/train.jsonl 272 未声明
Omni-MATH source/omni_math/train.jsonl 4,428 Apache-2.0
OlympiadBench OE_TO_maths_en_COMP source/olympiad_bench/train.jsonl 674 Apache-2.0

此外,仓库还包含:

  • DAPO-Math-17K:作为上游入口,位于 source/dapo_math_17k/README.md
  • DAPO-Math-17K compact:位于 derived/dapo_math_17k_compact/train.jsonl,共 17,917 行,许可证 Apache-2.0
  • DAPO-Math-17K dedup:位于 derived/dapo_math_17k_dedup/train.jsonl,共 17,176 行,许可证 Apache-2.0

目录结构约定

  • source/:上游数据快照。仅允许进行不改变行、字段、顺序和内容的序列化格式转换(如 parquet 转为 JSONL)。
  • derived/:经过滤、去重、去 prompt 或采样处理后的数据版本。每个目录记录父数据来源、转换规则及重建脚本。
  • canonical/:由 source/derived/ 机械转换而来、可直接被 math-eval 读取的 id/problem/answer 格式版本,共 32,228 行(含 17 个问题行)。

数据许可证说明

  • 仓库代码与文档采用 MIT License
  • 各数据集数据归各自上游权利人所有,遵循各数据目录所列的上游许可证条款。上游未声明许可证的标记为“未声明”,不代表公有领域。
  • 本仓库的 MIT License 不对数据重新授权。

数据重建

依赖仅需要 Python 标准库,支持通过脚本重建数据:

  • DAPO 去重版本:python derived/dapo_math_17k_dedup/build.py
  • math-eval 规范版本:python canonical/build.py

引用

bibtex @software{ge_math_vault_2026, author = {Ge, Xinmu}, title = {math-vault: Curated, Traceable Snapshots of Public Mathematical Reasoning Datasets}, year = {2026}, doi = {10.5281/zenodo.21411213}, url = {https://github.com/Geraldxm/math-vault}, license = {MIT} }

搜集汇总
数据集介绍
math-vault 数据集图片
构建方式
math-vault数据集致力于为数学推理研究提供结构清晰、来源可溯的标准化数据资源。其构建方式涵盖两大核心路径:一是从AIME、AMC、GSM8K、MATH-500、Omni-MATH等14个公开竞赛与学术基准中获取原始数据,保留上游格式并转换为JSONL序列化文件,存储于source目录;二是基于source数据进行过滤、去重或精简处理,形成derived版本,例如DAPO-Math-17K经过去重后生成17,176条样本。所有数据最终通过机械转换整合为统一的id/problem/answer字段格式,汇聚于canonical目录,确保与math-eval评估框架无缝对接。重建过程仅依赖Python标准库,通过简单脚本即可复现。
特点
该数据集最显著的特点在于其严格的溯源机制与标准化设计。每份数据均附带完整的provenance记录,明确标注上游许可证类型,如MIT、Apache-2.0或CC BY-NC-SA 4.0,未声明许可证的数据亦被如实标注,避免法律风险。数据目录采用三级分层结构:source存储原始快照,derived存放经过变换的子集,canonical提供可直接用于模型评估的统一格式。此外,数据集包含32,228条标准化样本,覆盖从初等数学到高难度奥赛题目,兼具广度与深度,为数学推理模型的训练与评测提供可靠基石。
使用方法
用户可通过两种主要方式使用该数据集。其一,直接读取canonical目录下的JSONL文件,其中每条记录包含id、problem和answer三个字段,可利用json.load()加载后供数学推理模型进行训练或测试,尤其适合搭配math-eval评估工具使用。其二,如需自定义数据版本,可依据derived目录中的README说明和构建脚本(如build.py),基于source原始数据执行过滤、去重或采样操作,生成满足特定需求的子集。所有脚本均以Python标准库编写,无需额外依赖,降低了使用门槛。引用时请参照提供的BibTeX条目以确保学术规范性。
背景与挑战
背景概述
数学推理是人工智能领域的一项核心挑战,尤其在大型语言模型(LLM)蓬勃发展的当下,衡量模型在复杂数学问题上的表现已成为评估其智能水平的关键指标。math-vault数据集由研究者葛心木于2026年创建,旨在整合分散的公开数学推理评测数据,提供一个统一、可追溯、标准化的数据仓库。该数据集汇集了包括AIME、AMC、GSM8K、MATH-500等在内的14个主流数学推理基准的瞬时快照,总计超过三万余条样本,并遵循严格的溯源记录与许可协议。math-vault的问世有效解决了数学推理评测数据碎片化、格式不统一、来源难以追溯等问题,为数学评估工具链(如math-eval)提供了可靠的输入基础,显著推动了数学推理研究的可复现性与数据治理水平。
当前挑战
math-vault数据集所对应的领域问题核心挑战在于:数学推理评测面临数据来源分散、格式异构、许可条款模糊,导致模型评估结果难以公平对比与复现。构建过程中,主要挑战包括:其一,不同上游数据集采用各异的存储格式(如parquet、JSONL等)与字段命名,需在不改变原始语义的前提下实现无损标准化转换;其二,部分数据集(如AIME 2024、MATH-500)未明确声明许可证,使得数据重用与分发存在法律风险;其三,数据集中可能包含重复样本(如DAPO-Math-17K版本经过去重后缩减约4%),需设计高效去重算法以维护数据纯净性;其四,需为每个数据目录记录完整的转换谱系(provenance),确保从原始快照到规范版本的每一步均可追溯重建。
常用场景
经典使用场景
math-vault数据集的核心使命在于为数学推理领域提供一套精心策划、可溯源且高度标准化的基准测试集合。其最经典的用途是作为大型语言模型在数学问题求解能力上的统一评测平台,通过将AIME、AMC、GSM8K、MATH-500等来自不同竞赛和学术来源的数据集,统一转换为id/problem/answer的规范JSONL格式,并记录完整的血缘信息,研究者能够直接将其接入math-eval等评估框架,开展多维度、跨模型的数学推理能力对比实验。这种标准化整合不仅消除了数据预处理带来的偏差,更使得不同历史时期、不同难度的数学问题能在同一评估尺度下公平较量。
实际应用
在工程实践层面,math-vault已深度嵌入数学推理模型的研发管线。模型开发者可直接将本数据集中的canonical版本作为训练与验证的标准测试集,用于评估模型在竞赛级数学题、复杂应用题(如GSM8K)及奥赛题型上的表现。其衍生版本如DAPO-Math-17K的去重与压缩子集,更可直接用于大规模强化学习训练(如DeepSeek-R1的风格策略优化)。通过提供cleaned、deduplicated、compacted等多种转换形态,该数据集有效支撑了从模型能力诊断、训练数据清洗到持续迭代优化的全链路研发需求。
衍生相关工作
math-vault的诞生催生并支撑了一系列后续研究工作。其中最具代表性的当属DAPO-Math-17K,该工作基于math-vault中的GSM8K、MATH-500及奥赛题源进行去重与压缩,产出了17K条高质量数学推理训练样本,并以此训练出在Math-500上达到与DeepSeek-R1同等性能的开源模型。此外,math-eval评估框架亦与math-vault深度耦合,使得研究者能够快速复现各种数学推理基准测试。其他衍生工作还包括利用其规范格式进行模型错误类型分析、思维链模式挖掘,以及构建课程学习难度的渐进式测试集,这些均得益于其严谨的数据溯源与标准化架构。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务