遇见数据集

nnmax/OpenMathReasoning

收藏
Hugging Face2025-12-15 更新2025-12-20 收录
官方服务:

资源简介:

OpenMathReasoning是一个大规模数学推理数据集,用于训练大型语言模型(LLMs)。该数据集包含来自AoPS论坛的30.6万个独特数学问题,以及320万条长链思维(CoT)解决方案、170万条工具集成推理(TIR)解决方案和56.6万个从多个候选方案中选择最有希望解决方案的样本(GenSelect)。此外,还包括19.3万个来自AoPS论坛的问题(仅问题,无解决方案)。该数据集是我们在AIMO-2 Kaggle竞赛中获胜的基础。数据集还包含了用于训练OpenMath-Nemotron系列模型的所有数据。

OpenMathReasoning is a large-scale math reasoning dataset for training large language models (LLMs). This dataset contains 306K unique mathematical problems sourced from AoPS forums with 3.2M long chain-of-thought (CoT) solutions, 1.7M long tool-integrated reasoning (TIR) solutions, and 566K samples that select the most promising solution out of many candidates (GenSelect). Additional 193K problems sourced from AoPS forums (problems only, no solutions) are also included. This dataset was a foundation of our winning submission to the AIMO-2 Kaggle competition. The dataset also includes all the data used to train the OpenMath-Nemotron series of models.

提供机构:
nnmax
搜集汇总
数据集介绍
nnmax/OpenMathReasoning 数据集图片
构建方式
OpenMathReasoning数据集由NVIDIA构建,旨在为大型语言模型提供大规模数学推理训练资源。其构建过程始于从AoPS论坛采集约30.6万个独特数学问题,并利用Qwen2.5-32B-Instruct模型对问题进行预处理与精炼。随后,借助DeepSeek-R1和QwQ-32B两种先进推理模型,为每个问题生成长链思维(CoT)与工具集成推理(TIR)两种类型的解答,分别产出约320万与170万条解决方案。此外,通过GenSelect机制从多个候选解答中筛选出最优解,形成约56.6万条精选样本。最终,数据集还包含约19.3万个仅含问题而无解答的附加样本,用于扩展问题覆盖范围。
特点
该数据集以大规模、高质量和多样性著称,涵盖约30.6万个独特数学问题,并配套超过500万条合成解答,总量接近1.14亿字节。其核心特点在于提供两种推理模式:链式思维与工具集成推理,分别模拟逐步逻辑推导与结合外部工具的求解过程。每条数据包含问题原文、生成解答、模型来源、问题类型(如可提取答案或证明类)、预期答案及来源论坛等丰富字段。特别地,数据集还提供基于Qwen2.5-Math-72B-Instruct模型在TIR模式下32次生成的通过率,便于评估问题难度。该数据集已成功支撑NVIDIA在AIMO-2 Kaggle竞赛中夺冠,验证了其卓越的训练效果。
使用方法
OpenMathReasoning数据集可通过HuggingFace平台直接加载,支持按配置名称(如cot、tir、genselect、additional_problems)选择特定子集。用户可利用transformers库结合模型进行微调,例如加载Qwen或DeepSeek系列模型后,以问题字段为输入、生成解答为标签进行监督学习。数据集中包含的推理模式字段允许针对不同任务场景选择CoT或TIR策略进行训练。此外,GenSelect子集可用于训练解答选择器,提升多候选场景下的推理质量。NVIDIA还开源了完整的复现管道(NeMo-Skills),提供从数据生成到模型训练的全流程指导,便于研究者复现或扩展其工作。
背景与挑战
背景概述
在数学推理领域,大规模高质量数据集的匮乏长期制约着大语言模型(LLM)在复杂数学问题上的推理能力提升。2025年4月,NVIDIA研究团队发布了OpenMathReasoning数据集,旨在填补这一空白。该数据集由Ivan Moshkov、Darragh Hanley、Ivan Sorokin等研究人员主导构建,核心研究问题在于如何通过合成数据驱动LLM在数学奥林匹克级难题上实现突破性进展。数据集源自Art of Problem Solving(AoPS)论坛的306K道独特数学问题,并利用DeepSeek-R1与QwQ-32B等先进模型生成了超过320万条长链思维(CoT)与170万条工具集成推理(TIR)解决方案。其影响力在AIMO-2 Kaggle竞赛中得到了直接验证——基于该数据集训练的OpenMath-Nemotron-14B模型赢得了冠军,并在AIME24、AIME25等基准测试中刷新了多项记录,展现了其在推动数学推理前沿研究中的关键作用。
当前挑战
OpenMathReasoning数据集的构建与应用面临多重挑战。首先,在领域问题层面,数学推理任务本身要求模型具备严谨的逻辑链与多步推导能力,不同于常规问答,其高维抽象性与解题路径的多样性使得传统监督学习难以覆盖所有推理模式,尤其在处理奥林匹克级别的复杂证明题时,模型常因中间步骤的微小疏漏导致整体失效。其次,在构建过程中,团队遭遇了显著的技术障碍:约137K道基于证明的题目因流水线缺陷而丢失,后续尝试将其纳入训练时反而导致监督微调性能倒退,揭示了合成数据质量与模型适应性之间的微妙平衡;此外,严格的格式过滤(如剔除是非题、选择题)、基准去污染以及现有LLM对部分问题的无效生成,使得初始540K道问题缩减至实际发布的306K道,这一数据损耗凸显了自动化质量控制在规模化生产中的脆弱性。
常用场景
经典使用场景
OpenMathReasoning数据集的核心应用场景在于大规模数学推理能力的训练与评估。该数据集汇聚了来自AoPS论坛的30.6万道独特数学问题,并附有超过320万条长链思维(CoT)与170万条工具集成推理(TIR)解决方案,为大型语言模型提供了丰富的数学推理学习素材。研究者可借助该数据集对模型进行监督微调,使其掌握从基础代数到高阶奥林匹克竞赛题目的系统性推理技巧,从而在AIME、HMMT等数学基准测试中显著提升性能。
实际应用
在实际应用中,OpenMathReasoning数据集的价值体现在数学教育智能化与竞赛辅助系统的开发。例如,基于该数据集训练的OpenMath-Nemotron模型可被集成至在线学习平台,为学生提供分步解题指导与个性化错题分析,或者作为数学奥林匹克竞赛的自动阅卷与解题建议工具。此外,该数据集还曾作为NVIDIA在AIMO-2 Kaggle竞赛中夺冠的核心基石,展示了其在真实竞赛场景中提升模型解题准确率与鲁棒性的巨大潜力。
衍生相关工作
围绕OpenMathReasoning数据集已衍生出一系列具有影响力的学术成果与开源资源。NVIDIA基于该数据发布了OpenMath-Nemotron系列模型(从1.5B至32B参数规模),在AIME24等基准上创造了多项最优记录。此外,该数据集与NeMo-Skills代码库、完整复现指南及学术论文共同构成了一个开放的研究生态,激发了对多步推理、工具融合推理与生成选择机制的深入探索。这些衍生工作不仅推动了数学推理领域的技术进步,也为其他复杂推理任务的数据构建与模型训练提供了可复制的范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务