遇见数据集

MathTrace

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

MathTrace是一个包含37B token的数学推理轨迹数据集,由DeepSeek-V4-Flash模型生成,覆盖竞赛、奥赛、证明和数学应用题等多种数学问题。数据来源于多个公开数学数据集,包括NuminaMath-1.5、MathNet、AOPS_WEB等。经过筛选和去重后,共包含243,534个唯一问题,每个问题最多采样四次,生成974,136个样本,总生成响应token数为37,024,348,313。数据集旨在为研究如何使用推理数据对较小模型进行后训练或监督微调提供资源。生成时使用了特定设置(如温度1、最大token数78,000),并采用提示模板要求模型以严谨、全面的方式解决问题。数据集包含id、prompt、problem、source、solution、is_completed、reasoning、final、response_len等字段。需要注意的是,生成未验证答案正确性,且使用时应利用source字段进行去污染处理,许可证遵循原始源数据集的条款。

MathTrace is a mathematical reasoning trace dataset comprising 37B tokens, generated by the DeepSeek-V4-Flash model, covering a wide range of mathematical problems including competition problems, Olympiad problems, formal proofs, and mathematical word problems. The dataset is derived from multiple publicly available mathematical datasets, including NuminaMath-1.5, MathNet, AOPS_WEB, among others. After filtering and deduplication, it contains 243,534 unique problems, with each problem sampled up to four times, yielding a total of 974,136 samples, and the total number of tokens in the generated responses is 37,024,348,313. This dataset is intended to serve as a resource for researching approaches to perform post-training or supervised fine-tuning on smaller models using reasoning data. Specific generation settings were employed, including a temperature of 1 and a maximum token limit of 78,000, and a prompt template was used to instruct the model to solve problems in a rigorous and comprehensive manner. The dataset includes fields such as id, prompt, problem, source, solution, is_completed, reasoning, final, and response_len. It is important to note that the correctness of the generated answers was not verified, and the source field should be utilized for decontamination processing when using the dataset. The licensing terms follow those of the original source datasets.

创建时间:
2026-06-21
原始信息汇总

数据集概览:MathTrace

MathTrace 是一个由 DeepSeek-V4-Flash 模型生成的数学推理轨迹数据集,总计包含 37B tokens,覆盖了 974K 数学推理样本。该数据集专为研究如何利用推理数据对小模型进行后训练(SFT)而设计。

核心统计

  • 问题总数: 243,534 个独特问题
  • 生成样本数: 974,136 个
  • 完成样本数: 789,522 个
  • 未完成样本数: 184,614 个
  • 生成的总响应 Token 数: 37,024,348,313 个
  • 平均响应长度: 38,007 tokens

数据来源与分布

问题来源于8个公开数学数据集和基准。每个问题最多被采样4次。

来源 独特问题数 样本总数 完成率 生成Token数
NuminaMath-1.5 204,578 818,312 82.5% 30.02B
MathNet 19,379 77,516 78.1% 3.15B
AOPS_WEB 15,462 61,848 67.0% 3.16B
Omni-MATH 2,441 9,764 83.9% 0.32B
RIMO 518 2,072 44.8% 0.13B
AnswerBench 396 1,584 50.8% 0.10B
MOBench 334 1,336 60.5% 0.07B
PutnamBench 326 1,304 87.5% 0.05B
BeyondAIME 100 400 56.8% 0.02B

数据字段

每个样本包含以下字段:

字段 类型 描述
id 字符串 原始生成ID,格式为 {base_id}_1{base_id}_4
prompt 字符串 发送给模型的完整提示词
problem 字符串 源数据集中的问题文本
source 字符串 数据集名称及子来源位置,用于基准去污染
solution 字符串或空 源数据集提供的解答(如果存在)
is_completed 布尔值 指示生成是否正常完成(finish_reason == "stop"
reasoning 字符串 模型在 </think> 标记前的推理过程文本
final 字符串或空 模型在 </think> 标记后的最终答案(仅完成样本)
response_len int64 响应总长度的token数

生成设置

  • 模型: deepseek-ai/DeepSeek-V4-Flash
  • 温度 (Temperature): 1
  • 推理努力 (Reasoning effort): max
  • 最大 Token 数 (Max tokens): 78,000
  • 每问题采样次数: 4

用途与注意事项

  • 研究目的: 旨在为使用推理数据对小模型进行后训练(SFT)提供研究素材。
  • 答案正确性: 数据集未验证生成最终答案的正确性。用户可利用 solution 字段自行验证。
  • 基准污染风险: 该数据集由现有公开数学数据集生成。若在相关基准上进行评估,需先使用 source 字段过滤本数据集,以避免污染。
  • 许可协议: 未添加额外许可,用户需遵守原始数据集的许可、条款及基准使用限制。
搜集汇总
数据集介绍
MathTrace 数据集图片
构建方式
MathTrace数据集由DeepSeek-V4-Flash模型在24块NVIDIA H200 GPU上生成,依托ABCI 3.0超级计算机的计算资源,并得到Fields Model Initiative的支持。数据源自多个公开数学数据集与基准测试,包括NuminaMath-1.5、MathNet、AOPS_WEB等,共计243,534道问题。每道问题均采用相同的提示模板进行最多四次采样,随后进行去重处理,最终汇聚为974,136个生成样本,涵盖37B量级的推理令牌。生成过程中设定温度为1、最大令牌数为78,000,并以max作为推理努力等级,以此确保推理链条的深度与多样性。
使用方法
MathTrace主要用于支撑数学推理数据在小型模型后训练与监督微调(SFT)中的研究。用户可从HuggingFace加载默认配置下的parquet格式数据,利用提供的prompt、reasoning、final、is_completed等字段灵活构建训练或评估流程。由于未对生成答案的正确性进行验证,研究者在涉及与来源基准重叠的评估任务时,应依据source字段先行过滤,或利用solution字段自行校对答案,以确保实验的科学性与公平性。
背景与挑战
背景概述
数学推理能力的提升是当前人工智能研究的前沿课题,尤其是面对竞赛与奥林匹克级别的复杂数学问题时,现有模型常因推理链过短或逻辑不完善而表现欠佳。为此,来自Fields Model Initiative与NII的研究团队于近期构建了MathTrace数据集,该数据集基于DeepSeek-V4-Flash模型,针对来自NuminaMath、MathNet、AOPS_WEB等9个公共数学来源的24万余道问题,通过高温采样生成了超过97万条长篇幅推理轨迹,总计约37B个token。该数据集的核心研究问题在于探索如何利用大规模、高难度的数学推理数据对较小模型进行有效后训练或监督微调,以期推动数学AI在严谨证明与复杂问题求解方面取得突破。MathTrace的发布为数学推理领域提供了前所未有的训练资源,对相关研究方向具有显著的推动作用。
当前挑战
MathTrace面临的首要挑战在于如何解决数学推理中长链逻辑的完整性与准确性难题,现有模型在处理竞赛与证明类问题时,推理常因逻辑断裂或计算错误而中途终止,导致近19%的样本存在不完整响应,特别是RIMO及AnswerBench等高标准来源的不完整率超过49%。同时,构建过程中需应对海量数据去重、多来源格式统一及长序列生成的计算资源消耗,尽管依托ABCI 3.0超级计算机的24张H200 GPU,仍需精细控制采样参数与提示模板以确保生成质量。此外,由于未对答案正确性进行验证,用户需自行评估推理可信度,这要求后续研究在数据清洗与验证环节投入更多精力,以保障下游任务效果的可靠性与泛化能力。
常用场景
经典使用场景
MathTrace数据集提供了由DeepSeek-V4-Flash模型生成的大规模数学推理轨迹,涵盖竞赛、奥林匹克、证明及数学文字题等多种类型。其最经典的使用场景在于对小型语言模型进行后训练或监督微调,通过蒸馏大型模型的长链推理能力,显著提升小模型在复杂数学问题上的逻辑推理与求解性能。研究者可将这些高质量的推理轨迹作为监督信号,引导模型学习逐步推导、自我验证与严谨证明的思维模式。
解决学术问题
该数据集直面当前大语言模型在数学推理领域的两大核心挑战:其一,小规模模型普遍缺乏生成多步推理链的能力,在竞赛级数学题上表现欠佳;其二,高质量、长形式的推理训练数据极度稀缺。MathTrace通过提供近37B token的完整推理过程,为知识蒸馏、思维链学习与推理能力迁移提供了规模化、多样化的数据基础,有力推动了数学推理模型的泛化性与鲁棒性研究。
实际应用
在实际教育科技与智能辅导系统中,基于MathTrace微调的语言模型可被部署为数学解题助手,为学生提供分步骤的详细解答与证明过程。此外,该数据还可服务于自动化竞赛试题的解答系统、数学教育内容生成平台,以及需要严谨逻辑验证的科研辅助工具,大幅降低人工批改与教学辅导的成本,加速教育智能化进程。
数据集最近研究
最新研究方向
MathTrace数据集汇聚了由DeepSeek-V4-Flash生成的37B tokens数学推理轨迹,涵盖竞赛、奥赛、证明及文字应用题等多层次数学问题,共计超过97万条生成样本。该数据集的诞生恰逢大语言模型在数学推理领域从“能解题”向“会推理”跃迁的关键时期,其高达38,007 tokens的平均响应长度标志着模型已具备处理长链条逻辑推演的能力。通过系统性地收集包含完整推理链与未完成样本的海量数据,MathTrace为研究如何利用推理数据对小型模型进行监督微调(SFT)或后训练提供了宝贵资源。在当前AI数学竞技如火如荼的背景下,该数据集不仅回应了AIMO Proof Pilot等国际竞赛对高质量数学推理数据的需求,更通过保留详尽的来源字段支持基准测试去污染,为构建更加透明、可复现的数学推理模型评估体系奠定了重要基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务