遇见数据集

Nemotron-Math-Proofs-v3-SFT

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

Nemotron-Math-Proofs-v3-SFT是一个面向长形式数学推理的数据集,专注于证明生成、证明改进、验证和元验证任务的轨迹数据。该数据集包含经过质量过滤后的414,890个样本,涵盖15,818个独特数学证明问题。问题来源选自nvidia/Nemotron-Math-Proofs-v1数据集中来自AoPS(Art of Problem Solving)社区的较难证明问题(共15,879个原始问题)。所有响应使用DeepSeek-V4-Pro模型在Max推理模式下生成,并采用四轮生成-验证-改进流水线:第一轮生成初始证明,第2至4轮对未严格解决的问题进行改进,同时生成验证器和元验证器轨迹。验证器轨迹评估候选证明并给出分数(0、0.5或1),元验证器轨迹评估自评或代表性验证器输出。数据字段包括uuid、messages(标准化用户/助手消息序列,含可见内容和长形式推理内容)、tools(工具定义)、license(cc-by-4.0)、metadata(含问题、问题索引、数据类型、token计数等)、source(AoPS)、dataset(Nemotron-Math-Proofs-v3-SFT)、subset以及后处理字段。数据类型通过metadata.data_type区分,包括proof、refinement、verification和meta_verification。数据格式为JSONL,训练集分为10个shard,总大小约121.95 GiB,总记录token数约390亿。该数据集适用于训练大语言模型进行结构化数学推理、证明生成与修订、验证轨迹生成、元验证、长上下文推理系统以及数学论证有效性研究。数据集采用CC-BY-4.0许可证,可用于商业和非商业用途。

Nemotron-Math-Proofs-v3-SFT is a dataset for long-form mathematical reasoning, focusing on trajectory data for proof generation, proof refinement, verification, and meta-verification tasks. It contains 414,890 quality-filtered samples covering 15,818 unique mathematical proof problems. The problems are selected from the nvidia/Nemotron-Math-Proofs-v1 dataset, specifically the more difficult proof problems from the AoPS (Art of Problem Solving) community (15,879 original problems). All responses are generated using the DeepSeek-V4-Pro model in Max reasoning mode, employing a four-round generation-verification-refinement pipeline: the first round generates initial proofs, rounds 2 to 4 refine unsolved problems, while generating verifier and meta-verifier trajectories. Verifier trajectories evaluate candidate proofs and assign scores (0, 0.5, or 1), and meta-verifier trajectories evaluate self-assessment or representative verifier outputs. Data fields include uuid, messages (standardized user/assistant message sequences with visible content and long-form reasoning content), tools (tool definitions), license (cc-by-4.0), metadata (including problem, problem index, data type, token counts, etc.), source (AoPS), dataset (Nemotron-Math-Proofs-v3-SFT), subset, and post-processing fields. Data types are distinguished via metadata.data_type, including proof, refinement, verification, and meta_verification. The data format is JSONL, with the training set split into 10 shards, total size approximately 121.95 GiB, and total recorded tokens about 39 billion. The dataset is suitable for training large language models on structured mathematical reasoning, proof generation and revision, verification trajectory generation, meta-verification, long-context reasoning systems, and mathematical argument validity research. The dataset is licensed under CC-BY-4.0, allowing commercial and non-commercial use.

提供机构:
NVIDIA
创建时间:
2026-09-04
原始信息汇总

Nemotron-Math-Proofs-v3-SFT 数据集概览

基本信息

  • 数据集名称:Nemotron-Math-Proofs-v3-SFT
  • 所有者:NVIDIA Corporation
  • 创建日期:2026年7月1日
  • 许可证:CC BY 4.0(知识共享署名4.0国际许可)
  • 语言:英语
  • 任务类型:文本生成
  • 数据集规模:100K至1M样本(实际为414,890条)
  • 数据格式:JSONL,共10个分片文件(data/train-00000-of-00010.jsonl 至 data/train-00009-of-00010.jsonl)
  • 总磁盘大小:121.95 GiB

数据集概述

Nemotron-Math-Proofs-v3-SFT 是一个数学推理数据集,包含**证明生成(proof generation)、证明细化(proof refinement)、验证(verification)和元验证(meta-verification)**四个任务类型的长期推理轨迹。经过质量过滤后,该数据集包含 414,890个样本,覆盖 15,818道独立题目


数据来源与生成流程

问题筛选

  • 题目来源于 Nemotron-Math-Proofs-v1 中从 AoPS(Art of Problem Solving)社区收集的证明类问题。
  • 基于先前的通过率评估,选取了 15,879道难度较高的问题 进入生成流程。

多轮轨迹生成

  • 使用 DeepSeek-V4-Pro(Max推理模式)生成所有四类任务数据。
  • 采用四轮"生成-验证-细化(generate-verify-refine)"流程:
    1. 第1轮:为每个问题生成多个初始证明尝试。
    2. 第2至4轮:利用先前尝试及验证反馈,对尚未严格解决的问题生成修订证明。
    3. 验证:多个验证器轨迹评估候选证明,并给出最终评分(00.51)。
    4. 元验证:元验证器轨迹评估候选者的自我评估或代表性验证器的评估结果。

生成超参数

  • 温度:1.0
  • Top-p:0.95
  • 各阶段Token上限:初始证明400,000;细化证明350,000;验证64,000;元验证96,000

质量过滤

严格的后处理过滤移除了以下内容:

  • 不完整或长度超限的生成结果
  • 空响应或格式错误的响应
  • 使用推理回退机制的行
  • 在可见回答文本中暴露<think>标记的行为
  • 证明和细化样本必须包含非空的可见SolutionSelf Evaluation部分
  • 验证和元验证样本必须包含可解析的最终评分,并以可见的最终证明为输入

数据集字段

数据集包含以下字段:

  • uuid:样本唯一标识符
  • messages:标准化用户/助手消息序列,助手消息包含可见的content及对应的长格式reasoning_content
  • tools:工具定义列表
  • license:样本级许可证标签(cc-by-4.0
  • metadata:任务元数据,包含problemproblem_idxdata_type
  • source:题目来源标签(AoPS
  • dataset:数据集/发布标签(Nemotron-Math-Proofs-v3-SFT
  • subset:兼容性子集标签
  • filter_reasonprocessing_infomatch_contextsmatched_categories:后处理及兼容性字段

任务类型以metadata.data_type为唯一权威标识,取值为:proofrefinementverificationmeta_verification


数据统计

数据类型 样本数 平均生成Token数
proof(证明生成) 58,543 210,267
refinement(证明细化) 67,971 208,965
verification(验证) 236,360 41,361
meta_verification(元验证) 52,016 29,057
总计 414,890 91,110

其他量化指标

  • 题目来源池:15,879道
  • 过滤后覆盖独立题目数:15,818道
  • 记录生成Token总数:37,800,710,874
  • 估算输入Token总数:1,246,480,841
  • 记录Token总计:39,047,191,715
  • 验证子集中,评分0的轨迹117,622条;评分0.51的轨迹118,738条

预期用途

  • 训练LLM进行结构化数学推理和证明生成
  • 训练LLM利用先前证明尝试及验证器反馈来修订证明
  • 训练LLM生成证明验证轨迹,识别数学论证中的缺陷
  • 训练LLM评估证明自评和验证器输出
  • 构建长上下文或多轨迹推理系统用于定理证明
  • 有关证明有效性、验证器准确性、错误模式及自验证数学推理的研究

版本关系

  • 本版本:Nemotron-Math-Proofs-v3-SFT
  • 上一版本
    • Nemotron-Math-Proofs-v1(作为本版题目来源)
    • Nemotron-Math-Proofs-v2(上一发布版)
    • Nemotron-Cascade-2-SFT-Data(包含同一来源题目的自然语言证明子集)
  • 版本定位:相比前版大幅扩展,增加了更难的题目池、多轮证明细化及额外的验证/元验证轨迹,作为Nemotron-Math-Proofs-v2 SFT数据集的替代版本

重要参考

搜集汇总
数据集介绍
Nemotron-Math-Proofs-v3-SFT 数据集图片
构建方式
Nemotron-Math-Proofs-v3-SFT数据集源自于AoPS社区的15,879道高难度证明题,从Nemotron-Math-Proofs-v1中精选而来。构建流程采用DeepSeek-V4-Pro模型在最高推理模式下执行四轮生成-验证-精炼循环:首轮生成初步证明,后续轮次针对未完全解决的任务,结合先前尝试与验证器反馈迭代优化。同时,生成遵循DeepSeekMath-V2风格的验证轨迹与元验证轨迹,分别对候选证明进行评分与评价。所有生成内容历经严格的质量过滤,剔除不完整或格式错误的样本,最终保留414,890条高质量轨迹,涵盖15,818道独特问题,确保了数据的纯净度与丰富性。
特点
该数据集的特点在于其多维度、多层次的结构化推理轨迹。它不仅包含自然语言证明生成样本,还系统性地涵盖了证明精炼、验证与元验证过程,形成一个完整的自反馈循环。每个样本都附加了推理过程的元数据,如输入输出token数量及任务类型标记,便于细粒度分析。此外,数据集的验证部分均衡地包含了不同得分(0分与0.5/1分)的轨迹,有助于训练判别性验证模型。大规模的数据量(超过39B生成的token)与高难度问题源池,共同构成了锻炼大型语言模型高级数学推理能力的宝贵资源,特别适合长上下文与多轮推理场景。
使用方法
该数据集专为监督式微调设计,其使用途径广泛。研究人员可直接利用其标准化的messages字段,对语言模型进行指令调优,以增强模型在代数和几何等领域的证明生成能力。同时,数据集中的精炼轨迹可训练模型根据反馈迭代改进证明,验证与元验证数据则用于开发自动评估证明正确性与识别逻辑漏洞的模型。通过分割或整合不同任务类型的数据,用户能够打造定制化的推理系统,甚至构建面向竞赛数学的自验证智能体,推动数学人工智能向更严谨、可靠的方向发展。
背景与挑战
背景概述
Nemotron-Math-Proofs-v3-SFT是由NVIDIA于2026年7月发布的大规模数学推理数据集,专注于长格式证明生成、证明精炼、验证与元验证。该数据集源自AoPS子集的15,879道高难度题目,经四轮生成-验证-精炼流水线产出414,890个样本,旨在训练语言模型进行结构化数学推理与自我验证。其技术报告《An Open Recipe for IMO Gold》展示了冲击国际数学奥林匹克金牌的开放配方,对人工智能数学推理领域具有里程碑意义,为构建可自我验证的推理系统提供了关键资源。
当前挑战
该数据集面临的挑战包括:在领域层面,数学证明推理要求模型具备严谨的逻辑与长链条思考,而现有模型常出现中间步骤错误或无法自我纠错,此数据集通过多轮精炼与验证轨迹试图解决证明有效性与自我验证的难题。在构建层面,大规模生成需处理严格的长度限制与输出质量,必须过滤掉不完整或格式错误的数据,并平衡正负样本(如验证子集中评分0与0.5/1的样本数需保持恰当比例),同时应对高达39B的生成token量带来的计算与存储开销,确保数据的一致性与可用性。
常用场景
经典使用场景
Nemotron-Math-Proofs-v3-SFT数据集聚焦于长格式数学推理,涵盖证明生成、精炼、验证及元验证四类轨迹。其核心应用在于训练大型语言模型进行结构化数学推理与形式化证明,通过四轮生成-验证-精炼流水线,促使模型迭代修正证明并利用验证器反馈提升证明质量。该数据集内含超过41万条样本,源自AoPS社区的15,818道高难度证明题,为模型提供了丰富的对抗性训练素材,推动了从启发式推理向严谨数学证明的跨越。
解决学术问题
该数据集主要解决了数学推理研究中模型缺乏高质量证明训练数据、验证与自我修正能力薄弱等核心难题。通过提供包含证明生成、迭代精炼、验证评分及元验证的完整轨迹,它支撑了关于证明有效性、验证器准确性、错误模式及自我验证推理的系统性研究,为构建可自我校正的数学推理模型奠定了数据基础,推动了自动化定理证明领域的发展。
衍生相关工作
基于该数据集,衍生出多类经典工作,包括开发高效的多轮推理框架以提升长上下文处理能力,构建更精确的证明验证器以衡量答案正确性,以及探索基于验证反馈的自我改进算法。此外,其技术报告《An Open Recipe for IMO Gold》所描述的完整训练配方,为后续研究提供了可复现的基准,催生了数学推理领域的数据构建、模型训练与评估等方向的后续研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务