Nemotron-Math-Proofs-v3-SFT
收藏资源简介:
Nemotron-Math-Proofs-v3-SFT是一个面向长形式数学推理的数据集,专注于证明生成、证明改进、验证和元验证任务的轨迹数据。该数据集包含经过质量过滤后的414,890个样本,涵盖15,818个独特数学证明问题。问题来源选自nvidia/Nemotron-Math-Proofs-v1数据集中来自AoPS(Art of Problem Solving)社区的较难证明问题(共15,879个原始问题)。所有响应使用DeepSeek-V4-Pro模型在Max推理模式下生成,并采用四轮生成-验证-改进流水线:第一轮生成初始证明,第2至4轮对未严格解决的问题进行改进,同时生成验证器和元验证器轨迹。验证器轨迹评估候选证明并给出分数(0、0.5或1),元验证器轨迹评估自评或代表性验证器输出。数据字段包括uuid、messages(标准化用户/助手消息序列,含可见内容和长形式推理内容)、tools(工具定义)、license(cc-by-4.0)、metadata(含问题、问题索引、数据类型、token计数等)、source(AoPS)、dataset(Nemotron-Math-Proofs-v3-SFT)、subset以及后处理字段。数据类型通过metadata.data_type区分,包括proof、refinement、verification和meta_verification。数据格式为JSONL,训练集分为10个shard,总大小约121.95 GiB,总记录token数约390亿。该数据集适用于训练大语言模型进行结构化数学推理、证明生成与修订、验证轨迹生成、元验证、长上下文推理系统以及数学论证有效性研究。数据集采用CC-BY-4.0许可证,可用于商业和非商业用途。
Nemotron-Math-Proofs-v3-SFT is a dataset for long-form mathematical reasoning, focusing on trajectory data for proof generation, proof refinement, verification, and meta-verification tasks. It contains 414,890 quality-filtered samples covering 15,818 unique mathematical proof problems. The problems are selected from the nvidia/Nemotron-Math-Proofs-v1 dataset, specifically the more difficult proof problems from the AoPS (Art of Problem Solving) community (15,879 original problems). All responses are generated using the DeepSeek-V4-Pro model in Max reasoning mode, employing a four-round generation-verification-refinement pipeline: the first round generates initial proofs, rounds 2 to 4 refine unsolved problems, while generating verifier and meta-verifier trajectories. Verifier trajectories evaluate candidate proofs and assign scores (0, 0.5, or 1), and meta-verifier trajectories evaluate self-assessment or representative verifier outputs. Data fields include uuid, messages (standardized user/assistant message sequences with visible content and long-form reasoning content), tools (tool definitions), license (cc-by-4.0), metadata (including problem, problem index, data type, token counts, etc.), source (AoPS), dataset (Nemotron-Math-Proofs-v3-SFT), subset, and post-processing fields. Data types are distinguished via metadata.data_type, including proof, refinement, verification, and meta_verification. The data format is JSONL, with the training set split into 10 shards, total size approximately 121.95 GiB, and total recorded tokens about 39 billion. The dataset is suitable for training large language models on structured mathematical reasoning, proof generation and revision, verification trajectory generation, meta-verification, long-context reasoning systems, and mathematical argument validity research. The dataset is licensed under CC-BY-4.0, allowing commercial and non-commercial use.
Nemotron-Math-Proofs-v3-SFT 数据集概览
基本信息
- 数据集名称:Nemotron-Math-Proofs-v3-SFT
- 所有者:NVIDIA Corporation
- 创建日期:2026年7月1日
- 许可证:CC BY 4.0(知识共享署名4.0国际许可)
- 语言:英语
- 任务类型:文本生成
- 数据集规模:100K至1M样本(实际为414,890条)
- 数据格式:JSONL,共10个分片文件(data/train-00000-of-00010.jsonl 至 data/train-00009-of-00010.jsonl)
- 总磁盘大小:121.95 GiB
数据集概述
Nemotron-Math-Proofs-v3-SFT 是一个数学推理数据集,包含**证明生成(proof generation)、证明细化(proof refinement)、验证(verification)和元验证(meta-verification)**四个任务类型的长期推理轨迹。经过质量过滤后,该数据集包含 414,890个样本,覆盖 15,818道独立题目。
数据来源与生成流程
问题筛选
- 题目来源于 Nemotron-Math-Proofs-v1 中从 AoPS(Art of Problem Solving)社区收集的证明类问题。
- 基于先前的通过率评估,选取了 15,879道难度较高的问题 进入生成流程。
多轮轨迹生成
- 使用 DeepSeek-V4-Pro(Max推理模式)生成所有四类任务数据。
- 采用四轮"生成-验证-细化(generate-verify-refine)"流程:
- 第1轮:为每个问题生成多个初始证明尝试。
- 第2至4轮:利用先前尝试及验证反馈,对尚未严格解决的问题生成修订证明。
- 验证:多个验证器轨迹评估候选证明,并给出最终评分(
0、0.5或1)。 - 元验证:元验证器轨迹评估候选者的自我评估或代表性验证器的评估结果。
生成超参数
- 温度:1.0
- Top-p:0.95
- 各阶段Token上限:初始证明400,000;细化证明350,000;验证64,000;元验证96,000
质量过滤
严格的后处理过滤移除了以下内容:
- 不完整或长度超限的生成结果
- 空响应或格式错误的响应
- 使用推理回退机制的行
- 在可见回答文本中暴露
<think>标记的行为 - 证明和细化样本必须包含非空的可见
Solution和Self Evaluation部分 - 验证和元验证样本必须包含可解析的最终评分,并以可见的最终证明为输入
数据集字段
数据集包含以下字段:
uuid:样本唯一标识符messages:标准化用户/助手消息序列,助手消息包含可见的content及对应的长格式reasoning_contenttools:工具定义列表license:样本级许可证标签(cc-by-4.0)metadata:任务元数据,包含problem、problem_idx、data_type等source:题目来源标签(AoPS)dataset:数据集/发布标签(Nemotron-Math-Proofs-v3-SFT)subset:兼容性子集标签filter_reason、processing_info、match_contexts、matched_categories:后处理及兼容性字段
任务类型以metadata.data_type为唯一权威标识,取值为:proof、refinement、verification 或 meta_verification。
数据统计
| 数据类型 | 样本数 | 平均生成Token数 |
|---|---|---|
| proof(证明生成) | 58,543 | 210,267 |
| refinement(证明细化) | 67,971 | 208,965 |
| verification(验证) | 236,360 | 41,361 |
| meta_verification(元验证) | 52,016 | 29,057 |
| 总计 | 414,890 | 91,110 |
其他量化指标:
- 题目来源池:15,879道
- 过滤后覆盖独立题目数:15,818道
- 记录生成Token总数:37,800,710,874
- 估算输入Token总数:1,246,480,841
- 记录Token总计:39,047,191,715
- 验证子集中,评分
0的轨迹117,622条;评分0.5或1的轨迹118,738条
预期用途
- 训练LLM进行结构化数学推理和证明生成
- 训练LLM利用先前证明尝试及验证器反馈来修订证明
- 训练LLM生成证明验证轨迹,识别数学论证中的缺陷
- 训练LLM评估证明自评和验证器输出
- 构建长上下文或多轨迹推理系统用于定理证明
- 有关证明有效性、验证器准确性、错误模式及自验证数学推理的研究
版本关系
- 本版本:Nemotron-Math-Proofs-v3-SFT
- 上一版本:
- Nemotron-Math-Proofs-v1(作为本版题目来源)
- Nemotron-Math-Proofs-v2(上一发布版)
- Nemotron-Cascade-2-SFT-Data(包含同一来源题目的自然语言证明子集)
- 版本定位:相比前版大幅扩展,增加了更难的题目池、多轮证明细化及额外的验证/元验证轨迹,作为Nemotron-Math-Proofs-v2 SFT数据集的替代版本
重要参考




