遇见数据集

Nemotron-Math-Proofs-v3-RL

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

Nemotron-Math-Proofs-v3-RL 是一个用于强化学习的数学推理数据集,专注于长格式数学证明生成。该数据集包含 9,597 个单轮用户提示,这些提示源自 nvidia/Nemotron-Math-Proofs-v1 数据集中来自 AoPS(Art of Problem Solving)社区的困难证明问题。数据集使用 NeMo Gym 兼容格式,每个样本包含一个数学问题(problem),以及用于策略模型生成严格解决方案和自我评估的格式化提示。字段包括 agent_ref(NeMo Gym 代理路由信息)、responses_create_params(单用户消息)、problem(自然语言数学问题)、uuid、license、source、dataset 和 metadata(空列表)。所有记录使用 cc-by-4.0 许可、来源为 AoPS、数据集标识为 Nemotron-Math-Proofs-v3。数据集适用于强化学习训练,通过在线验证器反馈来提升结构化数学推理能力,训练模型生成证明自我评估并识别数学论证中的漏洞。数据以 JSONL 格式存储,仅包含 train 分割(9,597 个样本,磁盘大小约 50.4 MB),不包含策略响应的生成标记。数据集采用混合方法(人工收集、合成、自动化)进行数据收集和标注。该数据集受 Creative Commons Attribution 4.0 International License (CC BY 4.0) 保护,可用于商业或非商业用途。

Nemotron-Math-Proofs-v3-RL is a mathematical reasoning dataset for reinforcement learning, focusing on long-form mathematical proof generation. It contains 9,597 single-turn user prompts derived from difficult proof problems from the AoPS (Art of Problem Solving) community in the nvidia/Nemotron-Math-Proofs-v1 dataset. The dataset uses NeMo Gym-compatible format, with each sample including a math problem (problem) and formatted prompts for generating rigorous solutions and self-evaluation by the policy model. Fields include agent_ref (NeMo Gym agent routing information), responses_create_params (single user message), problem (natural language math problem), uuid, license, source, dataset, and metadata (empty list). All records are licensed under cc-by-4.0, sourced from AoPS, and identified as Nemotron-Math-Proofs-v3. The dataset is suitable for reinforcement learning training to improve structured mathematical reasoning through online verifier feedback, training models to generate proof self-evaluations and identify gaps in mathematical arguments. Data is stored in JSONL format, containing only the train split (9,597 samples, approximately 50.4 MB on disk), without generated tokens from policy responses. Data collection and annotation use a hybrid approach (manual collection, synthesis, automation). The dataset is protected under Creative Commons Attribution 4.0 International License (CC BY 4.0) and can be used for commercial or non-commercial purposes.

提供机构:
NVIDIA
创建时间:
2026-09-03
原始信息汇总

Nemotron-Math-Proofs-v3-RL 数据集概述

基本信息

  • 数据集名称:Nemotron-Math-Proofs-v3-RL
  • 所有者:NVIDIA Corporation
  • 创建日期:2026年7月1日
  • 许可证:Creative Commons Attribution 4.0 International License (CC BY 4.0)
  • 语言:英语
  • 任务类型:文本生成
  • 数据集规模:1K < 样本数 < 10K

数据集简介

Nemotron-Math-Proofs-v3-RL 是一个用于强化学习的长篇数学推理数据集,包含 9,597 个证明生成提示(proof-generation prompts)。该数据集采用 NeMo Gym 兼容的单轮用户提示格式,提示内容源自 nvidia/Nemotron-Math-Proofs-v1 中来自 AoPS(Art of Problem Solving)社区的难题。训练分割要求策略模型生成严谨的解决方案并进行自我评估,策略响应和实际奖励在训练过程中产生,不存储在文件中。

数据来源

  • 问题来源:问题源自 nvidia/Nemotron-Math-Proofs-v1,该数据集收集了来自 AoPS 社区的基于证明的问题,所有记录均标识来源为 AoPS
  • 生成方式:数据采集和标注方法均为混合方式(人工 + 合成 + 自动化)。

数据集结构与格式

  • 模态:文本
  • 格式:JSONL
  • 结构:包含单一的 train 分割,内含用于强化学习的证明生成提示

字段说明

字段 描述
agent_ref NeMo Gym 智能体路由信息
responses_create_params 包含格式化策略提示的单个用户消息
problem 自然语言的数学问题
uuid, license, source, dataset 记录标识和发布来源字段(分别为 cc-by-4.0、AoPS、Nemotron-Math-Proofs-v3)
metadata 发布文件中的空列表

样本数量统计

  • train 分割:9,597 个样本,9,597 个唯一问题,磁盘占用 50,430,007 字节

版本关系

  • 前序版本
    • nvidia/Nemotron-Math-Proofs-v1:本数据集问题的来源
    • nvidia/Nemotron-Math-Proofs-v2:前一个发布版本
    • nvidia/Nemotron-Cascade-2-SFT-Data:包含来自相同来源问题的自然语言证明子集
  • 版本关系说明:本次发布在 Nemotron-Math-Proofs-v1 使用的同一系列难题基础上,新增了用于证明生成的强化学习数据。

预期用途

  • 利用在线验证器反馈进行结构化数学推理和证明生成的强化学习
  • 训练大语言模型生成证明自我评估并识别数学论证中的缺陷
  • 用于可验证奖励的证明生成和强化学习研究

参考资源

  • 技术报告:An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics(https://github.com/NVIDIA-NeMo/Skills/blob/main/recipes/nemotron-imo-tts/paper.pdf)
  • 相关数据集和模型链接已省略(同前例)

伦理考量

NVIDIA 强调可信 AI 是共同责任,并已建立相应政策与实践。开发者应与其内部开发团队协作,确保该数据集满足相关行业和用例的要求,并应对潜在的误用风险。质量问题、风险、安全漏洞或 AI 相关关切可通过 NVIDIA 官方渠道报告。

搜集汇总
数据集介绍
Nemotron-Math-Proofs-v3-RL 数据集图片
构建方式
在数学推理与强化学习交叉领域,证明生成任务长期面临高质量训练信号稀缺的困境。该数据集源自nvidia/Nemotron-Math-Proofs-v1中AoPS社区的高难度证明题,经格式重构后形成适配NeMo Gym框架的单轮用户提示。每条原始问题被嵌入证明器提示模板,并经由agent_ref路由至proof_simple_agent,要求策略输出包含严谨解答、自我评估及盒装评分。训练期间,证明验证裁判对生成内容进行打分,策略响应与实现奖励均动态生成而不落盘存储,从而确保数据文件仅承载策略输入,维持轻量与可复用性。
特点
该数据集的核心特质在于其面向可验证奖励强化学习的定向设计。全部9,597条训练样本均为唯一问题,杜绝重复带来的评估偏差。数据结构以JSONL格式组织,字段涵盖agent_ref路由信息、responses_create_params中的格式化策略提示、自然语言问题正文以及uuid、license、source等溯源标识,元数据字段则保留为空列表。问题来源明确标注为AoPS,许可协议统一为CC BY 4.0,训练文件不纳入生成令牌计数,体现出对策略输入而非完整轨迹的聚焦,为在线验证器反馈驱动的证明生成研究提供了纯净且可审计的数据基础。
使用方法
该数据集适用于以在线验证器反馈为奖励信号的强化学习流程,用于训练语言模型生成结构化数学证明及自我评估。使用者可借助NeMo Gym框架加载train.jsonl,通过agent_ref字段将每个问题路由至proof_simple_agent,触发策略生成包含解答、自评与盒装评分的响应。训练过程中,证明验证裁判对生成内容进行评分,并可选地评估自我评估的合理性,从而形成可验证奖励。该数据亦支持对证明生成中论证缺口的识别研究,以及带可验证奖励的强化学习算法探索,研究者可依据CC BY 4.0许可条款在商业或非商业场景中灵活使用。
背景与挑战
背景概述
大语言模型在形式化数学推理与证明生成领域长期面临严苛的评测瓶颈,奥林匹克级证明题因缺乏可验证的中间步骤与统一答案而成为检验模型深层推理能力的试金石。Nemotron-Math-Proofs-v3-RL由NVIDIA公司于2026年7月构建发布,其问题源自AoPS社区经人工筛选的硬证明题,并以前代Nemotron-Math-Proofs-v1为蓝本扩展出强化学习范式。该数据集包含9,597条证明生成提示,采用NeMo Gym兼容的单轮交互格式,要求策略模型输出严谨解法与自我评估,其技术报告《An Open Recipe for IMO Gold》系统阐述了以可验证奖励驱动奥数级证明能力提升的开放配方,为数学推理的强化学习研究提供了关键基础设施。
当前挑战
该数据集所应对的领域问题在于长程数学证明的自动生成与自验证,其核心挑战在于模型须在开放推理空间中构造逻辑严密、步骤完整的证明,并准确识别自身论证的薄弱环节。构建过程中,从AoPS社区采集的硬证明题需经形式化清洗与提示模板适配,以确保与NeMo Gym智能体路由及验证器反馈机制无缝衔接;同时,证明质量的自动评判依赖可靠的形式化验证器或模型评判器,而自我评估与最终证明之间的一致性亦难以保证。强化学习训练中奖励信号的稀疏性与证明搜索的庞大组合空间进一步加剧了策略优化的难度,要求数据集在提示设计上兼顾可验证性与探索效率。
常用场景
经典使用场景
在数学推理与形式化证明的交汇领域,该数据集构筑了面向强化学习的证明生成任务范式。其经典使用场景聚焦于以单轮用户提示驱动策略模型输出完整证明、自我评估及盒式评分,并借助在线验证器提供可验证奖励。研究者依托NeMo Gym框架,将万级硬证明问题转化为RL训练信号,使模型在生成严谨数学论证的同时习得对自身推理漏洞的识别能力,从而形成证明与自省的双重优化闭环。
衍生相关工作
以该数据集为基石,衍生出一系列围绕自验证数学推理与RLVR的经典工作。DeepSeekMath-V2探索了自我验证数学推理的路径,Nemotron-Math技术报告则系统阐述了从SFT到RL的奥林匹克数学训练配方。Nemotron-Math-Proofs-v1与v2版本逐步迭代出自然语言证明子集及强化学习数据,而NeMo-Skills工具链进一步将证明生成、验证与训练流程标准化,推动了开源数学推理生态的繁荣。
数据集最近研究
最新研究方向
在大模型数学推理能力跃迁的背景下,形式化证明与自然语言证明的自动化生成已成为国际数学奥林匹克(IMO)级别任务的核心攻关方向。Nemotron-Math-Proofs-v3-RL 依托 NeMo Gym 框架与可验证奖励强化学习(RLVR)范式,将 AoPS 高阶证明题转化为近万条证明生成提示,推动模型在单轮交互中完成严谨解答与自我评估的双重目标。该数据集与 DeepSeekMath-V2 提出的自验证推理路径形成呼应,为在线验证器反馈驱动的证明纠错与逻辑缺口识别提供了标准化实验场,其开放配方亦为开源社区复现 IMO 金牌级数学推理能力奠定了数据基石,对数学教育智能化与形式化验证工具链的融合具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务