Nemotron-RL-Math-v2
收藏资源简介:
Nemotron-RL-Math-v2是一个专为强化学习训练设计的精选数学问题数据集,特别适用于可验证奖励的强化学习(RLVR)工作流。该数据集整合了来自多个来源的数学问题:AoPS(美国数学竞赛问题)、从Nemotron-SFT-Math-v4 SFT集中保留的StackExchange衍生数学问题、Skywork/Skywork-OR1-RL-Data公共RL数据集、BytedTsinghua-SIA/DAPO-Math-17k公共数学RL数据集以及供应商购买的数据。数据集包含7,732个训练样本,采用JSONL格式,每个样本包含以下字段:唯一标识符(uuid)、用于RL训练的问题陈述(question)、经过验证的目标答案(expected_answer)、包含用户提示的Responses API风格请求参数(responses_create_params)、用于答案检查的智能体配置(agent_ref)、验证器类型(verifier_type)以及部分记录中存在的内部占位符字段(_hf_question_placeholder)。所有问题和预期答案均使用GPT-5.2模型进行正确性验证。数据集适用于以下场景:大型语言模型在可验证数学推理任务上的强化学习、需要带答案验证的精选数学问题的RLVR实验、研究相对于监督微调数据集的数学泛化能力、构建从易到难的课程式RL训练集,以及评估数学推理系统的答案验证和鲁棒性。数据集采用CC BY 4.0许可证,并兼容商业和非商业用途。
数据集名称
Nemotron-RL-Math-v2
数据集描述
Nemotron-RL-Math-v2 是一个精心策划的小型数学问题集合,专为强化学习(Reinforcement Learning, RL)设计。该数据集适用于可验证答案或具有其他验证信号的 RL 训练工作流,特别适合基于可验证奖励的强化学习(Reinforcement Learning from Verifiable Rewards, RLVR)。
数据集所有者
NVIDIA Corporation
创建与修改日期
- 创建日期:2026年5月1日
- 最后修改日期:2026年5月1日
版本
- 当前版本:Nemotron-RL-Math-v2
- 先前版本:https://huggingface.co/datasets/nvidia/Nemotron-RL-Super-Training-Blends
- 与前版关系:本数据集是先前发布数据集的直接替代品。
许可协议
- 主许可:Creative Commons Attribution 4.0 International (CC BY 4.0)
- 附加信息:Apache 2.0 License;MIT License;BSD-3 License
预期用途
- 对大型语言模型(LLM)进行可验证数学推理任务的强化学习
- 需要带有答案验证的策划数学问题的 RLVR 实验
- 研究相对于监督微调数据集的留出数学泛化能力
- 构建从易到难数学问题的课程式 RL 训练集
- 评估数学推理系统的答案验证能力和鲁棒性
数据集特征
组成与生成
问题来源
数据集综合了以下来源的策划子集:
- 来自 AoPS(https://artofproblemsolving.com/)的数学问题
- 来自 StackExchange(https://math.stackexchange.com/)的数学问题,这些数据从 Nemotron-SFT-Math-v4 SFT 集中留出
- Skywork/Skywork-OR1-RL-Data(https://huggingface.co/datasets/Skywork/Skywork-OR1-RL-Data):包含可验证数学和编程问题的公共 RL 数据集
- BytedTsinghua-SIA/DAPO-Math-17k(https://huggingface.co/datasets/BytedTsinghua-SIA/DAPO-Math-17k):包含提示和可验证答案的公共数学 RL 数据集
- 供应商购买的数据
策划与过滤
问题根据 RL 适用性进行筛选,重点在于可验证性、数学主题覆盖范围以及与 SFT 训练集的分离。所有问题和预期答案均经过 GPT-5.2 模型验证以确保正确性。
数据集字段
数据集包含以下字段:
uuid:样本的唯一标识符question:用于 RL 训练的题目描述expected_answer:经过验证的样本目标答案responses_create_params:包含用户提示的Responses API风格请求参数agent_ref:用于答案检查的智能体配置verifier_type:样本使用的验证器类型_hf_question_placeholder:部分记录包含的内部占位符字段
数据收集方法
混合方式:人工、合成、自动化、供应商购买
标注方法
混合方式:人工、合成、自动化
数据集格式
- 模态: 文本
- 格式: JSONL
- 结构: JSONL 记录,包含问题提示、验证答案、Responses API 风格请求参数、验证器配置,以及用于重建掩码公共来源行的占位符元数据(如适用)
数据量化
- 子集样本(训练集):7,732 条
- 总磁盘空间:6,873,775 字节
恢复掩码行
包含掩码占位符的行可通过本仓库附带的 fill_placeholders.py 脚本重建。使用方式:
- 创建
masked和restored目录 - 将
data/train.jsonl复制到masked/train.jsonl - 安装依赖:
python -m pip install "datasets>=2.19.0" - 运行脚本:
python fill_placeholders.py --input-dir masked --output-dir restored脚本会从BytedTsinghua-SIA/DAPO-Math-17k和Skywork/Skywork-OR1-RL-Data下载源行,填充question和expected_answer,更新responses_create_params.input[0].content,并将恢复后的 JSONL 文件写入输出目录。
参考来源
- https://huggingface.co/datasets/nvidia/Nemotron-RL-Super-Training-Blends
- https://huggingface.co/datasets/Skywork/Skywork-OR1-RL-Data
- https://huggingface.co/datasets/BytedTsinghua-SIA/DAPO-Math-17k
- https://huggingface.co/datasets/nvidia/Nemotron-SFT-Math-v3
- https://github.com/NVIDIA-NeMo/Gym
- https://github.com/NVIDIA-NeMo/RL/blob/super-v3/docs/guides/nemotron-3-super.md
伦理考量
NVIDIA 认为可信赖的 AI 是共同责任,并已制定政策和实践以支持多种 AI 应用的开发。开发者应与其内部开发团队合作,确保本数据集满足相关行业和用例的需求,并解决潜在的误用问题。质量、风险、安全漏洞或 NVIDIA AI 相关问题可在此处报告:https://www.nvidia.com/en-us/support/submit-security-vulnerability/




