Nemotron-RL-Ultra-Training-Blends
收藏资源简介:
本数据集提供了公开的Nemotron-3-Ultra后训练配方所使用的强化学习(RL)和多教师在线策略蒸馏(MOPD)训练数据混合。这些混合数据通过NeMo Gym代理框架被NeMo RL训练配方所使用,其中每个提示都与一个能够返回可验证或基于判断的奖励的代理/环境配对。数据集包含七个独立的子集(混合),分别是rlvr1、rlvr2、ifbench、rlhf、reasoning、swe和mopd。每个子集均由NVIDIA发布的数据集与多个外部数据集混合而成,具体混合比例在README中详细列出,涵盖了工具使用对话、软件工程、数学、代码、安全、推理、指令遵循、问答、知识、格式化等多种任务领域。数据总规模约为337,721个样本,总计约17.1 GB。数据格式为JSONL(NeMo Gym提示/代理记录),包含文本和元数据。数据收集和标注方法为混合模式(人工与合成)。数据集适用于研究人员和开发者使用NeMo RL配方和NeMo Gym代理框架对大型语言模型进行基于强化学习的后训练。数据集采用多种许可证(CC BY-SA 4.0、CC BY 4.0、ODC-BY 1.0、MIT、Apache 2.0),可用于商业或非商业用途。
数据集概述:Nemotron-RL-Ultra-Training-Blends
基本信息
- 数据集名称:Nemotron-RL-Ultra-Training-Blends
- 所有者:NVIDIA Corporation
- 创建日期:2026-05-29(最后修改于2026-06-03)
- 语言:英语
- 许可证:CC BY-SA 4.0、CC BY 4.0、ODC-BY 1.0、MIT、Apache 2.0
- 任务类别:文本生成
数据集描述
该数据集为 Nemotron-3-Ultra 后训练方案提供了强化学习(RL)和多教师在线策略蒸馏(MOPD)训练数据混合集。通过 NeMo Gym 智能体框架,每个提示与一个能够返回可验证或基于判断的奖励的智能体/环境配对。每个子集是一个独立的混合数据集。
预期用途
面向研究人员和开发者,使用 NeMo RL 训练方案和 NeMo Gym 智能体框架对大型语言模型进行强化学习后训练。
数据集构成
数据集包含7个子集(配置),每个子集是一个独立的数据混合:
rlvr1(98,424 样本,5.0 GB)
由17个数据集混合组成,主要成分包括:
- nvidia/Nemotron-RL-Agentic-Conversational-Tool-Use-v1(20.36%)
- nebius/SWE-rebench-V2 + SWE-Gym/SWE-Gym(14.12%)
- nvidia/Nemotron-RL-instruction_following(12.02%)
- nvidia/Nemotron-RL-Math-v4(10.86%)
- 其他13个数据集(2.11% - 8.06%不等)
rlvr2(99,116 样本,5.0 GB)
由20个数据集混合组成,主要成分包括:
- nvidia/Nemotron-RL-Agentic-Conversational-Tool-Use-v1(20.21%)
- nebius/SWE-rebench-V2 + SWE-Gym/SWE-Gym(14.02%)
- nvidia/Nemotron-RL-Math-v4(10.79%)
- nvidia/Nemotron-RL-instruction_following(10.50%)
- 其他16个数据集(0.91% - 8.00%不等)
ifbench(34,649 样本,890 MB)
由5个数据集混合组成:
- nvidia/Nemotron-RL-QA-Abstention-v1(43.00%)
- nvidia/Nemotron-RL-instruction_following(21.46%)
- nvidia/Nemotron-RL-Instruction-Following-MultiTurnChat-v1(21.18%)
- nvidia/Nemotron-RLHF-GenRM-v1(7.19%)
- nvidia/Nemotron-RL-InverseIFEval-v1(7.17%)
rlhf(6,500 样本,36 MB)
由2个数据集混合组成:
- nvidia/Nemotron-RLHF-GenRM-v1(84.62%)
- nvidia/Nemotron-RL-Safety-v1(15.38%)
reasoning(5,236 样本,4.5 MB)
- 100% 来自 virtuoussy/Multi-subject-RLVR
swe(7,816 样本,563 MB)
- nebius/SWE-rebench-V2(97.36%)
- SWE-Gym/SWE-Gym(2.64%)
mopd(85,980 样本,5.5 GB)
由20个数据集混合组成,主要成分包括:
- nebius/SWE-rebench-V2 + SWE-Gym/SWE-Gym(15.27%)
- nvidia/Nemotron-RL-Math-v4(12.44%)
- nvidia/Nemotron-RL-Instruction-Following-Structured-Outputs-v2(12.42%)
- 其他17个数据集(0.29% - 12.11%不等)
数据集总量
- 总计样本数:337,721
- 总大小:约17.1 GB
数据准备与格式
- 模态:文本
- 格式:JSONL(NeMo Gym 提示/智能体记录),结构包含文本和元数据
- 数据收集方法:混合(人工、合成)
- 标注方法:混合(人工、合成、自动化)
- 部分数据集使用占位符指向原始数据集(如 BytedTsinghua-SIA/DAPO-Math-17k、Skywork/Skywork-OR1-RL-Data),需使用
fill_placeholders.py脚本下载填充 - 每个混合集根据 Nemotron-3-Ultra 技术报告中的课程方案进行预处理,样本按通过率从高到低(简单到困难)排序
伦理考量
NVIDIA 倡导可信赖的人工智能,鼓励开发者确保数据集符合相关行业和用例的要求,并解决未预见的产品滥用问题。
参考资料
- NeMo RL:https://github.com/NVIDIA-NeMo/RL
- NeMo Gym:https://github.com/NVIDIA-NeMo/Gym
- Nemotron-3-Ultra 训练指南:https://github.com/NVIDIA-NeMo/RL/blob/ultra-v3/docs/guides/nemotron-3-ultra.md




