遇见数据集

Nemotron-RL-Lightning-Training-Blend

收藏
Hugging Face2026-08-15 更新2026-08-16 收录
官方服务:

资源简介:

该数据集是用于公开的 Nemotron-3.5-Lightning 后训练配方中可验证奖励强化学习(RLVR)阶段的训练数据混合。该混合数据通过 NeMo Gym 代理框架被 NeMo RL 训练配方使用,其中每个提示都与一个返回可验证或基于裁判奖励的代理/环境配对。混合数据将 NVIDIA 发布的数据集与多个外部数据集相结合,包括 nvidia/Nemotron-RL-Agentic-Conversational-Tool-Use-v1、nebius/SWE-rebench-V2 + SWE-Gym/SWE-Gym、nvidia/Nemotron-RL-instruction_following 等(共 16 个组件)。数据集规模为 92,684 个样本,总大小约 3.9 GB,模态为文本,格式为 JSONL(NeMo Gym 提示/代理记录),包含文本和元数据。数据收集和标注方法为混合(人工、合成和自动)。该数据集适用于商业或非商业用途,旨在供研究者和开发者使用 NeMo RL 配方和 NeMo Gym 代理框架对大型语言模型进行强化学习后训练。数据混合使用课程技术进行预处理,样本按通过率从高到低(从易到难)排序,以确保平衡的学习进度。

This dataset is a training data mixture for the verifiable reward reinforcement learning (RLVR) stage in the publicly available Nemotron-3.5-Lightning post-training recipe. The mixture is used by the NeMo RL training recipe through the NeMo Gym agent framework, where each prompt is paired with an agent/environment that returns a verifiable or judge-based reward. The mixture combines datasets released by NVIDIA with several external datasets, including nvidia/Nemotron-RL-Agentic-Conversational-Tool-Use-v1, nebius/SWE-rebench-V2 + SWE-Gym/SWE-Gym, nvidia/Nemotron-RL-instruction_following, etc. (16 components in total). The dataset size is 92,684 samples, total size approximately 3.9 GB, modality is text, format is JSONL (NeMo Gym prompt/agent records), containing text and metadata. Data collection and annotation methods are mixed (human, synthetic, and automatic). The dataset is suitable for commercial or non-commercial use and is intended for researchers and developers to perform reinforcement learning post-training on large language models using NeMo RL recipes and NeMo Gym agent framework. The data mixture is preprocessed using curriculum techniques, with samples sorted by pass rate from high to low (easy to difficult) to ensure balanced learning progress.

提供机构:
NVIDIA
创建时间:
2026-08-08
原始信息汇总

数据集概述:Nemotron-RL-Lightning-Training-Blend

基本信息

  • 数据集所有者:NVIDIA Corporation
  • 创建时间:2026-08-04,最后修改于 2026-08-06
  • 许可证:采用多重许可,包括 CC BY-SA 4.0、CC BY 4.0、ODC-BY 1.0、MIT 和 Apache 2.0
  • 语言:英语
  • 任务类型:文本生成

数据集描述

该数据集提供了公开的 Nemotron-3.5-Lightning 后训练配方中**可验证奖励强化学习(RLVR)**阶段所使用的训练数据混合集。该混合集通过 NeMo Gym 代理框架被 NeMo RL 训练配方使用,其中每个提示与一个代理/环境配对,该环境返回可验证或基于评判的奖励。该数据集可用于商业或非商业用途。

数据组成

数据集由 NVIDIA 发布的多个数据集与若干外部数据集混合而成,共包含 16 个组成成分,各成分占比如下:

数据集组件 占比
Nemotron-RL-Agentic-Conversational-Tool-Use-v1 17.51%
nebius/SWE-rebench-V2 + SWE-Gym/SWE-Gym 16.19%
Nemotron-RL-instruction_following 11.64%
Nemotron-RLHF-GenRM-v1 10.41%
Nemotron-RL-coding-competitive_coding 9.11%
Nemotron-RL-Math-v4 5.67%
Nemotron-RL-Safety-v1 5.20%
Nemotron-RL-Instruction-Following-MultiTurnChat-v1 4.48%
Nemotron-RL-QA-Abstention-v1 4.48%
Nemotron-SFT-Science-v2 2.39%
Nemotron-RL-knowledge-mcqa 2.38%
Nemotron-RL-Instruction-Following-Structured-Outputs-v2 2.37%
Nemotron-RL-Instruction-Following-Free-Form-Formatting-v1 2.37%
Nemotron-RL-Agentic-Function-Calling-Pivot-v1 2.34%
Nemotron-RL-Instruction-Following-Citation-Formatting-v1 2.33%
Nemotron-RL-Instruction-Following-Calendar-v2 1.13%

数据准备

对于混合集中的 BytedTsinghua-SIA/DAPO-Math-17k 和 Skywork/Skywork-OR1-RL-Data 数据,采用占位符引用原始数据集中的条目,使用 fill_placeholders.py 脚本可从原始数据集下载数据。用户须自行检查各数据集许可证是否符合预期用途。该混合集采用课程学习技术进行预处理,样本按通过率从高到低(易到难)排序。

数据特征

  • 数据收集方法:混合方式(人工 + 合成)
  • 标注方法:混合方式(人工 + 合成 + 自动化)
  • 模态:文本
  • 格式:JSONL(NeMo Gym 提示/代理记录),包含文本和元数据

数据规模

  • 样本数:92,684 条
  • 大小:约 3.9 GB

预期用途

该数据集面向使用 NeMo RL 配方和 NeMo Gym 代理框架对大型语言模型进行强化学习后训练的研究人员和开发者,具体端到端操作可参考 Nemotron-3.5-Lightning 训练指南。

参考链接

  • NeMo RL:https://github.com/NVIDIA-NeMo/RL
  • NeMo Gym:https://github.com/NVIDIA-NeMo/Gym
  • Nemotron-3.5-Lightning 训练指南:https://docs.nvidia.com/nemo/rl/nightly/guides/models/nemotron/nemotron-3.5-lightning.html

伦理考量

NVIDIA 认为可信赖的 AI 是共同责任,并已建立相关策略和实践以支持广泛的 AI 应用开发。开发者应与内部团队合作,确保该数据集满足相关行业和用例的需求,并处理不可预见的滥用风险。质量问题、风险、安全漏洞或 NVIDIA AI 问题可通过 https://www.nvidia.com/en-us/support/submit-security-vulnerability/ 报告。

搜集汇总
数据集介绍
Nemotron-RL-Lightning-Training-Blend 数据集图片
构建方式
在大语言模型后训练阶段,可验证奖励强化学习对训练数据的质量与配比提出了严苛要求。本数据集通过混合NVIDIA自研数据与多个外部开源数据集构建而成,其中外部数据以占位符形式指向原始数据源,需借助fill_placeholders.py脚本从原始数据集下载对应内容以完成填充。混合比例经过精细设计,覆盖智能体对话工具调用、软件工程、指令遵循、通用奖励模型、竞赛编程、数学推理、安全对齐、科学问答等十六个数据组件。数据经过统一预处理,采用由高通过率样本至低通过率样本的课程排序策略,以确保学习进程的平衡递进。
特点
该数据集展现出多维度、多层次的数据生态特征。其构成横跨智能体交互、代码生成、数学推理、安全合规、结构化输出及多轮对话等丰富任务类型,形成了覆盖广泛能力面向的训练信号。数据集采用JSONL格式存储,每条记录以提示词与智能体环境配对的形式组织,并附带可验证或基于评判的奖励信号。整体包含92,684条样本,规模约为3.9 GB,数据来源兼具人类标注与合成生成,标注方式融合人工、合成与自动化手段,在保证数据多样性的同时维持了奖励信号的可靠性。
使用方法
该数据集专为研究者与开发者利用NeMo RL训练配方及NeMo Gym智能体框架进行大语言模型强化学习后训练而设计。使用者可参照Nemotron-3.5-Lightning训练指南获取端到端操作流程,将本数据混合集直接接入NeMo RL训练管道。每个提示词通过NeMo Gym框架与对应的智能体或环境配对,由环境返回可验证或基于评判的奖励,从而驱动强化学习过程。对于包含占位符的外部数据集组件,使用者需先行运行数据填充脚本完成下载,并自行核查各原始数据集的许可条款是否契合预期用途。
背景与挑战
背景概述
在大语言模型后训练范式由监督微调向强化学习演进的脉络中,可验证奖励强化学习(RLVR)已成为提升模型推理与对齐能力的关键路径。NVIDIA于2026年8月发布的Nemotron-RL-Lightning-Training-Blend数据集,正是面向Nemotron-3.5-Lightning公开后训练配方中RLVR阶段的训练数据混合方案,由NVIDIA公司创建并维护。该数据集通过NeMo RL配方与NeMo Gym智能体框架消费,将每一提示与可返回可验证或评判式奖励的智能体/环境配对,并融合多个NVIDIA内部数据集与外部数据集,构成覆盖工具调用、指令遵循、编程、数学、安全与知识问答等多元能力维度的训练混合。该数据集为研究者与开发者复现和拓展RLVR后训练流程提供了标准化、可商用的数据基础,对推动强化学习后训练的可复现研究具有重要参考价值。
当前挑战
该数据集所应对的领域问题在于,如何为可验证奖励强化学习构建兼具能力广度与课程梯度的训练混合,使模型在数学、编程、指令遵循、工具使用与安全等多任务上协同提升,而非顾此失彼。其构建过程面临多重挑战:其一,异构数据源的配比设计需在多元能力间取得均衡,任何单一能力的过采样都可能引发灾难性遗忘或能力失衡;其二,外部数据集因许可限制而采用占位符引用机制,使用者需经脚本回填并自行核验各数据集的许可适配性,增加了复现成本与合规风险;其三,为遵循由易至难的课程学习策略,需对样本通过率进行可靠估计并据此排序,而通过率估计本身依赖模型与评判环境,存在偏差传导的可能;其四,奖励的可验证性与评判式奖励的可靠性在不同任务间差异显著,难以以统一标准校准。上述因素共同构成了该数据集在训练稳定性与泛化性方面的核心挑战。
常用场景
经典使用场景
在大语言模型后训练领域,强化学习与可验证奖励(RLVR)已成为提升模型推理与对齐能力的关键范式。Nemotron-RL-Lightning-Training-Blend作为专为Nemotron-3.5-Lightning后训练配方中RLVR阶段设计的训练数据混合体,其最经典的使用场景便是通过NeMo RL训练配方与NeMo Gym智能体框架,为每个提示词配对可返回可验证或基于评判奖励的智能体与环境,从而驱动模型在数学推理、代码生成、指令遵循、工具调用及安全对齐等多维度任务上进行强化学习训练。该混合体按照课程学习策略,将样本由高通过率(较易)至低通过率(较难)排序,确保模型获得均衡的学习进阶。
解决学术问题
该数据集有效回应了强化学习后训练中奖励信号稀疏、任务分布单一以及课程设计缺失等常见学术难题。通过融合可验证奖励与生成式奖励模型,它为复杂推理任务提供了稠密且可靠的反馈信号,缓解了传统RLHF中奖励模型易被利用的问题。同时,混合体覆盖数学、编程、科学、安全与多轮对话等多元领域,使研究者得以系统探究跨任务泛化与灾难性遗忘之间的权衡。其课程式样本排序方法亦为研究课程学习在RLVR中的作用提供了标准化实验平台,对推动可复现的强化学习后训练研究具有深远意义。
衍生相关工作
围绕该数据集,已衍生出一系列经典工作,包括Nemotron-3-Ultra技术报告中描述的课程学习技术,以及NeMo RL与NeMo Gym等开源训练与智能体框架。其组件数据集如Nemotron-RL-Agentic-Conversational-Tool-Use-v1、Nemotron-RL-instruction_following与Nemotron-RLHF-GenRM-v1等,各自成为工具使用、指令遵循与生成式奖励建模等方向的重要基准。此外,混合体引入的SWE-rebench-V2、SWE-Gym及DAPO-Math-17k等外部数据,亦促进了软件工程与数学推理领域强化学习研究的交叉融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务