遇见数据集

nemotron-gym-structured-outputs-v4

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

该数据集为Harbor任务二进制数据集,包含53,870个任务,从nvidia/Nemotron-RL-Instruction-Following-Structured-Outputs-v2转换而来,属于nvidia/Nemotron-Post-Training-v3集合的一部分。数据集包含两列:path(字符串类型)和task_binary(gzip压缩tar文件格式),转换过程使用了OpenThoughts-Agent的data.nemotron_gym框架。数据集主要用于文本生成任务,涉及智能体、Harbor、强化学习和Nemotron等技术,其评分机制基于JSON/YAML/TOML模式验证以及XML/CSV结构验证。相较于前一版本,本版本修复了终端智能体的答案交付契约问题,明确指示智能体通过shell heredoc将答案写入评分器指定的文件路径并验证,从而确保答案正确提交,避免因文件缺失导致的评分失败。该数据集适用于训练或评估智能体在遵循结构化输出指令方面的能力,特别是在需要生成符合特定模式或结构的文本生成场景中。

This dataset is the Harbor task binary dataset, containing 53,870 tasks, converted from nvidia/Nemotron-RL-Instruction-Following-Structured-Outputs-v2 and is part of the nvidia/Nemotron-Post-Training-v3 collection. The dataset includes two columns: path (string type) and task_binary (gzip-compressed tar file format), with the conversion process using OpenThoughts-Agents data.nemotron_gym framework. It is primarily used for text generation tasks, involving technologies such as agents, Harbor, reinforcement learning, and Nemotron. The scoring mechanism is based on JSON/YAML/TOML schema validation and XML/CSV structure validation. Compared to the previous version, this version fixes the answer delivery contract issue for terminal agents, explicitly instructing agents to write answers to the file path specified by the scorer via shell heredoc and verify, ensuring correct answer submission and avoiding scoring failures due to missing files. The dataset is suitable for training or evaluating agents ability to follow structured output instructions, particularly in text generation scenarios that require generating text conforming to specific schemas or structures.

提供机构:
LAION eV
创建时间:
2026-06-05
原始信息汇总

数据集概述:laion/nemotron-gym-structured-outputs-v4

  • 来源与转换:该数据集基于 nvidia/Nemotron-RL-Instruction-Following-Structured-Outputs-v2 转换而来,属于 nvidia/Nemotron-Post-Training-v3 系列的一部分。
  • 规模:包含 53,870 个任务(Harbor task-binary 格式)。
  • 数据列:包含 path(字符串)和 task_binary(gzip tar 格式)两列。
  • 转换框架:使用 OpenThoughts-Agent 的 data.nemotron_gym 框架完成转换。
  • 评分标准:支持 JSON、YAML、TOML 模式的验证;以及 XML、CSV 的结构验证。

相较于先前版本的变更

  • 修复了终端代理的“答案交付契约”问题:先前版本仅告知代理要生成什么,但未说明如何提交。导致 1 轮 terminus-2 代理以聊天回复形式输出答案,而非写入需评分的文件,造成大多数尝试因“答案文件缺失”得 0 分。
  • 改进后的指令:现已明确要求代理通过 shell heredoc 将答案写入评分器指定的文件路径,并执行验证。评分逻辑本身未作其他更改。

许可与标签

  • 许可协议:Apache-2.0
  • 任务类别:文本生成(text-generation)
  • 标签:agent、harbor、reinforcement-learning、nemotron
搜集汇总
数据集介绍
nemotron-gym-structured-outputs-v4 数据集图片
构建方式
该数据集源自NVIDIA提出的Nemotron-RL-Instruction-Following-Structured-Outputs-v2,隶属于更广泛的Nemotron-Post-Training-v3系列。为适配终端智能体的交互范式,我们利用OpenThoughts-Agent框架下的data.nemotron_gym工具,将原始数据高效转化为包含路径字段与任务二值化压缩包的Harbor格式,最终产出总计53,870条结构化任务样本。
特点
数据集的核心特色在于修复了先前版本中终端智能体与评估系统之间的答案交付契约缺陷。早期版本仅告知智能体需生成何种内容,却未规范提交方式,导致多数试验因答案文件缺失而得分归零。当前版本通过shell heredoc机制明确要求智能体将结果写入评分者指定的文件路径并进行验证,显著提升了模型在结构化输出任务中的执行可靠性。
使用方法
数据集中每条样本包含path(字符串)与task_binary(gzip压缩包)两列,适用于文本生成任务的强化学习微调。使用时需先行解压task_binary获取任务数据,并依据JSON、YAML、TOML等模式的schema验证规则对输出进行评分;对于XML与CSV格式则侧重结构合规性检测,确保模型生成内容满足结构化输出要求。
背景与挑战
背景概述
nemotron-gym-structured-outputs-v4数据集由LAION研究机构于近期发布,基于NVIDIA的Nemotron-RL-Instruction-Following-Structured-Outputs-v2转换而来,是NVIDIA Nemotron-Post-Training-v3系列的重要组成部分。该数据集专注于强化学习中结构化输出生成任务,包含53,870个二进制任务,旨在解决代理在终端环境中精确交付格式化输出(如JSON、YAML、TOML、XML、CSV)的挑战。通过Harbor任务框架和OpenThoughts-Agent工具链的整合,该数据集为训练和评估具备严格格式遵循能力的大语言模型提供了标准化基准,推动了强化学习在结构化输出领域的应用与发展。
当前挑战
该数据集面临的核心挑战源于领域问题与构建过程两方面。领域层面,代理需在单轮交互中精准生成并交付符合特定格式规范的输出,但早期版本因指令未明确提交方式而导致代理以聊天回复替代文件写入,评分近乎为零。构建过程中,如何设计清晰且可执行的“答案交付契约”成为难点,即需确保指令明确指示代理通过shell heredoc写入评分文件并验证,同时保持评分逻辑的稳定性。此外,将大量原始任务高效转换为二进制格式并保证数据一致性,亦增加了数据处理的复杂度。
常用场景
经典使用场景
在强化学习与智能体训练的前沿探索中,nemotron-gym-structured-outputs-v4数据集被广泛应用于结构化输出生成任务的训练与评估。其核心场景聚焦于引导智能体(agent)在复杂环境中按照精确的格式规范(如JSON、YAML、TOML、XML、CSV)生成指定内容,并通过自动化模式验证机制进行即时评分。该数据集包含53,870个任务,每个任务以二进制格式存储,专为大语言模型的文本生成与智能体行为优化而设计,是训练具备高度格式遵循能力与可靠输出交付能力的终端智能体的关键资源。
解决学术问题
该数据集直接回应了强化学习领域中一个长期存在的学术挑战:如何确保智能体不仅理解任务指令,还能严格按照指定格式完成任务交付。以往研究常忽视智能体在交互过程中的输出格式合规性,导致评估结果失真。nemotron-gym-structured-outputs-v4通过引入明确的“答案交付契约”,强制智能体将生成结果写入评分文件而非作为对话回复,从而解决了因为输出格式与提交机制不一致而引发的“文件缺失”评分失效问题。这一设计显著提升了训练过程中评分信号的准确性与任务完成的鲁棒性,为结构化输出生成与智能体行为规范研究提供了可复现的基准。
衍生相关工作
该数据集源自NVIDIA的Nemotron-RL-Instruction-Following-Structured-Outputs-v2项目,经由OpenThoughts-Agent框架转换而成,属于Nemotron-Post-Training-v3系列的重要组成部分。其衍生的经典工作包括基于Harbor框架的任务二进制格式处理管线、针对终端智能体的输出验证机制改进,以及强化学习中奖励信号与输出格式解耦的研究。后续工作围绕如何通过细粒度指令改进(如使用shell heredoc方式明确提交路径)提升智能体在真实复杂环境中的任务完成率,催生了大量关于结构化输出生成与智能体行为约束的实证研究,推动了人机协作中格式规范自动化的进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务