nemotron-gym-inverse-ifeval-v2
收藏资源简介:
该数据集名为nemotron-gym-inverse-ifeval-v2,是一个Harbor任务二进制数据集,包含1,000个任务,源自nvidia/Nemotron-RL-InverseIFEval-v1(属于nvidia/Nemotron-Post-Training-v3系列)。数据以两列形式组织:path(字符串类型,表示路径)和task_binary(gzip tar压缩格式,存储任务二进制数据),转换过程使用了OpenThoughts-Agent的data.nemotron_gym框架。数据集主要用于文本生成和代理相关任务,涉及强化学习环境,评估采用多标准LLM评判(全部结果为YES),运行需配置OPENAI_API_KEY。与前一版本相比,本版本修复了终端代理的答案交付问题:明确指示代理通过shell heredoc将答案写入指定文件路径并进行验证,从而确保答案文件正确提交,但核心评分逻辑保持不变。
The dataset named nemotron-gym-inverse-ifeval-v2 is a Harbor task binary dataset containing 1,000 tasks, derived from nvidia/Nemotron-RL-InverseIFEval-v1 (part of the nvidia/Nemotron-Post-Training-v3 series). The data is organized in two columns: path (string type, representing the path) and task_binary (gzip tar compressed format, storing task binary data), with the conversion process using the OpenThoughts-Agent data.nemotron_gym framework. The dataset is primarily used for text generation and agent-related tasks, involving reinforcement learning environments, and evaluation employs multi-criteria LLM judgment (all results are YES), requiring OPENAI_API_KEY configuration for operation. Compared to the previous version, this version fixes the answer delivery issue for terminal agents: explicitly instructing agents to write answers to a specified file path via shell heredoc and verifying them, ensuring correct submission of answer files, while the core scoring logic remains unchanged.
数据集概览
- 数据集名称:
laion/nemotron-gym-inverse-ifeval-v2 - 许可证: Apache-2.0
- 任务类别: 文本生成
- 标签: agent, harbor, reinforcement-learning, nemotron
数据集描述
该数据集是从 nvidia/Nemotron-RL-InverseIFEval-v1 转换而来的 Harbor task-binary 数据集,包含 1,000 个任务。它是 nvidia/Nemotron-Post-Training-v3 的一部分。
数据列
path(字符串)task_binary(gzip tar 归档文件)
数据转换框架
数据集使用 OpenThoughts-Agent 的 data.nemotron_gym 框架进行转换。
评分方式
采用多标准 LLM 判断(全部为 YES),在试验时需要 OPENAI_API_KEY。
版本更新说明(相较于前一版本)
- 问题修复: 解决了终端智能体的答案交付约定问题。前一版本仅告知智能体要生成什么,但未说明如何提交;导致 1 回合的
terminus-2智能体将答案以聊天回复形式输出,而未写入指定评分文件,多数试验因“答案文件缺失”得分为 0。 - 改进措施: 新版本明确指示智能体通过 shell heredoc 方式写入评分器的文件路径(并进行验证),评分逻辑本身未作其他改动。




