遇见数据集

nemotron-gym-qa-abstention-v2

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

Harbor任务二进制数据集是一个包含3,150个任务的数据集,由nvidia/Nemotron-RL-QA-Abstention-v1转换而来,属于nvidia/Nemotron-Post-Training-v3集合的一部分。数据格式包括两列:path(字符串类型)和task_binary(gzip压缩的tar格式),转换过程使用了OpenThoughts-Agent的data.nemotron_gym框架。评估方式基于标准化oxed{}文本匹配与黄金标准进行评分。v2版本主要修复了终端代理的答案交付契约问题,通过明确指示代理使用shell heredoc将答案写入评分文件路径并验证,解决了之前版本因答案文件缺失导致的评分问题,评分逻辑保持不变。该数据集适用于文本生成任务,特别涉及智能体、强化学习等场景,采用Apache 2.0许可证。

The Harbor Task Binary dataset contains 3,150 tasks, converted from nvidia/Nemotron-RL-QA-Abstention-v1 and is part of the nvidia/Nemotron-Post-Training-v3 collection. The data format includes two columns: path (string type) and task_binary (gzip-compressed tar format), with the conversion process using the OpenThoughts-Agent data.nemotron_gym framework. Evaluation is based on standardized oxed{} text matching with a gold standard for scoring. Version 2 primarily fixes the terminal agents answer delivery contract issue by explicitly instructing the agent to use a shell heredoc to write answers to the scoring file path and verify, resolving previous scoring problems due to missing answer files, while keeping the scoring logic unchanged. The dataset is suitable for text generation tasks, particularly involving agents and reinforcement learning scenarios, and uses the Apache 2.0 license.

提供机构:
LAION eV
创建时间:
2026-06-05
原始信息汇总
  • 数据集名称: laion/nemotron-gym-qa-abstention-v2
  • 许可证: Apache-2.0
  • 任务类别: 文本生成
  • 标签: agent, harbor, reinforcement-learning, nemotron

数据集概述

该数据集来源于 nvidia/Nemotron-RL-QA-Abstention-v1,是 nvidia/Nemotron-Post-Training-v3 系列的一部分。转换后的数据集包含 3,150 个任务,以二元任务(Harbor task-binary)格式呈现。

  • 数据列: path(字符串)和 task_binary(gzip tar 格式)
  • 转换框架: OpenThoughts-Agent 的 data.nemotron_gym 框架
  • 评分方式: 使用标准化的 oxed{} 文本匹配与黄金答案进行比对

版本变更说明(v2 相较于 v1)

  • 修复问题: 先前版本中,终端智能体(terminal agent)的答案交付协议存在缺陷。旧版本仅告知智能体“生成什么”,而未明确“如何提交”。例如,terminus-2 智能体在单轮对话中将答案以聊天回复形式输出,而非写入评分文件,导致大部分试炼因“答案文件缺失”而得分为 0。
  • 改进措施: 新版本指令明确要求智能体通过 shell heredoc 将答案写入评分器的文件路径,并加以验证。
  • 评分逻辑: 评分逻辑本身保持不变。
搜集汇总
数据集介绍
nemotron-gym-qa-abstention-v2 数据集图片
构建方式
该数据集源自NVIDIA的Nemotron-RL-QA-Abstention-v1,是Harbor任务二元分类数据集的一个转换版本,包含3,150个任务。构建过程依托OpenThoughts-Agent框架中的data.nemotron_gym组件,将原始数据集的路径(path)列与任务二元(task_binary)列以gzip tar格式进行封装,从而形成了可供强化学习与智能体训练直接使用的标准化数据格式。数据集的评分机制采用归一化的oxed{}文本匹配方式,与标准答案进行比对以评判正确性。
特点
本数据集的核心特点在于其对终端智能体应答交付合约的修正与强化。相较于前一版本,该数据集明确规定了智能体必须通过shell heredoc命令将答案写入评分者指定的文件路径,并进行验证,从而解决了旧版中智能体以聊天回复形式输出答案导致评分缺失的问题。评分逻辑保持不变,但指令的精确化显著提升了智能体在强化学习环境中的任务完成率与评分可靠性。
使用方法
使用时,可通过Hugging Face的datasets库加载该数据集,主要利用其path和task_binary字段进行智能体训练或评估。推荐将其纳入基于奖励模型的强化学习流程,以训练模型在问答任务中精准遵循终端输出协议。用户亦可直接使用预设的评分函数对模型输出进行归一化文本匹配验证,确保模型能够按预期生成结构化答案。数据集许可协议为Apache-2.0,适用于学术研究与商业应用。
背景与挑战
背景概述
在强化学习与智能体对齐领域,任务规范的精确性对于模型训练效果至关重要。nemotron-gym-qa-abstention-v2数据集由LAION团队于2024年基于NVIDIA的Nemotron-RL-QA-Abstention-v1转换而来,作为NVIDIA Nemotron-Post-Training-v3系列的一部分,旨在解决智能体在问答任务中因交互协议模糊导致的性能退化问题。该数据集包含3,150个二元判定任务,通过OpenThoughts-Agent框架将原始数据转化为统一的路径与任务二进制列格式,用于训练终端智能体在需要时拒绝回答或写入答案文件。其创新之处在于修正了答案交付契约,确保智能体能够正确执行文件写入而非仅生成文本回复,这对提升智能体在实际部署中的鲁棒性具有重要影响,并为后续强化学习微调提供了标准化评估基准。
当前挑战
当前该数据集面临的主要挑战包括:第一,所解决的领域问题在于智能体与环境的交互协议模糊性,即终端智能体在完成任务时缺乏明确的答案提交规范,前版数据集因指令未指定文件写入方式,导致大部分试验因答案文件缺失而得零分,严重干扰了模型优化方向。第二,构建过程中需处理任务二进制数据的高效压缩与解压(gzip tar格式),同时确保跨版本转换时评分逻辑的一致性,避免修改指令引入新的歧义。此外,如何通过shell heredoc指令精确引导智能体行为,并验证文件写入的可靠性,仍是数据工程中的关键难点。
常用场景
经典使用场景
在强化学习与智能体对齐研究的前沿,nemotron-gym-qa-abstention-v2数据集常被用于训练和评估语言模型在问答任务中的“弃权”能力。该数据集通过设定明确的指令约束,引导模型在不确定或无法回答问题时主动放弃作答,而非产生误导性输出。这一场景对于构建可靠、安全的对话系统至关重要,特别是在需要模型具备自我认知与风险规避能力的应用中,如医疗咨询或法律问答等领域。
实际应用
在实际应用中,该数据集支撑了终端智能体的指令遵循与结果提交流程的自动化改进。例如,在自动化客户服务系统中,模型可根据指令判断是否具备回答能力,并在无法解答时明确拒绝而非虚构信息;在数据分析场景中,智能体能够遵循严格的输出协议,将结果写入指定文件而非通过对话返回,从而保障系统流程的完整性与可审计性。
衍生相关工作
该数据集衍生了多项经典工作,其中最直接的是Nemotron系列中针对智能体回答交付协议的修正版本研究。通过对指令中“如何提交答案”的显式约束,研究者发现一阶终端智能体在未明确输出格式时表现极差,而修正版本则显著提升了任务成功率。此外,它激发了关于“指令合约”与“行为规范”在强化学习训练中的系统性探讨,促进了harbor框架下任务二进制转换与评估流程的标准化发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务