Nemotron-Science-v1
收藏资源简介:
Nemotron-Science-v1是一个合成的科学推理数据集,包含两个子集:一个MCQA集,改进了Nemotron-Post-Training-v1的STEM部分,使用GPT-OSS-120B生成GPQA风格的问题和推理轨迹;一个RQA集,包含合成的化学问题。该数据集旨在增强大型语言模型在科学领域的推理能力。数据集适用于商业用途,包含174,155个MCQA样本和52,179个RQA样本,总大小为约2.5 GB。
Nemotron-Science-v1 is a synthetic scientific reasoning dataset consisting of two subsets: an MCQA subset that enhances the STEM component of Nemotron-Post-Training-v1, using GPT-OSS-120B to generate GPQA-style questions and reasoning traces; and an RQA subset containing synthetic chemistry problems. This dataset is designed to enhance the reasoning abilities of large language models in the scientific domain. The dataset is available for commercial use, containing 174,155 MCQA samples and 52,179 RQA samples, with a total size of approximately 2.5 GB.
Nemotron-Science-v1 数据集概述
数据集基本信息
- 数据集名称: Nemotron-Science-v1
- 所有者: NVIDIA Corporation
- 创建日期: 2025年12月3日
- 最后修改日期: 2025年12月3日
- 许可证: Creative Commons Attribution 4.0 International License (CC BY 4.0) (https://creativecommons.org/licenses/by/4.0/)
- 语言: 英语 (en)
- 商业用途: 已准备就绪,可供商业使用。
数据集描述
Nemotron-Science-v1 是一个合成的科学推理数据集,包含两个子集:一个MCQA(多项选择问答)集和一个RQA(化学问答)集。该数据集旨在增强大型语言模型在科学领域的推理能力。
数据集子集
MCQA 子集
- 描述: 该子集是对 Nemotron-Post-Training-Dataset-v1 中STEM(科学、技术、工程、数学)部分的改进。它使用 GPT-OSS-120B 生成 GPQA 风格的问题和推理轨迹。包含合成的科学问题,旨在模拟 GPQA 风格的主题和子主题。
- 目的: 增强大型语言模型在科学领域的推理能力。
RQA 子集
- 描述: 该数据集由合成的化学问题组成。
- 目的: 增强大型语言模型在科学领域的推理能力。
数据集特征
- 数据收集方法: 合成 - 由大型语言模型生成的科学问题与解决方案对。
- 标注方法: 合成 - 由模型生成的解决方案和注释。
数据集格式
- 模态: 文本
- 格式: JSONL
- 结构: 文本 + 元数据
数据集量化
| 子集 | 样本数量 |
|---|---|
| MCQA | 174,155 |
| RQA | 52,179 |
| 总计 | 226,334 |
- 总磁盘大小: 约 2.5 GB
预期用途
本数据集适用于专注于提升科学推理和问题解决能力的LLM工程师和研究团队,用于开发和训练大型语言模型。它适用于基于科学的模型开发流程中的监督训练和数据增强。
伦理考量
NVIDIA 认为可信赖的 AI 是一项共同责任,并已制定政策和实践以支持广泛 AI 应用的开发。开发者在下载或使用本数据集时,应遵循服务条款,并与内部开发团队合作,确保该数据集满足相关行业和用例的要求,并解决不可预见的产品误用问题。




