Nemotron-SFT-Science-v2
收藏资源简介:
Nemotron-Science-v2是一个专注于科学推理的数据集,包含合成数据(如合成多选题和RQA)和非合成的供应商问题,以及由大语言模型生成的解决方案。数据集涵盖物理学、生物学和化学三个领域,提供多选题和开放式问题两种格式,并支持三种生成设置:无工具的思维链推理、使用Python工具以及使用Tavily API的搜索工具。解决方案由多种开源大语言模型生成,包括GPT-OSS、Kimi-K2-Instruct、DeepSeek-V3.2和DeepSeek-V4-Pro。数据集包含四个子集:1) Synthetic MCQ:包含4到10个选项的合成生成的多选题;2) RQA:合成的化学问题(包括多选题和开放式问题);3) Vendor:非合成的、研究生/研究级别的开放式STEM问题,涵盖物理、化学和生物领域;4) SO MCQ:源自Stack Exchange平台、涵盖物理、生物和化学领域的多选题。总计包含2,837,712个样本,数据量约为49 GB,以JSONL格式存储,包含文本和元数据。该数据集采用CC BY-SA 4.0许可证,适用于商业或非商业用途,旨在供大语言模型工程师和研究团队使用,用于开发和训练专注于提升科学推理和问题解决能力的大语言模型,适用于监督训练和科学模型开发流程中的数据增强。
Nemotron-Science-v2 is a dataset dedicated to scientific reasoning. It includes synthetic data (such as synthetic multiple-choice questions (MCQs) and RQA), non-synthetic vendor-provided questions, as well as solutions generated by large language models (LLMs). The dataset covers three disciplines: physics, biology and chemistry, and offers two question formats: MCQs and open-ended questions. It supports three generation settings: tool-free chain-of-thought reasoning, utilization of Python tools, and search tool usage via the Tavily API. Solutions are generated by a variety of open-source LLMs, including GPT-OSS, Kimi-K2-Instruct, DeepSeek-V3.2 and DeepSeek-V4-Pro. The dataset comprises four subsets: 1) Synthetic MCQ: synthetically generated MCQs with 4 to 10 options; 2) RQA: synthetic chemistry questions covering both MCQs and open-ended questions; 3) Vendor: non-synthetic, graduate/research-level open-ended STEM questions spanning physics, chemistry and biology; 4) SO MCQ: MCQs sourced from the Stack Exchange platform, covering physics, biology and chemistry. In total, the dataset contains 2,837,712 samples with a total data size of approximately 49 GB, stored in JSONL format and containing both text and metadata. It is licensed under CC BY-SA 4.0, permitting both commercial and non-commercial usage. The dataset is designed for LLM engineers and research teams to develop and train LLMs focused on improving scientific reasoning and problem-solving abilities, and is suitable for supervised training and data augmentation in scientific model development workflows.
数据集概述
数据集名称:Nemotron-Science-v2
发布者:NVIDIA Corporation
许可证:CC BY-SA 4.0
数据集描述
Nemotron-Science-v2 是一个面向科学推理的数据集,包含合成与非合成的科学问题及大模型生成的解答。覆盖物理、生物、化学三个学科领域,包含两种问题格式:多选题(MCQ)和开放题(OpenQ)。答案由多种开源大模型生成,生成方式包括:无工具的链式思维(CoT)推理、Python 工具使用、以及结合 Tavily API 的搜索工具使用。
数据子集
- Synthetic MCQ:合成生成的多选题,选项数量为 4-10 个。
- RQA:合成生成的化学问题,包含 MCQ 和 OpenQ 两种格式。
- Vendor:非合成的、研究生/研究级别的 STEM 开放题,涵盖物理、化学、生物。
- SO MCQ:基于 Stack Exchange 的多选题,覆盖物理、生物、化学领域。
数据集规模
| 子集 | 行数 | 大小 |
|---|---|---|
| Synthetic MCQ | 96,610 | 0.57 GB |
| Vendor | 221,598 | 25 GB |
| RQA | 413,519 | 8.9 GB |
| SO | 2,105,985 | 15 GB |
| 总计 | 2,837,712 | 49 GB |
数据格式
- 模态:文本
- 格式:JSONL
- 结构:文本 + 元数据
数据收集与标注
- 收集方法:混合(合成 + 自动)
- 标注方法:合成
语言与任务
- 语言:英语
- 任务类别:文本生成
- 标签:physics, biology, chemistry, stem, science, text, blend, Nemotron_3_Ultra, supervised-fine-tuning
预期用途
面向大语言模型工程师和研究团队,用于提升模型在科学推理和问题解决能力方面的训练,适用于基于科学的模型开发流程中的监督训练与数据增强。
版本信息
- 当前版本:Nemotron-SFT-Science-v2
- 创建日期:2026年5月13日
- 最后修改:2026年5月13日
- 上一版本:https://huggingface.co/datasets/nvidia/Nemotron-Science-v1
伦理考量
NVIDIA 强调可信赖的人工智能是共同责任,开发者应确保数据集符合相关行业和用例的要求,并防范产品误用。质量问题、安全漏洞或 AI 相关顾虑可在此提交:https://app.intigriti.com/programs/nvidia/nvidiavdp/detail




