OpenSciReasoning-Biology-20K
收藏资源简介:
OpenSciReasoning-Biology-20K 是一个从 nvidia/OpenScienceReasoning-2 数据集中提取的生物学领域问答数据集,专用于领域特定推理器训练和跨域迁移实验。该数据集包含约20,000个样本,每个样本均保留稳定的源行标识符 source_row_id,并具有唯一的 domain 字段值 BIOLOGY。领域归属通过两个独立的问题验证器根据问题和选项进行核查,同时重放答案和源标识符门控。数据集中包含的审计记录(audit/format_issues.jsonl)列出了源输出编码警告;任何包含 U+FFFD 替换字符的上游行被隔离并替换为干净的源行,未进行任何静默猜测或重写。数据集采用 CC-BY-4.0 许可证,语言为英语,适用于问答任务。
OpenSciReasoning-Biology-20K is a biology-domain question-answering dataset extracted from the nvidia/OpenScienceReasoning-2 dataset, specifically designed for domain-specific reasoning training and cross-domain transfer experiments. It contains approximately 20,000 samples, each retaining a stable source_row_id and a unique domain field value BIOLOGY. Domain attribution is verified by two independent question validators based on questions and options, with answer replay and source identifier gating. The dataset includes an audit record (audit/format_issues.jsonl) listing source output encoding warnings; any upstream rows containing U+FFFD replacement characters are isolated and replaced with clean source rows, without silent guessing or rewriting. The dataset is licensed under CC-BY-4.0, the language is English, and it is suitable for question-answering tasks.
OpenSciReasoning-Biology-20K 数据集概述
基本信息
- 数据集名称:OpenSciReasoning Biology 20K
- 许可证:CC-BY-4.0(知识共享署名4.0国际版)
- 语言:英语
- 任务类型:问答(Question Answering)
- 数据集规模:10K至100K条样本(对应文件包含20,000条数据)
- 数据格式:JSONL(每行一个JSON对象),文件名为
biology_20000.jsonl
数据来源与构建
- 该数据集源自
nvidia/OpenScienceReasoning-2,是一个三领域发布版本中的生物学子集 - 设计用于领域特定的推理模型训练以及跨领域迁移实验
数据特点
- 每条数据保留了稳定的
source_row_id字段,便于溯源与关联 - 每条数据具有唯一的互斥
domain字段,取值为BIOLOGY - 领域归属通过两个独立的、仅基于问题文本的验证器进行双重校验
- 同时复验了答案和来源ID的通过性
质量控制
- 审计记录保存在
audit/format_issues.jsonl文件中,列出剩余的来源输出编码警告 - 上游中包含 U+FFFD(替换字符)的行被隔离,替换为干净来源行
- 所有数据处理均未进行无依据的猜测或文本重写,确保数据原始性




