ORKG-core-domain-classifier-dataset
收藏资源简介:
该数据集包含由ORKG核心领域分类器(ORKG Core Domain Classifier)生成的研究领域标签,每个文档对应一行数据。数据集包含两个字段:id(文档标识符)和predicted_domain(分类器预测的研究领域)。数据集共有约36,165,993条记录,覆盖多个学科领域,包括艺术与人文、工程、生命科学、物理科学与数学、社会与行为科学等。该数据集适用于文本分类任务,特别是对学术论文进行学科领域分类。
This dataset contains research domain labels generated by the ORKG Core Domain Classifier, with each document corresponding to a row of data. The dataset has two fields: id (document identifier) and predicted_domain (the research domain predicted by the classifier). It comprises approximately 36,165,993 records covering multiple disciplinary areas, including Arts and Humanities, Engineering, Life Sciences, Physical Sciences and Mathematics, and Social and Behavioral Sciences. The dataset is suitable for text classification tasks, particularly for classifying academic papers by subject domain.
数据集概述
ORKG Core Domain Classifier — Metadata 是一个文本分类数据集,由 ORKG(Open Research Knowledge Graph)核心领域分类器生成,为每篇文档分配一个研究领域标签。该数据集采用 MIT 许可证,以英语为主,包含超过 3616 万条记录,适用于文本分类任务。
数据规模与版本
- 当前版本:v1(2026-08-14 发布)
- 记录总数:36,165,993 条
- 数据集大小:10M < n < 100M
数据结构
数据集包含两个字段:
| 字段名 | 说明 |
|---|---|
id |
文档标识符 |
predicted_domain |
分类器分配的研究领域标签 |
数据存储于 data/classifications.csv 文件中,可通过 Hugging Face datasets 库加载使用。
分类标签分布
数据集包含 85 个研究领域标签,覆盖多个学科大类。以下是主要类别及其占比:
主要学科领域(占比最高):
- 社会与行为科学:8,558,981 条(23.67%)
- 生物医学工程与生物工程:3,785,745 条(10.47%)
- 艺术与人文学科:3,747,673 条(10.36%)
- 工程学:1,350,298 条(3.73%)
其他代表性领域:
- 物理学:811,931 条(2.25%)
- 历史学:754,428 条(2.09%)
- 土木与环境工程:756,662 条(2.09%)
- 计算机科学:694,799 条(1.92%)
- 材料科学与工程:686,304 条(1.90%)
- 医学:611,792 条(1.69%)
规模较小的领域(占比低于 0.05%):包括化学固态与表面研究(0.02%)、高分子研究(0.04%)、社会学(0.02%)、海洋学(0.04%)等。
数据生成与维护
该数据集由 ORKG 核心领域分类器自动生成,分类器代码托管在 GitLab 仓库中。数据集卡片及 CSV 文件由该仓库中的自动化脚本生成,不建议手动编辑。





