遇见数据集

ORKG-core-domain-classifier-dataset

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

该数据集包含由ORKG核心领域分类器(ORKG Core Domain Classifier)生成的研究领域标签,每个文档对应一行数据。数据集包含两个字段:id(文档标识符)和predicted_domain(分类器预测的研究领域)。数据集共有约36,165,993条记录,覆盖多个学科领域,包括艺术与人文、工程、生命科学、物理科学与数学、社会与行为科学等。该数据集适用于文本分类任务,特别是对学术论文进行学科领域分类。

This dataset contains research domain labels generated by the ORKG Core Domain Classifier, with each document corresponding to a row of data. The dataset has two fields: id (document identifier) and predicted_domain (the research domain predicted by the classifier). It comprises approximately 36,165,993 records covering multiple disciplinary areas, including Arts and Humanities, Engineering, Life Sciences, Physical Sciences and Mathematics, and Social and Behavioral Sciences. The dataset is suitable for text classification tasks, particularly for classifying academic papers by subject domain.

创建时间:
2026-08-14
原始信息汇总

数据集概述

ORKG Core Domain Classifier — Metadata 是一个文本分类数据集,由 ORKG(Open Research Knowledge Graph)核心领域分类器生成,为每篇文档分配一个研究领域标签。该数据集采用 MIT 许可证,以英语为主,包含超过 3616 万条记录,适用于文本分类任务。

数据规模与版本

  • 当前版本:v1(2026-08-14 发布)
  • 记录总数:36,165,993 条
  • 数据集大小:10M < n < 100M

数据结构

数据集包含两个字段:

字段名 说明
id 文档标识符
predicted_domain 分类器分配的研究领域标签

数据存储于 data/classifications.csv 文件中,可通过 Hugging Face datasets 库加载使用。

分类标签分布

数据集包含 85 个研究领域标签,覆盖多个学科大类。以下是主要类别及其占比:

主要学科领域(占比最高)

  • 社会与行为科学:8,558,981 条(23.67%)
  • 生物医学工程与生物工程:3,785,745 条(10.47%)
  • 艺术与人文学科:3,747,673 条(10.36%)
  • 工程学:1,350,298 条(3.73%)

其他代表性领域

  • 物理学:811,931 条(2.25%)
  • 历史学:754,428 条(2.09%)
  • 土木与环境工程:756,662 条(2.09%)
  • 计算机科学:694,799 条(1.92%)
  • 材料科学与工程:686,304 条(1.90%)
  • 医学:611,792 条(1.69%)

规模较小的领域(占比低于 0.05%):包括化学固态与表面研究(0.02%)、高分子研究(0.04%)、社会学(0.02%)、海洋学(0.04%)等。

数据生成与维护

该数据集由 ORKG 核心领域分类器自动生成,分类器代码托管在 GitLab 仓库中。数据集卡片及 CSV 文件由该仓库中的自动化脚本生成,不建议手动编辑。

搜集汇总
数据集介绍
ORKG-core-domain-classifier-dataset 数据集图片
构建方式
该数据集源于ORKG(开放研究知识图谱)框架下的核心领域分类器,旨在为学术文献赋予精细的研究领域标签。构建过程依托于TIBHannover开发的机器学习模型,对海量学术文档进行自动化分类,每个文档对应一条记录,包含唯一标识符与预测的领域标签。数据通过自动化流水线生成,并借助publish_to_hf模块发布至HuggingFace平台,确保了数据的新鲜度与可复现性。
使用方法
研究者可通过HuggingFace的datasets库便捷加载数据,仅需调用load_dataset函数即可访问全部记录。数据适用于文本分类模型的训练与评估、科研生产力图谱的绘制、学科交叉度分析等多元场景。鉴于其规模庞大,建议利用分布式计算或数据采样策略进行处理。此外,数据集的版本化记录保障了研究的可追溯性,用户可依据修订历史选择合适的数据版本进行深度挖掘。
背景与挑战
背景概述
ORKG-core-domain-classifier-dataset由德国国家科学技术图书馆(TIB)于2026年8月14日发布,是开放研究知识图谱(ORKG)项目的一部分。该数据集包含超过3600万条学术文献的研究领域分类标签,由ORKG核心领域分类器自动生成,旨在解决大规模学术文献的领域归类问题。其创建源于学术信息爆炸背景下,传统人工分类难以应对海量文献的挑战。该数据集通过自然语言处理和机器学习技术,对文献进行细粒度领域划分,覆盖艺术与人文、工程、生命科学、物理与数学、社会科学等众多学科,为科研评估、文献检索和跨学科研究提供了重要的数据基础设施,对科学计量学和信息科学领域具有显著影响力。
当前挑战
该数据集面临的挑战包括:首先,分类体系涵盖83个具体领域,从大的学科到细分方向,层次复杂,且类别间存在交叉(如'电气工程与信息技术'和'电气与计算机工程'),易导致分类混淆;其次,数据规模庞大,超过3600万条记录,对分类器的效率和准确性提出极高要求,且在自动化分类中,错误标签的传播可能影响下游分析;此外,数据集的更新频率依赖于模型迭代,而科学领域不断涌现新主题,需要持续调整分类体系以适应学科演进;最后,数据来源以英文文献为主,可能引入语言偏差,限制了其在非英语学术环境中的适用性。
常用场景
经典使用场景
ORKG核心领域分类器数据集为学术文献的领域归属提供了大规模、细粒度的标注资源,常被用于训练和评估文本分类模型,以自动识别科研论文所属的研究领域。该数据集覆盖人文、工程、生命科学、社会科学等广泛学科,支持从粗粒度到细粒度的多层级分类任务,是学术信息检索和知识图谱构建中不可或缺的基准数据,尤其适合用于领域自适应和跨学科研究的分类性能验证。
解决学术问题
该数据集有效解决了学术文献领域标注缺失和不一致的问题,为科学计量学、文献计量学以及研究趋势分析提供了统一、可比的分类依据。通过大规模标注,研究者能够量化不同学科的研究产出分布,探测交叉学科演化方向,并为科研基金分配、学术评价和知识图谱的实体链接提供数据支撑,从而促进了科学学领域从定性描述向定量分析的转型。
实际应用
在实际应用中,该数据集支持学术搜索引擎的领域过滤功能,提升用户检索效率;可用于科研管理平台的研究产出统计分析,辅助机构评估学科优势;还可服务于科技情报分析,实现研究热点的自动追踪和前沿领域的预警。此外,数据集的公开版本为开发学术推荐系统、构建学者画像和优化文献归档流程提供了基础,具有广泛的产业与图书馆应用价值。
数据集最近研究
最新研究方向
该数据集依托开放研究知识图谱(ORKG)平台,运用前沿的文本分类技术对海量学术文献进行自动领域标注,其最新版本覆盖逾三千六百万条记录,横跨人文社科、工程技术、生命科学及自然科学等多元学科。研究焦点集中于提升分类器的精细粒度与跨学科适应性,以应对现代科学研究的交叉融合趋势。通过引入大规模语料训练与领域自适应算法,该数据集正推动学术资源语义组织方式的革新,为科学计量学、研究趋势分析和知识图谱的自动化构建提供坚实的数据基石,其影响力延伸至学术检索、基金评审及科研政策制定等关键环节。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务