遇见数据集

global-research-output-mobility-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集是基于OpenAlex官方快照构建的全球研究产出与流动性数据集,由DataForge开源数据项目提供。数据集包含机构、来源(期刊等)、主题、资助者等核心实体,以及基于这些实体衍生的机构研究产出概况和聚合的作者流动信息。数据以多个配置(config)形式组织,包括:author_mobility(作者流动)、funders(资助者)、institution_master(机构主表)、institution_profiles(机构概况)、publishers(出版商)、source_profiles(来源概况)、sources(来源)、topic_trends(主题趋势)、topics(主题)。数据规模在10M到100M行之间,具体分为三个层级:S级(约30.5万行,包含机构/来源/主题引用表)、M级(约248.7万行,包含机构概况)、L级(约3179.9万行,包含完整的衍生库和聚合的作者流动数据)。每个数据包均附带数据字典、数据表和QA报告。数据集主要用于大学和实验室的基准测试、人才流动与人才流失分析、资助者和主题图谱绘制、研究政策分析等任务。许可协议为CC BY-NC 4.0(学术/个人使用需署名并回链),商业使用需获取DataForge商业许可。

This dataset is a global research output and mobility dataset built from the official OpenAlex snapshot, provided by the DataForge open-source data project. It includes core entities such as institutions, sources (journals, etc.), topics, funders, and derived information including institutional research output profiles and aggregated author mobility data. The data is organized into multiple configurations: author_mobility, funders, institution_master, institution_profiles, publishers, source_profiles, sources, topic_trends, and topics. The dataset size ranges from 10M to 100M rows, with three levels: S-level (~305k rows, including institution/source/topic citation tables), M-level (~2.487M rows, including institutional profiles), and L-level (~31.799M rows, including the full derived library and aggregated author mobility data). Each data package includes a data dictionary, data tables, and a QA report. The dataset is primarily used for university and lab benchmarking, talent mobility and brain drain analysis, funder and topic mapping, and research policy analysis. The license is CC BY-NC 4.0 (academic/personal use requires attribution and backlink; commercial use requires a DataForge commercial license).

创建时间:
2026-08-08
原始信息汇总

全球科研产出与人才流动数据集(OpenAlex)

数据集概览

该数据集基于OpenAlex官方快照构建,提供机构层面的科研产出概况和聚合的学者流动数据,涵盖机构、来源、主题和资助者等信息。属于DataForge开放数据项目的一部分,适用于学术和个人使用。

数据规模与分装

数据集提供三个不同规模的压缩包:

版本 数据量 文件大小
S(入门版) 305,027行 18.8 MB
M(研究版) 2,487,020行 180.7 MB
L(完整版) 31,798,922行 2.41 GB

每个压缩包均包含数据字典、数据说明书和质量评估报告。

数据配置

数据集包含9个配置子集,所有数据以Parquet格式存储:

  • author_mobility(4个文件):学者流动数据
  • funders(1个文件):资助者信息
  • institution_master(1个文件):机构主数据
  • institution_profiles(1个文件):机构概况
  • publishers(1个文件):出版商信息
  • source_profiles(1个文件):来源概况
  • sources(1个文件):来源信息
  • topic_trends(1个文件):主题趋势
  • topics(1个文件):主题信息

数据用途

  • 高校与实验室绩效评估
  • 人才流动与人才流失分析
  • 资助者与学科主题分布研究
  • 科研政策分析

数据来源与方法论

数据来源于OpenAlex官方快照,包括机构、来源、主题、资助者等基础数据,并在此基础上衍生出机构概况和聚合的学者流动数据。

许可协议

采用双重许可模式:

  • 学术/个人用途:CC BY-NC 4.0许可,要求注明出处并回链至data.zalize.com
  • 商业用途:需获取DataForge商业许可
  • 底层数据:遵循OpenAlex的CC0 1.0许可,允许商业再分发

引用方式

text DataForge (data.zalize.com), built from the OpenAlex CC0 snapshot — https://data.zalize.com/datasets/global-research-output-mobility-dataset

数据集同时提供DOI(10.5281/zenodo.21837748)和GitHub Release镜像。

技术使用

支持通过Hugging Face的datasets库加载:

python from datasets import load_dataset

ds = load_dataset("zalizedata/global-research-output-mobility-dataset", "author_mobility", split="train")

相关数据集

DataForge还提供其他健康、法律与科学领域的开放数据集,完整目录共25个数据集,可在 https://data.zalize.com/open-data 查看。

搜集汇总
数据集介绍
global-research-output-mobility-dataset 数据集图片
构建方式
该数据集源自OpenAlex官方快照,经过精细的加工与聚合,构建了涵盖机构、来源、主题及资助者等多维度的研究产出与作者流动档案。其构建流程包括对原始数据的清洗、标准化处理,以及基于文献计量学方法的深度挖掘,最终形成包含作者流动、机构概况、主题趋势等在内的九个独立配置模块。数据以Parquet格式存储,并按照数据量级划分为S、M、L三个层级,满足不同规模的研究需求。
特点
该数据集的核心特色在于其宏大的规模与精细的粒度,拥有超过千万级的行数据,能够全面映射全球科研生态。其独创的机构级研究产出画像与聚合作者流动数据,为分析人才流动、脑力流失等科学学议题提供了前所未有的数据支撑。同时,数据集严格遵循CC BY-NC 4.0许可,确保学术使用的合法性,并附带详尽的数据字典与质量报告,保障了数据的透明性与可靠性。
使用方法
该数据集的使用便捷高效,通过HuggingFace的datasets库即可轻松加载,例如使用load_dataset函数指定配置名即可获取对应模块的数据。其设计支持多样化的应用场景,如大学与实验室的绩效评估、人才流动与脑力流失分析、资助者与主题版图绘制以及科研政策分析等。用户可根据研究需要,自由选择不同层级的打包文件或直接调用API,实现快速的数据接入与分析。
背景与挑战
背景概述
在知识经济时代,科研人才的全球流动与学术产出的空间分布已成为衡量国家创新能力和科研竞争力的关键指标。然而,传统科学计量学数据源往往存在覆盖不全、更新滞后及结构碎片化等问题,难以支撑对全球研究生态的系统性分析。针对这一瓶颈,DataForge于2026年构建了全球研究产出与流动性数据集,依托OpenAlex官方快照,整合了机构、来源、主题、资助者等多维信息,并衍生出机构研究画像与作者流动性聚合数据。该数据集的创建旨在为大学竞争力评估、人才流动与人才流失分析、资助格局与主题演化研究以及科研政策制定提供坚实的数据基座,其规模宏大,仅L级包即涵盖逾三千万条记录,为科学计量学领域的研究提供了前所未有的深度与广度,对推动全球科研治理的精细化与智能化具有深远意义。
当前挑战
该数据集所应对的挑战具有显著的层次性。首要挑战源于领域核心问题的复杂性:科研人才流动(即“人才流入与流失”)的精准刻画长期受制于作者姓名消歧、机构归属漂移及跨国流动路径的模糊性,传统数据往往难以区分真实流动与噪声,导致脑力流动分析失真。其次,在数据集构建过程中,挑战同样严峻:其一,OpenAlex原始数据规模庞大且格式庞杂,须经过多轮ETL流程以清洗、标准化并关联机构、来源、主题等异构实体;其二,聚合作者流动性数据时,需要设计复杂的匹配算法以追踪作者跨机构、跨时间的移动轨迹,同时兼顾数据隐私与精度平衡;其三,确保衍生画像(如机构侧写)在不同层级(S/M/L)间保持逻辑一致性与可扩展性,并满足开源许可的合规要求。这些挑战的攻克,不仅提升了数据集的可靠性,也为科学计量学的数据基础设施建设提供了方法论参考。
常用场景
经典使用场景
该数据集基于OpenAlex官方快照构建,整合了全球范围内机构、来源、主题和资助者的科研产出记录,并衍生出聚合的作者流动图谱。其经典使用场景聚焦于科学计量学与科技政策研究,常被用于分析国家或机构层面的研究生产力分布、评估科研资助成效、追踪学科前沿演化趋势,以及构建科研机构基准评价体系。研究者可借助其大规模表格化数据,开展跨区域、跨时段的比较研究,为理解全球科研生态的宏观图景提供数据支撑。
衍生相关工作
围绕此数据集,衍生出一系列科学计量学与数据挖掘的经典工作。例如,基于‘作者流动’配置,研究者构建了全球人才流动网络模型,从个体层面揭示‘人才环流’与‘智力集聚’的微观机制;结合‘机构画像’数据,开发了科研产出预测与绩效归因算法;利用‘主题趋势’与‘资助者’字段,开展了研究前沿探测与学科交叉演化分析。这些工作不仅深化了对知识生产与扩散规律的理解,也为后续构建开放科学时代的创新型评价指标与决策支持工具奠定了数据与方法基础。
数据集最近研究
最新研究方向
该数据集基于OpenAlex官方快照,构建了全球科研产出与人才流动的细粒度画像,为科学计量学与科技政策研究提供了前所未有的数据基础。当前研究前沿聚焦于利用机构级科研档案与聚合的作者迁移流,深入剖析全球人才流动网络的结构演化、脑力流失与知识扩散的时空规律,以及资助体系、学科主题与出版生态之间的复杂耦合关系。该数据集支持大规模、跨国家的实证分析,可服务于大学与实验室的绩效对标、人才流动预警、基金布局优化及研究政策评估等热点议题,为理解全球化背景下科研生态系统的动态演化提供了关键的数据支撑与决策依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务