遇见数据集

openalex-snapshot-2026-05

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

该数据集是OpenAlex Works 2026年5月快照的处理版本,包含学术元数据、引用关系和衍生文献计量数据。数据集包含五个主要子集:1) light_openalex_works:轻量级OpenAlex Works记录,包含作品ID、出版年份、类型、主题、作者关系等核心字段;2) citation_edges:扩展的引用边表,将作品的引用列表转换为引用-被引用工作对;3) filtered_type_article_preprint_books:按学术作品类型过滤的记录;4) ai_article_preprint_with_institution_sector:AI领域文章和预印本样本,包含机构部门信息;5) final_ai_di5:最终AI领域样本,包含DI5(五年颠覆性指数)值及相关文献计量字段。DI5指数基于五年引用窗口计算,衡量学术工作的颠覆性程度。数据集规模为十亿级别(1B<n<10B),以Parquet格式存储。适用于大规模文献计量研究、OpenAlex元数据分析、引用网络构建、引用窗口分析、颠覆性指数研究和AI领域学术出版物分析。数据集基于OpenAlex构建,继承了其元数据覆盖范围和引用链接的局限性。采用CC0-1.0许可证,允许商业和非商业使用。

This dataset is a processed version of the OpenAlex Works snapshot from May 2026, containing scholarly metadata, citation relationships, and derived bibliometric data. It includes five main subsets: 1) light_openalex_works: lightweight OpenAlex Works records with core fields such as work ID, publication year, type, topics, and author relationships; 2) citation_edges: an extended citation edge table that transforms work citation lists into cited-citing work pairs; 3) filtered_type_article_preprint_books: records filtered by academic work type; 4) ai_article_preprint_with_institution_sector: a sample of AI field articles and preprints, including institutional sector information; 5) final_ai_di5: a final AI field sample with DI5 (five-year disruptive index) values and related bibliometric fields. The DI5 index is calculated based on a five-year citation window to measure the disruptiveness of scholarly works. The dataset scale is in the billions (1B < n < 10B) and is stored in Parquet format. It is suitable for large-scale bibliometric research, OpenAlex metadata analysis, citation network construction, citation window analysis, disruptive index studies, and analysis of AI field academic publications. The dataset is built on OpenAlex and inherits its limitations in metadata coverage and citation links. It uses the CC0-1.0 license, permitting both commercial and non-commercial use.

创建时间:
2026-05-18
原始信息汇总

数据集概述

名称: OpenAlex Snapshot 2026-05 Processed Works and Citation Edges

许可协议: Creative Commons Zero v1.0 Universal (CC0-1.0)

语言: 英语

标签: tabular, openalex, bibliometrics, citations, scholarly-data, citation-network, disruption-index, di5, parquet, pandas, polars, datasets

数据规模: 1B < n < 10B

维护者: Kenny CHOW

数据集内容

本数据集是2026年5月OpenAlex Works快照的经处理版本,包含衍生出的引文边表及多个下游文献计量子集,适用于大规模学术元数据分析、引文网络分析和文献计量研究。

数据集按子集组织,每个子集均为Parquet格式文件:

子集名称 描述
light_openalex_works 轻量级OpenAlex Works记录,为Hugging Face Dataset Viewer中显示的默认子集。文件位于light_OpenAlex_works/目录。
citation_edges 从OpenAlex参考文献中扩展出的引文边。文件位于citation_edges/目录。
filtered_type_article_preprint_books 经筛选的特定学术作品类型的OpenAlex Works记录。
ai_article_preprint_with_institution_sector 人工智能领域文章/预印本样本,并补充了机构部门信息。
final_ai_di5 最终的人工智能领域样本,包含DI5值及相关文献计量字段。

目录结构

. ├── light_OpenAlex_works/ # 包含 works_light_part_00.parquet 至 works_light_part_19.parquet 共20个文件 ├── citation_edges/ # 包含 referenced_work_part_0.parquet 至 referenced_work_part_19.parquet 共20个文件 ├── filtered_type_article_preprint_books/ # 包含 part=0__data_0__filtered.parquet 至 part=19__data_0__filtered.parquet 共20个文件 ├── samples/ │ └── ai_article_preprint_with_institution_sector/ # 包含 openalex_ai_article_preprint_part-00000.parquet 至 part-00019.parquet 共20个文件 └── derived/ └── di5_cd5_ai_article_preprint_with_institution_sector_v2/ └── final_v2/ # 包含一个Parquet文件和一个manifest_final.json文件

主要子集详情

light_openalex_works 默认子集

包含轻量级OpenAlex Works记录,主要字段如下:

字段 描述
work_id OpenAlex作品ID。
publication_year 作品发表年份。
publication_date 作品发表日期(如可用)。
type OpenAlex作品类型,如文章、预印本、综述或书籍。
topics JSON格式的OpenAlex主题元数据。
authorships JSON格式的OpenAlex作者及机构元数据。
updated_date 该快照中OpenAlex记录的更新日期。

citation_edges 引文边子集

每条记录表示一个焦点作品与一个参考文献之间的引用关系,将每个作品的OpenAlex参考文献列表转换为焦点-参考文献作品对,并包含焦点作品的发表日期。核心字段包括:

字段 描述
citing_work_id 焦点/引证作品的OpenAlex ID。
citing_publication_year 焦点/引证作品的发表年份。
citing_publication_date 焦点/引证作品的发表日期。
referenced_work_id 被引/参考文献的OpenAlex ID。

该边表已针对处理后的Works全集进行过滤,移除了全集之外的参考文献,以避免构建引文网络或计算基于网络的指标时出现悬空节点。

final_ai_di5 最终DI5数据集

包含人工智能领域作品的五年期颠覆性指数(DI₅),计算公式为:

DI₅ = (nᵢ − nⱼ) / (nᵢ + nⱼ + nₖ)

其中,在五年引文窗口内:

符号 含义
nᵢ 引用焦点作品但不引用其参考文献的后续作品数量。
nⱼ 同时引用焦点作品及其参考文献的后续作品数量。
nₖ 引用焦点作品的参考文献但不引用焦点作品的后续作品数量。

预期用途

  • 大规模文献计量研究
  • OpenAlex Works元数据分析
  • 引文网络构建
  • 引文窗口分析
  • 颠覆性指数研究
  • 人工智能领域学术出版物分析
  • 机构与作者元数据分析

注意事项与局限

  • 数据集继承了OpenAlex在元数据覆盖、消歧和引文链接方面的局限性。
  • topicsauthorships字段为JSON格式,可能需要额外解析。
  • 引文边的覆盖范围取决于OpenAlex的参考文献元数据。
  • AI领域样本依赖于OpenAlex主题元数据及用于定义AI相关作品的选择标准。
  • DI5值取决于引文窗口定义及可用的引文元数据。
  • 衍生子集不应被视为所有学术作品或所有AI出版物的完整代表。

引用建议

若使用此数据集,建议引用本Hugging Face数据集仓库及OpenAlex。建议的引用格式已在README中提供。

搜集汇总
数据集介绍
openalex-snapshot-2026-05 数据集图片
构建方式
该数据集源自OpenAlex在2026年5月的学术作品快照,经过精细处理构建而成。原始数据被拆分为多个Parquet分片,形成轻量级学术作品记录子集,同时将引用关系转化为焦点作品与被引作品构成的引用边表,确保无外围节点悬挂。此外,基于主题元数据筛选出人工智能领域的文章与预印本样本,并融合机构部门信息,最终计算扰动指数DI₅以刻画学术影响力。
特点
数据集规模庞大,涵盖超过十亿条记录,以列式Parquet格式存储,支持高效查询与分析。其核心特色在于提供标准化的引用边表,便于构建大规模引文网络并计算网络指标。同时,针对人工智能领域专门生成带有DI₅指数的最终子集,为科学计量学和学术创新评估提供了精准且可复现的数据基础。
使用方法
用户可通过Hugging Face Datasets库轻松加载,例如使用`load_dataset`函数指定`light_openalex_works`或`citation_edges`配置,并启用流式模式以处理海量数据。此外,借助DuckDB可直接对远程Parquet文件执行SQL查询,实现跨分片的快速过滤与聚合。该数据集适用于文献计量分析、引文网络构建及学术创新度评估等研究场景。
背景与挑战
背景概述
OpenAlex Snapshot 2026-05 数据集由研究人员 Kenny CHOW 于 2026 年创建,旨在为大规模学术元数据分析和引文网络研究提供标准化、轻量级的数据基础。作为开放学术基础设施的重要组成部分,OpenAlex 项目致力于提供免费、全面的学术实体信息,而本数据集则在此基础上进一步处理,提取了经过筛选的学术著作记录及引文边表,并引入了面向人工智能领域文献的破坏性指数(DI5)计算样本。该数据集涵盖了超十亿条记录,采用 Parquet 格式存储,支持高效流式加载与复杂查询,为计量文献学、引文窗口分析、机构与作者贡献度研究等方向提供了高价值的数据支持,显著推动了开放科学数据的可复用性与可获取性。
当前挑战
该数据集面临的核心挑战包括:其一,学术文献海量且异构,原始 OpenAlex 数据包含复杂的元数据字段(如 JSON 形式的主题与作者关系),转化为结构化引文网络时需解决实体消歧、字段解析及不完整引文链接等问题;其二,构造引文边表时需过滤掉超出著作宇宙范围的引用节点,以避免生成悬挂节点,这要求精细的数据一致性校验;其三,针对人工智能领域的子样本构建依赖于主题分类标准与窗口期定义,DI5 指数的计算对引文时间窗口敏感,不同定义可能导致指标偏差;此外,大规模数据的分片存储与跨平台高效加载(如支持流式处理与 DuckDB 查询)也给数据工程架构带来诸多挑战。
常用场景
经典使用场景
在科学计量学与知识图谱研究中,OpenAlex的快照数据集常被用于构建大规模的引文网络。研究者可以借助其提供的轻量级学术作品记录与引用边列表,解析学术出版物的引用关系图谱,揭示学科知识的流动与演化轨迹。该数据集尤其适合追踪特定领域(如人工智能)的学术产出,通过过滤文章、预印本与书籍等类型,聚焦于高质量的学术文献,为引文窗口分析与网络节点指标计算奠定坚实的数据基础。
衍生相关工作
基于该数据集,学术界已衍生出多项富有影响力的后续工作。例如,研究者利用其AI领域的子集与DI₅指数,分析了机器学习与自然语言处理子领域的颠覆性研究分布,揭示了不同研究范式的演变规律。此外,结合机构部门信息的增强版样本,催生了关于学术界与产业界创新模式差异的比较研究,深入探讨了大学、企业与政府门在推动颠覆性创新中的角色差异,为创新生态系统的理论构建提供了实证依据。
数据集最近研究
最新研究方向
大规模学术引用网络与颠覆性指数(DI5)的前沿测度研究。该数据集整合了2026年5月OpenAlex快照中的轻量化学术文献记录与引用边表,特别提供了经机构部门信息增强的人工智能领域论文样本集,以及计算得到的五年窗口颠覆性指数(DI5),为量化评估AI科研成果的学术影响力与范式突破效应提供了标准化工具。在生成式人工智能蓬勃发展、科研产出指数级增长的背景下,该资源使研究者能够从网络拓扑视角追踪AI领域知识演变轨迹,结合引用扩散模式识别具有潜在颠覆性的核心工作,从而推动文献计量学在科学评价、资助决策与科研政策制定中的实际应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务