遇见数据集

us-research-grants-nih-nsf-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集整合了美国联邦研究资助数据,具体来自 NIH(美国国立卫生研究院)的 ExPORTER 项目资助和 NSF(美国国家科学基金会)的奖项数据,以分析就绪的表格形式呈现。数据集包含多个子表(配置),例如:awards(奖项总表)、nih_clinical_studies(NIH 临床研究)、nih_patents(NIH 专利)、nih_projects(NIH 项目)、nih_publications(NIH 出版物)、nih_publink(NIH 出版物链接)、nsf_awards(NSF 奖项)、org_year_funding(机构年度经费)、pi_award_edges(首席研究员与奖项关联)、pi_profiles(研究员档案)以及 project_publication_counts(项目发表计数)。总数据量超过 1000 万行(具体各表行数见 README 表格),采用 Parquet 格式存储,并提供多个压缩包(Tier S、M、L)供不同规模使用。数据覆盖金额、机构、研究人员和项目元数据,但不包含摘要全文。该数据集适用于资助格局与策略研究、大学及 PI 基准测试、技术转移与创新链分析,以及将资助与出版物、专利进行关联分析。数据遵循 CC BY-NC 4.0 许可(学术/个人使用免费,需注明出处并链接回 data.zalize.com),商业使用需获取商业许可。

This dataset integrates U.S. federal research funding data, specifically from NIH (National Institutes of Health) ExPORTER project grants and NSF (National Science Foundation) award data, presented in analysis-ready tabular format. It contains multiple sub-tables (configurations) such as: awards, nih_clinical_studies, nih_patents, nih_projects, nih_publications, nih_publink, nsf_awards, org_year_funding, pi_award_edges, pi_profiles, and project_publication_counts. The total data volume exceeds 10 million rows (specific row counts for each table are provided in the README table), stored in Parquet format, with multiple compressed packages (Tier S, M, L) for different scales. The data covers amounts, institutions, researchers, and project metadata, but does not include full abstracts. This dataset is suitable for funding landscape and strategy research, university and PI benchmarking, technology transfer and innovation chain analysis, as well as linking funding to publications and patents. The data is licensed under CC BY-NC 4.0 (free for academic/personal use with attribution and link back to data.zalize.com), and commercial use requires a commercial license.

创建时间:
2026-08-08
原始信息汇总

US Research Grants (NIH + NSF) 数据集概述

基本信息

  • 数据集名称: US Research Grants (NIH + NSF)
  • 语言: 英语
  • 许可证: CC BY-NC 4.0(学术/个人使用);商业使用需单独获得DataForge商业许可证
  • 数据规模: 10M < n < 100M 行
  • 任务类型: 文本分类
  • 数据来源: NIH ExPORTER + NSF Awards API 官方批量数据

数据集内容

该数据集将美国联邦科研资助整理为可直接分析的数据表,涵盖NIH(美国国立卫生研究院)项目资助和NSF(美国国家科学基金会)奖项数据,包括金额、机构、研究人员及项目元数据(不含摘要全文)。

数据表配置(共11个)

表格配置名 行数 大小
awards 3,514,467 250.1 MB
nih_clinical_studies 39,313 2.1 MB
nih_patents 92,343 4.4 MB
nih_projects 2,951,523 324.8 MB
nih_publications 3,078,034 518.9 MB
nih_publink 7,329,428 79.5 MB
nsf_awards 562,944 55.4 MB
org_year_funding 229,919 3.1 MB
pi_award_edges 3,866,665 136.9 MB
pi_profiles 532,881 21.1 MB
project_publication_counts 436,062 4.6 MB

数据格式与加载方式

  • 原生格式: Parquet(snappy压缩)
  • 支持加载方式: pandas、polars、duckdb,以及Hugging Face datasets
  • 提供CSV/JSONL副本、数据字典、数据说明书及QA报告

数据包层级

包名 层级 行数 大小
research_grants-tier1-S-2026-08-05.zip S(入门) 42,609 5.9 MB
research_grants-tier1-M-2026-08-05.zip M(研究) 785,707 55.5 MB
research_grants-tier1-L-2026-08-05.zip L(完整) 22,633,579 2.32 GB

应用场景

  • 资助格局与资助策略研究
  • 大学及首席研究员(PI)基准分析
  • 技术转移与创新链分析
  • 将资助与出版物和专利进行关联

引用方式

text DataForge (data.zalize.com), built from official NIH/NSF public data — https://data.zalize.com/datasets/us-research-grants-nih-nsf-dataset

DOI(Zenodo镜像): 10.5281/zenodo.21837780

搜集汇总
数据集介绍
us-research-grants-nih-nsf-dataset 数据集图片
构建方式
该数据集源自美国联邦科研资助体系的权威数据源,整合了美国国立卫生研究院(NIH)ExPORTER项目与国立科学基金会(NSF)奖项API的官方批量数据。通过系统化的数据清洗与结构化处理,构建了涵盖项目、奖项、人员、机构、出版物、专利及临床研究等多维度的分析就绪表格。数据以Parquet格式分片存储,并配套提供CSV/JSONL副本、数据字典、数据表及质量评估报告,确保了数据的可访问性与可复现性。
特点
该数据集的核心特征在于其全面性与关联性,收录了逾2200万条记录,覆盖从资助项目到成果转化的完整科研价值链。其独特之处在于整合了NIH与NSF两大机构的资助信息,并构建了项目-出版物-专利之间的关联网络,以及研究者-机构-资助的拓扑结构,为科学政策分析、科研绩效评估和技术转移研究提供了前所未有的数据深度与广度。
使用方法
用户可通过HuggingFace Datasets库直接加载不同配置的子集,或利用Pandas、Polars、DuckDB等工具读取Parquet分片进行灵活查询与分析。数据集提供分层级的数据包(S/M/L),适应从快速探索到深度挖掘的不同研究需求。典型应用场景包括资助格局分析、大学与研究者绩效基准测试、创新链条解析以及资助成果的文献计量研究,为科研管理决策提供实证支撑。
背景与挑战
背景概述
该数据集由DataForge开放数据项目于2026年发布,整合了美国国立卫生研究院(NIH)ExPORTER和NSF奖项API的官方批量数据,旨在提供分析就绪的联邦科研资助表格。核心研究问题在于构建一个跨越机构、研究者、项目、出版物和专利的关联性数据库,以支持科研资助格局分析和创新链条研究。该数据集包含超过2200万行记录,覆盖奖项、项目、出版物等11个配置表,规模庞大且结构完整,为科学政策研究和科研管理提供了宝贵的基础设施,在学术和个人研究中具有广泛的应用前景。
当前挑战
该数据集面临的挑战首先在于其解决的领域问题:科研资助数据分散于不同联邦机构(NIH和NSF),格式各异,缺乏统一整合,难以进行跨机构的全景分析。因此,数据集构建需克服数据格式异质性、实体匹配复杂性(如研究者、机构的去重与关联)以及数据更新持续性的挑战。此外,构建过程中还涉及大规模数据清洗、表间关联(如出版物与项目、专利与项目)的准确性维护,以及在不包含摘要全文的前提下,如何通过公开信息有效支持资助成果链的深入分析,这要求严谨的QA流程和数据字典设计以满足学术研究的可复现性要求。
常用场景
经典使用场景
该数据集汇聚了美国国立卫生研究院(NIH)与自然科学基金(NSF)的联邦科研资助项目数据,以分析就绪的表格形式呈现,涵盖资助金额、研究机构、项目负责人及项目元数据等核心字段,为科研政策与科研管理领域的研究者提供了系统性的数据支撑。其经典使用场景聚焦于科研资助格局的宏观审视,诸如描绘学科资助分布、识别顶尖研究机构与领军学者、追踪科研经费的时空演变,以及探究资助机制与科研产出之间的关联规律。凭借其多维度关联结构与海量记录,该数据集成为运用可计算社会科学方法解析美国联邦科研资助体系的基准性资源。
衍生相关工作
由该数据集衍生出的学术工作已涵盖多个前沿方向。基于其资助与产出关联表,诸多研究构建了科研生产力预测模型,探索项目特征与论著发表、专利授权之间的作用机理;结合网络科学方法,研究者绘制了科研合作网络与人才流动图谱,刻画了学术社会结构的演化轨迹。在政策评估领域,利用准实验设计,相关成果深入剖析了资助强度对科研创新绩效的因果效应。该数据集亦构成若干科学图谱与开放科学基础设施的基础数据源,支撑着大规模科研评价指标体系的构建,引领了一系列关于联邦研发投入经济影响的计量经济研究。
数据集最近研究
最新研究方向
在当前科研政策与创新生态研究的前沿,联邦科研资助数据的深度挖掘已成为衡量国家科技实力与资源配置效率的关键抓手。该数据集整合了美国国立卫生研究院(NIH)与国家科学基金会(NSF)的权威资助记录,构建了涵盖资助项目、临床研究、专利产出、学术发表及研究者画像的多维关联网络,为科学计量学、科技政策评估及知识图谱构建提供了前所未有的细粒度数据基础。其最新研究方向聚焦于利用大规模资助数据追踪科研生产力的演化轨迹,揭示资助策略与成果转化之间的内在规律,进而支撑高校竞争力对标、技术转移路径分析以及跨机构科研协作模式的实证研究。该数据集的发布不仅推动了开放科学数据的可复现性标准,更为政策制定者优化科研经费配置、识别战略新兴领域提供了数据驱动的决策支持,对理解美国联邦科研投资的宏观版图与微观影响具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务