UKRI Gateway to Research (GtR) Extended Dataset
收藏资源简介:
该数据集由英国国家美术馆与谢菲尔德大学联合构建,整合了英国研究创新署(UKRI)三大核心数据源,重构了从资助机会发布到项目成果产出的全生命周期数据链。数据集包含17.3万个项目、262万项研究成果及1,449次评审会议记录,涵盖艺术人文、生物医学等七大研究理事会的数据,通过解析PDF/表格等异构文档实现跨系统实体对齐。其创新性在于首次打通资助机会、评审决策与项目成果的关联,解决了传统GtR数据库存在的阶段性割裂问题,为研究资助公平性、政策效果评估等元分析提供结构化基础。
This dataset was co-developed by The National Gallery and the University of Sheffield, integrating three core data sources from UK Research and Innovation (UKRI) and reconstructing the full lifecycle data chain spanning from the release of funding opportunities to the delivery of project outcomes. Comprising 173,000 projects, 2.62 million research outputs, and 1,449 review meeting records, the dataset covers data from seven research councils including those for arts and humanities, biomedicine and other disciplines. Cross-system entity alignment is achieved by parsing heterogeneous documents such as PDFs and tables. Its core innovation lies in establishing, for the first time, the connections among funding opportunities, review decisions and project outcomes, addressing the staged fragmentation issue plaguing traditional Gateway to Research (GtR) databases, and providing a structured foundation for meta-analyses such as research funding fairness assessment and policy effect evaluation.
GtR-Extended 数据集概述
数据集来源与目的
本数据集是论文《Demystifying Funding: Reconstructing a Unified Dataset of the UK Funding Lifecycle》(发表于NSLP 2026)的配套资源。它首次将英国研究创新署(UKRI)的多个数据源整合为一个统一结构,完整呈现了UKRI的资助生命周期。
核心数据源
- UKRI Gateway to Research (GtR) API:提供项目、资金、组织、人员等核心研究信息。
- UKRI Panel Meetings and Attendance 数据集:提供评审会议、申请及评审人出席信息。
- UKRI funding opportunity pages:通过爬取和AI提取元数据的资助机会页面。
主要数据实体
来自GtR API的实体
- 项目:包含分类信息(研究主题、学科、计划)。
- 资金:与项目关联。
- 组织:包含地址信息。
- 人员:包含ORCID标识符。
- 项目成员:如首席研究员、共同研究员、研究员等。
- 项目合作伙伴:如牵头组织、合作者、共同资助者等。
- 人员-组织关联:雇佣关系。
- 项目关系:如学生项目、项目间转移。
- 成果:包括出版物、关键发现、影响摘要、合作、传播、后续资助、知识产权、政策影响、产品、研究材料、艺术/创意产品、研究数据库/模型、软件/技术产品、衍生公司。
来自会议数据集的实体
- 会议:包含评审小组参考号、理事会、日期、召集人。
- 申请:包含申请人、组织、奖项详情。
- 会议-申请关联:包含排名、结果、分数、授予金额。
- 评审小组出席情况:包含评审人姓名、组织、角色。
来自资助机会页面的实体
- 资助机会:包含通过AI提取的元数据,如资助金额、持续时间、资助者、日期。
实体链接方法
link.py 脚本创建了无法从单一数据源推导的跨实体链接。
- 申请到项目链接 (
--app-proj):通过application_id或award_id与grant_reference进行不区分大小写的精确匹配。 - 申请到资助机会链接 (
--app-opp):基于标题的模糊匹配,并受理事会匹配、日期筛选、金额范围等约束,最低得分阈值为0.65。 - 项目到资助机会链接 (
--proj-opp):通过已链接的申请,将opportunity_id传播给项目。 - 评审出席到人员链接 (
--pan-per):采用两阶段流程,包括基于(姓氏、首字母)的聚类消歧,以及与GtR人员记录的匹配。
数据获取与加载
- 数据库备份下载:可从 https://zenodo.org/records/19243841 下载。
- 加载备份数据库:使用提供的命令可将备份文件恢复到PostgreSQL数据库中。
数据摄入与处理流程
- 数据准备:将原始数据文件按类别置于
./data_cache/目录的相应子目录下。 - 数据摄入:运行
uv run python -m gtr_database.ingest命令。 - 创建链接:运行
uv run python -m gtr_database.link命令以建立实体间链接。 - 数据验证:运行
uv run python -m gtr_database.validate命令以检查数据匹配正确性和存储数据质量。




