遇见数据集

global-aid-activities-iati-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集为全球发展援助活动与交易数据集(IATI),源自官方 IATI 批量数据服务,但仅包含来自开放许可发布者的数据,并附带一个按发布者划分的许可注册表。数据集共包含约 91.7 万个援助活动和 1150 万条交易记录,以 Parquet 格式存储。数据被组织为多个表:活动表(activities,901,488 行)、预算表(budgets,2,695,558 行)、资金流表(flows,603,142 行)、实施组织概况表(implementer_profiles,113,762 行)、许可注册表(license_registry,2,012 行)、组织表(orgs,134,219 行)、参与组织表(participating_orgs,3,179,314 行)以及交易表(transactions,11,344,042 行)。部分大表(budgets、participating_orgs、transactions)被拆分为多个分片。每个表均包含详细的字段,例如活动标识符、发布者、日期、金额、国家、部门代码等,适用于分析援助资金流向、组织合作、预算执行情况等任务。数据集提供 S、M、L 三种大小的压缩包,内含数据词典、数据表、许可说明等。该数据集是 DataForge 开放数据项目的一部分,免费用于学术和个人用途,许可为 CC BY-NC 4.0。

This dataset is the International Aid Transparency Initiative (IATI) dataset for global development aid activities and transactions. It is derived from the official IATI bulk data service but only includes data from open-licensed publishers, accompanied by a license registry per publisher. The dataset contains approximately 917,000 aid activities and 11.5 million transaction records, stored in Parquet format. The data is organized into multiple tables: activities (901,488 rows), budgets (2,695,558 rows), flows (603,142 rows), implementer_profiles (113,762 rows), license_registry (2,012 rows), orgs (134,219 rows), participating_orgs (3,179,314 rows), and transactions (11,344,042 rows). Large tables (budgets, participating_orgs, transactions) are split into shards. Each table includes detailed fields such as activity identifier, publisher, dates, amounts, countries, sector codes, etc., suitable for analyzing aid fund flows, organizational cooperation, budget execution, and more. The dataset is available in three sizes (S, M, L) compressed packages, containing data dictionaries, data tables, and license descriptions. It is part of the DataForge Open Data Project, free for academic and personal use, licensed under CC BY-NC 4.0.

创建时间:
2026-08-08
原始信息汇总

全球发展援助活动与交易数据集(IATI)

数据集概述

该数据集源自IATI官方批量数据服务,包含917,000项援助活动1,150万条交易记录,仅限开放许可发布者数据,并配有按发布者分类的许可注册表。数据集属于DataForge开放数据计划的一部分,供学术和个人使用免费获取。

基本信息

  • 许可证:CC-BY-NC-4.0(知识共享-非商业使用4.0)
  • 语言:英语
  • 任务类型:表格分类
  • 数据规模:1000万至1亿条记录

数据内容与结构

数据集包含多个数据表,以Parquet格式存储,具体如下:

数据表 行数 说明
activities 901,488 援助活动主表,含唯一标识符、报告组织、受援国、部门分类、交易摘要等
budgets 2,695,558 预算记录,含预算类型、状态、周期和金额
flows 603,142 资金流动汇总,按捐赠方、受援国、部门类别、年份等维度聚合
implementer_profiles 113,762 实施组织概况,含实施活动数量、国家、部门及资助方信息
license_registry 2,012 发布者许可注册表,记录许可类型及纳入资格
orgs 134,219 组织规范化信息,含组织标识、类型、活动数量等
participating_orgs 3,179,314 参与组织记录,含角色、组织类型和标识
transactions 11,344,042 交易明细,含交易类型、日期、金额、供需方信息等

此外,budgets、participating_orgstransactions 表按数据量拆分为多个分区文件(如 budgets.part01-part03、transactions.part01-part12等),便于高效加载和处理。

关键字段说明

  • activities表:核心标识为iati_identifier(全局唯一),含受援国、DAC部门代码、交易总额(承诺/拨款/支出)、许可门禁状态等
  • transactions表:记录各类型交易(进账、承诺、拨款、支出),含金额、货币、提供方与接收方组织信息
  • license_registry表:记录各发布者的许可状态(开放、排除共享、排除非商业等),用于数据可追溯性

数据包版本

数据集提供不同规模的打包文件,均包含SHA-256校验值:

数据包 行数 大小
iati-tier1-S 164,072 7.5 MB
iati-tier1-M 6,912,591 389.2 MB
iati-tier1-L 18,973,537 602.2 MB

原始打包文件(含数据手册、数据字典和许可说明)存储于归档目录中。

搜集汇总
数据集介绍
global-aid-activities-iati-dataset 数据集图片
构建方式
该数据集源自国际援助透明度倡议(IATI)官方批量数据服务,经过严格的许可筛选流程构建而成。数据收集阶段仅纳入采用开放许可(如CC-BY、CC0等)的发布者,并以per-publisher许可注册表对数据进行门控,确保每一行数据均符合开放共享原则。原始数据经解析与规范化处理后,被划分为活动、预算、交易流、实施机构概况等八个核心表及多个分区表,以Parquet格式存储,便于高效读取与分析。
特点
数据集涵盖917K项援助活动与11.5M条交易记录,规模庞大且结构清晰。其特色在于多维度关联性:通过全球唯一的iati_identifier实现各表间无缝连接,活动表聚合了预算、交易及参与组织计数,交易流表提供了按捐赠方、受援国、行业类别及年份的汇总视图,而组织表与实施机构概况表则支持对援助主体的深度剖析。此外,数据集的许可注册表详细记录了各发布者的授权状态,增强了数据的合规性与可追溯性。
使用方法
使用者可通过HuggingFace数据集查看器直接浏览各表内容,或利用配置下拉框选择所需分表进行加载。Parquet格式支持Pandas、Dask等工具高效查询。建议用户结合活动表与交易表进行资金流动与项目执行分析,利用flows表开展国别或行业层面的趋势研究,通过orgs与implementer_profiles表进行组织网络与实施能力评估。数据集提供S、M、L三个规模的打包文件,适配从轻量探索到大规模建模的不同需求。
背景与挑战
背景概述
该数据集由DataForge开放数据计划于2026年推出,汇集了国际援助透明度倡议(IATI)官方数据服务中的917K项援助活动及11.5M条交易记录,严格限定为开放许可发布者,并附有逐发布者的许可注册表。其核心研究问题在于构建一个结构化、可复用的全球发展援助活动与交易数据库,以支撑对外援助、发展金融及官方发展援助(ODA)领域的定量分析与政策评估。凭借其多维度表格设计(如活动、预算、交易、参与组织等),该数据集为研究援助流动、资金分配及组织网络提供了高粒度数据基础,对发展经济学、国际关系及数据科学领域具有显著贡献,尤其在促进援助透明度和问责制研究方面影响深远。
当前挑战
该数据集面临的挑战首要在于解决发展援助领域长期存在的数据碎片化与非标准化问题。IATI数据虽覆盖广泛,但发布者众多,数据格式、字段定义及报告质量参差不齐,如何整合并清洗这些异构数据成为一大难点。构建过程中,项目需实施严格的开放许可过滤(fail-closed策略),排除含分享相同或非商业限制的发布者,同时构建许可注册表以维护版权合规,此过程涉及复杂的元数据追踪与许可判定。此外,数据规模庞大(交易记录超千万条),需高效的分区存储(如Parquet格式)与多分区配置以保持可访问性,而组织名称的规范化匹配(如基于官方标识或姓名回退)亦需精细算法以降低错误关联风险,这些均对数据治理与计算效能提出严苛要求。
常用场景
经典使用场景
该数据集源自国际援助透明度倡议(IATI)官方散装数据服务,整合了逾90万项援助活动与超过1100万条交易记录,并辅以预算、参与组织、实施者概况及许可证注册等细粒度表格,构建了一个多维度的全球发展援助知识库。其经典使用场景在于为发展经济学、国际关系及数据科学领域的研究者提供标准化、可互操作的实证基础,支撑援助流动追踪、援助有效性评估及援助分配的国别与部门比较分析,同时也作为训练机器学习模型以自动分类或预测援助活动属性的高质量语料。
衍生相关工作
围绕此数据集,已衍生了多项开拓性工作,包括构建援助流动的时空可视化平台,以动态地图呈现资金在全球的迁徙路径;开发基于自然语言处理的活动标题与描述分类器,自动映射至OECD DAC部门代码;以及利用图神经网络对参与组织网络进行嵌入学习,预测潜在合作风险或识别核心协调节点。此外,该数据集的许可证注册表设计启发了开放数据合规审计工具的研发,而交易级时间序列亦被用于训练预测模型,以预估突发危机下的人道主义援助需求波动,展现了从数据基础设施到高阶分析应用的广泛衍生潜力。
数据集最近研究
最新研究方向
全球发展援助数据(IATI)的最新研究聚焦于利用大规模细粒度交易记录与机构档案,构建国际发展金融的量化分析框架,以揭示援助资金流动的时空格局与主体网络。该数据集整合了90余万项援助活动及逾1100万条交易信息,通过标准化组织标识与许可校验,为官方发展援助(ODA)的可追溯性、实施效能评估及援助协调性研究提供了近乎全景式的数据底座。当前前沿方向涵盖基于机器学习的援助分配预测、非政府组织网络影响力分析,以及利用自然语言处理对项目描述进行主题建模,从而深化对全球发展治理动态与资金流向合规性的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务