遇见数据集

electricsheepasia/asia-ilo-gdp-2tot-noc-nb-gross-domestic-product-gdp-in-millions-constant-20

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲49个国家从1991年至2027年的年度国内生产总值(GDP)数据,共1,804个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,具体指标为GDP_2TOT_NOC_NB,即按购买力平价(PPP)计算的2021年不变价百万美元GDP(国际劳工组织模型估计)。数据集涵盖阿富汗、阿联酋、亚美尼亚、阿塞拜疆、孟加拉国、巴林、文莱、不丹、中国、塞浦路斯、格鲁吉亚、印度尼西亚、印度、伊朗、伊拉克等49个亚洲国家,每个国家提供37年的数据。数据列包括国家代码、国家名称、数据来源、指标代码、指标名称、观测年份和GDP观测值。数据集由Electric Sheep Asia重新打包,旨在为亚洲提供统一的机器学习就绪数据层。

This dataset contains annual Gross Domestic Product (GDP) data for 49 Asia countries from 1991 to 2027, with 1,804 observations. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator GDP_2TOT_NOC_NB, which represents GDP in millions of constant 2021 international dollars at purchasing power parity (PPP) based on ILO modelled estimates. It covers 49 Asia countries including Afghanistan, United Arab Emirates, Armenia, Azerbaijan, Bangladesh, Bahrain, Brunei, Bhutan, China, Cyprus, Georgia, Indonesia, India, Iran, Iraq, and others, each with 37 years of data. The dataset columns include country code, country name, data source, indicator code, indicator name, observation year, and GDP observed value. Repackaged by Electric Sheep Asia, it aims to provide a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-gdp-2tot-noc-nb-gross-domestic-product-gdp-in-millions-constant-20 数据集图片
构建方式
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT构建,原始数据来源于各国劳动力调查、家庭收支调查、企业调查及行政记录等多元途径,并依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理。Electric Sheep Asia团队通过ILOSTAT的REST API直接抽取指标ID为GDP_2TOT_NOC_NB的数据,并依据ISO 3166-1 alpha-3编码筛选出覆盖49个亚洲国家的观测值,最终以Parquet格式打包,形成包含1804条记录的标准化表格数据集,确保数据可追溯至原始来源。
特点
该数据集的核心特色在于其聚焦亚洲地区劳动生产率的跨时空分析能力,涵盖1991年至2027年共37年的年度观测数据,且统一以2021年不变价国际美元及购买力平价(PPP)为计量单位,确保跨国与跨时比较的科学性。数据集仅包含单一核心指标‘国内生产总值(百万美元)’,但通过ref_area、time、source等元数据字段,支持按国家、时间及数据来源进行精细化筛选。此外,数据由ILO建模估计生成,并在source.label中明确标注来源类型,便于用户评估数据质量与适用场景。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,如`ds = load_dataset("electricsheepasia/asia-ilo-gdp-2tot-noc-nb-gross-domestic-product-gdp-in-millions-constant-20")`,随后将训练集转换为pandas DataFrame进行后续分析。典型应用包括:按国家筛选特定时间序列数据(如印度尼西亚)、对单一指标按年份排序后进行可视化以观察经济趋势,或利用pivot_table将数据重构为国家×年份的矩阵形式,便于面板数据分析与回归建模。数据集以cc-by-4.0许可发布,使用时需同时标注ILO原始来源及Electric Sheep Asia的重新包装贡献。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年11月发布,经Electric Sheep Asia重新封装后上线HuggingFace平台,核心研究问题聚焦于亚洲地区劳动生产率的时空演变。数据集收录了1991年至2027年间49个亚洲国家的国内生产总值(按2021年不变购买力平价美元计)的ILO模型估计值,共计1804条观测记录。作为ILOSTAT数据库的子集,其数据来源涵盖劳动力调查、家庭收支调查及行政记录,经由ILO统计部门依据国际劳工统计学家会议标准进行统一协调。该数据集填补了亚洲区域长期、可比的劳动生产率指标空白,为跨国产出对比、经济增长研究及国际发展目标监测提供了标准化基准,对宏观经济学、劳动经济学及可持续发展领域的实证分析具有显著推动作用。
当前挑战
该数据集所解决的领域问题在于,亚洲各国官方GDP统计在口径、基期及购买力平价调整方法上存在显著异质性,传统数据难以直接进行跨国比较与时间序列分析。ILO通过模型估计统一了计算框架,但挑战依然存在:首先,部分国家早期年份(如1991-2000年)的原始数据缺失严重,模型推算依赖插值与外推技术,可能引入系统性偏差;其次,数据年度频率限制了季度或月度波动捕捉能力,不适用于高频经济监测;最后,多源数据融合中ILO虽选择“最佳来源”,但不同来源的抽样误差与定义差异(如非正规经济覆盖程度)未在数据集中显式量化,用户需警惕潜在测量误差对研究结论的影响。
常用场景
经典使用场景
该数据集收录了1991年至2027年间亚洲49个国家的国内生产总值(以百万计,按2021年不变国际美元购买力平价计算)的年度观测值,共计1804条记录。作为ILOSTAT劳动生产力指标的核心组成部分,它最经典的使用场景是进行跨国别、长时序的经济增长与劳动产出效率的定量分析。研究者通常利用该数据集构建面板数据模型,考察亚洲各国在不同发展阶段的经济规模演变轨迹;或将其与就业、工时等劳动力变量耦合,开展劳动生产率的分解与收敛性研究,从而揭示亚洲经济体在全球化背景下的结构性变迁特征。
解决学术问题
该数据集系统性地回应了亚洲发展经济学中若干关键学术难题。首先,它解决了因各国统计口径不一、数据缺失而导致的亚洲整体与区域经济增长测度不精确的问题,提供了经国际劳工组织统一协调的可比性基准。其次,基于长时间跨度的购买力平价调整GDP数据,学者得以突破汇率波动干扰,精确检验‘亚洲奇迹’中劳动生产率提升对经济增长的真实贡献。该数据集还助力于探究制度质量、人力资本积累与全要素生产率之间的深层关联,其严谨的元数据标注为实证研究的可重复性奠定了坚实基础。
衍生相关工作
围绕这一核心数据集,学术界催生了若干衍生性经典工作。其一,将亚洲GDP数据与ILOSTAT中的就业率、工资水平等指标融合,构建‘劳动产出弹性’与‘就业转换效率’等衍生面板数据集,用于分析经济增长的就业吸纳能力。其二,利用其覆盖49个国家的优势,发展出针对亚洲区域的‘经济复杂度’与‘产业升级指数’,结合贸易数据刻画国家间价值链分工格局。其三,基于该数据集的年度频率特性,研究者开发了专门的亚洲经济周期计量方法与先行指标合成模型,形成了系统的区域宏观经济监测研究框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务