遇见数据集

electricsheepafrica/africa-ilo-lap-2gdp-noc-rt-labour-income-share-as-a-percent-of-gdp-ilo-modell

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1,212个观测值,涉及收入与薪酬不平等数据,覆盖53个非洲国家,时间跨度为2004年至2026年,涵盖1个独立指标。

This dataset contains 1,212 observations of Income and pay inequality data across 53 Africa countries, spanning 2004–2026, covering 1 distinct indicators.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-lap-2gdp-noc-rt-labour-income-share-as-a-percent-of-gdp-ilo-modell 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接获取指标`LAP_2GDP_NOC_RT`的原始数据,并依据非洲国家ISO3代码进行地理范围筛选。数据经Electric Sheep Africa团队重新打包,统一格式并发布为HuggingFace数据集。ILOSTAT基于国际劳工统计学家会议(ICLS)标准,对各国劳动力调查、家庭收入调查等微观数据进行协调与建模,最终形成包含2004至2026年、覆盖53个非洲国家、共计1212条观测值的时间序列数据。
特点
此数据集聚焦于劳动收入占GDP比重的唯一指标,提供长跨度、跨国家的面板数据,便于进行非洲区域收入分配与经济增长关系的纵向分析。每条记录包含国家代码、时间、观测值、数据来源及状态标记等字段,支持按国家或年份快速过滤。数据来源于ILO的建模估计,具有权威性和一致性,同时保留了原始来源标签确保可追溯。数据量适中,适合用于时序回归、分类预测及面板数据分析等机器学习任务。
使用方法
用户可通过HuggingFace的`datasets`库直接加载数据集,使用`load_dataset()`函数一行代码即可获取DataFrame格式数据。随后可借助Pandas进行数据探索,例如按国家代码筛选特定国家的时间序列,或按指标分组后以时间与观测值绘制趋势图。推荐将数据透视转换为以时间为行、国家为列的矩阵形式,便于进行跨国家比较或作为面板模型输入。该数据集直接兼容主流Python数据分析与机器学习工具链,降低了劳动经济学研究的预处理门槛。
背景与挑战
背景概述
劳动收入份额(Labour Income Share)作为衡量国民收入在劳动者与资本所有者之间分配的关键指标,长期以来是发展经济学与劳动经济学关注的焦点。然而,撒哈拉以南非洲地区因统计体系薄弱、调查数据碎片化,导致该区域的劳动收入份额长期缺乏系统、可比的时间序列数据。为解决这一研究空白,国际劳工组织(ILO)依托其ILOSTAT数据库,于2025年发布了经模型校准的非洲劳动收入份额估算数据集(nov. 2025版),并由Electric Sheep Africa于2026年重新打包为HuggingFace格式。该数据集整合了53个非洲国家2004年至2026年的年度观测值,共计1,212条记录,为分析非洲大陆收入分配动态、评估可持续发展目标(SDG)第八项体面工作目标进展提供了迄今为止最为完整的高质量数据基础。数据集一经发布,便成为区域不平等研究、跨国面板分析以及机器学习预测模型的标准参考资源。
当前挑战
该数据集所应对的核心领域挑战在于,非洲国家的劳动收入份额数据长期存在来源不一、定义分歧和年度缺失率高等问题,传统统计方法难以建立一致的跨国时间序列。数据构建过程中面临多重挑战:首先,原始数据源自各国劳动力调查、家庭收支调查及行政记录,其调查方法和覆盖人群差异显著,ILO需依据国际劳工统计学家会议(ICLS)定义进行复杂的跨源归一化处理;其次,多源数据中同一国家同一年的指标常存在多个观测值,需通过ILO的“最佳来源”选择机制进行筛选,该机制依赖专家判断与模型估算,增加了不确定性;此外,ILO采用模型化估算(modelled estimates)对缺失年份进行插补,虽然保证了序列连续性,但估算精度受限于局部拟合质量与源数据密度,部分国家的观测状态被标记为“插补值”(Imputation),这对下游统计推断和机器学习建模中的置信区间估计提出了额外稳健性要求。
常用场景
经典使用场景
在劳动经济学与发展经济学领域,该数据集最经典的应用场景是追踪非洲各国劳动力收入份额的长期演变轨迹。研究人员可利用其覆盖2004至2026年的年度面板数据,针对53个非洲国家开展跨国比较分析,揭示劳动收入在国民生产总值中占比的结构性变化。基于ILO建模估计的统一口径,该数据集特别适用于评估非洲大陆内部不同经济体在要素收入分配格局上的异质性,为理解经济增长模式与收入分配公平性之间的内在联系提供关键数据支撑。
实际应用
在实际政策制定中,该数据集为国际组织与非洲各国政府评估可持续发展目标中体面工作目标的实现进展提供了量化标尺。劳动收入份额作为衡量经济包容性的核心指标,能够帮助政策制定者识别哪些国家或时段出现了资本收益过度挤压劳动报酬的风险,从而针对性地调整最低工资标准、产业补贴政策与税收结构。此外,跨国企业对非洲投资布局亦可借助该数据预判当地消费市场规模潜力,因为稳定的劳动收入份额往往预示着更强的内需基础。
衍生相关工作
基于该数据集已衍生出多项标志性研究工作。有学者利用其面板结构构建了非洲国家劳动收入份额的收敛性检验模型,发现南部非洲与东非地区呈现出差异化的俱乐部收敛特征。另有团队将其与全球工资报告数据耦合,开发出预测非洲国家技能溢价变化的机器学习框架。ILO自身也在其《全球工资报告》非洲专章中大量引用此数据作为基准,推动了国际社会对非洲非正规就业规模与劳动报酬关系的重新评估,催生了关于非正规经济中隐藏劳动收入测量的方法论创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务