electricsheepafrica/africa-ilo-ear-ehra-sex-eco-nb-average-hourly-earnings-of-employees-by-sex-and-ec
收藏数据链接:
官方服务:
资源简介:
该数据集包含14,821个观测值,涉及35个非洲国家从1991年至2024年按性别和经济活动划分的雇员平均小时收入(本地货币),数据来源于ILOSTAT。
This dataset contains 14,821 observations, covering 35 African countries over the period 1991 to 2024. It provides average hourly earnings (in local currency) of employees classified by gender and economic activity, with data sourced from ILOSTAT.
提供机构:
electricsheepafrica搜集汇总
数据集介绍

构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于非洲地区雇员按性别和经济活动划分的平均小时工资(以当地货币计)。数据通过调用ILOSTAT REST API直接获取,原始指标代码为EAR_EHRA_SEX_ECO_NB,并依据非洲ISO3国家代码进行过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调,数据来源在source.label列中予以标注,确保可追溯性。数据集由Electric Sheep Africa重新打包,以Parquet格式发布,包含35个非洲国家、1991年至2024年间共计14,821条观测值,覆盖1个关键指标。
特点
数据集具备多维度的精细分拆能力,主要体现在按性别(sex)和第一分类变量(classif1,如经济部门)的划分上,其中性别包含总、男、女三类。每个观测值均包含观测值、观测状态及多个注释字段,便于用户评估数据质量。数据以年度频率呈现,当同一国家与年份存在多个来源时,ILO会优先选取“最佳来源”,保证了数据的一致性。标注为“不可靠”(Unreliable)的观测状态字段,为用户提供了数据可信度的参考依据。整体设计兼顾了统计严谨性与实际应用的可操作性。
使用方法
用户可通过HuggingFace的datasets库轻松加载该数据集,仅需一行代码即可完成导入,并转换为Pandas DataFrame进行后续分析。支持按国家代码过滤,例如提取肯尼亚的工资数据。对于指标分析,可对特定指标(如EAR_EHRA_SEX_ECO_NB)按时间排序并绘制时序图,直观呈现变化趋势。还可以利用透视表功能,构建以时间(time)为行、国家代码(ref_area)为列、观测值(obs_value)为单元格的国家×年份矩阵,便于跨区域比较与面板数据分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)编制,经由Electric Sheep Africa于2024年重新打包,聚焦非洲地区按性别和经济活动划分的雇员平均时薪(以本币计)。数据集涵盖1991年至2024年间35个非洲国家的14,821条观测值,源于ILOSTAT数据库——这一全球劳动统计领域的权威枢纽。ILOSTAT通过整合各国劳动力调查、家庭收入调查及行政记录,依据国际劳动统计学家会议(ICLS)定义进行标准化处理,为研究非洲劳动力市场中的性别工资差异、经济结构转型与体面劳动目标(SDG 8)提供了跨时空的可比数据基础。该数据的发布显著推动了非洲区域劳动经济学研究,使学者得以突破以往依赖单一国家或短期面板的局限,系统审视薪资不平等与经济发展之间的动态关联。
当前挑战
数据集面临的挑战首先体现在领域问题层面:非洲各国统计能力参差不齐,导致数据覆盖的连续性与可比性受限,部分国家存在多年缺失值,且观测状态标记为‘不可靠’(如代码U)的条目可能引入测量误差。其次,在构建过程中,ILO虽采用最佳来源筛选策略,但同一国家不同年份间数据来源的差异(如劳动力调查与行政记录混用)可能破坏时间序列的一致性。此外,分类维度仅包含性别与广义经济活动(如整体行业),缺乏对教育水平、职业类型或城乡区域的精细划分,这限制了对性别工资差距根源的深入剖析。数据集以本币计价,跨国的名义薪资比较需额外处理通货膨胀与汇率波动,增加了分析复杂度。
常用场景
经典使用场景
该数据集囊括了1991年至2024年间35个非洲国家员工平均时薪的观测数据,按性别和经济活动类别进行细分。最经典的用法是作为面板数据,进行跨国、跨时段的工资水平与性别收入差距的纵向对比分析。研究者可通过按性别(SEX_T、SEX_M、SEX_F)拆分的维度,系统考察非洲各国不同经济部门中女性与男性时薪的演变轨迹,构建性别工资差距的时间序列模型。该数据结构规整,每一行代表特定国家、年份、性别及经济活动的单一观测值,非常适合直接用于回归分析、固定效应模型或随机效应模型,以识别影响工资水平的宏观与结构性因素。
衍生相关工作
围绕该数据集已衍生出一系列经典的学术与工程工作。在计量经济学领域,基于该面板数据可构建复杂的多水平模型,例如将性别工资差距拆解为行业内效应与行业间效应,并引入交互项以检验经济发展阶段对差距的影响。在机器学习方向,研究者利用时间序列预测模型(如Prophet、LSTM)对特定国家或行业的未来工资趋势进行外推,为劳动力市场预警系统提供输入。此外,该数据集常与非洲大陆其他社会经济指标(如GDP、教育普及率、非正规就业比例)进行融合,驱动结构性方程模型或因果推断研究,例如通过工具变量法检验最低工资上调对小时工资与就业率的因果效应。该数据的高质量与标准化结构,也使其成为图神经网络时空建模以及跨区域迁移学习的理想基准数据集。
数据集最近研究
最新研究方向
该数据集聚焦于非洲大陆按性别与经济活动划分的雇员平均小时工资趋势,为劳动经济学、性别平等研究及可持续发展目标(SDG)第8项“体面工作与经济增长”的量化分析提供了关键数据支撑。在当前全球关注非洲劳动力市场结构性转型与数字经济崛起的背景下,该数据可支持前沿方向如性别薪酬差距的跨国时序比较、非正规就业对工资的影响评估,以及疫情后非洲就业复苏的异质性研究。通过整合ILOSTAT官方统计,该数据集填补了非洲地区高粒度、长跨度工资数据的空白,有望推动机器学习模型在劳动市场预测、政策模拟等领域的应用,为国际组织与决策者提供基于证据的洞察。
以上内容由遇见数据集搜集并总结生成



