遇见数据集

electricsheepafrica/africa-ilo-ear-ehra-sex-edu-nb-average-hourly-earnings-of-employees-by-sex-and-ed

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的按性别和教育的员工平均小时收入(本地货币)指标数据,专门针对非洲地区。它涵盖了36个非洲国家从1991年至2024年的年度观测数据,总计6,902个观测值。数据集提供了按性别(总计、男性、女性)和受教育程度等维度分解的员工平均小时收入信息,以本地货币单位记录。数据来源于各国的劳动力调查、家庭收入调查、机构调查和行政记录,并经过ILO的统计部门根据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集以表格形式呈现,包含国家代码、国家名称、数据来源、指标代码、性别分类、时间年份、观测值、观测状态及相关注释等列,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains the Average hourly earnings of employees by sex and education (local currency) indicator data from the International Labour Organization (ILO) ILOSTAT database, specifically focused on Africa. It covers annual observations from 36 African countries spanning 1991 to 2024, with a total of 6,902 observations. The dataset provides information on average hourly earnings of employees disaggregated by sex (total, male, female) and education levels, recorded in local currency units. Data is sourced from national labour force surveys, household income surveys, establishment surveys, and administrative records, harmonized by the ILOs Department of Statistics using International Conference of Labour Statisticians (ICLS) definitions. The dataset is presented in tabular format with columns including country codes, country names, data sources, indicator codes, sex classifications, time years, observed values, observation statuses, and related notes, suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-ehra-sex-edu-nb-average-hourly-earnings-of-employees-by-sex-and-ed 数据集图片
构建方式
该数据集的构建依托于国际劳工组织(ILO)的ILOSTAT统计数据库,后者作为全球劳动统计的权威来源,整合了来自各国劳动力调查、家庭收入调查、机构调查及行政记录等多种原始数据。研究者通过ILOSTAT提供的REST API直接提取指标代码为EAR_EHRA_SEX_EDU_NB的数据,并依据非洲地区的ISO3国家代码进行地理过滤,最终汇聚了来自36个非洲国家、跨度自1991年至2024年的6902条观测记录。在数据抽取过程中,ILO依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行协调统一,并在source.label列中标注了每个观测值的数据来源,确保了数据可追溯性。Electric Sheep Africa团队进一步将这些标准化为Parquet格式并封装于HuggingFace数据集仓库中,便于研究者直接调用。
特点
此数据集的核心特点在于其多维度的细粒度拆分结构,涵盖了性别(sex)与教育水平(classif1)两大关键分类维度,能够支持对非洲地区不同性别与教育背景雇员平均时薪的深入比较分析。具体而言,sex列包含'总计'、'男性'与'女性'三个层次,而classif1列则提供了教育程度的聚合分类信息。此外,数据集不仅提供了核心的观测值(obs_value),还附带了观测状态标志(obs_status)、注释分类(note_classif)以及货币单位等备注信息,为用户评估数据质量提供了依据。数据的时间覆盖范围广泛,包含了从1991年至2024年的逐年观测,且通过ref_area列以ISO 3166-1 alpha-3代码形式清晰标识国家,便于进行跨国家与跨时间序列的计量分析。
使用方法
该数据集的使用极为便捷,支持通过HuggingFace的datasets库直接加载。用户仅需执行load_dataset函数,即可将数据一键读取为Pandas DataFrame格式,进而开展后续分析。针对特定国家的研究,可利用ref_area列进行条件过滤,如筛选肯尼亚(KEN)的数据。对于单一指标的时序分析,可通过按indicator列筛选后以time列排序并可视化obs_value的趋势。同时,数据集还支持通过pivot_table方法快速构建以年份为行、国家为列的矩阵式面板数据结构,便于实施横截面或面板数据回归分析。所有数据均以常用数据类型(字符串、整型、浮点型)存储,兼容性强,适合Python生态中的各类数据科学工作流。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年整理发布,经Electric Sheep Africa重新封装至HuggingFace平台,聚焦非洲36个国家1991至2024年间按性别与教育程度划分的员工平均小时工资(以本币计)。作为ILOSTAT核心统计数据库的子集,它在劳动经济学与可持续发展目标评估中占据关键位置,尤其为研究非洲大陆劳动力市场中的性别薪资差异、教育回报率及跨时期不平等演变提供了结构化的面板数据。数据集涵盖6902条观测,囊括完整的时间序列与国家截面,是对非洲地区缺乏精细劳动统计这一长期空白的系统性弥补,已被广泛应用于发展经济学、公共政策评估及相关机器学习建模任务。
当前挑战
数据集面临的核心挑战在于非洲地区劳动统计的数据稀疏性与质量异质性:多数国家调查年份不连续、部分观测被标记为不可靠(obs_status字段含‘U’标志),且各国采用不同来源(如劳动力调查、行政记录)导致数据可比性受限。构建过程中的难点包括:ILOSTAT仅筛选‘最佳来源’以避免重复,但不同来源的定义差异(如教育分层标准非统一)可能引入系统偏差;时间跨度跨度34年间多国货币价值波动剧烈,本币计价削弱了跨国家与跨时期的直接对比。此外,按性别与教育细分后的样本量骤降,尤其在高维交互分析时易产生稀疏矩阵,极大限制了统计效力与机器学习模型的泛化能力。
常用场景
经典使用场景
在劳动经济学与教育经济学的交叉领域中,该数据集被广泛用于探究非洲不同性别与教育水平的劳动者在小时工资上的差异格局。研究者常将其作为面板数据,通过固定效应模型或分位数回归,剖析教育回报率在性别间的异质性。数据集覆盖36个非洲国家、跨越1991至2024年的时间跨度,使其成为评估教育政策与劳动市场性别平等进程的理想素材,尤其适用于那些关注非洲大陆内部结构性不平等问题的实证研究。
实际应用
在实际应用中,该数据集为国际组织、各国劳工部门及非政府组织制定薪酬公平政策提供了数据基石。例如,国际劳工组织可借助其监测非洲国家在可持续发展目标(SDG)框架下关于体面工作与经济增长、性别平等的进展。非洲国家的教育部与劳工部也能据此评估不同教育层次对劳动市场回报的影响,进而优化教育投资与技能培训的资源配置。此外,该数据还可服务于跨国企业的人力资源战略,为其在非洲不同国家设定公平的薪酬结构提供依据。
衍生相关工作
基于该数据衍生的一系列经典工作主要集中在劳动市场异质性与政策模拟领域。研究者构建了非洲性别—教育工资溢价面板数据,拓展了Mincer方程在非洲的应用边界。相关衍生模型包括动态面板GMM估计、基于教育分层的反事实工资分解(如Blinder-Oaxaca分解法的改进版本),以及深入探讨教育职业匹配效应的结构性方程。这些工作不仅深化了对非洲劳动市场运行机制的理解,也为后续开发与本地化相关的计量经济学方法提供了标准化的基准测试平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务