遇见数据集

electricsheepafrica/africa-ilo-ear-ehrm-sex-dsb-nb-median-hourly-earnings-of-employees-by-sex-and-dis

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲22个国家的员工按性别和残疾状况划分的每小时收入中位数(本地货币)数据,涵盖2005年至2024年,共559个观测值,指标为EAR_EHRM_SEX_DSB_NB。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并过滤为非洲国家代码。数据集采用cc-by-4.0许可证发布,由Electric Sheep Africa重新打包,适用于表格分类、回归和时间序列预测等任务,包含国家代码、年份、性别分类、观测值等列,并提供了数据质量注意事项和使用示例。

This dataset contains 559 observations of median hourly earnings of employees by sex and disability status (in local currency) across 22 Africa countries, spanning from 2005 to 2024, with the indicator EAR_EHRM_SEX_DSB_NB. The data is sourced from ILOSTAT, the ILOs central statistics database, retrieved via REST API and filtered to Africa ISO3 country codes. It is licensed under cc-by-4.0, repackaged by Electric Sheep Africa, and suitable for tabular classification, regression, and time-series forecasting tasks. The dataset includes columns such as country code, year, sex disaggregation, observed value, and notes on data quality and usage examples.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-ehrm-sex-dsb-nb-median-hourly-earnings-of-employees-by-sex-and-dis 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,经由Electric Sheep Africa团队重新打包处理。构建过程通过直接调用ILOSTAT的REST API接口获取指标数据,并依据非洲国家ISO3代码进行严格筛选,最终汇聚了22个非洲国家自2005年至2024年间的559条观测记录。ILOSTAT本身基于国际劳工统计学家会议(ICLS)的定义框架,对各国劳动力调查、家庭收入调查等原始微观数据进行标准化处理,确保了数据源的权威性与一致性,并在`source.label`字段中明确标注了数据来源,便于追溯。
特点
该数据集最显著的特征在于其聚焦于非洲地区雇员按性别和残疾状况细分的中位小时收入,提供了唯一的核心指标`EAR_EHRM_SEX_DSB_NB`,并以当地货币计量。数据从性别(sex)和残疾状态(classif1)两个维度进行精细解构,包含`SEX_T`(总计)、`SEX_M`(男性)、`SEX_F`(女性)等细分项,同时涵盖了国家代码、年份、观测值、状态标志等丰富元数据。在数据质量方面,当同一国家与年份存在多个数据源时,ILO会精选最优来源;观测值状态(如`U`表示不可靠)也一并标注,为用户提供了透明度与审慎使用的依据。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集,仅需一行Python代码`load_dataset`即可获取训练集并转换为Pandas DataFrame进行探索。针对特定国家的分析,可依据`ref_area`字段(ISO3代码)进行过滤;对于时间序列研究,可按`indicator`和`time`列排序后绘制趋势图;如需构建国家×年份的面板数据,可运用`pivot_table`方法重塑为矩阵形式,便于进一步建模与可视化。数据集以Parquet格式封装,兼顾了存储效率与加载速度,极大降低了研究人员和开发者使用非洲劳动统计数据的门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过其ILOSTAT数据库发布,并经Electric Sheep Africa重新打包,聚焦于非洲22个国家2005至2024年间按性别和残疾状态划分的雇员中位数小时收入(以本币计)。该数据集的核心研究问题在于填补非洲地区劳动市场中针对残疾人群体的收入数据空白,为评估包容性就业政策提供实证基础。作为ILO全球劳动统计体系的关键组成部分,该数据集通过整合各国劳动力调查数据,为研究收入不平等、性别差异及残疾歧视等交叉性社会问题提供了可量化视角,对可持续发展目标(SDGs)中体面工作和减少不平等的监测具有重要推动作用,尤其为非洲大陆的政策制定者与学术研究者提供了稀缺的高质量微观数据支撑。
当前挑战
该数据集所解决的领域挑战在于:长期缺乏按残疾状态分层的非洲国家收入数据,导致针对残疾人的劳动市场包容性评估存在显著盲区,且现有数据多集中于性别维度而忽视残疾这一关键交叉变量。在构建过程中,面临的挑战包括:非洲各国调查标准(如ICLS定义)执行差异导致数据可比性不足,部分国家观测值稀疏(22国中7国数据少于20条),以及数据标注存在不可靠标记(如obs_status字段中的'U'值),反映了原始调查中样本量小或质量波动的问题。此外,不同时段和国家的货币单位与通货膨胀影响未直接校准,需用户自行处理跨期国际比较偏差,而数据的时间粒度局限于年度,无法捕捉季度性波动,限制了高频劳动力市场动态分析的可能性。
常用场景
经典使用场景
该数据集的核心用途在于分析非洲地区按性别和残疾状况划分的雇员中位数小时工资,为劳动经济学和收入不平等研究提供了稀缺的微观数据支撑。研究者可借助559条观测值,跨越22个非洲国家2005至2024年的时间跨度,构建面板数据模型,以揭示残疾状态与性别差异如何交织影响劳动力市场报酬。经典分析路径包括计算不同亚组(如男性残疾雇员与非残疾女性)的收入中位数差距、绘制时序趋势图以评估政策干预效果,或利用固定效应回归剥离国家与年份异质性,精准量化残疾歧视与性别工资鸿沟的交互效应。该数据集特别适合用于跨国比较研究,填补了非洲大陆在包容性劳动统计领域的空白。
实际应用
在实际政策制定与监测领域,该数据集可作为非洲各国劳动部门评估就业包容性进展的基线工具。例如,政府可从中提取本国年度中位数小时工资,按性别与残疾状况分类后,与ILO制定的体面劳动基准对标,识别特定群体(如非残疾女性)是否系统性处于收入底层。非政府组织可利用该数据设计针对性的职业培训项目,优先覆盖那些在时序数据中显示收入停滞或下降的亚组。跨国发展机构如世界银行或非洲开发银行,则可将其纳入区域就业质量监测框架,用于验证‘残疾友好型’劳动法规是否带来了实际收入改善。其本土货币计价特性还便于结合CPI数据进行真实购买力分析。
衍生相关工作
该数据集衍生出的经典工作多聚焦于劳动经济学与交叉不平等分析的交汇处。一个典型方向是构建‘性别-残疾’收入叠加效应模型,其中采用Oaxaca-Blinder分解方法将工资差距拆分为禀赋效应与歧视效应,以厘清残疾身份与性别对收入的独立及联合贡献。另一类关键研究利用该数据训练机器学习分类器(如随机森林或梯度提升树),预测哪些国家一年份组合最可能出现高收入不平等,从而实现早期预警。时间序列预测工作也常见于后续成果中,例如运用Prophet或ARIMA模型对个别国家未来五年的中位数工资进行推估,为劳动政策制定提供前瞻参考。这些工作共同提升了非洲残障劳工经济福祉研究的深度与精度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务