electricsheepafrica/africa-ilo-ear-cmta-sex-nb-average-monthly-earnings-of-care-employees-by-sex
收藏数据链接:
官方服务:
资源简介:
该数据集包含357个观测值,覆盖30个非洲国家,时间跨度为2000年至2024年,主要指标为按性别划分的护理员工平均月收入(本地货币)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过标准化处理,适用于表格分类、回归和时间序列预测等任务。数据集包括国家代码、性别分类、观测年份和数值等字段,并提供了数据来源和质量说明。
This dataset contains 357 observations across 30 African countries from 2000 to 2024, focusing on the indicator Average monthly earnings of care employees by sex (local currency). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), with harmonized data for machine learning tasks such as tabular classification, regression, and time-series forecasting. The dataset includes fields like country codes, sex disaggregation, observation years, and values, along with source and quality notes.
提供机构:
electricsheepafrica搜集汇总
数据集介绍

构建方式
该数据集由Electric Sheep Africa从ILOSTAT官方REST API直接抓取而来,原始数据源自国际劳工组织(ILO)的中央统计数据库。构建过程中,首先通过API接口获取指标代码为EAR_CMTA_SEX_NB的完整数据,随后根据非洲国家ISO3代码进行地理过滤,仅保留30个非洲国家的观测记录。ILOSTAT本身采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据来源涵盖劳动力调查、家庭收入调查及行政记录,并在source.label字段中标注溯源信息,确保了数据的一致性与可追溯性。最终数据集包含357条观测,覆盖2000年至2024年的时间跨度,以Parquet格式打包发布,便于直接加载使用。
特点
该数据集的核心特点在于其聚焦非洲地区带薪护理工作者的性别薪酬差异,提供单一核心指标——按性别划分的月平均收入(以当地货币计),并包含SEX_T(总计)、SEX_M(男性)、SEX_F(女性)三种性别维度。数据覆盖30个非洲国家,时间跨度长达25年,其中埃及、南非和毛里求斯贡献了最多的观测记录。每个观测均附带详尽元数据,包括数据来源、观测状态标识及货币单位注释,有助于用户评估数据质量。此外,数据集采用CC-BY-4.0许可协议,源数据与二次包装均需标注引用,体现了开放科学与学术规范并重的特点。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载数据,返回的Dataset对象可直接转换为Pandas DataFrame进行分析。典型使用场景包括:使用ref_area列按国家筛选数据,例如过滤出肯尼亚的观测记录;针对特定指标按时间排序,绘制时序图以观察薪酬变化趋势;或利用pivot_table将数据重塑为国家×年份的矩阵形式,便于跨区域比较。数据集中sex列提供了按性别拆分的能力,研究者可分别分析男性、女性及总体的薪酬演变规律。所有操作均基于标准Python数据科学生态,无需额外预处理即可快速开展统计分析或机器学习建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过其ILOSTAT数据库整理并发布,后经Electric Sheep Africa重新封装,聚焦于非洲30个国家2000至2024年间按性别划分的护工平均月收入(以当地货币计)。ILOSTAT作为全球劳动统计领域的权威数据源,整合了来自劳动力调查、行政记录等多渠道的微观数据,并遵循国际劳工统计学家会议(ICLS)定义进行标准化处理。这一数据集的核心研究问题在于揭示非洲地区护理行业在性别维度下的收入差异与时空演变规律,为劳动力经济学、性别平等研究及可持续发展目标(SDGs)中体面工作指标的监测提供了关键证据。其影响力体现在弥补了非洲区域高分辨率护理行业薪酬数据的空白,支撑政策制定者与国际组织评估劳动市场中的性别不平等现象,并推动数据驱动的社会科学研究范式向低频次、多国别、长时序的精细化方向演进。
当前挑战
该数据集所面对的领域挑战主要源于非洲护理行业性别薪酬差距的量化困难——传统宏观数据常掩盖行业内部的性别差异化收入模式,而该数据集通过按性别分列的收入指标(EAR_CMTA_SEX_NB)试图解构这一隐性不平等,但受限于样本量仅357条观测值及30国覆盖,难以捕捉非正规护理从业者的经济贡献与薪资波动。在构建过程中,挑战来自三方面:一是ILOSTAT多源数据的频繁断点(如‘Break in series’标记)与不同来源间口径差异(如调查问卷与行政记录的定义偏差);二是部分国家年度数据缺失(如多国仅提供6-9条记录),导致时间序列不连贯;三是货币单位(当地货币)与通胀因素未归一化处理,使得跨国家与跨年际的购买力平价比较面临潜在偏差,需引入额外汇率与价格指数进行校正。
常用场景
经典使用场景
该数据集聚焦于非洲30个国家2000至2024年间按性别划分的照护雇员月均收入观测,共包含357条记录。经典使用场景包括跨国面板数据分析与性别工资差异的时间序列建模。研究者可利用该数据探究非洲照护行业女性与男性雇员的收入动态演变,结合国家层面的宏观经济指标(如GDP、通货膨胀率)进行多变量回归分析,亦可构建固定效应或随机效应模型以剥离国家异质性与时间趋势对性别收入差距的贡献。其精细化的性别维度与年际连贯性使其成为劳动经济学中分析照护行业薪酬结构特征的理想定量工具。
实际应用
在实践中,该数据集被国际组织与非洲国家劳动部门用于监测可持续发展目标(SDG)框架下体面工作指标的进展,尤其聚焦目标8.5所强调的同工同酬原则。政策制定者可借助其按性别拆分的收入趋势,评估本国照护行业工资政策的有效性,并识别薪酬歧视的高发领域。对于非政府机构与社会企业,该数据支持其设计针对女性照护工作者的赋权干预方案,例如定向技能培训或薪酬透明度倡议。此外,跨国企业的人道供应链部门可用其评估非洲运营点的性别薪酬公平性,从而规避社会责任合规风险。
衍生相关工作
该数据集衍生了一系列具有影响力的学术与政策研究工作。在方法论层面,研究者基于其面板数据结构开发了适用于稀疏非洲观测的插补算法,以填补历史年份的缺失值。学术论文方面,有学者结合该数据与ILO其他劳动力指标(如失业率、行业就业占比)构建了非洲照护经济综合指数,揭示了性别收入差距与女性劳动参与率之间的非线性关系。政策报告中,联合国妇女署与非洲开发银行引用了该数据集的分析结果,发布了针对撒哈拉以南非洲照护行业薪酬改革的区域比较白皮书。此外,该数据还被集成至开源经济模拟平台,用于预测最低工资增长对性别收入平等的动态影响。
以上内容由遇见数据集搜集并总结生成



