遇见数据集

electricsheepafrica/africa-ilo-ear-emta-sex-cct-cur-nb-average-monthly-earnings-of-employees-by-sex-citiz

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别、公民身份和货币划分的员工平均月收入 | 非洲(ILOSTAT),包含来自国际劳工组织(ILO)ILOSTAT数据库的2,415个观测值,覆盖33个非洲国家,时间跨度为1991年至2025年。核心指标为EAR_EMTA_SEX_CCT_CUR_NB,即员工平均月收入,按性别(总计、男性、女性)、公民身份(总计等)和货币(本地货币等)进行细分。数据来源于ILOSTAT REST API,经过非洲国家代码过滤,并遵循国际劳工统计学家会议(ICLS)定义进行标准化。数据模式包括国家代码、国家名称、来源代码、指标代码、性别分类、时间(年份)、观测值(浮点数)等列,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Africa重新打包,以促进非洲数据的机器学习应用。

This dataset, titled Average monthly earnings of employees by sex, citizenship and currency | Africa (ILOSTAT), contains 2,415 observations from the International Labour Organization (ILO) ILOSTAT database, covering 33 African countries from 1991 to 2025. The core indicator is EAR_EMTA_SEX_CCT_CUR_NB, which represents average monthly earnings of employees, disaggregated by sex (total, male, female), citizenship (total, etc.), and currency (local currency, etc.). Data is sourced from the ILOSTAT REST API, filtered to African ISO3 country codes, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The schema includes columns such as country code, country name, source code, indicator code, sex classification, time (year), observed value (float), and is suitable for tabular classification, regression, and time-series forecasting tasks. The dataset is repackaged by Electric Sheep Africa to facilitate machine learning applications for African data.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-emta-sex-cct-cur-nb-average-monthly-earnings-of-employees-by-sex-citiz 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接提取了指标代码为EAR_EMTA_SEX_CCT_CUR_NB的数据,并依据非洲ISO3国家代码进行了地理范围筛选。在构建过程中,ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行了统一协调处理,数据来源均在source.label列中明确标注,确保了数据的可追溯性与标准化。最终,该数据集由Electric Sheep Africa重新打包整理,形成了包含2415条观测值、覆盖33个非洲国家、时间跨度从1991年至2025年的高质量表格数据。
特点
该数据集聚焦于非洲地区雇员的平均月收入,按性别、公民身份及货币类型进行细致划分,提供了唯一的指标EAR_EMTA_SEX_CCT_CUR_NB。其特色在于包含ref_area(国家代码)、sex(性别分类)、classif1(如公民身份)及classif2(如货币类型)等多个维度,支持从总体到细分群体的多层级分析。数据均为年度频率,并采用ILO选定的最佳来源以确保质量,同时以obs_status标记数据的可靠性状态。这种结构化的多维度设计,使得研究人员能够深入探究非洲劳动力市场中不同群体的薪资差异与演变趋势。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,仅需一行代码`load_dataset`即可获得可直接操作的Pandas DataFrame。基础操作包括按特定国家(如肯尼亚)过滤数据以进行国别分析,或利用time列和obs_value列对单个指标进行时间序列的可视化与趋势研究。此外,借助pivot_table函数,用户能轻松将数据重塑为国家×年份的矩阵格式,便于进行面板数据分析或跨国家横向比较。该数据集的标准化Schema与Parquet格式存储,确保了从加载到分析的流程效率极高,极大便利了非洲劳动经济学领域的计量研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于其ILOSTAT统计数据库中创建,后经Electric Sheep Africa整理并发布于HuggingFace平台。作为全球劳动力统计的权威来源,ILOSTAT致力于提供涵盖就业、工资、工作时间等维度的标准化指标,其数据源自各国劳动力调查与行政记录。本研究聚焦于非洲地区,整合了1991年至2025年间33个非洲国家的2,415条观测记录,核心指标为按性别和国籍分层的雇员平均月收入。该数据集的发布填补了非洲区域劳动力市场微观数据在机器学习领域的空白,为研究性别收入差距、移民群体经济融入及跨国工资比较等议题提供了可靠的时间序列基础,对推动非洲发展经济学与劳动经济学的量化分析具有重要价值。
当前挑战
该数据集面临的核心挑战在于其解决的领域问题以及构建过程中的多重困难。在领域问题层面,非洲大陆长期缺乏标准化、跨国的收入数据,阻碍了性别与国籍差异对工资影响的研究,现有模型因数据碎片化而难以捕捉区域劳动力市场的动态变化,例如非正规就业对官方统计的干扰。在构建过程中,ILOSTAT需要协调33个国家不同年代、不同调查方法(如家计调查与企业调查)产生的数据,面临定义不统一(如“工资”是否包含奖金)、货币单位波动(需转换为本币)及观测值质量参差(如标记为不可靠的`U`状态)等问题。此外,时间序列的不连续性(如部分国家仅2016-2025年有记录)与分类维度的稀疏性(性别或国籍分组非全量覆盖)增加了数据清洗与插补的复杂度,要求构建者设计鲁棒性处理策略以确保数据集的可用性。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织ILOSTAT数据库中关于非洲33个国家、覆盖1991至2025年间、按性别与公民身份分列的雇员平均月薪数据,共计2415条观测记录。其经典使用场景集中于劳动经济学领域的跨国面板数据分析,研究者可借此构建时间序列模型,解析非洲地区薪资结构的演变趋势、性别工资差距的动态变化,以及本国公民与外国劳工在薪酬上的差异格局。数据包含按性别、国籍及货币类型划分的多个维度,为进行差异性统计推断和政策评估提供了扎实的微观基础。
解决学术问题
在学术研究中,该数据集有效回应了非洲劳动力市场研究长期面临的几个关键挑战:一是缺乏统一的、跨年份的、具备可比性的薪酬统计数据,尤其是分性别与公民身份的精细数据;二是难以刻画外来移民与本国居民在工资收入上的结构性差异。该数据集的引入,使学者能够定量分析性别工资歧视的程度及其演变路径,评估国籍身份对收入水平的影响,并进一步探讨全球化背景下非洲各国劳动力市场的融合与分化问题。其意义在于,为发展经济学、劳动经济学与移民研究提供了可复现的经验证据,推动了非洲区域劳动政策的循证决策。
衍生相关工作
基于该数据集,已涌现出多项具有影响力的衍生工作。在计量方法上,研究者常将其与非洲各国的经济普查、劳动力调查数据联合使用,构建多层级回归模型或断点回归设计,以更准确地识别国籍身份对工资的因果效应。在理论层面,该数据集推动了关于非洲劳动力市场分割与双重劳动力市场的经验研究,并促进了性别不平等议题从发达国家向发展中国家的范式转移。此外,数据集的清洗与标准化工作为后续的机器学习与时间序列预测模型提供了高质量的训练样本,推动了劳动经济学与数据科学在非洲区域的交叉融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务