遇见数据集

electricsheepafrica/africa-ilo-ear-emta-sex-age-nb-average-monthly-earnings-of-employees-by-sex-and-a

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于非洲46个国家员工平均月收入的表格型数据集,时间跨度为1990年至2024年。它包含8,982条观测数据,核心指标为EAR_EMTA_SEX_AGE_NB,即按性别和年龄划分的员工平均月收入(以当地货币计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是劳动统计的全球权威来源,通过劳动力调查、家庭收入调查等收集并协调数据。数据集中的每条记录都包含国家代码、国家名称、数据来源、指标代码、指标标签、性别分类(总计、男性、女性)、年龄分类、观测年份、观测数值、观测状态标志以及相关注释等信息。数据按年度频率提供,并经过ILO的协调处理,以确保定义的一致性。该数据集适用于表格分类、回归和时间序列预测等机器学习任务,旨在为研究非洲劳动力市场、收入差异和经济趋势提供标准化的、可直接用于分析的数据。

This dataset is a tabular dataset on the average monthly earnings of employees across 46 African countries, spanning from 1990 to 2024. It contains 8,982 observations, with the core indicator being EAR_EMTA_SEX_AGE_NB, which represents the average monthly earnings of employees by sex and age in local currency. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, a leading global authority on labour statistics, which compiles and harmonizes data from sources such as labour force surveys and household income surveys. Each record in the dataset includes information such as country code, country name, data source, indicator code, indicator label, sex disaggregation (total, male, female), age classification, observation year, observed value, observation status flags, and related notes. The data is provided at an annual frequency and has been harmonized by the ILO to ensure consistent definitions. This dataset is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, and aims to provide standardized, analysis-ready data for studying labour markets, income disparities, and economic trends in Africa.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-emta-sex-age-nb-average-monthly-earnings-of-employees-by-sex-and-a 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT数据库,聚焦非洲大陆雇员平均月薪(按性别与年龄分层,以当地货币计值)。数据通过调用ILOSTAT REST API接口获取原始指标,并依据非洲ISO3国家代码进行地理过滤与筛选。为确保统计数据的一致性与国际可比性,ILO使用国际劳动统计学家会议(ICLS)定义对各国劳动力调查、家庭收支调查及行政记录等原始微观数据进行协调与标准化处理,最终生成包含8,982条观测值、覆盖46个非洲国家及1990至2024年时间跨度的结构化表格数据。
特点
该数据集的核心特色在于其精细的维度划分与严谨的数据治理。除了提供国家、年份、指标值等基础字段外,还专门设置了性别与年龄(如15岁以上青年与成年人)的分类变量,使用户能够深入剖析不同人群的薪资差异。此外,每条观测均附有数据来源标签及观测状态标识(如数据是否因系列中断而标记为临时性),极大提升了数据的可追溯性与透明度。数据以Parquet格式封装,由Electric Sheep Africa团队完成标准化整理,确保了机器学习任务的直接可用性。
使用方法
研究人员可直接通过HuggingFace Datasets库中的load_dataset()函数快速加载数据,并将其转换为Pandas DataFrame以便于分析。典型应用场景包括:按国家代码过滤以开展单一国家的时间序列分析,按指示代码排序并绘制薪资随年份变化的趋势图,或通过数据透视表构建以年份为行、国家为列的区域薪资矩阵,从而支持跨国比较与面板数据建模。数据集适用于表格分类、回归及时间序列预测等多项监督学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年通过其ILOSTAT数据库整理发布,经Electric Sheep Africa重新封装后呈现于HuggingFace平台。核心研究问题聚焦于非洲大陆46个国家1990年至2024年间,按性别与年龄分层计算员工平均月收入(以当地货币计量),旨在填补非洲劳动经济学领域高粒度、跨时域收入数据的空白。ILOSTAT作为全球劳动统计权威来源,整合了各国劳动力调查、家庭收支调查及行政记录,所采用的定义遵循国际劳动统计学家会议(ICLS)标准,确保了跨国可比性。该数据集为分析非洲劳动力市场中的性别工资差距、代际收入流动及经济发展阶段对收入分配的影响提供了基础性资源,对推动非洲区域发展经济学、劳动经济学及政策评估研究具有重要价值。
当前挑战
该数据集面临的挑战首先在于非洲劳动统计领域的根本性难题:许多国家缺乏连续、标准化的调查体系,导致数据在时空维度上存在显著稀疏性与断裂点,例如莫桑比克等国的观测年份零星分布,且同一国家不同年代的数据来源可能从行政记录切换为调查数据,引发断点问题。构建过程中,从多个来源的原始微观数据中提取消费者价格指数一致的收入值,需协调各国迥异的调查框架、计量单位及货币贬值因素,例如安哥拉宽扎(AOA)的观测值需通过注释列标注货币类型。此外,约三分之一的非洲国家缺少性别或年龄分层子集,导致代表性偏差,而年度频次限制了捕捉季节性就业波动(如农业周期)的精准性,使得机器学习模型在插值、反事实推断及鲁棒性验证上面临严峻考验。
常用场景
经典使用场景
该数据集汇聚了ILOSTAT数据库中1990年至2024年间46个非洲国家按性别与年龄分层的雇员月均收入信息,共计8,982条观测。研究者常将其用于构建面板数据结构,以追踪非洲大陆劳动力市场薪酬的时空演化规律。借助数据集中提供的性别维度(总、男、女)与国际劳工组织统一的统计分类,学者能够精准剖析不同人口群体在收入分配上的异质性变迁,从而为评估区域经济发展阶段的公平性提供量化基准。
解决学术问题
长期以来,非洲国家的劳动力收入数据因来源分散、定义不统一而难以进行跨国比较与纵向分析。本数据集通过整合ILO官方统计口径,系统解决了收入指标在时间与地理维度上的碎片化问题,使得研究者能够实证检验性别收入差距的收敛趋势、年龄结构对薪酬水平的影响机制,以及经济周期波动下低收入群体的脆弱性等经典问题。其意义在于为发展经济学、劳动经济学和性别研究提供了可信的实证基础,推动了以数据为驱动的非洲政策评估进程。
衍生相关工作
依托该数据集,已衍生出多项具有影响力的学术与实务工作。研究者在ILO框架下将其应用于非洲各国最低工资政策效果评估,发现薪酬性别差距在调薪后呈现非线性响应。另有学者结合世界银行的微观调查数据,通过倾向得分匹配方法考察了正规与非正规部门间的收入流动性。此外,数据还催生了若干开源工具包,如自动化生成非洲大陆性别薪酬热力图的Python库,以及基于该数据的时间序列异常检测基准任务,为后续跨学科协作奠定了标准化资源基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务