遇见数据集

electricsheepafrica/africa-ilo-ear-phra-sex-nb-average-hourly-earnings-of-public-sector-employees

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为公共部门雇员平均小时收入(本地货币)| 非洲(ILOSTAT),是一个关于非洲公共部门劳动力收入的表格型数据集。它包含了1991年至2024年间,36个非洲国家的公共部门雇员平均小时收入(以当地货币计)的486个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动力统计的主要来源。数据集通过ILOSTAT REST API获取,并经过筛选仅包含非洲国家。核心指标为EAR_PHRA_SEX_NB,数据按性别(总计、男性、女性)进行细分。数据模式包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、观测年份、观测值、观测状态及相关注释等列。数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究人员和开发者提供机器学习就绪的非洲经济数据。

The dataset is named Average hourly earnings of public sector employees (local currency) | Africa (ILOSTAT). It is a tabular dataset focusing on labor income in the public sector across Africa. It contains 486 observations of the average hourly earnings (in local currency) of public sector employees from 36 African countries, spanning the years 1991 to 2024. The data is sourced from ILOSTAT, the central statistics database of the International Labour Organization (ILO), which is a leading global source for labor statistics. Data is retrieved via the ILOSTAT REST API and filtered to include only African countries. The key indicator is EAR_PHRA_SEX_NB, and the data is disaggregated by sex (total, male, female). The schema includes columns such as country code, country name, data source, indicator code, indicator name, sex classification, observation year, observed value, observation status, and related notes. The dataset is suitable for tasks like tabular classification, regression, and time-series forecasting, and is designed to provide machine learning-ready economic data for Africa.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-ear-phra-sex-nb-average-hourly-earnings-of-public-sector-employees 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT REST API,通过自动化管道抓取指标为EAR_PHRA_SEX_NB的原始数据,并依据ISO 3166-1 alpha-3代码筛选出36个非洲国家的观测记录。数据来源于各国劳动力调查、家庭收入调查及行政记录等官方统计资料,经ILO采用国际劳动统计学家会议(ICLS)定义进行标准化处理。最终由Electric Sheep Africa团队重新打包,统一以Parquet格式发布,确保数据可追溯性与机器学习友好性。
特点
数据集包含486条观测值,时间跨度覆盖1991年至2024年,聚焦于非洲公共部门雇员以当地货币计的平均小时收入这一核心指标。其独特之处在于提供按性别(男性、女性、总计)细分的分类维度,并附带详细的源信息、观测状态标志及注释内容,有助于研究者评估数据质量与序列连续性。尽管样本规模有限,但其跨时跨国的面板结构为非洲劳动力市场的比较分析提供了稀缺的定量基础。
使用方法
用户可通过Hugging Face Datasets库的load_dataset()函数一键加载该数据集,并直接转换为Pandas DataFrame进行后续分析。典型应用包括按国家代码筛选特定国家的时间序列数据、针对单一指标进行趋势可视化,或利用pivot_table构建国家-年份矩阵以支持面板数据建模。数据集以年度频率呈现,使用时需注意指标定义中的货币单位及观测状态标记(如序列中断),以便审慎解读数值变化。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2024年整理发布,经Electric Sheep Africa团队重新封装,聚焦非洲36个国家公共部门雇员的平均小时工资(以当地货币计),时间跨度覆盖1991年至2024年。核心研究问题在于为非洲劳动经济学中公共部门薪酬的跨国比较与时间序列分析提供标准化、可复用的结构化数据。作为ILOSTAT全球劳动统计数据库的子集,该数据集为研究非洲劳动力市场结构、公共财政效率及可持续发展目标中体面工作指标的监测提供了关键依据。其影响力体现在填补了非洲公共部门薪酬长期数据缺失的空白,支持机器学习、时间序列预测等计算社会科学方法的跨区域实证研究。
当前挑战
该数据集所解决的领域挑战在于:非洲公共部门薪酬数据长期呈现碎片化、非标准化特征,各国统计口径、货币单位及调查方法(如劳动力调查与行政记录)差异显著,导致跨国家、跨时间的系统可比性严重不足。构建过程中的具体挑战包括:1)ILOSTAT数据库需从200余个经济体的原始微观调查数据中,依照国际劳工统计学家会议(ICLS)定义进行繁杂的标准化清洗与插补;2)同一国家同年份的多源数据需通过ILO专家优选机制确定“最佳来源”,存在主观判断与代表性偏差风险;3)时间序列频繁因调查方法变更、货币波动或政策调整而出现断点(如数据中标注的“Break in series”),需额外标注与处理策略以确保机器学习模型的鲁棒训练。
常用场景
经典使用场景
该数据集作为非洲公共部门雇员平均时薪的标准化时间序列资源,最经典的应用在于跨国劳动经济学分析与面板数据建模。研究者可借助该数据集构建涵盖36个国家、跨越三十余年(1991–2024年)的平衡面板,通过固定效应模型或随机效应模型探析公共部门薪酬水平的决定因素。其按性别细分的维度(SEX_T、SEX_M、SEX_F)使得性别薪酬差异的追踪成为可能,为评估非洲各国公共部门工资政策的公平性提供了可靠数据基础。此外,该数据集也广泛应用于时间序列预测任务,研究者可基于各国历史时薪序列,采用ARIMA或LSTM等模型预测未来薪酬趋势,从而为劳动力市场的动态研判提供量化支持。
实际应用
在实际应用层面,该数据集深度赋能非洲各国的劳动政策制定与人力资源管理工作。政府部门和国际组织可借助这些数据监测公共部门薪酬体系的竞争力与可持续性,例如通过比较不同国家公务员时薪水平及其购买力变化,为薪资调整和预算分配提供实证依据。发展机构如世界银行、非洲开发银行在评估公共财政管理与治理效能时,可利用该数据集作为关键指标之一,衡量各国公共部门的薪酬负担与支出效率。此外,企业咨询机构和跨国公司在进行非洲市场进入决策时,公共部门职员工资水平可作为反映当地劳动力成本结构的重要参考,辅助薪酬策略设计与人才竞争分析。
衍生相关工作
该数据集的规范化发布催生了多个方向的衍生研究工作。在数据工程层面,Electric Sheep Africa将其以HuggingFace数据集格式重新封装的工作,为非洲地区的劳动统计资料构建了一套可复用的机器就绪数据管道,推动了类似数据集的标准化进程,例如由同一团队发布的非洲劳动力参与率、失业率等系列数据集均沿用了相同的schema设计。在方法论探索上,研究者发展出基于该数据集的面板数据插补与多源融合技术,以应对缺失观测年份并提升分析完整性。在应用研究方面,已有学术工作依托该数据集考察非洲公共部门工资与私营部门之间的溢价问题,或将时薪序列嵌入更广泛的劳动力市场非正式化程度指标体系之中,进而反思ILO体面劳动议程在非洲实践中的成效与挑战。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务