遇见数据集

electricsheepafrica/africa-ilo-emp-5emp-sex-ste-nb-employment-by-sex-and-status-in-employment-19th-ic

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含按性别和就业状况划分的就业——第19届国际劳工统计学家会议(千)| 非洲(ILOSTAT),提供了1,809个观测值,覆盖12个非洲国家(如津巴布韦、斯威士兰、塞舌尔等),时间范围为2020年至2025年,包含1个核心指标(EMP_5EMP_SEX_STE_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤到非洲国家,使用第19届国际劳工统计学家会议(ICLS)定义进行标准化。数据集包括列如国家代码、国家名称、来源、指标、性别分类、时间、观测值等,适用于表格分类、回归和时间序列预测任务。数据以年度频率提供,并包含数据质量说明,如使用最佳来源和分列维度。

This dataset contains Employment by sex and status in employment -- 19th ICLS (thousands) | Africa (ILOSTAT), providing 1,809 observations across 12 African countries (e.g., Zimbabwe, Eswatini, Seychelles), spanning the years 2020 to 2025, with 1 distinct indicator (EMP_5EMP_SEX_STE_NB). The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, pulled via API and filtered to African country codes, harmonized using 19th International Conference of Labour Statisticians (ICLS) definitions. It includes columns such as country code, country name, source, indicator, sex disaggregation, time, observed value, and is suitable for tabular classification, regression, and time-series forecasting tasks. Data is provided at annual frequency, with quality caveats like the use of best source and disaggregation dimensions.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-emp-5emp-sex-ste-nb-employment-by-sex-and-status-in-employment-19th-ic 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT数据库,通过REST API接口直接提取指标EMP_5EMP_SEX_STE_NB的原始数据。随后,依据非洲ISO3国家代码进行地理维度过滤,并基于第19届国际劳动统计学家大会(ICLS)定义对各国劳动力调查微观数据进行统一协调与整合。数据集由Electric Sheep Africa团队重新封装为Parquet格式,确保数据在HuggingFace平台上可直接加载使用,每一条观测均保留了来源标识符(source.label)以支持数据溯源。
特点
本数据集涵盖2020至2025年间12个非洲国家的1,809条就业观测记录,核心指标为按性别和就业身份划分的就业人数(单位:千)。数据维度丰富,包含性别(男、女、合计)和就业身份分类(如自雇、雇员等),并附有观测状态标志(如临时性、数据断点)及详细注释信息,便于识别数据质量与序列中断情况。其具备跨年度、跨国别的面板结构,适宜开展时间序列分析和横向比较研究。
使用方法
利用HuggingFace的datasets库,用户可通过一行代码load_dataset()加载数据并转换为Pandas DataFrame,便于后续分析与可视化。典型应用包括:按国家代码(ref_area)筛选特定国别的就业数据;依据指标代码(indicator)提取统一序列并以年份排序绘制趋势图;借助pivot_table操作将数据重塑为国家×年份的矩阵格式,以开展区域间的对比研究和统计建模。数据集结构清晰,适合机器学习任务中表格分类、回归及时间序列预测等场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2025年发布,经Electric Sheep Africa团队重新封装并托管于HuggingFace平台,聚焦非洲12个国家在2020至2025年间按性别和就业身份划分的就业数据。核心研究问题在于提供标准化的、机器可读的劳动力统计指标,以支持非洲地区就业结构、性别差异及劳动市场动态的量化分析。该数据集作为ILOSTAT全球劳动力统计体系在非洲区域的细化产物,填补了该区域高分辨率、跨年度就业数据的空白,为政策制定者、发展机构及学术研究者提供了可信赖的基础数据源,尤其在追踪可持续发展目标(SDG)体面工作指标方面具有重要参考价值。
当前挑战
该领域的核心挑战在于非洲国家间劳动力调查方法和口径的多样性,导致数据可比性面临严峻考验。国际劳工统计局(ICLS)定义虽为统一标准,但各国在调查频率、问卷设计和样本覆盖上存在显著差异,使得跨国家序列的直接比较需谨慎处理。构建过程中,数据整合需从ILOSTAT REST API抽取原始指标,并依据ISO3代码过滤非洲国家,面临多源异构数据的清洗与对齐难题。观测值中的“序列中断”及“方法论修订”标记(如break in series)提示部分年度数据因调查改版而不可直接衔接,增加了时序建模的复杂度。此外,按性别、就业身份等维度的细粒度拆解导致稀疏性问题,某些国家-年份组合样本量极小,对机器学习模型的泛化能力构成限制。
常用场景
经典使用场景
该数据集收录了2020至2025年间非洲12个国家的就业数据,涵盖性别与就业身份维度,共计1809条观测记录。其经典使用场景包括:作为时间序列预测任务的基础,用以建模非洲区域就业总量及结构的变化趋势;在表格分类与回归任务中,通过性别、就业身份等特征构建预测模型,探索不同人口学变量对就业状况的影响;同时可作为多维度面板数据,支持跨国家、跨年份的宏观经济比较分析。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经权威统计方法整合,为非洲劳动市场研究提供了标准化且可复用的结构化数据资源。
实际应用
在实际应用层面,该数据集为国际发展机构、非洲国家统计局及政策制定者提供了数据驱动的决策支撑。例如,世界银行与国际劳工组织可借其监测非洲各国在可持续发展目标(SDG)第八项——体面工作与经济增长方面的进展,识别就业性别差距的关键区域与时段。国家层面,埃及、尼日利亚等国劳动部门能够利用该数据评估劳动力调查方法变革(如断点标注字段所示)对统计结果的影响,校准未来政策干预方向。此外,非政府组织可借此设计针对女性的职业培训计划,聚焦于就业身份从“自雇”向“受雇”的转化瓶颈。数据集以标准化格式发布,配合Python接口,显著降低了应用门槛,使快速原型开发与可视化面板搭建成为可能。
衍生相关工作
围绕该数据集已衍生出多项具有代表性的研究工作。其一,基于时间序列分量预测模型,学者利用序列中的性别与就业身份分类信息,构建了非洲特定国家(如津巴布韦、坦桑尼亚)的就业弹性预测框架,揭示经济周期与就业波动的非线性关联。其二,在面板计量领域,研究者结合该数据集与ILO其他指标(如工时、工资),开发了包含性别交互项的多水平回归模型,量化了教育扩展对女性就业身份提升的异质性效应。其三,数据驱动的聚类分析被用于识别非洲就业市场的“典型化事实”——例如将12个国家按就业性别比与自雇率划分为三类劳动力市场体制,为制度比较研究提供了新视角。此外,该数据集还被作为基准数据,用于检验大语言模型在非洲低资源环境下的表格推理能力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务