electricsheepafrica/africa-ilo-emp-temp-sex-ind-ins-nb-employment-by-ilo-sector-and-sex-and-institutional
收藏数据链接:
官方服务:
资源简介:
该数据集包含28,395个观测值,涵盖了42个非洲国家从2000年到2025年的就业数据,重点关注按ILO行业、性别和机构部门划分的就业(千)这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过重新打包,以适用于机器学习任务。数据集提供了按性别(总计、男性、女性)、行业分类和机构部门等维度的细分,并包含国家代码、年份、观测值、数据来源和质量标志等信息。
This dataset contains 28,395 observations of employment data across 42 African countries, spanning from 2000 to 2025, focusing on the indicator Employment by ILO sector and sex and institutional sector (thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, repackaged for machine learning readiness. It includes disaggregation by sex (total, male, female), industry classification, and institutional sector, along with country codes, years, observed values, data sources, and quality flags.
提供机构:
electricsheepafrica搜集汇总
数据集介绍

构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT数据库构建,通过REST API接口直接获取指标编码为EMP_TEMP_SEX_IND_INS_NB的原始数据,并依据非洲ISO3国家代码进行地理过滤。数据源自各国劳动力调查、家庭收支调查、企业调查及行政记录等多元渠道,ILO依据国际劳动统计学家会议(ICLS)定义对微观数据进行标准化处理,并在source.label字段中标注数据来源以确保可追溯性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并将其转化为Pandas DataFrame进行后续分析。典型应用包括按国家筛选(如df[df['ref_area'] == 'KEN'])、按指标与时间排序绘制时间序列图,以及将数据透视构建为国家×年份的就业矩阵。数据以Parquet格式打包,便于高效存储与处理,适合机器学习、时间序列预测及统计建模等任务。
背景与挑战
背景概述
非洲大陆的劳动力市场研究长期受困于数据碎片化与统计口径不一的问题,尤其是就业结构的性别与部门细分数据尤为稀缺。为应对这一困境,国际劳工组织(ILO)倾力构建了ILOSTAT数据库,而Electric Sheep Africa团队于2025年在此基础上精心整编了本数据集,聚焦非洲42个国家2000至2025年间按ILO部门、性别及制度部门划分的就业人数(千计)。该数据集整合了来自劳动力调查、住户收入调查及行政记录等多源异构数据,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行标准化对齐,旨在为非洲劳动力市场的时空比较与政策评估提供高一致性、高覆盖度的量化基础。作为首个面向非洲大陆的ML-ready就业结构数据集,它有效填补了非洲劳动经济学研究中精细分类面板数据的空白,对推动区域发展经济学、性别平等及体面劳动等可持续发展目标(SDGs)的量化分析具有里程碑意义。
当前挑战
该数据集解决的核心领域挑战在于非洲国家就业数据的纵向可比性与细粒度表征难题:各国统计能力参差导致历史数据稀疏且间断,非正规经济占比极高使得传统调查低估实际就业规模。构建过程中面临多重挑战,首先是跨源数据标准化困难——42国原始调查定义各异,ILO需通过系列断点标记(如note_indicator中的方法修订标识)协调口径,但过度平滑可能掩盖结构性变迁;其次是缺失数据与质量标注的权衡,数据集保留obs_status如'U'(不可靠)等标记以警示用户,却增加了自动建模时的过滤复杂度;再者是分类维度的层级差异,部分国家仅提供性别总计数而缺乏机构部门交叉分类,导致classif2字段大量空值,限制了多维度联合分析的可能;最后,时间跨度涵盖2025年预测值,其生成方法未透明公开,给未来回测验证带来不确定性。
常用场景
经典使用场景
在劳动经济学与发展经济学领域,该数据集的核心应用场景在于对非洲各国就业结构的跨时空比较分析。研究者可利用其按性别、ILO行业及制度部门细致划分的就业人数指标,构建面板数据模型,系统考察非洲大陆42个国家在2000至2025年间就业形态的演变轨迹。凭借ILOSTAT权威的统计口径与统一的数据质量框架,该数据集为探究非洲劳动力市场的性别差异、行业转移与制度性特征提供了坚实的数据基础,是开展非洲就业宏观研究的理想起点。
解决学术问题
该数据集有效解决了非洲劳动统计领域长期存在的数据碎片化与可比性不足这一学术瓶颈。通过整合42个国家超过26年的时序观测,学者得以跨越国界系统研究经济增长、产业结构变迁与制度环境如何塑造非洲多样化的就业景象。其明确的性别与行业分层为验证经典劳动经济学理论在非洲语境下的适用性创造了条件,例如女性劳动参与率与经济发展阶段之间的U型关系假说,从而推动发展经济学理论的在地化检验与深化。
实际应用
在实际应用层面,该数据集为国际组织、非洲各国政府及非政府机构制定与评估就业政策提供了量化依据。例如,决策者可以借助分性别与分行业的就业数据,识别特定经济部门中的性别不平等现状并设计精准干预措施。同时,该数据集可用于监测联合国可持续发展目标8(体面工作和经济增长)中关于就业质量的各项进展,为年度国家报告和区域一体化战略提供审慎且可追溯的统计支持,赋能从数据到行动的高效转化。
数据集最近研究
最新研究方向
该数据集聚焦于非洲地区按国际劳工组织(ILO)行业、性别及制度部门划分的就业结构,为劳动力市场动态分析提供了高颗粒度的时间序列数据(2000-2025年,覆盖42个非洲国家)。当前前沿研究方向主要集中在利用该数据进行非洲就业转型的量化评估,特别是结合ILO第19届国际劳动统计学家会议(ICLS)最新定义,探索非正规经济向正规就业的转移路径、性别就业差距的时空演变,以及新冠疫情后非洲就业复苏的异质性模式。此外,研究者正将该数据集与非洲大陆自由贸易区(AfCFTA)政策时间点对齐,以评估区域一体化对就业结构的冲击效应,同时借助机器学习模型(如时序预测与分类)识别行业层面就业弹性的关键驱动因素,为联合国可持续发展目标(SDG)第八项体面工作目标在非洲的落地提供数据驱动的政策模拟基础。该数据的标准化发布(Parquet格式与HuggingFace接口)显著降低了多国、多维度劳动统计数据的获取门槛,成为衔接宏观劳动力政策与微观就业动态的中枢性开源资源。
以上内容由遇见数据集搜集并总结生成



