遇见数据集

electricsheepafrica/africa-ilo-emp-temp-sex-ind-edu-nb-employment-by-ilo-sector-and-sex-and-education-tho

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含45,080个观测值,涵盖了42个非洲国家从2000年至2025年的就业数据,重点关注一个核心指标:按国际劳工组织(ILO)部门、性别和教育程度划分的就业人数(以千计)。数据来源于国际劳工组织的ILOSTAT数据库,经过统一处理并过滤至非洲地区,包含国家代码、数据来源、指标代码、性别分类、教育分类、年份、观测值及数据质量标志等详细字段,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains 45,080 observations of employment data across 42 African countries, spanning the years 2000 to 2025, with a focus on one distinct indicator: Employment by ILO sector and sex and education (thousands). Sourced from the ILOSTAT database of the International Labour Organization, the data is harmonized and filtered to Africa, featuring detailed fields such as country codes, data sources, indicator codes, sex disaggregation, education classification, year, observed values, and data quality flags, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-emp-temp-sex-ind-edu-nb-employment-by-ilo-sector-and-sex-and-education-tho 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口获取指标EMP_TEMP_SEX_IND_EDU_NB(按ILO部门、性别和教育程度划分的就业人数,单位:千人)的原始数据,并筛选出非洲42个国家的ISO3国别代码对应的观测值。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查、住户收入调查及行政记录等微观数据进行统一协调,源数据在source.label列中予以标记,确保数据可追溯。数据经过Electric Sheep Africa的流水线再处理后,以Parquet格式打包并上传至HuggingFace平台,形成便于机器学习直接加载的数据集。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,使用load_dataset函数即可获取训练集并转换为Pandas DataFrame。支持按国家代码(ref_area)过滤单国数据,或按指标排序后绘制时间序列图。亦可利用pivot_table将数据透视成国家×年份的矩阵,便于跨国家比较或面板数据分析。由于数据结构为表格形式且包含时间和分类维度,适用于分类、回归及时序预测等机器学习任务。使用时应引用原始ILO数据及Electric Sheep Africa的再包装版本,并遵循CC-BY-4.0许可协议。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Africa重新封装后提供,聚焦非洲大陆42个国家2000至2025年间按ILO行业、性别及教育水平划分的就业人数(单位:千)。依托ILOSTAT这一全球权威劳动统计数据库,数据集整合了来自劳动力调查、行政记录等多源异构数据,共计45,080条观测值,旨在系统刻画非洲地区就业结构的时空演变。作为首个面向非洲的、具备细粒度分层维度的就业时间序列数据集,其为劳动经济学、发展研究及联合国可持续发展目标(SDG)中的体面工作指标监测提供了关键支撑,显著提升了区域劳动力市场分析的深度与可复现性。
当前挑战
该数据集所应对的领域挑战主要体现为非洲劳动统计数据的碎片化与不规范性。许多非洲国家缺乏连续、高质量的劳动力调查,导致数据缺失与断点频现,需依赖ILO国际劳工统计学家会议(ICLS)定义进行跨国家、跨年份的协调与插补。数据构建过程中面临多重困难:不同来源的原始数据在分类编码(如教育水平、行业门类)上存在差异,观测值状态需标记为“暂定”或“不可靠”;同一国家同一年份出现多个来源时需选取“最佳来源”;且年频数据无法反映月度或季度波动,限制了高精度时序建模的可能性。此外,部分国家较晚才加入统计体系(如卢旺达自2017年起),长周期分析中边缘缺失问题显著。
常用场景
经典使用场景
该数据集广泛应用于非洲劳动力市场的结构性分析,尤其适用于探究不同国际劳工组织(ILO)经济部门、性别以及教育水平对就业人数的影响。研究者可借助其高度结构化的面板数据,开展时间序列回归、多维分类预测以及序列建模等任务,例如解析性别就业差距的演变趋势,或评估教育层次对部门间就业分布的非均衡调节效应。
解决学术问题
该数据集直面非洲地区长期存在的劳动力统计碎片化与可比性缺失困境,为学术研究提供首个覆盖42国、跨度25年的统一就业指标库。它系统性地解决了跨性别、跨教育背景与跨ILO部门的就业分布比较难题,使研究者能够实证检验人力资本理论在非洲的适用性,量化性别不平等对经济增长的抑制机制,并填补了次撒哈拉区域长时序劳动力动态分析的空白。
实际应用
在实际应用中,该数据集为国际发展机构、非洲各国劳动部门及非政府组织提供精准的就业监测抓手。例如,政策制定者可根据不同教育层次和性别分组的就业数据,优化定向技能培训项目的资源配置;世界银行与ILO可借助该数据评估非洲大陆自由贸易区(AfCFTA)对就业结构的实效影响,助力实现可持续的体面劳动目标。
数据集最近研究
最新研究方向
该数据集聚焦于非洲劳动力市场中按国际劳工组织(ILO)行业、性别与教育水平划分的就业结构研究,是当前劳动经济学与可持续发展目标(SDGs)交叉领域的前沿资源。随着非洲大陆自贸区(AfCFTA)的推进以及全球供应链重构背景下对体面劳动(Decent Work)的迫切需求,研究者正借助此数据深入剖析性别就业差异、教育回报率与产业结构变迁之间的动态关联。该数据集涵盖42国长达25年的年度观测,通过ILOSTAT标准化的分类体系,为量化分析非洲非正规经济转型、青年就业挑战及女性劳动力参与率的时空演变提供了可靠基石。其发布的时序特性支持面板数据建模与因果推断,尤其适合用于评估政策干预(如技能培训计划)对就业质量的异质性影响,从而为区域劳动力市场的科学治理与包容性增长策略的制定注入实证依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务