遇见数据集

electricsheepafrica/africa-ilo-eap-3eap-sex-age-edu-nb-youth-labour-force-by-sex-age-and-education-thousa

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别、年龄和教育程度划分的青年劳动力(千)| 非洲(ILOSTAT)”,是一个关于非洲青年劳动力的表格数据集。它包含19,209个观测值,涵盖49个非洲国家,时间跨度为1982年至2025年,涉及一个核心指标:按性别、年龄和教育程度划分的青年劳动力数量(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为非洲国家。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、年龄和教育程度分类、观测年份、观测值以及数据质量标志等。该数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究者和开发者提供机器学习就绪的非洲劳动力数据。

The dataset is named Youth labour force by sex, age and education (thousands) | Africa (ILOSTAT). It contains 19,209 observations across 49 African countries, spanning from 1982 to 2025, covering one distinct indicator: youth labour force disaggregated by sex, age, and education (in thousands). The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, retrieved via REST API and filtered to African countries. The dataset includes columns such as country code, country name, source, indicator code, sex classification (total, male, female), age and education classifications, observation year, observed value, and data quality flags. It is designed for tabular classification, regression, and time-series forecasting tasks, providing ML-ready labour force data for Africa.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eap-3eap-sex-age-edu-nb-youth-labour-force-by-sex-age-and-education-thousa 数据集图片
构建方式
该数据集来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口(具体指标代码为EAP_3EAP_SEX_AGE_EDU_NB)直接获取原始数据,并依据非洲ISO3国家代码进行地理筛选而构建。ILOSTAT本身会对各国劳动力调查、住户收入调查等微观数据进行基于国际劳工统计学家会议(ICLS)定义的一致性处理与协调,数据源的可追溯性通过source.label字段加以标识。最终由Electric Sheep Africa团队统一封装为HuggingFace Datasets可加载的Parquet格式数据集,总计包含19209条观测记录。
特点
本数据集覆盖1982年至2025年间49个非洲国家的青年劳动力数据,聚焦于按性别(男、女、总计)、年龄(15-29岁青年分段)和教育程度(汇总级别)分层的劳动力参与情况。观测值为年度频率,并以千人为单位表示。数据集中每个观测点均包含详尽的可追溯元数据,如数据来源、观测状态标志(如初步或不可靠)、分类注释以及断点修订信息,为用户提供了极高的数据透明度和质量判断依据。此外,数据源自权威的全球劳动力统计标杆——ILOSTAT,保证了跨时空比较的科学严谨性。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset()`函数一键加载该数据集,并将其转换为Pandas DataFrame进行后续分析。典型的使用场景包括:基于`ref_area`列筛选特定国家进行纵向劳动力趋势研究;按时间序列对`EAP_3EAP_SEX_AGE_EDU_NB`指标排序,绘制观测值随年份变化的图表;以及通过数据透视表构建以年份为行、国家为列的国家间劳动力面板矩阵。利用`sex`、`classif1`等分类列,研究人员能够灵活地将分析细化至不同性别与年龄教育组合的子群体,从而深入挖掘非洲青年劳动力市场的结构性特征。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT创建,经Electric Sheep Africa于2025年重新整理并发布在HuggingFace平台。数据集聚焦于非洲49个国家的青年劳动力市场,涵盖1982年至2025年间按性别、年龄和教育水平分层统计的劳动力参与情况,共计19,209条观测值。作为全球劳工统计的权威来源,ILOSTAT通过整合国家劳动力调查、家庭收入调查及行政记录等多元数据,采用国际劳工统计学家会议(ICLS)定义进行标准化处理,使得该数据集成为研究非洲青年就业结构、性别差异与教育回报率的关键基础资源。其在时间跨度与地理覆盖上的广度,为政策制定者与学者追踪劳动力市场长期变迁、评估可持续发展目标(SDG)体面工作进展提供了不可替代的实证素材。
当前挑战
该数据集所解决的领域问题挑战在于,非洲青年劳动力数据长期分散于不同国家调查体系,缺乏统一口径与时空连贯性,难以支撑跨国比较与动态分析。构建过程中面临的挑战包括:各国调查方法、问卷设计与统计口径差异巨大,需要ILOSTAT通过复杂的标准化流程调和原始微观数据;部分国家数据年份稀疏或存在方法论断裂(如注释中标注的“Break in series”),导致时间序列不连续;观测值附带的“不可靠”(Unreliable)状态标记表明数据质量参差不齐,使用者在建模时需谨慎处理异常值与缺失信息。此外,数据来源的多元性要求在保持可追溯性的同时,确保跨来源的一致性与代表性,这构成了数据整合与质量控制的持续难点。
常用场景
经典使用场景
该数据集汇集了自1982年至2025年间49个非洲国家青年劳动力市场的数据,涵盖性别、年龄及教育程度三个关键维度的分解信息,共计19209条观测记录。其典型应用场景在于对非洲青年劳动力参与模式的动态追踪与比较分析。研究者可利用该数据集进行跨国家、跨时段的面板数据建模,探索青年劳动力供给在时间序列上的演变轨迹,尤其适合考察不同教育背景的青年群体在劳动力市场中的差异性表现。
解决学术问题
长期以来,非洲地区青年劳动力数据的碎片化与口径不统一,严重制约了关于人力资本积累与劳动力市场互动关系的跨国实证研究。该数据集依托国际劳工组织ILOSTAT的统一统计框架,解决了数据可比性这一核心痛点,使学者得以开展跨国的面板数据分析,精准识别教育水平对青年就业的边际影响。其影响在于,为检验人力资本理论、劳动力市场分割理论以及性别差异假说提供了坚实的微观数据基础,推动了发展经济学与劳动经济学在非洲语境下的理论验证与边际创新。
衍生相关工作
基于该数据集,学术界已衍生出多项具有影响力的经典工作。例如,利用面板数据模型考察教育扩张对青年劳动力参与率的非线性影响,揭示过度教育与技能错配现象的国别差异。另一类代表性研究聚焦于性别维度的分解分析,量化了非洲各国女性青年在劳动力市场中的边缘化程度及其随时间的变化趋势。此外,该数据集还被用于构建预测模型,结合经济周期指标预报青年失业率的波动,为相关劳动力市场的早期预警系统提供了方法论范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务