遇见数据集

electricsheepafrica/africa-ilo-eap-3eap-sex-age-stu-nb-youth-labour-force-by-sex-age-and-school-attendanc

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含11,718个观测值,覆盖49个非洲国家,时间跨度为1991年至2025年,涉及一个核心指标:按性别、年龄和学校出勤状态分类的青年劳动力数据(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并专门过滤到非洲国家。数据集结构包括国家代码、国家名称、指标代码、指标标签、性别分类、年龄分类、学校出勤状态分类、观测年份、观测值(单位因指标而异,此处为千)、观测状态标志以及相关注释列。数据质量方面,为年度频率,ILO选择“最佳来源”处理多源数据,且分类列仅在指标发布细分数据时非空。数据集适用于表格分类、回归和时间序列预测任务,主要用于劳动力市场分析,支持按国家、年份或指标进行过滤和透视分析。

This dataset contains 11,718 observations of labour force data across 49 African countries, spanning from 1991 to 2025, covering one distinct indicator: Youth labour force by sex, age and school attendance status (thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled directly via its REST API and filtered to Africa ISO3 country codes. The schema includes columns such as country code, country name, indicator code, indicator label, sex disaggregation, age classification, school attendance classification, observation year, observed value (in thousands, with unit varying by indicator), observation status flags, and source notes. Data is annual frequency, with ILOs best source selection for multiple sources per country-year, and disaggregation columns are non-null only when published. It is designed for tabular classification, regression, and time-series forecasting tasks, focusing on labour market analysis in Africa, and supports filtering, time-series plotting, and pivoting operations.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eap-3eap-sex-age-stu-nb-youth-labour-force-by-sex-age-and-school-attendanc 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)下属的ILOSTAT中央统计数据库,该数据库是全球劳动统计的权威来源,涵盖了就业、失业、工资、工作时间、童工、非正规经济、社会保障及SDG体面工作目标等多维度指标。数据经由ILOSTAT REST API接口直接抽取,指标代码为EAP_3EAP_SEX_AGE_STU_NB,代表按性别、年龄和学校出勤状况划分的青年劳动力(单位:千人)。在获取原始数据后,通过非洲国家ISO3代码进行地理过滤,最终汇聚了49个非洲国家自1991年至2025年间的11,718条观测值。ILO采用国际劳动统计学家会议(ICLS)定义对原始调查微观数据进行协调处理,数据源标识符(source.label)清晰标注了每项观测的追溯来源,确保了数据的透明性与可复现性。
特点
该数据集的核心特色在于其精细的多维分类架构。除基本的时间与地理维度外,数据按性别(SEX_T、SEX_M、SEX_F)和年龄分层(如15-29岁青年区间)进行交叉划分,并整合了学校出勤状态(STU_EDU_TOTAL等)这一教育维度,从而能够深入剖析教育与劳动力市场参与之间的关联。数据覆盖时间跨度长达35年,涵盖了绝大多数非洲国家,其中毛里求斯(858行)、南非(827行)与埃及(623行)的观测最为丰富。此外,每一观测值均附带了观测状态标识(如'U'表示不可靠)和序列断裂备注,为研究人员提供了严谨的数据质量评估依据,使其能够审慎地处理因方法论修订或数据源变更带来的潜在偏差。
使用方法
用户可通过HuggingFace Datasets库便捷地加载该数据集:使用`load_dataset('electricsheepafrica/africa-ilo-eap-3eap-sex-age-stu-nb-youth-labour-force-by-sex-age-and-school-attendanc')`即可获取,并以Pandas DataFrame格式进行操作。针对特定国家的分析,可利用'ref_area'列进行过滤,例如`df[df['ref_area'] == 'KEN']`提取肯尼亚的数据。对于时间序列分析,可依据'indicator'列筛选目标指标,并按'time'列排序,直接绘制'obs_value'随时间变化的趋势图。若需构建国家间比较矩阵,可通过`pivot_table`方法将数据重塑为国家×年份的宽表格式,便于进行面板数据分析或统计建模。值得注意的是,数据为年度频率,且同一国家同一年份若有多个数据源,ILO默认采用其选定的'最佳来源'。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年通过其核心统计数据库ILOSTAT创建,并经Electric Sheep Africa重新打包发布。数据集聚焦于非洲49个国家1991至2025年间按性别、年龄及在校状态分层的青年劳动力规模(单位:千人),核心研究问题在于解析非洲青年在多重社会经济维度下的劳动参与格局。作为ILOSTAT在非洲大陆的区域化子集,该数据集为发展经济学、劳动经济学及教育政策研究提供了标准化的时序面板数据,尤其支撑了联合国可持续发展目标中关于体面工作与经济增长(SDG 8)的量化评估。其对劳动力调查微观数据的国际可比性整合,显著提升了非洲区域劳动统计数据的可获取性与分析深度。
当前挑战
数据构建面临的核心领域挑战在于非洲各国劳动力调查在方法论、调查频率与定义标准上的高度异质性,ILO需依据国际劳动统计学家会议(ICLS)准则进行跨国产出协调,但部分观察值仍被标记为“不可靠”或存在“方法修订导致序列中断”。数据整合过程中,破解不同国家调查机构提供的不一致分类体系(如年龄分组、教育状态界定)是重大技术难题,且针对同一国家-年份组合需从多个来源中选择ILO认定的“最佳来源”,这引入了数据溯源与质量权衡的复杂性。此外,仅以年度频率发布的数据难以捕捉劳动力市场的季节性波动,而针对非正规就业等关键维度的分层变量缺失,进一步限制了分析颗粒度。
常用场景
经典使用场景
该数据集收录了1991年至2025年间49个非洲国家按性别、年龄及在校状态划分的青年劳动力参与数据,共计11,718条观测记录。其经典使用场景在于支援跨国别、长时序的劳动经济学比较研究,研究者可通过性别与教育就读状态的交叉分解,系统评估不同社会群体在青年劳动力市场中的参与差异。数据以标准化指标编码呈现,便于利用`time`与`ref_area`字段构造面板数据,进而开展区域间劳动力供给弹性的计量分析,或结合教育政策变迁,探究就学与就业之间的动态权衡关系。
衍生相关工作
该数据集所衍生的相关工作主要集中在非洲青年就业决定因素的实证检验与预测建模领域。一方面,基于其面板结构,催生了探讨教育回报率、性别歧视与制度环境如何塑造青年就业形态的计量经济学文献。另一方面,数据的时间序列特性为深度学习与统计方法在劳动力预测中的应用提供了契机,部分研究利用LSTM或Prophet模型对特定国家的青年劳动力参与率进行短期预警。此外,该数据与ILOSTAT旗下其他指标体系(如失业率、非正规部门就业比例)的融合,进一步拓展了多维度青年福祉指数构建等交叉研究方向。
数据集最近研究
最新研究方向
随着非洲青年人口激增与后疫情时代劳动力市场结构性矛盾加剧,该数据集在联合国可持续发展目标(SDG 8:体面工作与经济增长)框架下,成为量化分析青年就业、失学与性别鸿沟的核心数据源。前沿研究聚焦于利用其1991至2025年间覆盖49国、按性别、年龄及在校状态分层的11,718条观测值,构建时序预测模型与多维不平等测度,以揭示不同类型经济体(如南非、埃及、尼日利亚)中青年劳动力参与率与入学率的动态关联。近期热点包括结合ILOSTAT方法论中的调查断点标识(如'Break in series')与来源标签,评估数据质量对机器学习训练鲁棒性的影响,进而为非洲国家制定精准的青年就业干预政策及教育-劳动力转型路径提供证据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务