遇见数据集

electricsheepafrica/africa-ilo-eip-3eip-sex-age-edu-nb-youth-outside-the-labour-force-by-sex-age-and-educ

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲49个国家从1982年至2025年的19,942个观测值,专注于“其他劳动力利用不足的衡量指标”中的青年非劳动力人口数据。具体指标为“按性别、年龄和教育程度分类的青年非劳动力人口(以千计)”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为非洲国家。数据集提供了结构化表格,包括国家代码、指标代码、性别分类、年龄和教育程度分类、观测年份、数值以及数据质量标志等列。数据可用于表格分类、回归和时间序列预测等任务,适用于劳动力市场分析和政策研究。数据集由Electric Sheep Africa重新打包,采用CC BY 4.0许可。

This dataset contains 19,942 observations across 49 African countries from 1982 to 2025, focusing on Other measures of labour underutilization data, specifically the indicator Youth outside the labour force by sex, age and education (thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for African countries. It provides a structured tabular format with columns including country codes, indicator codes, sex disaggregation, age and education classifications, observation year, numerical values, and data quality flags. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, applicable to labour market analysis and policy research. It is repackaged by Electric Sheep Africa and released under the CC BY 4.0 license.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-3eip-sex-age-edu-nb-youth-outside-the-labour-force-by-sex-age-and-educ 数据集图片
构建方式
该数据集由Electric Sheep Africa从ILOSTAT REST API中提取,以国际劳工组织(ILO)发布的劳动力利用不足指标“EIP_3EIP_SEX_AGE_EDU_NB”为核心,专指非洲地区不在劳动力队伍中的青年群体,并按性别、年龄及教育水平进行细分。数据获取后,依据非洲ISO3国家代码进行过滤,保留了覆盖49个非洲国家的观测值,时间跨度从1982年至2025年。ILOSTAT通过协调各国劳动力量调查、家庭收入调查等原始微观数据,依据国际劳工统计学家会议定义进行标准化处理,并在数据集中通过“source.label”字段标识数据来源,确保每一条观测的可追溯性。最终形成包含19,942条观测的表格型数据集,以Parquet格式封装,便于直接通过HuggingFace Datasets库调用。
特点
本数据集的核心特点在于其高度细化的多维分解能力。数据按性别(总、男、女)、年龄区间(如15-29岁青年段)及教育聚合水平进行交叉分类,揭示了非洲不同人口亚群在劳动力市场之外的结构性差异。覆盖国家广泛且时间序列长,从南非到坦桑尼亚等国均包含多年数据,部分国家如南非拥有超过1,600条观测,为纵向比较提供了丰富基础。数据质量方面,当同一国家与年份存在多个来源时,ILO自动选取其标注的“最佳来源”,并辅以观测状态标志(如“不可靠”),增强了可用性。同时,数据集自带的注释字段详尽记录方法论变更、教育分类偏差及来源信息,为深度分析提供了透明度。
使用方法
该数据集的使用极为便捷,研究者可通过HuggingFace的`load_dataset`函数直接加载为Pandas DataFrame,实现无缝对接Python数据分析环境。典型用法包括:按国家过滤以聚焦特定区域的时间序列分析,例如使用`df[df['ref_area'] == 'KEN']`获取肯尼亚全部数据;对单一指标进行趋势可视化,通过排序`time`列并绘制`obs_value`曲线即可观察青年不在劳动力人口的变化;亦可利用pivot_table构建国家×年份矩阵,便于跨国家比较或面板数据建模。此外,数据集中`sex`、`classif1`、`classif2`等分类变量支持按性别、年龄、教育水平进行分组或筛选,满足从简单统计到机器学习回归任务的多样化需求。
背景与挑战
背景概述
在全球劳动力市场研究中,非洲青年群体的劳动参与状况长期面临数据稀疏与碎片化的困境,制约了针对性的政策制定与学术分析。该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT发布,后经Electric Sheep Africa重新整理并发布于HuggingFace平台,聚焦于衡量非洲49个国家中15-29岁青年因性别、年龄及教育水平差异而‘脱离劳动力’的规模。数据集覆盖1982年至2025年的长时间序列,包含近2万条观测记录,为研究非洲青年失业、教育回报与劳动力市场结构性失衡提供了统一、跨国的量化基础,推动了对劳动力利用不足现象更细致的维度分析。
当前挑战
该数据集所解决的领域问题在于,传统的失业率指标未能充分刻画劳动力市场的隐性闲置,尤其是青年群体因教育参与、家庭责任或就业信心缺失而未进入劳动力市场的状况,亟需基于性别、年龄与教育分层的高分辨率数据以还原真实图景。在构建过程中,挑战主要源于多国劳动调查在定义与方法论上的差异,ILOSTAT虽采用国际劳工统计学家会议(ICLS)标准进行协调,但部分数据仍标注为‘不可靠’或存在方法论断裂,同时分类维度(如教育聚合级别)的非标准化录入增加了跨区域比较的复杂性。
常用场景
经典使用场景
该数据集深度聚焦于非洲地区青年劳动力市场中的隐性闲置群体——即因性别、年龄及教育背景差异而游离于劳动力市场之外的青年人群。基于国际劳工组织ILOSTAT的权威统计数据,它覆盖49个非洲国家自1982年至2025年的近两万条观测记录,为研究者提供了极为珍贵的、按性别与教育层次细分的时序面板数据。在经典建模场景中,研究者常借助该数据集开展青年劳动参与率的跨国比较分析、教育水平对就业抑制效应的回归估算,或是针对特定性别群体构建劳动力退出风险的预测模型。其高度结构化的分类变量使多维度分解成为可能,尤其适用于检验人力资本理论在非洲制度环境下的适用边界。
解决学术问题
该数据集的问世有效破解了非洲青年失业研究中长期存在的‘隐性闲置’测量难题。传统失业率统计往往忽视那些既不求职也不处于教育或培训状态的‘倦怠青年’,导致政策干预偏离真实痛点。此数据通过量化性别与教育维度下青年的劳动市场外溢规模,使学者能够精确识别哪些人群最容易陷入长期脱轨状态,并揭示教育扩张是否真正改善了女性的劳动参与困境。其深远意义在于,为验证‘技能错配假说’、‘性别歧视的劳动力市场传导机制’以及‘青年倦怠的代际循环效应’等学术命题提供了系统化的实证基础,从而推动发展经济学与劳动社会学在非洲语境下的深度融合。
衍生相关工作
围绕该数据集已涌现出一系列具有里程碑意义的延伸研究。有学者基于其观测值构建了‘青年劳动倦怠风险指数’,并利用机器学习方法预测北非地区因政治动荡导致的青年劳动参与断崖式下跌。另有一些工作将该数据与夜间灯光遥感数据、教育投入面板数据相结合,揭示了基础设施改善与青年就业率之间的非线性关联。在方法论层面,该数据集催生了针对高缺失率跨国面板数据的插值算法改进,以及适用于稀疏时序的中介效应模型扩展。更值得关注的是,国际劳工组织自身亦在利用该数据集校准其全球青年劳动力模型中的非洲参数,显著提升了对‘脆弱就业’指标的预测效度,从而反哺了ILO的旗舰报告《全球就业与社会展望》的学术权威性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务