遇见数据集

electricsheepafrica/africa-ilo-eip-teip-sex-edu-mts-nb-persons-outside-the-labour-force-by-sex-education

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含非洲49个国家1982年至2025年期间按性别、教育程度和婚姻状况划分的非劳动力人口统计数据(单位:千人),共96,010条观测记录。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖唯一指标EIP_TEIP_SEX_EDU_MTS_NB。数据集提供结构化表格,包括国家代码、数据源、指标代码、性别分类(总计、男性、女性)、教育程度分类、婚姻状况分类、观测年份、观测值及数据状态标记等字段。数据经过ILO基于国际劳工统计学家会议(ICLS)定义的标准化处理,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains demographic statistics on the non-labor force population (unit: thousands) categorized by gender, education level and marital status, covering 49 African countries from 1982 to 2025, with a total of 96,010 observations. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), covering the unique indicator EIP_TEIP_SEX_EDU_MTS_NB. The dataset provides structured tables including fields such as country code, data source, indicator code, gender classification (total, male, female), education level classification, marital status classification, observation year, observed value and data status marker. The data has undergone standardized processing by the ILO based on the definitions of the International Conference of Labour Statisticians (ICLS), and is suitable for machine learning tasks such as table classification, regression and time series forecasting.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-teip-sex-edu-mts-nb-persons-outside-the-labour-force-by-sex-education 数据集图片
构建方式
该数据集由Electric Sheep Africa基于国际劳工组织(ILO)的ILOSTAT数据库重新整理而成。研究人员通过ILOSTAT的REST API直接获取原始指标数据,该指标编码为EIP_TEIP_SEX_EDU_MTS_NB,代表按性别、教育程度和婚姻状况划分的劳动力市场之外的人口数量(单位:千人)。随后,数据被筛选至非洲地区的49个ISO3国家代码,涵盖1982年至2025年的年度观测值,共计96,010条记录。ILOSTAT本身通过整合各国劳动力调查、家庭收入调查及行政记录等多元来源,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理,源数据在source.label列中得以标注,确保了数据的可追溯性与一致性。最终,数据集以Parquet格式发布,便于机器学习和时间序列分析任务的直接调用。
特点
本数据集的核心特色在于其高度结构化的多维分类体系与广泛的时空覆盖能力。它提供了按性别(总、男、女)、教育水平及婚姻状况三个维度进行细粒度拆解的非劳动力人口统计量,有助于研究者深入分析非洲地区劳动力市场的结构性特征。数据覆盖49个非洲国家,时间跨度长达44年,为纵向比较与趋势预测提供了坚实的数据基础。此外,数据集包含了详尽的元数据列,如观测值状态标记(obs_status)、数据来源说明及分类备注(note_classif等),有助于用户识别潜在的数据质量问题或方法学变更,从而在分析中做出审慎判断。数据采用CC-BY 4.0许可协议,兼顾了开放共享与原始数据来源的版权归属。
使用方法
该数据集可直接通过HuggingFace Datasets库便捷加载,用户只需调用load_dataset函数即可快速获取数据并转换为Pandas DataFrame,极大降低了数据获取与预处理的门槛。用户可按国家代码(ref_area)进行筛选,聚焦于特定非洲国家的非劳动力人口分布;亦可针对单一指标进行时间序列分析,通过排序obs_value字段并绘制时序图来观察变化趋势。对于需要跨国家比较的研究,可利用pivot_table功能将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析或实现机器学习模型输入。数据集默认采用年度频率,且ILO已基于“最佳来源”原则为每个国家-年份组合筛选了最优数据,用户可直接使用无需额外清洗,适合经济学、社会学及公共政策领域的量化研究。
背景与挑战
背景概述
在劳动经济学与可持续发展目标(SDGs)监测领域,准确衡量劳动力市场闲置程度是评估经济活力与社会福祉的关键。国际劳工组织(ILO)长期致力于构建全球统一的劳动统计框架,其ILOSTAT数据库作为权威数据源,为政策制定与学术研究提供了坚实支撑。africa-ilo-eip-teip-sex-edu-mts-nb-persons-outside-the-labour-force-by-sex-education数据集正是基于此背景,由ILO于2025年发布,并由Electric Sheep Africa重新打包整合。该数据集聚焦于非洲地区不在劳动力队伍中的人群,涵盖49个非洲国家、1982年至2025年间共计96,010条观测记录,核心指标为按性别、教育程度和婚姻状况划分的劳动力之外人数(千人)。其发布解决了非洲大陆长期缺乏精细化、标准化劳动参与数据的困境,为研究性别差异、教育回报及婚姻状态对劳动决策的复合影响提供了独特视角,对推动非洲区域劳动力市场分析、社会政策评估及可持续发展目标(特别是目标8:体面工作和经济增长)的跟踪监测产生了深远影响。
当前挑战
该数据集所应对的领域挑战主要源于劳动力市场边缘人群的测量复杂性:传统失业率指标往往低估了劳动市场的真实闲置程度,而‘不在劳动力队伍中’的人群(如隐性失业者、丧失信心的求职者)是衡量劳动力未充分利用的关键组成。数据集构建过程中面临多重困难:首先,非洲各国劳动调查在问卷设计、抽样框架、数据收集频率与质量控制上存在显著差异,ILOSTAT需利用国际劳工统计学家会议(ICLS)定义进行复杂的跨国家数据协调与标准化处理。其次,数据集包含按性别、教育程度、婚姻状况的交叉分类,导致数据稀疏性问题,许多国家在某些细分维度上观测值有限。此外,数据来源标注存在多种状态标志(如'U'表示不可靠),部分序列因方法论修订而产生断点,需通过注释列记录异常,为时间序列分析引入了不确定性。最后,年度观测频率与部分国家存在的数据缺口,使得长期趋势建模与预测面临挑战。
常用场景
经典使用场景
该数据集涵盖了1982年至2025年间49个非洲国家约96,010条观测记录,核心指标为按性别、教育程度和婚姻状况划分的劳动力市场外人群数量(千人)。经典使用场景聚焦于劳动经济学中的劳动力闲置测度,研究者可借助该数据构建面板回归模型,分析非洲各国非劳动力人群的长期演变趋势,或利用时间序列预测方法推演未来劳动力供给结构的变化轨迹。数据按性别和教育程度分层的特性,使其成为研究性别差异与人力资本积累对劳动力退出行为影响的理想素材。
实际应用
在实际应用层面,该数据集为非洲各国政府及国际发展机构的劳动力政策制定提供了量化依据。劳动部门可利用其监测非劳动力人群的规模与构成,评估就业促进政策对特定群体(如低教育未婚女性)的覆盖效果。世界银行等组织可基于数据中的人口特征分层信息,优化职业技能培训项目的目标定位,减少因信息错配导致的资源浪费。此外,该数据还可用于构建劳动力市场的早期预警系统,通过追踪非劳动力人群的阶段性变化,提前预判结构性失业风险。
衍生相关工作
该数据集衍生出多个重要的学术与数据基础设施工作。ILO基于此构建了ILOSTAT劳动力闲置测算框架,成为全球劳动统计的基准参照体系。Electric Sheep Africa团队将其重封装为机器学习就绪格式,推动了非洲劳动经济数据的可复现分析范式。在应用层面,已有研究者以此为基础,发展出面向非洲国家的劳动力市场状态转移概率模型,并衍生出按教育层次和性别分层的劳动参与率预测方法,服务于联合国可持续发展目标8(体面工作)的进展评估。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务