遇见数据集

electricsheepafrica/africa-ilo-eip-teip-sex-edu-nb-persons-outside-the-labour-force-by-sex-and-educat

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个表格数据集,专注于非洲地区的劳动力统计,具体主题为“按性别和教育程度统计的非劳动力人口(以千计)”。数据集包含12,397个观测值,涵盖49个非洲国家,时间跨度为1982年至2025年。核心指标是“EIP_TEIP_SEX_EDU_NB”,即“其他劳动力未充分利用指标”中的“按性别和教育程度统计的非劳动力人口”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤到非洲国家。数据集结构包括多个列:国家代码(ref_area)、国家名称(ref_area.label)、数据来源代码和标签(source和source.label)、指标代码和标签(indicator和indicator.label)、性别分类(sex和sex.label)、教育分类(classif1和classif1.label)、年份(time)、观测值(obs_value)、观测状态(obs_status和obs_status.label)以及相关注释列。数据以年度频率发布,并提供了数据质量说明,如使用ILO选择的“最佳来源”和处理缺失值的方法。数据集可用于表格分类、回归和时间序列预测等任务,旨在为机器学习研究提供非洲劳动力市场的标准化数据。

This dataset is a tabular dataset focused on labor statistics in Africa, specifically on Persons outside the labour force by sex and education (thousands). It contains 12,397 observations across 49 African countries, spanning the years 1982 to 2025. The core indicator is EIP_TEIP_SEX_EDU_NB, which is part of the Other measures of labour underutilization category. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to African countries. The dataset schema includes columns such as country code (ref_area), country name (ref_area.label), source code and label (source and source.label), indicator code and label (indicator and indicator.label), sex disaggregation (sex and sex.label), education classification (classif1 and classif1.label), year (time), observed value (obs_value), observation status (obs_status and obs_status.label), and related note columns. Data is published at annual frequency, with quality notes on the use of ILO-selected best source and handling of missing values. It is suitable for tasks like tabular classification, regression, and time-series forecasting, providing standardized data for machine learning research on African labor markets.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-eip-teip-sex-edu-nb-persons-outside-the-labour-force-by-sex-and-educat 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API接口直接抽取指标代码为EIP_TEIP_SEX_EDU_NB的原始数据,并依据ICLS(国际劳工统计学家会议)定义对调查微观数据进行统一协调与清洗。在抽取过程中,数据被严格限定至非洲49个国家的ISO3国家代码范围,并经由Electric Sheep Africa团队重新封装为结构化的Parquet格式,便于机器学习流水线直接调用。数据集共收录12,397条观测记录,时间跨度从1982年至2025年,覆盖了非洲大陆主要经济体的劳动参与外人群统计。
特点
数据集以非洲区域劳动市场边缘群体为核心观测对象,聚焦于‘按性别与教育程度划分的劳动力外人群数量(千人)’这一单一指标,提供了性别(总、男、女)与教育层级的精细交叉分解。每条记录包含详尽的元数据标注,如数据来源追踪(source.label)、观测状态标志(obs_status)以及系列断裂或方法修订等注释信息(note_indicator.label),保障了数据的可溯源性与质量透明度。数据集时间序列覆盖长达44年,空间上涵盖49个非洲国家,为面板数据分析与跨区域比较提供了坚实的纵向与横向基础。
使用方法
用户可通过HuggingFace datasets库中的load_dataset()函数一键加载该数据集,返回的PyTorch或TensorFlow兼容对象可直接转换为Pandas DataFrame进行后续分析。针对时间序列建模,可依据‘ref_area’字段筛选特定国家子集,利用‘time’与‘obs_value’列开展趋势预测与季节性分析。若需进行跨国家矩阵式比较,可通过pivot_table操作以年份为行、国家代码为列重塑数据,生成规整的面板结构。数据集简洁的列式模式与标准化的编码设计,使得从探索性数据分析到监督学习任务的过渡极为顺畅。
背景与挑战
背景概述
在劳动经济学与社会政策研究领域,劳动力市场边缘群体——特别是那些处于劳动力市场之外的人群——的量化分析长期面临数据稀疏与标准不一的双重困境。由国际劳工组织(ILO)统计部维护的ILOSTAT数据库,作为全球劳动统计的权威来源,涵盖了200多个经济体的就业、失业、工资及劳动力利用不足等核心指标。该数据集由Electric Sheep Africa于2025年重新整理并发布,聚焦非洲49个国家从1982年至2025年的‘因性别与教育程度划分的劳动力市场外人口’这一特定指标,共计12,397条观测记录。核心研究问题在于揭示非洲地区不同性别与教育背景群体在劳动力参与中的结构性差异,从而为劳动力剩余评估、就业政策制定及可持续发展目标(SDGs)中体面劳动指标的监测提供数据支撑。这一数据集的发布,显著增强了非洲区域劳动统计的精细度与可获取性,对推动非洲劳动力市场研究与国际比较分析具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于:传统劳动力统计多聚焦于就业与失业的二元区分,却忽视了因教育壁垒、性别歧视或社会规范而被排斥在劳动力市场之外的庞大群体,导致‘劳动力利用不足’这一多维现象的量化盲区。非洲地区尤为突出,因调查覆盖不全、定义差异及数据缺失,难以捕捉教育程度与性别交织下的边缘化模式。在构建过程中,数据面临多重挑战:原始数据源自各国各类家庭调查与行政记录,需经ILO依据国际劳动统计学家会议(ICLS)定义进行标准化处理,处理中涉及来源多元性、年份断裂及方法修订带来的序列不一致性(如‘break in series’与‘nonstandard education level’标签所反映的问题)。此外,数据标注的质量标志(如‘不可靠’与‘临时值’)要求使用者在分析时审慎处理,以平衡数据广度与精度的权衡。
常用场景
经典使用场景
该数据集为非洲劳动力市场研究提供了超过1.2万条观测记录,覆盖49个国家跨越1982至2025年间的长期时序数据。经典使用场景包括运用时间序列分析或面板数据模型,探究非洲各国失业人群之外的劳动力闲置规模,结合性别与教育程度的分层维度,深入刻画劳动力市场边缘群体的结构特征。研究者常以此构建预测模型,评估政策干预对劳动力参与率的动态影响,或作为基准数据集验证区域劳动力流动与教育回报率之间的因果关系。
实际应用
在实际应用层面,该数据集被广泛用于国际发展机构及非洲国家政府的经济政策制定,例如通过追踪不同性别和教育背景人群脱离劳动市场的趋势,辅助设计更具包容性的就业促进计划。非政府组织和研究咨询机构可借助这些数据评估培训项目对女性或低学历人群重返劳动力市场的实效。同时,该数据集也支持构建数据驱动的社会预警系统,帮助识别特定区域或群体面临的结构性失业风险,从而指导资源投放与社会保障政策的优化。
衍生相关工作
该数据集衍生的经典工作包括基于ILOSTAT框架的劳动力市场不充分就业指标比较研究,其中不少学者将此数据与非洲其他经济指标(如GDP增长率、贫困率)联合分析,提出了针对劳动力闲置的新分类方法。后续工作还涉及运用机器学习模型预测未来五年内特定国家按性别与教育分层的人口退出劳动市场概率,这些模型常作为非洲劳动力供需预测系统的核心组件。此外,该数据集的标准化格式启发了其他区域劳动力数据的重新打包与发布,推动了非洲大陆范围内可比较劳动力统计数据库的建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务