遇见数据集

electricsheepeurope/europe-ilo-eip-xplf-sex-edu-nb-potential-labour-force-by-sex-and-education-thousa

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的其他劳动力未充分利用指标数据,具体指标为按性别和教育程度划分的潜在劳动力(千人)(EIP_XPLF_SEX_EDU_NB)。数据集覆盖38个欧洲国家,时间跨度为1987年至2025年,共27,590个观测值。数据以表格形式组织,包括国家代码、指标代码、性别分类(总计、男性、女性)、教育程度分类、观测年份、观测值(单位:千人)以及数据质量标志(如不可靠、临时数据)等列。数据来源于劳动力调查等国家统计,经ILO根据国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集适用于表格分类、回归和时间序列预测等机器学习任务,由Electric Sheep Europe重新打包为ML就绪格式。

This dataset contains Other measures of labour underutilization data from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator Potential labour force by sex and education (thousands) (EIP_XPLF_SEX_EDU_NB). It covers 38 European countries from 1987 to 2025, with 27,590 observations. The data is tabular, including columns such as country code, indicator code, sex disaggregation (total, male, female), education classification, observation year, observed value (in thousands), and data quality flags (e.g., unreliable, provisional). Data is sourced from national labour force surveys and harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions. The dataset is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, and has been repackaged by Electric Sheep Europe into an ML-ready format.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-xplf-sex-edu-nb-potential-labour-force-by-sex-and-education-thousa 数据集图片
构建方式
本数据集构建于国际劳工组织(ILO)下属ILOSTAT统计数据库的官方REST API接口,通过调用特定指标代码EIP_XPLF_SEX_EDU_NB获取原始数据,并依据欧洲ISO3国家代码进行地域筛选。数据来源涵盖各国劳动力调查、家庭收入调查、机构调查及行政记录等多元渠道,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理,最终形成涵盖38个欧洲国家、跨越1987年至2025年的年度面板数据。
特点
数据集包含27,590条观测记录,聚焦于劳动力未充分利用的度量指标之一——按性别与教育程度划分的潜在劳动力数量(千人)。数据以性别(总、男、女)为维度进行详细分解,并提供来源标注与观测状态标识,便于数据质量评估。其时间跨度长达近四十年,覆盖广泛地理范围,且原始数据均经ILO统一标准化的最佳来源选择,确保了跨国家、跨时期数据的可比性与权威性。
使用方法
用户可通过HuggingFace Datasets库直接加载数据集,使用一行代码`load_dataset("electricsheepeurope/europe-ilo-eip-xplf-sex-edu-nb-potential-labour-force-by-sex-and-education-thousa")`即可获取训练集,并转换为Pandas DataFrame进行后续分析。典型应用场景包括按国家代码筛选特定国家的时间序列数据,按指标代码提取特定变量并绘制时序图,或通过数据透视表构建以年份为行、国家为列的矩阵结构,便于进行跨国家比较、面板回归分析或用于时间序列预测任务。
背景与挑战
背景概述
在全球劳动力市场日益复杂化的背景下,国际劳工组织(ILO)通过其ILOSTAT数据库系统收集并整合了覆盖200余个经济体的劳动力统计数据,为政策制定与学术研究提供了不可或缺的基础。该数据集由Electric Sheep Europe于2025年重新打包并发布,聚焦于欧洲38个国家自1987年至2025年间潜在的劳动力人口,具体按性别与教育水平进行划分,包含27,590条观测记录。其核心研究问题在于量化那些未被传统失业指标涵盖、但仍具有劳动参与意愿或潜力的群体,从而弥补劳动力利用不足测量的空白。作为ILOSTAT中‘其他劳动力利用不足指标’的重要组成,该数据集为劳动经济学、社会分层以及教育政策的效果评估提供了高分辨率的纵向数据支持,在区域比较和时序分析领域具有显著影响力。
当前挑战
该数据集面临的领域挑战在于如何精准定义并测量‘潜在劳动力’这一边缘群体,因为其介于就业、失业与非经济活动之间,传统失业率指标难以捕捉其动态特征。教育水平与性别的细分引入增加了维度的复杂性,不同国家在统计口径、调查方法以及教育分类标准上存在显著差异,给跨国比较带来障碍。在构建过程中,数据来源于各国劳动力调查及行政记录,ILO虽进行了一定程度的协调,但仍面临原始数据质量参差不齐、时间序列存在断裂与修订的问题。此外,数据集仅包含年度频率,而部分指标本应具备更细粒度的时间分辨率。如何确保多源数据的一致性、透明地标注质量声明与数据来源,并在保持标准化格式的同时不失原始信息的完整性,始终是数据处理与发布中的关键挑战。
常用场景
经典使用场景
该数据集收录了1987年至2025年间38个欧洲国家的潜在劳动力规模,按性别与教育层次进行细分,涵盖逾两万七千条观测记录,为研究欧洲劳动力市场的结构性特征提供了宝贵的时间序列数据。研究者可据此探究不同教育背景下的性别差异如何随时间演变,亦可构建回归模型,分析教育投入与潜在劳动力供给之间的关联,从而揭示人力资本在区域经济发展中的作用机制。
衍生相关工作
该数据集衍生了一系列围绕劳动力市场闲置测度的经典工作,例如利用时间序列聚类方法识别欧洲劳动力转型的阶段性特征,或是结合面板数据模型探讨教育扩张对性别就业差距的调节效应。部分研究以此为基准,对比不同国家在金融危机或疫情冲击下劳动力韧性表现的差异,从而推动了劳动力经济学中“非标准就业”与“边缘劳动力”概念的操作化与量化验证。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲潜在劳动力市场与教育结构的动态交互,在劳动经济学前沿研究中,它被广泛用于分析不同性别与教育水平人群的劳动力未充分利用模式,尤其是在后疫情时代就业复苏与技能错配的议题中。结合欧洲近年面临的人口老龄化、绿色转型与数字化浪潮,研究者利用该数据集探索教育投资如何缓冲结构性失业风险,例如北欧国家通过终身学习政策显著缩小性别差距的实证案例。其1987年至2025年的时间跨度,为捕捉经济周期波动与教育政策干预的长效影响提供了宝贵的时间序列证据,推动学界对劳动力市场韧性的量化评估,并助力ILO等国际机构制定包容性就业框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务