遇见数据集

electricsheepeurope/europe-ilo-emp-xtru-sex-edu-geo-nb-time-related-underemployment-by-sex-education-and

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲34个国家从1998年至2025年的时间相关不充分就业数据,共有25,591个观察值,涵盖1个独特指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主题为按性别、教育水平和城乡地区细分的时间相关不充分就业(以千人为单位)。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类、教育分类、地区分类、观察年份、观察值、观察状态和相关注释。数据以年度频率发布,经过ILO的标准化处理,确保一致性和可追溯性。数据集适用于表格分类、表格回归和时间序列预测等任务,旨在支持劳动市场研究和机器学习应用。

This dataset contains 25,591 observations of time-related underemployment data across 34 Europe countries, spanning from 1998 to 2025, covering 1 distinct indicator. The data is sourced from ILOSTAT, the International Labour Organizations central statistics database, with the topic focusing on time-related underemployment by sex, education level, and rural/urban areas (in thousands). It includes detailed schema columns such as country code, country name, data source, indicator code, sex disaggregation, education classification, area classification, observation year, observed value, observation status, and related notes. The data is published at annual frequency, harmonized by ILO using International Conference of Labour Statisticians definitions for consistency and traceability. The dataset is suitable for tasks like tabular classification, tabular regression, and time-series forecasting, aimed at supporting labor market research and machine learning applications.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-xtru-sex-edu-geo-nb-time-related-underemployment-by-sex-education-and 数据集图片
构建方式
在全球劳动力市场监测与体面劳动评估领域,及时且可比的就业不足数据是政策研判的基石。该数据集由Electric Sheep Europe团队基于国际劳工组织统计数据库(ILOSTAT)的官方API接口进行系统性再包装。研究人员通过RESTful接口精准拉取指标代码为EMP_XTRU_SEX_EDU_GEO_NB的原始记录,并以ISO3国家代码为筛选条件,将地理范围限定于欧洲区域。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查微观数据进行标准化调和,数据来源在source.label列中留有可追溯标记,最终整理为包含25,591条观测值的结构化表格。
特点
该数据集的时间跨度自1998年延续至2025年,覆盖34个欧洲国家,能够支持长时段劳动力市场动态的纵向比较分析。其核心特征在于多维度的交叉分类体系:观测记录按照性别(总计、男性、女性)、教育程度以及城乡区域类型进行分层,同时包含来源机构、指标代码、观测状态标志及方法学注释等辅助字段。观测值以千人为计量单位,部分记录附有不稳定或临时性状态标记,为研究者识别数据质量差异提供了透明依据。数据集以表格形式组织,兼具时间序列与面板数据的双重属性。
使用方法
研究者可通过Hugging Face的datasets库以单行代码加载该数据集,并直接转换为Pandas数据框进行后续分析。典型操作包括按ref_area字段筛选特定国家(如df[df['ref_area'] == 'DEU']),或针对单一指标按时间排序以绘制趋势图。借助pivot_table函数,用户可将数据重塑为国家与年份的交叉矩阵,便于开展跨国比较或面板回归建模。该数据集适用于劳动经济学中的就业质量评估、教育回报异质性分析以及城乡劳动力市场分割等研究议题,亦可服务于时间序列预测与表格分类等机器学习任务。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,长期致力于全球劳动统计的标准化与传播。ILOSTAT作为其核心统计数据库,涵盖就业、失业、工资、工时及体面劳动等多项指标,数据源自各国劳动力调查与行政记录,经国际劳工统计学家会议(ICLS)定义协调后发布,具有高度的国际可比性。在此背景下,Electric Sheep Europe于2025年对ILOSTAT中欧洲区域的时间相关不充分就业数据进行了重新封装,构建了本数据集。该数据集覆盖34个欧洲国家、1998至2025年间共计25,591条观测记录,按性别、教育程度及城乡地域进行细分,为劳动经济学与区域就业政策研究提供了宝贵的微观面板数据。
当前挑战
时间相关不充分就业的测度本身即面临概念界定与跨国家可比性的挑战。不同国家劳动力调查中对“非自愿兼职”与“工时不足”的操作化定义存在差异,尽管ILOSTAT通过ICLS标准进行了协调,但各国问卷设计、抽样框及调查频率的不一致仍导致数据存在断点与缺失。此外,本数据集在构建过程中需处理多源异构数据,同一国家年份可能对应多个来源,需依据ILO“最佳来源”原则进行筛选;部分观测值标注为“不可靠”或“方法修订”,增加了数据清洗与建模的复杂性。城乡分类与教育维度的非标准化编码亦为后续分析带来整合困难。
常用场景
经典使用场景
在劳动经济学与就业统计研究中,剖析时间相关型不充分就业的性别差异、教育梯度与城乡分布,构成该数据集最为经典的应用情境。研究者惯常借助其面板结构,按性别、教育层级和地域类型进行交叉分组,考察不充分就业率的时序演化与跨国异质性,亦常用于构建国家×年份矩阵以开展均衡面板估计或差分趋势分析,从而揭示劳动力市场结构性扭曲的时空特征。
衍生相关工作
围绕该数据集,已衍生出一系列经典研究:劳动参与率的性别差距分解、教育错配与不充分就业的关联分析、城乡劳动力市场分割的跨国比较,以及基于时间序列的就业质量预测模型。部分工作将其与欧盟劳动力调查微观数据链接,开展多层次建模;亦有研究以其为基准,校验ILO与其他国际统计源的一致性。这些工作共同拓展了就业统计数据的学术价值与应用边界。
数据集最近研究
最新研究方向
在全球劳动力市场结构性转型与非标准就业形态扩张的宏观背景下,时间相关就业不足(time-related underemployment)作为衡量劳动力未充分利用程度的关键指标,日益成为劳动经济学与就业政策研究的焦点。该数据集覆盖34个欧洲国家、1998至2025年逾2.5万条观测记录,为刻画性别、教育层次与城乡区域交织下的就业不足异质性提供了高分辨率的面板基础。前沿研究依托此类ILOSTAT harmonised数据,结合贝叶斯时空模型与机器学习因果推断,探究教育错配、性别分工及城乡劳动力市场分割对工时不足的差异化驱动机制,并评估后疫情时代与数字经济转型期積極劳动力市场政策的缓释效应。该数据集亦为联合国可持续发展目标8(体面劳动)的监测与跨国比较提供了可复现的实证支撑,对理解欧洲一体化进程中劳动力市场韧性具有重要学术与政策意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务