遇见数据集

electricsheepeurope/europe-ilo-emp-2emp-sex-ocu-nb-employment-by-sex-and-occupation-ilo-modelled-esti

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别和职业划分的就业情况——国际劳工组织(ILO)建模估计,2025年11月(千计)| 欧洲(ILOSTAT),包含36,747个观测数据,覆盖39个欧洲国家,时间跨度为1991年至2025年,涵盖1个独特指标,即按性别和职业划分的就业情况。数据来源于国际劳工组织的ILOSTAT数据库,通过REST API获取,并经过欧洲国家代码过滤。数据集采用标准化模式,包括国家代码、指标代码、性别分类、年份和观测值等列,适用于表格分类、回归和时间序列预测任务。数据以cc-by-4.0许可证发布,由Electric Sheep Europe重新打包,便于机器学习应用。

The dataset is titled Employment by sex and occupation -- ILO modelled estimates, Nov. 2025 (thousands) | Europe (ILOSTAT) and contains 36,747 observations across 39 European countries, spanning from 1991 to 2025, covering 1 distinct indicator, which is Employment by sex and occupation. It is sourced from the ILOSTAT database of the International Labour Organization, retrieved via REST API and filtered to European country codes. The dataset follows a standardized schema including columns such as country code, indicator code, sex disaggregation, year, and observed value, and is suitable for tabular classification, regression, and time-series forecasting tasks. It is released under the cc-by-4.0 license and repackaged by Electric Sheep Europe for machine learning readiness.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-2emp-sex-ocu-nb-employment-by-sex-and-occupation-ilo-modelled-esti 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API直接提取了指标EMP_2EMP_SEX_OCU_NB的原始数据,并依据欧洲ISO3国家代码进行地理过滤。数据涵盖1991年至2025年间39个欧洲国家的36,747条观测记录,每条记录均包含就业人数(以千人为单位)及其按性别与职业类别的细分信息。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行协调与标准化处理,并在source.label字段中标注了数据来源,从而确保了跨国的可比性与可追溯性。最终,数据由Electric Sheep Europe团队重新打包为Parquet格式,并通过HuggingFace Datasets库发布,便于机器学习与时间序列分析任务直接调用。
特点
本数据集的核心特色在于其细粒度的多维分解结构,除了核心的就业人数观测值(obs_value)外,还提供了性别(sex)与职业分类(classif1)两个关键维度,其中性别包含总合、男性与女性三个类别,职业分类遵循ISCO-08标准。数据的时间跨度达35年,覆盖39个欧洲国家,且所有观测值均附带观测状态标志(obs_status)以指示数据是否经过调整,增强了数据的可信度与透明度。此外,每个地理单元对应945条记录,形成了均衡的年度面板数据结构,非常适合进行面板数据分析、纵向比较以及跨国就业趋势的时序建模。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,并将其转换为pandas DataFrame进行后续分析。典型操作包括按国家代码(ref_area)过滤特定国家的子集,或按指标(indicator)提取完整的就业时间序列,利用sort_values按年份排序后即可进行可视化或回归分析。对于需要构建国家-年份矩阵的场景,可通过pivot_table方法将数据重塑为以时间为行、国家为列的宽表格式,便于直接输入到机器学习模型或统计软件中进行面板数据回归。该数据集同时适用于表格分类、回归以及时间序列预测任务,为劳动经济学与欧洲就业市场研究提供了标准化的ML就绪数据源。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年11月发布,聚焦于欧洲39个国家1991至2025年间按性别与职业划分的就业人数(以千计),是ILOSTAT数据库的核心组成部分。作为全球劳动统计领域的权威来源,ILOSTAT通过整合各国劳动力调查、行政记录等多源数据,为研究者提供了衡量劳动力市场结构变迁的关键指标。该数据集被Electric Sheep Europe重新封装,以结构化的表格形式呈现,为时间序列预测、分类与回归任务提供了标准化资源,推动了就业领域计量经济学分析与机器学习研究的深入发展。
当前挑战
数据集面临的核心挑战在于弥合各国劳动统计体系间的异质性——不同国家在职业分类(如ISCO-08)、性别划分标准及调查方法上存在差异,ILO虽采用国际劳工统计学家会议(ICLS)定义进行协调,但原始数据的不可比性仍可能影响模型泛化能力。此外,数据集构建过程中需处理多种数据源(如劳动力调查与行政记录)的融合问题,部分观测值标记为‘调整后’或‘临时’,反映了插补与质量控制的复杂性。由于数据仅以年度频率发布,缺失月度或季度粒度,且少数国家在早期年份的覆盖不完整,给高精度时间序列建模带来额外限制。
常用场景
经典使用场景
该数据集的核心用途在于为欧洲劳动力市场研究提供结构化的、按性别和职业维度划分的就业时间序列数据。经典应用场景包括构建面板数据模型,以分析特定国家或整个欧洲区域在1991至2025年间就业结构的演变趋势,例如女性在高端职业中的参与率变化,或不同职业类别对经济周期的敏感度。研究者常借助该数据清洗后的格式(如Parquet)直接进行可视化分析、时间序列预测或构建分类与回归模型,以揭示职业分布与性别平等之间的动态关联。
衍生相关工作
基于该数据集衍生出的经典工作包括多种学术与实践产出。在方法层面,研究者已利用其建立了欧洲职业就业预测模型,结合机器学习算法预测未来五年不同性别群体的就业分布。在理论层面,产生了探讨职业性别隔离收敛性的面板数据分析论文,对比了东西欧国家间的差异。此外,政策导向的研究报告使用该数据量化了技术革新(如自动化)对不同职业岗位的就业替代效应,并评估了性别化职业结构的韧性与脆弱性。若干宏观经济分析则将该数据与国家GDP、教育支出等面板数据结合,构建了就业结构转型的驱动因素模型。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲39国1991至2025年间按性别与职业分层的就业率长时间序列分析,为劳动经济学、性别平等及职业结构性变迁研究提供了高颗粒度的时序数据支撑。当前前沿方向包括利用该数据训练多变量预测模型以探讨自动化和人工智能对职业构成的差异化冲击,以及结合宏观政策指标评估最低工资、性别配额法案对就业分布的调节效应。其跨年代、跨国别的覆盖特性,使研究者能够在ILO标准化方法论框架下,深入解析后疫情时代欧洲就业韧性、兼职与自雇形态演变,以及职业性别隔离的消长趋势,对实现联合国可持续发展目标中的体面劳动与性别平等具有关键的数据基准意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务