遇见数据集

electricsheepeurope/europe-ilo-emp-publ-sex-oc2-nb-public-sector-employment-by-sex-and-occupation-isc

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲12个国家从1993年至2025年的公共部门就业数据,按性别和职业(基于ISCO-08二级分类)进行统计,单位为千。数据集共有25,248个观测值,涵盖1个核心指标(EMP_PUBL_SEX_OC2_NB),数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过协调处理,以确保符合国际劳工统计标准。数据集采用表格格式,包含国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、职业分类、观测年份、观测值、数据状态标志等列,适用于表格分类、回归或时间序列预测等机器学习任务。数据覆盖国家包括阿尔巴尼亚、奥地利、波斯尼亚和黑塞哥维那、瑞士、法国、英国、希腊、马其顿、黑山、波兰、塞尔维亚、斯洛伐克,旨在为研究欧洲公共部门劳动力市场提供标准化、机器学习就绪的数据支持。

This dataset contains public sector employment data for 12 European countries from 1993 to 2025, disaggregated by sex and occupation (ISCO-08 level 2) in thousands. It includes 25,248 observations and covers one key indicator (EMP_PUBL_SEX_OC2_NB), sourced from the International Labour Organizations ILOSTAT database via API and harmonized using International Conference of Labour Statisticians definitions. The dataset is in tabular format with columns such as country code, country name, source, indicator code, sex classification (total, male, female), occupation classification, observation year, observed value, and data status flags, suitable for tabular classification, regression, or time-series forecasting tasks. It covers countries including Albania, Austria, Bosnia and Herzegovina, Switzerland, France, United Kingdom, Greece, North Macedonia, Montenegro, Poland, Serbia, and Slovakia, providing standardized, machine-learning-ready data for analyzing Europes public sector labor market.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-publ-sex-oc2-nb-public-sector-employment-by-sex-and-occupation-isc 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口获取原始数据,并依据ILO下属统计部门根据国际劳工统计学家会议(ICLS)的定义对微观调查数据进行统一协调处理。数据获取后,筛选出欧洲地区的ISO3国家代码进行地理范围限定,并经由Electric Sheep Europe团队重新打包整理,形成结构化的表格数据集。数据集中包含来自12个欧洲国家、时间跨度从1993年至2025年的共计25,248条观测记录,每条记录涵盖公共部门就业人数按性别与职业分类(ISCO二级)的详细信息。
特点
该数据集的核心特点在于其多维度颗粒度的结构化设计。数据不仅提供了按性别(总体、男性、女性)的细分维度,还包含了职业分类(ISCO-08二级)的详细信息,使得研究者能够深入挖掘公共部门劳动力市场的结构性特征。此外,数据集附带了详尽的元数据标注,包括数据来源、观测状态标志(如不可靠、临时性)以及序列中断等注释信息,为数据质量评估提供了透明依据。数据集的年度频率覆盖长达32年,支持纵向时间序列分析,并兼容表格分类、回归与时间序列预测等多种任务场景。
使用方法
研究者可借助HuggingFace的datasets库通过一行代码加载数据集,并将其转换为Pandas DataFrame格式以进行后续分析。典型的使用流程包括按国家代码筛选特定国家的子集、按时间排序以绘制特定指标的时间序列曲线,或利用透视表功能将数据重塑为国家×年份的矩阵形式,便于进行跨国比较或面板数据分析。数据集结构简洁规范,包含ref_area、sex、classif1、time与obs_value等关键字段,可直接适配统计建模与机器学习流程,无需额外的数据清洗工作。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Europe于2025年重新整理并发布在HuggingFace平台。它聚焦于欧洲12国1993至2025年间公共部门就业人数,按性别和职业(ISCO二级分类)进行细分,共计25,248条观测记录。核心研究问题在于揭示欧洲公共部门劳动力在性别与职业结构上的演变趋势,为劳动经济学、公共政策评估及社会学研究提供高精度数据支撑。作为ILOSTAT数据库的衍生品,该数据集继承了ILO在劳动统计领域的权威性,其标准化结构和时间跨度使其成为跨国比较和时间序列分析的重要资源,对理解欧洲劳动力市场转型具有显著影响力。
当前挑战
该数据集面临的挑战集中于领域问题与构建过程两个方面。在领域层面,它试图解析公共部门就业的性别与职业分布异质性,这要求数据能够捕捉不同国家在职业分类标准(如ISCO-08)实施中的细微差异,并应对因统计方法论修订(如数据质量标注中的“Break in series”)导致的序列不连续性。在构建过程中,面临的主要挑战包括:从ILOSTAT API拉取原始数据时需处理多源调查(如劳动力调查与行政记录)的整合,确保“最佳来源”选择的客观性;对于缺失的分级维度(如classif2)需进行标准化处理;以及需要协调12个国家在时间跨度、数据采集频率(年度为主)和可靠度标签(如“不可靠”)上的不一致性,从而生成一致且可复用的机器学习就绪格式。
常用场景
经典使用场景
作为国际劳工组织(ILO)官方统计数据库ILOSTAT的欧洲子集,该数据集汇集了12个欧洲国家长达三十余年的公共部门就业数据,涵盖性别、职业(ISCO-08二级分类)两大核心维度,共计25,248条观测记录。其经典使用场景聚焦于基于性别与职业交叉视角的公共部门劳动力结构分析,研究者可借助时间序列预测模型探究不同职业类别中女性与男性就业比例的演变趋势,亦可利用分类与回归方法识别影响公共部门就业的关键社会经济因子,为理解欧洲劳动力市场的结构性变迁提供坚实的数据基础。
衍生相关工作
围绕该数据集已催生出多项具有代表性的衍生研究,例如利用机器学习的梯度提升模型(GBM)预测公共部门就业变动趋势,或结合面板数据回归分析探讨财政紧缩政策对女性公共就业的异质性冲击。另有工作将其与欧洲性别平等指数(EIGE)、失业率等外部数据集进行融合,构建多源异构数据驱动的劳动力市场早期预警系统。这些研究不仅验证了数据集在时序预测与多变量联合分析中的稳健性,也为后续探索公共就业结构与宏观经济韧性之间的深层耦合关系铺平了道路。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲公共部门就业的性别与职业细分,通过国际劳工组织ILOSTAT的标准化统计框架,为分析劳动力市场中公共部门的性别平等、职业隔离及就业结构变迁提供了宝贵的时间序列资料。在全球日益关注公共部门改革与包容性增长的背景下,研究者可借此前沿数据,深入探讨不同国家在公共就业政策上的性别效应差异,并将其与当前热点的就业质量、职业流动性及数字化转型下公共岗位的重构趋势相关联,从而为跨区域劳动力政策评估与可持续发展目标中的体面工作指标提供实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务