遇见数据集

electricsheepeurope/europe-ilo-emp-2emp-sex-eco-nb-employment-by-sex-and-economic-activity-ilo-modell

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于欧洲就业的表格型数据集,包含110,241个观测值,覆盖39个欧洲国家,时间跨度为1991年至2025年。核心指标为EMP_2EMP_SEX_ECO_NB,即按性别和经济活动划分的就业数据(国际劳工组织模型估计,2025年11月,单位:千)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳工统计的主要来源,整合了就业、失业、工资、工作时间、童工、非正规经济、社会保护、职业伤害和可持续发展目标体面工作指标等数据,基于国家劳动力调查、家庭收入调查、企业调查和行政记录。数据集通过ILOSTAT REST API获取,并过滤为欧洲国家代码。数据模式包括国家代码(ref_area)、国家名称(ref_area.label)、来源代码(source)、来源标签(source.label)、指标代码(indicator)、指标标签(indicator.label)、性别分类(sex)、性别标签(sex.label)、第一分类变量(classif1)、第一分类标签(classif1.label)、年份(time)、观测值(obs_value)、观测状态(obs_status)和观测状态标签(obs_status.label)。数据按年度频率提供,使用ILO选择的最佳来源,分类列仅在指标发布细分数据时非空。数据集由Electric Sheep Europe重新打包,以Parquet格式发布,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset is a tabular dataset on employment in Europe, containing 110,241 observations across 39 European countries from 1991 to 2025. The core indicator is EMP_2EMP_SEX_ECO_NB, which represents employment by sex and economic activity (ILO modelled estimates, November 2025, in thousands). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), a leading global source for labour statistics that compiles indicators on employment, unemployment, wages, working time, child labour, informal economy, social protection, occupational injuries, and SDG decent work targets, drawing on national labour force surveys, household income surveys, establishment surveys, and administrative records. The dataset is retrieved via the ILOSTAT REST API and filtered to European country codes. The schema includes country code (ref_area), country name (ref_area.label), source code (source), source label (source.label), indicator code (indicator), indicator label (indicator.label), sex disaggregation (sex), sex label (sex.label), first classification variable (classif1), first classification label (classif1.label), year (time), observed value (obs_value), observation status (obs_status), and observation status label (obs_status.label). Data is provided at annual frequency, using the ILO-selected best source, with disaggregation columns non-null only when the indicator publishes that breakdown. The dataset is repackaged by Electric Sheep Europe and published in Parquet format, suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-2emp-sex-eco-nb-employment-by-sex-and-economic-activity-ilo-modell 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT数据库,经Electric Sheep Europe团队精心重构与封装。构建过程直接通过ILOSTAT REST API(https://rplumber.ilo.org/data/indicator?id=EMP_2EMP_SEX_ECO_NB)提取指标“Employment by sex and economic activity”(EMP_2EMP_SEX_ECO_NB),并依据欧洲ISO3国家代码进行地理过滤。原始数据基于ILO对各国劳动力调查微观数据的统一化处理,遵循国际劳工统计学家会议(ICLS)定义,来源信息在“source.label”字段中予以标注,确保了数据的可追溯性与统计口径的一致性。最终整合为包含110,241条观测值、横跨39个欧洲国家、时间跨度为1991年至2025年的标准化数据集。
特点
该数据集独具特色,聚焦于欧洲地区按性别和经济活动划分的就业情况,涵盖“Total”、“Male”、“Female”三种性别分类,是时间序列分析与面板数据研究的理想素材。其观测频率为年度,每个国家均有2,835条记录,数据结构规整。数据集包含多个关键字段,如国家代码(ref_area)、指标代码(indicator)、性别(sex)、经济活动分类(classif1)、年份(time)及观测值(obs_value),并辅以观测状态标志(obs_status)用于数据质量标记。数据来源以ILO建模估计为主,由专业机构统一评估,确保了跨国家、跨年度的可比性与可靠性。
使用方法
用户可通过HuggingFace Datasets库轻松加载该数据集,使用`from datasets import load_dataset`命令后调用`load_dataset`函数即可获取训练集,并便捷地转换为Pandas DataFrame进行后续分析。针对具体研究需求,可依据国家代码(如“DEU”代表德国)进行过滤以聚焦单一国家的时序变化,或通过指标代码(如“EMP_2EMP_SEX_ECO_NB”)筛选特定就业指标。此外,支持将数据重塑为国家×年份的矩阵形式,便于进行横向比较与面板数据建模。数据集以Parquet格式封装,兼容主流机器学习与统计软件,极大降低了数据处理门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年11月发布,经Electric Sheep Europe重新整理后发布于HuggingFace平台,旨在提供欧洲39个国家自1991年至2025年间按性别和经济活动划分的就业数据。作为ILOSTAT这一全球劳动统计核心数据库的重要组成部分,该数据集以国际劳工统计学家会议(ICLS)定义为标准,通过对各国劳动力调查、家庭收支调查等原始微观数据进行统一协调与建模估计,形成了超过11万条观测记录。其核心研究问题聚焦于揭示欧洲地区就业结构的长期演变趋势,为跨国比较、政策评估及劳动力市场动态分析提供了标准化的量化基础,对劳动经济学、人口统计学及可持续发展目标(SDGs)中体面工作指标的监测具有重要支撑作用。
当前挑战
该数据集首先需应对劳动统计领域长期存在的跨国可比性难题,不同国家在调查方法、行业分类标准及性别定义上的差异导致原始数据难以直接整合,ILO通过建模估计进行协调,但模型本身对异常值及结构性断点的敏感度可能影响估计精度。在构建过程中,面临多源数据融合时的最优来源选择困境,虽采用“最佳来源”原则,但不同来源间的统计口径与抽样误差仍构成潜在偏差。此外,数据年度频率限制了捕捉季度性或月度波动的能力,对短期劳动市场冲击的刻画存在滞后性,而性别与经济活动交叉分组的细粒度化虽增强了分析维度,却也加剧了稀疏数据单元的处理复杂度。
常用场景
经典使用场景
作为横跨1991至2025年间、覆盖39个欧洲国家的就业结构化时间序列表征,此数据集在宏观经济建模与劳动市场分析中被广泛运用。研究人员常将其作为面板数据源,用以探究性别与经济活动类型对就业人数分布的影响。通过sex与classif1等分组维度,研究者能够进行多维度的描述性统计与可视化分析,揭示不同欧洲国家在特定经济部门中的就业演变轨迹。该数据集因经国际劳工组织标准化建模处理,具有跨年度、跨国别的可比性,适合用于构建线性回归、固定效应模型或时序聚类等经典计量框架,为理解欧洲劳动市场的长期结构性变化提供了可靠基础。
衍生相关工作
基于该数据集的结构化与时序特性,衍生出一系列高质量的研究工作。表征学习方面,研究者利用其构建了欧洲就业时序的预测模型,例如基于LSTM与Transformer的深度学习框架,成功预测了不同性别组别在未来经济周期中的就业波动。在计量经济学方向,该数据驱动了关于经济增长与就业弹性之间关系的格兰杰因果检验以及动态面板估计模型,产出了多篇探讨‘无就业增长’悖论的论文。此外,数据质量评估领域出现了针对ILO建模估计与各国直接调查数据之间差异的校验性研究,这些成果进一步验证了该数据集作为劳动统计领域黄金标准参考的权威与可靠性。
数据集最近研究
最新研究方向
在劳动经济学与人工智能交叉的前沿领域,该数据集驱动着欧洲就业结构的精细化解构研究。当前热点聚焦于利用ILO建模估算的性别与经济活动细分数据,结合时序预测模型,揭示1991至2025年间欧洲39国劳动力市场的动态演变规律与代际变迁特征。研究者通过高维面板数据分析,量化数字化与绿色转型对不同性别及产业就业弹性的异质性冲击,为欧盟“Fit for 55”气候政策及后疫情时代劳动力韧性评估提供实证基础。该数据源作为ILOSTAT标准化统计的重要延伸,填补了跨国可比微观模拟数据的空白,有力支撑起兼顾公平与效率的算法治理框架构建,对推动体面劳动指标监测与社会保护政策精准化具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务