遇见数据集

electricsheepeurope/europe-ilo-emp-temp-sex-ind-cbr-nb-employment-by-ilo-sector-and-sex-and-place-of-birt

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含33,065个观测值,涵盖13个欧洲国家从2008年至2025年的就业数据。核心指标为EMP_TEMP_SEX_IND_CBR_NB,即按国际劳工组织(ILO)部门、性别和出生地划分的就业人数(以千计)。数据来源于ILO的ILOSTAT数据库,通过官方API获取,并经过欧洲国家代码筛选。数据集包含详细的列结构,如国家代码、数据来源、指标代码、性别分类、时间年份、观测值及数据状态标志等,支持按国家、时间或指标进行数据过滤和分析。数据为年度频率,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Europe重新打包,采用cc-by-4.0许可,旨在提供机器学习就绪的欧洲统一数据层。

This dataset comprises 33,065 observations, covering employment data across 13 European countries spanning 2008 to 2025. The core indicator is EMP_TEMP_SEX_IND_CBR_NB, which denotes the number of employed persons (in thousands) classified by International Labour Organization (ILO) sector, gender, and place of birth. The data is sourced from the ILOSTAT database of the ILO, retrieved via its official API, and filtered using European country codes. The dataset includes a detailed column structure, encompassing country code, data source, indicator code, gender classification, time year, observed values, and data status flags, enabling data filtering and analysis by country, time period, or indicator. The data has an annual frequency, and is suitable for tasks such as tabular classification, regression, and time series forecasting. This dataset was repackaged by Electric Sheep Europe, licensed under CC-BY-4.0, and aims to provide a machine-learning-ready unified European data layer.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-temp-sex-ind-cbr-nb-employment-by-ilo-sector-and-sex-and-place-of-birt 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API直接获取标识符为EMP_TEMP_SEX_IND_CBR_NB的原始数据,并基于欧洲ISO3国家代码进行地理过滤而构建。数据经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调处理,原始调查微观数据来源于各国劳动力调查、家庭收入调查及行政记录等渠道,并在source.label列中明确标注数据来源以保障可追溯性。最终由Electric Sheep Europe团队重新打包为Parquet格式,形成包含33,065条观测记录的机器学习就绪数据集。
特点
该数据集涵盖2008年至2025年间13个欧洲国家的就业统计数据,核心指标为按ILO产业部门、性别及出生地划分的就业人数(千单位)。数据呈现多维度的分类粒度,包含性别(总、男、女)、ILO产业类别及出生地等分类变量,同时提供观测值状态标志与注释信息以标识数据质量(如临时数据、方法修订导致的中断序列)。时间维度为年度频率,且当同一国家年份存在多个来源时,仅采纳ILO选定的“最佳来源”,确保了数据的一致性与权威性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据集,并转换为Pandas DataFrame进行后续分析。典型应用场景包括按国家过滤数据以开展国别研究,对特定指标进行时间序列可视化分析,或利用pivot_table方法构建国家×年份的观测值矩阵,便于横向比较欧洲各国在不同产业、性别及出生地维度下的就业结构演变趋势。数据集以cc-by-4.0许可协议发布,使用时需同时引用ILO原始数据来源及Electric Sheep Europe的重新打包版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)发布,经由Electric Sheep Europe于2025年重新封装,聚焦欧洲13个国家2008至2025年间按ILO行业、性别及出生地划分的就业数据(单位:千人次)。作为ILOSTAT数据库的核心组成部分,该数据集依托国际劳工统计学家会议(ICLS)定义,整合了劳动力调查、行政记录等多源微观数据,旨在通过标准化指标揭示欧洲就业结构的动态演变。其研究价值在于为劳动经济学、人口迁移与劳动力市场融合等议题提供高粒度的时间序列证据,尤其支撑联合国可持续发展目标中体面工作相关指标的监测。数据集涵盖33065条观测记录,通过性别、行业分类和出生地三重维度解构就业形态,为跨国家、跨时期的比较分析奠定了坚实基础。
当前挑战
首先,该数据集需克服多源异构数据的整合难题,ILO需协调各国劳动力调查在调查频率、抽样方法和统计口径上的差异,确保时间序列的一致性和可比性。其次,数据标注与质量标识面临挑战,如观测值中存在的'不可靠'(unreliable)状态及方法论修订导致的序列断裂(break in series),要求分析者在建模前进行精细的数据清洗与状态筛选。此外,数据仅提供年度频率,未纳入季度或月度高分辨率指标,限制了短期经济波动与政策冲击的即时捕捉能力。而不同国家间的数据覆盖时长不均衡(如西班牙仅2011年数据),进一步加剧了面板数据的不平衡性,对多国比较的统计推断提出严苛要求。
常用场景
经典使用场景
该数据集汇集了国际劳工组织ILOSTAT数据库中欧洲13国2008至2025年间按ILO产业部门、性别及出生地划分的就业人数数据,共计33065条观测值。经典使用场景聚焦于劳动经济学中的面板数据分析,研究人员可借助该数据集构建国家—年份多维面板,剖析欧洲各国就业结构的时空演变规律。分类维度涵盖性别(男性、女性、总计)、产业类别以及出生地等关键变量,为探讨移民劳动力融入本土就业市场、性别就业差异的产业分布特征等议题提供了精细的数据支撑。同时,因其时间跨度涵盖金融危机、新冠疫情及后疫情复苏期,该数据亦适用于评估重大经济冲击对就业格局的异质性影响。
衍生相关工作
围绕该数据集的特性,一系列衍生研究得以展开。经典工作包括基于时间序列分解方法对各欧洲国家就业周期的波动性进行测度,识别共同周期成分与国家特异成分的相对贡献。另有学者利用该数据构建多层混合效应模型,将个体层面的性别与出生地特征与宏观层面的国家—年份因素相结合,剖析就业概率的微观决定机制。在机器学习领域,此数据集常被用于时序预测模型的验证基准,如长短期记忆网络与Transformer架构在就业预测任务上的性能比较。此外,结合产业分类变量进行的就业结构转型分析,也催生了关于欧洲去工业化与服务业扩张如何重塑劳动力需求的系统性探讨。
数据集最近研究
最新研究方向
当前,随着欧洲劳动力市场在后疫情时代、地缘政治冲突与数字化转型交织的复杂背景下加速重构,该数据集为探究就业结构在性别、行业与移民背景多维交叉下的动态演变提供了关键数据支撑。研究前沿聚焦于利用时序分析与分类回归模型,揭示不同经济周期中女性、移民群体在服务业与工业部门间的就业韧性差异,并为评估ILO体面劳动目标(SDG 8)在欧洲各国的实现进度提供实证依据。此外,数据中附带的元数据注解(如方法修订与数据质量标记)亦为提升跨国劳动统计可比性与机器学习训练数据的可信度设立了新的标杆,对推动欧洲劳动经济学与公平就业政策研究具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务