遇见数据集

electricsheepeurope/europe-ilo-emp-2emp-sex-ste-nb-employment-by-sex-and-status-in-employment-ilo-mod

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲39个国家从1991年至2025年的32,664个观测值,覆盖一个核心指标:按性别和就业状况划分的就业人数(国际劳工组织模型估算,单位:千)。数据来源于国际劳工组织的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家代码。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类、时间年份、观测值等列,适用于表格分类、回归和时间序列预测等任务。数据已由Electric Sheep Europe重新打包,以支持机器学习应用。

This dataset contains 32,664 observations from 39 European countries spanning the period from 1991 to 2025. Its core indicator is the number of employed persons (estimated by the International Labour Organization model, unit: thousand), disaggregated by gender and employment status. The data is sourced from the International Labour Organization's ILOSTAT database, obtained via REST API and filtered to retain only European country codes. The dataset includes columns such as country code, country name, data source, indicator code, gender category, year, and observed values. It is applicable for tasks including tabular classification, regression, and time series forecasting. The dataset has been repackaged by Electric Sheep Europe to support machine learning applications.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-2emp-sex-ste-nb-employment-by-sex-and-status-in-employment-ilo-mod 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据平台ILOSTAT,通过REST API直接提取原始指标代码为EMP_2EMP_SEX_STE_NB的就业数据,并依据ISO 3166-1 alpha-3编码筛选出39个欧洲国家的观测值。数据经ILO统计部门采用国际劳工统计学家会议(ICLS)定义进行统一化处理,来源信息在source.label列中清晰标注以确保可追溯性。Electric Sheep Europe团队进一步完成格式标准化、打包为Parquet文件并发布至HuggingFace平台,使其可直接通过load_dataset()调用,实现了从原始统计到机器学习就绪数据的高效转化。
特点
数据集包含32,664条观测记录,时间跨度覆盖1991年至2025年,涵盖就业总量指标。其核心特点在于多维度的解构能力:性别维度(总、男性、女性)与就业身份类别(如总合计)的交叉组合为劳动力结构分析提供了精细视角。每条记录均包含完整的时间、国家、指标值及观测状态标签,数据质量标识清晰(如调整值、临估值)。此外,数据集忠实保留ILO评定的最佳来源选择逻辑,对同一国家年度存在多源数据时仅采用优选来源,确保了分析基础的一致性与可靠性。
使用方法
研究人员可通过HuggingFace datasets库以load_dataset方法一键加载数据,并转换为Pandas DataFrame进行后续操作。典型应用模式包括:按国家代码过滤获得单一国家的就业趋势;针对特定指标按年份排序生成时间序列并可视化;以及利用数据透视表构建国家-年份矩阵,便于进行面板数据分析或跨国比较。该数据集适用于时间序列预测、分类与回归等机器学习任务,其规整的表格结构也兼容统计建模软件的直接导入,降低了劳动经济学实证研究的数据预处理门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Europe重包装后发布于HuggingFace平台,聚焦于欧洲地区按性别与就业身份划分的就业人口估算数据。核心研究问题在于通过ILO的模型估计方法,提供1991年至2025年间39个欧洲国家就业状况的标准化、可比化时间序列数据。作为ILOSTAT数据库的重要组成部分,该数据集填补了跨国劳动力统计中细致度与一致性的缺口,为劳动经济学、社会政策评估及可持续发展目标(SDG)的监测提供了可靠基准,显著推动了欧洲区域就业结构研究的实证基础。
当前挑战
该数据集面临的核心挑战包括:1)领域问题方面,需处理跨国就业统计中因定义分歧(如ICLS标准对“就业身份”的分类差异)、数据源多样性(劳动力调查、行政记录等)以及时间序列中估算值波动带来的可比性与可靠性难题;2)构建过程中,须解决ILO模型估计对原始调查微数据的协调统一、多源数据冲突时的“最佳来源”筛选策略、以及按性别与就业身份细分时出现的稀疏化与缺失值问题,同时确保年度观测频率下对历史与预测指标的稳定性建模。
常用场景
经典使用场景
在欧洲劳动经济学研究中,该数据集提供了跨越39个欧洲国家、覆盖1991年至2025年间的就业人数与就业身份结构数据,成为分析长期就业趋势与劳动力市场性别差异的核心数据来源。研究者可借助其中的性别与就业身份分类(如受雇者与自雇者),构建时间序列模型,追踪欧洲各国就业形态的演变轨迹,或通过截面比较,揭示不同国家制度背景下就业结构的异同。数据的高频率年度观测与标准化ILO指标,使得研究者能够便捷地开展跨国面板回归分析,探讨经济增长、政策变革与就业模式之间的关系。
解决学术问题
该数据集有效弥补了欧洲范围内长期、跨国的就业身份统计缺口,解决了以往研究中国别数据口径不一、时间跨度短等难题。学者得以借助其在性别维度上的细致分类,深入探讨女性就业参与率、就业身份选择(如自雇与受薪就业)的演进规律及其背后的社会经济动因。基于此数据,研究者可量化全球化、技术变革与劳动力市场制度变迁对就业结构的冲击,并评估不同国家福利体制与劳动合同法规对就业质量的调节作用,为劳动经济学、性别经济学与比较政治经济学提供实证支撑。
衍生相关工作
该数据集衍生出多项颇具影响力的研究脉络。在时间序列预测领域,研究者已基于其长时间序列数据建立ARIMA、状态空间模型与神经网络模型,用于预测欧洲各国未来就业总量与性别就业差距的演变。在分类与回归任务中,数据集被用于训练用于就业身份识别与性别就业差异解释的机器学习模型。此外,数据集的跨年际结构催生了关于欧洲就业弹性、自雇率与制度质量关系的一系列实证分析,成为近年比较劳动经济学研究的重要数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务