遇见数据集

electricsheepeurope/europe-ilo-eip-xplf-sex-geo-nb-potential-labour-force-by-sex-and-rural-urban-area

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲36个国家从1987年至2025年的潜在劳动力数据,按性别和城乡地区划分(以千人为单位)。数据集共有6,665个观测值,涵盖1个主要指标(EIP_XPLF_SEX_GEO_NB),数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过重新打包为机器学习友好格式。数据集为表格型结构,包含国家代码、性别分类、年份、观测值和数据来源等列,适用于分类、回归和时间序列预测任务。

This dataset contains potential labor force data for 36 European countries spanning from 1987 to 2025, disaggregated by gender and urban-rural regions, with units in thousands. It comprises 6,665 observations and covers one primary indicator (EIP_XPLF_SEX_GEO_NB). The data is derived from the ILOSTAT database of the International Labour Organization (ILO), and has been repackaged into a machine learning-friendly format. It has a tabular structure, including columns such as country code, gender category, year, observed values and data source, and is suitable for classification, regression and time series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-xplf-sex-geo-nb-potential-labour-force-by-sex-and-rural-urban-area 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,聚焦于欧洲36国1987至2025年间潜在劳动力的性别与城乡分布情况。数据通过ILOSTAT REST API直接获取,原始指标代码为EIP_XPLF_SEX_GEO_NB,随后依据欧洲ISO3国家代码进行筛选与整合。ILOSTAT利用国际劳工统计学家会议(ICLS)定义对各国调查微观数据进行协调与标准化处理,并在source.label列中标注数据来源以确保可追溯性。Electric Sheep Europe团队进一步将这些数据重新打包为统一的Parquet格式,方便机器学习应用。
特点
该数据集包含6665条观测记录,覆盖36个欧洲国家,时间跨度近四十年,是研究劳动力未充分利用状况的重要资源。其核心指标为按性别和城乡地区划分的潜在劳动力人数(以千计),数据按年频率发布,并附有详细的分类维度如性别(总计、男性、女性)以及区域覆盖类型(全国性)。数据质量方面,当同一国家与年份存在多个来源时,采用ILO选定的最佳来源,同时通过obs_status与note_indicator等字段标注系列中断、方法论修订等状态信息,为研究者提供透明度。
使用方法
使用者可通过HuggingFace Datasets库快速加载数据,执行`load_dataset("electricsheepeurope/europe-ilo-eip-xplf-sex-geo-nb-potential-labour-force-by-sex-and-rural-urban-area")`即可获取训练集并转换为Pandas DataFrame进行分析。典型操作包括按国家代码筛选特定国家的时间序列数据,或按指标和时间聚合,构建国家×年份的透视矩阵,以观察劳动力潜在供给的时空演变趋势。该数据集适用于分类、回归及时间序列预测等任务,并遵循CC-BY-4.0许可协议,使用时需适当引用原始数据来源及Electric Sheep Europe的重新打包版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的统计数据库ILOSTAT创建,经Electric Sheep Europe于2025年重新整理后发布于HuggingFace平台。核心研究问题聚焦于欧洲地区潜在劳动力(即非就业但未充分参与劳动市场的群体)的规模与结构,通过性别与城乡区域两个维度进行细致刻画。数据集涵盖1987年至2025年间36个欧洲国家的6,665条观测值,为劳动力市场分析、政策评估及社会经济研究提供了关键的量化基础。其在劳动力统计领域的影响力显著,尤其服务于劳动利用不足的测量、性别平等研究以及城乡发展差异的分析,推动了欧洲层面劳动力数据的标准化与可获取性。
当前挑战
该数据集所解决的领域问题在于,传统失业率指标难以全面反映劳动力市场的闲置状况,潜在劳动力指标作为劳动利用不足的补充度量,能够捕捉到处于边缘或灰暗地带的非经济活动人口。数据构建过程中面临多重挑战:一是来自不同国家劳动力调查的原始数据需统一按照国际劳工统计学家会议(ICLS)定义进行协调与标准化,确保跨时跨国可比性;二是数据处理需处理年度频率数据与部分系列中断、方法论修订等标注信息(如obs_status列中的'B'类断点标记),保证用户能够识别并合理处理质量波动。此外,数据仅涵盖年度频次,而部分指标存在月度或季度数据,其缺失限制了更细粒度的时间序列分析。
常用场景
经典使用场景
在欧洲劳动力市场研究中,该数据集的核心用途在于量化不同性别与城乡区域的潜在劳动力规模。研究者通过分析1987至2025年间36个欧洲国家的观测数据,能够揭示潜在劳动力在性别与城乡维度上的分布特征与长期演化规律。经典场景包括构建时间序列模型以预测潜在劳动力供给变化,以及借助分类或回归任务识别影响潜在劳动力规模的关键社会经济因素,例如城乡差异与性别不平等对劳动力参与率的冲击效应。
解决学术问题
该数据集系统性地回应了劳动力市场研究中的核心难题——如何精确衡量未被充分就业统计覆盖的潜在劳动力群体。通过提供按性别和城乡区域细分的标准化时序数据,它解决了长期困扰学界的区域性数据碎片化与跨时期可比性不足的问题,从而赋能了对劳动力闲置现象、性别就业鸿沟及城乡劳动力流动机制的深入实证分析。其意义在于为国际劳工标准的本土化验证提供了可靠的数据基础,推动了劳动经济学、人口地理学及社会政策研究领域向更精细化的空时分析范式演进。
衍生相关工作
围绕此数据集,学界与业界已衍生出多项富有影响力的工作,包括基于该数据构建的欧洲劳动力市场面板数据库,以及融合其他社会人口变量的多源数据整合研究。典型代表如利用该数据验证城乡劳动力供需模型的数项论文,还有在此基础上开发的交互式可视化工具与跨国劳动力不平等指标体系。此外,该数据也常被用作训练预测欧洲特定区域就业趋势的机器学习模型的关键特征来源,以及作为评估不同统计口径下劳动力闲置测算方法一致性的基准测试平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务