遇见数据集

electricsheepeurope/europe-ilo-eip-xplf-sex-nb-potential-labour-force-by-sex-thousands

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲39个国家从1987年至2025年的按性别划分的潜在劳动力(千人)统计数据,共计2673条观察值,涵盖1个具体指标(EIP_XPLF_SEX_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Europe重新打包,旨在提供机器学习就绪的欧洲统一数据层。数据集包含国家代码、数据来源、指标、性别分类、年份、观测值等列,并提供了按性别(总计、男性、女性)的细分维度。数据为年度频率,经过ILO的统计定义和来源协调处理,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 2,673 observations of Potential labour force by sex (thousands) data across 39 Europe countries, spanning 1987–2025, covering 1 distinct indicator (EIP_XPLF_SEX_NB). The data is sourced from the International Labour Organizations ILOSTAT database and repackaged by Electric Sheep Europe to provide a unified, ML-ready data layer for Europe. It includes columns such as country code, data source, indicator, sex disaggregation, year, observed value, and more, with disaggregation by sex (total, male, female). The data is annual frequency, harmonized using ILO statistical definitions, and suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-xplf-sex-nb-potential-labour-force-by-sex-thousands 数据集图片
构建方式
该数据集由国际劳工组织(ILO)旗下的ILOSTAT数据库精心萃取而成,聚焦于欧洲地区潜在劳动力规模按性别划分的统计数据。构建过程中,数据通过ILOSTAT REST API直接获取,并依据国际劳工统计学家会议的统一定义对原始调查微观数据进行协调处理,随后精准筛选至39个欧洲国家的范围。数据来源清晰标注于`source.label`列,以确保可追溯性与透明度。最终,数据集由Electric Sheep Europe进行标准化重封装,以Parquet格式发布,便于机器学习与统计分析场景的便捷调用。
特点
该数据集包含2,673条观测记录,时间跨度覆盖1987年至2025年,空间维度涵盖39个欧洲国家,呈现出丰富的历史纵深与地域广度。核心指标为潜在劳动力规模(以千人为单位),并按性别进行细分,包含总计、男性和女性三类维度。数据结构严谨,包含国家代码、来源标签、观测值、观测状态及注释信息等多重字段,为分析劳动力利用不足状况提供了高质量、多角度的量化依据。数据遵循CC-BY-4.0许可协议,具备良好的开放性与可复用性。
使用方法
用户可通过HuggingFace的`datasets`库便捷加载此数据集,仅需调用`load_dataset`函数即可获取格式一致的训练集。加载后,可利用Pandas将数据转换为DataFrame格式,进而执行按国家筛选、按时间序列绘制趋势图、以及构建国家-年份透视矩阵等典型操作。例如,通过过滤`ref_area`列定位特定国家的数据,或按`indicator`列与`time`列排序以观察指标的历史演变。数据集设计充分考虑了时间序列预测与分类回归等下游任务的需求,为劳动经济学研究提供了即插即用的数据基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于近年创建,由Electric Sheep Europe于2025年重新打包并发布至HuggingFace平台。其核心研究问题聚焦于欧洲39个国家1987至2025年间“潜在劳动力人口”(按性别划分,单位千人)的时序观测,旨在揭示劳动力未充分利用的隐性维度。作为ILOSTAT中“其他劳动力未充分利用指标”的重要组成部分,该数据集为欧洲劳动力市场分析、性别差异研究及就业政策评估提供了标准化的跨国民间数据基础,对劳动经济学、公共政策与社会统计学领域具有显著的支撑价值,尤其在追踪非传统劳动力群体(如沮丧失业者、边际附着者)的规模演变方面贡献卓越。
当前挑战
当前数据集面临多重挑战。领域层面,其核心挑战在于精准量化“潜在劳动力”这一模糊概念——该群体既非失业又非非经济活动人口,各国调查定义与统计口径的差异(如国际劳工统计学家会议(ICLS)定义的适用性)常导致跨国可比性受损;同时,按性别细分的数据虽能揭示劳动参与的结构性不平等,却易受小样本脆弱性及年度频次过低所限,难以捕捉短期经济波动下的动态变化。构建过程中,该数据集需从ILOSTAT的REST API直接拉取原始数据,并强制限定于欧洲ISO3国家代码,面对多来源数据(如劳动力调查、行政记录)的一致性与标志修正(如“断点”标注),亦需在合并入库时处理时间序列断裂、源选择偏好等引发的质量风险,确保观测的可追溯性与稳健性。
常用场景
经典使用场景
在欧洲劳动力市场研究的宏观图景中,该数据集凭借其跨越39个国家、涵盖1987年至2025年近四十载的长期观测值,成为时间序列分析与面板数据回归的经典基石。研究者常借助其按性别分列的潜在劳动力规模数据,构建动态随机一般均衡模型或固定效应回归框架,以揭示欧洲各国劳动力未充分利用程度的演变轨迹与结构性差异。数据集中清晰的年度观测结构和标准化的ISO国家编码,使得跨国的纵向对比与周期波动分析变得流畅而严谨。
实际应用
在实际应用层面,该数据集为国际组织、国家统计局及政策智库提供了决策支持的可靠依据。欧盟委员会可凭借其中的性别细分数据,评估不同成员国在促进女性劳动参与方面的政策成效,并识别出需要重点干预的弱势群体。各国劳动力部门能够基于历史序列预测潜在劳动力的变化趋势,从而优化职业培训资源的配置与社会保障制度的调整。此外,该数据也常被纳入欧洲就业监测报告,用于追踪“欧洲2020”等就业战略目标的实现进度。
衍生相关工作
围绕该数据集已衍生出一系列具有深远影响的学术工作。其中,基于面板数据模型的跨国劳动力弹性估计研究,系统量化了经济冲击对不同性别潜在劳动力规模的异质性影响。另有一系列工作结合机器学习方法,利用此数据训练时间序列预测模型,以提前预判欧洲各国劳动力市场的紧张程度。此外,该数据还常与GDP、通胀等宏观经济变量联合使用,构建结构向量自回归模型,深入剖析劳动力未充分利用与经济周期之间的动态反馈机制,为后疫情时代的就业复苏政策提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务