遇见数据集

electricsheepeurope/europe-ilo-eip-xplf-sex-geo-mts-nb-potential-labour-force-by-sex-rural-urban-area-and

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个来自国际劳工组织(ILO)ILOSTAT数据库的数据集,专注于欧洲地区的潜在劳动力指标。数据集包含4,973个观测值,覆盖13个欧洲国家,时间跨度为1987年至2025年。核心指标为“按性别、城乡地区和婚姻状况划分的潜在劳动力(千人)”,用于衡量劳动力未充分利用的其他方面。数据通过ILOSTAT REST API获取,并经过欧洲国家代码过滤,采用国际劳工统计学家会议(ICLS)定义进行标准化。数据集以表格形式呈现,包括国家、性别、分类变量、年份和观测值等列,适用于表格分类、回归和时间序列预测等任务。数据由Electric Sheep Europe重新打包,便于机器学习使用。

This dataset is sourced from the International Labour Organization (ILO) ILOSTAT database, focusing on potential labour force indicators in Europe. It contains 4,973 observations across 13 European countries, spanning from 1987 to 2025. The core indicator is Potential labour force by sex, rural / urban area and marital status (thousands), which addresses other measures of labour underutilization. Data is pulled directly from the ILOSTAT REST API, filtered to European ISO3 country codes, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset is presented in tabular format with columns such as country, sex, classification variables, year, and observed value, suitable for tasks like tabular classification, regression, and time-series forecasting. It has been repackaged by Electric Sheep Europe for machine learning readiness.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-xplf-sex-geo-mts-nb-potential-labour-force-by-sex-rural-urban-area-and 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过调用其REST API接口获取原始指标数据,并依据欧洲ISO3国家代码进行地理范围过滤。Electric Sheep Europe团队对数据进行重封装,确保架构标准化并转换为Parquet格式存储。数据涵盖1987至2025年间13个欧洲国家的潜在劳动力统计,观测值总计4,973条,每条记录均包含性别、城乡区域及婚姻状况等分类维度的信息。
特点
数据集以时间序列与多元分类标签为特色,提供性别(总、男、女)、区域类型(国家层面)及婚姻状况(汇总)等三个维度的细粒度拆解。所有指标均遵循国际劳工统计学家会议(ICLS)的定义标准,并附有来源标记与观测状态标志(如是否可靠)以保障数据可追溯性。数据每年观测一次,覆盖13个欧洲国家,观测年份跨度近40年,为研究劳动力利用不足问题提供了宝贵的纵向资料。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,利用load_dataset()函数获取训练集后转换为Pandas DataFrame进行后续分析。支持按国家代码筛选特定国家的数据,针对特定指标构建时间序列图,或通过透视表将数据重塑为国家×年份的矩阵形式。代码示例提供了从加载、筛选到可视化的完整流程,便于快速集成至劳动力市场研究与计量经济学模型中。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT创建,并经Electric Sheep Europe重新打包发布。ILOSTAT作为全球劳动统计领域的权威数据源,长期致力于整合超过200个经济体的劳动力调查、家庭收支调查等多元数据,为国际劳动市场研究提供标准化指标。本数据集聚焦欧洲13个国家在1987至2025年间的潜在劳动力规模,按性别、城乡地域及婚姻状况进行细致划分,共计4973条观测记录,直指劳动未充分利用这一关键社会经济学议题。其发布填补了欧洲区域潜在劳动力细分数据的空白,为政策制定者与研究人员深入理解劳动力结构演变、评估就业政策效果提供了可量化且可复现的基础支撑,在劳动经济学与人口社会学交叉领域产生了显著影响。
当前挑战
该数据集所应对的核心领域挑战在于劳动未充分利用的精准度量问题。传统失业指标往往低估非典型就业人群(如失业丧失信心者、隐性失业者)的真实规模,而潜在劳动力指标的引入虽能弥补此缺陷,却因各国统计口径差异、调查方法变迁导致数据可比性下降。构建过程中,数据集面临多重挑战:首先,跨时段(1987-2025)的数据拼接需处理因方法论修订(如ICLS定义更新)引发的序列断裂,本数据集通过注记列标注断点以提示用户;其次,城乡分类、婚姻状况等细分维度的数据缺失显著,部分国家(如黑山)仅有少数年份观测,限制了长时段分析;此外,不同来源(如劳动力调查与生活水平调查)的指标融合需依赖ILO‘最佳来源’筛选算法,该过程可能引入选择偏差。最终,数据仅在年度频率上发布,缺失月度或季度的动态波动信息,削弱了对短期劳动市场变化的捕捉能力。
常用场景
经典使用场景
在欧洲劳动力市场研究中,该数据集常被用于分析潜在劳动力人口的结构特征与时空分布。研究者可通过性别、城乡地域与婚姻状况等维度,结合1987至2025年间覆盖13个欧洲国家的近五千条观测记录,构建面板数据模型,探讨潜在劳动力规模在不同社会经济群体间的演化规律。其经典应用包括预测劳动力供给缺口、评估失业边缘人群的分布格局,以及量化政策干预对潜在劳动力激活效果的影响。数据以年频次发布,支持时间序列分析与跨区域对比,为劳动经济学中的结构性失业、劳动力市场刚性与人口转变等议题提供了坚实的实证基础。
实际应用
在实际应用中,该数据集赋能了欧洲各国劳动部门与国际组织的决策支持系统。政策制定者可借助其按性别与婚姻状况的分层数据,识别特定群体(如农村已婚女性或城市单身男性)的潜在劳动力数量,从而精准设计职业培训计划、弹性就业政策或区域发展激励措施。对于跨国企业的人力资源规划团队,历史序列数据能辅助预测不同国家城市与农村的劳动力可及性变化,优化人力调配策略。此外,研究人员和智库利用其结构化的面板数据构建劳动力短缺预警模型,为社会保障体系的可持续性评估提供数据驱动的洞察。
衍生相关工作
围绕该数据集衍生出一系列影响深远的工作。在方法论层面,基于ILOSTAT协调定义的潜在劳动力指标催生了多种测度模型,如结合时间与地域固定效应的面板回归分析,以及针对分类变量(性别、婚姻状况)的多层贝叶斯估计框架。在实证研究领域,依托该数据的成果包括欧洲各国潜在劳动力时空异质性的比较研究、城乡劳动力流动非对称性的实证检验,以及婚姻状况对劳动力市场边缘化影响的微观计量分析。此外,Electric Sheep Europe的标准化打包工作使得该数据集能无缝接入HuggingFace生态,启发了后续更多劳动力统计数据的机器学习合规化处理与持续集成流程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务