遇见数据集

electricsheepeurope/europe-ilo-eip-xplf-sex-age-geo-nb-potential-labour-force-by-sex-age-and-rural-urban

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲36个国家1987年至2025年期间,按性别、年龄和城乡区域分类的潜在劳动力(以千计)数据,共57,156个观测值。指标为EIP_XPLF_SEX_AGE_GEO_NB,属于“其他劳动力利用不足指标”类别。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过统一处理,并覆盖多个欧洲国家,包括奥地利、德国、法国等。数据集提供了详细的模式,如国家代码、性别分类、年龄组、观测值和状态标志等,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 57,156 observations of potential labour force data, disaggregated by sex, age, and rural/urban areas (in thousands), across 36 European countries from 1987 to 2025. The indicator is EIP_XPLF_SEX_AGE_GEO_NB, categorized under Other measures of labour underutilization. Sourced from the International Labour Organizations (ILO) ILOSTAT database, the data is harmonized and includes details such as country codes, sex classifications, age groups, observed values, and status flags. It is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-xplf-sex-age-geo-nb-potential-labour-force-by-sex-age-and-rural-urban 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接抽取指标代码为EIP_XPLF_SEX_AGE_GEO_NB的原始数据,并依据欧洲ISO3国家代码进行地理范围过滤而构建。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对各国劳动力调查微观数据进行统一协调,数据集中的source.label字段清晰标注了各观测值的数据来源,确保了数据的可追溯性与国际可比性。数据随后经Electric Sheep Europe团队重新打包为Parquet格式,形成便于机器学习的结构化表格数据集。
特点
本数据集收录了自1987年至2025年间36个欧洲国家共计57,156条观测记录,聚焦于潜在劳动力这一衡量劳动力利用不足的关键指标,并以千人为单位呈现。数据涵盖按性别(总、男、女)、年龄以及城乡地域进行细分的多维度分类信息,其中性别维度包含3个唯一值,分类变量如classif1和classif2提供了年龄组与地理覆盖范围等额外分层。数据集还附带了观测状态标志、来源注释及序列中断说明等元数据,为数据质量评估与时间序列分析提供了坚实支撑。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载该数据集,并利用to_pandas方法将其转换为pandas DataFrame以进行后续分析。典型应用包括按国家代码(如ref_area为'DEU'时筛选德国数据)进行国家层面的子集提取,或针对单一指标按年份排序后绘制时间序列折线图。此外,借助pivot_table函数可将数据重塑为国家×年份的观测值矩阵,便于进行面板数据分析或跨国家比较。数据集兼容分类、回归及时间序列预测等多种机器学习任务范式。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司创建,经由Electric Sheep Europe在HuggingFace上重新整合并发布,旨在提供欧洲36个国家1987至2025年间按性别、年龄及城乡划分的潜在劳动力人口数据(单位:千),共收录57,156条观测值。数据集基于ILOSTAT数据库,该数据库是全球劳动统计领域最具权威性的数据来源之一,通过统一采用国际劳工统计学家会议(ICLS)定义,对不同来源的微观调查数据进行标准化处理,支持研究人员进行跨国界、跨时段的劳动力利用状况分析。作为衡量劳动力未充分利用情况的重要指标,该数据集为深入研究欧洲各国劳动力市场结构变化、性别与年龄差异以及城镇化进程对劳动力供给的影响提供了坚实的数据基础。
当前挑战
数据集所解决的领域问题聚焦于劳动力未充分利用的量化分析,传统失业率指标往往低估实际劳动力闲置状况,而潜在劳动力指标能更全面捕捉因经济环境、家庭责任或结构性障碍而退出或未充分参与劳动市场的群体,通过性别、年龄和城乡维度的细分,可揭示劳动力市场中的不平等现象。在构建过程中,主要挑战包括:1)不同国家和地区的数据来源存在差异性,需通过ILO选择的‘最佳来源’进行统一,但部分数据因方法修订或统计口径变化产生序列中断,需引入断点标记和注释进行识别;2)数据粒度虽覆盖36国且时间跨度近40年,但某些国家或年份的细分维度(如特定年龄组或城乡分类)存在缺失,导致跨群体可比性受限;3)观测状态中存在不可靠标记,提醒使用者需谨慎处理低质量数据。
常用场景
经典使用场景
该数据集在欧洲劳动力市场研究中扮演着基础性角色,其核心用途在于分析潜在劳动力人口按性别、年龄和城乡地域的分布特征。研究人员常利用这57,156条观测记录,构建时间序列模型以追踪1987至2025年间欧洲36国劳动力潜在供给的变化轨迹。该数据集的经典应用场景聚焦于探索劳动力利用不足的多元维度,通过解构不同人口群体的参与状态,揭示结构性就业障碍的演变规律。
实际应用
在实际决策层面,该数据集被广泛用于构建劳动参与率预测模型和政策评估系统。欧洲各国劳动部门依赖其细分维度,量化分析特定年龄群体或女性劳动人口的潜在贡献,从而制定精准的就业促进计划。城市与乡村地域分类的功能使得区域发展政策制定者能够识别劳动力短缺或冗余热点,优化教育、培训和社会保障资源的空间配置。此外,该数据还为国际组织监测可持续发展目标中体面工作的进展提供了可靠依据。
衍生相关工作
基于此数据集衍生出的经典工作主要集中在跨源数据融合与机器学习预测两大方向。研究者将其与就业率、工资水平等指标结合,构建了多标签分类模型以识别劳动力利用不足的复合模式。回归分析方面,利用该数据的时序特征探索了经济周期与潜在劳动力池大小的非线性关系。同时,该数据作为基准测试集,验证了时间序列预测模型(如ARIMA与LSTM)在劳动统计领域的泛化能力,推动了劳动经济学中可计算一般均衡模型的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务