遇见数据集

electricsheepeurope/europe-ilo-eip-teip-sex-age-geo-nb-persons-outside-the-labour-force-by-sex-age-and-ru

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别、年龄和城乡地区划分的非劳动力人口(千人)| 欧洲(ILOSTAT)”,包含135,247个观测值,覆盖40个欧洲国家,时间跨度为1987年至2025年。数据聚焦于“劳动力未充分利用的其他指标”,具体指标为EIP_TEIP_SEX_AGE_GEO_NB,用于统计按性别、年龄和城乡地区划分的非劳动力人口数量(以千为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过处理,涵盖国家代码、性别分类、年龄组、城乡地区、观测年份和数值等列。数据集适用于表格分类、回归和时间序列预测任务,可用于劳动力市场分析、经济研究等场景。数据以CC-BY-4.0许可证发布,由Electric Sheep Europe重新打包,确保ML就绪格式。

This dataset is named "Inactive Population by Sex, Age and Urban/Rural Area (Thousands) | Europe (ILOSTAT)". It contains 135,247 observations, covering 40 European countries, with a time span from 1987 to 2025. The dataset focuses on "other indicators of underutilization of labour", with the specific indicator being EIP_TEIP_SEX_AGE_GEO_NB, which is used to count the number of inactive population by sex, age and urban/rural area, measured in thousands. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), obtained via API and preprocessed. It includes columns such as country code, sex category, age group, urban/rural area, observation year and corresponding numerical values. This dataset is suitable for tasks including tabular classification, regression and time series forecasting, and can be applied to labor market analysis, economic research and other relevant scenarios. The data is released under the CC-BY-4.0 license, and repackaged by Electric Sheep Europe to ensure ML-ready format.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-teip-sex-age-geo-nb-persons-outside-the-labour-force-by-sex-age-and-ru 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于欧洲地区劳动力市场以外人群的统计测度。数据通过ILOSTAT的REST API直接采集,指标代码为EIP_TEIP_SEX_AGE_GEO_NB,并依据欧洲ISO3国家代码进行过滤筛选。ILO统计部门依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调统一,数据集中的`source.label`字段清晰标注了各数据来源,确保了数据的可追溯性与标准化。最终由Electric Sheep Europe团队进行重新封装,形成包含135,247条观测记录的整洁表格数据集。
特点
该数据集横跨1987年至2025年,覆盖40个欧洲国家,包含唯一核心指标——按性别、年龄及城乡区域划分的劳动力市场以外人口数量(单位:千)。数据结构丰富,提供了`sex`、`classif1`(年龄分类)、`classif2`(区域类型)等多维度分层变量,支持研究者从性别(总、男、女)、年龄段(如15岁以上青年与成人)以及地理覆盖范围(国家、城乡)等角度进行细致剖析。此外,数据标注了观测状态(如序列中断)及详尽注释,便于用户评估数据质量。
使用方法
用户可通过HuggingFace的`datasets`库轻松加载该数据集,调用`load_dataset()`函数即可将其转化为Pandas DataFrame格式,便于后续分析。具体应用包括:按国家代码筛选特定国家的子集;针对单一指标按时间排序后绘制时间序列图,以观察趋势变化;利用透视表功能将数据重塑为国家×年份的矩阵形式,以支持面板数据分析或跨国家比较。该数据集设计为即用型(ML-ready),极大降低了研究人员获取和处理欧洲劳动力统计数据的门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年创建,并经Electric Sheep Europe重新封装发布,聚焦于欧洲40个国家1987年至2025年间按性别、年龄及城乡划分的劳动力市场外人口规模(单位:千人)。作为ILOSTAT核心统计数据库的衍生数据,该数据集旨在系统量化“劳动力未充分利用”这一关键社会经济指标,为政策制定者、经济学家及社会科学研究者提供精细化的纵向比较基础。其研究核心在于揭示欧洲各国劳动力外群体在性别、年龄和地域维度上的结构性差异,从而为就业政策评估、社会包容性分析及劳动力市场动态监测提供实证支持。凭借ILO权威的统计方法与跨时空覆盖率,该数据集已成为欧洲劳动力研究领域的重要基准,推动了从宏观趋势到微观群体异质性的多层级分析范式。
当前挑战
该数据集主要应对的领域挑战在于:如何精准捕捉并解构劳动力市场外群体的多维特征——传统劳动力统计往往聚焦于就业与失业人口,而忽视了对因教育、家庭照料、健康或社会排斥等原因退出市场的人群的系统量化,尤其是性别与地域之间交叉作用的复杂影响。在构建过程中,数据整合面临显著技术障碍:40个国家横跨近四十年,其原始调查来源(如劳动力调查、家计调查)在定义、问卷设计和抽样方法上存在差异,需依赖ILO通过国际劳工统计会议(ICLS)标准进行协调统一;同时,数据中的“断点”(break in series)标记和城乡覆盖范围定义偏差等质量注释,要求在重新封装时保留原有时序一致性,避免因 метод更改导致误读,这对数据清洗与元数据管理提出了极高要求。
常用场景
经典使用场景
该数据集记录了1987年至2025年间欧洲40个国家的劳动力市场边缘群体——即由于性别、年龄及城乡地域差异而处于劳动力大军之外的个体数量(以千人为单位)。其最为经典的运用途径在于进行跨国别的时序比较与结构性剖析,研究者能够通过‘ref_area’与‘time’字段构建面板数据,精准追踪特定国家或地区非劳动力人口随年份的演化轨迹,并借助‘sex’与‘classif1’(年龄分层)、‘classif2’(城乡属性)等维度拆解,深度揭示劳动力参与率背后的社会分层逻辑,为劳动经济学中的‘沮丧工人效应’或‘隐蔽性失业’假说提供实证支撑。
衍生相关工作
围绕该数据集,学术界已衍生出构建欧洲劳动力市场‘边缘群体脆弱性指数’的经典工作,研究者通过整合性别、年龄与城乡三维交叉分类的非劳动力人口数据,建立了可预测经济危机下‘隐藏失业’规模的面板回归模型。此外,有学者基于此数据开发了一套动态聚类算法,用以识别欧洲国家在劳动力市场僵化程度上的异质性‘沉默带’,并据此设计差异化的劳动力激活政策评估框架。这些后续工作不仅深化了对劳动力市场分层机制的理论理解,也为比较社会政策分析领域贡献了可复用的数据分析方法与基准测试指标。
数据集最近研究
最新研究方向
当前,该数据集在欧洲劳动力市场研究中展现出重要价值,尤其在分析非劳动力人口的结构性特征与时空演变规律方面。前沿研究方向聚焦于利用时序预测模型(如Transformer、LSTM)对1987-2025年间40个欧洲国家的性别、年龄及城乡维度数据进行深度挖掘,以揭示劳动力闲置的长期趋势与周期性波动。结合ILOSTAT的标准化指标,研究者正尝试将此类数据与宏观经济事件(如新冠疫情对劳动参与率的冲击、欧洲能源危机后的就业结构调整)进行关联分析,评估劳动力市场韧性及政策干预效果。该数据集提供的精细分类维度(如性别-年龄-城乡三重交叉划分)为构建高分辨率劳动力流动模型提供了关键支撑,推动可持续劳动力发展规划。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务