遇见数据集

electricsheepeurope/europe-ilo-eip-dwap-sex-age-mts-rt-inactivity-rate-by-sex-age-and-marital-status

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是关于欧洲劳动力市场不充分利用其他指标的数据集,具体包含按性别、年龄和婚姻状况划分的不活动率(%)指标。数据集包含221,539个观测值,覆盖39个欧洲国家,时间跨度为1983年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过处理,包含国家代码、国家名称、数据来源、指标代码、性别分类、年龄分类、婚姻状况分类、观测年份、观测值、观测状态等字段。数据集适用于表格分类、表格回归和时间序列预测等任务。

This dataset contains observations on other measures of labour underutilization, specifically the inactivity rate by sex, age and marital status (%), for Europe. It includes 221,539 observations across 39 European countries, spanning from 1983 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and processed, and includes fields such as country code, country name, data source, indicator code, sex classification, age classification, marital status classification, observation year, observed value, and observation status. The dataset is suitable for tasks such as tabular classification, tabular regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-dwap-sex-age-mts-rt-inactivity-rate-by-sex-age-and-marital-status 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接提取指标`EIP_DWAP_SEX_AGE_MTS_RT`的数据,并依据欧洲ISO3国家代码进行地理范围过滤。ILOSTAT本身整合了各国劳动力调查、家庭收入调查及行政记录等微观数据,并依据国际劳工统计学家会议(ICLS)定义进行统一标准化处理。数据集保留了原始数据中的来源标识(`source.label`列),以保障数据可追溯性,最终由Electric Sheep Europe重新封装为便于机器学习使用的格式。
特点
数据集汇集了1983年至2025年间39个欧洲国家的221,539条观测记录,聚焦于按性别、年龄及婚姻状况划分的劳动力未充分利用指标——不活动率。其核心特点在于精细的维度划分,包括性别(SEX_T/M/F)及多重分类变量(如年龄段和婚姻状况汇总),提供了高颗粒度的社会人口学分析视角。此外,数据包含完整的元数据注释,如观测状态标记(`obs_status`)和方法论修订说明(`note_indicator.label`),有助于用户评估数据质量与时间序列的连续性。
使用方法
用户可通过Hugging Face的`datasets`库直接加载该数据集,例如`load_dataset("electricsheepeurope/europe-ilo-eip-dwap-sex-age-mts-rt-inactivity-rate-by-sex-age-and-marital-status")`,并将其转换为Pandas DataFrame进行后续分析。典型使用场景包括针对特定国家的筛选(如`df[df["ref_area"] == "DEU"]`)、单一指标的时间序列可视化、以及构建国家×年份的透视矩阵。数据以Parquet格式发布,确保高效存储与读取,适合进行劳动力市场趋势分析、经济比较研究或时间序列预测建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门基于ILOSTAT数据库构建,经Electric Sheep Europe于2025年重新整理并在HuggingFace平台发布,涵盖1983年至2025年间39个欧洲国家的不活动率数据,包含221,539条观测记录,按性别、年龄和婚姻状况进行细分。核心研究问题聚焦于劳动力市场边缘化群体的结构性特征,通过跟踪非就业、非求职的‘不活跃’人口分布,为理解欧洲各国劳动力参与率差异及社会保障需求提供量化基础。该数据集整合了多种国家调查数据(如劳动力调查、家庭收入调查),并采用国际劳工统计学家会议(ICLS)标准进行统一,在劳动经济学、社会政策评估及可持续发展目标(SDG)监测领域具有重要影响力,尤其为跨界别劳动力非充分就业的纵向比较分析提供了权威数据源。
当前挑战
该数据集所应对的领域挑战在于,传统失业率指标无法充分反映隐性劳动力闲置,例如因家庭责任、健康问题或结构性歧视而退出劳动力市场的人群,而数据集通过细粒度分类精确捕获了被常规指标忽略的不活跃形态。构建过程中面临多重挑战:首先,各国调查的时间频率与方法论差异显著,需通过ILO的‘最佳来源’选择机制进行数据融合,但部分观测值仍被标记为不可靠(obs_status字段含U标志),影响模型训练置信度;其次,跨39国的分类标准不统一,例如年龄分段和婚姻状态定义存在跨国差异,需通过classif1和classif2字段进行映射,但某些细分维度的数据非空值覆盖率不均,可能导致子群体分析时的样本稀疏性;此外,时间序列中存在因方法修订引发的序列中断(如note_indicator.label所示),需要研究者谨慎处理断裂点以避免伪趋势推断。
常用场景
经典使用场景
该数据集记录了1983年至2025年间39个欧洲国家按性别、年龄及婚姻状况划分的劳动参与率缺失数据,总计约22万条观测。其核心应用场景在于构建时间序列模型,以揭示劳动力市场中非活跃人口的结构性演变规律,并支持多维度的分类与回归分析。借助ILOSTAT官方统一口径的数据整理,研究者能够系统性地比较不同国家在特定社会人口变量下的劳动参与缺失差异。
实际应用
在政策制定与公共管理领域,该数据集的实践价值体现为:欧盟各国劳动部门可依据不同性别与年龄组别的非活跃率趋势,精准设计就业帮扶方案。例如,针对已婚女性群体较高的非活跃率,决策者可评估托幼服务与灵活工作制度的实际效果。此外,国际机构如国际劳工组织能够借此监测联合国可持续发展目标中体面工作目标的实现进度,推动区域间劳动政策的协调与改进。
衍生相关工作
围绕该数据集已衍生出多项具有代表性的经典工作,包括基于多变量面板数据的欧洲劳动力参与迟滞效应研究,以及运用因果推断方法分析婚姻状态变化对女性就业选择的长期冲击。同时,有学者将其与教育、社会保障等社会经济数据进行融合,构建了复合预测模型以模拟人口老龄化下劳动力供给的演变路径,进一步确立了该数据在实证劳动经济学研究中的基准地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务