遇见数据集

electricsheepeurope/europe-ilo-eip-dwap-sex-geo-mts-rt-inactivity-rate-by-sex-rural-urban-area-and-marita

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含国际劳工组织(ILO)ILOSTAT数据库中的其他劳动力未充分利用指标数据,专门针对欧洲地区。数据集核心指标为EIP_DWAP_SEX_GEO_MTS_RT,即按性别、城乡地区和婚姻状况划分的不活动率(百分比)。数据涵盖37个欧洲国家,时间跨度为1987年至2025年,共包含29,762个观测值。数据集提供了详细的分类维度,包括性别(总计、男性、女性)、地区类型(如国家层面)和婚姻状况(总计)等。数据以年度频率收集,来源包括劳动力调查、家庭收入调查等,并经过ILO harmonisation处理以确保一致性。数据集模式包含国家代码、来源标签、指标值、观测状态和质量注释等列,适用于表格分类、回归和时间序列预测等任务。数据由Electric Sheep Europe重新打包,以Parquet格式提供,便于机器学习使用。

This dataset contains Other measures of labour underutilization data from the International Labour Organization (ILO) ILOSTAT database, specifically for Europe. The core indicator is EIP_DWAP_SEX_GEO_MTS_RT, which represents the Inactivity rate by sex, rural / urban area and marital status (%). It covers 37 European countries from 1987 to 2025, with 29,762 observations. The dataset includes detailed disaggregation dimensions such as sex (total, male, female), area type (e.g., national), and marital status (total). Data is collected annually from sources like labour force surveys and household income surveys, harmonized by ILO for consistency. The schema comprises columns for country codes, source labels, indicator values, observation status, and quality notes, making it suitable for tabular classification, regression, and time-series forecasting tasks. Repackaged by Electric Sheep Europe in Parquet format for machine learning readiness.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-dwap-sex-geo-mts-rt-inactivity-rate-by-sex-rural-urban-area-and-marita 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过调用其REST API接口批量获取原始数据,并聚焦于欧洲地区。数据筛选过程中,以ISO3国家代码为基准,仅纳入37个欧洲国家的观测记录,最终汇聚成涵盖1987年至2025年间的29,762条时间序列数据。ILOSTAT本身采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行标准化处理,数据集中以'source.label'字段标记原始数据来源,确保数据可追溯性与方法论透明度。整个数据集的整合与重新打包工作由Electric Sheep Europe完成,旨在为机器学习研究提供标准化、可直接调用的数据资源。
特点
该数据集的核心特点在于其精细的多维分类结构与明确的时间跨度。其核心指标为非经济活动率,并按性别、城乡区域以及婚姻状况三个维度进行详细分解,提供了SEX_T(总计)、SEX_M(男性)和SEX_F(女性)三种性别分类方式。数据结构以年为单位呈现,覆盖近四十年,有利于进行长期劳动力市场趋势分析。此外,数据集通过'obs_status'和'note_indicator'等字段标记观测值的可靠性状态及方法变更信息,为用户提供了数据质量评估依据。该数据集在HuggingFace平台上以Parquet格式发布,兼容常见的表格分析与时间序列建模任务。
使用方法
使用该数据集极为便捷,用户可通过HuggingFace Datasets库的load_dataset()函数直接加载,并利用to_pandas()方法将其转换为Pandas DataFrame进行后续分析。针对特定国家的分析,用户可基于'ref_area'列进行过滤,如筛选德国数据。对于指标的时间序列分析,可按照'indicator'列筛选并依据'time'列排序后直接绘图。数据集还支持透视操作,用户可将数据重构为国家×年份的矩阵形式,便于进行面板数据分析或构建回归模型。该数据集适配表格分类、回归以及时间序列预测等多种机器学习任务,为欧洲劳动经济学研究提供了坚实的数据基础。
背景与挑战
背景概述
劳动力市场非充分就业的度量是劳动经济学与社会政策研究领域的核心议题,尤其在欧洲多元化的社会经济背景下,理解不同群体(如按性别、城乡地域及婚姻状况划分)的经济不活跃率对精准制定就业促进政策至关重要。该数据集由国际劳工组织(ILO)的ILOSTAT数据库于2025年通过Electric Sheep Europe重新整合发布,聚焦于37个欧洲国家1987年至2025年间的“非经济活动率(按性别、城乡地区和婚姻状况划分)”指标,涵盖29,762条观测记录。通过提供经ILO基于国际劳工统计学家会议(ICLS)标准协调后的微观调查数据,该数据集为研究人口结构、地域差异与劳动力退出之间的动态关联提供了系统化的跨时长序列资源,对分析欧洲劳动力市场结构性变化及评估社会包容性政策效果具有显著支撑价值。
当前挑战
该数据集所面对的领域挑战在于,非经济活动率的精准测度往往因不同群体间隐匿的就业意愿差异而复杂化,例如已婚女性与城乡迁移人群的非活跃成因可能截然不同,传统单一维度指标难以揭示其背后的结构性驱动机制。在构建过程中,数据整合面临多重挑战:首先,原始数据源自各国差异化的劳动力调查、家户收支调查与行政记录,需克服抽样框架与定义不一致导致的跨国家可比性问题;其次,长时间跨度(1987–2025)意味着统计方法修订(如标志“Break in series”)、数据源更替及“最佳来源”选择策略可能引入时序断裂,同时多项分类变量(如性别、城乡类型与婚姻状态)在部分国家年份存在缺失,增加了多维分解建模的约束。
常用场景
经典使用场景
该数据集收录了1987年至2025年间37个欧洲国家因性别、城乡区域及婚姻状况划分的劳动不活跃率观测值,共计29,762条记录。在劳动经济学与人口统计学研究中,研究者常利用此数据集构建面板数据模型,以分析性别平等、城乡差异及婚姻状态对劳动参与决策的交互影响。其经典使用场景包括通过固定效应或随机效应回归,量化城镇化进程对不同婚姻状况女性劳动退出率的差异化效应,或利用时间序列分解方法揭示欧洲各国在经济周期中劳动不活跃率的长期趋势与结构性突变。基于ILOSTAT标准化定义的多维分层变量,该数据为比较研究提供了可靠的基础统计资料。
实际应用
在实际应用中,该数据集为国际组织与各国统计部门提供了监测劳动力市场结构性弱点的量化工具。国际劳工组织可借助其追踪联合国可持续发展目标中关于体面工作的具体进展,尤其是评估不同社会群体在劳动市场中的边缘化程度。国家劳动与社会保障部门能依据性别与城乡分层的不活跃率,精准设计区域性的职业培训计划与育儿支持政策,以降低特定人群的就业障碍。此外,人力资源服务企业可结合此数据预测特定区域的人力供给潜力,优化招聘策略与区域扩张规划。区域发展机构亦可利用时间序列模式,识别因产业结构调整或老龄化而可能持续扩大的劳动闲置地带,为经济韧性规划提供预警依据。
衍生相关工作
围绕该数据集,研究者已衍生出多项开创性工作。在方法论层面,学者开发了针对多维分层时间序列的缺失值插补算法与数据同化技术,以处理部分国家早期年份观测值稀疏的问题。在实证领域,有工作利用此数据结合双重差分模型,评估了2008年金融危机后南欧国家劳动不活跃率的性别化反弹效应,发现婚姻状态成为危机冲击的缓冲器。另有前沿研究引入机器学习中的梯度提升树方法,从该数据集的分类特征中提取非线性关系,预测个体退出的风险轮廓。进一步地,该数据集还被整合进复合面板数据库,用以构建欧洲劳动力市场的动态随机一般均衡模型,量化婚姻与城乡结构变迁对自然失业率的长期影响。这些工作共同拓展了劳动统计数据的分析边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务