遇见数据集

electricsheepeurope/europe-ilo-eip-dwap-sex-edu-mts-rt-inactivity-rate-by-sex-education-and-marital-statu

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为按性别、教育程度和婚姻状况划分的不活动率(%)| 欧洲(ILOSTAT),包含了来自国际劳工组织(ILO)核心统计数据库ILOSTAT的劳动力市场数据。数据集聚焦于劳动力未充分利用的其他衡量指标主题,具体指标为EIP_DWAP_SEX_EDU_MTS_RT,即按性别、教育程度和婚姻状况划分的不活动率(%)。数据集包含156,734个观测值,覆盖39个欧洲国家,时间跨度为1987年至2025年。数据通过ILOSTAT REST API获取,并过滤至欧洲国家代码。ILOSTAT使用国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行协调处理,数据来源在`source.label`列中标注以确保可追溯性。数据集为表格形式,包含多个列,如`ref_area`(国家代码)、`indicator`(指标代码)、`sex`(性别分组)、`classif1`(教育程度分类)、`classif2`(婚姻状况分类)、`time`(年份)、`obs_value`(观测值)等,提供了按性别、教育程度和婚姻状况等多个维度进行细分的数据。数据为年度频率,当同一国家×年份有多个数据源时,使用ILO选择的最佳来源。数据集由Electric Sheep Europe重新打包,旨在为欧洲提供一个统一的、机器学习就绪的数据层,方便研究人员和开发者使用。

The dataset is named Inactivity rate by sex, education and marital status (%) | Europe (ILOSTAT) and contains labour market data from ILOSTAT, the central statistics database of the International Labour Organization (ILO). It focuses on the topic Other measures of labour underutilization, with the specific indicator EIP_DWAP_SEX_EDU_MTS_RT, which stands for Inactivity rate by sex, education and marital status (%). The dataset includes 156,734 observations across 39 European countries, spanning the years 1987 to 2025. Data is pulled directly from the ILOSTAT REST API and filtered to Europe ISO3 country codes. ILOSTAT harmonises raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions, and sources are flagged in the `source.label` column for traceability. The dataset is in tabular format with columns such as `ref_area` (country code), `indicator` (indicator code), `sex` (sex disaggregation), `classif1` (education classification), `classif2` (marital status classification), `time` (year), `obs_value` (observed value), etc., providing data disaggregated by dimensions like sex, education, and marital status. The data is annual frequency, and when multiple sources exist for the same country×year, the ILO-selected best source is used. The dataset is repackaged by Electric Sheep Europe as part of a mission to provide a unified, ML-ready data layer for Europe on HuggingFace, facilitating use by researchers and developers.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-dwap-sex-edu-mts-rt-inactivity-rate-by-sex-education-and-marital-statu 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的权威劳动统计数据库ILOSTAT,聚焦于欧洲地区劳动力未充分利用的度量。数据通过调用ILOSTAT REST API直接获取,选取了标识符为‘EIP_DWAP_SEX_EDU_MTS_RT’的指标,即按性别、教育程度与婚姻状况划分的不活跃率。原始数据依据国际劳动统计学家会议(ICLS)定义进行统一标准化,再经由Electric Sheep Europe团队重新整理,仅保留欧洲39个国家的ISO3国家代码数据,确保地域聚焦与分析一致性。
特点
本数据集涵盖1987年至2025年间长达近四十年的年度观测,总计156,734条记录,覆盖39个欧洲国家,兼具时间广度与空间深度。核心特征在于其多维度的精细拆分:数据按性别(总、男、女)、教育程度与婚姻状况进行交叉分类,为分析劳动力市场结构性特征提供了丰富的层次。此外,每个观测值均附有来源标签与状态说明,便于用户追溯数据质量与统计方法变更,增强了科研应用的透明度与可靠性。
使用方法
数据集以Hugging Face Datasets格式封装,可通过`load_dataset()`函数一键加载,并直接转换为Pandas DataFrame进行后续分析。用户可按国家代码(如`ref_area == 'DEU'`)筛选特定国家的时间序列,也可利用`obs_value`字段对不同指标的变动趋势进行可视化。对于面板数据分析,推荐采用数据透视功能,将数据重塑为国家×年份的矩阵格式,便于进行跨国的比较研究与计量建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下ILOSTAT数据库于2025年整理发布,经Electric Sheep Europe重新封装后呈现在HuggingFace平台。核心研究问题聚焦于欧洲39国1987至2025年间,按性别、教育程度及婚姻状况划分的劳动力非参与率(inactivity rate),旨在揭示劳动力市场边缘群体特征及其长期演变规律。作为ILOSTAT指标体系中的关键组成部分,该数据集为劳动经济学、公共政策评估及社会分层研究提供了标准化、高维度的面板数据支撑,尤其在探讨结构性失业、教育与就业的关联机制及性别不平等议题上具有重要学术价值。其涵盖逾15万观测值的庞大规模与长达近四十年的时间跨度,显著提升了欧洲区域劳动力研究的时空分辨率,对相关领域的实证分析产生了深远影响。
当前挑战
该数据集所解决的领域核心挑战在于量化分析与预测影响劳动力市场非参与行为的复合社会因素,即如何在控制性别、教育与婚姻状况三维交互效应的前提下,精准刻画其与劳动参与率的动态关联。传统宏观指标往往忽略个体细粒度特征,导致政策干预目标偏移。在构建过程中,数据整合面临显著挑战:需融合来自各国劳动力调查、家庭收支调查及行政记录等异质性源头,并依据国际劳工统计学家会议(ICLS)标准进行协调统一,以修正方法论变更、分类差异及时序断裂等系统性问题,例如数据中标注的‘非标准教育层级’与‘序列方法修订’等注释即反映了此类处理过程的复杂性。最终实现了跨国家、跨时期、跨人口维度的标准化可比数据架构。
常用场景
经典使用场景
该数据集收录了1987年至2025年间39个欧洲国家按性别、教育程度及婚姻状况分层统计的经济不活跃率,共计156,734条观测记录。在劳动经济学与社会学研究中,它常被用于刻画不同人口亚群在劳动力市场参与度上的长期演变趋势,尤其适合开展跨国比较分析。研究者可基于时间序列数据,运用面板回归或动态随机效应模型,探究性别差异、教育回报率与家庭结构变化对劳动退出行为的交互影响。数据集中详实的分类标签(如性别、教育层级、婚姻状态)为精细化解构劳动供给行为提供了理想的量化基础。
解决学术问题
该数据集的核心学术价值在于系统性地解构了欧洲劳动力市场中的非参与现象,弥补了传统失业率指标无法充分反映潜在劳动供给抑制的缺陷。通过引入教育程度与婚姻状况等交互维度,研究者得以突破以往单一性别分析的局限,更深入地探讨结构性失业、人力资本折旧与家庭决策对劳动退出行为的驱动机制。它对理解不同制度环境下(如北欧高福利国家与南欧劳动保护体系)的就业激活政策效果具有关键意义,为验证‘附加工人效应’、‘灰心丧气效应’等经典理论假设提供了跨度近四十年的跨国实证依据。
衍生相关工作
基于该数据集衍生的学术探索催生了一系列开创性工作。经典应用包括构建欧洲劳动力市场不活跃率的多层次动态面板模型,以分离国家固定效应与时变协变量对劳动供给决策的影响。同时,它被广泛用作机器学习基准任务,用于评估时序预测模型(如Prophet、LSTM或Transformer架构)在捕捉长期结构性变化与周期性波动方面的能力。在此基础上,学者们进一步开发出区域间经济脆弱性指数,通过聚类分析描绘出欧洲境内劳动参与程度的‘核心-边缘’格局,推动了空间计量经济学与劳动经济学的交叉融合。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务