遇见数据集

electricsheepeurope/europe-ilo-eip-wdis-sex-edu-mts-nb-discouraged-job-seekers-by-sex-education-and-marit

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含25,420个观测值,涵盖39个欧洲国家,时间跨度为1987年至2025年,覆盖1个特定指标:EIP_WDIS_SEX_EDU_MTS_NB,即按性别、教育程度和婚姻状况分类的受挫求职者(以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主题为其他劳动力未充分利用的衡量指标。数据集通过ILOSTAT REST API获取,并过滤为欧洲国家代码,采用国际劳工统计学家会议(ICLS)定义进行标准化。数据包含结构化字段,如国家代码、年份、观测值、数据来源及分类维度(性别、教育、婚姻状况),适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,部分观测可能带有临时或不可靠状态标记。数据集由Electric Sheep Europe重新打包,旨在为欧洲提供统一的、适合机器学习的数据层。

This dataset contains 25,420 observations of Other measures of labour underutilization data across 39 Europe countries, spanning 1987–2025, covering 1 distinct indicator: EIP_WDIS_SEX_EDU_MTS_NB — Discouraged job-seekers by sex, education and marital status (thousands). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled directly from the ILOSTAT REST API and filtered to Europe ISO3 country codes. ILOSTAT harmonises raw survey microdata using ICLS (International Conference of Labour Statisticians) definitions. The dataset includes structured columns such as country code, year, observed value, source, and disaggregation dimensions (sex, education, marital status), and is suitable for tabular classification, regression, and time-series forecasting tasks. Data is annual frequency, with some observations flagged as provisional or unreliable. Repackaged by Electric Sheep Europe as part of a unified, ML-ready data layer for Europe on HuggingFace.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-wdis-sex-edu-mts-nb-discouraged-job-seekers-by-sex-education-and-marit 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于欧洲39个国家中因性别、教育背景及婚姻状况而分层的沮丧求职者数量(单位:千)。数据通过ILOSTAT REST API直接提取,指标代码为EIP_WDIS_SEX_EDU_MTS_NB,并依据欧洲ISO3国家代码进行过滤。ILOSTAT团队依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一化处理,确保不同来源数据(如劳动力调查、行政记录)的可比性。最终数据集包含25,420条观测记录,时间跨度从1987年至2025年,覆盖1个核心指标,并以Parquet格式封装,便于机器学习就绪。
特点
本数据集的核心特点在于其精细的多维分类粒度:按性别(男、女、总计)、教育程度(总计及细分层次)和婚姻状况(总计及细分类型)提供了沮丧求职者的详细分解。数据以年度频率呈现,并附有观测状态标识(如不可靠、临时的),同时保留了来源说明、分类注释及指标注释,确保数据追踪透明。地理范围涵盖39个欧洲国家,各国时间序列长度不一(如希腊有1,264条记录,覆盖1987–2020年),为跨国家、跨时期比较提供了丰富基础。数据集中的每个字段均包含标签(如ref_area.label),提升了人类可读性。
使用方法
用户可通过HuggingFace Datasets库直接加载数据集,使用`load_dataset`函数即可快速转换为Pandas DataFrame进行探索。典型的操作包括按国家代码过滤(如`df[df['ref_area'] == 'DEU']`)以聚焦单一国家的时间序列,或按指标排序后利用`obs_value`字段进行时序可视化。数据集支持透视表分析,例如构建以时间为行、国家为列的矩阵,便于跨国家比较。此外,分类维度(sex、classif1、classif2)允许用户进一步细分亚组,进行性别、教育或婚姻状况间的差异分析。研究者在引用时需同时注明ILO原始数据及Electric Sheep Europe的重新封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,并经Electric Sheep Europe于2025年重新打包后在HuggingFace平台发布,聚焦于欧洲地区因性别、教育水平和婚姻状况分层的灰心求职者数量(单位:千)。作为ILOSTAT数据库的重要组成部分,该数据集旨在量化劳动力未充分利用中的隐性失业现象,即那些因长期求职失败而放弃寻找工作的人群。数据覆盖1987至2025年间的39个欧洲国家,包含25,420条观测记录,基于统一化国际劳工统计学家会议(ICLS)定义进行整合,为劳动经济学、社会政策评估及可持续发展目标(SDG)中体面劳动指标的监测提供了关键依据。该数据集通过高粒度分层(性别、教育、婚姻状况)揭示了劳动力市场中结构性失业的细微特征,成为分析欧洲不同社会群体就业困境的重要基准。
当前挑战
该数据集所应对的核心领域挑战在于,传统的失业率指标(如ILO定义的失业率)往往无法反映那些因失去信心而退出劳动力市场的‘灰心求职者’群体,导致对劳动力闲置风险的评估存在盲区。具体挑战包括:1) 如何通过多维分层(性别、教育、婚姻状况)精准捕捉不同社会群体中的劳动力闲置差异,以揭示政策干预的靶向区域;2) 数据构建过程中,需要整合来自各国劳动力调查、家庭收入调查及行政记录等异构来源,并通过统一化ICLS定义和最佳源选择(当同一国家年份存在多源时)来确保数据可比性,但方法论修订(如‘序列断点’)和部分观测值的‘不可靠’状态标记仍提示着时序一致性维护的困难;3) 年度频率的限制使得季节性失业和经济周期内短期波动无法被充分建模,且月度或季度子序列并未包含在当前发布中,限制了高精度时间序列分析的可能性。
常用场景
经典使用场景
该数据集提供了欧洲39个国家自1987年至2025年间,按性别、受教育程度和婚姻状况划分的沮丧求职者数量的年度观测值,共计25420条记录。其经典使用场景聚焦于劳动力市场分析中的脆弱群体研究,尤其是在经济下行周期中,那些因长期求职无果而放弃寻找工作的群体。研究者常利用该数据进行时间序列分析,揭示不同社会经济特征人群在劳动力市场边缘化过程中的差异化趋势,或通过面板数据模型探究制度因素、宏观经济波动与沮丧求职现象之间的关联机制。
衍生相关工作
基于该数据集,衍生出了一系列关于劳动力市场脆弱性的实证研究与建模工作。典型工作包括构建多元线性回归或面板固定效应模型,量化GDP增长率、失业救济金期限、最低工资水平等宏观变量对沮丧求职者比例的影响。在机器学习领域,有研究者利用该数据进行时间序列预测任务,探索使用LSTM、Prophet等模型对特定国家或群体的沮丧求职者规模进行短期预测。此外,该数据还被作为基准测试集,用于评估不同统计学习算法在分类与回归任务中处理高维分类变量时的表现,推动了劳动力统计数据的标准化应用与现代分析技术的融合。
数据集最近研究
最新研究方向
基于国际劳工组织ILOSTAT标准化框架,该数据集聚焦欧洲39国1987至2025年间因性别、教育程度及婚姻状况而分层的沮丧求职者(discouraged job-seekers)规模,为劳动力利用不足研究提供了高颗粒度的纵向面板数据。当前前沿研究正利用此类细粒度统计揭示后疫情时代欧洲劳动力市场的结构性隐匿失业动态,尤其关注边缘群体(如低教育女性或离异中年劳动者)在就业信心崩溃后的退出行为。该数据集与欧盟“减贫与就业战略”热点紧密关联,其多维分组特征使得研究者能够量化婚姻保护效应与教育缓冲作用在被动失业者中的异质性表现,从而为精准社会政策干预——如定向再就业激励计划与职业培训资源错配矫正——提供实证基石。这一丰富的微观标签体系正推动劳动力经济学从宏观总量分析向个体化脆弱性画像的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务