遇见数据集

electricsheepeurope/europe-ilo-eip-wdis-sex-age-geo-nb-discouraged-job-seekers-by-sex-age-and-rural-urban

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲39个国家从1987年至2025年关于按性别、年龄和农村/城市区域划分的沮丧求职者(千人)的劳动力市场数据,共有48,551个观察值,涉及1个独立指标(EIP_WDIS_SEX_AGE_GEO_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过Electric Sheep Europe重新打包处理,以提供机器学习就绪的格式。数据集包括国家代码、来源、指标、性别、年龄分类、区域类型、年份、观测值等列,支持按性别、年龄和区域进行细分分析。数据以年度频率发布,涵盖劳动力利用不足的其他衡量标准,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 48,551 observations of Discouraged job-seekers by sex, age and rural / urban areas (thousands) data across 39 Europe countries, spanning from 1987 to 2025, covering 1 distinct indicator (EIP_WDIS_SEX_AGE_GEO_NB). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO) and repackaged by Electric Sheep Europe to provide a machine-learning-ready format. It includes columns such as country code, source, indicator, sex, age classification, area type, year, observed value, etc., supporting disaggregation by sex, age, and region. The data is published annually and relates to other measures of labour underutilization, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-wdis-sex-age-geo-nb-discouraged-job-seekers-by-sex-age-and-rural-urban 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接提取指标代码为EIP_WDIS_SEX_AGE_GEO_NB的原始数据,并依据ISO 3166-1 alpha-3标准筛选出覆盖39个欧洲国家的观测记录。数据采集后,由Electric Sheep Europe团队进行标准化处理,统一封装为Parquet格式,以适配机器学习工作流。ILOSTAT自身则通过对各国劳动力调查、家庭收支调查等微观数据的整合与协调,采用国际劳工统计学家会议(ICLS)定义进行数据对齐,确保跨国比较的可靠性。
特点
该数据集的核心特点在于其精细的多维度分解结构,涵盖性别、年龄及城乡地域等分类变量,共计提供48,551条观测记录,时间跨度从1987年至2025年。每条记录均包含观测值及详尽的状态标记与注释信息,如数据来源、可靠性标志及方法修订备注,极大增强了数据的透明度和可溯源性。此外,数据集中针对同一国家与年份的多个数据源,仅保留ILO选定的“最佳来源”,有效降低了数据冗余与不一致性。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,调用load_dataset函数即可将数据转存为Pandas DataFrame进行进一步操作。典型应用包括按国家代码过滤以分析特定区域的失业情况,或对特定指标按时间排序构建时间序列进行趋势分析。同时,利用透视表功能可将数据重塑为国家×年份的矩阵形式,便于开展面板数据回归或可视化展示,操作流程简洁高效。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门整理发布,经Electric Sheep Europe重新打包,于2025年上线HuggingFace平台,核心关注欧洲地区因就业前景悲观而放弃求职的“沮丧求职者”群体。以39个欧洲国家为地理范围,覆盖1987年至2025年的近四万年观测数据,该数据集旨在系统量化性别、年龄及城乡区域维度下劳动力利用不足的隐性形态。作为ILOSTAT数据库的衍生资源,其为劳动经济学、社会政策及可持续发展目标(SDG)中“体面工作”指标的监测提供了关键支撑,推动了劳动力市场边缘群体的量化研究。
当前挑战
该数据集面临的首要挑战在于劳动力市场隐性失业的测量复杂性,即“沮丧求职者”这一概念在各国劳动调查中的操作化定义存在差异,导致跨国可比性受限。其次,数据构建过程中需应对多源异构数据融合的难题,ILOSTAT尽管采用ICLS标准进行协调,但各国调查方法、抽样框架及年度频次的差异仍带来缺失值与质量标记(如“不可靠”状态)的处理成本。此外,城乡划分标准与年龄分组口径的不统一,进一步增加了细分维度分析的稳健性挑战,要求研究者审慎处理分类变量的二义性影响。
常用场景
经典使用场景
在欧洲劳动力市场研究中,该数据集被广泛用于分析不同性别、年龄以及城乡地域背景下求职者的沮丧情绪分布。研究者可通过观测值揭示哪些群体更易因反复求职失败而退出劳动力市场,从而绘制出劳动力边缘化人群的精细画像。基于其年度覆盖的时间跨度,经典做法包括筛选特定国家的数据构建时序曲线,或通过透视表生成国家与年份的观测值矩阵,以比较政策周期或经济危机对求职信心的差异化冲击。
解决学术问题
该数据集有效解决了劳动经济学中关于劳动力利用不足的测量难题,特别是对传统失业率无法涵盖的隐性失业群体——即所谓‘沮丧求职者’进行量化。学术研究可借此探索性别歧视、年龄断层以及城乡资源分配不均如何共同塑造非参与劳动力的规模与构成。其意义在于为构建更完备的劳动力市场基准提供实证基础,推动超越标准失业率的政策评估框架,使学术讨论从单一失业率转向多维度的劳动利用质量。
衍生相关工作
该数据集衍生出多类经典学术工作,包括构建面板回归模型探究沮丧求职者数量与宏观经济周期、社会保障力度之间的关联,以及通过分解分析方法量化性别和城乡差异的相对贡献。此外,基于该数据的时间序列特性,研究者开发了预测模型来前瞻劳动力利用不足的演变趋势,并催生了关于‘隐性失业向正式就业转化条件’的计量研究。在方法论上,数据集推动了多水平模型在劳动力边缘化分析中的应用,为后续整合多源微观数据提供了标准化参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务