遇见数据集

electricsheepeurope/europe-ilo-une-5eap-sex-dsb-rt-unemployment-rate-by-sex-and-disability-status-19t

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲30个国家从2014年至2025年的2,730个观测值,专注于按性别和残疾状况划分的失业率——第19届国际劳工统计学家会议(ICLS)百分比指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过筛选和标准化处理,以确保遵循ICLS定义。数据集提供了详细的表格结构,包括国家代码、年份、性别分类(总计、男性、女性)、残疾状况、观测值及其状态标志等列,适用于表格分类、回归和时间序列预测等任务。数据质量方面,为年度频率,并包含数据来源和可靠性注释。该数据集由Electric Sheep Europe重新打包,旨在为机器学习研究提供统一、易用的欧洲劳动力市场数据。

This dataset contains 2,730 observations of unemployment data across 30 European countries, spanning from 2014 to 2025, focusing on the indicator Unemployment rate by sex and disability status -- 19th ICLS (%). The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via REST API, and filtered to European ISO3 country codes, with harmonization based on International Conference of Labour Statisticians (ICLS) definitions. It features a detailed tabular schema including columns for country codes, years, sex disaggregation (total, male, female), disability status, observed values, and data quality flags, making it suitable for tasks such as tabular classification, regression, and time-series forecasting. The dataset is repackaged by Electric Sheep Europe to provide a unified, machine learning-ready data layer for European statistics.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-une-5eap-sex-dsb-rt-unemployment-rate-by-sex-and-disability-status-19t 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接拉取标识符为UNE_5EAP_SEX_DSB_RT的失业率指标数据,并依据欧洲ISO3国家代码进行地理筛选。原始数据基于各国劳动力调查、住户收入调查等微观数据,经由ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行标准化处理,最终整合为涵盖30个欧洲国家、时间跨度从2014年至2025年的2,730条观测记录。数据集由Electric Sheep Europe团队重新封装,以Parquet格式发布,确保机器学习就绪。
特点
该数据集的核心特色在于其精细的维度划分与严谨的数据治理。它提供按性别(男性、女性、合计)和残疾状况交叉分组的失业率指标,反映了第19届ICLS对劳动统计的定义标准。每条记录均包含丰富的元数据字段,如数据来源标识、观测状态标志及注释分类,便于追溯数据质量。此外,ILO针对同一国家-年份组合的多来源数据采用‘最佳来源’选取策略,保障了数据的一致性与权威性。
使用方法
用户可通过Hugging Face Datasets库的load_dataset函数直接加载该数据集,并将其转换为pandas DataFrame进行后续分析。典型应用包括按国家筛选子集以进行国别研究,或利用时间列对特定指标进行时序分析与可视化。亦可借助pivot_table方法将数据重塑为国家×年份的矩阵形式,便于跨国家比较或作为面板数据输入至计量模型。数据集结构清晰,列名包含标签化字段,降低了数据探索与特征工程的门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,并由Electric Sheep Europe重新打包整理,聚焦于欧洲30个国家2014至2025年间按性别与残疾状态划分的失业率数据。数据源自ILOSTAT数据库,该数据库是全球劳动统计的权威来源,依据国际劳工统计学家会议(ICLS)第19届定义对原始调查微观数据进行标准化处理。核心研究问题在于揭示劳动力市场中性别与残疾状态的交织影响,为评估包容性就业政策效果提供实证依据。作为欧洲区域劳动市场研究的重要资源,该数据集填补了细分群体失业率长时间序列数据的空白,对劳动经济学、社会福利政策及可持续发展目标(SDG)监测具有显著支撑作用。
当前挑战
从领域问题看,该数据集精准回应了劳动市场中长期存在的交叉性身份歧视度量难题,即如何量化残疾状况与性别差异对失业率的复合影响,从而超越单一维度的就业分析框架。构建过程中面临的挑战包括:多国数据源整合时需弥合各国劳动力调查在残疾定义、问卷设计和抽样方法上的差异,ILO虽通过ICLS标准进行调和,但注释字段中仍存在非标准定义标记(如'Nonstandard definition of disability')。此外,年度频率数据难以捕捉季度或月度波动,而'最佳来源'选择策略可能隐含系统性偏差,观测状态中的'不可靠'标记亦需审慎处理,这些因素共同构成了数据质量与可比性之间的紧张关系。
常用场景
经典使用场景
在劳动经济学与公共政策研究领域,该数据集最经典的使用场景是分析欧洲各国按性别与残疾状态划分的失业率时空演化规律。研究者可借助其2730条年度观测记录,跨越30个欧洲国家、覆盖2014至2025年的长时段面板数据,构建多维度比较分析框架。通过将性别与残疾状况作为核心分层变量,学者能够揭示不同社会群体在劳动力市场中的结构性差异,例如女性残疾群体的失业率是否系统性高于男性残疾群体。该数据集还常被用于检验国际劳工组织第19届国际劳动统计学家会议(ICLS)定义的失业标准在欧洲不同制度环境下的适用性,为跨国家集群的雇佣弹性研究提供可靠的数据基石。
解决学术问题
该数据集精准回应了劳动经济学中关于弱势群体就业排斥的测量难题,尤其是残疾人群体的失业率长期缺乏标准化国际可比数据的困境。通过ILOSTAT统一调查口径与协调方法论,学者得以首次在30个欧洲国家间进行残疾人与非残疾人失业率的严格对比,从而定量评估《联合国残疾人权利公约》实施效果与欧洲就业战略的普惠性。数据按性别进一步细分后,更可揭示残疾群体内部的交叉性歧视现象——残疾女性可能面临双重劣势,这一发现推动了社会学与经济学交叉领域关于多重弱势叠加效应理论的实证检验。研究结论直接辅助欧盟委员会设计更精准的就业干预计划,例如定向技能培训或反歧视法规修订的循证需求。
衍生相关工作
该数据集的发布直接催生了一系列聚焦劳动市场不平等度量的衍生研究。多项工作基于其面板特性,利用固定效应模型或双重差分法剥离时间趋势与国家异质性,精准估计残疾状况对失业率的因果效应。部分研究将该数据与欧洲统计局(Eurostat)的教育结构或社会保障支出数据集连接,构建分析失业率如何受宏观福利制度调节的复合模型。另一些方法类论文则在此基准上比较时间序列预测算法(如Prophet、LSTM与ARIMA)对残疾失业人口的预测精度,为政策预警系统开发提供方法论基准。值得关注的是,该数据还被用于训练公平性导向的机器学习分类器,旨在消除历史数据中因抽样偏差导致的弱势群体预测歧视。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务