遇见数据集

electricsheepeurope/europe-ilo-eip-dwap-sex-edu-dsb-rt-inactivity-rate-by-sex-education-and-disability-st

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲32个国家从2002年至2025年的27,652个观察值,主题为按性别、教育程度和残疾状况划分的非活动率(%),属于劳动力未充分利用的其他衡量指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家。数据集采用表格格式,包含国家代码、年份、指标值、性别分类、教育程度和残疾状况等列,适用于表格分类、回归和时间序列预测任务。

This dataset contains 27,652 observations of Inactivity rate by sex, education and disability status (%) data across 32 Europe countries, spanning 2002–2025, covering 1 distinct indicator. It is part of the Other measures of labour underutilization topic, sourced from the International Labour Organization (ILO) ILOSTAT database, filtered to Europe ISO3 country codes. The data is in tabular format with columns such as country code, year, indicator value, sex disaggregation, education, and disability status, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-dwap-sex-edu-dsb-rt-inactivity-rate-by-sex-education-and-disability-st 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,数据通过ILOSTAT REST API直接获取,并依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调处理。经筛选后保留了32个欧洲国家的相关观测值,最终形成涵盖2002至2025年间的27,652条记录。数据集由Electric Sheep Europe进行再封装,以标准化的Parquet格式呈现,确保数据可追溯且便于直接加载。
特点
该数据集聚焦欧洲地区劳动力利用不足的衡量指标,具体包含按性别、教育程度和残疾状况划分的不活动率(%)。数据结构严谨,提供了丰富的分类维度,如性别(总、男、女)、教育程度和残疾状态,并附有详细的注释字段,涵盖数据来源编码、观察状态标志及系列中断说明。数据为年度频率,且经由ILO筛选的“最佳来源”整合,确保了跨国家、跨年份的一致性与可比性。
使用方法
使用该数据集极为便捷,可直接通过HuggingFace的datasets库以load_dataset函数加载,并转为Pandas DataFrame进行分析。用户可轻松筛选特定国家的时间序列数据,或者对特定指标进行趋势可视化。数据集支持透视操作,便于构建国家-年份矩阵,适合进行面板数据分析或时序预测模型训练,其结构化的列设计也直接适用于表格分类与回归任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司(ILOSTAT)维护,经Electric Sheep Europe团队于2025年重新整合并发布于HuggingFace平台。ILOSTAT作为全球劳动统计领域的权威数据源,依托各国劳动力调查、家庭收入调查及行政记录,提供覆盖200多个经济体的标准化指标。本数据集聚焦欧洲32个国家2002至2025年间按性别、教育程度和残疾状况划分的非经济活动率(Inactivity rate),包含27,652条观测记录。这一指标是衡量劳动力市场未充分利用程度的关键维度,尤其关注弱势群体的就业障碍,为政策制定者与研究者揭示劳动参与的结构性不平等提供了重要依据,在劳动经济学、公共政策评估及社会包容性研究领域具有广泛影响力。
当前挑战
数据集所解决的领域问题在于,劳动市场的非经济活动率通常被宏观失业率所掩盖,而性别、教育水平与残疾状况等交叉因素对劳动参与的影响难以通过单一指标量化。该数据集通过多维细分变量的标准化整合,使研究者能够识别特定群体面临的系统性就业排斥。构建过程中面临的核心挑战包括:各国原始调查的抽样设计、数据收集标准及残疾定义存在显著差异,ILO虽通过国际劳工统计学家会议(ICLS)定义进行协调,但仍需在‘最佳来源’筛选中权衡可比性与时效性;此外,部分国家的序列因方法论修订而产生断裂,数据质量标记(如不可靠状态)与注释信息的处理要求严谨的元数据管理,以确保时间序列分析的有效性。
常用场景
经典使用场景
该数据集主要服务于对欧洲劳动力市场非活跃人口的跨维度分析,适用于时间序列预测、分类与回归等任务。研究者可借助性别、教育程度与残疾状况等分层变量,剖析不同亚群体在经济不活跃状态下的长期演变趋势。通过在2002至2025年间覆盖32个欧洲国家的观测数据,可用于构建预测模型,探索残疾人口、教育水平与性别差异对劳动力市场退出行为的交互效应,亦可支撑面板数据回归分析,识别影响劳动参与率的结构性因素。
衍生相关工作
依托这一标准化的面板数据,学界已衍生出多个方向的经典工作。一方面,基于性别、教育与残疾状况的交叉分类催生了针对劳动力市场分层效应的计量经济学模型,拓展了对隐性就业壁垒的理解。另一方面,该数据作为欧洲地区ILOSTAT核心指标的时间序列子集,被广泛整合至宏观劳动预测系统中,用于模拟人口结构变化对不活跃率的冲击。此外,围绕这一数据集引发了关于指标内注记(如方法修订与数据断裂)对长期趋势一致性影响的讨论,推动了对历史统计序列重构与清理方法的研究。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲劳动力市场中因性别、教育程度与残疾状态交织导致的非经济活动率差异,为包容性劳动力市场的量化评估提供了高颗粒度时序基准。当前前沿研究正依托ILOSTAT的统一口径,结合面板数据模型与机器学习方法,剖析残疾人群在不同教育层次下的就业排斥机制,并追踪后疫情时代社会保护政策对弱势群体劳动参与率的动态影响。尤其在欧盟《残疾人权利战略》与《欧洲就业指南》的框架下,此类分维度观测数据已成为评估社会包容干预效果、校准技能培训资源分配与预测长期失业风险的关键支撑,推动了从宏观统计描述向因果推断与政策模拟的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务