遇见数据集

electricsheepeurope/europe-ilo-eip-3wap-sex-age-dsb-rt-youth-inactivity-rate-by-sex-age-and-disability-st

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含19,417个观测值,覆盖35个欧洲国家,时间跨度为2002年至2025年,专注于“其他劳动力利用不足指标”。具体指标为“按性别、年龄和残疾状况划分的青年非活动率(%)”,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至欧洲国家。数据集包括国家代码、来源、指标、性别、年龄和残疾状况分类、观测年份、观测值及其状态等字段,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,经过ILO的标准化处理,并包含数据质量说明,如使用最佳来源和分类字段的非空条件。

This dataset contains 19,417 observations across 35 European countries, spanning from 2002 to 2025, focusing on Other measures of labour underutilization. The specific indicator is Youth inactivity rate by sex, age and disability status (%), sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to European countries. It includes fields such as country codes, sources, indicators, sex, age and disability status classifications, observation years, observed values, and their statuses, suitable for tasks like tabular classification, regression, and time-series forecasting. The data is published at annual frequency, harmonized by ILO, and comes with data quality notes, such as the use of the best source and non-null conditions for disaggregation columns.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-3wap-sex-age-dsb-rt-youth-inactivity-rate-by-sex-age-and-disability-st 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,通过REST API直接抽取指标代码为EIP_3WAP_SEX_AGE_DSB_RT的原始观测数据,并依据欧洲ISO3国家代码进行地理过滤。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据来源在source.label列中予以标记以确保可追溯性。最终数据集收录了2002年至2025年间覆盖35个欧洲国家的19,417条年度观测记录,并以Parquet格式打包,便于机器学习和数据分析场景的直接调用。
使用方法
用户可通过HuggingFace的datasets库以load_dataset()函数一键加载数据集,并将其转换为Pandas DataFrame进行后续操作。典型用法包括依据ref_area字段过滤特定国家的数据,或按indicator字段筛选单一指标进行时间序列可视化。此外,用户可利用pivot_table方法将数据重塑为国家×年份的矩阵形式,便于回归分析或分类建模。数据集还支持按sex、classif1(年龄)和classif2(失能状态)等维度进行分组聚合,充分满足劳动经济学与社会科学研究中的多样分析需求。
背景与挑战
背景概述
在全球劳动力市场研究中,青年群体因身心发展阶段特殊而面临更高的就业脆弱性,其非经济活动率(即既不就业也不接受教育的比例)是衡量社会包容性与人力资本积累的关键指标。由国际劳工组织(ILO)统计部门基于ICLS国际标准定义的“其他劳动利用不足衡量指标”中,青年非活动率按性别、年龄及残疾状况的细分数据尤为稀缺。该数据集于2025年由Electric Sheep Europe团队从ILOSTAT官方API重新整合包装,覆盖35个欧洲国家2002至2025年的19,417条观测值。其核心贡献在于首次以统一格式公开提供跨国家、跨时间维度的多维细分序列,为研究残疾青年群体劳动力边缘化问题、评估欧盟社会政策效果以及构建预测模型提供了标准化、高可用性的数据基础。
当前挑战
构建该数据集所应对的领域挑战主要源于青年非活动率的多维异质性:残疾状况与性别、年龄的交叉效应导致传统汇总指标无法揭示结构性排斥模式,而欧洲各国在残疾定义标准、调查方法及数据质量上的差异(如source.label中标注的多种来源)使得跨国比较困难重重。数据构建过程中,团队需处理ILOSTAT API返回的多源数据辨析(如最佳来源选择逻辑)、不同国家年份间观测值密度不均(如GBR有756条而LUX仅619条)、分类变量缺失值与标识符歧义(如classif2字段在无关维度下为空)等实际问题。此外,残疾状况的非标准定义(如note_classif.label字段反映的C14:6260问题)与方法论修订导致的序列断层(如note_indicator.label中的I11:264标记)进一步增加了数据清洗与重标定的技术难度。
常用场景
经典使用场景
作为国际劳工组织(ILO)旗舰数据库ILOSTAT的核心子集,该数据集提供了欧洲35个国家2002至2025年间按性别、年龄及残疾状况分层的青年非经济活动率(%),共计19,417条观测记录。其经典使用场景聚焦于跨国、长时序的劳动力利用不足问题的动态监测,研究者可借助时间序列分析或面板数据回归,刻画青年群体在劳动市场边缘徘徊的结构性特征,尤其擅长捕捉不同社会身份(如残疾青年女性)在劳动力参与上的叠加劣势。
解决学术问题
该数据集有效回应了劳动经济学与社会政策研究中关于‘灰心丧气劳动者’及‘隐性失业’的量化困境。传统失业率指标往往低估青年就业障碍的真实程度,而本数据集通过ILO统一口径下的非经济活动率,为检验‘残疾—性别—年龄’三重歧视假说提供了高颗粒度证据。在学术上,它助力于评估欧洲各国福利制度、反歧视法案和积极劳动力市场政策(ALMP)对边缘人群的劳动供给效应,推动包容性增长理论的实证落地。
实际应用
在实际决策中,数据集被广泛用于欧盟委员会及各国劳动部门的社会监测仪表盘,助力政策制定者定位‘未就业、未就学、未培训’(NEET)群体的时空分布热点。非政府组织与智库可借助其分维度指标,针对残疾青年女性等脆弱群体设计精准干预方案,例如职业康复培训或远程工作推广。此外,该数据还被保险公司与跨国企业的人力资源部门用于评估区域劳动力韧性,优化人才储备与投资布局。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲青年因性别、年龄及残疾状况而分层的经济活动不参与率,为劳动市场包容性研究提供了细颗粒度的时序面板数据。当前前沿方向在于利用机器学习模型对ILOSTAT规范化的分类变量(如残疾状态、年龄分组)进行交叉分析,以揭示隐蔽的就业弱势群体动态;结合时间序列预测技术,追踪2002-2025年间欧洲各国青年劳动参与模式的演变,并与后疫情时代就业复苏政策的热点议题相呼应。其结构性字段设计支持多维分解研究,为评估社会经济政策对青年及残疾人群体的异质性影响奠定了可靠的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务