遇见数据集

electricsheepeurope/europe-ilo-eip-3eip-sex-age-stu-nb-youth-outside-the-labour-force-by-sex-age-and-scho

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含39,434个观测值,涉及按性别、年龄和就学状态划分的未参与劳动力青年(千人)数据,覆盖39个欧洲国家,时间跨度为1983年至2025年,涵盖1个独立指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主题为其他劳动力未充分利用指标,包括按性别、年龄和就学状态分类的青年未参与劳动力情况统计。数据集经过Electric Sheep Europe重新打包,以表格形式提供,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 39,434 observations of Youth outside the labour force by sex, age and school attendance status (thousands) data across 39 Europe countries, spanning 1983–2025, covering 1 distinct indicator. It is sourced from the ILOSTAT database of the International Labour Organization (ILO), focusing on Other measures of labour underutilization, and includes statistics on youth not in the labour force disaggregated by sex, age, and school attendance status. The dataset is repackaged by Electric Sheep Europe in tabular format, suitable for tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-eip-3eip-sex-age-stu-nb-youth-outside-the-labour-force-by-sex-age-and-scho 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心数据库,通过REST API直接提取标识符为EIP_3EIP_SEX_AGE_STU_NB的指标数据,并依据欧洲ISO3国家代码进行地理筛选。原始数据基于各国劳动力调查、家庭收入调查等微数据,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一清洗与标准化处理,最终汇聚成覆盖39个欧洲国家、横跨1983年至2025年的面板数据,共包含39,434条观测记录。数据重构过程中保留了完整的溯源信息列用于标记数据来源,确保每一条观测均可追溯至原始调查。
特点
该数据集聚焦于欧洲青年未参与劳动力市场的状况,按性别、年龄段和在校状况三个维度进行精细拆分,提供了独一无二的分类层级。其特色在于包含性别分类(总计、男性、女性)、年龄组(如15-29岁青年波段)以及教育出勤状态等结构化字段,研究者可针对特定亚群进行深度剖析。数据质量方面标注了观测状态(如不可靠)以及序列中断等注释信息,为时间序列分析提供了必要的质量警示。完整覆盖39个欧洲国家、长达42年的年度观察值,使跨国纵向比较成为可能。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据集,并转换为Pandas DataFrame进行后续分析。典型用法包括按国家代码筛选特定国家数据、针对单一指标按时间排序绘制趋势图,或利用pivot_table函数构建国家×年份的数值矩阵以进行面板数据回归。该数据集同时支持分类任务和回归任务,亦适用于时间序列预测,其规范的表格化结构使得数据清洗和特征工程工作变得简洁高效。
背景与挑战
背景概述
在全球劳动力市场研究中,青年群体因教育、技能错配或结构性失业等原因脱离劳动力市场的现象备受关注。国际劳工组织(ILO)的ILOSTAT数据库作为全球劳动统计的权威来源,系统收录了200多个经济体的就业与失业指标。该数据集由Electric Sheep Europe于2025年基于ILOSTAT API重新整合发布,聚焦欧洲39个国家1983年至2025年间青年(15-29岁)按性别、年龄与在校状况划分的劳动力外人口数据(单位:千人),共计39,434条观测值。其核心研究问题在于量化分析欧洲青年不活跃状态的时空分布与人口学特征,为评估各国青年就业政策成效及比较研究提供标准化、细粒度的面板数据,对劳动经济学、社会政策与人口统计学领域具有重要的基准价值。
当前挑战
该数据集所应对的领域挑战在于,传统劳动力失业率指标难以全面刻画青年因就学、家庭照料或丧失信心等非就业因素而游离于劳动力市场之外的现象,需要细分的劳动力利用不足指标来揭示隐性失业与社会排斥问题。在构建过程中,数据集面临着多源微观调查数据的跨国可比性挑战,ILO虽采用国际劳工统计学家会议(ICLS)定义进行协调,但不同国家劳动力调查的问卷设计、抽样框架与年度频率差异仍可能导致指标口径的微小偏差;此外,时间序列中因方法论修订(如 break in series)和质量标记(如观测值不可靠)引发的数据断裂与不确定性,要求使用者审慎处理长期趋势分析中的结构断点与时序一致性难题。
常用场景
经典使用场景
在劳动经济学与公共政策研究领域,该数据集最为经典的应用场景在于构建时间序列与面板数据模型,用于揭示欧洲各国青年群体(15-29岁)在性别、年龄及在校状态等多维度下脱离劳动力市场的结构性特征。研究者可借助近四十年的年度观测值,通过固定效应或随机效应模型,深入剖析经济周期、教育扩张、社会保障制度等宏观因素对青年劳动参与率的差异化影响。
衍生相关工作
围绕该数据集衍生出一系列创新性研究工作,诸如结合机器学习算法对青年劳动力外溢行为进行预测归因,以及利用空间计量模型揭示邻近国家间劳动力市场政策的示范效应。部分学者更以此为基础,构建了‘学校-工作转换’的多状态马尔可夫链模型,量化教育持续扩张对青年劳动参与轨迹的长期重塑。这些工作进一步推动了劳动统计从描述性向诊断性转变,深化了对欧洲青年边缘化机制的理解。
数据集最近研究
最新研究方向
当前,该数据集聚焦于欧洲青年劳动力市场边缘群体的精细化刻画,通过性别、年龄与在校状态的三维交叉分类,为研究“NEET”(不在教育、就业或培训中的青年)现象提供了高颗粒度的时间序列支撑。依托国际劳工组织ILOSTAT的权威来源和1983年至2025年横跨39国的长周期覆盖,这一资源正被广泛用于构建预测青年劳动参与率的机器学习模型,并与欧盟“欧洲青年保障”政策评估形成联动。在疫情后青年就业脆弱性凸显的背景下,该数据集助力学者追踪结构性失业与教育缓冲效应的动态演变,成为连接宏观劳动力统计与微观社会风险预警的关键数据桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务