遇见数据集

electricsheepasia/asia-ilo-eip-3wap-sex-age-edu-rt-youth-inactivity-rate-by-sex-age-and-education

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲38个国家从1970年到2025年的青年非活跃率统计数据,按性别、年龄和教育程度进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖24,256个观测值,主要指标为“EIP_AP_SEX_AGE_EDU_RT”,表示青年非活跃率(百分比)。数据集提供了详细的列结构,包括国家代码、来源、指标、性别分类、年龄和教育分类、观测年份、观测值以及数据质量标志。这些数据经过ILO的标准化处理,适用于表格分类、回归和时间序列预测等机器学习任务。数据集由Electric Sheep Asia重新打包,采用CC-BY-4.0许可。

This dataset contains statistics on youth inactivity rates for 38 Asian countries spanning the period from 1970 to 2025, disaggregated by sex, age group, and educational attainment. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), with a total of 24,256 observations. The core indicator is "EIP_AP_SEX_AGE_EDU_RT", which denotes the youth inactivity rate (in percentage). The dataset features a comprehensive column structure including country code, data source, indicator name, sex category, age and education category, observation year, observed value, and data quality flag. All data have been standardized by the ILO, making them applicable to machine learning tasks such as tabular classification, regression, and time series forecasting. This dataset was repackaged by Electric Sheep Asia and is licensed under CC-BY-4.0.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-eip-3wap-sex-age-edu-rt-youth-inactivity-rate-by-sex-age-and-education 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口,直接获取指标代码为EIP_3WAP_SEX_AGE_EDU_RT的原始数据,并依据亚洲ISO3国家代码进行筛选过滤,最终汇聚成包含24,256条观测记录的整洁数据集。数据涵盖了1970年至2025年间38个亚洲国家及地区的青年不活跃率信息,并依据ILO的国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行了统一协调与标准化处理,每条记录均附有source.label字段以追溯其来源。
特点
数据集的核心特点在于其多维度的细粒度拆解能力,提供了按性别(sex)、年龄(age)和教育程度(education)划分的青年不活跃率百分比值,为深入分析劳动力市场结构提供了丰富视角。其观察值覆盖了从1970年到2025年的长时间序列,支持时间序列分析与趋势研判。数据质量方面,当同一国家同年份存在多个来源时,数据集采用了ILO选定的“最佳来源”以保证数据一致性,同时通过obs_status等字段标记数据可靠性,为用户提供了清晰的数据质量参考。
使用方法
用户可通过Hugging Face Datasets库以一行代码加载该数据集,并轻松转换为Pandas DataFrame进行后续分析。典型的应用场景包括:针对特定国家(如印度尼西亚IDN)的指标筛选与趋势绘图,以观察劳动力市场动态;基于时间与地区维度进行透视表操作,构建国家×年份的矩阵以进行横向比较;以及结合性别、教育等分类变量进行多维度聚合统计。该数据集设计为即用型(ML-ready),避免了繁琐的数据清洗与格式转换,尤其适合劳动经济学、社会政策研究以及亚洲区域经济分析领域的研究者与数据科学家快速开展实证研究。
背景与挑战
背景概述
在劳动经济学与青年发展研究领域,青年不活跃率(即未就业、未受教育或培训的青年比例)是衡量劳动力市场包容性与人力资源潜力的关键指标。该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)于2025年整理发布,并经Electric Sheep Asia重新封装,聚焦于亚洲38个国家1970至2025年间按性别、年龄及教育程度划分的青年不活跃率数据,包含24,256条观测值。数据集核心旨在解决亚洲地区劳动力市场中青年群体参与度的量化分析问题,为政策制定者与研究者提供统一、可比的时间序列数据。自发布以来,数据集为跨国比较、劳动力市场周期性波动研究及教育-就业衔接机制的实证分析提供了坚实基础,显著推动了亚洲青年发展议题的数据驱动研究范式。
当前挑战
该数据集所面临的挑战首先源于领域问题:青年不活跃率受多维度因素交织影响,如宏观经济周期、教育体系结构、性别文化差异及制度性歧视等,仅凭单一指标难以全面捕捉其动态演变机制,且亚洲各国数据采集标准与质量参差不齐。在构建过程中,主要挑战包括:1) 数据源异质性问题,因各国劳动力调查方法、样本框架及国际劳工统计学家会议(ICLS)定义的实施程度不同,需通过ILO的协调与最佳来源筛选来保障跨时间与国别的可比性;2) 高维分类变量(如教育类别非标准化标识)引起的标注稀疏性与缺失值处理难题;3) 年代跨度长达55年,期间指标定义、统计口径及数据连续性多次调整,需在重构序列的同时通过注释字段(如“断点”)标记方法论变更,从而维护时间序列分析的完整性与准确性。
常用场景
经典使用场景
该数据集收录了1970年至2025年间亚洲38个国家的青年不活跃率观测数据,共计24,256条记录,并按性别、年龄分组及教育水平进行了细致的分层描述。在学术研究中,它被广泛应用于面板数据分析和时间序列建模,用以探究亚洲地区青年劳动力市场参与模式的长期演变。研究人员常借助该数据集构建多水平回归模型,剖析社会经济因素对青年就业决策的异质性影响,或运用因果推断方法评估教育政策与性别平等倡议对青年劳动力闲置状况的干预效果。
衍生相关工作
该数据集衍生了一系列具有影响力的学术与实践工作。基于其分层结构与长期时间跨度,学者提出并验证了青年劳动力闲置率与教育回报率之间的非线性关系假说,催生了关于亚洲新兴经济体“教育过剩”与“技能错配”的讨论。此外,该数据集被整合进全球劳动力市场监测平台,支撑了多篇聚焦亚洲青年就业脆弱性的比较研究论文。实践中,它成为构建劳动力供需预测模型的基础输入,推动了面向性别敏感的劳动力市场分析方法的开发,并助力国际劳工组织更新其“青年劳动力利用不足”指标体系的测算标准。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区青年不活跃率的精细解构,通过性别、年龄与教育程度的交叉维度,为理解区域劳动力市场中的结构性就业挑战提供了关键视角。当前前沿研究正借助这类高粒度时序数据,分析后疫情时代青年就业复苏的异质性路径,并探究教育水平如何调节不同性别青年在经济波动中的劳动参与差异。结合ILO对劳动力利用不足指标的标准化框架,该数据有力支撑了关于数字转型与绿色转型对青年就业挤出效应的跨国比较研究,为制定更具包容性的青年就业政策提供了实证基础,尤其服务于联合国可持续发展目标8(体面工作与经济增长)在亚洲区域的精准监测。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务