遇见数据集

electricsheepasia/asia-ilo-une-3une-sex-age-dur-nb-youth-unemployment-by-sex-age-and-duration-thousan

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的青年失业数据,专门针对亚洲地区。数据集涵盖32个亚洲国家,时间跨度为1990年至2025年,共包含16,367个观测值。核心指标为UNE_3UNE_SEX_AGE_DUR_NB,即按性别、年龄和失业持续时间细分的青年失业人数(以千计)。数据按年度频率提供,并包含性别(总计、男性、女性)、年龄组和失业持续时间等分类维度。数据集经过ILO的标准化处理,采用国际劳工统计学家会议(ICLS)定义,确保数据可比性。数据来源包括劳动力调查、家庭收入调查、机构调查和行政记录等,并在source.label列中标注以追溯。数据集适用于表格分类、回归和时间序列预测等机器学习任务,旨在为研究亚洲青年失业趋势提供结构化、可分析的数据资源。

This dataset contains youth unemployment data from the International Labour Organization (ILO) ILOSTAT database, specifically focused on Asia. It covers 32 Asian countries, spanning the years 1990 to 2025, with 16,367 observations. The core indicator is UNE_3UNE_SEX_AGE_DUR_NB, which measures youth unemployment by sex, age, and duration (in thousands). Data is provided at annual frequency and includes disaggregation dimensions such as sex (total, male, female), age groups, and unemployment duration. The dataset is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions for comparability. Sources include labor force surveys, household income surveys, establishment surveys, and administrative records, flagged in the source.label column for traceability. It is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, offering structured, analyzable data for studying youth unemployment trends in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-3une-sex-age-dur-nb-youth-unemployment-by-sex-age-and-duration-thousan 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,通过REST API直接抽取原始指标数据,并依据ISO 3166-1 alpha-3代码筛选出亚洲32个国家的观测值。ILO统计部门依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查等微观数据进行统一协调与标准化处理,确保跨国可比性。数据以Parquet格式打包,由Electric Sheep Asia平台重新组织并发布,保留了完整的来源标签(source.label)以追踪数据溯源。
特点
数据集包含16,367条观测记录,覆盖1990年至2025年间32个亚洲国家的青年失业数据,按性别、年龄组和失业持续时间进行细致分层。核心指标为‘UNE_3UNE_SEX_AGE_DUR_NB’,提供性别(总、男、女)、年龄带(如15-29岁)及持续时间聚合类别等多维分类变量。每个观测点均附带观测状态标志、注释分类及来源说明,便于用户评估数据质量与可能的序列中断或方法学修订。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载数据集,并转换为Pandas DataFrame进行后续分析。典型用法包括按国家代码筛选特定国家的时间序列数据、对单一指标按时间排序进行可视化,或利用透视表构建国家×年份的观测值矩阵。数据集兼容分类、回归及时间序列预测任务,适用于劳动经济学研究、政策评估或机器学习建模中的特征工程。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的ILOSTAT数据库于2025年整理发布,并由Electric Sheep Asia团队在HuggingFace上重新封装。核心研究问题聚焦于亚洲地区青年失业人口按性别、年龄和失业持续时间的分布特征,涵盖32个国家1990至2025年的16,367条观测值。作为全球劳动统计的权威来源,该数据集为分析亚洲劳动力市场结构、评估青年就业政策效果及实现联合国可持续发展目标中的体面工作指标提供了关键数据支撑。其高时间分辨率和多维度分类属性,使其在劳动经济学、社会政策研究和国际比较分析领域具有重要影响力。
当前挑战
当前面临的核心挑战包括:第一,所解决的领域问题涉及青年失业率与性别、年龄及持续时间的复杂交互效应,传统统计模型难以捕捉非线性动态关系,需借助机器学习方法进行深入挖掘。第二,构建过程中面临显著挑战——各国劳动力调查方法、数据采集频率及质量参差不齐,导致部分观测值标记为不可靠(obs_status字段),且存在因方法论修订导致的序列中断(如note_indicator.label记录)。此外,多源数据整合时国际劳工组织虽优先选用最佳来源,但不同来源间的定义差异仍可能引入系统性偏差,需要研究者在使用时注意数据清洗与一致性检验。
常用场景
经典使用场景
青年失业问题一直是劳动经济学与发展研究领域的核心议题,尤其在人口结构年轻化特征显著的亚洲地区,这一议题更显紧迫。该数据集汇聚了国际劳工组织ILOSTAT统计体系中关于亚洲32国1990至2025年间青年失业规模的权威数据,并按照性别、年龄及失业时长进行了精细分层。其最经典的使用场景在于纵向时序分析与跨国横向比较,研究者可借此构建面板数据模型,系统考察不同国家青年失业率的演变轨迹与结构性差异,为理解亚洲劳动力市场的动态变迁提供量化基石。
解决学术问题
该数据集精准回应了学界在青年就业领域长期面临的三大学术难题:其一,弥补了亚洲地区长时段、多国别、细粒度青年失业数据匮乏的空白,使研究者得以突破单一国家或短期数据的局限;其二,通过性别和年龄维度的分类,为探究青年失业的性别鸿沟与代际分化提供了实证素材,推动了关于劳动力市场歧视与人力资本积累的理论探讨;其三,失业时长的引入使学者能够区分短期摩擦性失业与长期结构性失业,从而更准确地评估劳动政策干预的时效性与靶向性,对深化失业经济学理论具有重要方法论意义。
衍生相关工作
围绕该数据集,学术界和产业界已衍生出多项经典研究工作。在方法论层面,研究者常以此为基础构建多层级贝叶斯模型或机器学习预测框架,用于推测数据缺失年份的青年失业状况,并评估经济危机、疫情冲击等外生事件对不同国家失业率的异质性影响。在应用层面,有工作将该数据与教育统计、GDP增长率等宏观指标融合,开发出青年失业预警系统;另一些研究则利用其性别与时长分类特征,深入剖析劳动力市场的匹配效率与结构性矛盾。这些衍生工作不仅拓展了数据的使用边界,也反向推动了ILOSTAT统计体系的完善与数据采集标准的优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务