遇见数据集

electricsheepasia/asia-ilo-une-3une-sex-age-cat-nb-youth-unemployment-by-sex-age-and-categories-of-un

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲29个国家从1999年至2025年的青年失业数据,共计10,724个观测值,涵盖一个独特指标:“按性别、年龄和失业类别分类的青年失业人数(千)”。数据来源于国际劳工组织(ILO)的中央统计数据库ILOSTAT,通过其REST API获取,并过滤至亚洲国家。数据集提供了详细的分类维度,包括性别(总计、男性、女性)、年龄组(如15-29岁青年段)和失业类别(如总计)。每行数据包含国家代码、国家名称、数据来源、指标代码、指标名称、分类变量、观测年份、观测值(以千为单位)、观测状态标志以及相关注释。数据以年度频率发布,并经过ILO的标准化处理,确保符合国际劳工统计学家会议(ICLS)的定义。数据集适用于表格分类、表格回归和时间序列预测等任务,旨在为研究者和开发者提供机器学习就绪的亚洲劳动力市场数据。

This dataset contains youth unemployment data spanning from 1999 to 2025 for 29 countries across Asia, comprising a total of 10,724 observations, and covers a distinct indicator: youth unemployment figures (in thousands) classified by gender, age group and unemployment category. The data is sourced from ILOSTAT, the central statistical database of the International Labour Organization (ILO), acquired via its REST API, and filtered to retain only Asian countries. The dataset offers detailed classification dimensions, including gender (total, male, female), age groups (e.g., the 15–29 youth cohort) and unemployment categories (e.g., total). Each data row includes country code, country name, data source, indicator code, indicator name, classification variable, observation year, observed value (in thousands), observation status flag, and associated annotations. The data is released annually and has been standardized by the ILO to align with the definitions set forth by the International Conference of Labour Statisticians (ICLS). This dataset is applicable for tasks such as tabular classification, tabular regression and time series forecasting, and is designed to provide machine learning-ready Asian labor market data for researchers and developers.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-3une-sex-age-cat-nb-youth-unemployment-by-sex-age-and-categories-of-un 数据集图片
构建方式
本数据集通过调用国际劳工组织(ILO)旗下ILOSTAT数据库的REST API接口,获取原始指标‘UNE_3UNE_SEX_AGE_CAT_NB’(即按性别、年龄和失业类别划分的青年失业人数,单位为千),然后依据亚洲地区ISO3国家代码进行地理过滤,最终整合形成。原始数据来源于各国劳动力调查、家计调查及行政记录等多元渠道,并经ILO依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理。Electric Sheep Asia团队在此过程中对数据结构进行了重新封装,确保其符合机器学习友好型数据集规范,并以Parquet格式发布。
特点
该数据集共计包含10,724条观测记录,覆盖亚洲29个国家和地区,时间跨度从1999年至2025年,包含青年失业这一核心指标。其显著特点在于提供了丰富的维度拆分,包括性别(男性、女性、总计)、年龄区间(如15-29岁青年群体)以及失业类别(如总失业、长期失业等),使得研究者能够从多角度深入剖析亚洲青年失业问题的结构性特征。此外,数据来源标注清晰,每条记录均附有源调查代码与标签,便于追溯与质量评估。
使用方法
用户可通过HuggingFace Datasets库便捷加载此数据集:首先使用`load_dataset`函数获取数据,并利用`to_pandas()`方法将其转换为Pandas DataFrame以进行后续分析。针对特定国家的研究,可依据`ref_area`字段进行条件筛选;开展时间序列分析时,可按`time`列排序并绘制`obs_value`随时间变化的趋势图;对于面板数据分析,可通过`pivot_table`将数据结构重塑为国家×年份矩阵,便于开展跨国比较与计量建模。数据集各字段的语义清晰,相关状态标记(如数据是否可靠、方法是否修订)也为用户进行数据清洗和异常值处理提供了参考依据。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年通过其核心劳动统计数据库ILOSTAT创建,并由Electric Sheep Asia团队重新整合封装。聚焦于亚太地区29个国家1999年至2025年间青年失业问题的性别、年龄及失业类型细分数据,包含超过1万条观测记录。作为ILO推动体面劳动与可持续发展目标(SDG)监测的重要数据产品,该数据集为分析亚洲青年劳动力市场的结构性特征提供了标准化、可比的时间序列基础,尤其服务于区域就业政策制定与跨国劳动经济比较研究。
当前挑战
领域挑战方面,青年失业统计面临多重复杂性:不同国家间失业定义与劳动调查方法差异导致数据可比性受限,非正规就业与隐性失业等边缘群体难以被传统调查完整捕捉。构建挑战则包括:多源异构数据(劳动力调查、行政记录等)的时序衔接与断点校正,部分国家早期年份数据稀疏或带有可靠性标记(如'Unreliable'状态码需审慎处理),以及细粒度分组(如性别×年龄×失业类型)在稀疏维度下统计推断的稳健性问题。
常用场景
经典使用场景
在劳动力经济学与公共政策研究领域,该数据集最经典的应用场景在于对亚洲青年失业问题的结构性剖析。通过提供按性别、年龄段和失业类型细分的年度观察值,研究者能够在时间序列和截面两个维度上识别青年失业的演变规律。例如,借助数据中的多维分类变量——sex、classif1和classif2,可构建年龄-性别-失业类型的联合分布矩阵,从而区分摩擦性失业与结构性失业在不同人口群体中的表现。这种精细化的分析框架,使得从宏观劳动力市场波动到微观个体就业障碍的层层递进得以实现,为后续建模提供了坚实的数据基础。
实际应用
在实际应用层面,该数据集已成为国际组织与亚洲各国制定青年就业政策的决策支持工具。ILO借助其数据与联合国可持续发展目标中的体面工作(Decent Work)指标进行对标,定期发布区域青年就业趋势报告,识别出需要优先干预的国家或群体。国家层面的劳动部门则利用该数据诊断特定性别和年龄段的失业症结——例如,南亚国家可依据女性青年失业率的独立序列,设计针对性的职业培训与创业扶持计划。此外,发展金融机构与智库在进行贷款条件评估或项目影响评价时,也常以此数据作为基线参考,通过对比政策实施前后的失业率变动,量化干预措施的实际效果。
衍生相关工作
围绕这一数据集,学术界已衍生出一系列具有影响力的研究成果。在理论深化方面,有学者结合ILO的年度调查与面板计量方法,提出了青年失业的'滞后效应'模型,揭示早期失业经历如何通过人力资本折旧和个人心理冲击,长期抑制未来收入潜力。在交叉学科领域,该数据被整合进教育回报率研究,用于评估不同教育层次的青年在劳动力市场中的转换成本。技术层面,各类时间序列预测模型——如基于LSTM的序列建模和状态空间分解方法——纷纷以此数据为基准,对比不同国家青年失业率的短中期走势。这些衍生工作不仅丰润了劳动经济学的理论大厦,也为AI与社会科学研究的深度融合开辟了新的实证路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务