遇见数据集

electricsheepasia/asia-ilo-une-3wap-sex-age-dsb-rt-youth-unemployment-to-population-ratio-by-sex-age

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自23个亚洲国家的3297个失业数据观测值,时间跨度为1996年至2024年,涵盖一个独特的指标。具体来说,它记录了按性别、年龄和残疾状况分类的青年失业人口比率(%),数据源自国际劳工组织(ILO)的ILOSTAT数据库,并经过处理和标准化,以支持机器学习应用。数据集以表格形式提供,包括国家代码、年份、观测值、数据来源和分类维度等列,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 3,297 observations of Unemployment data across 23 Asia countries, spanning 1996–2024, covering 1 distinct indicators. Specifically, it records the youth unemployment-to-population ratio by sex, age and disability status (%), sourced from the International Labour Organization (ILO) ILOSTAT database, processed and normalized to support machine learning applications. The dataset is provided in tabular format, including columns such as country codes, years, observed values, data sources, and disaggregation dimensions, suitable for tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-3wap-sex-age-dsb-rt-youth-unemployment-to-population-ratio-by-sex-age 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接获取指标代码为UNE_3WAP_SEX_AGE_DSB_RT的数据,并依据亚洲ISO3国家代码进行过滤筛选。ILOSTAT依据国际劳动统计学家会议(ICLS)定义对原始调查微观数据进行协调统一,数据来源均标注于source.label列以确保可追溯性。最终整合为涵盖23个亚洲国家、时间跨度从1996年至2024年的3,297条观测记录,形成一份高度结构化的劳动力统计数据集。
特点
该数据集的核心特色在于其精细的多维度分解能力,提供了按性别、年龄组和残疾状况划分的青年失业人口比率指标。数据包含丰富的分类变量,如sex(总、男、女)、classif1(年龄波段,如15-29岁)和classif2(残疾状况),并附有详细的来源编码、观测状态标记及系列中断等注解信息。此外,数据集已由Electric Sheep Asia进行标准化封装,格式为Parquet,便于机器学习工作流的直接加载与分析。
使用方法
用户可通过HuggingFace的datasets库,使用load_dataset()函数一键加载该数据集,并自动转换为Pandas DataFrame格式进行分析。推荐的操作包括按国家代码(如ref_area == 'IDN')筛选特定国家的时间序列数据,或利用pivot_table构建国家×年份的观测值矩阵。由于数据集为表格形式且包含时间列(time),尤其适用于时序预测、分类或回归任务。所有数据遵循CC-BY-4.0许可,使用时需标注ILO原始来源及Electric Sheep Asia的再封装贡献。
背景与挑战
背景概述
在全球劳动力市场的复杂图景中,青年群体因缺乏经验与技能积累,其失业问题长期受到国际劳工组织等权威机构的高度关注。该数据集由国际劳工组织统计司(ILOSTAT)于2024年创建,后经Electric Sheep Asia团队整理并发布于HuggingFace平台,旨在为亚洲地区青年失业率与人口之比的跨维度分析提供标准化数据基础。核心研究问题聚焦于性别、年龄及残疾状态对青年就业状况的差异化影响,数据集覆盖23个亚洲国家长达28年的观测记录,共计3297条数据。依托ILOSTAT严格遵循的国际劳动统计学家会议定义,该数据集为区域劳动力市场的不平等与包容性研究提供了关键支撑,在劳动经济学、公共政策及可持续发展目标监测领域具有重要影响力。
当前挑战
该数据集所应对的核心领域挑战在于,传统的青年失业率指标往往掩盖了不同性别、年龄层及残疾状态群体间的结构性差异,导致政策干预难以精准触达目标人群。构建过程中的主要挑战包括:第一,各国劳动力调查的原始数据在定义(如残疾状态的界定)、调查方法和覆盖范围上存在显著差异,数据集的同质性面临考验。第二,时间序列数据中存在因方法修订而产生的断点,数据的一致性维护成为难点。第三,部分数据点被标记为“不可靠”,导致在时序预测与回归任务中需额外进行噪声过滤与插补处理。此外,多源数据整合时最佳来源的选择标准虽已明确,但在缺乏统一元数据的情况下,数据溯源与质量审计仍构成挑战。
常用场景
经典使用场景
该数据集的核心应用在于对亚洲23个国家1996至2024年间青年失业与人口比率的时空建模与趋势分析。研究者可借助其按性别、年龄和残疾状况细分的分层结构,进行面板数据回归、时间序列预测与异质性效应检验,尤其适合探究经济发展、教育政策与劳动力市场波动对脆弱就业群体的差异化冲击,为亚洲区域劳动经济学提供了标准化的参照基准。
实际应用
在国际组织与政府决策层面,该数据集被用于监测联合国可持续发展目标(SDG)中体面工作的进展,尤其是目标8.5和8.6对青年就业的量化要求。亚洲各国劳动部门可依据其细分指标,动态调整职业培训资源配置、优化残疾人就业支持计划,并评估金融危机或公共卫生事件(如新冠疫情)对青年就业率的瞬时冲击,为制定包容性增长政策提供数据驱动的实证依据。
衍生相关工作
基于该数据集,衍生出多项经典工作,包括利用分层贝叶斯模型估计残疾青年失业的空间聚集特征、采用混合效应模型分解性别与年龄对失业比率的贡献度,以及结合IMF或世界银行经济指标构建预测劳动力供给弹性的面板工具变量回归。此外,部分研究将其与教育成就数据融合,通过结构方程模型揭示人力资本积累与青年就业脆弱性的因果链条,拓展了劳动经济学中可行能力理论的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务