遇见数据集

electricsheepasia/asia-ilo-une-3une-sex-age-geo-nb-youth-unemployment-by-sex-age-and-rural-urban-area

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲32个国家的12,747个观测值,时间跨度为1970年至2025年,专注于“按性别、年龄和城乡地区划分的青年失业人数(千)”这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过标准化API获取,并经过处理以覆盖亚洲地区。数据集以表格形式组织,包含国家代码、性别(总计、男性、女性)、年龄组(如15-29岁)、城乡类型、年份和失业人数等列,并附带数据来源和质量标记。它旨在支持表格分类、回归和时间序列预测等任务,适用于劳动力市场研究和机器学习应用。

This dataset contains 12,747 observations of Unemployment data across 32 Asia countries, spanning 1970–2025, covering 1 distinct indicator: Youth unemployment by sex, age and rural / urban areas (thousands). It is sourced from ILOSTAT, the ILOs central statistics database, and includes disaggregated data by sex, age groups, and geographic areas, with annual frequency and quality flags for reliability. The dataset is structured in a tabular format and is repackaged for machine learning use cases such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-3une-sex-age-geo-nb-youth-unemployment-by-sex-age-and-rural-urban-area 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API直接提取指标代码为UNE_3UNE_SEX_AGE_GEO_NB的青年失业数据,并依据亚洲ISO3国家代码进行过滤筛选。原始数据来自各国劳动力调查、家庭收入调查、机构调查及行政记录,经ILO依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理。数据集中每条观测记录均附有来源标签,确保数据的可追溯性。最终由Electric Sheep Asia团队以Parquet格式重新封装,形成适用于机器学习与时间序列分析的规整数据集。
使用方法
用户可通过HuggingFace Datasets库中的load_dataset函数一键加载该数据集,并轻松转换为Pandas DataFrame进行后续分析。典型使用场景包括按国家筛选子集(如印度尼西亚)、针对单一指标进行时间序列可视化,或利用透视表构建国家×年份的矩阵面板。分类列如性别和地域可用于分组聚合,而obs_status与note_*字段则为数据质量评估提供关键参考。该数据集格式规整,可直接用于回归、分类及时间序列预测等机器学习任务,亦便于与ILOSTAT其他指标数据合并开展跨维度劳动经济学研究。
背景与挑战
背景概述
青年失业问题作为衡量劳动力市场健康程度的关键指标,尤其在亚太地区兼具人口红利与结构性转型的复杂背景下,其时空演变规律的系统性量化分析需求日益迫切。该数据集由国际劳工组织(ILO)统计司依托ILOSTAT数据库于2025年整合发布,并经Electric Sheep Asia机构重新封装,覆盖1970年至2025年间32个亚洲国家的12,747条观测记录,聚焦于按性别、年龄及城乡地域划分的青年失业率(单位:千人)。核心研究问题在于填补亚洲发展中国家青年就业数据的碎片化空白,为多维度异质性分析提供标准化基础。其影响力体现在赋能联合国可持续发展目标(SDG)中体面工作指标的跨国监测,并支撑劳动经济学中关于青年劳动力流动、区域不平等与政策干预效果的实证研究。
当前挑战
该数据集面对的首要领域挑战是亚洲各国青年失业统计口径的差异性,例如不同国家对“青年”年龄界定(15-24岁或15-29岁)及城乡分类标准的不一致,导致跨国可比性受限。构建过程中遭遇的挑战包括:多源劳动调查数据(劳动力调查、住户调查等)的整合协调,需依赖国际劳工统计会议(ICLS)定义进行方法学统一,但原始调查中的“最佳来源”选择策略可能引入偏差;时间序列的非平衡性,如阿富汗、也门等冲突国家观测年份稀疏,而数据集中部分观测值被标记为“不可靠”(obs_status=U),提示估计精度受数据质量约束;此外,高维分类变量(性别、年龄组、城乡类型)的交叉分组使样本在某些细分单元中出现稀疏性,为时空建模与推断方法提出额外挑战。
常用场景
经典使用场景
该数据集收录了1970年至2025年间亚洲32个国家青年失业率的精细结构化信息,按性别、年龄组及城乡地域进行多维度分层。研究人员可以借此构建面板数据模型或时间序列回归,探究亚洲劳动力市场中青年就业的结构性变迁。其经典用法在于将观测值转化为国家-年份矩阵,进而开展跨国比较分析、趋势分解或政策效应评估,尤其适用于追踪不同人口亚群体在经济发展周期中的失业波动特征。
解决学术问题
数据集精准回应了劳动经济学与人口地理学中若干长期悬而未决的学术难题,例如青年失业的性别差异如何随城市化进程演变、城乡青年在劳动力市场中的机会分化机制,以及宏观经济冲击对不同年龄-性别群体的异质性影响。通过提供跨时近半世纪且经过国际劳工组织标准化处理的微观汇总数据,研究者能够更可靠地识别亚洲发展中经济体特有的结构性失业根源,从而推动区域就业政策理论从描述性统计向因果推断转型。
实际应用
在实际应用中,该数据集已成为国际组织与各国劳工部门开展就业诊断和规划的重要工具。政策制定者可利用其细颗粒度的城乡与性别分组信息,精准锁定失业高发人群,设计有针对性的青年就业促进方案、技能培训项目或创业扶持政策。此外,数据集还与可持续发展目标中体面劳动与经济增长指标密切关联,支撑亚洲各国监测其SDG进展并进行区域间对标的实证依据。
数据集最近研究
最新研究方向
随着全球青年就业危机加剧与可持续发展目标(SDG)第八项议程的推进,该数据集为亚洲地区青年失业问题的时空异质性研究提供了高分辨率数据基础。当前前沿方向聚焦于利用该面板数据构建机器学习模型,以量化性别、年龄阶层与城乡区位对失业风险的交互影响,并借助时间序列预测方法揭示后疫情时代亚洲劳动力市场复苏的非均衡路径。其中,ILOSTAT遵循国际劳工统计学家会议(ICLS)标准进行数据统一化处理,确保跨国可比性,这为探讨非正规就业、数字转型下青年失业陷阱等热点议题提供了实证锚点。该数据集覆盖32国长达55年的观测,不仅赋能政策制定者精准识别弱势群体与干预窗口,也推动了基于因果推断的劳动经济学与计算社会科学的交叉融合,对实现体面劳动与包容性增长具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务