遇见数据集

electricsheepasia/asia-ilo-une-3wap-sex-age-stu-rt-youth-unemployment-to-population-ratio-by-sex-age

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了亚洲地区青年失业人口与总人口比例的数据,按性别、年龄和上学出勤状态进行细分(单位:百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,覆盖了36个亚洲国家,时间跨度为1970年至2025年,共包含13,750个观测值。数据集的核心指标是UNE_3WAP_SEX_AGE_STU_RT,即青年失业人口与总人口比例。数据通过ILOSTAT REST API获取,并经过处理以仅包含亚洲国家的ISO3代码。数据集的结构包括多个列,如国家代码(ref_area)、国家名称(ref_area.label)、数据来源(source和source.label)、指标代码和名称(indicator和indicator.label)、性别分类(sex和sex.label)、年龄和上学状态分类(classif1和classif2及其标签)、观测年份(time)、观测值(obs_value)以及数据状态标志(obs_status和obs_status.label)等。数据质量方面,数据为年度频率,ILO在多个来源中选择最佳来源,且分类列仅在指标发布细分数据时非空。该数据集适用于表格分类、回归和时间序列预测等任务,可用于分析亚洲青年失业趋势。数据集由Electric Sheep Asia重新打包,以提供统一的、机器学习就绪的数据层,方便研究人员和开发者使用。

This dataset contains data on the youth unemployment-to-population ratio in Asia, disaggregated by sex, age, and school attendance status (in percentage). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), covering 36 Asian countries from 1970 to 2025, with 13,750 observations. The core indicator is UNE_3WAP_SEX_AGE_STU_RT, which represents the youth unemployment-to-population ratio. Data was retrieved via the ILOSTAT REST API and filtered to include only Asian country ISO3 codes. The dataset schema includes columns such as country code (ref_area), country name (ref_area.label), data source (source and source.label), indicator code and name (indicator and indicator.label), sex disaggregation (sex and sex.label), age and school status classifications (classif1 and classif2 with their labels), observation year (time), observed value (obs_value), and data status flags (obs_status and obs_status.label), among others. In terms of data quality, the data is annual frequency, with ILO selecting the best source when multiple sources exist for the same country-year, and disaggregation columns are non-null only when the indicator publishes that breakdown. This dataset is suitable for tabular classification, regression, and time-series forecasting tasks, enabling analysis of youth unemployment trends in Asia. It has been repackaged by Electric Sheep Asia to provide a unified, ML-ready data layer for researchers and developers.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-3wap-sex-age-stu-rt-youth-unemployment-to-population-ratio-by-sex-age 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API直接提取指标代码为‘UNE_3WAP_SEX_AGE_STU_RT’的原始数据,并依据亚洲国家ISO 3166-1 alpha-3代码进行过滤。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一协调处理,并在‘source.label’列中标注数据来源以确保可追溯性。最终,经Electric Sheep Asia重新打包后,形成包含13,750条观测值、覆盖36个亚洲国家、时间跨度为1970年至2025年的结构化数据集。
特点
该数据集聚焦亚洲青年失业人口比率这一核心指标,按性别、年龄及就学状态进行精细分层,包含‘sex’(总、男、女)、‘classif1’(如15-29岁年龄段)、‘classif2’(教育出勤状态)等维度,便于多维度交叉分析。数据采用年度频率发布,且设有‘obs_status’标记(如‘U’表示不可靠)及‘note_indicator’记录序列中断、方法论修订等注解,保障数据质量透明。此外,数据集已统一以Parquet格式存储并上传至HuggingFace,保持了ILO原始数据的完整性,同时优化了机器学习的即用性。
使用方法
用户可通过HuggingFace的`datasets`库直接加载数据集,仅需一行代码`ds = load_dataset("electricsheepasia/asia-ilo-une-3wap-sex-age-stu-rt-youth-unemployment-to-population-ratio-by-sex-age")`即可获取,并将其转换为Pandas DataFrame进行后续操作。典型用法包括按国家代码(如‘IDN’)过滤特定国家数据,或对‘UNE_3WAP_SEX_AGE_STU_RT’指标按时间排序绘制时序曲线,亦可利用pivot_table构建以年份为行、国家为列的矩阵表,便于区域对比与趋势分析。该数据集尤其适用于劳动经济学研究、政策评估及时间序列预测建模。
背景与挑战
背景概述
青年失业问题作为衡量劳动力市场活力与社会稳定的关键指标,长期以来受到国际组织与各国政策制定者的高度关注。为此,国际劳工组织(ILO)通过其ILOSTAT统计数据库,整合了涵盖全球200余经济体的劳动力调查与行政记录数据。在此背景下,2025年由Electric Sheep Asia团队基于ILOSTAT官方API重新打包并发布的本数据集,专注于亚洲36个国家1970至2025年间青年失业人口比率的精细统计。该数据集囊括13,750条观测记录,按照性别、年龄组及就学状态进行分层呈现,为深入探究亚洲区域青年劳动力市场的结构演变提供了标准化、机器就绪的研究基础。其对政策评估、国别比较及时间序列建模贡献显著,推动了区域劳动经济学与可持续发展目标监测的实证研究。
当前挑战
该数据集所应对的核心领域挑战在于,亚洲各国劳动力统计体系因地而异,数据采集频次、方法论标准(如国际劳工统计学家会议定义的应用)及调查质量参差不齐,导致跨时空可比性受限。数据集构建过程中需从ILOSTAT API中以统一代码提取数据,并过滤至预设的亚洲国家列表,面临多来源数据调和、分类维度对齐(如性别、年龄组的细粒度拆分)及元数据标注一致性等诸多技术难题。此外,部分观测值标有“不可靠”或“方法修订”标记,提示数据存在断点和质量波动,使用者需审慎处理缺失值与异常来源,以避免对分析结论的影响。
常用场景
经典使用场景
在劳动经济学与公共政策研究领域,该数据集的核心价值在于支持跨国青年失业率的结构性分析。通过提供按性别、年龄组和在校状态细分的失业人口比率观测值,研究者能够运用面板数据模型考察东南亚、南亚及中东等36个亚洲经济体在1970至2025年间的青年劳动力市场动态。典型应用包括利用固定效应模型隔离国家特定异质性,或借助时间序列分解方法识别青年就业危机的周期性成分与长期趋势。此外,该数据集亦可服务于生存分析框架,用于评估不同教育参与度下青年从学校向职场过渡的持续性风险。
实际应用
在实际决策支持层面,该数据集为国际组织、各国劳动部门及非政府机构提供了精准监测与预警工具。基于这些细粒度时序数据,政策制定者可构建动态青年失业指数,识别高脆弱性亚群(如未在校的年轻女性),并据此调整技能培训与就业缓冲方案的资源分配。世界银行与亚洲开发银行的项目评估中,该数据已被用作衡量教育-就业衔接项目成效的基准线。在私营领域,人力资源服务机构借助这些指标优化跨境人才配置策略,而金融分析机构则将其纳入国家主权信用风险评估框架中的劳动力维度。
衍生相关工作
基于此数据集衍生的学术工作已形成清晰脉络。在方法论层面,学者发展了融合国家固定效应与反事实推演的半参数估计器,用以剥离亚洲青年失业中不可观测的体制性影响。实证方面,多项研究借该数据检验了教育投入回报率在不同性别与年龄段的递减模式,并揭示了在校状态如何缓冲经济衰退对青年就业的冲击。更前沿的工作尝试将其与夜间灯光遥感数据或移民流量统计相链接,构建多模态深度学习模型,以实现对非正式就业与跨国务工流向的联合预测。这些衍生工作不仅深化了对亚洲青年劳动力市场的理解,也为国际比较劳动统计领域提示了数据融合的新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务