遇见数据集

electricsheepasia/asia-ilo-une-deap-sex-edu-rt-unemployment-rate-by-sex-and-education

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲39个国家从1970年至2025年的失业率数据,重点关注按性别和教育程度分类的统计指标。数据集共有15,580个观测值,核心指标为“UNE_DEAP_SEX_EDU_RT”(按性别和教育程度划分的失业率百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过标准化处理,涵盖国家代码、年份、观测值、数据来源、性别分类(总计、男性、女性等)和教育程度分类等字段。数据集适用于表格分类、回归分析和时间序列预测等机器学习任务,旨在为亚洲劳动力市场研究提供结构化、可机读的开放数据。

This dataset contains unemployment rate data for 39 Asian countries from 1970 to 2025, focusing on statistics disaggregated by sex and education. It comprises 15,580 observations, with the core indicator being UNE_DEAP_SEX_EDU_RT (unemployment rate by sex and education in percentage). Sourced from the International Labour Organization (ILO)s ILOSTAT database via its REST API, the data is harmonized and includes fields such as country codes, year, observed values, data sources, sex classification (total, male, female, etc.), and education classification. The dataset is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, providing structured, machine-readable open data for labor market research in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-deap-sex-edu-rt-unemployment-rate-by-sex-and-education 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,从ILOSTAT REST API直接提取指标UNE_DEAP_SEX_EDU_RT数据,并根据亚洲ISO3国家代码进行筛选,最终整理为包含15,580条观测值的表格数据。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,来源信息记录于source.label列以保障可追溯性,随后由Electric Sheep Asia重新打包发布。
特点
数据集涵盖39个亚洲国家,时间跨度为1970至2025年,包含15,580条观测值,聚焦于按性别和受教育程度分类的失业率指标。数据以年度频率呈现,提供ref_area、sex、classif1等多个维度字段,并附带观测状态和质量注释,便于识别数据可靠性。其表格结构适配分类、回归及时间序列预测等机器学习任务,采用cc-by-4.0许可协议。
使用方法
通过HuggingFace的datasets库以load_dataset函数加载,并转换为pandas数据框进行后续分析。用户可依据ref_area字段筛选特定国家,或针对单一指标按时间排序绘制时间序列图,亦可利用pivot_table将数据重塑为国家与年份的矩阵形式。数据集支持表格分类、回归及时间序列预测等任务,便于开展跨国失业率比较与趋势研究。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动力市场统计体系的构建与完善,其ILOSTAT数据库已成为劳动经济学研究领域最具权威性的跨国数据来源。该数据集由Electric Sheep Asia于2025年基于ILOSTAT官方API重新封装发布,覆盖39个亚洲国家、时间跨度自1970年至2025年,包含15,580条按性别与教育程度细分失业率的观测记录。数据集回应了发展经济学中关于教育回报异质性与性别劳动力市场分割的核心议题,为探究亚洲地区不同受教育群体失业率的结构性差异提供了长时序、跨国别的量化基础,对制定精准就业政策与推动可持续发展目标中的体面劳动议程具有重要参考价值。
当前挑战
该数据集所直面的领域问题在于:现有跨国劳动力统计多聚焦于总体失业率,鲜有将性别与教育维度同时纳入长时序比较框架,致使亚洲地区教育扩张与失业率变动之间的复杂关联难以被精确刻画。构建过程中的核心挑战包括:各国劳动力调查在抽样设计、教育分类标准及失业定义上存在显著异质性,ILO虽依据国际劳工统计学家会议决议进行协调,但分类口径的统一仍面临数据缺失与断点问题;部分国家观测年份稀疏且存在序列中断,教育层级聚合方式不一,加之观测状态标志与来源注释信息繁杂,对数据的清洗、对齐与建模提出了较高要求。
常用场景
经典使用场景
在劳动经济学与教育社会学的交叉领域,该数据集最为经典的使用场景在于构建跨国家、长时段的面板数据模型,以辨识性别与教育水平双重分层下失业率的动态演化规律。研究者常将其用于分解失业率变动的结构性因素,例如通过固定效应模型控制国家异质性后,考察不同教育层级劳动力在市场中的相对脆弱性。时间序列预测亦为常见用途,借助1970至2025年的连续观测,对亚洲各国未来失业趋势进行情景模拟,为劳动力市场预警提供量化基底。
解决学术问题
该数据集有效回应了劳动经济学中长期存在的若干研究难题:其一,缺乏统一口径的跨国可比失业统计,使得亚洲区域内的比较研究长期受制于数据异质性;其二,性别与教育交互效应在失业研究中的系统性检验不足,该数据集通过SEX与EDU的双重分类变量填补了这一空白;其三,为教育回报率衰减与技能错配假说提供了可检验的宏观证据。其意义在于将ILO的标准化协调方法引入可复现的机器学习流程,推动了劳动统计数据的二次分析范式。
衍生相关工作
基于该数据集或其底层ILOSTAT指标,已衍生出一系列经典工作:包括亚洲开发银行关于性别就业差距的系列国别报告、ILO自身发布的《亚洲就业与社会展望》中的教育维度分析章节,以及多篇发表于《World Development》《International Labour Review》的计量研究,这些工作利用该数据检验了教育扩张与失业率之间的非线性关系。在机器学习社区,该数据集被用于基准测试表格回归与时间序列预测模型,如基于LightGBM与Temporal Fusion Transformer的失业率预测竞赛。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务