遇见数据集

electricsheepasia/asia-ilo-une-deap-sex-edu-mts-rt-unemployment-rate-by-sex-education-and-marital-sta

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲地区失业率数据,具体指标为“按性别、教育和婚姻状况分列的失业率(%)”。数据集覆盖35个亚洲国家,时间跨度为1970年至2025年,共包含93,109个观测值。数据通过ILO的REST API获取,并经过统一处理,遵循国际劳工统计学家会议(ICLS)的定义。数据集包含多个维度的分类变量,如性别(SEX_T、SEX_M、SEX_F、SEX_O)、教育水平(classif1)和婚姻状况(classif2),以及国家代码、年份、观测值和数据来源等列。数据以年度频率发布,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Asia重新打包,以方便机器学习使用,并采用CC-BY-4.0许可证。

This dataset contains unemployment rate data for Asia from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator Unemployment rate by sex, education and marital status (%). It covers 35 Asian countries, spans the years 1970 to 2025, and includes 93,109 observations. The data is sourced directly from the ILOSTAT REST API and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes disaggregation dimensions such as sex (SEX_T, SEX_M, SEX_F, SEX_O), education level (classif1), and marital status (classif2), along with columns for country codes, year, observed values, and data sources. Data is published at annual frequency and is suitable for tasks like tabular classification, regression, and time-series forecasting. Repackaged by Electric Sheep Asia for machine learning readiness, it is released under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-deap-sex-edu-mts-rt-unemployment-rate-by-sex-education-and-marital-sta 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接提取指标UNE_DEAP_SEX_EDU_MTS_RT的原始记录,并依据亚洲ISO3国家代码进行筛选,最终由Electric Sheep Asia重新打包为HuggingFace数据集。ILOSTAT对各国劳动力调查等微观数据实施统一协调,遵循国际劳工统计学家会议(ICLS)的定义标准,数据来源在source.label字段中予以标注,确保了从原始采集到聚合发布的可追溯性。
特点
数据集涵盖93,109条观测记录,横跨35个亚洲国家,时间序列自1970年延伸至2025年,以年度频率呈现失业率指标。其核心特征在于对性别、教育程度和婚姻状况的多维度交叉 disaggregation,支持按国家、年份、性别等维度进行细分分析,并附有观测状态标志和注释变量以提示数据质量与系列断裂等潜在问题,适用于表格分类、回归及时间序列预测等任务。
使用方法
研究者可通过HuggingFace的datasets库加载该数据集,利用pandas转换为数据框以执行筛选、聚合与可视化。典型操作包括按ref_area字段提取单一国家数据,按indicator列筛选特定指标并依时间排序生成折线图,或通过pivot_table构建国家与年份的交叉矩阵。数据亦可直接用于训练机器学习模型,完成失业率的分类或回归预测,所有使用均需遵循CC-BY-4.0许可并同时引用ILO原始来源与Electric Sheep Asia的再发布工作。
背景与挑战
背景概述
在全球劳动市场统计中,失业率是衡量经济健康与社会福祉的关键指标。国际劳工组织(ILO)自1919年成立以来,始终致力于推动体面工作与劳动统计标准化。ILOSTAT作为其核心数据库,汇集了200余个经济体的劳动力调查数据,为政策制定与学术研究提供权威依据。在此背景下,Electric Sheep Asia于2025年对ILOSTAT中亚洲地区失业率指标进行重新打包,发布了涵盖35个亚洲国家、1970至2025年间93,109条观测值的数据集,聚焦于按性别、教育程度和婚姻状况细分的失业率。该数据集填补了亚洲区域精细化劳动市场数据的空白,为探究教育水平、婚姻状态与性别对就业影响的交互效应提供了坚实基础,对劳动经济学与区域发展研究具有显著推动意义。
当前挑战
该数据集所应对的领域问题在于传统失业率统计往往忽略性别、教育及婚姻状况的多维交互作用,而揭示这些细粒度差异对于理解结构性失业与制定针对性政策至关重要。构建过程中,ILOSTAT需协调各国差异显著的劳动力调查方法、教育分类体系与婚姻状态定义,并通过国际劳工统计学家会议(ICLS)标准进行数据调和。此外,部分国家数据缺失或年份不连续,需依赖模型估算并标注来源,增加了数据的不确定性。数据集在处理异质性来源、确保跨国可比性以及维护时间序列一致性方面面临持续挑战,要求使用者审慎对待观测状态标志与分类注释,以保障分析结论的稳健性。
常用场景
经典使用场景
在劳动经济学与人口统计学的交汇处,该数据集承载着解析亚洲劳动力市场结构性失衡的使命。其经典使用场景聚焦于按性别、教育程度与婚姻状况三重维度解构失业率,研究者可借助面板数据分析,揭示不同人口群体在1970至2025年间的失业动态,例如女性高等教育者与已婚低技能劳动者在东亚与南亚地区的失业风险差异,为跨国比较与时间序列预测奠定实证基础。
衍生相关工作
围绕该数据集,已衍生出若干经典研究脉络:一是基于ILOSTAT多指标构建的亚洲劳动力市场脆弱性指数,用于预测经济危机时期的失业波动;二是融合机器学习方法(如梯度提升与时间序列Transformer)进行失业率短期预测的基准模型;三是将本数据与世界银行教育统计、联合国婚姻数据库链接,生成跨源面板,用以评估教育政策对性别失业差距的长期因果效应。
数据集最近研究
最新研究方向
在劳动经济学与性别研究的交汇处,该数据集正推动着对亚洲地区失业率结构性差异的精细化解析。近期研究借助其涵盖性别、教育程度与婚姻状况的多维交叉分类,深入探讨婚姻状态如何调节教育回报在劳动力市场中的性别不对称性,尤其聚焦于南亚与西亚地区女性已婚群体中高学历与高失业率并存的悖论。结合国际劳工组织对非标准教育层级的标注,学者们亦在修正传统人力资本模型中对非正规教育的低估偏差。与此同时,该数据集的长时序特性为评估金融危机、疫情冲击等外生事件对脆弱群体失业的动态影响提供了准实验设计基础,其分层聚合逻辑更被用于检验ILO劳动力调查方法学修订前后的序列断点,从而提升跨国比较的效度。这些方向共同强化了该数据集在监测可持续发展目标中体面劳动指标方面的实证价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务