遇见数据集

electricsheepasia/asia-ilo-une-deap-sex-edu-cbr-rt-unemployment-rate-by-sex-education-and-place-of-bi

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲国家按性别、教育水平和出生地划分的失业率(百分比)的表格型数据集,来源于国际劳工组织(ILO)的ILOSTAT数据库。它包含4,258个观测值,覆盖19个亚洲国家,时间跨度为1999年至2024年,聚焦于一个独特指标UNE_DEAP_SEX_EDU_CBR_RT(失业率按性别、教育水平和出生地划分)。数据通过ILOSTAT REST API获取,并过滤为亚洲国家,采用ICLS定义进行标准化处理。数据集结构包括国家代码、指标代码、性别分类(如总计、男性、女性)、教育水平和出生地分类、观测年份、观测值(失业率百分比)以及数据质量标志(如可靠性状态)。数据为年度频率,并包含来源追踪信息,适用于表格分类、回归和时间序列预测等机器学习任务。数据集由Electric Sheep Asia重新打包,以促进亚洲数据的ML就绪使用。

This dataset is a tabular dataset on unemployment rates by sex, education level, and place of birth (percentage) for Asian countries, sourced from the International Labour Organization (ILO) ILOSTAT database. It contains 4,258 observations across 19 Asian countries, spanning from 1999 to 2024, focusing on a single indicator UNE_DEAP_SEX_EDU_CBR_RT (Unemployment rate by sex, education and place of birth). Data is pulled directly from the ILOSTAT REST API and filtered to Asia ISO3 country codes, harmonized using ICLS definitions. The dataset schema includes country codes, indicator codes, sex disaggregation (e.g., total, male, female), education and place of birth classifications, observation year, observed value (unemployment rate percentage), and data quality flags (e.g., reliability status). It is annual frequency and includes source traceability, suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting. The dataset is repackaged by Electric Sheep Asia to facilitate ML-ready usage of Asian data.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-deap-sex-edu-cbr-rt-unemployment-rate-by-sex-education-and-place-of-bi 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API接口直接提取指标UNE_DEAP_SEX_EDU_CBR_RT的原始数据,并依据ISO3国家代码筛选出19个亚洲国家。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行标准化调和,数据来源在source.label列中予以标注,以确保可追溯性。Electric Sheep Asia对提取后的数据进行重新打包,统一schema并发布为HuggingFace数据集。
特点
数据集涵盖1999至2024年间19个亚洲国家的4258条观测记录,聚焦按性别、教育程度和出生地划分的失业率指标。数据以表格形式组织,包含ref_area、sex、classif1、classif2、time、obs_value等字段,支持性别(总计、男性、女性)等多维度分解。观测值附有状态标志和质量注释,如暂定值、不可靠数据或序列中断说明,为分析提供透明度。年度频率数据以Parquet格式存储,便于高效加载与处理。
使用方法
研究者可通过HuggingFace的datasets库调用load_dataset函数加载数据集,并转换为Pandas DataFrame进行灵活操作。典型用法包括按国家代码筛选特定国家数据、按指标和时间排序生成时间序列图、或通过透视表构建国家与年份的矩阵。数据集适用于表格分类、回归和时间序列预测任务,支持对亚洲地区失业率的结构性分析。使用时应遵循CC-BY-4.0许可,并同时引用ILO原始来源和Electric Sheep Asia的再包装工作。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计的标准化与可比性建设,其ILOSTAT数据库汇集了涵盖就业、失业、工资及体面劳动等维度的跨国指标。在此背景下,Electric Sheep Asia于2024年对ILOSTAT原始数据进行系统性重打包,构建了聚焦亚洲地区的失业率数据集,收录19个国家自1999年至2024年的4,258条观测记录,按性别、教育程度与出生地三重维度交叉细分。该数据集的核心研究问题在于揭示移民身份与教育水平如何交互影响亚洲各国劳动力市场的失业风险,为移民融入、教育回报及性别不平等研究提供高粒度面板数据,对区域劳动政策评估具有重要参考价值。
当前挑战
该数据集所应对的领域问题在于传统失业统计往往掩盖了移民群体内部因教育分层与性别差异而产生的异质性失业风险,亟需细粒度交叉分类数据加以刻画。构建过程中的挑战则体现为多重维度:其一,亚洲各国劳动力调查的问卷设计、教育分类标准与出生地采集口径存在显著异质性,ILO虽以国际劳工统计学家会议定义进行调和,但残余不可比性仍存;其二,部分国家数据年份稀疏且存在序列断裂,如缅甸与阿富汗仅覆盖单一年份,削弱了时序建模的连续性;其三,观测状态标记(如“不可靠”)提示部分估计值精度有限,对下游分析的稳健性构成约束。
常用场景
经典使用场景
在劳动经济学与人口学的交叉研究中,该数据集通常被用于刻画亚洲地区失业率的性别与教育梯度,并进一步引入出生地维度以捕捉移民身份对劳动力市场表现的调节效应。研究者借助其提供的1999至2024年跨国年度观测,可构建面板数据模型,考察不同教育层次下男女失业率差异如何随出生地(本土出生与外国出生)而变化。其经典用法包括按国家、年份、性别、教育程度和出生地分类汇总,绘制失业率演变趋势图,或利用时间序列分解方法识别失业率的结构性断点与周期性波动。
解决学术问题
该数据集有效回应了劳动经济学中关于移民经济融入与教育回报异质性的核心学术争论。传统研究多局限于单一国家或仅关注性别与教育维度,难以系统比较出生地身份在亚洲多元劳动力市场中的作用。本数据集通过整合ILO标准化调查数据,为检验“移民失业惩罚”假说、教育对失业风险的缓冲效应以及性别与出生地的交互影响提供了跨国可比证据。其意义在于推动对亚洲移民劳动力市场边缘化的量化评估,并为国际组织制定包容性就业政策提供实证基础。
衍生相关工作
基于该数据集,已有研究衍生出多个方向的经典工作。部分学者将其与ILO其他指标(如工资、工时)链接,构建亚洲移民劳动力市场脆弱性指数。另一些工作运用机器学习方法对失业率进行多维度预测,并比较性别与出生地维度的预测偏差。还有研究将其与人口普查数据融合,分析教育错配与出生地歧视的交互机制。这些衍生工作不仅拓展了ILOSTAT数据的应用边界,也为Electric Sheep Asia系列数据集的进一步开发提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务