遇见数据集

electricsheepasia/asia-ilo-une-deap-sex-edu-cct-rt-unemployment-rate-by-sex-education-and-citizenship

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲19个国家从1999年至2025年的失业率数据,重点关注按性别、教育和公民身份划分的失业率(%)。数据集共有4,331个观测值,涵盖一个核心指标:UNE_DEAP_SEX_EDU_CCT_RT(按性别、教育和公民身份划分的失业率)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过处理以仅包含亚洲国家。数据集采用表格格式,包含多列信息,如国家代码、国家名称、数据来源、指标代码、指标标签、性别分类、教育分类、公民身份分类、观测年份、观测值、观测状态等。数据按年度频率提供,并包含数据质量说明,例如某些观测值可能标记为不可靠。该数据集适用于表格分类、回归和时间序列预测等任务,可用于分析亚洲国家的失业趋势及其在不同人口统计维度(如性别和教育水平)上的差异。数据集由Electric Sheep Asia重新打包发布,采用CC-BY-4.0许可证。

This dataset contains unemployment rate data for 19 Asian countries from 1999 to 2025, focusing on the unemployment rate by sex, education, and citizenship (%). It includes 4,331 observations and covers one core indicator: UNE_DEAP_SEX_EDU_CCT_RT (unemployment rate by sex, education, and citizenship). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via its REST API, and processed to include only Asian countries. The dataset is in tabular format with multiple columns, such as country code, country name, data source, indicator code, indicator label, sex classification, education classification, citizenship classification, observation year, observed value, observation status, etc. Data is provided at annual frequency and includes data quality notes, e.g., some observations may be flagged as unreliable. The dataset is suitable for tasks such as tabular classification, regression, and time-series forecasting, and can be used to analyze unemployment trends in Asian countries and their variations across demographic dimensions like sex and education level. It is repackaged and published by Electric Sheep Asia under the CC-BY-4.0 license.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-deap-sex-edu-cct-rt-unemployment-rate-by-sex-education-and-citizenship 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口(https://rplumber.ilo.org/data/indicator?id=UNE_DEAP_SEX_EDU_CCT_RT)直接提取原始数据,并依据ISO3国家代码筛选出19个亚洲国家。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查等微观数据进行标准化调和,确保指标的可比性。数据经Electric Sheep Asia重新打包为Parquet格式,并附带完整的溯源标签,如source.label列记录原始调查来源,以增强透明度和可追溯性。
特点
数据集涵盖1999年至2025年间19个亚洲国家的4,331条观测记录,聚焦于按性别、教育程度和公民身份分类的失业率(%)。其核心特点在于多维度分解:性别分为总计、男性和女性;教育程度和公民身份作为分类变量提供细化层次。数据以年度频率呈现,包含丰富的元数据列,如观测状态标志(obs_status)和注释标签(note_classif等),用于提示数据可靠性或方法变更。此外,数据集整合了多个权威来源,并采用ILO筛选的“最佳来源”原则,确保每一条记录的质量。
使用方法
研究人员可通过Hugging Face的datasets库以一行代码加载数据集:load_dataset("electricsheepasia/asia-ilo-une-deap-sex-edu-cct-rt-unemployment-rate-by-sex-education-and-citizenship"),并转换为Pandas DataFrame进行灵活分析。典型应用包括筛选特定国家(如df[df["ref_area"] == "IDN"])、提取单个指标的时间序列并可视化,或通过pivot_table构建国家×年份矩阵以比较趋势。数据集支持表格分类、回归和时间序列预测等任务,适用于劳动经济学、移民研究及政策评估等领域。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计数据的系统化建设,其ILOSTAT数据库涵盖就业、失业、工资及体面劳动等核心指标,为政策制定与学术研究提供关键实证基础。在此基础上,Electric Sheep Asia于2025年对ILOSTAT原始数据进行ML-ready重构,推出亚洲地区按性别、教育程度与公民身份分列的失业率数据集。该数据集覆盖19个亚洲国家1999至2025年间共4,331条观测记录,旨在揭示移民身份与教育水平交互作用下劳动力市场结果的异质性,为区域移民融入政策与教育回报研究提供精细化的数据支撑。
当前挑战
该数据集所回应的核心领域问题在于:如何量化亚洲多国劳动力市场中性别、教育程度与公民身份三重维度交织下的失业风险差异。其构建过程面临若干实质性挑战——原始数据源自各国劳动力调查与住户调查,ILO虽以国际劳工统计学家会议定义进行调和,但统计口径与抽样方法的国家间差异仍导致跨国可比性受限;部分国家年份数据存在序列中断或方法学修订,观测状态标注中可见“不可靠”与“序列断裂”等技术标记;公民身份分层数据仅在有相应分类的国家和年份发布,造成面板数据结构不平衡,对跨国比较与时序建模构成显著约束。
常用场景
经典使用场景
在劳动经济学与移民研究的交汇领域,该数据集最典型的应用场景在于刻画亚洲19国失业率的性别、教育程度与公民身份三重分层格局。研究者借助其1999至2025年的长时序观测值,构建多维面板数据模型,考察不同国籍群体在劳动力市场中的边缘化程度,并借助教育维度识别技能错配与结构性失业的传导路径。此类分析通常以时间序列预测或跨国比较回归为方法框架,服务于就业政策评估与移民融入效应的实证检验。
实际应用
在政策实践层面,国际组织与亚洲各国劳工部门可利用该数据集识别外籍劳工与本国公民失业率差距显著的年份与国家,进而调整工作许可、职业培训与社会保障政策。研究机构可基于国别时间序列预测失业率走势,辅助宏观经济预警;企业人力资源部门亦可参考教育分层数据评估特定技能供给缺口。数据集的API直采与Parquet封装设计,使得政策分析人员能够以较低技术门槛快速生成国别报告与可视化仪表板。
衍生相关工作
围绕该数据集已衍生出若干经典性工作方向:其一,基于其性别与教育维度开展的亚洲女性移民就业脆弱性研究,揭示了公民身份对女性失业率的放大效应;其二,将ILOSTAT多指标合并构建的亚洲劳动力市场不平等指数,被用于区域一体化政策评估;其三,Electric Sheep Asia以统一模式重打包的系列数据集,推动了亚洲ML-ready数据层建设,并为迁移学习与跨数据集泛化实验提供了基准。这些工作共同强化了该数据集在移民劳动研究中的基础设施地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务