遇见数据集

electricsheepasia/asia-ilo-une-deap-sex-age-geo-rt-unemployment-rate-by-sex-age-and-rural-urban-areas

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲38个国家从1970年至2025年的失业率数据,总计50,471个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤为亚洲国家代码。数据集的核心指标为“UNE_DEAP_SEX_AGE_GEO_RT”,即按性别、年龄和城乡地区划分的失业率(百分比)。数据列包括国家代码、国家名称、数据来源、指标代码、性别分类(如总计、男性、女性)、年龄分类、城乡地区分类、观测年份、观测值、数据状态标志以及相关注释。数据集支持表格分类、回归和时间序列预测任务,适用于劳动力市场分析、经济研究和机器学习应用。数据以年度频率发布,经过ILOSTAT标准化处理,确保数据可比性和可追溯性。

This dataset contains unemployment rate data for 38 Asian countries from 1970 to 2025, with a total of 50,471 observations. The data is sourced from the International Labour Organization (ILO) ILOSTAT statistical database, retrieved via API and filtered to Asian country codes. The core indicator is UNE_DEAP_SEX_AGE_GEO_RT, representing the unemployment rate by sex, age, and rural/urban areas (%). Columns include country codes, country names, data sources, indicator codes, sex disaggregation (e.g., total, male, female), age classification, rural/urban classification, observation year, observed values, data status flags, and related notes. The dataset supports tabular classification, regression, and time-series forecasting tasks, suitable for labor market analysis, economic research, and machine learning applications. Data is published at annual frequency and standardized by ILOSTAT for comparability and traceability.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-deap-sex-age-geo-rt-unemployment-rate-by-sex-age-and-rural-urban-areas 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的中央统计数据库ILOSTAT,依托其标准化数据管道,通过REST API接口直接提取指标代码为UNE_DEAP_SEX_AGE_GEO_RT的原始记录,并依据ISO3国家代码筛选出亚洲区域数据。ILOSTAT采用国际劳工统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查等微观数据进行统一调和,每项观测均标注来源标签以实现可追溯。Electric Sheep Asia在此基础上进行重新封装,将数据标准化为Parquet格式并发布至HuggingFace平台,形成覆盖38个亚洲国家、时间跨度自1970年至2025年、共计50,471条观测的规整数据集。
特点
该数据集以性别、年龄组及城乡区域为多维 disaggregation 维度,精细刻画亚洲各国失业率的异质性特征。数据以年度频率呈现,涵盖SEX_T、SEX_M、SEX_F、SEX_O四类性别分类,并借助classif1与classif2字段支持年龄、教育、城乡等交叉分层。每条记录附有obs_status质量标志及详尽的注释字段,可识别临时性、不可靠或方法修订等数据状态。数据集具有明确的表格化结构,涵盖国家代码、来源标签、指标代码、时间及观测值等核心列,便于直接用于分类、回归及时间序列预测等机器学习任务。
使用方法
研究者可通过HuggingFace的datasets库以一行代码加载该数据集,并借助to_pandas()方法转换为数据框进行后续分析。典型用法包括按ref_area列筛选特定国家(如印度尼西亚IDN),或按indicator列提取单一指标并依时间排序以绘制时间序列图。用户亦可利用pivot_table函数将数据重塑为国家与年份的交叉矩阵,从而观察失业率的时空演变格局。数据集支持表格分类、表格回归及时间序列预测等多类任务,配合schema中的标签列与注释信息,可灵活构建特征工程流程,满足劳动经济学与区域发展研究的多样化需求。
背景与挑战
背景概述
在国际劳工组织(ILO)持续推动全球劳动力市场统计标准化的背景下,ILOSTAT作为其核心统计数据库,长期为各国就业与失业研究提供权威数据支撑。该数据集由Electric Sheep Asia于2025年重新封装发布,源于ILO官方REST API,涵盖38个亚洲国家自1970年至2025年间共计50,471条观测记录,聚焦按性别、年龄及城乡地域划分的失业率指标。其核心研究问题在于揭示亚洲地区劳动力市场中不同人口群体的失业异质性,为区域就业政策制定与不平等研究提供精细化数据基础,对劳动经济学与区域发展研究具有重要参考价值。
当前挑战
该数据集所应对的领域问题在于,失业率统计常因各国劳动力调查方法、年龄分组标准及城乡定义不一而难以跨国比较,ILO虽通过ICLS定义进行协调,但数据仍存在来源碎片化与口径差异。构建过程中,数据源自各国劳动力调查、家庭收入调查及行政记录,覆盖不均导致部分国家年份缺失严重,且多个来源并存时仅保留‘最佳来源’,可能引入选择偏差;观测状态标志中‘不可靠’与‘序列中断’等标注亦反映原始数据质量参差。此外,性别维度中SEX_O类别样本稀疏,城乡分类仅部分年份可获,进一步加剧了细分维度分析的挑战。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇处,该数据集凭借其对亚洲38个国家、跨越1970至2025年逾五万条观察记录的系统汇编,成为探究失业率性别差异与城乡分化的经典数据基础。研究者常将其用于构建按性别、年龄组及城乡地域交叉分类的失业率面板,通过时间序列建模揭示不同人群在宏观经济周期中的脆弱性差异,尤其关注青年群体与女性劳动力在城乡二元结构中的就业波动特征,为理解亚洲劳动力市场的结构性变迁提供微观计量支撑。
解决学术问题
该数据集有效回应了劳动经济学中长期存在的若干学术难题,包括失业率统计口径跨国家可比性不足、城乡失业差距的时序演化机制模糊以及性别与年龄交互效应难以量化等。借助ILO统一协调的ICLS定义框架与来源标注体系,研究者得以在控制方法论差异的前提下开展跨国比较分析,检验诸如“城乡失业鸿沟随经济发展收敛”等理论假说。其意义在于将碎片化的国别劳动力调查数据整合为标准化面板,显著降低了跨国实证研究的门槛,并为亚洲区域就业政策评估提供了可复现的数据基准。
衍生相关工作
围绕该数据集已衍生出一系列经典研究工作,涵盖基于面板固定效应模型的城乡失业收敛性检验、利用年龄-时期- cohort分解方法揭示青年失业的世代效应、以及结合性别分层理论探讨女性劳动参与率与失业率之间的非对称关系。一些研究进一步将其与ILOSTAT其他指标如就业部门结构与工时数据链接,构建多维劳动力市场脆弱性指数;亦有工作以该数据集为基准,对机器学习方法在失业率预测中的适用性进行跨国家验证。这些衍生成果持续拓展着亚洲劳动力市场比较研究的深度与广度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务