遇见数据集

electricsheepasia/asia-ilo-une-tune-sex-age-geo-nb-unemployment-by-sex-age-and-rural-urban-areas-thou

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含50,769个观测数据,涉及亚洲38个国家的失业情况,按性别、年龄和城乡地区细分(单位:千人),时间跨度为1970年至2025年。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取并过滤至亚洲国家。数据集涵盖一个核心指标:UNE_TUNE_SEX_AGE_GEO_NB,即按性别、年龄和城乡地区划分的失业人数(千人)。数据模式包括国家代码、年份、观测值、性别分类、年龄分类、区域类型、数据来源和质量标志等列,适用于表格分类、回归和时间序列预测等任务。数据已由Electric Sheep Asia重新打包,以方便机器学习使用,并遵循CC-BY-4.0许可证。

This dataset contains 50,769 observations of unemployment data across 38 Asia countries, spanning 1970 to 2025, disaggregated by sex, age, and rural/urban areas (in thousands). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via its REST API and filtered to Asia country codes. The dataset focuses on one key indicator: UNE_TUNE_SEX_AGE_GEO_NB, which represents unemployment by sex, age and rural/urban areas (thousands). The schema includes columns such as country code, year, observed value, sex classification, age classification, area type, data source, and quality flags, making it suitable for tabular classification, regression, and time-series forecasting tasks. The data has been repackaged by Electric Sheep Asia for ML-ready use and is licensed under CC-BY-4.0.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-tune-sex-age-geo-nb-unemployment-by-sex-age-and-rural-urban-areas-thou 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的中央统计数据库ILOSTAT,经由Electric Sheep Asia团队重新封装而成。构建过程严格遵循可复现的数据工程流程:首先通过ILOSTAT的REST API接口端点(https://rplumber.ilo.org/data/indicator?id=UNE_TUNE_SEX_AGE_GEO_NB)直接拉取原始指标数据,继而依据ISO 3166-1 alpha-3国家代码筛选出38个亚洲经济体,时间跨度自1970年延伸至2025年。原始调查微观数据经国际劳工统计学家会议(ICLS)定义进行协调与标准化处理,最终以Parquet列式格式存储并发布,总计涵盖50,769条观测记录。
特点
数据集在空间与时间维度上均展现出显著的广度与纵深,囊括38个亚洲国家自1970年至2025年逾半个世纪的失业统计信息。其核心特征在于多维度的细分架构:以性别(总计、男性、女性及其他)为基本分层,同时纳入年龄组别(青年与成年人)以及城乡区域类型(全国、农村、城市)等分类变量,构成精细化的交叉分析框架。数据表结构包含来源标签、指标代码、观测状态标志(如临时性、不可靠)及方法学注释等元数据字段,为溯源与质量评估提供了充分的信息支撑。
使用方法
研究人员可借助HuggingFace datasets库以单行代码便捷加载数据,通过load_dataset函数获取数据集对象后转换为Pandas DataFrame进行后续分析。典型应用场景包括:按国家代码筛选特定经济体的失业序列,利用时间列排序绘制单一指标的时间趋势图,或通过透视表操作将数据重塑为国家与年份交叉的矩阵形式,以支持面板数据分析。此外,该数据集适用于表格分类、表格回归及时间序列预测等机器学习任务,亦可服务于劳动经济学领域的描述性统计与计量建模研究。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于推动全球劳动统计的标准化与可比性。ILOSTAT作为其核心统计数据库,汇集了200余个经济体的劳动力调查数据,为监测可持续发展目标中的体面劳动指标提供了关键支撑。在此背景下,亚洲地区失业数据的系统性整理尤显迫切。该数据集由Electric Sheep Asia于2025年基于ILOSTAT REST API重新打包发布,涵盖1970至2025年间38个亚洲国家、按性别、年龄及城乡区域细分的失业观测值,共计50,769条记录。这一工作填补了亚洲区域劳动市场微观数据在机器学习就绪格式方面的空白,为探究性别差异、青年失业及城乡二元结构等议题提供了高颗粒度的实证基础,对劳动经济学与区域发展研究具有显著的参考价值。
当前挑战
该数据集所回应的核心领域问题在于,如何精准刻画亚洲多元社会经济背景下失业现象的性别、年龄与城乡异质性,并支持跨国跨时的比较分析。其构建过程面临多重挑战:各国劳动力调查在抽样设计、变量定义及数据收集频率上存在显著差异,ILO虽依国际劳工统计学家会议决议进行调和,但观测状态标志仍揭示出部分数据具有临时性或可靠性不足的特征;城乡分类在若干国家缺乏统一标准,导致序列可比性受损;此外,时间跨度逾五十年,方法论修订与序列断裂时有发生,缺失值与非常规年龄分组进一步增加了建模复杂度。如何在保留数据原始语义的同时,为预测与分类任务提供稳健的输入,构成该数据集应用中的持续性难题。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交融处,该数据集凭借其跨越半世纪、覆盖38个亚洲国家、按性别年龄及城乡维度细分的失业观测值,成为刻画亚洲劳动力市场结构性变迁的经典面板资源。研究者惯常将其用于构建国别-年份-人口组的动态失业矩阵,以剖析青年与成年、男性与女性、乡村与城市之间的失业率差异及其时序演化规律,并以此为基础检验发展经济学中的劳动力市场分割假说。
实际应用
在政策制定与国际发展实务中,该数据集被广泛用于监测亚洲各国失业状况的实时演变,支撑劳动力市场政策的精准制定与效果评估。国际组织与政府机构可借助其城乡与性别细分数据,定位脆弱群体并设计靶向就业干预措施;同时,该数据亦为金融机构与智库评估区域经济风险、预测人力资本需求以及规划社会保障支出提供了关键量化依据。
衍生相关工作
基于该数据集的再封装与开放获取,衍生出一系列围绕亚洲劳动力市场的可复现研究及机器学习应用。典型的后续工作包括跨国失业率的时序预测模型、性别失业差距的因果推断分析,以及城乡失业空间异质性的聚类探索;此外,该数据集亦被整合进更广泛的ILOSTAT衍生数据生态,推动了关于非标准就业测度与可持续发展目标进展评估的方法论创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务