遇见数据集

electricsheepasia/asia-ilo-une-tune-sex-dur-geo-nb-unemployment-by-sex-duration-and-rural-urban-areas

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个关于亚洲国家失业统计的表格数据集,由国际劳工组织(ILO)的ILOSTAT数据库提供,并经Electric Sheep Asia重新打包。数据集包含11,168个观测值,覆盖26个亚洲国家,时间跨度为1990年至2025年,专注于一个独特指标:按性别、持续时间和城乡区域划分的失业数据(以千计),指标代码为UNE_TUNE_SEX_DUR_GEO_NB。数据以年度频率提供,使用ILO的ICLS定义进行标准化,并包括国家代码、来源、性别、分类变量、观测年份和观测值等详细列。数据集还包含数据质量说明,如使用最佳来源和分类列的可用性。它适用于表格分类、回归和时间序列预测任务,旨在为研究人员和开发者提供机器学习就绪的劳动统计数据。

This dataset is a tabular dataset on unemployment statistics for Asian countries, sourced from the ILOSTAT database of the International Labour Organization (ILO) and repackaged by Electric Sheep Asia. It contains 11,168 observations across 26 Asian countries, spanning from 1990 to 2025, focusing on a single indicator: unemployment by sex, duration, and rural/urban areas (in thousands), with the indicator code UNE_TUNE_SEX_DUR_GEO_NB. The data is provided at an annual frequency, standardized using ILOs ICLS definitions, and includes detailed columns such as country codes, sources, sex, classification variables, observation year, and observed values. The dataset also includes data quality notes, such as the use of the best source and the availability of disaggregation columns. It is suitable for tabular classification, regression, and time-series forecasting tasks, aiming to provide machine learning-ready labor statistics for researchers and developers.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-tune-sex-dur-geo-nb-unemployment-by-sex-duration-and-rural-urban-areas 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的中央统计数据库ILOSTAT,通过其REST API接口直接拉取指标UNE_TUNE_SEX_DUR_GEO_NB的原始记录,并依据ISO3国家代码筛选出亚洲区域数据。ILOSTAT本身依托各国劳动力调查、家庭收入调查及行政记录,遵循国际劳工统计学家会议(ICLS)标准对微观数据进行统一化处理,确保跨国可比性。Electric Sheep Asia在此基础上进行二次封装,将数据标准化为Parquet格式并发布至HuggingFace平台,最终形成涵盖26个亚洲国家、1990至2025年间的11168条观测记录。
特点
数据集以性别、失业持续时间及城乡区域为核心 disaggregation 维度,包含性别(总计、男性、女性)与分类变量(如持续时间、区域类型)的细粒度拆解。时间跨度为1990至2025年,覆盖26个亚洲国家,观测值以千人为单位。数据附带来源标签、观测状态标记及注释字段,便于追溯原始调查信息与识别方法学变更。其表格结构支持分类、回归及时间序列预测等多类任务,且所有字段均以英文标注,具备清晰的模式定义。
使用方法
研究者可通过HuggingFace的datasets库以一行代码加载数据集,并直接转换为Pandas DataFrame进行探索性分析。典型操作包括按国家代码筛选子集、提取单一指标的时间序列并可视化、或透视生成国家×年份矩阵以观察跨国趋势。数据亦可直接用于训练机器学习模型,完成失业率的分类、回归或预测任务。使用时需注意年度频率限制及源数据中标注的可靠性标识,并遵循CC-BY-4.0许可协议,同时引用ILO原始来源与Electric Sheep Asia的再封装工作。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计监测,其ILOSTAT数据库整合了各国劳动力调查与行政记录,构成就业与失业研究的权威数据基石。本数据集由Electric Sheep Asia于2025年重新封装发布,源自ILOSTAT的UNE_TUNE_SEX_DUR_GEO_NB指标,收录26个亚洲国家自1990至2025年间共11168条观察值,聚焦按性别、失业持续时间及城乡地域分层的失业规模。该数据集为亚洲区域劳动力市场性别差异与空间异质性研究提供了长时序、多维度的可比数据,对监测可持续发展目标中的体面劳动进展具有重要支撑意义。
当前挑战
该数据集所回应的核心领域问题在于失业测度的多维分解与跨时空可比性,需在性别、持续时间和城乡三类维度上同步实现精细化刻画,这对传统劳动力统计的样本量与分类标准提出严峻挑战。构建过程中,ILOSTAT需调和各国劳动力调查在失业定义、持续时间分组及城乡划分上的方法论差异,部分国家数据因来源更替出现序列断裂,观察状态标注为不可靠或临时性,且分类维度仅在指标支持时方可非空呈现,导致数据完整性与一致性问题成为建模分析时必须审慎处理的关键制约。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交汇处,该数据集以性别、失业持续时间与城乡地域三重维度刻画亚洲26国失业图景,其经典用法在于构建高维面板数据模型,用以识别失业持续期的性别差异与城乡分异规律。研究者常藉此进行时间序列预测与跨国比较分析,通过透视1990至2025年间逾万条观测记录,揭示不同社会经济背景下失业结构的动态演化轨迹。
解决学术问题
该数据集有效回应了劳动市场分层研究中长期存在的测量瓶颈,即缺乏同时涵盖性别、失业持续期与城乡属性的标准化跨国数据。其解决了失业持续时间性别差距的量化难题以及城乡二元结构下就业脆弱性比较的实证困境,为检验搜寻匹配理论、劳动力市场分割假说提供了可复现的数据基础。该数据集的意义在于将ILO的统计协调框架转化为可供机器学习模型直接调用的结构化资源,显著降低了跨国失业比较研究的门槛。
衍生相关工作
围绕该数据集已衍生出一系列经典工作,包括基于面板固定效应模型的亚洲失业持续期性别收敛性分析,以及利用随机森林与梯度提升机对城乡失业率进行多步向前预测的机器学习研究。部分学者将其与ILO其他指标数据集链接,构建了多维劳动脆弱性指数;另有研究以该数据为基准,评估了亚洲金融危机与新冠疫情冲击下失业持续期的非线性响应机制,拓展了劳动统计数据的二次分析范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务