遇见数据集

electricsheepasia/asia-ilo-une-deap-sex-geo-rt-unemployment-rate-by-sex-and-rural-urban-areas

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自31个亚洲国家的3,186个观测数据,涵盖1970年至2025年,涉及1个独特指标:按性别和城乡地区划分的失业率(%)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为亚洲国家代码。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类、年份、观测值等列,并提供了数据质量说明和使用示例。

This dataset contains 3,186 observations of unemployment data across 31 Asia countries, spanning 1970–2025, covering 1 distinct indicator: Unemployment rate by sex and rural / urban areas (%). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Asia ISO3 country codes. It includes columns such as country code, country name, data source, indicator code, sex disaggregation, year, observed value, and provides data quality caveats and usage examples.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-une-deap-sex-geo-rt-unemployment-rate-by-sex-and-rural-urban-areas 数据集图片
构建方式
依托国际劳工组织统计数据库(ILOSTAT)的权威数据源,该数据集通过REST API接口(https://rplumber.ilo.org/data/indicator?id=UNE_DEAP_SEX_GEO_RT)直接获取原始观测记录,并依据亚洲ISO3国家代码进行系统筛选与提取。ILOSTAT采用国际劳工统计学家会议(ICLS)标准定义对各国劳动力调查、住户收入调查及行政记录等原始微观数据进行统一协调,数据来源在source.label列中予以标注以保障可追溯性。最终由Electric Sheep Asia进行规范化封装,以Parquet格式发布,形成覆盖31个亚洲国家、1970至2025年间的3186条观测记录。
特点
该数据集聚焦于亚洲地区失业率的性别与城乡维度解析,涵盖SEX_T、SEX_M、SEX_F及SEX_O四种性别分类,并以classif1字段标识城乡区域类型。数据以年度频率呈现,时间跨度逾五十年,囊括印度尼西亚、巴勒斯坦、塞浦路斯、蒙古等31个亚洲经济体,构成一个兼具时空深度与人口维度细分的面板数据集。schema设计包含ref_area、source、indicator、sex、classif1、time、obs_value等字段,并附有obs_status与多重note标签以标识序列断裂、方法论修订等数据质量信息,为劳动经济学研究提供透明且可验证的微观基础。
使用方法
研究者可通过HuggingFace的datasets库以单行代码加载数据集,并借助Pandas转换实现灵活的数据操作。典型应用场景包括:按ref_area字段筛选特定国家(如df[df['ref_area'] == 'IDN'])以进行国别失业率分析;按indicator字段提取单一指标并依time排序以绘制时间序列趋势图;利用pivot_table方法将数据重塑为国家×年度的矩阵形式,便于开展跨国比较与面板回归建模。该数据集亦适用于表格分类、回归及时间序列预测等机器学习任务,其结构化特征与明确标注为模型训练提供了可靠输入。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳工统计体系的构建与完善,其ILOSTAT数据库已成为劳动经济学领域最具权威性的跨国数据来源之一。该数据集由Electric Sheep Asia于2026年从ILOSTAT REST API中提取并重新封装,覆盖31个亚洲国家,时间跨度为1970至2025年,共3186条观测记录,核心指标为按性别与城乡区域划分的失业率。数据集聚焦于劳动力市场中性别差异与城乡二元结构对失业率的交互影响,为探究亚洲地区劳动力市场不平等提供了精细化的量化基础,对劳动经济学、发展经济学及社会政策研究具有重要的实证支撑价值。
当前挑战
该数据集所回应的核心领域问题在于:如何精准刻画亚洲地区失业率在性别与城乡维度上的异质性分布,进而揭示劳动力市场中的结构性不平等。在构建过程中,数据面临多重挑战。其一,ILOSTAT原始数据来源于各国劳动力调查、家庭收入调查及行政记录,不同国家的调查方法、抽样框架与统计口径存在显著差异,即便经过ICLS定义 harmonization,跨国可比性仍受限于各国统计能力的非均衡发展。其二,部分国家在特定年份存在数据缺失、中断或仅发布国家层面汇总值,导致性别与城乡分项数据的非均衡覆盖。其三,数据中标注的断点、临时性及不可靠观测值需在建模时审慎处理,以避免时序分析中的偏误。
常用场景
经典使用场景
在劳动经济学与区域发展研究的交织视野中,该数据集凭借其覆盖亚洲31国、跨越1970至2025年的面板结构,成为探究失业率在性别与城乡维度上异质性的经典素材。研究者常将其用于构建面板回归模型,以检验性别差距与城乡二元结构对失业率的交互影响;亦可用于时间序列预测,捕捉亚洲劳动力市场随经济周期波动的长期趋势。
解决学术问题
该数据集针对劳动经济学中长期存在的性别与城乡失业差异量化难题,提供了跨国可比、长时序的标准化观测。它使得学者能够系统检验性别失业差距是否随经济发展收敛,以及城乡分割在亚洲不同制度背景下的持续性,从而为结构性失业理论提供跨情境证据,并推动国际劳工统计标准在区域研究中的实证应用。
衍生相关工作
以该数据集为基石,衍生了一系列涉及亚洲劳动力市场不平等、城乡转型与性别经济学的经典研究。部分工作将其与ILO其他指标(如劳动参与率、非正规就业)链接,深化了对失业结构成因的理解;亦有研究利用其时间序列特性,构建预警模型或评估宏观经济冲击的异质性影响,推动了区域劳动统计数据的二次开发与方法创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务