遇见数据集

electricsheepasia/asia-ilo-luu-xlu3-sex-geo-mts-rt-combined-rate-of-unemployment-and-potential-labour

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲26个国家的5,470个观测数据,涵盖1999年至2025年期间,涉及1个独特指标。数据集重点关注失业与潜在劳动力综合率(LU3),按性别、农村/城市地区和婚姻状况进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接获取,并经过亚洲国家代码过滤。数据集采用表格形式,包含多个列,如国家代码、指标代码、性别分类、观测年份和观测值等,适用于表格分类、回归和时间序列预测等任务。数据以CC-BY-4.0许可证发布,由Electric Sheep Asia重新打包,便于机器学习使用。

This dataset contains 5,470 observations of other measures of labour underutilization data across 26 Asia countries, spanning 1999–2025, covering 1 distinct indicator. It focuses on the combined rate of unemployment and potential labour force (LU3) by sex, rural/urban area, and marital status. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled directly via REST API and filtered to Asia ISO3 country codes. It is provided in a tabular format with columns such as country code, indicator code, sex classification, observation year, and observed value, suitable for tasks like tabular classification, regression, and time-series forecasting. The dataset is released under the CC-BY-4.0 license and repackaged by Electric Sheep Asia for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-luu-xlu3-sex-geo-mts-rt-combined-rate-of-unemployment-and-potential-labour 数据集图片
构建方式
该数据集由Electric Sheep Asia从ILOSTAT REST API抓取原始数据,并筛选出亚洲26个国家的ISO3代码,涵盖1999年至2025年的年度观测,共计5,470条记录。数据经由国际劳工组织(ILO)统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调,原始调查微观数据被加工为标准化的劳动指标。数据集中包含单一指标'LUU_XLU3_SEX_GEO_MTS_RT',即失业与潜在劳动力综合比率(LU3),并按性别、城乡地区及婚姻状况进行维度细分。每个观测值附带来源标签、状态标志及注释,确保数据的可追溯性和透明度。
特点
该数据集的核心特色在于其地域与时间的双重广度,覆盖亚洲26个国家,时间跨度长达27年,为研究亚洲劳动力市场动态提供了长时序视角。指标本身是ILOSTAT定义的劳动力利用不足的'其他衡量'之一,具有独特的政策相关性。数据经过性别(总、男、女)和地区(国家、城乡)等维度细粒度切分,支持多层次分析。数据集遵循CC-BY-4.0许可,来源可溯源至ILO官方数据,质量经过标准化处理,缺失值和非最优来源均被标注,保证了数据的可靠性和可比性。
使用方法
使用者可通过HuggingFace的datasets库轻松加载数据,例如使用load_dataset()函数获取数据集并转换为Pandas DataFrame。随后可按国家(如印度尼西亚)进行筛选,或对特定指标进行时间序列分析,利用plot函数直观观察趋势。此外,数据可透视成国家-年份矩阵,便于进行跨国的比较研究。该数据集特别适合经济学家、政策制定者和数据科学家用于分析亚洲劳动力市场结构、评估劳动政策效果,或作为宏观经济模型的训练数据。所有使用场景均需引用原始ILO来源及Electric Sheep Asia的再打包版本,以符合知识共享许可的要求。
背景与挑战
背景概述
在全球劳动力市场持续演变与后疫情时代经济复苏的双重背景下,劳动力利用不足的精准测度成为国际劳动统计学界关注的焦点。该数据集由国际劳工组织(ILO)统计部门基于其核心数据库ILOSTAT构建,并由Electric Sheep Asia于2025年重新封装发布,聚焦亚洲26国在1999至2025年间综合失业与潜在劳动力比率(LU3)的城乡及性别细分数据。作为劳动统计领域的权威来源,ILOSTAT通过统一国际劳动统计学家会议(ICLS)定义,调和各国调查微观数据,为跨区域比较提供了标准化框架。此数据集不仅填补了亚洲地区劳动力利用不足指标在时间序列与空间维度上的空白,还为研究劳动力市场结构变迁、性别差异及城乡发展不平衡等关键议题奠定了坚实的数据基础。
当前挑战
该数据集所面临的挑战首先源于劳动力利用不足现象本身的复杂性与多维度性,LU3指标虽综合了失业与潜在劳动力,但各国在数据采集频率、调查方法及定义执行上存在显著差异,导致跨国可比性受限。其次,在构建过程中,ILOSTAT需处理海量异构原始数据,包括劳动⼒调查、家庭收入调查及行政记录等,数据清洗与标准化流程繁重,且需谨慎排查不同来源间的矛盾与缺失。此外,由于亚洲各国统计能力不均,部分国家的时间序列不连续或存在明显断点,观测状态标注(如'Break in series')虽增强了透明度,却也揭示了数据质量的不均衡,为后续时间序列预测与因果推断带来了方法论上的严峻考验。
常用场景
经典使用场景
该数据集作为ILOSTAT官方劳动统计数据的亚洲区域子集,涵盖了1999年至2025年间26个亚洲国家的劳动力利用不足综合指标(LU3),其核心价值在于为劳动经济学研究提供了标准化的时间序列面板数据。研究者通常将其用于跨国比较分析,考察不同性别、城乡区域及婚姻状况下的劳动力闲置状况,并借助其年度频率与地域标识,构建动态面板模型以探究劳动力市场波动的宏观决定因素。该数据集亦适用于时序预测任务,例如基于历史观测值预测未来趋势,或运用机器学习算法识别非正规就业与潜在劳动力之间的结构性关联。其规范的字段设计,包括观测状态标记与中断序列注释,为数据清洗和稳健性检验提供了便利。
解决学术问题
该数据集直面劳动经济学中劳动力利用不足测度的难题,通过提供涵盖性别、城乡及婚姻状况的细分维度,使研究者能够深入剖析劳动力市场的结构性失衡问题,尤其是女性、农村青年及已婚群体的就业脆弱性。其长达二十余年的观测跨度支持长期趋势分析,有助于揭示亚洲各国在经济发展进程中劳动力闲置率的演变规律,为验证‘劳动力吸收’假说、评估社会保障政策成效及比较区域发展差异提供了实证基础。同时,数据的ILO官方权威性与可追溯性,解决了跨国数据可比性不足与来源混杂的痛点,为学术研究奠定了可信赖的数据根基。
衍生相关工作
该数据集作为ILOSTAT体系的亚洲子集,其衍生工作多集中于劳动经济学与数据科学的交叉领域。一方面,它支撑了关于劳动力闲置与经济发展阶段关系的实证论文,例如利用面板回归考察经济增长对LU3的非线性影响,或运用生存分析模型研究不同人口特征群体的失业持续时间。另一方面,该数据推动了机器学习在劳动统计中的应用,如构建预测模型以预估未来劳动力闲置率,或开发聚类算法以识别劳动力市场类型学。在数据工程层面,其‘重新打包’模式催生了若干区域劳动数据集的标准化工作,促进了跨数据库的整合分析。此外,该数据集常与ILO的其他指标(如就业人口比、工时数据)联合使用,拓展了研究视野,相关成果广泛发表于劳动经济学、发展研究及区域科学期刊。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务