遇见数据集

electricsheepasia/asia-ilo-luu-xlu2-sex-age-mts-rt-combined-rate-of-time-related-underemployment-and

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含16,552个观测值,覆盖29个亚洲国家,时间跨度为1996年至2025年,主要指标为其他劳动力利用不足的衡量指标,具体是按性别、年龄和婚姻状况划分的时间相关就业不足和失业综合率(LU2)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API直接获取并过滤至亚洲国家ISO3代码。数据集包含多个列,如国家代码、指标、性别、年龄、婚姻状况、年份、观测值等,用于分析和预测劳动力市场状况。数据以年度频率发布,并包含数据质量标志,如观测状态(例如临时或不可靠)。数据集适用于表格分类、回归和时间序列预测任务,可用于研究亚洲国家的劳动力利用不足和失业问题。

This dataset contains 16,552 observations of Other measures of labour underutilization data across 29 Asia countries, spanning 1996–2025, covering 1 distinct indicator: Combined rate of time-related underemployment and unemployment (LU2) by sex, age and marital status. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, pulled via API and filtered to Asia ISO3 country codes. It includes columns such as country code, indicator, sex, age, marital status, year, observed value, and data quality flags. The dataset is designed for tabular classification, regression, and time-series forecasting tasks, focusing on labour market analysis in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-luu-xlu2-sex-age-mts-rt-combined-rate-of-time-related-underemployment-and 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,由Electric Sheep Asia基于ILOSTAT REST API接口进行系统化再包装。数据获取过程首先通过API端点提取LUU_XLU2_SEX_AGE_MTS_RT指标的原始记录,继而依据ISO3国家代码筛选出亚洲地区数据。ILOSTAT对各国劳动力调查等原始微观数据进行ICLS标准统一化处理,确保指标定义与统计口径的跨国可比性,数据来源在source.label列中予以标注以便溯源。最终形成涵盖29个亚洲国家、1996至2025年间共计16,552条观测记录的结构化数据集。
特点
该数据集聚焦于时间相关就业不足与失业的复合比率(LU2指标),以年度频率呈现,覆盖亚洲29个国家近三十年的时间跨度。数据按性别、年龄组及婚姻状况等多维度进行交叉 disaggregation,提供SEX_T、SEX_M、SEX_F三类性别分类以及年龄、婚姻状态等分类变量。数据集包含丰富的元数据列,如来源标注、观测状态标志(如临时性、可靠性提示)及方法论修订断点说明,为跨国比较和时间序列分析提供透明度支撑。数据集规模介于10K至100K观测值之间,以表格形式组织,适用于分类、回归及时间序列预测等机器学习任务。
使用方法
研究者可通过HuggingFace datasets库以load_dataset()函数直接加载该数据集,并转换为Pandas DataFrame进行后续分析。典型使用方式包括:按ref_area字段筛选特定国家(如df[df['ref_area']=='IDN'])以开展国别研究;依据indicator字段提取目标指标并依time排序,构建时间序列以绘制趋势图;利用pivot_table方法将数据重塑为国家×年份矩阵,便于面板数据分析或跨国比较。数据列结构清晰,包含国家代码、指标代码、性别分类、年龄分类及观测值等字段,可直接接入统计模型或机器学习流程。
背景与挑战
背景概述
国际劳工组织长期致力于全球劳动力市场统计体系的标准化建设,ILOSTAT数据库为其核心统计基础设施。该数据集由Electric Sheep Asia团队于2025年重新封装发布,源自ILOSTAT劳动力未充分利用指标框架,聚焦亚洲29国1996至2025年间的时间相关就业不足与失业综合比率(LU2),按性别、年龄与婚姻状况进行多维度解聚,共计16,552条观测记录。该数据集回应了亚太地区劳动力市场监测数据碎片化的核心问题,为劳动经济学研究与可持续发展目标评估提供了跨国可比的基础数据支撑。
当前挑战
劳动力未充分利用的跨国测量始终面临概念界定与统计口径的深层张力:LU2综合比率融合时间相关就业不足与失业两类异质性状态,各国劳工力量调查在参考期设定、工时门槛及求职行为认定上的差异,导致指标内涵难以完全对齐。该数据集在构建过程中同样受制于原始调查数据的稀疏性与不连续性,部分国家观测年份覆盖有限,序列中断及方法论修订所引发的断点问题构成显著障碍,婚姻状况分类标准的国别差异亦增加了跨组比较的复杂性。
常用场景
经典使用场景
在劳动经济学与就业政策研究领域,该数据集最经典的使用场景在于刻画亚洲地区劳动力未充分利用的时间维度特征。研究者通常依据性别、年龄组与婚姻状况等分类变量,对1996年至2025年间29个亚洲国家的LU2综合比率进行面板数据分析,借助时间序列建模与横截面比较,揭示不同人口群体在时间相关就业不足与失业叠加状态下的演变轨迹,进而为区域劳动力市场监测提供精细化的事实基础。
解决学术问题
该数据集有效回应了劳动统计比较研究中长期存在的口径不一致与覆盖不均衡问题。通过ILO统一协调的ICLS定义框架,它将原本分散于各国劳动力调查的微观数据整合为可跨期、跨区域比较的标准化指标,缓解了既有文献在测量时间相关就业不足时因国别差异而产生的估计偏误。其意义在于为探讨非自愿兼职、工时不足与失业边界模糊化等议题提供了可靠的经验支撑,并推动了劳动力未充分利用多维测度理论的实证检验。
衍生相关工作
围绕该数据集,后续研究衍生出一系列与劳动力未充分利用测度相关的经典工作。部分学者将其与ILOSTAT其他指标如LU1、LU3、LU4等进行联合建模,拓展了劳动力市场松弛度的综合评估框架;另有研究基于其性别与年龄分层结构,探讨了亚洲地区青年与女性在时间相关就业不足中的异质性表现,并以此为基础发展了跨国面板回归与分层贝叶斯估计方法,丰富了就业统计与劳动政策评估的方法论体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务