遇见数据集

electricsheepasia/asia-ilo-luu-xlu2-sex-edu-geo-rt-combined-rate-of-time-related-underemployment-and

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家从1996年至2025年的9,408个观测值,涵盖1个独特指标:时间相关就业不足和失业的综合率(LU2)按性别、教育和城乡地区划分(百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涉及劳动利用不足的其他衡量指标,包括按性别(总计、男性、女性)、教育水平和地理区域(如国家层面)的细分维度。数据集经过重新打包,以表格形式提供,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 9,408 observations of Other measures of labour underutilization data across 25 Asia countries, spanning 1996–2025, covering 1 distinct indicator: Combined rate of time-related underemployment and unemployment (LU2) by sex, education and rural/urban areas (%). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), with disaggregation by sex (total, male, female), education level, and geographic coverage. Repackaged for machine learning use, it is suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-luu-xlu2-sex-edu-geo-rt-combined-rate-of-time-related-underemployment-and 数据集图片
构建方式
该数据集源自国际劳工组织ILOSTAT中央统计数据库,通过REST API接口直接提取指标LUU_XLU2_SEX_EDU_GEO_RT的原始记录,并依据ISO3国家代码筛选出亚洲地区数据。原始调查微观数据经国际劳工统计学家会议(ICLS)定义体系进行标准化调和,每项观测均标注来源标签以确保可追溯性,最终由Electric Sheep Asia以Parquet格式重新封装发布。
特点
数据集涵盖25个亚洲国家、1996至2025年间共9408条观测记录,聚焦于时间相关不充分就业与失业的复合比率(LU2),并按性别、教育程度及城乡区域进行多维 disaggregation。数据结构包含国家代码、来源标识、指标编码、分类变量、时间戳及观测值等字段,同时附带观测状态标志与注释标签,便于用户识别数据质量与序列断裂等潜在问题。
使用方法
研究者可通过HuggingFace datasets库以load_dataset()函数直接加载数据并转换为Pandas DataFrame,进而按国家、指标或时间维度进行筛选与聚合。典型操作包括提取特定国家子集、绘制单一指标的时间序列趋势图,或透视生成国家与年份交叉矩阵,以支撑劳动经济学领域的分类、回归及时序预测等分析任务。
背景与挑战
背景概述
国际劳工组织(ILO)长期致力于全球劳动力市场统计的标准化与跨国可比性,其ILOSTAT数据库汇集了200余个经济体的劳动力调查数据。在此背景下,Electric Sheep Asia于2026年对ILOSTAT原始数据进行抽取与整理,发布了涵盖25个亚洲国家、1996至2025年间9,408条观测值的LU2指标数据集,即时间相关不充分就业与失业的复合比率。该数据集按性别、教育程度及城乡地域进行多维分解,为探究亚洲地区劳动力利用不足的结构性差异提供了统一的、可直接用于机器学习建模的数据基础,对劳动经济学与区域发展研究具有重要参考价值。
当前挑战
该数据集所面对的领域问题在于,劳动力利用不足的测度本身具有显著的方法论敏感性,ILO基于国际劳工统计学家会议定义对原始微观数据进行协调,但各国调查工具与采集口径的异质性仍可能引入系统性偏差。构建过程中,数据来源跨越多套劳动力调查与行政记录,部分观测值因方法修订而存在序列断裂,且教育分类与地域覆盖的非标准化编码需额外注释方可解释。此外,不同国家起始年份差异悬殊、部分年份观测标记为不可靠,这些因素共同构成了时间序列建模与跨国比较分析时不可忽视的挑战。
常用场景
经典使用场景
在劳动经济学与就业统计研究领域,该数据集最经典的使用场景在于刻画亚洲地区劳动力市场的时间相关不充分就业与失业复合比率(LU2)的时序演变与结构分异。研究者依托1996至2025年覆盖25个亚洲国家的9408条观测,按性别、教育程度及城乡地域进行多维分解,藉此识别不同人口群体在劳动力利用不足方面的异质性模式,并为跨国比较分析提供标准化、可复现的数据基础。
衍生相关工作
围绕该数据集,已衍生出一系列聚焦亚洲劳动力市场动态的实证研究,包括运用面板回归与时间序列模型探究经济周期对不充分就业的影响、借助机器学习方法进行就业脆弱性预测,以及将ILOSTAT多指标进行融合以构建综合劳动力利用不足指数的尝试。Electric Sheep Asia的标准化封装亦促进了可复现研究范式的推广,为后续跨国比较与政策评估工作奠定了数据基石。
数据集最近研究
最新研究方向
在可持续发展目标框架下,劳动力未充分利用的精确测度成为劳动经济学的前沿议题。该数据集聚焦亚洲二十五国1996至2025年时间相关就业不足与失业复合率(LU2),按性别、教育程度及城乡地域精细分层。近期研究依托此类高维面板数据,运用时间序列预测与机器学习方法,揭示教育梯度与性别差异在亚洲劳动力市场中的动态演变,尤其关注后疫情时代非正规就业扩张对LU2的脉冲效应。该数据为评估体面劳动目标进展、识别脆弱群体提供了关键实证基础,对亚洲区域劳动政策制定具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务