遇见数据集

electricsheepasia/asia-ilo-luu-xlu2-sex-dsb-rt-combined-rate-of-time-related-underemployment-and

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲16个国家在1996年至2024年期间的劳动力市场数据,具体指标为“时间相关就业不足和失业的综合率(LU2)”,按性别和残疾状况分类。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过过滤和重新包装。数据集包含708个观测值,每个观测值包括国家代码、年份、指标值、性别分类、数据来源等信息。数据以表格形式组织,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Asia重新打包,旨在为亚洲提供统一的、机器学习就绪的数据层。

This dataset contains labor market data for 16 Asian countries from 1996 to 2024, with the specific indicator being the composite rate of time-related underemployment and unemployment (LU2), classified by gender and disability status. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), obtained via API, and has been filtered and repackaged. The dataset consists of 708 observations, each containing information such as country code, year, indicator value, gender category, data source and other relevant details. Organized in tabular format, the data is suitable for tasks including tabular classification, regression and time series forecasting. This dataset was repackaged by Electric Sheep Asia, aiming to provide a unified, machine learning-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-luu-xlu2-sex-dsb-rt-combined-rate-of-time-related-underemployment-and 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API接口直接获取指标代码为LUU_XLU2_SEX_DSB_RT的原始数据,并依据ISO3国家代码筛选出亚洲地区16个国家的记录。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查等微观数据进行标准化处理,确保跨国可比性。数据经Electric Sheep Asia重新打包为Parquet格式,保留源标签以支持溯源,最终形成708条年度观测记录,时间跨度为1996年至2024年。
特点
数据集聚焦于亚洲地区与时间相关的就业不足和失业的综合比率(LU2),按性别和残疾状况进行细分,涵盖16个国家,共计708条观测值。其核心特点在于提供了性别(总计、男性、女性)和残疾状况的分类维度,并附带详细的源标签、观测状态标志和注释信息,增强了数据透明度。数据以年度频率呈现,部分国家存在时间序列不连续或方法修订等质量提示,便于研究者识别潜在偏差。
使用方法
研究者可通过Hugging Face的datasets库调用load_dataset函数加载数据集,并转换为Pandas数据框进行探索。典型操作包括按国家代码筛选特定国家数据,或针对单一指标构建时间序列图以观察趋势,亦可利用数据透视表生成国家与年份的矩阵视图。数据集适用于表格分类、回归及时间序列预测等任务,使用时需注意观测状态标志和注释列,以准确解读数据质量。
背景与挑战
背景概述
劳动力未充分利用是衡量劳动力市场健康程度的重要维度,国际劳工组织(ILO)长期致力于构建跨国家可比的劳动统计指标体系。ILOSTAT作为ILO的核心统计数据库,依托各国劳动力调查与住户收入调查等微观数据,经国际劳工统计学家会议(ICLS)标准统一协调后发布。该数据集由Electric Sheep Asia于2024年从ILOSTAT REST API抽取并重新封装,聚焦亚洲16个国家1996至2024年间按性别与残疾状况分列的时限相关就业不足与失业合并率(LU2),共计708条观测,为探究亚洲劳动力市场结构性缺口与弱势群体就业状况提供了标准化、可直接用于机器学习建模的数据基础。
当前挑战
该数据集所回应的领域问题在于如何以跨国可比口径刻画时限相关就业不足与失业的合并发生率,传统失业率难以捕捉工时不足所导致的劳动力未充分利用,且残疾状况维度在多数国家统计中尚属稀缺。构建过程中的挑战体现于三方面:其一,残疾定义在各国间缺乏统一标准,部分观测附有非标准定义注释,削弱了横向可比性;其二,部分国家与年份存在序列断点、方法修订或数据可靠性不足的标记,需借助obs_status与注释字段审慎甄别;其三,亚洲各国覆盖年份与观测密度差异显著,样本量低于千条,给时间序列建模与缺失值处理带来实质性限制。
常用场景
经典使用场景
在劳动经济学与就业统计研究领域,该数据集最为经典的使用场景在于刻画亚洲地区时间相关不充分就业与失业复合比率(LU2)的时序演变轨迹。研究者依托1996至2024年间16个亚洲国家的708条观测记录,按性别与 disability status 进行分层比较,构建国别面板数据,进而揭示劳动力未被充分利用的长期趋势与周期性波动。其年度频率与跨国可比性为时间序列建模、面板回归以及性别差异分解提供了标准化的分析基础。
衍生相关工作
围绕该数据集已衍生出若干具有代表性的后续工作。Electric Sheep Asia将其整合为亚洲ML-ready数据层的一部分,推动了跨国劳动力市场数据的标准化再发布;相关研究在此基础上开展残疾与性别交互的就业缺口测算,并与其他ILO指标联合构建多维劳动力利用不足指数。这些工作拓展了ILOSTAT数据在机器学习与因果推断中的应用边界,也为后续亚洲区域劳动统计数据集的设计提供了可复用的架构范式。
数据集最近研究
最新研究方向
在全球劳动力市场经历结构性变革与数字经济扩张的背景下,劳动力未充分利用的测度已从单一失业指标转向涵盖时间相关就业不足与失业的复合维度。该数据集聚焦亚洲十六国1996至2024年间按性别与残疾状况分列的LU2综合比率,为探究残障群体在劳动力市场中的边缘化程度及其性别差异提供了稀缺的跨国面板证据。当前研究前沿正将此类指标嵌入包容性增长与可持续发展目标框架,利用机器学习方法识别就业不足的时空聚集模式,并评估社会保障政策对弱势群体劳动参与率的调节效应。该数据集亦回应了后疫情时代工时缩减与非自愿兼职激增的现实议题,对推动亚洲地区劳动统计标准化与残障就业政策精准化具有关键实证价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务