遇见数据集

electricsheepasia/asia-ilo-emp-xtru-sex-edu-geo-rt-time-related-underemployment-rate-by-sex-education

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的亚洲25个国家的时间相关就业不足率数据,涵盖1996年至2025年,共有8565个观测值。数据指标为“按性别、教育程度和城乡地区划分的时间相关就业不足率(%)”,核心指标代码为EMP_XTRU_SEX_EDU_GEO_RT。数据集提供了详细的分类维度,包括性别(总计、男性、女性)、教育程度和城乡地区类型,并包含国家代码、来源信息、观测年份、观测值及数据质量标志等列。数据经过ILO harmonization处理,基于国际劳工统计学家会议(ICLS)定义,并经过Electric Sheep Asia重新打包,以统一的模式提供,便于机器学习使用。

This dataset contains time-related underemployment rate data for 25 Asian countries from the International Labour Organization (ILO) ILOSTAT database, spanning from 1996 to 2025, with 8,565 observations. The indicator is Time-related underemployment rate by sex, education and rural / urban areas (%), with the core indicator code EMP_XTRU_SEX_EDU_GEO_RT. The dataset provides detailed disaggregation dimensions including sex (total, male, female), education level, and rural/urban area type, and includes columns such as country codes, source information, observation year, observed values, and data quality flags. The data is harmonized by ILO based on International Conference of Labour Statisticians (ICLS) definitions and repackaged by Electric Sheep Asia in a unified schema for machine learning readiness.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-xtru-sex-edu-geo-rt-time-related-underemployment-rate-by-sex-education 数据集图片
构建方式
该数据集源自国际劳工组织统计数据库(ILOSTAT),由Electric Sheep Asia团队通过ILOSTAT的REST API接口直接抓取原始数据,并依据亚洲ISO3国家代码进行系统筛选与整合。ILOSTAT依据国际劳工统计学家会议(ICLS)标准定义,对各国劳动力调查、家庭收入调查等微观数据进行标准化调和,确保指标的可比性与统计一致性。数据经过去重、格式规范化及年频次对齐处理,最终形成涵盖1996至2025年的结构化表格数据,每条记录均标注数据来源,以保障溯源透明。
特点
数据集以性别、教育程度及城乡地域为多维分类变量,系统呈现亚洲地区与时间相关的就业不足率。其显著特征在于覆盖范围广泛,涵盖25个亚洲国家,累计8565条观测记录,时间跨度近三十年,兼具横截面与时序分析价值。数据表结构清晰,包含国家代码、指标代码、性别分类、教育层级、城乡属性、观测值及状态标志等字段,且对数据质量进行标注,如标明临时性或不稳定观测。分类维度丰富,支持按性别、教育及地域的交叉分析,为劳动力市场研究提供精细化数据支撑。
使用方法
研究者可借助HuggingFace的datasets库直接加载该数据集,并通过to_pandas()方法转换为数据框进行后续分析。典型用法包括:筛选特定国家(如印度尼西亚)的子集,提取单一指标并依时间排序以绘制趋势图,或利用透视表将数据重构为国家与年份的矩阵形式,便于比较各国就业不足率的动态变化。数据集亦适用于表格分类、回归及时间序列预测等机器学习任务。使用时需遵循CC-BY-4.0许可协议,并同时引用国际劳工组织与Electric Sheep Asia的再包装工作。
背景与挑战
背景概述
时间相关就业不足(time-related underemployment)是衡量劳动力市场质量的关键指标,反映劳动者因工时不足而无法充分就业的程度。国际劳工组织(ILO)自成立以来始终致力于全球劳动统计的标准化与传播,其ILOSTAT数据库汇集了200余个经济体的劳动力调查数据,为政策制定与学术研究提供权威依据。本数据集由Electric Sheep Asia于2026年重新打包发布,基于ILOSTAT原始数据,聚焦亚洲25个国家1996至2025年间按性别、教育程度及城乡区域细分的时间相关就业不足率,共包含8565条观测记录,为亚洲地区劳动市场性别与教育差异的长期追踪提供了坚实的数据基础。
当前挑战
该数据集所应对的领域问题在于精确刻画亚洲发展中经济体就业不足的异质性,其挑战源于数据的高度离散与不均衡:各国调查年份、频率及教育分类标准存在显著差异,部分国家仅有个别年份数据,导致跨时段与跨区域比较困难。构建过程中,数据源自不同劳动力调查,存在定义不一致、方法修订导致的序列断裂,以及大量缺失值与不可靠标记,同时城乡与教育维度的细分进一步加剧了数据稀疏性。此外,非标准教育分类与来源标注的复杂性对标准化处理与机器学习模型的稳健性提出了严峻考验。
常用场景
经典使用场景
在劳动经济学与就业统计研究中,时间相关不充分就业率长期被视为衡量劳动力市场质量的关键指标。该数据集汇聚亚洲二十五国逾八千条观测记录,按性别、教育程度与城乡地域三重维度细分,为跨国比较与面板分析提供了坚实的微观基础。研究者可藉此构建固定效应模型或时间序列预测框架,系统考察不同社会群体在就业不足现象中的异质性表现,亦可用于检验教育扩张与城乡二元结构对劳动时间配置的调节效应。
衍生相关工作
围绕该数据集已衍生出一系列劳动统计与计量分析工作。研究者利用其面板结构开展跨国不充分就业收敛性检验、性别差距分解及教育回报率估算等经典议题。部分工作将其与国际劳工组织其他指标数据集整合,构建多维就业质量指数。在机器学习领域,该数据被用于时间序列预测与分类任务基准测试,推动了表格数据建模方法在社会科学中的迁移应用,亦为亚洲劳动市场比较研究提供了可复现的数据基础设施。
数据集最近研究
最新研究方向
在全球劳动力市场深刻变革的背景下,亚洲地区时间相关不充分就业问题日益成为劳动经济学与发展研究的焦点。该数据集基于ILOSTAT的标准化框架,覆盖25个亚洲国家近三十年的观测记录,为性别、教育程度与城乡维度的差异化分析提供了独特基础。前沿研究正利用其表格分类与时间序列预测任务,探讨教育错配与不充分就业的关联机制,并评估数字经济和自动化对城乡劳动力市场的异质性冲击。相关研究亦呼应国际劳工组织关于体面劳动与SDG目标的政策讨论,为识别脆弱群体、优化教育资源配置及制定区域就业政策提供了实证依据,具有重要的学术与政策意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务