遇见数据集

electricsheepasia/asia-ilo-emp-xtru-sex-edu-rt-time-related-underemployment-rate-by-sex-and-educa

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲31个国家从1996年至2025年的时间相关就业不足率数据,共有8,892个观测值,聚焦于按性别和教育划分的就业不足指标(EMP_XTRU_SEX_EDU_RT)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API提取并过滤为亚洲国家代码。数据集提供了详细的列结构,包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、教育分类、观测年份、观测值以及数据质量标志等。数据以年度频率发布,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 8,892 observations of time-related underemployment rate data across 31 Asia countries, spanning from 1996 to 2025, focusing on the indicator EMP_XTRU_SEX_EDU_RT (Time-related underemployment rate by sex and education in percentage). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), extracted via REST API and filtered to Asia ISO3 country codes. The dataset provides a detailed schema including country codes, country names, data sources, indicator codes, sex disaggregation (total, male, female), education classification, observation year, observed values, and data quality flags. Data is published at annual frequency and is suitable for tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-xtru-sex-edu-rt-time-related-underemployment-rate-by-sex-and-educa 数据集图片
构建方式
该数据集以国际劳工组织(ILO)的ILOSTAT中央统计数据库为权威来源,通过其REST API接口(https://rplumber.ilo.org/data/indicator?id=EMP_XTRU_SEX_EDU_RT)直接提取与时间相关就业不足率相关的原始观测记录,并依据ISO3国家代码筛选出亚洲地区31个国家的数据。原始调查微观数据经ILO统计局依据国际劳工统计学家会议(ICLS)定义进行标准化处理,数据集构建方Electric Sheep Asia在此基础上对字段结构进行规范化,以Parquet格式重新封装,最终形成8,892条观测记录,覆盖1996年至2025年的时间跨度,并保留source.label等溯源信息以增强数据可追溯性。
特点
该数据集聚焦于亚洲地区时间相关就业不足率这一特定劳动市场指标,同时按性别与教育程度进行交叉分类,涵盖SEX_T、SEX_M、SEX_F三种性别维度与多层次教育分类。数据以年度频率呈现,时间序列自1996年延伸至2025年,国家层面覆盖伊朗、塞浦路斯、越南、韩国等31个亚洲经济体,观测记录逾8,000条。每条记录包含完整的指标代码、来源标签、观测状态标志及分类注释,可支持对就业不足现象的性别差异与教育梯度进行精细化分析,亦适用于面板数据建模与跨国比较研究。
使用方法
研究者可通过HuggingFace的datasets库以一行代码加载该数据集,随后将其转换为Pandas数据框进行灵活操作。利用ref_area字段可筛选特定国家子集,通过indicator字段可锁定目标指标并依时间排序生成单变量时间序列图。借助pivot_table函数可将数据结构重塑为国家×年份矩阵,便于开展横向对比或时间序列预测建模。数据集字段类型明确,obs_value为浮点型观测值,time为整型年份,分类维度以字符串编码存储,适配表格分类、回归及时间序列预测等多种机器学习任务,亦可直接用于探索性数据分析与可视化。
背景与挑战
背景概述
国际劳工组织长期致力于全球劳动力市场统计体系的构建与标准化,其维护的ILOSTAT数据库是劳动经济学研究领域最具权威性的跨国数据基础设施之一。在此背景下,Electric Sheep Asia于2025年对ILOSTAT原始数据进行了系统性重构,发布了覆盖31个亚洲国家、时间跨度自1996年至2025年、共计8,892条观测的时间相关不充分就业率数据集。该数据集按性别与教育程度双重维度细分,核心研究问题在于揭示亚洲地区劳动力市场中工时不足型就业的分布规律与演变趋势。其发布为亚洲劳动市场比较研究、教育回报率分析以及性别就业差距测度提供了精细化的数据支撑,对推动区域就业政策评估具有重要参考价值。
当前挑战
时间相关不充分就业的测度本身即构成劳动统计领域的核心难题,其定义依赖于国际劳工统计学家会议所确立的复杂标准框架,各成员国在转化为本国调查实践时往往产生口径分歧。该数据集面临的首要挑战在于跨国可比性维护:不同国家劳动力量调查的抽样设计、问卷措辞与统计能力差异显著,导致同一指标在跨国比较时可能失真。其次,教育分类维度的非标准化问题突出,部分国家采用非标准教育层级,使得按教育程度细分的数据在跨国汇总时存在归并困难。再者,数据中大量存在的观测状态标记、序列中断注释与来源变更记录,要求使用者在建模前进行细致的质量筛查与时序断裂处理,否则将严重影响预测与推断的可靠性。
常用场景
经典使用场景
在劳动经济学与性别研究的交织领域中,时间相关就业不足率是刻画劳动力市场隐性闲置状态的核心指标。该数据集以年度频率系统记录了1996至2025年间31个亚洲国家按性别与教育程度细分的时间相关就业不足率,为探究亚洲地区劳动力利用效率的长期演变提供了坚实的经验基础。经典使用场景涵盖构建跨国面板数据以检验教育扩张对就业不足的抑制效应,以及运用时间序列模型追踪性别差异在经济周期中的动态调整,从而揭示亚洲劳动力市场结构转型的内在规律。
实际应用
在政策制定与劳动力市场监测层面,该数据集为亚洲各国政府、国际组织及研究机构评估就业质量提供了量化依据。政策分析者可借助其识别教育水平较高群体中就业不足的高发区域与时段,从而优化职业技能培训与就业匹配政策。国际机构可利用其监测可持续发展目标中充分就业与体面工作的进展,企业与社会组织亦可据此研判区域劳动力供给潜力与用工成本趋势,为投资决策与人力资源规划提供数据支撑。
衍生相关工作
基于该数据集,研究者已衍生出一系列与亚洲劳动力市场相关的经典工作,包括跨国就业不足收敛性分析、性别就业差距分解研究以及教育与就业匹配度的面板回归。Electric Sheep Asia的标准化封装进一步促进了机器学习应用,如利用梯度提升与循环神经网络进行就业不足率预测,以及基于聚类方法识别劳动力市场脆弱性模式。这些工作不仅拓展了ILOSTAT数据的应用边界,也为亚洲劳动统计数据的可复现研究树立了范例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务