遇见数据集

electricsheepasia/asia-ilo-emp-xtru-sex-geo-rt-time-related-underemployment-rate-by-sex-and-rural

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲25个国家的时间相关就业不足率数据,按性别和城乡地区分类,时间跨度为1996年至2025年。数据集共有1,921个观测值,核心指标为EMP_XTRU_SEX_GEO_RT(时间相关就业不足率,按性别和城乡地区划分的百分比)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过亚洲国家代码过滤。数据集以表格形式存储,包括国家代码、国家名称、数据来源、指标、性别分类、年份、观测值等列,适用于表格分类、回归和时间序列预测等任务。数据质量方面,为年度频率,ILO选择最佳来源,且分类列仅在指标发布细分数据时非空。数据集由Electric Sheep Asia重新打包,旨在为亚洲地区提供统一的机器学习就绪数据层。

This dataset contains time-related underemployment rate data for 25 Asian countries, disaggregated by sex and rural/urban areas, spanning the years 1996 to 2025. It includes 1,921 observations, with the core indicator being EMP_XTRU_SEX_GEO_RT (Time-related underemployment rate by sex and rural/urban areas, in percentage). The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via REST API and filtered to Asian ISO3 country codes. The dataset is structured in tabular format with columns such as country code, country name, data source, indicator, sex classification, year, observed value, etc., suitable for tasks like tabular classification, regression, and time-series forecasting. Data quality notes include annual frequency, ILO-selected best source for overlapping data, and disaggregation columns being non-null only when the indicator publishes that breakdown. Repackaged by Electric Sheep Asia, it aims to provide a unified, ML-ready data layer for Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-xtru-sex-geo-rt-time-related-underemployment-rate-by-sex-and-rural 数据集图片
构建方式
该数据集依托国际劳工组织统计数据库(ILOSTAT)构建,通过其REST API接口提取指标EMP_XTRU_SEX_GEO_RT的原始观测记录,并依据ISO3国家代码筛选出亚洲地区数据。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查等来源的微观数据进行调和处理,确保跨区域可比性。Electric Sheep Asia在此基础上重新打包,标准化字段结构并转化为Parquet格式,最终形成涵盖25个亚洲国家、1996至2025年共1,921条观测的机器学习就绪数据集。
特点
数据集聚焦于与时间相关的就业不足率,按性别及城乡区域进行多维分解,涵盖总计、男性和女性三类性别标识。观测值以百分比形式呈现,囊括25个亚洲国家,时间跨度近三十年,年度频率记录。数据附带来源标签、观测状态标志及方法修订注释等元数据,便于追溯数据质量与来源。每个国家记录量不等,从数十条至二百余条,体现出各国统计能力的差异,为性别与城乡维度的劳动市场分析提供细粒度面板数据。
使用方法
数据集可通过HuggingFace的datasets库一键加载,调用load_dataset函数后转换为Pandas数据框即可展开分析。研究者可依据ref_area字段筛选特定国家,如提取印度尼西亚数据;或对indicator字段过滤后按时间排序,绘制单一指标的时间序列图。利用pivot_table方法可将数据重塑为国家与年份的交叉矩阵,便于比较各国就业不足率的演变趋势。schema中丰富的标签列支持按性别、城乡等维度分组聚合,适用于回归、分类及时间序列预测等任务。
背景与挑战
背景概述
国际劳工组织(ILO)自1919年成立以来,始终致力于全球劳动统计的标准化与推广。ILOSTAT作为其核心统计数据库,汇集了200余个经济体的劳动力调查数据,为监测体面劳动和可持续发展目标提供关键支撑。在此背景下,该数据集由Electric Sheep Asia于2025年重新封装发布,聚焦亚洲25个国家1996至2025年间的时间相关就业不足率,按性别与城乡维度细分,共计1921条观测。其核心研究问题在于揭示亚洲地区劳动力市场中工作时间不足的性别与地域差异,为政策制定者提供量化依据,对劳动经济学与区域发展研究具有显著影响力。
当前挑战
该数据集所应对的领域问题在于就业不足的精准测度与跨区域可比性:不同国家劳动力调查方法、抽样框架与统计定义存在异质性,即便经ILO协调,断点与不可靠标志仍频繁出现。构建过程中,数据源自多国调查微数据,需处理缺失值、序列断裂与源选择偏差;性别与城乡分类仅部分年份可得,导致面板不平衡。此外,年度频率掩盖了季节性波动,且部分国家数据时效性滞后,对时间序列建模与因果推断构成显著挑战。
常用场景
经典使用场景
在劳动经济学与性别研究的交叉领域中,该数据集最为经典的运用场景在于刻画亚洲地区时间相关就业不足率的时空分异格局。研究者可借助其涵盖二十五国、横跨近三十年的面板结构,系统分析男性和女性在城乡不同地理单元中的就业不足演变轨迹。通过构建时间序列模型或面板回归,能够揭示性别鸿沟与城乡二元结构如何在宏观经济周期中交互作用,进而为理解亚洲劳动力市场脆弱性的动态特征提供量化基准。
解决学术问题
该数据集有效回应了劳动统计比较研究中长期存在的数据碎片化与口径不一致难题。借助国际劳工组织统一协调的ICLS定义框架,研究者得以在跨国可比的基础上检验时间相关就业不足的决定因素,例如产业结构转型、非正规就业扩张及性别分工变迁所产生的影响。其意义在于将分散于各国劳动力调查的微观信息整合为标准化宏观指标,为实证检验制度假说、评估政策干预效果以及监测可持续发展目标中的体面劳动进展奠定了可靠的数据基石。
衍生相关工作
围绕该数据集,已衍生出一系列聚焦亚洲劳动力市场性别不平等与城乡差距的经典研究。部分工作将其与亚洲开发银行、世界银行等机构的家庭调查数据链接,探讨就业不足对贫困脆弱性与收入流动性的传导机制。另有研究以此为基础开发面板预测模型,检验经济冲击下不同性别与地域群体的恢复弹性差异。这些衍生成果不仅拓展了国际劳工统计数据的二次分析边界,也推动了劳动经济学中关于时间相关就业不足概念的本土化理论建构。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务