遇见数据集

electricsheepasia/asia-ilo-emp-5emp-sex-ste-nb-employment-by-sex-and-status-in-employment-19th-ic

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲5个国家(蒙古、文莱、东帝汶、柬埔寨、老挝)在2019年至2024年期间的就业数据,共1,160个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API获取并过滤到亚洲地区。数据集的核心指标是“按性别和就业状况分类的就业人数——第19届国际劳工统计学家会议(千单位)”,涵盖了总就业人数按性别(总计、男性、女性)和就业状况的细分。数据列包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类、时间年份、观测值、观测状态等,并提供了数据质量说明,如年度频率、最佳来源选择等。该数据集旨在支持表格分类、回归和时间序列预测等任务,适用于劳动经济学研究和机器学习应用。

This dataset contains 1,160 observations of employment data across 5 Asian countries (Mongolia, Brunei, Timor-Leste, Cambodia, Laos) spanning 2019 to 2024. It is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via REST API and filtered to Asian ISO3 country codes. The primary indicator is Employment by sex and status in employment -- 19th International Conference of Labour Statisticians (ICLS) (thousands), which disaggregates total employment by sex (total, male, female) and employment status. Columns include country code, country name, data source, indicator code, indicator label, sex classification, time year, observed value, observation status, and more, with notes on data quality such as annual frequency and best-source selection. The dataset is designed for tabular classification, regression, and time-series forecasting tasks, supporting labor economics research and machine learning applications.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-5emp-sex-ste-nb-employment-by-sex-and-status-in-employment-19th-ic 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,聚焦亚洲地区就业状况的量化分析。研究人员通过ILOSTAT的REST API直接抽取原始指标数据(ID为EMP_5EMP_SEX_STE_NB),并依据ISO 3166-1 alpha-3标准过滤出亚洲国家的地理范围。数据经ILO统计部门依据第19届国际劳工统计学家会议(ICLS)定义进行标准化处理,保留了来源标识(source.label)以确保可追溯性。最终数据集涵盖2019至2024年间蒙古、文莱、东帝汶、柬埔寨和老挝五个国家的共计1160条观测记录。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载该数据集,并将其转换为Pandas DataFrame以便进行数据处理。典型应用包括按国家筛选子集(如过滤印度尼西亚数据)、对单一指标进行时间序列可视化(按年份排序并绘制obs_value曲线),或通过数据透视表构建国家×年份的观测值矩阵。此外,数据集支持tabluar-classification、tabular-regression及time-series-forecasting三类机器学习任务,适合就业预测、性别差异分析等实证研究场景。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2024年创建,经Electric Sheep Asia重新整理后发布于HuggingFace平台,旨在提供亚洲地区按性别和就业身份划分的就业数据。数据集涵盖2019至2024年间蒙古、文莱、东帝汶、柬埔寨和老挝五个亚洲国家的1160条观测值,基于第19届国际劳动统计学家会议(ICLS)定义进行标准化处理,数据源包括各国劳动力调查等官方统计。作为ILOSTAT数据库的亚洲子集,该数据集为区域劳动力市场研究、性别平等评估及可持续发展目标(SDG)体面工作指标的监测提供了关键支撑,在劳动经济学和公共政策领域具有重要参考价值。
当前挑战
领域问题挑战方面,该数据集着力解决亚洲地区就业统计口径不统一、性别与就业身份交叉分析数据匮乏的难题。不同国家采用的调查方法和ICLS定义版本差异,导致数据可比性受限,且部分观测值存在方法修订(如序列断裂)或不可靠标注,增加了时序分析的复杂性。构建过程中,团队需从ILOSTAT API海量指标中精确提取EMP_5EMP_SEX_STE_NB代码对应的数据,并筛选亚洲国家代码,同时处理多源数据冲突(如同一国家与年份存在多个来源时仅保留ILO选定的“最佳来源”)和缺失值问题。此外,数据仅覆盖五个国家且部分年份不连续(如柬埔寨仅2019年有数据),暴露了亚洲地区就业统计覆盖的碎片化挑战。
常用场景
经典使用场景
该数据集收录了2019年至2024年间五个亚洲国家按性别与就业身份划分的就业人数数据,共计1160条观测值,源自国际劳工组织ILOSTAT数据库。其经典使用场景集中于劳动经济学与性别研究的交叉领域,学者可借此剖析亚洲区域劳动力市场的结构性变迁,例如追踪不同性别劳动者在雇员、自雇或家庭帮工等就业身份上的分布演化。通过时间序列分析,研究者能揭示经济政策、产业结构调整或社会规范变迁对男女就业模式的差异化冲击,从而为区域劳动力市场的比较研究奠定坚实的数据基础。
解决学术问题
该数据集精准回应了亚洲劳动力研究中长期存在的两个关键难题:一是跨国可比数据的匮乏,二是就业身份细分维度的缺失。借助ILO统一采用的第19届国际劳动统计学家会议(ICLS)定义标准,数据集得以消弭各国统计口径差异,使跨国家、跨时期的实证分析成为可能。学者能够据此探讨性别就业鸿沟的演变规律、评估宏观经济冲击对不同就业身份群体的非对称影响,以及检验制度变革对女性劳动力参与率的调节效应,为劳动经济学、性别研究与发展经济学领域提供了可靠的经验证据。
实际应用
在实际应用层面,该数据集为国际组织、政府机构及非营利组织的政策制定与评估提供了量化支撑。决策者可利用此数据监测南亚与东南亚国家在联合国可持续发展目标第八项(体面工作和经济增长)上的进展,特别是针对女性就业质量与就业身份保障的改善效果。此外,数据集还可嵌入劳动市场监测预警系统,通过纵向比较不同性别与就业身份的就业波动,辅助识别经济危机或结构性转型中的脆弱群体,从而设计更具包容性的就业促进与技能培训干预方案。
数据集最近研究
最新研究方向
当前,基于国际劳工组织ILOSTAT数据源的亚洲就业统计数据集(asia-ilo-emp-5emp-sex-ste-nb)正被广泛运用于劳动力市场的性别差异分析与就业结构变迁研究。该数据集涵盖了2019至2024年间亚洲五国的就业数据,按性别与就业身份(ICSE-18)进行细致分解,为追踪新冠疫情后亚洲地区就业复苏的非均衡性提供了宝贵的年度观测序列。前沿研究方向聚焦于利用时间序列预测模型(如Transformer、Prophet)对短期就业趋势进行建模,并结合迁移学习技术,将数据丰富的蒙古国(MNG)等国的就业模式特征迁移至数据稀疏的老挝(LAO)等地区,以改善小样本国家的预测精度。此外,该数据在联合国可持续发展目标(SDG)第八项目标(体面工作和经济增长)的量化监测中扮演关键角色,其详细的源数据标注字段为评估调查方法修订(如方法论中断标记)对统计一致性的影响提供了实证基础,进而推动了更稳健的跨国面板数据分析方法的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务