遇见数据集

electricsheepasia/asia-ilo-emp-2emp-sex-ste-nb-employment-by-sex-and-status-in-employment-ilo-mod

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲49个国家从1991年至2025年的就业数据,具体为按性别和就业状况划分的就业人数——国际劳工组织(ILO)的模型估计值(单位为千计)。数据涵盖41,040个观测值,涉及1个核心指标(EMP_2EMP_SEX_STE_NB),源自ILOSTAT数据库,并经过Electric Sheep Asia重新打包处理。数据集适用于表格分类、回归和时间序列预测等机器学习任务,包含国家代码、年份、性别分类、观测值等字段,用于分析亚洲地区的就业趋势和模式。

This dataset contains 41,040 observations of employment data across 49 Asia countries, spanning 1991 to 2025, focusing on the indicator Employment by sex and status in employment -- ILO modelled estimates, Nov. 2025 (thousands). It is sourced from ILOSTAT, the ILOs central statistics database, and repackaged by Electric Sheep Asia for machine learning use. The data includes disaggregation by sex and employment status, with fields such as country codes, years, indicator values, and source information, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-2emp-sex-ste-nb-employment-by-sex-and-status-in-employment-ilo-mod 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接获取指标“EMP_2EMP_SEX_STE_NB”的原始数据,并依据亚洲地区的ISO3国家代码进行地理范围筛选。ILOSTAT依据国际劳动统计学家会议(ICLS)的定义对各国调查微观数据进行协调统一,数据来源信息在“source.label”字段中予以标注,以确保可追溯性。最终形成的观测数据集包含41,040条记录,覆盖49个亚洲国家,时间跨度为1991年至2025年。
特点
数据集围绕单一核心指标“按性别和就业身份划分的就业人数(ILO建模估计,2025年11月版,单位:千人)”展开,提供了丰富的维度划分。其中,“sex”字段将数据细分为总计、男性和女性三类,“classif1”字段则进一步按就业身份(如合计、雇员、自营工作者等)进行聚合分类。数据集以年为单位提供频率,并包含“obs_status”字段以标注观测值的调整状态,为研究者提供了清晰的元数据和质量标识,便于进行精细化的劳动经济分析。
使用方法
用户可通过HuggingFace Datasets库的`load_dataset()`函数一键加载数据,并转换为Pandas DataFrame进行后续操作。典型用法包括按国家代码(如`ref_area == 'IDN'`)筛选单一国家的就业时间序列,或针对特定指标按年份排序后绘制趋势图。更高级的分析可借助`pivot_table`方法将数据重塑为国家×年份的矩阵形式,从而支持面板数据分析或跨区域比较研究。所有操作均基于标准Python数据科学生态,无需额外数据预处理。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年11月发布,其核心研究问题聚焦于亚洲地区按性别和就业身份划分的就业状况。数据集整合了ILOSTAT数据库中49个亚洲国家1991年至2025年的就业观测数据,总计41,040条记录,旨在为劳动经济学、性别平等研究以及可持续发展目标(SDG)体面劳动指标的监测提供标准化、可比较的时空数据基础。作为ILO统计部门经国际劳动统计学家会议(ICLS)定义协调后的建模估算结果,该数据集填补了亚洲区域劳动力市场数据碎片化的空白,为跨国比较和长时序分析提供了权威资源,尤其对评估亚洲经济体在性别就业平等方面的进展具有深远影响力。
当前挑战
该数据集应对的核心领域挑战在于亚洲各国就业统计口径不一、调查方法各异所导致的数据可比性难题,ILO通过统一建模估算和最佳来源选择来缓解此问题。构建过程中,数据集面临多重挑战:首先,原始数据源自各国劳动调查与行政记录,其质量参差不齐,需通过观测状态标志(如调整值A)进行注释以警示不确定性;其次,部分国家某些年份数据缺失,仅依赖模型插补可能引入偏差;最后,数据集仅提供年度频率,而月度或季度波动特征被掩盖,限制了高频动态分析,同时性别与就业身份的分层维度虽已包含,但更细致的年龄、教育等交叉分类尚不完整。
常用场景
经典使用场景
在劳动经济学与区域发展研究领域,该数据集作为ILO对亚洲地区就业状况的权威建模估计,常被用于探究亚洲各国按性别与就业状态划分的就业结构演变。研究者可借助其覆盖1991至2025年的长期面板数据,追踪劳动力市场中自雇者、雇员等不同就业身份的分布变迁,并对比男女性别间的就业差异。通过引入该数据,学者能够构建时间序列模型或固定效应面板回归,深入分析经济增长、政策干预与就业形态之间的动态关联,从而揭示亚洲新兴经济体在劳动力转型过程中的内在规律。
解决学术问题
该数据集有效填补了亚洲区域就业统计中性别与就业状态交叉维度数据的空白,解决了以往研究中因数据零散、口径不一致而难以开展跨国比较与长期趋势分析的困境。学术上,它助力研究团队从性别平等视角出发,量化女性在正规与非正规就业中的参与程度,评估就业结构转换速率与经济发展阶段的关系。其重要意义在于为国际劳工标准、可持续发展目标中的体面劳动议题提供了坚实的实证基础,推动学界对亚洲劳动力市场分化现象提出更具解释力的理论框架。
衍生相关工作
基于该数据集衍生的工作涵盖了从计量方法创新到跨学科融合的多个方向。经典工作包括构建亚洲就业结构变迁的马尔可夫转移模型,预测不同性别与就业状态的人口流动概率;也有研究将其与教育、GDP等经济变量耦合,开发劳动力弹性预测框架。在机器学习领域,该数据集被用于训练时序预测模型,例如借助LSTM网络对未来五年亚洲各国就业总量进行外推。此外,学术界还衍生出将之与ILO其他指标(如失业率、工资水平)整合的多维数据集,推动了对亚洲体面劳动状况的综合评估研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务