遇见数据集

electricsheepasia/asia-ilo-emp-2emp-sex-ocu-nb-employment-by-sex-and-occupation-ilo-modelled-esti

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲49个国家从1991年至2025年期间按性别和职业划分的就业数据,共46,170个观测值,覆盖1个主要指标(EMP_2EMP_SEX_OCU_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接获取并过滤为亚洲国家,经过Electric Sheep Asia重新打包为机器学习就绪格式。数据集采用表格形式,包含国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、时间(年份)、观测值(单位:千)等字段,适用于表格分类、回归和时间序列预测等自然语言处理任务。数据以年度频率发布,并包含数据质量说明,如使用ILO选择的最佳来源和分类列的非空条件。数据集遵循CC-BY-4.0许可,可用于研究和开发目的。

This dataset contains employment data by sex and occupation for 49 Asian countries spanning from 1991 to 2025, with 46,170 observations covering one key indicator (EMP_2EMP_SEX_OCU_NB). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved directly via REST API and filtered for Asian countries, and repackaged by Electric Sheep Asia into a machine-learning-ready format. It is presented in tabular form with columns including country code, country name, data source, indicator code, sex disaggregation (total, male, female), time (year), observed value (in thousands), etc., suitable for tabular classification, regression, and time-series forecasting tasks. The data is published at annual frequency and includes quality notes such as the use of ILO-selected best source and non-null conditions for disaggregation columns. The dataset is licensed under CC-BY-4.0 and intended for research and development purposes.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-2emp-sex-ocu-nb-employment-by-sex-and-occupation-ilo-modelled-esti 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过REST API接口获取指标代码为EMP_2EMP_SEX_OCU_NB的原始数据,并依据亚洲ISO3国家代码进行地域筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义标准,对各国劳动力调查、家庭收入调查及行政记录等微观数据进行协调与整合,最终生成ILO的模化估算值。Electric Sheep Asia团队负责将数据重新封装为Parquet格式,并发布至HuggingFace平台,确保研究者可通过标准接口直接调用。
特点
数据集涵盖49个亚洲国家自1991年至2025年的年度就业观测数据,总计46,170条记录,观测指标为按性别与职业分类的就业人数(单位:千)。数据包含丰富的维度字段,如性别(总/男/女)、职业分类(基于ISCO-08标准)以及数据来源标识,支持多角度分析。所有观测值均附有状态标志(如调整值),便于用户评估数据质量。数据集采用CC-BY-4.0许可协议,兼具权威性与开放性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载数据,并转换为Pandas DataFrame进行操作。典型应用包括按国家代码筛选特定国家的子集、对单指标进行时间序列可视化分析,以及利用透视表构建国家×年份的观测值矩阵。数据预处理时需注意年度频率特征,部分指标可能仅存在季度或月度序列,且对于同一国家年份的多源数据,ILO选取了最佳来源作为最终值。
背景与挑战
背景概述
在全球劳动统计领域,国际劳工组织(ILO)通过其ILOSTAT数据库长期致力于提供标准化的就业数据,以支持跨国比较与政策制定。该数据集由ILO于2025年发布,经Electric Sheep Asia重新打包,聚焦于亚洲49个国家1991年至2025年间按性别与职业划分的就业人数(以千计),包含46,170条观测值。其核心研究问题在于揭示亚洲区域就业结构的动态演变,尤其关注性别与职业维度的交互影响。作为ILO modelled estimates系列的一部分,该数据集填补了亚洲地区长期、可比就业数据的空白,对劳动经济学、发展研究及国际组织评估可持续发展目标(SDG)中的体面劳动指标具有重要支撑作用。
当前挑战
该数据集所解决的领域问题主要集中于劳动统计中性别与职业交叉分析的复杂性,尤其是如何通过模型估计弥补国家间调查方法、定义差异及数据缺失导致的不可比性。构建过程中的挑战涵盖:其一,多来源数据(如劳动力调查、行政记录)的统一与调和,需遵循国际劳工统计学家会议(ICLS)定义;其二,对时间跨度长达35年且覆盖49国的数据,需处理不同国家在职业分类体系(如ISCO-08)实施上的滞后与偏差;其三,模型估计本身面临假设简化与现实异质性之间的张力,特别是在非正规就业普遍、统计基础设施薄弱的亚洲国家,估计值的可靠性需通过观测状态标志(如“adjusted”)谨慎辨析。
常用场景
经典使用场景
该数据集源自国际劳工组织(ILO)的ILOSTAT权威统计数据库,汇集了1991年至2025年间亚洲49个国家的就业数据,按性别和职业进行细致划分。其最经典的使用场景在于支持长时序面板数据分析,研究者能够利用46,170条观测记录构建跨国家、跨年代的就业趋势模型。通过将数据转换为国家×年份的矩阵形式,可进行区域间就业结构的横向对比,或针对单一国家进行时间序列预测,为劳动经济学领域提供了标准化的数据基础。
实际应用
在实际应用层面,该数据集可服务于区域发展政策制定与国际组织的监测评估工作。通过跟踪不同职业类别的就业吸纳能力,政策制定者能够识别劳动力市场的结构性短板,设计针对性的职业技能培训方案。同时,数据集支持对体面劳动目标(SDG)进展的量化监测,帮助政府与公益机构评估男女就业平等政策的实际成效,并在跨国比较中定位本国的相对位置与改进空间。
衍生相关工作
围绕该数据集已涌现出一系列相关性工作。在机器学习和统计建模领域,研究人员基于此数据开发了亚洲就业的时序预测模型,如使用长短期记忆网络(LSTM)预测未来职业结构变化。在数据工程层面,Electric Sheep Asia团队将其重新打包为Parquet格式并统一Schema,使得数据可直接通过HuggingFace Datasets库加载,显著降低了劳动经济学研究者使用高质量劳动力数据的技术门槛。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务