遇见数据集

electricsheepasia/asia-ilo-emp-temp-sex-ind-ocu-nb-employment-by-ilo-sector-and-sex-and-occupation-th

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的就业数据,专门针对亚洲地区。数据集涵盖了33个亚洲国家从2000年至2025年的238,833个观测值,核心指标为EMP_TEMP_SEX_IND_OCU_NB,即按ILO部门、性别和职业划分的就业人数(以千计)。数据通过ILOSTAT REST API获取,并按照国际劳工统计学家会议(ICLS)的定义进行标准化处理,确保跨国家的一致性。数据集包含详细的分类维度,如性别(总计、男性、女性等)、行业分类和职业分类,并提供了数据来源、观测状态和相关注释信息。数据以年度频率发布,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Asia重新打包,以Parquet格式提供,便于机器学习研究和使用。

This dataset contains employment data from the International Labour Organization (ILO) ILOSTAT database, specifically focused on Asia. It includes 238,833 observations across 33 Asian countries from 2000 to 2025, with the core indicator EMP_TEMP_SEX_IND_OCU_NB, representing employment by ILO sector, sex, and occupation (in thousands). Data is sourced via the ILOSTAT REST API and harmonized using International Conference of Labour Statisticians (ICLS) definitions for cross-country consistency. The dataset features detailed disaggregation dimensions such as sex (total, male, female, etc.), industry classification, and occupation classification, along with source information, observation status flags, and related notes. Data is published at annual frequency and is suitable for tasks like tabular classification, regression, and time-series forecasting. Repackaged by Electric Sheep Asia in Parquet format for easy machine learning research and usage.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-temp-sex-ind-ocu-nb-employment-by-ilo-sector-and-sex-and-occupation-th 数据集图片
构建方式
该数据集整合自国际劳工组织(ILO)的ILOSTAT数据库,该机构作为全球劳动力统计的权威来源,汇集了来自各国劳动力调查、家庭收支调查、企业调查及行政记录等多源数据,并依据国际劳工统计学家会议(ICLS)定义进行统一标准化处理。数据集通过调用ILOSTAT REST API直接获取指标代码为EMP_TEMP_SEX_IND_OCU_NB的原始数据,并依据亚洲地区ISO3国家代码进行地理过滤,最终形成涵盖33个亚洲国家、时间跨度为2000年至2025年、共计238,833条观测记录的综合性表格数据集。每条记录均标注了数据来源,以确保可追溯性。
特点
该数据集的核心特色在于其精细的多维分类结构,支持按性别(总、男性、女性、其他)、国际劳工组织部门及职业技能等级进行交叉分析,为深入探究亚洲劳动力市场的结构性特征提供了宝贵资源。数据集包含丰富元数据,如观测状态标记(如临时性、不可靠)和多种注释字段(涉及方法变更、非标准职业分类等),便于用户进行数据质量评估。此外,其时间序列属性使其适用于面板数据分析和预测建模,覆盖的33个国家确保了显著的地理多样性。
使用方法
用户可通过HuggingFace的datasets库便捷地加载该数据集,只需一行代码`load_dataset('electricsheepasia/asia-ilo-emp-temp-sex-ind-ocu-nb-employment-by-ilo-sector-and-sex-and-occupation-th')`即可获取数据。加载后的数据可直接转换为Pandas DataFrame进行清洗与分析。典型的应用场景包括按国家过滤进行国别研究、按时间排序进行趋势分析、或利用透视表构建国家×年份矩阵。该数据也适合作为时间序列预测、表格分类与回归等机器学习任务的训练数据,具有即开即用的便捷性。
背景与挑战
背景概述
在劳动经济学与可持续发展目标(SDGs)的研究中,精确的就业数据是剖析区域劳动力结构、性别不平等以及产业变迁的核心基石。由国际劳工组织(ILO)统计部门构建的ILOSTAT数据库,凭借其覆盖200多个经济体的标准化统计数据,已成为全球劳动研究的权威参照。在此背景下,Electric Sheep Asia于2025年对ILOSTAT中的亚洲核心指标进行了系统性重封装,创建了名为“asia-ilo-emp-temp-sex-ind-ocu-nb-employment-by-ilo-sector-and-sex-and-occupation-th”的数据集。该数据集汇集了33个亚洲国家从2000年至2025年间共计238,833条按经济部门、性别及职业分类的就业观测值,旨在为跨学科研究者提供一份经过清洗、可直接用于机器学习和时间序列分析的标准化亚洲劳动力数据资源。其发布不仅弥合了原始数据接口与学术工作流之间的鸿沟,更显著推动了亚洲区域劳动力市场比较研究的数据可及性与可复现性。
当前挑战
该数据集所应对的核心领域挑战在于,亚洲各国因统计能力差异而导致的就业数据碎片化与非可比性问题。具体而言,不同国家的调查方法(如劳动力调查、行政记录)、行业分类标准及职业技能层级定义存在显著异质性,致使跨国产出比较面临严重障碍。在构建过程中,数据集面临的首要挑战是多源数据的语义统一与质量分级,特别是ILOSTAT中来自不同国家调查的原始数据在时间频次(年度/月度)、数据状态标志(如临时、不可靠)以及分类维度(如性别、行业、职业的交叉组合)上存在大量不规则记录。此外,针对同一个国家同一时期的多个候选来源,必须依赖ILO指定的“最佳来源”制度进行数据裁决,这一过程涉及复杂的溯源判断。最终,在保留完整溯源信息(如源标签、观测状态与注释列)的前提下实现数据结构的扁平化,确保238,833条观测的完整性与可解释性,成为构建工作中最具技术挑战性的环节。
常用场景
经典使用场景
该数据集收录了2000年至2025年间亚洲33个国家的就业统计数据,涵盖国际劳工组织(ILO)定义的行业、性别和职业三个维度的交叉分类信息,共计约23.9万条观测记录。经典使用场景包括基于多类别分类变量(如性别、行业、职业)的就业结构分析,以及面向国家-年份-指标面板数据的时间序列预测建模。研究者可借助`load_dataset`接口快速加载数据,利用`pivot_table`构建国家×年份矩阵,或通过`filter`按特定国家和地区提取子集,进行劳动经济学的统计推断与机器学习实验。
解决学术问题
该数据集系统性地解决了亚洲区域劳动市场中长期存在的结构化就业数据碎片化与可获取性低的问题。在学术研究层面,它支撑了劳动力市场性别差异的纵向比较分析、行业间就业弹性测算、以及职业技能结构变迁的跨国家研究。通过提供按国际劳工统计学家会议(ICLS)标准统一口径的序列数据,研究者得以克服不同国家调查口径不一致的障碍,开展稳健的面板数据回归、因果推断或聚类分析,推动了对亚洲新兴经济体工业化进程中就业模式演变规律的深入理解。
衍生相关工作
基于该数据集的工作已经形成了若干代表性研究方向。一是劳动经济学中关于亚洲女性劳动参与率的动态建模,研究者利用性别与行业的交叉分类数据,估计了经济发展水平对性别就业差异的非线性影响。二是结合ILO的多源元数据(如来源标签、可靠性标注),衍生出自动识别数据质量异常与序列中断的方法学工作。三是将本数据集与教育、GDP等其他宏观面板联合使用,构建了多国就业弹性的贝叶斯层次模型,揭示了亚洲区域内部产业结构转型速度的异质性规律。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务