遇见数据集

electricsheepasia/asia-ilo-emp-publ-sex-ec2-nb-public-sector-employment-by-sex-and-economic-activ

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲34个国家从1997年至2025年的公共部门就业数据,按性别和经济活动(ISIC第2级)分类,单位为千。数据集共有27,037个观测值,覆盖1个独立指标,主要关注公共部门工作者。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理,适用于表格分类、回归和时间序列预测等任务。数据集包括国家代码、年份、性别分类、经济活动和观测值等列,并提供了数据来源和质量标志,以支持劳动统计分析和机器学习应用。

This dataset contains 27,037 observations of public sector employment data across 34 Asia countries, spanning from 1997 to 2025, disaggregated by sex and economic activity at ISIC level 2, with values in thousands. It covers 1 distinct indicator related to public sector workers, sourced from the ILOSTAT database of the International Labour Organization (ILO). The data is harmonized using ICLS definitions and includes columns for country codes, years, sex categories, economic activity classifications, and observation values, along with source and quality flags for traceability. It is designed for tabular classification, regression, and time-series forecasting tasks, and is repackaged by Electric Sheep Asia for easy integration via HuggingFace Datasets.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-publ-sex-ec2-nb-public-sector-employment-by-sex-and-economic-activ 数据集图片
构建方式
该数据集旨在为亚洲地区公共部门就业的性别与经济活动维度提供精细化的时序数据支撑。其构建基于国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过调用REST API直接抽取指标代码为EMP_PUBL_SEX_EC2_NB的原始数据,并依据ISO 3166-1 alpha-3标准严格筛选出34个亚洲国家的观测记录。ILOSTAT利用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、行政记录等微观数据进行标准化调和,所有数据来源均以source.label字段标记,确保数据溯源清晰可查。最终形成涵盖1997年至2025年、共计27,037条观测的规整数据集。
特点
该数据集的核心特色在于其多维度精细化的结构设计。数据不仅包含公共部门就业人数这一核心指标,还通过sex字段将就业细分为总计、男性和女性三类,并借助classif1字段引入ISIC-Rev.4第二层级的经济活动分类,从而支持交叉维度的深入分析。此外,数据集保留了obs_status、note_indicator等字段,用以标识数据质量(如临时值或不可靠值)与序列断点等元信息,为严谨的统计建模提供了透明性保障。时间跨度覆盖近三十年,地理范围涵盖东亚、东南亚、南亚及中亚等多区域,兼具广度和深度。
使用方法
使用者可通过HuggingFace Datasets库以load_dataset()函数一键加载数据,并将训练集转换为Pandas DataFrame进行后续操作。针对单个国家的时序分析,可直接按ref_area字段筛选特定国家代码,例如过滤印度尼西亚的数据。对于单一经济指标的时间序列可视化,可对indicator字段进行过滤后按年份排序并绘制折线图。若需构建国家与年份的交叉面板矩阵,可利用pivot_table方法以time为行索引、ref_area为列索引、obs_value为填充值进行重塑。这些操作均基于标准的数据科学生态系统,实现高效率和可复现性。
背景与挑战
背景概述
公共部门就业数据是衡量国家劳动力结构、性别平等及经济政策成效的关键指标。该数据集由国际劳工组织(ILO)于2025年整理发布,经Electric Sheep Asia重新打包并托管于HuggingFace平台,涵盖1997至2025年间34个亚洲国家的27,037条观测记录。核心研究问题聚焦于通过性别与经济活动的交叉维度(ISIC第二层级),揭示亚洲公共部门就业的时空分布特征与演变趋势。数据集源自ILOSTAT权威统计数据库,其标准化处理流程基于国际劳工统计学家会议(ICLS)定义,为劳动经济学、性别研究及公共政策分析提供了高可比性的基础数据,对理解亚洲劳动力市场的结构性变化具有重要支撑作用。
当前挑战
该数据集面临的核心挑战包括:一、所解决的领域问题——传统劳动统计多聚焦总量指标,缺乏按性别与经济活动的精细分层,难以精准刻画公共部门内部的就业异质性,而该数据集需在保持跨国家、跨年度可比性的同时,处理因各国调查方法、行业分类标准及数据质量差异导致的统计口径不统一问题;二、构建过程中的挑战——数据整合需克服不同国家原始调查数据的缺失、年度断点及异常值标记(如备注列中标注的“方法修订”及“不可靠”状态),同时需处理多源数据中同一国家年份内“最佳来源”的选择逻辑,确保时间序列的连续性与一致性,这对数据清洗与质量控制的工程化能力提出了较高要求。
常用场景
经典使用场景
该数据集最经典的应用场景集中于公共部门就业的时空动态分析。凭借涵盖1997至2025年间34个亚洲国家、逾两万七千条观测记录的丰富信息,研究者可以借助性别与经济活动(ISIC二级分类)双重维度,探析公共部门劳动力市场在区域经济发展浪潮中的演变轨迹。它不仅是绘制亚洲公共就业全景图的宝贵素材,也是实现跨国家、跨时段比较研究的理想数据基石。
实际应用
在国际组织、国家劳工部门及发展研究智库的实际运作中,该数据集为就业政策评估与劳动力市场监测提供了无可替代的量化工具。例如,政策制定者可依据数据追踪各国公共部门在特定经济活动类别中的用工趋势,及时发现就业结构的异常波动。同时,基于性别筛选的数据子集能够支撑性别敏感型就业方案的成效评估,帮助优化公共资源配置。在跨国发展援助项目中,此类标准化面板数据也常被用作基准参照,辅助衡量亚洲各国在实现体面劳动目标方面的实际进展。
衍生相关工作
以该数据集为牵引,一系列衍生研究工作得以蓬勃发展。在学术界,它常被整合进更大的劳动力市场面板中,用于构建公共就业与私人就业联动的多方程计量模型。部分研究围绕数据中的源标识与质量标记,开发出专门处理时序数据断点与统计标准变迁的稳健性分析框架。此外,该数据集也激发了面向亚洲区域特色的就业预测研究,例如基于长历史周期的公共部门就业时序建模,以及与宏观经济增长、财政收支等协变量结合的因果推断工作,相关成果为国际劳动统计的规范化应用树立了新的方法论标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务