electricsheepasia/asia-ilo-emp-publ-sex-how-nb-public-sector-employment-by-sex-and-weekly-hours-a
收藏数据链接:
官方服务:
资源简介:
该数据集包含亚洲30个国家从1997年至2025年的公共部门就业数据,按性别和每周实际工作小时数分类(以千人为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,涵盖5,853个观测值和1个主要指标,用于表格分类、回归和时间序列预测等任务。数据集经过Electric Sheep Asia重新打包,以标准化模式提供,便于机器学习使用。
This dataset contains public sector employment data by sex and weekly hours actually worked (in thousands) for 30 Asia countries from 1997 to 2025. Sourced from the International Labour Organizations ILOSTAT database, it includes 5,853 observations and 1 distinct indicator, designed for tabular classification, regression, and time-series forecasting tasks. Repackaged by Electric Sheep Asia with a normalized schema for machine learning readiness.
提供机构:
electricsheepasia搜集汇总
数据集介绍

构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口直接抓取公共部门就业指标(EMP_PUBL_SEX_HOW_NB)的原始数据,并基于亚洲ISO3国家代码进行地域过滤。原始数据由ILO依据国际劳工统计学家会议(ICLS)定义进行统一处理,来源信息在`source.label`字段中得以详尽标注,确保了数据溯源的可操作性。数据集由Electric Sheep Asia团队重新封装,以结构化表格形式呈现,便于机器学习应用。
特点
数据集涵盖1997至2025年间30个亚洲国家共计5,853条观测记录,聚焦公共部门就业人数(单位:千人)这一核心指标,并按性别(总、男、女)与每周实际工作小时进行细粒度拆解。数据以年度频率呈现,包含`ref_area`、`time`、`obs_value`等关键字段,并附有观测状态、数据来源及序列断裂等质量标记,为时间序列分析与面板数据建模提供了可靠基础。
使用方法
用户可通过HuggingFace的`datasets`库便捷加载数据:执行`load_dataset('electricsheepasia/asia-ilo-emp-publ-sex-how-nb-public-sector-employment-by-sex-and-weekly-hours-a')`即可获取训练集。随后可转换为Pandas DataFrame进行探索性分析,例如按国家代码过滤、按年份排序绘制时间序列,或使用pivot_table构建国家×年份的矩阵,适用于分类、回归及时间序列预测等任务。
背景与挑战
背景概述
亚太地区公共部门劳动力数据是评估政府治理效能、性别平等进程与劳动市场结构变迁的关键指标。国际劳工组织(ILO)统计司通过ILOSTAT数据库系统收录全球劳动力数据,其核心指标“EMP_PUBL_SEX_HOW_NB”专注刻画公共部门雇员数量、性别分布与周实际工作小时数。该数据集由Electric Sheep Asia于2025年重新打包发布,整合了亚洲30个经济体自1997年至2025年间的5,853条高质量观测值,涵盖菲律宾、伊朗、土耳其等代表性国家。通过统一数据模式并以Parquet格式结构化存储,该数据集极大降低了跨区域比较研究的预处理壁垒,为亚太地区劳动经济学、公共政策分析与可持续发展目标(SDG)监测提供了标准化、可复现的数据基础。
当前挑战
该数据集面临的核心领域挑战在于公共部门就业统计中存在显著的跨国方法论差异与数据断层。一方面,各国劳动力调查(LFS)的抽样框架、工时定义与职业分类标准尚未完全统一,导致不同来源数据的可比性受限,例如部分观测值因方法论修订(如I11:264标注)出现序列断裂。另一方面,数据集构建过程需解决多源异构数据的清洗与调和难题,包括处理缺失指标值、识别源数据可靠性标志(如U表示不可靠观测)以及应对部分国家时间序列数据稀疏的问题(如孟加拉国仅有21条记录)。此外,性别维度分类(SEX_T/SEX_M/SEX_F)与周工时带(HOW_BANDS_TOTAL)的层级整合,要求对跨年份、跨国别的指标进行一致性校验,以确保机器学习模型在面板数据建模中的鲁棒性。
常用场景
经典使用场景
该数据集收录了1997年至2025年间亚洲30个国家的公共部门就业数据,按性别与每周实际工作小时数进行细致分层,共计5853条观测记录。在经典使用场景中,研究者常将其用于构建面板数据模型,以分析亚洲各国公共部门劳动力市场的长期演变趋势。通过按性别(男性、女性、总计)和时间维度的交叉对比,该数据集为评估公共部门就业规模的性别差异、劳动强度分布以及宏观经济波动对公共就业的影响提供了坚实的数据基础。其标准化的ILOSTAT分类体系使得跨国比较分析成为可能,是劳动经济学与公共政策领域不可或缺的时序数据资源。
解决学术问题
该数据集的核心学术价值在于解决了亚洲区域公共部门就业统计长期缺乏统一、可跨境比较的微观时序数据这一关键难题。在学术研究中,它助力学者深入探讨公共部门就业的结构性特征,例如不同性别群体的周工作小时分布差异及其背后的制度性原因。同时,该数据支持对公共就业政策的有效性进行实证检验,例如分析劳动法规调整或财政支出变化对公共部门雇佣规模的动态影响。其包含的不连续标志(如方法论修订)还能帮助研究者识别统计口径变化带来的断点效应,从而更准确地建模就业趋势,推动了劳动经济学与社会分层研究在亚洲地区的深入发展。
衍生相关工作
该数据集的发布催生了多个方向的衍生研究工作。在方法学层面,其标准化的面板结构激发了许多关于亚洲劳动力时序数据插补与预测的研究,例如利用时序分解模型(如STL或Prophet)对缺失年份进行估计,或构建贝叶斯分层模型来捕捉国家间的异质性。在实证研究领域,已有学者基于此数据探讨公共部门就业对私营部门工资水平的外溢效应,以及女性公共部门就业比率与社会生育率之间的关联。此外,该数据集常被用作深度学习模型在教育、健康等跨领域公共就业影响分析中的特征输入,推动了公共经济学与数据科学交叉领域的新知产生。
以上内容由遇见数据集搜集并总结生成



