遇见数据集

electricsheepasia/asia-ilo-emp-publ-sex-eco-nb-public-sector-employment-by-sex-and-economic-activ

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的公共部门就业统计数据,专门针对亚洲地区。数据集记录了40个亚洲国家从1985年至2025年期间,按性别和经济活动划分的公共部门就业人数(以千为单位),共包含28,683个观测值。核心指标为EMP_PUBL_SEX_ECO_NB,表示按性别和经济活动划分的公共部门就业(千)。数据字段包括国家代码、国家名称、年份、性别分类(总计、男性、女性)、观测值、数据来源和质量标志等,适用于表格分类、回归和时间序列预测等任务。数据经过ILO统计部门基于国际劳工统计学家会议(ICLS)定义进行标准化处理,并由Electric Sheep Asia重新打包为机器学习就绪格式。

This dataset contains public sector employment statistics from the International Labour Organization (ILO) ILOSTAT database, specifically focused on Asia. It includes 28,683 observations across 40 Asian countries from 1985 to 2025, covering public sector employment by sex and economic activity (in thousands). The primary indicator is EMP_PUBL_SEX_ECO_NB, which represents Public sector employment by sex and economic activity (thousands). Data fields include country codes, country names, year, sex disaggregation (total, male, female), observed values, data sources, and quality flags, suitable for tabular classification, regression, and time-series forecasting tasks. The data is harmonized by the ILO Department of Statistics using International Conference of Labour Statisticians (ICLS) definitions and repackaged by Electric Sheep Asia into a machine-learning-ready format.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-publ-sex-eco-nb-public-sector-employment-by-sex-and-economic-activ 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,该数据库是全球劳动力统计领域的权威来源,汇集了各国劳动力调查、家庭收入调查及行政记录等多源数据。数据通过ILOSTAT REST API直接获取,并依据亚洲ISO3国家代码进行筛选与整合。原始数据经由ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行协调统一,确保了跨国可比性。最终由Electric Sheep Asia团队重新打包为Parquet格式,形成包含28,683条观测值、覆盖40个亚洲国家及1985至2025年时间跨度的结构化数据集。
特点
该数据集以公共部门就业为核心主题,聚焦于按性别和经济活动划分的就业人数(单位:千)。其核心特点在于高度的结构化多维分解能力,提供了性别(男性、女性、总计)与经济部门等细分维度,便于研究者进行交叉分析。数据标注了详尽的质量标识,如观测状态(可靠性标记)与体系变更注释,增强了数据的透明度与可用性。此外,数据集整合了来自不同调查来源的元数据,可追溯至原始数据源,为深度验证提供了依据。
使用方法
用户可通过HuggingFace Datasets库轻松加载该数据集,调用`load_dataset()`函数即可获取可直接转化为Pandas DataFrame的结构化数据。典型的分析流程包括:按国家代码过滤以聚焦特定区域;按指标代码筛选并排序时间序列数据,进行趋势可视化;或利用透视表功能构建国家与年份的交叉矩阵,以开展面板数据分析。数据集兼容分类、回归及时间序列预测等多种任务场景,为公共劳动力政策的量化研究提供了便捷的数据接口。
背景与挑战
背景概述
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT数据库,是全球劳动统计领域最具权威性的数据来源之一。由Electric Sheep Asia于2025年重新整理并发布至HuggingFace平台,聚焦亚洲40个国家1985年至2025年间公共部门就业的性别与经济活动分布。数据集包含28,683条观测记录,旨在为研究亚洲地区公共部门劳动力结构变迁、性别平等进程及经济转型提供标准化、机器可读的时序数据。其核心研究问题围绕公共就业的性别差异与行业异质性展开,尤其关注发展中国家在非正规经济与公共部门改革背景下的劳动力市场动态。作为连接宏观劳动政策与微观实证分析的数据桥梁,该数据集为发展经济学、劳动经济学及公共管理领域的研究者提供了跨时跨国的宝贵资源。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:公共部门就业数据在全球范围内长期存在统计口径不一、时序断裂及性别分类粗糙等痛点,尤其是在亚洲地区,各国经济活跃度差异显著,非正规就业比例高企,导致基于国际标准的就业数据难以准确刻画实际劳动力配置状况。构建过程中亦遭遇多重难点:来自40个国家的原始数据需经ILO基于国际劳工统计学家会议(ICLS)定义进行统一协调,但各国调查来源(如劳动力调查、行政记录)的覆盖周期、样本设计及职业分类体系各异,导致部分国家出现序列断裂与方法论修订(Break in series)问题;此外,数据集中标注为不可靠(Unreliable)的观测值占比不低,且诸如“非标准经济活动包含”等注释信息进一步增加了清洗与建模的复杂度,要求使用者具备扎实的计量经济学功底以审慎处理数据质量标记。
常用场景
经典使用场景
该数据集涵盖了亚洲40个国家在1985年至2025年间按性别和经济活动分类的公共部门就业人数,共计28,683条观测记录。经典使用场景包括利用时间序列分析揭示亚洲各国公共部门就业的长期演变趋势,对比不同经济活动中公共部门的劳动力配置差异,以及通过性别维度探究公共就业中的性别均衡状况。研究者可借助该数据构建固定效应模型或面板数据模型,解析经济增长、政策调整与公共部门就业波动之间的复杂关联。
衍生相关工作
以该数据集为基础,研究者已衍生出多项范式性工作。其一,结合ILOSTAT其他指标形成跨域分析框架,探讨公共就业与工资水平、劳动生产率之间的协同演变。其二,使用机器学习方法对亚洲公共部门就业进行预测建模,比较VAR、LSTM与传统经济计量模型的适用性。其三,构建面板向量自回归模型,量化外部经济冲击如何通过公共部门传导至不同性别和行业的劳动力市场,为跨区域比较研究奠定方法论基石。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区公共部门就业的性别与经济活动交叉分析,为劳动力市场研究提供了跨越四十国、长达四十年的时序面板数据。在当今全球劳动力结构深刻变革的背景下,公共部门作为就业与性别平等的关键场域,其数据价值愈发凸显。前沿研究方向主要围绕性别差异在公共部门就业中的动态演变、经济结构转型对公共雇佣的影响,以及跨国比较中的制度性因素分析。此外,该数据集与ILOSTAT的权威框架对接,使其成为探讨可持续发展目标(SDG)中体面劳动与性别平等议题的重要实证基础,助力研究者揭示亚洲地区公共部门就业的模式、趋势与政策效应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务