遇见数据集

electricsheepasia/asia-ilo-emp-publ-sex-edu-nb-public-sector-employment-by-sex-and-education-thou

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含亚洲33个国家从1997年至2025年的公共部门就业数据,共有4,129个观测值。核心指标为EMP_PUBL_SEX_EDU_NB,表示按性别和教育程度划分的公共部门就业人数(以千为单位)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过官方API获取并过滤为亚洲国家。数据集提供了年度时间序列数据,包括国家代码、年份、观测值、数据来源、性别分类(总计、男性、女性)和教育程度分类等列。数据经过ILO的标准化处理,确保与国际劳工统计学家会议(ICLS)定义一致,并包含数据质量标记(如可靠性状态)。该数据集适用于表格分类、回归和时间序列预测等机器学习任务,旨在支持对亚洲公共部门就业趋势的分析和研究。

This dataset contains public sector employment data for 33 Asian countries from 1997 to 2025, with 4,129 observations. The core indicator is EMP_PUBL_SEX_EDU_NB, representing public sector employment by sex and education (in thousands). Data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via the official API and filtered for Asian countries. It provides annual time-series data, including columns such as country code, year, observed value, data source, sex disaggregation (total, male, female), and education classification. The data is harmonized by ILO to align with International Conference of Labour Statisticians (ICLS) definitions and includes quality flags (e.g., reliability status). The dataset is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting, aiming to support analysis and research on public sector employment trends in Asia.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-publ-sex-edu-nb-public-sector-employment-by-sex-and-education-thou 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,聚焦亚洲地区公共部门就业中按性别与教育程度划分的从业人数(单位:千人)。数据通过ILOSTAT官方REST API接口直接采集,原始指标代码为EMP_PUBL_SEX_EDU_NB,并依据亚洲国家ISO3编码进行地理过滤,最终整合了33个亚洲国家自1997年至2025年间的4,129条观测记录。所有原始微观数据均依据国际劳工统计学家会议(ICLS)定义进行统一调和,每一条观测均附有来源标识(source.label),确保数据来源可追溯。由Electric Sheep Asia团队完成数据清洗、格式标准化并以Parquet格式封装,用户可通过HuggingFace Datasets库便捷加载。
特点
该数据集具有显著的多维分层特征。首先,覆盖时间跨度长达28年,空间上囊括伊朗、柬埔寨、泰国、越南等33个亚洲经济体,提供了横跨国家与年份的面板数据结构。其次,数据支持按性别维度(男性、女性、合计)进行分层,并隐含教育程度分类变量(classif1),使得研究者能够剖析不同教育背景人群在公共部门的就业分布模式。此外,每条记录还包含观测值状态标识(obs_status)、系列断裂注释(note_indicator)等质量标签,为使用者评估数据的可靠性与连续性提供了透明依据。数据以年度频率发布,在ILO优选来源的基础上,保持了统计口径的一致性。
使用方法
使用该数据集极为简便。推荐通过HuggingFace Datasets库的load_dataset()函数直接加载至Python环境,并转换为Pandas DataFrame以便后续分析。用户可依据ref_area列筛选特定国家(如IDN对应印尼),或通过indicator列聚焦单一指标EMP_PUBL_SEX_EDU_NB进行时间序列分析。经典用法包括按时间排序绘制折线图以观察趋势,或利用pivot_table函数构建国家×年份的数据矩阵,支撑跨国的面板计量分析。数据中的sex与classif1列可进一步用于分组聚合,计算不同性别与教育层次下的就业结构占比,适合从事劳动经济学、公共政策及亚洲区域发展研究的学者深度挖掘。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Asia于2025年重新打包发布,聚焦亚洲33个国家的公共部门就业状况。核心研究问题在于揭示1997至2025年间,基于性别与教育维度划分的公共部门从业人员数量变化趋势。作为ILOSTAT数据库的衍生资源,该数据集整合了各国劳动力调查、行政记录等多源数据,为分析亚洲地区劳动力市场结构、性别平等及教育回报率提供了标准化定量基础,对劳动经济学、发展社会学及国际比较研究具有重要参考价值。
当前挑战
该数据集面临的领域挑战在于,公共部门就业的跨国可比性受制于各国对‘公共部门’界定差异、教育分类标准不统一以及数据采集方法的异质性。构建过程中,ILO需从多源异构数据中整合时间跨度近30年、覆盖语言和统计口径各异的33国数据,面临数据缺失值处理、观测值可靠性标记(如‘不可靠’标签)以及方法修订导致的序列断裂等难题。此外,不同来源数据的最佳筛选与性别人口学特征的分解对齐也构成技术瓶颈。
常用场景
经典使用场景
在劳动经济学与公共政策研究领域,该数据集的核心应用场景在于剖析亚洲地区公共部门就业的结构性特征。研究者可借助其按性别与教育程度细分的数据,系统考察不同国家公共部门劳动力市场的演变规律。通过时间序列分析,能够识别从1997年至2025年间公共部门就业规模的波动趋势、性别差异的变迁路径以及教育水平对就业机会的差异化影响,从而为跨国比较研究提供坚实的数据基础。
解决学术问题
该数据集有效回应了多个悬而未决的学术难题。它使学者能够量化公共部门就业中的性别隔离程度,探究教育扩张是否促进了女性在公共领域的职业融入。同时,数据集为验证人力资本理论在公共部门的适用性提供了实证素材,即教育回报率是否因性别和部门差异而呈现异质性。此外,其长达近三十年的观测跨度,助力分析经济发展阶段与公共就业政策之间的动态交互关系,填补了亚洲区域系统性数据的空白。
衍生相关工作
围绕该数据集已衍生出一系列富有影响力的学术探索。研究者基于其细粒度特征,构建了预测公共部门就业规模的机器学习模型,将性别与教育维度作为关键输入特征。此外,有工作利用该数据验证了制度变迁理论,揭示亚洲国家从传统经济向现代公共服务体系转型过程中就业结构的趋同模式。另一部分经典研究则聚焦于性别平等与经济增长的关联,通过面板数据回归论证女性公共部门就业率的提升对宏观经济韧性的正向贡献。这些工作共同扩展了劳动经济学的理论边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务