遇见数据集

electricsheepasia/asia-ilo-emp-publ-sex-geo-nb-public-sector-employment-by-sex-and-rural-urban-ar

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的公共部门就业数据,专门针对亚洲地区。数据集涵盖26个亚洲国家,时间跨度为1997年至2025年,共包含2,094个观测值。核心指标为EMP_PUBL_SEX_GEO_NB,即按性别和城乡区域划分的公共部门就业人数(以千计)。数据以表格形式组织,包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、年份、观测值、观测状态等列。数据集适用于表格分类、表格回归和时间序列预测等任务,并已由Electric Sheep Asia重新打包为ML就绪格式,便于通过Hugging Face的`load_dataset()`加载。数据来源基于ILO对原始调查数据的协调处理,确保符合国际劳工统计会议(ICLS)定义。

This dataset contains public sector employment data from the International Labour Organization (ILO) ILOSTAT database, focused on Asia. It covers 26 Asian countries from 1997 to 2025, with 2,094 observations. The key indicator is EMP_PUBL_SEX_GEO_NB—public sector employment by sex and rural/urban areas (in thousands). The data is structured in tabular format, including columns such as country code, country name, data source, indicator code, sex disaggregation (total, male, female), year, observed value, and observation status. It is suitable for tabular classification, regression, and time-series forecasting tasks, and has been repackaged by Electric Sheep Asia into an ML-ready format for easy loading via Hugging Faces `load_dataset()`. The data is harmonized by ILO based on raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions.

提供机构:
electricsheepasia
搜集汇总
数据集介绍
electricsheepasia/asia-ilo-emp-publ-sex-geo-nb-public-sector-employment-by-sex-and-rural-urban-ar 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过调用其REST API获取公共部门就业指标的原始数据,并进一步筛选出亚洲地区的ISO3国家代码。数据经过ILOSTAT基于国际劳工统计学家会议(ICLS)定义的标准进行统一化处理,确保了跨国家与时间序列的一致性。随后,由Electric Sheep Asia团队对数据进行重新打包,转换为Parquet格式并发布至HuggingFace平台,使研究者能够便捷地通过标准化接口调用。数据集中包含了2094条观测值,覆盖26个亚洲国家,时间跨度从1997年到2025年,主要变量为按性别和城乡地区划分的公共部门就业人数(单位:千人)。
特点
本数据集的核心特质在于其精细的维度划分与高质量的数据溯源。首先,数据按性别(男性、女性、总计)和城乡地域(国家、城市、农村)进行分层,能够支持多维度的劳动市场分析。其次,每个观测值均附带了数据来源标签(如劳动力调查)、观测状态标记(如序列中断)以及附注说明,便于用户识别数据质量与潜在偏差。此外,数据集仅聚焦于一个关键指标——公共部门就业,主题明确,结构紧凑,适合用于时间序列预测、面板数据回归以及分类建模等任务。
使用方法
使用者可通过HuggingFace的`datasets`库直接加载数据,仅需一行代码`load_dataset('electricsheepasia/asia-ilo-emp-publ-sex-geo-nb-public-sector-employment-by-sex-and-rural-urban-ar')`即可获取训练集。借助`to_pandas()`方法可将数据转化为DataFrame格式,进而利用`pandas`进行灵活的子集筛选,例如按国家代码过滤,或按指标取值进行时间序列分析。推荐对`obs_value`列执行透视表操作,构建国家与年份的矩阵,以辅助面板数据建模或可视化探索。数据集遵循CC-BY 4.0许可,使用时应引用ILO原始数据及Electric Sheep Asia的重新打包版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门基于ILOSTAT数据库整理,并由Electric Sheep Asia于2025年重新打包发布,聚焦于1997至2025年间亚洲26个国家的公共部门就业情况,涵盖性别与城乡区域维度的细分数据。作为全球劳动统计的权威来源,ILOSTAT通过对各国劳动力调查、行政记录等多源数据的整合与标准化处理,为研究公共部门劳动力结构及其演变提供了扎实基础。该数据集的出现,填补了亚洲地区公共部门就业领域长时序、跨国产出数据的空缺,为劳动经济学、发展经济学与公共政策研究提供了可复用的量化工具,尤其有助于探究性别就业差异、城乡劳动力分布及区域经济发展模式等核心议题,在相关学术领域具有显著的数据价值与影响力。
当前挑战
该数据集面临的核心挑战首先在于所解决的领域问题:公共部门就业的性别与城乡差异分析长期受困于数据稀缺与口径不一,跨国的可比性极低,非正规就业与行政记录偏差也加剧了统计的难度。其次,构建过程中诸项挑战并存,包括从ILOSTAT API批量抽取数据时需应对接口稳定性与数据版本控制的问题;需对源自不同国家的多种调查定义(如ICLS标准下的分类差异)进行协调与标识,同时处理缺失值、异常值与序列断裂标记,以保证分析链条的完整性。此外,时间序列频率的不一致(年度为主而少季度、月度数据)与空间粒度有限(仅有国别级),限制了更精细的推断或微观计量分析,亦对用户的后续数据处理能力提出较高要求。
常用场景
经典使用场景
该数据集整合了国际劳工组织(ILO)ILOSTAT数据库中26个亚洲国家1997年至2025年间公共部门就业的官方统计资料,涵盖性别与城乡地域的精细维度。其最经典的用途在于构建面板数据模型,以探索亚洲各国公共部门就业规模随时间的演变轨迹及其结构性差异。研究者常利用该数据进行描述性统计分析,揭示不同性别和城乡群体在公共部门中的就业分布特征,或结合国家宏观经济指标进行相关性分析。同时,该数据也为时间序列预测任务提供了优质素材,支持对特定国家公共就业趋势的建模与短期展望。
衍生相关工作
该数据集的发布催生了一系列具有影响力的衍生工作。一方面,它促进了基于ILOSTAT的标准化数据处理管线的开发,如Electric Sheep Asia团队建立的自动化数据获取与清洗框架,为后续亚洲劳动数据的系统化整合树立了范式。另一方面,以该数据集为验证基础,涌现了若干关于公共部门就业波动与宏观经济周期联动的计量经济学研究,以及利用机器学习模型对不同人口特征下的公共就业参与率进行预测的尝试。此外,该数据也常被作为基准数据集,用于测试和比较各类区域劳动力市场模型的预测精度与泛化能力。
数据集最近研究
最新研究方向
该数据集聚焦于亚洲地区公共部门就业的性别与城乡差异,为劳动经济学与可持续发展研究提供了宝贵的纵向面板数据。近年来,随着亚太经济体公共部门改革深化及可持续发展目标(SDGs)中对体面劳动(目标8)与性别平等(目标5)的重视,该数据集在量化公共就业结构性变化、评估城乡就业鸿沟以及追踪女性在公共部门中的代表性等前沿议题中扮演关键角色。特别地,结合ILOSTAT所采用的国际劳工统计学家会议(ICLS)标准化定义,该数据有助于跨国比较研究,揭示不同发展阶段国家在公共部门就业上的异质性路径,其跨越1997至2025年的时间跨度更使得长周期劳动市场动态分析成为可能,为政策制定与学术研究提供了稳健的经验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务