遇见数据集

electricsheepafrica/africa-ilo-emp-publ-sex-ste-nb-public-sector-employment-by-sex-and-status-in-empl

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含2145个观测值,记录了48个非洲国家从1991年至2025年期间公共部门就业按性别和就业状况(千人)的数据。数据集涵盖了1个独特指标(EMP_PUBL_SEX_STE_NB),该指标衡量公共部门就业情况,并按性别和就业状况进行细分。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为非洲国家代码。数据集包括国家代码、国家名称、数据来源、指标代码、性别分类、时间年份、观测值、观测状态等列,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并经过ILO的标准化处理,确保与劳工统计国际定义一致。

This dataset contains 2,145 observations of Public sector employment by sex and status in employment (thousands) data across 48 Africa countries, spanning from 1991 to 2025, covering 1 distinct indicator (EMP_PUBL_SEX_STE_NB). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and filtered to Africa ISO3 country codes. It includes columns such as country code, country name, data source, indicator code, sex disaggregation, time year, observed value, and observation status, suitable for tabular classification, regression, and time-series forecasting tasks. The data is published at annual frequency and harmonized by ILO using International Conference of Labour Statisticians definitions.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
electricsheepafrica/africa-ilo-emp-publ-sex-ste-nb-public-sector-employment-by-sex-and-status-in-empl 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,经由Electric Sheep Africa重新打包并发布至HuggingFace平台。数据通过ILOSTAT REST API直接获取,其接口地址为https://rplumber.ilo.org/data/indicator?id=EMP_PUBL_SEX_STE_NB,并依据非洲ISO3国家代码进行地理筛选。ILOSTAT本身利用国际劳工统计学家会议(ICLS)的定义,对各国劳动力调查、家庭收支调查、企业调查及行政记录等原始微观数据进行统一协调与标准化处理,从而确保跨国可比性。数据集中包含了用于追溯数据来源的source.label字段,体现了严谨的数据溯源机制。最终,这份结构化数据以Parquet格式存储,便于机器学习工作流的直接调用。
特点
该数据集汇聚了覆盖48个非洲国家、时间跨度从1991年至2025年的2145条观测记录,聚焦于公共部门就业人数(以千人为单位)这一核心指标。数据在性别维度上进行了细分,涵盖总计、男性和女性三个类别,为深入分析公共部门就业的性别结构提供了宝贵素材。数据质量方面,标注了观测状态(如序列中断)及相关注释,提醒使用者注意潜在的统计口径变更。尽管大部分数据为年度频率,但数据集并未纳入ILOSTAT中可能存在的月度或季度系列,且对于同一国家年份存在多个来源的情况,采用了ILO选定的“最佳来源”,简化了使用者的判断过程。
使用方法
该数据集与HuggingFace Datasets库无缝集成,用户可通过load_dataset()函数一键加载,并轻松将数据转换为Pandas DataFrame进行后续分析。典型的使用场景包括:按国家筛选以研究单一国家的时间序列趋势;针对特定指标(如EMP_PUBL_SEX_STE_NB)进行排序和可视化,观察公共部门就业的长期演变;以及利用透视表功能构建以时间为行、国家为列的观测值矩阵,便于进行跨国比较或面板数据分析。数据集的结构化模式包含国家代码、来源、指标、性别、分类变量、时间和观测值等关键字段,为时间序列预测、分类或回归等机器学习任务提供了清晰的数据基础。
背景与挑战
背景概述
公共部门就业是衡量国家治理能力与经济结构健康度的核心指标之一,尤其在非洲大陆,公共部门不仅提供大量就业岗位,更是政策实施与社会稳定的关键支柱。国际劳工组织(ILO)作为全球劳动统计的权威机构,其下设的ILOSTAT数据库系统性地整合了各国劳动力调查与行政记录数据,为跨国比较与纵向研究提供了坚实基础。在此背景下,由Electric Sheep Africa于2025年重新打包发布的“非洲公共部门就业数据集”应运而生,该数据集聚焦1991至2025年间48个非洲国家的公共部门就业人数,按性别与就业状态进行细分,内含2145条观测记录。研究团队通过ILOSTAT API精准提取数据,并经过筛选与标准化处理,旨在为非洲劳动经济学、性别差异分析及公共政策评估提供高质量、机器可读的时序数据。该数据集的出现,弥补了非洲地区公共部门就业数据分散、格式不统一的关键缺口,有力推动了区域劳动力研究的可复现性与数据驱动决策的进程。
当前挑战
该数据集所应对的领域挑战主要源于非洲公共部门就业数据的高度碎片化与可比性缺失。首先,非洲各国统计体系发展不均衡,劳动力调查的年度频率、调查方法及问卷设计差异显著,导致同一指标在不同国家甚至同一国家不同年份间存在概念口径不一与数据断层的风险,数据集中的‘obs_status’与‘note_indicator’字段即是对此类方法论变更的显式标注。其次,性别与就业状态维度的精细拆分虽揭示了结构性不平等,却也因部分国家样本量过小或历史记录缺失而面临稀疏性难题,例如仅30%的国家能提供完整的年度序列。在构建过程中,研究者遭遇了ILOSTAT原始API中标识符编码复杂、多源数据重复及‘最佳来源’筛选逻辑不透明等挑战,需依赖详尽的溯源字段(如‘source.label’)进行人工校验与去重。此外,将多来源、多语言的元数据统一为英语标签体系并保持语义一致,亦耗费了大量规范化精力。这些挑战共同刻画了该数据集在填补数据空白的同时,仍需使用者审慎对待数据质量标志与序列连续性的现实困境。
常用场景
经典使用场景
该数据集收录了1991年至2025年间48个非洲国家公共部门按性别和就业身份分类的就业人数(单位:千)数据,共计2145条观测记录。最经典的使用场景在于支撑非洲地区劳动力市场的时空比较分析与面板数据建模。研究者可借助该数据探索公共部门就业规模的国别差异、性别构成演变趋势,以及就业身份(如正式雇员与非标准就业)的结构性变迁。其年度时间跨度与多国覆盖特性,尤为适合构建固定效应或随机效应模型,以量化宏观政策、经济周期或制度变革对公共部门就业的动态影响。
衍生相关工作
该数据集的发布催生了若干值得关注的衍生工作。在国际劳工组织的原始数据体系之外,Electric Sheep Africa的重新封装版本使得数据集能以一行代码(load_dataset)加载至机器学习流水线,极大降低了研究门槛。基于此,已有学者将其与非洲其他社会经济指标(如GDP、教育支出)关联,构建预测公共部门就业规模的多元回归模型。此外,该数据集的时序特性也激励了时间序列预测任务的探索,例如利用ARIMA或LSTM模型对特定国家的公共部门雇员数量进行短期推估,为前瞻性规划提供量化参考。
数据集最近研究
最新研究方向
该数据集聚焦于非洲公共部门就业的人口统计学解构与性别维度分析,为理解劳动力市场中制度性雇佣关系的结构性变迁提供了关键数据支撑。鉴于国际劳工组织持续追踪各国体面劳动目标的实现进程,这一跨越三十余年、覆盖48个非洲国家的面板数据,能够有效揭示公共就业在性别平等、雇佣身份非正规化趋势以及宏观经济波动应对中的角色演变。当前研究前沿正积极利用此类粒度化时序观测,结合多源调查与行政记录,探索非洲国家在实现可持续发展目标第8项(体面工作与经济增长)过程中的制度效能差异,以及新冠疫情后公共部门就业的复苏弹性,为制定包容性劳动政策提供了实证锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务