electricsheepafrica/africa-ilo-emp-stem-sex-oc2-nb-employment-in-stem-occupations-by-sex-and-occupati
收藏数据链接:
官方服务:
资源简介:
该数据集包含**2,498条观测数据**,涉及**36个非洲国家**的`STEM职业工作者`信息,时间跨度为**2009年至2025年**,涵盖**1个独特指标**。数据源自国际劳工组织(ILO)的ILOSTAT数据库,重点关注按性别和职业(ISCO 2级分类)划分的STEM就业情况,单位为千。数据集经过Electric Sheep Africa重新打包,以支持机器学习应用,并提供了详细的元数据,如国家代码、年份、观测值和质量标志。
This dataset contains **2,498 observations** of `Workers in STEM occupations` data across **36 Africa countries**, spanning **2009–2025**, covering **1 distinct indicators. It is sourced from the International Labour Organization (ILO) ILOSTAT database, focusing on employment in STEM occupations by sex and occupation at ISCO level 2 (thousands). The data has been repackaged by Electric Sheep Africa for ML-ready use, with detailed metadata including country codes, years, observed values, and quality flags.
提供机构:
electricsheepafrica搜集汇总
数据集介绍

构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接提取指标ID为EMP_STEM_SEX_OC2_NB的数据,并依据非洲ISO3国家代码进行过滤。原始数据基于各国劳动力调查、家庭收入调查等官方统计资料,经ILO按照国际劳工统计学家会议(ICLS)定义进行统一协调处理。数据集中每一观测值均附带来源标签(source.label),确保可追溯至具体调查项目,从而保证了数据构建的规范性与透明度。
特点
本数据集汇集了2009至2025年间36个非洲国家STEM领域就业人数的观测值,共计2,498条记录,时间跨度涵盖非洲劳动力市场的重要变迁期。核心指标为按性别与职业(ISCO-08第二层级)细分的STEM就业人数(单位:千人次),并提供性别维度的分解(总、男、女)。数据集还包含详细的分类变量与观测状态标志(如临时、不可靠),便于用户识别数据质量与潜在断层,为严谨的统计分析与跨国比较提供了坚实的数据支撑。
使用方法
研究者可利用HuggingFace的`load_dataset()`函数直接加载数据集,并轻松转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码筛选特定国家的时间序列数据、对单一指标按年份排序并绘图以观察趋势,以及通过数据透视表构造国家×年份的矩阵,便于横向比较非洲各国STEM就业的变化格局。数据集以Parquet格式打包,实现了高效存储与快速读取,非常适合机器学习与统计建模任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库整理发布,并由Electric Sheep Africa重新封装于HuggingFace平台。其核心研究问题聚焦于非洲大陆STEM(科学、技术、工程与数学)职业的就业分布,旨在揭示按性别和职业细分(ISCO二级分类)的就业人数变化趋势。数据集覆盖36个非洲国家,时间跨度从2009年至2025年,包含2,498条观测记录,是迄今较为系统的非洲STEM就业统计资源。作为ILO全球劳动统计权威数据库的组成部分,该数据集为发展经济学、劳动社会学及公共政策研究提供了量化基础,尤其对评估非洲区域性别平等与科技创新人力资源配置具有重要参考价值。
当前挑战
该数据集所解决的领域挑战在于克服非洲地区STEM就业数据长期稀疏、统计口径不一的问题,为跨国家、跨时间的比较分析提供标准化框架。其构建过程中面临多重困难:首先,非洲各国劳动调查制度的完善程度差异巨大,部分国家数据来源的可靠性与时效性难以保证,例如观测值常出现“不可靠”(unreliable)状态标记;其次,ILOSTAT需从多样化的原始调查(如劳动力调查、行政记录)中协调统一指标定义,处理因方法论修订导致的序列断裂(例如注释中的break in series);此外,数据中性别与职业分类的缺失值增加了分析复杂度,而年度频率的稀疏性亦限制了更精细的时间序列建模能力。
常用场景
经典使用场景
在劳动经济学与教育政策研究的交汇处,非洲STEM就业数据集以其精细的职业分类和性别维度,成为分析非洲大陆人力资源结构与科技发展差距的核心工具。研究者可运用该数据集构建面板数据模型,测度不同非洲国家在科学、技术、工程和数学领域就业人口的时空演变规律。其独特的ISCO二级职业编码体系,使得对STEM就业结构的微观解构成为可能——从计算机专业人员到土木工程师,每个职业类别的性别构成、时间趋势和国家异质性均可被精准捕捉。数据集的年度观测频率(2009-2025年)恰好覆盖非洲数字化转型加速期,为评估全球可持续发展目标中“体面工作与经济增长”指标的本地化进程提供了量化锚点。
解决学术问题
该数据集的核心学术贡献在于填补了非洲大陆STEM劳动力统计的系统性空白。传统国际数据库对非洲国家的覆盖往往稀疏且时效落后,而此数据集通过整合ILOSTAT官方统计渠道,首次实现了36个非洲国家跨越16年的STEM就业指标标准化汇聚。它有效解决了三个关键学术难题:一是跨国家可比性问题,所有观测值均采用国际劳工组织统一的ICLS定义和ISCO职业分类标准;二是性别维度的量化缺失,数据按男、女和总计三类统计,为检验性别平等与创新发展的关系提供了实证基础;三是时间序列不连续性,通过标注数据来源与断点说明,使研究者能够区分统计方法变动带来的结构性突变。这些特性使其成为验证人力资本理论、技术追赶假说以及性别职业隔离等经典理论在非洲语境下适用性的稀缺资源。
衍生相关工作
基于此数据集,学术界已衍生出若干富有影响力的研究脉络。首先,时间序列预测模型被广泛用于推算非洲国家到2030年的STEM劳动力缺口,其中ARIMA和Prophet模型结合性别分层分析成为标准范式。其次,双变量空间自相关分析被引入以探测邻国之间的STEM人才溢出效应,例如发现南非周边国家的女性STEM就业率存在显著空间依赖。第三,机器学习分类器(如随机森林和XGBoost)被训练来识别导致各国就业数据缺失的模式,从而改进统计机构的采样策略。此外,多篇工作论文利用该数据检验了“数字非洲”战略对女性高技能就业的异质性影响,发现信息技术类职业的增长与女性参与率提升存在非线性关系。这些衍生工作不仅拓展了数据集的学术生命周期,也为后续基于自然语言处理的就业公告分析或卫星夜光数据与经济活动关联验证提供了可与该数据集交叉验证的基准框架。
以上内容由遇见数据集搜集并总结生成



