遇见数据集

electricsheepeurope/europe-ilo-emp-spif-sex-nb-employment-in-stem-occupations-outside-the-formal

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲非正规部门STEM(科学、技术、工程和数学)职业就业数据(以千人为单位),来自国际劳工组织(ILO)的ILOSTAT数据库。数据涵盖3个欧洲国家(北马其顿、波斯尼亚和黑塞哥维那、塞尔维亚),时间跨度为2011年至2025年,共85个观测值,包含1个核心指标(EMP_SPIF_SEX_NB)。数据集提供按性别(总计、男性、女性)分列的就业数据,并包含来源、观测状态、注释等元数据,适用于表格分类、回归和时间序列预测等任务。

This dataset contains employment data in STEM (Science, Technology, Engineering, and Mathematics) occupations outside the formal sector (in thousands) for Europe, sourced from the International Labour Organization (ILO) ILOSTAT database. It covers 3 European countries (North Macedonia, Bosnia and Herzegovina, Serbia) from 2011 to 2025, with 85 observations and 1 core indicator (EMP_SPIF_SEX_NB). The data includes disaggregation by sex (total, male, female) and metadata such as source, observation status, and notes, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-spif-sex-nb-employment-in-stem-occupations-outside-the-formal 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT统计数据库构建,通过调用其REST API接口(https://rplumber.ilo.org/data/indicator?id=EMP_SPIF_SEX_NB)直接提取原始数据,并经Electric Sheep Europe团队二次封装与标准化处理。数据筛选范围限定于欧洲ISO3国家代码对应的区域,ILOSTAT采用国际劳工统计学家会议(ICLS)定义对调查微观数据进行统一整合与校正,同时通过`source.label`列标注数据来源(如劳动力调查),以确保数据的可追溯性与一致性。最终形成包含85条观测值、覆盖3个欧洲国家(北马其顿、波斯尼亚和黑塞哥维那、塞尔维亚)、时间跨度2011至2025年的结构化表格数据集。
特点
该数据集聚焦于正规部门外STEM(科学、技术、工程与数学)职业的就业人数(以千计),核心指标代码为`EMP_SPIF_SEX_NB`。数据特征鲜明:涵盖性别维度(`sex`列包含总、男、女三个类别),便于开展性别差异分析;每条观测包含详细的元数据,如`obs_status`标记数据可靠性状态(如不可靠)、`note_indicator`通知方法论或序列中断等变更说明;此外,`ref_area`使用ISO 3166-1 alpha-3国家代码标识地理单元,便于跨数据集整合。数据集规模虽小(不足1000行),但时间序列覆盖15年,对聚焦巴尔干地区非正规STEM就业趋势的研究具有独特价值。
使用方法
用户可通过Hugging Face的`datasets`库便捷加载数据集:使用`load_dataset('electricsheepeurope/europe-ilo-emp-spif-sex-nb-employment-in-stem-occupations-outside-the-formal')`命令即可获得`train`分割,并支持转换为Pandas DataFrame进行后续操作。典型用法包括:按国家筛选(如`df[df['ref_area'] == 'BIH']`提取波斯尼亚数据)、按指标进行时间序列分析(对`obs_value`按年份排序并绘图)、或通过透视表构建国家×年度矩阵以观察多国对比。由于数据以年频发布且经Electric Sheep统一规范化,用户可无缝衔接机器学习建模、统计回归或时间序列预测等任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库发布,并经Electric Sheep Europe重新整理,聚焦于欧洲非正规部门中STEM(科学、技术、工程和数学)职业的就业人数(单位:千人次)。核心研究问题在于揭示非正规经济中STEM劳动力的规模与分布,填补了传统正规就业统计的空白。数据集涵盖北马其顿、波斯尼亚和黑塞哥维那、塞尔维亚三个欧洲国家,时间跨度从2011年至2025年,共85条观测记录。作为ILOSTAT数据生态的组成部分,该数据集为劳动经济学、非正规经济研究及可持续发展目标(SDG)监测提供了关键基础,尤其对评估欧洲地区STEM人才储备与劳动力市场结构性不平等具有重要参考价值。
当前挑战
该数据集面临的挑战首先体现在领域问题上:非正规部门中STEM就业的统计长期受限于数据稀疏性与定义模糊性,尤其在发展中国家和转型经济体中,正规调查往往遗漏大量未注册或非合同制劳动者,导致对STEM人才真实供给的低估。其次,构建过程中遭遇多重障碍:ILOSTAT虽基于国家劳动力调查等渠道进行数据协调,但各国调查方法、职业分类标准及数据质量参差不齐,导致部分观测值被标记为‘不可靠’或存在序列中断。此外,仅覆盖三个国家、85条记录的小样本规模限制了跨国比较与时间序列分析的稳健性,且数据年度频率未能捕捉季度或月度波动,削弱了政策响应的时效性。
常用场景
经典使用场景
该数据集记录了2011至2025年间三个欧洲国家(北马其顿、波斯尼亚和黑塞哥维那、塞尔维亚)非正规部门STEM就业人数的年度观测值,共计85条。典型应用场景包括时间序列分析与面板数据建模,研究者可借此构建就业趋势预测模型,或借助性别维度(总、男、女)的细粒度拆分,审视非正规经济中STEM劳动力的结构性演变。数据以ILOSTAT官方统计为基础,经标准化的清洗与重包装,可直接通过Hugging Face的`load_dataset`接口加载,适用于快速原型开发与传统计量经济学回归,尤其适合劳动力市场中非正规就业与STEM交叉领域的量化探索。
实际应用
在政策分析与劳动市场监测实践中,该数据集可为国际组织(如ILO、欧盟统计局)及国家统计机构提供基准参照,用于评估非正规经济中STEM岗位的吸纳能力与稳定性。例如,通过分析2011至2025年间波黑与塞尔维亚的数据,政策制定者可识别出哪些时期非正规STEM就业激增,进而判断是否与产业结构调整或制度变迁(如税收改革、劳工法修订)存在耦合。对于发展机构而言,它能够辅助设计针对性的技能培训项目,将资源投放于非正规部门中最缺乏保障的技术劳动者群体。此外,性别维度数据助力性别平等倡议,帮助识别非正规STEM工作中女性参与率的瓶颈环节,从而优化干预策略。
衍生相关工作
该数据集衍生出的代表性工作多围绕非正规就业与人力资本的理论交叉。ILO基于类似数据源(如EMP_SPIF系列)发布过《全球非正规就业报告》,其中专门章节分析了STEM职业的非正规化倾向。学术研究中,有学者利用该类面板数据构建了非正规STEM就业弹性模型,发现非正规部门的技术岗位对经济周期更敏感,且女性就业波动幅度显著高于男性。另一支研究将其与教育统计合并,探讨高等教育扩招是否导致非正规STEM领域人才“溢出”。在方法层面,该数据集催生了针对小样本国家(如数据中仅含3国)的贝叶斯多级模型与合成控制法应用,为资源有限地区的劳动力统计推断提供了可操作的范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务