遇见数据集

electricsheepeurope/europe-ilo-emp-spif-sex-rt-share-of-employment-in-stem-occupations-outside-th

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲非正规部门STEM(科学、技术、工程和数学)职业就业份额(%)的数据,源自国际劳工组织(ILO)的ILOSTAT数据库。数据集涵盖3个欧洲国家(北马其顿、波黑、塞尔维亚),时间跨度为2011年至2025年,共85个观测值,包含1个核心指标(EMP_SPIF_SEX_RT),用于衡量非正规部门中STEM职业的就业比例。数据经过重新打包,以表格形式提供,支持分类、回归和时间序列预测等机器学习任务。数据列包括国家代码、年份、性别分类、观测值及数据来源注释等。

This dataset contains data on the share of employment in STEM occupations outside the formal sector (%) in Europe, sourced from the International Labour Organization (ILO) ILOSTAT database. It covers 3 European countries (Macedonia, Bosnia and Herzegovina, Serbia) from 2011 to 2025, with 85 observations and 1 core indicator (EMP_SPIF_SEX_RT). The data is repackaged for tabular use, supporting tasks like classification, regression, and time-series forecasting. Columns include country codes, years, sex disaggregation, observed values, and source notes.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-spif-sex-rt-share-of-employment-in-stem-occupations-outside-th 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API从官方端点提取指标EMP_SPIF_SEX_RT的原始数据,并依据ISO 3166-1 alpha-3标准筛选出欧洲国家的观测记录。ILOSTAT整合各国劳动力调查、家庭收入调查及行政记录等微观数据,依据国际劳工统计学家会议(ICLS)定义进行标准化处理。最终数据以Parquet格式封装,通过HuggingFace Datasets库提供便捷加载,确保数据可追溯性与机器学习就绪性。
特点
数据集涵盖2011至2025年间波黑、北马其顿和塞尔维亚三个欧洲国家的85条观测记录,聚焦于非正规部门STEM职业就业占比这一核心指标。数据按性别维度进行分解,包含总计、男性和女性三类子集。每条记录附有来源标签与观测状态标记,便于识别数据质量与连续性中断。此外,数据集对来源机构与方法变更提供注释,增强了透明度和研究适用性。
使用方法
研究者可通过HuggingFace Datasets库的load_dataset函数一键加载数据,并转换为pandas DataFrame进行深入分析。支持按国家代码筛选特定国家的时间序列,或针对单一指标按年份排序以观察变化趋势。也可通过透视表操作构建国家×年份矩阵,便于跨国家比较。数据集以年为单位提供观测值,适合用于回归分析、时序预测及分类建模任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,并由Electric Sheep Europe于2025年重新打包发布,聚焦于欧洲三国家(北马其顿、波黑、塞尔维亚)2011至2025年间非正规部门STEM职业就业份额的测量。其核心研究问题在于通过ILOSTAT这一全球劳动统计权威数据库,揭示欧洲区域非正规经济中STEM从业者的结构性特征。数据集仅含85条观测值,却提供了性别维度(总体、男性、女性)的细分,为理解劳动力市场中技能与正式就业之间的断裂带提供了稀缺的量化基础。作为ILO推动的体面劳动议程的一部分,该数据对分析就业质量、性别平等以及SDG指标监测具有直接贡献,尤其填补了转型经济体中STEM领域非正规就业数据的空白。
当前挑战
该数据集面临的首要领域挑战在于,非正规部门STEM就业的界定与测量本身即定义模糊——ILO虽采用ICLS标准,但各国调查问卷与执行差异导致数据可比性受限。构建过程中,仅覆盖三个欧洲国家且部分年份观测值标记为‘不可靠’,反映了小型样本下统计显著性不足与缺失值处理的困难。此外,数据来源混合了劳动力调查与行政记录,引入来源偏差,而年度频率无法捕捉季度或月度的快速变化,对时间序列预测构成分辨率瓶颈。性别分类虽存在,但3类单一维度难以揭示职业内部分层,限制了交叉性分析的可操作性。
常用场景
经典使用场景
该数据集记录了2011至2025年间欧洲三国(北马其顿、波黑、塞尔维亚)非正规部门STEM就业占比的年度观测值,共85条样本。其经典使用场景涵盖多维度分析框架:研究者可依托性别、时间与国别三重分类变量,构建面板数据模型,探究非正规经济中STEM劳动力结构的演变规律。同时,该数据可无缝接入时间序列预测任务,通过ARIMA或Prophet等模型对地区STEM就业趋势进行外推,亦可作为分类与回归基线,评估社会经济政策对非正规STEM岗位分布的干预效果。
实际应用
在实际决策场景中,该数据集为国际劳工组织、欧盟统计局及各国劳动部门评估非正规经济中的科技人才储备提供了量化基石。政策制定者可利用女性和男性在非正规STEM岗位的份额差值,设计针对性技能认证与岗位正规化激励措施。企业人力资源战略亦可借鉴该数据,结合GDP增速、教育投入等宏观变量,预判非正规经济中潜在的技术劳动力蓄水池,优化跨区域用工布局。此外,非政府组织可基于时序波动监测就业脆弱性,预警产业转型中的结构性失业风险。
衍生相关工作
围绕该数据集的衍生产出已催生若干标志性工作:在方法论层面,基于ILO标准化微数据与欧盟调查体系的互操作校验,形成了跨国非正规就业的协调指数构建范式;在实证应用方面,有学者将此数据与教育统计数据库(如UNESCO)融合,解析STEM毕业生留存率与非正规岗位扩张间的消长关系。同时,该数据作为Electric Sheep Europe统一数据层的一部分,激发了面向低资源语言的自动化数据管道设计与跨数据集知识蒸馏研究,其可复现的ETL流程已成为HuggingFace上欧洲区域数据集再包装的技术蓝本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务