遇见数据集

electricsheepeurope/europe-ilo-emp-snif-sex-rt-informal-employment-rate-in-stem-occupations

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲STEM(科学、技术、工程和数学)职业非正规就业率(百分比)的观测数据,由国际劳工组织(ILO)的ILOSTAT数据库提供,并通过Electric Sheep Europe重新打包。数据集涵盖3个欧洲国家(马其顿(MKD)、波斯尼亚和黑塞哥维那(BIH)、塞尔维亚(SRB)),时间跨度为2011年至2025年,共111个观测值。核心指标为EMP_SNIF_SEX_RT,表示STEM职业的非正规就业率,数据按性别(总计、男性、女性)细分。数据集以表格形式呈现,包括国家代码、年份、观测值、数据来源和质量标志等列,适用于表格分类、回归和时间序列预测等任务。数据来源于国家劳动力调查,并遵循ILO的统计标准,确保一致性和可追溯性。

This dataset contains observational data on the informal employment rate (in percentage) of STEM (Science, Technology, Engineering, and Mathematics) occupations in Europe. It is provided by the ILOSTAT database of the International Labour Organization (ILO) and repackaged by Electric Sheep Europe. The dataset covers 3 European countries: Macedonia (MKD), Bosnia and Herzegovina (BIH), and Serbia (SRB), with a time span from 2011 to 2025 and a total of 111 observations. The core indicator is EMP_SNIF_SEX_RT, which represents the informal employment rate of STEM occupations, with breakdowns by gender (total, male, female). The dataset is presented in tabular format, including columns such as country code, year, observed value, data source and quality flag, and is applicable to tasks like tabular classification, regression and time series forecasting. The data is sourced from national labor force surveys and complies with the statistical standards of the ILO, ensuring consistency and traceability.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-snif-sex-rt-informal-employment-rate-in-stem-occupations 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接获取指标代码为EMP_SNIF_SEX_RT的数据,并依据欧洲ISO3国家代码进行地理筛选。数据涵盖2011年至2025年间来自北马其顿、波斯尼亚和黑塞哥维那以及塞尔维亚三个欧洲国家的111条观测记录。ILOSTAT团队依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,并在source.label列中标注数据来源以保障可追溯性。Electric Sheep Europe团队将原始数据重新打包为Parquet格式,提供了完整的数据模式、分类维度以及观测状态标识,方便研究者直接使用。
特点
本数据集聚焦于STEM职业中的非正规就业率这一单一指标,但融合了性别、来源标签和观测状态等多重分类维度,为深入分析提供了丰富视角。数据覆盖三个国家,时间跨度达15年,样本量虽不大但时序性强,有助于识别结构性趋势。每个观测值均附有详细的元数据,包括数据来源、修订状态以及可能的断裂说明,提升了数据的透明度和可靠性。此外,数据以CC-BY-4.0许可发布,鼓励在学术研究中自由使用与传播。
使用方法
用户可通过HuggingFace的datasets库快速加载该数据集,导入为pandas DataFrame后,支持按国家代码筛选子集,或按时间序列对特定指标进行可视化。数据已标准化为一致的表格模式,包含ref_area、indicator、sex、time、obs_value等关键列,便于进行时间序列回归、分类任务或面板数据分析。示例代码展示了如何生成国家×年份的透视矩阵,以及如何绘制指标随时间的变化曲线,从而满足从描述性统计到预测建模的多样化研究需求。
背景与挑战
背景概述
STEM(科学、技术、工程与数学)领域的就业状况是衡量一个国家或地区创新能力和经济竞争力的关键指标。非正规就业率在STEM职业中的分布,则进一步揭示了劳动力市场中结构性不平等与人才利用效率的深层问题。该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)于2025年创建,后经Electric Sheep Europe重新打包并发布至HuggingFace平台。其核心研究问题聚焦于欧洲地区STEM职业中非正规就业率的性别分化与时间演变趋势。尽管数据集仅覆盖北马其顿、波斯尼亚和黑塞哥维那以及塞尔维亚三个国家,共111条观测记录,时间跨度为2011至2025年,但作为融合就业统计、性别分析与职业分类的专项数据集,它为欠发达欧洲经济体中的劳动力结构研究提供了稀缺的定量素材,对推动包容性就业政策评估具有独特的参考价值。
当前挑战
该数据集所应对的领域挑战在于:现有全球劳动统计往往聚焦于整体非正规就业水平,而对STEM这一高技能职业内部非正规化现象的系统性量化研究极为匮乏,导致政策干预缺乏精准基准。数据集自身构建亦面临多重困难。首先,ILOSTAT需从各国劳动调查、行政记录中调和不同统计口径与质量参差的微观数据,前述数据注释中出现的‘方法修订导致序列断裂’即为例证。其次,国家覆盖率极低(仅3国),且时间序列不完整(塞尔维亚数据仅至2019年),限制了跨区域比较与长期趋势建模的可靠性。此外,性别分类仅有总计、男、女三个维度,未能进一步纳入年龄或教育程度等细分变量,无法充分揭示STEM非正规就业的内部分异机制。
常用场景
经典使用场景
在劳动经济学与科学政策研究的交汇领域,europe-ilo-emp-snif-sex-rt-informal-employment-rate-in-stem-occupations 数据集承载着111条涵盖2011至2025年间三个欧洲国家的观测记录,聚焦于STEM职业中的非正规就业率。这一数据集经典地服务于跨国比较研究,研究者可利用其按性别、时间与国家分层的精细结构,系统性地剖析欧洲劳动力市场中STEM从业者的非正规就业格局。通过时间序列分析,学者能够追踪非正规就业率的动态演变,揭示其在特定国家或性别群体中的波动趋势。同时,数据集的多维分类属性支持构建面板数据模型,从而在控制时间与国家效应的前提下,深入探讨影响STEM领域非正规就业的关键因素,如经济周期或政策干预的调节作用。
解决学术问题
长期以来,学术领域在量化STEM职业中的非正规就业模式时面临数据碎片化与来源不一致的困境,导致跨国可比性不足。该数据集通过整合国际劳工组织ILOSTAT的标准化指标,解决了统一指标定义与数据口径的难题,使得研究者能够基于一致的统计框架进行严谨的因果推断。它助力攻克了劳动经济学中关于技能错配与劳动力市场分割的核心问题,即STEM领域的高技能工作者在特定地域或制度环境下为何会陷入非正规就业。由此,数据集推动了关于教育与就业质量关系的实证检验,为理解人力资本配置效率、性别平等与劳动权益保护提供了可靠的数据基石,显著提升了欧洲劳动市场研究的稳健性与可复制性。
衍生相关工作
围绕该数据集,学术界已涌现出一系列衍生工作,推动了劳动市场研究的纵深发展。经典工作包括基于其性别与时间维度构建的面板回归模型,用于探究欧盟东扩后劳动力流动对本土STEM就业形式的影响。另有研究者将该数据集与欧洲创新记分牌、教育支出等宏观指标进行联立,构建多变量时间序列模型,揭示了正规教育投入减弱与STEM非正规就业率上升之间的滞后关联。在方法学上,该数据集催生了针对小样本面板数据的贝叶斯推断框架,改进了在观测稀少情景下的估计精度。此外,通过结合机器学习中的聚类算法,有工作将其与ILOSTAT的其他职业分类数据集融合,绘制出欧洲非正规就业的异质性图谱,形成了对劳动力市场脆弱性区域的系统性分类。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务