electricsheepeurope/europe-ilo-ees-stem-sex-jbc-nb-employees-in-stem-occupations-by-sex-and-type-of-j
收藏数据链接:
官方服务:
资源简介:
该数据集包含欧洲15个国家在2001年至2025年间,按性别和合同类型分类的STEM(科学、技术、工程和数学)职业员工数量(以千计)的统计数据,共有1,917个观察值,涵盖1个具体指标(EES_STEM_SEX_JBC_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过Electric Sheep Europe重新打包,用于表格分类、回归或时间序列预测等机器学习任务。
This dataset contains 1,917 observations of Employees in STEM occupations by sex and type of job contract (thousands) across 15 Europe countries, spanning 2001–2025, covering 1 distinct indicator (EES_STEM_SEX_JBC_NB). It is sourced from the ILOSTAT database of the International Labour Organization (ILO), repackaged by Electric Sheep Europe, and is suitable for tabular classification, regression, or time-series forecasting tasks.
提供机构:
electricsheepeurope搜集汇总
数据集介绍

构建方式
该数据集源自国际劳工组织(ILO)旗下ILOSTAT数据库,通过REST API接口直接提取指标代码为EES_STEM_SEX_JBC_NB的原始数据,并经Electric Sheep Europe团队二次封装与标准化处理。在构建过程中,数据被严格过滤至欧洲15个国家的ISO3代码范围,同时依据国际劳工统计学家会议(ICLS)定义对微观调查数据进行统一调和,确保跨国家、跨年份数据的一致性与可比性。最终以Parquet格式打包,形成包含1,917条观测记录的表格化数据集,覆盖2001年至2025年的年度时间序列。
特点
该数据集聚焦于欧洲15个国家按性别和合同类型划分的STEM领域雇员人数(单位:千人),呈现出精细的多维拆解特征。数据包含性别(总、男、女)、合同类型等分类变量,使用者可灵活剖析不同群体在STEM职业中的分布差异。值得关注的是,数据集囊括了阿尔巴尼亚、白俄罗斯、波斯尼亚和黑塞哥维那等较少被覆盖的欧洲经济体,拓展了劳动统计的地域广度。此外,每条观测均附有来源标注与数据质量状态标记(如不可靠、修订中断等),为严谨的科学研究提供了不可或缺的可追溯性与审慎使用依据。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,并将其转化为Pandas DataFrame进行后续分析。典型用法包括按国家筛选子集以聚焦单一经济体的STEM就业变化,以及针对特定指标构建时间序列以观察长期趋势。亦可运用pivot_table方法将数据重塑为国家×年份的矩阵形式,便于进行跨国的比较研究。该数据集直接兼容表格分类、回归以及时间序列预测等多种下游任务,为劳动经济学、教育政策分析及欧洲区域研究等领域提供了即用型的数据基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Europe于2025年重新整理并发布在HuggingFace平台,聚焦于欧洲15个国家在2001至2025年间STEM(科学、技术、工程与数学)领域的就业状况。核心研究问题在于揭示不同性别与合同类型下STEM从业人员的规模与分布格局,为跨国劳动力比较与政策评估提供定量依据。作为ILOSTAT数据库的子集,该数据集整合了国家劳动力调查、行政记录等多源微观数据,遵循国际劳工统计学家会议(ICLS)定义进行标准化处理,对理解欧洲高技能劳动力市场的性别分化与就业稳定性具有重要参考价值,并为可持续发展目标(SDG)中体面劳动指标的监测提供了关键数据支撑。
当前挑战
该数据集所解决的领域挑战包括:一是在劳动力统计中,STEM职业的定义与分类因国家而异,ILO需协调各国调查标准以实现跨时空可比性;二是性别与合同类型等分项指标往往存在缺失或统计口径不一致,导致细分分析受限。在构建过程中,挑战主要体现在:数据提取需通过ILOSTAT REST API获取,并需过滤至欧洲国家代码,数据质量标注如'不可靠'(U)、'序列断裂'(Break in series)等状态码增加了清洗复杂度;部分国家(如西班牙)仅包含18条观测值,时间跨度不连续,限制了长时序趋势分析的可靠性,且多来源冲突时需依赖ILO指定的'最佳来源',这一决策逻辑可能影响用户对数据一致性的信任。
常用场景
经典使用场景
在劳动力市场与教育经济学交叉研究领域,该数据集常被用于分析欧洲各国STEM从业人员在不同性别与合同类型下的分布格局。研究者通过提取ILOSTAT标准化指标,结合时间序列与面板数据分析,可系统刻画2001至2025年间15个欧洲国家STEM就业规模的变化轨迹。其经典应用包括评估性别平等政策对STEM劳动力结构的影响,以及比较不同劳动合同类型(如全职与兼职)在各国STEM行业中的演进特征。
解决学术问题
该数据集有效填补了欧洲层面STEM就业性别与合同维度的微观统计空白,为探讨性别差异对高科技行业劳动力参与的影响提供了可靠依据。学术上,它解决了跨国家、长时段的面板数据整合难题,推动了关于劳动力市场分割、女性在STEM领域职业发展障碍以及劳动合同灵活性对就业稳定性影响等议题的实证研究。这些工作为国际劳工组织制定包容性就业政策提供了量化支撑。
衍生相关工作
基于该数据集,衍生出了一系列围绕STEM就业国际比较的经典工作。ILOSTAT官方使用同一指标代码发布的全球STEM劳动力报告,为后续研究奠定了方法论基础。学术界则依托该数据构建了多种面板回归模型,探讨技术创新、教育投资与性别平等政策如何交互影响STEM就业率。此外,Electric Sheep Europe团队将原始数据重塑为ML就绪格式,推动了机器学习在劳动力预测任务中的创新应用,如使用时间序列模型预测各国STEM就业趋势。
以上内容由遇见数据集搜集并总结生成



