遇见数据集

electricsheepeurope/europe-ilo-emp-stem-sex-edu-nb-employment-in-stem-occupations-by-sex-and-educatio

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲15个国家(如英国、瑞士、法国等)在2001年至2025年期间的STEM(科学、技术、工程和数学)职业就业数据,按性别和教育程度分类,单位为千。数据集共有2,460个观测值,涵盖1个核心指标(EMP_STEM_SEX_EDU_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过权威调查(如劳动力调查)收集,并经过统一处理以确保可比性。数据集字段包括国家代码、数据来源、指标代码、性别分类、观测年份、观测值及状态标志等,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并包含数据质量说明(如部分数据可能为临时或不可靠)。数据集由Electric Sheep Europe重新打包,旨在为机器学习研究提供标准化的欧洲数据层。

This dataset contains employment data in STEM (Science, Technology, Engineering, and Mathematics) occupations for 15 European countries (e.g., United Kingdom, Switzerland, France) from 2001 to 2025, disaggregated by sex and education, in thousands. It includes 2,460 observations covering one core indicator (EMP_STEM_SEX_EDU_NB). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, collected through authoritative surveys (e.g., Labour Force Surveys) and harmonized for comparability. Fields include country codes, data sources, indicator codes, sex classifications, observation years, observed values, and status flags, making it suitable for tasks such as tabular classification, regression, and time-series forecasting. The data is published at an annual frequency and includes quality caveats (e.g., some data may be provisional or unreliable). Repackaged by Electric Sheep Europe, the dataset aims to provide a standardized, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-stem-sex-edu-nb-employment-in-stem-occupations-by-sex-and-educatio 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API接口直接拉取指示器`EMP_STEM_SEX_EDU_NB`的原始数据,并依据欧洲ISO3国家代码进行筛选过滤,最终保留15个欧洲国家的观测记录。ILOSTAT本身采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收支调查及行政记录等微观数据进行规范化处理,并在`source.label`字段中标注每一条数据的来源,确保数据的可追溯性与标准化整合。
特点
数据集共包含2,460条观测,时间跨度从2001年至2025年,覆盖英国、瑞士、法国等15个欧洲国家,核心指标为按性别与教育程度分列的STEM行业就业人数(单位:千)。数据采用年度频率发布,并提供性别(总计、男性、女性)和教育程度等细分维度,便于进行多层次交叉分析。此外,数据注释字段详细记录了方法修订、来源库变更等质量信息,有助于研究者准确评估数据的可靠性与适用性。
使用方法
该数据集已封装为HuggingFace Datasets格式,用户可通过`load_dataset()`函数一行代码加载至Python环境,并便捷地转换为Pandas DataFrame进行后续分析。典型使用场景包括:按国家代码筛选特定国家的STEM就业时间序列、按指示器排序后绘制趋势图,或利用透视表构建国家×年份的矩阵面板数据。数据集采用cc-by-4.0许可协议,使用时需同时引用ILO原始数据及Electric Sheep Europe的整理版本。
背景与挑战
背景概述
europe-ilo-emp-stem-sex-edu-nb-employment-in-stem-occupations-by-sex-and-educatio 数据集由国际劳工组织(ILO)统计部门创建,并由 Electric Sheep Europe 于 2025 年重新打包发布。该数据集聚焦于欧洲 15 个国家 2001 至 2025 年间 STEM 职业就业人数的性别与教育层次分布,包含 2460 条观测记录。其核心研究问题在于揭示劳动力市场中性别与教育背景对 STEM 领域参与度的交互影响,为政策制定者与研究者提供量化依据。作为 ILO 旗下 ILOSTAT 数据库的子集,该数据凭借权威的跨国调查数据源与一致性的统计方法,成为分析欧洲 STEM 人才趋势、评估教育政策效果及追踪可持续发展目标中体面工作指标的重要资源,在劳动经济学与教育经济学领域具有显著影响力。
当前挑战
该数据集所解决的领域挑战在于,STEM 领域长期面临性别失衡与教育回报率不透明的问题,而欧洲各国统计口径差异与数据缺失令跨国比较困难。数据构建过程中,ILO 需将各国劳动力调查、家庭收入调查等异构数据源统一为 ICLS 标准定义,并通过“最佳来源”选择机制处理同一国家同年份多源冲突的问题。此外,数据集中含有异常值标记(如“不可靠”状态)、年度频率限制导致的时序粒度不足,以及部分国家样本量过少(如西班牙仅 27 条),均增加了分析中的偏倚风险,要求使用者谨慎对待断点序列与低代表性样本。
常用场景
经典使用场景
该数据集在学术界常被用于探究欧洲各国STEM领域就业的时空演变规律。研究者借助其覆盖2001至2025年间15个国家、2440余条观测记录,可系统分析性别与教育水平双重维度下STEM从业人数的分布特征。通过构建多截面面板数据,能够揭示不同国家在科技创新人才储备上的异质性,并追踪劳动力市场结构性变迁的长期脉络。
解决学术问题
该数据集有效解决了跨国家、长时间序列下STEM就业数据难以获取与标准化的学术困境。依托国际劳工组织(ILO)统一分类体系,研究者得以规避各国统计口径差异,科学评估欧洲劳动力市场在性别平等与教育回报率方面的进展。数据集为探讨人力资本如何驱动区域创新、验证教育扩张与产业升级的交互效应提供了可靠经验证据,其引入显著提升了劳动经济学与教育经济学领域研究结论的可比性与稳健性。
衍生相关工作
基于此数据集,学界已衍生出多项经典建模工作。时间序列分析被用于预测未来五年STEM就业人数的短期波动,季节性分解模型揭示了数据中隐含的结构性周期。面板回归模型则量化了教育投入、研发支出等因素对各国STEM就业的差异化影响,识别出若干关键驱动变量。此外,聚类分析将15个国家按就业模式划分为技术优势型与追赶型两类,为不同发展阶段的经济体提供了差异化的政策启示。耦合多源数据的劳动迁移模型亦受益于此数据,成功模拟了高技能人才在欧盟内部的流动路径及其对区域创新能力的塑造效应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务