遇见数据集

electricsheepeurope/europe-ilo-emp-stem-sex-ocu-nb-employment-in-stem-occupations-by-sex-and-occupati

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含3,230个观测值,覆盖15个欧洲国家,时间跨度为2001年至2025年,专注于STEM职业就业人数指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家代码。数据经过ILO的统计标准(如国际劳工统计学家会议定义)进行标准化处理,并包含来源标记以追踪。数据集提供了按性别(总计、男性、女性)和职业分类的就业人数(以千计),适用于表格分类、回归和时间序列预测等任务。

This dataset contains 3,230 observations across 15 European countries, spanning from 2001 to 2025, focusing on the Workers in STEM occupations indicator. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via the REST API and filtered to European country codes. It is harmonized using ILO statistical standards (e.g., International Conference of Labour Statisticians definitions) and includes source flags for traceability. The dataset provides employment numbers (in thousands) disaggregated by sex (total, male, female) and occupation, suitable for tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-stem-sex-ocu-nb-employment-in-stem-occupations-by-sex-and-occupati 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)旗下ILOSTAT数据库,聚焦于欧洲地区STEM领域就业状况的统计。数据通过ILOSTAT REST API直接抓取,原始指标编码为EMP_STEM_SEX_OCU_NB,代表按性别与职业划分的STEM行业从业人数(单位:千)。数据集依据国际劳工统计学家会议(ICLS)定义的标准,对各国劳工调查微观数据进行统一整合与清洗,并仅保留欧洲15个国家的ISO3代码所对应的观测值,最终形成了包含3,230条记录、时间跨度从2001年至2025年的结构化数据集合。
特点
该数据集的核心特点在于其精细的多维拆解能力:通过sex和classif1等分类变量,允许研究人员从性别(总、男、女)与职业类型等维度对STEM就业数据进行切片分析。数据涵盖15个欧洲国家,时间序列长达25年,且每条记录均附带了来源标识、观测状态标志以及可能的系列断裂注释,为数据质量追溯提供了透明依据。此外,数据集采用CC-BY-4.0许可协议发布,由Electric Sheep Europe重新打包为Parquet格式,确保了高兼容性与即用性。
使用方法
用户可通过HuggingFace的datasets库一行代码完成加载:load_dataset("electricsheepeurope/europe-ilo-emp-stem-sex-ocu-nb-employment-in-stem-occupations-by-sex-and-occupati")。加载后可直接将训练集转换为Pandas DataFrame进行探索。常见的分析流程包括按国家筛选子集、按时间序列绘制单一指标的变化趋势,或利用pivot_table构建国家×年份的观测矩阵。数据集中所有列均以英文命名,并配有清晰的标签列,便于快速理解字段含义与进行跨语言协作分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)的ILOSTAT统计数据库创建,经Electric Sheep Europe于2025年重新整理并发布在HuggingFace平台上。其核心研究问题聚焦于欧洲15个国家在2001至2025年间STEM(科学、技术、工程和数学)职业的就业人数,并按性别与职业进行分层统计。数据集汇总了3230条观测记录,涵盖1项核心指标,旨在为劳动经济学、性别平等以及科技人才流动等交叉领域提供标准化、机器可读的量化基础。ILOSTAT作为全球劳动统计的权威来源,其数据经国际劳工统计学家会议(ICLS)定义统一标准,确保了跨国可比性,该数据集也因此成为研究欧洲STEM劳动力结构变迁的重要参考资源。
当前挑战
该数据集所应对的领域问题主要涉及STEM劳动力统计中的多维分类挑战,包括性别差异的精确量化、不同国家间职业分类标准的对齐,以及长时间序列内调查方法变动带来的数据可比性问题。在构建过程中,ILOSTAT需从各国劳动调查、行政记录等多源异构数据中提取并统一格式,面临来源标记、缺失值处理及指标定义一致性等难题。例如,数据集内的‘obs_status’标记了数据的不稳定性,而‘note_indicator’则记录了方法修订导致的序列断裂。此外,空间覆盖仅限于15个欧洲国家,且部分国家数据稀疏(如西班牙仅35条),限制了区域间深度比较与泛化分析能力。
常用场景
经典使用场景
该数据集汇聚了欧洲15个国家2001年至2025年间STEM领域就业人数的年度观测数据,并按性别与职业类别进行了精细分层。研究者可基于此展开跨国比较分析,探究不同欧洲国家在STEM劳动力结构上的历时演变与性别差异,亦可构建时间序列模型,对各国STEM就业趋势进行预测与归因。其标准化的ILOSTAT编码体系与丰富的元数据注释,为跨数据集的融合分析和多维度交叉研究提供了坚实的数据基石。
解决学术问题
在学术界,该数据集有效填补了欧洲范围内长时间序列、高粒度STEM就业数据缺失的空白,尤其为劳动力经济学、教育经济学与性别研究领域提供了可靠证据。它使研究者能够实证检验科技政策、教育改革与劳动力市场变迁之间的动态关系,例如评估女性参与STEM职业的促进措施的实际成效,或量化技术进步对特定职业结构的冲击效应,从而推动了相关理论模型的验证与修正。
衍生相关工作
该数据集的衍生研究路径丰富,已催生一系列围绕欧洲STEM劳动力市场结构与性别平等议题的经典工作。后续工作多在此基础上,通过引入教育背景、研发投入、技术专利等协变量,构建因果推断模型以解析STEM就业变动的驱动力。此外,结合欧洲社会调查或其他劳动力调查数据,学者们开展了关于职业流动、技能错配以及自动化风险对STEM群体影响的跨学科探讨,这些成果深化了对知识经济时代人力资本动态的理论认知。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务