遇见数据集

electricsheepeurope/europe-ilo-emp-stem-sex-cbr-nb-employment-in-stem-occupations-by-sex-and-place-of

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲STEM职业就业统计数据,具体指标为按性别和出生地划分的STEM职业就业人数(千)。数据集涵盖13个欧洲国家(包括阿尔巴尼亚、奥地利、波黑、捷克、法国、英国、希腊、意大利、葡萄牙、塞尔维亚、斯洛伐克、西班牙、瑞士),时间跨度为2008年至2025年,共包含1,382条观察记录。数据按性别(总计、男性、女性)和出生地(总计)进行细分,包含国家代码、年份、观测值、数据来源、质量标志等字段。数据经过ILO统一 harmonization 处理,源自各国劳动力调查等官方统计,适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains 1,382 observations of Workers in STEM occupations data across 13 Europe countries, spanning 2008–2025, covering 1 distinct indicator: Employment in STEM occupations by sex and place of birth (thousands). The data is sourced from ILOSTAT, the ILOs central statistics database, and includes disaggregation by sex (total, male, female) and place of birth. It covers countries such as Greece, Switzerland, France, Austria, Portugal, Czech Republic, Slovakia, Bosnia and Herzegovina, Serbia, United Kingdom, Italy, Albania, and Spain, with annual frequency and harmonized definitions according to International Conference of Labour Statisticians (ICLS) standards.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-emp-stem-sex-cbr-nb-employment-in-stem-occupations-by-sex-and-place-of 数据集图片
构建方式
该数据集由Electric Sheep Europe团队从国际劳工组织(ILO)的ILOSTAT REST API直接拉取原始指标数据,并过滤至欧洲13个国家的ISO3代码范围。原始数据源自各国劳动力调查、家庭收入调查、机构调查及行政记录,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一协调处理。团队保留来源标签列以确保数据可追溯,并将结构化数据以Parquet格式封装,最终发布至HuggingFace平台,便于研究者通过标准化接口直接调用。
特点
数据集涵盖2008至2025年间欧洲13个国家的STEM就业数据,包含1,382条观测记录和1个核心指标(EMP_STEM_SEX_CBR_NB),即按性别和出生地划分的STEM领域就业人数(千计)。数据按年频率呈现,并支持按性别(总计、男性、女性)和出生地分类的维度拆解,同时附带观测状态标记及方法论修订注释,允许用户识别数据的可靠性和潜在断裂点。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset函数直接加载数据集,并转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码过滤单国数据、按指标和时间排序生成时间序列图,或利用透视表构建国家×年份的矩阵视图。数据集兼容分类、回归及时间序列预测任务,其标准化模式设计使得从加载到分析的流程极为高效,适合快速集成至劳动经济学或STEM教育相关的实证研究管道中。
背景与挑战
背景概述
在劳动力市场研究领域,STEM(科学、技术、工程和数学)职业的就业状况是衡量一个国家创新能力与人力资本结构的重要指标。该数据集由国际劳工组织(ILO)的ILOSTAT数据库于2025年发布,并由Electric Sheep Europe重新打包,专注于欧洲13个国家2008年至2025年间STEM职业就业的性别与出生地分布。核心研究问题在于揭示不同性别和出生地背景下的STEM就业差异,为政策制定者提供数据支撑,以推动劳动力市场的包容性与性别平等。该数据集涵盖了1,382条观测值,其标准化格式和丰富的人口统计学维度为跨国家、跨时间的比较分析奠定了基础,对劳动经济学、性别研究和人口迁移领域产生了显著影响。
当前挑战
该数据集所解决的领域问题核心在于应对STEM领域就业中的性别失衡和出生地背景带来的结构性不平等,传统数据源往往缺乏细粒度的人口统计学分类,难以深入剖析就业差异的根源。构建过程中面临的挑战包括:首先,ILOSTAT需从各国不同的劳动力调查(如LFS)和行政记录中整合数据,并依据国际劳工统计学家会议(ICLS)定义进行统一协调,这一过程面临指标定义和调查方法不一致的难题。其次,数据存在年度频率和部分国家的时序断裂(如`note_indicator.label`标注的方法学修订),以及观测值可靠性标志(如`obs_status`中的'Unreliable'),给时间序列分析的连续性和准确性带来挑战。此外,少数国家的数据稀疏性(如西班牙仅9条观测值)限制了亚组分析的统计效力。
常用场景
经典使用场景
该数据集汇集了欧洲13个国家2008至2025年间STEM(科学、技术、工程与数学)职业的就业人数数据,按性别和出生地维度进行细致划分。经典使用场景主要集中在时序预测与分类回归任务中,研究者可借助ILOSTAT统一规范的统计口径,构建各国STEM劳动力规模的变化曲线,探索性别失衡、外来人口贡献度等议题的时间演化规律。通过HuggingFace数据集库的便捷加载接口,研究人员能快速将1382条观测值转化为训练集,用于劳动力经济学与教育政策方向的实证分析。
实际应用
实际应用方面,该数据集对政府与国际组织的劳动力监测工作具有直接价值。政策制定者可通过年度数据追踪本国STEM人才供给的动态变化,尤其关注女性与海外出生群体的就业表现,从而精准调整教育投入方向与人才签证配额。企业人力资源部门也可结合宏观经济趋势,预判不同国家STEM人才的可得性与结构特征,制定跨区域招聘策略。此外,数据集的开源许可与标准化格式降低了使用门槛,使非营利机构与智库能够快速生成可视化报告,服务于公共决策咨询与公众科普。
衍生相关工作
基于此数据集,研究者已衍生出一系列经典工作,例如国家间STEM就业弹性对比、性别差异收敛速度的跨国计量分析,以及移民身份对高技术岗位匹配效率的影响评估。在方法论层面,数据集常与欧洲统计局(Eurostat)的人口数据或经合组织(OECD)的教育支出指标合并,构成多源面板数据集,推动劳动经济学中关于技能偏向性技术变革的实证研究。此外,部分工作利用该数据集训练小幅时序模型,验证其在短期就业预测任务上的表现,为劳动力预警系统的开发提供基准参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务