遇见数据集

electricsheepeurope/europe-ilo-ees-stem-sex-ins-nb-employees-in-stem-occupations-by-sex-and-public-pr

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含1,233个观测值,涉及欧洲10个国家的STEM(科学、技术、工程和数学)职业工作者数据,时间跨度为2008年至2025年,涵盖1个具体指标(按性别和公共/私营部门划分的STEM职业雇员数,以千计)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,该数据库是全球劳动力统计的主要来源,通过统一调查数据提供就业、工资、工作时间等多方面指标。数据集经过Electric Sheep Europe重新打包,以表格形式提供,便于机器学习和分析使用。

This dataset contains 1,233 observations of Workers in STEM occupations data across 10 Europe countries, spanning 2008–2025, covering 1 distinct indicator (Employees in STEM occupations by sex and public/private sector in thousands). It is sourced from ILOSTAT, the ILOs central statistics database and a leading global source for labour statistics, which harmonizes data from surveys and administrative records on employment, unemployment, wages, and other labour topics. The dataset has been repackaged by Electric Sheep Europe for easy access and use in machine learning and analytical applications.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ees-stem-sex-ins-nb-employees-in-stem-occupations-by-sex-and-public-pr 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Europe重新打包整理而成。原始数据通过ILOSTAT REST API直接获取,指标编码为EES_STEM_SEX_INS_NB,涵盖欧洲10个国家2008年至2025年的年度观测值,共计1,233条记录。构建过程中,数据集自动筛选出欧洲ISO3国家代码,并保留了ILO依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行协调后的标准指标,同时在source.label列中标注数据来源以实现可追溯性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,返回的DataFrame包含ref_area(国家代码)、time(年份)、obs_value(观测值)等关键字段。典型应用场景包括:按国家筛选数据框进行单一国家分析;针对特定指标按年份排序绘制时间序列图;利用pivot_table构建国家×年份的矩阵面板数据,便于横向比较或机器学习模型输入。数据集已按照统一的模式标准化,无需额外清洗即可直接投入研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库发布,经Electric Sheep Europe重新整理后托管于HuggingFace平台。数据集聚焦于欧洲10个国家在2008至2025年间,按性别和公共/私营部门划分的STEM(科学、技术、工程与数学)领域从业人员数量(以千计),共包含1,233条观测值。作为全球劳动力统计的核心来源,ILOSTAT通过整合各国劳动力调查数据,为分析欧洲STEM劳动力市场的性别结构及部门分布提供了关键支撑。该数据集的发布填补了区域级、细粒度STEM就业数据的缺口,有助于研究者追踪技能型劳动力在公共与私营部门之间的流动趋势,并评估相关政策对性别平等和人力资源配置的影响,对劳动经济学、教育政策及可持续发展目标(SDG)的监测具有重要参考价值。
当前挑战
该数据集所应对的核心挑战在于欧洲各国劳动力调查方法、职业分类标准及数据发布频率的不一致性,这为跨国家、跨时期的STEM就业比较带来了系统性障碍。具体而言,不同国家采用的调查工具(如劳动力调查、行政记录)在采集STEM职业定义时可能参照不同版本的国际标准职业分类(ISCO),导致跨区域数据可比性受限。数据构建过程中,ILOSTAT虽通过国际劳工统计学家会议(ICLS)定义进行统一协调,但原始数据仍存在因方法修订、源数据替换或断点引起的序列不连续问题(如数据集中出现的'Break in series'标记),这要求用户在使用时必须谨慎处理时序分析中的结构性突变。此外,部分国家(如阿尔巴尼亚、塞尔维亚)的观测年份范围有限,且样本量较小(如塞尔维亚仅81条记录),这可能影响子群体(如特定性别或部门)统计推断的稳健性,并限制了对长期趋势的全面建模。
常用场景
经典使用场景
在劳动经济学与社会学交叉研究领域,本数据集的核心应用在于追踪欧洲国家STEM从业人口的性别构成与部门分布。通过整合国际劳工组织(ILO)ILOSTAT数据库的标准化指标,研究者能够构建覆盖2008–2025年、横跨10个欧洲国家的面板数据,精准刻画女性与男性在公共与私营部门STEM岗位中的就业规模及演变轨迹。该数据集特别适用于时间序列分析,可揭示金融危机、数字化转型或新冠疫情等重大事件对STEM劳动力市场的结构性冲击。其年度观测频率与统一的分类体系(如性别维度SEX_T/SEX_M/SEX_F)为政策评估提供了实证基础,例如比较各国性别平等措施对STEM领域女性参与率的干预效果。
解决学术问题
学术研究中,本数据集系统性地回应了STEM劳动力多元化的两大核心困境:一是性别差异在技术密集型行业中的动态演化机制,二是公共与私营部门制度环境对职业隔离的调节效应。传统研究常受限于零散的国家统计或短窗口数据,而本数据集通过ILO的跨国产出标准化方法,填补了长期跨国比较的空白。基于这些高粒度数据,学者得以验证“玻璃天花板”理论在STEM领域的适用性,或识别福利国家体制如何调节性别偏好与岗位选择的关联。此外,数据中附带的obs_status与断面标记(如Break in series)使研究者能够控制方法论变更带来的偏误,从而提升因果推断的信度。这项工作推动了劳动经济学从描述性分析向机制解释的转型,为理解技术变革中的社会公平议题提供了可靠的数据基础设施。
实际应用
从政策规划与人力资源管理的实际视角出发,该数据集为欧洲各国政府、国际组织及企业提供了量化决策工具。政府劳动部门可利用这些历史序列监测STEM教育投资与产业需求之间的匹配度,例如通过对比特定国家十年间的女性STEM就业占比,评估奖学金或育儿补贴政策的成效。欧盟委员会在制定“数字欧洲计划”(Digital Europe Programme)时,可参考数据中按性别与部门分解的就业趋势,调整区域间资源分配的优先级。对于跨国科技企业而言,数据集有助于识别人才储备薄弱的地域与细分领域,从而优化招聘策略——例如发现法国私营部门女性STEM工程师占比持续低于公共部门的模式,便可针对性设计本地化的多元招聘活动。同时,数据呈现的欧洲整体STEM就业增长斜率,也为行业预测模型提供了校准依据。
数据集最近研究
最新研究方向
探究欧洲各国STEM领域从业人员的性别差异与公共/私营部门分布格局,融合时间序列分析与跨区域对比,揭示劳动市场中结构性不平等与政策干预的实效性。该数据集整合了国际劳工组织权威统计,覆盖2008至2025年间的10个欧洲国家,共计1,233条观测,为追踪后疫情时代技能型人才的流动轨迹、衡量性别平权倡议成效、以及评估公共投资对科技创新劳动力的撬动作用提供了实证基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务