遇见数据集

electricsheepeurope/europe-ilo-ear-smta-sex-cur-nb-average-monthly-earnings-of-stem-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲7个国家从2009年至2025年的756个观测值,涉及STEM职业从业者主题,具体指标为按性别和货币划分的STEM员工平均月收入。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家,涵盖就业、工资等劳动统计信息,并经过ILO的标准化处理。数据集包括国家代码、年份、性别分类、货币类型和观测值等字段,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 756 observational records covering 7 European countries over the 2009–2025 period, focusing on STEM professionals. Its core metrics are the average monthly incomes of STEM employees, categorized by gender and currency. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), acquired via API, filtered to retain only European country datasets, and covers labor statistics including employment and wage information, with standardized processing conducted by the ILO. The dataset includes fields such as country code, year, gender category, currency type, and observed values, and is suitable for tasks including tabular classification, regression analysis, and time series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-smta-sex-cur-nb-average-monthly-earnings-of-stem-employees-by-sex 数据集图片
构建方式
该数据集由Electric Sheep Europe从ILOSTAT官方REST API直接提取并重新封装而成。原始数据源自国际劳工组织(ILO)统计司,基于各国劳动力调查、家庭收入调查及行政记录等多元来源,并按照国际劳工统计学家会议(ICLS)定义进行统一协调。数据集聚焦于欧洲七国,筛选出ISO 3166-1 alpha-3代码对应的国家区域,覆盖2009至2025年间STEM雇员平均月收入按性别与货币分类的观测值,保留了原始数据源标签以确保可追溯性。
使用方法
用户可通过HuggingFace Datasets库以一行代码直接加载数据集,并便捷地转换为Pandas DataFrame进行操作。典型应用包括按国家筛选特定区域的收入趋势、绘制指定指标的时间序列折线图,或使用透视表构建国家×年份的收入矩阵。数据集接口设计友好,支持多种下游任务如表格分类、回归分析和时间序列预测,适合劳动经济学研究人员、政策分析者及机器学习从业者快速开展跨性别与跨国的STEM薪酬比较研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门自2009年至2025年间构建,经Electric Sheep Europe团队整理后发布于HuggingFace平台,专注于欧洲7个国家的STEM(科学、技术、工程和数学)从业者按性别和货币分类的平均月收入。核心研究问题在于揭示欧洲劳动力市场中STEM领域工资的性别差异及跨国动态,为劳动经济学、性别平等政策及可持续发展目标(SDG)监测提供标准化数据支撑。作为ILOSTAT全球劳动统计数据库的细分产品,该数据集凭借ILO对各国调查数据的统一协调与ILCS定义规约,在区域比较研究和时间序列分析中具有重要参考价值,尤其服务于欧洲范围内STEM人才流动、薪酬公平性评估及跨国经济建模等方向。
当前挑战
该数据集所应对的领域挑战包括:一是STEM领域长期存在的性别薪酬差距,亟需细粒度、跨国的标准化指标以支持比较分析与政策干预;二是欧洲各国劳动统计体系存在数据口径不一、时间序列断裂及分类维度缺失等问题,阻碍了区域一体化研究。在构建过程中,主要面临以下挑战:数据来源多元性导致版本差异——需从ILO多源调查中筛选“最佳来源”并处理观测状态标记(如序列中断);分类变量仅在指标发布时有效,增加了拆解分析的复杂性;高频数据(月度/季度)未被纳入,限制了短期波动研判能力;此外,受国家数据覆盖率不均衡影响,部分年份的观测值稀疏(如希腊仅54条记录),影响了模型训练与推论的稳健性。
常用场景
经典使用场景
在劳动经济学与教育政策研究领域,该数据集最经典的使用场景是作为跨国家、跨时间维度的STEM从业者薪酬基准分析工具。研究者可通过756条覆盖7个欧洲国家、时间跨度达17年的观测值,系统比较不同性别STEM雇员的月均收入水平及其演变趋势。借助数据集提供的性别细分维度(总、男、女)和多种货币分类,可构建面板数据模型,量化性别薪酬差距在STEM领域的动态变化,或评估各国劳动政策对STEM人才吸引力的影响。
解决学术问题
该数据集有效回应了STEM领域性别薪酬不平等这一长期困扰学术界的核心议题。通过ILOSTAT标准化方法整合的国家间可比数据,解决了以往研究因各国统计口径、货币单位和调查方式差异而难以进行跨国比较的难题。它为验证人力资本理论、劳动力市场歧视理论以及工资结构分割理论提供了可靠的实证基础,推动了关于欧洲各国STEM从业者薪酬决定因素的计量经济学研究,并为SDG体面工作目标的监测提供了关键数据支撑。
实际应用
在实际应用中,该数据集被广泛用于国际组织、国家统计局及政策智库的劳动力市场监测与报告编制。例如,欧洲委员会可基于此数据评估各成员国在促进STEM领域性别平等方面的进展,调整欧盟技能议程中的薪酬干预策略。企业人力资源部门亦可借鉴跨国薪酬水平基准,优化其全球薪酬架构与多元化招聘目标。此外,非营利组织利用这些数据制作可视化的性别薪酬差距仪表盘,提升公众对STEM领域公平薪酬议题的认知与倡导。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲七国STEM领域雇员的性别薪酬差异分析,为劳动经济学与性别平等研究提供了细粒度的时间序列数据。当前前沿方向包括利用机器学习模型(如时序预测与分类回归)探究薪酬差距的演变规律,并结合ILOSTAT的标准化定义,剖析不同货币计量下的结构性不平等。这一数据资源与全球热议的“科技行业性别鸿沟”事件紧密相连,为政策制定者与研究者提供了量化依据,助力推动欧盟《薪酬透明度指令》等法规的落地评估,具有促进社会公平与优化劳动力市场治理的深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务