遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-edu-nb-average-monthly-earnings-of-employees-by-sex-and-e

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲33个国家从1991年至2025年的员工平均月收入数据,按性别和教育程度划分,使用当地货币。数据集共有13,556个观测值,涵盖1个主要指标(EAR_EMTA_SEX_EDU_NB),数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家。数据模式包括国家代码、国家名称、数据来源、指标代码、性别分类、教育分类、观测年份、观测值、观测状态和相关注释等字段。数据集适用于表格分类、回归和时间序列预测任务,并遵循cc-by-4.0许可证。

This dataset contains average monthly earnings of employees in 33 European countries from 1991 to 2025, disaggregated by sex and education, in local currency. It includes 13,556 observations and covers one main indicator (EAR_EMTA_SEX_EDU_NB). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered for European countries. The schema includes columns such as country code, country name, data source, indicator code, sex classification, education classification, observation year, observed value, observation status, and related notes. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, and is released under the cc-by-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-edu-nb-average-monthly-earnings-of-employees-by-sex-and-e 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于欧洲地区雇员的月均收入水平。数据通过ILOSTAT REST API直接获取,并基于欧洲国家ISO3编码进行筛选,最终整合了33个欧洲国家1991年至2025年间共计13,556条观测记录。ILO统计部门依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,并在数据集中通过来源标注字段追溯其来源,如劳动力调查或行政记录,确保了数据的规范性和可溯源性。
特点
数据集的核心特点在于其精细的维度划分和广泛的覆盖范围。它以“按性别和教育程度划分的雇员平均月收入(本币)”为单一指标,提供了性别(总计、男性、女性)和教育程度(含合计与详细级别)两大核心分类维度。数据涵盖瑞士、葡萄牙、法国、英国等33个欧洲国家,时间跨度长达35年,为跨国比较和长期趋势分析提供了宝贵素材。同时,数据集包含了丰富的元数据字段,如观测状态、注释分类等,便于用户评估数据质量和进行精细化筛选。
使用方法
该数据集已打包为HuggingFace Datasets格式,用户可通过`load_dataset()`函数一键加载,并轻松转换为Pandas DataFrame进行后续分析。针对时序分析场景,可按国家筛选后进行时间序列可视化;若需进行跨国对比,可利用数据透视功能构建以年份为索引、国家为列的收入矩阵。数据集适用于监督学习中的表格分类与回归任务,以及时间序列预测任务,为劳工经济学、性别收入差异研究及教育回报率分析等领域提供了标准化的数据基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年整理并发布,经Electric Sheep Europe团队重新封装,聚焦于欧洲33个国家的员工按性别与教育程度划分的平均月收入(以当地货币计)。核心研究问题在于揭示劳动力市场中教育回报与性别收入差距的长期演变规律,为劳动经济学、社会政策评估及可持续发展目标(SDG)监测提供量化支撑。依托ILOSTAT这一全球劳动统计权威数据库,数据集整合了1991年至2025年间逾1.3万条观测记录,其结构化的时间序列与多维分类属性(如性别、教育层级)使其成为分析欧洲人力资本与收入分配动态的关键资源。该数据集的发布显著提升了跨国劳动统计数据的可获取性与标准化水平,对推动基于证据的政策制定与机器学习驱动的劳动市场建模具有重要影响力。
当前挑战
该数据集所应对的领域挑战在于,传统劳动收入数据常因国家间统计口径、调查方法及货币单位差异而难以直接比较,亟需一套标准化、可跨时期追溯的指标来量化教育与性别对收入的影响。构建过程中面临的挑战包括:从ILOSTAT REST API提取数据时需处理多源异构的原始调查数据(如劳动力调查、家庭收支调查),并依据国际劳工统计学家会议(ICLS)定义进行调和;同时需应对年度观测频次不统一、部分国家数据缺失及观察状态标记(如“不可靠”)对数据质量的影响。此外,性别与教育分类维度的非完全覆盖、多来源冲突时仅采用ILO“最佳来源”的选择逻辑,进一步增加了数据整合与噪声控制的复杂性。
常用场景
经典使用场景
该数据集汇聚了1991年至2025年间33个欧洲国家按性别和教育程度划分的雇员月平均收入信息,是劳动经济学与统计科学领域开展薪酬结构差异与长期收入动态研究的经典素材。研究者可通过性别(男性、女性、总计)与教育层次等细分维度,构建跨国、跨时段的收入对比面板,或利用时间序列方法考察欧洲各国教育回报率的变化趋势。数据源自国际劳工组织(ILO)的ILOSTAT平台,经规范清洗后以Parquet格式提供,支持直接加载为Pandas DataFrame进行可视化与建模,为探究收入不平等的微观机制与宏观演变提供了坚实的数据基础。
实际应用
在实际应用层面,该数据集为政策制定者、国际组织及企业人力资源部门提供了重要的决策参考。一方面,各国劳动部门可利用这些数据监测本国薪酬体系的公平性,识别收入歧视的高发群体与行业,并据此调整最低工资标准或制定反歧视法规。另一方面,跨国企业能够依据分性别、分教育层次的薪酬趋势,优化其全球化薪酬策略与人才留任方案。此外,非政府组织可借助该数据推动公众对性别薪酬差距的认知与讨论,助力可持续发展目标中体面工作与经济增长指标的监测与实现。
衍生相关工作
围绕该数据集,可衍生出一系列影响深远的学术与产业工作。基于面板数据特性,研究者可构建欧洲国家收入收敛性分析的经典论文,或训练用于预测未来收入走势的时间序列模型。在机器学习领域,该数据集可用于开发基于性别与教育特征进行收入分类或回归的基准模型,并催生关于收入数据偏差与公平性的讨论。此外,结合其他社会经济指标(如GDP、失业率),可开展多维度联合分析,产出解释收入不平等结构性根源的综合性研究。目前已有研究利用类似ILOSTAT数据探讨性别薪酬差距的制度决定因素,该数据集的出现将极大降低此类工作的数据获取门槛,推动研究成果的复现与深化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务