遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-edu-cur-nb-median-monthly-earnings-of-employees-by-sex-educat

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于欧洲33个国家员工月收入中位数的数据集,涵盖1991年至2025年,包含39,264个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至欧洲国家。数据集包含一个核心指标:按性别、教育和货币划分的员工月收入中位数(指标代码:EAR_EMTM_SEX_EDU_CUR_NB)。数据按国家、年份、性别(总计、男性、女性)、教育分类和货币类型等维度进行细分,适用于表格分类、回归和时间序列预测等机器学习任务。数据集以结构化表格形式提供,包含国家代码、指标标签、观测值、数据来源和质量标志等列。

This is a dataset containing the monthly median employee income across 33 European countries, covering the period from 1991 to 2025, with a total of 39,264 observations. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), obtained via API and filtered to retain only European countries. The dataset includes one core indicator: the monthly median employee income categorized by gender, education level and currency (indicator code: EAR_EMTM_SEX_EDU_CUR_NB). The data is segmented along dimensions including country, year, gender (total, male, female), education category and currency type, and is suitable for machine learning tasks such as tabular classification, regression and time series forecasting. The dataset is provided in structured tabular format, with columns including country code, indicator label, observed values, data source and quality flags.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-edu-cur-nb-median-monthly-earnings-of-employees-by-sex-educat 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于欧洲地区雇员按性别、教育程度和货币分类的月收入中位数指标。数据经由ILOSTAT REST API直接抽取,并依据欧洲国家ISO3代码进行地理过滤。ILO统计部门依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,数据来源在source.label字段中予以标记,确保可追溯性。最终汇集了1991年至2025年间33个欧洲国家的39,264条观测记录,构成一个面向劳动力收入分析的时序横截面混合数据集。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据集,仅需一行代码即可将数据转为Pandas DataFrame格式。典型使用方式包括:按国家代码过滤以分析特定国家的收入演变趋势;针对单一指标(如EAR_EMTM_SEX_EDU_CUR_NB)进行时序可视化;利用pivot_table函数将数据重塑为国家-年份矩阵,便于面板数据分析。数据集还预定义了任务类型(表格分类、回归、时序预测),可直接集成到机器学习工作流中,极大降低了研究者获取和预处理高质量劳动力统计数据的门槛。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年整理发布,经Electric Sheep Europe重新封装后托管于HuggingFace平台,聚焦于分析1991年至2025年间33个欧洲国家按性别、教育程度和货币划分的雇员月收入中位数。作为ILOSTAT数据库的重要子集,该数据集旨在揭示欧洲劳动力市场中性别收入差距与教育回报率的时空演变规律,为劳动经济学、社会政策评估及可持续发展目标(SDG)中的体面工作指标提供关键实证基础。其结构化面板数据涵盖约3.9万条观测记录,融合了多源调查与行政数据,对于理解欧洲一体化进程中的人力资本定价与分配公平性具有重要学术价值。
当前挑战
该数据集所解决的领域挑战在于:长期缺乏跨国、跨性别与教育维度的标准化月收入可比数据,导致欧洲层面的性别工资差异与教育溢价动态难以进行系统性量化分析。构建过程中面临多重困难,首先需整合33国来源各异的劳动力调查与家庭收支调查数据,依据国际劳工统计学家会议(ICLS)定义进行跨时期协调统一,部分国家数据存在不连续性或标记为‘不可靠’。此外,货币单位与教育分类标准的跨国差异显著,需通过ILOSTAT的元数据注释机制进行对齐,最终形成兼顾时间深度与细分维度的均衡数据集,但仍有约10%的观测值受限于数据质量标记而需审慎使用。
常用场景
经典使用场景
该数据集收录了1991年至2025年间33个欧洲国家雇员的月度收入中位数,按性别、教育程度和货币类型进行精细划分,共计39,264条观测记录。在劳动经济学与社会分层研究中,学者常利用该数据集探究教育回报率的跨国差异与时间演变趋势,通过对比不同性别群体的收入中位数,剖析劳动力市场中性别工资差距的长期动态。数据的时间跨度和国别覆盖使其成为面板回归分析的理想材料,广泛用于估计人力资本积累对收入水平的边际影响,以及检验明瑟方程(Mincer equation)在多元欧洲语境下的适配性。
解决学术问题
该数据集直接回应了劳动经济学中关于教育与性别收入不平等的核心实证难题。传统研究常受限于小范围调查或单一国家的截面数据,难以捕捉制度环境与政策变迁对收入结构的异质性影响。凭借连贯的年度序列与统一的ILOSTAT统计口径,研究者得以量化教育层次提升对中位数收入的净效应,分离出性别歧视、职业隔离与教育选择等混杂因素的贡献。该数据还助力检验最低工资制度、集体谈判覆盖率等制度变量如何调节教育与性别的收入梯度,为缩小欧洲内部劳动力市场失衡提供经验证据。
实际应用
在实际政策制定与劳动力市场监测中,该数据集服务于欧洲各国政府及国际组织的薪酬公平性评估。社会规划者通过分析不同教育层级雇员的收入中位数,识别技能短缺领域并优化教育资源分配;性别平等机构则依据分性别的收入趋势,设计针对性的工资透明化措施与反歧视法规。金融分析机构利用本国货币与欧元双重口径的收入序列,评估购买力平价变动对居民消费能力的影响。此外,该数据还嵌入企业薪酬对标系统,帮助企业依据地域与行业特征合理设定薪酬架构,提升人才竞争力。
数据集最近研究
最新研究方向
基于ILOSTAT欧洲雇员中位数月薪数据集,当前研究前沿聚焦于解析性别、教育水平与货币波动对薪资差异的协同影响机制。结合欧盟推动薪酬透明化指令与全球性别平等指数相关热点,研究者正利用该数据构建多维度薪资不平等预测模型,并通过时间序列分析揭示1991年至2025年间欧洲劳动力市场结构性变迁。该数据集的高颗粒度与跨国可比性,为评估宏观经济政策对特定人群(如女性及低教育层次劳动者)的薪酬效应提供了可靠证据,有力支撑了基于性别差异的薪酬公平性实证研究,并推动了数据驱动的劳动经济学模型优化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务