遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-edu-cur-nb-average-monthly-earnings-of-employees-by-sex-educa

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的39,264个观察值,涵盖33个欧洲国家从1991年到2025年的数据。它专注于一个指标:按性别、教育和货币划分的员工平均月收入(EAR_EMTA_SEX_EDU_CUR_NB)。数据经过ILO使用国际劳工统计学家会议(ICLS)定义进行协调,并包括按性别、教育水平和货币类型等维度的细分。数据集由Electric Sheep Europe重新打包,以提供统一的、适合机器学习的欧洲数据层。

This dataset contains 39,264 observations from the International Labour Organization (ILO) ILOSTAT database, covering 33 European countries from 1991 to 2025. It focuses on one indicator: Average monthly earnings of employees by sex, education and currency (EAR_EMTA_SEX_EDU_CUR_NB). The data is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions and includes disaggregation by dimensions such as sex, education level, and currency type. The dataset is repackaged by Electric Sheep Europe to provide a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-edu-cur-nb-average-monthly-earnings-of-employees-by-sex-educa 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,专注于欧洲地区按性别、教育程度及货币分类的雇员平均月收入数据。通过调用ILOSTAT REST API,从原始指标`EAR_EMTA_SEX_EDU_CUR_NB`中提取数据,并依据ISO3国家代码筛选出33个欧洲国家的观测值。数据集采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,并在`source.label`字段中标注数据来源,确保了数据的可追溯性与统计口径的一致性。经Electric Sheep Europe二次封装后,以Parquet格式发布,共计39,264条观测记录,时间跨度从1991年至2025年。
使用方法
用户可通过HuggingFace Datasets库便捷使用该数据集,仅需调用`load_dataset("electricsheepeurope/europe-ilo-ear-emta-sex-edu-cur-nb-average-monthly-earnings-of-employees-by-sex-educa")`即可加载。加载后的数据可直接转换为Pandas DataFrame进行探索。典型用法包括:按国家代码过滤特定国家的数据以进行国别分析;针对单一指标按时间排序进行时间序列绘制;或利用透视表功能,以时间为行、国家为列构建国家间收入对比矩阵。该数据集适用于表格分类、回归及时间序列预测等任务,是研究欧洲劳动力市场动态与经济不平等的利器。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年整理发布,由Electric Sheep Europe团队封装至HuggingFace平台,旨在提供欧洲33个国家1991至2025年间雇员平均月收入的标准化数据。核心研究问题聚焦于性别、教育水平与货币类型对劳动收入的影响,为劳动经济学、收入不平等及人力资本研究提供了跨时空的高质量面板数据。数据集源自ILOSTAT官方数据库,经国际劳工统计学家会议定义统一框架,整合了家庭收入调查、企业调查等多源数据,在学术研究与政策制定中具有重要影响力,尤其支撑了欧洲各国劳动市场分析与可持续发展目标监测。
当前挑战
该数据集面临的核心挑战在于数据异质性与完整性:由于各国统计体系差异(如教育分类标准不一),相同收入指标可能因定义歧义导致跨境比较失真;部分国家的时序数据存在大量缺失(如早期年份覆盖率低),且观测状态标记为“不可靠”或“临时”的条目增加了噪声干扰。构建过程中的挑战则源于数据整合:需从超过200个经济体的多源调查中筛选欧洲子集,调和不同调查工具间因采样方法与问卷设计产生的系统性偏差,同时需处理随时间变化的货币单位(如欧元区过渡)及通胀影响,使得多维度标准化过程极为繁复。
常用场景
经典使用场景
该数据集汇聚了1991年至2025年间欧洲33个国家按性别、教育程度及货币类型划分的雇员平均月收入观测数据,共计39,264条记录。在学术研究中,它常被用于构建面板数据模型,以剖析欧洲各国劳动力市场中教育回报率的时空演变,或作为核心变量探究性别收入差距的长期趋势。研究者可借助其丰富的分类维度,灵活开展跨国比较或时间序列分析,从而揭示不同经济与社会制度背景下人力资本定价机制的异同。
解决学术问题
该数据集有力地回应了劳动经济学中两个长期悬而未决的议题:教育投资的经济回报如何随国家与时代变迁,以及性别工资差距在教育水平与地理空间上的异质性表现。通过整合国际劳工组织统一规范的微观数据,它解决了以往研究因各国调查口径不一导致的可比性难题,为验证明瑟收入方程、构建性别歧视分解模型及评估最低工资政策效应提供了可靠的数据基石,推动了欧洲劳动力市场实证研究的科学化与系统化。
实际应用
在实际应用层面,该数据集对欧洲各国政府制定薪酬平等政策与教育投资战略具有直接的参考价值。政策制定者可依据按性别和教育程度细分的收入数据,精准识别特定群体面临的结构性收入劣势,进而设计针对性的技能培训计划或反歧视法规。国际组织与智库亦可借助其时间序列特征,持续监测劳动力市场对经济周期及技术变革的响应,为区域一体化进程中的人力资源协调提供数据驱动的决策支持。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲雇员平均月薪的性别与教育层面差异,近期研究前沿正围绕劳动力市场中的性别薪酬鸿沟与教育回报率展开。随着ILOSTAT的权威数据被整合至机器学习就绪的格式,研究者得以利用时间序列预测与分类回归模型,深度剖析1991至2025年间33个欧洲国家的薪资演变规律。这些分析不仅服务于欧洲经济政策制定,更与全球体面劳动目标相接轨,为评估性别平等政策成效及教育投资回报提供了量化支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务