遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-cur-nb-average-monthly-earnings-of-employees-by-sex-and-c

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的“员工月平均收入(按性别和货币分类)”统计信息,涵盖欧洲41个国家从1969年至2025年的7,975个观测数据。数据集提供单一指标“EAR_EMTA_SEX_CUR_NB”,表示按性别和货币分类的员工月平均收入,数据以年度频率发布,并包含国家代码、年份、性别分类(总计、男性、女性)、货币类型、观测值及数据来源等详细列。数据经过ILO标准化处理,适用于表格分类、回归分析和时间序列预测等机器学习任务。

This dataset contains Average monthly earnings of employees by sex and currency statistics from the ILOSTAT database of the International Labour Organization (ILO), covering 7,975 observations across 41 European countries from 1969 to 2025. It features a single indicator EAR_EMTA_SEX_CUR_NB representing average monthly earnings disaggregated by sex and currency, with annual frequency data. The schema includes columns such as country codes, year, sex classification (total, male, female), currency type, observed values, and data sources, harmonized by ILO standards for use in tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-cur-nb-average-monthly-earnings-of-employees-by-sex-and-c 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接提取标识符为EAR_EMTA_SEX_CUR_NB的指标数据,并依据欧洲ISO3国家代码进行过滤与整合。ILOSTAT本身依据国际劳动统计学家会议(ICLS)的定义对原始调查微观数据进行统一处理,使得数据在跨国家、跨年份之间具备可比性。数据集以Parquet格式封装,由Electric Sheep Europe重新打包并托管于HuggingFace,确保研究人员能够以标准化的方式便捷获取。
特点
该数据集涵盖1969年至2025年间41个欧洲国家的7,975条观测记录,聚焦于按性别和货币分类的雇员平均月收入这一核心指标。数据展现多维度信息,包括性别(男性、女性、总和)、数据来源及注释标签,便于用户追溯每条记录的原始出处与质量状态。此外,数据集保留了丰富的分类变量和标识字段,为时间序列分析、面板数据建模及跨国比较研究提供了坚实的数据基础。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载该数据集,并以Pandas DataFrame形式进行后续操作。例如,按国家代码过滤特定国家的数据,或针对特定指标按时间排序进行时间序列可视化。数据集亦支持透视操作,便于构建以年份为行、国家为列的矩阵结构。这些灵活的操作方式使得该数据集能够无缝融入机器学习、统计建模及经济学分析的工作流程之中。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Europe于2025年重新整理并发布于HuggingFace平台。其核心研究问题聚焦于欧洲地区雇员平均月收入的性别差异与货币分布,旨在为劳动经济学、性别薪酬平等及跨国比较研究提供标准化、可复用的时间序列数据。数据集涵盖41个欧洲国家,时间跨度从1969年至2025年,包含7,975条观测记录,是ILOSTAT全球劳动力统计体系的重要组成部分。该数据集的发布显著降低了研究者获取高质量、跨国长期薪酬数据的门槛,推动了关于欧洲劳动力市场结构、性别收入差距演变及政策效果评估的量化分析,对相关领域具有基础性支撑作用。
当前挑战
该数据集所应对的领域挑战包括:欧洲各国薪酬统计口径不一,存在货币单位、调查方式(如劳动力调查与行政记录)及分类标准(如性别、行业)的差异,给跨国可比性带来障碍;同时,薪酬数据常受到通货膨胀、汇率波动及经济周期的影响,需进行精细的归一化处理。在构建过程中,面临的挑战在于:从ILOSTAT REST API提取原始数据后,需清洗并统一多来源(如不同国家的劳动力调查、所得税记录)的格式,处理缺失值、断点系列(Break in series)及标注不一致问题;此外,需将数据精准过滤至欧洲国家并确保ISO3编码对应正确,同时保留来源追踪信息以维持可追溯性,最终形成结构清晰、可直接用于机器学习与时间序列分析的表格数据集。
常用场景
经典使用场景
在劳动经济学与计量分析领域,欧洲各国雇员月均收入数据集(基于ILOSTAT指标EAR_EMTA_SEX_CUR_NB)的核心用途在于构建面板数据模型,以探究性别收入差异的跨国动态演变。研究者可借助该数据集按性别维度(总、男、女)拆分的时序观测值,结合固定效应或随机效应回归,揭示欧盟一体化进程中工资收敛趋势与性别收入鸿沟的消长关系。其长达56年(1969-2025年)的跨期覆盖与41国地理广度,为检验库兹涅茨曲线是否适用于收入分配议题提供了稀缺的实证支撑。
衍生相关工作
基于此数据集衍生的标志性工作包括欧洲统计局(Eurostat)发布的《欧盟收入结构年度报告》中的跨国分位数回归分析,以及多个计量经济学团队利用断点回归设计(RDD)对2004年欧盟东扩事件对新成员国工资溢价效应的因果识别。此外,国际劳工组织自身在《全球工资报告》中反复引用该系列数据,构建了评估技术进步与全球价值链重塑对欧洲劳动力市场回报率的动态一般均衡模型。
数据集最近研究
最新研究方向
该数据集聚焦欧洲41国1969至2025年间基于性别与货币分类的员工平均月收入,为劳动经济学中的性别薪酬差距、收入不平等及劳动力市场结构性变迁提供了纵贯数十年的高分辨率面板数据。当前前沿研究方向集中于利用该时序数据集进行跨周期收入收敛性分析、女性劳动参与率与收入增长的动态关联建模,以及结合机器学习方法预测通货膨胀、最低工资调整对实际购买力的潜在冲击。尤其在后疫情时代与欧洲能源危机背景下,该数据成为评估薪酬韧性、推动国际劳工组织体面工作目标(SDG 8.5)量化监测的关键工具,其性别维度支撑了基于证据的社会保护政策设计与跨国比较研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务