遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-mts-cur-nb-average-hourly-earnings-of-employees-by-sex-marita

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲7个国家(瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、希腊)从1991年至2025年的员工平均小时收入数据,共3,741个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,通过API获取并过滤为欧洲国家。核心指标为EAR_EHRA_SEX_MTS_CUR_NB,即按性别、婚姻状况和货币划分的员工平均小时收入。数据集提供结构化表格,包含国家代码、来源、指标、性别分类(总计、男性、女性)、婚姻状况分类、货币类型、观测年份、观测数值等列,适用于表格分类、回归和时间序列预测任务。数据经过ILO标准化处理,使用ICLS定义,并标注了来源和质量标志,如观测状态和备注。

This dataset contains average hourly earnings data for employees from 7 European countries (Switzerland, Portugal, France, United Kingdom, Moldova, Bosnia and Herzegovina, Greece) spanning the years 1991 to 2025, with a total of 3,741 observations. The data is sourced from the ILOSTAT statistical database of the International Labour Organization (ILO), retrieved via API and filtered to retain only European country datasets. The core indicator is EAR_EHRA_SEX_MTS_CUR_NB, which denotes the average hourly earnings of employees categorized by gender, marital status and currency. The dataset provides structured tabular data with columns including country code, data source, indicator name, gender categories (total, male, female), marital status categories, currency type, observation year and observed value, among others, and is suitable for tasks such as tabular classification, regression and time series forecasting. The data has been standardized by the ILO in accordance with the ICLS definition, and is annotated with source information and quality markers including observation status and remarks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-mts-cur-nb-average-hourly-earnings-of-employees-by-sex-marita 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口直接获取指标代码为EAR_EHRA_SEX_MTS_CUR_NB的原始数据,并依据欧洲ISO3国家代码进行地理区域筛选。数据经过ILOSTAT官方基于国际劳工统计学家会议(ICLS)定义进行的标准化处理,涵盖了来自劳动力调查、家庭收入调查、企业调查及行政记录等多源数据。Electric Sheep Europe团队进一步对原始数据进行重新封装,统一了数据模式并转换为Parquet格式,最后以HuggingFace Datasets的形式发布,实现了与`load_dataset()`函数的无缝对接,为研究人员提供了开箱即用的便捷体验。
特点
本数据集聚焦于欧洲7个国家(瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、希腊)1991年至2025年间雇员按性别、婚姻状况及货币分类的每小时平均收入信息。数据集包含3,741条观测记录,覆盖1个核心指标,并以年频率呈现。其核心特色在于丰富的维度拆解能力,提供了性别(男性、女性、总计)、婚姻状况及货币类型等多个分类变量,使用户能够从多元视角探究工资差异的演变趋势。此外,每条观测均附有来源标注、观测状态标志及说明性备注,有效保障了数据的可追溯性与透明度。
使用方法
使用者可通过HuggingFace的`datasets`库便捷地加载数据:`load_dataset("electricsheepeurope/europe-ilo-ear-ehra-sex-mts-cur-nb-average-hourly-earnings-of-employees-by-sex-marita")`,并将训练集转换为Pandas DataFrame以便进行后续分析。数据提供了灵活的筛选与透视功能,用户可依据`ref_area`(国家代码)筛选特定国家的时间序列数据,或利用`pivot_table`构建以年份为行、国家为列的矩阵视图。针对单一指标,通过按`time`列排序并结合`obs_value`列即可绘制随时间变化的趋势图,适用于经典的表格分类、回归及时间序列预测任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据部门通过ILOSTAT平台整理,并由Electric Sheep Europe于2025年重新打包发布,聚焦于欧洲7个国家(瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、希腊)1991至2025年间雇员按性别、婚姻状况及货币划分的平均小时工资。作为全球劳动统计的权威来源,ILOSTAT整合了各国劳动力调查、企业调查及行政记录数据,为研究收入不平等、性别工资差距及劳动市场结构提供了关键的时间序列基础。该数据集共计3741条观测,涵盖单一核心指标,其精细的分层维度(如性别、婚姻状况)使其成为探讨社会经济因素与收入关系的宝贵资源,对劳动经济学、社会政策评估及可持续发展目标(SDG)监测具有重要支撑作用。
当前挑战
该数据集所解决的领域挑战在于,欧洲各国劳动统计口径不一,性别与婚姻状况对工资影响的跨国可比性长期缺失,导致政策制定缺乏统一基准。此外,构建过程中面临多重困难:ILOSTAT需协调各国采用国际劳工统计学家会议(ICLS)定义,但原始调查来源(如劳动力调查、企业调查)在问卷设计、抽样框架及时间频率上存在差异,导致部分年份数据因来源变更出现序列断裂(如“Break in series”标记);且数据仅覆盖7国,南欧及东欧国家代表性不足,非平衡面板结构(如希腊仅2015-2020年)限制了长期趋势分析的稳健性;最后,时薪以本币计价,未统一为购买力平价,跨货币比较需额外转换处理。
常用场景
经典使用场景
在劳动经济学与社会科学计量研究中,该数据集被广泛用于分析性别、婚姻状况与货币单位对员工平均小时工资的差异化影响。研究者常通过该数据集构建面板数据模型,探索欧洲七国自1991年至2025年间工资结构的时间演变规律。其经典使用方式包括利用时间序列分析识别工资水平的长期趋势与周期波动,或通过分组回归比较不同性别与婚姻状态群体间的收入差距。此外,该数据集还可作为特征工程与预测建模的输入,用于开发工资预测算法或评估经济政策对劳动力市场的干预效果。
衍生相关工作
围绕该数据集,学术界已涌现众多衍生性经典工作。在方法论层面,研究者基于此数据集开发了多种处理分类变量与时间序列交叉结构的高级统计模型,例如融合婚姻状态与性别分层效应的结构性断点检测算法。在实证研究方面,该数据催生了一系列关于欧洲劳动力市场性别工资差距的动态演进分析,其中一些工作引入双重差分或工具变量法,试图识别婚姻状态对工资的因果效应。此外,该数据集还作为基准测试数据,被用于验证新型机器学习方法在工资预测任务中的性能,尤其在处理稀疏维度与多类别分类变量时的鲁棒性评估中扮演关键角色。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲七国按性别与婚姻状况划分的雇员平均时薪动态,为劳动经济学中工资差距的交叉性研究提供了权威的纵向数据支撑。当前前沿方向集中于利用该时空序列数据,结合机器学习模型(如时间序列预测与分类算法),探究新冠疫情后欧洲劳动力市场中性别薪酬差距的演变轨迹、婚姻状况对薪资的异质性影响,以及不同国家间劳动政策差异在工资平等化进程中的调节效应。该数据集源自ILOSTAT,其规范的元数据与多维度分层结构,使其成为分析《2030年可持续发展议程》中体面工作与经济增长目标的不可或缺的实证基础,尤其在欧盟推动《薪酬透明指令》等政策落地的背景下,为量化评估薪酬公平性干预措施的有效性提供了关键证据链。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务