遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-mts-nb-average-hourly-earnings-of-employees-by-sex-and-ma

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲按性别和婚姻状况划分的员工平均小时收入(本地货币)数据。数据集涵盖7个欧洲国家(包括瑞士、葡萄牙、英国、摩尔多瓦、法国、波斯尼亚和黑塞哥维那、希腊),时间跨度为1991年至2025年,共3,579个观察值,专注于一个指标:EAR_EHRA_SEX_MTS_NB,即按性别和婚姻状况划分的员工平均小时收入(本地货币)。数据以表格形式组织,包含国家代码、来源、指标、性别分类(总计、男性、女性)、年份、观察值等列,适用于表格分类、回归和时间序列预测任务。数据是年度频率的,经过ILO的标准化处理,以确保数据质量,并附带元数据如来源标签和观察状态标志。数据集由Electric Sheep Europe重新打包,便于机器学习使用,遵循CC BY 4.0许可。

This dataset contains data on average hourly earnings of employees by sex and marital status (in local currency) for Europe, sourced from the International Labour Organization (ILO) ILOSTAT database. It covers 7 European countries (including Switzerland, Portugal, United Kingdom, Moldova, France, Bosnia and Herzegovina, Greece), spanning the years 1991 to 2025, with 3,579 observations focusing on one indicator: EAR_EHRA_SEX_MTS_NB, which represents average hourly earnings of employees by sex and marital status (local currency). The data is organized in tabular format, including columns for country codes, sources, indicators, sex disaggregation (total, male, female), year, observed values, and more, making it suitable for tabular classification, regression, and time-series forecasting tasks. The data is annual frequency, harmonized by ILO for quality assurance, and includes metadata such as source labels and observation status flags. The dataset is repackaged by Electric Sheep Europe for machine learning readiness and is licensed under CC BY 4.0.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-mts-nb-average-hourly-earnings-of-employees-by-sex-and-ma 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,通过REST API直接提取特定指标(EAR_EHRA_SEX_MTS_NB)的观测数据,并依据欧洲ISO3国家代码进行地域筛选。数据集构建中,ILOSTAT采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,同时在source.label列中标注数据来源,确保每一条记录具备可追溯性。最终由Electric Sheep Europe进行标准化封装,以Parquet格式发布,便于机器学习场景下的高效加载与使用。
特点
数据集涵盖1991年至2025年间7个欧洲国家的3579条观测记录,包含一个核心指标——按性别和婚姻状况划分的雇员平均小时工资(以本币计价)。其显著特色在于提供了sex和classif1等分类维度,允许用户从性别(总、男、女)及婚姻状况等角度进行细分分析。数据以年度频率呈现,并包含观测状态标志(如B代表序列中断)及详细的注释列,便于用户评估数据质量和理解序列变化。
使用方法
用户可通过HuggingFace Datasets库轻松加载该数据集,使用`load_dataset("electricsheepeurope/europe-ilo-ear-ehra-sex-mts-nb-average-hourly-earnings-of-employees-by-sex-and-ma")`一步获取训练集,并以Pandas DataFrame格式进行操作。典型应用包括按国家代码过滤分析特定国家的时间序列走势、绘制某指标随年份变化的曲线图,或利用pivot_table构建国家×年份的矩阵视图,以支持跨国的工资水平对比与趋势研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)下属的ILOSTAT数据库于2025年整理并发布,经Electric Sheep Europe重新打包为机器学习就绪格式。数据集聚焦于欧洲七国(瑞士、葡萄牙、英国、摩尔多瓦、法国、波斯尼亚和黑塞哥维那、希腊)1991至2025年间按性别与婚姻状况划分的雇员平均小时工资(以当地货币计),共包含3579条观测值。作为全球劳动统计的权威来源,ILOSTAT通过统一国际劳工统计学家会议(ICLS)定义,整合多国劳动力调查与行政记录数据,为研究劳动经济学、性别工资差距及婚姻状况对收入的影响提供了关键基础。该数据集在推动劳动力市场不平等量化分析、政策评估以及时间序列预测研究中具有重要价值,尤其填补了欧洲区域细粒度工资数据的可获取性空白。
当前挑战
该数据集面临的核心挑战包括:1)劳动力市场中的性别与婚姻状况工资差异分析常受限于数据稀疏性与统计口径不一致,例如不同国家对‘雇员’‘小时工资’的定义存在偏差,且部分国家(如希腊)仅覆盖有限年份,导致跨国产出可比性降低;2)构建过程中,ILOSTAT需从多源调查(如劳动力调查、企业调查)中提取并统一数据,面临来源标签冲突、年度频率与月度/季度数据缺失、以及ILO选定的‘最佳来源’可能隐含选择偏差等问题;3)元数据中的观测状态标志(如‘系列中断’)反映了数据收集的非连续性,为长期趋势建模与因果推断引入噪音,需谨慎处理缺失值及结构性断点。
常用场景
经典使用场景
在劳动经济学与公共政策研究中,europe-ilo-ear-ehra-sex-mts-nb-average-hourly-earnings-of-employees-by-sex-and-ma数据集被广泛用于分析欧洲各国雇员平均小时工资的性别差异及其随时间的演变轨迹。研究者可基于该数据集按性别和婚姻状况对工资数据进行拆解,利用时间序列回归或面板数据模型,定量评估劳动力市场中性别工资差距的幅度、趋势和构成因素。该数据集涵盖七个欧洲国家、跨越三十余年的观测值,为跨国比较研究和长期工资动态分析提供了坚实的数据基础。
解决学术问题
该数据集的核心学术价值在于回答以下关键问题:性别与婚姻状况如何影响雇员的平均小时工资?婚姻溢价或惩罚在不同国家和时期是否存在显著差异?通过提供标准化、可复现的跨国面板数据,它使研究者能够检验人力资本理论、统计歧视假说和劳动力市场分割理论等经典框架的适用性。数据集的出现显著推动了欧洲劳动力市场不平等研究的发展,为理解社会结构因素对薪酬决定的影响提供了经验证据,进而启发关于反歧视政策和工资透明度的政策讨论。
衍生相关工作
基于该数据集,学术界已衍生出一系列重要工作,包括利用该数据构建的性别工资差距预测模型、马尔可夫链模拟的劳动力流动性研究,以及结合其他社会经济指标的跨数据集联合分析。这些衍生工作不仅深化了对欧洲劳动市场分化机制的理解,还催生了开源的分析工具包和可视化仪表盘,便于非专业用户也能力便地探索工资动态。同时,数据集与ILOSTAT的衔接为全球劳动统计的标准化推广提供了范例,激励了其他地区类似数据集的构建与开放共享。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务