遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-age-cur-nb-average-hourly-earnings-of-employees-by-sex-and-ag

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲国家员工平均小时收入统计信息。数据集涵盖8个欧洲国家(包括瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、意大利和希腊),时间跨度为1991年至2025年,共10,670个观察值。核心指标为EAR_EHRA_SEX_AGE_CUR_NB,即按性别、年龄和货币划分的员工平均小时收入。数据通过性别(总计、男性、女性)、年龄分类和货币类型进行细分,并包含国家代码、数据来源、观察年份、数值状态等详细列。数据来源于ILO harmonised的劳动力调查等官方统计,采用年度频率,适用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Europe重新打包,以Parquet格式提供,便于机器学习使用。

This dataset contains statistical information on average hourly earnings of employees in European countries, sourced from the International Labour Organization (ILO) ILOSTAT database. It covers 8 European countries (including Switzerland, Portugal, France, United Kingdom, Moldova, Bosnia and Herzegovina, Italy, and Greece) from 1991 to 2025, with 10,670 observations. The core indicator is EAR_EHRA_SEX_AGE_CUR_NB, which represents average hourly earnings of employees disaggregated by sex, age, and currency. Data is broken down by sex (total, male, female), age classification, and currency type, and includes detailed columns such as country codes, data sources, observation years, and value status. The data originates from ILO-harmonised official statistics like labour force surveys, is annual in frequency, and is suitable for tasks like tabular classification, regression, and time-series forecasting. The dataset is repackaged by Electric Sheep Europe in Parquet format for machine learning readiness.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-age-cur-nb-average-hourly-earnings-of-employees-by-sex-and-ag 数据集图片
构建方式
该数据集源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接抽取指标编码为EAR_EHRA_SEX_AGE_CUR_NB的原始数据,并依据欧洲ISO3国家代码进行地理过滤。数据涵盖来自8个欧洲国家的10,670条观测记录,时间跨度为1991年至2025年。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理,每条记录均包含来源标签(source.label)以确保可追溯性。最终由Electric Sheep Europe团队重新封装,形成结构化的表格数据集。
特点
本数据集聚焦于按性别和年龄划分的雇员平均小时收入,包含唯一的指标变量,并以本地货币为计价单位。数据按年频次发布,具备多维度的分类结构,包括性别(总、男、女)和年龄分组等字段。每个观测值均附有状态标记(如系列中断、临时值)以反映数据质量。地理覆盖涵盖瑞士、葡萄牙、法国等8国,其中瑞士以2,112条记录最为丰富。数据来源多样,涵盖劳动力调查、行政记录等,由ILO选取最佳来源进行整合。
使用方法
数据集可通过HuggingFace的`load_dataset`函数一键加载,例如`load_dataset("electricsheepeurope/europe-ilo-ear-ehra-sex-age-cur-nb-average-hourly-earnings-of-employees-by-sex-and-ag")`,返回的DataFrame可直接用于分析。用户可按国家进行子集筛选(如`df[df["ref_area"] == "DEU"]`),或针对单一指标进行时间序列可视化(如按`time`和`obs_value`绘图)。还可通过透视表构建国家×年份矩阵,便于跨区域比较。数据集已预分割为训练集,兼容表格分类、回归及时间序列预测等任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,并由Electric Sheep Europe于2025年重新整理发布,聚焦于欧洲8个国家1991至2025年间按性别和年龄划分的雇员平均时薪数据。数据集源自ILOSTAT——全球劳动统计领域的权威数据库,其核心研究问题在于揭示欧洲劳动力市场中工资结构的性别与年龄差异。该数据集整合了来自劳动调查、行政记录等多源异构信息,为劳动经济学、社会政策及性别平等研究提供了标准化、可复用的时序数据基础。其发布显著降低了研究人员获取高质量欧洲工资微观数据的门槛,推动了跨国比较分析和机器学习模型在劳动薪资预测与不平等度量中的应用。
当前挑战
该数据集面临的挑战主要体现在领域问题与构建过程两个层面。在领域问题方面,它致力于解决劳动市场中工资数据粒度粗糙、跨国可比性不足的痛点,但性别与年龄的交叉分组仍难以完全捕捉职业、教育背景或行业内部的结构性工资不平等。在构建过程中,数据来源涉及多个国家的劳动调查与行政记录,不同统计体系间的定义差异(如年龄分组标准、货币种类)和时序断点(如长期缺失或标记为‘中断’的观测)增加了数据清洗与统一归约的难度。此外,部分国家样本量稀疏(如希腊仅432条记录),可能导致估计偏误,而对‘最优来源’的选择虽由ILO官方指定,却可能引入潜在的选择性偏差。
常用场景
经典使用场景
在劳动经济学与时间序列预测的研究中,europe-ilo-ear-ehra-sex-age-cur-nb-average-hourly-earnings-of-employees-by-sex-and-ag数据集扮演着基准测试场的角色。研究者常利用该数据集构建薪资水平的多维度分解模型,通过性别、年龄和国家等分类变量,探索欧洲劳动力市场中工资差异的演变规律。该数据涵盖1991年至2025年间8个欧洲国家的年度观测值,丰富的时序信息使其成为检验面板数据回归、混合效应模型以及长短期记忆网络(LSTM)等深度学习架构对薪资趋势拟合与预测能力的理想选择。
衍生相关工作
该数据集衍生了一系列具有影响力的研究工作,特别是在性别经济学和跨国劳动统计领域。基于此数据,学者构建了预测欧洲劳动力市场性别工资差距收敛速度的动态随机模型,并开发了识别薪酬政策冲击效应的因果推断框架。在方法论上,它促进了处理ILOSTAT多源数据质量标记(如序列中断标识)的稳健统计方法的发展。同时,该数据集的时序特性催生了专为经济面板数据设计的深度学习预测模型,推动了图神经网络在捕捉国家间经济关联性薪资传导中的应用,丰富了定量社会科学的研究工具箱。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲多国按性别与年龄划分的雇员平均时薪动态,为劳动经济学中的性别薪酬差距、年龄相关收入不平等及跨国产能比较提供了长时序、细粒度的实证基础。当前前沿研究正借助ILOSTAT标准化指标,结合机器学习与时间序列预测模型,探索欧洲各国在1991至2025年间薪酬结构的演变规律,尤其关注金融危机、新冠疫情及自动化浪潮对非标准就业群体薪酬的冲击。数据集的高质量分类特征(如性别与年龄组)支撑了因果推断与公平性分析,为欧盟‘同工同酬’政策评估及国际劳工组织体面劳动目标的量化监测提供了关键数据锚点,推动了从描述性统计向预测性劳动力市场治理的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务