遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-ocu-cur-nb-average-hourly-earnings-of-employees-by-sex-occupa

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含36,613个观测值,覆盖37个欧洲国家,时间跨度为1991年至2025年,专注于一个指标:EAR_EHRA_SEX_OCU_CUR_NB,即按性别、职业和货币分类的员工平均小时收入。数据源自国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家,经过标准化处理。数据集为表格形式,适用于分类、回归和时间序列预测等任务,包含国家代码、年份、观测值、性别分类等列,并提供了数据质量说明和使用示例。

This dataset contains 36,613 observations across 37 European countries, spanning from 1991 to 2025, focusing on one indicator: EAR_EHRA_SEX_OCU_CUR_NB, which represents the average hourly earnings of employees disaggregated by sex, occupation, and currency. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered for European countries, with harmonized schemas. It is presented in tabular format, suitable for tasks such as classification, regression, and time-series forecasting, and includes columns for country codes, years, observed values, sex disaggregation, among others, along with data quality notes and usage examples.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-ocu-cur-nb-average-hourly-earnings-of-employees-by-sex-occupa 数据集图片
构建方式
该数据集基于国际劳工组织(ILO)的ILOSTAT数据库构建,通过调用其REST API接口(https://rplumber.ilo.org/data/indicator?id=EAR_EHRA_SEX_OCU_CUR_NB)直接获取原始数据,并依据欧洲地区ISO3国家代码进行地理范围筛选与过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查微观数据进行统一协调与标准化,数据来源在source.label列中明确标注,以确保源数据可追溯。最终由Electric Sheep Europe团队重新打包为易于机器学习加载的Parquet格式,收录于HuggingFace数据集平台。
特点
该数据集涵盖1991年至2025年间37个欧洲国家的36,613条观测记录,聚焦于雇员按性别、职业和货币分组的平均时薪指标。数据包含丰富的分类维度,如性别(总、男、女)、职业技能等级及货币类型,并通过classif1与classif2字段实现了多层次细粒度分解。每一观测均附有观测状态标记(如不可靠、临时值)以及详细的来源说明。数据集结构整洁,包含国家代码、标签、时间、观测值等关键字段,便于进行横截面比较与时间序列分析。
使用方法
用户可通过HuggingFace datasets库中的load_dataset()函数一键加载该数据集,并利用to_pandas()方法转换为Pandas DataFrame以便后续分析。典型应用包括筛选特定国家(如DEU)的子集进行国别工资趋势研究,或基于indicator字段排序后对单一指标(如EAR_EHRA_SEX_OCU_CUR_NB)绘制时间序列图。此外,借助pivot_table方法可方便地将数据重塑为国家×年份的矩阵格式,支持面板数据分析与跨国家比较,极大降低了劳动经济学研究中数据获取与预处理的复杂度。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年整理发布,由Electric Sheep Europe团队重新打包为机器学习友好格式,聚焦于1991至2025年间37个欧洲国家雇员按性别、职业及货币划分的平均时薪数据。数据集源自ILOSTAT核心劳动统计数据库,该数据库整合了各国劳动力调查、企业薪酬调查及行政记录,是全球劳动经济学研究的关键数据支柱。其核心研究问题在于揭示欧洲劳动力市场中性别薪酬差异、职业层级工资分布及货币波动对实际收入的影响,为政策制定者与学者提供跨国可比的时间序列证据。作为ILO推进体面劳动与可持续发展目标(SDG)的核心指标之一,该数据集对劳动经济学、社会分层及国际比较研究具有重要推动力,尤其在高频时序分析与面板数据建模领域备受关注。
当前挑战
该数据集所解决的领域核心挑战在于,欧洲各国薪酬统计口径、调查频率及职业分类标准差异显著,导致跨国薪酬比较长期缺乏统一基准。ILOSTAT通过ICLS定义协调原始调查微观数据,并采用ILO优选数据源策略,但观测值质量标记(如“不可靠”状态)仍提示部分国家特定年份数据存在调查周期错配或采样偏差。构建过程中面临的挑战包括:多来源数据融合时的粒度对齐困难(例如部分指标仅发布年度数据而原始调查可能为月度或季度);分类维度(性别、职业技能层级、货币类型)组合激增带来的稀疏性问题;以及长时序数据中近三分之一国家存在显著缺失观测值,如意大利仅覆盖2008至2020年,需依赖插补或多源验证以控制推断偏差。
常用场景
经典使用场景
在欧洲劳动力市场研究中,该数据集因其横跨37个国家、涵盖1991至2025年的时间纵深,成为经典的面板数据分析材料。研究者常利用其按性别和职业分类的小时收入信息,构建跨国或跨时期的工资决定模型。该数据集的经典使用场景包括:分析性别工资差距的时间演变趋势、探究不同职业技能等级下的收入分配结构,以及评估欧洲各国最低工资政策或集体谈判制度对劳动报酬的异质性影响。借助ILOSTAT标准化的统计口径,学者能够在一个连贯的框架内开展跨国比较研究,从而揭示欧洲劳动力市场中收入不平等的深层规律。
实际应用
在实际应用层面,该数据集的价值广泛渗透于政策制定与商业分析领域。国际组织和国家统计机构可将其作为基准,监测欧洲各国体面劳动目标的实现进程,尤其是SDG指标体系中关于工资公平性的追踪。社会政策研究者可以借助数据识别性别工资差距较大的国家或行业,为针对性干预措施提供证据支撑。人力资源咨询公司和薪酬调研机构也能够利用这份跨国的结构化收入信息,构建区域性的薪酬对标模型,帮助跨国企业制定公平且具竞争力的薪酬策略。数据集的机器可读格式和标准化元数据,还使得它易于集成到自动化监测系统和预警工具中,实现收入趋势的实时追踪。
衍生相关工作
该数据集衍生出的一系列经典工作,极大丰富了劳动经济学的实证研究图谱。基于ILOSTAT收入数据,已有研究开发了跨国性别工资差距的分解模型,将总体差距拆解为职业分布差异和同职收入差异两个维度。也有工作利用该数据构建了欧洲职业技能电梯图,刻画了不同技能水平劳动者的收入阶梯,并与职业流动数据结合分析代际收入流动性。此外,数据集的时序特性催生了一系列关于工资刚性与宏观经济冲击的研究,学者们通过建模小时收入对失业率、通胀等指标的响应,验证了劳动力市场制度的调节作用。这些衍生工作不仅扩展了数据本身的分析维度,也为后续政策模拟和理论建模奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务