遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-eco-cur-nb-median-hourly-earnings-of-employees-by-sex-economi

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲8个国家(瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、意大利、希腊)从1991年至2025年的员工每小时中位数收入数据,共44,945个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,核心指标为“按性别、经济活动和货币划分的员工每小时中位数收入”(代码EAR_EHRM_SEX_ECO_CUR_NB)。数据集以表格形式组织,包含国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、经济活动分类、货币分类、观测年份、观测值、数据状态等列。数据经过ILO harmonization处理,确保符合国际劳工统计标准,并提供了数据质量说明(如年度频率、最佳来源选择、分类列非空条件)。数据集适用于表格分类、回归和时间序列预测等任务,可用于分析欧洲国家收入趋势、性别差异和经济活动影响。

This dataset contains median hourly earnings data for employees across 8 European countries (Switzerland, Portugal, France, United Kingdom, Moldova, Bosnia and Herzegovina, Italy, Greece) from 1991 to 2025, with 44,945 observations. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, with the core indicator being Median hourly earnings of employees by sex, economic activity and currency (code EAR_EHRM_SEX_ECO_CUR_NB). The dataset is organized in tabular format, including columns such as country code, country name, data source, indicator code, sex disaggregation (total, male, female), economic activity classification, currency classification, observation year, observed value, and data status. The data is harmonized by ILO following International Conference of Labour Statisticians (ICLS) definitions, with quality notes (e.g., annual frequency, best source selection, non-null disaggregation columns). It is suitable for tasks like tabular classification, regression, and time-series forecasting, enabling analysis of income trends, gender disparities, and economic activity impacts in Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-eco-cur-nb-median-hourly-earnings-of-employees-by-sex-economi 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,经由Electric Sheep Europe团队从ILOSTAT REST API直接拉取原始数据,并依据欧洲ISO3国家代码进行地理范围的精细过滤,最终汇聚而成。ILOSTAT本身基于国际劳工统计学家会议(ICLS)定义的统一标准,对各国劳动力调查、家庭收支调查及行政记录等微观数据进行系统性整合与标准化处理。整个构建过程确保了数据来源的明晰可溯,每一笔观测值均在'source.label'列中标注了原始数据的产生方式,为研究者提供了坚实的溯源基础。
特点
该数据集汇集了44,945条观测记录,时间跨度从1991年至2025年,覆盖瑞士、葡萄牙、法国等8个欧洲国家,聚焦于‘按性别、经济活动及货币分类的雇员小时工资中位数’这一核心指标。其显著特点在于多维度的精细解构:数据不仅按性别(总计、男性、女性)进行拆分,还引入了经济活动部门及货币类型等分类变量。此外,数据集包含了详尽的观测状态标志(如临时、不可靠)及丰富的注释信息,为严谨的时间序列分析与跨国比较提供了高质量、可验证的原始素材。
使用方法
用户可通过HuggingFace Datasets库以一行代码轻松加载该数据集,进而转换为熟悉的pandas DataFrame进行操作。经典的使用路径包括:依据'ref_area'列筛选特定国家的子集以进行国别分析;按'indicator'列过滤出核心指标后,按'time'列排序并绘制时间序列图,直观观察薪资水平的历史演变趋势;亦可利用pivot_table方法将数据重塑为国家×年份的矩阵形式,便于开展面板数据计量回归或多国横向对比。这些接口设计使得从数据获取到分析的链条极为简洁高效。
背景与挑战
背景概述
在劳动经济学与社会政策研究领域,薪资水平的跨国比较与时间序列分析一直是理解劳动力市场结构、评估经济政策效果以及监测可持续发展目标的核心议题。由国际劳工组织(ILO)统计司维护的ILOSTAT数据库,作为全球劳动统计的权威来源,整合了来自200多个经济体的调查与行政记录数据。基于此,Electric Sheep Europe于2025年重新包装并发布了欧洲八国雇员按性别、经济活动与货币分列的时薪中位数数据集,涵盖1991年至2025年间44,945条观测值。该数据集旨在为研究人员与政策制定者提供一个结构统一、可直接用于机器学习的标准化接口,从而降低从原始API获取并清洗数据的技术门槛,促进对欧洲劳动力市场性别薪资差异与行业薪资变动的深入挖掘。其对相关领域的核心贡献在于,将精确的薪资统计与易用的数据科学工具结合,赋能跨国家、跨时段的比较研究。
当前挑战
该数据集所要解决的领域问题主要来自劳动统计中薪资数据的高度异质性与复杂背景挑战:不同国家使用不同货币(如本国货币与欧元),且各国调查方法与数据质量参差不齐,导致直接的跨国比较与聚合分析极其困难;此外,薪资数据常受经济周期、产业结构变迁与劳动法规调整的影响,呈现出非平稳的时间序列特征。在数据集的构建过程中,团队面临了多重挑战:首先是从ILOSTAT的REST API中筛选并统一欧洲国家代码,并处理因各国调查频率与定义不同而导致的观测时间维度的稀疏与不规则;其次,需要妥善处理数据中的标识性注释,如不稳定性标记与源数据版本差异,这些注释对数据分析结果的可靠性至关重要;最后,多源数据融合时需要应对因最佳数据源选择机制而产生的逻辑复杂性,确保在同一个国家与年份内不存在数据冲突。
常用场景
经典使用场景
在劳动经济学与交叉不平等研究中,该数据集常用于剖析欧洲八国劳动者的小时工资中位数在不同性别、经济活动领域和货币计价下的分布特征。研究者可借助丰富的分类维度(如性别、行业)构建回归模型或时间序列分析,以揭示工资水平的长期演变轨迹及其结构性差异。基于其细粒度的年度观测,该数据尤为适合进行跨国比较研究,识别各国劳动力市场中性别工资差距的异质性模式,并考察经济周期对不同行业薪酬的冲击效应。
解决学术问题
该数据集有效回应了劳动力市场中性别薪酬不平等这一经典学术命题,为实证检验人力资本理论、劳动力市场歧视理论及制度性薪酬决定因素提供了高质量证据。通过涵盖多国多年份的面板结构,研究者能够分离个体层面无法观测的异质性,准确估计性别、产业归属及货币因素对工资中位数的独立贡献。其数据来源ILOSTAT严格遵循国际劳动统计学家会议(ICLS)定义,确保了跨国比较的可信度,为解决数据一致性难题和推动劳动经济学理论验证提供了坚实基础。
衍生相关工作
基于该数据集,研究者已发展出一系列富有影响力的后续工作,例如在时间序列预测框架中运用长短期记忆网络(LSTM)或Transformer模型对欧洲各国未来薪酬趋势进行建模,探索经济政策不确定性对工资中位数波动的影响。另一些工作将其与ILOSTAT其他指标(如失业率、劳动参与率)联合分析,构建多元面板回归模型以识别工资决定的新机制。部分学者还将其改造为分类任务,利用机器学习方法预测工资水平所属的高、中、低区间,推动了数据驱动型劳动市场研究的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务