遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-ocu-nb-average-monthly-earnings-of-employees-by-sex-and-o

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含33,235个观测值,覆盖39个欧洲国家,时间跨度为1991年至2025年,主要指标为按性别和职业划分的员工月平均收入(本地货币)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤为欧洲国家,涵盖了收入相关的统计信息。数据集为表格格式,适用于表格分类、回归和时间序列预测任务,包含国家代码、性别、职业分类、年份、观测值等列,并提供了数据来源和质量说明。数据以年度频率发布,部分观测值可能带有状态标志(如不可靠)。数据集由Electric Sheep Europe重新打包,旨在为机器学习提供统一、易于使用的欧洲数据层。

This dataset contains 33,235 observations across 39 Europe countries, spanning 1991 to 2025, with the main indicator being Average monthly earnings of employees by sex and occupation (local currency). The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via API and filtered to Europe country codes. It covers earnings statistics in tabular format, suitable for tabular classification, regression, and time-series forecasting tasks. The schema includes columns such as country code, sex, occupation classification, year, observed value, and data quality flags. Data is published at annual frequency, with some observations marked with status flags (e.g., Unreliable). The dataset is repackaged by Electric Sheep Europe as part of a unified, ML-ready data layer for Europe on HuggingFace.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-ocu-nb-average-monthly-earnings-of-employees-by-sex-and-o 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,精选覆盖39个欧洲国家、时间跨度从1991年至2025年的薪资数据。数据通过调用ILOSTAT REST API直接获取,并依据ILO统一方法论,对国家层面的劳动力调查、行政记录等多源微观数据进行了标准化整合与清洗,确保定义一致。随后,数据集仅保留欧洲ISO3国家代码范围内的观测值,并保留了`source.label`字段以追踪每一条数据的原始出处,形成了包含33,235条观测值的纯净表格。
特点
数据集以雇员平均月薪(本币计价)为核心指标,针对性别和职业类别提供了精细化的分类维度。其显著特点在于丰富的元数据注释,如观测状态标志(如不可靠值)与分类注释,为用户筛选高质量数据提供了可靠依据。同时,数据集涵盖了国家、时间、性别和职业分类等多个维度,适合进行多层面、跨国的面板数据分析。数据版本控制清晰,遵循CC BY 4.0许可协议,便于合法共享与学术引用。
使用方法
该数据集被封装为HuggingFace Datasets格式,可通过`load_dataset()`函数一键加载至Python环境。用户可直接将训练集转换为Pandas DataFrame进行数据探索。典型操作包括按国家代码过滤以获得单国时间序列,或对特定指标按年份排序后进行可视化。此外,可通过数据透视表功能将原始长格式数据重塑为国家×年份的矩阵,便于进行面板数据回归或建模。数据集对科研工作者与技术开发者极为友好。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司创建,经Electric Sheep Europe于2025年重新整理并发布在HuggingFace平台上,旨在提供欧洲39个国家自1991年至2025年间按性别和职业分类的员工平均月收入数据(以当地货币计)。作为ILOSTAT核心数据库的子集,该数据集聚焦于劳动力市场中收入分配这一关键维度,为研究欧洲地区性别工资差距、职业收入分化及跨时空劳动经济学比较提供了标准化、可复现的高质量数据基础。其重要性在于填补了区域级微观收入数据整合的空白,支撑政策制定者、经济学家和社会科学家开展基于证据的劳动力市场分析,推动了可持续发展目标(SDG)中体面工作指标的量化监测。
当前挑战
该数据集面临的挑战首要来自领域问题的复杂性:收入数据受制于各国统计标准(如不同职业分类体系、调查口径差异)、货币单位波动及经济周期影响,导致跨国可比性构建困难。在构建过程中,数据整合需协调ILO从劳动力调查、行政记录等多源异构数据中提取一致指标,并处理年度频率与更细粒度(月度、季度)数据的对齐问题;同时,观测值中的缺失、不可靠标记(如provisional或unreliable状态)以及多来源冲突需依据ILO的“最佳来源”规则进行筛选,而性别(男/女/总计)和职业分类维度的不完整拆分进一步增加了时间序列建模与归因分析的难度。
常用场景
经典使用场景
在劳动经济学与社会科学交叉研究领域,该数据集为探究欧洲各国工资水平的时间演变与空间异质性提供了高分辨率的数据基础。研究者可基于其涵盖1991至2025年间39个欧洲国家的观测,构建面板数据模型,用以分析性别工资差距的长期变化趋势、职业结构对薪酬的影响,以及宏观经济周期与劳动力市场回报之间的联动关系。通过按性别与职业类型细分的月平均收入指标,能够有效支撑固定效应回归、分位数回归及时间序列分解等经典计量方法的应用。
衍生相关工作
依托该数据集,研究者已发展出若干具有影响力的衍生工作。典型的后续研究包括构建欧洲工资与性别不平等的长期面板数据库,并在此基础上应用双重差分法或合成控制法,量化国家层面同工同酬立法的实际成效。同时,该数据也催生了针对职业隔离与收入回报关系的结构方程模型分析,以及将ILOSTAT指标与宏观教育、产业政策数据相融合的多维劳动力市场评估框架。这些工作共同扩展了比较劳动政策分析的边界。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲国家按性别和职业划分的雇员平均月薪(以当地货币计),为劳动经济学中的性别薪酬差距、职业隔离及欧洲一体化劳动力市场研究提供了关键数据支撑。在ILOSTAT权威框架下,数据集涵盖1991至2025年39国的时序观测,使其成为追踪欧洲薪酬动态与政策干预效果的理想工具。当前,围绕欧盟《薪酬透明指令》及性别平等立法热点,研究者可利用此数据集剖析不同技能层级和性别间的薪资异质性,评估产业结构转型对收入分配的影响,并构建预测模型以识别薪酬不平等的时空演化规律。此外,数据与可持续发展目标(SDG 8.5)紧密关联,助力基于证据的体面劳动指标监测,推动社会科学从描述性统计向因果推断与政策模拟的前沿方向迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务