遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-geo-cur-nb-median-hourly-earnings-of-employees-by-sex-rural-u

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲5个国家(法国、摩尔多瓦、瑞士、波斯尼亚和黑塞哥维那、希腊)从2000年至2025年的2,124个观测值,重点关注按性别、城乡地区和货币划分的员工中位小时收入这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过欧洲国家代码过滤。数据集提供结构化表格数据,涵盖国家代码、性别、地理分类、货币类型、年份和观测值等字段,适用于表格分类、回归和时间序列预测等任务。数据质量方面,为年度频率,使用ILO选择的最佳来源,且分类列仅在指标发布细分数据时非空。

This dataset contains 2,124 observations across 5 European countries (France, Moldova, Switzerland, Bosnia and Herzegovina, Greece) from 2000 to 2025, focusing on the indicator Median hourly earnings of employees by sex, rural / urban areas and currency. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered by European country codes. It provides structured tabular data with fields such as country code, sex, geographic classification, currency type, year, and observed value, suitable for tasks like tabular classification, regression, and time-series forecasting. Data quality notes include annual frequency, use of ILO-selected best source, and disaggregation columns being non-null only when the indicator publishes breakdowns.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-geo-cur-nb-median-hourly-earnings-of-employees-by-sex-rural-u 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT权威统计数据库,通过REST API接口直接抽取特定指标(EAR_EHRM_SEX_GEO_CUR_NB)的原始数据,并依据欧洲ISO3国家代码进行地理范围过滤。数据来源涵盖劳动力调查、家庭收入调查、企业调查及行政记录等多种渠道,由ILO统计局依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理,确保跨国数据的可比性与一致性。
特点
数据集涵盖2000年至2025年间5个欧洲国家的2124条观测记录,聚焦于雇员按性别、城乡地域及货币分类的时薪中位数这一核心指标。数据以年度频率呈现,包含性别(总、男、女)的细分解构,并标注了来源类型、观测状态及序列中断等质量标记,便于用户评估数据可信度与进行分维度分析。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载,并利用to_pandas方法转换为DataFrame进行后续操作。支持按国家筛选特定子集、按指标排序进行时间序列可视化,以及通过数据透视表构建国家×年份的观测矩阵,便于开展跨国比较分析或构建机器学习模型的特征输入。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2025年创建,经Electric Sheep Europe团队重新封装后发布,聚焦欧洲5个国家(法国、摩尔多瓦、瑞士、波黑、希腊)在2000至2025年间按性别及城乡划分的雇员每小时工资中位数。作为全球劳动统计领域的权威来源,ILOSTAT通过整合各国劳动力调查、家庭收入调查及行政记录,提供了标准化、跨国的工资数据,为解决劳动力市场不平等、城乡收入差距及性别薪酬差异等核心研究问题奠定了数据基础。该数据集在劳动经济学、社会政策及可持续发展目标(SDG)监测中具有重要影响力,尤其为欧洲地区的比较研究和时间序列分析提供了精细化的微观依据。
当前挑战
该数据集所解决的领域问题主要包括:一是劳动经济学中性别与地域工资差异的量化分析,传统上受限于各国统计口径不一与数据碎片化,难以进行跨国比较;二是城乡二元结构下收入不平等的动态监测,缺乏高频、标准化的面板数据支撑。在构建过程中,面临的挑战包括:原始数据来源于多国不同的调查体系(如劳动力调查、企业调查),需经由国际劳工统计学家会议(ICLS)定义进行复杂的协调与插补;部分国家的时间序列存在断点(如希腊仅覆盖2015至2020年),且观测状态标注了中断、临时等标记,需谨慎处理;数据质量的标注(如“最佳来源”选择)与分类维度的非一致性使得自动化清洗和跨域融合难度显著增加。
常用场景
经典使用场景
该数据集汇集了欧洲五国2000年至2025年间按性别与城乡划分的雇员每小时工资中位数数据,共计2124条观测记录,是劳动经济学领域中研究工资差异、性别薪酬不平等以及城乡收入鸿沟的经典资源。研究者可借助这一结构化表格数据,开展分类与回归任务,构建预测模型以解析不同人口群体间的薪酬动态。亦可将数据序列化为时间轴,用于时间序列预测,揭示工资水平随年度变迁的长期趋势与波动规律。其精细的维度设计——涵盖性别、城乡、币种等标签——使得区域间的横向对比与纵向时序分析成为可能,为欧洲劳动力市场的比较研究奠定了坚实的数据基础。
解决学术问题
该数据集为薪酬不平等与劳动市场结构性问题提供了可量化的实证支撑,尤为关键的是,它填补了欧洲特定国家(如波黑、摩尔多瓦等中欧及东欧国家)在公开薪资统计中按城乡与性别双重维度细分的空白。在学术研究中,它被广泛用于检验人力资本理论、双重劳动市场理论以及城乡迁移对工资影响的假设。通过观测不同性别的薪酬中位数差异,研究者得以评估各国劳动政策(如同工同酬立法)的实际成效;而城乡维度的引入,则有助于揭示经济地理因素如何与性别角色交织,塑造出复杂的薪酬决定机制,进而推动对欧盟区域发展不均与社会公正议题的深度探讨。
衍生相关工作
基于该数据集,学术界已衍生出一系列深化研究,例如以固定效应模型分析欧洲国家性别薪酬差距的收敛速度,探讨教育扩张与产业升级如何缓和城乡间的收入分化。亦有研究者将其与ILOSTAT数据库中的其它劳动统计指标(如失业率、非正规就业比例)进行联合分析,构建多变量回归模型,揭示工资水平背后的结构性动因。在机器学习领域,该数据集被用作特征工程实验的基底,尝试通过集成学习方法预测特定维度下的薪酬演变趋势。此外,该数据集作为“Electric Sheep Europe”项目的一部分,推动了标准化、即用型统计数据集在HuggingFace平台上的共建生态,为后续更广泛的欧洲社会经济数据集发布与复用树立了范本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务