遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-geo-nb-median-hourly-earnings-of-employees-by-sex-and-rur

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自5个欧洲国家(法国、摩尔多瓦、瑞士、波黑、希腊)的720个观测值,时间跨度为2000年至2025年,涵盖一个独特指标:按性别和城乡地区划分的员工小时收入中位数(本地货币)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动统计的主要来源,通过调查和行政记录收集,并使用国际劳工统计学家会议(ICLS)定义进行标准化。数据集包括国家代码、国家名称、数据来源、指标代码、指标名称、性别分类、分类变量、观测年份、观测值、观测状态和相关注释等列。数据以年频率提供,并包含数据质量说明,如使用最佳来源和分类列的非空条件。数据集适用于表格分类、回归和时间序列预测等任务,并遵循CC-BY-4.0许可证。

This dataset contains 720 observations of Earnings data across 5 Europe countries (France, Moldova, Switzerland, Bosnia and Herzegovina, Greece), spanning 2000–2025, covering 1 distinct indicator: Median hourly earnings of employees by sex and rural / urban areas (local currency). The data is sourced from ILOSTAT, the ILOs central statistics database, which harmonizes raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions. It includes columns such as country code, country name, source, indicator code, indicator name, sex disaggregation, classification variables, observation year, observed value, observation status, and notes. The data is provided at annual frequency, with quality caveats like the use of the best source and non-null disaggregation columns. It is suitable for tabular classification, regression, and time-series forecasting tasks, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-geo-nb-median-hourly-earnings-of-employees-by-sex-and-rur 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过其REST API接口直接抽取,并基于国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理。数据范围限定于欧洲地区的五个国家,涵盖2000年至2025年间的年度观测,共计720条记录。每个观测值均包含来源标识、指标代码、性别和地域划分等元数据,确保数据可追溯且符合国际统计标准。
特点
该数据集的核心特点在于其精细的维度划分和权威的数据来源。它提供了按性别(男性、女性、总计)及城乡地域(国家层面)分类的小时收入中位数指标,反映了不同群体在劳动力市场中的经济地位。数据来源包括劳动调查、住户收入调查等官方渠道,并由ILO负责统一协调,保证了跨国家、跨时间段的可比性和可靠性。此外,数据集还包含观测状态标志和注释信息,便于用户评估数据质量。
使用方法
使用者可通过HuggingFace的`datasets`库轻松加载数据集,例如`load_dataset("electricsheepeurope/europe-ilo-ear-ehrm-sex-geo-nb-median-hourly-earnings-of-employees-by-sex-and-rur")`,并将其转换为Pandas DataFrame进行后续分析。常见的操作包括按国家筛选数据、针对特定指标绘制时间序列图,或通过数据透视表构建国家与年份的矩阵。数据集设计为机器学习模型可直接使用的格式,支持分类、回归及时序预测等任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Europe重新整理后托管于HuggingFace平台,聚焦于欧洲5个国家(法国、摩尔多瓦、瑞士、波黑、希腊)2000至2025年间按性别和城乡区域划分的雇员时薪中位数。作为ILOSTAT数据库的子集,它旨在揭示欧洲内部劳动力市场报酬的结构性差异,尤其关注性别工资差距与城乡收入不平等的交织影响。数据来源于各国劳动力调查和行政记录,经ILO统一协调,为劳动经济学、区域发展及社会政策研究提供了810条高质量观测值,推动了跨国比较分析在微观层面的精细化发展。
当前挑战
该数据集面临的核心挑战在于解决性别与地理维度交织下的工资不平等量化问题——现有数据虽区分了男性和女性以及城乡分类,却难以捕捉更细粒度如行业、教育水平或工作类型的交叉影响,限制了对于收入差距深层驱动因素的剖析。构建过程中,数据源于多来源调查,各国统计口径与时序连续性各异,例如希腊仅有2015至2020年数据,且部分观测值因来源变更存在序列断裂(Break in series),影响了纵向趋势分析的稳健性。此外,本地货币计值阻碍了跨国间购买力平价的直接比较,增加了跨区域模型的校准难度。
常用场景
经典使用场景
该数据集涵盖了2000年至2025年间五个欧洲国家雇员按性别和城乡区域划分的时薪中位数信息,共720条观测值。其经典使用场景聚焦于劳动经济学的跨地域与跨性别薪酬差异分析,研究者可借此考察城乡二元结构下性别收入鸿沟的演变轨迹,以及不同国家劳动力市场制度对薪酬公平性的塑造作用。同时,数据集以年度为时间粒度,适合构建面板数据模型,用于追踪经济周期、政策干预或社会变迁对小时工资分布的影响。作为国际劳工组织标准化统计的产物,它为验证和校准微观调查数据中的薪酬估算提供了权威参考基准。
实际应用
在实际政策制定层面,该数据集为政府劳工部门及国际组织提供了动态监测工具。通过绘制不同性别与地区的小时工资中位数时序图,政策制定者能够迅速定位薪酬不平等的高发区域,并据此调整区域发展基金分配或女性就业扶持计划。企业人力资源机构亦可借助此类数据对比自身薪酬结构,确保符合欧盟性别平等指令所要求的同工同酬合规审查。此外,在非政府组织倡导社会公正的报告中,该数据能作为量化城乡性别收入鸿沟的核心证据,推动公众认知向包容性增长倾斜。
衍生相关工作
该数据集衍生了一系列重要的学术与工具性工作。在计量方法层面,它促进了基于性别和地域分解的收入不平等分解方法(如Oaxaca-Blinder分解、分位数回归)在跨国面板数据中的精细化应用。模型构建方面,有学者将其与ILOSTAT其他指标(如失业率、非正规就业比例)联立,开发了预测欧洲区域劳动力市场韧性的时空混合效应模型。数据集本身也催生了若干开源可视化仪表盘项目,例如Electric Sheep Europe的交互式地图,使非专业用户也能直观探索工资随年份、性别和城乡类型的动态变化,进一步降低了社会经济学数据的准入门槛。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务