遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-eco-nb-median-hourly-earnings-of-employees-by-sex-and-eco

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲8个国家(瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、意大利、希腊)从1991年至2025年的15,897条观测数据,专注于“按性别和经济活动划分的员工小时收入中位数(本地货币)”这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过统一处理,涵盖就业、工资等劳动统计领域。数据集以表格形式呈现,包括国家代码、年份、性别分类、经济活动分类、观测值等列,适用于表格分类、回归和时间序列预测等任务。数据为单语(英语),规模在10K到100K之间,采用CC-BY-4.0许可证发布。

This dataset contains 15,897 observations of median hourly earnings of employees by sex and economic activity (in local currency) across 8 European countries (Switzerland, Portugal, France, United Kingdom, Moldova, Bosnia and Herzegovina, Italy, Greece) spanning from 1991 to 2025. Sourced from the ILOSTAT database of the International Labour Organization (ILO), it provides harmonized labor statistics on earnings, with data structured in tabular format including columns for country codes, years, sex disaggregation, economic activity classification, and observed values. It is designed for tabular classification, regression, and time-series forecasting tasks, is monolingual (English), falls under the size category of 10K to 100K, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-eco-nb-median-hourly-earnings-of-employees-by-sex-and-eco 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动统计的核心权威来源。数据通过ILOSTAT REST API直接获取,并筛选出欧洲八个国家的ISO3代码。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对原始调查微观数据进行统一协调,数据来源在'source.label'列中标注以便追溯。数据集共包含15,897条观测记录,覆盖瑞士、葡萄牙、法国等八个欧洲国家,时间跨度从1991年至2025年。数据以年度频率呈现,当同一国家-年份组合存在多个来源时,采用ILO选定的'最佳来源'。数据集由Electric Sheep Europe重新打包,以Parquet格式发布,便于机器学习应用。
特点
该数据集聚焦于'按性别和经济活动划分的雇员中位数小时收入(本地货币)'这一核心指标,代码为EAR_EHRM_SEX_ECO_NB。其突出特点在于丰富的维度分解:提供'性别'(总、男、女)三个唯一值和按经济活动分类的变量'classif1'。数据结构包含20个字段,包括国家代码、来源、指标、性别、分类、年份、观测值及状态标志等,每个字段均有类型说明和英文标签。数据质量标记明确,如观测状态标志位表示数据是初步值(P)还是不可靠值(U)。此外,注释列详细记录了货币单位、数据来源存储库等附加信息,增强了数据的透明度和可追溯性。
使用方法
使用者可通过Hugging Face的datasets库便捷加载该数据集,例如使用from datasets import load_dataset后调用load_dataset函数,即可获得可直接转换为pandas DataFrame的'训练'集。针对特定国家的分析,可利用'ref_area'列进行过滤,如筛选德国数据。时间序列分析可通过对'indicator'列过滤并按'time'排序实现,进而可视化展示趋势。此外,利用pivot_table方法可将数据重塑为国家-年份矩阵,便于进行跨国家、跨时间的对比研究。该数据集特别适用于劳动经济学中的收入不平等分析、性别工资差距研究以及欧洲劳动力市场的时空动态建模。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,并由Electric Sheep Europe重新包装为机器学习就绪格式,聚焦于欧洲8个国家1991至2025年间按性别和经济活动划分的雇员中位数小时收入。数据源自ILOSTAT这一全球领先的劳动力统计数据库,其核心研究问题在于揭示欧洲劳动力市场中收入分配的结构性特征与性别差异。通过对15897条观测值的系统化整理,该数据集为劳动经济学、性别不平等研究及跨国收入比较提供了高频率、标准化的重要基础资源,尤其在推动ILO体面劳动目标(SDG)的量化评估方面具有显著影响力。
当前挑战
该数据集面临的核心挑战之一在于劳动力统计数据的跨国可比性难题:各国调查方法、货币单位及行业分类标准(如ICLS定义)的差异导致原始数据整合困难,需依赖ILO协调的‘最佳来源’选择机制以削弱异质性偏差。此外,构建过程中需处理年度频率与潜在月度/季度数据间的粒度冲突,以及性别和行业分类维度的稀疏性问题——当特定指标未发布细分值时,相关列将出现缺失值,增加了时间序列建模的复杂性。数据质量标记(如‘不可靠’状态)的准确解读与处理亦构成分析中的隐性障碍。
常用场景
经典使用场景
在欧洲劳动经济学与性别平等研究领域,该数据集凭借其对八个国家长达三十余年(1991–2025)的工资追踪,成为分析性别收入差距与经济部门薪酬分化的核心资源。研究者可借助该数据集中按性别与经济活动分类的时薪中位数指标,构建面板数据回归模型,评估产业结构调整、最低工资政策或劳动力市场制度对收入分配的影响。其精确的观测值结构和ILOSTAT统一口径的统计方法,更使得跨国比较研究得以在消除定义差异的基础上展开,为理解欧洲劳动力市场的动态演化提供了坚实的数据基石。
衍生相关工作
围绕该数据集,一系列衍生研究工作已相继涌现。典型应用包括基于ILOSTAT工资数据构建的欧洲性别收入差距长期趋势分析,以及结合国家经济普查数据开展的行业薪资决定因素计量研究。部分工作将其作为输入特征,训练时间序列预测模型以估计未来五年内不同性别组群的薪资增长率;另一些研究则通过融合失业率、GDP增速等宏观指标,构建面板向量自回归模型,剖析经济周期对性别薪酬差异的非对称冲击。这些衍生产品共同丰富了劳动经济学实证工具箱,也反过来验证了该数据集在跨国、跨时段分析中的可靠性、灵活性与不可替代性。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲八国1991至2025年间按性别与经济活动划分的雇员时薪中位数,为劳动经济学中的性别薪酬差距与行业收入结构研究提供了宝贵的时序面板数据。当前前沿方向集中于利用该数据构建多国比较的薪酬不平等度量模型,并借助时间序列分析方法揭示金融危机、疫情冲击等重大事件对性别工资差异的动态影响。同时,结合ILOSTAT的标准化指标,研究者能够深入探讨欧洲劳动力市场中女性就业质量、行业隔离与薪酬弹性的关联,为政策制定者优化同工同酬法规及包容性增长战略提供实证依据。该数据集的发布推动了跨国劳动统计的可比性和机器学习就绪性,成为评估可持续发展目标中体面工作进展的关键资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务