遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-ocu-cur-nb-median-monthly-earnings-of-employees-by-sex-occupa

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲33个国家从1991年至2025年的员工月收入中位数数据,总计91,546个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主要指标为按性别、职业和货币分类的员工月收入中位数(EAR_EMTM_SEX_OCU_CUR_NB)。数据集通过ILOSTAT的REST API获取,并过滤为欧洲国家代码,数据经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)定义进行协调。数据模式包括国家代码、国家名称、来源代码、指标代码、性别分类(总计、男性、女性)、时间(年份)、观测值等列,提供详细的数据分解维度。数据为年度频率,当同一国家×年份有多个来源时,使用ILO选择的“最佳来源”。数据集由Electric Sheep Europe重新打包,以Parquet格式发布,便于机器学习研究和开发使用。

This dataset contains median monthly earnings data for employees across 33 European countries from 1991 to 2025, with a total of 91,546 observations. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, focusing on the indicator Median monthly earnings of employees by sex, occupation and currency (EAR_EMTM_SEX_OCU_CUR_NB). The data is pulled directly from the ILOSTAT REST API and filtered to Europe ISO3 country codes, harmonized using International Conference of Labour Statisticians (ICLS) definitions. The schema includes columns such as country code, country name, source code, indicator code, sex disaggregation (total, male, female), time (year), observed value, and more, providing detailed breakdown dimensions. The data is annual in frequency, and when multiple sources exist for the same country×year, the ILO-selected best source is used. The dataset is repackaged by Electric Sheep Europe in Parquet format for machine learning-ready use.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-ocu-cur-nb-median-monthly-earnings-of-employees-by-sex-occupa 数据集图片
构建方式
在欧洲劳工统计的宏大版图中,薪资数据一直是衡量劳动力市场健康状况的核心指标之一。该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,后者通过整合各国劳动力调查、家庭收入调查、企业调查及行政记录,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理,构建了全球最具权威性的劳工统计体系。具体构建过程中,数据通过ILOSTAT REST API直接拉取,经筛选后仅保留欧洲33个国家的观测记录,最终形成包含91,546条观测、覆盖1991年至2025年时间跨度的结构化数据集。每条记录都经由ILO的'最优来源'策略进行甄选,并在source.label字段中标注数据溯源信息,确保了数据的一致性与可追溯性。
特点
该数据集的核心单元是'雇员按性别与职业划分的月收入中位数',以本地货币计价,呈现为一个紧凑但信息密度极高的表格。其突出特点在于多维度的分类结构:除时间与地域维度外,数据通过sex字段提供总、男性、女性三种性别分组,并借助classif1与classif2字段承载职业技能等级与货币类型等复杂分类信息。这种精细的分层设计使得研究者能够同时从性别公平、职业结构差异以及汇率变动的视角剖析欧洲各国的薪资动态。此外,数据质量标注字段obs_status及其标签为每个观测值提供了可靠性评估,而详细的备注字段(note_indicator、note_source等)则进一步揭示了数据背后的推导规则与来源信息,为严谨的学术分析提供了关键的质量控制层。
使用方法
借助HuggingFace Datasets库,该数据集的使用过程被极大地简化。研究者只需执行几行Python代码,即可将数据加载至本地环境并转换为Pandas DataFrame进行探索性分析。具体而言,用户可以通过load_dataset()函数直接获取完整数据集,随后利用ref_area字段进行单国别筛选,例如聚焦德国(DEU)的薪资演变。对于时间序列分析,推荐按indicator字段筛选核心指标后以time字段排序并绘制折线图,直观呈现欧洲各国中位数薪资的长期趋势。若需进行跨国横向比较,则可利用pivot_table方法将数据重塑为国家×年份的矩阵形式,便于后续的聚类分析或面板数据回归。这种高度兼容科学计算生态的设计,使得从数据获取到高级分析的整个工作流变得流畅而高效。
背景与挑战
背景概述
国际劳工组织(ILO)旗下ILOSTAT统计数据库是全球劳动统计领域的权威源头,其发布的“欧洲雇员月收入中位数(按性别、职业与货币分列)”数据集由Electric Sheep Europe于2025年重新封装,涵盖1991年至2025年间33个欧洲国家的91,546条观测记录。该数据集围绕劳动力市场收入分配这一核心研究问题,聚焦于通过性别和职业维度揭示薪酬差异的时空演变规律。作为ILO推动体面劳动与可持续发展目标(SDG)监测的关键工具,该数据集为经济学、劳动社会学及公共政策领域提供了高质量、可比较的微观基础,其开放获取的CC-BY-4.0许可协议进一步促进了跨国面板分析与机器学习建模的广泛应用,对研究欧洲劳动市场结构性不平等具有深远影响。
当前挑战
该数据集所面临的领域挑战主要集中于劳动经济学中收入不平等的精细刻画:如何克服原始调查微观数据在各国统计口径、调查方法与货币单位上的非标准化,将异构的原始收入信息转化为跨时空可比的集中趋势测量(如中位数)。在构建过程中,数据整合面临多重技术挑战,包括从ILOSTAT REST API抽取时处理不同来源(如劳动力调查、家庭收入调查)的数据质量标记(如“不可靠”状态),对高维分类变量(性别、技能等级、货币类型)进行分层聚合时需确保无偏估计,以及协调33国不同年份的汇率变动与购买力差异,以维持时序序列的内在一致性。此外,部分国家早期年份数据稀疏或存在多个矛盾来源,要求精细的“最佳来源”选择策略,这些步骤均对数据管道的稳健性提出了严峻考验。
常用场景
经典使用场景
在劳动经济学与薪酬不平等研究领域,europe-ilo-ear-emtm-sex-ocu-cur-nb-median-monthly-earnings-of-employees-by-sex-occupa数据集凭借其覆盖33个欧洲国家、横跨1991年至2025年的长达三十余年的面板数据,成为探究欧洲劳动力市场中工资动态演变的基石性资源。研究者常借助该数据集中按性别和职业分类的月收入中位数指标,构建跨国面板回归模型,系统评估欧盟一体化进程、最低工资政策调整以及产业结构变迁对不同群体薪酬水平的影响。其精细化的分类维度——涵盖性别、职业技能等级和货币单位——使得学者能够剥离多重混淆因素,精准识别工资差距的时变特征与国别异质性。
解决学术问题
该数据集的核心学术价值在于解决了欧洲薪酬比较研究中长期存在的两大顽疾:数据来源碎片化与统计口径不统一。通过国际劳工组织ILOSTAT的标准化框架,数据集将各国基于不同调查方法和时间跨度的原始薪酬数据加以同质化处理,使得跨国的性别薪酬差距分解、职业隔离的经济后果评估以及技能溢价的时间趋势分析成为可行。这一整合彻底改变了以往依赖零散国家统计报告进行推断的研究范式,使学者得以借助统一的计量框架回答诸如‘欧洲性别工资差距收敛速度是否因经济周期而波动’或‘高技能职业的薪酬溢价是否在各国呈现同步上升趋势’等深层次问题,从而为欧盟层面制定包容性增长政策提供了坚实的经验证据。
衍生相关工作
围绕此数据集的经典衍生工作主要集中在两个方面。其一,剥离性别和职业分类后,利用该数据集的观察值作为训练标签,研究人员开发了基于梯度提升机或神经网络的工资预测模型,用于预测缺失年份或未覆盖国家的薪酬水平,此类模型通常结合了国家宏观经济指标与职业技能分类特征。其二,在时间序列分析方向,衍生出大量关于欧洲工资传导机制的研究,例如运用向量自回归模型探讨各国公共部门与私营部门工资中位数的长期协整关系,或者借助动态面板数据模型估计欧盟东扩后新成员国与老成员国之间薪酬的追赶效应。这些工作不仅深化了对欧洲劳动力市场一体化程度的理解,也推动了统计学习方法在劳动经济学中的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务