遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-nb-average-hourly-earnings-of-employees-by-sex-local

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含474个观察值,涉及8个欧洲国家(1991年至2025年),专注于一个独特指标:按性别划分的员工平均小时收入(本地货币),指标代码为EAR_EHRA_SEX_NB。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家代码。数据集采用表格格式,包含列如国家代码(ref_area)、国家名称(ref_area.label)、来源代码(source)、来源名称(source.label)、指标代码(indicator)、指标名称(indicator.label)、性别分类(sex)、性别标签(sex.label)、年份(time)、观测值(obs_value)、观测状态(obs_status)等,支持按性别(总计、男性、女性)进行细分。数据为年度频率,并使用了ILO选择的“最佳来源”以确保质量。数据集由Electric Sheep Europe重新打包,旨在为欧洲提供统一的、机器学习就绪的数据层,便于研究人员和开发者使用load_dataset()快速加载和分析。许可证为cc-by-4.0,使用时需引用原始来源和重新打包方。

This dataset contains 474 observations across 8 European countries from 1991 to 2025, focusing on a single indicator: Average hourly earnings of employees by sex (local currency), with the indicator code EAR_EHRA_SEX_NB. The data is sourced from the International Labour Organizations (ILO) ILOSTAT database, retrieved via the REST API and filtered to European country codes. It is presented in a tabular format with columns including country code (ref_area), country name (ref_area.label), source code (source), source name (source.label), indicator code (indicator), indicator name (indicator.label), sex disaggregation (sex), sex label (sex.label), year (time), observed value (obs_value), observation status (obs_status), and more, supporting breakdowns by sex (total, male, female). The data is annual frequency and uses the ILO-selected best source for quality assurance. Repackaged by Electric Sheep Europe, it aims to provide a unified, ML-ready data layer for Europe, enabling researchers and developers to quickly load and analyze data using load_dataset(). Licensed under cc-by-4.0, users are required to cite both the original source and the repackaging entity.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-nb-average-hourly-earnings-of-employees-by-sex-local 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,通过其REST API直接提取指标代码为EAR_EHRA_SEX_NB的观测数据,并依据欧洲ISO3国家代码进行地理过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)的定义对原始调查微数据进行统一协调,数据来源涵盖劳动力调查、家庭收入调查、企业调查及行政记录,且数据集中以source.label字段标注了每条观测的数据溯源信息。最终,Electric Sheep Europe将经过筛选和标准化的474条观测数据重新封装为HuggingFace上的Machine Learning就绪格式。
特点
数据集聚焦于欧洲8个国家(瑞士、葡萄牙、英国、法国、摩尔多瓦、波斯尼亚和黑塞哥维那、意大利、希腊)从1991年至2025年间员工按性别划分的平均小时收入(以当地货币计价),共计474条年度观测。其核心特色在于提供了性别这一关键维度的数据分解,包含总计、男性和女性三类取值,使研究者能够按性别进行细致分析。此外,数据集还附带了观测状态标志及来源注释等信息,支持数据质量评估与追溯。
使用方法
用户可通过HuggingFace的datasets库便捷加载数据:使用load_dataset函数即可将数据一键导入为Pandas DataFrame格式,便于进行后续的数据处理与分析。利用数据框的筛选功能,可快速聚焦于单一国家的时间序列分析;通过数据透视表,能轻松构建以时间为行、国家为列的观测值矩阵,适用于面板数据分析或跨国的可视化对比。数据集特设的性别分列字段也支持按性别子集进行分组分析或性别工资差异的量化研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年整理并发布,后经Electric Sheep Europe团队重新封装至HuggingFace平台,聚焦欧洲8个国家1991至2025年间按性别划分的雇员平均时薪数据(以本币计)。ILOSTAT作为全球劳动统计的权威数据库,长期致力于整合各国劳动力调查、家庭收入调查及行政记录,为经济学、劳动社会学及性别平等研究提供标准化指标。该数据集的核心研究问题在于揭示欧洲劳动力市场中性别薪酬差异的时空演变规律,从而为政策制定者评估薪酬平等措施的有效性提供实证基础。其影响力体现在为时间序列预测、面板数据分析及性别经济学模型提供了高质量、可复用的结构化数据资源,尤其适用于比较研究欠发达欧洲经济体的劳动市场动态。
当前挑战
该数据集面临的挑战主要源于劳动力市场固有的复杂性。首先,各国薪酬数据采集方法差异显著,例如部分国家依赖劳动力调查,而另一些则采用企业行政记录,导致跨国际比较时需谨慎处理统计口径不一致的问题。其次,数据中存在的序列中断(如标注为“Break in series”的观测值)反映了若干国家在调查方法、行业分类或货币单位方面的调整,这给长期趋势分析带来了分段建模的困难。再次,由于数据集仅包含年度频率,无法捕捉月度或季度薪酬波动,限制了对于短期经济冲击与政策响应的精细评估。此外,数据稀疏性也是一个突出问题,例如希腊仅有18个观测值且时间跨度较短,可能导致针对特定国家的推断面临偏差风险。最后,ILO虽已筛选每个国家年份组合的“最佳来源”,但来源变更引入的结构性断裂仍需研究者通过变点检测或混合效应模型加以修正。
常用场景
经典使用场景
在欧洲劳动经济学与性别平等研究中,该数据集为分析雇员平均小时工资的性别差异提供了可靠的量化基础。研究人员常将其用于构建面板数据模型,通过整合时间序列与跨国截面信息,揭示工资报酬在不同性别群体间的演化轨迹与收敛态势。典型应用包括计算性别工资差距的基尼系数、构建收入分配不平等指数,以及利用固定效应回归模型控制国家异质性后检验性别对小时工资的净效应。数据中涵盖的1991至2025年、覆盖8个欧洲国家的观测值为长周期跨国比较研究提供了稀缺的连续样本,尤其适合进行断点回归或时间序列因果推断。
实际应用
在政策制定与商业决策领域,该数据集被用作欧盟就业战略中性别平等目标的监测工具。各国劳工部门可据此绘制本国内部及与邻国间的工资性别差异图谱,从而精准设计地区性的薪酬透明度法规与同工同酬激励计划。企业人力资源团队利用这些公开基准数据,校准自身薪酬体系的内部公平性,借以规避因性别歧视引发的合规风险。此外,国际发展机构如ILO在年度全球工资报告中,以此作为测算欧洲区域可持续目标8(体面工作与经济增长)进展的输入指标,确保多边谈判中的政策建议有据可依。
衍生相关工作
该数据集在深度学习与计量经济学领域衍生了多项标志性工作。基于其时间序列特性,研究者开发了适用于稀疏面板数据的Transformer架构进行多步工资预测,实现了跨国性别时薪的贝叶斯概率预报。另有团队利用该数据集微调了具有领域知识的概率图模型,用以识别工资分布中因性别导致的隐式因果结构。在传统回归之外,该数据催生了专门面向劳动统计的轻量级时序分类基准任务,鼓励将联邦学习框架引入跨国隐私保护下的工资对比分析。这些工作不仅拓展了ILOSTAT数据的学术复用边界,也推动了更抗数据缺失的统计推断方法演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务