遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-ind-nb-average-hourly-earnings-of-employees-by-ilo-sector

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲7个国家(葡萄牙、法国、瑞士、英国、意大利、波黑、希腊)从2008年至2025年的6,494条观测数据,专注于“按ILO部门和性别划分的员工平均每小时收入(本地货币)”这一指标(代码为EAR_EHRA_SEX_IND_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API获取,并经过欧洲国家代码过滤。数据集以表格形式呈现,包括国家代码、国家名称、数据来源、指标、性别分类(总计、男性、女性)、ILO部门分类、观测年份、观测值、观测状态和相关注释等列。数据为年度频率,经过ILO的标准化处理,使用国际劳工统计学家会议(ICLS)定义进行协调,并标注了数据源以便追溯。该数据集适用于表格分类、表格回归和时间序列预测等任务,旨在为研究者和开发者提供机器学习就绪的欧洲劳动力市场收入数据。

This dataset contains 6,494 observational records covering the period from 2008 to 2025 across 7 European countries: Portugal, France, Switzerland, the United Kingdom, Italy, Bosnia and Herzegovina, and Greece. It focuses on the indicator "Average hourly earnings of employees by ILO sector and gender (local currency)" with the code EAR_EHRA_SEX_IND_NB. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via its REST API, and filtered using European country codes. The dataset is presented in a tabular format, with columns including country code, country name, data source, indicator, gender category (total, male, female), ILO sector classification, observation year, observed value, observation status, and relevant annotations. The data is of annual frequency, standardized by the ILO, harmonized using the definitions adopted by the International Conference of Labour Statisticians (ICLS), and annotated with data sources for traceability. This dataset is applicable to tasks such as tabular classification, tabular regression, and time series forecasting, and aims to provide machine learning-ready European labor market earnings data for researchers and developers.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-ind-nb-average-hourly-earnings-of-employees-by-ilo-sector 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT统计数据系统,通过其REST API直接抽取指标编码为EAR_EHRA_SEX_IND_NB的原始数据,并依据欧洲ISO3国家代码进行地域过滤。ILOSTAT基于国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一协调,数据来源在source.label列中清晰标注以保证可追溯性。最终由Electric Sheep Europe团队完成清洗、标准化和重封装,形成一份可直接用于机器学习流程的表格数据。
特点
该数据集包含6,494条观测记录,覆盖葡萄牙、法国、瑞士、英国、意大利、波斯尼亚和黑塞哥维那及希腊共7个欧洲国家,时间跨度从2008年至2025年。核心指标为按国际劳工组织行业与性别分组的员工平均时薪(以本币计),并提供了性别(总、男、女)的细分解读。数据以年度频率发布,采用ILO筛选的“最佳来源”以确保质量,同时附有观测状态标记(如不可靠)和货币注释,便于用户识别数据可信度与计量单位差异。
使用方法
用户可通过HuggingFace的datasets库一行代码加载数据集:load_dataset("electricsheepeurope/europe-ilo-ear-ehra-sex-ind-nb-average-hourly-earnings-of-employees-by-ilo-sector"),并转换为pandas DataFrame进行后续操作。典型用法包括按国家筛选以进行国别比较、按时间序列对单一指标进行趋势分析,以及通过数据透视表构建国家×年份的面板矩阵。数据以Parquet格式存储,支持高效的大规模读取与计算,特别适合用于回归分析、时间序列预测或面板数据建模任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门编制,经Electric Sheep Europe重新整理后发布于2025年,聚焦于欧洲7个国家2008至2025年间按ILO行业和性别分类的平均小时工资(以本币计)。作为ILOSTAT数据库的分支,该数据集核心研究问题在于揭示劳动力市场中薪酬的行业与性别差异,为劳动经济学、政策评估及社会公正研究提供可靠数据支撑。其影响力体现在为跨国比较提供了标准化指标,助力实现联合国可持续发展目标中体面劳动与经济增长的监测。
当前挑战
当前挑战主要体现在三个方面:首先,薪酬数据的跨国可比性面临障碍,不同国家调查方法、货币换算及名义工资波动需精细处理。其次,构建过程中遭遇数据碎片化难题,如多来源冲突、指标定义差异(如“ILO行业”分类的国别变异),以及缺失值管理(部分国家仅提供总体数据而未按性别细分)。此外,数据质量标签(如“不可靠”标记)的存在要求用户具备专业筛选能力,否则易导致分析偏差。
常用场景
经典使用场景
在劳动经济学与跨国比较研究中,该数据集被广泛用于分析欧洲各国不同行业与性别维度的平均小时工资差异。研究者可利用其包含的7个欧洲国家、2008至2025年的年度观测数据,构建面板数据模型,探究行业特征、性别结构及宏观经济环境对薪资水平的影响。数据集提供了按ILO行业分类和性别分解的精细粒度,使得经典的收入决定方程估计、性别收入差距分解(如Oaxaca-Blinder分解)以及行业间工资收敛性检验等研究得以开展。其时间跨度覆盖金融危机、新冠疫情等重大经济事件,为评估结构性冲击对劳动力市场报酬的动态效应提供了宝贵的实证素材。
实际应用
在实际应用中,该数据集成为欧盟及各国劳工部门、国际组织和政策智囊团监测劳动力市场健康状况的重要工具。通过追踪特定行业和性别群体的平均小时工资变化趋势,决策者能够及时发现行业工资结构失衡或性别平等进展迟缓的领域,从而制定针对性的最低工资调整方案、劳动力技能培训计划或性别平等激励政策。此外,企业人力资源部门与行业协会也可利用这些数据,进行行业薪酬基准对标,优化内部公平性薪酬体系设计。经济预测机构则将其输入宏观经济模型中,工资数据作为核心变量,用于通胀预期评估与消费动力分析,为商业决策与公共政策提供可靠参照。
衍生相关工作
围绕该数据集,衍生了多个具有影响力的研究与工具。在学术层面,其数据被整合进欧洲工资动态追踪项目中,衍生出关于行业间工资溢出效应、性别工资趋同速度的系列论文。在方法论层面,研究者基于此数据集开发了改进的加权面板估计方法与缺失数据插补技术,以适应混合来源与不完整年份的统计挑战。数据工程领域,它催生了面向ILOSTAT API的自动化数据清洗与标准化提取管线,并通过Electric Sheep Europe平台的重新打包,形成了一套可复用的、支持HuggingFace `load_dataset` 接口的欧洲劳动经济数据集家族,大幅降低了后续研究者跨数据集整合的时间成本。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务