遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-ind-cur-nb-average-hourly-earnings-of-employees-by-ilo-sector

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲7个国家(葡萄牙、法国、瑞士、英国、意大利、波黑、希腊)从2008年到2025年的员工平均小时收入数据,共19,272个观测值。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,由Electric Sheep Europe重新打包为机器学习就绪格式。核心指标为按ILO部门、性别和货币分类的员工平均小时收入(EAR_EHRA_SEX_IND_CUR_NB),数据以表格形式组织,包括国家代码、来源、指标、性别、分类变量、观测年份、观测值等列。数据集适用于表格分类、回归和时间序列预测任务,并提供了数据质量说明(如年度频率、最佳来源选择)和使用代码示例。

This dataset contains 19,272 observations of average hourly earnings of employees across 7 European countries (Portugal, France, Switzerland, United Kingdom, Italy, Bosnia and Herzegovina, Greece) from 2008 to 2025. The data is sourced from the International Labour Organization (ILO) ILOSTAT database and repackaged by Electric Sheep Europe for machine learning readiness. The core indicator is Average hourly earnings of employees by ILO sector, sex and currency (EAR_EHRA_SEX_IND_CUR_NB), organized in tabular format with columns such as country code, source, indicator, sex, classification variables, observation year, and observed value. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, and includes data quality notes (e.g., annual frequency, best source selection) and usage code examples.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-ind-cur-nb-average-hourly-earnings-of-employees-by-ilo-sector 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接提取了标识符为EAR_EHRA_SEX_IND_CUR_NB的指标数据,并依据欧洲ISO3国家代码进行了地理范围筛选。数据经过ILO统计部门基于国际劳工统计学家会议(ICLS)定义的标准进行统一整合与处理,涵盖了来自劳动力调查、行政记录等多源微观数据,确保了跨国家与时间序列的可比性。最终由Electric Sheep Europe团队进行重新封装与标准化处理,形成了结构一致的表格数据。
特点
该数据集收录了覆盖7个欧洲国家、时间跨度从2008年至2025年的19,272条观测记录,聚焦于按ILO行业分类、性别及货币细分的雇员平均时薪单一指标。数据提供了丰富的维度划分,包括性别(总、男、女)、行业分类及货币类型,并附有详细的数据来源标签,便于追溯每条记录的真实采集背景。值得注意的是,数据标注了观测状态(如临时、不可靠)及附加注释,为用户评估数据质量与使用限制提供了充分依据。
使用方法
用户可通过HuggingFace的datasets库直接加载该数据集,调用load_dataset函数即可将数据转化为Pandas DataFrame进行分析。例如,可通过ref_area列筛选特定国家数据,利用indicator列定位目标指标进行时间序列分析与可视化,或通过pivot_table函数构建国家×年份的矩阵以支持跨时期多国比较。数据集以Parquet格式存储,兼顾了高效的读取速度与机器学习场景的友好性,降低了劳动经济学研究者的预处理门槛。
背景与挑战
背景概述
在劳动经济学与政策分析领域,精准的工资数据是衡量劳动力市场状况、评估社会公平性及制定经济政策的核心基石。国际劳工组织(ILO)作为全球劳动统计的权威机构,其ILOSTAT数据库汇集了来自200多个经济体的海量劳动指标。为此,Electric Sheep Europe于2025年对ILOSTAT中的欧洲工时工资数据进行了重新整合,构建了本数据集,涵盖2008至2025年间7个欧洲国家的19,272条观测记录。该数据集聚焦于按ILO产业部门、性别及货币分类的雇员平均时薪,旨在为跨国家、跨时期的劳动报酬比较提供标准化、机器可读的高质量数据源,有力支撑了关于工资差距、性别平等及产业经济结构的实证研究。
当前挑战
本数据集所应对的核心领域挑战在于,不同国家间因调查方法、统计定义及货币单位的差异,导致跨国工资数据难以直接比较,且传统行政数据通常缺乏细粒度分类,难以满足性别与产业维度的精细分析需求。在构建过程中,研究者需克服多重困难:首先,需从ILOSTAT的REST API中动态提取原始数据,并依据欧洲ISO3国家代码进行精准过滤,涉及高频数据更新的兼容性处理;其次,原始数据中指示标签存在多语种及编码差异,需统一转换为英文标准标签;此外,不同国家数据源的质量参差不齐,需借助ILO认可的“最佳来源”进行筛选,并保留观测状态标记以警示数据异常,最终实现了19,272条记录的清洗与结构化封装。
常用场景
经典使用场景
在劳动经济学与时序分析领域,该数据集凭借其涵盖2008至2025年间7个欧洲国家、近两万条观测记录的丰富体量,成为研究欧洲劳动力市场薪酬动态的经典资源。研究者常将其作为构建面板数据模型的基础,通过细粒度维度(如性别、行业、币种)剖析小时工资的演变趋势。利用时间序列预测任务,学者可基于ILO标准化指标,对特定国家或行业的薪酬走势进行建模,从而揭示经济周期、政策调整与劳动力成本之间的内在关联。
实际应用
在实际应用中,该数据集为国际组织、政府部门及企业提供了可操作的经济洞察。欧盟统计局或各国劳动部门可利用其追踪行业薪酬水平,辅助制定最低工资标准或就业促进政策。跨国企业HR部门通过比对不同国家的平均小时工资,优化薪酬策略与劳动力布局。金融与投资机构则将其纳入宏观经济预测模型,藉由薪酬指标判断消费动能与通胀压力,从而调整资产配置策略。
衍生相关工作
围绕该数据集衍生了多个具有影响力的研究方向与工具。例如,部分学者基于其面板数据结构提出了性别薪酬差异的时间序列分解方法,催生了关于欧洲劳动力市场公平性的计量经济学拓展。在机器学习领域,研究人员利用该指标作为特征之一,构建了预测国家层面失业率与GDP增长的多变量模型。此外,该数据集与ILOSTAT其他指标(如就业率、工作时长)的联合分析,支撑了劳动力市场弹性与全球化冲击效应的经典实证研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务