遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-ocu-cur-nb-median-hourly-earnings-of-employees-by-sex-occupat

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲国家员工中位小时收入数据,按性别、职业和货币进行细分。数据涵盖8个欧洲国家(包括瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、意大利和希腊),时间跨度为1991年至2025年,共21,589个观测值。核心指标为EAR_EHRM_SEX_OCU_CUR_NB(中位小时收入),数据通过ILOSTAT REST API获取,并经过标准化处理以符合国际劳工统计学家会议(ICLS)定义。数据集包含多个字段,如国家代码、数据来源、性别分类、职业分类、货币类型、观测年份、观测值及状态等,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,并经过ILO选择的最佳来源处理,确保数据质量。

This dataset contains median hourly earnings data for employees in European countries, disaggregated by sex, occupation, and currency, sourced from the International Labour Organizations (ILO) ILOSTAT database. It covers 8 European countries (including Switzerland, Portugal, France, the United Kingdom, Moldova, Bosnia and Herzegovina, Italy, and Greece), spanning the years 1991 to 2025, with 21,589 observations. The core indicator is EAR_EHRM_SEX_OCU_CUR_NB (median hourly earnings), retrieved via the ILOSTAT REST API and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes fields such as country codes, data sources, sex disaggregation, occupation classification, currency type, observation year, observed values, and status flags, making it suitable for tasks like tabular classification, regression, and time-series forecasting. Data is published at an annual frequency and uses ILO-selected best sources for reliability.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-ocu-cur-nb-median-hourly-earnings-of-employees-by-sex-occupat 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过调用其REST API接口(https://rplumber.ilo.org/data/indicator?id=EAR_EHRM_SEX_OCU_CUR_NB)直接获取原始数据,并依据欧洲ISO3国家代码进行地理范围筛选。ILOSTAT本身汇集了来自劳动力调查、家庭收入调查、企业调查及行政记录等多源微观数据,并依据国际劳工统计学家会议(ICLS)的定义进行标准化处理。Electric Sheep Europe团队在完成数据拉取后,进一步对数据结构进行规范化整理,最终以Parquet格式封装,从而构建出一个高度结构化、机器学习就绪的数据集,确保研究者和开发者能够便捷地直接使用。
特点
该数据集涵盖1991年至2025年间欧洲8个国家的21,589条观测记录,聚焦于“按性别、职业和货币划分的员工每小时收入中位数”这一核心经济指标。其突出特点在于多维度的分类颗粒度:数据按性别(总、男、女)、职业技能水平以及货币类型(本地货币)进行精细拆分,提供了丰富的截面分析视角。所有观测值均附有明确的来源标签和观测状态标志(如“不可靠”),便于用户进行数据质量评估。此外,数据以年度为时间频率,时间跨度长达35年,为长期趋势研究和时序分析奠定了坚实基础。
使用方法
使用者可通过HuggingFace Datasets库的load_dataset()函数一行代码加载该数据集,并便捷地转换为Pandas DataFrame进行后续操作。具体应用场景多样:例如,可按国家代码(ref_area)快速筛选特定国家的时间序列数据;可针对单一指标(如EAR_EHRM_SEX_OCU_CUR_NB)按年份排序后直接绘制趋势图;亦可利用pivot_table方法将数据重塑为国家×年份的矩阵形式,便于进行面板数据分析或横向对比。由于数据格式统一且包含完整的分类变量,该数据集极适合于构建回归预测模型、时间序列预测任务,或作为教育、经济不平等研究的基础数据源。
背景与挑战
背景概述
在劳动经济学与社会科学研究领域,薪资数据的精细化分析对于理解劳动力市场结构、性别平等状况及职业分布差异具有举足轻重的意义。该数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT整理发布,并由Electric Sheep Europe重新封装于HuggingFace平台。数据集聚焦于欧洲八国(瑞士、葡萄牙、法国、英国、摩尔多瓦、波斯尼亚和黑塞哥维那、意大利、希腊)1991年至2025年间按性别和职业划分的雇员时薪中位数,共计21,589个观测值。其核心研究问题在于揭示不同性别与职业类别下薪资水平的动态演变规律,为政策制定者、经济学家及计算社会科学研究者提供了跨时期、跨国别的标准化微观数据基础,在推动劳动力市场比较研究与薪资不平等量化分析方面具有显著影响力。
当前挑战
该数据集所解决的领域挑战主要体现在两个方面。其一,劳动力市场中薪资数据的跨国可比性长期受限于各国统计口径、货币单位及调查方法的差异,数据集通过ILO统一采纳国际劳工统计学家会议(ICLS)定义进行标准化处理,有效弥合了不同来源间的结构性鸿沟。其二,构建过程中面临的核心挑战包括多源调查数据(劳动力调查、家庭收支调查等)的清洗与去重,以及“最佳来源”选择策略的制定——当同一国家与年份存在多个数据来源时,需依据ILO选定准则仅保留一条记录。此外,数据质量标注(如不可靠标记“U”)的保留虽增强了透明度,但也为下游模型引入噪声,要求使用者审慎处理异常值及缺失分类维度(如性别、职业细项)所引发的偏差风险。
常用场景
经典使用场景
该数据集在劳动经济学与社会科学研究中具有广泛的经典应用场景,最常用于探索欧洲各国按性别与职业划分的雇员小时工资中位数差异。研究者可借助该数据集构建面板数据模型,系统分析性别工资差距的演变趋势及其与职业技能水平之间的动态关系。数据集覆盖1991年至2025年间八个欧洲国家的观测数据,时间跨度长、维度丰富,为进行跨国比较与纵向趋势分析提供了坚实基础。无论是运用回归分析探究经济发展水平对工资的影响,还是使用时间序列方法预测薪酬变动的周期性特征,该数据集都能为研究者提供高质量且标准化的数据支持。
衍生相关工作
围绕该数据集衍生出的一系列经典工作涵盖了从数据挖掘到可解释性分析的多个方向。在学术领域,研究者基于该数据开发了多种性别工资差距的分解方法,如Oaxaca-Blinder分解和分位数回归模型,深入揭示教育与职业选择对工资的影响。在机器学习领域,该数据集常被用作表格数据回归任务的基准,用于比较不同模型如随机森林、梯度提升树和深度学习网络在结构化数据上的预测性能。此外,时间序列预测工作利用该数据中的历史趋势,构建了工资变化预报模型,助力经济政策模拟。数据集的规整格式和丰富的标签信息也使其成为可信赖的可解释人工智能研究平台。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲多国基于性别与职业分类的雇员时薪中位数时序追踪,为劳动经济学中的性别薪酬差距、职业隔离及薪资动态演进提供了高颗粒度的跨国家面板数据。当前前沿研究正借助此类精细化ILOSTAT来源数据,结合机器学习与时间序列预测方法,深入剖析欧洲劳动力市场的结构化不平等,并探索政策干预对薪酬公平性的长期影响。尤其在欧盟推动《薪酬透明指令》等热点政策背景下,该数据集成为验证同工同酬立法成效、监测各国薪酬收敛趋势的关键实证基础,其连续三十余年的观测跨度更支撑了对周期性经济波动与结构性转型如何重塑薪酬格局的因果推断。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务