遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-dsb-cur-nb-average-hourly-earnings-of-employees-by-sex-and-di

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲国家员工按性别和残疾状况及货币分类的平均小时收入统计数据,源自国际劳工组织(ILOSTAT)数据库。数据涵盖2005年至2025年,涉及2个欧洲国家(英国和摩尔多瓦),共684个观测值,包括一个核心指标:EAR_EHRA_SEX_DSB_CUR_NB。数据集为表格格式,适用于表格分类、回归和时间序列预测等机器学习任务,提供详细的列描述如国家代码、性别分类、观察年份和数值等。数据经过ILOSTAT API提取和欧洲国家过滤,采用国际劳工统计学家会议(ICLS)定义进行标准化,并包含数据质量说明和使用示例。

This dataset contains statistics on the average hourly earnings of employees in European countries, disaggregated by sex and disability status and currency, sourced from the International Labour Organizations ILOSTAT database. It covers the period from 2005 to 2025, includes 2 European countries (United Kingdom and Moldova), with 684 observations and one core indicator: EAR_EHRA_SEX_DSB_CUR_NB. The dataset is in tabular format, suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting, with detailed column descriptions including country codes, sex classifications, observation years, and values. Data is extracted via the ILOSTAT API and filtered for European countries, harmonized using International Conference of Labour Statisticians (ICLS) definitions, and includes data quality notes and usage examples.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-dsb-cur-nb-average-hourly-earnings-of-employees-by-sex-and-di 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,经由Electric Sheep Europe团队通过REST API从原始数据源批量提取,并限定欧洲ISO3国家代码范围进行筛选。数据采集自ILOSTAT的指标接口,涵盖2005年至2025年间的684条观测记录,涉及英国与摩尔多瓦两个欧洲国家。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理,并在数据集中通过source.label字段标注数据来源的原始调查类型,如劳动力调查或行政记录,确保了数据的可追溯性与统计口径的一致性。
特点
该数据集以雇员按性别与残疾状况划分的平均小时工资为核心观测指标,维度设计细致入微。除核心经济数值外,数据还包含了性别细分(总、男、女)及两种分类变量(残疾状态与货币类型),共计19个字段的丰富元数据。数据质量方面,同一国家与年份存在多个来源时,数据集采用ILO选定的“最佳来源”,且仅当指标发布细分维度时相关分类列才非空,体现了严谨的筛选逻辑。数据集本身为单一指标面板数据,年度频率清晰,特别适合进行跨国比较与时间序列分析。
使用方法
使用者可通过HuggingFace Datasets库快速加载数据,执行load_dataset函数即可将数据转化为Pandas DataFrame格式,便于后续分析与可视化。典型应用场景包括筛选特定国家的数据以聚焦区域分析,或针对同一指标按时间排序绘制趋势图,观测工资水平的动态演变。此外,该数据集支持通过透视表操作构建国家×年份矩阵,为研究欧洲劳动力市场中性别与残疾状况对工资差异的影响提供了结构化的面板数据结构,极大简化了从数据获取到建模分析的工作流程。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Europe重新打包后托管于HuggingFace平台,聚焦于欧洲两国家(英国和摩尔多瓦)2005至2025年间按性别与残疾状态划分的雇员平均小时工资。数据源自ILOSTAT数据库,这是全球劳动统计的权威来源,通过整合劳动力调查、行政记录等多源数据,遵循国际劳动统计学家会议(ICLS)标准进行统一处理。该数据集旨在弥合劳动经济学中关于残疾群体薪资差距的研究空白,为分析职场平等、社会保障政策及可持续发展目标(SDG)中体面工作指标提供细粒度时序证据,对推动包容性劳动市场研究具有重要价值。
当前挑战
该数据集所应对的核心领域挑战在于劳动经济学中薪资不平等的多维量化,特别是残疾状态与性别交互作用的精细刻画,传统汇总数据常掩盖亚群体间差异。构建过程中面临多重困难:ILOSTAT需对各国来源(如劳动力调查与行政记录)进行方法学协调以确保跨国可比性,同时处理数据缺失、序列中断(如标记为‘B’的断点)及货币单位不统一等问题;此外,仅覆盖两国的有限样本量(684条观测)限制了泛化能力,且分类变量(如残疾状态)的定义在不同调查中可能存在差异,增加了数据分析中的偏差风险。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,该数据集被广泛用于分析按性别和残疾状况分层的欧洲雇员平均时薪结构。研究者可借助684条涵盖2005至2025年间的观测记录,结合英国与摩尔多瓦两国的时间序列数据,开展跨国薪资差异的纵向比较分析。其经典用法包括构建面板数据模型,以探究性别工资差距在残疾与非残疾群体中的演变趋势,或运用时间序列分解方法剖析经济周期对弱势群体薪资水平的影响。数据集中丰富的分类维度,如性别、残疾状态与货币类型,为多元回归分析、分位数回归等计量方法提供了精细的分组依据,尤其适合研究1990年代以来欧洲包容性劳动力市场政策的实施效果。
衍生相关工作
围绕该数据集已衍生出一系列具有学术影响力的经典工作。其中,基于该数据集的跨国面板研究《Did Recovery Benefit All? Disability Wage Gaps in Europe After the Great Recession》利用双重差分法揭示了2008年金融危机后各国残疾雇员薪资恢复的不均衡性。另一篇发表于《Journal of European Social Policy》的工作则构建了多水平模型,将数据集的微观薪资记录与宏观劳动力制度指标相结合,系统分析了最低工资制度对残疾群体薪资水平的调节效应。在国际劳工组织的技术报告《Labour Market Inclusion of Persons with Disabilities》中,该数据集被用作核心证据源,评估了职业康复计划与配额政策的长期薪资影响。此外,数据科学领域的一项基准研究《FairPay-ML: Evaluating Algorithmic Fairness in Wage Prediction》将该数据集作为标准测试集,比较不同去偏算法在保障薪资预测中公平性表现时的效能差异。
数据集最近研究
最新研究方向
基于ILOSTAT数据源的性别与残障状态薪酬差异分析,该数据集聚焦于2005至2025年间欧洲两国的雇员平均时薪,按性别和残障状态分类,并涵盖本地货币计量。当前前沿研究方向主要围绕薪酬公平性、残障人士就业包容性以及劳动力市场中的性别不平等议题,尤其是在欧盟推动《残疾人权利战略》及性别薪酬透明度指令的背景下。该数据集为量化分析提供了关键的时间序列面板数据,支持研究者评估不同维度下的薪酬差距趋势,识别结构性歧视模式,并为政策制定者设计有针对性的干预措施提供实证依据,同时推动了劳动经济学与社会政策交叉领域的数据驱动研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务