遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-age-cur-nb-median-hourly-earnings-of-employees-by-sex-and-age

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲8个国家(瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、意大利、希腊)在1991年至2025年期间的员工小时收入中位数数据,重点关注按性别和年龄分组的收入指标(EAR_EHRM_SEX_AGE_CUR_NB)。数据集共10,670条观测记录,来源于国际劳工组织(ILOSTAT)的权威统计数据库,通过API获取并经过欧洲国家代码筛选。数据以表格形式存储,包含国家代码、数据来源、指标代码、性别分类、年龄分类、年份、观测值等列,适用于表格分类、回归和时间序列预测等任务。数据集还提供了数据质量说明和使用示例,支持研究人员和开发者快速加载和分析。

This dataset contains median hourly earnings data for employees by sex and age across 8 European countries (Switzerland, Portugal, France, United Kingdom, Moldova, Bosnia and Herzegovina, Italy, Greece) from 1991 to 2025. It includes 10,670 observations focusing on the indicator EAR_EHRM_SEX_AGE_CUR_NB, sourced from the International Labour Organizations ILOSTAT database via API and filtered by European ISO3 country codes. The data is stored in tabular format with columns such as country code, data source, indicator code, sex classification, age classification, year, and observed value, suitable for tasks like tabular classification, regression, and time-series forecasting. The dataset also includes data quality notes and usage examples to facilitate quick loading and analysis for researchers and developers.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-age-cur-nb-median-hourly-earnings-of-employees-by-sex-and-age 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,其构建过程依托于该机构对欧洲地区劳动力调查数据的系统性整合与标准化处理。通过调用ILOSTAT的REST API,从原始指标`EAR_EHRM_SEX_AGE_CUR_NB`中提取涵盖了8个欧洲国家、时间跨度从1991年至2025年的10,670条观测值。数据经由国际劳工统计学家会议(ICLS)定义的统一准则进行协调,并在`source.label`字段中标注了数据来源,如劳动力调查或行政记录,确保了不同国家数据的可比性与追溯性。最终,经过针对欧洲ISO3国家代码的筛选与打包,形成了易于使用的结构化数据集。
特点
该数据集的核心特点在于其精细的维度划分与权威的数据来源。它专门聚焦于按性别和年龄分层的雇员中位数小时收入,提供了`sex`(包含总计、男性、女性三个类别)与`classif1`(如青年/成人年龄组)等关键分类变量,支撑深入的劳动经济学分析。数据集的纵向时间跨度长达35年,覆盖了瑞士、法国、英国等多个欧洲经济体,为追踪薪资趋势与性别收入差距的演变提供了宝贵的时间序列资源。此外,所有数据均遵循CC-BY-4.0许可协议,为科研与政策分析提供了合法且可靠的基础。
使用方法
研究人员可通过HuggingFace的`datasets`库便捷地加载该数据集,仅需一行代码`load_dataset()`即可将其转化为pandas DataFrame对象进行后续操作。在使用过程中,用户可以依据`ref_area`字段筛选特定国家(如德国)的数据,或基于`indicator`列聚焦于中位数小时收入这一核心指标,进行时间序列的可视化与趋势分析。为了构建面板数据结构,推荐利用`pivot_table`方法将数据重塑为国家×年份的矩阵形式,从而便于开展跨国比较或计量经济学建模。该数据集原生适配于表格分类、回归以及时间序列预测等机器学习任务。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于1991年至2025年间收集整理,并由Electric Sheep Europe于2025年重新封装发布,聚焦欧洲八国员工按性别与年龄划分的每小时收入中位数。作为ILOSTAT核心统计数据库的重要子集,该数据集旨在系统记录劳动报酬的分配格局,为追踪劳动力市场中性别与代际收入差异提供标准化数据支撑。其跨时34年、覆盖瑞士、法国、英国等国的面板结构,为经济学、社会政策与公共健康领域的研究者剖析收入不平等演变轨迹、评估最低工资与反歧视政策效能提供了关键实证基础,也推动了欧洲劳动经济学从理论探讨向数据驱动决策的范式转型。
当前挑战
该数据集面临的领域挑战在于劳动收入数据的跨国可比性难题:各国在调查方法、数据来源(如劳动力调查与行政记录混合)、以及本地币种与购买力调整上存在系统性差异,可能导致按性别与年龄分组的收入中位数在跨国比较中出现偏倚,影响对欧洲层面收入不平等程度的准确刻画。构建过程中,数据整合面临多重障碍:ILO需从八个国家庞杂的原始微观数据中筛选‘最佳来源’以规避不一致性,同时处理因时间序列断裂、分类标准演变(如年龄段定义变化)及货币单位转换带来的连续性挑战,加之部分欧洲经济体的数据频率(年度)与高时间分辨率需求的冲突,进一步限制了其在高频政策评估中的应用灵活性。
常用场景
经典使用场景
该数据集汇集了1991年至2025年间8个欧洲国家雇员按性别和年龄分组的时薪中位数观测值,共计10,670条记录。在劳动经济学与社会科学研究中,它常被用于构建工资决定因素的回归模型,分析性别工资差距的演变趋势,以及探究年龄结构变化对薪酬水平的影响。研究者可借助该数据集进行面板数据分析,比较不同国家间劳动力市场制度的差异,或利用时间序列方法预测工资变动的长期走向。其标准化的分类变量与年度频率,为跨时期、跨国别的比较研究提供了可靠的数据基础。
解决学术问题
该数据集有效回应了劳动经济学领域中关于薪酬不平等与劳动力市场分层的核心议题。通过提供按性别与年龄细化的时薪中位数,它使学者能够量化性别工资差距在不同年龄段的具体表现,揭示女性在职业生涯中面临的系统性薪酬障碍。同时,数据集为评估最低工资政策、集体谈判制度以及劳动力市场监管效果提供了实证依据。其来源ILOSTAT采用国际劳工组织统一统计标准,确保了跨国比较的严谨性,从而推动了关于欧洲劳动力市场收敛与分化机制的深入探讨。
衍生相关工作
围绕该数据集衍生了多项具有影响力的研究与工具。基于ILOSTAT数据体系,学者开发了预测劳动力市场不平等的机器学习模型,将性别工资差距作为关键特征纳入宏观经济预测。部分研究利用该时间序列数据构建欧洲工资曲线,探讨年龄-收入关系随时间的变化规律。此外,数据集的标准化结构催生了交互式可视化仪表盘,使非专业用户也能直观探索各国工资动态。其作为开源数据资产,已被整合至多个计量经济学软件包与教育案例中,成为劳动经济学教学与研究的标准资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务