遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-age-nb-median-hourly-earnings-of-employees-by-sex-and-age

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的按性别和年龄划分的员工中位小时收入(本地货币)指标数据,专门针对欧洲地区。数据集涵盖8个欧洲国家(瑞士、葡萄牙、英国、法国、摩尔多瓦、波黑、意大利、希腊),时间跨度为1991年至2025年,共包含3,780个观测值。数据按年度频率提供,并可按性别(总计、男性、女性)和年龄(15岁以上)进行细分。数据集结构包括国家代码、国家名称、数据来源、指标代码、指标标签、性别分类、年龄分类、观测年份、观测值、观测状态等列。数据经过ILO harmonisation处理,使用国际劳工统计学家会议(ICLS)定义,并标注来源以确保可追溯性。该数据集适用于表格分类、回归和时间序列预测等任务,旨在为研究欧洲劳动力市场收入差异提供ML-ready数据支持。

This dataset contains the Median hourly earnings of employees by sex and age (local currency) indicator data from the International Labour Organization (ILO) ILOSTAT database, specifically for the European region. It covers 8 European countries (Switzerland, Portugal, United Kingdom, France, Moldova, Bosnia and Herzegovina, Italy, Greece) from 1991 to 2025, with a total of 3,780 observations. The data is provided at an annual frequency and can be disaggregated by sex (total, male, female) and age (15+). The dataset structure includes columns such as country code, country name, data source, indicator code, indicator label, sex classification, age classification, observation year, observed value, and observation status. The data is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions, with source annotations for traceability. This dataset is suitable for tasks like tabular classification, regression, and time-series forecasting, aiming to provide ML-ready data for studying income disparities in the European labor market.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-age-nb-median-hourly-earnings-of-employees-by-sex-and-age 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于欧洲8个国家(瑞士、葡萄牙、英国、法国、摩尔多瓦、波黑、意大利、希腊)1991至2025年间雇员按性别与年龄划分的中位数小时收入数据。数据通过ILOSTAT REST API直接抽取,并依据欧洲ISO3国家代码进行过滤,最终经Electric Sheep Europe团队标准化整合为3,780条观测记录。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,并在source.label列中标注数据来源(如劳动力调查),确保数据可追溯性。
特点
数据集具有多维度的精细特征。其核心指标EAR_EHRM_SEX_AGE_NB提供了按性别(总、男性、女性)与年龄组别(如15岁以上青年与成年人)双重分解的时薪中位数,以当地货币计价。数据涵盖8个欧洲经济体,时间跨度长达35年,其中瑞士以840条观测居首。每条记录包含国家代码、来源标识、指标标签、观测值及状态标记(如序列中断),并附有详细的注释字段说明货币单位、数据存储库等信息,便于用户理解数据背景与质量。
使用方法
研究者可通过HuggingFace的datasets库便捷加载该数据集,使用`load_dataset`函数即可将数据导入为Pandas DataFrame。典型操作包括按国家过滤(如`df[df["ref_area"] == "DEU"]`)、针对特定指标进行时间序列分析(如按年份排序后绘制obs_value变化曲线),以及通过数据透视表将数据重塑为国家×年份矩阵,以比较不同国家间收入中位数的长期演变趋势。数据集以cc-by-4.0许可发布,使用时需同时引用ILO原始来源与Electric Sheep Europe的重新包装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门通过ILOSTAT平台构建,Electric Sheep Europe于2025年重新整理后发布于HuggingFace,包含1991年至2025年间8个欧洲国家共计3780条关于员工按性别和年龄划分的时薪中位数观测数据。其核心研究问题聚焦于跨国劳动力市场中性别与年龄维度的收入差异,为劳动经济学、社会政策及可持续发展目标(SDG)中的体面工作议题提供跨时空的量化支撑。作为ILO全球劳动统计体系的重要组成部分,该数据集凭借其标准化的元数据框架和来源可追溯性,已成为研究欧洲劳动力市场不平等、性别工资差距及代际收入流动的关键参照基准。
当前挑战
该数据集所应对的领域挑战在于:多国劳动统计口径的异质性导致原始调查数据难以直接比较,ILO通过ICLS定义进行统一化处理,但仍需依赖各国来源的追踪标签来评估数据质量。构建过程中面临的核心挑战包括:年度频率数据无法捕捉季度或月度波动,限制了高频劳动关系分析;部分国家或年份因调查缺位或数据不可靠被标记为“序列中断”,造成时间序列不连续;性别与年龄分类维度仅覆盖粗粒度分组(如15岁以上),难以精细刻画特定亚群体的收入结构。此外,同一国家同年份存在多重来源时,ILO精选的“最佳来源”虽确保了一致性,却可能引入选择偏差,需谨慎处理模型不确定性。
常用场景
经典使用场景
在劳动经济学与公共政策研究领域,该数据集的核心使用场景集中于性别与年龄维度的工资差异分析。研究人员可借助其对欧洲八国近三十年间雇员中位时薪的精细刻画,运用面板数据回归或时间序列分解方法,量化性别工资鸿沟的演变轨迹,揭示不同年龄组(如青年与成年劳动者)在劳动力市场中的薪酬分布特征。此外,该数据常被用于跨国比较研究,通过标准化指标统一分析瑞士、法国、意大利等国的工资结构异同,为理解欧洲内部劳动力市场的制度差异提供了坚实的数据基础。
解决学术问题
该数据集精准回应了劳动经济学中两个长期悬而未决的学术命题:其一,如何系统量化性别工资差距的动态演化及其与宏观经济周期的关联;其二,年龄结构变迁如何重塑劳动力市场的薪酬分配格局。通过提供长达三十余年、横跨多元国家制度背景的微观聚合数据,它使得研究者能够突破单一国家或短期样本的局限,开展诸如工资刚性、人力资本回报率跨代差异等经典议题的稳健实证检验。其重要影响在于,为验证理论模型(如补偿性工资差异理论或统计歧视模型)提供了高频率、跨国的可比较观测证据。
衍生相关工作
围绕此数据集,学术界已衍生出诸多经典工作。一方面,研究者将其与ILOSTAT其他指标(如失业率、非正规就业比例)结合,构建了欧洲劳动力市场多维脆弱性指数,推动了交叉性不平等研究的方法论创新。另一方面,基于该数据的时序特征,涌现了一批利用贝叶斯结构时间序列模型或机器学习方法预测工资趋势的前沿成果。此外,该数据集还常被用作基准测试平台,验证薪酬公平性审计算法与因果推断工具(如双重差分法在制度突变点上的应用)的有效性,深刻影响了计量经济学中面板数据处理范式的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务