遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-age-nb-average-hourly-earnings-of-employees-by-sex-and-ag

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为“按性别和年龄划分的员工平均小时收入(本地货币)| 欧洲(ILOSTAT)”,包含了来自国际劳工组织(ILO)ILOSTAT数据库的欧洲地区劳动统计信息。具体内容涉及8个欧洲国家(包括瑞士、葡萄牙、英国、法国、摩尔多瓦、波黑、意大利和希腊)从1991年至2025年的员工平均小时收入数据,以本地货币计,并按性别和年龄进行细分。数据集共包含3,780个观测值,涵盖一个核心指标:EAR_EHRA_SEX_AGE_NB(按性别和年龄划分的员工平均小时收入)。数据通过ILOSTAT REST API获取,并经过过滤和处理,以确保覆盖欧洲国家。数据集以表格形式呈现,包含多列信息,如国家代码、国家名称、数据来源、指标代码、性别分类、年龄分类、观测年份、观测值、观测状态等。数据质量方面,为年度频率,ILO会为同一国家×年份选择“最佳来源”,且细分列仅在指标发布该细分时非空。该数据集由Electric Sheep Europe重新打包,旨在为欧洲提供统一的、机器学习就绪的数据层,便于研究人员和开发者使用。

This dataset is named Average hourly earnings of employees by sex and age (local currency) | Europe (ILOSTAT) and contains labor statistics for Europe from the International Labour Organization (ILO) ILOSTAT database. Specifically, it includes data on average hourly earnings of employees, in local currency, disaggregated by sex and age, for 8 European countries (including Switzerland, Portugal, United Kingdom, France, Moldova, Bosnia and Herzegovina, Italy, and Greece) spanning from 1991 to 2025. The dataset comprises 3,780 observations and covers one core indicator: EAR_EHRA_SEX_AGE_NB (Average hourly earnings of employees by sex and age). Data is pulled directly from the ILOSTAT REST API and filtered to Europe ISO3 country codes. It is presented in tabular format with multiple columns, such as country code, country name, data source, indicator code, sex classification, age classification, observation year, observed value, observation status, etc. In terms of data quality, it is annual frequency, the ILO selects the best source for the same country×year, and disaggregation columns are non-null only when the indicator publishes that breakdown. The dataset is repackaged by Electric Sheep Europe as part of a unified, ML-ready data layer for Europe, facilitating use by researchers and developers.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-age-nb-average-hourly-earnings-of-employees-by-sex-and-ag 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,通过其REST API直接抽取指标编码为EAR_EHRA_SEX_AGE_NB的原始数据,并依据欧洲ISO3国家代码进行地理过滤。数据经ILO统计部门依据国际劳工统计学家会议定义进行协调与标准化,同时保留source.label列以标记数据来源,确保可追溯性。最终由Electric Sheep Europe团队重新封装为Parquet格式,生成包含3,780条观测记录、覆盖8个欧洲国家、时间跨度从1991年至2025年的结构化数据集,旨在提供机器学习就绪的欧洲劳动统计资料。
特点
本数据集聚焦于欧元区按性别与年龄划分的雇员平均小时收入,以本地货币计量,呈现显著的结构化表格特性。其特色在于精细的分组维度,涵盖性别(男、女、总计)与年龄分类变量,支持多层级分析;同时收录多国多年份的面板数据,便于进行跨国比较与时间序列建模。数据集还附带了观测状态标记及详尽注释列,明确标识序列中断、货币单位等潜在质量问题,为实证研究提供透明度与可靠性保障。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数快速加载数据,并将其转化为Pandas DataFrame以便操作。针对时序分析,可按国家筛选子集后以年份排序,绘制特定指标的时间序列图;亦可利用透视表功能构建国家×年份的矩阵,进行横截面比较。数据集适用于表格分类、回归及时间序列预测任务,使用者应留意年度频率及最佳来源选择原则,并依据CC-BY-4.0协议同时引用原始ILO数据与Electric Sheep Europe的封装工作。
背景与挑战
背景概述
在全球劳动力市场动态日益复杂的背景下,性别与年龄维度的工资差异已成为劳动经济学与社会政策研究的核心议题。由国际劳工组织(ILO)统计司构建、Electric Sheep Europe于2025年重新整合发布的数据集,聚焦欧洲8个国家1991年至2025年间按性别与年龄划分的雇员平均时薪(以当地货币计)。该数据集源自ILOSTAT这一全球权威劳动统计数据库,旨在为区域劳动力市场不平等性、薪酬结构演变及政策干预效果评估提供精细化数据支撑。其发布填补了欧洲多国长时序、细粒度薪酬数据的空白,对推动性别平等、老龄化社会下的劳动参与率研究以及跨国比较分析具有重要学术价值与实践意义。
当前挑战
该数据集所应对的核心领域挑战在于如何精准量化并解析欧洲各国间因性别与年龄分层导致的薪酬差异及其演变规律,为消除劳动市场歧视与优化薪酬政策提供实证基础。在构建过程中,面临多重难题:首先,不同国家采用的数据源(如劳动力调查、机构调查)在定义、抽样方法与统计口径上存在显著差异,需依赖国际劳工组织(ICLS)标准进行大规模数据协调与质量控制。其次,长时序数据(35年)中频繁出现的序列中断(break in series)、数据标记变化(如provisional与unreliable状态)以及多来源择优选择策略,增加了数据一致性与可比性维护的复杂性。此外,缺失值处理与分类变量(如年龄组、性别)的标准化编码也对数据清洗与整合流程提出了严苛要求。
常用场景
经典使用场景
在劳动经济学与收入分配研究领域,该数据集最为经典的使用场景是性别与年龄维度的工资差异分析。研究者可借助其中按性别(男性、女性、总计)和年龄组别划分的欧洲八国小时平均工资数据,构建面板回归模型,探究性别工资差距在不同年龄段的表现及其随时间演变的趋势。例如,通过对比不同国家男女小时工资的时序变化,揭示性别平等政策与劳动力市场结构性变迁对收入分配的影响。此外,该数据还可用于验证人力资本理论中关于年龄-收入曲线形态的假设,或评估经济周期对不同年龄劳动者收入的异质性冲击。
解决学术问题
该数据集着力解决的核心学术问题,在于长期、跨国可比的小时工资微观数据的匮乏。以往研究常受限于各国统计口径不一、时间跨度短或缺失性别细分数据,难以进行稳健的跨国比较和因果推断。本数据整合了国际劳工组织ILOSTAT的标准化指标,覆盖1991至2025年间八个欧洲国家的连续性观测,为探讨劳动力市场中的性别收入不平等、代际收入流动性、最低工资政策的效应以及技术进步与全球化对工资结构的冲击等议题提供了可靠的实证基础。其意义在于,通过提供细粒度、跨国家的面板数据,助力研究者更精准地辨识影响工资差异的宏观与个体层面因素,推动劳动经济学诸多经典理论的实证检验与修正。
衍生相关工作
该数据集衍生出的经典工作多集中在劳动经济学的计量方法创新与跨学科融合。一方面,研究者基于此开展了性别工资差距的分解研究(如运用Blinder-Oaxaca分解法),将其应用于不同制度下的欧洲国家,识别出可解释部分(如教育、职业分布)与不可解释的“歧视部分”的贡献。另一方面,时序预测领域的学者利用其长时间跨度特性,开发了混合预测模型(如结合ARIMA与机器学习的组合模型),以提前模拟人口老龄化背景下特定年龄组工资水平的变动路径。此外,该数据还催生了社会分层领域关于“理想工作年龄”跨文化比较的分析,探讨不同福利体制如何塑造年龄与收入之间的关联模式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务