遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-age-nb-average-monthly-earnings-of-employees-by-sex-and-a

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个关于欧洲员工按性别和年龄划分的平均月收入(以本地货币计)的数据集,数据来源于国际劳工组织(ILO)的ILOSTAT数据库。数据集包含29,138个观察值,覆盖36个欧洲国家,时间跨度为1991年至2025年,涵盖一个独特指标:EAR_EMTA_SEX_AGE_NB,即按性别和年龄划分的员工平均月收入。数据经过ILOSTAT API提取,并过滤至欧洲国家代码,采用国际劳工统计学家会议(ICLS)定义进行标准化。数据集适用于表格分类、回归和时间序列预测等任务,并遵循CC-BY-4.0许可。

This dataset contains average monthly earnings of employees by sex and age in local currency for Europe, sourced from the International Labour Organizations (ILO) ILOSTAT database. It includes 29,138 observations across 36 European countries, spanning the years 1991 to 2025, with one distinct indicator: EAR_EMTA_SEX_AGE_NB, which represents average monthly earnings of employees by sex and age. Data is pulled directly from the ILOSTAT REST API and filtered to European ISO3 country codes, harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, and is released under the CC-BY-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-age-nb-average-monthly-earnings-of-employees-by-sex-and-a 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API直接抽取指标EAR_EMTA_SEX_AGE_NB的原始数据,并严格筛选出欧洲36个国家的ISO3代码区域。数据经过ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行协调标准化,原始调查微观数据来源在source.label列中清晰标注,确保可追溯性。数据涵盖1991年至2025年间的29,138条观测记录,以年度频率聚合,深度整合了不同性别与年龄组别雇员平均月收入信息。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数一键加载数据,并转化为Pandas DataFrame进行深入分析。基于提供的时间列(time)和观测值列(obs_value),可轻松绘制特定国家或指标的时间序列趋势。利用pivot_table功能,可以便捷地将数据重塑为国家×年份的宽表矩阵,便于进行面板数据分析或跨区域比较。数据集天然适配表格分类、回归与时序预测等机器学习任务,为欧洲劳动经济学研究提供了即拿即用的标准化基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门于2025年整理发布,经Electric Sheep Europe重新封装后托管于HuggingFace平台,聚焦欧洲36个国家1991年至2025年间按性别和年龄划分的雇员平均月薪(以当地货币计)问题。作为ILOSTAT数据库的子集,其核心研究目标在于系统记录并揭示欧洲劳动力市场中薪资结构的时序演变与人口差异,为跨国比较、性别薪酬差距分析及劳动经济学建模提供可靠数据基础。凭借ILO在劳工统计领域的权威性以及29,138条观测值的体量,该数据集已成为欧洲区域薪资研究的重要参考,广泛服务于社会科学实证分析、政策评估及机器学习预测任务。
当前挑战
该数据集所应对的核心挑战在于跨国家、长期序贯的薪资数据可比性难题,即如何统一不同来源的原始调查数据(如劳动力调查、家庭收支调查),克服各国统计口径、货币单位及年龄分组标准的异质性,以实现对性别薪酬不平等与劳动力市场结构性变化的精准量化。构建过程中,ILO需调和来自200余个经济体的多样化行政记录,并对观测状态(如临时性、不可靠性)加以标注,但数据集仍面临数据稀疏、非标准年龄分组(如排除15岁)以及多源冲突时的“最佳来源”选择偏差等问题,而这些均可能引入模型训练与收入预测的潜在噪声。
常用场景
经典使用场景
该数据集汇聚了1991年至2025年间36个欧洲国家按性别与年龄划分的雇员平均月薪数据,共计逾两万九千条观测记录,为劳动经济学与人口统计学领域的研究提供了宝贵的时间序列资料。研究者常将其应用于工资差异的跨国比较分析,考察不同性别与年龄群体在劳动力市场中的报酬结构演变。同时,数据集以标准化格式呈现,便于直接加载为国家×年份矩阵,用于面板数据回归建模,探究经济发展、制度政策与薪酬水平之间的动态关联。其跨时跨域的覆盖特性,使其在分析欧洲一体化进程中劳动力市场的趋同或分异趋势时,成为不可或缺的实证基础。
解决学术问题
该数据集有效填补了欧洲范围内系统性、可比性工资微观数据的空白,解决了传统官方统计中因各国调查口径与货币单位不一而导致的分析障碍。学术研究者借此能够定量评估性别工资差距的时序演变,揭示老龄化社会中不同年龄劳动力群体的薪酬劣势累积模式,并检验最低工资政策、集体谈判制度等结构性因素对收入分配的调节效应。此外,通过整合ILO标准化定义与多源调查数据,该数据集为跨国面板回归、贝叶斯分层模型及结构方程建模提供了高信度的实证基础,推动了关于工资刚性、劳动力流动性及代际公平等经典劳动经济学命题的深入探讨。
实际应用
在实际决策层面,该数据集被广泛用于国际组织与各国统计部门的薪酬监测与政策评估工作。欧盟委员会与欧洲统计局可依据其中分性别、分年龄的工资数据,追踪成员国在性别平等与体面工作方面的进展,为《欧洲支柱社会权利行动计划》等政策框架提供量化支撑。工会与雇主协会借其开展行业薪酬对标谈判,辅助制定公平的薪资策略。同时,数据可视化工具开发者利用标准化字段构建交互式仪表板,向公众直观呈现欧洲各国劳动力薪酬格局,提升社会透明度与公众认知。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲36国1991至2025年间按性别与年龄划分的雇员月均收入(本币),为劳动经济学中的薪酬不平等、性别工资差距及人口结构变迁等前沿议题提供了高分辨率面板数据。当前研究热点在于利用此类长时间序列与多维度细分数据,结合时间序列预测与面板回归模型,量化欧洲各国在性别工资平权政策(如欧盟薪酬透明度指令)实施后的实际收敛效应,并分析数字化与老龄化双重冲击下不同年龄层群体的收入分化趋势。数据集来自国际劳工组织权威统计库ILOSTAT,经标准化处理后可直接用于机器学习建模,为跨国产出比较、劳动力市场效率评估及可持续发展目标(SDG 8.5)的实证监测提供了关键数据基础,对推动证据驱动的社会政策设计具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务