遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-age-nb-median-monthly-earnings-of-employees-by-sex-and-ag

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲国家雇员月收入中位数统计数据,具体指标为EAR_EMTM_SEX_AGE_NB(按性别和年龄划分的雇员月收入中位数,以本地货币计)。数据集涵盖33个欧洲国家,时间跨度为1991年至2025年,共包含29,058个观测值。数据字段包括国家代码(ref_area)、国家名称、数据来源(source)、指标代码(indicator)、性别分类(sex)、年龄分类(classif1)、观测年份(time)、观测值(obs_value)以及相关的状态和注释字段。数据以年频率发布,经过ILO根据国际劳工统计学家会议(ICLS)定义进行标准化处理,并筛选了每个国家×年份组合下的最佳来源数据。该数据集适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains median monthly earnings statistics for employees in European countries from the International Labour Organization (ILO) ILOSTAT database, specifically the indicator EAR_EMTM_SEX_AGE_NB (Median monthly earnings of employees by sex and age in local currency). It covers 33 European countries from 1991 to 2025, with 29,058 observations. The data fields include country code (ref_area), country name, data source (source), indicator code (indicator), sex disaggregation (sex), age classification (classif1), observation year (time), observed value (obs_value), and related status and note fields. The data is published at annual frequency, harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions, and selects the best source for each country×year combination. The dataset is suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-age-nb-median-monthly-earnings-of-employees-by-sex-and-ag 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的核心统计数据库ILOSTAT,通过调用其REST API接口直接获取原始数据,并依据欧洲ISO3国家代码进行地理范围过滤。数据底层来源于各国劳动力调查、家庭收入调查、企业调查及行政记录,经由ILO统计部门依据国际劳动统计学家会议(ICLS)定义进行统一协调与标准化处理。最终由Electric Sheep Europe团队重新打包,形成包含29,058条观测记录、覆盖33个欧洲国家、时间跨度从1991年至2025年的结构化数据集,以Parquet格式发布,便于机器学习流水线直接加载。
特点
该数据集的核心特征在于其聚焦于员工按性别与年龄分组的月收入中位数(以本币计),提供单一但高度细化的劳动经济指标。数据蕴含了丰富的维度拆解能力,包括性别(总、男性、女性)、年龄分组以及数据来源溯源列,使得研究者能够进行多维度的交叉分析与纵向比较。此外,数据集标注了观测状态(如临时、不可靠)及各类注释信息,为数据质量评估提供了透明依据,特别适合用于欧洲劳动力市场的时序分析、性别收入差距研究以及区域性工资动态建模。
使用方法
使用者可通过HuggingFace Datasets库的`load_dataset`函数一键加载数据集,并利用Pandas将其转换为DataFrame格式进行后续操作。典型应用包括按国家代码筛选特定国家的子集,按指标代码过滤特定序列并进行时间序列可视化,或通过数据透视表构建国家×年份的矩阵进行横截面分析。由于数据已按年度频率整理且包含标准化的分类变量,研究者可以直接将其应用于监督学习回归任务、时序预测或分类问题,而无需进行复杂的数据清洗与对齐工作。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司于2025年整理发布,并由Electric Sheep Europe团队重新封装至HuggingFace平台,聚焦于欧洲33个国家1991至2025年间雇员按性别与年龄分组的月收入中位数(以本币计)。收入性别差距与年龄分层是劳动经济学与社会政策领域长期关注的核心议题,这一数据集为跨国比较与时间序列分析提供了罕见的、标准化且经过ILO协调的统一指标。其来源ILOSTAT数据库是全球劳动力统计的权威枢纽,依托各国劳动力调查与行政记录,使得该数据集不仅具备高覆盖度与长跨期,更在区域一体化研究、性别平等评估及欧盟社会政策模型的构建中扮演关键角色,为学术界、国际组织与政策制定者提供了可复现、可交互的基础数据结构。
当前挑战
该数据集所面临的领域问题核心在于劳动力收入数据的异质性与可比性挑战。不同国家因统计口径、调查方法、货币单位及通货膨胀水平的差异,使得跨国的收入中位数直接比较存在方法论障碍,尤其是本币计价使得货币转换与购买力平价调整成为深度分析的前置任务。此外,构建过程中遭遇的挑战包括数据源的多源性及其质量不统一——ILO虽选定“最佳来源”,但观测值中仍存在标注为“不可靠”或“暂定”的状态标识,且部分国家早期年份的收入数据因失访或抽样误差而缺失,非标准年龄分组与分类变量的差异性进一步增加了聚合与建模的复杂度。
常用场景
经典使用场景
作为欧洲劳动力市场中位月收入结构化面板数据的代表,该数据集在计量经济学和劳动经济学领域被广泛用于构建薪资水平的跨国面板回归模型。研究者能够利用时间跨度自1991年至2025年、覆盖33个欧洲国家的观测值,按性别与年龄维度剖析收入分布的动态变迁。其经典应用包括运用固定效应或随机效应模型,控制国家和年份的异质性,量化教育水平、劳动力市场制度或宏观经济周期对薪资中位数的影响。此外,由于数据按国际劳工组织的统一标准进行调和,亦为评估欧盟各国的收入趋同进程或性别工资差距的时间演化提供了可靠的实证基础。
衍生相关工作
基于该数据集衍生出一系列具有影响力的学术作品,尤其聚焦于欧洲性别工资差距的跨国分解与演变轨迹。经典研究包括运用Oaxaca-Blinder分解法,将可观测特征差异与不可解释的歧视效应分离,进而剖析不同年龄段的性别收入鸿沟。此外,部分工作将其与宏观制度数据结合,构建多层线性模型来评估工会密度、集体谈判覆盖率或育儿假政策对女性收入净效应的调节作用。近年来,随着时间序列分析方法的普及,亦涌现出利用贝叶斯结构时间序列模型预测特定国家薪资增速方向的探索性研究。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲33国1991至2025年间按性别与年龄分层的雇员月收入中位数,为劳动经济学中性别薪酬差距的动态演化与代际收入不平等研究提供了关键时序证据。当前前沿方向包括利用该面板数据构建因果推断模型,以量化欧盟同工同酬指令等政策干预对缩小性别收入鸿沟的实际效果;同时,结合新冠疫情与通货膨胀等宏观经济冲击,分析不同年龄群体(如青年与中年劳动者)收入弹性的非对称响应。此外,该数据的高频次与跨国家特性正被用于训练时间序列预测模型,以预警潜在的社会不稳定风险,为完善国际劳工组织体面劳动指标与欧洲社会权利支柱的实施提供了数据驱动的实证基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务