遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-nb-median-monthly-earnings-of-employees-by-sex-local

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲33个国家1991年至2025年间按性别划分的员工月收入中位数(以当地货币计)的表格数据,共1963个观测值,核心指标为EAR_EMTM_SEX_NB。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理,涵盖国家代码、指标、性别、年份、观测值等字段,适用于表格分类、回归和时间序列预测等任务。

This dataset contains tabular data on the median monthly employee income (denominated in local currency) categorized by gender for 33 European countries spanning from 1991 to 2025, with a total of 1963 observations. The core indicator of this dataset is EAR_EMTM_SEX_NB. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), obtained via API and standardized. It includes fields such as country code, indicator, gender, year, and observed value, and is applicable to tasks including tabular classification, regression, and time series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-nb-median-monthly-earnings-of-employees-by-sex-local 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接调取指示符代码为EAR_EMTM_SEX_NB的原始数据,并依据欧洲国家ISO3编码进行地理范围过滤。数据经过ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行协调与标准化处理,原始调查微观数据来源在source.label列中予以标记,以确保数据可追溯。最终由Electric Sheep Europe重新封装为便于机器学习使用的格式。
特点
数据集包含1963条观测记录,覆盖33个欧洲国家,时间跨度从1991年至2025年,聚焦于按性别分列的雇员月收入中位数(本地货币)这一核心指标。数据以年度频率呈现,并提供性别维度(总、男、女)的分组信息,同时标注了观测状态(如临时数据、序列中断)及货币等备注信息。ILO选取的每个国家与年份组合的最佳数据源被优先采用,保证了数据的权威性与一致性。
使用方法
用户可通过HuggingFace的datasets库直接加载数据集,使用load_dataset函数获取包含所有观测值的DataFrame。加载后可依据ref_area列筛选特定国家数据进行区域分析,或基于indicator列过滤特定指标进行时间序列可视化。此外,利用pivot_table方法可将数据重构为国家×年份的矩阵形式,便于跨国家比较或构建面板数据模型。数据集以Parquet格式存储,支持高效的读取与处理。
背景与挑战
背景概述
本数据集由国际劳工组织(ILO)于2025年通过其核心统计数据库ILOSTAT创建,并由Electric Sheep Europe团队重新封装后发布在HuggingFace平台。该数据集聚焦于欧洲33个国家1991至2025年间按性别划分的员工月收入中位数(以当地货币计),共包含1963条观测记录。ILOSTAT作为全球劳动统计的权威来源,整合了来自各国劳动力调查、家庭收入调查及行政记录等多元数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。该数据集的发布为研究欧洲劳动力市场中性别薪酬差距的长期演变趋势提供了关键支持,尤其适用于开展跨国比较和时间序列分析,对劳动经济学、社会政策及可持续发展目标(SDG)中体面工作指标的监测具有显著推动作用。
当前挑战
该数据集面临的挑战主要体现在两个方面。在领域问题层面,它旨在解决劳动经济学中性别薪酬差异的量化与动态追踪难题,但不同国家间的数据采集方法、统计口径及货币单位差异可能导致跨国比较的偏差,需谨慎处理缺失值、序列中断(如“Break in series”状态标记)及多重来源的择优选择。在构建过程中,数据整合面临来源异构性挑战,例如各国调查的抽样设计、时间频率(部分指标为月/季度数据未纳入)及分类维度(仅涵盖性别细分,缺乏教育水平、职业类别等关键协变量)的局限性;同时,本地货币单位不统一使跨区域汇总和汇率波动校正成为技术难点。此外,1,963条观测对于33国34年跨度而言密度较低,部分国家数据稀疏(如CHE有105行,而最少的仅18行),可能影响模型泛化能力与时序分析的稳健性。
常用场景
经典使用场景
该数据集收录了1991年至2025年间33个欧洲国家雇员性别分组的月收入中位数数据,共计1963条观测值,是劳动经济学与性别薪酬差距研究的核心资源。研究者常利用其时间序列与国别面板结构,构建线性回归或固定效应模型,量化性别收入差异的长期演变趋势;亦可结合ILOSTAT统一的数据定义与分类标准,进行跨国比较分析,揭示欧洲各国在劳动力市场平等政策上的实效差异。数据集提供的性别维度(男、女、总计)与来源标记字段,为开展异质性分析提供了细粒度支撑,成为探讨欧洲薪酬机制、劳动制度演进及社会性别平等议题的基础性数据资产。
衍生相关工作
该数据的衍生工作主要围绕欧洲劳动力市场的实证分析与算法建模展开。经典成果包括基于多国面板数据构建的性别工资差距决定因素模型,其中学者引入制度性变量(如工会密度、产假时长)与宏观经济指标,借助交互效应揭示政策环境下性别收入差异的收敛条件。此外,部分研究利用该数据训练时间序列预测模型(如ARIMA或Prophet),对各国未来数年的性别薪酬中位数进行估算,预警潜在恶化趋势。在数据科学领域,该数据集被用作不平衡回归或缺失值填充算法的基准测试案例,检验性别分组下纵向数据插补方法的稳健性。其作为ILOSTAT标准化产出的一部分,亦被整合进欧洲社会经济监测仪表盘项目,成为多源数据融合与可视化叙事的基础构件。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲33国1991至2025年间按性别划分的雇员月收入中位数(以本币计),为劳动经济学与性别工资差距的前沿研究提供了关键数据支撑。在当前全球推动体面工作与性别平等的背景下,研究者正利用这些时序数据,结合机器学习与时间序列预测方法,深入剖析欧洲各国工资结构的演变趋势、性别收入差异的收敛或分化态势,并关联宏观经济政策与劳动力市场改革的影响。ILOSTAT标准化的方法论确保了跨国可比性,使其成为监测可持续发展目标中‘性别平等’与‘体面劳动’进展的核心资源,对制定公平薪酬政策具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务