遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-eco-nb-median-monthly-earnings-of-employees-by-sex-and-ec

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲员工月收入中位数数据,按性别和经济活动划分,以本地货币计价。数据集涵盖33个欧洲国家,时间跨度为1991年至2025年,共48,942个观测值,涉及一个核心指标:EAR_EMTM_SEX_ECO_NB(按性别和经济活动划分的员工月收入中位数)。数据通过ILOSTAT REST API获取,并经过欧洲国家ISO3代码过滤,以确保地理覆盖范围。数据集包括多维度分类,如性别(总计、男性、女性)和经济活动部门,并提供详细的元数据列,如国家代码、来源标签、观测值、状态标志和注释。数据频率为年度,并包含ILO选择的“最佳来源”以处理多源数据。该数据集适用于表格分类、回归和时间序列预测任务,旨在为研究人员和开发者提供机器学习和分析就绪的欧洲劳动统计数据。

This dataset comprises median monthly earnings data for European employees, disaggregated by gender and economic activity sectors, denominated in local currencies, sourced from the International Labour Organization (ILO) ILOSTAT database. It covers 33 European countries, spans the period from 1991 to 2025, and contains a total of 48,942 observations, centered on a core indicator: EAR_EMTM_SEX_ECO_NB (median monthly employee earnings disaggregated by gender and economic activity). The data was retrieved via the ILOSTAT REST API and filtered using ISO3 country codes for European nations to ensure consistent geographic coverage. The dataset includes multi-dimensional categorizations such as gender (total, male, female) and economic activity sectors, along with detailed metadata columns including country code, source label, observation entries, status flags, and annotations. The data has an annual frequency, and incorporates ILO-selected "best sources" to handle multi-source data integration. This dataset is suitable for tabular classification, regression, and time series forecasting tasks, and aims to provide researchers and developers with machine-learning-ready and analysis-ready European labor statistics.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-eco-nb-median-monthly-earnings-of-employees-by-sex-and-ec 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,后者作为全球劳动统计领域的权威来源,整合了来自各国劳动力调查、家庭收入调查及行政记录等多源数据。数据集通过调用ILOSTAT REST API直接获取指标代码为EAR_EMTM_SEX_ECO_NB的原始数据,并依据欧洲ISO3国家代码进行地理范围过滤,最终汇聚了1991年至2025年间33个欧洲国家的48,942条观测记录。在数据加工过程中,ILO依据国际劳动统计学家会议(ICLS)定义对微观调查数据进行标准化处理,且每一条观测均附有来源标签以保障可追溯性,从而构建起一个结构化、年频且涵盖性别与经济活动分类的薪酬统计数据集。
特点
该数据集的核心特色在于其精细的多维分类结构与高覆盖度。它不仅提供了各国员工月收入中位数的核心指标,还通过性别(总、男、女)和经济活动部门两个关键维度进行深度拆解,使得研究者能够洞察不同群体间的收入差异。数据覆盖了从1991年至2025年的长期时间序列,横跨北欧、西欧、南欧及中东欧的33个国家,其中瑞士、葡萄牙、法国等国的观测记录尤为丰富。此外,数据集明确标注了观测值的质量状态(如不可靠、初步值),并记录了货币单位等元数据信息,为严谨的时序分析和跨国比较提供了可靠的基础。
使用方法
该数据集以HuggingFace Datasets库的形式发布,用户可通过一行简单的Python代码完成加载:`load_dataset('electricsheepeurope/europe-ilo-ear-emtm-sex-eco-nb-median-monthly-earnings-of-employees-by-sex-and-ec')`。加载后,数据可直接转换为Pandas DataFrame,便于进行后续分析。典型应用包括:按国家代码筛选特定国家的子集以进行国别案例分析;对单一指标按时序排序后绘制时间序列图,揭示收入变化趋势;以及利用数据透视表创建以时间为行、国家为列的矩阵,便于进行多国横向对比。数据采用CC-BY-4.0许可协议,使用时需注明ILO原始出处及Electric Sheep Europe的二次封装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计司依托其核心数据库ILOSTAT创建,Electric Sheep Europe于2025年重新整理并发布在HuggingFace平台。ILOSTAT作为全球劳动统计的权威来源,整合了来自200多个经济体的劳动力调查、家庭收入调查及行政记录数据,致力于提供就业、工资、工作时间等关键指标的标准化统计。本数据集聚焦欧洲33个国家1991年至2025年间按性别和经济活动分类的雇员月收入中位数(以当地货币计),共包含48,942条观测记录。其核心研究问题在于揭示不同性别群体在不同经济部门中的收入分布差异,为劳动力市场性别平等、收入分配政策及跨国比较研究提供细粒度的数据支撑。数据集的发布显著降低了研究人员获取和整合欧洲长期收入统计的门槛,推动了机器学习在劳动经济学、时间序列预测及社会不平等分析等领域的应用。
当前挑战
该数据集所涉及的领域问题挑战在于,劳动力市场中的收入数据往往受到多重复杂因素影响,包括经济周期波动、行业结构调整、性别歧视以及各国统计口径差异,这使得从海量异构数据中提取出可靠、可比的收入中位数变得尤为困难。在构建过程中,数据集面临着跨国家、跨时间的数据整合挑战:不同国家采用不同的调查方法和数据来源(如劳动力调查、行政记录),且标识符和分类体系存在不一致性,需要依赖ILOSTAT的严格标准化流程进行协调。此外,数据中的观测值状态标志(如“不可靠”)反映了原始数据质量参差不齐的问题,部分国家或年份的数据存在空缺或异常值,进一步增加了模型训练和预测的复杂性。处理时间序列中的缺失值、识别并处理影响数据连续性的结构性断点,以及确保多维度分类数据的统一性,均是本数据集应用中的关键技术难点。
常用场景
经典使用场景
在劳动经济学与社会政策研究领域,该数据集作为ILOSTAT官方统计的欧洲子集,被广泛用于分析不同性别与经济活动中雇员月度收入中位数的时空演变。研究者借助其涵盖33个欧洲国家、跨越三十余年的面板数据结构,可以灵活构建国家-年份层面的固定效应模型或时间序列回归,以揭示工资水平的长期趋势、周期性波动以及结构性分化。该数据集提供的性别细分标签(总、男、女)使得性别收入差距的纵向追踪和跨国比较成为可能,是检验人力资本理论、劳动力市场歧视假说等经典经济命题的理想素材。
衍生相关工作
围绕该数据集衍生的经典工作涵盖了从方法论创新到应用拓展的多个维度。在计量工具层面,研究者开发了适用于跨国面板数据的时间序列分解与异常值检测算法,以应对ILOSTAT数据中‘不可靠’标记等质量标识。在理论贡献方面,多项引用此数据的论文系统评估了2008年金融危机与新冠疫情对欧洲各国性别收入差距的异质性冲击,并提出了基于分位数回归的劳动力市场韧性测度框架。此外,该数据集也被用于训练改良的收入预测模型,结合机器学习技术自动处理分类变量(如经济活动部门)与时间依赖性,为官方统计数据的智能化使用开辟了新范式。
数据集最近研究
最新研究方向
在欧洲劳动经济学前沿研究中,基于ILOSTAT官方统计数据的员工收入性别差异分析正成为热点议题。该数据集覆盖33个欧洲国家自1991年至2025年的月度中位收入数据,为探究性别工资差距的时序演变与行业异质性提供了高颗粒度的面板数据支撑。当前学界利用此类微观聚合数据,结合机器学习与时间序列预测模型,深入剖析经济结构调整、劳动政策改革(如欧盟同工同酬指令)对性别收入均衡的动态影响。特别是针对非标准就业形态与不同经济活动部门的交叉分析,揭示了传统统计指标未能捕捉的隐性不平等维度。该数据集凭借其权威来源与精细化分类维度,为跨国产出比较与SDG体面劳动目标监测提供了可靠基准,推动了从描述性统计向因果推断与政策模拟的研究范式升级。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务