遇见数据集

electricsheepeurope/europe-ilo-ear-emtg-sex-edu-nb-gini-index-of-monthly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个表格数据集,专注于欧洲员工月收入基尼指数,按性别和教育程度进行细分。它包含13,529个观测值,覆盖33个欧洲国家,时间跨度为1991年至2025年,核心指标为“EAR_EMTG_SEX_EDU_NB”(按性别和教育程度划分的员工月收入基尼指数)。数据源自国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理,适用于表格分类、回归或时间序列预测等机器学习任务。数据集列包括国家代码、指标、性别分类、教育分类、年份、观测值等,支持对收入不平等趋势的分析和建模。

This dataset is a tabular dataset focusing on the Gini index of monthly earnings of employees in Europe, disaggregated by sex and education. It comprises 13,529 observations across 33 European countries, spanning from 1991 to 2025, with the core indicator being EAR_EMTG_SEX_EDU_NB (Gini index of monthly earnings of employees by sex and education). Sourced from the International Labour Organizations (ILO) ILOSTAT database, the data is retrieved via API and harmonized, making it suitable for machine learning tasks such as tabular classification, regression, or time-series forecasting. The dataset columns include country codes, indicators, sex classifications, education classifications, years, observed values, etc., facilitating analysis and modeling of income inequality trends.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtg-sex-edu-nb-gini-index-of-monthly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集汇聚了来自国际劳工组织(ILO)核心统计数据库ILOSTAT的官方数据,聚焦于欧洲33个国家中,按性别与教育程度分层的雇员月收入基尼系数。数据通过ILOSTAT REST API直接抓取,并依据欧洲ISO3国家代码进行地域过滤,最终纳入13,529条观测记录,时间跨度从1991年至2025年。ILO统计部门依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,确保跨国家、跨时期的数据可比性,每条观测均附有数据来源标签以供追溯。
使用方法
用户可通过HuggingFace Datasets库便捷加载数据,使用`load_dataset`函数即可将数据转换为Pandas DataFrame格式,进而开展灵活的探索性分析。典型应用包括:按国家筛选(如过滤德国数据)进行纵向趋势研究;针对特定指标(如基尼指数)进行时间序列可视化,观察不平等程度随年代的变化;或利用透视表功能将数据重塑为以年份为行、国家为列的矩阵形式,便于比较不同国家在同一时间点的收入分配差异。该设计极大降低了时序与面板数据分析的技术门槛。
背景与挑战
背景概述
收入与薪酬不平等是劳动经济学与社会政策研究中的核心议题,其测度与跨国比较对理解劳动力市场结构、评估社会公平进程至关重要。基尼系数作为衡量收入分配不均等程度的经典指标,被广泛应用于各国及国际组织的政策分析之中。在此背景下,国际劳工组织(ILO)于2025年通过其ILOSTAT数据库发布了涵盖33个欧洲国家、横跨1991年至2025年共13,529条观测值的“欧洲雇员月薪基尼系数(按性别与教育程度分)”数据集。该数据集由Electric Sheep Europe在HuggingFace平台上进行规范化重封装,提供统一的Parquet格式和结构化元数据,为研究者快速开展跨性别、跨教育维度的薪酬不平等时序分析奠定了数据基础,并显著降低了多国微观数据整合与清洗的门槛。
当前挑战
该数据集所解决的领域核心挑战在于:劳动收入不平等在性别与教育维度上的交互效应长期缺乏标准化、可比较的跨国数据支撑,传统研究常受限于各国统计口径不一、数据获取成本高昂以及微观数据隐私保护的限制。在构建过程中,ILO需面对各国调查体系差异带来的数据协调难题,包括劳动力调查、住户收入调查等不同来源的统计标准统一,以及‘最佳来源’筛选、观察状态标记(如不可靠值)与教育分类非标准化注释(如非标准教育层级)等质量标识的保留。此外,数据集中部分指标为年度频率,而原始存在的高频月度或季度序列未被纳入,这限制了更细粒度波动分析与实时政策评估的能力。
常用场景
经典使用场景
在劳动经济学与收入不平等研究领域,该数据集最为经典的使用场景莫过于基于时间序列的跨国收入差距分析。研究者可借助其丰富的观测记录,追踪1991年至2025年间33个欧洲国家按性别与教育水平划分的基尼系数演变轨迹,从而揭示不同国家在收入分配格局上的异质性特征。此外,该数据还常被用于构建面板数据模型,以考察教育改革、劳动市场政策或经济周期对收入不平等的影响效应。
解决学术问题
该数据集精准回应了劳动经济学中几个悬而未决的核心学术问题:性别收入差距的长期收敛趋势是否受制于教育回报率的结构性差异?不同欧洲福利国家体制下,人力资本积累能否有效缓释收入分配失衡?通过提供精细化的性别与教育分组数据,研究者得以剥离混杂因素,识别出教育扩张对工资离散度的异质性影响,从而为解释欧洲内部收入不平等的分化格局提供了强有力的实证锚点。
实际应用
在实际应用层面,该数据集为欧盟及各国劳动部门监测性别薪酬平等政策的效果提供了关键量化工具。政策制定者可利用其年度观测数据,动态评估反歧视立法、育儿津贴制度改革或最低工资调整对男女收入差距的实际收敛效果。同时,非政府组织与智库也常以此数据集为基础,撰写关于欧洲社会公平状况的年度报告,进而为公众舆论与政策辩论提供数据支撑。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲33国1991至2025年间按性别及教育程度划分的月收入基尼系数,为劳动经济学中收入不平等的前沿研究提供了横跨三十余年的精细面板数据。当前研究热点围绕性别薪酬差距与教育回报率的交互效应,结合ILOSTAT的权威统计与欧洲各国劳动力调查,学者可系统评估教育分层如何塑造不同性别群体的收入分配格局。鉴于近年欧洲多国推行薪酬透明度法规及性别平等新政策,该数据集为验证政策效果、构建收入不平等预警模型及推动包容性经济增长提供了关键实证基础,其长时间跨度与多维度分类特性尤为珍贵。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务