electricsheepeurope/europe-ilo-ear-ehrg-sex-edu-nb-gini-index-of-hourly-earnings-of-employees-by-sex
收藏数据链接:
官方服务:
资源简介:
该数据集包含6,622个关于收入和薪酬不平等情况的观测数据,覆盖8个欧洲国家,时间跨度为1991年至2025年,涵盖1个独特指标。具体来说,数据集主要关注员工每小时收入的基尼指数,按性别和教育程度进行细分,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,经过Electric Sheep Europe重新打包,以表格形式提供,适用于分类、回归和时间序列预测等任务。
This dataset contains 6,622 observations of Income and pay inequality data across 8 Europe countries, spanning 1991–2025, covering 1 distinct indicators. Specifically, it focuses on the Gini index of hourly earnings of employees by sex and education, sourced from the International Labour Organization (ILO) ILOSTAT database, repackaged by Electric Sheep Europe, and provided in tabular format suitable for tasks such as classification, regression, and time-series forecasting.
提供机构:
electricsheepeurope搜集汇总
数据集介绍

构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过调用其REST API接口获取指标代码为EAR_EHRG_SEX_EDU_NB的原始观测数据,并依据ISO 3166-1 alpha-3标准筛选出欧洲8个国家的记录。数据经ILO依据国际劳工统计学家会议(ICLS)定义进行统一化处理,保留了来源标签以追溯原始调查类型,如劳动力调查或行政记录,并由Electric Sheep Europe团队进行重新封装与标准化,最终形成包含6,622条观测值的数据集。
特点
数据集聚焦于欧洲八国(瑞士、葡萄牙、英国、法国等)1991年至2025年间按性别与教育程度划分的小时收入基尼系数,是反映收入与薪酬不平等的关键指标。数据以年度频率呈现,提供了按性别(总、男、女)与教育水平的细粒度分解,并附有观测状态标志(如不可靠值)及详细的注释字段,便于用户识别数据质量与来源。所有条目均源于ILO甄选的‘最佳来源’,确保了跨国家与时间序列的一致性与可比性。
使用方法
用户可通过HuggingFace的`datasets`库直接加载数据集:`load_dataset("electricsheepeurope/europe-ilo-ear-ehrg-sex-edu-nb-gini-index-of-hourly-earnings-of-employees-by-sex")`,并将其转换为Pandas DataFrame以便分析。典型应用包括按国家代码筛选特定国家的时间序列数据、对单一指标按时间排序并绘制变化趋势,或使用透视表构建以年份为行、国家为列的矩阵,从而直观比较不同经济体间的收入不平等演进。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)发布,经Electric Sheep Europe重新整理后于2025年公开,聚焦于欧洲8个国家1991至2025年间按性别与教育程度划分的每小时收入基尼系数。基尼系数作为衡量收入不平等程度的核心指标,在劳动经济学与社会分层研究中具有重要地位。数据集覆盖瑞士、葡萄牙、英国、法国等国家,共包含6,622条观测记录,为探究欧洲劳动力市场中性别与教育维度下的收入差距演变提供了跨国家、长时序的标准化数据基础。其依托ILOSTAT这一全球权威劳动统计数据库,通过统一的统计口径与数据清洗流程,显著提升了跨国比较的可靠性与研究可复现性。
当前挑战
该数据集面临的核心挑战在于多源异构数据的整合与质量标注:各国调查数据来源各异(如劳动力调查、行政记录),即便经ILO协调统一,仍存在观测状态标记为不可靠(U)或存在非标准化教育分类等情况,直接影响分析结论的稳健性。此外,数据覆盖的国家数量有限(8国)且时序完整度不均,如意大利止于2020年、希腊始自2015年,限制了面板数据分析的广度与深度。在构建层面,从多样化国家统计体系中提取并标准化教育水平与性别分组信息,同时确保跨时期指标可比性,是技术实现上的显著难点。
常用场景
经典使用场景
在欧洲劳动经济学与社会分层研究领域,基于国际劳工组织ILOSTAT数据库整理的小时收入基尼系数数据集,为探究性别与教育维度下的收入不平等提供了标准化的量化工具。研究人员常利用该数据集构建面板数据模型,分析欧洲八国(如瑞士、葡萄牙、英国等)在1991至2025年间收入分配的动态演变轨迹,通过控制性别与教育分类变量,揭示不同社会群体间收入差距的结构性特征。该数据集的经典用法在于支持跨国家、跨时段的比较研究,尤其适合采用固定效应或随机效应回归,检验教育回报率对收入不平等的影响机制,或评估劳动力市场制度变革(如最低工资政策)的分配效应。
衍生相关工作
围绕该数据集衍生了多项具有影响力的学术工作,包括基于机器学习的收入不平等预测模型、多层级结构方程框架下的性别收入差距分解研究以及结合空间计量方法考察收入不平等在欧洲区域间的溢出效应等经典案例。研究者常将其与劳动力调查微观数据或教育成就数据集进行链接,构建复合型分析体系。此外,该数据集的标准化时序结构也催生了若干时间序列预测基准测试工作,例如利用长短期记忆网络或门控循环单元模型预测未来五年的性别教育收入基尼指数变化趋势。在数据科学社区中,该数据集被广泛用作分类与回归任务的基准测试资源,尤其因其维度丰富且标注规范,成为评估算法在表格数据处理上泛化能力的重要工具之一。
数据集最近研究
最新研究方向
在收入与薪酬不平等的前沿研究中,该数据集为探索欧洲八国按性别与教育程度划分的时薪基尼系数提供了珍贵的纵向数据支撑,覆盖1991至2025年间的逾六千笔观测。当前,学界正借助此类精细化的ILOSTAT微观数据,深入剖析劳动力市场中教育回报率的结构性差异及其对性别工资差距的传导效应,并与欧洲各国后疫情时代的就业复苏政策、最低工资法案调整等热点事件紧密关联。该数据的核心价值在于,它突破了传统宏观基尼系数的泛化局限,使得研究者能够精准量化不同教育层级内性别间薪酬离散度的演变轨迹,从而为欧盟“2030年缩小性别就业与薪酬差距”的宏伟目标提供了动态监测的实证锚点,对制定包容性增长策略具有不可替代的参考意义。
以上内容由遇见数据集搜集并总结生成



