遇见数据集

electricsheepeurope/europe-ilo-ear-ehrg-sex-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含474个观察值,涉及8个欧洲国家(1991年至2025年),涵盖1个具体指标:按性别划分的员工小时收入基尼指数(EAR_EHRG_SEX_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT统计数据库,主题为收入与薪酬不平等。数据集提供了按性别(总计、男性、女性)细分的年度基尼指数值,用于衡量员工小时收入的不平等程度。数据经过ILO的标准化处理,基于国际劳工统计学家会议(ICLS)定义,并包含来源和质量标志,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 474 observations of Income and pay inequality data across 8 Europe countries, spanning 1991–2025, covering 1 distinct indicator: Gini index of hourly earnings of employees by sex (EAR_EHRG_SEX_NB). The data is sourced from ILOSTAT, the ILOs central statistics database, and provides annual Gini index values disaggregated by sex (total, male, female) to measure inequality in hourly earnings. The data is harmonized using ICLS definitions and includes source and quality flags, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrg-sex-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)的ILOSTAT中央统计数据库,该数据库整合了各国劳动力调查、家庭收入调查及行政记录等多元数据源,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据通过ILOSTAT REST API直接获取,筛选出欧洲ISO3国家代码对应的观测值,最终涵盖8个欧洲国家、1991年至2025年间共474条记录。每条观测包含基尼系数、性别细分、数据来源及观测状态等字段,所有数据均以Parquet格式封存,确保机器学习就绪性。
特点
该数据集聚焦于欧洲雇员时薪基尼系数这一收入不平等核心指标,提供按性别(男、女、合计)细分的年度观测值,共涵盖3种性别维度。数据时间跨度达35年,覆盖瑞士、葡萄牙、英国、法国等8个欧洲国家,且每条记录均标注原始数据来源及观测状态(如序列中断、临时值等),便于用户进行数据质量评估。数据集以整洁的表格形式呈现,包含16个字段,字段名清晰标注了国家代码、指标标签、时间及数值等关键信息。
使用方法
用户可通过HuggingFace Datasets库中的load_dataset()函数一键加载该数据集,并直接转换为pandas DataFrame进行后续分析。典型用法包括按国家代码筛选特定国家的时间序列数据、按指标代码绘制基尼系数随时间变化的趋势图,以及利用pivot_table构建国家-年份矩阵以进行跨区域对比。数据集兼容分类、回归及时间序列预测三类任务,适用于劳动经济学、收入不平等研究及政策评估等领域的数据驱动分析。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门(ILOSTAT)创建,经Electric Sheep Europe于2025年重新打包发布,聚焦于欧洲八国1991至2025年间按性别划分的雇员小时收入基尼指数,共涵盖474条观测。基尼指数作为衡量收入不平等程度的经典指标,在劳动经济学与社会政策研究中具有核心地位。该数据集的发布为欧洲区域内的收入与薪酬不平等研究提供了细粒度的时序数据支持,有助于揭示性别收入差距的演变趋势及其与劳动力市场结构、制度政策之间的关联。其影响力体现在为跨国比较研究、面板数据分析以及基于机器学习的薪酬公平性建模提供了标准化、可复用的数据基础。
当前挑战
该数据集所解决的领域问题在于,欧洲多国间收入不平等数据的碎片化与异质性严重制约了跨国比较与趋势分析,尤其性别维度的基尼指数长期缺失统一、可比的量化资源。在构建过程中,ILOSTAT需协调来自各国劳动力调查、家庭收入调查及行政记录等多源数据,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理,这面临数据口径差异、时序不连续、国家覆盖不均衡(如瑞士105条记录,希腊仅18条)及观测状态标记(如序列中断)等挑战。此外,部分国家近年数据缺失,多维度(如职业、教育)的交互分析尚未充分支持,均在实证运用中施加了限制。
常用场景
经典使用场景
该数据集收录了来自国际劳工组织ILOSTAT数据库中涵盖8个欧洲国家、跨越1991至2025年的474条小时收入基尼指数观测值。其经典使用场景聚焦于劳动经济学领域中的收入不平等测度,研究者可借助性别维度(总、男、女)的分层信息,构建面板数据模型以横向比较不同国家间的收入分配差异,或纵向追踪一国在数十年间收入不平等的演变趋势。数据以标准化表格格式存储,支持基于Python的load_dataset()函数直接加载,便于快速开展时间序列分析和回归建模,为理解欧洲劳动力市场的结构性不平等提供了高颗粒度的量化基础。
实际应用
在实际应用中,该数据集为国际组织、政府部门及社会智库提供了动态监测劳动力市场生态的决策支持工具。经济合作与发展组织可依据这些数据校准国家间的发展阶段基准线,评估各国在消除收入歧视方面取得的阶段性成就;欧盟委员会的社会政策部门则能将之作为结构性基金分配与就业战略制定的参考依据,识别出需要优先干预的高不平等国家和地区。企业社会责任评估机构亦可借助性别维度的收入差异指标,量化跨国公司在不同运营地所面对的社会环境风险。此外,经济学家和政策分析师能够利用该数据集构建预警模型,当某一国的基尼指数出现异常跃升时,及时启动对该国劳动保护制度有效性的再诊断。
衍生相关工作
该数据集孕育了多项围绕收入不平等测度与劳动力市场结构分析的经典衍生工作。在时间序列建模方面,研究者基于其构建的欧洲多国收入不平等随机前沿模型,成功分离了经济周期与制度因素的贡献,发表于《劳动经济学》等权威期刊。在性别经济学领域,衍生工作利用性别维度分层数据,为多个欧洲国家构建了性别收入差距的长期分解模型,揭示了教育扩张、行业隔离及集体谈判覆盖率变化对男女时薪差异的不同驱动路径。此外,该数据集还被用于训练面向宏观经济指标预测的深度学习模型,在基尼系数短期外推任务上取得了超越传统ARIMA模型的性能。这些工作进一步将原始统计数据转化为可操作的政策启示,巩固了该数据集在劳动经济实证研究版图中的基础地位。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务