遇见数据集

electricsheepeurope/europe-ilo-ear-emtg-sex-ocu-nb-gini-index-of-monthly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含31,337个观测值,涵盖33个欧洲国家从1991年至2025年的“收入与薪酬不平等”数据,重点关注一个核心指标:按性别和职业划分的员工月收入基尼系数(Gini index of monthly earnings of employees by sex and occupation)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤至欧洲国家,经过ILO的统计定义(如国际劳工统计学家会议定义)协调处理。数据集包含国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、职业分类、观测年份、观测值、数据状态标志等列,适用于表格分类、回归和时间序列预测等任务。数据为年度频率,并包含数据质量说明(如使用最佳来源、分类列的非空条件)。

This dataset contains 31,337 observations of Income and pay inequality data across 33 Europe countries, spanning 1991–2025, covering one distinct indicator: Gini index of monthly earnings of employees by sex and occupation. The data is sourced from ILOSTAT, the ILOs central statistics database, pulled via the ILOSTAT REST API and filtered to Europe ISO3 country codes, with harmonisation based on International Conference of Labour Statisticians definitions. It includes columns such as country code, country name, source, indicator code, sex disaggregation (total, male, female), occupation classification, observation year, observed value, and status flags, suitable for tabular classification, regression, and time-series forecasting tasks. The data is annual frequency, with caveats on data quality (e.g., use of best source, non-null disaggregation columns).

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtg-sex-ocu-nb-gini-index-of-monthly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于欧洲地区雇员月度收入的基尼指数,并按性别与职业进行细分。数据通过ILOSTAT的REST API接口直接获取,筛选出33个欧洲国家的ISO3代码,涵盖1991年至2025年的年度观测值,共计31,337条记录。原始数据来源于各国劳动力调查、家庭收入调查及行政记录,经ILO统计部门依据国际劳工统计学家会议(ICLS)定义进行统一整合与标准化处理,确保了跨国可比性。Electric Sheep Europe团队对数据进行了重新打包,统一转换为Parquet格式,并附带了清晰的模式说明,便于直接加载与分析。
特点
数据集的核心特色在于其精细的维度划分与高质量的时间序列结构。它仅包含一个关键指标——EAR_EMTG_SEX_OCU_NB,即雇员月度收入的基尼指数,但提供了性别(男、女、总计)与职业分类的交叉分析能力,使用户能够深入探究收入不平等在人口亚群中的异质性表现。数据覆盖33个欧洲国家,时间跨度长达35年,形成了丰富而连贯的面板数据,特别适合用于纵向比较与趋势研究。此外,每条记录均附带了数据来源、观测状态及注释字段,便于用户评估数据质量与可靠性,为严谨的学术分析提供了重要保障。
使用方法
使用者可通过HuggingFace的datasets库以一行代码加载整个数据集,并将其转换为Pandas DataFrame进行灵活操作。为便于按国家分析,可基于'ref_area'列筛选特定国家(如德国)的数据。对于时间序列研究,可针对单一指标按时间排序后直接绘图,观察收入不平等的变化趋势。若需构建国家间的对比矩阵,可借助pivot_table函数将数据重塑为以年份为行、国家为列的布局,直观展示多国同步演变态势。该数据集结构规范,标注清晰,适用于回归分析、分类任务以及时间序列预测,助力劳动经济学与社会不平等领域的实证探索。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,并由Electric Sheep Europe重新封装,聚焦于欧洲33个国家1991至2025年间基于性别与职业划分的月收入基尼系数。基尼系数作为衡量收入不平等程度的核心指标,在劳动经济学与社会政策研究中具有举足轻重的地位。该数据集依托ILOSTAT这一全球劳动统计权威数据库,整合了来自劳动力调查、家庭收入调查及行政记录的标准化数据,为探讨欧洲劳动力市场中的性别薪酬差距与职业分层问题提供了高颗粒度的时序数据支撑。其发布填补了欧洲范围内长时间跨度、多维度细分收入不平等公开数据的空白,推动了比较政治经济学与劳动社会学领域的实证研究。
当前挑战
该数据集所解决的领域核心挑战在于量化与分析欧洲各国收入不平等的演变趋势,特别是性别与职业维度下的差异化表现,这要求数据在跨国家、跨年度间保持高度可比性。构建过程中面临的挑战包括:各国原始调查问卷设计与统计口径差异导致的跨源数据异构问题;ILOSTAT需通过国际劳工统计学家会议(ICLS)定义对微观数据进行繁复的协调标准化;部分历史年份或小样本职业分类下的数据存在观测值不稳定或标记为不可靠的情况;多源数据融合时需甄别并选取“最佳来源”,以避免因调查方法差异产生的系统误差。此外,维持长时间序列的连续性,并妥善处理因国家统计体系更新带来的数据结构断裂,亦是关键难题。
常用场景
经典使用场景
在劳动经济学与社会不平等研究领域,该数据集最典型的应用场景是基于性别与职业维度的收入不平等动态监测。研究人员可借助其中涵盖1991年至2025年间33个欧洲国家、超过三万余条观测记录的基尼系数指标,构建面板数据模型,以实证分析欧洲各国工资分布的长期演变趋势,并深入探讨不同职业技能层级内部及跨性别的收入差距演化规律。
解决学术问题
该数据集有效回应了劳动经济学中关于收入分配结构变化与性别工资差距成因的经典学术问题。通过提供经国际劳工组织统一口径的跨国时序数据,它帮助学者剥离国别制度差异的干扰,精准识别职业技能升级、性别平等政策与全球化竞争对收入不平等的影响路径,从而为验证库兹涅茨曲线假说、工资极化理论以及性别歧视的统计性度量提供可靠的经验证据。
衍生相关工作
围绕该数据集,衍生出一系列以ILO统计标准为核心的经典学术与政策分析工作。其中包括基于混合效应模型对欧洲职业性别隔离与工资溢价分化的实证研究,以及利用结构分解技术揭示技术进步与制度变迁对不平等贡献度的系统性论文。此外,由国际劳工组织主导的区域不平等基准报告亦常以此数据为支撑,构建起全球劳动收入分配的监测框架,进而推动了各国在性别平等立法与薪酬透明度制度方面的现代化改革。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务