遇见数据集

electricsheepeurope/europe-ilo-ear-ehrg-sex-ocu-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲8个国家(包括瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、意大利和希腊)从1991年至2025年的7,650个观察值,专注于收入和薪酬不平等主题。核心指标为EAR_EHRG_SEX_OCU_NB,即按性别和职业分类的员工小时收入基尼指数,用于衡量收入分配的不平等程度。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家代码,使用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集包含多个维度,如国家、来源、指标、性别(总计、男性、女性)、职业分类、观测年份、观测值及其状态标志等,适用于表格分类、回归和时间序列预测等任务。数据以年度频率发布,部分观测可能带有不可靠等状态标识,适用于经济学、社会学研究和政策分析。

This dataset contains 7,650 observations spanning from 1991 to 2025 across 8 European countries, namely Switzerland, Portugal, France, the United Kingdom, Moldova, Bosnia and Herzegovina, Italy, and Greece, focusing on the topic of income and wage inequality. The core indicator is EAR_EHRG_SEX_OCU_NB, specifically the Gini coefficient of hourly employee earnings categorized by gender and occupation, which is used to measure the inequality of income distribution. The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), obtained via REST API, filtered to retain only European country codes, and standardized in accordance with the definitions established by the International Conference of Labour Statisticians (ICLS). The dataset encompasses multiple dimensions, including country, data source, indicator, gender (total, male, female), occupational classification, observation year, observed value and its status flag, among others, and is applicable to tasks such as tabular classification, regression and time series forecasting. The data is released on an annual frequency. Some observations may carry status flags such as 'unreliable', and the dataset is suitable for economic and sociological research as well as policy analysis.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrg-sex-ocu-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,聚焦于欧洲8国雇员小时收入的基尼指数,涵盖1991年至2025年间共7,650条观测记录。数据通过ILOSTAT REST API直接提取,并依据欧洲ISO3国家代码进行过滤筛选。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一整合,其数据来源包括劳动力调查、家庭收入调查等,并在source.label字段中标注来源信息,确保数据的可追溯性。Electric Sheep Europe团队将原始数据重新打包为标准化的Parquet格式,方便研究者直接调用。
特点
本数据集的核心特色在于其聚焦于收入不平等领域的基尼指数,并细分为性别与职业层级,提供了SEX_T(总计)、SEX_M(男性)、SEX_F(女性)三种性别维度。数据集覆盖瑞士、葡萄牙、法国等8个欧洲国家,时间跨度长达34年,观测值排列密集且分布不均,其中瑞士单一国家贡献了1,742条记录,占比最高。数据质量方面,当同一国家与年份存在多个来源时,采用ILO甄选的“最佳来源”,并附有观测状态标记(如provisional、unreliable)以反映数据可靠性。
使用方法
用户可通过HuggingFace Datasets库轻松加载该数据集,仅需一行代码`load_dataset`即可获取包含19个字段的表格,涵盖国家代码、来源、指标名称、性别分类、时间及观测值等核心信息。典型的分析流程包括按国家筛选构建子集,或针对单一指标(如EAR_EHRG_SEX_OCU_NB)按时间排序绘制趋势图。进阶应用可借助pandas的pivot_table函数将数据重塑为国家×年份的矩阵,便于进行跨国比较或时间序列建模。数据集采用cc-by-4.0许可协议,使用时需同时标注ILO原数据来源及Electric Sheep Europe的再封装信息。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门基于其核心数据库ILOSTAT构建,由Electric Sheep Europe于2025年重新整理并发布至HuggingFace平台。ILOSTAT作为全球劳动统计的权威来源,整合了来自200多个经济体的劳动力调查、家庭收入调查及行政记录数据。本数据集聚焦于欧洲8个国家(瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、意大利、希腊)在1991至2025年间小时工资的基尼指数,涵盖7650条观测记录,并按性别和职业进行分层。这一精细化的收入不平等指标为理解欧洲劳动力市场的结构性差异提供了关键数据支撑,尤其对追踪不同性别与职业群体间的薪酬鸿沟具有里程碑意义,被广泛应用于劳动经济学、社会政策及可持续发展目标(SDG)的实证研究。
当前挑战
该数据集所解决的领域核心挑战在于欧洲劳动力市场中收入不平等(尤其是基于性别和职业的薪酬差距)的量化与实证分析。传统宏观数据往往掩盖了内部结构性差异,而该数据集通过细粒度分层揭示了不同群体间的分配正义问题。在构建过程中,面临的挑战包括:数据源异构性——各国劳动力调查方法与统计口径不一(如基尼指数计算对薪酬上下限的处理差异),需要ILO遵循国际劳工统计学家会议(ICLS)标准进行统一化处理;数据质量标注——约20%的观测值被标记为不可靠(obs_status=U),需在建模中谨慎处理;以及时间序列的不连续性——部分国家(如希腊2015-2020年)仅存稀疏记录,对跨国家、跨时期的纵向分析造成偏差。
常用场景
经典使用场景
该数据集汇聚了国际劳工组织(ILO)旗下ILOSTAT数据库中欧洲八国长达三十余年(1991–2025年)的基尼系数观测值,专门用以刻画不同性别与职业类别下雇员时薪的不平等程度。研究者可借助该数据集进行面板数据分析与时间序列建模,系统考察欧洲各国薪酬差距的长期演变规律,识别性别与职业交叉维度下收入不平等的结构性特征。数据以年度频率记录,并附有详细的分类维度(如性别、职业技能水平)与观测质量标识,为劳动经济学、收入分配研究及社会政策评估提供了标准化的计量基础。其紧凑的表格结构(7,650条记录)适合直接应用于回归分析、分位数回归或机器学习中的分类与回归任务,尤其适用于探究区域间与时段间的差异比较。
解决学术问题
在劳动经济学与社会不平等研究领域,该数据集填补了欧洲范围内高分辨率、跨时期薪酬不平等数据的空白。传统研究常因数据颗粒度不足或跨国可比性缺失而难以深入探讨性别与职业交互作用对收入分布的影响,而该数据通过ILO统一制定的国际劳工统计学家会议(ICLS)标准对原始微观数据进行调和,确保了跨国与跨时段的指标一致性。借助这一数据集,学者能够量化不同欧洲国家在近三十年间的时薪基尼系数变化趋势,进而检验库兹涅茨曲线、性别歧视理论以及技能偏向型技术进步等经典假设在欧洲语境下的适用性。此外,数据中的分类变量允许研究者分解总体不平等为组内与组间成分,从而精确评估劳动力市场制度(如最低工资、集体谈判覆盖率)对薪酬公平性的调节效应。这些分析对于理解欧洲社会融合进程中的分配正义问题具有深刻的学术意义。
衍生相关工作
该数据集的发布催生了围绕欧洲薪酬不平等计量与预测的一系列衍生工作。在方法论层面,研究者基于此数据开发了针对稀疏面板数据的插补算法与贝叶斯分层模型,以克服部分国家或年份观测值缺失带来的推断挑战。时序建模方面,经典工作如利用ARIMA或Prophet框架对各国基尼系数进行短期预测,并对比不同性别与职业亚组的收敛速度。另有学者构建了多水平回归模型,将国家层面的制度变量(如劳动保护法严格度)与个体层面的基尼指数相连接,检验制度变迁对薪酬分布的异质性影响。在数据融合方向上,该数据集常与欧洲统计局的欧盟收入与生活条件统计(EU-SILC)或经合组织的收入分配数据库结合,形成更全面的收入不平等面板。此外,基于该数据集的基准测试已用于评估公平感知理论模型,并推动了性别薪酬透明度政策效果的因果推断研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务