遇见数据集

electricsheepeurope/europe-ilo-ear-ehrg-sex-eco-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的按性别和经济活动划分的员工小时收入基尼指数(指标代码:EAR_EHRG_SEX_ECO_NB)数据,专门针对欧洲地区。数据集涵盖了8个欧洲国家(瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、意大利、希腊)在1991年至2025年期间的15,897个观测值。数据按年度频率提供,并通过性别(总计、男性、女性)和经济活动(广泛部门)等维度进行细分。数据集经过重新包装,旨在为机器学习和研究提供统一、可直接使用的格式,包含国家代码、指标值、观测状态、数据来源注释等结构化字段。

This dataset contains the Gini index of hourly earnings of employees by sex and economic activity (indicator code: EAR_EHRG_SEX_ECO_NB) data from the International Labour Organization (ILO) ILOSTAT database, specifically for Europe. It comprises 15,897 observations across 8 European countries (Switzerland, Portugal, France, United Kingdom, Moldova, Bosnia and Herzegovina, Italy, Greece) spanning the years 1991 to 2025. The data is provided at annual frequency and is disaggregated by dimensions such as sex (total, male, female) and economic activity (broad sector). Repackaged for machine learning readiness, the dataset includes structured fields like country codes, indicator values, observation status, and data source notes.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrg-sex-eco-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT核心统计数据库,聚焦于欧洲地区雇员小时收入基尼系数的性别与经济活动维度分解。数据通过ILOSTAT的REST API接口直接抽取,仅保留欧洲八国(瑞士、葡萄牙、法国等)的ISO3国家代码记录,原始调查微观数据经由国际劳工统计学家会议(ICLS)定义进行统一协调处理。最终形成包含15,897条观测值、覆盖1991年至2025年时间跨度的面板数据,数据来源字段详实标注以供溯源。
特点
数据集以单一核心指标——基于性别与经济活动的雇员小时收入基尼系数——为主线,辅以性别细分维度(总、男、女)及经济活动分类变量,提供标准化的面板结构。其独特性在于整合了多国多年份的官方统计资料,同时保留数据质量标记(如不可靠值标识),并附加来源代码与注释信息,确保研究者能对数据可靠性进行独立评估。数据以Parquet格式封装,可直接利用HuggingFace Datasets库加载,极大降低了预处理复杂度。
使用方法
用户可通过Python的`datasets`库以`load_dataset`函数一键加载数据,并转换为Pandas DataFrame格式进行后续分析。典型操作包括按国家代码筛选子集、针对单一指标按时间排序以绘制时序趋势图,或利用透视表将数据重塑为国家×年份的矩阵形式,便于跨国家比较或面板回归建模。数据集中还包括观测状态标志位,建议在分析前根据`obs_status`字段过滤不可靠值,以保障结论的稳健性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其核心统计数据库ILOSTAT编制,由Electric Sheep Europe于2025年重新打包发布,聚焦于欧洲8个国家1991年至2025年间按性别和经济活动划分的每小时收入基尼系数。基尼系数作为衡量收入不平等程度的经典指标,在劳动经济学与社会分层研究中具有核心地位。该数据集涵盖了瑞士、葡萄牙、法国、英国等国家的15897条观测记录,数据源包括劳动力调查、家庭收入调查等官方统计资料,并经由ILO按照国际劳工统计学家会议(ICLS)标准进行统一协调。该数据集的发布为研究欧洲劳动力市场中性别收入差距的长期演变趋势、评估经济政策对收入分配的影响,以及构建跨国收入不平等比较模型提供了系统化、标准化的高质量数据基础,对推动劳动经济学、社会不平等研究以及可持续发展目标(SDG)中的体面劳动指标监测具有显著贡献。
当前挑战
该数据集所应对的核心领域挑战在于精准量化与比较不同国家、不同性别及不同经济活动类别下的收入不平等水平,特别是基尼系数作为综合指标的敏感性与数据质量高度相关。在构建过程中,面临的挑战包括:1)多源数据的整合与标准化,不同国家的劳动力调查在设计、抽样方法、变量定义上存在差异,ILO需通过复杂的协调流程确保数据可比性;2)时间序列的连续性难以保证,例如部分国家(如希腊、意大利)数据仅覆盖有限年份,且存在观测状态标记为不可靠(obs_status=U)的情况;3)分类维度(性别、经济活动)的细分导致数据稀疏性问题,尤其在交叉分析时样本量不足;4)数据获取与更新依赖于各国统计机构的及时报送,存在滞后性与数据缺口,影响模型的时效性与外推能力。
常用场景
经典使用场景
该数据集聚焦于欧洲八国(瑞士、葡萄牙、法国、英国等)时薪收入的基尼系数,涵盖1991至2025年间的近1.6万条观测记录。其经典使用场景在于分析不同性别与经济部门间的收入不平等动态,研究者可借助时间序列建模追踪收入分配格局的演变。通过按性别(男女总计)和广泛经济部门进行分层,该数据为探讨劳动报酬差异提供了细粒度视角。通常被用于构建面板数据回归模型,以评估制度变迁、技术进步或全球化对收入不均的异质性冲击,尤其在比较福利国家体制下的薪酬公平性时具有独特价值。
衍生相关工作
基于该数据集衍生的经典工作主要围绕不平等指标的动态预测与政策反事实模拟展开。一方面,研究者利用长跨度面板数据训练时序预测模型(如ARIMA或Prophet),以预判未来五年内各国基尼系数的演化路径,为预警机制提供依据。另一方面,结合双重差分法或合成控制法,学者已将数据用于评估2008年金融危机期间欧盟薪资救助计划对性别收入平等的异质性影响。在计量方法创新上,该数据集催生了分位数基尼系数分解技术,能够分离出不同收入分位点的贡献来源。值得注意的是,该数据还被整合进多源数据库如OECD收入分配数据库,成为跨国不平等比较项目的核心组成部分。
数据集最近研究
最新研究方向
在劳动经济学与社会不平等研究的交汇处,该数据集为探究欧洲各国小时工资的性别薪酬差异及其经济活动的结构性根源提供了宝贵的时间序列素材。当前前沿研究方向聚焦于利用基尼系数这一经典指标,结合性别与行业分类维度,深度解析金融危机、新冠疫情及数字化转型等重大事件对收入分配格局的冲击。研究者借助该数据集的年度观测值,可动态追踪1991年至2025年间欧洲八国薪酬不平等性的演变轨迹,并揭示不同经济部门内女性与男性劳动者在收入极化现象中的差异化暴露程度。此数据集的价值在于其纵贯三十余年的长周期覆盖与ILO标准化的方法论基础,为验证效率工资理论、人力资本溢价以及制度性补偿差异等经典假设提供了实证锚点,同时为欧盟层面设计更具包容性的薪酬政策和缩小性别收入差距的干预措施注入了数据驱动的决策依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务