遇见数据集

electricsheepeurope/europe-ilo-ear-ehrg-sex-mts-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲地区员工小时收入基尼指数数据,按性别和婚姻状况划分。数据集涵盖7个欧洲国家(瑞士、葡萄牙、英国、摩尔多瓦、法国、波黑、希腊),时间跨度为1991年至2025年,共3,579个观测值。核心指标为“EAR_EHRG_SEX_MTS_NB”,即按性别和婚姻状况划分的员工小时收入基尼指数。数据以表格形式组织,包含国家代码、国家名称、数据来源、指标代码、性别分类、婚姻状况分类、观测年份、观测值、观测状态标志和注释等列。数据经过ILO基于国际劳工统计学家会议(ICLS)定义进行标准化处理,适用于表格分类、回归和时间序列预测等机器学习任务。数据集由Electric Sheep Europe重新打包,以Parquet格式发布,便于使用HuggingFace的`load_dataset()`函数直接加载。

This dataset contains Gini index of hourly earnings of employees by sex and marital status for Europe, sourced from the International Labour Organization (ILO) ILOSTAT database. It includes 3,579 observations across 7 European countries (Switzerland, Portugal, United Kingdom, Moldova, France, Bosnia and Herzegovina, Greece) spanning the years 1991 to 2025. The primary indicator is EAR_EHRG_SEX_MTS_NB – Gini index of hourly earnings of employees by sex and marital status. The data is structured in a tabular format with columns for country code, country name, data source, indicator code, sex disaggregation, marital status classification, observation year, observed value, observation status flags, and notes. The data is harmonized by ILO using International Conference of Labour Statisticians (ICLS) definitions and is suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting. Repackaged by Electric Sheep Europe in Parquet format for easy loading via HuggingFaces `load_dataset()` function.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrg-sex-mts-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
在收入不平等研究领域,精准的性别差异衡量数据是劳动经济学分析的基础。该数据集依托国际劳工组织(ILO)的ILOSTAT权威统计平台,通过REST API接口直接抽取标识为EAR_EHRG_SEX_MTS_NB的基尼系数原始数据,并依据ISO 3166-1 alpha-3国家代码筛选出欧洲七国的观测记录。数据源涵盖劳动力调查、家庭收入调查等多类国家层面的微观数据,经ILO依据国际劳工统计学家会议(ICLS)定义进行标准化处理,最终以结构化的表格形式呈现,每个观测值均附有来源标签以实现完全溯源。
使用方法
借助HuggingFace Datasets库,用户可以便捷地通过一条Python命令加载整个数据集至工作环境。加载后,数据将以Pandas DataFrame格式呈现,支持按国家代码进行子集筛选,例如单独提取某国的时序记录。针对特定指标的时间序列分析,可通过排序并绘图直观展现收入不平等的演变趋势。更为高阶的操作包括将数据透视重组为国家×年份矩阵,便于开展跨国比较面板数据分析。数据集采用CC-BY-4.0许可协议,使用者需同时标注原始数据来源ILO及其再包装方Electric Sheep Europe,以尊重数据生产与分发的贡献。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库发布,经Electric Sheep Europe团队重新打包并托管于HuggingFace平台,聚焦于欧洲7个国家(瑞士、葡萄牙、英国、摩尔多瓦、法国、波斯尼亚和黑塞哥维那、希腊)1991至2025年间按性别和婚姻状况划分的雇员时薪基尼指数。作为衡量收入不平等程度的核心指标,基尼指数在劳动经济学和社会分层研究中具有举足轻重的地位。该数据集专门针对欧洲区域,旨在提供高质量、标准化的时间序列数据,以支持经济学家、政策制定者和社会科学家深入分析欧洲劳动力市场中性别与婚姻状况对收入分配的影响,进而为缩小性别收入差距、优化劳动政策提供实证基础。其来源ILOSTAT是全球劳动统计的权威数据库,经过严格的国际劳工统计学家会议(ICLS)定义协调,确保了数据的可比性和可靠性,对劳动经济学、公共政策及社会学领域的跨国比较研究具有重要推动意义。
当前挑战
该数据集所应对的核心领域挑战在于,收入不平等,尤其是按性别和婚姻状况细分的收入差异,长期困扰欧洲劳动力市场,难以通过单一国家的统计数据揭示其全貌与演变规律。具体而言,从领域问题看,现有多数数据集缺乏对婚姻状况这一关键社会变量的细致拆分,难以区分单身、已婚等群体在收入分配中的差异化表现,限制了针对性别收入差距背后家庭结构因素的解析能力。从构建过程看,挑战体现在多源数据整合的复杂性上:ILOSTAT需从各国不同的劳动调查(如劳动力调查、行政记录)中提取并协调数据,各国调查方法、定义和频率的差异(例如‘雇员’定义是否涵盖自雇者、‘小时收入’的计算口径等)导致数据断点和标注差异(如观测状态中的‘系列中断’),需依赖ILO的‘最佳来源’选择机制进行消歧。此外,数据集仅涵盖7个欧洲国家,地理覆盖的局限性使得对东欧或南欧部分地区的代表性不足,且部分国家(如希腊)观测记录稀少,影响了跨国时间序列分析的稳健性和可推广性。
常用场景
经典使用场景
该数据集收录了1991年至2025年间欧洲7个国家按性别与婚姻状况分类的小时薪酬基尼指数,包含3,579条观测记录。在劳动经济学与社会科学研究中,它常用于跨国面板数据分析与时间序列建模,研究者可通过`ref_area`、`sex`和`time`等字段灵活筛选子集,构建国家—年份矩阵,剖析欧洲地区收入不平等程度的长期演进趋势与性别差异特征。
解决学术问题
数据集系统性地回应了收入分配领域的两大核心议题:其一,如何量化性别与婚姻状况对薪酬不平等的影响,为分解基尼指数、识别歧视性薪酬差距提供跨国、长时序的实证基础;其二,如何揭示福利制度变迁与劳动力市场政策对收入分配的调节效应,推动关于最低工资立法、集体谈判制度及社会转移支付效果的比较研究,从而深化对欧洲发达国家收入不平等驱动机制的理论认知。
实际应用
在实际政策评估中,该数据集为欧盟统计局及各国劳动部门监测《欧洲2020战略》中减贫与包容性增长目标进展提供量化锚点。国际劳工组织借助这些数据编制全球劳工统计年报,识别薪酬不平等的区域性热点,从而指导技术援助项目聚焦于性别薪酬透明度法规的实施、工会覆盖率提升以及劳动监察资源的优化配置。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲七国1991至2025年间按性别与婚姻状况划分的时薪基尼系数,为劳动经济学中的收入不平等与性别薪酬差距研究提供了精细化的面板数据。当前前沿方向集中于利用时间序列模型与机器学习方法,结合婚姻状态这一相对被忽视的维度,剖析欧洲劳动力市场中性别工资差异的动态演变。关联热点事件包括新冠疫情后欧洲多国薪酬分布的结构性变化,以及欧盟层面推动的《男女同工同酬指令》等政策实施效果评估。该数据集的独特价值在于其ILOSTAT官方来源的权威性与跨维度分解能力,能够支撑对性别、婚姻状态与宏观经济周期交互效应的因果推断研究,进而为制定更具包容性的劳动力市场政策提供实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务