遇见数据集

electricsheepeurope/europe-ilo-ear-emtg-sex-mts-nb-gini-index-of-monthly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含16,986个观测值,覆盖33个欧洲国家,时间跨度为1991年至2025年,主要指标为按性别和婚姻状况划分的员工月收入基尼系数。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,主题聚焦于收入与薪酬不平等。数据集为表格形式,适用于表格分类、回归和时间序列预测任务。数据通过ILOSTAT REST API获取,并经过欧洲国家代码过滤,采用国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集包含多个列,如国家代码、国家名称、数据来源、指标代码、性别分类、婚姻状况分类、观测年份、观测值等,支持按性别和婚姻状况等多维度分析。数据为年度频率,并包含数据质量注释,如观测状态标志。数据集旨在为研究欧洲收入不平等提供机器学习就绪的数据支持。

This dataset contains 16,986 observations across 33 European countries, spanning from 1991 to 2025, with the primary indicator being Gini index of monthly earnings of employees by sex and marital status. The data is sourced from the International Labour Organization (ILO)s ILOSTAT database, focusing on income and pay inequality. It is in tabular format and suitable for tabular classification, regression, and time-series forecasting tasks. Data is pulled directly from the ILOSTAT REST API, filtered to European country codes, and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset includes columns such as country code, country name, data source, indicator code, sex disaggregation, marital status classification, observation year, observed value, and data quality flags. It supports multi-dimensional analysis by sex and marital status, with annual frequency and caveats on data reliability. The dataset is designed to provide machine learning-ready data for studying income inequality in Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtg-sex-mts-nb-gini-index-of-monthly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集由Electric Sheep Europe团队通过ILOSTAT REST API直接从国际劳工组织(ILO)的中央统计数据库获取,筛选出欧洲地区33个国家的ISO3代码后整理而成。数据涵盖了1991年至2025年间的16,986条观测记录,聚焦于收入与薪酬不平等领域的单一核心指标——按性别与婚姻状况划分的雇员月收入基尼系数。原始数据源于各国劳动力调查、家庭收入调查及行政记录,ILO依据国际劳工统计学家会议(ICLS)定义进行统一协调与标准化处理,确保了跨国数据的可比性与权威性。
特点
数据集呈现高维度结构化特征,包含ref_area(国家代码)、sex(性别分类)、classif1(婚姻状况分类)等多个分类变量,以及time(观测年份)和obs_value(基尼系数数值)等核心字段。其中sex维度涵盖总人口、男性与女性三种分类,支持细粒度的性别差异分析。观测状态标识(obs_status)与数据来源标注(source.label)字段为数据质量提供了可追溯性。值得注意的是,所有数据均采用年度频率发布,并在同一国家与年份存在多个数据源时优先采用ILO选定的“最佳来源”,保障了数据的一致性与可靠性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载数据,返回的Dataset对象可轻松转换为Pandas DataFrame进行后续分析。典型应用包括按国家筛选特定地区的时序数据、对指定指标按时间排序后绘制序列图以观察基尼系数演变趋势、以及利用透视表功能构建以年份为行、国家为列的矩阵,便于开展跨国比较研究。数据以Parquet格式存储,高效支持大规模时间序列分析与机器学习建模任务,开箱即用的特性显著降低了研究人员的数据预处理成本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,并经Electric Sheep Europe重新封装,聚焦于欧洲33个国家1991至2025年间雇员月收入的基尼系数,共计16,986条观测记录。作为衡量收入不平等程度的核心指标,基尼系数在劳动经济学、社会政策及可持续发展目标监测中具有举足轻重的地位。数据集依托ILOSTAT这一全球领先的劳动统计数据库,其数据源自各国劳动力调查、家庭收支调查及行政记录,经ILO统计部门统一协调与标准化处理,为研究欧洲范围内不同性别与婚姻状况群体的收入分配差异提供了权威且系统化的数据基础。该数据集的出现,极大便利了跨国比较与时间序列分析,推动了收入不平等领域实证研究的精细化与可复现性。
当前挑战
该数据集所应对的领域问题核心在于量化并比较欧洲各国不同性别与婚姻状况下雇员的收入不平等程度,从而揭示劳动力市场中的结构性差异与歧视现象。然而,数据构建过程面临多重挑战:首先,各国统计数据的采集频率、调查方法及定义标准存在显著差异,即便ILO进行了协调统一,不同时间点或国家间的观测值仍可能因调查口径不同而难以直接比较。其次,部分观测值被标记为“不可靠”(unreliable),反映了原始数据在质量与完整性上的局限。此外,数据集仅包含年度频率数据,而月度和季度序列的缺失限制了更高时间分辨率下的分析。最后,在性别与婚姻状况的细分维度中,某些类别样本量有限,可能导致统计估计的稳定性不足。
常用场景
经典使用场景
该数据集的核心应用场景在于对欧洲各国员工月度收入的性别与婚姻状况差异进行基尼系数测算,从而揭示收入不平等在社会人口结构维度上的分布特征。研究者通常利用面板数据结构,以国家、年份、性别和婚姻状态为分组变量,构建纵向比较框架。经典方法包括绘制各群体的收入不平等时间趋势图,或通过固定效应模型量化性别间与婚姻状态间的基尼系数差距。此外,该数据也广泛应用于跨国收敛分析,用以检验欧洲一体化进程中收入分配格局是否趋于均等化。其年度频率与长达三十余年的跨度为长期动态研究提供了坚实的数据基础。
实际应用
在实际应用层面,该数据集为政策制定者与社会监测机构提供了量化工具,用以评估劳工市场干预措施的效果。例如,欧盟委员会可借助性别维度的基尼系数监测其性别平等战略在各国间的落实进展,判断薪酬透明化法规是否降低了男性与女性员工内部的收入差距。国家层面的劳动与社会保障部门能够利用婚姻状态分组,识别单亲家庭或已婚双职工家庭面临的经济脆弱性,从而设计更具针对性的社会转移支付方案。此外,国际工会组织与劳工权益倡议者可通过该数据集发布年度横向比较报告,推动政策对话与公众舆论关注。
衍生相关工作
围绕该数据集已衍生出一系列经典工作。在方法论层面,研究者发展了基于基尼系数的群体分解技术,将总体不平等量化为组内不平等与组间不平等之和,并应用于性别-婚姻交叉分类。在实证方面,基于该数据涌现了多篇探讨欧洲国家养老金改革对老年女性收入不平等影响的研究,以及针对东欧转型经济体市场开放后收入分配变化的历史分析。在数据基础设施领域,Electric Sheep Europe 团队将其标准化为 HuggingFace Datasets 格式,使得研究者能够无缝对接现代机器学习工作流,进而催生了利用时间序列预测模型(如 Prophet 或 LSTM)对收入不平等短期趋势进行预测的交叉学科探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务