遇见数据集

electricsheepeurope/europe-ilo-ear-emtg-sex-dsb-nb-gini-index-of-monthly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲32个国家从2004年到2025年的月度收入基尼指数数据,专注于按性别和残疾状况分类的员工收入不平等情况。数据集共有5,363个观测值,覆盖一个核心指标:EAR_EMTG_SEX_DSB_NB(按性别和残疾状况分类的员工月度收入基尼指数)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,并通过Electric Sheep Europe重新打包,以方便机器学习使用。数据集采用表格形式,包含国家代码、国家名称、数据来源、指标代码、性别分类、残疾状况分类、观测年份、观测值、数据状态标志等字段。数据可用于表格分类、回归或时间序列预测任务,适用于研究收入不平等、劳动力市场分析等场景。

This dataset contains 5,363 observations of the Gini index of monthly earnings for employees, disaggregated by sex and disability status, across 32 European countries from 2004 to 2025. It focuses on income and pay inequality, with a single indicator: EAR_EMTG_SEX_DSB_NB (Gini index of monthly earnings of employees by sex and disability status). The data is sourced from the International Labour Organization (ILO) ILOSTAT database and repackaged by Electric Sheep Europe for machine learning readiness. The dataset is in tabular format, including columns such as country code, country name, data source, indicator code, sex classification, disability status classification, observation year, observed value, and data quality flags. It is suitable for tabular classification, regression, or time-series forecasting tasks, and can be used for research on income inequality, labor market analysis, and related areas.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtg-sex-dsb-nb-gini-index-of-monthly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集基于国际劳工组织(ILO)的ILOSTAT数据库构建,数据通过REST API从官方接口(https://rplumber.ilo.org/data/indicator?id=EAR_EMTG_SEX_DSB_NB)直接抽取,并筛选出欧洲32个国家的ISO3代码进行地理范围限定。ILOSTAT利用国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调,来源涵盖劳动力调查、家庭收入调查、机构调查及行政记录,并通过source.label列标注数据来源以确保可追溯性。最终由Electric Sheep Europe完成重新打包与标准化处理。
特点
本数据集收录了2004至2025年间欧洲32个国家的5,363条观测记录,聚焦于一项核心指标——按性别和残疾状况划分的雇员月收入基尼指数(EAR_EMTG_SEX_DSB_NB)。数据支持性别维度(总、男、女)的细粒度拆解,并包含丰富的注释字段,如观察状态标记、分类变量说明及来源注释,为分析收入不平等提供了可靠且透明的数据基础。其覆盖范围广、时间跨度长,便于开展跨国家与跨时期的比较研究。
使用方法
用户可通过HuggingFace Datasets库中的load_dataset()函数便捷加载该数据集,将其转换为Pandas DataFrame后即可进行各类分析操作。例如,可依据ref_area列筛选特定国家的时间序列数据,利用pivot_table方法构建国家×年份的矩阵,或直接对obs_value进行可视化呈现。数据集以表格形式组织,包含23个字段,支持分类、回归及时间序列预测等多样化下游任务,适合经济学与劳动社会学领域的量化研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT数据库整合发布,并由Electric Sheep Europe重新封装,聚焦于欧洲32个国家2004至2025年间雇员月收入的基尼系数,涵盖了性别与残疾状态两个关键维度的分解。收入不平等是劳动经济学中核心的研究议题,而残疾人群体的收入差距往往被传统不平等指标所忽视。该数据集通过标准化ILO的统计方法,统一了来自各国劳动力调查、家庭收入调查等多源异构数据,为跨国家、跨时间维度的比较研究提供了坚实基础,推进了对欧盟及周边国家包容性增长与劳动力市场分层问题的量化分析。其发布对于追踪可持续发展目标(SDGs)中体面工作与经济增长的进展具有重要参考价值。
当前挑战
该数据集所应对的领域挑战在于如何精准量化残疾人口在劳动力市场中的收入不平等状况,这一群体长期缺乏系统性、可比性的跨国面板数据。基尼系数虽为衡量不均衡分配的经典指标,但其对性别与残疾状态的交叉分解要求数据源具备高颗粒度,而各国在残疾定义、调查覆盖范围与统计口径上存在显著差异,导致跨国产出难以直接对齐。在构建过程中,ILO需从超过200个经济体的原始微观数据中协调统一,采用ICLS定义进行标准化,并标记数据来源与质量标识以维护透明度。此外,数据集面临样本量与时效性之间的平衡:尽管包含5,363条观测,部分国家年份的观测因数据可靠性问题被打上不可靠或临时性标记,反映出国家统计能力差异对面板完整性的制约。
常用场景
经典使用场景
在劳动经济学与社会分层研究中,该数据集最经典的使用场景是评估欧洲各国劳动力市场中的收入不平等程度及其演变趋势。凭借其覆盖32个欧洲国家、时间跨度长达二十余年的面板数据结构,研究者能够量化不同性别与残疾状态群体的基尼系数,从而揭示收入分配在多重社会维度上的差异。该数据将国际劳工组织官方统计与细颗粒度的分组标签相结合,为跨国家、跨时期的纵向比较分析奠定了坚实基础,尤其适合用于评估福利政策、最低工资制度以及劳动保障法规对收入分配格局的长期影响。
解决学术问题
该数据集有效解决了劳动经济学中关于收入不平等多重嵌套结构的实证难题。传统宏观统计往往掩盖了性别、残疾状态等群体内部的异质性,而本数据集则通过提供精准的细分基尼系数,使研究者得以同时考察总体不平等与子群体内的收入离散程度。它回应了学界长期关注的“弱势群体收入风险”问题——即在经济波动与制度变迁背景下,女性与残疾劳动者是否承受更高的收入不稳定性。该数据的发布推动了双重差分、分位数回归等方法在跨国收入分析中的应用,并显著提升了国际劳动统计比较的科学性与可靠性。
衍生相关工作
基于该数据集,学界已衍生出多项具有影响力的研究工作。有学者将其与欧洲社会调查数据相融合,构建了涵盖劳动报酬、社会保护与工作条件等多维度的劳工福利综合指数。另一支研究则利用该数据的离散化结构,训练了用于预测国家层面收入不平等演变趋势的时间序列模型,并成功识别出金融危机与疫情冲击后收入分化的非线性响应模式。同时,该数据集还催生了若干关于残疾劳动者就业质量的空间计量分析,揭示了不同欧洲福利体制对残障群体收入保障的差异化效应,为后续比较政治经济学研究提供了关键经验证据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务