遇见数据集

electricsheepeurope/europe-ilo-ear-emtg-sex-nb-gini-index-of-monthly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲国家员工月收入基尼指数统计数据,涵盖33个欧洲国家,时间跨度为1991年至2025年,共1,963个观测值。数据核心指标为EAR_EMTG_SEX_NB,即按性别划分的员工月收入基尼指数,用于衡量收入不平等程度。数据集提供了详细的列信息,包括国家代码、国家名称、数据来源、指标代码、性别分类(总计、男性、女性)、观测年份、观测值、观测状态及相关注释。数据经过ILO harmonisation处理,基于国际劳工统计学家会议(ICLS)定义,并标注来源以确保可追溯性。该数据集适用于表格分类、回归和时间序列预测等任务,专注于收入与薪酬不平等主题。

许可证:CC-BY-4.0 语言: - 英语 任务类别: - 表格分类 - 表格回归 - 时间序列预测 多语言属性:单语言 样本量类别: - 1000 < 样本量 < 10000 标签: - 表格数据 - 欧洲 - ILOSTAT - 收入与薪酬不平等 - ILO(国际劳工组织,International Labour Organization) - 劳工 - 就业 美观名称:"按性别划分的雇员月收入基尼系数 | 欧洲(ILOSTAT)" # 按性别划分的雇员月收入基尼系数 | 欧洲(ILOSTAT) 🇪🇺 **1,963条观测数据** · **33个欧洲国家** · **1991–2025年** · *由[Electric Sheep Europe](https://huggingface.co/electricsheepeurope)重新整理发布* ![rows](https://img.shields.io/badge/rows-1,963-blue) ![countries](https://img.shields.io/badge/countries-33-green) ![years](https://img.shields.io/badge/years-1991–2025-orange) ![indicators](https://img.shields.io/badge/indicators-1-purple) ![license](https://img.shields.io/badge/license-cc-by-4.0-lightgrey) ## 快速概览(TL;DR) 本数据集包含覆盖**33个欧洲国家**的**1,963条收入与薪酬不平等**观测数据,时间跨度为**1991–2025年**,涵盖**1个专属指标**。 ## 数据源说明 **ILOSTAT**(国际劳工组织统计数据库,International Labour Organization Statistical Database)是国际劳工组织(ILO,International Labour Organization)的核心统计数据库,也是全球领先的劳工统计权威来源。其收录的指标涵盖就业、失业、工资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标(SDG)的体面工作目标——数据源自全国劳动力调查、家庭收入调查、机构调查以及行政记录,覆盖全球200余个经济体,由国际劳工组织统计部门负责数据的标准化协调。 - **数据源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EMTG_SEX_NB) - **发布方**:国际劳工组织(ILO,International Labour Organization) - **许可协议**:[CC-BY-4.0](https://creativecommons.org/licenses/by/4.0/) - **主题**:收入与薪酬不平等 ## 数据处理方法 本数据集直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=EAR_EMTG_SEX_NB`拉取原始数据,并筛选出欧洲地区的ISO3国家代码子集。ILOSTAT采用国际劳工统计学家会议(ICLS,International Conference of Labour Statisticians)的定义对原始调查微观数据进行标准化协调;数据来源可通过`source.label`字段进行溯源追踪。 ## 地理覆盖范围 33个欧洲国家 · 以下按数据行数排序展示部分国家: | 国家 | 行数 | 起始年份 | 结束年份 | |---------|-----:|-----------:|----------:| | `CHE` | 105 | 1991 | 2025 | | `PRT` | 84 | 1998 | 2025 | | `AUT` | 63 | 2004 | 2024 | | `DNK` | 63 | 2004 | 2024 | | `BEL` | 63 | 2004 | 2024 | | `IRL` | 63 | 2004 | 2024 | | `FRA` | 63 | 2004 | 2024 | | `FIN` | 63 | 2004 | 2024 | | `EST` | 63 | 2004 | 2024 | | `SWE` | 63 | 2004 | 2024 | | `NOR` | 63 | 2004 | 2024 | | `LUX` | 63 | 2004 | 2024 | | `POL` | 60 | 2005 | 2024 | | `GBR` | 60 | 2005 | 2025 | | `HUN` | 60 | 2005 | 2024 | | ... | _另有18个国家_ | | | ## 指标(示例) - `EAR_EMTG_SEX_NB` — 按性别划分的雇员月收入基尼系数 ## 数据结构 | 字段名 | 数据类型 | 字段说明 | 示例值 | |--------|------|-------------|---------| | `ref_area` | `string` | ISO 3166-1 alpha-3 国家代码 | `AUT` | | `ref_area.label` | `string` | 英文国名 | `Austria`(奥地利) | | `source` | `string` | ILOSTAT 数据源代码(如劳动力调查) | `BB:275` | | `source.label` | `string` | 英文数据源名称 | `HIES - EU Statistics on Income and Li…`(HIES——欧盟收入与负债统计……) | | `indicator` | `string` | ILOSTAT 指标代码 | `EAR_EMTG_SEX_NB` | | `indicator.label` | `string` | 英文指标名称 | `Gini index of monthly earnings of emp…`(雇员月收入基尼系数……) | | `sex` | `string` | 性别细分维度(`SEX_T`=总计,`SEX_M`=男性,`SEX_F`=女性) | `SEX_T` | | `sex.label` | `string` | — | `Total`(总计) | | `time` | `int64` | 观测年份 | `2024` | | `obs_value` | `float64` | 观测指标值(单位因指标而异,请参阅指标定义) | `0.313` | | `obs_status` | `string` | 观测状态标记(如临时、不可靠) | `B` | | `obs_status.label` | `string` | — | `Break in series`(序列中断) | | `note_indicator` | `string` | — | `T30:161` | | `note_indicator.label` | `string` | — | `Currency: AUT - Euro (EUR)`(货币:奥地利——欧元(EUR)) | | `note_source` | `string` | — | `R1:3513_T2:85` | | `note_source.label` | `string` | — | `Repository: ILO-STATISTICS - Micro da…`(存储库:ILO统计数据库——微观数据……) | ## 细分维度 以下字段提供数据细分维度: - **`sex`**(共3个唯一值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 数据为年度频率。部分指标同时发布月度或季度序列,但本数据集未包含此类数据。 - 当同一国家×年份的同一指标存在多个数据源时,将采用国际劳工组织选定的“最优数据源”。 - 细分字段(`sex`、`classif1`、`classif2`)仅在指标支持对应细分时才会非空。 ## 使用方法 python from datasets import load_dataset ds = load_dataset("electricsheepeurope/europe-ilo-ear-emtg-sex-nb-gini-index-of-monthly-earnings-of-employees-by-sex") df = ds["train"].to_pandas() print(df.head()) ### 筛选单个国家 python germany = df[df["ref_area"] == "DEU"] ### 单个指标的时间序列数据 python sample = (df[df["indicator"] == "EAR_EMTG_SEX_NB"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EAR_EMTG_SEX_NB") ### 转换为国家×年份矩阵 python matrix = (df[df["indicator"] == "EAR_EMTG_SEX_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{europe_ilo_ear_emtg_sex_nb_gini_index_of_monthly_earnings_of_employees_by_sex_2025, title = {Gini index of monthly earnings of employees by sex | Europe (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EMTG_SEX_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Europe}, howpublished = {url{https://huggingface.co/datasets/electricsheepeurope/europe-ilo-ear-emtg-sex-nb-gini-index-of-monthly-earnings-of-employees-by-sex}} } ## 许可协议 本数据集采用[CC-BY-4.0](https://creativecommons.org/licenses/by/4.0/)许可协议发布。 原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始数据源与Electric Sheep Europe的重新整理版本。 ## 关于Electric Sheep Electric Sheep Europe是Electric Sheep项目的组成部分:该项目旨在为HuggingFace平台上的欧洲数据构建统一的、可供机器学习直接使用的数据层。我们从权威开源数据源拉取数据,标准化数据结构,以Parquet格式打包发布,并采用统一的数据集卡片规范,使研究人员与开发者可通过`load_dataset()`函数在数秒内启动数据分析工作。 浏览完整数据集集合:[huggingface.co/electricsheepeurope](https://huggingface.co/electricsheepeurope) --- _数据溯源:2026年5月28日通过Electric Sheep流水线导入。源URL:https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EMTG_SEX_NB_

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtg-sex-nb-gini-index-of-monthly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集通过调用ILOSTAT REST API直接获取原始指标数据,过滤出欧洲33个国家的ISO3代码对应的观测值,共汇集了1991年至2025年间1963条收入与薪酬不平等领域的记录。ILO的统计部门依据国际劳工统计学家会议定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行协调处理,确保跨国的可比性,并将数据来源标注于source.label列中以实现溯源。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数一键加载数据,随后将其转换为Pandas DataFrame以便进行探索与分析。数据支持基于国家代码进行滤波,对同一指标按时间序列进行排序和绘图,亦可利用透视表功能快速构建以年份为行、国家为列的价值矩阵,为面板数据分析或时间序列建模提供了便利的预处理基础。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,经Electric Sheep Europe重新封装,聚焦于欧洲33个国家1991至2025年间按性别划分的月收入基尼指数。基尼指数作为衡量收入不平等程度的经典指标,在劳动经济学与社会政策研究中占据核心地位。该数据集依托ILO的ILOSTAT数据库,后者整合了全球200多个经济体的劳动力调查、家庭收入调查等官方数据,为跨国比较提供了标准化基准。数据集包含1963条观测记录,覆盖性别维度(总性别、男性、女性)的细粒度划分,旨在支撑收入分配、性别工资差距及劳动市场结构性失衡等前沿议题的实证分析,对欧洲劳动经济学与可持续发展目标(SDG)研究具有重要参考价值。
当前挑战
该数据集面临的核心挑战源于收入不平等度量本身的复杂性。首先,基尼指数的计算高度依赖高质量微观调查数据,而各国在调查设计、统计口径与数据采集频率上的差异,导致跨国家、跨时期的可比性存在隐忧。例如,部分国家数据来源为劳动力调查,另一些则依赖家庭收支调查,不同调查方法可能引入系统性偏差。其次,数据构建过程中面临来源碎片化与质量标注不一的困难,ILO虽通过‘最佳来源’策略进行筛选,但观察值状态标识(如‘序列中断’)提示数据连续性可能受损,这对于时间序列分析构成严格限制。此外,性别维度的缺失值问题在部分国家较为突出,可能削弱对性别收入差距的稳健推断能力。
常用场景
经典使用场景
该数据集的核心价值在于为研究者提供了一个跨越33个欧洲国家、涵盖1991至2025年间月收入基尼系数的标准化面板数据。其最经典的使用场景是构建收入不平等的时间序列分析,通过按性别分层的观测值,学者可以细致刻画欧洲各国劳动收入分配格局的长期演变轨迹。数据集以年度频率呈现,并附有数据来源标识和质量状态标记,非常适合用于跨国的比较研究。
解决学术问题
在学术研究层面,该数据集有效解决了欧洲范围内收入不平等比较研究中的数据碎片化和口径不统一问题。它使研究者能够基于国际劳工组织统一调和的统计数据,系统探索性别收入差距的宏观经济决定因素、劳动力市场制度对分配公平的影响,以及福利国家体制与收入极化之间的关联。这一数据集为验证库兹涅茨曲线假说、分析全球化与技术变革的收入分配效应提供了坚实的经验基础。
实际应用
在实际应用中,该数据集为国际组织、政府智库和社会政策制定者提供了关键证据。利用这些基尼系数数据,相关机构可以监测各国实现联合国可持续发展目标中关于减少不平等的进展,评估最低工资政策、税收调节措施和性别平等法案的实际效果。非政府组织亦可借助这些信息,识别收入分配最为失衡的地区,从而精准投放资源以促进社会公平。
数据集最近研究
最新研究方向
当前,欧洲劳动力市场的收入不平等问题因新冠疫情后的经济复苏、能源危机与通货膨胀压力而愈发凸显。该数据集基于国际劳工组织ILOSTAT的权威统计,提供了1991年至2025年间33个欧洲国家按性别分列的月收入基尼指数,为研究性别收入差距的长期演变、政策干预效果及跨国比较提供了珍贵的时序证据。前沿方向聚焦于利用该数据进行收入不平等的动态建模与预警,结合面板计量方法量化劳动力市场制度、税收与转移支付体系对性别收入分配的影响,并在欧盟《性别平等战略》框架下评估各国缩小收入差距的进展。该数据集的高时间分辨率与标准化编码设计,使之成为链接微观调查与宏观政策分析的关键桥梁,对推动大数据驱动的社会政策研究与实证劳动经济学具有重要示范意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务