遇见数据集

electricsheepeurope/europe-ilo-ear-ehrg-sex-age-nb-gini-index-of-hourly-earnings-of-employees-by-sex

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲8个国家(瑞士、葡萄牙、英国、法国、摩尔多瓦、波黑、意大利、希腊)从1991年至2025年的3,780个观测值,专注于按性别和年龄划分的员工小时收入基尼指数这一指标。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取,并经过欧洲ISO3国家代码过滤处理。数据集涵盖表格分类、回归和时间序列预测等任务,包含多个字段,如国家代码、年份、性别分类、观测值等,用于分析收入不平等和劳动力市场趋势。数据以年度频率发布,并包含数据质量说明,如使用ILO选择的最佳来源和处理缺失值的方法。数据集由Electric Sheep Europe重新打包,以Parquet格式提供,便于机器学习应用。

license: cc-by-4.0 语言: - en 任务类别: - 表格分类 - 表格回归 - 时间序列预测 多语言属性: 单语言 数据规模: - 1K<n<10K 标签: - 表格数据 - 欧洲 - ILOSTAT - 收入与薪酬不平等 - ILO - 劳动 - 就业 数据集名称: "按性别与年龄划分的雇员小时收入基尼系数 | 欧洲(ILOSTAT)" --- # 按性别与年龄划分的雇员小时收入基尼系数 | 欧洲(ILOSTAT) 🇪🇺 **3780条观测数据** · **8个欧洲国家** · **1991年至2025年** · *由[Electric Sheep Europe](https://huggingface.co/electricsheepeurope)重新整理* ![行数](https://img.shields.io/badge/rows-3,780-blue) ![国家数](https://img.shields.io/badge/countries-8-green) ![年份范围](https://img.shields.io/badge/years-1991–2025-orange) ![指标数](https://img.shields.io/badge/indicators-1-purple) ![许可证](https://img.shields.io/badge/license-cc-by-4.0-lightgrey) ## 摘要概览(TL;DR) 本数据集涵盖8个欧洲国家1991年至2025年间的**收入与薪酬不平等**相关数据,共计3780条观测,涉及1个独立指标。 ## 数据源说明 **国际劳工组织统计数据库(ILOSTAT)**是国际劳工组织(International Labour Organization, ILO)的中央统计数据库,也是全球领先的劳动统计权威数据源。其整合了就业、失业、工资、工作时长、童工、非正规经济、社会保障、职业伤害以及可持续发展目标(SDG)体面工作目标等多领域指标,数据来源于全国劳动力调查、家庭收入调查、企业调查及行政记录,覆盖200余个经济体,由国际劳工组织统计司负责数据的标准化协调。 - **数据来源**:[ILOSTAT](https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EHRG_SEX_AGE_NB) - **发布机构**:国际劳工组织(ILO) - **许可证**:[cc-by-4.0](https://creativecommons.org/licenses/by/4.0/) - **研究主题**:收入与薪酬不平等 ## 数据处理方法 数据直接从ILOSTAT的REST API接口`https://rplumber.ilo.org/data/indicator?id=EAR_EHRG_SEX_AGE_NB`拉取,并筛选出欧洲地区的ISO 3166-1 alpha-3国家代码对应的数据集。ILOSTAT依据**国际劳工统计学家会议(International Conference of Labour Statisticians, ICLS)**的定义对原始调查微观数据进行标准化协调;数据来源信息会在`source.label`字段中标注,以保证数据可追溯性。 ## 地理覆盖范围 8个欧洲国家,以下按观测条数降序展示部分数据: | 国家代码 | 观测条数 | 起始年份 | 截止年份 | |---------|---------:|---------:|---------:| | `CHE` | 840 | 1991 | 2025 | | `PRT` | 672 | 1998 | 2025 | | `GBR` | 480 | 2005 | 2025 | | `FRA` | 480 | 2005 | 2024 | | `MDA` | 456 | 2007 | 2025 | | `BIH` | 396 | 2001 | 2024 | | `ITA` | 312 | 2008 | 2020 | | `GRC` | 144 | 2015 | 2020 | ## 指标示例 - `EAR_EHRG_SEX_AGE_NB` — 按性别与年龄划分的雇员小时收入基尼系数 ## 数据结构 | 字段名 | 数据类型 | 字段说明 | 示例值 | |--------|----------|----------|--------| | `ref_area` | `string` | ISO 3166-1 alpha-3 国家代码 | `BIH` | | `ref_area.label` | `string` | 国家英文名称 | `Bosnia and Herzegovina` | | `source` | `string` | ILOSTAT 数据源代码(如劳动力调查) | `BA:493` | | `source.label` | `string` | 数据源英文名称 | `LFS - Labour Force Survey` | | `indicator` | `string` | ILOSTAT 指标代码 | `EAR_EHRG_SEX_AGE_NB` | | `indicator.label` | `string` | 指标英文名称 | `Gini index of hourly earnings of empl…` | | `sex` | `string` | 性别细分维度(`SEX_T`=全体,`SEX_M`=男性,`SEX_F`=女性) | `SEX_T` | | `sex.label` | `string` | 细分维度说明 | `Total` | | `classif1` | `string` | 第一分类变量(年龄、教育程度、就业状态等) | `AGE_YTHADULT_YGE15` | | `classif1.label` | `string` | 分类变量说明 | `Age (Youth, adults): 15+` | | `time` | `int64` | 观测年份 | `2024` | | `obs_value` | `float64` | 观测指标值(单位详见指标定义) | `0.232` | | `obs_status` | `string` | 观测状态标记(如临时数据、不可靠数据) | `B` | | `obs_status.label` | `string` | 状态标记说明 | `Break in series` | | `note_classif` | `string` | 分类备注 | `—` | | `note_classif.label` | `string` | 分类备注说明 | `—` | | `note_indicator` | `string` | 指标备注 | `T30:164` | | `note_indicator.label` | `string` | 指标备注说明 | `Currency: BIH - Marka (BAM)` | | `note_source` | `string` | 数据源备注 | `R1:3513` | | `note_source.label` | `string` | 数据源备注说明 | `Repository: ILO-STATISTICS - Micro da…` | ## 细分维度 以下字段提供数据细分维度: - **`sex`**(共3个唯一值):`SEX_T`、`SEX_M`、`SEX_F` ## 数据质量与注意事项 - 数据为年度频率。部分指标同时发布月度或季度序列,但本数据集未包含此类数据。 - 当同一国家×年份的同一指标存在多个数据源时,将采用国际劳工组织选定的“最优数据源”。 - 细分字段(`sex`、`classif1`、`classif2`)仅在指标支持对应细分维度时才非空。 ## 使用示例 python from datasets import load_dataset ds = load_dataset("electricsheepeurope/europe-ilo-ear-ehrg-sex-age-nb-gini-index-of-hourly-earnings-of-employees-by-sex") df = ds["train"].to_pandas() print(df.head()) ### 筛选单一国家 python germany = df[df["ref_area"] == "DEU"] ### 单个指标的时间序列可视化 python sample = (df[df["indicator"] == "EAR_EHRG_SEX_AGE_NB"] .sort_values("time")) sample.plot(x="time", y="obs_value", title="EAR_EHRG_SEX_AGE_NB") ### 转换为国家×年份矩阵 python matrix = (df[df["indicator"] == "EAR_EHRG_SEX_AGE_NB"] .pivot_table(index="time", columns="ref_area", values="obs_value")) print(matrix.tail()) ## 引用格式 bibtex @misc{europe_ilo_ear_ehrg_sex_age_nb_gini_index_of_hourly_earnings_of_employees_by_sex_2025, title = {Gini index of hourly earnings of employees by sex and age | Europe (ILOSTAT)}, author = {International Labour Organization (ILO)}, year = {2025}, url = {https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EHRG_SEX_AGE_NB}, publisher = {HuggingFace Datasets, repackaged by Electric Sheep Europe}, howpublished = {url{https://huggingface.co/datasets/electricsheepeurope/europe-ilo-ear-ehrg-sex-age-nb-gini-index-of-hourly-earnings-of-employees-by-sex}} } ## 许可证 本数据集采用[cc-by-4.0](https://creativecommons.org/licenses/by/4.0/)许可证发布。原始数据版权归国际劳工组织(ILO)所有。使用本数据集时,请同时引用上述原始数据源与Electric Sheep Europe的重新整理版本。 ## 关于 Electric Sheep Electric Sheep Europe是Electric Sheep项目的组成部分,该项目旨在构建HuggingFace平台上面向欧洲的统一、可直接用于机器学习的标准化数据层。我们从权威开放数据源获取数据,对数据结构(schema)进行标准化处理,打包为Parquet格式,并发布为统一格式的数据集卡片,以便研究人员与开发者仅需通过`load_dataset()`即可在数秒内开始使用数据。 浏览完整数据集集合:[huggingface.co/electricsheepeurope](https://huggingface.co/electricsheepeurope) --- _数据溯源:2026年5月28日通过Electric Sheep流水线摄取。源URL: https://www.ilo.org/shinyapps/bulkexplorer/?id=EAR_EHRG_SEX_AGE_NB_

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrg-sex-age-nb-gini-index-of-hourly-earnings-of-employees-by-sex 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过其REST API直接获取指标代码为EAR_EHRG_SEX_AGE_NB的原始数据,并依据欧洲ISO3国家代码进行地理范围筛选。ILOSTAT采用国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行标准化处理,确保跨国可比性。数据集由Electric Sheep Europe团队重新封装,整合了来自8个欧洲国家1991至2025年间的3,780条观测记录,每条记录均包含国家、性别、年龄组及收入不平等度量等信息,并以Parquet格式存储,便于机器学习应用。
特点
数据集的核心特点在于聚焦欧洲地区雇员时薪的基尼指数,提供了按性别和年龄分层的收入不平等度量,涵盖总人口、男性与女性三个维度。其时间跨度达34年,覆盖瑞士、葡萄牙、英国等8个欧洲国家,数据来源清晰可追溯,每一观测均标注了原始调查来源及状态标志(如“序列中断”),研究者可据此评估数据可靠性。此外,数据集仅包含一个核心指标,结构简洁,但通过性别与年龄的细分,支持深入分析收入不平等的结构性差异。
使用方法
数据集可通过HuggingFace的`datasets`库便捷加载,调用`load_dataset()``函数即可将数据转为Pandas DataFrame进行后续分析。用户可依据`ref_area`列筛选特定国家,或针对单一指标按时间排序绘制趋势图。利用`pivot_table`方法,还能轻松构建以年份为索引、国家为列的时间序列矩阵,便于跨国比较。数据集已预设为表格回归与时间序列预测任务格式,可直接用于模型训练或统计建模,无需额外数据清洗。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过ILOSTAT数据库整理发布,并由Electric Sheep Europe重新打包为机器学习友好格式,旨在提供欧洲8个国家(1991–2025年)按性别和年龄分类的小时收入基尼系数,共3,780条观测记录。基尼系数作为衡量收入不平等程度的经典指标,在劳动经济学、社会政策评估及可持续发展目标(SDG)监测中具有核心价值。该数据集将ILO标准化的劳动统计方法与欧洲区域数据相结合,为研究欧洲劳动力市场中的性别工资差距、代际收入分配动态以及国家间不平等模式提供了高质量、可比的时间序列数据,尤其适用于面板数据分析和跨国家比较研究。
当前挑战
该数据集面临的挑战包括:1)在领域问题层面,收入不平等度量本身存在方法论争议,如基尼系数对极端值敏感、不同国家调查方法(如劳动力调查与行政记录)的差异可能导致可比性偏差;此外,数据集仅覆盖8个国家,且时间跨度不均衡(如希腊仅2015–2020年),限制了泛欧洲推断的可靠性;2)在构建过程中,ILO从多源异构数据(如国家劳动力调查、收入调查)中汇集指标,需处理不同来源的定义差异、观测状态标识(如序列中断标识“B”)以及最佳来源选择标准,且数据集中存在缺失的分解维度(如classif2列为空),增加了清洗和插补的难度,同时元数据中“note_indicator”字段包含货币信息等非标准化注释,需要额外解析才能用于建模。
常用场景
经典使用场景
该数据集最经典的使用场景集中于劳动经济学与收入分配不平等研究领域。研究者可借助基尼系数这一衡量收入分配均等程度的黄金指标,基于性别与年龄的精细划分,对欧洲八国自1991年至2025年间雇员小时收入的分配状况进行纵向比较与横向剖析。通过时间序列分析,学者能够追踪特定国家收入不平等程度的演变轨迹,识别政策干预前后基尼系数的波动规律。同时,性别的二分类与年龄的多层次划分使得跨群体差异分析成为可能,为探讨性别工资差距的代际变化、年龄对收入分化效应等议题提供了坚实的数据基础。
解决学术问题
该数据集致力于解决劳动经济学中收入不平等测度与比较的核心学术难题。传统研究中,各国统计口径的差异与数据可及性不足常制约跨国比较的深度,而此数据集通过国际劳工组织的标准化处理,统一了基尼系数的计算定义与调查方法,有效消除了来源异质性带来的偏误。它使学界能够系统地回答以下关键问题:欧洲各国收入不平等程度在近三十年间的变化趋势是否趋同或分化?性别与年龄如何交互影响收入分配格局?不同社会制度与劳动力市场政策背景下,基尼系数的敏感度如何?这些发现对评估最低工资、税收调节与社会保障等公共政策的效能具有深远理论价值。
衍生相关工作
该数据集衍生了一系列富有影响力的经典研究工作,涵盖方法创新与实证拓展两大方向。在方法层面,学者基于面板数据结构开发了动态基尼系数分解模型,将总体不平等拆解为性别间、年龄组内及跨期流动效应,深化了对收入分化动力机制的理解。在实证层面,后续研究将基尼系数与失业率、工会密度、劳动市场制度等变量结合,检验库兹涅茨曲线在发达经济体中的适用性。另有工作聚焦于性别差距的收敛速度,利用分位数回归与反事实模拟,揭示不同年龄段女性面临的多重收入壁垒。这些衍生工作不仅丰富了劳动经济学的理论体系,也强化了数据集作为基准测试平台的地位,持续吸引着国际研究团队围绕其展开复现与拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务