遇见数据集

electricsheepeurope/europe-ilo-ear-pmta-sex-cur-nb-average-monthly-earnings-of-public-sector-employee

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含975个观察值,涉及6个欧洲国家的公共部门员工数据,时间跨度为1996年至2025年,涵盖1个不同的指标。具体指标为“按性别和货币分类的公共部门员工月平均收入”。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,该数据库是全球劳动统计的主要来源,通过国家劳动力调查、家庭收入调查、机构调查和行政记录等收集数据,并按照国际劳工统计学家会议(ICLS)的定义进行标准化。数据集涵盖了瑞士、法国、英国、摩尔多瓦、波斯尼亚和黑塞哥维那、希腊等国家,并提供按性别(总计、男性、女性)和货币分类的细分维度。数据以年度频率发布,并包括数据质量标志和来源信息,适用于表格分类、回归和时间序列预测等任务。

This dataset contains 975 observations of public sector workers data across 6 Europe countries, spanning 1996 to 2025, covering 1 distinct indicator: Average monthly earnings of public sector employees by sex and currency. The data is sourced from ILOSTAT, the ILOs central statistics database, which harmonizes raw survey microdata using International Conference of Labour Statisticians (ICLS) definitions. It includes countries such as Switzerland, France, United Kingdom, Moldova, Bosnia and Herzegovina, and Greece, with disaggregation by sex (total, male, female) and currency. The data is annual frequency and includes quality flags and source information, suitable for tabular classification, regression, and time-series forecasting tasks.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-pmta-sex-cur-nb-average-monthly-earnings-of-public-sector-employee 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT数据库,通过REST API接口直接拉取标识符为EAR_PMTA_SEX_CUR_NB的指标数据,并依据欧洲ISO3国家代码进行地域过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对原始调查微观数据进行统一协调处理,数据来源在source.label字段中予以标注以确保可追溯性。数据集最终由Electric Sheep Europe进行重新打包与结构化整理,以Parquet格式发布在HuggingFace平台上,支持便捷的机器学习工作流集成。
特点
本数据集聚焦欧洲6国(瑞士、法国、英国、摩尔多瓦、波黑、希腊),覆盖1996年至2025年间的公共部门雇员平均月收入数据,共计975条观测记录。数据按性别(总、男性、女性)与货币类型进行详细分类,并包含观测状态标记以提示数据质量(如系列中断等)。每个观测值均附带ILO优选来源标识,确保数据权威性与可追溯性。数据集以年度频率发布,包含丰富的元数据字段(如来源标签、分类维度),便于多维分析与交叉验证。
使用方法
用户可通过HuggingFace Datasets库的load_dataset函数直接加载数据集,并借助to_pandas方法转换为DataFrame进行后续分析。典型用例包括按国家代码过滤特定国家的数据子集、针对单一指标按时间排序进行时序可视化、或利用pivot_table构建国家×年份的面板数据矩阵。数据集采用cc-by-4.0许可证,使用时需同时引用原始ILO数据来源及Electric Sheep Europe的重新包装版本。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)通过其ILOSTAT数据库整理发布,后经Electric Sheep Europe在HuggingFace平台重新打包,专注于欧洲六国(瑞士、法国、英国、摩尔多瓦、波黑、希腊)公共部门雇员按性别和货币分类的平均月收入数据,时间跨度覆盖1996年至2025年,共计975条观测值。作为全球劳动统计领域的权威来源,ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、行政记录等多源数据进行标准化处理,为跨国比较公共部门薪酬水平提供了可靠基础。该数据集填补了欧洲区域公共部门工资微观数据的空白,有助于经济学家、政策制定者及社会学家深入分析性别收入差距、公共部门薪酬结构演变及货币政策对实际收入的影响,对推动体面劳动目标(SDG 8)的监测与评估具有重要支撑作用。
当前挑战
该数据集面临的核心挑战在于多维度数据整合的复杂性:首先,公共部门雇员收入受各国货币、税务制度、福利政策及统计口径差异影响,跨时间可比性需谨慎处理,例如波黑使用当地货币(BAM)而其他国家使用欧元或本币,汇率波动可能扭曲实际收入趋势;其次,数据来源多样(劳动力调查、行政记录等),部分观测值标记为“序列断裂”(Break in series)或“临时性”(provisional),提示数据结构不连续或质量不一,影响时间序列分析的稳定性;此外,性别维度仅分“总计”、“男性”、“女性”三类,缺乏按年龄、教育水平或职业类别等更细粒度的交叉分组,限制了对公共部门内部收入不均等性的深入探究;最后,仅覆盖6个国家且部分国家数据年限较短(如希腊仅2015-2020年),样本量和时空均衡性不足,制约了面向全欧洲范围的政策建模与预测能力。
常用场景
经典使用场景
在劳动经济学与公共财政研究领域,该数据集为分析欧洲公共部门雇员的薪酬结构提供了宝贵的微观数据基础。其经典使用场景集中于跨国比较分析,通过整合6个欧洲国家长达近三十年的年度观测值,研究者能够系统性地评估不同国家公共部门工资水平的演变趋势。数据集中包含按性别和货币细分的字段,使得研究人员可以深入探讨公共部门内部的薪酬性别差异及其动态变化。此外,该数据集的时间序列特性使其成为进行面板数据回归分析的理想素材,可用于检验公共部门工资决定因素、财政政策对薪酬的影响以及经济周期与公共部门薪资的关联等经典实证问题。
解决学术问题
在学术研究领域,该数据集有效回应了公共部门薪酬研究中长期存在的数据碎片化与可比性不足的难题。通过提供经由国际劳工组织统一口径整理后的标准化序列,它解决了跨国公共部门工资比较中因统计方法不一致而导致的度量偏误问题。研究者得以据此深入探讨公共部门薪酬溢价之谜,即公共部门与私营部门之间工资差距的形成机制及其结构性特征。同时,数据中按性别划分的字段为研究劳动力市场中性别工资不平等的制度性根源提供了关键证据,有助于阐释公共部门作为反歧视政策工具的效能。该数据集还推动了关于欧元区货币联盟下工资趋同假说的实证检验,对于理解欧洲一体化进程中的社会政策协调具有重要学术价值。
衍生相关工作
基于该数据集的发布,学术界与开源社区已催生出一系列衍生工作与创新应用。在数据科学技术层面,Hugging Face平台上由Electric Sheep Europe维护的标准化数据管道为公共部门薪酬数据的可复现性研究树立了范例,后续工作借助该管道扩展了包括私营部门薪酬、工作时间等在内的关联指标数据集。在实证研究方面,已有学者利用该数据集开展欧洲公共部门薪酬性别差距的分解研究,采用Oaxaca-Blinder方法量化了可解释因素与不可解释成分的贡献。此外,该数据集与ILOSTAT其他劳动统计指标的联合使用,催生了探讨公共部门就业规模对私人劳动力市场溢出效应的面板数据分析工作。在开放科学运动推动下,该数据集还被整合到机器学习驱动的经济预测开源项目中,用于训练预测公共部门工资增长与就业流动性的时序模型。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务