遇见数据集

electricsheepeurope/europe-ilo-ear-phra-sex-nb-average-hourly-earnings-of-public-sector-employees

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲公共部门员工平均每小时收入(以本地货币计)的统计信息,源自国际劳工组织(ILO)的ILOSTAT数据库。数据集涵盖6个欧洲国家(瑞士、法国、英国、摩尔多瓦、波黑和希腊),时间跨度为1996年至2025年,共336个观测值,涉及1个核心指标(EAR_PHRA_SEX_NB)。数据通过ILOSTAT REST API获取,并经过标准化处理,使用国际劳工统计学家会议(ICLS)定义进行协调。数据集为表格格式,包含列如国家代码、来源、指标、性别分类(总计、男性、女性)、年份、观测值、观测状态和注释等,支持按性别分解维度。数据质量方面,为年度频率,当同一国家×年份有多个来源时,使用ILO选定的最佳来源。该数据集适用于表格分类、回归和时间序列预测任务,旨在为研究欧洲公共部门劳动力市场提供机器学习就绪的数据。

This dataset contains statistical information on the average hourly earnings of public sector employees in local currency across Europe, sourced from the International Labour Organization (ILO) ILOSTAT database. It covers 6 European countries (Switzerland, France, United Kingdom, Moldova, Bosnia and Herzegovina, and Greece), spanning the years 1996 to 2025, with 336 observations and 1 core indicator (EAR_PHRA_SEX_NB). Data is retrieved via the ILOSTAT REST API and harmonized using International Conference of Labour Statisticians (ICLS) definitions. The dataset is in tabular format, including columns such as country code, source, indicator, sex disaggregation (total, male, female), year, observed value, observation status, and notes, with support for disaggregation dimensions like sex. In terms of data quality, it is annual frequency, and when multiple sources exist for the same country×year, the ILO-selected best source is used. This dataset is suitable for tabular classification, regression, and time-series forecasting tasks, aiming to provide machine learning-ready data for studying the European public sector labor market.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-phra-sex-nb-average-hourly-earnings-of-public-sector-employees 数据集图片
构建方式
该数据集依托国际劳工组织(ILO)的ILOSTAT数据库构建,通过其REST API直接提取指标代码为EAR_PHRA_SEX_NB的原始数据,并依据欧洲ISO3国家代码进行筛选。数据来源涵盖劳动力调查、企业调查及行政记录等多种渠道,ILO依据国际劳工统计学家会议(ICLS)定义对微观数据进行统一协调,确保跨国比较的严谨性。最终经Electric Sheep Europe团队重新封装,以标准化模式存储为Parquet格式,便于机器学习流水线直接调用。
特点
数据集包含336条观测记录,覆盖瑞士、法国、英国等6个欧洲国家,时间跨度从1996年至2025年,聚焦公共部门雇员平均时薪这一单一核心指标。数据按性别维度细分为总计、男性与女性三类,并提供来源标签便于追溯数据质量。缺失值以空值标记,观测状态字段(如“序列中断”)为数据可靠性提供明确提示,整体结构简洁且高度对齐于劳动经济学研究的典型分析需求。
使用方法
用户可通过HuggingFace的`load_dataset`函数一行加载数据,返回的表格可直接转换为Pandas DataFrame进行后续操作。典型用法包括按国家筛选子集、绘制特定指标的时间序列折线图,或利用pivot_table构建以年份为行、国家为列的二维面板数据矩阵。数据集设计兼容时间序列预测、回归分析及分类任务,结合ILOSTAT提供的元数据,研究者可灵活开展跨国公共部门薪酬趋势研究。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年通过其ILOSTAT统计数据库创建,并由Electric Sheep Europe团队重新打包至HuggingFace平台,旨在提供欧洲6国(瑞士、法国、英国、摩尔多瓦、波黑、希腊)公共部门雇员的平均小时工资数据(以本币计),时间跨度从1996年至2025年,共计336条观测。作为ILOSTAT这一全球劳动统计权威来源的子集,数据集聚焦于公共部门薪酬这一关键指标,为研究欧洲劳动力市场结构、工资差异及公共政策效果提供了标准化、机器可读的时序数据。其发布填补了区域公共部门薪酬微观数据的可获取性空白,尤其适用于跨国的工资水平比较、通货膨胀调整分析及机器学习模型中的回归与时间序列预测任务,对劳动经济学、公共财政及欧洲一体化研究具有重要支撑作用。
当前挑战
数据集所解决的领域问题在于:公共部门雇员工资数据长期分散于各国统计机构,缺乏统一的开放标准化格式,导致跨区域比较与模型训练困难。其构建挑战包括:1)数据整合层面,ILOSTAT需从200余个经济体的劳动力调查、行政记录等多源异构数据中提取公共部门子集,并依据国际劳工统计学家会议(ICLS)定义进行统一,过程中需处理不同货币、通胀率与调查方法带来的可比性偏差;2)质量标注层面,观测值附有状态标记(如序列中断、不可靠)与附注(如货币单位),需用户谨慎理解,例如波黑以马克计值;3)时序完整性挑战,部分国家年度数据缺失(如希腊仅覆盖2015-2020年),且仅包含年度频率而排除更高频的月度或季度序列,限制了对短期波动的捕获能力。
常用场景
经典使用场景
在劳动经济学与公共政策研究领域,该数据集因其聚焦于欧洲六国公共部门雇员平均时薪的长期面板数据而备受青睐。研究人员常利用其涵盖1996年至2025年间的时间序列观测,构建国家间横向比较与纵向趋势分析模型。例如,通过按性别维度(总、男性、女性)的细分数据,可以深入剖析公共部门内部薪酬的性别差异及其演变规律,为评估欧盟层面同工同酬政策的实施效果提供实证依据。
解决学术问题
该数据集有效回应了劳动经济学中关于公共部门薪酬决定机制与劳动力市场分割的经典学术问题。凭借ILO标准化的统计口径和长达近三十年的序列长度,它能够支持研究者识别公共部门薪资变动的结构性因素,如经济周期影响、财政紧缩政策效应以及制度变革带来的冲击。同时,数据中提供的来源标签和断序标识(B标志)允许学界审慎处理数据质量差异,从而显著提升跨国比较研究的信度与效度,弥合了此前欧洲公共部门薪酬跨国研究中数据碎片化的缺憾。
衍生相关工作
围绕该数据集已涌现出多项衍生性经典工作,涵盖时空建模、面板数据计量与交互式可视化系统等方向。典型工作包括利用Python的HuggingFace Datasets库进行一体化加载,并借助pandas与matplotlib构建国家-年份矩阵及趋势图,为快捷的数据探索奠定基础。另有研究者基于此数据开发了用于欧盟劳动力市场制度比较的元分析框架,将ILOSTAT指标与国家治理指数联立使用。未来,该数据集还可激励更多关于公共部门薪酬收敛性检验、性别平等政策工具评估等领域的联动研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务