遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-cur-nb-median-hourly-earnings-of-employees-by-sex-and-cur

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为员工按性别和货币分类的每小时收入中位数 | 欧洲(ILOSTAT),包含1,338个观测值,覆盖8个欧洲国家(瑞士、葡萄牙、法国、英国、摩尔多瓦、波斯尼亚和黑塞哥维那、意大利、希腊),时间跨度为1991年至2025年。主要指标为按性别和货币分类的员工每小时收入中位数,数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过权威调查(如劳动力调查)和行政记录收集,并按照国际劳工统计学家会议(ICLS)定义进行标准化。数据集提供详细的分类维度,包括性别(总计、男性、女性)和货币类型(本地货币),适用于表格分类、回归和时间序列预测等机器学习任务。数据以结构化表格形式呈现,包含国家代码、来源、指标、时间、观测值等列,并附带数据质量说明和使用示例。

The dataset is named Median hourly earnings of employees by sex and currency | Europe (ILOSTAT) and contains 1,338 observations across 8 European countries (Switzerland, Portugal, France, United Kingdom, Moldova, Bosnia and Herzegovina, Italy, Greece), spanning from 1991 to 2025. The primary indicator is Median hourly earnings of employees by sex and currency, sourced from the International Labour Organizations (ILO) ILOSTAT database, which compiles data from authoritative surveys such as labour force surveys and administrative records, harmonized using International Conference of Labour Statisticians (ICLS) definitions. It includes disaggregation dimensions like sex (total, male, female) and currency type (local currency), and is suitable for machine learning tasks such as tabular classification, regression, and time-series forecasting. The data is presented in a structured tabular format with columns for country codes, sources, indicators, time, observed values, etc., along with data quality caveats and usage examples.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-cur-nb-median-hourly-earnings-of-employees-by-sex-and-cur 数据集图片
构建方式
本数据集源自国际劳工组织(ILO)旗下的ILOSTAT数据仓库,该库是全球劳动统计的权威来源,整合了来自各国劳动力调查、家庭收入调查及行政记录等多源微观数据,并依据国际劳动统计学家会议(ICLS)定义进行标准化处理。数据通过ILOSTAT REST API直接获取,筛选出欧洲八国的ISO3国家代码对应的观测记录,最终汇聚成包含1338条观测值的数据集,覆盖1991年至2025年的年度中位小时收入指标,并按性别和货币类别进行细致分类。
特点
数据集的核心特点在于其高度的结构化与多维度分解能力,每条记录不仅包含观测值、国家代码和年份,还提供了性别(男、女、总计)、货币类型等分类变量,以及来源标识和数据状态标记(如系列中断),便于用户进行精细化的异质性分析。此外,数据经过Electric Sheep Europe的重组与规范化,以Parquet格式存储,确保了机器学习就绪(ML-ready)的兼容性,并保留了原始数据的可追溯性。
使用方法
用户可通过HuggingFace的`datasets`库一行代码加载数据,并轻松转换为Pandas DataFrame进行探索。典型应用包括按国家筛选进行国别分析、针对单一指标构建时间序列以观察趋势变化,或通过数据透视表将原始宽表转化为国家-年份矩阵,便于直接进行跨国的面板数据回归或可视化比较。这种便捷的数据接口极大降低了劳动经济学研究的准入门槛。
背景与挑战
背景概述
在劳动经济学与社会政策研究领域,薪酬数据的可获得性与精细度是分析性别工资差距、评估劳动力市场状况与制定公平政策的关键基石。该数据集由国际劳工组织(ILO)统计司依托其核心数据库ILOSTAT构建,并由Electric Sheep Europe于2025年重新封装后发布。ILOSTAT作为全球劳动统计的权威来源,通过整合各国劳动力调查、企业普查等多种行政记录,确保数据质量与跨国可比性。数据集聚焦于欧洲8个国家,收录了1991年至2025年间共1,338条关于按性别和货币分列的雇员每小时工资中位数观测值,覆盖瑞士、葡萄牙、法国等重要经济体。其核心研究问题在于揭示欧洲区域薪酬结构的动态演变与性别差异,为劳动力市场监测与比较研究提供了标准化、机器可读的数据基础,对推动性别平等政策评估及跨国民间劳动经济学分析具有显著影响力。
当前挑战
该数据集所应对的领域核心挑战在于劳动收入指标的跨国可比性与粒度不足问题。传统上,各国工资数据在统计口径、货币单位、调查方式上存在显著异质性,难以直接用于跨区域的性别薪酬差距建模与时间序列分析。ILOSTAT通过国际劳动统计学家会议(ICLS)定义进行数据协调,但数据集构建过程仍面临多重困难:包括不同国家数据源类型差异导致的标记一致性维护、同一国家或年份存在多个数据来源时“最佳来源”的选择逻辑、以及观测状态标记(如序列中断、临时数据)所隐含的噪声与缺失值处理。此外,性别维度的细分虽然提供了SEX_T、SEX_M、SEX_F三种分类,但部分国家数据稀疏,尤其是希腊等国观测点仅有54条,限制了高分辨率性别工资动态分析的稳健性,这要求使用者能审慎处理样本不平衡与时间跨度变长后的数据质量问题。
常用场景
经典使用场景
该数据集收录了1991年至2025年间欧洲8个国家按性别和货币分类的雇员小时工资中位数指标,共计1338条观测记录。研究人员可将其用于时间序列分析,通过绘制特定国家或性别群体的工资随时间演变的趋势曲线,揭示劳动力市场中工资结构的动态变化。数据集中包含的性别、地域和货币分类维度的字段,使得交叉分组统计成为可能,为探索性别工资差距的时空异质性提供了坚实的基础。同时,该数据集也可作为面板数据回归分析的输入,用以量化经济周期、政策干预或劳动力市场制度对工资水平的影响。
解决学术问题
在劳动经济学与社会政策研究中,该数据集首先解决了欧洲多国工资数据来源分散、口径不统一的核心障碍。依托国际劳工组织ILOSTAT的标准化流程,它将各国劳动力调查与行政记录中的工资信息进行同质化处理,使跨国的性别工资差距比较得以在严谨的定义一致性下进行。研究者得以揭示不同福利体制或劳动力市场监管强度下,性别收入不平等的演化轨迹,并检验诸如最低工资政策、同工同酬立法或职业隔离缓解等制度因素的调节效应。由此,数据集不仅支撑了对欧洲一体化过程中劳动力市场趋同或分化的实证检验,也推动了关于性别经济赋权与可持续发展目标中体面工作指标的量化讨论。
衍生相关工作
该数据集的衍生工作主要体现在跨学科的知识发现与方法创新。在劳动经济领域,经典研究利用类似ILOSTAT面板数据发现了欧洲性别工资差距的收敛速度呈减缓趋势,并识别出服务业岗位扩张与灵活用工安排对男女收入分化的非对称影响。统计方法上,学者发展出基于分层潜变量模型来处理工资分布中零值、缺失值与异质性误差问题,改进了对性别人群中位数比较的推断效率。计算社会科学界则以此类标准化开放数据为基础,构建了欧洲劳动力市场的人工智能预测体,实现对本地工资增长、区域就业弹性及外生冲击(如疫情封锁或能源危机)恢复路径的态势感知。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务