遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-eco-cur-nb-average-hourly-earnings-of-employees-by-sex-econom

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的欧洲8个国家(1991年至2025年)的44,945条观测数据,核心指标为“按性别、经济活动和货币划分的员工平均小时收入”(EAR_EHRA_SEX_ECO_CUR_NB)。数据覆盖瑞士、葡萄牙、法国、英国、摩尔多瓦、波黑、意大利和希腊,提供年度频率的统计信息,并按性别(总计、男性、女性)等维度进行细分。数据集经过Electric Sheep Europe重新打包,采用标准化模式(包括国家代码、指标、时间、观测值等列),适用于表格分类、回归和时间序列预测等机器学习任务。

This dataset contains 44,945 observations of earnings data from the International Labour Organization (ILO) ILOSTAT database, covering 8 European countries from 1991 to 2025, with the primary indicator being Average hourly earnings of employees by sex, economic activity and currency (EAR_EHRA_SEX_ECO_CUR_NB). It includes data for Switzerland, Portugal, France, the United Kingdom, Moldova, Bosnia and Herzegovina, Italy, and Greece, providing annual frequency statistics disaggregated by dimensions such as sex (total, male, female). Repackaged by Electric Sheep Europe, the dataset features a normalized schema (including columns for country codes, indicators, time, observed values, etc.) and is suitable for machine learning tasks like tabular classification, regression, and time-series forecasting.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-eco-cur-nb-average-hourly-earnings-of-employees-by-sex-econom 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接提取了平均每小时收入指标(EAR_EHRA_SEX_ECO_CUR_NB)的原始数据,并依据欧洲ISO3国家代码进行地理范围筛选。数据采集过程严格遵循ILO统计部门制定的国际劳工统计学家会议(ICLS)定义标准,对所有原始调查微观数据进行了规范化处理与整合。Electric Sheep Europe团队进一步将这些跨国家、跨年份的时序观测记录重新封装为结构化的表格数据,并以Parquet格式存储,确保数据质量与机器学习的兼容性。
特点
该数据集包含44,945条观测记录,覆盖瑞士、葡萄牙、法国等8个欧洲国家,时间跨度从1991年至2025年。数据以性別(总、男性、女性)、经济活动部门和货币类型为多维分类维度,每个观测值均附带来源标签、观测状态标志以及详细的分类注释,便于用户追溯数据来源与质量。所有指标均以年频率发布,且对于同一国家与年份存在多个来源时,采用ILO选取的“最佳来源”数据,从而保证了数据的一致性与权威性。
使用方法
用户可通过HuggingFace Datasets库的load_dataset()函数直接加载该数据集,返回的DataFrame对象包含ref_area、sex、time、obs_value等核心字段。研究人员能够依据ref_area字段筛选特定国家的子集,或使用pandas库对单一指标进行时间序列可视化分析。此外,通过pivot_table方法可将数据重塑为国家×年份的矩阵形式,便于开展跨国的面板数据分析与统计建模工作。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)旗下ILOSTAT数据库于2025年整理发布,经Electric Sheep Europe重新封装为机器学习就绪格式,聚焦于欧洲8个国家(瑞士、葡萄牙、法国、英国等)1991至2025年间按性别、经济活动与货币划分的雇员平均时薪观测值,共计44,945条记录。作为全球劳动统计的权威来源,ILOSTAT通过统一国际劳动统计学家会议(ICLS)定义,整合各国劳动力调查、行政记录等多源数据,为研究劳动力市场中的性别工资差异、行业薪资结构与跨国经济对比提供了标准化、跨时段的基础数据。该数据集的核心价值在于其细粒度的分类维度(性别、经济部门、货币)与长达34年的时间跨度,能够有力支撑劳动经济学中的纵向比较分析和面板数据建模,对欧洲区域内的性别平等政策评估、最低工资影响研究及跨国劳动力市场效率探索具有重要学术意义与应用前景。
当前挑战
该数据集所应对的领域挑战聚焦于劳动经济学中的性别工资差距量化与跨时空可比性难题:由于各国统计方法、货币单位与经济活动分类标准不一,传统上难以构建统一的薪资面板数据。此数据集通过ILO的标准化处理解决了指标定义异质性,但研究者在利用时仍需面对观测值标识(如'U'标记不可靠数据)导致的噪声处理问题,以及部分国家(如希腊、意大利)数据覆盖时段较短或不连续带来的样本偏差。在构建过程中,该数据集面临多重挑战:一是从ILOSTAT REST API抽取数据时,需对欧盟ISO3国家代码进行精准过滤,并处理多来源数据(如劳动力调查与行政记录)间的择优选择逻辑;二是维持性别(SEX_T/SEX_M/SEX_F)与经济分类(如'ECO_SECTOR_TOTAL')等维度上的非空约束一致性,尤其在部分细分指标缺乏完整分类记录时;三是确保时间频率统一为年度,排除月度或季度序列,以简化回归分析中的时间结构,但这牺牲了高频波动信息,可能掩盖周期内薪资变动的瞬时特征。
常用场景
经典使用场景
该数据集收录了1991年至2025年间欧洲8个国家的平均时薪数据,按性别、经济活动领域及货币类型进行精细划分。经典使用场景集中于劳动力市场领域的跨国比较与趋势分析,研究者可借此探索不同欧洲经济体在工资水平上的动态演变。通过时间序列分析,能够揭示工资增长的长期模式、周期性波动以及结构性变化。亦可用于构建面板数据模型,控制国家与时间固定效应,从而识别性别工资差异、行业间薪资不平等及其随时间演化的特征。数据的分层结构还支持多维度聚合,为经济学与社会学中的劳动力报酬研究提供坚实的数据基础。
解决学术问题
该数据集直击劳动经济学中关于工资决定机制与收入分配的核心学术问题。通过提供标准化的跨国时薪指标,解决了以往研究因数据口径不一、时间跨度短或国家覆盖有限而难以进行稳健跨国推断的困境。它使得学者能够系统性地考察欧洲范围内性别收入差异的收敛趋势,评估不同经济活动部门间的工资溢价是否存在持续分化。此外,该数据还为研究制度因素对工资水平的影响创造了条件,例如最低工资立法、工会覆盖率与集体谈判制度等变量如何塑造不同国家与行业间的薪资分布,从而推动对劳动力市场运行机制更深刻的理解。
衍生相关工作
该数据集已衍生出若干经典研究工作,尤其是在劳动经济学与计量经济学领域。以其为支撑的学术工作常聚焦于欧洲性别工资差异的跨国收敛性分析,通过固定效应模型与分位数回归揭示了不同国家在促进男女同工同酬方面的制度差异。另一类衍生研究利用该数据进行经济周期与工资弹性的联动分析,发现金融危机期间欧洲各国平均时薪的敏感度存在显著异质性。此外,基于该数据集的时间序列特征,部分工作探索了工资增长与劳动生产率之间的脱钩现象,为理解技术进步与收入分配的关系提供了实证素材。这些衍生研究共同彰显了该数据集作为欧洲劳动力市场基准数据源的核心价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务