遇见数据集

electricsheepeurope/europe-ilo-ear-ehra-sex-edu-nb-average-hourly-earnings-of-employees-by-sex-and-ed

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲8个国家(瑞士、葡萄牙、英国、法国、波黑、摩尔多瓦、意大利、希腊)从1991年至2025年的员工平均小时收入数据,按性别和教育程度进行细分,以本地货币为单位。数据集共有6,622个观测值,核心指标为“EAR_EHRA_SEX_EDU_NB”(按性别和教育划分的员工平均小时收入)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过官方API获取并过滤为欧洲国家。数据集以表格形式组织,包括国家代码、性别分类、教育水平、年份、观测值等列,并包含数据质量说明(如年度频率、最佳来源选择等)。该数据集由Electric Sheep Europe重新打包,旨在为机器学习提供统一、标准化的欧洲数据层。

This dataset contains average hourly earnings of employees by sex and education (in local currency) for 8 European countries (Switzerland, Portugal, United Kingdom, France, Bosnia and Herzegovina, Moldova, Italy, Greece) from 1991 to 2025. It includes 6,622 observations with a core indicator EAR_EHRA_SEX_EDU_NB (Average hourly earnings of employees by sex and education). The data is sourced from the International Labour Organizations ILOSTAT database, retrieved via its REST API and filtered for European countries. The dataset is structured in tabular format with columns such as country code, sex classification, education level, year, observed value, and includes data quality notes (e.g., annual frequency, best source selection). It is repackaged by Electric Sheep Europe as part of a unified, ML-ready data layer for Europe.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehra-sex-edu-nb-average-hourly-earnings-of-employees-by-sex-and-ed 数据集图片
构建方式
该数据集由Electric Sheep Europe团队从ILOSTAT官方REST API中直接抓取原始数据,并筛选出欧洲地区的ISO3国家代码观测值而构建。ILOSTAT作为国际劳工组织的核心统计数据仓库,依据国际劳动统计学家会议(ICLS)的定义对各国劳动力调查、家庭收入调查及行政记录等微观数据进行统一的清洗与标准化处理,确保跨国的可比性。数据集中保留了`source.label`字段以标记原始数据来源,为用户提供精确的溯源路径。最终汇集了8个欧洲国家自1991年至2025年间共计6,622条关于雇员平均小时工资的年度观测记录。
特点
该数据集的核心特色在于其精细的人口统计维度划分与严谨的数据质量标注。数据集不仅包含性别(男、女、总计)的分解信息,还通过`classif1`字段提供了教育水平的分类维度,使得研究者能够深入分析不同性别的教育回报差异。每个观测值均附有`obs_status`状态标记(如'U'表示不可靠),配合`note_classif`、`note_indicator`和`note_source`等注释列,详尽说明了教育水平定义的非标准情况、货币单位及数据存储库等信息。数据覆盖了瑞士、葡萄牙、英国等多个欧洲主要经济体,时间跨度长达34年。
使用方法
用户可通过HuggingFace的`datasets`库以一行代码`load_dataset`便捷加载此数据集,并直接转换为Pandas DataFrame进行操作。针对单一国家的分析,可以通过`ref_area`字段(ISO 3166-1 alpha-3代码)进行过滤。进行时间序列建模时,可依据`indicator`字段筛选特定指标数据,并按`time`字段排序后可视化。为构建国家-年份面板数据,可利用Pandas的`pivot_table`方法将数据重塑为以时间为行、国家为列的宽表矩阵,便于后续的计量回归或预测任务。数据集默认以Parquet格式存储,兼备高效的读写性能与跨平台兼容性。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门维护,通过其核心数据库ILOSTAT发布,并由Electric Sheep Europe于2025年重新打包,专注于欧洲8个国家(瑞士、葡萄牙、英国等)1991至2025年间按性别和教育程度划分的雇员平均小时收入(以当地货币计)。作为全球劳动统计的权威来源,ILO利用统一的国际劳动统计学家会议定义,整合各国劳动力调查、家庭收入调查及行政记录,旨在为经济学家、政策制定者及社会科学家提供跨越时空的精细化收入对比数据,从而支持劳动力市场不平等研究、教育回报率分析及欧洲区域经济一体化效应的实证评估。该数据集填补了微观劳动统计在跨国家、长时间序列上的数据空白,推动了对性别收入差距与教育赋能关系的量化理解。
当前挑战
该数据集所解决的领域挑战是双重的。首先,在劳动经济学中,按性别和教育分层的小时收入数据长期缺乏系统性的跨国可比较数据集,传统来源往往存在定义差异、年份断层或覆盖范围局限,阻碍了精准的跨国不平等量化研究。其次,在构建过程中,ILO面临从多源异构国家数据中实施国际标准化清洗的挑战,需处理原始调查中的分类差异(如非标准教育水平标签)、数据标注状态(如可靠性标记‘U’)以及多源冲突下的‘最佳来源’选择机制,而Electric Sheep Europe进一步面临将这些复杂元数据统一为机器学习就绪格式的挑战,确保时间序列的连续性与跨国家Schema的一致可解析性。
常用场景
经典使用场景
该数据集汇集了欧洲八国自1991年至2025年间按性别与教育程度划分的雇员平均时薪数据,由国际劳工组织(ILO)的ILOSTAT数据库整理而成。经典使用场景主要集中在劳动经济学与计量经济学领域,研究者常将其用于构建面板数据模型,以探究教育回报率的性别差异、人力资本投资的收益分配以及劳动力市场工资动态的长期趋势。数据集的年度频率和多维度细粒度信息使其特别适合进行固定效应回归分析与基尼系数分解,揭示不同教育水平和性别群体在工资结构上的演变规律。
实际应用
实际应用中,该数据集是国际组织、政府智库和跨国企业进行薪酬基准分析与劳动力市场监测的关键工具。政策制定者可利用其追踪最低工资政策对特定性别或教育群体的影响,评估经济周期中各层级劳动者的福利变化;企业人力资源部门则可参照国别数据进行行业薪资对标,优化全球薪酬策略。此外,数据在可持续投资(ESG)领域亦发挥重要作用,帮助分析区域性别平等指数与包容性增长目标的实现进展。
衍生相关工作
该数据集衍生了多项富有影响力的研究工作。其集成在HuggingFace平台上后,便于机器学习社区基于时间序列特征开展工资预测建模,例如使用LSTM或Transformer架构预测未来年份的性别薪资差距趋势。同时,数据催生了关于欧洲劳动力流动性与教育匹配效率的计量分析,部分学者将其与《欧洲劳动力量调查》数据合并,构建了教育—职业错配指数。还出现了以该数据集为基准进行多国工资收敛性检验的经典论文,推动了新经济地理学在劳动市场研究中的应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务