遇见数据集

electricsheepeurope/europe-ilo-ear-ehrm-sex-edu-nb-median-hourly-earnings-of-employees-by-sex-and-edu

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲8个国家(1991年至2025年)员工按性别和教育程度划分的中位小时收入(以当地货币计)的6,622个观测值,核心指标为EAR_EHRM_SEX_EDU_NB。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并过滤欧洲国家代码,涵盖国家代码、指标、性别(总计、男性、女性)、教育分类、年份、观测值等列,适用于表格分类、回归和时间序列预测任务。数据集包括数据质量说明,如年度频率、最佳来源选择和非空分类列限制,并提供Python使用示例。

This dataset contains 6,622 observations of median hourly earnings of employees by sex and education (in local currency) across 8 European countries from 1991 to 2025, with the core indicator EAR_EHRM_SEX_EDU_NB. Sourced from the International Labour Organization (ILO) ILOSTAT database via API and filtered for European country codes, it includes columns such as country code, indicator, sex (total, male, female), education classification, year, and observed value, suitable for tabular classification, regression, and time-series forecasting tasks. The dataset covers data quality notes like annual frequency, best-source selection, and non-null disaggregation columns, along with Python usage examples.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-ehrm-sex-edu-nb-median-hourly-earnings-of-employees-by-sex-and-edu 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)旗下的ILOSTAT核心统计数据库,通过REST API直接抽取标识符为EAR_EHRM_SEX_EDU_NB的指标,并筛选出欧洲地区的ISO3国家代码子集。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等原始微观数据进行统一协调,数据来源均在source.label列中标注以确保可追溯。最终汇集了8个欧洲国家自1991年至2025年间共6622条观测记录,覆盖瑞士、葡萄牙、英国、法国、波黑、摩尔多瓦、意大利和希腊。
特点
该数据集专注于雇员按性别与教育程度划分的时薪中位数(以当地货币计),是欧洲劳动经济学分析中稀缺的细粒度工资数据。其核心优势在于提供了sex和classif1两个维度的解构:sex维度涵盖总计、男性和女性三类,classif1则细化教育层级,使得研究者能够精准洞察不同群体间的薪酬差异。此外,数据集还附带了观测状态标记(如不可靠)及各类注释说明,助力用户评估数据质量,兼具时间序列特性,可用于纵向趋势挖掘。
使用方法
用户可通过HuggingFace Datasets库中的load_dataset函数一键加载该数据集,并将其转换为Pandas DataFrame以便进行常规操作。为聚焦特定国家,可利用ref_area字段进行过滤;若要开展时间序列分析,可对indicator列进行筛选并依据time字段排序后绘制趋势图。更高级的用法包括将数据重塑为国家×年份的透视矩阵,以便进行面板数据分析或跨国家比较,所有操作均可在Python环境下高效完成。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计部门创建,经Electric Sheep Europe于2025年重新整理后发布于HuggingFace平台。其核心研究问题聚焦于欧洲地区按性别与教育程度划分的雇员中位数小时工资水平,旨在揭示劳动力市场中人力资本回报的异质性。ILO作为全球劳动统计的权威来源,其ILOSTAT数据库整合了来自各国劳动力调查、家庭收入调查及行政记录的海量数据,为跨国劳动经济学研究提供了坚实基础。该数据集覆盖1991年至2025年的8个欧洲国家,包含6622条观测值,在教育经济学、性别工资差距及欧盟劳动力市场政策评估等领域具有重要影响力,为研究者提供了统一、可比的时序面板数据。
当前挑战
该数据集面临的挑战主要体现在两方面:其一,所解决的领域问题在于劳动经济学中工资决定因素的精确量化,特别是教育与性别对收入的交互影响。由于各国教育体系分类标准不一(如classif1字段包含非标准教育水平),且存在数据来源多样性(如劳动力调查与行政记录并存),导致跨国比较中标准化与一致性的保持成为核心难题。其二,构建过程中遭遇了数据质量与完整性的挑战,例如部分观测值被标记为'不可靠'(obs_status='U'),不同国家的时间跨度不均衡(如希腊仅覆盖2015-2020年),且某些年份存在数据缺失或来源冲突。ILO虽采用'最佳来源'选择策略,但仍可能引入统计口径的波动,影响面板数据的平稳性与模型推断的稳健性。
常用场景
经典使用场景
在欧洲劳动经济学与社会政策研究领域,该数据集为分析性别与教育水平对劳动报酬的影响提供了横跨三十余年、覆盖八个欧洲国家的精细化面板数据。研究者常借助其中按性别与教育程度分层的中位时薪指标,构建固定效应或随机效应模型,探究教育回报率的长期演变趋势与性别工资差距的动态收敛特征。其年度时序结构与多国对比维度,使得时间序列回归、差异中的差异分析以及基于分位数回归的异质性研究成为可能,是劳动经济学实证分析中不可或缺的基础资源。
实际应用
在实际应用层面,该数据集为国际组织与欧洲各国劳工部门的政策制定与评估提供了有力的数据支撑。国际劳工组织可据此监测各国体面劳动目标的实现进展,欧盟委员会则能利用其比较各国在性别平等和技能溢价方面的表现,以设计更具针对性的就业与培训计划。此外,薪资调查机构与人力资源咨询公司可通过引入该数据集,构建行业薪资基准模型,帮助企业在跨国薪酬管理中识别并纠正潜在的性别偏见,促进薪酬公平。
衍生相关工作
基于该数据集,学术界已衍生出一系列具有影响力的研究工作。部分学者利用其面板结构,结合自然实验方法评估了最低工资法案、同工同酬立法以及产假政策对性别工资差距的因果效应。另一些研究则聚焦于教育与科技变革的赛跑,通过该数据中的教育细分维度,检验了技能偏向性技术进步对不同教育层次劳动者薪资的差异化影响。此外,该数据还常被用于构建欧洲层面的工资追赶指数与劳动收入份额估算模型,成为后续研究劳动力市场结构性变迁的重要基准资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务