遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-edu-nb-median-monthly-earnings-of-employees-by-sex-and-ed

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲33个国家从1991年至2025年按性别和教育程度划分的员工月收入中位数(本地货币)数据,涵盖13,556个观测值和1个核心指标(EAR_EMTM_SEX_EDU_NB)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过API获取并经过标准化处理,包括国家代码、数据来源、指标分类、性别维度、观测年份和数值等信息。数据集适用于表格分类、回归和时间序列预测等任务,重点关注欧洲劳动力市场的收入分布情况。

This dataset contains median monthly earnings of employees by sex and education (local currency) for 33 European countries from 1991 to 2025, with 13,556 observations and one core indicator (EAR_EMTM_SEX_EDU_NB). The data is sourced from the ILOSTAT database of the International Labour Organization (ILO), retrieved via API and harmonized using ICLS definitions. It includes information such as country codes, data sources, indicator classifications, gender dimensions, observation years, and values. The dataset is suitable for tabular classification, regression, and time-series forecasting tasks, focusing on income distribution in the European labor market.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-edu-nb-median-monthly-earnings-of-employees-by-sex-and-ed 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API接口直接提取指标代码为EAR_EMTM_SEX_EDU_NB的观测数据,并依据欧洲ISO3国家代码进行地理过滤。ILOSTAT数据库本身整合了来自各国劳动力调查、家庭收入调查、企业调查及行政记录等多元数据源,并依据国际劳工统计学家会议(ICLS)定义进行标准化处理。数据集共收录13,556条记录,覆盖33个欧洲国家,时间跨度从1991年至2025年,由Electric Sheep Europe团队重新封装为HuggingFace数据集,以Parquet格式提供,确保数据加载的高效性与便捷性。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,使用简单的Python代码即可获取完整的DataFrame。建议首先利用`load_dataset`函数载入数据,并转换为pandas DataFrame以便进行后续分析。对于特定国家的研究,可依据`ref_area`列进行过滤;若关注时间序列趋势,可按`indicator`列筛选并排序`time`字段进行可视化。此外,用户可通过透视表操作将数据重塑为国家×年份的矩阵形式,便于进行跨国家比较或面板数据回归。数据集支持分类与回归任务,也适用于时间序列预测,研究者可根据实际需求灵活选择建模策略。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理发布,经Electric Sheep Europe重新打包,聚焦欧洲33个国家1991至2025年间按性别与教育程度划分的员工月收入中位数(以当地货币计)。数据源自ILOSTAT数据库,这是全球劳动统计领域的权威来源,通过对各国劳动力调查、家庭收入调查及行政记录等原始微数据进行ILO标准化处理而得出。核心研究问题在于揭示欧洲劳动力市场中性别与教育水平对收入影响的长期演化趋势,为劳动经济学、收入分配研究及政策评估提供跨国家、跨时段的可比性基准。该数据集对于追踪可持续发展目标(SDGs)中体面劳动与经济增长相关指标具有重要支撑价值,尤其便于分析教育回报率与性别收入差距的动态变化。
当前挑战
该数据集面临的核心挑战包括:一、领域研究层面,如何从混杂的宏观时间序列中准确剥离教育水平与性别对收入的独立贡献,排除通货膨胀汇率波动、劳动力市场制度变迁等干扰因素。二、数据构建层面,原始数据来源多样且统计口径各异,如部分国家采用不同教育分类标准(classif1字段中非标准教育等级标识),需要ILO通过ICLS定义进行复杂协调,但数据质量列(obs_status)仍标记了部分不可靠观测值。三、时间与空间覆盖不均衡,瑞士、葡萄牙等国家观测记录丰富(达数千行),而部分国家数据稀疏,且时间跨度从1991至2025年不等,导致跨国家面板分析面临严重缺失值问题。四、收入指标为地方货币单位,缺乏跨国标准化,需要研究者额外进行购买力平价或汇率调整才能进行有效比较。
常用场景
经典使用场景
在劳动经济学与教育经济学的交叉研究领域,该数据集因其细粒度的维度划分而成为探究教育与性别如何共同塑造收入分配的核心资源。研究者常利用其中分性别、分教育层次的月收入中位数数据,构建面板数据模型,系统考察欧洲各国人力资本回报率的动态变化趋势。经典的使用方式包括固定效应回归分析教育年限对收入的边际影响,或通过分位数回归揭示不同收入阶层中性别工资差距的演变特征。
解决学术问题
该数据集有效回应了长期困扰学界的两个关键命题——教育回报率的跨国异质性根源,以及性别收入差距在时间维度上的收敛或固化现象。借助覆盖33个欧洲国家、跨越三十余年的标准化统计指标,学者能够分离出制度变迁、产业结构转型与劳动力市场政策对收入结构的冲击效应。其意义在于为验证明瑟方程在不同福利体制下的解释力、评估欧盟性别平等政策的实际成效,提供了可靠的经验证据。
实际应用
在实际应用层面,该数据集为国际劳工组织成员国监测体面劳动目标进展提供了量化基准。欧洲各国劳动与社会保障部门可依据其中分教育层次的中位数工资数据,动态调整最低工资标准与职业教育补贴系数。跨国企业的人力资源部门亦能借此基准,在不同国家业务单元间校准薪酬公平性审查指标,确保性别薪酬差异的合规管控。此外,智库与政策研究机构常以该数据作为输入,构建欧洲劳动力市场预警模型的参考基线。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲33国1991至2025年间按性别与教育程度划分的雇员月收入中位数,为劳动力经济学中的性别收入鸿沟与教育回报率研究提供了跨时空的高颗粒度观测样本。当前前沿方向集中利用该时间序列数据构建动态面板模型,以量化性别薪酬差异的长期演变趋势,并结合欧洲各国教育体系改革与劳动政策变迁,解析教育扩张如何通过技能溢价机制调节性别收入不平衡。尤其在欧盟《同工同酬透明度指令》等热点政策推进的背景下,该数据成为评估制度干预效果的关键依据。其影响力体现在填补了ILOSTAT官方数据在机器学习友好型格式上的空白,使研究者能无缝衔接至因果推断或时序预测任务,助力从统计描述跃迁至结构性解释层面,为制定基于证据的包容性增长策略提供坚实的量化基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务