遇见数据集

electricsheepeurope/europe-ilo-ear-emtm-sex-age-cur-nb-median-monthly-earnings-of-employees-by-sex-age-an

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含欧洲33个国家从1991年至2025年的45,288条观测记录,主要指标为员工月收入中位数(按性别、年龄和货币分类)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过REST API获取并过滤为欧洲国家代码。数据涵盖了性别(总、男性、女性)、年龄和货币等分类维度,用于表格分类、回归和时间序列预测等任务。数据集由Electric Sheep Europe重新打包,采用cc-by-4.0许可证。

This dataset contains 45,288 observations across 33 Europe countries from 1991 to 2025, with the main indicator being Median monthly earnings of employees by sex, age and currency. The data is sourced from the International Labour Organization (ILO) ILOSTAT database, retrieved via REST API and filtered to Europe ISO3 country codes. It includes disaggregation dimensions such as sex (total, male, female), age, and currency, and is designed for tabular classification, regression, and time-series forecasting tasks. The dataset is repackaged by Electric Sheep Europe and released under the cc-by-4.0 license.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emtm-sex-age-cur-nb-median-monthly-earnings-of-employees-by-sex-age-an 数据集图片
构建方式
该数据集基于国际劳工组织(ILO)的ILOSTAT REST API直接抽取,聚焦于欧洲33个国家的雇员月收入中位数指标(EAR_EMTM_SEX_AGE_CUR_NB)。数据通过API接口获取后,依据ISO 3166-1 alpha-3欧洲国家代码进行筛选,并遵循国际劳动统计学家会议(ICLS)的定义对原始调查微观数据进行统一协调。原始数据来源于劳动力调查、家庭收入调查、企业调查及行政记录等多元渠道,每个观测值的来源信息均通过source.label列清晰标注,确保数据溯源的可信性与透明度。最终整合为45,288条观测记录,覆盖1991年至2025年的时间跨度,并以结构化表格形式呈现。
使用方法
数据使用极为便捷,研究者可通过HuggingFace Datasets库以load_dataset函数一键加载,返回的DataFrame可直接用于Python环境中的Pandas操作。典型应用包括使用ref_area列对特定国家进行子集筛选,例如提取德国数据;或利用indicator列锁定单一指标,按时间排序后绘制时间序列曲线。进一步的,通过pivot_table方法可将数据重塑为国家×年份的矩阵形式,便于面板数据分析或回归建模。数据集内嵌的sex、classif1等分类维度支持多层级的群体比较,而obs_status等质量标记则帮助用户识别数据可靠程度,从而在分析前进行必要的清洗或加权处理。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年发布,经Electric Sheep Europe重新封装后托管于HuggingFace平台,聚焦于欧洲33个国家1991至2025年间按性别、年龄及货币分类的雇员月收入中位数。其核心研究问题在于揭示欧洲劳动力市场中收入分配的性别与年龄差异,为劳动经济学、社会政策评估及可持续发展目标(特别是体面工作与经济增长指标)提供跨国可比的数据基础。作为ILOSTAT数据库的子集,该数据集通过统一采集与标准化流程,为研究者提供了高时间分辨率的面板数据,对推动欧洲内部收入不平等、性别工资差距以及代际经济流动性的实证分析具有重要影响力。
当前挑战
该数据集所解决的领域问题在于,欧洲各国劳动统计数据在定义、分类与收集方法上存在显著差异,导致跨国的收入比较与趋势分析面临障碍。ILOSTAT通过国际劳工统计学家会议(ICLS)定义进行数据协调,但仍面临多重挑战:一是数据源异构性,各国依赖不同的调查类型(如劳动力调查、家庭收入调查),需通过‘最佳来源’选择策略进行整合,可能引入偏差;二是离散维度复杂,性别、年龄组与货币分类的交叉组合导致样本稀疏,尤其是在小国或特定时间段内有效观测值减少;三是数据质量标签(如不可靠、临时性)需要谨慎处理,确保模型能够区分高置信度与低置信度的观测,避免错误推断。
常用场景
经典使用场景
该数据集汇聚了1991年至2025年间33个欧洲国家的雇员月收入中位数观测值,按性别、年龄及货币种类进行细分,为劳动经济学与收入不平等研究提供了精细化的时序面板数据。研究者可借助该数据集拟合收入决定方程,探讨性别收入差距随年龄变化的动态轨迹,或在泛欧尺度上比较不同福利体制与劳动力市场制度对收入分配的影响。凭借其纵向跨度长与分类维度丰富的特点,该数据尤为适合构建混合效应模型或面板回归模型,以剥离时间趋势与个体异质性对收入水平的交互效应。
解决学术问题
该数据集直面欧洲劳动力市场中性别收入鸿沟与年龄收入曲线的量化难题。长期以来,跨国比较受限于收入统计口径不统一与时间序列断裂,ILOSTAT框架下的标准化指标则提供了可靠基准。借助该数据,学者可系统检验人力资本理论在泛欧背景下的解释力,识别性别歧视在职业生涯不同阶段的累积效应,以及最低工资制度、集体谈判覆盖率等制度变量对收入中位数的调节作用。这些研究为揭示结构性的不平等根源提供了基于证据的推论基础。
实际应用
在实际政策评估领域,该数据集被广泛用于监测联合国可持续发展目标中涉及体面工作的具体指标进展。欧洲各国劳动部门与统计局可利用该数据追踪本国收入中位数在性别和代际层面的演变趋势,从而校准最低工资标准、设计针对青年与女性就业的薪酬激励方案。跨国企业亦可参照该数据调整各分支机构所在国市场的薪酬基准线,以在合规前提下提升人才竞争力。
数据集最近研究
最新研究方向
在劳动经济学与数据科学的交叉前沿,europe-ilo-ear-emtm-sex-age-cur-nb-median-monthly-earnings-of-employees-by-sex-age-an数据集正成为推动欧洲劳动力市场性别薪酬差距量化研究的关键基石。该数据集整合了ILOSTAT自1991年至2025年间覆盖33个欧洲国家的45,288条观测值,按性别、年龄与货币维度细化了雇员中位数月收入,为追踪后疫情时代欧洲各国薪酬不平等演变趋势、评估性别平等政策实效提供了高颗粒度的时序数据支撑。当前研究方向聚焦于利用该多维度面板数据,结合因果推断与时空建模方法,揭示产业转型、最低工资调整及通货膨胀等宏观变量对不同性别与年龄群体薪酬结构的异质性冲击,从而为跨国比较与欧盟层面‘同工同酬’议程的精细化施策提供实证洞见。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务