遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-cct-nb-average-monthly-earnings-of-employees-by-sex-and-c

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含来自国际劳工组织(ILO)ILOSTAT数据库的“员工平均月薪按性别和国籍分类(本地货币)”数据,专门针对欧洲地区。数据集涵盖17个欧洲国家,时间跨度为1991年至2025年,共包含1,634个观察值。核心指标为“EAR_EMTA_SEX_CCT_NB”,即员工平均月薪按性别和国籍分类(本地货币)。数据通过ILOSTAT REST API获取,并经过过滤以仅包括欧洲国家。数据集提供了详细的元数据,如国家代码、数据来源、性别分类(总计、男性、女性)、观察年份、数值、状态标志和注释。它适用于表格分类、回归和时间序列预测等任务,旨在支持劳动经济学研究和机器学习应用。数据以标准化模式组织,便于使用HuggingFace的datasets库加载和处理。

This dataset contains data titled "Average Monthly Salary of Employees by Sex and Nationality (Local Currency)" from the International Labour Organization (ILO) ILOSTAT database, specifically focused on the European region. The dataset covers 17 European countries, spans the period from 1991 to 2025, and contains a total of 1,634 observations. The core indicator is "EAR_EMTA_SEX_CCT_NB", which refers to the average monthly salary of employees categorized by sex and nationality (local currency). The data was obtained via the ILOSTAT REST API and filtered to only include European countries. The dataset provides detailed metadata, including country codes, data sources, sex categories (total, male, female), observation years, numerical values, status flags, and annotations. It is applicable to tasks such as tabular classification, regression, and time series forecasting, and aims to support labor economics research and machine learning applications. The data is organized in a standardized format, making it easy to load and process using the HuggingFace datasets library.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-cct-nb-average-monthly-earnings-of-employees-by-sex-and-c 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,通过REST API直接获取指标代码为EAR_EMTA_SEX_CCT_NB的原始数据,并依据欧洲ISO3国家代码进行地理范围过滤。ILOSTAT依据国际劳工统计学家会议(ICLS)定义对各国劳动力调查、家庭收入调查等微观数据进行协调与标准化处理,数据集在schema中保留了source.label字段以标注数据来源,确保可追溯性。最终由Electric Sheep Europe团队重新打包为HuggingFace Dataset格式,便于机器学习流水线直接调用。
特点
数据集包含1,634条观测记录,覆盖17个欧洲国家,时间跨度从1991年至2025年,聚焦于“按性别和国籍划分的员工平均月收入(本币)”这一核心指标。数据以年频率呈现,并提供性别(总、男、女)和公民身份等维度细分。值得注意的是,数据集对观测值状态进行了标记(如不可靠值),并附有详细的变量说明表,涵盖国家代码、来源、指标标签、时间戳及注释字段,提升了数据的透明度和可用性。
使用方法
使用者可通过HuggingFace的datasets库以load_dataset函数直接加载数据,并将其转换为Pandas DataFrame进行后续分析。典型操作包括按国家代码过滤(如筛选德国数据)、对特定指标按时间排序以绘制时间序列图,或通过数据透视表生成国家×年份的观测值矩阵。该数据集支持表格分类、回归及时间序列预测等多种任务,且因采用统一的Parquet格式与标准化schema,能高效接入各类机器学习工作流。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)统计数据库ILOSTAT于2025年整理发布,经Electric Sheep Europe重新封装后呈现在HuggingFace平台上,聚焦于欧洲17个国家1991至2025年间按性别和国籍划分的员工平均月收入(以当地货币计)。作为劳动经济学领域的关键指标,这一数据集旨在揭示欧洲劳动力市场中性别与国籍在薪酬分配上的结构性差异,为研究者分析工资不平等、移民劳动力融入及政策干预效果提供了跨时空的量化基础。其核心研究问题在于如何通过标准化的国际劳动统计数据,系统追踪欧洲各国薪酬分化的演变轨迹,从而推动体面劳动与可持续发展目标(SDGs)的实证评估。凭借ILO官方数据的权威性与1,634条观测值的精细粒度,该数据集已成为劳动经济学、人口迁移研究及政策科学领域不可或缺的基准资源。
当前挑战
该数据集所解决的领域挑战主要呈现为三重困境:其一,欧洲各国薪酬数据因调查方法、统计口径与货币单位的差异而难以直接比较,ILOSTAT通过国际劳工统计学家会议(ICLS)定义进行数据协调,然而跨国产出仍可能保留源于调查设计与汇率波动的非一致性;其二,构建过程中面临数据稀疏性与观测值标签标注不足的约束,例如按时间序列填充时,部分国家(如阿尔巴尼亚、爱沙尼亚)仅覆盖有限年份,且关键变量如国籍与性别的细粒度交叉分类常因隐私或样本量限制而缺失,导致多维度比较分析受阻;其三,数据质量标记(如“不可靠”状态)的介入为模型训练引入了不确定性,研究者需谨慎处理异常值过滤与缺失值插补,以避免隐式的样本选择偏误对时间序列预测鲁棒性的侵蚀。
常用场景
经典使用场景
europe-ilo-ear-emta-sex-cct-nb-average-monthly-earnings-of-employees-by-sex-and-c数据集汇集了国际劳工组织(ILO)ILOSTAT数据库中17个欧洲国家1991年至2025年间员工平均月收入的性别与国籍分类数据。这一结构化时间序列数据集在劳动经济学研究中常被用于构建面板数据模型,探究性别工资差距的时空演变趋势,或分析国籍身份对劳动力市场回报的影响。通过按性别和国籍维度细分观测值,研究者能够利用该数据集进行差异分解分析,揭示不同群体在收入分配中的结构性差异。其年度频次特性也使其适合与宏观经济指标、移民政策变迁等外部变量进行关联分析,从而评估制度环境与经济周期对工资决定机制的调节效应。
衍生相关工作
围绕该数据集及其底层数据源,学术界已衍生出一系列具有影响力的研究成果与方法论创新。ILOSTAT本身的统计框架和ICLS劳动统计定义常被国际比较研究引用为标准基准;基于类似数据的元分析研究系统梳理了欧洲性别工资差距的收敛路径与社会经济决定因素。在方法层面,研究者发展出针对多源混合数据的质量评估与整合技术,并设计了处理年度频率观测值中缺失信息的插补算法。该数据集还被用作教学案例,驱动关于劳动经济学中面板数据模型、多维分类变量处理以及时间序列探索性分析的公开课程与实验项目,进一步推动了数据驱动型社会科学研究的普及。
数据集最近研究
最新研究方向
该数据集聚焦于欧洲各国雇员平均月薪的性别与国籍差异,为劳动经济学与移民研究提供了高时空分辨率的纵向数据。当前前沿方向包括结合联合国可持续发展目标中的体面工作与经济增长(SDG 8)和减少不平等(SDG 10),利用时间序列模型分析欧洲一体化进程中移民身份对薪资水平的动态影响,尤其关注2008年金融危机、新冠疫情期间及疫后复苏阶段的薪资波动异质性。同时,该数据与ILOSTAT其他指标(如失业率、非正规就业占比)的关联分析,正成为揭示欧洲劳动力市场结构性分割与性别薪资鸿沟演变的研究热点,为跨国比较政策评估提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务