遇见数据集

electricsheepeurope/europe-ilo-ear-emta-sex-cbr-nb-average-monthly-earnings-of-employees-by-sex-and-p

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含了欧洲18个国家(1998年至2025年)的员工平均月薪数据,按性别和出生地进行细分,并以本地货币计价。数据集共包含1,445个观测值,涵盖一个核心指标:EAR_EMTA_SEX_CBR_NB,即按性别和出生地划分的员工平均月薪(本地货币)。数据来源于国际劳工组织(ILO)的ILOSTAT数据库,通过官方API获取,并经过过滤以仅包括欧洲国家。数据集提供了结构化表格,包含国家代码、年份、指标值、数据来源、性别分类(总计、男性、女性)以及出生地分类等列,适用于表格分类、回归和时间序列预测等任务。数据以CC-BY-4.0许可证发布,由Electric Sheep Europe重新打包,便于机器学习使用。

This dataset contains average monthly earnings of employees in 18 European countries from 1998 to 2025, disaggregated by sex and place of birth, and measured in local currency. It includes 1,445 observations focusing on a single indicator: EAR_EMTA_SEX_CBR_NB, which represents Average monthly earnings of employees by sex and place of birth (local currency). Sourced from the ILOSTAT database of the International Labour Organization (ILO), the data is retrieved via the official API and filtered to European countries. The dataset is structured in a tabular format with columns such as country code, year, indicator value, data source, sex classification (total, male, female), and place of birth classification, making it suitable for tasks like tabular classification, regression, and time-series forecasting. Released under the CC-BY-4.0 license, it has been repackaged by Electric Sheep Europe for machine learning readiness.

提供机构:
electricsheepeurope
搜集汇总
数据集介绍
electricsheepeurope/europe-ilo-ear-emta-sex-cbr-nb-average-monthly-earnings-of-employees-by-sex-and-p 数据集图片
构建方式
该数据集源自国际劳工组织(ILO)的ILOSTAT统计数据库,聚焦于欧洲18个国家中按性别和出生地划分的员工平均月薪(以本币计)。数据通过ILOSTAT的REST API直接抓取,原始数据来自各国劳动力调查、家庭收入调查及行政记录,经ILO依据国际劳工统计学家会议(ICLS)定义进行标准化处理。Electric Sheep Europe团队将数据筛选至欧洲ISO3国家代码范围,并重新打包为HuggingFace数据集格式,共包含1,445条观测记录,时间跨度覆盖1998年至2025年。数据集中每行包含国家代码、性别分类(总、男、女)、出生地分类、观测年份、数值及观测状态等字段,并附有数据来源标签以确保可追溯性。
使用方法
使用该数据集极为便捷,研究者可直接通过HuggingFace的`datasets`库以`load_dataset`函数一行加载,自动转换为Pandas DataFrame后即可进行探索。典型应用包括过滤特定国家(如德国DEU)的观测值,或按时间排序绘制单一指标的折线图以观察趋势。更进一步,可通过数据透视表将数据重塑为国家×年份的矩阵,便于直接计算增长率或构建面板回归模型。数据集适配表格分类、回归及时间序列预测等多种任务类型,其长格式结构天然支持按性别或出生地分组分析,为劳动经济学与移民研究的实证工作提供了即用型高质量数据源。
背景与挑战
背景概述
该数据集由国际劳工组织(ILO)于2025年整理并经由Electric Sheep Europe在HuggingFace平台重新封装发布,聚焦于18个欧洲国家1998年至2025年间按性别和出生地划分的雇员平均月薪(本地货币)。其核心研究问题在于揭示劳动力市场中移民与本地出生人群的收入差异,以及性别工资差距的时空演化规律。作为ILOSTAT全球劳动统计数据库的衍生子集,该数据集为劳动经济学、移民政策评估及性别平等研究提供了标准化、可复现的微观数据基础,尤其支撑面板数据分析与时间序列建模。其对相关领域的影响力体现在:为联合国可持续发展目标(SDG)中体面工作与经济增长的量化监测提供欧洲区域证据,同时推动跨国家比较研究中一致性与透明度的提升。
当前挑战
该数据集面临的核心领域挑战包括:一是劳动力市场收入动态的复杂性——需同时控制国家间制度差异(如最低工资法、集体谈判覆盖)、移民结构异质性(如技术移民与低技能劳工)及周期性经济波动,以隔离性别与出生地的净效应。二是数据质量与可比性难题——不同国家调查方法(如劳动力量调查与行政记录)及定义差异(如‘月薪’是否包含奖金与补贴)可能导致系统性偏差,ILO虽通过ICLS定义进行统一,但‘最佳来源’选择逻辑与断点标注(如`obs_status`标志)仍需使用者审慎处理。三是时间序列的不完整性——部分国家年份稀疏(如爱沙尼亚仅3年数据),限制了对长期趋势的稳健推断;同时,分类变量(如`classif1`)仅在部分观测中非空,增加了多维度分析的复杂性。
常用场景
经典使用场景
在欧洲劳动力市场研究中,该数据集被广泛用于分析不同性别及出生背景雇员在月度薪资上的差异。借助ILOSTAT标准化定义与长时间跨度(1998–2025),研究者可构建面板数据模型,考察薪资随时间推移的演变趋势、国别间异质性以及性别工资差距的收敛或扩张态势。数据经多维度分类字段(如性别、国籍来源地)整理,为时间序列回归、因果推断及跨国比较提供了坚实的数据基础。
解决学术问题
该数据集的核心学术价值在于缓解了欧洲移民劳工薪资结构研究中的数据碎片化问题。传统研究中,跨国、跨群体的可比薪资数据难以获取,而此数据通过统一计量单位与观测标志(如最佳来源挑选、断点标记),使得探索性别与出生地对工资影响的交互效应成为可能。它有效支撑了关于工资歧视、移民融入效应以及劳动力市场制度差异如何塑造薪资不平等的定量检验,为劳动经济学与移民经济学领域的理论提供了实证锚点。
实际应用
实际应用中,此数据集为国际组织、国家统计机构及政策智库提供了可靠的决策参考。例如,欧盟委员会可利用其监测成员国在《欧洲平等战略》中的性别薪酬差距进展;非政府组织可依据数据揭示特定群体(如海外出生的女性雇员)面临的双重劣势,进而设计更具针对性的薪酬公平干预措施。此外,企业在进行跨国薪酬基准与多元包容性审计时,亦可借助此数据校准本地化的薪资策略。
数据集最近研究
最新研究方向
基于ILOSTAT欧洲分性别与出生地员工月均收入数据集的前沿研究,聚焦于劳动力市场中的结构性不平等与移民融合议题。当前,欧洲多国正经历移民潮与人口结构转型,该数据集覆盖1998至2025年18国的1445条观测,为追踪不同性别及出生地群体的薪酬差距提供了关键依据。研究热点包括利用时间序列分析揭示金融危机与新冠疫情后薪酬恢复的异质性轨迹,以及通过多国面板数据识别制度差异(如最低工资政策、集体谈判覆盖率)对移民-本地工资差距的调节效应。该数据集的精细分层性(如按性别与出生地交叉分类)使其成为检验双重歧视理论与评估欧盟《性别薪酬透明度指令》2026年实施效果的宝贵工具,推动了劳动经济学与数据驱动治理的交汇。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务